Вопросы на собеседовании: AI-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Junior.
Смотреть пример резюме: AI-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Эти термины обозначают связанные категории с разным охватом.
- Искусственный интеллект является широкой областью создания систем, которые выполняют задачи, связанные с человеческим интеллектом.
- Машинное обучение является частью ИИ, в которой модели находят закономерности в данных, а не полагаются только на явно заданные правила.
- Глубокое обучение является частью машинного обучения и использует нейронные сети со множеством слоев.
- Генеративный ИИ создает контент, например текст, изображения или аудио, и часто использует модели глубокого обучения.
Зачем это спрашивают: Интервьюер проверяет, различаете ли вы основные категории ИИ и не считаете ли их синонимами.
Языковая модель назначает вероятности последовательностям языковых единиц.
- В зависимости от модели такими единицами могут быть слова, символы или токены, например части слов.
- Модель изучает статистические закономерности в текстах, включая то, какие единицы обычно встречаются в заданном контексте.
- Она может использовать изученные вероятности, чтобы оценивать вероятные продолжения, генерировать текст или сравнивать последовательности.
- Большая языковая модель является языковой моделью со множеством обучаемых параметров, которую обучают на большом объеме данных.
Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы языковую модель как вероятностную модель, а не как базу сохраненных предложений.
Авторегрессионная LLM генерирует текст по одному токену с учетом предыдущих токенов.
- Токенизатор преобразует промпт в идентификаторы токенов, которые образуют начальную последовательность.
- Модель вычисляет распределение вероятностей возможных токенов для следующей позиции.
- Метод декодирования выбирает токен из этого распределения и добавляет его к последовательности.
- Модель повторяет эти шаги, пока не создаст токен остановки или не выполнит другое условие завершения.
Зачем это спрашивают: Интервьюер проверяет, можете ли вы описать авторегрессионную генерацию как повторяющийся процесс предсказания следующего токена.
Токен является единицей текста, а токенизация преобразует текст в последовательность идентификаторов токенов, которую может обработать модель.
- Токен может соответствовать целому слову, части слова, знаку препинания, пробелу или другому фрагменту текста.
- Токенизатор применяет свой словарь и правила разбиения, чтобы разбить или закодировать входной текст.
- Он сопоставляет каждому полученному токену целое число, которое называют идентификатором токена.
- Границы токенов не всегда совпадают с границами слов, поэтому одно слово может превратиться в несколько токенов.
Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы, как исходный текст превращается в дискретные входные единицы языковой модели.
Словарь модели является фиксированным набором токенов, которые распознает ее токенизатор, причем каждому токену назначен числовой идентификатор.
- Словарь может включать слова, части слов, символы, знаки препинания и специальные токены.
- Идентификатор токена является целочисленным индексом, по которому модель получает обученное векторное представление токена.
- Число, назначенное идентификатору, не выражает смысл или важность токена.
- Разные токенизаторы могут использовать разные словари, поэтому один и тот же текст может давать разные токены и идентификаторы.
Зачем это спрашивают: Интервьюер проверяет, можете ли вы связать результат токенизации с числовыми входными данными модели.
Контекстное окно LLM является максимальным числом токенов, которые модель может одновременно использовать при предсказании следующего токена.
- Во время генерации окно содержит входные токены и сгенерированные токены, которые все еще входят в последовательность.
- Ограничение измеряется в токенах, а не в словах или символах.
- Содержимое за пределами окна не может напрямую влиять на текущее предсказание модели.
- Более широкое окно делает доступным больше содержимого, но не гарантирует, что модель правильно использует каждую деталь.
Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы ограниченную емкость контекста модели и ее влияние на доступную информацию.
Параметры модели представляют собой числовые значения, которые настраиваются во время обучения нейросетевой языковой модели.
- Обучение изменяет эти значения, чтобы уменьшить ошибки в предсказаниях модели на обучающих примерах.
- Значения эмбеддингов и веса в слоях внимания и полносвязных слоях являются примерами параметров.
- Число параметров часто используют для описания размера модели, но само по себе оно не измеряет качество модели.
- Параметры отличаются от гиперпараметров, например скорости обучения или числа слоев, которые выбирают, а не изучают из данных.
Зачем это спрашивают: Интервьюер проверяет, отличаете ли вы значения, изучаемые моделью, от настроек ее архитектуры или обучения.
Трансформер является архитектурой нейронной сети, которая обрабатывает представления токенов с помощью внимания и полносвязных слоев.
- Информация о токенах и их позициях объединяется в начальные векторные представления.
- Самовнимание позволяет представлению каждого токена использовать информацию из других значимых позиций последовательности.
- Полносвязный слой дополнительно преобразует каждую позицию, а эти компоненты объединяются в повторяющиеся блоки.
- В LLM только с декодером итоговые представления преобразуются в оценки возможных следующих токенов.
Зачем это спрашивают: Интервьюер проверяет, знаете ли вы основные компоненты и поток данных в архитектуре, которую использует большинство LLM.
Самовнимание обновляет представление каждого токена, объединяя информацию из доступных позиций той же последовательности.
- Модель создает векторы запроса, ключа и значения из представления каждого токена.
- Она сравнивает запрос токена с ключами в разрешенных позициях и преобразует полученные оценки в нормированные веса внимания.
- Взвешенная комбинация соответствующих векторов значений формирует контекстное представление этого токена.
- Несколько голов внимания могут учиться выделять разные связи между токенами.
Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы, как представления токенов получают контекст внутри слоя Transformer.
Трансформеру нужна информация о позициях, потому что по одному содержимому токена самовнимание не определяет его место в последовательности.
- Информация о позиции помогает модели различать последовательности, которые содержат одинаковые токены в разном порядке.
- Она также позволяет модели изучать связи, зависящие от порядка токенов и расстояния между ними.
- Один из методов добавляет обучаемый или фиксированный вектор позиции к представлению каждого токена.
- Методы относительного позиционирования вместо этого представляют расстояние и направление между позициями токенов при вычислении внимания.
Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы, почему порядок токенов нужно представлять отдельно от их содержимого.
Предобучение представляет собой начальный этап, на котором модель усваивает общие закономерности из большого набора данных до возможной адаптации под конкретную задачу.
- Данные для предобучения обычно охватывают больше примеров и тем, чем набор данных для одной конкретной задачи.
- Обучающий сигнал часто получают из самих данных, например предлагая модели предсказать скрытый или следующий токен.
- Во время обучения параметры модели обновляются так, чтобы её предсказания лучше соответствовали закономерностям в данных.
- Полученную предобученную модель можно использовать с промптами или адаптировать её параметры с помощью дообучения.
Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат предобучение как широкое начальное обучение, а не обучение для одной узкой задачи.
Цель обучения определяет, чему должна научиться модель, а функция потерь численно измеряет отклонение её предсказаний от ожидаемых ответов.
- Цель языковой модели может состоять в предсказании скрытого токена или следующего токена в последовательности.
- Функция потерь сравнивает предсказания модели с правильными ответами в обучающих примерах.
- Оптимизатор использует значение функции потерь и её градиенты, чтобы обновлять параметры модели в направлении, которое обычно уменьшает потери.
- Низкие потери только на обучающих данных не гарантируют точных результатов на незнакомых данных.
Зачем это спрашивают: Интервьюер проверяет, может ли кандидат связать цель обучения, измеримую ошибку и обновление параметров без использования формул.
Инференс представляет собой использование обученной модели для получения предсказания или сгенерированного результата без обновления её параметров.
- Модель применяет закономерности, представленные значениями параметров, которые были получены во время обучения.
- В задаче классификации один прямой проход может выдать оценки или вероятности доступных классов.
- При авторегрессионной генерации модель многократно предсказывает следующий токен с учётом токенов, уже находящихся в контексте.
- Метод декодирования превращает предсказанные вероятности токенов в выбранные токены и итоговую последовательность.
Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат использование обученной модели от обновления её параметров во время обучения.
Температура управляет тем, насколько сосредоточено распределение вероятностей следующего токена при случайном выборе токенов во время генерации.
- Низкая температура усиливает преимущество токенов с высокой вероятностью, поэтому результат обычно становится предсказуемее.
- Высокая температура даёт больше шансов токенам с низкой вероятностью, поэтому результат обычно становится разнообразнее.
- При очень низкой температуре выбор приближается к выбору самого вероятного токена, а жадное декодирование выбирает такой токен напрямую без сэмплирования.
- Температура меняет вероятности выбора токенов, но не параметры модели и не сохранённые в ней знания.
Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат температуру как настройку сэмплирования, а не как показатель интеллекта модели.
Top-k и top-p представляют собой методы сэмплирования, которые ограничивают набор возможных следующих токенов.
- Top-k сохраняет фиксированное число k токенов с самыми высокими вероятностями.
- Top-p сохраняет минимальный набор наиболее вероятных токенов, чья суммарная вероятность достигает как минимум порога p.
- Размер набора top-p меняется в зависимости от того, насколько сосредоточено текущее распределение вероятностей.
- После применения любого из фильтров оставшиеся вероятности нормализуются, и из них случайно выбирается один токен.
Зачем это спрашивают: Интервьюер проверяет, может ли кандидат отличить набор фиксированного размера от набора на основе суммарной вероятности.
Один и тот же промпт может давать разные результаты, потому что при генерации токены часто случайно выбираются из распределений вероятностей, а не определяются однозначно.
- На каждом шаге несколько токенов могут иметь ненулевую вероятность и оставаться возможными вариантами.
- Другой токен, выбранный в начале генерации, меняет контекст для всех последующих предсказаний.
- Температура, top-k и top-p влияют на то, насколько сильно сэмплирование может разнообразить результат.
- Жадное декодирование устраняет эту случайность, выбирая самый вероятный токен на каждом шаге.
Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат вероятностную и последовательную природу генерации текста.
Галлюцинация представляет собой результат, в котором модель выдаёт ложную или неподтверждённую информацию за достоверную.
- Она может проявляться как выдуманные факты, цитаты, ссылки на источники, события или шаги рассуждения.
- Связная и уверенная формулировка не доказывает правильность содержания.
- Генеративные модели предсказывают вероятные продолжения и не проверяют автоматически каждое утверждение по надёжным данным.
- Чтобы определить обоснованность результата, его утверждения нужно сопоставить с надёжными источниками или предоставленными исходными материалами.
Зачем это спрашивают: Интервьюер проверяет, отделяет ли кандидат убедительную формулировку от фактической подтверждённости.
Базовую модель получают в результате общего предобучения, а модель для следования инструкциям дополнительно обучают выполнять инструкции и давать подходящие ответы.
- Базовая языковая модель прежде всего предсказывает правдоподобное продолжение текста и может не воспринимать запрос как инструкцию для выполнения.
- Для обучения следованию инструкциям обычно используют примеры, в которых инструкции сопоставлены с желаемыми ответами.
- Такое дополнительное обучение меняет наиболее вероятные ответы модели, но не гарантирует их правильность.
- Модель для следования инструкциям может исходно иметь ту же архитектуру и те же предобученные параметры, что и соответствующая базовая модель.
Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат обучение следованию инструкциям как настройку поведения поверх предобучения.
Эти семейства моделей отличаются тем, как они обрабатывают входную последовательность и создают результат.
- Модели только с энкодером могут учитывать контекст с обеих сторон каждого входного токена для построения представлений, что подходит, например, для классификации и извлечения информации.
- Модели только с декодером используют предыдущие токены как причинный контекст и обычно генерируют текст по одному токену.
- Модели с архитектурой энкодер-декодер сначала кодируют вход, а затем создают отдельный результат с учётом закодированного входа и ранее сгенерированных токенов.
- Эти архитектуры обычно связывают с разными задачами, но название семейства не ограничивает модель только приведёнными примерами.
Зачем это спрашивают: Интервьюер проверяет, может ли кандидат связать каждое семейство моделей с его потоком информации и типичной формой задачи.
Мультимодальная модель искусственного интеллекта может обрабатывать или создавать данные более чем одной модальности, например текст, изображения, аудио или видео.
- Данные каждой поддерживаемой модальности преобразуются в числовые представления, которые модель может обрабатывать.
- Модель может объединять информацию из разных модальностей, например связывать слова с областями изображения.
- Это позволяет отвечать на вопросы по изображению, описывать видео или расшифровывать речь.
- Поддерживаемые входные и выходные модальности зависят от модели, поэтому мультимодальность не означает поддержку любого формата данных.
Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат мультимодальность как работу с разными формами информации.
Закрытые вопросы
- 21
Чем модель с открытыми весами отличается от модели с закрытыми весами и означает ли проприетарность то же самое?
- 22
Что такое квантизация модели?
- 23
Что такое эмбеддинг в машинном обучении?
mlnlpembeddings - 24
Как косинусное сходство сравнивает два эмбеддинга?
nlpembeddings - 25
Чем эмбеддинги отличаются от сгенерированного текста?
nlpembeddings - 26
Для чего нужна векторная база данных?
vector-dbdatabase - 27
Что такое векторный индекс и зачем нужен приближенный поиск ближайших соседей?
indexes - 28
Что такое метаданные и фильтрация по метаданным в векторном поиске?
vector-db - 29
Что такое разбиение документа на чанки?
chunking - 30
Какой компромисс создает размер чанка при поиске по документам?
retrieval - 31
Что такое RAG и какую проблему решает дополнение генерации извлечёнными данными?
retrieval - 32
Из каких концептуальных этапов состоит базовый RAG-процесс?
rag - 33
Чем различаются задачи ретривера и генератора в RAG?
raggenerators - 34
Чем лексический поиск отличается от семантического?
retrieval - 35
Что такое гибридный поиск в RAG-системе?
ragsystem-design - 36
Что такое переранжирование в процессе извлечения данных?
retrievalrerankingci-cd - 37
Что означает опора ответа RAG на извлечённый контекст?
rag - 38
Почему в ответах RAG важны цитаты и ссылки на источники?
ragcitations - 39
Зачем фрагменты документов делают с перекрытием и какой компромисс это создаёт?
- 40
Что означает top-k при извлечении и каким компромиссом управляет его значение?
retrieval - 41
Что делает промпт ясным и конкретным?
prompting - 42
Чем системное сообщение отличается от пользовательского в диалоге с языковой моделью?
system-design - 43
Чем отличаются zero-shot, one-shot и few-shot промптинг?
prompting - 44
Что такое шаблон промпта и какую роль в нём играют переменные?
prompting - 45
Что такое структурированный вывод языковой модели и что определяет схема?
schema - 46
Что означает дообучение предобученной модели?
fine-tuning - 47
Чем на концептуальном уровне дообучение отличается от генерации с дополнением извлечённым контекстом?
retrievalfine-tuning - 48
Что такое параметрически эффективное дообучение и в чём основная идея LoRA?
fine-tuning - 49
Что такое LangChain и какие основные абстракции он предоставляет?
langchainoop - 50
Какие разные роли играют Hugging Face и PyTorch в наборе инструментов начинающего AI-инженера?
distinct - 51
Вам нужно собрать первую версию RAG-ассистента по внутреннему справочнику компании. Какие шаги вы реализуете?
rag - 52
RAG-система часто находит соседний раздел, но пропускает предложение с ответом. Что вы измените в первую очередь?
ragsystem-design - 53
База знаний содержит PDF с таблицами, которые теряют смысл после извлечения в обычный текст. Как вы с ними поступите?
- 54
В одном векторном индексе лежат инструкции для нескольких продуктов, и ответы иногда используют не тот продукт. Как это исправить?
indexes - 55
Пользователи ищут по сокращениям, а в документации используются полные технические названия. Как улучшить поиск?
retrievaldocumentation - 56
Первый найденный чанк не относится к простому вопросу. Как вы будете искать причину?
- 57
В базе знаний есть два документа с разными датами и противоречащими друг другу правилами. Что должен делать ассистент?
- 58
Документ с правилами меняется каждую неделю. Как поддерживать актуальность RAG-индекса и не плодить старый контент?
ragindexes - 59
Пользователь задаёт уточнение вроде А что насчёт премиум-тарифа, и для поиска не хватает контекста. Как это поддержать?
retrieval - 60
Как сделать ссылки на источники в RAG-ответе полезными и проверяемыми для пользователя?
ragcitations - 61
Ретривер не находит подходящий документ, но ассистент всё равно уверенно отвечает. Что вы измените?
- 62
LLM извлекает поля из счетов и выдумывает номер заказа, когда такого поля нет. Как это уменьшить?
llm - 63
Ассистент поддержки пытается угадать правила возврата, когда текст политики неоднозначен. Какое поведение вы реализуете?
- 64
Модель отвечает из общих знаний, хотя переданный контекст утверждает другое. Как вы это исправите?
- 65
Вам нужны надёжные JSON-сводки из заметок в свободной форме, но модель иногда добавляет неподтверждённые факты. Что вы построите?
forms - 66
Как обнаруживать неподтверждённые утверждения в ответах, созданных по небольшому набору документов?
- 67
До запуска внутреннего ассистента для вопросов и ответов осталось десять дней. Как создать полезный первый eval-набор?
- 68
RAG-система дала неправильный ответ. Как понять, ошибка произошла в ретривале или в генерации?
ragretrieval - 69
Какие сигналы вы будете отслеживать для оценки LLM-фичи поддержки клиентов после запуска?
llmdecision-makingllm-eval - 70
Люди проверяют ответы LLM, но их оценки расходятся. Что вы сделаете?
llmconflict - 71
У вас есть две версии промпта для одного ассистента. Как сравнить их до релиза?
prompting - 72
Команда предлагает оценивать каждый ответ с помощью другой LLM. Как безопасно использовать этот метод?
llm - 73
После перехода на новую модель средняя оценка выросла, но несколько важных вопросов стали обрабатываться хуже. Что вы порекомендуете?
- 74
Пользователь поставил ответу ассистента дизлайк. Как превратить этот сигнал в полезные данные для оценки?
llm-eval - 75
Чат-бот показывает ответ через восемь секунд. Что вы сначала измерите и оптимизируете?
optimization - 76
Месячный счёт за LLM вырос вдвое, хотя пользовательский трафик увеличился незначительно. Как вы найдёте причину?
llm - 77
Большинство запросов сводится к простой классификации, но некоторые требуют внимательного рассуждения. Как контролировать стоимость моделей?
classification - 78
Полный ответ LLM занимает пять секунд, но пользователи в основном жалуются на зависший интерфейс. Что вы реализуете?
llmtypes - 79
Команда хочет кешировать ответы LLM для снижения задержки и стоимости. Что вы будете кешировать, а чего избегать?
cachinglatencyllm - 80
Чат-фича отправляет всю историю на каждом шаге и становится медленной и дорогой. Как безопасно сократить контекст?
- 81
Промпт работает в песочнице провайдера, но ломается внутри приложения. Как вы найдёте различие?
prompting - 82
Модель обычно соблюдает требуемый формат ответа, но иногда добавляет лишний текст. Что вы измените?
- 83
Небольшое изменение промпта улучшило один пример, но ухудшило несколько существующих случаев. Как продолжить отладку?
prompting - 84
Как вы встроите LLM-фичу суммаризации в существующее приложение на FastAPI?
llmframeworks - 85
LLM-провайдер иногда превышает тайм-аут или возвращает ошибку ограничения частоты. Как должно реагировать приложение?
llm - 86
Что вы будете записывать в логи LLM-фичи, чтобы отлаживать ошибки и не раскрывать пользовательские данные?
llm - 87
Найденная веб-страница содержит указание игнорировать предыдущие инструкции и раскрыть секреты. Как защитить RAG-ассистента?
ragsecrets - 88
Пользователь просит публичного чат-бота создать контент, нарушающий политику безопасности продукта. Что должно сделать приложение?
- 89
Пользователи могут вставлять номера телефонов и данные аккаунтов в LLM-фичу. Как снизить риск для приватности?
llm - 90
Ассистент может вызвать инструмент для оформления возврата денег клиенту. Какие ограничения вы добавите?
- 91
Модель генерирует SQL для аналитического ассистента. Как не допустить опасные запросы к базе данных?
sqldatabasequeries - 92
Как вы проверите защитные ограничения новой LLM-фичи перед запуском для сотрудников?
llmguardrailsllm-safety - 93
Продакт-менеджер просит создать AI-ассистента, но не может объяснить, каким должен быть хороший ответ. Как вы поступите?
- 94
Старший инженер отклонил ваше изменение промпта, но вы считаете, что оно повышает качество. Что вы сделаете?
prompting - 95
Ваше недавно выпущенное изменение привело к неверным ответам ассистента для части пользователей. Как вы поступите?
- 96
Дедлайн близко, и команда предлагает пропустить оценку LLM, чтобы успеть выпустить фичу. Как вы ответите?
llmestimationllm-eval - 97
После код-ревью вам нужно значительно переписать интеграцию с LLM. Как вы будете работать с замечаниями?
feedbackcode-reviewllm - 98
Коллега не может воспроизвести улучшение из вашего эксперимента с промптом. Что вы проверите и передадите ему?
promptingdebuggingexperiments - 99
Вам поручили фичу на незнакомом API модели с коротким сроком. Как вы подойдёте к задаче?
estimationapi - 100
Ваш AI-прототип не достиг обещанного качества. Как вы объясните результат нетехническому стейкхолдеру?
communicationprototypespromises