Skip to content

Вопросы на собеседовании: AI-инженер

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.

Смотреть пример резюме: AI-инженер

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

raggroundednessarchitecture

RAG-система индексирует исходные материалы, извлекает релевантные фрагменты для запроса и передает их генератору.

  • На этапе загрузки система разбирает документы, делит их на чанки, создает эмбеддинги и сохраняет векторы вместе с текстом и метаданными.
  • Во время запроса система преобразует вопрос пользователя в представление для поиска и извлекает из индекса чанки-кандидаты.
  • Необязательный реранкер точнее упорядочивает кандидатов, после чего сборщик контекста выбирает и форматирует лучшие фрагменты.
  • Языковая модель получает вопрос и собранный контекст, генерирует ответ и может добавить ссылки на сохраненные источники.

Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы RAG как сквозной пайплайн поиска и генерации, а не как один вызов векторного поиска.

ragretrievalsystem-design

Размер чанка и перекрытие определяют баланс между полнотой смысла, точностью поиска и стоимостью контекста.

  • Маленькие чанки обычно точнее соответствуют узким вопросам, но могут разорвать объяснение и убрать контекст, нужный для понимания факта.
  • Большие чанки сохраняют больше локального контекста, но их эмбеддинги могут описывать несколько тем, а сами чанки занимают больше контекстного окна модели.
  • Перекрытие сохраняет информацию у границ чанков, но чрезмерное перекрытие создает дубликаты в результатах, увеличивает индекс и повторяет текст в промпте.
  • Выбирайте размеры в токенах с учетом типа документов, затем сравнивайте полноту поиска и качество ответов на репрезентативном наборе для оценки.

Зачем это спрашивают: Сильный ответ раскрывает компромиссы и для поиска, и для генерации, а также предлагает измерения вместо универсального размера чанка.

chunking

Используйте структурный чанкинг, когда границы документа несут смысл, а семантический, когда смена темы важнее форматирования.

  • Структурный чанкинг следует заголовкам, абзацам, спискам, таблицам или блокам кода, сохраняя иерархию и связь с источником.
  • Семантический чанкинг объединяет соседние предложения по смыслу и ставит границы при смене темы, поэтому подходит для расшифровок и слабо структурированного текста.
  • Структурные блоки могут сильно различаться по размеру, поэтому крупные разделы приходится дополнительно делить по токенам, а мелкие объединять.
  • Семантический чанкинг дороже, менее детерминирован и может разделить единый структурный блок, поэтому на практике оба подхода часто сочетают.

Зачем это спрашивают: Интервьюер хочет понять, умеете ли вы связывать границы чанков с семантикой документа и учитывать ограничения каждого метода.

retrieval

При parent-child-поиске система ищет по небольшим точным чанкам, но передает модели более крупные родительские разделы.

  • Для каждого дочернего чанка создается эмбеддинг с идентификатором родителя, а крупный родительский текст хранится отдельно.
  • Поиск выполняется по дочерним чанкам, потому что их сфокусированные эмбеддинги обычно точнее соответствуют конкретным вопросам, чем большие разделы.
  • Система удаляет дубли идентификаторов родителей и получает соответствующие разделы либо выбранные соседние чанки для сборки контекста.
  • Подход сочетает точность поиска с понятным связным контекстом, но слишком большие родительские разделы добавляют нерелевантный текст и занимают много токенов промпта.

Зачем это спрашивают: Интервьюер оценивает, понимаете ли вы, как разделение единиц поиска и единиц контекста снимает компромисс между точностью и полнотой.

retrieval

Плотный поиск сопоставляет смысл, разреженный сопоставляет термины, а гибридный объединяет оба сигнала.

  • Плотный поиск сравнивает обученные эмбеддинги, поэтому распознает перефразирование и смысловую близость, но может пропускать редкие имена и точные идентификаторы.
  • Разреженный поиск, например BM25, учитывает совпадения токенов и редкость терминов, поэтому хорошо находит коды продуктов, имена и точные технические фразы.
  • Гибридный поиск запускает оба метода и объединяет их ранги, например с помощью reciprocal rank fusion или взвешивания откалиброванных оценок.
  • Выбирайте подход на размеченных запросах, причем гибридный поиск часто подходит корпусам, где естественный язык сочетается с точной терминологией.

Зачем это спрашивают: Сильный ответ объясняет слабые стороны лексического и семантического сопоставления и показывает, как объединение оценок делает их взаимодополняющими.

retrievalqueries

Эти методы улучшают поиск по-разному: уточняют один запрос, расширяют его словарь или делят его на более простые запросы.

  • Переписывание создает более ясный самостоятельный запрос, например раскрывает местоимения или контекст диалога, сохраняя исходное намерение.
  • Расширение создает связанные формулировки, синонимы или вероятные термины, чтобы найти релевантные документы с другой лексикой.
  • Декомпозиция делит составной или многошаговый вопрос на подвопросы, доказательства для которых можно найти и объединить.
  • Каждый метод может исказить намерение и увеличить стоимость, поэтому сохраняйте исходный запрос и его ограничения, а объединенные результаты оценивайте отдельно.

Зачем это спрашивают: Интервьюер проверяет, различаете ли вы три стратегии преобразования запроса и умеете ли балансировать рост полноты поиска с риском смыслового отклонения.

vector-db

Предварительная фильтрация сначала ограничивает множество доступных для поиска кандидатов, а последующая удаляет результаты уже после поиска по сходству.

  • Предварительная фильтрация применяет жесткие ограничения по тенанту, языку, типу документа или дате до того, как нерелевантные векторы попадут в выдачу.
  • Очень избирательные предварительные фильтры могут снизить полноту или эффективность ANN-поиска, если векторный индекс плохо поддерживает поиск с фильтрами.
  • Последующая фильтрация удобнее для гибких критериев, но после нее может остаться меньше k допустимых результатов, поскольку часть поисковой выдачи будет потрачена на отброшенных кандидатов.
  • Используйте поддерживаемую предварительную фильтрацию для авторизации и других обязательных ограничений, а последующую фильтрацию или расширенный набор кандидатов для мягких предпочтений.

Зачем это спрашивают: Сильный ответ связывает место фильтрации с корректностью, числом результатов и особенностями работы приближенных векторных индексов.

retrieval

Выбирайте минимальный top-k, который обеспечивает нужную полноту с учетом ограничений по задержке и стоимости последующей обработки.

  • Маленький top-k быстрее и дешевле, но более поздние этапы уже не смогут вернуть релевантный фрагмент, оказавшийся сразу за порогом.
  • Больший top-k повышает шанс найти нужные данные, но увеличивает объем передаваемой выдачи, работу реранкера и стоимость отбора контекста.
  • Top-k не заменяет параметры ширины ANN-поиска, такие как efSearch или nprobe, которые тоже определяют, насколько тщательно индекс исследует кандидатов.
  • Измеряйте recall@k и задержку на размеченных запросах, а top-k на этапе retrieval задавайте больше итогового числа чанков, передаваемых модели.

Зачем это спрашивают: Интервьюер хочет увидеть, что вы настраиваете ANN-поиск по измерениям и различаете полноту набора кандидатов и итоговый размер контекста.

retrievalreranking

Bi-encoder эффективно находит кандидатов, а cross-encoder точнее ранжирует их небольшой набор с учетом связей между запросом и документом.

  • Bi-encoder кодирует запросы и документы независимо, поэтому векторы документов можно вычислить заранее и искать через ANN-индекс.
  • Cross-encoder совместно обрабатывает каждую пару запроса и документа, точнее учитывает связи на уровне токенов, но требует отдельного запуска модели для каждой пары.
  • Типичный пайплайн получает десятки или сотни кандидатов с помощью bi-encoder, а затем cross-encoder ранжирует их и оставляет гораздо меньший итоговый набор.
  • Реранкинг не вернет релевантный документ, пропущенный первым этапом, поэтому до оценки реранкера нужно измерить полноту исходного поиска.

Зачем это спрашивают: Сильный ответ объясняет роль каждой модели на своем этапе и называет полноту первого этапа верхней границей качества реранкинга.

retrievalcss

Многоэтапный поиск сужает широкий набор кандидатов все более точными методами, а MMR уменьшает повторы в итоговой выдаче.

  • Начальный разреженный, плотный или гибридный поиск извлекает достаточно кандидатов, отдавая приоритет полноте над точностью.
  • Затем проверки метаданных, дедупликация и более сильный реранкер сокращают этот набор перед сборкой контекста.
  • MMR выбирает каждый следующий чанк, учитывая его релевантность запросу и одновременно штрафуя за сходство с уже выбранными чанками.
  • Большее разнообразие улучшает покрытие тем, но может допустить слабые совпадения, поэтому баланс релевантности и разнообразия настраивают по покрытию и качеству ответов.

Зачем это спрашивают: Интервьюер оценивает, умеете ли вы сочетать этапы поиска и управлять повторами, а не заполнять контекст почти одинаковыми фрагментами.

nlpembeddings

Текстовые эмбеддинги кодируют изученные признаки, которые помогают располагать связанные входные данные рядом, а не полное или буквальное значение текста.

  • Относительная геометрия векторов формируется обучающими данными и целевой функцией и может отражать семантические или синтаксические связи, но отдельные измерения обычно не имеют устойчивого понятного человеку смысла.
  • Высокая оценка означает близость в изученном пространстве, но не доказывает логическое следование, совпадение фактов или одинаковое намерение.
  • Отрицания, числа, редкие сущности, обрезка текста и смена предметной области могут скрывать важные различия между внешне похожими векторами.
  • Качество поиска нужно измерять на размеченных примерах задачи, а точные ограничения обрабатывать фильтрами или реранкером.

Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат как полезную абстракцию эмбеддингов, так и ограниченность трактовки сходства как тождества смысла или истинности.

nlpembeddings

Я бы сравнил модели на репрезентативных запросах и документах, учитывая компромисс между релевантностью, размерностью, пропускной способностью и полной стоимостью.

  • Обучающие данные и результаты мультиязычной оценки должны охватывать терминологию предметной области, нужные языки и требуемые сценарии межъязыкового поиска.
  • Большая размерность может сохранить больше сигнала, но увеличивает объем хранения векторов, требования к пропускной способности памяти и нагрузку на индекс без гарантии лучшего качества.
  • Максимальная длина входа, токенизация, производительность пакетной обработки, лицензия и стоимость обработки токенов или собственных вычислений определяют, соответствует ли модель ограничениям.
  • Итоговый выбор должны определять recall@k или nDCG на размеченной выборке, после чего модель нужно проверить во всем предполагаемом поисковом пайплайне.

Зачем это спрашивают: Сильный ответ рассматривает выбор модели как эмпирический поиск компромисса, а не предполагает, что самая большая или новая модель всегда лучше.

nlpembeddingsqueries

Асимметричные эмбеддинги кодируют запросы и документы с учетом их разных ролей, но отображают их в общее пространство, где релевантные пары получают высокую оценку.

  • Кодировщик запросов или инструкция для него ориентированы на кратко сформулированную информационную потребность, а представление документа должно отражать более подробные сведения, способные ее удовлетворить.
  • Обе стороны могут использовать общие веса с разными префиксами или отдельные кодировщики, совместно обученные с контрастивной целевой функцией.
  • Такой подход полезен, когда распределения запросов и документов различаются, например короткий вопрос должен находить длинный фрагмент.
  • Для каждой стороны нужно применять предписанный моделью режим запроса или документа, потому что симметричное кодирование может снизить качество поиска.

Зачем это спрашивают: Интервьюер хочет понять, отличает ли кандидат ролевое кодирование для поиска от применения одного универсального кодировщика предложений ко всем текстам.

vector-db

Эти метрики ранжируют векторы по-разному, если их нормы не контролируются, поэтому метрика поиска должна соответствовать целевой функции обучения и способу нормализации модели.

  • Косинусная схожесть сравнивает направления и не учитывает величину, поскольку делит скалярное произведение на нормы обоих векторов.
  • Скалярное произведение учитывает и направление, и величину, что важно, если модель кодирует полезную информацию в длине вектора.
  • Евклидово расстояние измеряет длину прямого отрезка между векторами, причем меньшее значение означает большую близость.
  • Для нормализованных векторов единичной длины скалярное произведение равно косинусной схожести, а квадрат евклидова расстояния равен двум минус удвоенное значение косинусной схожести.

Зачем это спрашивают: Интервьюер оценивает, связывает ли кандидат выбор метрики, нормализацию и поведение ранжирования, а не считает все векторные расстояния взаимозаменяемыми.

nlpembeddingsfine-tuning

Я бы стал дообучать модель, только если измеренный базовый уровень показывает, что модель регулярно не улавливает важные различия предметной области, и для обучения есть подходящие пары.

  • Сначала анализ ошибок должен исключить более простые причины, например неудачное разбиение текста, слабую разметку или неподходящую метрику схожести.
  • Обучающие примеры должны связывать реалистичные запросы с релевантными объектами и содержать информативные отрицательные примеры для контрастивной или ранжирующей функции потерь.
  • При разделении на обучающую и валидационную выборки связанные документы, сущности или пользователи не должны пересекаться, чтобы близкие дубликаты не завышали оценки поиска.
  • Я бы сравнил исходную и дообученную модели по полноте поиска в предметной области и на более широкой валидационной выборке, а новую модель оставил бы только в том случае, если прирост качества оправдывает дополнительные затраты.

Зачем это спрашивают: Сильный ответ показывает, что дообучение служит обоснованной данными реакцией на конкретный пробел в поиске, а не первым шагом по умолчанию.

nlpembeddingsbatch

Оба вида нерелевантных примеров формируют границу в пространстве эмбеддингов, но сложные отрицательные примеры намеренно похожи на правильные, а внутрибатчевые повторно используются ради эффективности.

  • Сложные отрицательные примеры близки к запросу, но неверны, и их можно находить лексическим поиском, предыдущей моделью или с помощью экспертной разметки.
  • При внутрибатчевом обучении положительные документы для других запросов того же батча считаются отрицательными, что даёт много сравнений без дополнительного кодирования.
  • Ложноотрицательные пары нужно маскировать, поскольку положительный пример другого запроса может быть релевантен и текущему, особенно в данных с дубликатами или несколькими верными ответами.
  • Разнообразные батчи, подходящая температура функции потерь и смесь простых и сложных отрицательных примеров обычно дают более стабильное обучение, чем только самые трудные примеры.

Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат пользу отрицательных примеров для различения объектов и риск обучения неверным связям при небрежной выборке.

indexes

HNSW организует векторы в многоуровневый граф близости и выполняет приближённый жадный поиск от разреженных верхних уровней к плотному нижнему.

  • Каждый добавляемый вектор получает случайный максимальный уровень и соединяется с ближайшими соседями, а M примерно ограничивает число связей узла.
  • Поиск спускается по верхним уровням в перспективную область, а затем исследует очередь кандидатов на нижнем уровне.
  • Увеличение M и efConstruction обычно улучшает связность графа и полноту поиска, но повышает расход памяти, время построения индекса и стоимость вставки.
  • Увеличение efSearch расширяет число проверяемых кандидатов и обычно улучшает полноту ценой задержки запроса, причём его значение должно быть не меньше числа запрошенных результатов.

Зачем это спрашивают: Сильный ответ объясняет механику графа и отделяет параметры построения от настройки баланса полноты и задержки во время запроса.

vector-db

IVF ограничивает поиск выбранными грубыми кластерами, а Product Quantization (PQ) хранит компактные коды и оценивает расстояния вместо точного сравнения всех полных векторов.

  • IVF обучает центроиды, назначает каждому вектору инвертированный список и при запросе проверяет только ближайшие списки в количестве nprobe.
  • Product Quantization (PQ) делит векторы или их остатки на подвекторы и представляет каждую часть индексом изученного кодового слова.
  • Проверка большего числа списков повышает полноту IVF, но увеличивает задержку, а более сильное сжатие экономит память и пропускную способность ценой большей ошибки расстояния.
  • Большее число центроидов, частей вектора или битов кода может повысить точность ценой обучения, хранения или вычислений; точный реранкинг возможен, только если полноточные векторы сохранены или загружаются отдельно, и не вернет кандидатов, отсутствующих в коротком списке.

Зачем это спрашивают: Интервьюер оценивает, может ли кандидат объяснить оба этапа сжатого приближённого поиска и настраивать их как явный компромисс между полнотой, задержкой и памятью.

indexes

Изменяемые векторные хранилища часто представляют обновление как новую вставку, а старые записи скрывают метками логического удаления до тех пор, пока компакция не перестроит индекс без неактуальных записей.

  • При обновлении нужно заменить или сделать недействительным предыдущий вектор с тем же логическим ID, чтобы в результатах возвращалась только последняя актуальная версия.
  • При удалении запись можно сразу снабдить меткой логического удаления, даже если физически убрать ее из связей графа или сжатых сегментов на месте слишком дорого.
  • Поиск отфильтровывает записи с такими метками, но накопившиеся удаленные элементы занимают место и могут увеличить объем проверки кандидатов или ухудшить качество графа.
  • Компакция переписывает сегменты или перестраивает индекс по актуальным записям, освобождая место и сохраняя соответствие ID и согласованное представление данных.

Зачем это спрашивают: Интервьюер хочет увидеть понимание того, почему изменяемые векторные индексы часто разделяют логическое удаление и физическое освобождение места.

databaseshardingreplication

Шардирование распределяет векторы по узлам для увеличения емкости, а репликация хранит копии каждого шарда для повышения доступности и пропускной способности чтения.

  • Хеширование ключа с высокой кардинальностью обычно выравнивает объем данных, а шардирование по арендатору локализует владение, но может создать перекос или горячие шарды, если размеры арендаторов сильно различаются.
  • Глобальный поиск ближайших соседей часто запрашивает локальные лучшие результаты у всех нужных шардов и объединяет их в итоговый top-k; выборочная маршрутизация сокращает число запросов, но может снизить полноту при ошибке маршрута.
  • Реплики должны содержать совместимые векторы и настройки индекса, а выбранная модель согласованности определяет, когда свежие записи становятся видны в каждой копии.
  • Увеличение числа шардов добавляет расходы на маршрутизацию и объединение, а реплик на хранение и запись, поэтому оба числа выбирают по требованиям к емкости, задержке и отказоустойчивости.

Зачем это спрашивают: Сильный ответ различает разделение данных и избыточность, а также учитывает стоимость запросов и согласованности в распределённом векторном поиске.

Закрытые вопросы

  • 21

    Как решить, нужны ли приложению с LLM и большим объемом знаний RAG или дообучение?

    ragfine-tuningllm
  • 22

    Когда следует выбрать полное дообучение вместо PEFT-методов, например LoRA?

    fine-tuning
  • 23

    Чем отличаются обычный промптинг, prompt tuning и instruction fine-tuning?

    promptingfine-tuning
  • 24

    Что такое продолженное предобучение и когда оно полезно для адаптации к домену?

  • 25

    Почему дообучение может вызвать катастрофическое забывание и как смесь данных снижает этот риск?

    fine-tuning
  • 26

    Каким должен быть качественный датасет для дообучения чат-модели и почему формат диалогов должен соответствовать модели?

    fine-tuning
  • 27

    Как распределять токены в контекстном окне LLM?

    contexttokensllm
  • 28

    Чем отличаются сжатие контекста, суммаризация и выборочный поиск как способы уместить полезную информацию в контекстное окно?

    retrievalcontext
  • 29

    Что такое эффект lost in the middle и как он должен влиять на порядок доказательств в контексте?

  • 30

    Какие виды памяти можно использовать в приложении с диалоговой LLM и каковы компромиссы памяти на основе сводок?

    llmmemory
  • 31

    Как выстроить многоуровневую оценку RAG-системы?

    ragsystem-designllm-eval
  • 32

    Чем различаются Recall@k, MRR и nDCG при оценке поиска?

    retrievaldecision-makingllm-eval
  • 33

    Что измеряют обоснованность, верность источнику, релевантность ответа и полнота при оценке RAG?

    raggroundednessllm-eval
  • 34

    Какие смещения возникают при оценке ответов через LLM-судью и как его калибровать?

    llmllm-eval
  • 35

    Как использовать эталонные, синтетические и состязательные примеры в наборе для оценки ИИ?

    llm-eval
  • 36

    Когда применять оценку с эталонным ответом, а когда оценку без него?

    llmllm-eval
  • 37

    Как составить рубрику для человеческой оценки и измерить согласованность экспертов?

    llm-evaldesign
  • 38

    Как поставить контролируемый эксперимент для сравнения двух промптов или моделей?

    promptingdesignforms
  • 39

    Что такое базовый цикл агента и как архитектура планировщик-исполнитель расширяет его?

    agentsarchitecture
  • 40

    Что отличает хорошую схему вызова функции и описание инструмента для LLM?

    llmschemaon-call
  • 41

    Как агенту выбирать инструмент для очередного шага?

    agents
  • 42

    Чем состояние агента отличается от краткосрочной и долгосрочной памяти?

    agentsmemory
  • 43

    Как задать условия остановки и бюджеты для цикла агента?

    agents
  • 44

    Почему структурированный вызов функций обычно лучше разбора свободного текста модели?

    tool-useforms
  • 45

    Как оценивать AI-агента помимо того, насколько хорошо звучит его финальный ответ?

    agentsdecision-makingllm-eval
  • 46

    Какой подход вы используете для выбора модели для AI-функции?

  • 47

    Чем модели с открытыми весами отличаются от закрытых моделей в управляемых сервисах?

  • 48

    Когда использовать маленькую модель, большую модель или каскад из обеих?

  • 49

    Как temperature и top-p влияют на декодирование языковой модели?

    decoding
  • 50

    Когда стоит выбрать reasoning-модель вместо обычной instruction-модели?

  • 51

    RAG-ассистент в продакшене часто пропускает документы, в которых явно есть ответ. Как вы будете диагностировать и повышать полноту поиска?

    ragretrieval
  • 52

    Поиск обычно находит ответ, но большинство возвращённых чанков нерелевантны и ухудшают генерацию. Что вы измените?

  • 53

    Как вы подберёте размер чанка и перекрытие для RAG-корпуса с регламентами, инструкциями и таблицами?

    rag
  • 54

    После добавления фильтров по метаданным некоторые авторизованные пользователи перестали находить доступные им документы. Как вы найдёте и исправите проблему?

  • 55

    Плотный поиск хорошо обрабатывает перефразирование, но пропускает коды продуктов и точные технические термины. Как вы внедрите гибридный плотный и разреженный поиск?

    retrieval
  • 56

    Вы хотите добавить cross-encoder reranker в RAG, но у эндпоинта уже жёсткий бюджет задержки. Как вы будете его выкатывать?

    ragrerankinglatency
  • 57

    Пользователи получают ответы из документов, которые обновили или удалили вчера. Как вы обеспечите актуальность RAG-индекса?

    ragindexes
  • 58

    В многошаговом чате поддержки уточнения вроде «Это действует в Европе?» находят посторонние документы. Как вы реализуете переформулирование запроса?

    queries
  • 59

    Как сделать так, чтобы RAG-ассистент возвращал цитаты, которые пользователь может открыть и сверить с источником?

    ragcitations
  • 60

    Многоязычная RAG-система хорошо работает на английском, но заметно хуже на испанском и немецком. Как вы будете её диагностировать и улучшать?

    ragsystem-design
  • 61

    RAG-ассистент выдумывает деталь политики, хотя правильный документ есть в извлечённом контексте. Как вы найдёте и исправите причину?

    rag
  • 62

    Как настроить ассистента поддержки так, чтобы он отказывался отвечать при недостатке доказательств в базе знаний, но не отказывал слишком часто?

  • 63

    На извлечённой веб-странице есть текст, который требует от модели игнорировать инструкции и вызвать внутренний инструмент. Какие меры защиты вы добавите?

  • 64

    После небольшой правки системного промпта качество ответов упало, но общие метрики задержки и ошибок выглядят нормально. Как вы исследуете регрессию?

    latencysystem-designmonitoring
  • 65

    В промпт для классификации заявок можно добавить только четыре few-shot примера. Как вы их выберете?

    classificationprompting
  • 66

    Эндпоинт извлечения обычно возвращает валидный JSON, но иногда добавляет текст, пропускает обязательные поля или использует неверные типы. Как вы стабилизируете результат?

    endpoints
  • 67

    Как версионировать и выпустить изменение промпта для продакшен-функции суммаризации, чтобы сбои было легко найти и откатить?

    promptingtracing
  • 68

    Модель отвечает правильно, когда ключевой фрагмент находится в начале контекста, но пропускает его в середине. Что вы измените?

  • 69

    Ассистент для записи выбирает правильный инструмент, но иногда передаёт неверный диапазон дат или идентификатор клиента из диалога вместо авторизованного пользователя. Как это исправить?

    jobs
  • 70

    В RAG-ответ попали два документа с политиками, которые по-разному задают срок возврата. Как должна ответить система и как вы проверите её поведение?

    ragsystem-designconflict
  • 71

    Как бы вы собрали первый эталонный eval-набор для LLM-функции, у которой уже есть production-трафик?

    llmllm-eval
  • 72

    Пользователи ставят LLM-ассистенту дизлайки и пишут обращения в поддержку; как превратить эту обратную связь в полезные eval-кейсы?

    llmfeedback
  • 73

    Как перед использованием LLM-as-a-judge в CI проверить, достаточно ли надёжны его оценки?

    llm
  • 74

    Провайдер выпустил новую версию модели, и eval-оценка снизилась; как решить, принимать обновление или блокировать его?

    decision-making
  • 75

    Качество ответов RAG-системы упало; как определить, виноват поиск контекста или генерация?

    ragretrievalsystem-design
  • 76

    Как построить практический red-team eval для guardrails LLM-агента, который умеет вызывать инструменты?

    agentsllmguardrails
  • 77

    Как оценить одновременно фактологичность и корректность цитат в ответах RAG-ассистента?

    ragcitationsdecision-making
  • 78

    LLM-eval то проходит, то падает при неизменном коде; как диагностировать и обработать такую нестабильность?

    llm
  • 79

    Общая eval-оценка не изменилась, но одна группа клиентов сообщает об ухудшении ответов; как исследовать скрытую регрессию?

    cohortsaggregation
  • 80

    Как задать acceptance thresholds для LLM-функции до оценки релиз-кандидата?

    llmllm-eval
  • 81

    У LLM-функции p95 задержки составляет девять секунд, но команда измеряет только полное время запроса; как вы найдёте и сократите задержку?

    latencyllm
  • 82

    Пользователи несколько секунд не видят ответ, потому что ваш API буферизует весь ответ LLM; что вы измените, чтобы сократить время до первого токена?

    tokensllmapi
  • 83

    Ассистент поддержки получает много повторяющихся похожих запросов, и вы хотите добавить точный и семантический кеш без устаревших ответов или утечки между клиентами; как вы это реализуете?

    caching
  • 84

    Большинству запросов достаточно дешёвой модели, но сложные теряют точность, если не попадают в более сильную модель; как вы добавите маршрутизацию?

  • 85

    Расход токенов удвоился после добавления поиска контекста и более длинных ответов в LLM-функцию; как вы сократите стоимость, не снижая качество модели вслепую?

    retrievaltokensllm
  • 86

    Во время пика трафика LLM-провайдер начинает возвращать ошибки ограничения частоты, хотя сам сервис исправен; как вы стабилизируете запросы?

    llm
  • 87

    Этап переранжирования иногда завершается по таймауту и обрушает весь RAG-запрос; как вы сохраните полезный частичный ответ?

    ragreranking
  • 88

    Основная модель периодически падает, но резервная выдаёт другие поля JSON и ответы более низкого качества; как вы сделаете переключение безопасным?

  • 89

    Всплеск запросов на анализ документов исчерпывает воркеры, из-за чего интерактивные вызовы LLM завершаются по таймауту; как вы добавите backpressure?

    llmbackpressure
  • 90

    LLM-провайдер полностью недоступен в рабочее время; что должно делать приложение в первые минуты и во время восстановления?

    llm
  • 91

    Пользователь сообщил об одном неверном ответе LLM-приложения с поиском по базе знаний и инструментами; как вы проследите такой запрос от начала до конца?

    retrievalllm
  • 92

    Как предотвратить утечку персональных данных через промпты и логи приложения, сохранив достаточно информации для разбора сбоев?

    promptingdiscovery
  • 93

    Недавно включённый guardrail блокирует много безопасных запросов пользователей; как снизить ложные срабатывания, не ослабляя защиту вслепую?

    guardrailsllm-safety
  • 94

    Клиент получил RAG-ответ со ссылкой на документ другого клиента; как вы локализуете инцидент, найдёте причину и устраните утечку между tenants?

    rag
  • 95

    Как перенести production RAG-систему на новую модель эмбеддингов, не сломав поиск по существующим документам?

    nlpragembeddings
  • 96

    Документы в основной системе обновляются или удаляются, но векторная база продолжает возвращать старые фрагменты; как исправить и предотвратить такой рассинхрон?

    vector-dbdatabasesystem-design
  • 97

    Асинхронная задача ingestion документа падает после создания части фрагментов, а повторные запуски иногда создают дубликаты; как сделать повторную обработку безопасной?

    async
  • 98

    Несколько production-пользователей жалуются на бесполезные ответы ассистента, но описания расплывчаты; как превратить эти жалобы в исправления и проверки качества?

    llm-eval
  • 99

    PM хочет запустить LLM-функцию на следующей неделе и спрашивает, достаточно ли её качество; как согласовать реалистичную планку и ограниченный запуск?

    llm
  • 100

    Сразу после релиза LLM-приложения качество ответов резко упало; как вы проведёте диагностику регрессии от начала до конца?

    llm