Вопросы на собеседовании: AI-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.
Смотреть пример резюме: AI-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
RAG-система индексирует исходные материалы, извлекает релевантные фрагменты для запроса и передает их генератору.
- На этапе загрузки система разбирает документы, делит их на чанки, создает эмбеддинги и сохраняет векторы вместе с текстом и метаданными.
- Во время запроса система преобразует вопрос пользователя в представление для поиска и извлекает из индекса чанки-кандидаты.
- Необязательный реранкер точнее упорядочивает кандидатов, после чего сборщик контекста выбирает и форматирует лучшие фрагменты.
- Языковая модель получает вопрос и собранный контекст, генерирует ответ и может добавить ссылки на сохраненные источники.
Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы RAG как сквозной пайплайн поиска и генерации, а не как один вызов векторного поиска.
Размер чанка и перекрытие определяют баланс между полнотой смысла, точностью поиска и стоимостью контекста.
- Маленькие чанки обычно точнее соответствуют узким вопросам, но могут разорвать объяснение и убрать контекст, нужный для понимания факта.
- Большие чанки сохраняют больше локального контекста, но их эмбеддинги могут описывать несколько тем, а сами чанки занимают больше контекстного окна модели.
- Перекрытие сохраняет информацию у границ чанков, но чрезмерное перекрытие создает дубликаты в результатах, увеличивает индекс и повторяет текст в промпте.
- Выбирайте размеры в токенах с учетом типа документов, затем сравнивайте полноту поиска и качество ответов на репрезентативном наборе для оценки.
Зачем это спрашивают: Сильный ответ раскрывает компромиссы и для поиска, и для генерации, а также предлагает измерения вместо универсального размера чанка.
Используйте структурный чанкинг, когда границы документа несут смысл, а семантический, когда смена темы важнее форматирования.
- Структурный чанкинг следует заголовкам, абзацам, спискам, таблицам или блокам кода, сохраняя иерархию и связь с источником.
- Семантический чанкинг объединяет соседние предложения по смыслу и ставит границы при смене темы, поэтому подходит для расшифровок и слабо структурированного текста.
- Структурные блоки могут сильно различаться по размеру, поэтому крупные разделы приходится дополнительно делить по токенам, а мелкие объединять.
- Семантический чанкинг дороже, менее детерминирован и может разделить единый структурный блок, поэтому на практике оба подхода часто сочетают.
Зачем это спрашивают: Интервьюер хочет понять, умеете ли вы связывать границы чанков с семантикой документа и учитывать ограничения каждого метода.
При parent-child-поиске система ищет по небольшим точным чанкам, но передает модели более крупные родительские разделы.
- Для каждого дочернего чанка создается эмбеддинг с идентификатором родителя, а крупный родительский текст хранится отдельно.
- Поиск выполняется по дочерним чанкам, потому что их сфокусированные эмбеддинги обычно точнее соответствуют конкретным вопросам, чем большие разделы.
- Система удаляет дубли идентификаторов родителей и получает соответствующие разделы либо выбранные соседние чанки для сборки контекста.
- Подход сочетает точность поиска с понятным связным контекстом, но слишком большие родительские разделы добавляют нерелевантный текст и занимают много токенов промпта.
Зачем это спрашивают: Интервьюер оценивает, понимаете ли вы, как разделение единиц поиска и единиц контекста снимает компромисс между точностью и полнотой.
Плотный поиск сопоставляет смысл, разреженный сопоставляет термины, а гибридный объединяет оба сигнала.
- Плотный поиск сравнивает обученные эмбеддинги, поэтому распознает перефразирование и смысловую близость, но может пропускать редкие имена и точные идентификаторы.
- Разреженный поиск, например BM25, учитывает совпадения токенов и редкость терминов, поэтому хорошо находит коды продуктов, имена и точные технические фразы.
- Гибридный поиск запускает оба метода и объединяет их ранги, например с помощью reciprocal rank fusion или взвешивания откалиброванных оценок.
- Выбирайте подход на размеченных запросах, причем гибридный поиск часто подходит корпусам, где естественный язык сочетается с точной терминологией.
Зачем это спрашивают: Сильный ответ объясняет слабые стороны лексического и семантического сопоставления и показывает, как объединение оценок делает их взаимодополняющими.
Эти методы улучшают поиск по-разному: уточняют один запрос, расширяют его словарь или делят его на более простые запросы.
- Переписывание создает более ясный самостоятельный запрос, например раскрывает местоимения или контекст диалога, сохраняя исходное намерение.
- Расширение создает связанные формулировки, синонимы или вероятные термины, чтобы найти релевантные документы с другой лексикой.
- Декомпозиция делит составной или многошаговый вопрос на подвопросы, доказательства для которых можно найти и объединить.
- Каждый метод может исказить намерение и увеличить стоимость, поэтому сохраняйте исходный запрос и его ограничения, а объединенные результаты оценивайте отдельно.
Зачем это спрашивают: Интервьюер проверяет, различаете ли вы три стратегии преобразования запроса и умеете ли балансировать рост полноты поиска с риском смыслового отклонения.
Предварительная фильтрация сначала ограничивает множество доступных для поиска кандидатов, а последующая удаляет результаты уже после поиска по сходству.
- Предварительная фильтрация применяет жесткие ограничения по тенанту, языку, типу документа или дате до того, как нерелевантные векторы попадут в выдачу.
- Очень избирательные предварительные фильтры могут снизить полноту или эффективность ANN-поиска, если векторный индекс плохо поддерживает поиск с фильтрами.
- Последующая фильтрация удобнее для гибких критериев, но после нее может остаться меньше k допустимых результатов, поскольку часть поисковой выдачи будет потрачена на отброшенных кандидатов.
- Используйте поддерживаемую предварительную фильтрацию для авторизации и других обязательных ограничений, а последующую фильтрацию или расширенный набор кандидатов для мягких предпочтений.
Зачем это спрашивают: Сильный ответ связывает место фильтрации с корректностью, числом результатов и особенностями работы приближенных векторных индексов.
Выбирайте минимальный top-k, который обеспечивает нужную полноту с учетом ограничений по задержке и стоимости последующей обработки.
- Маленький top-k быстрее и дешевле, но более поздние этапы уже не смогут вернуть релевантный фрагмент, оказавшийся сразу за порогом.
- Больший top-k повышает шанс найти нужные данные, но увеличивает объем передаваемой выдачи, работу реранкера и стоимость отбора контекста.
- Top-k не заменяет параметры ширины ANN-поиска, такие как efSearch или nprobe, которые тоже определяют, насколько тщательно индекс исследует кандидатов.
- Измеряйте recall@k и задержку на размеченных запросах, а top-k на этапе retrieval задавайте больше итогового числа чанков, передаваемых модели.
Зачем это спрашивают: Интервьюер хочет увидеть, что вы настраиваете ANN-поиск по измерениям и различаете полноту набора кандидатов и итоговый размер контекста.
Bi-encoder эффективно находит кандидатов, а cross-encoder точнее ранжирует их небольшой набор с учетом связей между запросом и документом.
- Bi-encoder кодирует запросы и документы независимо, поэтому векторы документов можно вычислить заранее и искать через ANN-индекс.
- Cross-encoder совместно обрабатывает каждую пару запроса и документа, точнее учитывает связи на уровне токенов, но требует отдельного запуска модели для каждой пары.
- Типичный пайплайн получает десятки или сотни кандидатов с помощью bi-encoder, а затем cross-encoder ранжирует их и оставляет гораздо меньший итоговый набор.
- Реранкинг не вернет релевантный документ, пропущенный первым этапом, поэтому до оценки реранкера нужно измерить полноту исходного поиска.
Зачем это спрашивают: Сильный ответ объясняет роль каждой модели на своем этапе и называет полноту первого этапа верхней границей качества реранкинга.
Многоэтапный поиск сужает широкий набор кандидатов все более точными методами, а MMR уменьшает повторы в итоговой выдаче.
- Начальный разреженный, плотный или гибридный поиск извлекает достаточно кандидатов, отдавая приоритет полноте над точностью.
- Затем проверки метаданных, дедупликация и более сильный реранкер сокращают этот набор перед сборкой контекста.
- MMR выбирает каждый следующий чанк, учитывая его релевантность запросу и одновременно штрафуя за сходство с уже выбранными чанками.
- Большее разнообразие улучшает покрытие тем, но может допустить слабые совпадения, поэтому баланс релевантности и разнообразия настраивают по покрытию и качеству ответов.
Зачем это спрашивают: Интервьюер оценивает, умеете ли вы сочетать этапы поиска и управлять повторами, а не заполнять контекст почти одинаковыми фрагментами.
Текстовые эмбеддинги кодируют изученные признаки, которые помогают располагать связанные входные данные рядом, а не полное или буквальное значение текста.
- Относительная геометрия векторов формируется обучающими данными и целевой функцией и может отражать семантические или синтаксические связи, но отдельные измерения обычно не имеют устойчивого понятного человеку смысла.
- Высокая оценка означает близость в изученном пространстве, но не доказывает логическое следование, совпадение фактов или одинаковое намерение.
- Отрицания, числа, редкие сущности, обрезка текста и смена предметной области могут скрывать важные различия между внешне похожими векторами.
- Качество поиска нужно измерять на размеченных примерах задачи, а точные ограничения обрабатывать фильтрами или реранкером.
Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат как полезную абстракцию эмбеддингов, так и ограниченность трактовки сходства как тождества смысла или истинности.
Я бы сравнил модели на репрезентативных запросах и документах, учитывая компромисс между релевантностью, размерностью, пропускной способностью и полной стоимостью.
- Обучающие данные и результаты мультиязычной оценки должны охватывать терминологию предметной области, нужные языки и требуемые сценарии межъязыкового поиска.
- Большая размерность может сохранить больше сигнала, но увеличивает объем хранения векторов, требования к пропускной способности памяти и нагрузку на индекс без гарантии лучшего качества.
- Максимальная длина входа, токенизация, производительность пакетной обработки, лицензия и стоимость обработки токенов или собственных вычислений определяют, соответствует ли модель ограничениям.
- Итоговый выбор должны определять recall@k или nDCG на размеченной выборке, после чего модель нужно проверить во всем предполагаемом поисковом пайплайне.
Зачем это спрашивают: Сильный ответ рассматривает выбор модели как эмпирический поиск компромисса, а не предполагает, что самая большая или новая модель всегда лучше.
Асимметричные эмбеддинги кодируют запросы и документы с учетом их разных ролей, но отображают их в общее пространство, где релевантные пары получают высокую оценку.
- Кодировщик запросов или инструкция для него ориентированы на кратко сформулированную информационную потребность, а представление документа должно отражать более подробные сведения, способные ее удовлетворить.
- Обе стороны могут использовать общие веса с разными префиксами или отдельные кодировщики, совместно обученные с контрастивной целевой функцией.
- Такой подход полезен, когда распределения запросов и документов различаются, например короткий вопрос должен находить длинный фрагмент.
- Для каждой стороны нужно применять предписанный моделью режим запроса или документа, потому что симметричное кодирование может снизить качество поиска.
Зачем это спрашивают: Интервьюер хочет понять, отличает ли кандидат ролевое кодирование для поиска от применения одного универсального кодировщика предложений ко всем текстам.
Эти метрики ранжируют векторы по-разному, если их нормы не контролируются, поэтому метрика поиска должна соответствовать целевой функции обучения и способу нормализации модели.
- Косинусная схожесть сравнивает направления и не учитывает величину, поскольку делит скалярное произведение на нормы обоих векторов.
- Скалярное произведение учитывает и направление, и величину, что важно, если модель кодирует полезную информацию в длине вектора.
- Евклидово расстояние измеряет длину прямого отрезка между векторами, причем меньшее значение означает большую близость.
- Для нормализованных векторов единичной длины скалярное произведение равно косинусной схожести, а квадрат евклидова расстояния равен двум минус удвоенное значение косинусной схожести.
Зачем это спрашивают: Интервьюер оценивает, связывает ли кандидат выбор метрики, нормализацию и поведение ранжирования, а не считает все векторные расстояния взаимозаменяемыми.
Я бы стал дообучать модель, только если измеренный базовый уровень показывает, что модель регулярно не улавливает важные различия предметной области, и для обучения есть подходящие пары.
- Сначала анализ ошибок должен исключить более простые причины, например неудачное разбиение текста, слабую разметку или неподходящую метрику схожести.
- Обучающие примеры должны связывать реалистичные запросы с релевантными объектами и содержать информативные отрицательные примеры для контрастивной или ранжирующей функции потерь.
- При разделении на обучающую и валидационную выборки связанные документы, сущности или пользователи не должны пересекаться, чтобы близкие дубликаты не завышали оценки поиска.
- Я бы сравнил исходную и дообученную модели по полноте поиска в предметной области и на более широкой валидационной выборке, а новую модель оставил бы только в том случае, если прирост качества оправдывает дополнительные затраты.
Зачем это спрашивают: Сильный ответ показывает, что дообучение служит обоснованной данными реакцией на конкретный пробел в поиске, а не первым шагом по умолчанию.
Оба вида нерелевантных примеров формируют границу в пространстве эмбеддингов, но сложные отрицательные примеры намеренно похожи на правильные, а внутрибатчевые повторно используются ради эффективности.
- Сложные отрицательные примеры близки к запросу, но неверны, и их можно находить лексическим поиском, предыдущей моделью или с помощью экспертной разметки.
- При внутрибатчевом обучении положительные документы для других запросов того же батча считаются отрицательными, что даёт много сравнений без дополнительного кодирования.
- Ложноотрицательные пары нужно маскировать, поскольку положительный пример другого запроса может быть релевантен и текущему, особенно в данных с дубликатами или несколькими верными ответами.
- Разнообразные батчи, подходящая температура функции потерь и смесь простых и сложных отрицательных примеров обычно дают более стабильное обучение, чем только самые трудные примеры.
Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат пользу отрицательных примеров для различения объектов и риск обучения неверным связям при небрежной выборке.
HNSW организует векторы в многоуровневый граф близости и выполняет приближённый жадный поиск от разреженных верхних уровней к плотному нижнему.
- Каждый добавляемый вектор получает случайный максимальный уровень и соединяется с ближайшими соседями, а M примерно ограничивает число связей узла.
- Поиск спускается по верхним уровням в перспективную область, а затем исследует очередь кандидатов на нижнем уровне.
- Увеличение M и efConstruction обычно улучшает связность графа и полноту поиска, но повышает расход памяти, время построения индекса и стоимость вставки.
- Увеличение efSearch расширяет число проверяемых кандидатов и обычно улучшает полноту ценой задержки запроса, причём его значение должно быть не меньше числа запрошенных результатов.
Зачем это спрашивают: Сильный ответ объясняет механику графа и отделяет параметры построения от настройки баланса полноты и задержки во время запроса.
IVF ограничивает поиск выбранными грубыми кластерами, а Product Quantization (PQ) хранит компактные коды и оценивает расстояния вместо точного сравнения всех полных векторов.
- IVF обучает центроиды, назначает каждому вектору инвертированный список и при запросе проверяет только ближайшие списки в количестве nprobe.
- Product Quantization (PQ) делит векторы или их остатки на подвекторы и представляет каждую часть индексом изученного кодового слова.
- Проверка большего числа списков повышает полноту IVF, но увеличивает задержку, а более сильное сжатие экономит память и пропускную способность ценой большей ошибки расстояния.
- Большее число центроидов, частей вектора или битов кода может повысить точность ценой обучения, хранения или вычислений; точный реранкинг возможен, только если полноточные векторы сохранены или загружаются отдельно, и не вернет кандидатов, отсутствующих в коротком списке.
Зачем это спрашивают: Интервьюер оценивает, может ли кандидат объяснить оба этапа сжатого приближённого поиска и настраивать их как явный компромисс между полнотой, задержкой и памятью.
Изменяемые векторные хранилища часто представляют обновление как новую вставку, а старые записи скрывают метками логического удаления до тех пор, пока компакция не перестроит индекс без неактуальных записей.
- При обновлении нужно заменить или сделать недействительным предыдущий вектор с тем же логическим ID, чтобы в результатах возвращалась только последняя актуальная версия.
- При удалении запись можно сразу снабдить меткой логического удаления, даже если физически убрать ее из связей графа или сжатых сегментов на месте слишком дорого.
- Поиск отфильтровывает записи с такими метками, но накопившиеся удаленные элементы занимают место и могут увеличить объем проверки кандидатов или ухудшить качество графа.
- Компакция переписывает сегменты или перестраивает индекс по актуальным записям, освобождая место и сохраняя соответствие ID и согласованное представление данных.
Зачем это спрашивают: Интервьюер хочет увидеть понимание того, почему изменяемые векторные индексы часто разделяют логическое удаление и физическое освобождение места.
Шардирование распределяет векторы по узлам для увеличения емкости, а репликация хранит копии каждого шарда для повышения доступности и пропускной способности чтения.
- Хеширование ключа с высокой кардинальностью обычно выравнивает объем данных, а шардирование по арендатору локализует владение, но может создать перекос или горячие шарды, если размеры арендаторов сильно различаются.
- Глобальный поиск ближайших соседей часто запрашивает локальные лучшие результаты у всех нужных шардов и объединяет их в итоговый top-k; выборочная маршрутизация сокращает число запросов, но может снизить полноту при ошибке маршрута.
- Реплики должны содержать совместимые векторы и настройки индекса, а выбранная модель согласованности определяет, когда свежие записи становятся видны в каждой копии.
- Увеличение числа шардов добавляет расходы на маршрутизацию и объединение, а реплик на хранение и запись, поэтому оба числа выбирают по требованиям к емкости, задержке и отказоустойчивости.
Зачем это спрашивают: Сильный ответ различает разделение данных и избыточность, а также учитывает стоимость запросов и согласованности в распределённом векторном поиске.
Закрытые вопросы
- 21
Как решить, нужны ли приложению с LLM и большим объемом знаний RAG или дообучение?
ragfine-tuningllm - 22
Когда следует выбрать полное дообучение вместо PEFT-методов, например LoRA?
fine-tuning - 23
Чем отличаются обычный промптинг, prompt tuning и instruction fine-tuning?
promptingfine-tuning - 24
Что такое продолженное предобучение и когда оно полезно для адаптации к домену?
- 25
Почему дообучение может вызвать катастрофическое забывание и как смесь данных снижает этот риск?
fine-tuning - 26
Каким должен быть качественный датасет для дообучения чат-модели и почему формат диалогов должен соответствовать модели?
fine-tuning - 27
Как распределять токены в контекстном окне LLM?
contexttokensllm - 28
Чем отличаются сжатие контекста, суммаризация и выборочный поиск как способы уместить полезную информацию в контекстное окно?
retrievalcontext - 29
Что такое эффект lost in the middle и как он должен влиять на порядок доказательств в контексте?
- 30
Какие виды памяти можно использовать в приложении с диалоговой LLM и каковы компромиссы памяти на основе сводок?
llmmemory - 31
Как выстроить многоуровневую оценку RAG-системы?
ragsystem-designllm-eval - 32
Чем различаются Recall@k, MRR и nDCG при оценке поиска?
retrievaldecision-makingllm-eval - 33
Что измеряют обоснованность, верность источнику, релевантность ответа и полнота при оценке RAG?
raggroundednessllm-eval - 34
Какие смещения возникают при оценке ответов через LLM-судью и как его калибровать?
llmllm-eval - 35
Как использовать эталонные, синтетические и состязательные примеры в наборе для оценки ИИ?
llm-eval - 36
Когда применять оценку с эталонным ответом, а когда оценку без него?
llmllm-eval - 37
Как составить рубрику для человеческой оценки и измерить согласованность экспертов?
llm-evaldesign - 38
Как поставить контролируемый эксперимент для сравнения двух промптов или моделей?
promptingdesignforms - 39
Что такое базовый цикл агента и как архитектура планировщик-исполнитель расширяет его?
agentsarchitecture - 40
Что отличает хорошую схему вызова функции и описание инструмента для LLM?
llmschemaon-call - 41
Как агенту выбирать инструмент для очередного шага?
agents - 42
Чем состояние агента отличается от краткосрочной и долгосрочной памяти?
agentsmemory - 43
Как задать условия остановки и бюджеты для цикла агента?
agents - 44
Почему структурированный вызов функций обычно лучше разбора свободного текста модели?
tool-useforms - 45
Как оценивать AI-агента помимо того, насколько хорошо звучит его финальный ответ?
agentsdecision-makingllm-eval - 46
Какой подход вы используете для выбора модели для AI-функции?
- 47
Чем модели с открытыми весами отличаются от закрытых моделей в управляемых сервисах?
- 48
Когда использовать маленькую модель, большую модель или каскад из обеих?
- 49
Как temperature и top-p влияют на декодирование языковой модели?
decoding - 50
Когда стоит выбрать reasoning-модель вместо обычной instruction-модели?
- 51
RAG-ассистент в продакшене часто пропускает документы, в которых явно есть ответ. Как вы будете диагностировать и повышать полноту поиска?
ragretrieval - 52
Поиск обычно находит ответ, но большинство возвращённых чанков нерелевантны и ухудшают генерацию. Что вы измените?
- 53
Как вы подберёте размер чанка и перекрытие для RAG-корпуса с регламентами, инструкциями и таблицами?
rag - 54
После добавления фильтров по метаданным некоторые авторизованные пользователи перестали находить доступные им документы. Как вы найдёте и исправите проблему?
- 55
Плотный поиск хорошо обрабатывает перефразирование, но пропускает коды продуктов и точные технические термины. Как вы внедрите гибридный плотный и разреженный поиск?
retrieval - 56
Вы хотите добавить cross-encoder reranker в RAG, но у эндпоинта уже жёсткий бюджет задержки. Как вы будете его выкатывать?
ragrerankinglatency - 57
Пользователи получают ответы из документов, которые обновили или удалили вчера. Как вы обеспечите актуальность RAG-индекса?
ragindexes - 58
В многошаговом чате поддержки уточнения вроде «Это действует в Европе?» находят посторонние документы. Как вы реализуете переформулирование запроса?
queries - 59
Как сделать так, чтобы RAG-ассистент возвращал цитаты, которые пользователь может открыть и сверить с источником?
ragcitations - 60
Многоязычная RAG-система хорошо работает на английском, но заметно хуже на испанском и немецком. Как вы будете её диагностировать и улучшать?
ragsystem-design - 61
RAG-ассистент выдумывает деталь политики, хотя правильный документ есть в извлечённом контексте. Как вы найдёте и исправите причину?
rag - 62
Как настроить ассистента поддержки так, чтобы он отказывался отвечать при недостатке доказательств в базе знаний, но не отказывал слишком часто?
- 63
На извлечённой веб-странице есть текст, который требует от модели игнорировать инструкции и вызвать внутренний инструмент. Какие меры защиты вы добавите?
- 64
После небольшой правки системного промпта качество ответов упало, но общие метрики задержки и ошибок выглядят нормально. Как вы исследуете регрессию?
latencysystem-designmonitoring - 65
В промпт для классификации заявок можно добавить только четыре few-shot примера. Как вы их выберете?
classificationprompting - 66
Эндпоинт извлечения обычно возвращает валидный JSON, но иногда добавляет текст, пропускает обязательные поля или использует неверные типы. Как вы стабилизируете результат?
endpoints - 67
Как версионировать и выпустить изменение промпта для продакшен-функции суммаризации, чтобы сбои было легко найти и откатить?
promptingtracing - 68
Модель отвечает правильно, когда ключевой фрагмент находится в начале контекста, но пропускает его в середине. Что вы измените?
- 69
Ассистент для записи выбирает правильный инструмент, но иногда передаёт неверный диапазон дат или идентификатор клиента из диалога вместо авторизованного пользователя. Как это исправить?
jobs - 70
В RAG-ответ попали два документа с политиками, которые по-разному задают срок возврата. Как должна ответить система и как вы проверите её поведение?
ragsystem-designconflict - 71
Как бы вы собрали первый эталонный eval-набор для LLM-функции, у которой уже есть production-трафик?
llmllm-eval - 72
Пользователи ставят LLM-ассистенту дизлайки и пишут обращения в поддержку; как превратить эту обратную связь в полезные eval-кейсы?
llmfeedback - 73
Как перед использованием LLM-as-a-judge в CI проверить, достаточно ли надёжны его оценки?
llm - 74
Провайдер выпустил новую версию модели, и eval-оценка снизилась; как решить, принимать обновление или блокировать его?
decision-making - 75
Качество ответов RAG-системы упало; как определить, виноват поиск контекста или генерация?
ragretrievalsystem-design - 76
Как построить практический red-team eval для guardrails LLM-агента, который умеет вызывать инструменты?
agentsllmguardrails - 77
Как оценить одновременно фактологичность и корректность цитат в ответах RAG-ассистента?
ragcitationsdecision-making - 78
LLM-eval то проходит, то падает при неизменном коде; как диагностировать и обработать такую нестабильность?
llm - 79
Общая eval-оценка не изменилась, но одна группа клиентов сообщает об ухудшении ответов; как исследовать скрытую регрессию?
cohortsaggregation - 80
Как задать acceptance thresholds для LLM-функции до оценки релиз-кандидата?
llmllm-eval - 81
У LLM-функции p95 задержки составляет девять секунд, но команда измеряет только полное время запроса; как вы найдёте и сократите задержку?
latencyllm - 82
Пользователи несколько секунд не видят ответ, потому что ваш API буферизует весь ответ LLM; что вы измените, чтобы сократить время до первого токена?
tokensllmapi - 83
Ассистент поддержки получает много повторяющихся похожих запросов, и вы хотите добавить точный и семантический кеш без устаревших ответов или утечки между клиентами; как вы это реализуете?
caching - 84
Большинству запросов достаточно дешёвой модели, но сложные теряют точность, если не попадают в более сильную модель; как вы добавите маршрутизацию?
- 85
Расход токенов удвоился после добавления поиска контекста и более длинных ответов в LLM-функцию; как вы сократите стоимость, не снижая качество модели вслепую?
retrievaltokensllm - 86
Во время пика трафика LLM-провайдер начинает возвращать ошибки ограничения частоты, хотя сам сервис исправен; как вы стабилизируете запросы?
llm - 87
Этап переранжирования иногда завершается по таймауту и обрушает весь RAG-запрос; как вы сохраните полезный частичный ответ?
ragreranking - 88
Основная модель периодически падает, но резервная выдаёт другие поля JSON и ответы более низкого качества; как вы сделаете переключение безопасным?
- 89
Всплеск запросов на анализ документов исчерпывает воркеры, из-за чего интерактивные вызовы LLM завершаются по таймауту; как вы добавите backpressure?
llmbackpressure - 90
LLM-провайдер полностью недоступен в рабочее время; что должно делать приложение в первые минуты и во время восстановления?
llm - 91
Пользователь сообщил об одном неверном ответе LLM-приложения с поиском по базе знаний и инструментами; как вы проследите такой запрос от начала до конца?
retrievalllm - 92
Как предотвратить утечку персональных данных через промпты и логи приложения, сохранив достаточно информации для разбора сбоев?
promptingdiscovery - 93
Недавно включённый guardrail блокирует много безопасных запросов пользователей; как снизить ложные срабатывания, не ослабляя защиту вслепую?
guardrailsllm-safety - 94
Клиент получил RAG-ответ со ссылкой на документ другого клиента; как вы локализуете инцидент, найдёте причину и устраните утечку между tenants?
rag - 95
Как перенести production RAG-систему на новую модель эмбеддингов, не сломав поиск по существующим документам?
nlpragembeddings - 96
Документы в основной системе обновляются или удаляются, но векторная база продолжает возвращать старые фрагменты; как исправить и предотвратить такой рассинхрон?
vector-dbdatabasesystem-design - 97
Асинхронная задача ingestion документа падает после создания части фрагментов, а повторные запуски иногда создают дубликаты; как сделать повторную обработку безопасной?
async - 98
Несколько production-пользователей жалуются на бесполезные ответы ассистента, но описания расплывчаты; как превратить эти жалобы в исправления и проверки качества?
llm-eval - 99
PM хочет запустить LLM-функцию на следующей неделе и спрашивает, достаточно ли её качество; как согласовать реалистичную планку и ограниченный запуск?
llm - 100
Сразу после релиза LLM-приложения качество ответов резко упало; как вы проведёте диагностику регрессии от начала до конца?
llm