Вопросы на собеседовании: LLM-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.
Смотреть пример резюме: LLM-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Ingestion готовит поисковое представление знаний, а query-time компоненты находят и собирают evidence для одного запроса.
- Ingestion разбирает sources, нормализует metadata, создаёт chunks и embeddings и обновляет indexes со стабильными document IDs.
- Во время запроса система преобразует вопрос, применяет access filters, выполняет retrieval и reranking и упаковывает context для generation.
- Версионирование source, chunker и embedding model делает содержимое index воспроизводимым и позволяет выполнять управляемый reindexing.
Зачем это спрашивают: Интервьюер проверяет понимание RAG как двух связанных pipelines с разным жизненным циклом.
Fixed-size chunking следует количеству токенов или символов, а structure-aware сохраняет единицы документа вроде headings, paragraphs, tables и code blocks.
- Fixed windows просты и предсказуемы, но могут разрезать смысловую единицу в случайном месте.
- Structure-aware chunks часто улучшают понятность и качество citations у источников со значимыми границами.
- Оба подхода всё равно требуют size limits, поскольку одна section может превысить бюджет embedding или generation.
Зачем это спрашивают: Сильный ответ сравнивает простоту эксплуатации и сохранение смысла документа.
Semantic chunking ставит границы при смене темы или смысла, а не только через фиксированную длину.
- Он может сравнивать embeddings соседних предложений или использовать модель для поиска связных sections.
- Более цельные chunks улучшают retrieval, но метод дороже и даёт неравномерные размеры.
- Thresholds и итоговые chunks нужно оценивать на domain questions, а не считать автоматически лучше простой нарезки.
Зачем это спрашивают: Интервьюер оценивает понимание цели semantic chunking и его дополнительной вариативности.
Parent-child retrieval индексирует маленькие child chunks для точного поиска, но возвращает более крупную parent section в context генерации.
- Маленькие children повышают шанс совпадения сфокусированного query с нужным passage.
- Parent восстанавливает окружающие определения и ссылки, потерянные маленьким chunk.
- Parent IDs и offsets должны быть стабильными, чтобы retrieved children указывали на правильную source section.
Зачем это спрашивают: Сильный ответ объясняет, почему гранулярность retrieval может отличаться от гранулярности context.
Multi-vector retrieval хранит несколько представлений одного source item, чтобы разные его аспекты совпадали с query.
- Vectors могут представлять исходный текст, summary, heading, извлечённые вопросы или отдельные fields.
- Совпадение любого representation возвращает тот же source и повышает recall для разных формулировок query.
- Большее число vectors увеличивает index и duplicate matches, поэтому нужны grouping и source-level scoring.
Зачем это спрашивают: Интервьюер проверяет понимание более богатых представлений и их стоимости для index.
Overlap должен сохранять информацию на границах chunks, не заполняя index и prompt почти одинаковыми фрагментами.
- Для связного текста может быть важна непрерывность предложений, а code и tables требуют собственных структурных границ.
- Избыточный overlap увеличивает storage, смещает ranking к повторному тексту и тратит context tokens.
- Настройка выбирается через retrieval и answer evaluations на репрезентативных типах документов.
Зачем это спрашивают: Сильный ответ рассматривает overlap как domain-dependent параметр с измеримой стоимостью повторов.
Dense retrieval кодирует queries и passages в совместимое vector space и ранжирует passages по vector similarity.
- Dual-encoder models вычисляют query и passage vectors отдельно, поэтому document embeddings индексируются заранее.
- Dense retrieval находит семантическое сходство и paraphrases, но может пропускать точные IDs и редкие terms.
- Качество зависит от embedding model, input formatting, corpus, metric и index configuration.
Зачем это спрашивают: Интервьюер оценивает понимание эффективности и ограничений dual-encoder retrieval.
Sparse retrieval остаётся сильным, когда точные lexical evidence важнее семантического сходства.
- Он хорошо работает с product codes, names, error strings, legal phrases и редкими domain terms.
- BM25 взвешивает частоту и редкость терминов без embedding model и vector index.
- Его слабость на paraphrases дополняет dense retrieval, поэтому методы часто объединяют.
Зачем это спрашивают: Сильный ответ объясняет lexical signal и не считает sparse search устаревшим.
Hybrid search получает результаты обеих систем и объединяет их rankings или откалиброванные scores в один список candidates.
- Reciprocal Rank Fusion объединяет позиции без предположения об общей шкале BM25 и vector scores.
- Weighted score fusion требует normalization и validation, поскольку raw scores имеют разный смысл.
- Fusion weights и candidate depths настраиваются по relevance labels целевого распределения queries.
Зачем это спрашивают: Интервьюер проверяет понимание rank fusion и опасности прямого сложения несопоставимых scores.
Metadata filtering должен как можно раньше ограничивать candidates по обязательным access и domain constraints, если retrieval system умеет применить их корректно.
- Pre-filtering исключает retrieval чужих tenants, languages, dates и document classes.
- Post-filtering может оставить слишком мало результатов, поскольку запрещённые candidates уже заняли nearest-neighbor slots.
- Selectivity filters и поддержка index влияют на recall и latency, поэтому поведение vector store нужно проверить.
Зачем это спрашивают: Сильный ответ связывает место фильтрации с security, recall и выполнением index.
Cross-encoder оценивает query и candidate вместе и поддерживает взаимодействие на уровне токенов, недоступное отдельным embeddings.
- Обычно он точнее dual encoder для тонких различий релевантности.
- Joint encoding слишком дорог для всего corpus, поэтому применяется к ограниченному набору первого этапа.
- Первый retriever всё равно должен иметь высокий recall, поскольку reranker не вернёт отсутствующий document.
Зачем это спрашивают: Интервьюер оценивает понимание схемы сначала recall, затем precision.
Late-interaction models сохраняют несколько token-level vectors и сравнивают их при query вместо сжатия всего смысла в один vector.
- Это сохраняет более точные matching signals для terms и passages.
- Подход занимает промежуточное место по quality и cost между dual encoders и полными cross-encoders.
- Компромисс состоит в большем index и более дорогом scoring по сравнению с single-vector retrieval.
Зачем это спрашивают: Сильный ответ определяет различие representation и cost без лишних implementation details.
Query rewriting преобразует ввод пользователя в более ясный retrieval query с сохранением исходной информационной потребности.
- Он разрешает ссылки в диалоге, раскрывает сокращения, нормализует терминологию и удаляет нерелевантные формулировки.
- Исходный вопрос сохраняется для generation, поскольку rewrite может потерять intent или constraints.
- Качество rewrite нужно оценивать, так как связная, но неверная версия ломает все следующие этапы.
Зачем это спрашивают: Интервьюер проверяет понимание transformation как потенциально ошибочного инструмента retrieval, а не замены user intent.
Multi-query retrieval создаёт несколько вариантов поиска для одной информационной потребности и объединяет их candidates.
- Варианты покрывают synonyms, разные аспекты и lexical или semantic формулировки.
- Метод повышает recall, если одна формулировка query пропускает релевантные evidence.
- Он добавляет model и retrieval cost и может вызвать topic drift, поэтому требует deduplication и evaluation.
Зачем это спрашивают: Сильный ответ объясняет рост recall вместе с cost и drift.
HyDE просит модель создать гипотетический релевантный документ и использует его embedding для поиска реальных документов.
- Гипотетический текст может быть ближе к языку и деталям ответа, чем короткий вопрос.
- Retrieval использует generated representation, а не гипотетические утверждения как фактические evidence.
- HyDE помогает сложным queries, но может направить поиск к неподтверждённым предположениям модели.
Зачем это спрашивают: Интервьюер оценивает понимание embedding trick и риска hallucination.
Query decomposition полезен, когда один вопрос содержит несколько фактов или reasoning steps с разными evidence.
- Каждый subquery получает сфокусированный набор passages вместо одного embedding для всего запроса.
- Результаты объединяются в рамках исходного вопроса, чтобы не потерять связи и constraints.
- Лишняя decomposition увеличивает latency и накапливает ошибки generated subquestions.
Зачем это спрашивают: Сильный ответ выбирает decomposition для составной информационной потребности и учитывает propagation ошибок.
Contextual compression извлекает или выбирает части retrieved content, наиболее релевантные текущему query, до generation.
- Он уменьшает token use и отвлекающий материал в больших source chunks.
- Compression может использовать rules, sentence selection или другую модель.
- Compressor способен удалить qualifiers или evidence, поэтому faithfulness оценивается по исходному source.
Зачем это спрашивают: Интервьюер проверяет понимание compression как lossy stage с собственным риском качества.
Retrieval embeddings обычно обучаются с contrastive objectives, сближающими релевантные пары и отдаляющими нерелевантные.
- Positive pairs могут быть query-document, title-passage, duplicates и семантически эквивалентные examples.
- Hard negatives учат модель отличать правдоподобные, но неверные candidates от настоящих совпадений.
- Распределение training pairs определяет, какое понятие similarity изучит модель.
Зачем это спрашивают: Сильный ответ связывает objective и negative sampling с итоговым поведением retrieval.
Asymmetric embedding models используют разные instructions, prefixes или encoders, поскольку query и document выполняют разные роли.
- Query обычно короткий и выражает потребность, а passage содержит ответ в другом стиле.
- Правильные prefixes согласуют оба inputs с training objective и общим vector space.
- Использование document format для queries снижает качество, даже если dimensions vectors всё ещё совпадают.
Зачем это спрашивают: Интервьюер оценивает соблюдение model-specific encoding contracts.
Normalization меняет magnitude vector и определяет, когда cosine similarity, dot product и Euclidean distance дают эквивалентный ranking.
- Для unit-normalized vectors cosine similarity равна dot product, а Euclidean distance монотонно связана с ними.
- Без normalization dot product также учитывает magnitude vector.
- Метрика index должна соответствовать рекомендации embedding model и способу сохранения vectors.
Зачем это спрашивают: Сильный ответ понимает metric choice и preprocessing как одно решение совместимости.
Закрытые вопросы
- 21
Что важно при выборе multilingual embedding model?
nlpembeddings - 22
Как сравнивать embedding models для domain corpus?
nlpembeddings - 23
Как HNSW vector index обменивает точность на скорость и память?
indexesmemory - 24
Когда exact search в pgvector предпочтительнее approximate index?
indexes - 25
Как упаковывать retrieved chunks в context LLM?
llm - 26
Что такое эффект lost in the middle?
- 27
Как делить token budget в многошаговом LLM workflow?
tokensllm - 28
Каковы компромиссы summarization истории диалога?
- 29
Когда retrieval предпочтительнее помещения всего corpus в long context window?
retrievalcontext - 30
Как speculative decoding ускоряет генерацию?
decoding - 31
Как оценивать оптимизацию prompt?
promptingoptimizationdecision-making - 32
Как выбирать few-shot examples для prompt?
prompting - 33
Как представлять instruction hierarchy и untrusted context в prompt?
prompting - 34
Когда constrained decoding предпочтительнее просьбы вернуть JSON в prompt?
promptingdecoding - 35
Как проектировать schema для structured output LLM?
llmschemadesign - 36
Чем grammar-based decoding отличается от constrained decoding по JSON Schema?
decodingschema - 37
Что делать после неудачной validation structured response LLM?
llmvalidation - 38
Что такое function или tool calling в LLM?
llm - 39
Что делает tool definition удобным для LLM?
llm - 40
Каковы основные этапы agent loop с tools?
agents - 41
Когда deterministic workflow предпочтительнее LLM agent?
agentsllm - 42
Что такое supervised fine-tuning instruction model?
supervisedfine-tuning - 43
Как LoRA обеспечивает parameter-efficient fine-tuning?
fine-tuning - 44
Чем QLoRA отличается от обычной LoRA?
fine-tuning - 45
Какую роль играют Axolotl, Unsloth, LLaMA-Factory и TRL в fine-tuning?
fine-tuning - 46
Каковы основные этапы RLHF?
alignment - 47
Чем DPO отличается от RLHF с reward model?
alignment - 48
Как FP16, FP8, INT4 и AWQ влияют на model inference?
inference - 49
Что RAGAS оценивает в системе RAG?
ragsystem-designdecision-making - 50
Как сделать LLM-as-judge evaluation заслуживающей доверия?
llmllm-eval - 51
RAG-ассистент даёт плохие ответы. Как определить, ломается retrieval или generation?
ragretrieval - 52
Релевантные документы редко попадают в верхние результаты retrieval. Как повысить recall?
retrieval - 53
Retrieval возвращает много тематически близких, но бесполезных chunks. Как повысить precision?
retrieval - 54
Как диагностировать, что ошибки ответов RAG вызваны chunking?
ragchunking - 55
Tenant иногда видит источники другого tenant в RAG. Как исправить retrieval design?
ragretrievaldesign - 56
Качество поиска упало после смены embedding model. Как диагностировать миграцию?
nlpembeddingsmigrations - 57
Как настроить hybrid lexical и vector retrieval?
retrieval - 58
Как решить, стоит ли добавлять reranker в production RAG?
ragreranking - 59
Как настроить approximate index pgvector, не скрывая потерю recall?
indexes - 60
Как улучшить retrieval для queries со словами, которых нет в документах?
retrievalqueries - 61
Как построить retrieval для вопросов, требующих evidence из нескольких документов?
retrieval - 62
Как собирать retrieved chunks в context при жёстком token budget?
tokens - 63
Generated citations часто указывают на нерелевантные passages. Как это исправить?
citations - 64
Grounded prompt всё равно создаёт галлюцинации. Как их исследовать?
hallucinationgroundednessprompting - 65
Как обеспечить grounded answers и не блокировать слишком много полезных ответов?
groundedness - 66
Как исправить RAG corpus с устаревшим или дублирующимся контентом?
rag - 67
Как спроектировать automated eval pipeline для LLM-приложения?
llmdesignci-cd - 68
Как безопасно превратить production traces в evaluation dataset?
llm-eval - 69
Как использовать Braintrust или Inspect AI для командного eval suite?
- 70
Как откалибровать LLM-as-judge scorer?
llm - 71
Как обнаружить и снизить position bias у LLM judge?
llm - 72
Как провести online experiment для нового RAG pipeline?
ragci-cdexperiments - 73
Offline eval улучшился, но пользователи сообщают об ухудшении ответов. Как исследовать расхождение?
conflict - 74
Как решить, является ли изменение eval score значимым?
- 75
Как мониторить quality drift в LLM-приложении?
monitoringiacllm - 76
Как версионировать prompts для воспроизводимости production regression?
reproducibilityprompting - 77
Prompt change вызывает failures только у части пользователей. Как его отлаживать?
prompting - 78
Как спроектировать structured-output gateway для нескольких LLM providers?
designgatewayllm - 79
Как сделать выполнение LLM tools безопасным и устойчивым к повторам?
llmresilience - 80
Как реализовать многоуровневые guardrails от prompt injection?
injectionllm-safetyguardrails - 81
LLM-фича работает слишком медленно. Как разложить и снизить latency?
latencyplanningllm - 82
Как реализовать semantic caching и не отдавать неверный ответ?
caching - 83
Где batching поможет в LLM pipeline и какие компромиссы измерять?
llmbatchci-cd - 84
Как построить model routing для снижения cost без потери quality?
- 85
Как оценить speculative decoding для self-hosted model?
decodingdecision-makingllm-eval - 86
Как выбрать между fp16, fp8 и INT4 или AWQ quantization?
- 87
Как спланировать capacity для deployment vLLM в Kubernetes?
kubernetesdeploymentcapacity - 88
vLLM cluster имеет высокий throughput, но плохую tail latency. Как её улучшить?
latencythroughput - 89
Как реализовать per-million-token cost governance?
tokens - 90
Как снизить context cost без ухудшения качества RAG?
rag - 91
Как сохранить доступность LLM-фичи во время сбоя provider?
llm - 92
Как обрабатывать rate limits нескольких LLM providers?
llmrate-limiting - 93
Как предотвратить duplicate side effects при retry LLM workflow?
llm - 94
Как обработать provider failure после показа части streamed response?
- 95
Что включить в monitoring dashboard LLM-приложения?
llmmonitoring - 96
Как определить SLO для LLM-powered фичи?
llmslo - 97
Как реализовать guardrails для PII и unsafe content без лишних false positives?
piillm-safetyguardrails - 98
Как безопасно выкатить новую model или prompt version?
prompting - 99
Как выбрать между изменением prompt, RAG, SFT и DPO для проблемы качества?
ragprompting - 100
Качество production LLM-фичи снижается. Какой recovery plan вы примените?
llmrecovery