Skip to content

Вопросы на собеседовании: LLM-инженер

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.

Смотреть пример резюме: LLM-инженер

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

ragqueriesarchitecture

Ingestion готовит поисковое представление знаний, а query-time компоненты находят и собирают evidence для одного запроса.

  • Ingestion разбирает sources, нормализует metadata, создаёт chunks и embeddings и обновляет indexes со стабильными document IDs.
  • Во время запроса система преобразует вопрос, применяет access filters, выполняет retrieval и reranking и упаковывает context для generation.
  • Версионирование source, chunker и embedding model делает содержимое index воспроизводимым и позволяет выполнять управляемый reindexing.

Зачем это спрашивают: Интервьюер проверяет понимание RAG как двух связанных pipelines с разным жизненным циклом.

chunking

Fixed-size chunking следует количеству токенов или символов, а structure-aware сохраняет единицы документа вроде headings, paragraphs, tables и code blocks.

  • Fixed windows просты и предсказуемы, но могут разрезать смысловую единицу в случайном месте.
  • Structure-aware chunks часто улучшают понятность и качество citations у источников со значимыми границами.
  • Оба подхода всё равно требуют size limits, поскольку одна section может превысить бюджет embedding или generation.

Зачем это спрашивают: Сильный ответ сравнивает простоту эксплуатации и сохранение смысла документа.

chunking

Semantic chunking ставит границы при смене темы или смысла, а не только через фиксированную длину.

  • Он может сравнивать embeddings соседних предложений или использовать модель для поиска связных sections.
  • Более цельные chunks улучшают retrieval, но метод дороже и даёт неравномерные размеры.
  • Thresholds и итоговые chunks нужно оценивать на domain questions, а не считать автоматически лучше простой нарезки.

Зачем это спрашивают: Интервьюер оценивает понимание цели semantic chunking и его дополнительной вариативности.

ragretrieval

Parent-child retrieval индексирует маленькие child chunks для точного поиска, но возвращает более крупную parent section в context генерации.

  • Маленькие children повышают шанс совпадения сфокусированного query с нужным passage.
  • Parent восстанавливает окружающие определения и ссылки, потерянные маленьким chunk.
  • Parent IDs и offsets должны быть стабильными, чтобы retrieved children указывали на правильную source section.

Зачем это спрашивают: Сильный ответ объясняет, почему гранулярность retrieval может отличаться от гранулярности context.

retrieval

Multi-vector retrieval хранит несколько представлений одного source item, чтобы разные его аспекты совпадали с query.

  • Vectors могут представлять исходный текст, summary, heading, извлечённые вопросы или отдельные fields.
  • Совпадение любого representation возвращает тот же source и повышает recall для разных формулировок query.
  • Большее число vectors увеличивает index и duplicate matches, поэтому нужны grouping и source-level scoring.

Зачем это спрашивают: Интервьюер проверяет понимание более богатых представлений и их стоимости для index.

rag

Overlap должен сохранять информацию на границах chunks, не заполняя index и prompt почти одинаковыми фрагментами.

  • Для связного текста может быть важна непрерывность предложений, а code и tables требуют собственных структурных границ.
  • Избыточный overlap увеличивает storage, смещает ranking к повторному тексту и тратит context tokens.
  • Настройка выбирается через retrieval и answer evaluations на репрезентативных типах документов.

Зачем это спрашивают: Сильный ответ рассматривает overlap как domain-dependent параметр с измеримой стоимостью повторов.

ragretrievalsystem-design

Dense retrieval кодирует queries и passages в совместимое vector space и ранжирует passages по vector similarity.

  • Dual-encoder models вычисляют query и passage vectors отдельно, поэтому document embeddings индексируются заранее.
  • Dense retrieval находит семантическое сходство и paraphrases, но может пропускать точные IDs и редкие terms.
  • Качество зависит от embedding model, input formatting, corpus, metric и index configuration.

Зачем это спрашивают: Интервьюер оценивает понимание эффективности и ограничений dual-encoder retrieval.

nlpretrievalembeddings

Sparse retrieval остаётся сильным, когда точные lexical evidence важнее семантического сходства.

  • Он хорошо работает с product codes, names, error strings, legal phrases и редкими domain terms.
  • BM25 взвешивает частоту и редкость терминов без embedding model и vector index.
  • Его слабость на paraphrases дополняет dense retrieval, поэтому методы часто объединяют.

Зачем это спрашивают: Сильный ответ объясняет lexical signal и не считает sparse search устаревшим.

Hybrid search получает результаты обеих систем и объединяет их rankings или откалиброванные scores в один список candidates.

  • Reciprocal Rank Fusion объединяет позиции без предположения об общей шкале BM25 и vector scores.
  • Weighted score fusion требует normalization и validation, поскольку raw scores имеют разный смысл.
  • Fusion weights и candidate depths настраиваются по relevance labels целевого распределения queries.

Зачем это спрашивают: Интервьюер проверяет понимание rank fusion и опасности прямого сложения несопоставимых scores.

retrievalci-cd

Metadata filtering должен как можно раньше ограничивать candidates по обязательным access и domain constraints, если retrieval system умеет применить их корректно.

  • Pre-filtering исключает retrieval чужих tenants, languages, dates и document classes.
  • Post-filtering может оставить слишком мало результатов, поскольку запрещённые candidates уже заняли nearest-neighbor slots.
  • Selectivity filters и поддержка index влияют на recall и latency, поэтому поведение vector store нужно проверить.

Зачем это спрашивают: Сильный ответ связывает место фильтрации с security, recall и выполнением index.

reranking

Cross-encoder оценивает query и candidate вместе и поддерживает взаимодействие на уровне токенов, недоступное отдельным embeddings.

  • Обычно он точнее dual encoder для тонких различий релевантности.
  • Joint encoding слишком дорог для всего corpus, поэтому применяется к ограниченному набору первого этапа.
  • Первый retriever всё равно должен иметь высокий recall, поскольку reranker не вернёт отсутствующий document.

Зачем это спрашивают: Интервьюер оценивает понимание схемы сначала recall, затем precision.

nlpretrievalembeddings

Late-interaction models сохраняют несколько token-level vectors и сравнивают их при query вместо сжатия всего смысла в один vector.

  • Это сохраняет более точные matching signals для terms и passages.
  • Подход занимает промежуточное место по quality и cost между dual encoders и полными cross-encoders.
  • Компромисс состоит в большем index и более дорогом scoring по сравнению с single-vector retrieval.

Зачем это спрашивают: Сильный ответ определяет различие representation и cost без лишних implementation details.

ragqueries

Query rewriting преобразует ввод пользователя в более ясный retrieval query с сохранением исходной информационной потребности.

  • Он разрешает ссылки в диалоге, раскрывает сокращения, нормализует терминологию и удаляет нерелевантные формулировки.
  • Исходный вопрос сохраняется для generation, поскольку rewrite может потерять intent или constraints.
  • Качество rewrite нужно оценивать, так как связная, но неверная версия ломает все следующие этапы.

Зачем это спрашивают: Интервьюер проверяет понимание transformation как потенциально ошибочного инструмента retrieval, а не замены user intent.

retrievalqueries

Multi-query retrieval создаёт несколько вариантов поиска для одной информационной потребности и объединяет их candidates.

  • Варианты покрывают synonyms, разные аспекты и lexical или semantic формулировки.
  • Метод повышает recall, если одна формулировка query пропускает релевантные evidence.
  • Он добавляет model и retrieval cost и может вызвать topic drift, поэтому требует deduplication и evaluation.

Зачем это спрашивают: Сильный ответ объясняет рост recall вместе с cost и drift.

retrieval

HyDE просит модель создать гипотетический релевантный документ и использует его embedding для поиска реальных документов.

  • Гипотетический текст может быть ближе к языку и деталям ответа, чем короткий вопрос.
  • Retrieval использует generated representation, а не гипотетические утверждения как фактические evidence.
  • HyDE помогает сложным queries, но может направить поиск к неподтверждённым предположениям модели.

Зачем это спрашивают: Интервьюер оценивает понимание embedding trick и риска hallucination.

ragqueries

Query decomposition полезен, когда один вопрос содержит несколько фактов или reasoning steps с разными evidence.

  • Каждый subquery получает сфокусированный набор passages вместо одного embedding для всего запроса.
  • Результаты объединяются в рамках исходного вопроса, чтобы не потерять связи и constraints.
  • Лишняя decomposition увеличивает latency и накапливает ошибки generated subquestions.

Зачем это спрашивают: Сильный ответ выбирает decomposition для составной информационной потребности и учитывает propagation ошибок.

retrievalci-cd

Contextual compression извлекает или выбирает части retrieved content, наиболее релевантные текущему query, до generation.

  • Он уменьшает token use и отвлекающий материал в больших source chunks.
  • Compression может использовать rules, sentence selection или другую модель.
  • Compressor способен удалить qualifiers или evidence, поэтому faithfulness оценивается по исходному source.

Зачем это спрашивают: Интервьюер проверяет понимание compression как lossy stage с собственным риском качества.

nlpretrievalembeddings

Retrieval embeddings обычно обучаются с contrastive objectives, сближающими релевантные пары и отдаляющими нерелевантные.

  • Positive pairs могут быть query-document, title-passage, duplicates и семантически эквивалентные examples.
  • Hard negatives учат модель отличать правдоподобные, но неверные candidates от настоящих совпадений.
  • Распределение training pairs определяет, какое понятие similarity изучит модель.

Зачем это спрашивают: Сильный ответ связывает objective и negative sampling с итоговым поведением retrieval.

nlpembeddingsqueries

Asymmetric embedding models используют разные instructions, prefixes или encoders, поскольку query и document выполняют разные роли.

  • Query обычно короткий и выражает потребность, а passage содержит ответ в другом стиле.
  • Правильные prefixes согласуют оба inputs с training objective и общим vector space.
  • Использование document format для queries снижает качество, даже если dimensions vectors всё ещё совпадают.

Зачем это спрашивают: Интервьюер оценивает соблюдение model-specific encoding contracts.

normalizationmonitoring

Normalization меняет magnitude vector и определяет, когда cosine similarity, dot product и Euclidean distance дают эквивалентный ranking.

  • Для unit-normalized vectors cosine similarity равна dot product, а Euclidean distance монотонно связана с ними.
  • Без normalization dot product также учитывает magnitude vector.
  • Метрика index должна соответствовать рекомендации embedding model и способу сохранения vectors.

Зачем это спрашивают: Сильный ответ понимает metric choice и preprocessing как одно решение совместимости.

Закрытые вопросы

  • 21

    Что важно при выборе multilingual embedding model?

    nlpembeddings
  • 22

    Как сравнивать embedding models для domain corpus?

    nlpembeddings
  • 23

    Как HNSW vector index обменивает точность на скорость и память?

    indexesmemory
  • 24

    Когда exact search в pgvector предпочтительнее approximate index?

    indexes
  • 25

    Как упаковывать retrieved chunks в context LLM?

    llm
  • 26

    Что такое эффект lost in the middle?

  • 27

    Как делить token budget в многошаговом LLM workflow?

    tokensllm
  • 28

    Каковы компромиссы summarization истории диалога?

  • 29

    Когда retrieval предпочтительнее помещения всего corpus в long context window?

    retrievalcontext
  • 30

    Как speculative decoding ускоряет генерацию?

    decoding
  • 31

    Как оценивать оптимизацию prompt?

    promptingoptimizationdecision-making
  • 32

    Как выбирать few-shot examples для prompt?

    prompting
  • 33

    Как представлять instruction hierarchy и untrusted context в prompt?

    prompting
  • 34

    Когда constrained decoding предпочтительнее просьбы вернуть JSON в prompt?

    promptingdecoding
  • 35

    Как проектировать schema для structured output LLM?

    llmschemadesign
  • 36

    Чем grammar-based decoding отличается от constrained decoding по JSON Schema?

    decodingschema
  • 37

    Что делать после неудачной validation structured response LLM?

    llmvalidation
  • 38

    Что такое function или tool calling в LLM?

    llm
  • 39

    Что делает tool definition удобным для LLM?

    llm
  • 40

    Каковы основные этапы agent loop с tools?

    agents
  • 41

    Когда deterministic workflow предпочтительнее LLM agent?

    agentsllm
  • 42

    Что такое supervised fine-tuning instruction model?

    supervisedfine-tuning
  • 43

    Как LoRA обеспечивает parameter-efficient fine-tuning?

    fine-tuning
  • 44

    Чем QLoRA отличается от обычной LoRA?

    fine-tuning
  • 45

    Какую роль играют Axolotl, Unsloth, LLaMA-Factory и TRL в fine-tuning?

    fine-tuning
  • 46

    Каковы основные этапы RLHF?

    alignment
  • 47

    Чем DPO отличается от RLHF с reward model?

    alignment
  • 48

    Как FP16, FP8, INT4 и AWQ влияют на model inference?

    inference
  • 49

    Что RAGAS оценивает в системе RAG?

    ragsystem-designdecision-making
  • 50

    Как сделать LLM-as-judge evaluation заслуживающей доверия?

    llmllm-eval
  • 51

    RAG-ассистент даёт плохие ответы. Как определить, ломается retrieval или generation?

    ragretrieval
  • 52

    Релевантные документы редко попадают в верхние результаты retrieval. Как повысить recall?

    retrieval
  • 53

    Retrieval возвращает много тематически близких, но бесполезных chunks. Как повысить precision?

    retrieval
  • 54

    Как диагностировать, что ошибки ответов RAG вызваны chunking?

    ragchunking
  • 55

    Tenant иногда видит источники другого tenant в RAG. Как исправить retrieval design?

    ragretrievaldesign
  • 56

    Качество поиска упало после смены embedding model. Как диагностировать миграцию?

    nlpembeddingsmigrations
  • 57

    Как настроить hybrid lexical и vector retrieval?

    retrieval
  • 58

    Как решить, стоит ли добавлять reranker в production RAG?

    ragreranking
  • 59

    Как настроить approximate index pgvector, не скрывая потерю recall?

    indexes
  • 60

    Как улучшить retrieval для queries со словами, которых нет в документах?

    retrievalqueries
  • 61

    Как построить retrieval для вопросов, требующих evidence из нескольких документов?

    retrieval
  • 62

    Как собирать retrieved chunks в context при жёстком token budget?

    tokens
  • 63

    Generated citations часто указывают на нерелевантные passages. Как это исправить?

    citations
  • 64

    Grounded prompt всё равно создаёт галлюцинации. Как их исследовать?

    hallucinationgroundednessprompting
  • 65

    Как обеспечить grounded answers и не блокировать слишком много полезных ответов?

    groundedness
  • 66

    Как исправить RAG corpus с устаревшим или дублирующимся контентом?

    rag
  • 67

    Как спроектировать automated eval pipeline для LLM-приложения?

    llmdesignci-cd
  • 68

    Как безопасно превратить production traces в evaluation dataset?

    llm-eval
  • 69

    Как использовать Braintrust или Inspect AI для командного eval suite?

  • 70

    Как откалибровать LLM-as-judge scorer?

    llm
  • 71

    Как обнаружить и снизить position bias у LLM judge?

    llm
  • 72

    Как провести online experiment для нового RAG pipeline?

    ragci-cdexperiments
  • 73

    Offline eval улучшился, но пользователи сообщают об ухудшении ответов. Как исследовать расхождение?

    conflict
  • 74

    Как решить, является ли изменение eval score значимым?

  • 75

    Как мониторить quality drift в LLM-приложении?

    monitoringiacllm
  • 76

    Как версионировать prompts для воспроизводимости production regression?

    reproducibilityprompting
  • 77

    Prompt change вызывает failures только у части пользователей. Как его отлаживать?

    prompting
  • 78

    Как спроектировать structured-output gateway для нескольких LLM providers?

    designgatewayllm
  • 79

    Как сделать выполнение LLM tools безопасным и устойчивым к повторам?

    llmresilience
  • 80

    Как реализовать многоуровневые guardrails от prompt injection?

    injectionllm-safetyguardrails
  • 81

    LLM-фича работает слишком медленно. Как разложить и снизить latency?

    latencyplanningllm
  • 82

    Как реализовать semantic caching и не отдавать неверный ответ?

    caching
  • 83

    Где batching поможет в LLM pipeline и какие компромиссы измерять?

    llmbatchci-cd
  • 84

    Как построить model routing для снижения cost без потери quality?

  • 85

    Как оценить speculative decoding для self-hosted model?

    decodingdecision-makingllm-eval
  • 86

    Как выбрать между fp16, fp8 и INT4 или AWQ quantization?

  • 87

    Как спланировать capacity для deployment vLLM в Kubernetes?

    kubernetesdeploymentcapacity
  • 88

    vLLM cluster имеет высокий throughput, но плохую tail latency. Как её улучшить?

    latencythroughput
  • 89

    Как реализовать per-million-token cost governance?

    tokens
  • 90

    Как снизить context cost без ухудшения качества RAG?

    rag
  • 91

    Как сохранить доступность LLM-фичи во время сбоя provider?

    llm
  • 92

    Как обрабатывать rate limits нескольких LLM providers?

    llmrate-limiting
  • 93

    Как предотвратить duplicate side effects при retry LLM workflow?

    llm
  • 94

    Как обработать provider failure после показа части streamed response?

  • 95

    Что включить в monitoring dashboard LLM-приложения?

    llmmonitoring
  • 96

    Как определить SLO для LLM-powered фичи?

    llmslo
  • 97

    Как реализовать guardrails для PII и unsafe content без лишних false positives?

    piillm-safetyguardrails
  • 98

    Как безопасно выкатить новую model или prompt version?

    prompting
  • 99

    Как выбрать между изменением prompt, RAG, SFT и DPO для проблемы качества?

    ragprompting
  • 100

    Качество production LLM-фичи снижается. Какой recovery plan вы примените?

    llmrecovery