Skip to content

Вопросы на собеседовании: LLM-инженер

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Senior.

Смотреть пример резюме: LLM-инженер

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

llmdesign

Я бы разделил policy-aware gateway, token-based scheduler, model pools и versioned capability registry, чтобы routing и capacity были явными.

  • Gateway enforce trust tier, region, context limit, tools, schema, quotas и deadlines до выбора hosted или self-hosted route.
  • Hot models получают resident vLLM или TGI pools по prompt и output distributions, а cold variants используют isolated pools с declared cold-start behavior.
  • Load tests на 26 000 requests per minute проверяют 30% headroom, p99 TTFT, output tokens per second, quality и cost каждого route.

Зачем это спрашивают: Интервьюер проверяет, превращает ли кандидат multi-model platform в измеримые routing, isolation, capacity и trust contracts.

promptingtokensconcurrency

Я бы сначала route по data eligibility и measured task quality, затем оптимизировал cost внутри каждого eligible pool.

  • Regulated prompts остаются на approved private deployment с pinned weights, regional storage и audited retention; nonregulated traffic может идти в hosted models.
  • Common request contract сохраняет messages, tools, schemas, deadlines и usage, а provider-specific adapters открывают features без заявления model equivalence.
  • Shadow evaluation сравнивает quality, p95, effective cost per successful task и capacity до переноса части 200 млн daily tokens.

Зачем это спрашивают: Сильный ответ сочетает data-boundary constraints с measured model capability и economics вместо одного universal deployment model.

schemaapi

Я бы использовал constrained decoding по versioned JSON Schema и оставил semantic validation вне модели.

  • Outlines, Guidance или provider-native grammar ограничивает token choices для syntax, а enums, ranges и cross-field rules выполняются deterministic code.
  • Repair retries capped и получают exact validation failures; truncated, contradictory или policy-invalid outputs идут отдельным fallback path.
  • Release gate покрывает exact schema validity выше 99,95%, field accuracy, retry rate, p99 и tokens на production-shaped payloads.

Зачем это спрашивают: Интервьюер оценивает, обеспечивается ли structured generation через decoding и validation, а не только prompt wording.

designbatchllm

Я бы управлял им как resumable token-aware pipeline и доказал required throughput и cost через representative pilot.

  • Immutable manifests и deterministic record IDs поддерживают stage checkpoints, idempotent writes, classified retries и resume без duplicate charges.
  • Queues группируют records по model, prompt length и output bound, применяя provider batch APIs или self-hosted continuous batching под quota и GPU backpressure.
  • Hourly forecasts отслеживают accepted records per second, quality-pass rate, remaining tokens, completion probability и projected spend против 18 часов и $120 000.

Зачем это спрашивают: Сильный ответ рассматривает massive LLM batch inference как систему deadline, quality, idempotency и unit economics.

fine-tuning

Я бы держал shared base replicas resident и dynamically load versioned adapters через bounded cache с key tenant и base revision.

  • Registry проверяет tokenizer, target modules, rank, base hash, evaluation и tenant authorization до adapter load.
  • Hot adapters replicated по measured demand, cold adapters принимают declared load delay, а eviction использует memory pressure и recent frequency.
  • Requests с разными adapters batch только при сохранении adapter isolation engine, и KV или adapter state не пересекают tenant boundaries.

Зачем это спрашивают: Интервьюер проверяет, сохраняет ли multi-LoRA density compatibility, isolation, batching и predictable cold behavior.

Я бы сделал hard eligibility deterministic и применил calibrated difficulty policy для выбора cheapest model, выполняющей quality floor задачи.

  • Context, language, modality, tools, data policy и latency исключают incapable routes до рассмотрения cost learned router.
  • Randomized holdouts и shadow labels оценивают false cheap-route acceptance, escalation, p99 и total success без router selection bias.
  • Полная routed policy, а не каждая model отдельно, должна выполнить quality и cost targets на production task mixture.

Зачем это спрашивают: Сильный ответ формулирует model routing как constrained optimization с unbiased end-to-end evaluation.

fine-tuning

Я бы начал с LoRA, потому что dataset и budget 36 часов не оправдывают optimizer states и gradients всех 70B parameters без evidence quality ceiling.

  • Pilot перебирает rank 16, 32 и 64 плюс attention-only против attention-and-MLP targets на fixed held-out set.
  • BF16 base weights остаются frozen, а adapter checkpoints, optimizer state, tokenizer, data manifest и exact base revision versioned.
  • Full fine-tuning рассматривается, только если LoRA materially не выполняет task floor, а measured throughput и memory plan помещаются на восьми H100.

Зачем это спрашивают: Интервьюер оценивает, следует ли adaptation scope dataset size, quality evidence, memory и schedule, а не престижу.

fine-tuningtokensconfig

Я бы загрузил frozen base в 4-bit NF4 с double quantization, обучал BF16 LoRA adapters и потратил memory на activations и sequence throughput.

  • Начну с rank 32, alpha 64, dropout около 0,05 и target attention плюс selected MLP projections, затем ablate narrower targets.
  • Gradient checkpointing, packed sequences, gradient accumulation и distributed sampler сохраняют продуктивность четырёх GPUs без memory overflow.
  • QLoRA сравнивается с BF16 LoRA по held-out quality, training tokens per second, peak memory и merge или serving compatibility.

Зачем это спрашивают: Сильный ответ связывает weight compression QLoRA с concrete adapter, precision, activation и evaluation choices.

fine-tuning

Я бы выбрал rank 16, если gain 1,1 point у rank 64 не закрывает predefined critical-slice requirement.

  • Adapter parameters и memory растут примерно с rank, поэтому rank 64 делает storage, network loading и resident adapter cache примерно в четыре раза тяжелее.
  • Ranks сравниваются по task slice, forgetting, latency, batch density и cold-load time, а не только aggregate success.
  • Если одна high-value task требует rank 64, этот adapter остаётся exception вместо одинаковой стоимости для всех 100 tenants.

Зачем это спрашивают: Интервьюер проверяет, выбирается ли LoRA rank по marginal quality и fleet economics, а не автоматически максимизируется.

Я бы выбирал mixture weights по target product importance и gradient value, а не копировал raw collection ratio 70:20:10.

  • Сначала deduplicate, cap repeated support templates и построить per-domain validation sets с rare и high-risk cases.
  • Short mixture pilots вроде 50:30:20 и temperature-smoothed sampling измеряют task gains и interference после equal training tokens.
  • Final manifest записывает source counts, sampling weights, licenses, consent и effective examples seen для reproducibility.

Зачем это спрашивают: Сильный ответ рассматривает data mixture как experimentally measured optimization, а не отражение collection volume.

benchmarkingdedup

Я бы удалил exact и semantic duplicates и quarantined benchmark contamination до любого train-validation split.

  • Stable fields normalize, exact records hash, а MinHash или embedding clusters с source-aware thresholds обрабатывают near-duplicate groups.
  • Benchmark prompts, references и paraphrases сопоставляются со всеми sources, а provenance сохраняется для exclusion и audit suspected contamination.
  • Split по document, customer, conversation и time boundary идёт после grouping с отчётом removed counts и contamination rates по source.

Зачем это спрашивают: Интервьюер оценивает, предотвращают ли deduplication и contamination controls inflated evaluation и repeated-gradient waste.

tokenscss

Я бы pack несколько examples в каждую sequence с сохранением loss и boundary semantics.

  • Вставляется правильный EOS или separator, padding и prompt tokens вне loss masked, а labels не позволяют одному example leak в другой.
  • Bucket by length до packing уменьшает новый padding от long examples, а deterministic packing фиксируется в dataset manifest.
  • Измеряются nonpadding-token ratio, examples per step, tokens per second, convergence и held-out quality, а не только GPU utilization.

Зачем это спрашивают: Сильный ответ повышает training efficiency без corruption causal labels или example boundaries.

tokensoptimizationbatch

Я бы calibrated schedule через short range-finding run и задал его в tokens, а не examples или wall-clock time.

  • Для LoRA начну conservatively, сравню peak rates вроде 1e-4 и 2e-4 и warmup около 1%-3% planned training tokens.
  • Track train и validation loss по domain, gradient norm, update norm, throughput и task evals каждый fixed token interval.
  • Stop определяется held-out task saturation или regression, а не завершением arbitrary epoch по duplicated data.

Зачем это спрашивают: Интервьюер проверяет, учитывают ли optimization schedules effective token batch и task evidence.

conflict

Я бы очистил и sliced pairs, pinned reference model и настроил DPO strength по preference gain и capability regression.

  • Agreement analysis разделяет ambiguous pairs, systematic reviewer differences и label errors; uncertain pairs excluded или weighted намеренно.
  • Начну с beta sweep 0,05, 0,1 и 0,2 плюс length controls, затем проверю chosen-rejected margins по task.
  • Release evaluation включает blinded pairwise win rate, factuality, safety, verbosity, KL movement и base benchmarks на sealed holdout.

Зачем это спрашивают: Сильный ответ рассматривает DPO как controlled preference optimization с label-quality и regression checks.

alignmentagents

Я бы pilot PPO, только если simulator reward robust, а online policy exploration исправляет failures, не покрываемые static pairs.

  • Reward precision валидируется на adversarial trajectories, partial success, invalid tools и shortcut behavior до optimization policy против него.
  • PPO stack требует rollout workers, reference и value models, advantage estimation, KL control и monitoring reward growth без task improvement.
  • Продолжу, только если held-out task success materially выше 58%, а gain покрывает rollout GPU-hours и operational complexity.

Зачем это спрашивают: Интервьюер оценивает, оправдан ли online RL verifiable interactive feedback и measured limit offline tuning.

validation

Я бы обучил pairwise scorer с domain-balanced sampling и проверил calibration и ranking вне annotators и prompts из training.

  • Split по prompt family, time и annotator group предотвращает paraphrase или reviewer leakage с сохранением disagreement и provenance.
  • Report pairwise accuracy, calibration, domain и language slices, length bias, position bias и adversarial reward-hacking cases.
  • До RL reward rankings сравниваются с blinded human judgments на fresh policy outputs, а не только original 500 000 pairs.

Зачем это спрашивают: Сильный ответ считает reward model potentially biased learned metric, обязанной generalize к changing policy outputs.

fine-tuningtokens

Я бы смешал targeted long-context examples и оценивал position-sensitive tasks вместо предположения, что short SFT сохраняет behavior на 128 000 tokens.

  • Включаются retrieval, aggregation и needle tasks по lengths и positions с controlled fraction sequences от 16 000 до 128 000 tokens.
  • Packing и length curriculum применяются осторожно, потому что long batches доминируют token count и memory даже при малом числе examples.
  • Gate включает short-task quality, long-context retrieval, lost-in-the-middle slices, throughput и memory до принятия tuned model.

Зачем это спрашивают: Интервьюер проверяет, соответствует ли fine-tuning data length context capability, которую продукт хочет сохранить.

fine-tuningtokens

Я бы расширял его, только если compression и task gains выше embedding changes и compatibility cost.

  • Candidate tokens обучаются на domain text с meaningful frequency и nonoverlap, затем сравниваются average length, truncation и inference tokens с current tokenizer.
  • New embeddings требуют careful initialization и достаточного supervised или continued-pretraining exposure при стабильном old-token behavior.
  • New tokenizer создаёт distinct model и serving artifact, поэтому adapters, caches, quantized engines и clients не смешивают versions.

Зачем это спрашивают: Сильный ответ связывает domain tokenization gains с retraining requirements и strict runtime compatibility.

tokensestimationconcurrency

Run требует около 30,3 wall-clock hours и примерно 243 H100 GPU-hours с allowance 20%.

  • 200 млн делить на 2 200 составляет около 90 909 секунд, или 25,3 hours measured compute time.
  • Умножение на 1,2 покрывает evaluation, checkpoints, stragglers и expected interruptions, давая около 30,3 hours.
  • Восемь GPUs на 30,3 hours дают около 243 GPU-hours, а storage и failed-run reserve оцениваются отдельно.

Зачем это спрашивают: Интервьюер проверяет, превращает ли кандидат measured token throughput в defensible schedule и GPU-hour budget.

distributed

Я бы checkpoint не реже каждых 20 минут progress и benchmark asynchronous save time против training throughput.

  • Faithful checkpoint включает model или adapter, optimizer, scheduler, scaler, random states, dataloader position и global step под одним manifest.
  • Sharded checkpoints не собирают huge full state на rank zero, а periodic consolidated weights поддерживают evaluation и serving.
  • Resume tests специально убивают workers и проверяют matching loss и sample order, потому что written checkpoint не доказывает recoverability.

Зачем это спрашивают: Сильный ответ связывает recovery-point objective с exact distributed state и tested resume behavior.

Закрытые вопросы

  • 21

    Обучите model 70B с Adam на 16 H100. Как выбрать между PyTorch FSDP и DeepSpeed ZeRO-3?

  • 22

    Model 140B не помещается на один node, есть четыре nodes по восемь H100 с fast intra-node NVLink и slower inter-node fabric. Как разместить parallelism?

  • 23

    Fine-tune на 32 000 tokens превышает GPU memory на 28%. Выбрать activation checkpointing, CPU offload или smaller batches?

    fine-tuningtokensbatch
  • 24

    Sequence length растёт с 8 000 до 64 000 tokens, и attention memory становится training bottleneck. Какой parallelism добавить?

    tokensmemorytracking
  • 25

    H100 training поддерживает BF16 и FP8. Когда использовать FP8 для continued-pretraining model 70B?

  • 26

    Сколько memory требуют weights model 70B в BF16, INT8 и INT4 до runtime overhead?

    memory
  • 27

    Оцените BF16 KV-cache memory для GQA model 70B с 80 layers, 8 KV heads, head dimension 128 и одной sequence 32 000 tokens.

    cachingmemoryestimation
  • 28

    vLLM endpoint должен давать 8 000 output tokens per second при p99 TTFT ниже 900 мс. Как настроить continuous batching?

    tokensendpointsbatch
  • 29

    Выберите между vLLM и TGI для serving model 34B со streaming, continuous batching, LoRA adapters и contexts 16 000 tokens.

    fine-tuningtokensstreaming
  • 30

    BF16 model 70B должна serving на четырёх H100 по 80 GB в одном node. Как выбрать tensor parallelism и memory headroom?

    memory
  • 31

    Model 180B занимает два nodes по восемь GPUs, но inter-node bandwidth в пять раз ниже NVLink. Добавлять pipeline parallelism?

    ci-cd
  • 32

    INT8 сохраняет 98,8% task quality, INT4 AWQ сохраняет 95,6%, но INT4 удваивает batch capacity. Какую precision deploy?

    capacitybatchdeployment
  • 33

    Target model 70B использует draft model 1,5B с token acceptance rate 72%. Как решить, полезен ли speculative decoding?

    tokensdecoding
  • 34

    Восемьдесят процентов requests делят identical system и tool prefix 4 000 tokens. Как использовать prefix caching?

    cachingsystem-designtokens
  • 35

    Serving engine использует paged KV cache с blocks по 16 tokens. Какой trade-off заставит тестировать blocks по 8 или 32 tokens?

    tokenscaching
  • 36

    Grammar-constrained decoding повышает JSON validity с 94% до 99,98%, но снижает throughput на 17%. Оставлять?

    throughputdecoding
  • 37

    Inference fleet имеет cold starts 12 минут, а traffic может утроиться за 5 минут. Какие autoscaling signals и capacity policy использовать?

    capacityscalinginference
  • 38

    Server держит 80 LoRA adapters, а load cold adapter занимает 1,8 секунды. Как size и schedule adapter cache?

    fine-tuningcaching
  • 39

    Как benchmark новый inference engine для prompts от 200 до 32 000 tokens и outputs от 20 до 2 000 tokens?

    promptingtokensbenchmarking
  • 40

    GPU utilization 55%, но CPU tokenization занимает 22 мс per request при 10 000 requests per second. Как size front end?

    tokens
  • 41

    Model поддерживает 128 000 tokens, но request должен reserve 4 000 output tokens и содержит conversation 70 000 tokens. Как allocate context?

    tokens
  • 42

    Retrieved и conversational context занимают 60 000 tokens, но latency budget допускает только 16 000 input tokens. Как compress?

    latencytokens
  • 43

    Support prompt вырос до 9 000 tokens из-за 40 examples, но removal examples ухудшает rare intents. Как его сократить?

    promptingtokens
  • 44

    Задайте decoding для deterministic invoice extractor и creative marketing assistant на одной model. Что отличается?

    decoding
  • 45

    Model 32B обучена на 8 000 tokens, но product просит 64 000 через RoPE scaling. Какие evidence потребовать?

    tokensscaling
  • 46

    Постройте release harness для model с 12 tasks, шестью languages, тремя risk tiers и 10 000 labeled examples. Как его структурировать?

    mlops
  • 47

    LLM judge согласен с human reviewers на 86% overall, но только 64% на code answers. Может ли он gate model release?

    llm
  • 48

    Fine-tuned model получает gain 8 points на MMLU, но 6% benchmark prompts найдены в training. Как сообщить result?

    promptingfine-tuningbenchmarking
  • 49

    Candidate повышает average task success с 87% до 89%, но structured-output validity падает с 99,9% до 98,7%. Выпускать?

  • 50

    New model лидирует MMLU и HumanEval, но customer-support task имеет только 74% success. Какой benchmark решает deployment?

    benchmarkingdeployment
  • 51

    LoRA release улучшает support style на 12 пунктов, но снижает core reasoning benchmark с 78% до 69%. Как реагировать?

    fine-tuningbenchmarking
  • 52

    DPO model выигрывает 64% style comparisons, но factual accuracy падает с 91% до 83%. Что расследовать?

  • 53

    Support fine-tune повышает ticket resolution на 8 пунктов, но снижает code-generation pass@1 с 62% до 41%. Как обработать catastrophic forgetting?

    fine-tuningsoft-skills
  • 54

    После SFT в основном на examples по 2 000 tokens needle retrieval на 96 000 tokens падает с 76% до 38%. Что делать?

    retrievaltokens
  • 55

    Reward PPO agent растёт на 40%, но verified tool-task success остаётся 57%, а trajectories становятся длиннее. Что происходит?

    agents
  • 56

    Loss становится NaN на step 18 400 run 70B FP8 после 600 H100 GPU-hours. Как восстановиться?

  • 57

    Training throughput падает с 2 400 до 1 350 tokens per second после scaling с 8 до 32 H100. Как расследовать?

    throughputscalingtokens
  • 58

    Resumed ZeRO-3 run совпадает по loss 200 steps, затем расходится на 17%. Какое state проверить?

  • 59

    За неделю до release обнаружено, что 7% evaluation prompts имеют near-duplicates в SFT data. Что сообщить и переделать?

    promptingdedupllm-eval
  • 60

    Fine-tuned checkpoint served с base tokenizer, вызывая 4,6% malformed outputs и loss quality 13 points. Как восстановиться?

    fine-tuningtokens
  • 61

    Hosted inference bill растёт на 92% от $310 000, а request volume только на 4%. Что проверить сначала?

    inference
  • 62

    Self-hosted fleet потребляет 38 000 H100 GPU-hours в месяц, рост 61%, а useful output tokens растут 9%. Как снизить waste?

    tokens
  • 63

    Speculative decoding повышает total GPU cost на 24% после падения acceptance с 74% до 39% на new traffic. Что решить?

    decoding
  • 64

    Cold LoRA loads растут с 3% до 31%, добавляя 1,7 секунды p99 и 14 000 GPU-hours в месяц. Как исправить adapter-cache thrashing?

    fine-tuningcaching
  • 65

    INT4 rollout снижает memory на 46%, но Arabic task success падает с 81% до 59%. Product хочет capacity savings. Что делать?

    capacitymemory
  • 66

    При нагрузке в 4 раза выше p99 TTFT растёт с 680 до 3 400 мс, а decode speed стабилен. Как стабилизировать?

  • 67

    После увеличения maximum batched tokens throughput растёт на 22%, но p99 inter-token latency с 55 до 170 мс. Оставлять?

    latencythroughputbatch
  • 68

    Priority scheduler preempts batch work, но 28% batch requests теперь пропускают deadline шесть часов. Как rebalance?

    estimationbatch
  • 69

    Server traces показывают TTFT 480 мс, но 35% browsers получают первый token через 2,6 секунды после gateway upgrade. Где искать?

    tokensgateway
  • 70

    New model загружается 14 минут, а traffic spike утраивает demand за 6 минут. Как избежать repeated cold-start saturation?

  • 71

    vLLM workers OOM, когда десять users отправляют prompts по 128 000 tokens, хотя average context 7 500. Как восстановиться?

    promptingtokens
  • 72

    Load 41-го LoRA adapter вызывает CUDA OOM, хотя estimated adapter weights помещаются с 9 GB free. Что проверить?

    fine-tuningestimation
  • 73

    KV-cache occupancy остаётся 96% после завершения requests, а concurrency падает 40% за шесть часов. Как диагностировать?

    cachingconcurrency
  • 74

    В four-way tensor-parallel replica один H100 достигает 78 GB, остальные около 61 GB, и worker OOM. Что проверить?

    replication
  • 75

    Autoscaler переключается между 12 и 40 replicas каждые 20 минут, теряя 6 000 GPU-hours monthly и destabilizing p99. Как остановить?

    replicationscaling
  • 76

    Release candidate проходит judge suite, но 180 из 1 000 generated programs падают в sandbox из-за missing imports. Что решает rollout?

  • 77

    LLM judge показывает gain 7 points после silent update judge model провайдером, но human preference не меняется. Что делать?

    llm
  • 78

    После provider migration 14% requests возвращают empty completions, и 27 000 daily workflows не могут продолжить. Как восстановиться?

    migrations
  • 79

    Eval suite проходит overall, но 11 из 240 safety cases regression после prompt change. Product считает sample слишком маленькой. Что решить?

    prompting
  • 80

    Offline task success остаётся 88%, но production complaint rate удваивается с 0,7% до 1,4% после release. Как согласовать?

  • 81

    Jailbreak заставляет public assistant выдавать prohibited weapon instructions в 2,3% red-team attempts. Как реагировать?

    llm-safety
  • 82

    Сотрудник вставляет 6 000 строк proprietary code в consumer LLM account с retention 30 дней. Что делать?

    llmretention
  • 83

    Retrieved document injects instructions, заставляющие agent отправить customer data на external URL. Как ограничить?

    agents
  • 84

    Email addresses и API tokens появляются в 1,8% traces у vendor с retention 45 дней. Как реагировать?

    tokensapiretention
  • 85

    Model checkpoint на четырёх hosts выполняет unexpected pickle payload и открывает network connection. Что делать?

  • 86

    Responses tenant B иногда используют LoRA style и phrases tenant A после adapter swaps. Как расследовать 19 confirmed cases?

    fine-tuning
  • 87

    Legal assistant придумывает пять citations, а два клиента уже подали generated briefs. Как реагировать?

    citations
  • 88

    Medical assistant выдаёт unsupported dosage 73 users несмотря на moderation pass. Как вести response?

  • 89

    Model уверенно сообщает tax rule, истёкшее 14 месяцев назад, и его увидели 4 200 users. Как ограничить hallucination?

    hallucination
  • 90

    Agent придумывает nonexistent argument `transfer_funds` и переводит $18 000 на неверный account после coercion tool wrapper. Что сломалось?

    agentsfundamentals
  • 91

    Provider удалит model с 42 млн monthly requests в 17 workflows через 45 дней. Как migrate?

    mlops
  • 92

    Hosted model alias меняет behavior за ночь: refusal rate растёт с 6% до 19% без release notice. Что делать?

  • 93

    Primary provider недоступен, а fallback fails 16% tool-selection tests. Переводить весь traffic?

    testing
  • 94

    Provider сокращает usable context с 128 000 до 64 000 tokens и повышает output price на 35% за две недели. Как выбрать route?

    tokens
  • 95

    Middle engineer меняет prompt без eval harness, вызывая падение JSON validity с 99,8% до 94%. Как mentor?

    promptingmentoring
  • 96

    Researcher заявляет gain 6 points, но checkpoint невозможно reproduce, а 900 GPU-hours уже потрачено. Как coach?

  • 97

    Junior engineer 'исправляет' recurring KV-cache OOM рестартом pods каждый час. Как перенаправить работу?

    caching
  • 98

    Два senior engineers спорят о monthly overrun $90 000: один хочет INT4, другой fewer warm replicas. Как решить?

    conflictreplication
  • 99

    Product хочет Friday launch, но red-team jailbreak success остаётся 6,5% для agent с customer-write tools. Что рекомендовать?

    agentsllm-safety
  • 100

    Prompt и scheduler release вызывают retry amplification, cache misses и incident на $620 000 между четырьмя teams. Как провести postmortem?

    incidentscachingresilience