Вопросы на собеседовании: LLM-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Senior.
Смотреть пример резюме: LLM-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Я бы разделил policy-aware gateway, token-based scheduler, model pools и versioned capability registry, чтобы routing и capacity были явными.
- Gateway enforce trust tier, region, context limit, tools, schema, quotas и deadlines до выбора hosted или self-hosted route.
- Hot models получают resident vLLM или TGI pools по prompt и output distributions, а cold variants используют isolated pools с declared cold-start behavior.
- Load tests на 26 000 requests per minute проверяют 30% headroom, p99 TTFT, output tokens per second, quality и cost каждого route.
Зачем это спрашивают: Интервьюер проверяет, превращает ли кандидат multi-model platform в измеримые routing, isolation, capacity и trust contracts.
Я бы сначала route по data eligibility и measured task quality, затем оптимизировал cost внутри каждого eligible pool.
- Regulated prompts остаются на approved private deployment с pinned weights, regional storage и audited retention; nonregulated traffic может идти в hosted models.
- Common request contract сохраняет messages, tools, schemas, deadlines и usage, а provider-specific adapters открывают features без заявления model equivalence.
- Shadow evaluation сравнивает quality, p95, effective cost per successful task и capacity до переноса части 200 млн daily tokens.
Зачем это спрашивают: Сильный ответ сочетает data-boundary constraints с measured model capability и economics вместо одного universal deployment model.
Я бы использовал constrained decoding по versioned JSON Schema и оставил semantic validation вне модели.
- Outlines, Guidance или provider-native grammar ограничивает token choices для syntax, а enums, ranges и cross-field rules выполняются deterministic code.
- Repair retries capped и получают exact validation failures; truncated, contradictory или policy-invalid outputs идут отдельным fallback path.
- Release gate покрывает exact schema validity выше 99,95%, field accuracy, retry rate, p99 и tokens на production-shaped payloads.
Зачем это спрашивают: Интервьюер оценивает, обеспечивается ли structured generation через decoding и validation, а не только prompt wording.
Я бы управлял им как resumable token-aware pipeline и доказал required throughput и cost через representative pilot.
- Immutable manifests и deterministic record IDs поддерживают stage checkpoints, idempotent writes, classified retries и resume без duplicate charges.
- Queues группируют records по model, prompt length и output bound, применяя provider batch APIs или self-hosted continuous batching под quota и GPU backpressure.
- Hourly forecasts отслеживают accepted records per second, quality-pass rate, remaining tokens, completion probability и projected spend против 18 часов и $120 000.
Зачем это спрашивают: Сильный ответ рассматривает massive LLM batch inference как систему deadline, quality, idempotency и unit economics.
Я бы держал shared base replicas resident и dynamically load versioned adapters через bounded cache с key tenant и base revision.
- Registry проверяет tokenizer, target modules, rank, base hash, evaluation и tenant authorization до adapter load.
- Hot adapters replicated по measured demand, cold adapters принимают declared load delay, а eviction использует memory pressure и recent frequency.
- Requests с разными adapters batch только при сохранении adapter isolation engine, и KV или adapter state не пересекают tenant boundaries.
Зачем это спрашивают: Интервьюер проверяет, сохраняет ли multi-LoRA density compatibility, isolation, batching и predictable cold behavior.
Я бы сделал hard eligibility deterministic и применил calibrated difficulty policy для выбора cheapest model, выполняющей quality floor задачи.
- Context, language, modality, tools, data policy и latency исключают incapable routes до рассмотрения cost learned router.
- Randomized holdouts и shadow labels оценивают false cheap-route acceptance, escalation, p99 и total success без router selection bias.
- Полная routed policy, а не каждая model отдельно, должна выполнить quality и cost targets на production task mixture.
Зачем это спрашивают: Сильный ответ формулирует model routing как constrained optimization с unbiased end-to-end evaluation.
Я бы начал с LoRA, потому что dataset и budget 36 часов не оправдывают optimizer states и gradients всех 70B parameters без evidence quality ceiling.
- Pilot перебирает rank 16, 32 и 64 плюс attention-only против attention-and-MLP targets на fixed held-out set.
- BF16 base weights остаются frozen, а adapter checkpoints, optimizer state, tokenizer, data manifest и exact base revision versioned.
- Full fine-tuning рассматривается, только если LoRA materially не выполняет task floor, а measured throughput и memory plan помещаются на восьми H100.
Зачем это спрашивают: Интервьюер оценивает, следует ли adaptation scope dataset size, quality evidence, memory и schedule, а не престижу.
Я бы загрузил frozen base в 4-bit NF4 с double quantization, обучал BF16 LoRA adapters и потратил memory на activations и sequence throughput.
- Начну с rank 32, alpha 64, dropout около 0,05 и target attention плюс selected MLP projections, затем ablate narrower targets.
- Gradient checkpointing, packed sequences, gradient accumulation и distributed sampler сохраняют продуктивность четырёх GPUs без memory overflow.
- QLoRA сравнивается с BF16 LoRA по held-out quality, training tokens per second, peak memory и merge или serving compatibility.
Зачем это спрашивают: Сильный ответ связывает weight compression QLoRA с concrete adapter, precision, activation и evaluation choices.
Я бы выбрал rank 16, если gain 1,1 point у rank 64 не закрывает predefined critical-slice requirement.
- Adapter parameters и memory растут примерно с rank, поэтому rank 64 делает storage, network loading и resident adapter cache примерно в четыре раза тяжелее.
- Ranks сравниваются по task slice, forgetting, latency, batch density и cold-load time, а не только aggregate success.
- Если одна high-value task требует rank 64, этот adapter остаётся exception вместо одинаковой стоимости для всех 100 tenants.
Зачем это спрашивают: Интервьюер проверяет, выбирается ли LoRA rank по marginal quality и fleet economics, а не автоматически максимизируется.
Я бы выбирал mixture weights по target product importance и gradient value, а не копировал raw collection ratio 70:20:10.
- Сначала deduplicate, cap repeated support templates и построить per-domain validation sets с rare и high-risk cases.
- Short mixture pilots вроде 50:30:20 и temperature-smoothed sampling измеряют task gains и interference после equal training tokens.
- Final manifest записывает source counts, sampling weights, licenses, consent и effective examples seen для reproducibility.
Зачем это спрашивают: Сильный ответ рассматривает data mixture как experimentally measured optimization, а не отражение collection volume.
Я бы удалил exact и semantic duplicates и quarantined benchmark contamination до любого train-validation split.
- Stable fields normalize, exact records hash, а MinHash или embedding clusters с source-aware thresholds обрабатывают near-duplicate groups.
- Benchmark prompts, references и paraphrases сопоставляются со всеми sources, а provenance сохраняется для exclusion и audit suspected contamination.
- Split по document, customer, conversation и time boundary идёт после grouping с отчётом removed counts и contamination rates по source.
Зачем это спрашивают: Интервьюер оценивает, предотвращают ли deduplication и contamination controls inflated evaluation и repeated-gradient waste.
Я бы pack несколько examples в каждую sequence с сохранением loss и boundary semantics.
- Вставляется правильный EOS или separator, padding и prompt tokens вне loss masked, а labels не позволяют одному example leak в другой.
- Bucket by length до packing уменьшает новый padding от long examples, а deterministic packing фиксируется в dataset manifest.
- Измеряются nonpadding-token ratio, examples per step, tokens per second, convergence и held-out quality, а не только GPU utilization.
Зачем это спрашивают: Сильный ответ повышает training efficiency без corruption causal labels или example boundaries.
Я бы calibrated schedule через short range-finding run и задал его в tokens, а не examples или wall-clock time.
- Для LoRA начну conservatively, сравню peak rates вроде 1e-4 и 2e-4 и warmup около 1%-3% planned training tokens.
- Track train и validation loss по domain, gradient norm, update norm, throughput и task evals каждый fixed token interval.
- Stop определяется held-out task saturation или regression, а не завершением arbitrary epoch по duplicated data.
Зачем это спрашивают: Интервьюер проверяет, учитывают ли optimization schedules effective token batch и task evidence.
Я бы очистил и sliced pairs, pinned reference model и настроил DPO strength по preference gain и capability regression.
- Agreement analysis разделяет ambiguous pairs, systematic reviewer differences и label errors; uncertain pairs excluded или weighted намеренно.
- Начну с beta sweep 0,05, 0,1 и 0,2 плюс length controls, затем проверю chosen-rejected margins по task.
- Release evaluation включает blinded pairwise win rate, factuality, safety, verbosity, KL movement и base benchmarks на sealed holdout.
Зачем это спрашивают: Сильный ответ рассматривает DPO как controlled preference optimization с label-quality и regression checks.
Я бы pilot PPO, только если simulator reward robust, а online policy exploration исправляет failures, не покрываемые static pairs.
- Reward precision валидируется на adversarial trajectories, partial success, invalid tools и shortcut behavior до optimization policy против него.
- PPO stack требует rollout workers, reference и value models, advantage estimation, KL control и monitoring reward growth без task improvement.
- Продолжу, только если held-out task success materially выше 58%, а gain покрывает rollout GPU-hours и operational complexity.
Зачем это спрашивают: Интервьюер оценивает, оправдан ли online RL verifiable interactive feedback и measured limit offline tuning.
Я бы обучил pairwise scorer с domain-balanced sampling и проверил calibration и ranking вне annotators и prompts из training.
- Split по prompt family, time и annotator group предотвращает paraphrase или reviewer leakage с сохранением disagreement и provenance.
- Report pairwise accuracy, calibration, domain и language slices, length bias, position bias и adversarial reward-hacking cases.
- До RL reward rankings сравниваются с blinded human judgments на fresh policy outputs, а не только original 500 000 pairs.
Зачем это спрашивают: Сильный ответ считает reward model potentially biased learned metric, обязанной generalize к changing policy outputs.
Я бы смешал targeted long-context examples и оценивал position-sensitive tasks вместо предположения, что short SFT сохраняет behavior на 128 000 tokens.
- Включаются retrieval, aggregation и needle tasks по lengths и positions с controlled fraction sequences от 16 000 до 128 000 tokens.
- Packing и length curriculum применяются осторожно, потому что long batches доминируют token count и memory даже при малом числе examples.
- Gate включает short-task quality, long-context retrieval, lost-in-the-middle slices, throughput и memory до принятия tuned model.
Зачем это спрашивают: Интервьюер проверяет, соответствует ли fine-tuning data length context capability, которую продукт хочет сохранить.
Я бы расширял его, только если compression и task gains выше embedding changes и compatibility cost.
- Candidate tokens обучаются на domain text с meaningful frequency и nonoverlap, затем сравниваются average length, truncation и inference tokens с current tokenizer.
- New embeddings требуют careful initialization и достаточного supervised или continued-pretraining exposure при стабильном old-token behavior.
- New tokenizer создаёт distinct model и serving artifact, поэтому adapters, caches, quantized engines и clients не смешивают versions.
Зачем это спрашивают: Сильный ответ связывает domain tokenization gains с retraining requirements и strict runtime compatibility.
Run требует около 30,3 wall-clock hours и примерно 243 H100 GPU-hours с allowance 20%.
- 200 млн делить на 2 200 составляет около 90 909 секунд, или 25,3 hours measured compute time.
- Умножение на 1,2 покрывает evaluation, checkpoints, stragglers и expected interruptions, давая около 30,3 hours.
- Восемь GPUs на 30,3 hours дают около 243 GPU-hours, а storage и failed-run reserve оцениваются отдельно.
Зачем это спрашивают: Интервьюер проверяет, превращает ли кандидат measured token throughput в defensible schedule и GPU-hour budget.
Я бы checkpoint не реже каждых 20 минут progress и benchmark asynchronous save time против training throughput.
- Faithful checkpoint включает model или adapter, optimizer, scheduler, scaler, random states, dataloader position и global step под одним manifest.
- Sharded checkpoints не собирают huge full state на rank zero, а periodic consolidated weights поддерживают evaluation и serving.
- Resume tests специально убивают workers и проверяют matching loss и sample order, потому что written checkpoint не доказывает recoverability.
Зачем это спрашивают: Сильный ответ связывает recovery-point objective с exact distributed state и tested resume behavior.
Закрытые вопросы
- 21
Обучите model 70B с Adam на 16 H100. Как выбрать между PyTorch FSDP и DeepSpeed ZeRO-3?
- 22
Model 140B не помещается на один node, есть четыре nodes по восемь H100 с fast intra-node NVLink и slower inter-node fabric. Как разместить parallelism?
- 23
Fine-tune на 32 000 tokens превышает GPU memory на 28%. Выбрать activation checkpointing, CPU offload или smaller batches?
fine-tuningtokensbatch - 24
Sequence length растёт с 8 000 до 64 000 tokens, и attention memory становится training bottleneck. Какой parallelism добавить?
tokensmemorytracking - 25
H100 training поддерживает BF16 и FP8. Когда использовать FP8 для continued-pretraining model 70B?
- 26
Сколько memory требуют weights model 70B в BF16, INT8 и INT4 до runtime overhead?
memory - 27
Оцените BF16 KV-cache memory для GQA model 70B с 80 layers, 8 KV heads, head dimension 128 и одной sequence 32 000 tokens.
cachingmemoryestimation - 28
vLLM endpoint должен давать 8 000 output tokens per second при p99 TTFT ниже 900 мс. Как настроить continuous batching?
tokensendpointsbatch - 29
Выберите между vLLM и TGI для serving model 34B со streaming, continuous batching, LoRA adapters и contexts 16 000 tokens.
fine-tuningtokensstreaming - 30
BF16 model 70B должна serving на четырёх H100 по 80 GB в одном node. Как выбрать tensor parallelism и memory headroom?
memory - 31
Model 180B занимает два nodes по восемь GPUs, но inter-node bandwidth в пять раз ниже NVLink. Добавлять pipeline parallelism?
ci-cd - 32
INT8 сохраняет 98,8% task quality, INT4 AWQ сохраняет 95,6%, но INT4 удваивает batch capacity. Какую precision deploy?
capacitybatchdeployment - 33
Target model 70B использует draft model 1,5B с token acceptance rate 72%. Как решить, полезен ли speculative decoding?
tokensdecoding - 34
Восемьдесят процентов requests делят identical system и tool prefix 4 000 tokens. Как использовать prefix caching?
cachingsystem-designtokens - 35
Serving engine использует paged KV cache с blocks по 16 tokens. Какой trade-off заставит тестировать blocks по 8 или 32 tokens?
tokenscaching - 36
Grammar-constrained decoding повышает JSON validity с 94% до 99,98%, но снижает throughput на 17%. Оставлять?
throughputdecoding - 37
Inference fleet имеет cold starts 12 минут, а traffic может утроиться за 5 минут. Какие autoscaling signals и capacity policy использовать?
capacityscalinginference - 38
Server держит 80 LoRA adapters, а load cold adapter занимает 1,8 секунды. Как size и schedule adapter cache?
fine-tuningcaching - 39
Как benchmark новый inference engine для prompts от 200 до 32 000 tokens и outputs от 20 до 2 000 tokens?
promptingtokensbenchmarking - 40
GPU utilization 55%, но CPU tokenization занимает 22 мс per request при 10 000 requests per second. Как size front end?
tokens - 41
Model поддерживает 128 000 tokens, но request должен reserve 4 000 output tokens и содержит conversation 70 000 tokens. Как allocate context?
tokens - 42
Retrieved и conversational context занимают 60 000 tokens, но latency budget допускает только 16 000 input tokens. Как compress?
latencytokens - 43
Support prompt вырос до 9 000 tokens из-за 40 examples, но removal examples ухудшает rare intents. Как его сократить?
promptingtokens - 44
Задайте decoding для deterministic invoice extractor и creative marketing assistant на одной model. Что отличается?
decoding - 45
Model 32B обучена на 8 000 tokens, но product просит 64 000 через RoPE scaling. Какие evidence потребовать?
tokensscaling - 46
Постройте release harness для model с 12 tasks, шестью languages, тремя risk tiers и 10 000 labeled examples. Как его структурировать?
mlops - 47
LLM judge согласен с human reviewers на 86% overall, но только 64% на code answers. Может ли он gate model release?
llm - 48
Fine-tuned model получает gain 8 points на MMLU, но 6% benchmark prompts найдены в training. Как сообщить result?
promptingfine-tuningbenchmarking - 49
Candidate повышает average task success с 87% до 89%, но structured-output validity падает с 99,9% до 98,7%. Выпускать?
- 50
New model лидирует MMLU и HumanEval, но customer-support task имеет только 74% success. Какой benchmark решает deployment?
benchmarkingdeployment - 51
LoRA release улучшает support style на 12 пунктов, но снижает core reasoning benchmark с 78% до 69%. Как реагировать?
fine-tuningbenchmarking - 52
DPO model выигрывает 64% style comparisons, но factual accuracy падает с 91% до 83%. Что расследовать?
- 53
Support fine-tune повышает ticket resolution на 8 пунктов, но снижает code-generation pass@1 с 62% до 41%. Как обработать catastrophic forgetting?
fine-tuningsoft-skills - 54
После SFT в основном на examples по 2 000 tokens needle retrieval на 96 000 tokens падает с 76% до 38%. Что делать?
retrievaltokens - 55
Reward PPO agent растёт на 40%, но verified tool-task success остаётся 57%, а trajectories становятся длиннее. Что происходит?
agents - 56
Loss становится NaN на step 18 400 run 70B FP8 после 600 H100 GPU-hours. Как восстановиться?
- 57
Training throughput падает с 2 400 до 1 350 tokens per second после scaling с 8 до 32 H100. Как расследовать?
throughputscalingtokens - 58
Resumed ZeRO-3 run совпадает по loss 200 steps, затем расходится на 17%. Какое state проверить?
- 59
За неделю до release обнаружено, что 7% evaluation prompts имеют near-duplicates в SFT data. Что сообщить и переделать?
promptingdedupllm-eval - 60
Fine-tuned checkpoint served с base tokenizer, вызывая 4,6% malformed outputs и loss quality 13 points. Как восстановиться?
fine-tuningtokens - 61
Hosted inference bill растёт на 92% от $310 000, а request volume только на 4%. Что проверить сначала?
inference - 62
Self-hosted fleet потребляет 38 000 H100 GPU-hours в месяц, рост 61%, а useful output tokens растут 9%. Как снизить waste?
tokens - 63
Speculative decoding повышает total GPU cost на 24% после падения acceptance с 74% до 39% на new traffic. Что решить?
decoding - 64
Cold LoRA loads растут с 3% до 31%, добавляя 1,7 секунды p99 и 14 000 GPU-hours в месяц. Как исправить adapter-cache thrashing?
fine-tuningcaching - 65
INT4 rollout снижает memory на 46%, но Arabic task success падает с 81% до 59%. Product хочет capacity savings. Что делать?
capacitymemory - 66
При нагрузке в 4 раза выше p99 TTFT растёт с 680 до 3 400 мс, а decode speed стабилен. Как стабилизировать?
- 67
После увеличения maximum batched tokens throughput растёт на 22%, но p99 inter-token latency с 55 до 170 мс. Оставлять?
latencythroughputbatch - 68
Priority scheduler preempts batch work, но 28% batch requests теперь пропускают deadline шесть часов. Как rebalance?
estimationbatch - 69
Server traces показывают TTFT 480 мс, но 35% browsers получают первый token через 2,6 секунды после gateway upgrade. Где искать?
tokensgateway - 70
New model загружается 14 минут, а traffic spike утраивает demand за 6 минут. Как избежать repeated cold-start saturation?
- 71
vLLM workers OOM, когда десять users отправляют prompts по 128 000 tokens, хотя average context 7 500. Как восстановиться?
promptingtokens - 72
Load 41-го LoRA adapter вызывает CUDA OOM, хотя estimated adapter weights помещаются с 9 GB free. Что проверить?
fine-tuningestimation - 73
KV-cache occupancy остаётся 96% после завершения requests, а concurrency падает 40% за шесть часов. Как диагностировать?
cachingconcurrency - 74
В four-way tensor-parallel replica один H100 достигает 78 GB, остальные около 61 GB, и worker OOM. Что проверить?
replication - 75
Autoscaler переключается между 12 и 40 replicas каждые 20 минут, теряя 6 000 GPU-hours monthly и destabilizing p99. Как остановить?
replicationscaling - 76
Release candidate проходит judge suite, но 180 из 1 000 generated programs падают в sandbox из-за missing imports. Что решает rollout?
- 77
LLM judge показывает gain 7 points после silent update judge model провайдером, но human preference не меняется. Что делать?
llm - 78
После provider migration 14% requests возвращают empty completions, и 27 000 daily workflows не могут продолжить. Как восстановиться?
migrations - 79
Eval suite проходит overall, но 11 из 240 safety cases regression после prompt change. Product считает sample слишком маленькой. Что решить?
prompting - 80
Offline task success остаётся 88%, но production complaint rate удваивается с 0,7% до 1,4% после release. Как согласовать?
- 81
Jailbreak заставляет public assistant выдавать prohibited weapon instructions в 2,3% red-team attempts. Как реагировать?
llm-safety - 82
Сотрудник вставляет 6 000 строк proprietary code в consumer LLM account с retention 30 дней. Что делать?
llmretention - 83
Retrieved document injects instructions, заставляющие agent отправить customer data на external URL. Как ограничить?
agents - 84
Email addresses и API tokens появляются в 1,8% traces у vendor с retention 45 дней. Как реагировать?
tokensapiretention - 85
Model checkpoint на четырёх hosts выполняет unexpected pickle payload и открывает network connection. Что делать?
- 86
Responses tenant B иногда используют LoRA style и phrases tenant A после adapter swaps. Как расследовать 19 confirmed cases?
fine-tuning - 87
Legal assistant придумывает пять citations, а два клиента уже подали generated briefs. Как реагировать?
citations - 88
Medical assistant выдаёт unsupported dosage 73 users несмотря на moderation pass. Как вести response?
- 89
Model уверенно сообщает tax rule, истёкшее 14 месяцев назад, и его увидели 4 200 users. Как ограничить hallucination?
hallucination - 90
Agent придумывает nonexistent argument `transfer_funds` и переводит $18 000 на неверный account после coercion tool wrapper. Что сломалось?
agentsfundamentals - 91
Provider удалит model с 42 млн monthly requests в 17 workflows через 45 дней. Как migrate?
mlops - 92
Hosted model alias меняет behavior за ночь: refusal rate растёт с 6% до 19% без release notice. Что делать?
- 93
Primary provider недоступен, а fallback fails 16% tool-selection tests. Переводить весь traffic?
testing - 94
Provider сокращает usable context с 128 000 до 64 000 tokens и повышает output price на 35% за две недели. Как выбрать route?
tokens - 95
Middle engineer меняет prompt без eval harness, вызывая падение JSON validity с 99,8% до 94%. Как mentor?
promptingmentoring - 96
Researcher заявляет gain 6 points, но checkpoint невозможно reproduce, а 900 GPU-hours уже потрачено. Как coach?
- 97
Junior engineer 'исправляет' recurring KV-cache OOM рестартом pods каждый час. Как перенаправить работу?
caching - 98
Два senior engineers спорят о monthly overrun $90 000: один хочет INT4, другой fewer warm replicas. Как решить?
conflictreplication - 99
Product хочет Friday launch, но red-team jailbreak success остаётся 6,5% для agent с customer-write tools. Что рекомендовать?
agentsllm-safety - 100
Prompt и scheduler release вызывают retry amplification, cache misses и incident на $620 000 между четырьмя teams. Как провести postmortem?
incidentscachingresilience