Skip to content

Вопросы на собеседовании: Инженер генеративного ИИ

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Senior.

Смотреть пример резюме: Инженер генеративного ИИ

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

designlatency

Я бы оставил единый policy и job contract, но выделил каждой модальности отдельный класс исполнения.

  • Gateway определяет tenant, modality, model manifest, safety policy, deadline и cost ceiling до отправки в очереди image, video, audio или text.
  • Интерактивные text, image previews и audio получают admission по deadline, а video идёт в durable async jobs с progress events и идемпотентной публикацией результата.
  • Capability registry явно задаёт resolution, duration, conditioning, streaming, hardware и artifact compatibility модели, не обещая ложную переносимость.
  • Load tests на 39 000 запросов в минуту проверяют headroom 30%, p99 каждой модальности, quality gates и корректный отказ при насыщении GPU pool.

Зачем это спрашивают: Интервьюер проверяет, сохраняет ли общая multimodal-платформа отдельные scheduling, contracts и SLO для каждой модальности.

model-serving

Я бы считал capacity по измеренным GPU-seconds на принятый asset и разделил очереди preview и final render.

  • 2 млн в день это в среднем 23,1 asset в секунду; при пике 5x и headroom 25% нужна ёмкость примерно 145 принятых assets в секунду.
  • Если оптимизированный eight-step pipeline даёт 2,4 изображения на GPU-second, пик требует около 61 GPU до запаса на redundancy, safety retries и обслуживание.
  • Continuous dynamic batching объединяет совместимые model, resolution, scheduler, adapter и conditioning requests, а deadline 4 секунды ограничивает queue wait.
  • Safety rejections и client cancellations не входят в success, а SLO 99,9% считает только admitted jobs, которые обязаны опубликовать ровно один immutable asset.

Зачем это спрашивают: Сильный ответ переводит суточный объём изображений в пиковую GPU capacity и точно определяет границы reliability-метрики.

system-designdesignbatch

SLO выполним только с workers на двух GPU, запускаемых через gang scheduling, и почти без queue delay.

  • Два GPU при efficiency 80% дают wall time 18 / 1,6 = 11,25 минуты, оставляя лишь 45 секунд на queueing, safety, muxing и publication.
  • Из-за потерь масштабирования job занимает 22,5 allocated GPU-minutes; 20 000 jobs требуют 7 500 allocated GPU-hours в день, в среднем 312,5 GPU.
  • При effective utilization 70% и reserve 20% я бы заложил около 268 slots по два GPU, то есть 536 GPU, а затем проверил arrival distribution вместо опоры на daily average.
  • Admission атомарно резервирует оба GPU, считает stranded single GPUs как fragmentation и отклоняет либо упрощает job, если slot не стартует внутри 45-секундного бюджета вне generation.

Зачем это спрашивают: Интервьюер проверяет, согласованы ли GPU-minutes с wall time, parallel efficiency, gang scheduling и fragmentation.

designbatchlatency

Я бы считал capacity по измеренному числу batched streams, а не переводил real-time factor напрямую в физические GPU.

  • Inference требует 200 / 8 = 25 L40S; headroom 30% округляет число до 33, а сохранение его после отказа host с четырьмя GPU требует 40 deployed GPU, то есть десять полных hosts.
  • Измеренные 175 мс и buffer 60 мс занимают 235 мс из бюджета 300 мс, оставляя 65 мс на network и gateway delay; buffer остаётся ниже цели jitter 80 мс.
  • Session-affine workers связывают tenant, model, speaker embedding, consent, locale и codec, а batch slots и caches используют тот же isolation key.
  • Test на 260 streams с отключением host проверяет first-audio p99, underruns, streams per GPU, cancellation и failover вместо предположения о линейном scaling.

Зачем это спрашивают: Сильный ответ использует измеренную batched TTS capacity и отдельно учитывает inference, failover, buffering и isolation.

design

Я бы сделал канонический пакет продукта неизменяемым контуром управления, а генерировал только сцену, освещение, движение камеры и текст вокруг него.

  • Реестр SKU версионирует утверждённые mesh, размеры, UV, PBR-карты, декали и маски логотипа, калиброванные цвета и допустимые ракурсы под одним digest; каждый job фиксирует этот digest, а генерация не может изменять поверхности продукта.
  • Geometry-conditioned pipeline рендерит из mesh проходы depth, normals, segmentation, shadow и product beauty, генерирует фон и движение по этим условиям, затем композитит или повторно рендерит заблокированный продуктовый слой для каждого изображения или кадра видео.
  • Автоматические gates сравнивают силуэты и landmarks на восьми ракурсах при IoU не ниже 0,995, требуют similarity логотипа не ниже 0,98 и Delta E 2000 калиброванного albedo не выше 2, а также проверяют digests PBR и эталонные блики; ошибки поступают человеку, который не может изменить пакет SKU.
  • Capacity test на трёхкратном часовом пике должен поддерживать 10 000 принятых креативов в день при p95 изображения ниже 12 секунд, p95 видео ниже 120 секунд, стоимости принятого изображения не выше $0,15, видео не выше $1,20, first-pass acceptance не ниже 98% и отсутствии нарушений SKU в release-аудите на 5 000 ассетов.

Зачем это спрашивают: Интервьюер проверяет, остаётся ли готовый канонический 3D-продукт неизменяемым источником истины, а генерация, проверки, capacity и передача исключений человеку образуют измеримую production-архитектуру.

diffusiondesign

Я бы сделал legality данных, token throughput и recoverability частью одного immutable training manifest.

  • Pilot измеряет examples per GPU-second на целевом resolution; полный run должен обрабатывать минимум 386 examples в секунду, чтобы увидеть 1 млрд pairs за 30 дней до учёта evaluation и downtime.
  • Versioned shards хранят license grant, source, checksum, caption transform, dedup cluster, opt-out status и hash preprocessing code, а невалидные records удаляются до sampling.
  • FSDP или ZeRO sharding optimizer state, mixed precision и activation checkpointing помогают разместить модель, а topology-aware data loading загружает все 512 GPU.
  • Checkpoints каждые 20 минут ограничивают lost work, а fixed prompts, distribution metrics уровня FID, human preference, safety и memorization probes разрешают продолжение.

Зачем это спрашивают: Сильный ответ объединяет throughput обучения на миллиарде пар с контролями licensed data и проверенным восстановлением.

Я бы определял recovery по возрасту и восстанавливаемости последнего successful checkpoint, а не по таймеру checkpoint.

  • Capacity моделируется в encoded frames с учётом duration и resolution; 27,6 clips в секунду служат лишь sanity check, поскольку стоимость clips различается.
  • Checkpoint запускается каждые 10 минут, имеет p99 write budget три минуты и становится видимым только после checksums, проверки shards и atomic commit manifest.
  • Manifest сохраняет model, optimizer, scheduler, loss scaler, position dataloader и sampler, ordered shard cursor и все RNG states для точной sequence.
  • Failure drills завершают workers и coordinator, восстанавливают run на новых nodes, сравнивают следующие batches и losses и поднимают alert при age последнего successful checkpoint около 15 минут.

Зачем это спрашивают: Интервьюер оценивает, означает ли checkpoint RPO свежую, атомарную, полную и проверенную точку восстановления.

leakagegeneratorsci-cd

Я бы разделил данные по rights holder и artist до feature extraction, а training запускал из versioned rights-aware sample manifest.

  • Каждый segment хранит grants на recording и composition, territory, expiry, artist, ISRC-подобный identifier, checksum и разрешённую training purpose; истёкшие grants прекращают будущий sampling.
  • Loudness normalization, resampling, source separation, codec tokens и text conditioning фиксируются как pinned transforms, а artist и track groups не пересекаются с validation.
  • Throughput считается в audio-hours per GPU-hour, а не в tracks, а duration buckets не позволяют десятиминутным песням определять step time.
  • Release gates объединяют listener preference, intelligibility, musical structure, safety и nearest-neighbor memorization tests по licensed catalog.

Зачем это спрашивают: Сильный ответ рассматривает licensed audio catalog как rights-scoped temporal data, а не папку взаимозаменяемых файлов.

concurrency

Я бы разделил adapter training, compatibility validation, registry publication и serving admission под единым tenant-scoped manifest.

  • Training queues взвешиваются по plan и GPU-seconds, quotas не дают одному tenant занять все 50 slots, а predicted cost проверяется до admission.
  • Default LoRA recipe перебирает только rank 16 и 32 на held-out identity and style set; early stopping завершает runs, которые не обгонят base внутри ceiling $12.
  • Каждый adapter хранит base hash, VAE, text encoder, target modules, rank, precision, dataset consent, recipe и eval result до atomic publication.
  • Для SLO 95% за два часа capacity tests включают 65 concurrent jobs, failed nodes, retries и artifact upload, а не только training loop.

Зачем это спрашивают: Интервьюер проверяет, объединяет ли multi-tenant LoRA platform fair scheduling, unit economics и строгую artifact compatibility.

fine-tuningloraleakage

Я бы авторизовал и загружал adapters через tenant-scoped broker, затем атомарно публиковал их в bounded caches каждой replica.

  • Cache key включает tenant, adapter version, base hash, tokenizer, VAE и precision; digest mismatch или чужой tenant приводит к hard rejection.
  • Requests batch между adapters только при корректной изоляции weights движком, а KV, latent, CUDA graph и output caches используют тот же isolation key.
  • Concurrent misses объединяются в один verified download, hot adapters закрепляются по measured demand, а cold-load остаётся виден внутри p99 5 секунд.
  • Cross-tenant fuzz tests, memory-scrub tests, signed artifact checks и audit logs доказывают controls, не обещая магическую конфиденциальность GPU memory.

Зачем это спрашивают: Сильный ответ покрывает authorization, cache identity, batching behavior и реалистичные границы accelerator isolation.

rollbackregistriesdesign

Я бы сделал release manifest, который связывает model artifact со всеми evaluations, dependencies, policies и product approvals для запуска.

  • Registry хранит immutable hashes для weights, architecture, tokenizer или codec, VAE, preprocessing, adapters, runtime image, prompts, safety policy и license status.
  • Evaluation records ссылаются на точные dataset, rubric, judge, human panel, seeds, hardware и per-slice results, а не на один pass badge.
  • Compatibility graph задаёт допустимые surfaces и runtimes для каждого artifact, а promotion использует signed stage transitions вместо mutable labels.
  • Rollback активирует предыдущий полный manifest и routing weights; ежеквартальные drills доказывают восстановление всех 18 surfaces за 10 минут.

Зачем это спрашивают: Интервьюер оценивает, делает ли registry design multimodal releases воспроизводимыми, совместимыми и быстро обратимыми.

promptingimmutabilityllm-eval

Я бы рассматривал каждую evaluation как content-addressed experiment без drift в prompt, conditioning, generation и scoring inputs.

  • Manifest фиксирует prompt text, negative prompt, seeds, aspect ratio, duration, input assets, masks, scheduler, guidance, steps, model graph и runtime container.
  • Scheduler стратифицирует 4 000 prompts по safety, typography, anatomy, composition, motion, language и product use, затем даёт кандидатам одинаковые paired seeds.
  • Cached generations переиспользуются только при точном manifest hash; metric code и embedding models становятся versioned outputs, а не скрытыми dependencies.
  • Six-hour gate показывает paired deltas и confidence intervals по slices и падает на incomplete cells вместо сравнения разных prompt subsets.

Зачем это спрашивают: Сильный ответ не позволяет fixed-prompt evaluation незаметно меняться через conditioning, runtime или scoring dependencies.

Я бы заранее зарегистрировал prompt pair как independent unit и рассчитал power primary forced-choice estimand до открытия panel.

  • Normal approximation требует около 6 600 независимых pairs для power 90% при эффекте два пункта; pilot оценивает clustering по reviewers и prompts, после чего n умножается на design effect.
  • Три blinded judgments на пару по 45 секунд используют около 248 часов до поправки, оставляя из 600 часов запас на quality checks и oversampling slices.
  • Reviewer assignment пересекает models и prompt strata, gold items выявляют невнимательность, а mixed model не считает repeated reviewers независимыми.
  • Primary test использует alpha 0,05; четыре critical slices получают Holm correction и pilot-powered sample sizes, а aggregate win не перекрывает underpowered или failing slice.

Зачем это спрашивают: Сильный ответ отделяет confidence от power и переводит effect size, review time, clustering и multiplicity в sample plan.

promptingdesigncss

Я бы сделал delta severe flicker в clips 8-12 секунд primary paired endpoint, отдельным от frame aesthetics.

  • При one-sided alpha 0,05, discordance 4% и margin один пункт около 3 500 pairs дают power 90%; я бы выделил 4 000 clips этой duration и 6 000 остальным.
  • Motion, cuts, faces, text и occlusion задаются заранее; 1 000 подходящих pairs на critical sub-slice дают MDE примерно два пункта, что указывается честно.
  • Deterministic decode выравнивает timestamps, а optical flow, tracking survival и embedding drift диагностируют failures, которым blinded reviewers назначают severity.
  • One-sided paired bound должен остаться внутри одного пункта, critical slices с Holm adjustment обязаны пройти, а gain 6% не компенсирует temporal failure.

Зачем это спрашивают: Интервьюер проверяет, распределяет ли temporal gate clips по powered paired design и честно ли указывает более слабую точность sub-slices.

css

Я бы перевёл time budget в judgments, а затем по pilot paired scores определил, какие claims по языкам можно доказать.

  • При одной минуте на judgment 1 200 часов дают 72 000 judgments; три listeners на pair позволяют оценить максимум 24 000 pairs, или 600 на язык поровну.
  • Pilot оценивает variance paired scores и correlation listeners; n равно ((z alpha плюс z power) умножить на paired SD и разделить на один пункт) в квадрате с поправкой на repeated listeners.
  • Если 600 pairs не поддерживают bound после Holm correction, я бы сузил preregistered critical-language set или увеличил review budget, а не объявил все 40 non-inferior.
  • Hidden references и degraded anchors квалифицируют listeners, а отдельные naturalness, intelligibility, prosody, artifact и speaker-fidelity endpoints показывают codec damage.

Зачем это спрашивают: Сильный ответ переводит panel hours в ratings и рассматривает multilingual non-inferiority как ограничение power и multiplicity, включая нехватку бюджета.

Я бы построил modality-specific cascades, но promotion зависел бы от exact-binomial bounds по независимо выбранным positive и negative banks.

  • При design recall 99,9% против floor 99,5% normal calculation требует около 1 550 severe positives на critical slice; exact simulation задаёт итоговый n и допустимые misses.
  • При design false-positive rate 0,7% против ceiling 1% около 8 200 benign negatives на slice дают power 90% с итоговым exact one-sided upper bound.
  • Image, video, transcript, acoustic и text detectors поступают в calibrated combiner, а uncertain high-impact cases эскалируются, не исчезая в majority vote.
  • Holm correction покрывает critical slices, а adversarial, multilingual, compressed и transformed sets остаются отдельными, чтобы daily volume не подменял power.

Зачем это спрашивают: Интервьюер проверяет, имеют ли предельные safety targets явные denominators, one-sided bounds, power и multiplicity control.

hardware

Я бы отдельно рассчитал weighted modality work и очередь reviewers.

  • Suite содержит 638 000 GPU-seconds, или 177,2 GPU-hours; за восемь часов нужны 22,2 busy GPU, около 34 при utilization 80% и reserve 20%.
  • Dedicated pools не дают 450 000 GPU-seconds video work блокировать text и image, а critical path показывает queued GPU-seconds вместо tests per second.
  • Две тысячи escalations требуют 100 reviewer-hours, поэтому нужны минимум 13 concurrent reviewers и запас на disagreement и перерывы.
  • Versioned scenarios сохраняют seed, mutation, manifest, detector output, artifact hash и oracle decision; severe slice или поздний human backlog блокирует release.

Зачем это спрашивают: Сильный ответ рассчитывает heterogeneous red teaming в weighted compute и human-oracle work вместо одной вводящей в заблуждение throughput-метрики.

c2padesign

Я бы подписывал на trusted export boundary и описывал C2PA statements как claims, а не permissions или доказательство выполнения edit.

  • Manifest связывает output, parent ingredient, model и workflow identifiers и claimed actions editor; verification проверяет signature chain, trust list, hard или soft binding и ingredient relationship.
  • Signers с HSM используют rotation и revocation, а append-only log событий сертификатов является внутренним control, не возможностью C2PA.
  • Embedded manifests идут с поддерживаемыми images; sidecars для video или audio используют signed package index и discovery URL, связанный с asset, а отсутствие означает unknown, не fake.
  • Средние 23 signatures в секунду тестируются на peak 10x и signer failover с сохранением 99,99% attachment и limit p95 80 мс.

Зачем это спрашивают: Интервьюер оценивает точность C2PA semantics, проверки trust и binding и честный discovery mechanism для отделяемых manifests.

watermark

Я бы внедрил watermarking как один probabilistic signal рядом с C2PA provenance и никогда не обещал его неуничтожимость.

  • Perceptual watermark вставляется до final encoding, payload использует error correction, а keys разделяются по product и epoch для ограничения последствий компрометации.
  • Evaluation покрывает JPEG, resize, crop, blur, color edits, screenshots, regeneration и adversarial removal с recall и false-positive confidence bounds по каждому transform.
  • Target recall 95% относится только к объявленному transform suite и quality range; вне них verifier возвращает unknown, а не authentic или fake.
  • C2PA даёт signed positive provenance при сохранении, а watermark detection помогает investigation и abuse response, не становясь единственным enforcement evidence.

Зачем это спрашивают: Интервьюер оценивает, задаёт ли кандидат честные границы robustness и сочетает watermarking с более сильными provenance signals.

system-designdesignapi

Consent становится revocable authorization, связанным с verified speaker, а statistical gate использует только consent-negative attempts.

  • Enrollment сочетает account verification, liveness со случайной phrase, declared uses, expiry и revocation; synthesis требует capability по tenant, speaker, model и purpose.
  • Samples и embeddings шифруются, изолируются по tenant, имеют retention limit и исключаются из general training, а high-risk policy может блокировать matched voice.
  • Проверка 0,2% против ceiling 0,5% требует около 3 400 независимых negative attempts на critical slice по approximation; exact binomial simulation задаёт n и допустимые approvals.
  • Clusters speakers и attack families покрывают spoof, replay, synthetic, multilingual и accessibility slices с Holm-adjusted upper bounds; uncertainty возвращает review, не approval.

Зачем это спрашивают: Сильный ответ объединяет revocable consent с denominator, power model, upper bound, clustering и multiplicity для spoof false approvals.

Закрытые вопросы

  • 21

    Инструмент для дизайна обрабатывает 3 млн промптов в день и должен блокировать запрещённую имитацию ныне живущих художников и частных лиц, сохраняя долю ложных блокировок добросовестных запросов на стиль ниже 2%. Как обеспечить соблюдение политики?

    promptingdesignconcurrency
  • 22

    Rights holder требует за 30 дней удалить 8 млн assets из training corpus на 1 млрд pairs, включая derived captions и latents. Спроектируйте lineage and deletion.

    designlineage
  • 23

    Ежемесячно вы получаете 200 новых data licenses на image, video и audio с ограничениями по territory, expiry и purpose. Как не допустить invalid asset в run на 500 GPU?

    hardware
  • 24

    Доля synthetic images выросла с 10% до 45% в training mix на 400 млн examples, а diversity упала на 7% за три runs. Как контролировать feedback loop?

    feedback
  • 25

    Product собирает 5 млн ratings в неделю, но только 3% содержат comments, а complaint rate удвоился после model release. Спроектируйте active evaluation loop с response SLO 48 часов.

    designslollm-eval
  • 26

    Задайте monthly quality SLO и error budget для suite, генерирующей 60 млн images, 600 000 videos и 20 млн audio minutes, когда модальности используют разные quality metrics.

    reliabilityslomonitoring
  • 27

    Prompts, schedulers, adapters и safety rules независимо меняются для 25 models и 14 surfaces, но любой asset должен воспроизводиться 90 дней. Спроектируйте configuration versioning.

    reproducibilitypromptingversioning
  • 28

    Три команды обрабатывают 800 млн images, и silent crop change обесценил две недели training. Определите immutable preprocessing and conditioning contract с нулевым silent drift.

    iacimmutability
  • 29

    Upgrade diffusers ломает 7 из 60 production workflows, а rollback должен занимать меньше 15 минут. Как обеспечить artifact compatibility между runtime versions?

    rollbackartifactsdiffusers
  • 30

    Image endpoint переживает burst 10x до 180 requests per second, имеет p99 ниже 6 секунд и requests с четырьмя resolutions и 200 LoRAs. Спроектируйте dynamic batching.

    designbatchlatency
  • 31

    20 000 video jobs в день длятся от 6 секунд до 5 минут, а premium jobs требуют p95 completion меньше 20 минут без starvation free users. Спроектируйте queues.

    designdata-structures
  • 32

    Спрогнозируйте отдельные GPU pools для 2 млн images в день по 1,2 GPU-seconds с peak 5x, 20 000 video jobs в день по 18 GPU-minutes с target utilization 70% и 200 peak TTS streams при восьми streams на L40S. Добавьте headroom 30% в трёх zones; крупнейшая содержит 40% каждого pool и может отказать.

    hardware
  • 33

    У вас есть 64 H100, 40 L40S, шесть моделей изображений, три модели видео и две модели TTS. p99 нарушает целевое значение при средней загрузке 58%, но ни одну модель не тестировали на обоих типах GPU. Как разместить модели?

    benchmarkinglatency
  • 34

    Regional outage убирает 45% GPU capacity, interactive generation имеет availability target 99,95%, а video jobs могут завершиться за 30 минут. Спроектируйте failover.

    designcapacityhardware
  • 35

    Запустите image generation на devices с 8 ГБ RAM и sustained limit 12 ватт, выдавая preview 512 pixels меньше трёх секунд и сохраняя prompts local. App также должна выпускать offline-verifiable provenance.

    prompting
  • 36

    Mobile users переключаются между links 2 Mbps и 50 Mbps, а asset 1024 pixels должен приходить за p95 8 секунд, сохраняя prompts private где возможно. Спроектируйте hybrid generation.

    promptingdesign
  • 37

    Выберите architecture для design editor с interactive masked edits меньше секунды, final renders 2048 pixels меньше восьми секунд и preview на low-power device с 8 ГБ RAM. Сравните diffusion, autoregressive visual tokens и masked-token generation.

    designtokens
  • 38

    Выберите precision portfolio для 12 models на H100, L40S и consumer NPU с целью снизить cost на 30% без quality loss critical slices больше 1 пункта.

  • 39

    Спроектируйте production-сервис создания 3D-моделей по тексту и изображениям для 50 000 ассетов в день с p95 ниже 10 минут. Каждый результат должен включать mesh, UV, PBR-текстуры, turntable preview и исправленную non-manifold геометрию.

    design
  • 40

    60% из 8 млн daily generations повторно используют template, source asset или edit history. Benchmarks показывают savings 35 GPU-ms для image prompt encoding, 90 для source VAE encoding, 240 для video source encoding и 18 для audio speaker conditioning. Снизьте GPU time на 20% без cross-tenant reuse.

    feature-engineeringpromptinghardware
  • 41

    Finance требует per-asset cost с accuracy 5% для 60 млн images, 600 000 videos и 20 млн audio minutes в месяц. Спроектируйте attribution, где monthly invoice reconciliation не скрывает ошибки.

    reactdesign
  • 42

    Multimodal GPU bill равен $8 млн за quarter, и leadership требует сократить его на 40% за два quarters без падения accepted-asset rate больше 1 пункта. Какой plan выполнить?

    hardware
  • 43

    При 2 млн images и 20 000 video jobs в день сравните собственный inference с командой 12 человек стоимостью $3,6 млн в год и vendor по $0,05 за image и $2,20 за video.

    inferenceprocurement
  • 44

    Regulated customers генерируют 15% из 80 млн monthly assets, а vendor model выигрывает human preference у open weights на 4 пункта. Выберите вариант с учётом license и privacy constraints.

    procurement
  • 45

    Candidate model может обслуживать 30 млн assets в день, но severe regressions нужно ограничить числом меньше 10 000 candidate outputs. Automated detection занимает две минуты, specialist review ещё 15 минут. Спроектируйте preflight, canary и rollback.

    designdeployment-strategiesrollback
  • 46

    Model используется в 4 млн saved creative workflows и должна быть retired за 90 дней, но 8% workflows падают на successor. Спроектируйте deprecation.

    design
  • 47

    Восемь команд публикуют 300 workflows в ComfyUI, custom nodes могут выполнять Python-код, а production требует 99,9% успешных запусков и установки исправлений критических уязвимостей за 48 часов. Спроектируйте управление этой средой.

    vulnerabilitiesdesignpython
  • 48

    Двадцать client SDKs используют image, video, audio и text APIs, а breaking model capability change нужно выпустить без unannounced failures за шесть месяцев. Спроектируйте versioning.

    versioningdesign
  • 49

    Нужно обслуживать 80 млн private generations в месяц с p99 incident detection меньше пяти минут, но observability не может хранить raw prompts или assets. Какие signals собирать?

    promptingobservabilityincidents
  • 50

    Research передаёт 10 multimodal checkpoints в quarter в runtime для 12 product teams, но integration занимает восемь недель, а ownership спорный. Составьте cross-org handoff RFC с target четыре недели.

    decision-makingownership
  • 51

    Сразу после выпуска нового scheduler p99 генерации изображений вырос с 6 до 18 секунд, а p50 не изменился. Что вы будете делать?

    latency
  • 52

    Очередь генерации видео нарушает 15-минутный SLO завершения для 22% jobs во время вечерних пиков. Как вы её восстановите?

    slodata-structures
  • 53

    После оптимизации audio runtime p95 времени до первого звука вырос с 240 до 710 мс при SLO 300 мс, хотя генерация полного клипа ускорилась на 12%. Какое решение вы примете?

    slooptimization
  • 54

    Новый MM-DiT checkpoint делает изображения товаров заметно менее насыщенными, но CLIP score улучшается на 3%. Как вы проведёте расследование?

    mm-dit
  • 55

    После обновления сцены 3D Gaussian Splatting в 14% Web-сессий появились двойные фасады и плавающие splats, хотя offline-рендеры чистые. Camera poses изменились в release 42, но часть клиентов получила сжатую сцену из release 41. Как устранить проблему?

    splattingsessions
  • 56

    Реверсивный локальный image editor повреждает replay на шаге 17 из 20: после undo меняются пиксели вне mask, а provenance-запись указывает на неверную родительскую ветку. Как вы перепроектируете систему?

    decision-making
  • 57

    INT4 quantization экономит 44% GPU memory, но редкие художественные стили схлопываются в основной house style. Что вы выпустите?

    memorymodel-compressionhardware
  • 58

    4D-сцена получает хорошую оценку temporal smoothness, но стул смещается на 11 см, когда камера через 10 секунд возвращается в ту же точку обзора. Как диагностировать и ограничить выпуск модели?

  • 59

    LoRA adapter одного tenant влияет на следующий image request другого tenant в течение 90 секунд. Как вы отреагируете?

    fine-tuningloraincidents
  • 60

    Adapter cache повысил hit rate с 41% до 79%, но теперь два GPU workers в час падают с OOM. Как вы его перепроектируете?

    cachinghardware
  • 61

    Streaming video system возвращает двухсекундный preview за 1,4 секунды, но финальное refinement незаметно разворачивает уже одобренный выход персонажа в 6,8% клипов. Как изменить контракт?

    system-designstreaming
  • 62

    GPU загружены только на 38%, CPU preprocessing насыщен, а возраст очереди изображений растёт. Что вы измените сначала и как определите успех?

    data-structures
  • 63

    Shared identity system сохраняет образ автора между portrait, talking-head и multilingual voice, но в 37 запросах черты лица или голоса одного tenant попали в результат другого. Спроектируйте containment и замену.

    system-designdesign
  • 64

    Unified model создаёт изображение красной упаковки, а через 80 tokens в том же interleaved response сообщает пользователю, что упаковка синяя, в 9% сессий. Как диагностировать и предотвратить противоречие?

    tokenssessions
  • 65

    Обнаружено, что популярный custom node для ComfyUI отправляет API keys с render workers наружу. Как вы отреагируете?

    comfyuiapi
  • 66

    90-секундный dubbed talking-head clip синхронен в начале, но после конвертации с 24 до 25 fps рассинхрон губ достигает 180 мс; в последней трети также пропадает эмоция. Как исправить pipeline для 10 языков?

    ci-cd
  • 67

    Music model выигрывает preference tests на 20-секундных клипах, но 41% трёхминутных композиций повторяют chorus, пропускают bridge или теряют тональность после второй минуты. Что вы измените?

    testing
  • 68

    Сервис similarity для generated music отправляет на review 12% треков из-за распространённых четырёхнотных motifs, но пропускает 7 из 50 известных melodic copies после смены тональности и темпа. Как его перепроектировать?

  • 69

    Клиент создал узнаваемый voice clone без согласия человека, которому принадлежит голос. Что вы сделаете в первые сутки?

  • 70

    После запуска вирусного template доля запросов на имитацию стиля живущих художников выросла с 2% до 19%. Как вы ответите?

  • 71

    Safety classifier пропускает запрещённые материалы с сексуальным насилием над детьми в небольшом числе случаев генерации изображений. Опишите реакцию, не раскрывая вредных деталей.

    safety-classifier
  • 72

    Изображение и audio track по отдельности проходят safety review, но вместе создают обманную инструкцию, которая попала в 3 200 campaign assets. Как перепроектировать policy fusion?

  • 73

    Текст внутри загруженного изображения просит creative agent получить private campaign data, и agent пытается вызвать tool. Как вы отреагируете?

    agents
  • 74

    В storyboard из 40 shots постоянно меняется пальто детектива, разворачивается география комнаты, а улика раскрывается в shot 23, хотя должна оставаться нерешённой до shot 38. Как спроектировать generation state?

    design
  • 75

    Managed image API незаметно расширяет refusal policy, и completion за ночь падает с 96% до 74%. Что вы сделаете, если vendor не предоставляет ни pinned model version, ни policy changelog?

    procurementapi
  • 76

    Generated Foley совпадает с preview 60 fps, но после финального монтажа 29,97 fps шаги и удары расходятся на 420 мс к четвёртой минуте, а ambience обрывается на границах shots. Как исправить систему?

    system-designiac
  • 77

    Text model галлюцинирует опасную инструкцию сцены, которой не было в безопасном запросе пользователя к генерации изображения. Как перепроектировать pipeline?

    ci-cd
  • 78

    Multimodal router в течение 14 минут отправлял private reference image клиента не тому внешнему vendor. Каков ваш incident plan?

    procurementincidents
  • 79

    VLM evaluator даёт outputs собственного model family преимущество 8 points, хотя expert reviewers не находят различий на 1 600 парных изображениях. Как доказать и устранить self-preference?

    llm-eval
  • 80

    Generator-verifier loop расширяет редкие сцены с инвалидными колясками для training; после четырёх циклов verifier pass rate растёт с 72% до 96%, но geometry errors по оценке experts увеличиваются с 6% до 19%. Как остановить усиление blind spots?

    generators
  • 81

    Иллюстратор жалуется, что generated output почти полностью повторяет изображение из private portfolio. Как вы исследуете memorization?

    dedup
  • 82

    Обновление tokenizer и codebooks unified any-to-any model улучшает scores текста и изображений, но 11% speech responses повторяют phonemes, а синхронизация слов между audio и video сдвигается на 240 мс в четырёх языках. Как вы проведёте incident?

    tokensincidents
  • 83

    Text-to-3D service получает 4,5 из 5 за turntable renders, но 23% exported meshes являются non-manifold, у 31% перекрываются UV, а несколько PBR materials нарушают ограничения target engine. Что вы выпустите?

  • 84

    Evaluator, который совпадал с expert reviewers в 86% случаев, теперь совпадает только в 61%, хотя generator не менялся. Как решить, можно ли вернуть ему право на promotion decisions?

    llm-evalgenerators
  • 85

    Human raters на английском и японском расходятся на 24 points по одному release image model. Как определить, является ли это шумом rubric или реальным locale-specific preference?

  • 86

    Video optimization сокращает render cost на 28%, но лицо персонажа мерцает в 7% shots. Что вы выпустите?

    optimization
  • 87

    После замены motion module в generated videos ноги скользят, а объекты ускоряются вверх в 12% physics-heavy prompts. Как вы проведёте debugging?

    prompting
  • 88

    TTS speed optimization снижает real-time factor на 21%, но speaker-similarity score падает с 0,84 до 0,68. Какое решение вы примете?

    optimization
  • 89

    Audio watermark слышен как металлический писк в 9% тихих speech clips. Как вы отреагируете?

    watermark
  • 90

    Duplex speech-to-speech assistant выдерживает response latency 420 мс во время монологов, но p95 времени до остановки своей речи и ответа достигает 1,4 секунды, когда пользователь перебивает. Как перепроектировать runtime?

    latency
  • 91

    GPU vendor поставляет только 320 из 800 законтрактованных accelerators за две недели до launch. Каков ваш план?

    procurementhardware
  • 92

    Managed image vendor недоступен глобально, а self-hosted fallback на 18% хуже по preference и имеет capacity на шесть часов. Какой traffic вы обслужите?

    procurementcapacity
  • 93

    Во время rollback runtime не может загрузить предыдущий adapter format, и 38% tenant generations завершаются ошибкой. Что вы сделаете?

    rollback
  • 94

    Перегенерация dialogue stem для shot 18 инвалидирует 74 несвязанных assets и теряет provenance исходного голоса, из-за чего нужен полный render проекта на шесть часов. Как спроектировать partial regeneration?

    design
  • 95

    Campaign объединяет generated image, licensed music, cloned voice с записанным consent, stock video и human edits. Спроектируйте rights manifest, который должен пережить export в 12 рынков.

    design
  • 96

    Canary на 5% не показывает safety regression, но вредный rare slice встречается лишь раз на 200 000 generations. Можно ли запускаться?

    deployment-strategies
  • 97

    Multimodal release улучшает aggregate score на 4 points, но 2,7% clips превышают лимит lip sync, а video safety misses растут до 1,1%. Задайте release rule, которое не скроет эти сбои.

    aggregation
  • 98

    Mid-level engineer улучшает image sharpness на 11%, но пропускает regression audio-video sync на 280 мс, затронувшую 18% clips. Как вы будете наставлять его после локализации последствий release?

    mentoring
  • 99

    Research ожидает от нового sampler выигрыш 4 preference points, а runtime считает, что он может нарушить p99 SLO в 5 секунд. Как спроектировать decision experiment с достаточной статистической мощностью?

    designsloexperiments
  • 100

    Вам нужно передать активный image-safety incident executive incident lead при смене дежурства. Что содержит хорошая передача?

    incidents