Skip to content

Вопросы на собеседовании: Инженер генеративного ИИ

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.

Смотреть пример резюме: Инженер генеративного ИИ

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

Они по-разному параметризуют одну задачу денойзинга, но перераспределяют масштаб цели и ошибки между уровнями шума.

  • Epsilon prediction оценивает добавленный шум и просто реализуется, однако его фактический акцент может быть неравномерным при очень высоком и низком отношении сигнала к шуму.
  • x0 prediction напрямую оценивает чистый образец, что может помогать реконструкции, но становится численно сложным, когда во входе почти один шум.
  • v prediction объединяет компоненты чистого образца и шума, поэтому дисперсия цели лучше сбалансирована на распространённых расписаниях, но scheduler и преобразование при инференсе должны соответствовать чекпойнту.

Зачем это спрашивают: Интервьюер проверяет, связывает ли кандидат параметризацию предсказания с уровнями шума и совместимостью scheduler.

min-snr

SNR-based weighting управляет вкладом каждого уровня шума, чтобы простые таймстепы или таймстепы с целевыми значениями большой величины не доминировали в обновлении.

  • Отношение сигнала к шуму показывает, похож ли таймстеп больше на реконструкцию или на предсказание шума при выбранном расписании.
  • Min-SNR weighting ограничивает влияние, вычисленное из SNR, и уменьшает конфликт между градиентами от сильно различающихся таймстепов.
  • Формула зависит от epsilon, x0 или v prediction, поэтому я проверю реализацию и сравню сходимость и качество соответствия промпту, а не буду вслепую копировать одно значение gamma.

Зачем это спрашивают: Сильный ответ объясняет оптимизационную проблему и зависимость формулы weighting от параметризации.

sampling

DDPM следует стохастической обратной марковской цепи, а DDIM может использовать детерминированную немарковскую траекторию для той же обученной модели.

  • DDPM добавляет дисперсию на обратных шагах, поэтому повторные запуски могут расходиться даже из связанных промежуточных состояний.
  • DDIM предоставляет параметр наподобие eta, где ноль даёт детерминированный путь для фиксированного начального латента, а большие значения возвращают стохастичность.
  • DDIM часто достигает приемлемого качества за меньшее число шагов, но скорость и качество всё равно зависят от чекпойнта, размещения таймстепов и реализации.

Зачем это спрашивают: Интервьюер оценивает, отличает ли кандидат цель обучения от выбранного семплера обратного процесса.

Я сравню их на конкретной модели, расписании, бюджете шагов, диапазоне guidance и целевом распределении промптов, потому что рейтинг семплеров ненадёжно переносится между условиями.

  • Методы Euler просты и могут давать сильный результат при умеренном числе шагов, а ancestral-варианты намеренно добавляют шум и повышают разнообразие между запусками.
  • Семейства DPM-Solver и DPM++ используют формулы более высокого порядка или предсказание данных, что бывает эффективно, но история multistep и выбор расписания влияют на стабильность при малом числе шагов.
  • Я зафиксирую промпты, seeds и число результатов на промпт, а затем измерю latency, частоту ошибок, preference wins и разнообразие на нескольких бюджетах шагов.

Зачем это спрашивают: Сильный ответ рассматривает выбор семплера как контролируемую проверку на конкретной модели, а не как набор слухов.

Они уменьшают артефакты от применения одного большого classifier-free guidance scale на всём процессе денойзинга.

  • Высокий CFG может улучшать соответствие промпту, но перенасыщать цвета, сокращать разнообразие или уводить образец за пределы обученного распределения модели.
  • CFG rescale приближает величину guided prediction к статистикам conditional prediction, ограничивая чрезмерный контраст без полного отказа от guidance.
  • Динамические расписания меняют guidance по таймстепам, часто ослабляя его там, где conditioning мало помогает, и требуют настройки по соответствию промпту и срезам визуального качества.

Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат уменьшать over-guidance, сохраняя силу conditioning.

flow-matching

Flow matching обучает зависящее от времени поле скоростей, которое переносит образцы между распределениями шума и данных, вместо прямой оптимизации denoising score objective.

  • Цель обучения получается из выбранного вероятностного пути и его условной скорости, причём прямая интерполяция часто служит простым вариантом пути.
  • Rectified flow является flow matching на прямой интерполяции между связанными образцами источника и данных; выученная marginal ODE не обязана быть прямой, тогда как reflow может постепенно выпрямлять её coupling и уменьшать ошибку интегрирования.
  • Путь, параметризация, связь данных с шумом и ODE solver всё равно определяют результат, поэтому одно название метода не гарантирует одноступенчатую генерацию.

Зачем это спрашивают: Сильный ответ объясняет обучаемое поле скоростей и не приравнивает rectified flow к гарантированному успеху на малом числе шагов.

system-design

Латентный автоэнкодер переносит денойзинг в меньшее пространственное и канальное представление, снижая стоимость attention и свёрток по сравнению с диффузией в пикселях.

  • Энкодер сжимает изображение в латенты, а декодер восстанавливает пиксели после семплирования, поэтому коэффициент уменьшения разрешения во многом задаёт экономию вычислений.
  • Агрессивное сжатие может удалить мелкий текст, лица, текстуры или высокочастотные детали ещё до того, как их увидит диффузионная модель.
  • Я отдельно оценю реконструкцию и генерацию, потому что артефакты декодера и ошибки масштаба латентов нельзя исправить сменой семплера.

Зачем это спрашивают: Интервьюер оценивает, понимает ли кандидат границу эффективности и потолок качества автоэнкодера.

DiT применяет transformer blocks к патчам латентного изображения, поэтому генеративную ёмкость удобно увеличивать через глубину, ширину, число токенов и объём вычислений.

  • Разбиение латентов на патчи превращает пространственную генерацию в последовательность токенов, а timestep и class или text conditioning модулируют transformer blocks.
  • Масштабирование трансформеров использует зрелые attention kernels и инфраструктуру параллельного обучения, но число токенов всё равно быстро растёт с разрешением.
  • Одних параметров или FLOPs недостаточно, поэтому я сопоставлю качество с вычислениями обучения, масштабом данных, качеством автоэнкодера и стоимостью инференса.

Зачем это спрашивают: Сильный ответ связывает архитектуру DiT с практическим масштабированием, не забывая об ограничениях разрешения и данных.

mm-dit

MM-DiT позволяет текстовым токенам и токенам латентного изображения участвовать в совместном attention, сохраняя при этом специфичные для модальностей представления или проекции.

  • Текстовый и визуальный потоки могут использовать отдельные веса для частей блока, а затем обмениваться информацией через общую операцию attention.
  • В отличие от одностороннего cross-attention, joint attention позволяет токенам изображения влиять на состояния текстовых токенов и одновременно получать текстовый conditioning.
  • Длина последовательности, masking, positional encoding и баланс модальностей становятся ограничениями дизайна, потому что оба набора токенов используют одни и те же вычисления attention.

Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат joint attention в MM-DiT от обычного text-to-image cross-attention.

lcmconsistencymodel-compression

LCM distillation обучает student отображать точки диффузионной траектории к согласованному чистому результату, поэтому при инференсе можно пропустить большинство шагов teacher.

  • Обучение использует переходы от teacher или траекторию probability flow и требует согласованности между правильно сопоставленными зашумлёнными состояниями.
  • Граничное условие фиксирует consistency function около конечной точки данных и не даёт выучить произвольное тривиальное отображение.
  • На практике возможны один-восемь шагов, но сохранение качества зависит от guidance distillation, совместимости scheduler и покрытия распределения промптов.

Зачем это спрашивают: Сильный ответ объясняет consistency objective, а не описывает LCM как обычную квантизацию чекпойнта.

model-compression

Progressive distillation последовательно вдвое сокращает нужное число шагов денойзинга, а adversarial distillation может обучать student для очень малого числа шагов через discriminator или выученный сигнал реалистичности.

  • Progressive-этапы дают контролируемый путь от teacher к student, но после нескольких раундов ошибки могут накапливаться, а каждый этап требует дополнительного обучения.
  • Adversarial objective повышает воспринимаемую резкость на одном или нескольких шагах, но может сокращать разнообразие и приносить нестабильность или артефакты, характерные для GAN.
  • Я сравню соответствие промпту, разнообразие, ошибки на редких концептах и latency при точном числе шагов из production, а не только FID.

Зачем это спрашивают: Интервьюер оценивает, различает ли кандидат механизмы дистилляции и их типичные отказы.

diffusioncontrolnet

ControlNet обучает параллельную conditioning-ветку из копии backbone и вводит её признаки в почти замороженный денойзер.

  • Карта позы, границ, глубины или сегментации поступает в control-ветку на соответствующих пространственных разрешениях.
  • Соединения с нулевой инициализацией начинают с почти нулевых добавочных residuals, сохраняя поведение предобученной модели в начале обучения.
  • Силу контроля и начальные или конечные таймстепы нужно настраивать, потому что слишком сильные residuals могут подавить текстовый conditioning или воспроизвести шум детектора.

Зачем это спрашивают: Сильный ответ называет обучаемую копию, residual path с нулевой инициализацией и практическое расписание контроля.

ip-adapter

IP-Adapter кодирует референсное изображение в отдельные conditioning tokens и вводит их через дополнительные attention paths рядом с текстовым conditioning.

  • Визуальный энкодер и projection network преобразуют референс в токены, совместимые с размерностями attention денойзера.
  • Отдельные веса image cross-attention позволяют оставить базовый текстовый путь замороженным и сохранить небольшой размер адаптера.
  • Масштаб адаптера балансирует перенос идентичности или стиля и соответствие промпту, а варианты для лица или композиции требуют подходящих оценочных данных.

Зачем это спрашивают: Интервьюер проверяет понимание разделённого механизма image attention и его основного регулятора.

controlnetip-adapter

Адаптеры могут конкурировать за одну ёмкость attention или residual, поэтому хорошие по отдельности настройки иногда ломаются при суммировании эффектов.

  • Сильный ControlNet может зафиксировать геометрию, пока IP-Adapter навязывает композицию референса, что приводит к искажённым объектам или игнорированию текста.
  • Масштабы, окна таймстепов, места инъекции и normalization различаются между адаптерами, поэтому композицию нужно настраивать совместной сеткой, а не изолированно.
  • Я проверю каждую поддерживаемую комбинацию и порядок на конфликтных промптах, затем ограничу несовместимые пары или направлю их в специализированный pipeline.

Зачем это спрашивают: Сильный ответ рассматривает композицию адаптеров как взаимодействующие вмешательства, а не независимые ползунки.

fine-tuninglora

Rank задаёт ёмкость обновления, alpha масштабирует low-rank update, а target modules определяют, в каких местах эта ёмкость может менять модель.

  • Более высокий rank способен представить более сложные изменения, но увеличивает число обучаемых параметров, память optimizer, размер файла и риск переобучения.
  • Во многих реализациях эффективный масштаб связан с alpha, делённой на rank, поэтому смена rank без проверки scaling меняет поведение оптимизации.
  • Проекции cross-attention часто служат целями, а добавление self-attention, feed-forward, свёрточных или text-encoder modules должно отвечать измеренному пробелу в способности модели.

Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат настраивать LoRA-stack глубже выбора готового rank.

Я объединю проверенную фиксированную комбинацию для более простого и быстрого serving, но сохраню runtime composition, если пользователям нужен независимый выбор и масштабирование адаптеров.

  • Merge убирает накладные расходы переключения адаптеров и упрощает export, однако итоговые веса привязаны к одному базовому чекпойнту и набору коэффициентов.
  • Runtime composition сохраняет обратимость и масштабы на каждый запрос, но дополнительные чтения адаптеров или kernels расходуют пропускную способность памяти и усложняют batching.
  • Несколько обновлений не обязаны складываться без конфликтов, поэтому оба пути требуют конфликтных промптов и регрессионных проверок до deployment.

Зачем это спрашивают: Сильный ответ связывает стратегию композиции LoRA с гибкостью serving, batching и взаимным влиянием адаптеров.

dreambooth

Prior preservation смешивает примеры конкретного объекта с примерами класса, чтобы обучение субъекта не стянуло весь класс к этому субъекту.

  • Instance loss учит редкий идентификатор воспроизводить нужного человека или объект по небольшому датасету.
  • Class images и class prompt задают prior loss, который препятствует language drift и потере разнообразия для обычных промптов класса.
  • Вес loss, качество class images, дубликаты и покрытие субъекта требуют настройки, потому что чрезмерный prior может ослабить обучение идентичности.

Зачем это спрашивают: Интервьюер проверяет понимание цели регуляризации и её практического баланса.

Настройка text encoder может сильнее связать новую концепцию с токеном, но также способна исказить языковое пространство для всех остальных промптов.

  • При малом числе подписей token embeddings могут впитать корреляции с фоном, позой или стилем и вызвать утечку признаков в другие промпты.
  • Обновление большого text encoder требует больше памяти optimizer и может переобучиться быстрее денойзера, особенно при агрессивном learning rate.
  • Я начну с замороженного энкодера и проверю частичное обновление с меньшей скоростью только при слабой привязке идентификатора, добавив регрессии на общих и композиционных промптах.

Зачем это спрашивают: Сильный ответ рассматривает tuning text encoder как глобальное семантическое изменение, а не бесплатную дополнительную ёмкость.

fine-tuning

Я буду отбирать данные по точности соответствия изображения и текста, покрытию нужной вариативности и отсутствию shortcuts, которые модель может запомнить.

  • Нужно удалить точные и близкие дубликаты, повреждённые или слишком маленькие файлы и сбалансировать объекты, стили, позы, фоны и сложные случаи.
  • Подписи должны называть признаки, которыми модель должна управлять, но не приписывать невидимые детали и не повторять один шаблон для каждого изображения.
  • Я версионирую права источника, правила фильтрации, captioner и ручные правки, а затем проверю стратифицированные выборки вместо доверия одним автоматическим оценкам.

Зачем это спрашивают: Интервьюер оценивает, рассматривает ли кандидат подписи как обучающий сигнал и данные с provenance.

generators

Aspect-ratio bucketing группирует изображения похожей формы в батчи, чтобы resizing меньше обрезал контент, а padding меньше тратил вычисления.

  • Каждый bucket использует размеры, совместимые со stride автоэнкодера и патчей, одновременно ограничивая бюджет пикселей или токенов.
  • Семплирование только по исходной частоте датасета может переоценить распространённые формы, поэтому вероятности buckets иногда нужно балансировать.
  • Слишком много buckets дробят батчи и снижают throughput, а слишком мало вынуждают обрезать или искажать изображения, поэтому я буду вместе профилировать utilization и качество композиции.

Зачем это спрашивают: Сильный ответ связывает bucketing с сохранением данных и эффективным batching.

Закрытые вопросы

  • 21

    Зачем поддерживать EMA весов генеративной модели?

  • 22

    Как mixed precision и loss scaling предотвращают сбои при обучении диффузионной модели?

    scaling
  • 23

    Как gradient checkpointing и gradient accumulation решают разные ограничения памяти?

    memorycheckpointing
  • 24

    Как распределить обучение большого diffusion transformer?

    nlpdit
  • 25

    Что добавляет temporal attention в модель генерации видео?

    temporal-attention
  • 26

    Зачем разделять пространственное и временное моделирование при генерации видео?

  • 27

    Как добавить conditioning по движению камеры в генератор видео?

    generators
  • 28

    Какую роль neural audio codec играет в генеративных аудиосистемах?

    system-designaudio-codec
  • 29

    Как выбирать между autoregressive audio tokens и diffusion-based генерацией аудио?

    tokens
  • 30

    Что делает diffusion vocoder в речевом pipeline?

    vocoderci-cd
  • 31

    Как разделить идентичность говорящего и стиль речи в TTS?

  • 32

    Как стабилизировать обучение GAN для генеративного компонента?

    components
  • 33

    Что такое posterior collapse в VAE и как его обнаружить?

  • 34

    Каковы ограничения FID, связанные с covariance и размером выборки?

    fid
  • 35

    Когда KID полезен по сравнению с FID?

    fid
  • 36

    Что означают precision и recall для генеративных распределений?

    evaluationdistributions
  • 37

    Как построить region-grounded VLM evaluator для дефектов сгенерированных изображений?

    groundednessdefectsllm-eval
  • 38

    Как оценивать временное качество сгенерированного видео?

    llm-evaldecision-making
  • 39

    Как провести исследование audio MOS или listener panel?

  • 40

    Как aesthetic или reward model может внести bias в генеративный pipeline?

    ci-cd
  • 41

    Как применить preference optimization к генерации изображений или аудио?

    optimization
  • 42

    Как определить safety evaluation slices для мультимодального генератора?

    llm-evalgenerators
  • 43

    Что доказывают C2PA assertions и Content Credentials?

    c2pa
  • 44

    Что должно входить в надёжную threat model для watermark?

    threat-modelingwatermark
  • 45

    Как отслеживать права и provenance обучающих данных?

  • 46

    Как спроектировать cross-modality eval harness?

    llm-evaldesign
  • 47

    Как построить per-asset cost model для генеративного сервиса?

  • 48

    При каких условиях FP8 inference действительно ускоряет генеративный runtime?

    inference
  • 49

    Чем Triton language kernels отличаются от NVIDIA Triton Inference Server?

    inferencetriton-server
  • 50

    Как спроектировать multimodal model router между vendor APIs и self-hosted runtimes?

    procurementdesignapi
  • 51

    После включения min-SNR weighting с gamma 5 общий loss image diffusion fine-tune улучшается, но тёмные сцены деградируют. Как вы будете искать причину?

    fine-tuningmin-snr
  • 52

    Diffusion checkpoint, обученный с v-prediction, случайно загружен в pipeline с epsilon-prediction. Какие симптомы и проверки вы ожидаете?

    ci-cd
  • 53

    Pipeline diffusers обучался с 1 000 noise steps, но inference использует конфигурацию scheduler от другой модели. Изображения ухудшаются только при 20 шагах. Как вы проведёте расследование?

    configci-cddiffusers
  • 54

    Image model рисует красное кожаное кресло рядом с синим бархатным пуфом, но часто меняет их цвета или материалы местами. Как оценить attribute binding?

    bindingdecision-makingllm-eval
  • 55

    После замены VAE в SDXL pipeline изображения стали малоконтрастными. Как обнаружить несовпадение latent scaling factor?

    a11yscalingci-cd
  • 56

    VAE tiling позволяет генерировать 4K, но оставляет видимые швы каждые 512 пикселей. Как вы это исправите?

  • 57

    Multi-aspect image model хорошо строит квадратные изображения, но плохо портретные, хотя портреты составляют 35 процентов датасета. Как вы проверите aspect-bucket sampler?

  • 58

    Caption dropout задан как 10 процентов, но модель начинает почти полностью игнорировать текст. Как вы найдёте ошибку?

    experiments
  • 59

    Instruction-based image editor по запросу делает кружку матово-чёрной, но также меняет стол, логотип и освещение. Как его оценить?

    llm-evaldecision-making
  • 60

    LoRA training сходится, но сохранённый adapter почти не влияет на изображение. Вы подозреваете, что он подключён не к тем модулям. Как это подтвердить?

    fine-tuninglora
  • 61

    Product generator создаёт turntable из 24 видов, но ручки, швы и пропорции меняются между ракурсами. Как измерить geometry consistency?

    consistencygeneratorsiac
  • 62

    Material generator создаёт убедительные product renders, но экспортирует запечённые textures, которые художники не могут редактировать. Как сгенерировать и проверить пригодный PBR material?

    validationgenerators
  • 63

    LCM-distilled image student достигает целевой задержки на четырёх шагах, но теряет читаемые вывески, которые правильно рисует teacher. Как восстановить текст?

    latency
  • 64

    Distilled diffusion student расходится, хотя teacher стабилен; pipelines используют разные параметризации scheduler. Как вы найдёте ошибку?

    ci-cd
  • 65

    При diffusion fine-tune в fp16 gradients ранних слоёв становятся нулевыми, тогда как fp32 стабилен. Как вы устраните underflow?

    fine-tuningprecision
  • 66

    Нужен product editor на 1024 pixels, который сохраняет логотипы, поддерживает masked changes и возвращает интерактивный preview за две секунды. Как выбрать между autoregressive visual tokens, masked-token generation, diffusion и flow?

    tokens
  • 67

    Gradient checkpointing снижает расход памяти на 30 процентов, но замедляет обучение на 55 процентов, больше ожидаемого. Что вы будете профилировать?

    memorycheckpointing
  • 68

    Distributed video training зависает каждые несколько сотен шагов на clips с разным числом frames. Как вы локализуете несовпадение collective operations?

    distributed
  • 69

    Восемь A100 загружены в среднем лишь на 35 процентов при video training, а CPU полностью занят. Как подтвердить и исправить decode bottleneck?

    tracking
  • 70

    Latent cache ускоряет обучение, но после частичной пересборки случайные samples декодируются как цветной шум. Как найти и восстановить повреждённые записи?

    caching
  • 71

    Video diffusion на 24 frames помещается в 80 GB GPU до начала temporal attention, после чего возникает OOM. Что вы измените сначала?

    temporal-attentionhardware
  • 72

    У сгенерированного персонажа сохраняется одежда, но лицо меняется после 20-го frame. Как вы исследуете frame identity drift?

    iac
  • 73

    Text-to-video model строит нужную сцену, но игнорирует prompts вроде slow dolly in или pan left. Как вы исследуете camera-motion conditioning?

    prompting
  • 74

    Audio generator обучен с 50 codec tokens в секунду, а serving decoder ожидает 75. Какой сбой вы ожидаете и как его исправите?

    tokensgeneratorsmodel-serving
  • 75

    Multi-speaker TTS model иногда даёт speaker A акцент и тембр speaker B. Как вы исследуете speaker leakage?

    leakage
  • 76

    Neural TTS system разборчив, но даёт металлический звон на фрикативных звуках. Как определить, виноват ли vocoder?

    vocodersystem-design
  • 77

    В GAN training accuracy discriminator держится около 99 процентов, а generator samples перестают улучшаться. Что вы измените?

    generators
  • 78

    У generated video длительностью 30 секунд правдоподобный звук, но dialogue, Foley, ambience и music cues смещаются относительно shots. Как их синхронизировать и оценить?

    llm-evaldecision-makingiac
  • 79

    Новый image checkpoint улучшает FID с 18 до 14, но люди предпочитают его только в 42 процентах сравнений. Как решить, выпускать ли его?

    fid
  • 80

    У model A KID 0.012, а у model B 0.010 на 2 000 изображений. Как понять, что B действительно лучше?

  • 81

    Оптимизация image model по CLIP score приводит к буквальным текстовым надписям и повторам объектов из prompt. Как обработать reward hacking?

    promptingoptimization
  • 82

    Listener panel явно предпочитает новую music model, но её outputs в среднем на 4 LUFS громче baseline. Как убрать loudness bias?

  • 83

    NSFW classifier с recall 94 процента на фотографиях пропускает unsafe anime generations. Как вы отреагируете на domain shift?

  • 84

    Как выбрать NSFW thresholds для детского конструктора аватаров и взрослого творческого инструмента, работающих в шести locales?

    thresholding
  • 85

    Слушатели предпочитают music model на 12-секундных clips, но её четырёхминутные песни теряют направление, повторяют sections и резко заканчиваются. Как оценить long-form structure?

    llm-evaldecision-makingforms
  • 86

    Сгенерированные музыкальные stems приемлемо звучат по отдельности, но в суммарном mix возникают фазовое подавление, clipping и проникновение звука между stems. Как найти и исправить причины?

    resilience
  • 87

    Pipeline хранит provenance внутри, но внешний upscaling vendor возвращает только URL без signed transformation claim. Что вы сделаете?

    procurementci-cd
  • 88

    Правообладатель находит 600 неразрешённых изображений в training corpus из 20 миллионов assets уже после обучения модели. Какой процесс удаления вы реализуете?

    concurrency
  • 89

    Multimodal release улучшает aggregate quality score на 6 процентов, но пользователи audio сразу жалуются. Как изменить представление evaluation?

    llm-evalaggregation
  • 90

    Спроектируйте low-latency speech-to-speech assistant с p95 до первого audio ниже 600 ms, barge-in, сохранением разрешённой speaker identity и запрошенной emotion.

    latencydesign
  • 91

    Custom Triton kernel на 22 процента быстрее PyTorch attention, но меняет цвета изображения на длинных prompts. Как найти numeric mismatch?

    promptingpytorch
  • 92

    Dynamic batching в Triton Inference Server увеличивает GPU throughput на 35 процентов, но удваивает p95 latency интерактивных video jobs. Как настроить serving?

    latencythroughputhardware
  • 93

    В generated product story длительностью 60 секунд и восемь shots между сценами меняются actor, состояние props и screen direction. Как поддерживать story state?

  • 94

    Реконструкция 3D Gaussian Splatting хорошо выглядит с training cameras, но на held-out views появляются floaters и дыры. Как найти причину и улучшить результат?

    splatting
  • 95

    Managed image API меняет safety policy и начинает возвращать размытые outputs для разрешённых вашим продуктом prompts. Как локализовать изменение?

    promptingapi
  • 96

    Один campaign request должен создать hero image, voiceover, music и 20-секундное video с согласованными cues. Как его маршрутизировать и оркестрировать?

    orchestration
  • 97

    Как провести canary нового image checkpoint, если generation стохастична, а unpaired traffic даёт много шума?

    deployment-strategies
  • 98

    После смены LoRA styles пользователи получают старый по виду generated asset, потому что cache key не содержит adapter. Как исправить cache contract?

    fine-tuningloracaching
  • 99

    Streaming TTS продолжает генерацию и начисление платы ещё 30 секунд после barge-in или отмены пользователем. Как остановить лишнюю работу?

    streamingresilience
  • 100

    У вас одна неделя на release, который на 8 процентов ниже quality target и на 40 процентов выше cost. Как выбрать между двумя исправлениями?