Skip to content

Вопросы на собеседовании: Инженер генеративного ИИ

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Junior.

Смотреть пример резюме: Инженер генеративного ИИ

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

discriminative

Генеративная модель изучает распределение данных, из которого можно получать новые примеры, а дискриминативная модель учится предсказывать метку или границу по входным данным.

  • Диффузионная модель может создать новое изображение, похожее на примеры из обучающего распределения.
  • Дискриминативный классификатор изображений относит готовое изображение к классам, например кошка или собака.
  • Одни и те же обученные представления иногда полезны для обеих задач, но генерация и классификация используют разные цели и выдают разные результаты.

Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат генерацию контента от предсказания и не считает ли любую нейросеть генеративным ИИ.

latent

Латентное представление является компактным обученным описанием данных в пространстве, где модель может менять полезные признаки.

  • Близкие точки латентного пространства часто декодируются в результаты со схожими высокоуровневыми свойствами, хотя это гарантировано не для каждой модели.
  • Латент может сохранять форму и композицию, опуская часть деталей на уровне пикселей.
  • Сэмплинг и редактирование латентов дешевле работы со всеми пикселями, если латентный тензор намного меньше изображения.

Зачем это спрашивают: Сильный ответ связывает латентное пространство с обученными признаками, сжатием и практической генерацией, а не называет его просто скрытыми данными.

Автоэнкодер учится восстанавливать входные данные через энкодер, узкое внутреннее представление и декодер.

  • Энкодер переводит изображение или другой объект в код меньшей размерности.
  • Декодер использует этот код, чтобы восстановить результат, близкий к исходным данным.
  • Функция потерь реконструкции обучает обе части, а узкое место заставляет код сохранять полезную информацию вместо прямого копирования каждого значения.

Зачем это спрашивают: Интервьюер оценивает, понимает ли кандидат энкодер, узкое место, декодер и цель реконструкции как одну систему.

vae

Вариационный автоэнкодер изучает распределение латентного кода для каждого входа, а ELBO при обучении балансирует реконструкцию и регулярность латентного пространства.

  • Энкодер предсказывает параметры, например среднее и дисперсию, а не один фиксированный код.
  • Член реконструкции поощряет латенты, из которых декодер может восстановить входные данные.
  • KL-член удерживает обученное апостериорное распределение рядом с выбранным априорным, обычно стандартным нормальным, чтобы из него можно было сэмплировать новые латенты.
  • ELBO оптимизируют потому, что точное правдоподобие данных содержит практически невычислимый интеграл по возможным латентам.

Зачем это спрашивают: Сильный ответ объясняет оба члена ELBO и пользу нижней границы без полного математического вывода.

reparameterization

Трюк репараметризации делает случайный сэмплинг латента совместимым с обучением по градиенту.

  • Энкодер предсказывает среднее и масштаб, после чего сэмпл записывается как z, равный среднему плюс масштаб, умноженный на случайный эпсилон.
  • Эпсилон берется из фиксированного распределения, поэтому случайность отделена от обучаемых выходов энкодера.
  • Благодаря этому при обратном распространении градиенты проходят через среднее и масштаб в параметры энкодера.

Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат, как этот прием сохраняет случайность и одновременно пропускает градиенты к параметрам энкодера.

generators

В GAN генератор учится создавать синтетические примеры, а дискриминатор учится отличать реальные примеры от сгенерированных.

  • Генератор превращает случайный шум, а иногда и дополнительное условие, в изображение или другой объект.
  • Дискриминатор получает реальные и сгенерированные примеры и решает, настоящие они или поддельные.
  • Обновления двух сетей чередуются, поэтому дискриминатор создает обучаемый сигнал для генератора.

Зачем это спрашивают: Сильный ответ называет вход, выход и роль каждой сети в связанном процессе обучения.

gan-loss

Состязательная функция потерь поощряет дискриминатор за разделение реальных и сгенерированных примеров, а генератор за успешный обман дискриминатора.

  • Две цели образуют игру, а не фиксированную попиксельную цель для генератора.
  • На практике для генератора часто используют несатурирующую функцию потерь, поскольку в начале обучения она дает более сильные градиенты.
  • Если одна сеть становится намного сильнее другой, вторая получает слабые градиенты, поэтому важен баланс частоты обновлений и learning rate.

Зачем это спрашивают: Интервьюер оценивает, понимает ли кандидат конкурирующие цели и причину нестабильности состязательного обучения.

mode-collapse

Коллапс мод возникает, когда генератор выдает лишь узкий набор результатов, хотя реальные данные намного разнообразнее.

  • Я бы сгенерировал много примеров из разных входных шумов при одинаковых настройках и проверил повторы лиц, поз, композиций или текстур.
  • Расстояния в пространстве признаков, кластеризация и метрики покрытия или recall помогают найти низкое разнообразие внутри сгенерированного набора и пропущенные области реального валидационного распределения.
  • Резкие отдельные изображения не исключают коллапс, а поиск ближайших обучающих примеров проверяет запоминание, а не разнообразие генерации.

Зачем это спрашивают: Сильный ответ отличает визуальное качество от покрытия распределения и диагностирует коллапс по разнообразию сгенерированных примеров, а не по сходству с обучающей выборкой.

diffusionconcurrency

Прямой процесс диффузии постепенно добавляет известный шум к чистым обучающим данным, пока они не становятся близкими к случайному шуму.

  • На каждом шаге добавляется небольшая порция гауссовского шума по заранее заданному расписанию.
  • Замкнутая формула позволяет сразу получить зашумленный пример для выбранного шага во время обучения.
  • Прямой процесс фиксирован, а не обучается; он создает пары зашумленных и чистых данных для обучения денойзера.

Зачем это спрашивают: Интервьюер проверяет, знает ли кандидат, что прямая диффузия портит данные известным процессом, а не генерирует их.

diffusion

Обратное удаление шума начинается со случайного шума и многократно использует обученную модель для оценки менее зашумленного примера.

  • Денойзер получает текущий зашумленный латент или изображение вместе с номером шага.
  • Планировщик преобразует предсказание модели в следующий пример по выбранному правилу сэмплинга.
  • Повторение этого пути к нулевому шагу создает структурированный результат из изученного распределения данных.

Зачем это спрашивают: Сильный ответ отделяет предсказание денойзера от шага планировщика, который обновляет пример.

noise-schedule

Расписание шума определяет, сколько сигнала удаляется или сколько шума добавляется на разных шагах диффузии.

  • В зависимости от формулировки и планировщика его выражают через значения beta, alpha или sigma.
  • У ранних и поздних шагов разное отношение сигнала к шуму, поэтому денойзер восстанавливает на них разные виды информации.
  • Расписания обучения и инференса должны быть совместимы, поскольку произвольное расхождение может ухудшить качество.

Зачем это спрашивают: Интервьюер оценивает, связывает ли кандидат расписание с отношением сигнала к шуму, а не считает его простым счетчиком прогресса.

nlpembeddingstimestep

Эмбеддинги шага сообщают денойзеру текущий уровень шума, чтобы он применил подходящее преобразование.

  • Одна и та же сеть видит входы от почти чистых до почти полностью шумовых.
  • Числовой номер шага преобразуется в вектор, часто через синусоидальные признаки и последующие обучаемые слои.
  • Этот вектор обуславливает блоки по всему денойзеру, а не обрабатывается как пиксель изображения.

Зачем это спрашивают: Сильный ответ объясняет, зачем одному общему денойзеру нужен явный сигнал об уровне шума.

При предсказании epsilon модель оценивает шум в текущем примере, а при предсказании x0 напрямую оценивает чистый пример.

  • Зная шаг и расписание, одно предсказание можно математически преобразовать в другое.
  • Параметризация меняет масштаб цели и то, как обучение выделяет разные уровни шума.
  • Планировщик пайплайна должен интерпретировать выход модели в той параметризации, на которой обучен чекпойнт.

Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат эти варианты как альтернативные цели предсказания с согласованной математикой пайплайна.

diffusioncfg

Classifier-free guidance усиливает условие, объединяя условное и безусловное предсказания одного денойзера.

  • Во время обучения условие иногда удаляют, чтобы модель научилась обоим режимам.
  • На инференсе разница между условным и безусловным предсказаниями масштабируется и добавляется к безусловному результату.
  • Высокое значение guidance scale может улучшить следование промпту, но уменьшить разнообразие или создать перенасыщенные артефакты.

Зачем это спрашивают: Сильный ответ описывает и удаление условия при обучении, и компромисс качества при выборе guidance scale.

latencysampling

Большее число шагов сэмплинга обычно линейно повышает задержку, а прирост качества часто выходит на плато после достаточного числа шагов для выбранной модели и планировщика.

  • Каждый шаг обычно требует еще одного запуска денойзера, а это самая дорогая часть генерации изображения.
  • При слишком малом числе шагов композиция и мелкие детали могут остаться недоработанными, если модель не обучена или не дистиллирована для короткого сэмплинга.
  • Я бы сравнивал варианты на фиксированном наборе промптов и сидов, потому что оптимальное число зависит от планировщика и чекпойнта.

Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат измерять компромисс качества и задержки вместо предположения, что больше шагов всегда лучше.

latent-diffusion

Латентная диффузия выполняет удаление шума в сжатом обученном пространстве, а не напрямую в полноразмерных пикселях.

  • Перед обучением диффузии или инференсом с исходным изображением энкодер переводит картинку в меньший пространственный латентный тензор.
  • Денойзер обрабатывает меньше значений, поэтому требует меньше памяти и вычислений по сравнению с пиксельной диффузией.
  • Декодер превращает итоговый чистый латент обратно в изображение, поэтому качество сжатия все равно влияет на результат.

Зачем это спрашивают: Сильный ответ связывает денойзинг в латентном пространстве и с экономией вычислений, и с ограничениями реконструкции.

latent-diffusionci-cd

VAE переводит изображения между пиксельным и латентным пространствами, в котором работает диффузионная модель.

  • Энкодер используется для обучающих изображений и для задач img2img или inpainting, начинающихся с картинки.
  • Декодер превращает итоговый очищенный латент в видимые пиксели.
  • VAE не является основным денойзером, а ошибки реконструкции могут проявиться как сдвиги цвета или потеря мелких деталей даже при успешном денойзинге.

Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат сжатие и реконструкцию от задачи диффузионного удаления шума.

diffusionu-net

U-Net-денойзер преобразует зашумленное изображение или латент в предсказание, нужное для одного обратного шага диффузии.

  • Путь уменьшения разрешения собирает широкий пространственный контекст, а путь увеличения восстанавливает разрешение.
  • Пропускающие соединения переносят локальные детали между соответствующими разрешениями.
  • Условие по шагу и тексту вводится в блоки сети, чтобы предсказание учитывало и уровень шума, и промпт.

Зачем это спрашивают: Сильный ответ связывает многоуровневую структуру U-Net с фактическим выходом денойзера.

cross-attention

Cross-attention позволяет признакам изображения или латента извлекать нужную информацию из текстовых представлений во время денойзинга.

  • Запросы поступают из текущих признаков изображения, а ключи и значения из закодированных токенов промпта.
  • Разные пространственные позиции могут обращать внимание на разные слова, помогая связать объекты и атрибуты с областями.
  • Cross-attention улучшает обусловливание, но не гарантирует правильный счет, привязку атрибутов или компоновку.

Зачем это спрашивают: Интервьюер оценивает, знает ли кандидат, какая модальность дает запросы, а какая передает условие.

ci-cd

Текстовый энкодер преобразует токенизированный промпт в контекстные векторы, которыми обуславливается денойзер изображения.

  • Сначала токенизатор переводит текст в словарь и формат последовательности, ожидаемые этим энкодером.
  • Энкодер представляет каждый токен в контексте, поэтому одно слово может получить разные векторы в разных промптах.
  • Во многих пайплайнах текстовый энкодер остается замороженным при инференсе и большинстве обучений адаптеров, а денойзер использует его выходы.

Зачем это спрашивают: Сильный ответ различает токенизацию, кодирование текста и денойзинг изображения как отдельные этапы пайплайна.

Закрытые вопросы

  • 21

    Что происходит, когда промпт превышает лимит токенов текстового энкодера?

    promptingtokens
  • 22

    Как случайный сид помогает воспроизводимости генерации изображений?

  • 23

    Что такое негативный промпт в диффузионной генерации изображений?

    promptingnegative-prompt
  • 24

    Что контролирует denoising strength в img2img?

  • 25

    Как маска inpainting используется в диффузионном пайплайне?

    inpaintingci-cd
  • 26

    Как outpainting расширяет изображение?

  • 27

    Какую проблему решает ControlNet в диффузионных пайплайнах?

    controlnetci-cd
  • 28

    Что IP-Adapter добавляет в пайплайн text-to-image?

    ip-adapterci-cd
  • 29

    Что такое LoRA для дообучения диффузионной модели изображений?

    fine-tuninglora
  • 30

    Для чего используют DreamBooth?

    dreambooth
  • 31

    Когда стоит выбрать LoRA вместо полного дообучения?

    fine-tuninglora
  • 32

    Что означают концепции base и refiner в SDXL?

  • 33

    Что такое Diffusion Transformer, или DiT?

    nlpdit
  • 34

    В чем основная идея архитектуры MM-DiT для генерации text-to-image?

    mm-dit
  • 35

    Почему временную согласованность сложно обеспечить в генерации text-to-video?

    temporal
  • 36

    Чем ключевые кадры отличаются от интерполяции кадров?

    interpolation
  • 37

    Чем отличаются представления звука в виде волны, спектрограммы и токенов?

    tokensspectrogram
  • 38

    Что такое акустическая модель и вокодер в системе TTS?

    vocodersystem-design
  • 39

    Какие виды условий могут направлять модель генерации музыки?

  • 40

    Что такое мультимодальные эмбеддинги?

    nlpembeddings
  • 41

    Как вычисляется стандартный FID для сгенерированных изображений?

    fid
  • 42

    Каковы основные ограничения Inception Score?

    inception-score
  • 43

    Как оценить композиционную генерацию для счета объектов, пространственных отношений и привязки атрибутов?

    bindingdecision-makingoop
  • 44

    Как провести парную человеческую оценку двух моделей изображений?

    llm-eval
  • 45

    Какую роль классификатор безопасности играет в генеративном пайплайне?

    safety-classifierci-cd
  • 46

    Чем водяной знак отличается от метаданных происхождения сгенерированного контента?

    watermarkprovenance
  • 47

    Что означает fp16 для инференса генеративной модели и является ли это целочисленной квантизацией?

    model-compressionprecisionquantization
  • 48

    Как размер батча влияет на пропускную способность и стоимость генерации одного объекта?

    throughputbatch
  • 49

    Из каких основных компонентов состоит text-to-image пайплайн Hugging Face diffusers?

    ci-cddiffuserscomponents
  • 50

    Как безопасно передать и запустить workflow ComfyUI со скачанными файлами моделей?

    comfyui
  • 51

    Пользователь запрашивает баннер 16:9, но пайплайн генерации возвращает квадратное изображение. Как вы будете искать ошибку?

    ci-cd
  • 52

    Один и тот же video prompt с одинаковым seed создаёт на двух компьютерах клипы с разным движением и временем воспроизведения. Что вы зафиксируете для воспроизводимости?

    prompting
  • 53

    В SDXL prompt обязательный объект находится ближе к концу, но никогда не появляется. Как вы проверите оба текстовых энкодера?

    prompting
  • 54

    После повышения CFG с 7 до 20 изображения становятся перенасыщенными и получают жёсткие края. Что вы сделаете?

  • 55

    Четырёхшаговый preview изображения выглядит приемлемо в целом, но часто портит маленькие лица и логотипы. Как определить, где такой preview безопасен?

  • 56

    Редактор изображений по инструкции меняет синюю куртку на красную, но также изменяет лицо человека и комнату. Как улучшить локальность правки?

  • 57

    Вокруг маски на отредактированном через inpainting рукаве виден шов. Как его уменьшить?

  • 58

    Пайплайн ControlNet получает карту границ Canny, но создаёт бессвязную структуру с checkpoint ControlNet для глубины. В чём ошибка?

    controlnetci-cd
  • 59

    С включённым референсом IP-Adapter каждый результат копирует его композицию и почти не следует текстовому prompt. Как восстановить баланс?

    promptingip-adapteroop
  • 60

    Портретный LoRA воспроизводит одну и ту же одежду и фон почти в каждом prompt. Как исправить переобучение?

    promptingfine-tuninglora
  • 61

    У вас есть одно утверждённое изображение персонажа, но в анимации через несколько секунд теряются лицо и одежда. Как последовательно перенести персонажа в видео?

  • 62

    В датасете для fine-tune text-to-image много пустых подписей и подписей с неверными объектами. Что вы сделаете до обучения?

    fine-tuning
  • 63

    Fine-tuning падает на середине из-за нескольких повреждённых скачанных изображений. Как предотвратить ещё один потерянный запуск?

    fine-tuning
  • 64

    Обучение LoRA стабильно в fp32, но loss становится NaN в mixed precision. Как вы найдёте причину?

    fine-tuninglora
  • 65

    Задача SDXL помещается в память при 1024 на 1024 и batch size 1, но падает с OOM при 1536 на 1536, batch size 2 и с ControlNet. Как уместить её?

    controlnetbatch
  • 66

    Сгенерированные изображения получают зелёный оттенок только после декодирования latent. Как вы проверите VAE?

  • 67

    Коллега заменил diffusion scheduler, и тот же prompt с тем же seed теперь создаёт другое изображение. Это ошибка?

    prompting
  • 68

    Фильтр модерации блокирует безопасные анатомические рисунки как NSFW. Как вы обработаете этот false positive?

  • 69

    Тестовое изображение red team проходит модерацию, хотя явно нарушает политику продукта. Что вы сделаете с этим false negative?

  • 70

    Невидимый watermark определяется на исходном изображении, но исчезает после повторного сжатия социальной сетью. Что вы измените?

    watermark
  • 71

    Генератор портретов хорошо сохраняет референс на фронтальных студийных фото, но ошибается на боковых позах, при слабом свете и с некоторой культурной одеждой. Как вы его оцените?

    llm-evaldecision-makinggenerators
  • 72

    Модель получает высокий CLIPScore, вписывая слова из prompt прямо в изображение. Как оценить её честнее?

    promptingdecision-makingllm-eval
  • 73

    Два ревьюера часто расходятся при сравнении результатов image-моделей A и B. Как улучшить попарную оценку?

    llm-evalconflict
  • 74

    Сгенерированное изображение для кампании почти совпадает с одним обучающим изображением. Как вы проверите возможное запоминание?

  • 75

    Сгенерированное аудио звучит искажённо, а у waveform плоские пики на максимальном уровне. Как исправить clipping?

  • 76

    TTS-голос постоянно неверно произносит название продукта Qlora. Как вы исправите и проверите произношение?

  • 77

    Клиент загружает интервью знаменитости и просит приложение клонировать этот голос. Что должен сделать пайплайн?

    ci-cd
  • 78

    Запрос MusicGen требует 20 секунд, но melody-conditioning длится только 5 секунд, и концовка становится несвязанной. Как обработать несовпадение длительности?

  • 79

    Сгенерированное видео хорошо выглядит покадрово, но при воспроизведении яркость и текстура мерцают. Как вы найдёте причину?

  • 80

    После экспорта барабанный стем в сгенерированной музыке звучит на 180 мс раньше стема мелодии. Как вы найдёте и исправите причину?

  • 81

    Сгенерированный клип 24 fps после экспорта воспроизводится слишком быстро, а аудио заканчивается позже видео. Что вы проверите?

  • 82

    Общий workflow ComfyUI открывается с красными неизвестными узлами на новом компьютере. Как его запустить?

    comfyui
  • 83

    Пайплайн diffusers работал вчера, но после обновления библиотеки загрузка той же модели падает. Как устранить несовпадение ревизий?

    ci-cddiffusers
  • 84

    Пользователь просит учебник, где текст и сгенерированные изображения чередуются в одном ответе. Когда выбрать interleaved multimodal output, а когда отдельные вызовы текста и изображений?

  • 85

    Первый запрос изображения к Modal-эндпоинту занимает 35 секунд, а прогретые запросы занимают 4 секунды. Как уменьшить cold start?

    endpoints
  • 86

    Replicate повторяет webhook о завершении, и сервис создаёт три копии одного результата. Как сделать обработчик безопасным?

    replicationwebhooks
  • 87

    Batch создал 800 пригодных изображений за двухчасовой запуск на GPU стоимостью $1.60 в час. Как рассчитать стоимость одного изображения?

    batchhardware
  • 88

    Пропускная способность GPU растёт при batch из восьми запросов, но интерактивные пользователи слишком долго ждут его заполнения. Что вы измените?

    throughputhardwarebatch
  • 89

    Модель сообщает о четырёх секундах inference, но пользователи получают изображения через семь секунд. Как измерить недостающую задержку?

    inferencelatency
  • 90

    Дизайнер хочет воссоздать утверждённое изображение через месяц. Какие данные происхождения генерации вы сохраните?

    design
  • 91

    В запрос на проверку креатива загружено 28 референсов, но мультимодальная модель принимает не больше 20 изображений. Как это обработать?

  • 92

    Сгенерированная подпись утверждает, что человек держит телефон, хотя телефона не видно. Как уменьшить такую галлюцинацию?

    hallucination
  • 93

    Пайплайн image-to-3D получает фото стула спереди, сбоку и сзади, но на одном виде ножки отличаются, и mesh искажается. Как обработать расхождение видов?

    conflictci-cd
  • 94

    Видео с говорящим человеком начинается синхронно, но ближе к концу губы заметно отстают от речи. Как обнаружить и локализовать drift?

    iac
  • 95

    Нужно переводить звонок поддержки в реальном времени, сохраняя тон говорящего. Как выбрать между speech-to-speech и каскадом ASR, перевода и TTS?

  • 96

    Загруженное изображение mood board содержит мелкий текст с приказом игнорировать пользователя и опубликовать приватные активы. Как защититься?

  • 97

    Генератор кампании начинает с французского минималистичного стиля, но позже выдаёт английский текст с игривым тоном. Как предотвратить дрейф?

    iacgenerators
  • 98

    Видеомодератор проверяет один кадр каждые десять секунд и пропускает односекундный опасный фрагмент между выборками. Как улучшить пайплайн?

    ci-cd
  • 99

    Debug logs эндпоинта генерации изображений содержат полные пользовательские prompt и загруженные портреты. Что вы измените?

    promptingendpoints
  • 100

    Как вы расскажете о созданном вами проекте генерации изображений с учётом качества, задержки и стоимости?

    latency