Вопросы на собеседовании: Инженер генеративного ИИ
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Junior.
Смотреть пример резюме: Инженер генеративного ИИ →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Генеративная модель изучает распределение данных, из которого можно получать новые примеры, а дискриминативная модель учится предсказывать метку или границу по входным данным.
- Диффузионная модель может создать новое изображение, похожее на примеры из обучающего распределения.
- Дискриминативный классификатор изображений относит готовое изображение к классам, например кошка или собака.
- Одни и те же обученные представления иногда полезны для обеих задач, но генерация и классификация используют разные цели и выдают разные результаты.
Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат генерацию контента от предсказания и не считает ли любую нейросеть генеративным ИИ.
Латентное представление является компактным обученным описанием данных в пространстве, где модель может менять полезные признаки.
- Близкие точки латентного пространства часто декодируются в результаты со схожими высокоуровневыми свойствами, хотя это гарантировано не для каждой модели.
- Латент может сохранять форму и композицию, опуская часть деталей на уровне пикселей.
- Сэмплинг и редактирование латентов дешевле работы со всеми пикселями, если латентный тензор намного меньше изображения.
Зачем это спрашивают: Сильный ответ связывает латентное пространство с обученными признаками, сжатием и практической генерацией, а не называет его просто скрытыми данными.
Автоэнкодер учится восстанавливать входные данные через энкодер, узкое внутреннее представление и декодер.
- Энкодер переводит изображение или другой объект в код меньшей размерности.
- Декодер использует этот код, чтобы восстановить результат, близкий к исходным данным.
- Функция потерь реконструкции обучает обе части, а узкое место заставляет код сохранять полезную информацию вместо прямого копирования каждого значения.
Зачем это спрашивают: Интервьюер оценивает, понимает ли кандидат энкодер, узкое место, декодер и цель реконструкции как одну систему.
Вариационный автоэнкодер изучает распределение латентного кода для каждого входа, а ELBO при обучении балансирует реконструкцию и регулярность латентного пространства.
- Энкодер предсказывает параметры, например среднее и дисперсию, а не один фиксированный код.
- Член реконструкции поощряет латенты, из которых декодер может восстановить входные данные.
- KL-член удерживает обученное апостериорное распределение рядом с выбранным априорным, обычно стандартным нормальным, чтобы из него можно было сэмплировать новые латенты.
- ELBO оптимизируют потому, что точное правдоподобие данных содержит практически невычислимый интеграл по возможным латентам.
Зачем это спрашивают: Сильный ответ объясняет оба члена ELBO и пользу нижней границы без полного математического вывода.
Трюк репараметризации делает случайный сэмплинг латента совместимым с обучением по градиенту.
- Энкодер предсказывает среднее и масштаб, после чего сэмпл записывается как z, равный среднему плюс масштаб, умноженный на случайный эпсилон.
- Эпсилон берется из фиксированного распределения, поэтому случайность отделена от обучаемых выходов энкодера.
- Благодаря этому при обратном распространении градиенты проходят через среднее и масштаб в параметры энкодера.
Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат, как этот прием сохраняет случайность и одновременно пропускает градиенты к параметрам энкодера.
В GAN генератор учится создавать синтетические примеры, а дискриминатор учится отличать реальные примеры от сгенерированных.
- Генератор превращает случайный шум, а иногда и дополнительное условие, в изображение или другой объект.
- Дискриминатор получает реальные и сгенерированные примеры и решает, настоящие они или поддельные.
- Обновления двух сетей чередуются, поэтому дискриминатор создает обучаемый сигнал для генератора.
Зачем это спрашивают: Сильный ответ называет вход, выход и роль каждой сети в связанном процессе обучения.
Состязательная функция потерь поощряет дискриминатор за разделение реальных и сгенерированных примеров, а генератор за успешный обман дискриминатора.
- Две цели образуют игру, а не фиксированную попиксельную цель для генератора.
- На практике для генератора часто используют несатурирующую функцию потерь, поскольку в начале обучения она дает более сильные градиенты.
- Если одна сеть становится намного сильнее другой, вторая получает слабые градиенты, поэтому важен баланс частоты обновлений и learning rate.
Зачем это спрашивают: Интервьюер оценивает, понимает ли кандидат конкурирующие цели и причину нестабильности состязательного обучения.
Коллапс мод возникает, когда генератор выдает лишь узкий набор результатов, хотя реальные данные намного разнообразнее.
- Я бы сгенерировал много примеров из разных входных шумов при одинаковых настройках и проверил повторы лиц, поз, композиций или текстур.
- Расстояния в пространстве признаков, кластеризация и метрики покрытия или recall помогают найти низкое разнообразие внутри сгенерированного набора и пропущенные области реального валидационного распределения.
- Резкие отдельные изображения не исключают коллапс, а поиск ближайших обучающих примеров проверяет запоминание, а не разнообразие генерации.
Зачем это спрашивают: Сильный ответ отличает визуальное качество от покрытия распределения и диагностирует коллапс по разнообразию сгенерированных примеров, а не по сходству с обучающей выборкой.
Прямой процесс диффузии постепенно добавляет известный шум к чистым обучающим данным, пока они не становятся близкими к случайному шуму.
- На каждом шаге добавляется небольшая порция гауссовского шума по заранее заданному расписанию.
- Замкнутая формула позволяет сразу получить зашумленный пример для выбранного шага во время обучения.
- Прямой процесс фиксирован, а не обучается; он создает пары зашумленных и чистых данных для обучения денойзера.
Зачем это спрашивают: Интервьюер проверяет, знает ли кандидат, что прямая диффузия портит данные известным процессом, а не генерирует их.
Обратное удаление шума начинается со случайного шума и многократно использует обученную модель для оценки менее зашумленного примера.
- Денойзер получает текущий зашумленный латент или изображение вместе с номером шага.
- Планировщик преобразует предсказание модели в следующий пример по выбранному правилу сэмплинга.
- Повторение этого пути к нулевому шагу создает структурированный результат из изученного распределения данных.
Зачем это спрашивают: Сильный ответ отделяет предсказание денойзера от шага планировщика, который обновляет пример.
Расписание шума определяет, сколько сигнала удаляется или сколько шума добавляется на разных шагах диффузии.
- В зависимости от формулировки и планировщика его выражают через значения beta, alpha или sigma.
- У ранних и поздних шагов разное отношение сигнала к шуму, поэтому денойзер восстанавливает на них разные виды информации.
- Расписания обучения и инференса должны быть совместимы, поскольку произвольное расхождение может ухудшить качество.
Зачем это спрашивают: Интервьюер оценивает, связывает ли кандидат расписание с отношением сигнала к шуму, а не считает его простым счетчиком прогресса.
Эмбеддинги шага сообщают денойзеру текущий уровень шума, чтобы он применил подходящее преобразование.
- Одна и та же сеть видит входы от почти чистых до почти полностью шумовых.
- Числовой номер шага преобразуется в вектор, часто через синусоидальные признаки и последующие обучаемые слои.
- Этот вектор обуславливает блоки по всему денойзеру, а не обрабатывается как пиксель изображения.
Зачем это спрашивают: Сильный ответ объясняет, зачем одному общему денойзеру нужен явный сигнал об уровне шума.
При предсказании epsilon модель оценивает шум в текущем примере, а при предсказании x0 напрямую оценивает чистый пример.
- Зная шаг и расписание, одно предсказание можно математически преобразовать в другое.
- Параметризация меняет масштаб цели и то, как обучение выделяет разные уровни шума.
- Планировщик пайплайна должен интерпретировать выход модели в той параметризации, на которой обучен чекпойнт.
Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат эти варианты как альтернативные цели предсказания с согласованной математикой пайплайна.
Classifier-free guidance усиливает условие, объединяя условное и безусловное предсказания одного денойзера.
- Во время обучения условие иногда удаляют, чтобы модель научилась обоим режимам.
- На инференсе разница между условным и безусловным предсказаниями масштабируется и добавляется к безусловному результату.
- Высокое значение guidance scale может улучшить следование промпту, но уменьшить разнообразие или создать перенасыщенные артефакты.
Зачем это спрашивают: Сильный ответ описывает и удаление условия при обучении, и компромисс качества при выборе guidance scale.
Большее число шагов сэмплинга обычно линейно повышает задержку, а прирост качества часто выходит на плато после достаточного числа шагов для выбранной модели и планировщика.
- Каждый шаг обычно требует еще одного запуска денойзера, а это самая дорогая часть генерации изображения.
- При слишком малом числе шагов композиция и мелкие детали могут остаться недоработанными, если модель не обучена или не дистиллирована для короткого сэмплинга.
- Я бы сравнивал варианты на фиксированном наборе промптов и сидов, потому что оптимальное число зависит от планировщика и чекпойнта.
Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат измерять компромисс качества и задержки вместо предположения, что больше шагов всегда лучше.
Латентная диффузия выполняет удаление шума в сжатом обученном пространстве, а не напрямую в полноразмерных пикселях.
- Перед обучением диффузии или инференсом с исходным изображением энкодер переводит картинку в меньший пространственный латентный тензор.
- Денойзер обрабатывает меньше значений, поэтому требует меньше памяти и вычислений по сравнению с пиксельной диффузией.
- Декодер превращает итоговый чистый латент обратно в изображение, поэтому качество сжатия все равно влияет на результат.
Зачем это спрашивают: Сильный ответ связывает денойзинг в латентном пространстве и с экономией вычислений, и с ограничениями реконструкции.
VAE переводит изображения между пиксельным и латентным пространствами, в котором работает диффузионная модель.
- Энкодер используется для обучающих изображений и для задач img2img или inpainting, начинающихся с картинки.
- Декодер превращает итоговый очищенный латент в видимые пиксели.
- VAE не является основным денойзером, а ошибки реконструкции могут проявиться как сдвиги цвета или потеря мелких деталей даже при успешном денойзинге.
Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат сжатие и реконструкцию от задачи диффузионного удаления шума.
U-Net-денойзер преобразует зашумленное изображение или латент в предсказание, нужное для одного обратного шага диффузии.
- Путь уменьшения разрешения собирает широкий пространственный контекст, а путь увеличения восстанавливает разрешение.
- Пропускающие соединения переносят локальные детали между соответствующими разрешениями.
- Условие по шагу и тексту вводится в блоки сети, чтобы предсказание учитывало и уровень шума, и промпт.
Зачем это спрашивают: Сильный ответ связывает многоуровневую структуру U-Net с фактическим выходом денойзера.
Cross-attention позволяет признакам изображения или латента извлекать нужную информацию из текстовых представлений во время денойзинга.
- Запросы поступают из текущих признаков изображения, а ключи и значения из закодированных токенов промпта.
- Разные пространственные позиции могут обращать внимание на разные слова, помогая связать объекты и атрибуты с областями.
- Cross-attention улучшает обусловливание, но не гарантирует правильный счет, привязку атрибутов или компоновку.
Зачем это спрашивают: Интервьюер оценивает, знает ли кандидат, какая модальность дает запросы, а какая передает условие.
Текстовый энкодер преобразует токенизированный промпт в контекстные векторы, которыми обуславливается денойзер изображения.
- Сначала токенизатор переводит текст в словарь и формат последовательности, ожидаемые этим энкодером.
- Энкодер представляет каждый токен в контексте, поэтому одно слово может получить разные векторы в разных промптах.
- Во многих пайплайнах текстовый энкодер остается замороженным при инференсе и большинстве обучений адаптеров, а денойзер использует его выходы.
Зачем это спрашивают: Сильный ответ различает токенизацию, кодирование текста и денойзинг изображения как отдельные этапы пайплайна.
Закрытые вопросы
- 21
Что происходит, когда промпт превышает лимит токенов текстового энкодера?
promptingtokens - 22
Как случайный сид помогает воспроизводимости генерации изображений?
- 23
Что такое негативный промпт в диффузионной генерации изображений?
promptingnegative-prompt - 24
Что контролирует denoising strength в img2img?
- 25
Как маска inpainting используется в диффузионном пайплайне?
inpaintingci-cd - 26
Как outpainting расширяет изображение?
- 27
Какую проблему решает ControlNet в диффузионных пайплайнах?
controlnetci-cd - 28
Что IP-Adapter добавляет в пайплайн text-to-image?
ip-adapterci-cd - 29
Что такое LoRA для дообучения диффузионной модели изображений?
fine-tuninglora - 30
Для чего используют DreamBooth?
dreambooth - 31
Когда стоит выбрать LoRA вместо полного дообучения?
fine-tuninglora - 32
Что означают концепции base и refiner в SDXL?
- 33
Что такое Diffusion Transformer, или DiT?
nlpdit - 34
В чем основная идея архитектуры MM-DiT для генерации text-to-image?
mm-dit - 35
Почему временную согласованность сложно обеспечить в генерации text-to-video?
temporal - 36
Чем ключевые кадры отличаются от интерполяции кадров?
interpolation - 37
Чем отличаются представления звука в виде волны, спектрограммы и токенов?
tokensspectrogram - 38
Что такое акустическая модель и вокодер в системе TTS?
vocodersystem-design - 39
Какие виды условий могут направлять модель генерации музыки?
- 40
Что такое мультимодальные эмбеддинги?
nlpembeddings - 41
Как вычисляется стандартный FID для сгенерированных изображений?
fid - 42
Каковы основные ограничения Inception Score?
inception-score - 43
Как оценить композиционную генерацию для счета объектов, пространственных отношений и привязки атрибутов?
bindingdecision-makingoop - 44
Как провести парную человеческую оценку двух моделей изображений?
llm-eval - 45
Какую роль классификатор безопасности играет в генеративном пайплайне?
safety-classifierci-cd - 46
Чем водяной знак отличается от метаданных происхождения сгенерированного контента?
watermarkprovenance - 47
Что означает fp16 для инференса генеративной модели и является ли это целочисленной квантизацией?
model-compressionprecisionquantization - 48
Как размер батча влияет на пропускную способность и стоимость генерации одного объекта?
throughputbatch - 49
Из каких основных компонентов состоит text-to-image пайплайн Hugging Face diffusers?
ci-cddiffuserscomponents - 50
Как безопасно передать и запустить workflow ComfyUI со скачанными файлами моделей?
comfyui - 51
Пользователь запрашивает баннер 16:9, но пайплайн генерации возвращает квадратное изображение. Как вы будете искать ошибку?
ci-cd - 52
Один и тот же video prompt с одинаковым seed создаёт на двух компьютерах клипы с разным движением и временем воспроизведения. Что вы зафиксируете для воспроизводимости?
prompting - 53
В SDXL prompt обязательный объект находится ближе к концу, но никогда не появляется. Как вы проверите оба текстовых энкодера?
prompting - 54
После повышения CFG с 7 до 20 изображения становятся перенасыщенными и получают жёсткие края. Что вы сделаете?
- 55
Четырёхшаговый preview изображения выглядит приемлемо в целом, но часто портит маленькие лица и логотипы. Как определить, где такой preview безопасен?
- 56
Редактор изображений по инструкции меняет синюю куртку на красную, но также изменяет лицо человека и комнату. Как улучшить локальность правки?
- 57
Вокруг маски на отредактированном через inpainting рукаве виден шов. Как его уменьшить?
- 58
Пайплайн ControlNet получает карту границ Canny, но создаёт бессвязную структуру с checkpoint ControlNet для глубины. В чём ошибка?
controlnetci-cd - 59
С включённым референсом IP-Adapter каждый результат копирует его композицию и почти не следует текстовому prompt. Как восстановить баланс?
promptingip-adapteroop - 60
Портретный LoRA воспроизводит одну и ту же одежду и фон почти в каждом prompt. Как исправить переобучение?
promptingfine-tuninglora - 61
У вас есть одно утверждённое изображение персонажа, но в анимации через несколько секунд теряются лицо и одежда. Как последовательно перенести персонажа в видео?
- 62
В датасете для fine-tune text-to-image много пустых подписей и подписей с неверными объектами. Что вы сделаете до обучения?
fine-tuning - 63
Fine-tuning падает на середине из-за нескольких повреждённых скачанных изображений. Как предотвратить ещё один потерянный запуск?
fine-tuning - 64
Обучение LoRA стабильно в fp32, но loss становится NaN в mixed precision. Как вы найдёте причину?
fine-tuninglora - 65
Задача SDXL помещается в память при 1024 на 1024 и batch size 1, но падает с OOM при 1536 на 1536, batch size 2 и с ControlNet. Как уместить её?
controlnetbatch - 66
Сгенерированные изображения получают зелёный оттенок только после декодирования latent. Как вы проверите VAE?
- 67
Коллега заменил diffusion scheduler, и тот же prompt с тем же seed теперь создаёт другое изображение. Это ошибка?
prompting - 68
Фильтр модерации блокирует безопасные анатомические рисунки как NSFW. Как вы обработаете этот false positive?
- 69
Тестовое изображение red team проходит модерацию, хотя явно нарушает политику продукта. Что вы сделаете с этим false negative?
- 70
Невидимый watermark определяется на исходном изображении, но исчезает после повторного сжатия социальной сетью. Что вы измените?
watermark - 71
Генератор портретов хорошо сохраняет референс на фронтальных студийных фото, но ошибается на боковых позах, при слабом свете и с некоторой культурной одеждой. Как вы его оцените?
llm-evaldecision-makinggenerators - 72
Модель получает высокий CLIPScore, вписывая слова из prompt прямо в изображение. Как оценить её честнее?
promptingdecision-makingllm-eval - 73
Два ревьюера часто расходятся при сравнении результатов image-моделей A и B. Как улучшить попарную оценку?
llm-evalconflict - 74
Сгенерированное изображение для кампании почти совпадает с одним обучающим изображением. Как вы проверите возможное запоминание?
- 75
Сгенерированное аудио звучит искажённо, а у waveform плоские пики на максимальном уровне. Как исправить clipping?
- 76
TTS-голос постоянно неверно произносит название продукта Qlora. Как вы исправите и проверите произношение?
- 77
Клиент загружает интервью знаменитости и просит приложение клонировать этот голос. Что должен сделать пайплайн?
ci-cd - 78
Запрос MusicGen требует 20 секунд, но melody-conditioning длится только 5 секунд, и концовка становится несвязанной. Как обработать несовпадение длительности?
- 79
Сгенерированное видео хорошо выглядит покадрово, но при воспроизведении яркость и текстура мерцают. Как вы найдёте причину?
- 80
После экспорта барабанный стем в сгенерированной музыке звучит на 180 мс раньше стема мелодии. Как вы найдёте и исправите причину?
- 81
Сгенерированный клип 24 fps после экспорта воспроизводится слишком быстро, а аудио заканчивается позже видео. Что вы проверите?
- 82
Общий workflow ComfyUI открывается с красными неизвестными узлами на новом компьютере. Как его запустить?
comfyui - 83
Пайплайн diffusers работал вчера, но после обновления библиотеки загрузка той же модели падает. Как устранить несовпадение ревизий?
ci-cddiffusers - 84
Пользователь просит учебник, где текст и сгенерированные изображения чередуются в одном ответе. Когда выбрать interleaved multimodal output, а когда отдельные вызовы текста и изображений?
- 85
Первый запрос изображения к Modal-эндпоинту занимает 35 секунд, а прогретые запросы занимают 4 секунды. Как уменьшить cold start?
endpoints - 86
Replicate повторяет webhook о завершении, и сервис создаёт три копии одного результата. Как сделать обработчик безопасным?
replicationwebhooks - 87
Batch создал 800 пригодных изображений за двухчасовой запуск на GPU стоимостью $1.60 в час. Как рассчитать стоимость одного изображения?
batchhardware - 88
Пропускная способность GPU растёт при batch из восьми запросов, но интерактивные пользователи слишком долго ждут его заполнения. Что вы измените?
throughputhardwarebatch - 89
Модель сообщает о четырёх секундах inference, но пользователи получают изображения через семь секунд. Как измерить недостающую задержку?
inferencelatency - 90
Дизайнер хочет воссоздать утверждённое изображение через месяц. Какие данные происхождения генерации вы сохраните?
design - 91
В запрос на проверку креатива загружено 28 референсов, но мультимодальная модель принимает не больше 20 изображений. Как это обработать?
- 92
Сгенерированная подпись утверждает, что человек держит телефон, хотя телефона не видно. Как уменьшить такую галлюцинацию?
hallucination - 93
Пайплайн image-to-3D получает фото стула спереди, сбоку и сзади, но на одном виде ножки отличаются, и mesh искажается. Как обработать расхождение видов?
conflictci-cd - 94
Видео с говорящим человеком начинается синхронно, но ближе к концу губы заметно отстают от речи. Как обнаружить и локализовать drift?
iac - 95
Нужно переводить звонок поддержки в реальном времени, сохраняя тон говорящего. Как выбрать между speech-to-speech и каскадом ASR, перевода и TTS?
- 96
Загруженное изображение mood board содержит мелкий текст с приказом игнорировать пользователя и опубликовать приватные активы. Как защититься?
- 97
Генератор кампании начинает с французского минималистичного стиля, но позже выдаёт английский текст с игривым тоном. Как предотвратить дрейф?
iacgenerators - 98
Видеомодератор проверяет один кадр каждые десять секунд и пропускает односекундный опасный фрагмент между выборками. Как улучшить пайплайн?
ci-cd - 99
Debug logs эндпоинта генерации изображений содержат полные пользовательские prompt и загруженные портреты. Что вы измените?
promptingendpoints - 100
Как вы расскажете о созданном вами проекте генерации изображений с учётом качества, задержки и стоимости?
latency