Вопросы на собеседовании: AI ресерч-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.
Смотреть пример резюме: AI ресерч-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Я превращу идею в опровержимое утверждение с заранее заданными сравнением, метрикой и правилом решения.
- Я укажу изменение и механизм, например масштабирование RoPE улучшит поиск на 32K, потому что относительные фазы останутся полезными за пределами обучающей длины 8K.
- Я зафиксирую baseline, снимок данных, бюджет токенов, три seed, основную метрику и метрики срезов в карточке эксперимента.
- Я задам порог, например не менее +1,0 пункта accuracy с 95% доверительным интервалом выше нуля, вместо принятия любой положительной дельты.
- Позднейшие анализы я помечу как exploratory и потребую отдельный подтверждающий прогон, прежде чем считать их доказательством.
Зачем это спрашивают: Интервьюер проверяет, умеете ли вы предотвращать ретроспективное искажение и превращать правдоподобный механизм в тест, который действительно может провалиться.
Я проведу эксперимент 2 на 2, чтобы отдельно оценить основные эффекты и взаимодействие, а не сравнивать каждое изменение только с baseline.
- Четыре ячейки содержат отсутствие изменений, только A, только B и A плюс B при одинаковых порядке данных, токенах, политике инициализации и оценке.
- При трех seed на ячейку я оценю A, B и взаимодействие A:B, а не сложу две независимо измеренные дельты.
- Положительное взаимодействие означает, что общий выигрыш больше суммы основных эффектов, а отрицательное может показать, что оба изменения решают одно узкое место.
- Если compute позволяет только восемь прогонов, я сокращу вторичные оценки, прежде чем убирать ячейки, потому что пропуск ячейки ломает факторное сравнение.
Зачем это спрашивают: Сильный ответ показывает, что кандидат отличает взаимодействие от двух изолированных улучшений и учитывает ограниченный compute-бюджет.
Я рассчитаю бюджет по минимально обнаружимому эффекту и наблюдаемой дисперсии, а не выберу произвольное число прогонов.
- По пилоту я оценю дисперсию по примерам или seed, задам alpha 0,05 и мощность 80%, затем рассчитаю нужное число примеров и seed.
- Оценка обеих моделей на одних примерах часто снижает дисперсию, поэтому 3 000 парных примеров могут дать больше информации, чем 6 000 независимых.
- Около 10% compute я оставлю на неудачные старты и одно нетронутое подтверждение, не включая этот резерв в основной анализ.
- Если нужный бюджет недоступен, я повышу порог обнаружимого эффекта или сужу гипотезу, а не молча запущу тест с низкой мощностью.
Зачем это спрашивают: Интервьюер хочет увидеть, что вы связываете статистическую мощность с GPU- и eval-бюджетом, а не считаете три seed универсальным правилом.
Парный тест убирает вариацию сложности заданий, сравнивая обе модели на одних независимых eval-items.
- Пару задаёт item ID: я сохраню оба результата для каждого задания и проанализирую внутрипарную дельту вместо двух независимых агрегированных средних.
- Для бинарной корректности тест Мак-Немара использует пары с разными исходами, а для непрерывных scores парный permutation test или bootstrap сохраняет ковариацию заданий.
- Один и тот же целочисленный seed декодирования не создаёт парность, потому что разные распределения токенов по-разному отображают один random stream в samples.
- Для стохастической генерации я возьму повторные samples на каждое задание или явно обоснованное coupling общих случайных чисел, затем учту неопределённость по заданиям и samples.
Зачем это спрашивают: Интервьюер проверяет, правильно ли вы определяете единицу парного сравнения и не принимаете общий seed за статистический дизайн.
Я применю двухуровневый анализ, отражающий неопределённость независимых training runs и выбранных eval-items.
- Я построю перекрёстный дизайн, где каждый блок seed для baseline и candidate оценивается на одном наборе заданий, сохраняя парность методов там, где её поддерживает политика seed.
- Двухуровневый bootstrap независимо пересэмплирует пары seed и item IDs, а затем на каждой реплике заново считает общую дельту методов.
- Альтернативой служит crossed random-effects model, но объявление каждой строки seed-item независимой создаст псевдорепликацию и слишком узкий интервал.
- Я покажу интервал вместе с компонентами variance по seed и items и добавлю прогоны, если межпрогонная неопределённость оценена слишком слабо для решения.
Зачем это спрашивают: Сильный ответ объединяет оба уровня неопределённости и не позволяет тысячам заданий скрыть малое число training runs.
Я определю семейство гипотез до просмотра результатов и внесу поправку внутри него, а не буду выделять минимальный исходный p-value.
- Поправка Холма подходит для небольшого набора подтверждающих выводов, потому что контролирует семейную вероятность ошибки и менее консервативна, чем Bonferroni.
- Метод Бенджамини-Хохберга подходит широкому поисковому sweep, где допустим контролируемый false discovery rate, например 5%.
- Я назначу один основной benchmark и метрику, а остальные пять оставлю вторичными доказательствами вместо умножения числа равноправных главных выводов.
- В отчете будут исходные и скорректированные p-value, размеры эффектов и доверительные интервалы, чтобы поправка не заменяла оценку величины результата.
Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы, что перебор множества вариантов и метрик повышает вероятность ложного research-вывода.
Я сформулирую сравнение качества как заранее заданный non-inferiority test с границей 0,3 пункта.
- Я определю delta как candidate минус baseline, проверю фактический расход 75% заявленных полных FLOPs и до запуска задам margin -0,3.
- Нулевая гипотеза утверждает delta не выше -0,3, поэтому non-inferiority принимается только при нижней односторонней 95% границе выше -0,3.
- Совпадающие блоки training seed и одни eval-items снизят variance, но интервал всё равно должен учитывать неопределённость обоих источников.
- Я порекомендую метод, только если подтверждены экономия 25% и ограничения latency или memory, потому что non-inferiority не доказывает ни equivalence, ни superiority.
Зачем это спрашивают: Интервьюер оценивает, умеете ли вы сопоставить конкретную экономию compute с заранее допустимой потерей качества через правильный односторонний тест.
Я проведу повторные перекрестные измерения, чтобы оценить вклад разных источников случайности в общую дисперсию.
- Я буду по отдельности менять seed инициализации, seed порядка данных, шаг checkpoint и eval-выборку, а не менять все четыре фактора одновременно.
- Модель случайных эффектов может разделить дисперсию на компоненты seed, checkpoint, задания benchmark и остатка, добавив взаимодействия при достаточном дизайне.
- Если порядок данных объясняет 60% вариации, увеличение eval-набора не снимет неопределенность, а дополнительные независимые training-run снимут.
- Я опубликую компоненты дисперсии и выбранное число seed, чтобы следующие эксперименты тратили compute на главный источник неопределенности.
Зачем это спрашивают: Интервьюер хочет понять, умеете ли вы количественно диагностировать шум в research, а не усреднять произвольное число повторов.
Сначала я докажу, что intervention активировал предполагаемый механизм, а не выдам неработающую реализацию за научный отрицательный результат.
- До запуска я назову механистический признак, например большую дистанцию attention, изменение routing entropy или измеримое вспомогательное представление.
- Traces treatment и baseline должны различаться по этому признаку, а проверки config, gradient flow и обновлений параметров подтвердят реальное использование нового path.
- Removal-, sham- или dose-check коэффициента должен выключать признак или предсказуемо менять его силу, что убедительнее одной плоской итоговой метрики.
- Только после подтверждения активности я проверю, исключает ли interval минимально полезный gain; иначе результат является невалидным или неубедительным, но не отрицательным.
Зачем это спрашивают: Сильный кандидат валидирует причинное вмешательство до отклонения механизма по нулевому изменению метрики.
Warmup ограничивает нестабильные ранние обновления, пока выравниваются моменты оптимизатора и масштабы активаций, а decay уменьшает шаг по мере приближения к минимуму.
- Я начну с линейного warmup на 1-3% всех шагов, затем сравню cosine и linear decay при одинаковых peak rate, токенах и настройках оптимизатора.
- Слишком короткий warmup может вызвать скачки loss или overflow, а 10% warmup способен потратить заметную часть короткого прогона на лишне малый шаг.
- Сравнение должно включать ранний loss, итоговый validation loss, gradient norm и качество при фиксированных FLOPs, а не только последний checkpoint.
- Я буду настраивать peak rate вместе с формой расписания, потому что cosine может выглядеть лучше лишь из-за другого среднего learning rate.
Зачем это спрашивают: Сильный ответ связывает форму расписания с динамикой оптимизации и предлагает контролируемое сравнение вместо пересказа стандартного recipe.
AdamW сочетает адаптивные первый и второй моменты с weight decay, применяемым отдельно от градиентного обновления, поэтому точные гиперпараметры являются частью результата.
- Обновление использует скорректированные моменты с beta часто около 0,9 и 0,95 или 0,999, а изменение beta2 меняет реакцию на дисперсию градиента.
- Decoupled decay напрямую уменьшает параметры и не равен добавлению L2 loss при адаптивном preconditioner.
- Bias и масштабы нормализации часто исключают из decay, а для embedding и выходных весов нужна явно описанная политика.
- Epsilon, precision, gradient clipping и хранение моментов в FP32 могут менять малые обновления, поэтому я сохраню и опишу все эти настройки.
Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы AdamW глубже названия и можете ли воспроизвести правило обновления без скрытых defaults.
Gradient noise scale оценивает границу, после которой увеличение batch перестает пропорционально улучшать оптимизацию, потому что дисперсия градиента уже мала относительно среднего сигнала.
- Ниже critical batch удвоение batch size часто позволяет примерно удвоить learning rate и сократить число шагов для того же объема токенов.
- Выше этой границы дополнительные примеры в основном дублируют информацию о градиенте, поэтому throughput может расти, а качество на training FLOP снижаться.
- Я оценю scale по статистикам градиентов microbatch в нескольких checkpoint, потому что в ходе обучения он меняется.
- Исследование batch должно фиксировать общее число токенов и заново настраивать learning rate, иначе сравнение по равному числу шагов дает большому batch лишний compute.
Зачем это спрашивают: Сильный кандидат использует статистики градиента, чтобы объяснить границы линейного масштабирования batch, а не считает это правило универсальным.
Label smoothing переносит часть вероятностной массы с one-hot класса, ограничивая чрезмерные logits и часто улучшая калибровку.
- При smoothing 0,1 в задаче с K классами основная масса остается на правильном классе, а остаток распределяется между другими классами по выбранному правилу.
- Он может повысить validation accuracy при шумных labels, но чрезмерный smoothing ослабляет сигнал редких или близких классов.
- Он способен мешать knowledge distillation или отбору по уверенности, потому что модель специально учат не воспроизводить резкие целевые вероятности.
- Я сравню значения 0, 0,05 и 0,1 и покажу accuracy, NLL, ECE и recall по классам, а не только accuracy.
Зачем это спрашивают: Интервьюер оценивает, понимаете ли вы механизм изменения целевого распределения и компромисс между калибровкой и различающей способностью.
Focal loss полезен, когда легкие примеры доминируют в обучении и эксперимент должен усилить вклад сложных или редких примеров.
- Он умножает cross-entropy на (1 - p_t) в степени gamma, поэтому gamma 2 сильно уменьшает вес примеров, которые модель уже уверенно классифицирует.
- Вес alpha может отдельно учитывать частоты классов, но совместная настройка alpha и gamma способна чрезмерно исправить дисбаланс.
- Среди сложных примеров встречаются ошибочные labels, поэтому focal loss может усилить шум разметки и ухудшить калибровку даже при росте recall.
- Я сравню его со взвешенным cross-entropy при одинаковом sampling и покажу PR-AUC, recall редкого класса, NLL и долю градиента по классам.
Зачем это спрашивают: Сильный ответ объясняет перевзвешивание градиентов и учитывает, что акцент на сложных примерах усиливает как полезные редкие случаи, так и шум.
Temperature масштабирует similarity logits перед softmax и задает, насколько сильно loss сосредоточится на самых сложных negatives.
- В InfoNCE деление cosine similarity на 0,07 создает более резкие вероятности и большие градиенты около близких negatives, чем temperature 0,2.
- Слишком малое значение позволяет нескольким false negatives доминировать и дестабилизировать обучение, а большое дает чрезмерно размытые градиенты.
- Лучшее значение зависит от нормализации embedding, batch size и negative mining, потому что все три фактора меняют распределение similarity.
- Я буду отслеживать retrieval Recall@k, статистики alignment и uniformity, gradient norms и срезы false negatives, ограничив обучаемую temperature безопасным диапазоном.
Зачем это спрашивают: Интервьюер хочет увидеть, что вы связываете temperature с весом negatives и понимаете его взаимодействие с batch и геометрией embedding.
Я объединю обучение по жёстким labels с температурно сглаженным расхождением teacher и student и изолирую его пользу при фиксированных условиях student.
- Стандартный objective имеет вид (1 - alpha) * CE + alpha * T^2 * KL(softmax(z_teacher / T) || softmax(z_student / T)).
- Множитель T^2 компенсирует ослабление градиента из-за сглаживания, а T от 2 до 4 раскрывает предпочтения вторичных классов.
- Alpha балансирует task labels и поведение teacher, а feature matching является отдельной гипотезой и не входит в первое сравнение.
- Я сравню с student того же размера без teacher и покажу качество, калибровку и срезы, отдельно учитывая генерацию teacher logits.
Зачем это спрашивают: Сильный кандидат точно задаёт направление KL и температурный множитель и использует baseline, изолирующий сигнал teacher.
Я выберу коэффициент auxiliary по поведению градиентов общих параметров, а не только по двум скалярным значениям loss.
- На общем backbone я сравню ||g_main|| и ||lambda * g_aux||, не включая в отношение параметры, принадлежащие только auxiliary head.
- На тех же векторах я измерю cosine similarity, потому что cosine показывает направление, а отношение норм показывает значимость согласованного или конфликтующего сигнала.
- Sweep коэффициента может удерживать заданное отношение auxiliary к main norm, а clipping или schedule добавляются только как отдельные контролируемые interventions.
- Я сохраню слагаемое, только если основная задача улучшится при одинаковом полном compute, а removal ablation обратит эффект без скрытых регрессий срезов.
Зачем это спрашивают: Интервьюер проверяет, диагностируете ли вы и величину, и направление градиентов на параметрах, где objectives действительно взаимодействуют.
Я заранее укажу, относится ли claim к одинаковой работе модели или к одинаковому полному algorithmic compute, потому что это разные сравнения.
- Срез по одинаковым токенам может фиксировать exposure данных и forward-backward FLOPs модели, но его нельзя называть равным полным compute при разной цене optimizer.
- Полный compute добавляет к forward-backward ledger повторные вычисления и обновление optimizer, включая построение и применение preconditioner у методов вроде Shampoo.
- Каждый optimizer получит одинаковое число tuning trials для learning rate, decay и собственных настроек вместо наследования defaults AdamW.
- Я построю validation loss и по накопленным forward-backward FLOPs, и по полным FLOPs, добавив step time, peak memory и итоговое качество по seed.
Зачем это спрашивают: Сильный ответ отделяет полезную работу модели от полного compute с optimizer и не создаёт преимущество дешёвому или дорогому update через выбор учёта.
Pre-norm ставит нормализацию перед каждой residual-веткой и обычно создает более прямой путь градиента в глубоких Transformer, а post-norm нормализует после residual addition.
- В pre-norm identity residual path обходит sublayer и нормализацию, помогая градиенту проходить через десятки или сотни слоев.
- Post-norm может сильнее менять представление в каждом блоке, но чувствительнее к инициализации, warmup и глубине.
- Pre-norm не гарантирует победу при равном compute: его residual stream может расти, а финальная нормализация становится важной.
- Я сравню варианты при одинаковых параметрах и токенах, затем изучу loss spikes, layerwise gradient norms, масштаб активаций и итоговое benchmark-качество.
Зачем это спрашивают: Интервьюер оценивает, умеете ли вы связать место нормализации с градиентами residual path и предложить измерения помимо итоговой accuracy.
RoPE поворачивает признаки query и key на зависящие от позиции углы, а ALiBi добавляет к attention scores линейные штрафы за расстояние с разными наклонами по heads.
- RoPE делает dot product зависимым от относительной фазы и сохраняет богатую позиционную геометрию, но длинные невиданные позиции выходят за обученный диапазон частот.
- ALiBi не имеет обучаемой таблицы позиций и смещает разные heads к разным диапазонам локальности, часто проще экстраполируя, но задавая менее выразительное позиционное взаимодействие.
- Я обучу оба варианта до 8K при одинаковых параметрах и токенах, затем оценю perplexity, retrieval и reasoning на 8K, 16K и 32K.
- Любая интерполяция или смена частот RoPE является отдельным изменением, а качество короткого контекста нужно проверить из-за возможного ухудшения обученного диапазона.
Зачем это спрашивают: Сильный кандидат объясняет механизмы на уровне scores и проектирует тест экстраполяции, который не скрывает регрессии короткого контекста.
Закрытые вопросы
- 21
В чем алгоритмическая идея FlashAttention и почему это точный, а не приближенный attention?
flash-attnalgorithms - 22
Какой компромисс качества создает grouped-query attention по сравнению с multi-head и multi-query attention?
queriesgqa - 23
Как работают routing и auxiliary losses в разреженном mixture-of-experts Transformer?
nlptransformermoe - 24
Как сравнить разреженную MoE-модель с dense-моделью при одинаковых training FLOPs?
flops - 25
Как исследовать компромисс между глубиной и шириной Transformer?
nlptransformer - 26
Как проверить, что long-context метод действительно экстраполирует за пределы обучающей длины?
long-context - 27
Как сравнить early fusion, cross-attention и late fusion в multimodal-модели?
multimodal - 28
Как сформулировать speculative decoding как research-гипотезу, а не задачу serving?
hypothesis-testingmodel-servingspec-decode - 29
Что делают saved tensors и version counters внутри PyTorch autograd?
pytorchautograd - 30
Когда стоит реализовать custom torch.autograd.Function и как его проверить?
validationautograd - 31
Как DistributedDataParallel синхронизирует градиенты во время backward?
distributed - 32
Чем отличаются FULL_SHARD и SHARD_GRAD_OP в FSDP с учетом текущих концепций FSDP?
shardingfsdp - 33
Чем именно жертвует activation checkpointing и как выбрать границы checkpoint?
checkpointactivationact-checkpoint - 34
Что вызывает graph breaks в torch.compile и как исследовать их влияние на training experiment?
experiments - 35
Как построить надёжный microbenchmark CUDA kernel до заявления об ускорении?
cuda - 36
Как jit, vmap и grad сочетаются в JAX и какие ограничения они накладывают?
jax - 37
Как JAX device mesh и PartitionSpec описывают sharded computation?
shardingpartitioningjax - 38
Почему JAX использует явные PRNG keys и как управлять ими в параллельных экспериментах?
experimentsjax - 39
Как выбрать веса смеси многодоменных данных для pretraining?
- 40
Как выбрать и проверить threshold дедупликации training data?
dedupvalidationqueries - 41
Как провести аудит загрязнения benchmark в большом training corpus?
contamination - 42
Как измерить и повысить согласие annotators для preference data?
- 43
Как распознать насыщение benchmark и что с ним делать?
- 44
Как оценить и улучшить калибровку вероятностей research-модели?
probabilitycalibrationdecision-making - 45
Как спроектировать subgroup slices, не превратив evaluation в поиск удобных метрик?
designmonitoring - 46
Что должны фиксировать golden-trace replay и eval contract для воспроизводимого model research?
reproducibility - 47
Какие objective и data-решения важнее всего при supervised fine-tuning языковой модели?
supervised - 48
Как reward model обучается по парным preferences?
reward-model - 49
Какую роль reference model и beta играют в DPO?
dpo - 50
Какие разные роли clipping PPO и KL penalty играют в RLHF?
pporlhfdistinct - 51
На шаге 18 000 включается auxiliary objective, после чего main loss один раз резко растёт и восстанавливается. Как проверить валидность intervention?
validation - 52
Distributed refactor меняет порядок reduction градиентов, а заявленный eval-gain равен лишь 0,2 пункта. Как проверить влияние численного порядка?
refactoringdistributed - 53
Один rank постоянно на 18% медленнее остальных 63 и удлиняет хвост каждого collective. Как найти причину straggler?
- 54
DataLoader хорошо питает 8 GPU, но при масштабировании того же прогона на 64 GPU появляются многосекундные паузы. Как вы будете искать причину?
dataloader - 55
Каталог distributed checkpoint существует, но rank 37 не дописал свой optimizer shard. Что вы сделаете?
checkpointshardingdistributed - 56
Resumed curriculum-run переходит от общих данных к математике и позже обгоняет непрерывный control. Как проверить результат?
validation - 57
Прогон FSDP FULL_SHARD всё равно падает с OOM на 8 GPU, хотя оценки памяти параметров и optimizer state укладываются. Что вы проверите?
estimationoptimizationfsdp - 58
Вы сохранили FSDP-прогон на 8 GPU и должны возобновить его на 16 GPU. Как обеспечить переносимость state dict между world sizes?
fsdp - 59
После добавления fused RMSNorm extension torch.compile вставляет по одному graph break на каждый Transformer block и работает медленнее eager mode. Как это исправить?
nlptransformer - 60
Fused bias-GELU autograd function проходит gradcheck для одной строки, но падает на входе размером 7 на 128 только по gradient bias. Что вы проверите?
autograd - 61
Triton kernel работает быстро, но незаметно возвращает неверные значения для некоторых нечётных длин последовательности. Как вы будете его отлаживать?
triton - 62
Ваш новый Triton kernel лишь в 1,05 раза быстрее PyTorch baseline. Что вы спрофилируете до заявления об успешной оптимизации?
pytorchtritonoptimization - 63
В исследовании precision FP16 получает дополнительные данные взамен пропущенных updates, а BF16 останавливается на token budget. Почему сравнение невалидно?
precisionbf16tokens - 64
Gradient accumulation даёт целевой batch size, но результат меняется, когда у ranks разное число валидных токенов. В чём ошибка?
tokensbatch - 65
Config данных задаёт доменам веса 70%, 20% и 10%, но ledger consumed tokens показывает 84%, 11% и 5%. Как проверить реальную mixture?
tokensvalidationconfig - 66
Воспроизведение использует опубликованные weights, но его первое optimizer update отличается от авторского прогона. Как исследовать mismatch optimizer state?
optimization - 67
Effective batch вырос в 8 раз после изменения world size и accumulation. Как вы скорректируете learning rate?
optimizationbatch - 68
Preemption происходит в среднем раз в шесть часов, а синхронный checkpoint останавливает все GPU на 90 секунд. Как выбрать cadence с минимальной ожидаемой потерей compute?
checkpointhardware - 69
Во время distributed run отказывает один узел. Что может восстановить elastic restart и где вы зададите пределы?
distributed - 70
Run на 32 GPU показывает лишь 35% utilization в nvidia-smi. Как рассчитать model FLOPs utilization и объяснить разницу?
flopshardware - 71
Eval scores незаметно регрессируют после рефакторинга eval harness, хотя checkpoint не менялся. Как вы будете исследовать проблему?
checkpointrefactoring - 72
Вы подозреваете, что benchmark examples в training corpus завысили score. Как проверить влияние данных вместо нового overlap search?
test-data - 73
Команда проводит evaluation после каждого нового seed и останавливается, как только p становится меньше 0,05. Как контролировать sequential peeking?
pitfallsdecision-making - 74
Adaptive sweep выбрал одного победителя из 30 ablations. Как спроектировать независимое confirmatory study?
design - 75
Как применить item-response analysis, чтобы понять, различает ли benchmark сильные модели?
- 76
Agreement annotators остаётся стабильным, но preference labels меняются между ежемесячными партиями. Как обнаружить temporal rubric drift?
batchiac - 77
Как до дорогой human evaluation определить, сможет ли она обнаружить preference gain в три пункта?
- 78
Synthetic-data branch не даёт gain против дополнительных реальных данных при фиксированных FLOPs. Когда вы его закроете?
flops - 79
Auxiliary objective по коду повышает общий score на два пункта, но снижает mathematical reasoning на три. Как проверить capability interference и принять решение?
aggregation - 80
Schema eval-traces должна перейти с version 2 на version 3 без потери сравнимости многолетних результатов. Как построить migration bridge?
schemamigrations - 81
Mixture-of-experts run начинает отправлять 70% токенов двум experts. Как диагностировать expert collapse?
tokensmoe - 82
Команда предлагает attention sinks и RoPE position interpolation для исправления long-context quality. Как оценить их как разные механизмы?
ropelong-contextdecision-making - 83
DPO улучшает blinded helpfulness, но вызывает явную regression reasoning. Как вы отреагируете?
dpo - 84
Reward model хорошо работает на validation set, но теряет accuracy на новой партии preferences. Как проверить validation overfitting?
overfittingreward-modelbatch - 85
Во время PPO reference KL вырастает в шесть раз, после чего reward рушится вместе с held-out quality. Что вы сделаете?
ppo - 86
Loss SFT-прогона падает, но sampled chats выводят user markers и продолжаются после assistant turn. Как отладить chat template?
sft - 87
Как провести ablation фильтров synthetic-data pipeline, не смешивая качество фильтра с размером dataset?
pipelinesci-cd - 88
Distilled student отстаёт от teacher на 13 пунктов. Как отделить предел capacity от провала distillation?
capacitymodel-compression - 89
Какие инварианты verifier и correction path нужно проверить в реализации speculative decoding?
spec-decode - 90
У multimodal model улучшается text loss, пока image-conditioned quality падает. Как диагностировать modality imbalance?
multimodal - 91
Вы владеете очередью из 40 sweep proposals, но за неделю можно запустить только 10. Как сделать очередь evidence-gated?
data-structures - 92
У лучшего run в dashboard нет полного lineage record. Что вы сделаете с результатом?
lineage - 93
Theoretical FLOPs report и счёт scheduler в GPU-hours расходятся на 28%. Как их сверить?
flopsconflicthardware - 94
Как вы будете наставлять junior research engineer во время его первого ablation?
mentoring - 95
PR заявляет воспроизведение новой статьи об attention, но меняет 900 строк в модели и training configs. Какие проверки вы потребуете?
config - 96
Как вы внесёте Triton kernel в open-source research library?
triton - 97
Collaborator оспаривает ваш reported gain и говорит, что его rerun дал отрицательный результат. Как разрешить спор?
- 98
Deadline статьи наступает до завершения запланированных пяти seed. Что вы сделаете?
estimation - 99
На каком из 40 commits регрессировал научный результат? Как провести bisect без полного retraining каждой revision?
retraining - 100
Как выбрать следующий experiment по expected information per GPU-hour?
experimentshardware