Skip to content

Вопросы на собеседовании: AI ресерч-инженер

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.

Смотреть пример резюме: AI ресерч-инженер

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

experimentsarchitecturehypothesis-testing

Я превращу идею в опровержимое утверждение с заранее заданными сравнением, метрикой и правилом решения.

  • Я укажу изменение и механизм, например масштабирование RoPE улучшит поиск на 32K, потому что относительные фазы останутся полезными за пределами обучающей длины 8K.
  • Я зафиксирую baseline, снимок данных, бюджет токенов, три seed, основную метрику и метрики срезов в карточке эксперимента.
  • Я задам порог, например не менее +1,0 пункта accuracy с 95% доверительным интервалом выше нуля, вместо принятия любой положительной дельты.
  • Позднейшие анализы я помечу как exploratory и потребую отдельный подтверждающий прогон, прежде чем считать их доказательством.

Зачем это спрашивают: Интервьюер проверяет, умеете ли вы предотвращать ретроспективное искажение и превращать правдоподобный механизм в тест, который действительно может провалиться.

design

Я проведу эксперимент 2 на 2, чтобы отдельно оценить основные эффекты и взаимодействие, а не сравнивать каждое изменение только с baseline.

  • Четыре ячейки содержат отсутствие изменений, только A, только B и A плюс B при одинаковых порядке данных, токенах, политике инициализации и оценке.
  • При трех seed на ячейку я оценю A, B и взаимодействие A:B, а не сложу две независимо измеренные дельты.
  • Положительное взаимодействие означает, что общий выигрыш больше суммы основных эффектов, а отрицательное может показать, что оба изменения решают одно узкое место.
  • Если compute позволяет только восемь прогонов, я сокращу вторичные оценки, прежде чем убирать ячейки, потому что пропуск ячейки ломает факторное сравнение.

Зачем это спрашивают: Сильный ответ показывает, что кандидат отличает взаимодействие от двух изолированных улучшений и учитывает ограниченный compute-бюджет.

experiments

Я рассчитаю бюджет по минимально обнаружимому эффекту и наблюдаемой дисперсии, а не выберу произвольное число прогонов.

  • По пилоту я оценю дисперсию по примерам или seed, задам alpha 0,05 и мощность 80%, затем рассчитаю нужное число примеров и seed.
  • Оценка обеих моделей на одних примерах часто снижает дисперсию, поэтому 3 000 парных примеров могут дать больше информации, чем 6 000 независимых.
  • Около 10% compute я оставлю на неудачные старты и одно нетронутое подтверждение, не включая этот резерв в основной анализ.
  • Если нужный бюджет недоступен, я повышу порог обнаружимого эффекта или сужу гипотезу, а не молча запущу тест с низкой мощностью.

Зачем это спрашивают: Интервьюер хочет увидеть, что вы связываете статистическую мощность с GPU- и eval-бюджетом, а не считаете три seed универсальным правилом.

testing

Парный тест убирает вариацию сложности заданий, сравнивая обе модели на одних независимых eval-items.

  • Пару задаёт item ID: я сохраню оба результата для каждого задания и проанализирую внутрипарную дельту вместо двух независимых агрегированных средних.
  • Для бинарной корректности тест Мак-Немара использует пары с разными исходами, а для непрерывных scores парный permutation test или bootstrap сохраняет ковариацию заданий.
  • Один и тот же целочисленный seed декодирования не создаёт парность, потому что разные распределения токенов по-разному отображают один random stream в samples.
  • Для стохастической генерации я возьму повторные samples на каждое задание или явно обоснованное coupling общих случайных чисел, затем учту неопределённость по заданиям и samples.

Зачем это спрашивают: Интервьюер проверяет, правильно ли вы определяете единицу парного сравнения и не принимаете общий seed за статистический дизайн.

confidence-intervalsconfidence

Я применю двухуровневый анализ, отражающий неопределённость независимых training runs и выбранных eval-items.

  • Я построю перекрёстный дизайн, где каждый блок seed для baseline и candidate оценивается на одном наборе заданий, сохраняя парность методов там, где её поддерживает политика seed.
  • Двухуровневый bootstrap независимо пересэмплирует пары seed и item IDs, а затем на каждой реплике заново считает общую дельту методов.
  • Альтернативой служит crossed random-effects model, но объявление каждой строки seed-item независимой создаст псевдорепликацию и слишком узкий интервал.
  • Я покажу интервал вместе с компонентами variance по seed и items и добавлю прогоны, если межпрогонная неопределённость оценена слишком слабо для решения.

Зачем это спрашивают: Сильный ответ объединяет оба уровня неопределённости и не позволяет тысячам заданий скрыть малое число training runs.

testing

Я определю семейство гипотез до просмотра результатов и внесу поправку внутри него, а не буду выделять минимальный исходный p-value.

  • Поправка Холма подходит для небольшого набора подтверждающих выводов, потому что контролирует семейную вероятность ошибки и менее консервативна, чем Bonferroni.
  • Метод Бенджамини-Хохберга подходит широкому поисковому sweep, где допустим контролируемый false discovery rate, например 5%.
  • Я назначу один основной benchmark и метрику, а остальные пять оставлю вторичными доказательствами вместо умножения числа равноправных главных выводов.
  • В отчете будут исходные и скорректированные p-value, размеры эффектов и доверительные интервалы, чтобы поправка не заменяла оценку величины результата.

Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы, что перебор множества вариантов и метрик повышает вероятность ложного research-вывода.

flops

Я сформулирую сравнение качества как заранее заданный non-inferiority test с границей 0,3 пункта.

  • Я определю delta как candidate минус baseline, проверю фактический расход 75% заявленных полных FLOPs и до запуска задам margin -0,3.
  • Нулевая гипотеза утверждает delta не выше -0,3, поэтому non-inferiority принимается только при нижней односторонней 95% границе выше -0,3.
  • Совпадающие блоки training seed и одни eval-items снизят variance, но интервал всё равно должен учитывать неопределённость обоих источников.
  • Я порекомендую метод, только если подтверждены экономия 25% и ограничения latency или memory, потому что non-inferiority не доказывает ни equivalence, ни superiority.

Зачем это спрашивают: Интервьюер оценивает, умеете ли вы сопоставить конкретную экономию compute с заранее допустимой потерей качества через правильный односторонний тест.

dispersion

Я проведу повторные перекрестные измерения, чтобы оценить вклад разных источников случайности в общую дисперсию.

  • Я буду по отдельности менять seed инициализации, seed порядка данных, шаг checkpoint и eval-выборку, а не менять все четыре фактора одновременно.
  • Модель случайных эффектов может разделить дисперсию на компоненты seed, checkpoint, задания benchmark и остатка, добавив взаимодействия при достаточном дизайне.
  • Если порядок данных объясняет 60% вариации, увеличение eval-набора не снимет неопределенность, а дополнительные независимые training-run снимут.
  • Я опубликую компоненты дисперсии и выбранное число seed, чтобы следующие эксперименты тратили compute на главный источник неопределенности.

Зачем это спрашивают: Интервьюер хочет понять, умеете ли вы количественно диагностировать шум в research, а не усреднять произвольное число повторов.

architecture

Сначала я докажу, что intervention активировал предполагаемый механизм, а не выдам неработающую реализацию за научный отрицательный результат.

  • До запуска я назову механистический признак, например большую дистанцию attention, изменение routing entropy или измеримое вспомогательное представление.
  • Traces treatment и baseline должны различаться по этому признаку, а проверки config, gradient flow и обновлений параметров подтвердят реальное использование нового path.
  • Removal-, sham- или dose-check коэффициента должен выключать признак или предсказуемо менять его силу, что убедительнее одной плоской итоговой метрики.
  • Только после подтверждения активности я проверю, исключает ли interval минимально полезный gain; иначе результат является невалидным или неубедительным, но не отрицательным.

Зачем это спрашивают: Сильный кандидат валидирует причинное вмешательство до отклонения механизма по нулевому изменению метрики.

nlptransformer

Warmup ограничивает нестабильные ранние обновления, пока выравниваются моменты оптимизатора и масштабы активаций, а decay уменьшает шаг по мере приближения к минимуму.

  • Я начну с линейного warmup на 1-3% всех шагов, затем сравню cosine и linear decay при одинаковых peak rate, токенах и настройках оптимизатора.
  • Слишком короткий warmup может вызвать скачки loss или overflow, а 10% warmup способен потратить заметную часть короткого прогона на лишне малый шаг.
  • Сравнение должно включать ранний loss, итоговый validation loss, gradient norm и качество при фиксированных FLOPs, а не только последний checkpoint.
  • Я буду настраивать peak rate вместе с формой расписания, потому что cosine может выглядеть лучше лишь из-за другого среднего learning rate.

Зачем это спрашивают: Сильный ответ связывает форму расписания с динамикой оптимизации и предлагает контролируемое сравнение вместо пересказа стандартного recipe.

adamw

AdamW сочетает адаптивные первый и второй моменты с weight decay, применяемым отдельно от градиентного обновления, поэтому точные гиперпараметры являются частью результата.

  • Обновление использует скорректированные моменты с beta часто около 0,9 и 0,95 или 0,999, а изменение beta2 меняет реакцию на дисперсию градиента.
  • Decoupled decay напрямую уменьшает параметры и не равен добавлению L2 loss при адаптивном preconditioner.
  • Bias и масштабы нормализации часто исключают из decay, а для embedding и выходных весов нужна явно описанная политика.
  • Epsilon, precision, gradient clipping и хранение моментов в FP32 могут менять малые обновления, поэтому я сохраню и опишу все эти настройки.

Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы AdamW глубже названия и можете ли воспроизвести правило обновления без скрытых defaults.

scalingbatchexperiments

Gradient noise scale оценивает границу, после которой увеличение batch перестает пропорционально улучшать оптимизацию, потому что дисперсия градиента уже мала относительно среднего сигнала.

  • Ниже critical batch удвоение batch size часто позволяет примерно удвоить learning rate и сократить число шагов для того же объема токенов.
  • Выше этой границы дополнительные примеры в основном дублируют информацию о градиенте, поэтому throughput может расти, а качество на training FLOP снижаться.
  • Я оценю scale по статистикам градиентов microbatch в нескольких checkpoint, потому что в ходе обучения он меняется.
  • Исследование batch должно фиксировать общее число токенов и заново настраивать learning rate, иначе сравнение по равному числу шагов дает большому batch лишний compute.

Зачем это спрашивают: Сильный кандидат использует статистики градиента, чтобы объяснить границы линейного масштабирования batch, а не считает это правило универсальным.

loss-functions

Label smoothing переносит часть вероятностной массы с one-hot класса, ограничивая чрезмерные logits и часто улучшая калибровку.

  • При smoothing 0,1 в задаче с K классами основная масса остается на правильном классе, а остаток распределяется между другими классами по выбранному правилу.
  • Он может повысить validation accuracy при шумных labels, но чрезмерный smoothing ослабляет сигнал редких или близких классов.
  • Он способен мешать knowledge distillation или отбору по уверенности, потому что модель специально учат не воспроизводить резкие целевые вероятности.
  • Я сравню значения 0, 0,05 и 0,1 и покажу accuracy, NLL, ECE и recall по классам, а не только accuracy.

Зачем это спрашивают: Интервьюер оценивает, понимаете ли вы механизм изменения целевого распределения и компромисс между калибровкой и различающей способностью.

Focal loss полезен, когда легкие примеры доминируют в обучении и эксперимент должен усилить вклад сложных или редких примеров.

  • Он умножает cross-entropy на (1 - p_t) в степени gamma, поэтому gamma 2 сильно уменьшает вес примеров, которые модель уже уверенно классифицирует.
  • Вес alpha может отдельно учитывать частоты классов, но совместная настройка alpha и gamma способна чрезмерно исправить дисбаланс.
  • Среди сложных примеров встречаются ошибочные labels, поэтому focal loss может усилить шум разметки и ухудшить калибровку даже при росте recall.
  • Я сравню его со взвешенным cross-entropy при одинаковом sampling и покажу PR-AUC, recall редкого класса, NLL и долю градиента по классам.

Зачем это спрашивают: Сильный ответ объясняет перевзвешивание градиентов и учитывает, что акцент на сложных примерах усиливает как полезные редкие случаи, так и шум.

a11y

Temperature масштабирует similarity logits перед softmax и задает, насколько сильно loss сосредоточится на самых сложных negatives.

  • В InfoNCE деление cosine similarity на 0,07 создает более резкие вероятности и большие градиенты около близких negatives, чем temperature 0,2.
  • Слишком малое значение позволяет нескольким false negatives доминировать и дестабилизировать обучение, а большое дает чрезмерно размытые градиенты.
  • Лучшее значение зависит от нормализации embedding, batch size и negative mining, потому что все три фактора меняют распределение similarity.
  • Я буду отслеживать retrieval Recall@k, статистики alignment и uniformity, gradient norms и срезы false negatives, ограничив обучаемую temperature безопасным диапазоном.

Зачем это спрашивают: Интервьюер хочет увидеть, что вы связываете temperature с весом negatives и понимаете его взаимодействие с batch и геометрией embedding.

decision-makingmodel-compression

Я объединю обучение по жёстким labels с температурно сглаженным расхождением teacher и student и изолирую его пользу при фиксированных условиях student.

  • Стандартный objective имеет вид (1 - alpha) * CE + alpha * T^2 * KL(softmax(z_teacher / T) || softmax(z_student / T)).
  • Множитель T^2 компенсирует ослабление градиента из-за сглаживания, а T от 2 до 4 раскрывает предпочтения вторичных классов.
  • Alpha балансирует task labels и поведение teacher, а feature matching является отдельной гипотезой и не входит в первое сравнение.
  • Я сравню с student того же размера без teacher и покажу качество, калибровку и срезы, отдельно учитывая генерацию teacher logits.

Зачем это спрашивают: Сильный кандидат точно задаёт направление KL и температурный множитель и использует baseline, изолирующий сигнал teacher.

Я выберу коэффициент auxiliary по поведению градиентов общих параметров, а не только по двум скалярным значениям loss.

  • На общем backbone я сравню ||g_main|| и ||lambda * g_aux||, не включая в отношение параметры, принадлежащие только auxiliary head.
  • На тех же векторах я измерю cosine similarity, потому что cosine показывает направление, а отношение норм показывает значимость согласованного или конфликтующего сигнала.
  • Sweep коэффициента может удерживать заданное отношение auxiliary к main norm, а clipping или schedule добавляются только как отдельные контролируемые interventions.
  • Я сохраню слагаемое, только если основная задача улучшится при одинаковом полном compute, а removal ablation обратит эффект без скрытых регрессий срезов.

Зачем это спрашивают: Интервьюер проверяет, диагностируете ли вы и величину, и направление градиентов на параметрах, где objectives действительно взаимодействуют.

optimization

Я заранее укажу, относится ли claim к одинаковой работе модели или к одинаковому полному algorithmic compute, потому что это разные сравнения.

  • Срез по одинаковым токенам может фиксировать exposure данных и forward-backward FLOPs модели, но его нельзя называть равным полным compute при разной цене optimizer.
  • Полный compute добавляет к forward-backward ledger повторные вычисления и обновление optimizer, включая построение и применение preconditioner у методов вроде Shampoo.
  • Каждый optimizer получит одинаковое число tuning trials для learning rate, decay и собственных настроек вместо наследования defaults AdamW.
  • Я построю validation loss и по накопленным forward-backward FLOPs, и по полным FLOPs, добавив step time, peak memory и итоговое качество по seed.

Зачем это спрашивают: Сильный ответ отделяет полезную работу модели от полного compute с optimizer и не создаёт преимущество дешёвому или дорогому update через выбор учёта.

nlptransformeroptimization

Pre-norm ставит нормализацию перед каждой residual-веткой и обычно создает более прямой путь градиента в глубоких Transformer, а post-norm нормализует после residual addition.

  • В pre-norm identity residual path обходит sublayer и нормализацию, помогая градиенту проходить через десятки или сотни слоев.
  • Post-norm может сильнее менять представление в каждом блоке, но чувствительнее к инициализации, warmup и глубине.
  • Pre-norm не гарантирует победу при равном compute: его residual stream может расти, а финальная нормализация становится важной.
  • Я сравню варианты при одинаковых параметрах и токенах, затем изучу loss spikes, layerwise gradient norms, масштаб активаций и итоговое benchmark-качество.

Зачем это спрашивают: Интервьюер оценивает, умеете ли вы связать место нормализации с градиентами residual path и предложить измерения помимо итоговой accuracy.

ropealibi

RoPE поворачивает признаки query и key на зависящие от позиции углы, а ALiBi добавляет к attention scores линейные штрафы за расстояние с разными наклонами по heads.

  • RoPE делает dot product зависимым от относительной фазы и сохраняет богатую позиционную геометрию, но длинные невиданные позиции выходят за обученный диапазон частот.
  • ALiBi не имеет обучаемой таблицы позиций и смещает разные heads к разным диапазонам локальности, часто проще экстраполируя, но задавая менее выразительное позиционное взаимодействие.
  • Я обучу оба варианта до 8K при одинаковых параметрах и токенах, затем оценю perplexity, retrieval и reasoning на 8K, 16K и 32K.
  • Любая интерполяция или смена частот RoPE является отдельным изменением, а качество короткого контекста нужно проверить из-за возможного ухудшения обученного диапазона.

Зачем это спрашивают: Сильный кандидат объясняет механизмы на уровне scores и проектирует тест экстраполяции, который не скрывает регрессии короткого контекста.

Закрытые вопросы

  • 21

    В чем алгоритмическая идея FlashAttention и почему это точный, а не приближенный attention?

    flash-attnalgorithms
  • 22

    Какой компромисс качества создает grouped-query attention по сравнению с multi-head и multi-query attention?

    queriesgqa
  • 23

    Как работают routing и auxiliary losses в разреженном mixture-of-experts Transformer?

    nlptransformermoe
  • 24

    Как сравнить разреженную MoE-модель с dense-моделью при одинаковых training FLOPs?

    flops
  • 25

    Как исследовать компромисс между глубиной и шириной Transformer?

    nlptransformer
  • 26

    Как проверить, что long-context метод действительно экстраполирует за пределы обучающей длины?

    long-context
  • 27

    Как сравнить early fusion, cross-attention и late fusion в multimodal-модели?

    multimodal
  • 28

    Как сформулировать speculative decoding как research-гипотезу, а не задачу serving?

    hypothesis-testingmodel-servingspec-decode
  • 29

    Что делают saved tensors и version counters внутри PyTorch autograd?

    pytorchautograd
  • 30

    Когда стоит реализовать custom torch.autograd.Function и как его проверить?

    validationautograd
  • 31

    Как DistributedDataParallel синхронизирует градиенты во время backward?

    distributed
  • 32

    Чем отличаются FULL_SHARD и SHARD_GRAD_OP в FSDP с учетом текущих концепций FSDP?

    shardingfsdp
  • 33

    Чем именно жертвует activation checkpointing и как выбрать границы checkpoint?

    checkpointactivationact-checkpoint
  • 34

    Что вызывает graph breaks в torch.compile и как исследовать их влияние на training experiment?

    experiments
  • 35

    Как построить надёжный microbenchmark CUDA kernel до заявления об ускорении?

    cuda
  • 36

    Как jit, vmap и grad сочетаются в JAX и какие ограничения они накладывают?

    jax
  • 37

    Как JAX device mesh и PartitionSpec описывают sharded computation?

    shardingpartitioningjax
  • 38

    Почему JAX использует явные PRNG keys и как управлять ими в параллельных экспериментах?

    experimentsjax
  • 39

    Как выбрать веса смеси многодоменных данных для pretraining?

  • 40

    Как выбрать и проверить threshold дедупликации training data?

    dedupvalidationqueries
  • 41

    Как провести аудит загрязнения benchmark в большом training corpus?

    contamination
  • 42

    Как измерить и повысить согласие annotators для preference data?

  • 43

    Как распознать насыщение benchmark и что с ним делать?

  • 44

    Как оценить и улучшить калибровку вероятностей research-модели?

    probabilitycalibrationdecision-making
  • 45

    Как спроектировать subgroup slices, не превратив evaluation в поиск удобных метрик?

    designmonitoring
  • 46

    Что должны фиксировать golden-trace replay и eval contract для воспроизводимого model research?

    reproducibility
  • 47

    Какие objective и data-решения важнее всего при supervised fine-tuning языковой модели?

    supervised
  • 48

    Как reward model обучается по парным preferences?

    reward-model
  • 49

    Какую роль reference model и beta играют в DPO?

    dpo
  • 50

    Какие разные роли clipping PPO и KL penalty играют в RLHF?

    pporlhfdistinct
  • 51

    На шаге 18 000 включается auxiliary objective, после чего main loss один раз резко растёт и восстанавливается. Как проверить валидность intervention?

    validation
  • 52

    Distributed refactor меняет порядок reduction градиентов, а заявленный eval-gain равен лишь 0,2 пункта. Как проверить влияние численного порядка?

    refactoringdistributed
  • 53

    Один rank постоянно на 18% медленнее остальных 63 и удлиняет хвост каждого collective. Как найти причину straggler?

  • 54

    DataLoader хорошо питает 8 GPU, но при масштабировании того же прогона на 64 GPU появляются многосекундные паузы. Как вы будете искать причину?

    dataloader
  • 55

    Каталог distributed checkpoint существует, но rank 37 не дописал свой optimizer shard. Что вы сделаете?

    checkpointshardingdistributed
  • 56

    Resumed curriculum-run переходит от общих данных к математике и позже обгоняет непрерывный control. Как проверить результат?

    validation
  • 57

    Прогон FSDP FULL_SHARD всё равно падает с OOM на 8 GPU, хотя оценки памяти параметров и optimizer state укладываются. Что вы проверите?

    estimationoptimizationfsdp
  • 58

    Вы сохранили FSDP-прогон на 8 GPU и должны возобновить его на 16 GPU. Как обеспечить переносимость state dict между world sizes?

    fsdp
  • 59

    После добавления fused RMSNorm extension torch.compile вставляет по одному graph break на каждый Transformer block и работает медленнее eager mode. Как это исправить?

    nlptransformer
  • 60

    Fused bias-GELU autograd function проходит gradcheck для одной строки, но падает на входе размером 7 на 128 только по gradient bias. Что вы проверите?

    autograd
  • 61

    Triton kernel работает быстро, но незаметно возвращает неверные значения для некоторых нечётных длин последовательности. Как вы будете его отлаживать?

    triton
  • 62

    Ваш новый Triton kernel лишь в 1,05 раза быстрее PyTorch baseline. Что вы спрофилируете до заявления об успешной оптимизации?

    pytorchtritonoptimization
  • 63

    В исследовании precision FP16 получает дополнительные данные взамен пропущенных updates, а BF16 останавливается на token budget. Почему сравнение невалидно?

    precisionbf16tokens
  • 64

    Gradient accumulation даёт целевой batch size, но результат меняется, когда у ranks разное число валидных токенов. В чём ошибка?

    tokensbatch
  • 65

    Config данных задаёт доменам веса 70%, 20% и 10%, но ledger consumed tokens показывает 84%, 11% и 5%. Как проверить реальную mixture?

    tokensvalidationconfig
  • 66

    Воспроизведение использует опубликованные weights, но его первое optimizer update отличается от авторского прогона. Как исследовать mismatch optimizer state?

    optimization
  • 67

    Effective batch вырос в 8 раз после изменения world size и accumulation. Как вы скорректируете learning rate?

    optimizationbatch
  • 68

    Preemption происходит в среднем раз в шесть часов, а синхронный checkpoint останавливает все GPU на 90 секунд. Как выбрать cadence с минимальной ожидаемой потерей compute?

    checkpointhardware
  • 69

    Во время distributed run отказывает один узел. Что может восстановить elastic restart и где вы зададите пределы?

    distributed
  • 70

    Run на 32 GPU показывает лишь 35% utilization в nvidia-smi. Как рассчитать model FLOPs utilization и объяснить разницу?

    flopshardware
  • 71

    Eval scores незаметно регрессируют после рефакторинга eval harness, хотя checkpoint не менялся. Как вы будете исследовать проблему?

    checkpointrefactoring
  • 72

    Вы подозреваете, что benchmark examples в training corpus завысили score. Как проверить влияние данных вместо нового overlap search?

    test-data
  • 73

    Команда проводит evaluation после каждого нового seed и останавливается, как только p становится меньше 0,05. Как контролировать sequential peeking?

    pitfallsdecision-making
  • 74

    Adaptive sweep выбрал одного победителя из 30 ablations. Как спроектировать независимое confirmatory study?

    design
  • 75

    Как применить item-response analysis, чтобы понять, различает ли benchmark сильные модели?

  • 76

    Agreement annotators остаётся стабильным, но preference labels меняются между ежемесячными партиями. Как обнаружить temporal rubric drift?

    batchiac
  • 77

    Как до дорогой human evaluation определить, сможет ли она обнаружить preference gain в три пункта?

  • 78

    Synthetic-data branch не даёт gain против дополнительных реальных данных при фиксированных FLOPs. Когда вы его закроете?

    flops
  • 79

    Auxiliary objective по коду повышает общий score на два пункта, но снижает mathematical reasoning на три. Как проверить capability interference и принять решение?

    aggregation
  • 80

    Schema eval-traces должна перейти с version 2 на version 3 без потери сравнимости многолетних результатов. Как построить migration bridge?

    schemamigrations
  • 81

    Mixture-of-experts run начинает отправлять 70% токенов двум experts. Как диагностировать expert collapse?

    tokensmoe
  • 82

    Команда предлагает attention sinks и RoPE position interpolation для исправления long-context quality. Как оценить их как разные механизмы?

    ropelong-contextdecision-making
  • 83

    DPO улучшает blinded helpfulness, но вызывает явную regression reasoning. Как вы отреагируете?

    dpo
  • 84

    Reward model хорошо работает на validation set, но теряет accuracy на новой партии preferences. Как проверить validation overfitting?

    overfittingreward-modelbatch
  • 85

    Во время PPO reference KL вырастает в шесть раз, после чего reward рушится вместе с held-out quality. Что вы сделаете?

    ppo
  • 86

    Loss SFT-прогона падает, но sampled chats выводят user markers и продолжаются после assistant turn. Как отладить chat template?

    sft
  • 87

    Как провести ablation фильтров synthetic-data pipeline, не смешивая качество фильтра с размером dataset?

    pipelinesci-cd
  • 88

    Distilled student отстаёт от teacher на 13 пунктов. Как отделить предел capacity от провала distillation?

    capacitymodel-compression
  • 89

    Какие инварианты verifier и correction path нужно проверить в реализации speculative decoding?

    spec-decode
  • 90

    У multimodal model улучшается text loss, пока image-conditioned quality падает. Как диагностировать modality imbalance?

    multimodal
  • 91

    Вы владеете очередью из 40 sweep proposals, но за неделю можно запустить только 10. Как сделать очередь evidence-gated?

    data-structures
  • 92

    У лучшего run в dashboard нет полного lineage record. Что вы сделаете с результатом?

    lineage
  • 93

    Theoretical FLOPs report и счёт scheduler в GPU-hours расходятся на 28%. Как их сверить?

    flopsconflicthardware
  • 94

    Как вы будете наставлять junior research engineer во время его первого ablation?

    mentoring
  • 95

    PR заявляет воспроизведение новой статьи об attention, но меняет 900 строк в модели и training configs. Какие проверки вы потребуете?

    config
  • 96

    Как вы внесёте Triton kernel в open-source research library?

    triton
  • 97

    Collaborator оспаривает ваш reported gain и говорит, что его rerun дал отрицательный результат. Как разрешить спор?

  • 98

    Deadline статьи наступает до завершения запланированных пяти seed. Что вы сделаете?

    estimation
  • 99

    На каком из 40 commits регрессировал научный результат? Как провести bisect без полного retraining каждой revision?

    retraining
  • 100

    Как выбрать следующий experiment по expected information per GPU-hour?

    experimentshardware