Skip to content

Вопросы на собеседовании: Data Scientist

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.

Смотреть пример резюме: Data Scientist

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

boostingensembles

Случайный лес обычно выбирают за устойчивость, а градиентный бустинг за максимальное качество на табличных данных.

  • Случайный лес независимо обучает глубокие деревья на бутстрап-выборках и случайных подмножествах признаков, затем усредняет их для снижения дисперсии.
  • Градиентный бустинг последовательно добавляет неглубокие деревья, уменьшая текущий лосс и смещение, но сильнее зависит от learning rate, числа деревьев и шума.
  • Я беру бустинг как основного кандидата на качество, а случайный лес как сильный базлайн или когда важны минимальный тюнинг, параллельное обучение и стабильные оценки важности.

Зачем это спрашивают: Рамка снижение дисперсии против снижения смещения, а не просто параллельно против последовательно, и отличает понимание от заученной таксономии.

boosting

Переобучение XGBoost я снижаю через размер шага, ёмкость деревьев, случайность и явную регуляризацию.

  • Уменьшаю learning_rate, увеличиваю число деревьев и включаю early stopping на нетронутой валидации, чтобы заменить несколько агрессивных шагов множеством малых.
  • Снижаю max_depth или повышаю min_child_weight, чтобы деревья не запоминали редкие паттерны, затем применяю subsample и colsample для их декорреляции.
  • Повышаю gamma для более строгого отбора сплитов, а lambda или alpha для штрафа весов листьев, оценивая изменения только на данных без обучения модели.

Зачем это спрашивают: Группировка ручек по механизму, размер шага, ёмкость дерева, случайность, штрафы, показывает, что кандидат тюнит с ментальной моделью, а не скопированной сеткой.

boosting

XGBoost и LightGBM после тюнинга часто дают похожее качество, но различаются ростом деревьев и поведением на больших данных.

  • LightGBM растит дерево по листьям, деля лист с максимальным снижением лосса, что эффективно, но на малых данных может создавать глубокие неровные ветви и переобучаться.
  • Классический XGBoost растёт по уровням и получается более сбалансированным, а гистограммы, сэмплинг и нативные категории ускоряют LightGBM на больших датасетах.
  • Я предпочитаю LightGBM для миллионов строк и быстрых итераций, совместно ограничивая num_leaves и max_depth, а в остальных случаях смотрю на экосистему и валидацию.

Зачем это спрашивают: Рост по листьям против роста по уровням со следствием для переобучения и есть содержательное различие, которое проверяют интервьюеры, за пределами он быстрее.

boostingownership

Градиентный бустинг строит аддитивную модель как градиентный спуск в пространстве функций.

  • Он начинает с константного предсказания и для каждого объекта считает градиент лосса по текущему предсказанию ансамбля.
  • Следующее дерево подгоняется под эти градиенты, его вклад умножается на learning rate и добавляется к ансамблю, после чего цикл повторяется.
  • Для квадратичной ошибки градиенты совпадают с остатками, а тот же механизм поддерживает другие дифференцируемые цели, включая логистический, квантильный и ранжирующий лосс.

Зачем это спрашивают: Формулировка градиентный спуск в пространстве функций и понимание остатков как частного случая квадратичного лосса отделяют настоящее понимание от народного объяснения.

Стандартная важность признаков в бустинге может отражать смещения обучающих данных, а не реальную предсказательную ценность.

  • Оценки по числу сплитов и gain завышают признаки с множеством точек разбиения, а коррелирующие признаки произвольно делят важность между собой.
  • Я ранжирую признаки пермутационной важностью на отложенных данных и применяю групповую пермутацию для совместной оценки коррелирующих переменных.
  • SHAP добавляет направление и вклад в отдельное предсказание, но решающая проверка состоит в переобучении без подозрительного признака и измерении изменения на валидации.

Зачем это спрашивают: Называние смещения к кардинальности сплитов и делёжки кредита при корреляции с выходом на пермутацию по отложенным данным показывает важность как измерение, а не декорацию.

explainabilitycommunicationstakeholder-management

SHAP показывает направление и величину вклада признаков в каждое отдельное предсказание.

  • Предсказание раскладывается относительно базового уровня, поэтому видно, какие признаки повысили или понизили конкретный скор, а не только их глобальный рейтинг.
  • Агрегации SHAP дают общую картину, dependence-графики показывают изменение эффектов и взаимодействия, а кластеры объяснений находят разные субпопуляции.
  • Со стейкхолдерами я использую разбор конкретных кейсов и проверку здравого смысла, отдельно уточняя, что SHAP объясняет поведение модели, а не причинные эффекты.

Зачем это спрашивают: Пообъектная знаковая атрибуция плюс оговорка объясняет модель, а не мир показывают SHAP, используемый корректно, а не как оракул.

SVM остаётся эффективным на малых и средних высокоразмерных датасетах, если соблюдать его геометрические требования.

  • Линейный SVM особенно силён на разреженных текстах с тысячами TF-IDF признаков, а ядра моделируют нелинейные границы через неявные отображения.
  • Масштабирование обязательно, поскольку зазор и RBF-расстояния зависят от геометрии, иначе признак с крупным масштабом начнёт доминировать.
  • Ядерные SVM плохо масштабируются после нескольких сотен тысяч объектов, вероятности требуют калибровки, а C и gamma нужно настраивать совместно.

Зачем это спрашивают: Знание, где SVM всё ещё выигрывает, высокоразмерные малые данные, и жёсткое требование масштабирования показывают практическую широту за пределами рефлекса бустинг для всего.

clustering

Бессмысленные сегменты k-means обычно указывают на нарушение геометрических предположений или неудачное пространство признаков.

  • K-means предполагает примерно сферические кластеры похожего размера и плотности в евклидовом расстоянии и всегда выдаёт k групп, даже если кластеров нет.
  • Я проверяю масштабирование, изучаю проекции PCA или UMAP и сравниваю silhouette score для разных k, допуская, что данные образуют одно непрерывное облако.
  • Если группам не хватает бизнес-смысла, я сначала перестраиваю признаки вокруг нужного поведения, потому что подбор другого k не исправит нерелевантные входы.

Зачем это спрашивают: Признание, что k-means всегда возвращает кластеры, и допрос пространства признаков раньше алгоритма и есть прощупываемая диагностическая зрелость.

clustering

DBSCAN даёт кластеры произвольной формы и явную обработку шума, но сильно зависит от осмысленной локальной плотности.

  • Он объединяет точки с минимум min_samples соседями в радиусе eps, не требует заранее заданного k и оставляет разреженные точки шумом.
  • Один eps не описывает кластеры с сильно разной плотностью, в высоких размерностях плотность размывается, а сам eps приходится выбирать по диагностике вроде локтя k-distance.
  • Я применяю DBSCAN к низкоразмерным пространственным или шумным данным, а для масштабируемых каплевидных кластеров выбираю k-means или гауссовы смеси, часто после снижения размерности.

Зачем это спрашивают: Провал один eps против переменной плотности и концентрация расстояний в высоких размерностях показывают DBSCAN, знакомый по использованию, а не по обещанию не нужен k.

regularization

L1 создаёт разреженные модели, а L2 обычно даёт более плавное и стабильное сжатие коэффициентов.

  • У L1 постоянный градиент штрафа и ромбовидная область ограничения с углами на осях, поэтому малые коэффициенты могут стать точными нулями.
  • L1 подходит для отбора признаков и разреженной интерпретации, а L2 распределяет вес между коррелирующими признаками и чаще служит надёжным дефолтом для предсказания.
  • Elastic net сочетает оба штрафа для коррелирующих групп, когда нужна разреженность, при этом признаки стандартизируют, а силу штрафа выбирают кросс-валидацией.

Зачем это спрашивают: Геометрическая интуиция углов на осях плюс различие поведения на коррелирующих признаках показывают регуляризацию понятой, а не пересказанной как разреженность против сжатия.

boostingregression

Логистическая регрессия может обойти бустинг, когда объём данных, представление или требования эксплуатации подходят линейной модели.

  • Она хорошо работает на малых датасетах и широких разреженных входах вроде текста или тяжёлого one-hot, где бустинг способен переобучиться.
  • Её легко разворачивать и аудировать, а вероятности часто лучше откалиброваны без постобработки, поэтому она остаётся обязательным базлайном.
  • Сырые коэффициенты выражают логарифм шансов, сравнимы только после масштабирования, нестабильны при корреляции и описывают связь, а не причинность.

Зачем это спрашивают: Называние калибровки и разреженных широких данных линейными победами плюс ловушки лог-шансов и нестабильности при корреляции показывают классический инструмент уважаемым и читаемым верно.

Деревянным и линейным моделям нужен разный препроцессинг, потому что они по-разному представляют связи.

  • Деревья делят данные по сохраняющим порядок порогам, поэтому масштабирование, нормализация и монотонные логарифмы не меняют сплиты и обычно бесполезны для XGBoost.
  • Линейным и дистанционным моделям нужно масштабирование, при скошенности помогают логарифмы, а нелинейность приходится задавать через бины, сплайны или взаимодействия.
  • Для деревьев я сосредотачиваюсь на кодировании категорий, смысле пропусков и доменных признаках вроде отношений, которые иначе потребовали бы множества сплитов.

Зачем это спрашивают: Знание инвариантности к монотонным преобразованиям и перенаправление усилий на отношения и кодировки показывают препроцессинг, подобранный под механику модели, а не ритуал.

knn

Метод k ближайших соседей ломается в высоких размерностях, потому что геометрическая близость перестаёт различать объекты.

  • Расстояния концентрируются, относительная разница между ближайшим и дальним соседом уменьшается, и ближайшая точка становится почти не осмысленнее случайной.
  • Объём пространства также делает фиксированный датасет разреженным, а нерелевантные измерения непропорционально разбавляют сигнал в метрике.
  • Для kNN, кластеризации и RBF-методов я снижаю размерность, обучаю эмбеддинги или метрику либо перехожу к деревьям, которые неявно отбирают полезные признаки.

Зачем это спрашивают: Концентрация расстояний как механизм, распространённый на ядра и кластеризацию, показывает проклятие размерности понятым как геометрия, а не лозунг.

Модель некалибрована, если её предсказанные вероятности не совпадают с наблюдаемыми частотами событий.

  • Если среди объектов со скором 0.9 позитивны лишь 60 процентов, reliability-диаграмма покажет отклонение от ожидаемых 90 процентов.
  • Усреднение в лесах часто избегает крайних значений, бустинг бывает сверхуверенным, а ресэмплинг при дисбалансе меняет базовую частоту в скорах.
  • Я калибрую на отложенных данных через Platt scaling для гладкой коррекции или изотоническую регрессию при достаточном объёме, особенно если вероятности определяют ценность, риск или порог.

Зачем это спрашивают: Reliability-диаграммы, модельно-специфичные причины искажений и знание, когда калибровка вообще важна, показывают вероятностные выходы как измерения.

algorithms

Стекинг оправдан, только когда разнообразные сильные модели добавляют достаточно качества для компенсации эксплуатационной сложности.

  • Разные алгоритмы, представления признаков или обучающие подмножества декоррелируют ошибки, позволяя мета-модели получить примерно один-три процента сверх лучшей базовой модели.
  • В соревновании такой прирост может решить всё, но в проде он должен окупить рост задержки, стоимости сервинга и сопровождения по сравнению с одним настроенным бустингом.
  • Мета-признаки обязаны быть out-of-fold предсказаниями на невидимых базовой модели строках, иначе утечка научит мета-модель доверять переобученным скорам.

Зачем это спрашивают: Out-of-fold мета-признаки как условие корректности и честная калькуляция продовой цены отделяют практиков от гонщиков за лидербордом.

Категориальному признаку с десятью тысячами уровней нужно компактное кодирование с защитой от утечки и редких значений.

  • One-hot создаёт десять тысяч разреженных колонок, расходует память и оставляет слишком мало данных для множества сплитов.
  • Лучше подходят нативные категории LightGBM или CatBoost, сглаженный out-of-fold target encoding либо устойчивые к утечке хеширование и частотное кодирование.
  • Я предпочитаю нативную поддержку, а иначе объединяю редкий хвост в категорию «прочее» и считаю сглаженные out-of-fold таргет-статистики, чтобы категории не запоминали метки.

Зачем это спрашивают: Out-of-fold расчёт со сглаживанием как правила безопасности target encoding показывает кандидата, обжёгшегося на стандартной утечке или выучившегося у обжёгшихся.

missing-datasoft-skills

Обработка пропусков должна учитывать модель, сохранять полезный сигнал отсутствия и не протаскивать артефакты сбора данных.

  • XGBoost и LightGBM принимают NaN напрямую и учат направление сплита для пропусков, часто используя их паттерн лучше импутации.
  • Линейным моделям и нейросетям нужна явная импутация, например медиана для скошенных чисел или отдельная категория, вместе с бинарным индикатором пропуска.
  • Отсутствие ответа или сигналов сенсора может быть предсказательным, но решения о сборе, связанные с исходом, создают утечку, которая исчезнет в проде.

Зачем это спрашивают: Деревья едят NaN плюс колонки-индикаторы для импутирующих моделей и различие информативной против протекающей пропущенности показывают пропуски как инженерию сигнала.

outliersconcurrency

Выбросы требуют разной обработки для разных моделей, а их происхождение определяет, исправлять значение или моделировать его.

  • Экстремальные наблюдения могут доминировать в регрессии с квадратичным лоссом и градиентах, смещать центроиды k-means и искажать настроенные скейлеры.
  • Деревья устойчивы к экстремальным значениям признаков благодаря порядковым сплитам, но крайние значения таргета всё равно искажают листья при квадратичном лоссе.
  • Я исправляю или удаляю подтверждённые ошибки, моделирую реальные экстремумы через MAE, Huber, логарифм или RobustScaler и ограничиваю хвост только при явном согласии бизнеса.

Зачем это спрашивают: Разделение устойчивости в пространстве признаков и таргета плюс триаж от происхождения зеркалят практические решения, которые навязывают реальные датасеты.

Мультиколлинеарность в первую очередь угрожает интерпретации коэффициентов, а не качеству предсказания.

  • Коррелирующие предикторы делают линейные коэффициенты нестабильными, увеличивают стандартные ошибки и могут менять знаки между выборками, а типичной диагностикой служит VIF.
  • Качество прогноза часто почти не меняется, и деревья переносят корреляцию, хотя оценки важности произвольно делят вклад внутри группы.
  • Для инференса я удаляю или объединяю переменные либо применяю ridge, для предсказания могу ничего не делать, а при интерпретации оцениваю коррелирующие признаки группами.

Зачем это спрашивают: Разделение ответа по цели, инференция против предсказания против интерпретации, снимает вечную путаницу, которую эта тема порождает на практике.

В новой табличной задаче я иду от тривиального базлайна к линейной модели, а затем к настроенному градиентному бустингу.

  • Предсказание мажоритарного класса или среднего задаёт нижнюю границу, а логистическая или линейная регрессия показывает, объясняет ли простая структура основную часть сигнала.
  • Бустинг становится главным кандидатом на качество, поскольку хорошо работает с разными масштабами, нелинейными порогами, взаимодействиями и пропусками на умеренных объёмах данных.
  • Для малых данных или строгой интерпретируемости я выбираю линейные модели, для текста, изображений и последовательностей нейросети, а сложность обязана честно обойти базлайн.

Зачем это спрашивают: Дисциплина от базлайна вверх с объяснением табличного доминирования бустинга через индуктивное смещение показывает выбор модели как рассуждение, а не моду.

Закрытые вопросы

  • 21

    Назовите самые коварные случаи утечки данных, которые вы знаете, и как каждый проявился бы до того, как его вскроет прод.

    leakage
  • 22

    Почему препроцессинг обязан подгоняться внутри фолдов кросс-валидации и что механически гарантирует Pipeline из sklearn?

    cross-validationvalidationci-cd
  • 23

    Вы строите признаки из истории поведения пользователей для модели оттока. Что здесь означает point-in-time корректность и как вы её энфорсите?

    churn
  • 24

    Зачем вообще удалять признаки, если бустинг сносно терпит нерелевантные, и чем различаются filter, wrapper и embedded отбор?

  • 25

    Когда PCA реально помогает модельному пайплайну, когда вредит и почему t-SNE и UMAP должны оставаться вне модели?

    ci-cd
  • 26

    Опишите корректный target encoding: почему наивная версия течёт и что чинят out-of-fold расчёт и сглаживание по отдельности?

  • 27

    Стоит ли вручную строить признаки-взаимодействия для градиентного бустинга, если деревья умеют учить взаимодействия сами?

    boosting
  • 28

    StandardScaler, MinMaxScaler, RobustScaler: как выбираете и для каких моделей выбор безразличен?

  • 29

    Вам нужны текстовые признаки в остальном табличной модели оттока, скажем содержимое тикетов поддержки. Какие варианты есть до глубокой модели?

    churn
  • 30

    Обучающие признаки считаются ночью в SQL, а прод скорит в реальном времени из данных приложения. Что ломается и что такое train-serve консистентность?

    sqlconsistency
  • 31

    Ваша фрод-модель имеет точность 99.4 процента, а команда по борьбе с фродом в ярости. Что случилось и как выбрать метрику, которая не соврёт?

    monitoring
  • 32

    Precision, recall и F1 зависят от порога классификации. Что это означает операционно и когда F1 остаётся неверной сводкой?

    classificationevaluation
  • 33

    ROC-AUC против PR-AUC: почему ROC-AUC обманчиво хорош на несбалансированных задачах и что вы репортите когда?

    evaluationimbalanced
  • 34

    Как вы выставляете порог классификации для задеплоенной модели, когда бизнес даёт реальные цены и ограничения ёмкости?

    classificationdeploymentcapacity
  • 35

    Стратифицированный k-fold, групповой k-fold, временной сплит: как выбрать схему кросс-валидации и на какой вопрос CV вообще отвечает?

    cross-validationvalidation
  • 36

    Кросс-валидация говорит 0.85, прод говорит 0.70. Перечислите правдоподобные причины и как бы вы их различили.

    cross-validationvalidation
  • 37

    Как кривые обучения подсказывают, собирать ли больше данных, добавлять признаки или упрощать модель?

  • 38

    После восьмидесяти итераций тюнинга против валидационного набора скор вырос с 0.81 до 0.84. Почему этому приросту не стоит верить и что защищает?

    validationiteration
  • 39

    RMSE, MAE, MAPE: как выбор меняет то, что учит регрессионная модель, и где каждая метрика обманывает?

    evaluation
  • 40

    Модель A набирает 0.742 в CV, модель B набирает 0.738. Команда хочет катить A. Что не так с этим рассуждением и что убедило бы вас в реальности разницы?

  • 41

    Почему вы настаиваете на тривиальном базлайне до любого настоящего моделирования и как выглядят базлайны по типам задач?

  • 42

    Вы построили модель ранжирования позиций для пользователей. Почему AUC остаётся неверной линзой и что реально меряют NDCG и MAP?

    evaluation
  • 43

    Общая метрика модели сильна, но вы не смотрели на сегменты. Что может прятаться в агрегате и какова ваша рутина сегментной оценки?

    aggregationmonitoring
  • 44

    Оффлайн-оценка улучшилась на 5 процентов, онлайн A/B-тест не показывает ничего. Что объясняет оффлайн-онлайн разрывы и как затянуть корреляцию?

    ab-testingcorrelation
  • 45

    Веса классов против оверсэмплинга против андерсэмплинга для несбалансированного классификатора: чем они различаются механически и каков ваш дефолт?

    imbalanced
  • 46

    Как работает SMOTE и какие режимы отказа заставляют многих практиков его избегать?

    imbalanced
  • 47

    Какие метрики вы реально репортите для сильно несбалансированной задачи и почему одного скаляра никогда не хватает?

    imbalancedmonitoring
  • 48

    Вы передискретизировали фрод до 30 процентов в обучении, и теперь модель говорит, что треть транзакций мошеннические. Что случилось и как починить вероятности?

    transactions
  • 49

    Когда экстремальный дисбаланс оправдывает переформулировку из классификации с учителем в детекцию аномалий и что это меняет?

    supervisedclassification
  • 50

    Набросайте ваш подход к модели детекции фрода из конца в конец: что делает фрод труднее стандартного классификационного туториала?

    classification
  • 51

    Почему случайный поиск обычно бьёт grid search при том же вычислительном бюджете и как вы задаёте пространство поиска?

    grid
  • 52

    Чем байесовская оптимизация инструментом вроде Optuna улучшает случайный поиск и что добавляют колбеки прунинга?

    bayesianoptimizationcallbacks
  • 53

    У вас бюджет тюнить только три-четыре гиперпараметра XGBoost или LightGBM. Какие вы берёте и почему?

    boostinghyperparameters
  • 54

    Опишите полный процесс от тюнинга до финальной модели, который не даёт обмануть самого себя, от поиска до артефакта в проде.

    artifacts
  • 55

    Как работает ранняя остановка в градиентном бустинге и какие тонкие ошибки вносит её оценочный набор?

    boostingownership
  • 56

    Когда тюнинг гиперпараметров перестаёт окупаться и куда уходят эти усилия вместо него?

    hyperparameters
  • 57

    Вы запускаете новую ранжирующую модель и должны доказать в A/B-тесте, что она бьёт действующую. Проведите меня через решения дизайна.

    ab-testingdesign
  • 58

    PM спрашивает, сколько пользователей нужно эксперименту с моделью. Какие входы гонят ответ и что вы делаете, когда трафика не хватает?

    experiments
  • 59

    Коллега смотрит дашборд эксперимента с моделью ежедневно и хочет остановиться, как только появится значимость. Объясните проблему и легитимные альтернативы.

    experiments
  • 60

    Вы репортите AUC 0.86 на тесте. Стейкхолдер спрашивает, насколько вы уверены. Как навесить честную неопределённость на метрики модели?

    evaluationcommunicationmonitoring
  • 61

    Ваш отчёт по эксперименту покрывает двенадцать метрик по восьми сегментам. В чём здесь проблема множественных сравнений и как справиться без паралича?

    experimentssoft-skillsmonitoring
  • 62

    До чтения любых метрик исхода в эксперименте с моделью какие проверки валидности вы гоняете на самом эксперименте?

    experimentsmonitoring
  • 63

    Первая неделя новой рекомендательной модели показывает сильный прирост вовлечения. Почему вы можете ему не верить и как отделить новизну от настоящего эффекта?

    engagement
  • 64

    Продукт хочет знать, вызывает ли программа лояльности удержание, но эксперимента не было, только наблюдательные данные. Что делает это трудным и что бы вы реально сделали?

    experimentsretention
  • 65

    Маркетинг таргетирует клиентов, наиболее склонных купить после скидки. Почему модель вероятности покупки остаётся неверным инструментом и что меняет uplift-моделирование?

    upliftprobability
  • 66

    Когда байесовский A/B-анализ реально помогает по сравнению с частотной версией и где люди им злоупотребляют?

    bayesian
  • 67

    Когда многорукий бандит подходит лучше классического A/B-теста и чем вы за это платите?

    ab-testingbandits
  • 68

    Ваша модель выигрывает по первичной метрике. Какие гардрейлы должны были следить и что происходит при деградации одного?

    guardrailsmonitoring
  • 69

    Вы тестируете ценовую модель в маркетплейсе и подозреваете, что пользователи воздействия влияют на контрольных. Что такое интерференция и как она меняет дизайн?

    pricingdesign
  • 70

    Что входит в пререгистрированный план анализа эксперимента с моделью и какую проблему решает его написание заранее?

    experiments
  • 71

    Вам нужен текстовый классификатор для тикетов поддержки. Проведите меня через эскалацию от базлайна к трансформеру с точками решения.

    nlpescalation
  • 72

    Что такое эмбеддинги и как использовать предобученные для задачи семантической похожести, ничего не обучая?

    nlp
  • 73

    Почему transfer learning стал дефолтом для задач с изображениями и от чего зависит решение файн-тюнить или брать признаки?

  • 74

    Ваша модель изображений отлично работает на курированном обучающем наборе и плохо на реальных пользовательских загрузках. Что происходит и что реально покупают аугментации?

    train-test
  • 75

    Два аннотатора разметили ваши обучающие данные и расходятся на 20 процентах позиций. Что это означает для модели и её оценки?

    conflict
  • 76

    Стейкхолдер читает p равно 0.03 как 97-процентный шанс, что эффект реален. Поправьте его и скажите, что p-value на самом деле такое.

    hypothesis-testingcommunicationstakeholder-management
  • 77

    Что на самом деле означает 95-процентный доверительный интервал и какая интерпретация чаще всего неверна?

    confidence-intervals
  • 78

    Определите ошибки первого и второго рода в контексте фрод-алертов и объясните, как вы их балансируете.

    hypothesis-testingalerting
  • 79

    Почему центральная предельная теорема важна для A/B-тестов и доверительных интервалов, которые вы строите ежедневно?

    confidence-intervalsclttesting
  • 80

    Вы сравниваете средний чек между двумя группами, а распределение сильно скошено вправо с выбросами. Валиден ли ещё t-тест и какие у вас варианты?

    distributionsoutliershypothesis-testing
  • 81

    Когда вы берёте хи-квадрат тест и каковы его предположения и пределы?

    hypothesis-testing
  • 82

    Продажи выросли в регионах, где вы увеличили рекламный бюджет. Почему это не доказывает, что реклама сработала, и что такое парадокс Симпсона?

    paradoxes
  • 83

    С десятью миллионами пользователей ваш тест выдаёт p меньше 0.001 на приросте конверсии 0.05 процента. Стоит ли катить?

  • 84

    У вас числовые, категориальные и текстовые колонки, кормящие одну модель. Как выстроить препроцессинг, чтобы он остался без утечек и деплоился?

    schemadeployment
  • 85

    Вам нужен шаг препроцессинга, которого нет в sklearn. Как построить его, чтобы он корректно встал в пайплайн?

    ci-cd
  • 86

    Как вы тюните гиперпараметр, живущий внутри шага пайплайна, и почему весь поиск можно обернуть в ещё один CV-цикл?

    hyperparametersci-cd
  • 87

    Точность вашей задеплоенной модели медленно падает. Различите data drift и concept drift и как бы вы определили, что у вас.

    mlopsdeploymentiac
  • 88

    Что вы реально мониторите у модели в проде помимо её точности?

    monitoring
  • 89

    Когда вы отдаёте предсказания ночными батчами против реального времени и что между ними меняется?

    batch
  • 90

    Как вы решаете, как часто переобучать модель, и что запускает внеплановое переобучение?

  • 91

    Вы переобучили модель, и оффлайн она выглядит лучше. Как выкатить её, не рискуя продом?

  • 92

    Модель в проде принимает решение, которое вы не можете объяснить, и вам нужно воспроизвести, как именно её обучали. Что должно было версионироваться?

  • 93

    Как вы объясняете выход модели нетехническому руководителю, которому по нему действовать?

    communication
  • 94

    PM просит вас построить модель машинного обучения для задачи, которой, как вы подозреваете, модель не нужна. Как вы это разруливаете?

    mlsoft-skills
  • 95

    Аналитик настаивает на добавлении признака, который, по-вашему, течёт информацией из будущего. Команда под давлением дедлайна. Что вы делаете?

    estimation
  • 96

    Стейкхолдер говорит предсказывать, какие клиенты уйдут, но не даёт ни определения, ни срока. Как превратить это в реальный проект?

    churncommunicationstakeholder-management
  • 97

    Расскажите о модели или проекте, который не удался, и что вы из этого вынесли.

    story
  • 98

    У вас бэклог из десяти возможных моделей и признаков, но время на два. Как вы приоритизируете?

    backlogprioritization
  • 99

    Посреди проекта вы обнаруживаете, что в базовом датасете серьёзные проблемы с качеством. Как вы действуете?

  • 100

    Как вы работаете с дата- и ML-инженерами, чтобы модель реально отгрузилась и осталась здоровой, а не умерла в ноутбуке?