Skip to content

Вопросы на собеседовании: Data Scientist

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Junior.

Смотреть пример резюме: Data Scientist

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

descriptive

Среднее, медиана и мода по-разному описывают центр набора данных.

  • Среднее является арифметическим средним и лучше всего подходит для примерно симметричных данных.
  • Медиана является серединным значением отсортированного ряда и устойчива к выбросам и скосу в данных вроде доходов или длительности сессий.
  • Мода является самым частым значением и подходит для категориальных данных, например типа устройства.
  • Совместное использование среднего и медианы помогает выявить скос, поскольку большой разрыв предупреждает, что одно из этих чисел может ввести в заблуждение.

Зачем это спрашивают: Сценарии применения каждой меры плюс разрыв среднее-медиана как диагностика показывают рабочий статистический инстинкт.

dispersion

Дисперсия и стандартное отклонение измеряют разброс значений вокруг среднего.

  • Дисперсия является средним квадратом отклонения от среднего.
  • Стандартное отклонение является корнем из дисперсии и выражается в исходных единицах, например в долларах, а не долларах в квадрате.
  • Товары с одинаковыми средними продажами, но разными стандартными отклонениями требуют разного планирования, поскольку для более волатильного нужен больший страховой запас и более точный прогноз.

Зачем это спрашивают: Пункт про одинаковые единицы и бизнес-следствие превращают определения в понимание.

percentiles

Перцентили и межквартильный размах описывают положение и разброс данных без опоры на одно среднее.

  • P-й перцентиль является значением, ниже которого лежит p процентов наблюдений, поэтому задержка в две секунды на 95-м перцентиле означает, что 95 процентов запросов выполняются быстрее.
  • Квартили являются 25-м, 50-м и 75-м перцентилями.
  • Межквартильный размах является расстоянием от 25-го до 75-го перцентиля и измеряет разброс без учёта крайних хвостов.
  • Перцентили лучше общего среднего показывают, с чем сталкиваются конкретные группы пользователей.

Зачем это спрашивают: Связь перцентилей с пользовательским опытом, а не с формулами - прикладной взгляд, который хотят интервьюеры.

distributions

Распределение считается скошенным, когда один его хвост намного длиннее другого.

  • Правый скос часто встречается в данных о деньгах и длительности.
  • Длинный хвост тянет среднее к себе, а медиана остаётся устойчивее, поэтому при сильном правом скосе среднее может быть намного выше типичного наблюдения.
  • Перед выбором сводной статистики или передачей сырой переменной в модель, предполагающую симметрию, нужно проверить форму распределения по гистограмме.

Зачем это спрашивают: Сначала-посмотри-на-форму - привычка, которую проверяет этот вопрос сверх определения.

distributions

Нормальное распределение имеет симметричную колоколообразную форму с центром в среднем значении.

  • Около 68 процентов значений лежат в пределах одного стандартного отклонения от среднего, а около 95 процентов лежат в пределах двух.
  • Оно часто встречается потому, что суммы и средние множества малых независимых эффектов стремятся к нормальности согласно центральной предельной теореме.
  • Ошибки измерений служат классическим примером этой закономерности.
  • Бизнес-метрики вроде выручки и задержек часто сильно скошены, поэтому нормальность нужно проверять, а не предполагать.

Зачем это спрашивают: Оговорка проверяй-не-предполагай отделяет практиков от пересказчиков учебника.

clt

Центральная предельная теорема говорит, что с ростом выборки распределение выборочных средних стремится к нормальному независимо от формы исходного распределения.

  • Благодаря этому можно строить доверительные интервалы и тесты для средних, даже когда исходные данные скошены.
  • Приближение становится полезным только при достаточном числе наблюдений.
  • Малые выборки и тяжёлые хвосты могут сделать его ненадёжным, поэтому у теоремы есть условия применимости.

Зачем это спрашивают: Формулировка, что именно ЦПТ разрешает на практике, вывод о средних, - проверяемое понимание.

sampling

Генеральная совокупность является всей интересующей группой, а выборка является фактически наблюдаемым подмножеством.

  • Хорошая выборка репрезентативна, то есть каждая значимая часть совокупности имеет равный шанс попасть в неё.
  • Рандомизация помогает обеспечить такой шанс.
  • Больший размер повышает точность, но репрезентативность важнее, поскольку смещённая выборка из миллиона наблюдений может очень точно ответить не на тот вопрос.

Зачем это спрашивают: Репрезентативность-важнее-размера - ключевой инсайт, и пример со смещённым миллионом доказывает, что он усвоен.

sampling

Смещение выборки возникает, когда наблюдаемые данные систематически исключают значимые части совокупности.

  • Смещение самоотбора появляется, когда в данные опроса входят только пользователи, решившие ответить.
  • Ошибка выжившего появляется, когда модель оттока видит только клиентов, которые оставались достаточно долго для накопления истории, и упускает быстро ушедших.
  • Обобщение наблюдений за будни на выходные смешивает разные группы.
  • Смещённые данные могут выглядеть совершенно чистыми, поэтому до анализа нужно выяснить, как они появились и кого в них нет.

Зачем это спрашивают: Рамка кого-не-хватает и вопрос о происхождении данных показывают зрелый скепсис к данным.

correlation

Корреляция показывает, что две переменные меняются вместе, а причинность означает, что изменение одной действительно меняет другую.

  • Продажи мороженого коррелируют с утоплениями, потому что лето влияет на оба показателя.
  • Пользователи функции могут удерживаться лучше потому, что вовлечённые люди и чаще пользуются функциями, и дольше остаются, а не из-за влияния самой функции.
  • Наблюдательные данные подтверждают корреляционные выводы, а причинные выводы требуют экспериментов вроде A/B-тестов или аккуратных каузальных методов.
  • Путаница между корреляцией и причинностью может привести к дорогим ошибочным решениям.

Зачем это спрашивают: Механизм скрытой общей причины и требование эксперимента - две части, которые обязаны прозвучать обе.

correlation

Коэффициент корреляции Пирсона измеряет направление и силу линейной связи в диапазоне от минус единицы до единицы.

  • Знак показывает направление, модуль показывает силу, а ноль означает отсутствие линейной связи.
  • Коэффициент не видит нелинейные закономерности, поэтому даже идеальная U-образная зависимость может дать значение около нуля.
  • Он чувствителен к выбросам, поскольку одна экстремальная точка может создать или уничтожить видимую корреляцию.
  • Всегда нужно смотреть на диаграмму рассеяния, потому что одинаковые коэффициенты могут скрывать совершенно разные связи.

Зачем это спрашивают: Названные нелинейность и хрупкость к выбросам с графиком как противоядием завершают ответ.

paradoxes

Парадокс Симпсона возникает, когда тренд во всех подгруппах меняется на противоположный после их объединения.

  • Разные размеры групп работают как скрытые веса в общем результате.
  • Например, каждый факультет может принимать женщин чаще, хотя общая доля выглядит ниже, если женщины чаще подавали документы на более конкурентные факультеты.
  • Перед доверием к агрегированному показателю нужно проверять важные выводы по значимым сегментам, поскольку изменения состава групп могут искажать дашборды.

Зачем это спрашивают: Распознавание агрегации как источника перевёрнутых выводов - базовая аналитическая защита, которая проверяется.

probability

Независимые события не меняют вероятности друг друга, а условная вероятность учитывает уже известную информацию.

  • Для независимых событий совместная вероятность равна произведению их отдельных вероятностей.
  • Условная вероятность P(A при B) является вероятностью A после того, как стало известно о наступлении B.
  • Зависимость означает, что P(A при B) отличается от P(A).
  • В data science часто задают условные вопросы, например о вероятности оттока при условии, что пользователь перестал открывать приложение.

Зачем это спрашивают: Переформулировка бизнес-вопросов в условные вероятности показывает, что концепция рабочая, а не формальная.

bayesian

Теорема Байеса обновляет исходную оценку с учётом новых данных и распространённости целевого события.

  • Вероятность болезни после положительного теста зависит и от точности теста, и от распространённости болезни.
  • Тест с точностью 99 процентов для болезни, встречающейся у одного человека из тысячи, даёт примерно десять ложных тревог на один настоящий случай из-за огромного числа здоровых людей.
  • Та же логика действует в обнаружении мошенничества и фильтрации спама, поэтому при редкой цели даже хороший классификатор может выдавать много ложных срабатываний.

Зачем это спрашивают: Расчёт базовой частоты, применённый к фроду или спаму, показывает настоящее владение, а не вспоминание формулы.

hypothesis-testing

P-value показывает, насколько неожиданным был бы наблюдаемый результат при верной нулевой гипотезе.

  • Формально это вероятность получить данные не менее экстремальные, чем наблюдаемые, при нулевой гипотезе.
  • Это не вероятность истинности нулевой гипотезы и не вероятность практической важности результата.
  • Маленький p-value может сопровождать крошечный эффект, который статистически значим, но практически бесполезен.
  • Вместе с p-value нужно сообщать размер эффекта, чтобы показать его практическую важность.

Зачем это спрашивают: Для зачёта должны прозвучать и корректное определение, и оба классических неверных прочтения.

hypothesis-testing

Проверка гипотез сравнивает наблюдаемые данные с предсказанием нулевой гипотезы по заранее выбранному порогу.

  • До просмотра результатов нужно задать нулевую гипотезу, обычно об отсутствии эффекта или различия, альтернативную гипотезу и уровень значимости, например 0.05.
  • Затем нужно вычислить p-value и отвергнуть нулевую гипотезу в пользу альтернативной, если значение ниже порога.
  • Порог 0.05 допускает примерно одну ложную тревогу на двадцать тестов на чистом шуме.
  • Поэтому множество тестов без поправки приводит к ложным открытиям.

Зачем это спрашивают: Рамка бюджета ложных тревог и предупреждение о множественных тестах показывают прикладное понимание.

confidence-intervals

95-процентный доверительный интервал выражает точность оценки через процедуру повторных выборок.

  • При многократном повторении выборки интервалы, построенные таким способом, содержали бы истинное значение совокупности в 95 процентах случаев.
  • Оценка конверсии 5.2 процента плюс-минус 0.3 намного точнее той же оценки плюс-минус 3.
  • Большие выборки и меньшая дисперсия дают более узкие интервалы.
  • Если решение меняется в пределах интервала, данные пока не дают для него надёжного основания.

Зачем это спрашивают: Использование ширины интервала как проверки готовности решения - практический навык сверх определения.

ab-testing

Надёжный A/B-тест следует плану, заданному до запуска, и сохраняет случайное распределение.

  • Случайное распределение должно обеспечить различие групп только по воздействию.
  • Размер выборки и длительность нужно заранее зафиксировать расчётом мощности, а не останавливать тест при появлении красивого результата.
  • До запуска нужно объявить одну основную метрику, а не искать эффект среди множества показателей.
  • Подглядывание, ранняя остановка, неслучайное разделение и перебор двадцати метрик увеличивают число ложных срабатываний или ломают сравнение.

Зачем это спрашивают: Названные подглядывание и рыбалка по метрикам как классические грехи показывают контакт с настоящими экспериментами.

outliers

Выбросы нужно находить системно и обрабатывать в зависимости от их причины.

  • Для поиска необычных наблюдений используют box plot, гистограммы, правило 1.5 IQR или экстремальные z-оценки.
  • Ошибки данных нужно исправлять или удалять, а настоящие крайности вроде очень крупного клиента следует сохранять.
  • Корректные экстремальные значения при необходимости обрабатывают устойчивыми статистиками, винзоризацией или отдельной отчётностью.
  • Нельзя молча удалять точки, которые портят желаемую картину, поскольку выбросы могут оказаться главным результатом.

Зачем это спрашивают: Разберись-потом-решай вместо автоматического удаления - суждение, которое отсеивает этот вопрос.

distributionsprobabilitydata-types

Распределение вероятностей описывает возможные значения случайной величины и их вероятности.

  • Дискретные распределения охватывают счётные исходы вроде покупок, кликов или дефектов и задают вероятность точных значений.
  • Непрерывные распределения охватывают измерения вроде времени или веса, где вероятность относится к интервалам и описывается плотностью.
  • Это различие определяет подходящие графики, сводные статистики и модели для переменной.

Зачем это спрашивают: Связь различия с выбором графиков и моделей заземляет абстрактное определение.

distributions

Распространённые распределения вероятностей соответствуют разным процессам возникновения данных.

  • Биномиальное распределение моделирует число успехов в фиксированном числе испытаний, например конверсии среди тысячи посетителей.
  • Распределение Пуассона моделирует число событий за интервал, например обращений в поддержку за час, и подходит для редких событий.
  • Экспоненциальное распределение моделирует время ожидания между событиями, например время до следующего отказа.
  • Нормальное распределение моделирует суммы и средние множества малых эффектов или шум измерений, но его применение к деньгам с тяжёлыми хвостами даёт систематически неверные выводы.

Зачем это спрашивают: Сопоставление распределений их порождающим историям - навык распознавания, который прощупывают интервьюеры.

Закрытые вопросы

  • 21

    Что такое математическое ожидание и как оно используется в решениях?

    probability
  • 22

    В чём разница между стандартным отклонением и стандартной ошибкой?

    dispersioninference
  • 23

    Как вы рассуждаете о том, достаточно ли велика выборка?

  • 24

    Вы сравниваете метрики этого месяца с прошлым и видите рост. Что может вас обмануть?

    monitoring
  • 25

    Как вы объясняете статистический результат нетехническому стейкхолдеру?

    communicationstakeholder-management
  • 26

    В чём разница между DataFrame и Series в pandas?

    pandas
  • 27

    Вам пришёл новый датасет в CSV. Какие первые шаги в pandas?

    pandas
  • 28

    Как фильтровать строки в pandas и на чём спотыкаются новички?

    pandas
  • 29

    Как работает groupby в pandas и как выглядит типичная агрегация?

    pandasaggregation
  • 30

    Что идёт не так при слиянии DataFrame и как защититься?

    pandas
  • 31

    Как вы работаете с пропущенными значениями в pandas?

    missing-datapandas
  • 32

    Для чего вы используете value_counts при осмотре данных?

    pandas
  • 33

    Почему векторизованные операции предпочтительнее apply с питоновской функцией в pandas?

    pandaspython
  • 34

    Что такое NumPy и почему он быстрее обычных питоновских списков?

    numpypython
  • 35

    Что такое broadcasting в NumPy на уровне интуиции?

    numpy
  • 36

    В чём разница между loc и iloc?

    pandas
  • 37

    Как находить и обрабатывать дубликаты в pandas DataFrame?

    pandas
  • 38

    Как вы работаете с датами в pandas?

    pandas
  • 39

    Датасет больше вашей оперативной памяти. Какие варианты в Python?

    python
  • 40

    Как вы делаете свой анализ воспроизводимым?

    reproducibility
  • 41

    Какие привычки в Jupyter-ноутбуках отделяют чистую работу от хаоса?

    python
  • 42

    Что включает разведочный анализ данных и что вы в нём ищете?

    exploratory
  • 43

    Какой график вы выбираете под какой вопрос?

    chart-choice
  • 44

    Как читать box plot?

    charts
  • 45

    Что делает визуализацию вводящей в заблуждение, даже ненамеренно?

    dataviz
  • 46

    Чем хороша тепловая карта корреляций и где она обманывает?

    correlationcharts
  • 47

    Какой SQL необходим дата-сайентисту для выборки данных под моделирование?

    sql
  • 48

    За чем следить при джойне таблиц для сборки модельного датасета?

  • 49

    Когда вы агрегируете в SQL, а когда в pandas?

    sqlaggregationpandas
  • 50

    Как вы сэмплируете данные для прототипирования и что сэмплирование может сломать?

    samplingprototypes
  • 51

    В чём разница между обучением с учителем и без учителя?

    supervisedunsupervised
  • 52

    В чём разница между классификацией и регрессией?

    classification
  • 53

    Зачем делить данные на обучающую и тестовую выборки и как?

    train-test
  • 54

    Что такое переобучение и как его обнаружить?

    overfitting
  • 55

    Объясните компромисс bias-variance и его влияние на выбор модели.

    bias-variancedispersion
  • 56

    Что такое кросс-валидация и почему она важна?

    cross-validationvalidation
  • 57

    Что такое утечка данных и как она выглядит на практике?

    leakage
  • 58

    Как работает линейная регрессия и что джуну знать о её предпосылках?

    regression
  • 59

    Как интерпретировать коэффициенты линейной регрессии?

    regression
  • 60

    В чём разница между MSE, RMSE и MAE?

    evaluation
  • 61

    Что говорит R-квадрат и каковы его пределы?

    evaluation
  • 62

    Что делает логистическая регрессия и как читать её выход?

    regression
  • 63

    Как работает дерево решений и каковы его сильные и слабые стороны?

    trees
  • 64

    Как удержать дерево решений от переобучения?

    overfittingtrees
  • 65

    Как работает метод k ближайших соседей и что нужно обработать, чтобы он прилично работал?

    knn
  • 66

    Что такое случайный лес и почему он бьёт одиночное дерево?

    ensemblestrees
  • 67

    Что такое градиентный бустинг на уровне интуиции и где здесь XGBoost?

    boosting
  • 68

    Как работает кластеризация k-means и как выбирать число кластеров?

    clustering
  • 69

    Когда точность как метрика обманывает?

    monitoring
  • 70

    Объясните precision и recall и компромисс между ними.

    evaluation
  • 71

    Как читать матрицу ошибок?

    evaluation
  • 72

    Что такое F1 и когда это правильная метрика?

    monitoring
  • 73

    Что измеряет ROC AUC на уровне интуиции?

    evaluation
  • 74

    Как вы работаете с несбалансированными датасетами?

    imbalancedsoft-skills
  • 75

    Зачем начинать с простой бейзлайн-модели?

    modeling
  • 76

    Что такое признак и как выглядит feature engineering на практике?

    feature-engineering
  • 77

    Как кодировать категориальные переменные и когда какой метод подходит?

    feature-engineering
  • 78

    У категориального признака тысячи уникальных значений. Что делаете?

    distinct
  • 79

    Что такое масштабирование признаков и каким моделям оно нужно?

    scaling
  • 80

    Как вы обрабатываете пропуски при подготовке признаков для модели?

    missing-datasoft-skills
  • 81

    Почему слишком много признаков вредит и какие есть простые подходы к отбору?

    feature-selection
  • 82

    Что такое утечка целевой в признаках и как её аудировать?

    feature-engineering
  • 83

    Зачем тройное разбиение на train, validation и test?

    validation
  • 84

    В чём разница между параметрами модели и гиперпараметрами?

    hyperparameters
  • 85

    Как практически работает подбор гиперпараметров?

    hyperparameters
  • 86

    Как понять, какие признаки двигают предсказания вашей модели?

    explainability
  • 87

    Что такое Pipeline в scikit-learn и какую проблему он решает?

    ci-cd
  • 88

    В чём разница между fit, transform и fit_transform и почему это важно?

    sklearn
  • 89

    Как вы представляете результаты модели бизнес-стейкхолдерам?

    stakeholder-managementcommunication
  • 90

    Проведите меня по ML-проекту из конца в конец.

    ml
  • 91

    Модель отлично выглядела офлайн, но плохо работает в продакшене. Что проверяете?

    mlops
  • 92

    Стейкхолдер просит AI, но задача решается простым правилом. Как отвечаете?

    stakeholder-managementcommunication
  • 93

    Ваш анализ противоречит тому, во что стейкхолдер твёрдо верит. Как это коммуницировать?

    communicationstakeholder-management
  • 94

    Дедлайн близко, а модель ещё можно улучшать. Как решаете, когда остановиться?

    estimation
  • 95

    Как вы продолжаете расти как джун-дата-сайентист?

  • 96

    Коллеге нужно продолжить ваш анализ. Что вы передаёте?

  • 97

    Сколько вы копаете проблему в одиночку, прежде чем попросить помощи?

  • 98

    Сеньор-дата-сайентист предлагает подход, который вы считаете ошибочным. Что делаете?

  • 99

    Как модель может быть несправедливой или смещённой и за чем следить джуну?

    fairness
  • 100

    Что делает портфолио-проект действительно убедительным для интервьюеров?