Вопросы на собеседовании: Data Scientist
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Junior.
Смотреть пример резюме: Data Scientist →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Среднее, медиана и мода по-разному описывают центр набора данных.
- Среднее является арифметическим средним и лучше всего подходит для примерно симметричных данных.
- Медиана является серединным значением отсортированного ряда и устойчива к выбросам и скосу в данных вроде доходов или длительности сессий.
- Мода является самым частым значением и подходит для категориальных данных, например типа устройства.
- Совместное использование среднего и медианы помогает выявить скос, поскольку большой разрыв предупреждает, что одно из этих чисел может ввести в заблуждение.
Зачем это спрашивают: Сценарии применения каждой меры плюс разрыв среднее-медиана как диагностика показывают рабочий статистический инстинкт.
Дисперсия и стандартное отклонение измеряют разброс значений вокруг среднего.
- Дисперсия является средним квадратом отклонения от среднего.
- Стандартное отклонение является корнем из дисперсии и выражается в исходных единицах, например в долларах, а не долларах в квадрате.
- Товары с одинаковыми средними продажами, но разными стандартными отклонениями требуют разного планирования, поскольку для более волатильного нужен больший страховой запас и более точный прогноз.
Зачем это спрашивают: Пункт про одинаковые единицы и бизнес-следствие превращают определения в понимание.
Перцентили и межквартильный размах описывают положение и разброс данных без опоры на одно среднее.
- P-й перцентиль является значением, ниже которого лежит p процентов наблюдений, поэтому задержка в две секунды на 95-м перцентиле означает, что 95 процентов запросов выполняются быстрее.
- Квартили являются 25-м, 50-м и 75-м перцентилями.
- Межквартильный размах является расстоянием от 25-го до 75-го перцентиля и измеряет разброс без учёта крайних хвостов.
- Перцентили лучше общего среднего показывают, с чем сталкиваются конкретные группы пользователей.
Зачем это спрашивают: Связь перцентилей с пользовательским опытом, а не с формулами - прикладной взгляд, который хотят интервьюеры.
Распределение считается скошенным, когда один его хвост намного длиннее другого.
- Правый скос часто встречается в данных о деньгах и длительности.
- Длинный хвост тянет среднее к себе, а медиана остаётся устойчивее, поэтому при сильном правом скосе среднее может быть намного выше типичного наблюдения.
- Перед выбором сводной статистики или передачей сырой переменной в модель, предполагающую симметрию, нужно проверить форму распределения по гистограмме.
Зачем это спрашивают: Сначала-посмотри-на-форму - привычка, которую проверяет этот вопрос сверх определения.
Нормальное распределение имеет симметричную колоколообразную форму с центром в среднем значении.
- Около 68 процентов значений лежат в пределах одного стандартного отклонения от среднего, а около 95 процентов лежат в пределах двух.
- Оно часто встречается потому, что суммы и средние множества малых независимых эффектов стремятся к нормальности согласно центральной предельной теореме.
- Ошибки измерений служат классическим примером этой закономерности.
- Бизнес-метрики вроде выручки и задержек часто сильно скошены, поэтому нормальность нужно проверять, а не предполагать.
Зачем это спрашивают: Оговорка проверяй-не-предполагай отделяет практиков от пересказчиков учебника.
Центральная предельная теорема говорит, что с ростом выборки распределение выборочных средних стремится к нормальному независимо от формы исходного распределения.
- Благодаря этому можно строить доверительные интервалы и тесты для средних, даже когда исходные данные скошены.
- Приближение становится полезным только при достаточном числе наблюдений.
- Малые выборки и тяжёлые хвосты могут сделать его ненадёжным, поэтому у теоремы есть условия применимости.
Зачем это спрашивают: Формулировка, что именно ЦПТ разрешает на практике, вывод о средних, - проверяемое понимание.
Генеральная совокупность является всей интересующей группой, а выборка является фактически наблюдаемым подмножеством.
- Хорошая выборка репрезентативна, то есть каждая значимая часть совокупности имеет равный шанс попасть в неё.
- Рандомизация помогает обеспечить такой шанс.
- Больший размер повышает точность, но репрезентативность важнее, поскольку смещённая выборка из миллиона наблюдений может очень точно ответить не на тот вопрос.
Зачем это спрашивают: Репрезентативность-важнее-размера - ключевой инсайт, и пример со смещённым миллионом доказывает, что он усвоен.
Смещение выборки возникает, когда наблюдаемые данные систематически исключают значимые части совокупности.
- Смещение самоотбора появляется, когда в данные опроса входят только пользователи, решившие ответить.
- Ошибка выжившего появляется, когда модель оттока видит только клиентов, которые оставались достаточно долго для накопления истории, и упускает быстро ушедших.
- Обобщение наблюдений за будни на выходные смешивает разные группы.
- Смещённые данные могут выглядеть совершенно чистыми, поэтому до анализа нужно выяснить, как они появились и кого в них нет.
Зачем это спрашивают: Рамка кого-не-хватает и вопрос о происхождении данных показывают зрелый скепсис к данным.
Корреляция показывает, что две переменные меняются вместе, а причинность означает, что изменение одной действительно меняет другую.
- Продажи мороженого коррелируют с утоплениями, потому что лето влияет на оба показателя.
- Пользователи функции могут удерживаться лучше потому, что вовлечённые люди и чаще пользуются функциями, и дольше остаются, а не из-за влияния самой функции.
- Наблюдательные данные подтверждают корреляционные выводы, а причинные выводы требуют экспериментов вроде A/B-тестов или аккуратных каузальных методов.
- Путаница между корреляцией и причинностью может привести к дорогим ошибочным решениям.
Зачем это спрашивают: Механизм скрытой общей причины и требование эксперимента - две части, которые обязаны прозвучать обе.
Коэффициент корреляции Пирсона измеряет направление и силу линейной связи в диапазоне от минус единицы до единицы.
- Знак показывает направление, модуль показывает силу, а ноль означает отсутствие линейной связи.
- Коэффициент не видит нелинейные закономерности, поэтому даже идеальная U-образная зависимость может дать значение около нуля.
- Он чувствителен к выбросам, поскольку одна экстремальная точка может создать или уничтожить видимую корреляцию.
- Всегда нужно смотреть на диаграмму рассеяния, потому что одинаковые коэффициенты могут скрывать совершенно разные связи.
Зачем это спрашивают: Названные нелинейность и хрупкость к выбросам с графиком как противоядием завершают ответ.
Парадокс Симпсона возникает, когда тренд во всех подгруппах меняется на противоположный после их объединения.
- Разные размеры групп работают как скрытые веса в общем результате.
- Например, каждый факультет может принимать женщин чаще, хотя общая доля выглядит ниже, если женщины чаще подавали документы на более конкурентные факультеты.
- Перед доверием к агрегированному показателю нужно проверять важные выводы по значимым сегментам, поскольку изменения состава групп могут искажать дашборды.
Зачем это спрашивают: Распознавание агрегации как источника перевёрнутых выводов - базовая аналитическая защита, которая проверяется.
Независимые события не меняют вероятности друг друга, а условная вероятность учитывает уже известную информацию.
- Для независимых событий совместная вероятность равна произведению их отдельных вероятностей.
- Условная вероятность P(A при B) является вероятностью A после того, как стало известно о наступлении B.
- Зависимость означает, что P(A при B) отличается от P(A).
- В data science часто задают условные вопросы, например о вероятности оттока при условии, что пользователь перестал открывать приложение.
Зачем это спрашивают: Переформулировка бизнес-вопросов в условные вероятности показывает, что концепция рабочая, а не формальная.
Теорема Байеса обновляет исходную оценку с учётом новых данных и распространённости целевого события.
- Вероятность болезни после положительного теста зависит и от точности теста, и от распространённости болезни.
- Тест с точностью 99 процентов для болезни, встречающейся у одного человека из тысячи, даёт примерно десять ложных тревог на один настоящий случай из-за огромного числа здоровых людей.
- Та же логика действует в обнаружении мошенничества и фильтрации спама, поэтому при редкой цели даже хороший классификатор может выдавать много ложных срабатываний.
Зачем это спрашивают: Расчёт базовой частоты, применённый к фроду или спаму, показывает настоящее владение, а не вспоминание формулы.
P-value показывает, насколько неожиданным был бы наблюдаемый результат при верной нулевой гипотезе.
- Формально это вероятность получить данные не менее экстремальные, чем наблюдаемые, при нулевой гипотезе.
- Это не вероятность истинности нулевой гипотезы и не вероятность практической важности результата.
- Маленький p-value может сопровождать крошечный эффект, который статистически значим, но практически бесполезен.
- Вместе с p-value нужно сообщать размер эффекта, чтобы показать его практическую важность.
Зачем это спрашивают: Для зачёта должны прозвучать и корректное определение, и оба классических неверных прочтения.
Проверка гипотез сравнивает наблюдаемые данные с предсказанием нулевой гипотезы по заранее выбранному порогу.
- До просмотра результатов нужно задать нулевую гипотезу, обычно об отсутствии эффекта или различия, альтернативную гипотезу и уровень значимости, например 0.05.
- Затем нужно вычислить p-value и отвергнуть нулевую гипотезу в пользу альтернативной, если значение ниже порога.
- Порог 0.05 допускает примерно одну ложную тревогу на двадцать тестов на чистом шуме.
- Поэтому множество тестов без поправки приводит к ложным открытиям.
Зачем это спрашивают: Рамка бюджета ложных тревог и предупреждение о множественных тестах показывают прикладное понимание.
95-процентный доверительный интервал выражает точность оценки через процедуру повторных выборок.
- При многократном повторении выборки интервалы, построенные таким способом, содержали бы истинное значение совокупности в 95 процентах случаев.
- Оценка конверсии 5.2 процента плюс-минус 0.3 намного точнее той же оценки плюс-минус 3.
- Большие выборки и меньшая дисперсия дают более узкие интервалы.
- Если решение меняется в пределах интервала, данные пока не дают для него надёжного основания.
Зачем это спрашивают: Использование ширины интервала как проверки готовности решения - практический навык сверх определения.
Надёжный A/B-тест следует плану, заданному до запуска, и сохраняет случайное распределение.
- Случайное распределение должно обеспечить различие групп только по воздействию.
- Размер выборки и длительность нужно заранее зафиксировать расчётом мощности, а не останавливать тест при появлении красивого результата.
- До запуска нужно объявить одну основную метрику, а не искать эффект среди множества показателей.
- Подглядывание, ранняя остановка, неслучайное разделение и перебор двадцати метрик увеличивают число ложных срабатываний или ломают сравнение.
Зачем это спрашивают: Названные подглядывание и рыбалка по метрикам как классические грехи показывают контакт с настоящими экспериментами.
Выбросы нужно находить системно и обрабатывать в зависимости от их причины.
- Для поиска необычных наблюдений используют box plot, гистограммы, правило 1.5 IQR или экстремальные z-оценки.
- Ошибки данных нужно исправлять или удалять, а настоящие крайности вроде очень крупного клиента следует сохранять.
- Корректные экстремальные значения при необходимости обрабатывают устойчивыми статистиками, винзоризацией или отдельной отчётностью.
- Нельзя молча удалять точки, которые портят желаемую картину, поскольку выбросы могут оказаться главным результатом.
Зачем это спрашивают: Разберись-потом-решай вместо автоматического удаления - суждение, которое отсеивает этот вопрос.
Распределение вероятностей описывает возможные значения случайной величины и их вероятности.
- Дискретные распределения охватывают счётные исходы вроде покупок, кликов или дефектов и задают вероятность точных значений.
- Непрерывные распределения охватывают измерения вроде времени или веса, где вероятность относится к интервалам и описывается плотностью.
- Это различие определяет подходящие графики, сводные статистики и модели для переменной.
Зачем это спрашивают: Связь различия с выбором графиков и моделей заземляет абстрактное определение.
Распространённые распределения вероятностей соответствуют разным процессам возникновения данных.
- Биномиальное распределение моделирует число успехов в фиксированном числе испытаний, например конверсии среди тысячи посетителей.
- Распределение Пуассона моделирует число событий за интервал, например обращений в поддержку за час, и подходит для редких событий.
- Экспоненциальное распределение моделирует время ожидания между событиями, например время до следующего отказа.
- Нормальное распределение моделирует суммы и средние множества малых эффектов или шум измерений, но его применение к деньгам с тяжёлыми хвостами даёт систематически неверные выводы.
Зачем это спрашивают: Сопоставление распределений их порождающим историям - навык распознавания, который прощупывают интервьюеры.
Закрытые вопросы
- 21
Что такое математическое ожидание и как оно используется в решениях?
probability - 22
В чём разница между стандартным отклонением и стандартной ошибкой?
dispersioninference - 23
Как вы рассуждаете о том, достаточно ли велика выборка?
- 24
Вы сравниваете метрики этого месяца с прошлым и видите рост. Что может вас обмануть?
monitoring - 25
Как вы объясняете статистический результат нетехническому стейкхолдеру?
communicationstakeholder-management - 26
В чём разница между DataFrame и Series в pandas?
pandas - 27
Вам пришёл новый датасет в CSV. Какие первые шаги в pandas?
pandas - 28
Как фильтровать строки в pandas и на чём спотыкаются новички?
pandas - 29
Как работает groupby в pandas и как выглядит типичная агрегация?
pandasaggregation - 30
Что идёт не так при слиянии DataFrame и как защититься?
pandas - 31
Как вы работаете с пропущенными значениями в pandas?
missing-datapandas - 32
Для чего вы используете value_counts при осмотре данных?
pandas - 33
Почему векторизованные операции предпочтительнее apply с питоновской функцией в pandas?
pandaspython - 34
Что такое NumPy и почему он быстрее обычных питоновских списков?
numpypython - 35
Что такое broadcasting в NumPy на уровне интуиции?
numpy - 36
В чём разница между loc и iloc?
pandas - 37
Как находить и обрабатывать дубликаты в pandas DataFrame?
pandas - 38
Как вы работаете с датами в pandas?
pandas - 39
Датасет больше вашей оперативной памяти. Какие варианты в Python?
python - 40
Как вы делаете свой анализ воспроизводимым?
reproducibility - 41
Какие привычки в Jupyter-ноутбуках отделяют чистую работу от хаоса?
python - 42
Что включает разведочный анализ данных и что вы в нём ищете?
exploratory - 43
Какой график вы выбираете под какой вопрос?
chart-choice - 44
Как читать box plot?
charts - 45
Что делает визуализацию вводящей в заблуждение, даже ненамеренно?
dataviz - 46
Чем хороша тепловая карта корреляций и где она обманывает?
correlationcharts - 47
Какой SQL необходим дата-сайентисту для выборки данных под моделирование?
sql - 48
За чем следить при джойне таблиц для сборки модельного датасета?
- 49
Когда вы агрегируете в SQL, а когда в pandas?
sqlaggregationpandas - 50
Как вы сэмплируете данные для прототипирования и что сэмплирование может сломать?
samplingprototypes - 51
В чём разница между обучением с учителем и без учителя?
supervisedunsupervised - 52
В чём разница между классификацией и регрессией?
classification - 53
Зачем делить данные на обучающую и тестовую выборки и как?
train-test - 54
Что такое переобучение и как его обнаружить?
overfitting - 55
Объясните компромисс bias-variance и его влияние на выбор модели.
bias-variancedispersion - 56
Что такое кросс-валидация и почему она важна?
cross-validationvalidation - 57
Что такое утечка данных и как она выглядит на практике?
leakage - 58
Как работает линейная регрессия и что джуну знать о её предпосылках?
regression - 59
Как интерпретировать коэффициенты линейной регрессии?
regression - 60
В чём разница между MSE, RMSE и MAE?
evaluation - 61
Что говорит R-квадрат и каковы его пределы?
evaluation - 62
Что делает логистическая регрессия и как читать её выход?
regression - 63
Как работает дерево решений и каковы его сильные и слабые стороны?
trees - 64
Как удержать дерево решений от переобучения?
overfittingtrees - 65
Как работает метод k ближайших соседей и что нужно обработать, чтобы он прилично работал?
knn - 66
Что такое случайный лес и почему он бьёт одиночное дерево?
ensemblestrees - 67
Что такое градиентный бустинг на уровне интуиции и где здесь XGBoost?
boosting - 68
Как работает кластеризация k-means и как выбирать число кластеров?
clustering - 69
Когда точность как метрика обманывает?
monitoring - 70
Объясните precision и recall и компромисс между ними.
evaluation - 71
Как читать матрицу ошибок?
evaluation - 72
Что такое F1 и когда это правильная метрика?
monitoring - 73
Что измеряет ROC AUC на уровне интуиции?
evaluation - 74
Как вы работаете с несбалансированными датасетами?
imbalancedsoft-skills - 75
Зачем начинать с простой бейзлайн-модели?
modeling - 76
Что такое признак и как выглядит feature engineering на практике?
feature-engineering - 77
Как кодировать категориальные переменные и когда какой метод подходит?
feature-engineering - 78
У категориального признака тысячи уникальных значений. Что делаете?
distinct - 79
Что такое масштабирование признаков и каким моделям оно нужно?
scaling - 80
Как вы обрабатываете пропуски при подготовке признаков для модели?
missing-datasoft-skills - 81
Почему слишком много признаков вредит и какие есть простые подходы к отбору?
feature-selection - 82
Что такое утечка целевой в признаках и как её аудировать?
feature-engineering - 83
Зачем тройное разбиение на train, validation и test?
validation - 84
В чём разница между параметрами модели и гиперпараметрами?
hyperparameters - 85
Как практически работает подбор гиперпараметров?
hyperparameters - 86
Как понять, какие признаки двигают предсказания вашей модели?
explainability - 87
Что такое Pipeline в scikit-learn и какую проблему он решает?
ci-cd - 88
В чём разница между fit, transform и fit_transform и почему это важно?
sklearn - 89
Как вы представляете результаты модели бизнес-стейкхолдерам?
stakeholder-managementcommunication - 90
Проведите меня по ML-проекту из конца в конец.
ml - 91
Модель отлично выглядела офлайн, но плохо работает в продакшене. Что проверяете?
mlops - 92
Стейкхолдер просит AI, но задача решается простым правилом. Как отвечаете?
stakeholder-managementcommunication - 93
Ваш анализ противоречит тому, во что стейкхолдер твёрдо верит. Как это коммуницировать?
communicationstakeholder-management - 94
Дедлайн близко, а модель ещё можно улучшать. Как решаете, когда остановиться?
estimation - 95
Как вы продолжаете расти как джун-дата-сайентист?
- 96
Коллеге нужно продолжить ваш анализ. Что вы передаёте?
- 97
Сколько вы копаете проблему в одиночку, прежде чем попросить помощи?
- 98
Сеньор-дата-сайентист предлагает подход, который вы считаете ошибочным. Что делаете?
- 99
Как модель может быть несправедливой или смещённой и за чем следить джуну?
fairness - 100
Что делает портфолио-проект действительно убедительным для интервьюеров?