Skip to content

Вопросы на собеседовании: MLOps-инженер

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.

Смотреть пример резюме: MLOps-инженер

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

ci-cdorchestrationpipelines

Оркестратор пайплайнов отделяет планирование процесса и управление состоянием от выполнения задач и хранения артефактов.

  • Парсер или компилятор превращает определение пайплайна в граф и проверяет структурные ограничения.
  • Планировщик находит готовые к запуску экземпляры задач по зависимостям, правилам запуска, квотам и состоянию запуска.
  • Исполнитель отправляет работу локальным процессам, очередям воркеров или кластеру, но сам задачу не выполняет.
  • Хранилище метаданных записывает запуски и состояния задач, а объектное хранилище или база данных содержит крупные результаты.

Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат оркестрацию как набор взаимодействующих компонентов уровня управления, а не как скрипт для запуска команд.

pipelinesci-cd

DAG задаёт конечный частичный порядок, в котором направленные рёбра выражают зависимости задач без циклов.

  • Задача становится доступной для запуска, только когда её предшествующие зависимости удовлетворяют настроенным правилам запуска.
  • Независимые ветви могут выполняться параллельно, потому что граф не задаёт порядок между ними.
  • Разветвление создаёт параллельные ветви, а соединение ожидает необходимые предшествующие ветви.
  • Цикл недопустим, потому что для циклических зависимостей нельзя построить топологический порядок выполнения.

Зачем это спрашивают: Сильный ответ отделяет семантику зависимостей от случайного порядка, в котором воркеры фактически выполняют задачи.

pipelinesci-cd

Компиляция строит проверенную исполняемую спецификацию, а среда выполнения создаёт конкретные запуски и управляет их состоянием.

  • Компиляция фиксирует компоненты, рёбра, плейсхолдеры параметров, условия и настройки выполнения в промежуточном представлении.
  • Статические проверки могут отклонить отсутствующие входы, несовместимые типы, циклы и некорректные определения компонентов до отправки.
  • Среда выполнения подставляет фактические параметры, создаёт экземпляры задач и вычисляет условия, значения которых пришли из предыдущих задач.
  • Среда выполнения записывает переходы состояний и передаёт доступную работу настроенной системе выполнения.

Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат отделять декларативное построение графа от управляющего цикла, который выполняет запуск.

pipelinesci-cd

Граница задачи должна охватывать один независимо исполняемый шаг с явным и стабильным контрактом входов и выходов.

  • Разделяйте шаги, которым нужны разные образы, профили ресурсов, политики повторов, владельцы или жизненные циклы кеша.
  • Оставляйте тесно связанные операции в памяти вместе, если материализация промежуточного результата добавит стоимость без повторного использования.
  • Отделяйте побочные эффекты вроде публикации модели от чистых преобразований, чтобы их политика выполнения была видна.
  • Избегайте слишком мелких задач, у которых расходы на планирование и запуск контейнера превышают полезную работу.

Зачем это спрашивают: Интервьюер ожидает обоснованный баланс между изоляцией и накладными расходами оркестрации.

ci-cdartifactspipelines

Задачи должны передавать через оркестратор ссылки на долговечные артефакты, а крупные данные хранить вне его базы метаданных.

  • Задача-производитель записывает неизменяемый объект или версионированный датасет в общее хранилище до публикации его URI.
  • Запись о результате должна включать тип, схему или формат, контрольную сумму, запуск-производитель и важные метаданные происхождения.
  • Задача-потребитель читает только объявленные входы, что сохраняет зависимости явными, а среды выполнения изолированными.
  • Атомарная публикация через финальное переименование, манифест или маркер коммита не даёт потребителям увидеть частичный результат.

Зачем это спрашивают: Сильный ответ рассматривает передачу артефактов как долговечный контракт с данными о происхождении, а не как общее состояние локальной файловой системы.

pipelinesci-cd

Расписание создаёт запуски для логических временных интервалов, а событие создаёт их при поступлении определённого внешнего факта.

  • Запуски по расписанию должны использовать логический интервал как вход, а не считать временем данных фактическое время выполнения.
  • Навёрстывание и заполнение истории материализуют пропущенные исторические интервалы согласно той же семантике расписания.
  • Событийные триггеры должны передавать стабильный идентификатор события и ссылку на данные для дедупликации повторной доставки.
  • Оба типа триггеров должны вести к одному параметризованному контракту пайплайна, чтобы выполнение оставалось воспроизводимым.

Зачем это спрашивают: Интервьюер проверяет понимание логического времени, исторических запусков и семантики доставки событий хотя бы один раз.

pipelinesidempotencyci-cd

Задача пайплайна идемпотентна, если повторное выполнение с теми же логическими входами сходится к тому же зафиксированному результату.

  • Формируйте пути результатов или ключи операций из партиции запуска, версий входов и значимых параметров.
  • Для внешних записей используйте upsert, compare-and-set или ограничения уникальности вместо безусловного добавления.
  • Сначала записывайте временный результат и открывайте к нему доступ только атомарным шагом коммита.
  • Регистрируйте завершённые побочные эффекты по ключу идемпотентности, чтобы повтор мог распознать предыдущее выполнение.

Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат делать повторы безопасными и для записи артефактов, и для внешних побочных эффектов.

pipelinesresilienceci-cd

Повторы следует разрешать только для временных классов сбоев и выполнять с ограниченной экспоненциальной задержкой и случайным разбросом.

  • Политике повторов нужен лимит попыток, чтобы постоянные ошибки не занимали ресурсы бесконечно.
  • Экспоненциальные задержки снижают давление на восстанавливающуюся зависимость, а случайный разброс предотвращает синхронные волны повторов.
  • Ошибки валидации, несовместимые схемы и неверные параметры должны завершаться без повтора, потому что повторение их не изменит.
  • Безопасность повторов зависит от идемпотентности задачи и одинакового контракта логических входов для каждой попытки.

Зачем это спрашивают: Сильный ответ связывает политику повторов с классификацией сбоев, контролем нагрузки и идемпотентным выполнением.

resilienceorchestrationci-cd

В оркестрации пайплайнов нужны отдельные лимиты времени для ожидания, выполнения задачи и всего запуска процесса.

  • Таймаут очереди ограничивает ожидание воркера или дефицитного ресурса до признания задачи неуспешной.
  • Таймаут выполнения ограничивает процесс задачи после фактического старта и должен оставлять время на корректное завершение до принудительной остановки.
  • Таймаут сенсора или внешней операции ограничивает общее время ожидания с учётом повторных проверок и отсрочек.
  • Таймаут процесса ограничивает запуск целиком, даже если каждая отдельная задача укладывается в собственный лимит.

Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат ожидание ресурсов от активного выполнения и общей длительности запуска.

pipelinescachingci-cd

Кеш задачи повторно использует результаты, только если ключ кеша отражает все входы, способные повлиять на результат.

  • Ключ обычно включает код компонента или дайджест образа, версии входных артефактов, параметры и значимую конфигурацию.
  • Кешированные артефакты должны оставаться неизменяемыми и доступными не меньше срока жизни записей об их метаданных.
  • Недетерминированные входы вроде текущего времени, случайных начальных значений или изменяемых внешних таблиц нужно зафиксировать или включить в ключ.
  • Кеширование следует отключать для намеренных побочных эффектов, например уведомлений или публикации модели.

Зачем это спрашивают: Интервьюер оценивает понимание корректности кеша, а не умение просто включить настройку платформы.

pipelinesci-cd

Возобновление пайплайна пропускает уже зафиксированные задачи, а сохранение контрольных точек позволяет восстановить прогресс внутри одного долгого вычисления.

  • Оркестратор возобновляет работу по сохранённым состояниям задач и проверяет доступность успешных результатов.
  • Возобновлённый запуск должен сохранять исходные параметры и версии входов, если намеренно не создан новый запуск.
  • Код обучения периодически записывает в долговечное хранилище контрольные точки с состояниями модели, оптимизатора, планировщика и хода обучения.
  • Восстановленная из контрольной точки задача всё равно должна публиковать финальный артефакт через обычный атомарный контракт результата.

Зачем это спрашивают: Сильный ответ отделяет восстановление состояния на уровне оркестратора от восстановления внутри кода обучения.

airflow

Планировщик Airflow превращает разобранные определения DAG и интервалы расписания в готовые к запуску экземпляры задач.

  • Обработчики DAG разбирают файлы и сериализуют структуру DAG, поэтому планирование не зависит от импорта кода на воркерах.
  • Планировщик создаёт DagRuns, проверяет зависимости задач и правила запуска и переводит доступные экземпляры к состоянию «в очереди».
  • До передачи задач исполнителю он применяет ограничения пулов, конкурентности DAG и максимального числа активных запусков.
  • Несколько планировщиков координируются через базу метаданных, чтобы решения о планировании оставались согласованными.

Зачем это спрашивают: Интервьюер проверяет знание управляющего цикла планирования Airflow и его координации через метаданные.

airflow

Исполнитель Airflow распределяет поставленные в очередь экземпляры задач по вычислительным ресурсам, а воркеры запускают процессы задач.

  • LocalExecutor запускает процессы задач на хосте планировщика и подходит для развёртывания на одной машине.
  • CeleryExecutor отправляет задачи через брокер постоянному пулу воркеров, которые получают и выполняют их.
  • KubernetesExecutor создаёт отдельный под для каждой задачи, позволяя выбирать собственный образ и запросы ресурсов.
  • Состояние задач и координация остаются на уровне управления Airflow, даже когда выполнение происходит на внешних воркерах.

Зачем это спрашивают: Сильный ответ объясняет абстракцию выполнения и эксплуатационные различия распространённых моделей исполнения.

airflow

Airflow XCom должен содержать небольшие значения или ссылки для обмена между задачами, а не крупные ML-артефакты.

  • Типичные значения включают URI объектного хранилища, идентификатор раздела, версию модели или компактные метаданные состояния.
  • По умолчанию строки XCom находятся в слое метаданных, поэтому крупные данные повышают расходы базы и сериализации.
  • Большие датасеты, контрольные точки и модели должны лежать в долговечном хранилище артефактов, а в XCom остаются только ссылки.
  • Пользовательский бэкенд XCom на объектном хранилище может выгружать сериализованные значения, но явные контракты артефактов понятнее.

Зачем это спрашивают: Интервьюер оценивает, соблюдает ли кандидат границу между метаданными оркестрации и хранением данных.

airflow

Режимы сенсоров Airflow отличаются тем, занимает ли ожидание слот воркера и как назначается следующая проверка.

  • В режиме poke задача ожидает внутри запущенного процесса и сохраняет за ней слот воркера между проверками.
  • Режим reschedule освобождает слот воркера и просит планировщик выполнить новую проверку позже.
  • Отложенный сенсор передаёт ожидание асинхронному компоненту triggerer и возобновляет задачу, когда срабатывает её триггер.
  • Для долгого ожидания обычно подходят отложенный режим или reschedule, а для коротких проверок может быть оправдан режим poke.

Зачем это спрашивают: Сильный ответ связывает семантику сенсоров с ёмкостью воркеров и архитектурой triggerer.

airflowci-cdcapacity

Пулы Airflow и ограничения конкурентности сдерживают разные области готовых к запуску экземпляров задач.

  • Пул представляет общий ресурс, например GPU-задачи или доступ к сервису с ограничением частоты запросов, а задачи занимают настроенное число слотов.
  • Глобальный параметр parallelism ограничивает число экземпляров задач во всей установке Airflow.
  • Ограничение конкурентности на уровне DAG задаёт число одновременных экземпляров задач одного DAG во всех активных запусках.
  • Параметр maximum active runs ограничивает пересекающиеся DagRuns и не даёт частому расписанию многократно увеличить нагрузку на последующие этапы.

Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат ограничения конкретного ресурса от глобальных ограничений и ограничений DAG.

ci-cdkubeflowcomponents

Спецификация компонента Kubeflow Pipelines определяет переносимый типизированный интерфейс и контейнерное выполнение его реализации.

  • Входы и выходы объявляют имена параметров или артефактов, типы и необязательные значения по умолчанию.
  • Секция контейнера фиксирует образ, команду, аргументы и плейсхолдеры, связывающие объявленные входы и выходы.
  • Запросы ресурсов, окружение, параметры кеширования и настройки конкретной платформы можно добавить при использовании компонента.
  • Стабильный контракт компонента позволяет авторам пайплайна менять версии реализации без изменения связей с последующими компонентами.

Зачем это спрашивают: Интервьюер оценивает, видит ли кандидат в компоненте Kubeflow типизированный контракт выполнения, а не произвольный код Python.

ci-cdartifactskubeflow

Kubeflow Pipelines использует параметры для небольших значений, а типизированные артефакты для долговечных файловых результатов.

  • Параметры переносят скалярные или структурированные управляющие значения, которые бэкенд подставляет в аргументы компонента.
  • Артефакты предоставляют путь или URI хранилища вместе с типом и метаданными, не встраивая сами данные в состояние пайплайна.
  • Среда выполнения назначает расположение входов и выходов и записывает происхождение артефактов в сервис метаданных.
  • Объявленные типы артефактов Dataset, Model и Metrics делают совместимость и происхождение видимыми между компонентами.

Зачем это спрашивают: Сильный ответ объясняет и границу данных, и работу метаданных при передаче артефактов Kubeflow.

ci-cdkubeflowpipelines

Компиляция Kubeflow превращает программу построения пайплайна в статический пакет PipelineSpec для отправки.

  • Вызовы компонентов становятся узлами задач с явными зависимостями, каналами входов, каналами выходов и плейсхолдерами.
  • Управляющие конструкции вроде условий, циклов и обработки завершения кодируются в промежуточном представлении.
  • Компилятор проверяет связи графа и совместимость типов, которые можно определить без значений среды выполнения.
  • Позже бэкенд создаёт запуск из пакета и разрешает параметры среды выполнения, расположение артефактов и платформенные детали выполнения.

Зачем это спрашивают: Интервьюер проверяет понимание того, что Python-код пайплайна строит спецификацию, а не запускает код компонентов напрямую.

argo

Argo WorkflowTemplates хранят переиспользуемые определения процессов и шаблонов, которые объекты Workflow могут подключать по ссылке или запускать.

  • Шаблон может определять шаги, задачи DAG, контейнеры, скрипты, входы, выходы и настройки синхронизации.
  • Workflow может ссылаться на WorkflowTemplate в пространстве имён через templateRef вместо копирования его реализации.
  • ClusterWorkflowTemplates дают переиспользование на уровне кластера и поэтому требуют осознанного управления доступом.
  • Версионированные имена шаблонов или манифесты под управлением Git привязывают вызывающие стороны к проверенному контракту выполнения.

Зачем это спрашивают: Сильный ответ охватывает переиспользование, семантику ссылок, область видимости и версионирование определений процессов Argo.

Закрытые вопросы

  • 21

    Когда в процессе Argo следует использовать параметры, а когда артефакты?

    artifactsargo
  • 22

    Какие объекты Kubernetes подходят для распространённых ML-нагрузок?

    kubernetes
  • 23

    Как Kubernetes планирует нагрузки с GPU?

    kubernetesgpu
  • 24

    Чем отличаются пакетное, онлайн- и потоковое обслуживание моделей?

    streamingbatchmodel-serving
  • 25

    Что должен определять контракт обслуживания моделей?

    model-servingmlops
  • 26

    Как Triton Inference Server организует и выполняет модели?

    serving-tools
  • 27

    Какую роль играют динамический батчинг и экземпляры моделей в Triton?

    batchserving-tools
  • 28

    Какие абстракции предоставляет KServe для обслуживания моделей в Kubernetes?

    kubernetesserving-toolsmodel-serving
  • 29

    Какую роль играет Bento в BentoML?

    serving-tools
  • 30

    Зачем vLLM использует PagedAttention и непрерывный батчинг?

    batchserving-tools
  • 31

    Чем различаются Triton, KServe, BentoML и vLLM в стеке обслуживания?

    serving-toolsmodel-serving
  • 32

    Из каких основных компонентов состоит хранилище признаков Feast?

    mlopscomponentsfeature-store
  • 33

    Что должен определять контракт хранилища признаков?

  • 34

    Что такое временная корректность при получении признаков?

  • 35

    Что делает материализация признаков в Feast?

    feature-store
  • 36

    Как определять и измерять свежесть признаков?

  • 37

    Как хранилище признаков поддерживает согласованность обучения и обслуживания?

    consistencyfeature-storemlops
  • 38

    Чем Feast отличается от Tecton как платформа хранилища признаков?

    feature-store
  • 39

    Какие тесты должны входить в CI для ML-системы?

    system-designtesting
  • 40

    Как проверки допуска должны управлять ML-процессом?

    pipelinesvalidationci-cd
  • 41

    Что означает неизменяемая непрерывная доставка для ML-артефактов?

    ci-cdartifactsimmutability
  • 42

    Что должна содержать политика продвижения в model registry?

    registries
  • 43

    Какие меры контроля делают непрерывное обучение безопасным и воспроизводимым?

    continuous-trainingreproducibility
  • 44

    Как lineage в MLflow поддерживает воспроизводимость в масштабе?

    lineagereproducibilityexperiment-tracking
  • 45

    Как версионировать датасеты для воспроизводимого обучения?

    reproducibility
  • 46

    Что нужно фиксировать для версионирования среды выполнения ML?

  • 47

    Как карточки моделей, одобрения и аудиторские записи поддерживают управление моделями?

  • 48

    Какие уровни наблюдаемости и метрики должна предоставлять платформа обслуживания ML-моделей?

    observabilitymonitoringmodel-serving
  • 49

    Чем различаются дрейф данных, дрейф предсказаний, дрейф концепции и train-serve skew?

    mlopsdrifttrain-serve-skew
  • 50

    Как Evidently и WhyLabs поддерживают мониторинг ML-данных и дрейфа?

    monitoringiacdrift
  • 51

    Задача в Kubeflow pipeline уже 20 минут находится в состоянии Pending, хотя соседние задачи выполняются; как вы будете искать причину в production?

    ci-cdkubeflowpipelines
  • 52

    Интерфейс пайплайна сообщает об успехе, но система развёртывания не находит артефакт модели или отклоняет его из-за неверной контрольной суммы; как вы расследуете и предотвратите повторение?

    deploymentci-cdartifacts
  • 53

    Два запуска обучения используют одинаковые конфигурацию и данные, но метрики расходятся сильнее допустимого; как вы будете искать источник недетерминированности?

    configmonitoring
  • 54

    Задача обучения на GPU иногда падает из-за нехватки памяти, но в успешных запусках средняя загрузка GPU низкая; как вы проведёте диагностику и настройку?

    memorygpu
  • 55

    Поставщик данных меняет тип поля, и следующий запуск обучения должен забрать новую партицию; как вы остановите плохие данные до начала обучения?

    partitioning
  • 56

    После выпуска нового признака offline-оценка остаётся высокой, но прогнозы в production ухудшаются; как вы подтвердите и устраните расхождение offline и online в Feast или Tecton?

    train-serve-skewfeature-store
  • 57

    Из-за ошибки в логике признака нужен backfill за шесть месяцев; как выполнить его без утечки будущих данных и перезаписи более свежих online-значений?

    backfill
  • 58

    Шаг Argo регистрирует модель и запрашивает deployment, но сетевой тайм-аут запускает retry и создаёт два развёртывания; как вы исправите workflow?

    resiliencedeploymentargo
  • 59

    Сотни одновременных экспериментов перегружают кластер, оставляют поды в Pending и задерживают production retraining; как вы справедливо масштабируете выполнение пайплайнов?

    retrainingconcurrencyci-cd
  • 60

    Кластер показывает свободные GPU, но задачи на нескольких GPU остаются в Pending, пока другие команды держат выделенные, но почти простаивающие устройства; как вы устраните фрагментацию и повысите загрузку?

    gpu
  • 61

    Сервис KServe с Triton внезапно нарушил SLO по задержке p99; как вы будете искать причину по слоям?

    serving-toolsendpointslatency
  • 62

    После развертывания новая модель сразу начала возвращать 5xx; как вы отделите сбой контейнера от проблем с готовностью, загрузкой модели и маршрутизацией?

    containersdeploymenthealth-checks
  • 63

    Качество предсказаний в рабочей среде ухудшилось, но задержка, доля ошибок, CPU и GPU остаются в норме; как вы отреагируете?

    latencygpumonitoring
  • 64

    Какие метрики вы используете при канареечном развертывании модели и когда принимаете решение об откате?

    deployment-strategiesmonitoring
  • 65

    Как безопасно выполнить откат, если новая модель также изменила контракт признаков или выходной контракт?

    rollback
  • 66

    Автомасштабирование поддерживает доступные мощности, но холодные запуски все равно нарушают SLO по задержке онлайн-предсказаний; что вы измените?

    capacityscalingslo
  • 67

    Сервис Triton под нагрузкой начал получать ошибки нехватки памяти GPU; как вы разделите влияние пакетной обработки, параллелизма и памяти модели?

    memorygpudeployment
  • 68

    Трафик к API инференса неожиданно вырос; как защитить SLO по задержке и не допустить неконтролируемого роста стоимости?

    sloapilatency
  • 69

    Во время дежурства одновременно сработали оповещения о качестве модели и состоянии инфраструктуры; как вы расставите приоритеты и выстроите коммуникацию?

    prioritizationcommunicationalerting
  • 70

    Онлайн-хранилище признаков стало недоступно во время обработки запросов; как безопасно перейти в режим ограниченной работы и контролировать свежесть резервных значений?

    feature-storemodel-servingmlops
  • 71

    Мониторинг обнаружил ковариатный дрейф нескольких важных признаков в продакшне; как вы отреагируете на практике?

    monitoringalertingiac
  • 72

    Вы подозреваете дрейф концепции, но фактические целевые метки появляются только через шесть недель; как вы исследуете проблему и ограничите риск?

    mlopsiacdrift
  • 73

    Дашборд внезапно показывает сильный сдвиг распределения; как отличить сбой качества данных от реального дрейфа аудитории?

    distributionsincidentsiac
  • 74

    Команда получает слишком много алертов о дрейфе; как настроить пороги и окна, не скрыв значимые изменения?

    alertingiacdrift
  • 75

    Сводные метрики продакшна выглядят здоровыми, но качество в одном клиентском сегменте падает; что вы сделаете?

    aggregationmonitoring
  • 76

    Через шесть недель поступили отложенные метки, метрика качества выросла с 0,78 до 0,96, а два дашборда показывают разные результаты; как вы проверите связь с метками и исправите метрики?

    conflictjoinsmonitoring
  • 77

    Подтверждённый дрейф затрагивает новых клиентов, но зрелые метки доступны только за две недели, а трафик зависит от сезона; как выбрать безопасное окно и состав данных для переобучения?

    retrainingiacdrift
  • 78

    Как провести теневое развёртывание по схеме чемпион и претендент и какие доказательства нужны для продвижения претендента?

    deployment-strategiesdeployment
  • 79

    Реестр моделей блокирует продвижение из-за отсутствующих данных о происхождении, согласования и оценки; как вы поступите?

    registriesmodel-registrylineage
  • 80

    Как воспроизвести историческое продакшн-предсказание по данным MLflow о происхождении модели, включая признаки, код и окружение?

    lineageexperiment-tracking
  • 81

    CI проходит, но контейнер с ML-моделью не запускается в рабочем кластере из-за несовпадения архитектуры, системной библиотеки или среды ускорителя; как вы найдете и устраните причину?

    system-designcontainers
  • 82

    Пакет модели превышает ограничения CI, реестра артефактов или системы развертывания по размеру; что вы измените без потери трассируемости?

    deploymentartifactsregistries
  • 83

    GPU-интеграционные тесты проходят отдельно, но падают при параллельном запуске в CI, потому что задачи делят кэши моделей, порты и состояние ускорителя; как вы локализуете причину и сделаете набор тестов надёжным?

    cachinggpuintegration
  • 84

    Полный набор проверок ML занимает четыре часа и блокирует каждое изменение кода обучения; как перестроить CI/CD, не ослабив безопасность продвижения?

    cicdci-cdvalidation
  • 85

    Желаемое состояние в GitOps или KServe отличается от фактического развертывания модели; как вы исследуете и устраните расхождение?

    deploymentgitopsserving-tools
  • 86

    Развертывание модели падает из-за Kubernetes RBAC, секретов или настройки ServiceAccount; как безопасно найти и исправить проблему?

    kubernetesdeploymentconfig
  • 87

    Канареечная версия с малым трафиком не набирает выборку для статистической уверенности; как вы решите, можно ли продвигать выпуск?

    deployment-strategies
  • 88

    Как вы скоординируете изменение схемы признака между пайплайном данных, хранилищем признаков и сервисом онлайн-предсказаний?

    pipelinesfeature-storemodel-serving
  • 89

    Как безопасно выкатить изменение нескольких моделей или ансамбля, если зависимые компоненты должны откатываться вместе?

    dependenciesrollbackcomponents
  • 90

    Из-за устаревшего кэша CI или изменяемого тега развернулась не та модель; как доказать, что именно работало, и исключить повторение?

    deploymentartifactscaching
  • 91

    Сервис онлайн-инференса соблюдает SLO по задержке, но его счет растет быстрее трафика. Как вы профилировали бы сервис и снизили затраты, не нарушив SLO?

    slolatency
  • 92

    Нужно выполнять инференс модели ранжирования на градиентном бустинге при 150 запросах в секунду, целевом p99 не выше 80 мс и резких всплесках трафика. Как вы выберете между CPU- и GPU-инстансами?

    gpu
  • 93

    Обучение занимает восемь часов на четырех GPU, и команда хочет перенести его на прерываемые инстансы. Как вы организуете чекпоинты и определите, остаются ли повторы экономически выгодными?

    designfinops
  • 94

    Развертывание vLLM требует больших затрат на GPU и показывает нестабильный p99 при разной длине промптов. Как вы настроите батчинг, квантизацию, KV-кеш и реплики?

    cachinglatencygpu
  • 95

    Несколько команд совместно используют обучающие кластеры, сервинг моделей и хранилище артефактов, но финансовый отдел видит только единый счет ML-платформы. Как вы построите распределение затрат и используете его для изменения поведения?

    model-servingartifactsmlops
  • 96

    Платформа запускает тысячи пайплайнов в день, а запросы к метаданным и хранение артефактов становятся медленными и дорогими. Как вы масштабируете их и ограничите сроки хранения?

    ci-cdartifactsqueries
  • 97

    Специалист по данным передает вам ноутбук, который обучает перспективную модель, и просит запустить еженедельное переобучение в production. Как вы подготовите его к эксплуатации?

    retraining
  • 98

    Специалист по данным предлагает модель с лучшей офлайн-метрикой, но ваш бенчмарк показывает худшие задержку, стоимость и надежность. Как вы разрешите разногласие?

    conflictlatencymonitoring
  • 99

    Изменение схемы привело к шести часам падений задач обучения, а постмортем дал двенадцать пунктов действий. Как превратить их в профилактику, а не в забытый список?

    incidentsschematracking
  • 100

    Специалисты по данным хотят новую возможность распределенного обучения, а ML-платформа страдает от повторяющихся инцидентов и накопленных проблем надежности. Как вы вместе расставите приоритеты?

    prioritizationincidentsdistributed