Вопросы на собеседовании: MLOps-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.
Смотреть пример резюме: MLOps-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Оркестратор пайплайнов отделяет планирование процесса и управление состоянием от выполнения задач и хранения артефактов.
- Парсер или компилятор превращает определение пайплайна в граф и проверяет структурные ограничения.
- Планировщик находит готовые к запуску экземпляры задач по зависимостям, правилам запуска, квотам и состоянию запуска.
- Исполнитель отправляет работу локальным процессам, очередям воркеров или кластеру, но сам задачу не выполняет.
- Хранилище метаданных записывает запуски и состояния задач, а объектное хранилище или база данных содержит крупные результаты.
Зачем это спрашивают: Интервьюер проверяет, понимает ли кандидат оркестрацию как набор взаимодействующих компонентов уровня управления, а не как скрипт для запуска команд.
DAG задаёт конечный частичный порядок, в котором направленные рёбра выражают зависимости задач без циклов.
- Задача становится доступной для запуска, только когда её предшествующие зависимости удовлетворяют настроенным правилам запуска.
- Независимые ветви могут выполняться параллельно, потому что граф не задаёт порядок между ними.
- Разветвление создаёт параллельные ветви, а соединение ожидает необходимые предшествующие ветви.
- Цикл недопустим, потому что для циклических зависимостей нельзя построить топологический порядок выполнения.
Зачем это спрашивают: Сильный ответ отделяет семантику зависимостей от случайного порядка, в котором воркеры фактически выполняют задачи.
Компиляция строит проверенную исполняемую спецификацию, а среда выполнения создаёт конкретные запуски и управляет их состоянием.
- Компиляция фиксирует компоненты, рёбра, плейсхолдеры параметров, условия и настройки выполнения в промежуточном представлении.
- Статические проверки могут отклонить отсутствующие входы, несовместимые типы, циклы и некорректные определения компонентов до отправки.
- Среда выполнения подставляет фактические параметры, создаёт экземпляры задач и вычисляет условия, значения которых пришли из предыдущих задач.
- Среда выполнения записывает переходы состояний и передаёт доступную работу настроенной системе выполнения.
Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат отделять декларативное построение графа от управляющего цикла, который выполняет запуск.
Граница задачи должна охватывать один независимо исполняемый шаг с явным и стабильным контрактом входов и выходов.
- Разделяйте шаги, которым нужны разные образы, профили ресурсов, политики повторов, владельцы или жизненные циклы кеша.
- Оставляйте тесно связанные операции в памяти вместе, если материализация промежуточного результата добавит стоимость без повторного использования.
- Отделяйте побочные эффекты вроде публикации модели от чистых преобразований, чтобы их политика выполнения была видна.
- Избегайте слишком мелких задач, у которых расходы на планирование и запуск контейнера превышают полезную работу.
Зачем это спрашивают: Интервьюер ожидает обоснованный баланс между изоляцией и накладными расходами оркестрации.
Задачи должны передавать через оркестратор ссылки на долговечные артефакты, а крупные данные хранить вне его базы метаданных.
- Задача-производитель записывает неизменяемый объект или версионированный датасет в общее хранилище до публикации его URI.
- Запись о результате должна включать тип, схему или формат, контрольную сумму, запуск-производитель и важные метаданные происхождения.
- Задача-потребитель читает только объявленные входы, что сохраняет зависимости явными, а среды выполнения изолированными.
- Атомарная публикация через финальное переименование, манифест или маркер коммита не даёт потребителям увидеть частичный результат.
Зачем это спрашивают: Сильный ответ рассматривает передачу артефактов как долговечный контракт с данными о происхождении, а не как общее состояние локальной файловой системы.
Расписание создаёт запуски для логических временных интервалов, а событие создаёт их при поступлении определённого внешнего факта.
- Запуски по расписанию должны использовать логический интервал как вход, а не считать временем данных фактическое время выполнения.
- Навёрстывание и заполнение истории материализуют пропущенные исторические интервалы согласно той же семантике расписания.
- Событийные триггеры должны передавать стабильный идентификатор события и ссылку на данные для дедупликации повторной доставки.
- Оба типа триггеров должны вести к одному параметризованному контракту пайплайна, чтобы выполнение оставалось воспроизводимым.
Зачем это спрашивают: Интервьюер проверяет понимание логического времени, исторических запусков и семантики доставки событий хотя бы один раз.
Задача пайплайна идемпотентна, если повторное выполнение с теми же логическими входами сходится к тому же зафиксированному результату.
- Формируйте пути результатов или ключи операций из партиции запуска, версий входов и значимых параметров.
- Для внешних записей используйте upsert, compare-and-set или ограничения уникальности вместо безусловного добавления.
- Сначала записывайте временный результат и открывайте к нему доступ только атомарным шагом коммита.
- Регистрируйте завершённые побочные эффекты по ключу идемпотентности, чтобы повтор мог распознать предыдущее выполнение.
Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат делать повторы безопасными и для записи артефактов, и для внешних побочных эффектов.
Повторы следует разрешать только для временных классов сбоев и выполнять с ограниченной экспоненциальной задержкой и случайным разбросом.
- Политике повторов нужен лимит попыток, чтобы постоянные ошибки не занимали ресурсы бесконечно.
- Экспоненциальные задержки снижают давление на восстанавливающуюся зависимость, а случайный разброс предотвращает синхронные волны повторов.
- Ошибки валидации, несовместимые схемы и неверные параметры должны завершаться без повтора, потому что повторение их не изменит.
- Безопасность повторов зависит от идемпотентности задачи и одинакового контракта логических входов для каждой попытки.
Зачем это спрашивают: Сильный ответ связывает политику повторов с классификацией сбоев, контролем нагрузки и идемпотентным выполнением.
В оркестрации пайплайнов нужны отдельные лимиты времени для ожидания, выполнения задачи и всего запуска процесса.
- Таймаут очереди ограничивает ожидание воркера или дефицитного ресурса до признания задачи неуспешной.
- Таймаут выполнения ограничивает процесс задачи после фактического старта и должен оставлять время на корректное завершение до принудительной остановки.
- Таймаут сенсора или внешней операции ограничивает общее время ожидания с учётом повторных проверок и отсрочек.
- Таймаут процесса ограничивает запуск целиком, даже если каждая отдельная задача укладывается в собственный лимит.
Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат ожидание ресурсов от активного выполнения и общей длительности запуска.
Кеш задачи повторно использует результаты, только если ключ кеша отражает все входы, способные повлиять на результат.
- Ключ обычно включает код компонента или дайджест образа, версии входных артефактов, параметры и значимую конфигурацию.
- Кешированные артефакты должны оставаться неизменяемыми и доступными не меньше срока жизни записей об их метаданных.
- Недетерминированные входы вроде текущего времени, случайных начальных значений или изменяемых внешних таблиц нужно зафиксировать или включить в ключ.
- Кеширование следует отключать для намеренных побочных эффектов, например уведомлений или публикации модели.
Зачем это спрашивают: Интервьюер оценивает понимание корректности кеша, а не умение просто включить настройку платформы.
Возобновление пайплайна пропускает уже зафиксированные задачи, а сохранение контрольных точек позволяет восстановить прогресс внутри одного долгого вычисления.
- Оркестратор возобновляет работу по сохранённым состояниям задач и проверяет доступность успешных результатов.
- Возобновлённый запуск должен сохранять исходные параметры и версии входов, если намеренно не создан новый запуск.
- Код обучения периодически записывает в долговечное хранилище контрольные точки с состояниями модели, оптимизатора, планировщика и хода обучения.
- Восстановленная из контрольной точки задача всё равно должна публиковать финальный артефакт через обычный атомарный контракт результата.
Зачем это спрашивают: Сильный ответ отделяет восстановление состояния на уровне оркестратора от восстановления внутри кода обучения.
Планировщик Airflow превращает разобранные определения DAG и интервалы расписания в готовые к запуску экземпляры задач.
- Обработчики DAG разбирают файлы и сериализуют структуру DAG, поэтому планирование не зависит от импорта кода на воркерах.
- Планировщик создаёт DagRuns, проверяет зависимости задач и правила запуска и переводит доступные экземпляры к состоянию «в очереди».
- До передачи задач исполнителю он применяет ограничения пулов, конкурентности DAG и максимального числа активных запусков.
- Несколько планировщиков координируются через базу метаданных, чтобы решения о планировании оставались согласованными.
Зачем это спрашивают: Интервьюер проверяет знание управляющего цикла планирования Airflow и его координации через метаданные.
Исполнитель Airflow распределяет поставленные в очередь экземпляры задач по вычислительным ресурсам, а воркеры запускают процессы задач.
- LocalExecutor запускает процессы задач на хосте планировщика и подходит для развёртывания на одной машине.
- CeleryExecutor отправляет задачи через брокер постоянному пулу воркеров, которые получают и выполняют их.
- KubernetesExecutor создаёт отдельный под для каждой задачи, позволяя выбирать собственный образ и запросы ресурсов.
- Состояние задач и координация остаются на уровне управления Airflow, даже когда выполнение происходит на внешних воркерах.
Зачем это спрашивают: Сильный ответ объясняет абстракцию выполнения и эксплуатационные различия распространённых моделей исполнения.
Airflow XCom должен содержать небольшие значения или ссылки для обмена между задачами, а не крупные ML-артефакты.
- Типичные значения включают URI объектного хранилища, идентификатор раздела, версию модели или компактные метаданные состояния.
- По умолчанию строки XCom находятся в слое метаданных, поэтому крупные данные повышают расходы базы и сериализации.
- Большие датасеты, контрольные точки и модели должны лежать в долговечном хранилище артефактов, а в XCom остаются только ссылки.
- Пользовательский бэкенд XCom на объектном хранилище может выгружать сериализованные значения, но явные контракты артефактов понятнее.
Зачем это спрашивают: Интервьюер оценивает, соблюдает ли кандидат границу между метаданными оркестрации и хранением данных.
Режимы сенсоров Airflow отличаются тем, занимает ли ожидание слот воркера и как назначается следующая проверка.
- В режиме poke задача ожидает внутри запущенного процесса и сохраняет за ней слот воркера между проверками.
- Режим reschedule освобождает слот воркера и просит планировщик выполнить новую проверку позже.
- Отложенный сенсор передаёт ожидание асинхронному компоненту triggerer и возобновляет задачу, когда срабатывает её триггер.
- Для долгого ожидания обычно подходят отложенный режим или reschedule, а для коротких проверок может быть оправдан режим poke.
Зачем это спрашивают: Сильный ответ связывает семантику сенсоров с ёмкостью воркеров и архитектурой triggerer.
Пулы Airflow и ограничения конкурентности сдерживают разные области готовых к запуску экземпляров задач.
- Пул представляет общий ресурс, например GPU-задачи или доступ к сервису с ограничением частоты запросов, а задачи занимают настроенное число слотов.
- Глобальный параметр parallelism ограничивает число экземпляров задач во всей установке Airflow.
- Ограничение конкурентности на уровне DAG задаёт число одновременных экземпляров задач одного DAG во всех активных запусках.
- Параметр maximum active runs ограничивает пересекающиеся DagRuns и не даёт частому расписанию многократно увеличить нагрузку на последующие этапы.
Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат ограничения конкретного ресурса от глобальных ограничений и ограничений DAG.
Спецификация компонента Kubeflow Pipelines определяет переносимый типизированный интерфейс и контейнерное выполнение его реализации.
- Входы и выходы объявляют имена параметров или артефактов, типы и необязательные значения по умолчанию.
- Секция контейнера фиксирует образ, команду, аргументы и плейсхолдеры, связывающие объявленные входы и выходы.
- Запросы ресурсов, окружение, параметры кеширования и настройки конкретной платформы можно добавить при использовании компонента.
- Стабильный контракт компонента позволяет авторам пайплайна менять версии реализации без изменения связей с последующими компонентами.
Зачем это спрашивают: Интервьюер оценивает, видит ли кандидат в компоненте Kubeflow типизированный контракт выполнения, а не произвольный код Python.
Kubeflow Pipelines использует параметры для небольших значений, а типизированные артефакты для долговечных файловых результатов.
- Параметры переносят скалярные или структурированные управляющие значения, которые бэкенд подставляет в аргументы компонента.
- Артефакты предоставляют путь или URI хранилища вместе с типом и метаданными, не встраивая сами данные в состояние пайплайна.
- Среда выполнения назначает расположение входов и выходов и записывает происхождение артефактов в сервис метаданных.
- Объявленные типы артефактов Dataset, Model и Metrics делают совместимость и происхождение видимыми между компонентами.
Зачем это спрашивают: Сильный ответ объясняет и границу данных, и работу метаданных при передаче артефактов Kubeflow.
Компиляция Kubeflow превращает программу построения пайплайна в статический пакет PipelineSpec для отправки.
- Вызовы компонентов становятся узлами задач с явными зависимостями, каналами входов, каналами выходов и плейсхолдерами.
- Управляющие конструкции вроде условий, циклов и обработки завершения кодируются в промежуточном представлении.
- Компилятор проверяет связи графа и совместимость типов, которые можно определить без значений среды выполнения.
- Позже бэкенд создаёт запуск из пакета и разрешает параметры среды выполнения, расположение артефактов и платформенные детали выполнения.
Зачем это спрашивают: Интервьюер проверяет понимание того, что Python-код пайплайна строит спецификацию, а не запускает код компонентов напрямую.
Argo WorkflowTemplates хранят переиспользуемые определения процессов и шаблонов, которые объекты Workflow могут подключать по ссылке или запускать.
- Шаблон может определять шаги, задачи DAG, контейнеры, скрипты, входы, выходы и настройки синхронизации.
- Workflow может ссылаться на WorkflowTemplate в пространстве имён через templateRef вместо копирования его реализации.
- ClusterWorkflowTemplates дают переиспользование на уровне кластера и поэтому требуют осознанного управления доступом.
- Версионированные имена шаблонов или манифесты под управлением Git привязывают вызывающие стороны к проверенному контракту выполнения.
Зачем это спрашивают: Сильный ответ охватывает переиспользование, семантику ссылок, область видимости и версионирование определений процессов Argo.
Закрытые вопросы
- 21
Когда в процессе Argo следует использовать параметры, а когда артефакты?
artifactsargo - 22
Какие объекты Kubernetes подходят для распространённых ML-нагрузок?
kubernetes - 23
Как Kubernetes планирует нагрузки с GPU?
kubernetesgpu - 24
Чем отличаются пакетное, онлайн- и потоковое обслуживание моделей?
streamingbatchmodel-serving - 25
Что должен определять контракт обслуживания моделей?
model-servingmlops - 26
Как Triton Inference Server организует и выполняет модели?
serving-tools - 27
Какую роль играют динамический батчинг и экземпляры моделей в Triton?
batchserving-tools - 28
Какие абстракции предоставляет KServe для обслуживания моделей в Kubernetes?
kubernetesserving-toolsmodel-serving - 29
Какую роль играет Bento в BentoML?
serving-tools - 30
Зачем vLLM использует PagedAttention и непрерывный батчинг?
batchserving-tools - 31
Чем различаются Triton, KServe, BentoML и vLLM в стеке обслуживания?
serving-toolsmodel-serving - 32
Из каких основных компонентов состоит хранилище признаков Feast?
mlopscomponentsfeature-store - 33
Что должен определять контракт хранилища признаков?
- 34
Что такое временная корректность при получении признаков?
- 35
Что делает материализация признаков в Feast?
feature-store - 36
Как определять и измерять свежесть признаков?
- 37
Как хранилище признаков поддерживает согласованность обучения и обслуживания?
consistencyfeature-storemlops - 38
Чем Feast отличается от Tecton как платформа хранилища признаков?
feature-store - 39
Какие тесты должны входить в CI для ML-системы?
system-designtesting - 40
Как проверки допуска должны управлять ML-процессом?
pipelinesvalidationci-cd - 41
Что означает неизменяемая непрерывная доставка для ML-артефактов?
ci-cdartifactsimmutability - 42
Что должна содержать политика продвижения в model registry?
registries - 43
Какие меры контроля делают непрерывное обучение безопасным и воспроизводимым?
continuous-trainingreproducibility - 44
Как lineage в MLflow поддерживает воспроизводимость в масштабе?
lineagereproducibilityexperiment-tracking - 45
Как версионировать датасеты для воспроизводимого обучения?
reproducibility - 46
Что нужно фиксировать для версионирования среды выполнения ML?
- 47
Как карточки моделей, одобрения и аудиторские записи поддерживают управление моделями?
- 48
Какие уровни наблюдаемости и метрики должна предоставлять платформа обслуживания ML-моделей?
observabilitymonitoringmodel-serving - 49
Чем различаются дрейф данных, дрейф предсказаний, дрейф концепции и train-serve skew?
mlopsdrifttrain-serve-skew - 50
Как Evidently и WhyLabs поддерживают мониторинг ML-данных и дрейфа?
monitoringiacdrift - 51
Задача в Kubeflow pipeline уже 20 минут находится в состоянии Pending, хотя соседние задачи выполняются; как вы будете искать причину в production?
ci-cdkubeflowpipelines - 52
Интерфейс пайплайна сообщает об успехе, но система развёртывания не находит артефакт модели или отклоняет его из-за неверной контрольной суммы; как вы расследуете и предотвратите повторение?
deploymentci-cdartifacts - 53
Два запуска обучения используют одинаковые конфигурацию и данные, но метрики расходятся сильнее допустимого; как вы будете искать источник недетерминированности?
configmonitoring - 54
Задача обучения на GPU иногда падает из-за нехватки памяти, но в успешных запусках средняя загрузка GPU низкая; как вы проведёте диагностику и настройку?
memorygpu - 55
Поставщик данных меняет тип поля, и следующий запуск обучения должен забрать новую партицию; как вы остановите плохие данные до начала обучения?
partitioning - 56
После выпуска нового признака offline-оценка остаётся высокой, но прогнозы в production ухудшаются; как вы подтвердите и устраните расхождение offline и online в Feast или Tecton?
train-serve-skewfeature-store - 57
Из-за ошибки в логике признака нужен backfill за шесть месяцев; как выполнить его без утечки будущих данных и перезаписи более свежих online-значений?
backfill - 58
Шаг Argo регистрирует модель и запрашивает deployment, но сетевой тайм-аут запускает retry и создаёт два развёртывания; как вы исправите workflow?
resiliencedeploymentargo - 59
Сотни одновременных экспериментов перегружают кластер, оставляют поды в Pending и задерживают production retraining; как вы справедливо масштабируете выполнение пайплайнов?
retrainingconcurrencyci-cd - 60
Кластер показывает свободные GPU, но задачи на нескольких GPU остаются в Pending, пока другие команды держат выделенные, но почти простаивающие устройства; как вы устраните фрагментацию и повысите загрузку?
gpu - 61
Сервис KServe с Triton внезапно нарушил SLO по задержке p99; как вы будете искать причину по слоям?
serving-toolsendpointslatency - 62
После развертывания новая модель сразу начала возвращать 5xx; как вы отделите сбой контейнера от проблем с готовностью, загрузкой модели и маршрутизацией?
containersdeploymenthealth-checks - 63
Качество предсказаний в рабочей среде ухудшилось, но задержка, доля ошибок, CPU и GPU остаются в норме; как вы отреагируете?
latencygpumonitoring - 64
Какие метрики вы используете при канареечном развертывании модели и когда принимаете решение об откате?
deployment-strategiesmonitoring - 65
Как безопасно выполнить откат, если новая модель также изменила контракт признаков или выходной контракт?
rollback - 66
Автомасштабирование поддерживает доступные мощности, но холодные запуски все равно нарушают SLO по задержке онлайн-предсказаний; что вы измените?
capacityscalingslo - 67
Сервис Triton под нагрузкой начал получать ошибки нехватки памяти GPU; как вы разделите влияние пакетной обработки, параллелизма и памяти модели?
memorygpudeployment - 68
Трафик к API инференса неожиданно вырос; как защитить SLO по задержке и не допустить неконтролируемого роста стоимости?
sloapilatency - 69
Во время дежурства одновременно сработали оповещения о качестве модели и состоянии инфраструктуры; как вы расставите приоритеты и выстроите коммуникацию?
prioritizationcommunicationalerting - 70
Онлайн-хранилище признаков стало недоступно во время обработки запросов; как безопасно перейти в режим ограниченной работы и контролировать свежесть резервных значений?
feature-storemodel-servingmlops - 71
Мониторинг обнаружил ковариатный дрейф нескольких важных признаков в продакшне; как вы отреагируете на практике?
monitoringalertingiac - 72
Вы подозреваете дрейф концепции, но фактические целевые метки появляются только через шесть недель; как вы исследуете проблему и ограничите риск?
mlopsiacdrift - 73
Дашборд внезапно показывает сильный сдвиг распределения; как отличить сбой качества данных от реального дрейфа аудитории?
distributionsincidentsiac - 74
Команда получает слишком много алертов о дрейфе; как настроить пороги и окна, не скрыв значимые изменения?
alertingiacdrift - 75
Сводные метрики продакшна выглядят здоровыми, но качество в одном клиентском сегменте падает; что вы сделаете?
aggregationmonitoring - 76
Через шесть недель поступили отложенные метки, метрика качества выросла с 0,78 до 0,96, а два дашборда показывают разные результаты; как вы проверите связь с метками и исправите метрики?
conflictjoinsmonitoring - 77
Подтверждённый дрейф затрагивает новых клиентов, но зрелые метки доступны только за две недели, а трафик зависит от сезона; как выбрать безопасное окно и состав данных для переобучения?
retrainingiacdrift - 78
Как провести теневое развёртывание по схеме чемпион и претендент и какие доказательства нужны для продвижения претендента?
deployment-strategiesdeployment - 79
Реестр моделей блокирует продвижение из-за отсутствующих данных о происхождении, согласования и оценки; как вы поступите?
registriesmodel-registrylineage - 80
Как воспроизвести историческое продакшн-предсказание по данным MLflow о происхождении модели, включая признаки, код и окружение?
lineageexperiment-tracking - 81
CI проходит, но контейнер с ML-моделью не запускается в рабочем кластере из-за несовпадения архитектуры, системной библиотеки или среды ускорителя; как вы найдете и устраните причину?
system-designcontainers - 82
Пакет модели превышает ограничения CI, реестра артефактов или системы развертывания по размеру; что вы измените без потери трассируемости?
deploymentartifactsregistries - 83
GPU-интеграционные тесты проходят отдельно, но падают при параллельном запуске в CI, потому что задачи делят кэши моделей, порты и состояние ускорителя; как вы локализуете причину и сделаете набор тестов надёжным?
cachinggpuintegration - 84
Полный набор проверок ML занимает четыре часа и блокирует каждое изменение кода обучения; как перестроить CI/CD, не ослабив безопасность продвижения?
cicdci-cdvalidation - 85
Желаемое состояние в GitOps или KServe отличается от фактического развертывания модели; как вы исследуете и устраните расхождение?
deploymentgitopsserving-tools - 86
Развертывание модели падает из-за Kubernetes RBAC, секретов или настройки ServiceAccount; как безопасно найти и исправить проблему?
kubernetesdeploymentconfig - 87
Канареечная версия с малым трафиком не набирает выборку для статистической уверенности; как вы решите, можно ли продвигать выпуск?
deployment-strategies - 88
Как вы скоординируете изменение схемы признака между пайплайном данных, хранилищем признаков и сервисом онлайн-предсказаний?
pipelinesfeature-storemodel-serving - 89
Как безопасно выкатить изменение нескольких моделей или ансамбля, если зависимые компоненты должны откатываться вместе?
dependenciesrollbackcomponents - 90
Из-за устаревшего кэша CI или изменяемого тега развернулась не та модель; как доказать, что именно работало, и исключить повторение?
deploymentartifactscaching - 91
Сервис онлайн-инференса соблюдает SLO по задержке, но его счет растет быстрее трафика. Как вы профилировали бы сервис и снизили затраты, не нарушив SLO?
slolatency - 92
Нужно выполнять инференс модели ранжирования на градиентном бустинге при 150 запросах в секунду, целевом p99 не выше 80 мс и резких всплесках трафика. Как вы выберете между CPU- и GPU-инстансами?
gpu - 93
Обучение занимает восемь часов на четырех GPU, и команда хочет перенести его на прерываемые инстансы. Как вы организуете чекпоинты и определите, остаются ли повторы экономически выгодными?
designfinops - 94
Развертывание vLLM требует больших затрат на GPU и показывает нестабильный p99 при разной длине промптов. Как вы настроите батчинг, квантизацию, KV-кеш и реплики?
cachinglatencygpu - 95
Несколько команд совместно используют обучающие кластеры, сервинг моделей и хранилище артефактов, но финансовый отдел видит только единый счет ML-платформы. Как вы построите распределение затрат и используете его для изменения поведения?
model-servingartifactsmlops - 96
Платформа запускает тысячи пайплайнов в день, а запросы к метаданным и хранение артефактов становятся медленными и дорогими. Как вы масштабируете их и ограничите сроки хранения?
ci-cdartifactsqueries - 97
Специалист по данным передает вам ноутбук, который обучает перспективную модель, и просит запустить еженедельное переобучение в production. Как вы подготовите его к эксплуатации?
retraining - 98
Специалист по данным предлагает модель с лучшей офлайн-метрикой, но ваш бенчмарк показывает худшие задержку, стоимость и надежность. Как вы разрешите разногласие?
conflictlatencymonitoring - 99
Изменение схемы привело к шести часам падений задач обучения, а постмортем дал двенадцать пунктов действий. Как превратить их в профилактику, а не в забытый список?
incidentsschematracking - 100
Специалисты по данным хотят новую возможность распределенного обучения, а ML-платформа страдает от повторяющихся инцидентов и накопленных проблем надежности. Как вы вместе расставите приоритеты?
prioritizationincidentsdistributed