Вопросы на собеседовании: CV-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Staff Computer Vision инженер.
Смотреть пример резюме: CV-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Я бы оставил передачу видео внутри объекта и дал доказательствам событий приоритет над best-effort аналитикой.
- Два шлюза на объекте принимают RTSP-сессии, нормализуют время и держат 30-минутный кольцевой буфер на NVMe, рассчитанный по измеренному битрейту с запасом на восстановление.
- Кольцевой буфер переживает пятисекундный сбой WAN, только пока исправны шлюз и его локальный диск; при потере шлюза камеры переподключаются к парному, а не полагаются на этот буфер.
- При перегрузке анализ сначала снижается с 15 до 5 FPS, а подтверждённые клипы получают резерв места и приоритет выгрузки; если резерв заполнен, сервис сообщает самое раннее восстановимое время вместо обещания нулевых потерь.
- Метаданные Kafka реплицируются в трёх зонах; месячная доступность приёма должна достигать 99,95%, а контрольные суммы клипов и p95 поисковой индексации ниже 2 секунд измеряются отдельно.
Зачем это спрашивают: Сильный ответ точно ограничивает отказы, которые покрывает локальный буфер, и задаёт явную политику переполнения для доказательств.
Я бы планировал штатный конвейер на 80 мс, оставив 20 мс на джиттер и температурные колебания.
- Захват и синхронизация получают 8 мс, предобработка 12 мс, параллельный инференс камер и лидара 45 мс, фузия 10 мс, трекинг и публикация 5 мс, всего 80 мс.
- CUDA streams перекрывают передачу и ядра, очереди держат не более одного цикла, а устаревшая работа отменяется и не задерживает следующее управляющее обновление.
- Релизная кампания покрывает весь ODD, температуры, отказы сенсоров и достаточно часов движения, чтобы верхняя односторонняя 95-процентная граница вероятности пропуска дедлайна уложилась в цель; одной 60-минутной поездки недостаточно.
- После заданного числа последовательных пропусков стек публикует состояние деградации, а планировщик переходит к ограниченному режиму или состоянию минимального риска вместо бесконечного молчаливого отбрасывания кадров.
Зачем это спрашивают: Главное различие проходит между бюджетом задержки, статистически достаточной проверкой и безопасным действием после повторных пропусков дедлайна.
Я бы объединил контролируемую съёмку с двухступенчатым детектором и рассчитывал приёмку по положительным примерам с дефектами, а не по общему объёму линии.
- Четыре камеры с глобальным затвором и импульсным светом держат смаз ниже 0,2 мм, а PLC-триггер связывает все ракурсы одним ID детали.
- Для каждого критичного типа дефекта и линии заранее задаётся число положительных примеров; recall проходит только тогда, когда его нижняя односторонняя 95-процентная граница не ниже 99,5% в обязательных срезах.
- Нормальные детали образуют отдельный репрезентативный знаменатель для ложного брака, а несколько ракурсов одной детали считаются одним решением, а не независимыми примерами.
- Сомнительные детали отводятся на проверку, а пропускная способность подтверждается на 600 деталях в минуту без ослабления статистических тестов.
Зачем это спрашивают: Значимы число и независимость реальных положительных примеров с дефектами, тогда как для ложного брака нужен другой знаменатель.
Я бы провёл сравнение с одинаковым вычислительным бюджетом, которое показывает компромиссы длинного контекста, а не навязывает трём семействам один рецепт для изображений.
- Из 576 GPU-часов каждое семейство получает 192 с одинаковыми train split, декодером кадров, корпусом предобучения, бюджетом поиска оптимизатора и числом просмотренных кадров; seeds и неудачные запуски тоже расходуют лимит.
- Временная свёрточная модель проверяет сильный локальный motion bias, transformer с оконным или разреженным attention проверяет дальние связи при контролируемом росте токенов, а state-space модель проверяет потоковый 10-минутный контекст с линейным состоянием и памятью.
- Все модели проходят одинаковые срезы коротких, средних и 10-минутных событий, а плотность выборки меняется только как объявленная ablation, а не как скрытый дополнительный compute.
- Я выбираю по границе Парето качества, калибровки, пиковой памяти, потокового состояния и задержки на целевом GPU, а не по названию архитектуры или image top-1 accuracy.
Зачем это спрашивают: Вопрос проверяет честный дизайн эксперимента и понимание масштабирования современных video backbone с длиной последовательности.
Я бы хранил неизменяемые медиа в объектном хранилище, а поисковые манифесты в версионируемых таблицах Iceberg.
- Объекты получают хеши содержимого, а Parquet-манифесты несут камеру, правовое основание, метку, контрольную сумму и предобработку без листинга bucket.
- Каждый обучающий запрос фиксирует snapshot ID Iceberg, а архивный tier всё равно хранит исходные медиа полные пять лет.
- Контрольные суммы проверяются при записи, выборочно при чтении и во время ремонта реплик; приёмка требует ноль необнаруженных повреждений в заданном аудите, а не непроверяемую гарантию на миллиард чтений.
- Проверка восстановления собирает закреплённый датасет из архивной реплики по манифесту и за 30 минут проверяет дайджест каждого объекта.
Зачем это спрашивают: Ответ должен отделять хранение и скорость запросов от доказательств обнаружения повреждений и восстановления.
Я бы считал правку надёжно сохранённой только после подтверждения сервера, а неподтверждённые операции держал в клиентском write-ahead log.
- Каждая операция с рамкой записывается в IndexedDB с ключом идемпотентности до появления статуса pending; autosave раз в 10 секунд пакетирует отправку, но не задаёт границу надёжности.
- PostgreSQL фиксирует операцию относительно монотонной ревизии задания и возвращает принятую ревизию, после чего клиент удаляет запись из локального журнала.
- После переподключения или перезапуска браузера pending-операции повторяются идемпотентно; устаревшая базовая ревизия создаёт ветку для проверки вместо перезаписи чужой работы.
- Тесты отказов требуют отсутствия потерь подтверждённых правок, а нагрузочные тесты держат 250 сессий, p95 загрузки задания ниже 2 секунд и 120 000 принятых рамок в день; UI честно показывает риск локальных правок при уничтожении устройства.
Зачем это спрашивают: Достоверное обещание без потерь называет момент подтверждения, журнал восстановления, правило идемпотентности и предел до принятия сервером.
Я бы объединил скрытые gold-задания, контролируемое перекрытие и арбитраж, но оценивал классы и рамки метриками, которые показывают случайное согласие и пропущенные аннотации.
- Пять процентов заданий составляют обновляемые скрытые gold-примеры, а 10% независимо размечаются дважды.
- Для классов сохраняется требуемое сырое согласие 0,95, но приёмка также показывает Cohen's kappa и поклассовые precision и recall, потому что доминирующий класс может завысить agreement.
- Рамки один раз сопоставляются по объявленному class-aware IoU assignment; требуемое перекрытие 0,85 дополняется распределением IoU, recall несопоставленных эталонов и precision лишних рамок вместо одной медианы.
- Провал в скользящем окне приостанавливает аннотатора для калибровки, а часто оспариваемые gold-примеры уходят старшему арбитру и не штрафуют команду автоматически.
Зачем это спрашивают: Такой ответ отличает реальное согласие от дисбаланса классов и измеряет полноту разметки вместе с перекрытием рамок.
Я бы сделал оценку версионируемым batch-заданием по дайджесту модели, snapshot датасета, пакету метрик и коммиту срезов.
- Воркеры Ray один раз записывают предсказания по стабильным ID примеров, поэтому 300 срезов используют один inference pass.
- Агрегация метрик использует фиксированный порядок и стабильное суммирование; одинаковые дайджесты должны давать точные значения отчёта, если только неизбежное недетерминированное ядро не описано явно.
- Допустимый численный диапазон задаётся отдельно для метрики, например 0,01 процентного пункта recall вместо неопределённого 0,01, а релизные срезы содержат доверительные интервалы.
- CI повторяет фиксированное подмножество при разном числе воркеров, чтобы до полного двухчасового прогона находить изменения порядка редукции и границ шардов.
Зачем это спрашивают: Для воспроизводимости нужны детерминированная агрегация и названные единицы, а не общий допуск для несвязанных метрик.
Я бы использовал MLflow-совместимый реестр над неизменяемыми артефактами и требовал подписанный lineage-манифест каждой версии.
- Манифест связывает Git-коммит, дайджест контейнера, конфигурацию, snapshots датасетов, контракт предобработки, отчёт и родительский checkpoint.
- Переход candidate, validated и production требует сервисной идентичности и двух одобрений; артефакты никогда не перезаписываются.
- По prediction_id точная модель и lineage данных возвращаются за пять минут, а ежедневный аудит подтверждает 100% покрытия.
Зачем это спрашивают: Интервьюер оценивает обязательную прослеживаемость за счёт неизменяемых идентификаторов и записей о развёртывании.
Я бы выделил ограниченный интерактивный класс и допускал только такое число одновременных заданий, которое его восемь GPU реально могут запустить за 10 минут.
- Каждая команда получает квоту и не более одного интерактивного задания на два GPU в защищённом классе; лишние заявки видят оценку очереди и не наследуют гарантию старта.
- Остальные 56 GPU выполняют batch-задания с gang scheduling, fair-share и backfill, а свободную batch-мощность интерактивные задания могут занимать с вытеснением после сохранения контрольной точки.
- Манифесты датасетов размещаются на локальных NVMe, а topology-aware placement не разносит multi-GPU задание по медленным связям.
- Принятые задания должны держать p95 старта ниже 10 минут и месячную полезную загрузку выше 75%; отказы и ожидание квоты не дают высокой загрузке скрыть неудовлетворённый спрос.
Зачем это спрашивают: Конечный резерв поддерживает SLO старта только при явных admission, квотах и правилах заимствования.
Я бы использовал эластичные воркеры с опубликованным шардированным checkpoint каждые 15 минут и измерял потерю вычислений отдельно от времени замены.
- Каждый rank пишет временный шард, а rank zero публикует поколение только после всех контрольных сумм, поэтому отказ теряет не более одного интервала checkpoint.
- Checkpoint содержит global step, optimizer, RNG, эпоху и курсор sampler в dataloader и манифест датасета, предотвращая пропуски и повторы после перемешивания.
- Замена планировщиком может добавить около 10 минут простоя, но не меняет 15-минутный recovery point objective; в отчётах эти величины показываются отдельно.
- Chaos-прогоны сравнивают validation curve после возобновления и без отказа на одинаковых global steps с допуском и доверительным интервалом конкретной метрики, а не с общим расхождением 0,1%.
Зачем это спрашивают: Кандидат должен разделять recovery point и recovery time и сохранять достаточно состояния sampler для корректного продолжения.
Я бы оставил байты внутри правовой границы, а ссылки на неизменяемые объекты передавал через региональный асинхронный автомат состояний.
- Региональный ingest записывает изображение по хешу содержимого и версии объекта, затем ставит в очередь регион, tenant, модель, дайджест предобработки и неизменяемую ссылку вместо копирования байтов через глобальную шину.
- Глобальный control plane может маршрутизировать метаданные, но policy допускает работу только в разрешённую региональную очередь; воркер получает короткоживущее право чтения точной версии, поэтому европейские медиа нельзя получить из США.
- Ключ идемпотентности по tenant, версии объекта, модели и предобработке делает at-least-once доставку безопасной, а переход состояния с арендой и условная запись публикуют только один финальный результат.
- При отказе регионального пула задания ждут или переходят в другой пул внутри той же правовой границы; возраст очереди, истёкшие задания, dead letters и отмена являются видимыми исходами, а не маскируются синхронной ошибкой.
Зачем это спрашивают: Архитектура оценивается по enforcement residency, неизменяемому lineage и точной семантике повторов, а не по ещё одному расчёту GPU.
Я бы использовал pull-агент подписанных обновлений, аппаратно-зависимые манифесты и A/B-разделы моделей.
- Устройства опрашивают CDN через случайно разнесённые интервалы, проверяют подписи модели и runtime, свободное место, устанавливают в неактивный раздел и проходят аппаратный self-test до переключения.
- Rollout проходит лабораторию, 1%, 10%, 50% и 100% только пока ошибки установки, подписи, места, self-test, crashes и задержки остаются в объявленных бюджетах.
- Завершение считается среди устройств, которые были online и доступны в 24-часовом окне; offline, заблокированные политикой и неподдерживаемые когорты показываются отдельно и не записываются в успех.
- Цель составляет 99% завершения среди eligible-устройств за 24 часа и менее 0,5% неудачных установок; сбойное устройство локально возвращается назад и согласует desired и observed версии после подключения.
Зачем это спрашивают: Метрики rollout имеют смысл, только когда видны eligible-знаменатель и все причины отказа до активации.
Я бы делил модель на версионируемом промежуточном представлении только после доказательства выигрыша по privacy и bandwidth относительно локального инференса.
- Edge-encoder обрабатывает сырой кадр и выдаёт сжатый feature tensor; слой разделения выбирается измерениями, потому что ранние признаки крупнее и легче инвертируются, а поздние могут потерять детали для cloud-head.
- Privacy review проверяет восстановление изображения, membership leakage и связывание tenants, затем фиксирует шифрование, retention, доступ, дайджест encoder, tensor schema и разрешённое сжатие.
- Облако принимает только совместимую пару encoder и head, а edge меняет квантование признаков или sampling под bandwidth-бюджет магазина без скрытого изменения контракта.
- При потере канала или совместимости полная локальная модель возвращает помеченный degraded-результат; сырые пиксели не загружаются, а признаки в очереди истекают и не порождают устаревшие решения.
Зачем это спрашивают: Вопрос проверяет отношение к промежуточным признакам как к чувствительным версионируемым данным и наличие реальной локальной границы отказа.
Я бы поставил первым откалиброванный CPU-фильтр или малую GPU-модель, а неоднозначные примеры направлял в дорогой детектор.
- Первая ступень настраивается на 99,7% recall и убирает только явные отрицательные примеры ниже confidence 0,05, завершая 70% запросов.
- Вторая ступень обрабатывает положительные примеры и зону неопределённости, а пороги выбираются по срезам реального трафика.
- Релиз требует 98% сквозного recall, потери критичного среза не более 0,3 пункта, p99 ниже 100 мс и снижения GPU-часов минимум на 50%.
Зачем это спрашивают: Интервьюер оценивает пороги каскада и сквозные метрики вместо изолированной accuracy.
В стандартном Triton я бы использовал ограниченный dynamic batching и изоляцию классов трафика, а не приписывал ему отсутствующий EDF scheduler.
- Интерактивный deployment задаёт max_batch_size 32, preferred_batch_size 8, 16 и 32 и max_queue_delay_microseconds 4000; preferred-размеры являются подсказками, а реальный максимум ограничивает max_batch_size.
- Уровни приоритета Triton и queue timeout policy могут отклонять слишком долго ожидающий запрос, но штатный dynamic batcher не отправляет batch по абсолютным дедлайнам запросов или ровно за 8 мс до дедлайна старейшего.
- Bulk-трафик использует отдельно названный deployment модели со своими model config, очередью и проверенным max batch 64; добавление instance groups к одной модели не создаёт очереди для классов трафика.
- Если нужен EDF, я явно ставлю custom scheduler или backend перед Triton и тестирую его на 1 000, 6 000 и 12 000 FPS с требованием сквозного p99 ниже 100 мс.
Зачем это спрашивают: Ожидаемый ответ отличает штатные настройки Triton от custom scheduling и однозначно задаёт максимальный batch.
Я бы считал по устойчивому throughput одного GPU при заданном SLO и держал тёплую мощность одновременно для дневного пика и потери зоны.
- При 300 FPS на L4 пик 60 000 FPS требует 200 GPU при 100% измеренной мощности.
- Ограничение загрузки после отказа до 80% требует 60 000 разделить на 300 и на 0,8, то есть 250 оставшихся GPU.
- При трёх равных зонах каждая держит 125 GPU, всего 375; после потери одной остаются требуемые 250, а не пул, уже загруженный на 100%.
- Forecast autoscaling может сокращать активные replicas, только если резерв и время старта сохраняют этот контур отказа; иначе перегрузка переходит в явный admission или load-shed режим.
Зачем это спрашивают: В расчёте запас по загрузке применяется после отказа, а не выдаётся голая пиковая мощность за отказоустойчивую.
Я бы сначала профилировал память и задержку, затем изолировал критичные модели в поддерживаемых MIG-профилях названного GPU, а не планировал абстрактные сегменты.
- Например, на 16 A100 40 GB критичная модель с измеренным пиком 14 ГБ помещается с запасом в профиль 3g.20gb; модель, которая не помещается, получает полный GPU.
- NVIDIA Kubernetes device plugin публикует MIG-ресурсы, планировщик закрепляет один критичный экземпляр Triton за MIG-сегментом, а контроль допуска не разрешает запускать больше экземпляров, чем допускает профиль памяти.
- Long-tail модели используют отдельные полные GPU или совместимые меньшие профили с weighted queues и выгрузкой после простоя.
- Noisy-neighbor тесты покрывают точную MIG-раскладку, формы входа, Triton instance groups и конкурентный пик памяти, требуя p99 критичных моделей ниже 80 мс и long-tail ниже 500 мс.
Зачем это спрашивают: MIG-изоляция убедительна только с поддерживаемым SKU, конкретными профилями, placement и измеренной памятью модели.
Я бы версионировал предобработку как декларативный контракт и проверял каждый runtime на том этапе, где различия имеют смысл.
- Семантика decoder, EXIF orientation, порядок цветов, геометрия resize, padding, нормализация, layout, dtype и округление фиксируются дайджестом.
- Метаданные и преобразования координат должны совпадать точно, а FP32-тензоры используют строгий численный допуск из golden fixtures вместо универсальной константы.
- FP16 и INT8 runtimes получают допуски тензоров с учётом dtype и decision-level parity для рамок, масок, классов и NMS около рабочего порога.
- Изменение контракта создаёт новую версию и требует либо переобучения, либо явного доказательства совместимости для каждого целевого runtime.
Зачем это спрашивают: Полезный parity-контракт отделяет точную геометрию от зависящих от точности тензоров и итоговых решений модели.
Я бы ограничил матрицу одним движком на сочетание модели, целевого стека и точности, размещая несколько optimization profiles внутри движка при общем безопасном контуре памяти.
- Для INT8 в TensorRT 10 экспортированный граф содержит явные Q/DQ nodes; quantization scales или calibration artifact получают на репрезентативном датасете и фиксируют дайджестами датасета и графа, а не перекалибруют только из-за смены SKU GPU.
- Движки собираются и измеряются для точного целевого стека: compute capability T4, L4, A10 или Orin, OS либо JetPack, CUDA, TensorRT, plugins, tactic policy и разрешённые формы.
- Один сериализованный движок может содержать несколько optimization profiles; я выбираю три для ожидаемых малых, средних и больших диапазонов форм и разделяю движки только при обосновании по старту, памяти или производительности tactics.
- Валидация покрывает границы каждого профиля, качество соответствующей точности, десериализацию на цели, пик памяти и задержку вместо обещания переносимости между стеками.
Зачем это спрашивают: Современный контроль TensorRT означает явную Q/DQ-квантизацию, сборку под целевой стек и учёт профилей внутри движка без двойного умножения.
Закрытые вопросы
- 21
Определите приёмку перевода FP32-детектора в INT8, если p99 должен улучшиться на 35%, а recall может упасть максимум на 0,5 пункта.
latency - 22
Модель сегментации на 180 миллионов параметров должна поместиться в 4 ГБ на edge и работать быстрее 60 мс; спроектируйте pruning и distillation.
model-compressiondesignsegmentation - 23
Спроектируйте детекцию объектов 6-20 пикселей на 20-мегапиксельных аэроснимках с обработкой снимка быстрее 2 секунд.
detectiondesign - 24
Спроектируйте сегментацию слайдов 30 000 на 30 000 пикселей при 8 ГБ GPU, ошибке швов ниже 0,5% и SLA 90 секунд.
segmentationdesignhardware - 25
Спроектируйте фузию камер, лидара и радара на 20 Гц с выдачей объектов за 80 мс и безопасностью после деградации одного сенсора.
design - 26
Спроектируйте сервис калибровки для 1 000 объектов по 8 камер с ошибкой репроекции ниже 0,5 пикселя и обнаружением дрейфа за 10 минут.
calibrationdesigniac - 27
Восемь камер с rolling shutter и два лидара асинхронно снимают движущегося робота; спроектируйте временную калибровку и компенсацию движения с эквивалентной ошибкой совмещения ниже 2 мс.
calibrationdesignasync - 28
Для складского робота на 2 м/с выберите, как stereo и lidar дополняют друг друга для препятствий 0,3-30 метров на 20 Гц.
warehouse - 29
Определите интерфейс SLAM и perception для 500 роботов при ежедневных картах и воспроизводимости старых запусков 90 дней.
types - 30
Спроектируйте понимание 100 000 восьмичасовых видео в месяц с поиском активностей через 15 минут после загрузки.
design - 31
Спроектируйте multi-object tracking для 200 камер при 30 FPS и 100 объектах в кадре, с ID switches ниже 1% и p99 ниже 100 мс.
designlatency - 32
Спроектируйте privacy-хранение 5 000 потоков, если сырое видео живёт 72 часа, клипы инцидентов 30 дней, а удаление занимает 24 часа.
retentiondesignincidents - 33
Спроектируйте защиту face-entry на 50 000 пользователей от spoofing и adversarial-атак с false accept ниже 0,01% и p99 ниже 300 мс.
designmodel-servinglatency - 34
Recall упал после поэтапных обновлений camera firmware, ISP, предобработки и модели на 10 000 камер; как локализовать причину через factorial cohorts?
cohorts - 35
Спроектируйте feedback и label loop для 2 миллионов предсказаний в день с обучаемыми исправлениями за 48 часов.
feedbackdesign - 36
Спроектируйте active learning для 100 миллионов изображений с бюджетом 50 000 меток в неделю и целью 2 пункта recall за квартал.
design - 37
Определите governance синтетических данных, если рендеры пяти симуляторов составляют 30% набора редких дефектов.
train-testformsgovernance - 38
Спроектируйте safeguards continual learning при ежедневных 20 000 меток и допустимой потере recall старого домена 0,5 пункта.
design - 39
Спроектируйте safe rollback perception-релиза на 10 000 устройств с началом за пять минут и завершением за 30 минут.
designrollback - 40
Определите perception SLO и error budget для 5 000 камер с решениями за 200 мс, где пропуск в десять раз дороже ложной тревоги.
reliabilityslo - 41
Спроектируйте CV observability для 10 000 камер и 40 моделей без неконтролируемого роста кардинальности метрик и потери диагностики камеры.
observabilitymonitoringdesign - 42
GPU-инференс 20 000 FPS стоит 500 000 долларов в месяц; снизьте стоимость на 40% без p99 выше 120 мс и потери recall более 0,5 пункта.
inferencelatencyhardware - 43
Определите release governance пяти CV-команд с 30 версиями моделей в месяц для safety-sensitive продукта.
- 44
Спроектируйте dataset governance для 3 ПБ изображений в 20 командах, если отзыв согласия должен блокировать обучение за 24 часа.
design - 45
Спроектируйте bias и slice evaluation детектора пешеходов в шести странах без demographic или environment recall gap выше 3 пунктов.
llm-evaldesign - 46
Составьте контракт качества подрядчика на 500 000 рамок в неделю по 12 классам.
procurement - 47
Спроектируйте версионирование inference API для 25 клиентов при еженедельных моделях, совместимости шесть месяцев и p99 ниже 150 мс.
designinferenceapi - 48
Спроектируйте regional fault tolerance CV API на 15 000 FPS в Европе и Северной Америке с 99,99% доступности и восстановлением за пять минут.
designapi - 49
Конвейер получает 30 FPS с камеры, но пять минут обрабатывает только 20 FPS; задайте backpressure и drops при свежести 200 мс.
backpressureconcurrencyci-cd - 50
Спроектируйте крупномасштабную structure-from-motion реконструкцию для 2 миллионов городских изображений с геометками, регистрацией минимум 95% кадров и RMSE 10 см на геодезических контрольных точках.
evaluationdesign - 51
После деплоя TensorRT медианная задержка детектора снизилась с 42 до 18 мс, но на динамических входах 1920×1080 продакшн-p99 достигает 210 мс. Как проверить, связано ли это с optimization profiles?
optimizationlatencydeployment - 52
Recall пешеходов равен 91% в целом, но после замены освещения упал до 58% на 140 ночных камерах одного региона. Что вы сделаете?
- 53
После обновления датасета офлайн-mAP детектора вырос с 0,61 до 0,79 без убедительного изменения модели. Как проверить утечку видеокадров и получить допустимого кандидата на релиз?
- 54
После сбоя двухкамерная фузия размещает одну машину в точках на расстоянии 4 метров, а метки времени камер за сутки расходятся до 380 мс. Как вы отреагируете?
iac - 55
Сервис калибровки опубликовал неверные extrinsics для 320 камер, из-за чего проекции детекций сместились на 1,7 метра. Каков ваш план инцидента?
calibrationincidents - 56
После включения динамических батчей серверы Triton получают GPU OOM, хотя среднее потребление памяти равно лишь 63%. Как вы проведете диагностику и ограничите проблему?
memoryhardwarebatch - 57
p95 очереди инференса достиг 1,4 секунды, пока утилизация GPU остается около 22%. Куда вы посмотрите сначала?
inferencedata-structureshardware - 58
Edge-детектор начинает с 28 FPS, но через 18 минут при температуре воздуха 42°C падает до 11 FPS. Как вы ограничите проблему и квалифицируете решение?
decodingsoft-skills - 59
INT8-квантизация сохраняет общий mAP в пределах 0,6 пункта, но снижает recall редких опасных сближений погрузчика с человеком с 86% до 49%. Вы выпускаете модель?
model-compression - 60
Кастомный ONNX-оператор rotated NMS преобразовали в плагин TensorRT. На A100 он совпадает с эталоном, но на L4 и Jetson Orin смещает boxes при batch 5 и динамической ширине. Как исследовать проблему и безопасно выпустить плагин?
batchserving-runtimes - 61
Кастомное CUDA-ядро постпроцессинга меняет 0,4% детекций между одинаковыми запусками, из-за чего safety-тесты нестабильны. Какие доказательства и правило приемки вы потребуете?
flakyimage-kernels - 62
Обучающий job на 64 GPU теряет один узел с 8 GPU через 11 часов. Он должен продолжить на 56 GPU, затем вернуться к 64 без повреждения optimizer state и скрытых пропусков данных. Как спроектировать восстановление?
optimizationhardwaredesign - 63
Job на 64 GPU не может восстановиться: один объект optimizer checkpoint оказался на 38% короче после multipart upload, а другие workers уже закешировали шарды этого поколения. Как восстановиться и предотвратить частичное чтение чекпоинта?
cachingoptimizationhardware - 64
Размеры pedestrian boxes в новой разметке внезапно уменьшились на 12%, и выяснилось, что подрядчик без уведомления изменил правило для окклюзий. Как вы отреагируете?
procurement - 65
Продуктовая онтология разделяет класс vehicle на car и truck, но 18 миллионов старых labels, шесть развернутых моделей и три года оценок используют только vehicle. Как развить онтологию без потери сопоставимости?
llm-evaldeployment - 66
После обновления video ingestion motion features ломаются на 2,6% клипов. В пакетных логах PTS немонотонен при наличии B-frames. Как определить, действительно ли переставлены кадры?
- 67
Warehouse-трекер дает в среднем 4,8 переключения ID в минуту, когда работники проходят за стеллажами, вместо прежних 0,9. Как вы его улучшите?
warehouse - 68
После релиза робот получает препятствия на 2 метра левее их позиции на изображении, потому что один сервис инвертировал боковую ось 3D. Что вы сделаете?
- 69
Оценки глубины смещены на 14% на одной партии стереокамер: в метаданных baseline равен 120 мм, а разбор устройства показывает 105 мм. Как вы поступите?
soft-skillsestimationbatch - 70
Только в продакшне внутри сплошных масок сегментации появляются мелкие отверстия, а в notebook результат правильный. Что вы проверите?
segmentationsolid - 71
Open-vocabulary детектор расширили с 40 одобренных меток до 260 понятий, заданных промптами. mAP известных классов не изменился, но после правок промптов и онтологии число ложных предупреждений об опасности выросло с 0,7 до 8,4 на камеру в час. Как исследовать проблему?
promptingalerting - 72
Tiled-детектор 4K вместе с фузией трех камер создает дублирующиеся boxes для 14% машин у границ тайлов и в зонах пересечения камер. NMS внутри каждого тайла работает правильно. Как исправить координаты и fusion path?
- 73
После редизайна упаковки false defect alarms выросли с 1,1% до 16% на 40 инспекционных линиях. Как вы отреагируете?
defects - 74
Монитор дрейфа создает alert при embedding PSI 0,31, но ошибки модели и условия камер выглядят неизменными. Как определить, действительно ли изменилась геометрия эмбеддингов?
nlpembeddingsmonitoring - 75
Ground-truth labels приходят через 30 дней после инференса, но эксплуатации нужен alert о падении recall за 24 часа. В день можно проверить только 300 клипов. Что вы построите и что это сможет доказать?
inference - 76
Кандидатный детектор 14 дней работал в shadow: recall выше на 3,2 пункта, false positive хуже на 0,7 пункта, p99 медленнее на 18 мс, а интервалы двух редких критичных классов пересекаются. Вы выпускаете его?
confidence-intervalslatency - 77
Rollout модели провалился, но предыдущий артефакт не загружается, потому что сервис препроцессинга уже выдает новую схему тензоров. Как восстановиться и предотвратить повторение?
schemaartifacts - 78
За 48 часов edge OTA-релиз модели дошел только до 62% из 8 000 устройств, а сбои распределены по четырем версиям прошивки. Что вы сделаете?
- 79
40-минутный WAN outage ломает гибридную vision-систему: edge-устройства бесконечно ждут облачную классификацию. Как вы измените поведение при отказе?
classificationsystem-design - 80
После сбоя шлюза 900 потоков с камер одновременно переподключаются, перегружая очереди декодирования и задерживая live alerts на 12 минут. Как ограничить backlog и восстановиться?
backloggatewaydata-structures - 81
Сырые кадры лиц 2 300 пользователей обнаружены в debug bucket, доступном всей компании. Что вы сделаете в первые часы?
- 82
Распечатанный adversarial patch позволяет 9 из 20 тестовых машин обойти gate camera, а похожие изображения найдены в продакшн-логах. Как отреагировать и задать защищаемую границу приемки?
- 83
Соблюдение p99 SLO инференса в 100 мс стоит $420 000 в месяц на GPU, а ослабление до 160 мс сэкономит 38% без измеренного роста отказов пользователей. Что вы рекомендуете?
sloinferencelatency - 84
Облачный провайдер не может предоставить 160 запланированных H100 к запуску через три недели и гарантирует только 70. Каков ваш план?
- 85
Точность скрытых gold-задач подрядчика по разметке упала с 96% до 71% в поставке из 180 000 boxes. Как вы восстановитесь?
procurement - 86
Active-learning loop выбирает кадры с низкой уверенностью; после двух циклов качество на смазанных кадрах выросло, но на ясных дневных сценах упало на 8 пунктов. Что произошло?
performance - 87
Добавление 4 миллионов синтетических изображений повышает benchmark mAP на 6 пунктов, но снижает recall на реальных фабриках на 9 пунктов. Как вы диагностируете переобучение на synthetic data?
benchmarking - 88
Поставщик заменил image sensor в 60 000 устройствах; color response и rolling shutter изменились, снизив recall с 89% до 74%. Какие доказательства нужны для квалификации?
- 89
Юрисдикция требует за 30 дней удалить идентифицируемое видео одного клиента и производные training data. Как вы это выполните?
- 90
Продакшн-модель невозможно воспроизвести: в registry есть weights, но нет точного commit кода, snapshot датасета и CUDA-окружения. Что вы сделаете?
snapshotregistries - 91
Junior-инженер выпускает обновление pose-модели, которое меняет местами левые и правые keypoints после horizontal flip и считает все окклюдированные joints неразмеченными. Как вы будете менторить инженера и исправлять релиз?
keypointsscalingmentoring - 92
Два senior-инженера спорят между CNN и ViT для edge-детектора; на решение есть две недели и шесть device-days. Как вы разрешите спор?
cnnconflict - 93
Product просит рекламировать 98% accuracy, но это число исключает пустые кадры, а на ночном срезе результат всего 72%. Что вы ответите?
- 94
После multilingual OCR-релиза общий character error rate остается 4,1%, но word error rate растет до 22%, а 12% арабских и двуязычных счетов получают неправильный порядок чтения. Как вы проведете техническое исправление?
ocr - 95
Ваша on-call смена заканчивается во время outage: 37 площадок деградированы, причина неизвестна, а рискованное исправление находится посередине canary на 20 площадках. Как вы передадите дежурство?
on-calldeployment-strategies - 96
Нужно отключить 14 legacy-клиентов инференса, которые отправляют три формата изображений и не передают версию модели; на них приходится 18% трафика. Каков план миграции?
inferencemigrationsimages - 97
Спроектируйте 90-минутное hiring exercise для senior computer vision engineer, которое не награждает заучивание model trivia. Что вы предложите?
cvdesign - 98
На квартал можно профинансировать один CV tech debt: дублирование preprocessing вызывает 9 инцидентов в год, сборки моделей тратят лишние $240 000, а calibration tooling задерживает каждый релиз на 4 дня. Как выбрать?
incidentstech-debtcalibration - 99
Новый vision transformer превосходит вашу модель на 7 mAP в публичном benchmark, но теряет 11 пунктов recall и вдвое снижает throughput на продакшн-камерах. Каков вывод?
nlpvitthroughput - 100
Data, model и edge-команды отказываются владеть повторяющимся расхождением preprocessing, которое вызвало четыре инцидента за два месяца. Какую операционную модель вы установите?
incidentsownership