Skip to content

Вопросы на собеседовании: NLP-инженер

100 реальных вопросов с образцовыми ответами и пояснениями для уровня NLP-инженер II.

Смотреть пример резюме: NLP-инженер

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

queries

Масштабирование удерживает логиты attention в диапазоне, где softmax сохраняет полезные градиенты при росте размерности key.

  • Дисперсия немасштабированных скалярных произведений пропорциональна размерности key, поэтому при больших размерностях логиты становятся экстремальными.
  • Экстремальные логиты делают softmax почти one-hot, из-за чего большинство производных стремится к нулю.
  • Деление на квадратный корень из размерности key нормализует дисперсию, не меняя выученное ранжирование ключей.

Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат связать формулу attention с численной стабильностью и поведением оптимизации.

distinct

Несколько голов позволяют модели параллельно представлять разные связи между токенами, не заставляя одну карту attention кодировать все закономерности.

  • Одна голова может выделять локальные синтаксические связи, например согласование прилагательного с существительным, а другая отслеживать дальнюю кореференцию.
  • Отдельные обучаемые проекции query, key и value дают каждой голове собственное пространство меньшей размерности.
  • Роли голов не гарантированы и не всегда интерпретируемы, а избыточные головы часто можно удалить почти без потери качества.

Зачем это спрашивают: Сильный ответ отличает рост выразительности от необоснованного утверждения, что у каждой головы есть фиксированный лингвистический смысл.

nlpbert

Я бы сравнил подходящие для задачи чекпоинты, потому что RoBERTa и DeBERTa часто качественнее BERT, но могут требовать больше памяти или времени.

  • BERT является стабильной базовой моделью с широкой поддержкой чекпоинтов и инструментов, особенно когда важна совместимость.
  • RoBERTa изменила предобучение за счет большего объема данных, динамического masking и отказа от next-sentence prediction, что обычно улучшает представления при сопоставимом размере.
  • DeBERTa разделяет attention по содержанию и позиции и часто дает более высокое качество, но ее реализация и профиль инференса должны подходить продакшн-стеку.
  • Я сравниваю качество на валидации, p95 latency, память, покрытие токенизатора и наличие доменных чекпоинтов, а не только место в бенчмарке.

Зачем это спрашивают: Интервьюер ожидает практическое сравнение семейств моделей с учетом различий предобучения и ограничений развертывания.

Encoder-decoder модель подходит для нового вывода переменной длины, а encoder-only модель проще для меток, спанов или эмбеддингов.

  • Перевод и абстрактивная суммаризация требуют авторегрессионного декодирования на основе закодированного источника, что дают модели вроде T5 или BART.
  • Для классификации и разметки токенов обычно достаточно энкодера с небольшим task head без задержки декодера и ошибок генерации.
  • Экстрактивная суммаризация тоже может использовать только энкодер, потому что выбирает предложения источника, а не генерирует текст.

Зачем это спрашивают: Вопрос проверяет, сопоставляет ли кандидат архитектуру модели со структурой вывода, а не превращает все NLP-задачи в генерацию.

nlptokenscrf

Линейный CRF оценивает всю последовательность меток и использует обучаемые оценки переходов между соседними тегами вместо независимого предсказания каждого токена.

  • Обычный CRF с алгоритмом Витерби не гарантирует допустимый BIO-вывод; перед декодированием я добавляю маску переходов или задаю недопустимым переходам оценку минус бесконечность.
  • Выигрыш наиболее вероятен при сильных закономерностях переходов и ограниченных данных; крупный энкодер может уже выучить большую часть этой структуры.
  • CRF усложняет обучение и декодирование и не решает вложенные или разрывные сущности, потому что по-прежнему выдает один линейный тег на токен.

Зачем это спрашивают: Интервьюер оценивает понимание пользы последовательного уровня и структурных ограничений CRF.

classificationtokensner

Token classification назначает токенам BIO-метки, а span-модель оценивает диапазоны start-end и тип каждого кандидата.

  • Разметка токенов вычислительно эффективна и подходит для плоских сущностей, но требует аккуратного выравнивания сабвордов и обработки недопустимых переходов тегов.
  • Оценка спанов напрямую представляет границы сущности и может классифицировать пересекающиеся кандидаты, поэтому естественнее поддерживает вложенный NER.
  • Перебор всех спанов квадратичен по длине последовательности, поэтому на практике ограничивают ширину спана или отбирают кандидатов.
  • Я выбираю подход по структуре разметки и бюджету latency, а затем оцениваю точные спаны сущностей, а не accuracy токенов.

Зачем это спрашивают: Сильный ответ связывает представление вывода с поддержкой пересечений, вычислительной стоимостью и оценкой.

bio-tags

Одна BIO-метка на токен не может представить пересекающиеся слои сущностей или одну сущность из нескольких несмежных фрагментов.

  • Для вложенных сущностей, например New York внутри New York University, нужны классификация спанов, многослойные теггеры или декодирование на основе гиперграфа.
  • Для разрывных упоминаний, распространенных в медицинских текстах, нужны модели, связывающие несколько спанов либо предсказывающие фрагменты и отношения между ними.
  • Схема аннотации должна определить, нужны ли внутренние сущности и разрывные упоминания, потому что от этого зависят архитектура и оценка.

Зачем это спрашивают: Интервьюер проверяет, видит ли кандидат ограничение представления, а не объясняет такие случаи недостаточной мощностью модели.

Энкодер выдает оценку каждого токена как возможного начала и отдельную оценку как возможного конца, после чего выбирается допустимая пара с высоким score.

  • При обучении обычно применяют cross-entropy к правильным позициям начала и конца на основе контекстных представлений токенов.
  • На инференсе рассматривают пары, где конец не предшествует началу, и часто ограничивают максимальную длину ответа.
  • Независимые start и end heads эффективны, но могут предпочитать несовместимые границы, поэтому совместная оценка спана или reranking помогают на сложных примерах.

Зачем это спрашивают: Вопрос проверяет, может ли кандидат объяснить конкретный механизм предсказания и декодирования в экстрактивном QA.

system-design

Модели нужен явный score отсутствия ответа, который сравнивается с лучшим кандидатом-спаном по настроенному порогу.

  • Системы в стиле BERT часто используют classification token как null span и сравнивают его score с лучшим ненулевым start-end score.
  • Я настраиваю порог разницы scores на валидации, балансируя полноту вопросов без ответа и число ложных ответов.
  • Оценка должна отдельно показывать срезы вопросов с ответом и без него, иначе aggregate exact match скроет слишком частые отказы.
  • Перед изменением порога следует отдельно проверить калибровку и полноту поиска подходящего отрывка.

Зачем это спрашивают: Интервьюер хочет увидеть, что отказ рассматривается как оцениваемое решение с явной валидацией, а не как дополнительная эвристика.

design

Я бы сохранил структуру таксономии в предсказании и loss, чтобы дочерняя метка не могла появиться без совместимого родителя.

  • Каскад сверху вниз сужает кандидатов на каждом уровне и легко объясняется, но ранняя ошибка родителя блокирует всех потомков.
  • Одна модель с иерархическими ограничениями может разделять признаки между уровнями и обеспечивать допустимые пути при декодировании.
  • Я показываю метрики на каждой глубине и path accuracy, потому что правильный родитель с неверным листом отличается от полностью ошибочной ветки.

Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат использовать структуру меток и анализировать ошибки с правильной детализацией.

classification

В multilabel-классификации каждая метка предсказывается независимо или с учетом зависимостей, потому что для одного документа могут быть верны несколько меток.

  • На выходе обычно используют отдельный sigmoid для каждой метки с binary cross-entropy, а не softmax с суммой вероятностей, равной единице.
  • Пороги нужно настраивать глобально или отдельно по меткам, потому что редким меткам часто нужна другая рабочая точка.
  • Micro F1 сильнее учитывает частые метки, а macro F1 выявляет слабое качество редких.
  • При устойчивом совместном появлении меток classifier chains или общее представление с моделированием зависимостей могут использовать этот сигнал.

Зачем это спрашивают: Сильный ответ охватывает изменения выходного слоя, правила решения и метрик, а не только определение multilabel-данных.

context

Я бы разделил документ на смысловые фрагменты, закодировал их и агрегировал evidence, сохранив достаточно структуры документа для предсказания метки.

  • Для редких решающих фрагментов max pooling или top-k attention по логитам частей может поднять один важный абзац.
  • Для распределенного evidence второй transformer или рекуррентный агрегатор может моделировать упорядоченные представления фрагментов.
  • При обучении нужно сэмплировать полные документы, а не считать фрагменты независимо размеченными, если метка относится только ко всему тексту.
  • Я проверяю размер, overlap и обрезание фрагментов на срезах длинных документов, потому что случайные короткие примеры скрывают потерю покрытия.

Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат избежать наивного обрезания и выбрать агрегацию под расположение evidence.

chunkinglong-context

Я бы использовал энкодер с разреженным attention, когда решение зависит от связей между удаленными разделами, которые теряются при агрегации фрагментов.

  • Attention со скользящим окном снижает квадратичную стоимость локального контекста, а выбранные global tokens связывают информацию по всему документу.
  • Более длинный ввод все равно увеличивает память и latency, а предобученные чекпоинты могут быть слабее или менее доменными, чем у стандартных энкодеров.
  • Разбиение остается проще для независимо информативных разделов и позволяет обрабатывать только нужные части.
  • Я сравниваю качество на примерах со связями между разделами и p95 стоимость инференса, а не считаю больший контекст автоматически лучшим.

Зачем это спрашивают: Вопрос оценивает понимание компромиссов качества и системы у архитектур для длинных документов.

nlpembeddingstokens

Я использую pooling, согласованный с целью обучения модели, а не считаю первый токен универсальным семантическим вектором предложения.

  • Mean pooling по токенам без padding является сильной базой для sentence-transformer моделей и использует информацию всей последовательности.
  • Pooling первого токена работает, когда чекпоинт специально обучали под это представление, но обычное masked-language pretraining этого не гарантирует.
  • Для cosine search я обычно применяю L2-нормализацию и проверяю качество на доменных парах, включая срезы коротких и длинных предложений.

Зачем это спрашивают: Интервьюер проверяет понимание того, что качество эмбеддинга совместно определяют pooling и цель обучения.

retrievalbi-encodercross-encoder

Я использую bi-encoder для дешевого поиска по множеству кандидатов, а cross-encoder для более точной попарной оценки небольшого набора.

  • Bi-encoder независимо вычисляет переиспользуемые векторы, поэтому можно эффективно индексировать и искать среди миллионов документов или кандидатов в дубликаты.
  • Cross-encoder совместно применяет attention к обоим текстам и видит тонкие связи токенов, но запускается отдельно для каждой пары.
  • Практический поисковый стек извлекает кандидатов bi-encoder и переранжирует, например, от 20 до 100 результатов cross-encoder.
  • При офлайн-дедупликации сначала нужны blocking rules или приближенный поиск, чтобы избежать квадратичного cross-encoding всех пар.

Зачем это спрашивают: Сильный ответ ограничивает сравнение дискриминативным сопоставлением и количественно объясняет двухэтапный дизайн.

retrievalbm25dense-retrieval

BM25 вознаграждает лексическое совпадение терминов, а dense retrieval сопоставляет обученные семантические представления, поэтому они ошибаются на разных запросах.

  • BM25 силен для точных кодов товаров, редких названий и новых терминов без переобучения модели.
  • Dense retrieval обрабатывает перефразирование вроде waterproof hiking shoes и rain-resistant trail footwear, но может пропустить точный идентификатор.
  • Scores BM25 зависят от частоты термина, inverse document frequency и нормализации длины; качество dense зависит от обучающих пар и покрытия домена.
  • Я оцениваю методы по срезам запросов и часто объединяю ранжированные результаты, когда важны семантика и точное совпадение.

Зачем это спрашивают: Интервьюер ожидает специфичные для поиска сильные стороны и ошибки, а не общее определение sparse и vector подходов.

nlpembeddingsbatch

Contrastive training сближает совпадающие пары текстов и отдаляет несовпадающие в пространстве эмбеддингов с помощью цели на основе similarity.

  • В multiple-negatives ranking loss остальные targets в батче становятся negatives для каждого query, давая много сравнений без дополнительного кодирования.
  • Большие батчи обычно усиливают сигнал, но создают false negatives, когда другой элемент батча на самом деле релевантен или эквивалентен.
  • Temperature определяет, насколько сильно loss выделяет близких конкурентов, и настраивается вместе с нормализацией эмбеддингов.
  • Формирование батчей должно исключать дублирующиеся positives среди negatives и соответствовать продакшн-задаче сопоставления.

Зачем это спрашивают: Вопрос проверяет понимание механики и предположений о данных при эффективном обучении эмбеддингов.

retrieval

Полезный hard negative выглядит правдоподобно для текущего retriever, но действительно нерелевантен по правилам разметки задачи.

  • BM25 или предыдущая dense-модель могут находить верхние неположительные результаты с общей лексикой или темой запроса.
  • Случайные negatives часто слишком просты и почти ничему не учат, когда модель уже отделяет несвязанные документы.
  • Непроверенные верхние результаты могут быть false negatives, поэтому я исключаю известные positives и вручную проверяю либо оцениваю cross-encoder часть выборки.
  • Я обновляю найденные negatives во время обучения, потому что сложные для начальной модели примеры перестают быть информативными.

Зачем это спрашивают: Сильный ответ показывает, как усложнить обучение, не испортив цель ошибочно размеченными релевантными парами.

Domain-adaptive pretraining продолжает исходную self-supervised цель энкодера на неразмеченном доменном тексте перед supervised fine-tuning.

  • Masked-language modeling на медицинских записях или юридических документах обучает доменной терминологии и употреблению без task labels.
  • Подход особенно полезен, когда целевой корпус сильно отличается от общих данных предобучения, а размеченных примеров мало.
  • Я оставляю downstream-валидацию, при признаках forgetting подмешиваю общий текст и сравниваю результат с простым добавлением размеченных примеров.
  • Токенизатор остается ограничением, поэтому сильная фрагментация терминов может оправдать адаптацию словаря с аккуратной инициализацией эмбеддингов.

Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат встроить продолженное предобучение энкодера в экономически обоснованный процесс адаптации.

fine-tuning

При послойном уменьшении learning rate нижние слои энкодера получают меньшие обновления, а верхние слои и целевая голова постепенно более крупные.

  • Например, для головы можно задать 2e-5 и умножать rate на 0,8 с каждым слоем в сторону эмбеддингов, чтобы общие лексические признаки менялись меньше целевых.
  • Подход часто помогает при небольшом размеченном наборе или близкой к предобучению задаче, где крупные обновления нижних слоев могут стереть полезные представления.
  • При сильном сдвиге домена он может мешать, если нижним слоям тоже нужно адаптироваться, поэтому я сравню его с единым learning rate, а не буду считать уменьшение заведомо лучшим.
  • Я настраиваю rate головы и коэффициент уменьшения вместе, а выбираю их по качеству на отложенной выборке и стабильности обучения на нескольких seed.

Зачем это спрашивают: Интервьюер проверяет понимание иерархии обновлений, компромисса между сохранением и адаптацией признаков и способа валидации настройки.

Закрытые вопросы

  • 21

    Когда замораживание слоев энкодера помогает при fine-tuning задачи?

    fine-tuning
  • 22

    Когда multi-task learning улучшает NLP-энкодер и как оно может навредить?

    nlp
  • 23

    Как дистиллировать большой классификатор текстов в меньший энкодер?

  • 24

    Каковы основные компромиссы при pruning энкодерной модели?

    model-compression
  • 25

    Как INT8 quantization влияет на инференс энкодера?

    inferencemodel-compression
  • 26

    Как выбрать между ONNX Runtime и TensorRT для инференса энкодера?

    model-servingserving-runtimes
  • 27

    Как dynamic batching улучшает инференс энкодера и какую задержку добавляет?

    batchmodel-servinglatency
  • 28

    Как откалибровать confidence scores классификатора текстов?

    calibration
  • 29

    Как установить пороги решений для multilabel-классификатора?

    thresholding
  • 30

    Когда использовать focal loss вместо resampling для несбалансированной классификации текстов?

    classificationimbalanced
  • 31

    Как weak или distant supervision может создавать обучающие метки для NLP-задачи?

    nlp
  • 32

    Как спроектировать цикл active learning для аннотации текстов?

    design
  • 33

    Когда использовать Cohen's kappa, а когда Krippendorff's alpha для согласия аннотаторов?

  • 34

    Как проводить adjudication разногласий аннотаторов, не скрывая проблемы гайдлайна?

    conflict
  • 35

    Как развивать продакшн-таксономию меток, не обесценивая старые обучающие данные и метрики?

    monitoring
  • 36

    Как выбрать между mBERT и XLM-R для мультиязычной задачи на базе энкодера?

  • 37

    Как выполнить zero-shot cross-lingual transfer для классификации intent?

    classification
  • 38

    Что такое tokenizer fertility и почему она важна в мультиязычном NLP?

    nlptokenstokenizer-fertility
  • 39

    Как обрабатывать транслитерацию и code-switching в мультиязычном классификаторе текстов?

    code-switching
  • 40

    Какие методы augmentation полезны для low-resource NLP-задачи и как контролировать шум меток?

    nlp
  • 41

    Что измеряют BLEU и ROUGE и какое важное качество они могут пропустить?

    bleurouge
  • 42

    Чем BERTScore отличается от метрик лексического совпадения для перевода или суммаризации?

    monitoring
  • 43

    Как оценивать NER, если точное совпадение границ сущности является не единственным полезным результатом?

  • 44

    Как с помощью bootstrap testing решить, действительно ли одна NLP-модель лучше другой?

    nlptesting
  • 45

    Как спроектировать robustness, slice и fairness оценку классификатора текстов?

    llm-evaldesign
  • 46

    Какой lineage данных и модели следует записывать в MLflow или Weights & Biases для NLP-эксперимента?

    nlplineageexperiments
  • 47

    Что должен содержать контракт модели и данных для продакшн NLP-классификатора?

    nlpdata-contracts
  • 48

    Как построить воспроизводимый пайплайн предобработки большого текстового корпуса на Spark и Airflow?

    airflowci-cdspark
  • 49

    Как спроектировать Kafka-пайплайн для потоковой NLP-классификации?

    kafkadesignstreaming
  • 50

    Как спроектировать индекс Elasticsearch для лексического поиска в NLP-продукте?

    indexessearchdesign
  • 51

    NER-модель достигает 97% token accuracy, но только 71% entity-level F1. Как вы диагностируете разрыв?

    tokens
  • 52

    Ваш BIO-теггер выдаёт последовательности вроде I-ORG после O и I-PER после B-ORG. Как вы исправите невалидный вывод?

    bio-tags
  • 53

    В юридических договорах встречаются вложенные сущности, например компания внутри определённого имени стороны, но BIO-модель возвращает только одну метку на токен. Что вы спроектируете?

    tokensdesignbio-tags
  • 54

    Два аннотатора получили Cohen's kappa 0,48 для интентов обращений в поддержку. Что вы сделаете до обучения классификатора?

  • 55

    Цикл active learning выбирает только короткие неоднозначные жалобы, а качество на длинных обычных тикетах падает. Как вы исправите смещение выборки?

    samplingperformance
  • 56

    Эвристические weak labels удвоили обучающую выборку, но precision на валидации резко упал. Как вы найдёте и уменьшите шум меток?

    train-testvalidationweak-supervision
  • 57

    У двух интентов поддержки Cohen's kappa равна 0,38, и модель чаще всего путает их между собой, но продукт утверждает, что они запускают разные процессы. Как решить, нужно ли их объединить, уточнить или собрать больше данных?

  • 58

    Классификатор обращений уверенно относит запросы о новой функции приостановки подписки к оплате или отмене, хотя такого интента нет в таксономии. Как вы добавите безопасный отказ от классификации?

    resilience
  • 59

    Мультилейбл-классификатор обращений иногда одновременно предсказывает refund-approved и refund-denied или выдаёт card-chargeback без родительской метки payments. Как вы обеспечите согласованность таксономии?

  • 60

    Общая accuracy равна 94%, но recall редкого класса мошеннических текстов составляет 38%. Что вы измените?

  • 61

    Классификатор тикетов показывает 98% офлайн, но ломается после удаления подписей писем и заголовков маршрутизации. Как вы устраните shortcut?

  • 62

    Validation F1 равен 96%, но ручная проверка находит почти одинаковые документы в train и validation. Как вы исправите утечку?

    leakagevalidation
  • 63

    Новостной классификатор оценивают случайным сплитом, но в продакшне он всегда предсказывает статьи, опубликованные позже. Как вы перестроите оценку?

    llm-evaldecision-making
  • 64

    Классификатор, обученный на чатах, теряет 15 пунктов F1 после развёртывания на расшифровках телефонных звонков. Как вы обработаете domain drift?

    deploymentiac
  • 65

    BERT-классификатор документов пропускает условия расторжения, которые обычно находятся в конце договоров длиной 2000 токенов. Что вы измените?

    tokensbertresilience
  • 66

    Перекрывающиеся окна повышают recall на длинных документах, но одно положительное окно делает положительными слишком много целых документов. Как вы агрегируете скоры окон?

    aggregation
  • 67

    Extractive QA-модель выбирает правильные слова, но возвращаемые символьные смещения подсвечивают неверную подстроку исходного документа. Как вы это отладите?

  • 68

    Extractive QA-система отвечает на вопросы без ответа правдоподобными спанами. Как вы настроите поведение no-answer?

    system-design
  • 69

    Поиск товаров находит перефразировки через dense embeddings, но пропускает точные номера деталей, а BM25 находит номера, но слабо понимает намерение. Как вы спроектируете поиск?

    nlpembeddingsbm25
  • 70

    У bi-encoder семантического поиска приемлемая задержка, но слабый top-10 recall; переранжирование каждого документа cross-encoder превышает бюджет 200 мс. Что вы сделаете?

    retrievalrerankingbi-encoder
  • 71

    Hard-negative mining улучшает training loss, но качество поиска падает, потому что многие найденные negatives на самом деле релевантны. Как вы исправите процесс?

    concurrency
  • 72

    Sentence encoder выдаёт cosine similarity выше 0,95 почти для каждой пары предложений. Как вы исследуете collapse эмбеддингов?

    nlpembeddings
  • 73

    Fine-tuning XLM-R повышает F1 английских интентов на 6 пунктов, но снижает F1 испанских и польских на 9 пунктов. Как вы восстановите мультиязычное качество?

    fine-tuning
  • 74

    Токенизатор даёт в среднем 1,3 субтокена на английское слово, но 4,8 на турецкое, а инференс на турецком медленнее и менее точен. Что вы сделаете?

    inferencetokens
  • 75

    Модель тональности работает на одноязычных сообщениях, но ломается на испано-английских code-switched чатах. Как вы её улучшите?

  • 76

    У вас есть только 300 размеченных примеров нового интента на языке с ограниченными ресурсами. Как вы построите убедительный классификатор?

  • 77

    Domain-adaptive pretraining на медицинских заметках улучшает точность кодирования, но ухудшает качество на обычных сообщениях пациентов. Как вы его скорректируете?

    performance
  • 78

    После последовательного fine-tuning одного энкодера на пяти наборах интентов новая задача улучшается, а первая теряет 20 пунктов F1. Как вы уменьшите catastrophic forgetting?

    fine-tuning
  • 79

    Fine-tuning одного BERT-классификатора с пятью random seeds даёт macro F1 от 72% до 84%. Как вы стабилизируете обучение?

    fine-tuningbert
  • 80

    Заморозка нижних девяти слоёв трансформера снижает стоимость обучения, но доменный классификатор недообучается на специальной терминологии. Что вы попробуете?

    nlp
  • 81

    Дистиллированный текстовый классификатор работает вдвое быстрее, но теряет большую часть recall на редких интентах. Как вы измените distillation objective?

    model-compression
  • 82

    INT8-квантизация снижает задержку на 35%, но F1 падает только для арабского и тайского. Как вы исследуете и смягчите проблему?

    latencymodel-compression
  • 83

    Экспортированный в ONNX классификатор возвращает другие вероятности, чем PyTorch, для батчей с паддингом. Как вы отладите расхождение?

    batchserving-runtimespytorch
  • 84

    Dynamic batching удваивает throughput, но p99 latency растёт со 180 до 900 мс при неравномерном трафике. Как вы его настроите?

    latencythroughputbatch
  • 85

    Нужно обслуживать текстовый классификатор с задержкой 120 мс в Kubernetes, доступны CPU- и GPU-ноды. Как вы выберете и развернёте serving target?

    kubernetesdeploymentmodel-serving
  • 86

    Classification API получает много эквивалентных входов с разным регистром и пробелами. Как добавить Redis-кеш без возврата неверных меток?

    cachingapiredis
  • 87

    NLP-пайплайн на Kafka иногда дважды классифицирует одно событие и порой обрабатывает обновления не по порядку. Как сделать результаты корректными?

    nlpkafkaconcurrency
  • 88

    Spark-задача предобработки работает медленно, потому что несколько очень длинных документов создают отстающие партиции. Как вы устраните skew?

    partitioningspark
  • 89

    Новый токенизатор требует Airflow-backfill документов за два года без задержки ежедневной предобработки. Как вы его спроектируете?

    designbackfilltokens
  • 90

    MLflow-run показывает ожидаемые метрики, но деплой загружает токенизатор из другого эксперимента. Как вы предотвратите релизы с неверным артефактом?

    deploymentmonitoringartifacts
  • 91

    Команда предобработки меняет token IDs с int64 на int32 и переименовывает attention_mask, из-за чего ломается модельный сервис. Как вы обеспечите model-data contract?

    tokensdata-contracts
  • 92

    Доля нейтральной тональности за месяц растёт с 40% до 75%, но распределение входных текстов выглядит стабильным. Как вы исследуете сдвиг распределения целевых меток?

    iac
  • 93

    Точность модели падает при стабильных долях меток, а средняя длина сообщений и частота эмодзи удвоились. Как вы обработаете feature drift?

    iac
  • 94

    У модели перевода приемлемый корпусный BLEU, но аудит выявляет низкую точность редких медицинских терминов. Как вы оцените и ограничите следующий релиз?

    llm-evaldecision-makingbleu
  • 95

    ROUGE суммаризатора растёт после того, как он начал копировать длинные фрагменты источника, но пользователи предпочитают прежние резюме. Что вы измените?

    rouge
  • 96

    Система entity resolution объединяет разных людей с одной фамилией и работодателем. Как вы снизите false matches?

    system-design
  • 97

    Нужно обучить классификатор поддержки на сообщениях с именами, телефонами и номерами счетов. Как вы обработаете PII при предобработке?

    pii
  • 98

    Общий F1 интентов не изменился после релиза, но выросло число жалоб от пользователей с короткими сообщениями на немецком. Как вы используете срезы ошибок?

    aggregation
  • 99

    Офлайн-метрики предпочитают новый классификатор тикетов. Как вы проведёте A/B-тест, чтобы решить, улучшает ли он продукт?

    ab-testingmonitoring
  • 100

    Спроектируйте endpoint для триажа и маршрутизации документов, который должен извлекать организации, классифицировать тип документа и ранжировать срочность за 250 мс. Как вы его построите?

    designendpoints