Вопросы на собеседовании: NLP-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня NLP-инженер II.
Смотреть пример резюме: NLP-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Масштабирование удерживает логиты attention в диапазоне, где softmax сохраняет полезные градиенты при росте размерности key.
- Дисперсия немасштабированных скалярных произведений пропорциональна размерности key, поэтому при больших размерностях логиты становятся экстремальными.
- Экстремальные логиты делают softmax почти one-hot, из-за чего большинство производных стремится к нулю.
- Деление на квадратный корень из размерности key нормализует дисперсию, не меняя выученное ранжирование ключей.
Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат связать формулу attention с численной стабильностью и поведением оптимизации.
Несколько голов позволяют модели параллельно представлять разные связи между токенами, не заставляя одну карту attention кодировать все закономерности.
- Одна голова может выделять локальные синтаксические связи, например согласование прилагательного с существительным, а другая отслеживать дальнюю кореференцию.
- Отдельные обучаемые проекции query, key и value дают каждой голове собственное пространство меньшей размерности.
- Роли голов не гарантированы и не всегда интерпретируемы, а избыточные головы часто можно удалить почти без потери качества.
Зачем это спрашивают: Сильный ответ отличает рост выразительности от необоснованного утверждения, что у каждой головы есть фиксированный лингвистический смысл.
Я бы сравнил подходящие для задачи чекпоинты, потому что RoBERTa и DeBERTa часто качественнее BERT, но могут требовать больше памяти или времени.
- BERT является стабильной базовой моделью с широкой поддержкой чекпоинтов и инструментов, особенно когда важна совместимость.
- RoBERTa изменила предобучение за счет большего объема данных, динамического masking и отказа от next-sentence prediction, что обычно улучшает представления при сопоставимом размере.
- DeBERTa разделяет attention по содержанию и позиции и часто дает более высокое качество, но ее реализация и профиль инференса должны подходить продакшн-стеку.
- Я сравниваю качество на валидации, p95 latency, память, покрытие токенизатора и наличие доменных чекпоинтов, а не только место в бенчмарке.
Зачем это спрашивают: Интервьюер ожидает практическое сравнение семейств моделей с учетом различий предобучения и ограничений развертывания.
Encoder-decoder модель подходит для нового вывода переменной длины, а encoder-only модель проще для меток, спанов или эмбеддингов.
- Перевод и абстрактивная суммаризация требуют авторегрессионного декодирования на основе закодированного источника, что дают модели вроде T5 или BART.
- Для классификации и разметки токенов обычно достаточно энкодера с небольшим task head без задержки декодера и ошибок генерации.
- Экстрактивная суммаризация тоже может использовать только энкодер, потому что выбирает предложения источника, а не генерирует текст.
Зачем это спрашивают: Вопрос проверяет, сопоставляет ли кандидат архитектуру модели со структурой вывода, а не превращает все NLP-задачи в генерацию.
Линейный CRF оценивает всю последовательность меток и использует обучаемые оценки переходов между соседними тегами вместо независимого предсказания каждого токена.
- Обычный CRF с алгоритмом Витерби не гарантирует допустимый BIO-вывод; перед декодированием я добавляю маску переходов или задаю недопустимым переходам оценку минус бесконечность.
- Выигрыш наиболее вероятен при сильных закономерностях переходов и ограниченных данных; крупный энкодер может уже выучить большую часть этой структуры.
- CRF усложняет обучение и декодирование и не решает вложенные или разрывные сущности, потому что по-прежнему выдает один линейный тег на токен.
Зачем это спрашивают: Интервьюер оценивает понимание пользы последовательного уровня и структурных ограничений CRF.
Token classification назначает токенам BIO-метки, а span-модель оценивает диапазоны start-end и тип каждого кандидата.
- Разметка токенов вычислительно эффективна и подходит для плоских сущностей, но требует аккуратного выравнивания сабвордов и обработки недопустимых переходов тегов.
- Оценка спанов напрямую представляет границы сущности и может классифицировать пересекающиеся кандидаты, поэтому естественнее поддерживает вложенный NER.
- Перебор всех спанов квадратичен по длине последовательности, поэтому на практике ограничивают ширину спана или отбирают кандидатов.
- Я выбираю подход по структуре разметки и бюджету latency, а затем оцениваю точные спаны сущностей, а не accuracy токенов.
Зачем это спрашивают: Сильный ответ связывает представление вывода с поддержкой пересечений, вычислительной стоимостью и оценкой.
Одна BIO-метка на токен не может представить пересекающиеся слои сущностей или одну сущность из нескольких несмежных фрагментов.
- Для вложенных сущностей, например New York внутри New York University, нужны классификация спанов, многослойные теггеры или декодирование на основе гиперграфа.
- Для разрывных упоминаний, распространенных в медицинских текстах, нужны модели, связывающие несколько спанов либо предсказывающие фрагменты и отношения между ними.
- Схема аннотации должна определить, нужны ли внутренние сущности и разрывные упоминания, потому что от этого зависят архитектура и оценка.
Зачем это спрашивают: Интервьюер проверяет, видит ли кандидат ограничение представления, а не объясняет такие случаи недостаточной мощностью модели.
Энкодер выдает оценку каждого токена как возможного начала и отдельную оценку как возможного конца, после чего выбирается допустимая пара с высоким score.
- При обучении обычно применяют cross-entropy к правильным позициям начала и конца на основе контекстных представлений токенов.
- На инференсе рассматривают пары, где конец не предшествует началу, и часто ограничивают максимальную длину ответа.
- Независимые start и end heads эффективны, но могут предпочитать несовместимые границы, поэтому совместная оценка спана или reranking помогают на сложных примерах.
Зачем это спрашивают: Вопрос проверяет, может ли кандидат объяснить конкретный механизм предсказания и декодирования в экстрактивном QA.
Модели нужен явный score отсутствия ответа, который сравнивается с лучшим кандидатом-спаном по настроенному порогу.
- Системы в стиле BERT часто используют classification token как null span и сравнивают его score с лучшим ненулевым start-end score.
- Я настраиваю порог разницы scores на валидации, балансируя полноту вопросов без ответа и число ложных ответов.
- Оценка должна отдельно показывать срезы вопросов с ответом и без него, иначе aggregate exact match скроет слишком частые отказы.
- Перед изменением порога следует отдельно проверить калибровку и полноту поиска подходящего отрывка.
Зачем это спрашивают: Интервьюер хочет увидеть, что отказ рассматривается как оцениваемое решение с явной валидацией, а не как дополнительная эвристика.
Я бы сохранил структуру таксономии в предсказании и loss, чтобы дочерняя метка не могла появиться без совместимого родителя.
- Каскад сверху вниз сужает кандидатов на каждом уровне и легко объясняется, но ранняя ошибка родителя блокирует всех потомков.
- Одна модель с иерархическими ограничениями может разделять признаки между уровнями и обеспечивать допустимые пути при декодировании.
- Я показываю метрики на каждой глубине и path accuracy, потому что правильный родитель с неверным листом отличается от полностью ошибочной ветки.
Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат использовать структуру меток и анализировать ошибки с правильной детализацией.
В multilabel-классификации каждая метка предсказывается независимо или с учетом зависимостей, потому что для одного документа могут быть верны несколько меток.
- На выходе обычно используют отдельный sigmoid для каждой метки с binary cross-entropy, а не softmax с суммой вероятностей, равной единице.
- Пороги нужно настраивать глобально или отдельно по меткам, потому что редким меткам часто нужна другая рабочая точка.
- Micro F1 сильнее учитывает частые метки, а macro F1 выявляет слабое качество редких.
- При устойчивом совместном появлении меток classifier chains или общее представление с моделированием зависимостей могут использовать этот сигнал.
Зачем это спрашивают: Сильный ответ охватывает изменения выходного слоя, правила решения и метрик, а не только определение multilabel-данных.
Я бы разделил документ на смысловые фрагменты, закодировал их и агрегировал evidence, сохранив достаточно структуры документа для предсказания метки.
- Для редких решающих фрагментов max pooling или top-k attention по логитам частей может поднять один важный абзац.
- Для распределенного evidence второй transformer или рекуррентный агрегатор может моделировать упорядоченные представления фрагментов.
- При обучении нужно сэмплировать полные документы, а не считать фрагменты независимо размеченными, если метка относится только ко всему тексту.
- Я проверяю размер, overlap и обрезание фрагментов на срезах длинных документов, потому что случайные короткие примеры скрывают потерю покрытия.
Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат избежать наивного обрезания и выбрать агрегацию под расположение evidence.
Я бы использовал энкодер с разреженным attention, когда решение зависит от связей между удаленными разделами, которые теряются при агрегации фрагментов.
- Attention со скользящим окном снижает квадратичную стоимость локального контекста, а выбранные global tokens связывают информацию по всему документу.
- Более длинный ввод все равно увеличивает память и latency, а предобученные чекпоинты могут быть слабее или менее доменными, чем у стандартных энкодеров.
- Разбиение остается проще для независимо информативных разделов и позволяет обрабатывать только нужные части.
- Я сравниваю качество на примерах со связями между разделами и p95 стоимость инференса, а не считаю больший контекст автоматически лучшим.
Зачем это спрашивают: Вопрос оценивает понимание компромиссов качества и системы у архитектур для длинных документов.
Я использую pooling, согласованный с целью обучения модели, а не считаю первый токен универсальным семантическим вектором предложения.
- Mean pooling по токенам без padding является сильной базой для sentence-transformer моделей и использует информацию всей последовательности.
- Pooling первого токена работает, когда чекпоинт специально обучали под это представление, но обычное masked-language pretraining этого не гарантирует.
- Для cosine search я обычно применяю L2-нормализацию и проверяю качество на доменных парах, включая срезы коротких и длинных предложений.
Зачем это спрашивают: Интервьюер проверяет понимание того, что качество эмбеддинга совместно определяют pooling и цель обучения.
Я использую bi-encoder для дешевого поиска по множеству кандидатов, а cross-encoder для более точной попарной оценки небольшого набора.
- Bi-encoder независимо вычисляет переиспользуемые векторы, поэтому можно эффективно индексировать и искать среди миллионов документов или кандидатов в дубликаты.
- Cross-encoder совместно применяет attention к обоим текстам и видит тонкие связи токенов, но запускается отдельно для каждой пары.
- Практический поисковый стек извлекает кандидатов bi-encoder и переранжирует, например, от 20 до 100 результатов cross-encoder.
- При офлайн-дедупликации сначала нужны blocking rules или приближенный поиск, чтобы избежать квадратичного cross-encoding всех пар.
Зачем это спрашивают: Сильный ответ ограничивает сравнение дискриминативным сопоставлением и количественно объясняет двухэтапный дизайн.
BM25 вознаграждает лексическое совпадение терминов, а dense retrieval сопоставляет обученные семантические представления, поэтому они ошибаются на разных запросах.
- BM25 силен для точных кодов товаров, редких названий и новых терминов без переобучения модели.
- Dense retrieval обрабатывает перефразирование вроде waterproof hiking shoes и rain-resistant trail footwear, но может пропустить точный идентификатор.
- Scores BM25 зависят от частоты термина, inverse document frequency и нормализации длины; качество dense зависит от обучающих пар и покрытия домена.
- Я оцениваю методы по срезам запросов и часто объединяю ранжированные результаты, когда важны семантика и точное совпадение.
Зачем это спрашивают: Интервьюер ожидает специфичные для поиска сильные стороны и ошибки, а не общее определение sparse и vector подходов.
Contrastive training сближает совпадающие пары текстов и отдаляет несовпадающие в пространстве эмбеддингов с помощью цели на основе similarity.
- В multiple-negatives ranking loss остальные targets в батче становятся negatives для каждого query, давая много сравнений без дополнительного кодирования.
- Большие батчи обычно усиливают сигнал, но создают false negatives, когда другой элемент батча на самом деле релевантен или эквивалентен.
- Temperature определяет, насколько сильно loss выделяет близких конкурентов, и настраивается вместе с нормализацией эмбеддингов.
- Формирование батчей должно исключать дублирующиеся positives среди negatives и соответствовать продакшн-задаче сопоставления.
Зачем это спрашивают: Вопрос проверяет понимание механики и предположений о данных при эффективном обучении эмбеддингов.
Полезный hard negative выглядит правдоподобно для текущего retriever, но действительно нерелевантен по правилам разметки задачи.
- BM25 или предыдущая dense-модель могут находить верхние неположительные результаты с общей лексикой или темой запроса.
- Случайные negatives часто слишком просты и почти ничему не учат, когда модель уже отделяет несвязанные документы.
- Непроверенные верхние результаты могут быть false negatives, поэтому я исключаю известные positives и вручную проверяю либо оцениваю cross-encoder часть выборки.
- Я обновляю найденные negatives во время обучения, потому что сложные для начальной модели примеры перестают быть информативными.
Зачем это спрашивают: Сильный ответ показывает, как усложнить обучение, не испортив цель ошибочно размеченными релевантными парами.
Domain-adaptive pretraining продолжает исходную self-supervised цель энкодера на неразмеченном доменном тексте перед supervised fine-tuning.
- Masked-language modeling на медицинских записях или юридических документах обучает доменной терминологии и употреблению без task labels.
- Подход особенно полезен, когда целевой корпус сильно отличается от общих данных предобучения, а размеченных примеров мало.
- Я оставляю downstream-валидацию, при признаках forgetting подмешиваю общий текст и сравниваю результат с простым добавлением размеченных примеров.
- Токенизатор остается ограничением, поэтому сильная фрагментация терминов может оправдать адаптацию словаря с аккуратной инициализацией эмбеддингов.
Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат встроить продолженное предобучение энкодера в экономически обоснованный процесс адаптации.
При послойном уменьшении learning rate нижние слои энкодера получают меньшие обновления, а верхние слои и целевая голова постепенно более крупные.
- Например, для головы можно задать 2e-5 и умножать rate на 0,8 с каждым слоем в сторону эмбеддингов, чтобы общие лексические признаки менялись меньше целевых.
- Подход часто помогает при небольшом размеченном наборе или близкой к предобучению задаче, где крупные обновления нижних слоев могут стереть полезные представления.
- При сильном сдвиге домена он может мешать, если нижним слоям тоже нужно адаптироваться, поэтому я сравню его с единым learning rate, а не буду считать уменьшение заведомо лучшим.
- Я настраиваю rate головы и коэффициент уменьшения вместе, а выбираю их по качеству на отложенной выборке и стабильности обучения на нескольких seed.
Зачем это спрашивают: Интервьюер проверяет понимание иерархии обновлений, компромисса между сохранением и адаптацией признаков и способа валидации настройки.
Закрытые вопросы
- 21
Когда замораживание слоев энкодера помогает при fine-tuning задачи?
fine-tuning - 22
Когда multi-task learning улучшает NLP-энкодер и как оно может навредить?
nlp - 23
Как дистиллировать большой классификатор текстов в меньший энкодер?
- 24
Каковы основные компромиссы при pruning энкодерной модели?
model-compression - 25
Как INT8 quantization влияет на инференс энкодера?
inferencemodel-compression - 26
Как выбрать между ONNX Runtime и TensorRT для инференса энкодера?
model-servingserving-runtimes - 27
Как dynamic batching улучшает инференс энкодера и какую задержку добавляет?
batchmodel-servinglatency - 28
Как откалибровать confidence scores классификатора текстов?
calibration - 29
Как установить пороги решений для multilabel-классификатора?
thresholding - 30
Когда использовать focal loss вместо resampling для несбалансированной классификации текстов?
classificationimbalanced - 31
Как weak или distant supervision может создавать обучающие метки для NLP-задачи?
nlp - 32
Как спроектировать цикл active learning для аннотации текстов?
design - 33
Когда использовать Cohen's kappa, а когда Krippendorff's alpha для согласия аннотаторов?
- 34
Как проводить adjudication разногласий аннотаторов, не скрывая проблемы гайдлайна?
conflict - 35
Как развивать продакшн-таксономию меток, не обесценивая старые обучающие данные и метрики?
monitoring - 36
Как выбрать между mBERT и XLM-R для мультиязычной задачи на базе энкодера?
- 37
Как выполнить zero-shot cross-lingual transfer для классификации intent?
classification - 38
Что такое tokenizer fertility и почему она важна в мультиязычном NLP?
nlptokenstokenizer-fertility - 39
Как обрабатывать транслитерацию и code-switching в мультиязычном классификаторе текстов?
code-switching - 40
Какие методы augmentation полезны для low-resource NLP-задачи и как контролировать шум меток?
nlp - 41
Что измеряют BLEU и ROUGE и какое важное качество они могут пропустить?
bleurouge - 42
Чем BERTScore отличается от метрик лексического совпадения для перевода или суммаризации?
monitoring - 43
Как оценивать NER, если точное совпадение границ сущности является не единственным полезным результатом?
- 44
Как с помощью bootstrap testing решить, действительно ли одна NLP-модель лучше другой?
nlptesting - 45
Как спроектировать robustness, slice и fairness оценку классификатора текстов?
llm-evaldesign - 46
Какой lineage данных и модели следует записывать в MLflow или Weights & Biases для NLP-эксперимента?
nlplineageexperiments - 47
Что должен содержать контракт модели и данных для продакшн NLP-классификатора?
nlpdata-contracts - 48
Как построить воспроизводимый пайплайн предобработки большого текстового корпуса на Spark и Airflow?
airflowci-cdspark - 49
Как спроектировать Kafka-пайплайн для потоковой NLP-классификации?
kafkadesignstreaming - 50
Как спроектировать индекс Elasticsearch для лексического поиска в NLP-продукте?
indexessearchdesign - 51
NER-модель достигает 97% token accuracy, но только 71% entity-level F1. Как вы диагностируете разрыв?
tokens - 52
Ваш BIO-теггер выдаёт последовательности вроде I-ORG после O и I-PER после B-ORG. Как вы исправите невалидный вывод?
bio-tags - 53
В юридических договорах встречаются вложенные сущности, например компания внутри определённого имени стороны, но BIO-модель возвращает только одну метку на токен. Что вы спроектируете?
tokensdesignbio-tags - 54
Два аннотатора получили Cohen's kappa 0,48 для интентов обращений в поддержку. Что вы сделаете до обучения классификатора?
- 55
Цикл active learning выбирает только короткие неоднозначные жалобы, а качество на длинных обычных тикетах падает. Как вы исправите смещение выборки?
samplingperformance - 56
Эвристические weak labels удвоили обучающую выборку, но precision на валидации резко упал. Как вы найдёте и уменьшите шум меток?
train-testvalidationweak-supervision - 57
У двух интентов поддержки Cohen's kappa равна 0,38, и модель чаще всего путает их между собой, но продукт утверждает, что они запускают разные процессы. Как решить, нужно ли их объединить, уточнить или собрать больше данных?
- 58
Классификатор обращений уверенно относит запросы о новой функции приостановки подписки к оплате или отмене, хотя такого интента нет в таксономии. Как вы добавите безопасный отказ от классификации?
resilience - 59
Мультилейбл-классификатор обращений иногда одновременно предсказывает refund-approved и refund-denied или выдаёт card-chargeback без родительской метки payments. Как вы обеспечите согласованность таксономии?
- 60
Общая accuracy равна 94%, но recall редкого класса мошеннических текстов составляет 38%. Что вы измените?
- 61
Классификатор тикетов показывает 98% офлайн, но ломается после удаления подписей писем и заголовков маршрутизации. Как вы устраните shortcut?
- 62
Validation F1 равен 96%, но ручная проверка находит почти одинаковые документы в train и validation. Как вы исправите утечку?
leakagevalidation - 63
Новостной классификатор оценивают случайным сплитом, но в продакшне он всегда предсказывает статьи, опубликованные позже. Как вы перестроите оценку?
llm-evaldecision-making - 64
Классификатор, обученный на чатах, теряет 15 пунктов F1 после развёртывания на расшифровках телефонных звонков. Как вы обработаете domain drift?
deploymentiac - 65
BERT-классификатор документов пропускает условия расторжения, которые обычно находятся в конце договоров длиной 2000 токенов. Что вы измените?
tokensbertresilience - 66
Перекрывающиеся окна повышают recall на длинных документах, но одно положительное окно делает положительными слишком много целых документов. Как вы агрегируете скоры окон?
aggregation - 67
Extractive QA-модель выбирает правильные слова, но возвращаемые символьные смещения подсвечивают неверную подстроку исходного документа. Как вы это отладите?
- 68
Extractive QA-система отвечает на вопросы без ответа правдоподобными спанами. Как вы настроите поведение no-answer?
system-design - 69
Поиск товаров находит перефразировки через dense embeddings, но пропускает точные номера деталей, а BM25 находит номера, но слабо понимает намерение. Как вы спроектируете поиск?
nlpembeddingsbm25 - 70
У bi-encoder семантического поиска приемлемая задержка, но слабый top-10 recall; переранжирование каждого документа cross-encoder превышает бюджет 200 мс. Что вы сделаете?
retrievalrerankingbi-encoder - 71
Hard-negative mining улучшает training loss, но качество поиска падает, потому что многие найденные negatives на самом деле релевантны. Как вы исправите процесс?
concurrency - 72
Sentence encoder выдаёт cosine similarity выше 0,95 почти для каждой пары предложений. Как вы исследуете collapse эмбеддингов?
nlpembeddings - 73
Fine-tuning XLM-R повышает F1 английских интентов на 6 пунктов, но снижает F1 испанских и польских на 9 пунктов. Как вы восстановите мультиязычное качество?
fine-tuning - 74
Токенизатор даёт в среднем 1,3 субтокена на английское слово, но 4,8 на турецкое, а инференс на турецком медленнее и менее точен. Что вы сделаете?
inferencetokens - 75
Модель тональности работает на одноязычных сообщениях, но ломается на испано-английских code-switched чатах. Как вы её улучшите?
- 76
У вас есть только 300 размеченных примеров нового интента на языке с ограниченными ресурсами. Как вы построите убедительный классификатор?
- 77
Domain-adaptive pretraining на медицинских заметках улучшает точность кодирования, но ухудшает качество на обычных сообщениях пациентов. Как вы его скорректируете?
performance - 78
После последовательного fine-tuning одного энкодера на пяти наборах интентов новая задача улучшается, а первая теряет 20 пунктов F1. Как вы уменьшите catastrophic forgetting?
fine-tuning - 79
Fine-tuning одного BERT-классификатора с пятью random seeds даёт macro F1 от 72% до 84%. Как вы стабилизируете обучение?
fine-tuningbert - 80
Заморозка нижних девяти слоёв трансформера снижает стоимость обучения, но доменный классификатор недообучается на специальной терминологии. Что вы попробуете?
nlp - 81
Дистиллированный текстовый классификатор работает вдвое быстрее, но теряет большую часть recall на редких интентах. Как вы измените distillation objective?
model-compression - 82
INT8-квантизация снижает задержку на 35%, но F1 падает только для арабского и тайского. Как вы исследуете и смягчите проблему?
latencymodel-compression - 83
Экспортированный в ONNX классификатор возвращает другие вероятности, чем PyTorch, для батчей с паддингом. Как вы отладите расхождение?
batchserving-runtimespytorch - 84
Dynamic batching удваивает throughput, но p99 latency растёт со 180 до 900 мс при неравномерном трафике. Как вы его настроите?
latencythroughputbatch - 85
Нужно обслуживать текстовый классификатор с задержкой 120 мс в Kubernetes, доступны CPU- и GPU-ноды. Как вы выберете и развернёте serving target?
kubernetesdeploymentmodel-serving - 86
Classification API получает много эквивалентных входов с разным регистром и пробелами. Как добавить Redis-кеш без возврата неверных меток?
cachingapiredis - 87
NLP-пайплайн на Kafka иногда дважды классифицирует одно событие и порой обрабатывает обновления не по порядку. Как сделать результаты корректными?
nlpkafkaconcurrency - 88
Spark-задача предобработки работает медленно, потому что несколько очень длинных документов создают отстающие партиции. Как вы устраните skew?
partitioningspark - 89
Новый токенизатор требует Airflow-backfill документов за два года без задержки ежедневной предобработки. Как вы его спроектируете?
designbackfilltokens - 90
MLflow-run показывает ожидаемые метрики, но деплой загружает токенизатор из другого эксперимента. Как вы предотвратите релизы с неверным артефактом?
deploymentmonitoringartifacts - 91
Команда предобработки меняет token IDs с int64 на int32 и переименовывает attention_mask, из-за чего ломается модельный сервис. Как вы обеспечите model-data contract?
tokensdata-contracts - 92
Доля нейтральной тональности за месяц растёт с 40% до 75%, но распределение входных текстов выглядит стабильным. Как вы исследуете сдвиг распределения целевых меток?
iac - 93
Точность модели падает при стабильных долях меток, а средняя длина сообщений и частота эмодзи удвоились. Как вы обработаете feature drift?
iac - 94
У модели перевода приемлемый корпусный BLEU, но аудит выявляет низкую точность редких медицинских терминов. Как вы оцените и ограничите следующий релиз?
llm-evaldecision-makingbleu - 95
ROUGE суммаризатора растёт после того, как он начал копировать длинные фрагменты источника, но пользователи предпочитают прежние резюме. Что вы измените?
rouge - 96
Система entity resolution объединяет разных людей с одной фамилией и работодателем. Как вы снизите false matches?
system-design - 97
Нужно обучить классификатор поддержки на сообщениях с именами, телефонами и номерами счетов. Как вы обработаете PII при предобработке?
pii - 98
Общий F1 интентов не изменился после релиза, но выросло число жалоб от пользователей с короткими сообщениями на немецком. Как вы используете срезы ошибок?
aggregation - 99
Офлайн-метрики предпочитают новый классификатор тикетов. Как вы проведёте A/B-тест, чтобы решить, улучшает ли он продукт?
ab-testingmonitoring - 100
Спроектируйте endpoint для триажа и маршрутизации документов, который должен извлекать организации, классифицировать тип документа и ранжировать срочность за 250 мс. Как вы его построите?
designendpoints