Skip to content

Вопросы на собеседовании: Промпт-инженер

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Staff промпт-инженер.

Смотреть пример резюме: Промпт-инженер

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

promptingregistriestemplates

Я бы сделал реестр типизированным источником истины для идентификаторов, владельцев, версий, согласований и результатов оценки промптов.

  • Каждая неизменяемая версия хранит шаблон, схему переменных, контракт ответа, варианты для моделей, владельца, уровень риска и ссылку на точный отчёт оценки.
  • Черновик, ревью, согласование, канареечный запуск, активное состояние и снятие с поддержки являются явными этапами; в продакшн-пакет входят только подписанные согласованные версии.
  • SLA 10 минут охватывает проверку и публикацию, а локальные копии активных пакетов сохраняют работу продуктов при недоступности реестра.

Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат превратить сотни промптов и множество команд в проверяемый жизненный цикл с устойчивой границей публикации.

promptingrollbackprompt-bundle

Я бы выпускал один адресуемый по содержимому манифест, который разрешает все зависимости промптов до получения трафика.

  • Манифест фиксирует хеши шаблонов, локализованные варианты, схемы переменных и ответов, фрагменты политик, примеры, версии адаптеров моделей и наборов оценки.
  • Сборка отклоняет отсутствующие языки, изменяемые псевдонимы, несовместимые схемы и неразрешённое наследование во всех 180 промптах.
  • Продакшн-трейсы несут ID манифеста, а откат за пять минут переключает один активный указатель на предыдущий подписанный пакет.

Зачем это спрашивают: Сильный ответ делает поведение промптов воспроизводимым как единый пакет, а не набор независимо меняющихся строк.

promptingtokensoop

Я бы использовал явную композицию с неглубоким направленным графом зависимостей, а не неограниченное текстовое наследование.

  • Общие фрагменты политик, бренда, задач и локалей имеют типизированные интерфейсы; продуктовые промпты выбирают их и переопределяют только объявленные точки расширения.
  • Компилятор до публикации находит циклы, затенённые переменные, конфликтующие инструкции, дубликаты и превышение глубины в два уровня.
  • Снимок итогового текста и число токенов оцениваются для каждого продукта и модели, поэтому общая правка не выталкивает промпт незаметно за 6 000 токенов.

Зачем это спрашивают: Интервьюер оценивает, остаётся ли повторное использование понятным, ограниченным и проверяемым на масштабе всего набора.

prompting

Я бы сохранил назначение задачи независимым от провайдера и компилировал его через адаптеры ролей и возможностей конкретного провайдера.

  • Общий контракт задаёт приоритет инструкций, переменные, примеры, инструменты и схему ответа, а адаптеры честно отображают системные роли, синтаксис инструментов и структурированный вывод.
  • Неподдерживаемые возможности отклоняются проверкой совместимости, а не имитируются молча; каждый вариант проходит парную оценку на одинаковых примерах.
  • Я бы согласовал только варианты в пределах двух пунктов качества и $0,03, документируя намеренные различия вместо требования одинакового текста.

Зачем это спрашивают: Сильный ответ отделяет устойчивое назначение промпта от семантики провайдера и не делает вид, что провайдеры взаимозаменяемы.

promptingmigrations

Я бы использовал иерархический дизайн оценки, достаточный для выявления порога 1%, а не распределял 6 000 кейсов поровну между 250 промптами.

  • Матрица совместимости покрывает иерархию ролей, отказы, описания инструментов, ограничения JSON, порядок контекста, остановку вывода и следование инструкциям на каждом языке.
  • Анализ мощности задаёт достаточную парную выборку для общего риска и критичных срезов по провайдеру, языку, намерению и семейству промптов с усилением редких высокорисковых задач.
  • Теневой трафик и этапы 5%, 20% и 50% предшествуют полному переносу, а старый пакет промптов и провайдера остаётся готовым к откату все 30 дней.

Зачем это спрашивают: Интервьюер проверяет, учитывает ли межпровайдерная миграция семантику промптов и обеспечивает ли статистически достаточное иерархическое покрытие вместо слабых средних по промптам.

promptinglintingcompiler

Я бы компилировал шаблоны в детерминированные итоговые артефакты и разделил быстрые статические проверки и целевые поведенческие тесты.

  • Статические правила находят неопределённые переменные, мёртвые ветви, нарушение порядка ролей, дубли инструкций, запрещённые секреты, несовместимые схемы и превышение токенов.
  • Анализ изменённых фрагментов выбирает затронутые промпты и языки, удерживая обычный CI ниже 90 секунд, а расширенный набор запускается перед продвижением.
  • У каждого правила есть положительные и отрицательные фикстуры, серьёзность, владелец и срок исключения, чтобы ложные блокировки оставались ниже 0,5% без вечных обходов.

Зачем это спрашивают: Сильный ответ рассматривает инструменты качества промптов как компилятор с детерминированной диагностикой и измеримым удобством для разработчиков.

testing

Я бы дал каждой переменной объявленный тип, класс доверия, ограничение размера и канонический сериализатор вместо подстановки сырых строк.

  • Типы различают обычный текст, доверенную политику, цитируемое доказательство, локаль, перечисление, JSON и аргументы инструментов; компилятор запрещает небезопасную конкатенацию и выход из структуры.
  • Безопасный рендеринг не даёт данным изменить структуру шаблона, но не доказывает устойчивость поведения, когда модель читает вредоносные инструкции внутри корректных данных, поэтому это проверяет отдельный набор injection-тестов.
  • Сервер независимо авторизует каждое действие, ограничивает разрешённые инструменты и аргументы и считает ответ модели недоверенным запросом до выполнения.

Зачем это спрашивают: Интервьюер оценивает, отделяет ли кандидат безопасность структуры при рендеринге от устойчивости поведения к prompt injection и оставляет ли авторизацию вне модели.

promptingschemadesign

Я бы версионировал входной контракт, промпт и контракт ответа вместе, а смысловые инварианты оставил явными за пределами прозы.

  • Входная схема определяет обязательные доказательства, допускающие null поля, единицы, локаль и версию политики; промпт обращается только к объявленным полям.
  • Схема ответа фиксирует типы, перечисления, ссылки на доказательства, смысл уверенности и причины отказа, а код проверяет межполевые правила.
  • Контрактные тесты покрывают повышение и понижение версий, а релиз требует 99,95% валидности и точности полей на репрезентативных производственных данных.

Зачем это спрашивают: Сильный ответ связывает формулировку промпта с типизированными входными и выходными обязательствами, которые можно безопасно развивать.

promptingjson-outputstructured-output

Я бы стандартизировал схему как основу промпта и использовал самый сильный механизм ограниченного вывода каждого провайдера.

  • Общие инструкции задают использование доказательств, обработку null, запрет домыслов и описание полей, а каждый экстрактор предоставляет версионированную JSON Schema.
  • Синтаксические, схемные и смысловые ошибки являются разными метриками; только исправимые ошибки формата получают один повтор с точным сообщением проверки.
  • Общие гейты требуют 99,99% валидного JSON, порогов точности полей, ограниченного вывода и отсутствия скрытого роста повторов на всех активных вариантах моделей.

Зачем это спрашивают: Интервьюер проверяет, управляется ли надёжность структурированного вывода как семейство промптов, а не исправляется отдельно в каждом шаблоне.

promptingdesign

Я бы заставил каждый этап выдавать минимальный типизированный артефакт для следующего и рано отклонял недопустимые переходы.

  • Классификация, извлечение пунктов, сравнение с политикой, сводка рисков и итоговое объяснение имеют отдельные схемы, промпты, лимиты токенов и наборы оценки.
  • Результаты этапов несут ссылки на доказательства и уверенность, а текстовые сводки не заменяют точные пункты договора или идентификаторы политики.
  • Независимые этапы идут параллельно, но гейт измеряет итоговую точность, происхождение ошибок, p95 ниже 12 секунд и стоимость ниже $0,18.

Зачем это спрашивают: Сильный ответ не даёт цепочке промптов превратиться в непрозрачную последовательность свободных вызовов модели.

promptingtokensagents

Я бы дал планированию и исполнению разные контракты, контекст и полномочия, указав бюджеты в промптах и обеспечив их снаружи.

  • Планировщик возвращает цели, зависимости, нужные доказательства, условия остановки и ограниченный план без результатов инструментов и права исполнения.
  • Исполнитель получает один согласованный шаг, типизированные описания инструментов, прошлые наблюдения и остаток бюджета, но не может переписать общую цель.
  • Оценка измеряет достаточность плана, недопустимые действия, лишние перепланирования, завершение за восемь вызовов и 45 секунд и расход менее 12 000 токенов.

Зачем это спрашивают: Интервьюер оценивает, уменьшает ли разделение промптов путаницу полномочий и делает ли бюджеты агента измеримыми.

promptingarchitecturereact

Я бы поместил цикл ReAct под управление машины состояний во время выполнения, а промпт использовал только для направления предложений внутри этого контура.

  • Машина состояний считает каждый цикл рассуждения и действия, принимает явное завершение, отказ или эскалацию и жёстко останавливается после шестого цикла.
  • Каждое предложенное действие до исполнения проходит проверку по схеме и внешнюю авторизацию политикой; текст промпта никогда не выдаёт полномочия.
  • Типизированные недоверенные наблюдения и атакующие тесты покрывают повторы, неподтверждённые выводы и нарушения политики с порогом релиза 0,2%.

Зачем это спрашивают: Сильный ответ отделяет подсказки промпта от внешнего контроля через подсчёт циклов, проверку действий и независимую авторизацию.

tokensagentstool-descriptions

Я бы управлял описаниями инструментов как версионированными интерфейсами промптов вместе с базовыми операциями.

  • Каждое описание указывает одно назначение, условия применения, обязательные аргументы, побочные эффекты, исключения и два различающих примера без пересекающихся рекламных формулировок.
  • Линтер находит дубли назначения, противоречивые подсказки аргументов, отсутствующие метки побочных эффектов и итоговый размер выше 4 000 токенов.
  • Общий набор путаницы измеряет выбор и отказ для всех 75 инструментов, а изменение схемы или описания обязано удерживать точность выше 98%.

Зачем это спрашивают: Интервьюер проверяет, рассматриваются ли описания инструментов как влияющие на поведение активы с общей проверкой неоднозначности.

citationspromptingdesign

Я бы явно разделил в промпте авторитетность и работу с доказательствами и потребовал ссылки на уровне утверждений в контракте ответа.

  • Промпт разрешает отвечать только по переданным фрагментам, требует цитату для каждого фактического утверждения и отказ при отсутствии подтверждения.
  • Метаданные авторитетности задают победителя из трёх уровней; неразрешённые конфликты показываются с обеими цитатами, а не скрыто примиряются.
  • Оценка отдельно измеряет правильность ответа, точность и полноту цитат, работу с конфликтами и точность отказов с порогом цитат 97%.

Зачем это спрашивают: Сильный ответ сосредоточен на подтверждённом ответе и приоритете источников, не уходя в устройство поиска.

promptingtokensretention

Я бы защитил инструкции и правила вывода, затем организовал доказательства против потери информации в середине вместо сохранения порядка загрузки.

  • Задача, определения и схема ответа идут первыми; доказательства получают стабильные ID, заголовки, даты и уровни авторитетности, а самые важные фрагменты размещаются ближе к границам.
  • Краткая карта доказательств предшествует полным разделам, дубли шаблонного текста удаляются, а созданная моделью сводка не заменяет цитируемый юридический текст.
  • Тесты с перестановкой всех 30 разделов измеряют сохранение фактов, поддержку цитат и лимит вывода 2 000 токенов до согласования макета.

Зачем это спрашивают: Интервьюер оценивает, проектируется ли порядок длинного контекста как проверяемая задача размещения информации.

promptingdesign

Я бы задал фиксированную цепочку приоритетов от корпоративной конституции к доменной политике, задаче, настройкам клиента и пользовательскому вводу.

  • У каждого слоя есть разрешённые решения и защищённые положения; нижние слои уточняют объявленные поля, но не заменяют правила безопасности, права или данных.
  • Компилятор показывает итоговую иерархию, отмечает противоречия и доказывает наличие текущей версии политики во всех 120 шаблонах.
  • Фикстуры проверяют прямые, косвенные, многоязычные и конфликтующие инструкции, а подписанный пакет публикуется в пределах 24 часов.

Зачем это спрашивают: Сильный ответ превращает конституционные промпты в явные правила приоритета и переопределения, доступные компиляции и тестированию.

prompting

Я бы предоставил небольшие модули под конкретные риски с общими контрактами отказа и безопасного ответа вместо одного огромного универсального абзаца.

  • Каждая из восьми категорий задаёт запрещённую помощь, допустимую общую информацию, формулировку эскалации и контрпримеры, проверенные специалистами по политике.
  • Продукты собирают только модули своего риска и возможностей, а языковые версии проходят независимое ревью вместо механического перевода.
  • Закрытый атакующий набор требует recall выше 99% для английского и испанского, а лишние отказы измеряются на соседних допустимых запросах.

Зачем это спрашивают: Интервьюер проверяет, являются ли промпты безопасности модульными, локализованными и оценёнными как по пропускам, так и по лишним отказам.

promptinginjectionred-teaming

Я бы сочетал фиксированные регрессионные атаки с создаваемыми мутациями и оценивал реальные ошибки поведения, а не поиск ключевых слов.

  • 25 семейств покрывают прямые, косвенные, кодированные, ролевые, разделительные, многоязычные, инструментальные и длинноконтекстные атаки с ожидаемым безопасным исходом.
  • Риск-ориентированная выборка запускает все критические промпты каждую ночь и чередует менее рискованные комбинации, покрывая все 200 промптов за неделю.
  • Анализ изменений удерживает ночной запуск в четырёх часах, а любое запрещённое раскрытие или предложение действия блокирует релиз независимо от среднего балла.

Зачем это спрашивают: Сильный ответ создаёт масштабируемую атакующую оценку вокруг поведения промпта и явных последствий ошибки.

promptingtokens

Я бы принимал настройки клиента только через типизированную схему с разрешёнными полями и выводил их в фиксированные слоты, всегда считая недоверенными данными.

  • Схема разрешает ограниченные поля тона, терминологии, примеров и согласованных бизнес-правил; неизвестные поля, структурный текст и содержимое свыше 3 000 токенов отклоняются.
  • Политика безопасности, полномочия инструментов, иерархия ролей, границы переменных и контракт ответа собираются вне текста клиента, поэтому он не может занять или переопределить эти позиции.
  • Линтинг конфликтов, секретов и признаков инъекции служит дополнительной защитой, после которой идут клиентские и общие тесты безопасности и возврат к последней согласованной версии.

Зачем это спрашивают: Интервьюер оценивает, ограничена ли настройка структурно типизированными слотами, а политика и полномочия вынесены за пределы недоверенного текста клиента.

prompting

Я бы рассматривал каждую локаль как вариант поведения с общим назначением и независимой языковой оценкой.

  • Канонические требования, переменные, примеры и контракты ответа не зависят от языка, а носители могут адаптировать формальность, синтаксис и неоднозначные термины.
  • Память переводов помогает согласованности, но носители владеют рискованными промптами, а проверка паритета блокирует отсутствующие или устаревшие локали.
  • Релиз за 48 часов использует автоматическую регрессию шести языков и выборочное ревью носителей; ни одна локаль не отстаёт от базы более чем на три пункта.

Зачем это спрашивают: Сильный ответ сочетает общую семантику промптов с настоящим авторством на каждой локали и доказательствами релиза.

Закрытые вопросы

  • 21

    Спроектируйте контроль промптов для регулируемого кредитного помощника с 400 000 заявок в месяц, 100% покрытием причин цитатами и аудитом за семь лет.

    citationspromptingdesign
  • 22

    Минимизируйте PII в промптах для 12 млн запросов поддержки в месяц, удерживая ненужные поля PII ниже 0,01% и поддерживая четыре региона.

    promptingpii
  • 23

    Сократите промпт поддержки с 9 500 до 5 000 токенов для 20 млн вызовов в месяц, потеряв менее одного пункта качества и сэкономив минимум $120 000 в месяц.

    promptingtokens
  • 24

    Разместите промпт с удобным стабильным префиксом для 70% из 8 млн ежедневных вызовов, имеющих общие 2 800 токенов, без потери качества более 0,5 пункта.

    promptingtokenscaching
  • 25

    Управляйте вариантами для моделей у 320 промптов и пяти семейств моделей с менее чем 10% дублирующихся строк и SLA подключения модели три дня.

    promptingonboarding
  • 26

    Спроектируйте совместимость резервных промптов для 85 процессов, способных сменить модель за 30 секунд, с 99,5% валидных ответов и без инструкций для неподдерживаемых инструментов.

    promptingdesign
  • 27

    Спроектируйте платформу оценки промптов для 900 шаблонов, 15 команд и 50 000 размеченных случаев с полной регрессией за шесть часов.

    promptingestimationllm-eval
  • 28

    Соберите золотой набор из 10 000 случаев по 40 млн ежемесячных взаимодействий, шести языкам и четырём уровням риска с лимитом обновления 1 500 меток в квартал.

  • 29

    Спроектируйте архитектуру рубрик для 60 задач промптов и 80 проверяющих с согласием не ниже 0,75 и не более восьми критериев в рубрике.

    promptingarchitecturedesign
  • 30

    Откалибруйте промпты судьи для 25 задач и четырёх языков, если согласие с людьми равно 84% в целом и 62% на японском, за две недели.

    promptingestimationllm-judge
  • 31

    Спроектируйте человеческое разрешение 6 000 ежемесячных разногласий оценки с 12 доменными экспертами, SLA 48 часов и бюджетом $35 000 в месяц.

    promptingdesignconflict
  • 32

    Постройте платформу A/B-тестов промптов для 30 млн сессий в месяц и 25 одновременных экспериментов с допустимой регрессией безопасности не более 1%.

    promptingsessionsllm-safety
  • 33

    Задайте гейты качества для 500 релизов промптов в месяц и трёх уровней риска с CI быстрее 15 минут и критическими регрессиями ниже 0,1%.

    promptingquality-gates
  • 34

    Спроектируйте наблюдаемость и происхождение промптов для 100 млн вызовов в месяц с диагностикой за 30 дней, агрегатами за 13 месяцев и четырьмя региональными границами данных.

    promptingdesignlineage
  • 35

    Обнаруживайте смысловой дрейф поведения 300 неизменных промптов при еженедельном изменении трафика на 8%, оповещая за 24 часа и допуская менее пяти ложных тревог в месяц.

    promptingalertingiac
  • 36

    Спланируйте поэтапный запуск и откат пакета, затрагивающего 220 промптов и 18 команд, с доступностью 99,95% и откатом быстрее трёх минут.

    promptingrollbackprompt-bundle
  • 37

    Внедрите стандарты промптов в 22 командах и 700 шаблонах за квартал с принятием 80% и не более двух часов обучения на инженера.

    promptingdecision-making
  • 38

    Спроектируйте ревью 450 ежемесячных pull request с промптами от 16 команд, медианой четыре часа и двумя обязательными проверяющими для рискованных промптов.

    promptingdesigncode-review
  • 39

    Определите владение и снятие с поддержки для 900 промптов, если у 18% нет активного владельца, с очисткой за шесть месяцев и нулём необъявленных удалений.

    promptingownership
  • 40

    Создайте аварийный процесс исправления промптов для круглосуточной работы с устранением риска за 15 минут, полным ревью за четыре часа и 20 продуктовыми командами.

    promptingconcurrency
  • 41

    Организуйте промпты генерации кода для 1 200 разработчиков на четырёх языках программирования с 85% прохождения песочницы и нулём запросов встроенных секретов.

    promptingsecrets
  • 42

    Спроектируйте семейство промптов суммаризации для 14 типов документов и шести языков с сохранением 92% фактов, выводом 1 200 токенов и лимитом $0,025 на запрос.

    promptingtokensdesign
  • 43

    Спроектируйте семейство промптов извлечения для 35 схем и 5 млн страниц в месяц с точностью полей 98,5% и менее 0,3 исправляющего вызова на документ.

    promptingschemadesign
  • 44

    Спроектируйте семейство промптов классификации для 180 намерений и 10 млн обращений в месяц на английском, немецком и японском с macro-F1 выше 0,90.

    classificationpromptingdesign
  • 45

    Задайте управление стоимостью 600 промптов с расходом $1,8 млн в месяц, целью снижения 20% и потерей не более одного пункта качества на любом срезе.

    prompting
  • 46

    Команда из шести промпт-инженеров предлагает скопировать промпт на 7 000 токенов в 30 процессов ради срока шесть недель. Как вы наставите лида и сохраните график?

    promptingtokensmentoring
  • 47

    Локализуйте 110 медицинских промптов на арабский и японский за восемь недель с двумя носителями на язык и recall критической безопасности выше 99,5%.

    prompting
  • 48

    Спроектируйте промпты разрешения конфликтов среди 12 переданных фрагментов политик с 95% правильных решений о приоритете и объяснениями короче 600 токенов.

    promptingtokensdesign
  • 49

    Предоставьте аудиторские доказательства для 70 регулируемых промптов и трёх внешних аудиторов за пять рабочих дней с воспроизводимостью в течение семи лет.

    prompting
  • 50

    Спроектируйте общекорпоративную архитектуру для 1 200 промптов, 25 команд и шести языков с годовым бюджетом оценки $3 млн и доступностью публикации 99,9%.

    promptingarchitecturedesign
  • 51

    Правка системного промпта на 14 строк снижает долю решённых обращений с 89% до 76% на 3 000 тестах. Релиз назначен сегодня на 16:00. Что вы сделаете?

    promptingsystem-designllm-eval
  • 52

    При миграции 9 ролевых инструкций переносят из сообщений пользователя в системный промпт, после чего соблюдение политики падает с 97% до 83%. До завтра, 11:00, нужно решить, продолжать ли миграцию. Как вы проведёте расследование?

    promptingmigrationssystem-design
  • 53

    После обновления провайдера модель иначе выполняет отрицательные инструкции, и доля запрещённых ответов растёт с 0,4% до 3,1% на 8 000 тестах. Решение нужно принять за 4 часа. Как вы отреагируете?

    testing
  • 54

    Имя клиента с закрывающим XML-тегом выходит из переменной шаблона и переопределяет инструкцию суммаризации в 62 из 20 000 запросов. Уязвимость нужно сдержать за 90 минут. Что вы измените?

    promptingxml-sections
  • 55

    Документ содержит тот же тройной разделитель, что и шаблон промпта, и 7,8% из 1 200 суммаризаций начинают выполнять инструкции документа. Исправление нужно выпустить до 18:00. Что вы сделаете?

    prompting
  • 56

    Few-shot пример из реального обращения содержит скрытую инструкцию, и одобрение возвратов растёт с 6% до 19% в повторе 10 000 кейсов. До следующего развёртывания осталось 3 часа. Что вы сделаете?

    promptingfew-shot
  • 57

    Перестановка 6 few-shot примеров меняет победителя в 24% из 2 400 попарных тестов. Результаты эксперимента нужны завтра к 09:00. Как вы учтёте смещение из-за порядка?

    promptingfew-shotsoft-skills
  • 58

    Промпт с chain-of-thought получает 82% на бенчмарке рассуждений из 5 000 заданий, а утверждённая цель к пятнице равна 90%. Как закрыть разрыв, не показывая скрытое рассуждение?

    promptingchain-of-thoughtbenchmarking
  • 59

    Отладочный промпт раскрывает внутреннее рассуждение и API-ключ в 38 производственных ответах. Security требует сдержать инцидент за 30 минут и исправить его до 17:00. Что вы сделаете?

    promptingapi
  • 60

    Self-consistency промпт повышает точность с 87% до 89%, но увеличивает месячную стоимость с $90 000 до $310 000. Финансам нужно решение завтра к полудню. Что вы предложите?

    promptingself-consistencyconsistency
  • 61

    Промпт generate-then-critique превращает правильные налоговые ответы в неправильные в 11% из 900 проверенных кейсов. Окно релиза закрывается через 5 часов. Как вы поступите?

    prompting
  • 62

    ReAct-промпт повторяет одно некорректное действие 17 раз и тратит $4,20 на задачу с бюджетом $0,20. У вас 2 часа, чтобы исключить повторение. Что вы измените?

    promptingreact
  • 63

    Промпт планировщика тратит 70% бюджета в 12 000 токенов на план и оставляет недостаточно контекста для завершения 31% задач. Новый вариант нужен к 15:00. Как вы его спроектируете?

    promptingtokenscontext
  • 64

    Описание инструмента говорит, что он может обновить любой аккаунт, и red-team промпты вызывают 14 попыток несанкционированного обновления в 500 тестах. Инструмент должен стать безопасным завтра к 10:00. Что вы измените?

    promptingtestingred-teaming
  • 65

    Промпт аргументов инструмента копирует указанный пользователем customer ID вместо аутентифицированного ID в 3,6% из 4 000 вызовов. До 13:00 нужно исключить межаккаунтные запросы. Что вы сделаете?

    prompting
  • 66

    В цепочке из 4 промптов extractor переименовывает confidence в score, а verifier молча принимает отсутствие confidence в 22% из 6 000 запусков. Исправление нужно за 6 часов. Что вы сделаете?

    promptingsoft-skills
  • 67

    Правка промпта снижает долю валидного JSON с 99,6% до 91,2% при 80 000 запросов в день. Operations требует восстановление за 45 минут. Каков ваш план?

    promptingjson-output
  • 68

    Промпт схемы трактует отсутствующую скидку как 0 на английском и как null на испанском, повреждая 8 700 записей до срока сверки в 19:00. Как устранить путаницу nullable и default?

    promptingschemafundamentals
  • 69

    Правильная политика стоит первой в переданном контексте, но промпт ответа игнорирует её в 16% из 2 500 кейсов. Демонстрация клиенту через 7 часов. Как исправить промпт?

    promptingcontext
  • 70

    Промпт цитирования выдумывает правдоподобные номера разделов в 9% из 1 600 юридических ответов. До завтра, 08:00, нужно подготовить workflow к релизу. Что вы измените?

    citationsprompting
  • 71

    Две переданные политики конфликтуют, и промпт выбирает старую в 29% из 1 000 тестов, хотя даты видны. Решение нужно к 14:00. Как вы зададите конфликт и актуальность?

    promptingtesting
  • 72

    Найденная страница предлагает игнорировать системные правила, и промпт ответа следует ей в 23 из 400 red-team кейсов. У вас 60 минут на сдерживание. Что вы сделаете?

    promptingsystem-designred-teaming
  • 73

    Прямой jailbreak обходит safety-промпт в 4,8% из 2 000 попыток и выдаёт запрещённые инструкции. Публичный endpoint нужно исправить за 2 часа. Как вы отреагируете?

    promptingendpointsllm-safety
  • 74

    Base64, символы нулевой ширины и смешанные алфавиты обходят защиту от инъекций в 37 из 3 000 тестов. Исправить и проверить нужно до 17:30. Что вы сделаете?

    promptinginjectionvalidation
  • 75

    За 120 попыток пользователи восстанавливают 86% конфиденциального системного промпта. Legal требует оценку раскрытия завтра к 10:00. Как вы отреагируете?

    promptingsystem-designsystem-prompt
  • 76

    Constitutional-промпт содержит 12 правил, причём правила 4 и 9 конфликтуют и вызывают 18% непоследовательных отказов на 2 200 кейсах. До policy review осталось 6 часов. Что вы сделаете?

    prompting
  • 77

    Safety-промпт снижает опасные ответы с 2,1% до 0,2%, но повышает ложные отказы на допустимые запросы с 5% до 28% на 7 500 кейсах. Product ждёт решение к 12:00. Что вы предложите?

    prompting
  • 78

    Email-адреса и медицинские заметки попадают в итоговые промпты и tracing logs в 2,4% из 18 000 запросов. Privacy требует сдержать инцидент за 1 час и определить масштаб до конца дня. Что вы сделаете?

    prompting
  • 79

    Восемнадцать клиентов могут вставлять собственные блоки промпта, и эти блоки ослабляют обязательную базовую политику в 3,2% из 6 000 тестов. Безопасное исправление нужно к 15:00. Что вы сделаете?

    promptingtesting
  • 80

    Правка английского промпта улучшает точность на 5 пунктов, но немецкий и японский падают на 12 и 17 пунктов в 6 000 тестах. Глобальный rollout запланирован через 8 часов. Что вы решите?

    promptingllm-eval
  • 81

    Переведённый safety-промпт разрешает запрещённые финансовые советы в 6,2% португальских тестов против 0,5% английских. Локаль запускается завтра в 09:00. Что вы сделаете?

    promptingtesting
  • 82

    При входе в 96 000 токенов критичная инструкция в середине пропускается в 21% из 1 500 кейсов, а варианты на 16 000 проходят. Смягчение нужно до 18:00. Что вы измените?

    tokens
  • 83

    Компрессор промпта удаляет одно правило no refund without receipt, повышая несанкционированные одобрения с 1% до 13% в 4 000 тестах. На исправление релиза есть 2 часа. Что вы сделаете?

    promptingtesting
  • 84

    Системный промпт растёт с 1 800 до 7 400 токенов, p95 latency повышается с 1,4 до 2,8 секунды, а месячная стоимость на $170 000. План сокращения нужен к пятнице. Как вы поступите?

    promptingtokenslatency
  • 85

    Добавление request timestamp перед стабильным префиксом на 2 200 токенов снижает cache hit с 81% до 9% и добавляет $95 000 месячных расходов. Срок hotfix в 15:00. Что вы измените?

    tokenscachingestimation
  • 86

    Реестр промптов отдаёт версию 41 для 8% трафика, хотя одобрена версия 43, из-за чего качество когорт различается на 10 пунктов. У вас 1 час на стабилизацию production. Что вы сделаете?

    promptingregistries
  • 87

    Неверсионированный hotfix промпта исправляет один кейс возврата, но снижает общую точность политики с 94% до 81% в 5 000 повторов. Формальная замена нужна до 17:00. Что вы сделаете?

    prompting
  • 88

    Rollback возвращает системный промпт, но оставляет активными 5 новых few-shot примеров, поэтому error rate остаётся 8% вместо 1%. На полное восстановление есть 45 минут. Что вы сделаете?

    promptingfew-shotsystem-design
  • 89

    Версия 12 промпта рубрики judge меняет два ориентира оценки, из-за чего результаты за 18 месяцев становятся несопоставимыми, а кандидат сдвигается на 6 пунктов в 12 000 оценках. Решение нужно через 3 часа. Что вы сделаете?

    promptingllm-eval
  • 90

    Попарный judge выбирает первый ответ в 64% случаев и предпочитает ответы длиннее 500 слов на 18 пунктов. Надёжный результат нужен завтра к полудню. Как исправить промпт judge?

    prompting
  • 91

    Люди предпочитают промпт A в 61% из 800 слепых пар, а judge-промпт предпочитает B в 68%. Решение о запуске нужно через 5 часов. Какой сигнал использовать?

    promptinghuman-eval
  • 92

    Вы обнаруживаете, что 320 из 2 000 ответов golden set скопированы в few-shot примеры, из-за чего оценка качества промпта выросла с 84% до 93%. Отчёт нужен завтра к 09:00. Что вы сделаете?

    promptingfew-shot
  • 93

    Eval suite из 9 000 кейсов пропускает релиз промпта, но за 48 часов жалобы пользователей voice старше 65 лет растут втрое. План смягчения нужен к 16:00. Что вы сделаете?

    prompting
  • 94

    A/B-тест показывает aggregate gain 4 пункта для промпта B, но точность Spanish billing падает с 92% до 71% на 1 100 кейсах. Полный rollout назначен на пятницу. Что вы решите?

    promptingaggregationab-testing
  • 95

    Через 6 недель после запуска успешность промпта снижается с 90% до 82%, а 1 400 комментариев объединяются вокруг слишком жёстких ответов на новые типы запросов. Диагноз нужен к понедельнику. Что вы сделаете?

    promptingiac
  • 96

    Нужно перенести 27 production-промптов на новую модель за 21 день, а первый replay показывает падение качества на 9 пунктов и рост отказов на 14%. Как вы проведёте миграцию?

    promptingmigrations
  • 97

    Политика возврата меняется в 10:00, но старый пример в промпте всё ещё обещает 60 дней вместо 30, и к 13:00 неверный ответ получают 780 пользователей. Исправление нужно за 1 час. Что вы сделаете?

    prompting
  • 98

    На code review вы видите правку, которая добавляет сырой пользовательский текст в system role и пропускает injection suite из 2 500 кейсов ради merge до 17:00. Что вы сделаете?

    promptingcode-reviewestimation
  • 99

    Middle промпт-инженер собирает шесть блоков промпта с неверным приоритетом, оставляет активными две устаревшие директивы и снижает точность claims с 93% до 79% в 26 000 запросах. У вас 24 часа на восстановление и менторство. Что вы сделаете?

    promptingmentoring
  • 100

    Юридический disclaimer-блок на 3 200 токенов снижает завершённость ответов с 94% до 71% и не даёт измеримого роста безопасности, но запуск через 2 часа. Что вы порекомендуете?

    tokens