Вопросы на собеседовании: Промпт-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Staff промпт-инженер.
Смотреть пример резюме: Промпт-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Я бы сделал реестр типизированным источником истины для идентификаторов, владельцев, версий, согласований и результатов оценки промптов.
- Каждая неизменяемая версия хранит шаблон, схему переменных, контракт ответа, варианты для моделей, владельца, уровень риска и ссылку на точный отчёт оценки.
- Черновик, ревью, согласование, канареечный запуск, активное состояние и снятие с поддержки являются явными этапами; в продакшн-пакет входят только подписанные согласованные версии.
- SLA 10 минут охватывает проверку и публикацию, а локальные копии активных пакетов сохраняют работу продуктов при недоступности реестра.
Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат превратить сотни промптов и множество команд в проверяемый жизненный цикл с устойчивой границей публикации.
Я бы выпускал один адресуемый по содержимому манифест, который разрешает все зависимости промптов до получения трафика.
- Манифест фиксирует хеши шаблонов, локализованные варианты, схемы переменных и ответов, фрагменты политик, примеры, версии адаптеров моделей и наборов оценки.
- Сборка отклоняет отсутствующие языки, изменяемые псевдонимы, несовместимые схемы и неразрешённое наследование во всех 180 промптах.
- Продакшн-трейсы несут ID манифеста, а откат за пять минут переключает один активный указатель на предыдущий подписанный пакет.
Зачем это спрашивают: Сильный ответ делает поведение промптов воспроизводимым как единый пакет, а не набор независимо меняющихся строк.
Я бы использовал явную композицию с неглубоким направленным графом зависимостей, а не неограниченное текстовое наследование.
- Общие фрагменты политик, бренда, задач и локалей имеют типизированные интерфейсы; продуктовые промпты выбирают их и переопределяют только объявленные точки расширения.
- Компилятор до публикации находит циклы, затенённые переменные, конфликтующие инструкции, дубликаты и превышение глубины в два уровня.
- Снимок итогового текста и число токенов оцениваются для каждого продукта и модели, поэтому общая правка не выталкивает промпт незаметно за 6 000 токенов.
Зачем это спрашивают: Интервьюер оценивает, остаётся ли повторное использование понятным, ограниченным и проверяемым на масштабе всего набора.
Я бы сохранил назначение задачи независимым от провайдера и компилировал его через адаптеры ролей и возможностей конкретного провайдера.
- Общий контракт задаёт приоритет инструкций, переменные, примеры, инструменты и схему ответа, а адаптеры честно отображают системные роли, синтаксис инструментов и структурированный вывод.
- Неподдерживаемые возможности отклоняются проверкой совместимости, а не имитируются молча; каждый вариант проходит парную оценку на одинаковых примерах.
- Я бы согласовал только варианты в пределах двух пунктов качества и $0,03, документируя намеренные различия вместо требования одинакового текста.
Зачем это спрашивают: Сильный ответ отделяет устойчивое назначение промпта от семантики провайдера и не делает вид, что провайдеры взаимозаменяемы.
Я бы использовал иерархический дизайн оценки, достаточный для выявления порога 1%, а не распределял 6 000 кейсов поровну между 250 промптами.
- Матрица совместимости покрывает иерархию ролей, отказы, описания инструментов, ограничения JSON, порядок контекста, остановку вывода и следование инструкциям на каждом языке.
- Анализ мощности задаёт достаточную парную выборку для общего риска и критичных срезов по провайдеру, языку, намерению и семейству промптов с усилением редких высокорисковых задач.
- Теневой трафик и этапы 5%, 20% и 50% предшествуют полному переносу, а старый пакет промптов и провайдера остаётся готовым к откату все 30 дней.
Зачем это спрашивают: Интервьюер проверяет, учитывает ли межпровайдерная миграция семантику промптов и обеспечивает ли статистически достаточное иерархическое покрытие вместо слабых средних по промптам.
Я бы компилировал шаблоны в детерминированные итоговые артефакты и разделил быстрые статические проверки и целевые поведенческие тесты.
- Статические правила находят неопределённые переменные, мёртвые ветви, нарушение порядка ролей, дубли инструкций, запрещённые секреты, несовместимые схемы и превышение токенов.
- Анализ изменённых фрагментов выбирает затронутые промпты и языки, удерживая обычный CI ниже 90 секунд, а расширенный набор запускается перед продвижением.
- У каждого правила есть положительные и отрицательные фикстуры, серьёзность, владелец и срок исключения, чтобы ложные блокировки оставались ниже 0,5% без вечных обходов.
Зачем это спрашивают: Сильный ответ рассматривает инструменты качества промптов как компилятор с детерминированной диагностикой и измеримым удобством для разработчиков.
Я бы дал каждой переменной объявленный тип, класс доверия, ограничение размера и канонический сериализатор вместо подстановки сырых строк.
- Типы различают обычный текст, доверенную политику, цитируемое доказательство, локаль, перечисление, JSON и аргументы инструментов; компилятор запрещает небезопасную конкатенацию и выход из структуры.
- Безопасный рендеринг не даёт данным изменить структуру шаблона, но не доказывает устойчивость поведения, когда модель читает вредоносные инструкции внутри корректных данных, поэтому это проверяет отдельный набор injection-тестов.
- Сервер независимо авторизует каждое действие, ограничивает разрешённые инструменты и аргументы и считает ответ модели недоверенным запросом до выполнения.
Зачем это спрашивают: Интервьюер оценивает, отделяет ли кандидат безопасность структуры при рендеринге от устойчивости поведения к prompt injection и оставляет ли авторизацию вне модели.
Я бы версионировал входной контракт, промпт и контракт ответа вместе, а смысловые инварианты оставил явными за пределами прозы.
- Входная схема определяет обязательные доказательства, допускающие null поля, единицы, локаль и версию политики; промпт обращается только к объявленным полям.
- Схема ответа фиксирует типы, перечисления, ссылки на доказательства, смысл уверенности и причины отказа, а код проверяет межполевые правила.
- Контрактные тесты покрывают повышение и понижение версий, а релиз требует 99,95% валидности и точности полей на репрезентативных производственных данных.
Зачем это спрашивают: Сильный ответ связывает формулировку промпта с типизированными входными и выходными обязательствами, которые можно безопасно развивать.
Я бы стандартизировал схему как основу промпта и использовал самый сильный механизм ограниченного вывода каждого провайдера.
- Общие инструкции задают использование доказательств, обработку null, запрет домыслов и описание полей, а каждый экстрактор предоставляет версионированную JSON Schema.
- Синтаксические, схемные и смысловые ошибки являются разными метриками; только исправимые ошибки формата получают один повтор с точным сообщением проверки.
- Общие гейты требуют 99,99% валидного JSON, порогов точности полей, ограниченного вывода и отсутствия скрытого роста повторов на всех активных вариантах моделей.
Зачем это спрашивают: Интервьюер проверяет, управляется ли надёжность структурированного вывода как семейство промптов, а не исправляется отдельно в каждом шаблоне.
Я бы заставил каждый этап выдавать минимальный типизированный артефакт для следующего и рано отклонял недопустимые переходы.
- Классификация, извлечение пунктов, сравнение с политикой, сводка рисков и итоговое объяснение имеют отдельные схемы, промпты, лимиты токенов и наборы оценки.
- Результаты этапов несут ссылки на доказательства и уверенность, а текстовые сводки не заменяют точные пункты договора или идентификаторы политики.
- Независимые этапы идут параллельно, но гейт измеряет итоговую точность, происхождение ошибок, p95 ниже 12 секунд и стоимость ниже $0,18.
Зачем это спрашивают: Сильный ответ не даёт цепочке промптов превратиться в непрозрачную последовательность свободных вызовов модели.
Я бы дал планированию и исполнению разные контракты, контекст и полномочия, указав бюджеты в промптах и обеспечив их снаружи.
- Планировщик возвращает цели, зависимости, нужные доказательства, условия остановки и ограниченный план без результатов инструментов и права исполнения.
- Исполнитель получает один согласованный шаг, типизированные описания инструментов, прошлые наблюдения и остаток бюджета, но не может переписать общую цель.
- Оценка измеряет достаточность плана, недопустимые действия, лишние перепланирования, завершение за восемь вызовов и 45 секунд и расход менее 12 000 токенов.
Зачем это спрашивают: Интервьюер оценивает, уменьшает ли разделение промптов путаницу полномочий и делает ли бюджеты агента измеримыми.
Я бы поместил цикл ReAct под управление машины состояний во время выполнения, а промпт использовал только для направления предложений внутри этого контура.
- Машина состояний считает каждый цикл рассуждения и действия, принимает явное завершение, отказ или эскалацию и жёстко останавливается после шестого цикла.
- Каждое предложенное действие до исполнения проходит проверку по схеме и внешнюю авторизацию политикой; текст промпта никогда не выдаёт полномочия.
- Типизированные недоверенные наблюдения и атакующие тесты покрывают повторы, неподтверждённые выводы и нарушения политики с порогом релиза 0,2%.
Зачем это спрашивают: Сильный ответ отделяет подсказки промпта от внешнего контроля через подсчёт циклов, проверку действий и независимую авторизацию.
Я бы управлял описаниями инструментов как версионированными интерфейсами промптов вместе с базовыми операциями.
- Каждое описание указывает одно назначение, условия применения, обязательные аргументы, побочные эффекты, исключения и два различающих примера без пересекающихся рекламных формулировок.
- Линтер находит дубли назначения, противоречивые подсказки аргументов, отсутствующие метки побочных эффектов и итоговый размер выше 4 000 токенов.
- Общий набор путаницы измеряет выбор и отказ для всех 75 инструментов, а изменение схемы или описания обязано удерживать точность выше 98%.
Зачем это спрашивают: Интервьюер проверяет, рассматриваются ли описания инструментов как влияющие на поведение активы с общей проверкой неоднозначности.
Я бы явно разделил в промпте авторитетность и работу с доказательствами и потребовал ссылки на уровне утверждений в контракте ответа.
- Промпт разрешает отвечать только по переданным фрагментам, требует цитату для каждого фактического утверждения и отказ при отсутствии подтверждения.
- Метаданные авторитетности задают победителя из трёх уровней; неразрешённые конфликты показываются с обеими цитатами, а не скрыто примиряются.
- Оценка отдельно измеряет правильность ответа, точность и полноту цитат, работу с конфликтами и точность отказов с порогом цитат 97%.
Зачем это спрашивают: Сильный ответ сосредоточен на подтверждённом ответе и приоритете источников, не уходя в устройство поиска.
Я бы защитил инструкции и правила вывода, затем организовал доказательства против потери информации в середине вместо сохранения порядка загрузки.
- Задача, определения и схема ответа идут первыми; доказательства получают стабильные ID, заголовки, даты и уровни авторитетности, а самые важные фрагменты размещаются ближе к границам.
- Краткая карта доказательств предшествует полным разделам, дубли шаблонного текста удаляются, а созданная моделью сводка не заменяет цитируемый юридический текст.
- Тесты с перестановкой всех 30 разделов измеряют сохранение фактов, поддержку цитат и лимит вывода 2 000 токенов до согласования макета.
Зачем это спрашивают: Интервьюер оценивает, проектируется ли порядок длинного контекста как проверяемая задача размещения информации.
Я бы задал фиксированную цепочку приоритетов от корпоративной конституции к доменной политике, задаче, настройкам клиента и пользовательскому вводу.
- У каждого слоя есть разрешённые решения и защищённые положения; нижние слои уточняют объявленные поля, но не заменяют правила безопасности, права или данных.
- Компилятор показывает итоговую иерархию, отмечает противоречия и доказывает наличие текущей версии политики во всех 120 шаблонах.
- Фикстуры проверяют прямые, косвенные, многоязычные и конфликтующие инструкции, а подписанный пакет публикуется в пределах 24 часов.
Зачем это спрашивают: Сильный ответ превращает конституционные промпты в явные правила приоритета и переопределения, доступные компиляции и тестированию.
Я бы предоставил небольшие модули под конкретные риски с общими контрактами отказа и безопасного ответа вместо одного огромного универсального абзаца.
- Каждая из восьми категорий задаёт запрещённую помощь, допустимую общую информацию, формулировку эскалации и контрпримеры, проверенные специалистами по политике.
- Продукты собирают только модули своего риска и возможностей, а языковые версии проходят независимое ревью вместо механического перевода.
- Закрытый атакующий набор требует recall выше 99% для английского и испанского, а лишние отказы измеряются на соседних допустимых запросах.
Зачем это спрашивают: Интервьюер проверяет, являются ли промпты безопасности модульными, локализованными и оценёнными как по пропускам, так и по лишним отказам.
Я бы сочетал фиксированные регрессионные атаки с создаваемыми мутациями и оценивал реальные ошибки поведения, а не поиск ключевых слов.
- 25 семейств покрывают прямые, косвенные, кодированные, ролевые, разделительные, многоязычные, инструментальные и длинноконтекстные атаки с ожидаемым безопасным исходом.
- Риск-ориентированная выборка запускает все критические промпты каждую ночь и чередует менее рискованные комбинации, покрывая все 200 промптов за неделю.
- Анализ изменений удерживает ночной запуск в четырёх часах, а любое запрещённое раскрытие или предложение действия блокирует релиз независимо от среднего балла.
Зачем это спрашивают: Сильный ответ создаёт масштабируемую атакующую оценку вокруг поведения промпта и явных последствий ошибки.
Я бы принимал настройки клиента только через типизированную схему с разрешёнными полями и выводил их в фиксированные слоты, всегда считая недоверенными данными.
- Схема разрешает ограниченные поля тона, терминологии, примеров и согласованных бизнес-правил; неизвестные поля, структурный текст и содержимое свыше 3 000 токенов отклоняются.
- Политика безопасности, полномочия инструментов, иерархия ролей, границы переменных и контракт ответа собираются вне текста клиента, поэтому он не может занять или переопределить эти позиции.
- Линтинг конфликтов, секретов и признаков инъекции служит дополнительной защитой, после которой идут клиентские и общие тесты безопасности и возврат к последней согласованной версии.
Зачем это спрашивают: Интервьюер оценивает, ограничена ли настройка структурно типизированными слотами, а политика и полномочия вынесены за пределы недоверенного текста клиента.
Я бы рассматривал каждую локаль как вариант поведения с общим назначением и независимой языковой оценкой.
- Канонические требования, переменные, примеры и контракты ответа не зависят от языка, а носители могут адаптировать формальность, синтаксис и неоднозначные термины.
- Память переводов помогает согласованности, но носители владеют рискованными промптами, а проверка паритета блокирует отсутствующие или устаревшие локали.
- Релиз за 48 часов использует автоматическую регрессию шести языков и выборочное ревью носителей; ни одна локаль не отстаёт от базы более чем на три пункта.
Зачем это спрашивают: Сильный ответ сочетает общую семантику промптов с настоящим авторством на каждой локали и доказательствами релиза.
Закрытые вопросы
- 21
Спроектируйте контроль промптов для регулируемого кредитного помощника с 400 000 заявок в месяц, 100% покрытием причин цитатами и аудитом за семь лет.
citationspromptingdesign - 22
Минимизируйте PII в промптах для 12 млн запросов поддержки в месяц, удерживая ненужные поля PII ниже 0,01% и поддерживая четыре региона.
promptingpii - 23
Сократите промпт поддержки с 9 500 до 5 000 токенов для 20 млн вызовов в месяц, потеряв менее одного пункта качества и сэкономив минимум $120 000 в месяц.
promptingtokens - 24
Разместите промпт с удобным стабильным префиксом для 70% из 8 млн ежедневных вызовов, имеющих общие 2 800 токенов, без потери качества более 0,5 пункта.
promptingtokenscaching - 25
Управляйте вариантами для моделей у 320 промптов и пяти семейств моделей с менее чем 10% дублирующихся строк и SLA подключения модели три дня.
promptingonboarding - 26
Спроектируйте совместимость резервных промптов для 85 процессов, способных сменить модель за 30 секунд, с 99,5% валидных ответов и без инструкций для неподдерживаемых инструментов.
promptingdesign - 27
Спроектируйте платформу оценки промптов для 900 шаблонов, 15 команд и 50 000 размеченных случаев с полной регрессией за шесть часов.
promptingestimationllm-eval - 28
Соберите золотой набор из 10 000 случаев по 40 млн ежемесячных взаимодействий, шести языкам и четырём уровням риска с лимитом обновления 1 500 меток в квартал.
- 29
Спроектируйте архитектуру рубрик для 60 задач промптов и 80 проверяющих с согласием не ниже 0,75 и не более восьми критериев в рубрике.
promptingarchitecturedesign - 30
Откалибруйте промпты судьи для 25 задач и четырёх языков, если согласие с людьми равно 84% в целом и 62% на японском, за две недели.
promptingestimationllm-judge - 31
Спроектируйте человеческое разрешение 6 000 ежемесячных разногласий оценки с 12 доменными экспертами, SLA 48 часов и бюджетом $35 000 в месяц.
promptingdesignconflict - 32
Постройте платформу A/B-тестов промптов для 30 млн сессий в месяц и 25 одновременных экспериментов с допустимой регрессией безопасности не более 1%.
promptingsessionsllm-safety - 33
Задайте гейты качества для 500 релизов промптов в месяц и трёх уровней риска с CI быстрее 15 минут и критическими регрессиями ниже 0,1%.
promptingquality-gates - 34
Спроектируйте наблюдаемость и происхождение промптов для 100 млн вызовов в месяц с диагностикой за 30 дней, агрегатами за 13 месяцев и четырьмя региональными границами данных.
promptingdesignlineage - 35
Обнаруживайте смысловой дрейф поведения 300 неизменных промптов при еженедельном изменении трафика на 8%, оповещая за 24 часа и допуская менее пяти ложных тревог в месяц.
promptingalertingiac - 36
Спланируйте поэтапный запуск и откат пакета, затрагивающего 220 промптов и 18 команд, с доступностью 99,95% и откатом быстрее трёх минут.
promptingrollbackprompt-bundle - 37
Внедрите стандарты промптов в 22 командах и 700 шаблонах за квартал с принятием 80% и не более двух часов обучения на инженера.
promptingdecision-making - 38
Спроектируйте ревью 450 ежемесячных pull request с промптами от 16 команд, медианой четыре часа и двумя обязательными проверяющими для рискованных промптов.
promptingdesigncode-review - 39
Определите владение и снятие с поддержки для 900 промптов, если у 18% нет активного владельца, с очисткой за шесть месяцев и нулём необъявленных удалений.
promptingownership - 40
Создайте аварийный процесс исправления промптов для круглосуточной работы с устранением риска за 15 минут, полным ревью за четыре часа и 20 продуктовыми командами.
promptingconcurrency - 41
Организуйте промпты генерации кода для 1 200 разработчиков на четырёх языках программирования с 85% прохождения песочницы и нулём запросов встроенных секретов.
promptingsecrets - 42
Спроектируйте семейство промптов суммаризации для 14 типов документов и шести языков с сохранением 92% фактов, выводом 1 200 токенов и лимитом $0,025 на запрос.
promptingtokensdesign - 43
Спроектируйте семейство промптов извлечения для 35 схем и 5 млн страниц в месяц с точностью полей 98,5% и менее 0,3 исправляющего вызова на документ.
promptingschemadesign - 44
Спроектируйте семейство промптов классификации для 180 намерений и 10 млн обращений в месяц на английском, немецком и японском с macro-F1 выше 0,90.
classificationpromptingdesign - 45
Задайте управление стоимостью 600 промптов с расходом $1,8 млн в месяц, целью снижения 20% и потерей не более одного пункта качества на любом срезе.
prompting - 46
Команда из шести промпт-инженеров предлагает скопировать промпт на 7 000 токенов в 30 процессов ради срока шесть недель. Как вы наставите лида и сохраните график?
promptingtokensmentoring - 47
Локализуйте 110 медицинских промптов на арабский и японский за восемь недель с двумя носителями на язык и recall критической безопасности выше 99,5%.
prompting - 48
Спроектируйте промпты разрешения конфликтов среди 12 переданных фрагментов политик с 95% правильных решений о приоритете и объяснениями короче 600 токенов.
promptingtokensdesign - 49
Предоставьте аудиторские доказательства для 70 регулируемых промптов и трёх внешних аудиторов за пять рабочих дней с воспроизводимостью в течение семи лет.
prompting - 50
Спроектируйте общекорпоративную архитектуру для 1 200 промптов, 25 команд и шести языков с годовым бюджетом оценки $3 млн и доступностью публикации 99,9%.
promptingarchitecturedesign - 51
Правка системного промпта на 14 строк снижает долю решённых обращений с 89% до 76% на 3 000 тестах. Релиз назначен сегодня на 16:00. Что вы сделаете?
promptingsystem-designllm-eval - 52
При миграции 9 ролевых инструкций переносят из сообщений пользователя в системный промпт, после чего соблюдение политики падает с 97% до 83%. До завтра, 11:00, нужно решить, продолжать ли миграцию. Как вы проведёте расследование?
promptingmigrationssystem-design - 53
После обновления провайдера модель иначе выполняет отрицательные инструкции, и доля запрещённых ответов растёт с 0,4% до 3,1% на 8 000 тестах. Решение нужно принять за 4 часа. Как вы отреагируете?
testing - 54
Имя клиента с закрывающим XML-тегом выходит из переменной шаблона и переопределяет инструкцию суммаризации в 62 из 20 000 запросов. Уязвимость нужно сдержать за 90 минут. Что вы измените?
promptingxml-sections - 55
Документ содержит тот же тройной разделитель, что и шаблон промпта, и 7,8% из 1 200 суммаризаций начинают выполнять инструкции документа. Исправление нужно выпустить до 18:00. Что вы сделаете?
prompting - 56
Few-shot пример из реального обращения содержит скрытую инструкцию, и одобрение возвратов растёт с 6% до 19% в повторе 10 000 кейсов. До следующего развёртывания осталось 3 часа. Что вы сделаете?
promptingfew-shot - 57
Перестановка 6 few-shot примеров меняет победителя в 24% из 2 400 попарных тестов. Результаты эксперимента нужны завтра к 09:00. Как вы учтёте смещение из-за порядка?
promptingfew-shotsoft-skills - 58
Промпт с chain-of-thought получает 82% на бенчмарке рассуждений из 5 000 заданий, а утверждённая цель к пятнице равна 90%. Как закрыть разрыв, не показывая скрытое рассуждение?
promptingchain-of-thoughtbenchmarking - 59
Отладочный промпт раскрывает внутреннее рассуждение и API-ключ в 38 производственных ответах. Security требует сдержать инцидент за 30 минут и исправить его до 17:00. Что вы сделаете?
promptingapi - 60
Self-consistency промпт повышает точность с 87% до 89%, но увеличивает месячную стоимость с $90 000 до $310 000. Финансам нужно решение завтра к полудню. Что вы предложите?
promptingself-consistencyconsistency - 61
Промпт generate-then-critique превращает правильные налоговые ответы в неправильные в 11% из 900 проверенных кейсов. Окно релиза закрывается через 5 часов. Как вы поступите?
prompting - 62
ReAct-промпт повторяет одно некорректное действие 17 раз и тратит $4,20 на задачу с бюджетом $0,20. У вас 2 часа, чтобы исключить повторение. Что вы измените?
promptingreact - 63
Промпт планировщика тратит 70% бюджета в 12 000 токенов на план и оставляет недостаточно контекста для завершения 31% задач. Новый вариант нужен к 15:00. Как вы его спроектируете?
promptingtokenscontext - 64
Описание инструмента говорит, что он может обновить любой аккаунт, и red-team промпты вызывают 14 попыток несанкционированного обновления в 500 тестах. Инструмент должен стать безопасным завтра к 10:00. Что вы измените?
promptingtestingred-teaming - 65
Промпт аргументов инструмента копирует указанный пользователем customer ID вместо аутентифицированного ID в 3,6% из 4 000 вызовов. До 13:00 нужно исключить межаккаунтные запросы. Что вы сделаете?
prompting - 66
В цепочке из 4 промптов extractor переименовывает confidence в score, а verifier молча принимает отсутствие confidence в 22% из 6 000 запусков. Исправление нужно за 6 часов. Что вы сделаете?
promptingsoft-skills - 67
Правка промпта снижает долю валидного JSON с 99,6% до 91,2% при 80 000 запросов в день. Operations требует восстановление за 45 минут. Каков ваш план?
promptingjson-output - 68
Промпт схемы трактует отсутствующую скидку как 0 на английском и как null на испанском, повреждая 8 700 записей до срока сверки в 19:00. Как устранить путаницу nullable и default?
promptingschemafundamentals - 69
Правильная политика стоит первой в переданном контексте, но промпт ответа игнорирует её в 16% из 2 500 кейсов. Демонстрация клиенту через 7 часов. Как исправить промпт?
promptingcontext - 70
Промпт цитирования выдумывает правдоподобные номера разделов в 9% из 1 600 юридических ответов. До завтра, 08:00, нужно подготовить workflow к релизу. Что вы измените?
citationsprompting - 71
Две переданные политики конфликтуют, и промпт выбирает старую в 29% из 1 000 тестов, хотя даты видны. Решение нужно к 14:00. Как вы зададите конфликт и актуальность?
promptingtesting - 72
Найденная страница предлагает игнорировать системные правила, и промпт ответа следует ей в 23 из 400 red-team кейсов. У вас 60 минут на сдерживание. Что вы сделаете?
promptingsystem-designred-teaming - 73
Прямой jailbreak обходит safety-промпт в 4,8% из 2 000 попыток и выдаёт запрещённые инструкции. Публичный endpoint нужно исправить за 2 часа. Как вы отреагируете?
promptingendpointsllm-safety - 74
Base64, символы нулевой ширины и смешанные алфавиты обходят защиту от инъекций в 37 из 3 000 тестов. Исправить и проверить нужно до 17:30. Что вы сделаете?
promptinginjectionvalidation - 75
За 120 попыток пользователи восстанавливают 86% конфиденциального системного промпта. Legal требует оценку раскрытия завтра к 10:00. Как вы отреагируете?
promptingsystem-designsystem-prompt - 76
Constitutional-промпт содержит 12 правил, причём правила 4 и 9 конфликтуют и вызывают 18% непоследовательных отказов на 2 200 кейсах. До policy review осталось 6 часов. Что вы сделаете?
prompting - 77
Safety-промпт снижает опасные ответы с 2,1% до 0,2%, но повышает ложные отказы на допустимые запросы с 5% до 28% на 7 500 кейсах. Product ждёт решение к 12:00. Что вы предложите?
prompting - 78
Email-адреса и медицинские заметки попадают в итоговые промпты и tracing logs в 2,4% из 18 000 запросов. Privacy требует сдержать инцидент за 1 час и определить масштаб до конца дня. Что вы сделаете?
prompting - 79
Восемнадцать клиентов могут вставлять собственные блоки промпта, и эти блоки ослабляют обязательную базовую политику в 3,2% из 6 000 тестов. Безопасное исправление нужно к 15:00. Что вы сделаете?
promptingtesting - 80
Правка английского промпта улучшает точность на 5 пунктов, но немецкий и японский падают на 12 и 17 пунктов в 6 000 тестах. Глобальный rollout запланирован через 8 часов. Что вы решите?
promptingllm-eval - 81
Переведённый safety-промпт разрешает запрещённые финансовые советы в 6,2% португальских тестов против 0,5% английских. Локаль запускается завтра в 09:00. Что вы сделаете?
promptingtesting - 82
При входе в 96 000 токенов критичная инструкция в середине пропускается в 21% из 1 500 кейсов, а варианты на 16 000 проходят. Смягчение нужно до 18:00. Что вы измените?
tokens - 83
Компрессор промпта удаляет одно правило no refund without receipt, повышая несанкционированные одобрения с 1% до 13% в 4 000 тестах. На исправление релиза есть 2 часа. Что вы сделаете?
promptingtesting - 84
Системный промпт растёт с 1 800 до 7 400 токенов, p95 latency повышается с 1,4 до 2,8 секунды, а месячная стоимость на $170 000. План сокращения нужен к пятнице. Как вы поступите?
promptingtokenslatency - 85
Добавление request timestamp перед стабильным префиксом на 2 200 токенов снижает cache hit с 81% до 9% и добавляет $95 000 месячных расходов. Срок hotfix в 15:00. Что вы измените?
tokenscachingestimation - 86
Реестр промптов отдаёт версию 41 для 8% трафика, хотя одобрена версия 43, из-за чего качество когорт различается на 10 пунктов. У вас 1 час на стабилизацию production. Что вы сделаете?
promptingregistries - 87
Неверсионированный hotfix промпта исправляет один кейс возврата, но снижает общую точность политики с 94% до 81% в 5 000 повторов. Формальная замена нужна до 17:00. Что вы сделаете?
prompting - 88
Rollback возвращает системный промпт, но оставляет активными 5 новых few-shot примеров, поэтому error rate остаётся 8% вместо 1%. На полное восстановление есть 45 минут. Что вы сделаете?
promptingfew-shotsystem-design - 89
Версия 12 промпта рубрики judge меняет два ориентира оценки, из-за чего результаты за 18 месяцев становятся несопоставимыми, а кандидат сдвигается на 6 пунктов в 12 000 оценках. Решение нужно через 3 часа. Что вы сделаете?
promptingllm-eval - 90
Попарный judge выбирает первый ответ в 64% случаев и предпочитает ответы длиннее 500 слов на 18 пунктов. Надёжный результат нужен завтра к полудню. Как исправить промпт judge?
prompting - 91
Люди предпочитают промпт A в 61% из 800 слепых пар, а judge-промпт предпочитает B в 68%. Решение о запуске нужно через 5 часов. Какой сигнал использовать?
promptinghuman-eval - 92
Вы обнаруживаете, что 320 из 2 000 ответов golden set скопированы в few-shot примеры, из-за чего оценка качества промпта выросла с 84% до 93%. Отчёт нужен завтра к 09:00. Что вы сделаете?
promptingfew-shot - 93
Eval suite из 9 000 кейсов пропускает релиз промпта, но за 48 часов жалобы пользователей voice старше 65 лет растут втрое. План смягчения нужен к 16:00. Что вы сделаете?
prompting - 94
A/B-тест показывает aggregate gain 4 пункта для промпта B, но точность Spanish billing падает с 92% до 71% на 1 100 кейсах. Полный rollout назначен на пятницу. Что вы решите?
promptingaggregationab-testing - 95
Через 6 недель после запуска успешность промпта снижается с 90% до 82%, а 1 400 комментариев объединяются вокруг слишком жёстких ответов на новые типы запросов. Диагноз нужен к понедельнику. Что вы сделаете?
promptingiac - 96
Нужно перенести 27 production-промптов на новую модель за 21 день, а первый replay показывает падение качества на 9 пунктов и рост отказов на 14%. Как вы проведёте миграцию?
promptingmigrations - 97
Политика возврата меняется в 10:00, но старый пример в промпте всё ещё обещает 60 дней вместо 30, и к 13:00 неверный ответ получают 780 пользователей. Исправление нужно за 1 час. Что вы сделаете?
prompting - 98
На code review вы видите правку, которая добавляет сырой пользовательский текст в system role и пропускает injection suite из 2 500 кейсов ради merge до 17:00. Что вы сделаете?
promptingcode-reviewestimation - 99
Middle промпт-инженер собирает шесть блоков промпта с неверным приоритетом, оставляет активными две устаревшие директивы и снижает точность claims с 93% до 79% в 26 000 запросах. У вас 24 часа на восстановление и менторство. Что вы сделаете?
promptingmentoring - 100
Юридический disclaimer-блок на 3 200 токенов снижает завершённость ответов с 94% до 71% и не даёт измеримого роста безопасности, но запуск через 2 часа. Что вы порекомендуете?
tokens