Skip to content

Вопросы на собеседовании: Промпт-инженер

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Senior промпт-инженер.

Смотреть пример резюме: Промпт-инженер

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

promptingzero-shotchain-of-thought

Я использую zero-shot chain-of-thought для многошаговых задач только после того, как прямой промпт показал недостаточную точность на оценке.

  • Он может улучшить арифметику, учет ограничений и составные вопросы, поскольку просит модель проработать промежуточные шаги.
  • Он увеличивает расход токенов и задержку, а простую классификацию может превратить в длинный путь с дополнительными возможностями отклониться.
  • Для ответственных сценариев я измеряю точность финального ответа на фиксированном наборе и прошу краткое обоснование или проверяемые вычисления, а не принимаю связное рассуждение за доказательство.

Зачем это спрашивают: Интервьюер проверяет, считает ли кандидат chain-of-thought измеряемым приемом, а не универсальным суффиксом для любого промпта.

chain-of-thought

Промпт не может сделать chain-of-thought приватным, поэтому я запрашиваю только краткие проверяемые артефакты, а показом данных управляет приложение.

  • Контракт ответа может разрешать итог, ключевые допущения, ссылки на доказательства и краткую формулу с входными данными, но не полный ход рассуждения.
  • Я никогда не помещаю секреты, скрытые политики или учетные данные в контекст модели в надежде, что инструкция не даст их раскрыть.
  • Приложение валидирует и фильтрует разрешенные поля ответа, а eval-тесты проверяют правильность, согласованность доказательств и утечки.

Зачем это спрашивают: Сильный ответ не запрашивает полный chain-of-thought, не помещает секреты в контекст и поручает контроль утечек приложению, а не промпту.

promptingself-consistencydesign

Я генерирую несколько вариантов решения и агрегирую нормализованные финальные ответы только тогда, когда измеренный прирост точности оправдывает дополнительные вызовы.

  • Число выборок и параметры генерации я настраиваю на development-наборе для конкретной модели и задачи: универсальной температуры или числа от пяти до десяти нет.
  • Для точных ответов подходит большинство голосов, а свободный текст требует канонизации, кластеризации или калиброванного судьи с заданной рубрикой.
  • Я показываю ничьи, концентрацию голосов, стоимость и задержку, затем подтверждаю конфигурацию на holdout-наборе, поскольку коррелированные выборки создают ложную уверенность.

Зачем это спрашивают: Интервьюер оценивает, понимает ли кандидат и разнообразие выборок, и сложность агрегации в self-consistency.

prompting

Я бы сделал выявление допущений обязательным результатом планирования и блокировал выполнение, если неподтвержденное допущение существенно влияет на результат.

  • Планировщик разделяет предоставленные факты, выведенные факты, допущения и неизвестные, указывая источник или способ проверки каждого пункта.
  • Каждый шаг объявляет предпосылки; отсутствие важных данных приводит к уточнению или проверке, а не к подстановке правдоподобного значения.
  • В eval-тестах я удаляю или опровергаю ожидаемые входные данные и проверяю, что план показывает пробел до запуска зависимого действия.

Зачем это спрашивают: Интервьюер проверяет, использует ли кандидат планирование для выявления неподтвержденных допущений и неизвестных до выполнения, а не только для составления шагов.

promptingleast-to-mostdesign

Я использую least-to-most, когда поздние подзадачи действительно зависят от ответов на более простые ранние вопросы.

  • Промпт декомпозиции сначала выдает упорядоченный список от предпосылок к финальной задаче, а не сразу просит полное решение.
  • Каждый ответ явно передается в следующий шаг, что помогает со составными вопросами и длинными цепочками ограничений.
  • Главный риск состоит в накоплении ошибок, поэтому я валидирую критические промежуточные результаты или сравниваю итог с прямым базовым промптом.

Зачем это спрашивают: Интервьюер хочет увидеть, умеет ли кандидат превращать least-to-most декомпозицию в явные зависимости и проверять границу распространения ошибок.

promptingdesign

Я требую, чтобы декомпозиция выдавала независимо разрешимые подвопросы с явными зависимостями и целью синтеза.

  • Промпт запрещает пересекающиеся подвопросы и помечает, какие из них можно выполнять параллельно, а каким нужны предыдущие результаты.
  • Каждый подвопрос содержит требуемые доказательства и ожидаемую форму ответа, например одно утверждение с источником и датой.
  • Этап синтеза получает исходный запрос и все промежуточные ответы, чтобы находить пробелы, а не просто склеивать текст.

Зачем это спрашивают: Сильный ответ превращает декомпозицию в проверяемые входы и выходы этапов, а не ограничивается просьбой разбить задачу.

prompting

Я разделяю критику и редактуру на два прохода с узкой рубрикой, а не предлагаю модели переписывать ответ без ограничений.

  • Критика называет конкретные дефекты, например неподтвержденные утверждения, пропущенные ограничения или нарушение схемы, и указывает проблемный фрагмент.
  • Промпт редактуры получает исходный запрос, черновик и критику, но меняет только подтвержденные критикой проблемы.
  • Повторная саморедактура может удалить верные детали или укрепить собственную ошибку модели, поэтому я ограничиваюсь одним или двумя проходами и сравниваю с базовым вариантом без редактуры.

Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат ограничивать редактуру и учитывать самоподтверждение и регресс качества.

prompting

Я превращаю конституцию в приоритетные проверяемые принципы и требую назвать нарушенный принцип до переписывания.

  • Проход критики возвращает ID принципа, проблемный фрагмент и краткое описание конфликта вместо общей оценки безопасности.
  • Переписывание сохраняет разрешенный контент и меняет только нарушающую часть, что сокращает лишние отказы и потерю пользы.
  • Я задаю приоритет при конфликтах, например юридическая безопасность выше тона бренда, и оцениваю каждый принцип на положительных и отрицательных примерах.

Зачем это спрашивают: Интервьюер оценивает, реализован ли конституционный промптинг как проверяемый процесс применения политики, а не общая просьба быть безопасным.

reactserializationsessions

Я бы сохранял версионированный артефакт состояния под управлением рантайма, который можно проверить и воспроизвести перед продолжением.

  • Он фиксирует стабильные ID действий, завершенную и ожидающую работу, проверенные наблюдения и происхождение, связывающее каждое наблюдение с вызовом инструмента и результатом рантайма.
  • Состояние остановки содержит причину, позицию продолжения, разрешенные следующие переходы и требование пользовательского ввода или одобрения повтора.
  • При продолжении рантайм валидирует артефакт, отклоняет наблюдения от ассистента и идет от последнего проверенного перехода, не повторяя завершенные действия.

Зачем это спрашивают: Интервьюер проверяет, остается ли ReAct-процесс надежным и возобновляемым между ходами благодаря сериализованному состоянию и проверенному происхождению.

promptingagents

Планировщик должен выдавать ограниченный граф задач, а исполнитель должен выполнить ровно один утвержденный шаг без права менять план.

  • Планировщик видит цель, ограничения, доступные возможности и предыдущие результаты, затем выдает шаги, зависимости и критерии успеха.
  • Исполнитель видит один шаг, разрешенные для него инструменты, относящиеся к нему входы и ожидаемую схему результата, что ограничивает случайное расширение задачи.
  • Перепланирование запускается типизированным блокером или нарушенным допущением, а не скрытым изменением процесса любым исполнителем.

Зачем это спрашивают: Сильный ответ разделяет полномочия планирования и исполнения и задает управляемое перепланирование.

promptingabstention

Я описываю инструменты через важные для решения возможности, исключения и предварительные условия, а отказ от выбора делаю явным допустимым исходом.

  • Каждое описание говорит, что возвращает инструмент и когда его нельзя применять, например поиск аккаунта доступен только для записей авторизованного клиента.
  • Выход содержит выбранный инструмент, короткую причину на основе входных данных и недостающие условия вместо свободного плана действий.
  • Я тестирую похожие пары инструментов и случаи без подходящего инструмента, потому что очевидные примеры не раскрывают границы маршрутизации.

Зачем это спрашивают: Интервьюер оценивает, основан ли выбор инструмента на различающих контрактах и есть ли безопасный путь без вызова.

prompting

Я указываю допустимый источник каждого чувствительного или значимого аргумента и запрещаю модели додумывать отсутствующие значения.

  • Авторизованные ID берутся из доверенного состояния сессии, а даты или предпочтения могут поступать из последнего явного сообщения пользователя.
  • Перечисления, единицы измерения, диапазоны и взаимоисключающие поля описываются и в схеме, и в текстовой политике.
  • Если обязательное значение отсутствует или неоднозначно, модель должна задать точный вопрос, а не копировать правдоподобное значение из найденного текста.

Зачем это спрашивают: Интервьюер хочет увидеть, что кандидат управляет происхождением аргументов, а не только синтаксисом JSON.

prompting

Жесткие лимиты применяет runtime, а планировщик или исполнитель получает структурированный снимок остатка, нужный для следующего решения.

  • Планировщик видит остаток шагов, вызовов инструментов и перепланирований и должен уложить план в них; исполнитель получает один утвержденный шаг и разрешенные вызовы.
  • Промпт задает поведение при достаточном, малом и исчерпанном бюджете, включая возврат подтвержденного частичного результата или блокера вместо заявления о завершении.
  • Приложение считает токены и вызовы и останавливает выполнение, потому что модель не умеет надежно считать токены или применять к себе лимиты.

Зачем это спрашивают: Сильный ответ переводит runtime-бюджет в разное поведение планировщика и исполнителя, не поручая модели подсчет токенов и применение лимитов.

prompting

Каждый этап получает одну ответственность, валидируемую входную схему и выходную схему, подготовленную для следующего этапа.

  • Этап извлечения возвращает фрагменты источника и поля, а последующий синтез может интерпретировать их, но не создавать отсутствующие доказательства.
  • Контракты описывают работу с null, правила уверенности или отказа и исходные входы, которые остаются доступны дальше.
  • Я оцениваю этапы по отдельности до проверки всей цепочки, чтобы хороший финальный ответ не скрывал сломанный промежуточный шаг.

Зачем это спрашивают: Интервьюер проверяет, проектирует ли кандидат цепочки промптов как тестируемые интерфейсы, а не свободную передачу текста.

promptingabstentiondesign

Я задаю взаимно различимые критерии маршрутов и выделяю unknown как полноценную метку с четким порогом.

  • Маршрутизатор видит только нужную для выбора информацию, чтобы содержание будущего ответа или лишний контекст не смещали метку.
  • Few-shot примеры сосредоточены на границах, смешанных намерениях и неподдерживаемых областях, а не на простых случаях.
  • Выход содержит enum маршрута и совпавшие признаки, а низкая уверенность или противоречивые признаки ведут к уточнению или ручной проверке.

Зачем это спрашивают: Интервьюер оценивает проектирование границ маршрутов и управляемый исход при неопределенности.

ensemblesprompting

Я использую ансамбли для независимого разнообразия, а дебаты только там, где явное оспаривание может выявить конкурирующие допущения.

  • Параллельные кандидаты снижают коррелированные ошибки одной выборки, но агрегатор должен применять рубрику, а не выбирать самый уверенный текст.
  • Дебаты могут найти пропущенные доказательства, однако поздние агенты способны привязаться к первому ответу или согласиться с общей ошибкой.
  • Оба подхода умножают расход токенов и задержку, поэтому я сравниваю прирост с self-consistency и более сильным одиночным промптом на одном наборе оценки.

Зачем это спрашивают: Сильный ответ различает независимое голосование и интерактивные дебаты и сравнивает оба подхода с более дешевыми вариантами.

prompting

Я оставляю поиск по дереву для задач со значимыми альтернативными состояниями, дешевой оценкой частичного решения и высокой ценой раннего выбора.

  • Задачи планирования, расписания с ограничениями и выбор стратегии программы могут выиграть, потому что ветви оцениваются до полного завершения.
  • Промпт должен определить генерацию ветвей, представление состояния, оценку для отсечения, глубину и жесткий бюджет расширений.
  • Для обычного резюме или извлечения ветвление в основном дублирует текст и повышает стоимость, поэтому лучше прямой или plan-and-solve промпт.

Зачем это спрашивают: Интервьюер хочет услышать конкретный критерий ветвления, а не использование tree-of-thought ради модного приема.

ragpromptingtokens

Я бы задал лимит, измеряемый целевым токенизатором, и контракт сохранения, который проверяется по исходному контексту.

  • Сжатие обязано сохранять отрицание, числовые уточнения, стабильные ID источников и метаданные авторитетности, включая издателя, дату вступления в силу и тип документа.
  • Каждый сжатый тезис остается связанным с исходным фрагментом, а менее важные повторы удаляются раньше любых уточняющих деталей.
  • Валидатор проверяет число токенов, связь с источниками и сохранность решающих тезисов, отклоняя резюме, которые меняют смысл доказательств.

Зачем это спрашивают: Интервьюер проверяет, соблюдает ли сжатие RAG реальный бюджет токенов с сохранением и валидацией смысла доказательств.

citationsprompting

Я требую цитирование на уровне утверждений и соответствие каждой ссылки фрагменту, который прямо подтверждает это утверждение.

  • Формат ответа ставит ID источника сразу после фактического предложения, а не собирает несвязанные ссылки в конце.
  • Проверочный проход извлекает каждую пару утверждения и ссылки и помечает полную, частичную, отсутствующую или противоречащую поддержку.
  • Я запрещаю ссылки у чистых рекомендаций, если они не зависят от факта из источника, чтобы контракт цитирования сохранял смысл.

Зачем это спрашивают: Сильный ответ сосредоточен на логической поддержке и гранулярности цитат, а не просто на наличии ID источников.

groundednessprompting

Я требую явно показывать существенные конфликты и применять документированную политику приоритета, а не усреднять утверждения или выбирать самый новый текст.

  • Для источника указываются область действия, юрисдикция, авторитетность, даты публикации и действия, статус и явная связь замены прежнего документа.
  • Сначала промпт отбирает применимые источники, затем выбирает регулирующий источник нужной юрисдикции и периода; свежесть важна только среди одинаково применимых источников.
  • Если эти признаки не разрешают конфликт, ответ называет оба утверждения и не делает однозначный вывод.

Зачем это спрашивают: Интервьюер оценивает, учитывает ли приоритет применимость, юрисдикцию, период действия, авторитетность и явную замену, а не только свежесть.

Закрытые вопросы

  • 21

    Как определить расположение инструкций, примеров, контекста и пользовательского запроса в длинном промпте?

    promptingcontextqueries
  • 22

    Как спроектировать оценку с перестановкой позиций для эффекта lost-in-the-middle?

    promptingdesignllm-eval
  • 23

    Когда стоит применять quote-first или extract-then-answer промптинг?

    prompting
  • 24

    Как написать мультимодальный промпт, который однозначно ссылается на области или страницы?

    prompting
  • 25

    Как описания и примеры в JSON Schema влияют на структурированную генерацию?

    schemajson-output
  • 26

    Когда грамматические ограничения предпочтительнее текстовых инструкций по формату ответа?

    promptingoutput-contract
  • 27

    Как развивать схему структурированного ответа, не ломая потребителей промпта?

    promptingschemastructured-output
  • 28

    Как few-shot примеры должны учить модель правильно вызывать инструменты?

    promptingfew-shot
  • 29

    Как адаптировать одну задачу промпта для моделей OpenAI, Claude и Gemini?

    prompting
  • 30

    В чем разница между system и developer инструкциями при проектировании промпта?

    system-designdesigninstruction-roles
  • 31

    Как выбирать между XML-тегами и другими разделителями в промпте?

    promptingdelimitersxml-sections
  • 32

    Как компоновать и наследовать шаблоны промптов без непрозрачной иерархии?

    promptingownershiptemplates
  • 33

    Как защитить повторно используемые блоки промптов от скрытых конфликтов инструкций?

    prompting
  • 34

    Как локализовать промпт для мультиязычного продукта?

    prompting
  • 35

    Как задать культурные ограничения и тон, не опираясь на стереотипы?

  • 36

    Как распределять бюджет и сжимать содержимое промпта при тесном лимите контекста?

    promptingcontext
  • 37

    Что входит в стабильный префикс промпта и зачем сохранять его неизменным?

    prompting
  • 38

    Что должен содержать lock-манифест зависимостей для промпта, собранного из переиспользуемых компонентов?

    promptingcomponentsdependencies
  • 39

    Какие статические проверки следует включить в линтер промптов?

    promptinglinting
  • 40

    Как составить набор оценки для нового промпта?

    promptingllm-eval
  • 41

    Как декомпозировать рубрику для оценки ответов промпта?

    promptingllm-eval
  • 42

    Когда использовать попарные, а когда поточечные промпты судьи?

    promptingllm-judge
  • 43

    Как исследовать смещения judge-промпта и улучшать его рубрику?

    promptingiteration
  • 44

    Как разрешать разногласия оценщиков, чтобы улучшать рубрику промпта и ее примеры?

    promptingconflictllm-eval
  • 45

    Как инструментировать A/B-эксперимент двух версий промпта в продакшне?

    promptingexperiments
  • 46

    Чем promptfoo, Inspect AI, LangSmith и RAGAS отличаются с точки зрения оценки промптов?

    promptingllm-eval
  • 47

    Как построить red-team корпус для проверки prompt injection?

    injectionprompt-injectionred-teaming
  • 48

    Какие защиты в промпте помогают против прямых и косвенных prompt injection?

    injectionprompt-injectionprompting
  • 49

    Как написать конституционный промпт safety-политики, который сохраняет полезность?

    prompting
  • 50

    Как тестировать и снижать чрезмерные отказы, вызванные safety-промптом?

    prompting
  • 51

    Промпт для рассуждения работает на чистых примерах, но ошибается после добавления лишних фактов или перефразирования вопроса. Как повысить его устойчивость?

    prompting
  • 52

    Агрегатор self-consistency считает 0,5, 1/2 и 50% тремя разными ответами. Как исправить голосование?

    self-consistencyconsistencyaggregation
  • 53

    Промпт поддержки раскрывает внутренние обоснования вроде названий политик в 7% ответов, хотя сами ответы верны. Как остановить утечку?

    prompting
  • 54

    В цепочке least-to-most первый этап правильно декомпозирует задачи, но второй неверно использует предыдущий подответ в 14% из 300 случаев. Как вы будете это отлаживать?

    least-to-most
  • 55

    Промпт-критик отклоняет редкие правильные факты как незнакомые и не приводит источники. Как его переработать?

    prompting
  • 56

    Конституционный критик находит правильный принцип, но переписывание теряет ID принципа и обязательное изменение. Как обеспечить надежную передачу?

  • 57

    Инструмент возвращает partial_failure после выполнения двух из пяти элементов, но ReAct-промпт считает любой результат успехом. Как исправить контракт?

    promptingreact
  • 58

    Планировщик и исполнитель повторяют одно и то же исследование и вызовы инструментов из-за неясной границы ответственности. Как их разделить?

  • 59

    В 2 из 500 тестов промпт выбора инструмента выбирает delete_account вместо suspend_account для неоднозначного запроса. Как сделать его безопасным?

    promptingtesting
  • 60

    Аргументы инструментов нарушают бизнес-правила в 6,5% вызовов, хотя каждый ответ соответствует JSON Schema. Как улучшить промпт?

    promptingschemajson-output
  • 61

    Имена полей совпадают на всех этапах цепочки промптов, но между извлечением и синтезом теряются ID источников. Как сохранить происхождение данных?

    prompting
  • 62

    Промпт-роутер отправляет 31% простых переписываний в дорогой reasoning-промпт, хотя бюджет допускает не более 12%. Как его настроить?

    prompting
  • 63

    В промпте дебатов двух агентов второй повторяет первый ответ в 70% случаев и находит мало ошибок. Как вернуть независимую проверку?

    promptingagents
  • 64

    Промпт счетов дает лишь 94% валидных по схеме ответов при цели 99,5%. Как сравнить нативную строгую схему провайдера и grammar constraints?

    promptingschema
  • 65

    Нужно добавить обязательное поле confidence_reason в схему промпта, которую используют три downstream-потребителя без общего окна деплоя. Как провести миграцию?

    promptingschemadeployment
  • 66

    Промпт Claude с четырьмя XML-секциями набирает 88%, но после прямого копирования в роли OpenAI получает 78%. Как его перенести?

    promptingxml-sections
  • 67

    Один и тот же moderation-промпт обрывается посреди предложения у одного провайдера и возвращает полный отказ у другого в 8% тестов. Как нормализовать поведение?

    promptingnormalizationtesting
  • 68

    Классификатор с шестью английскими few-shot примерами набирает 92% на английском, 74% на испанском и 71% на немецком. Что вы измените?

    promptingfew-shot
  • 69

    После локализации промпта отмены 11% русских запросов трактуются как немедленное удаление вместо отмены в конце периода. Как это исправить?

    promptingresilience
  • 70

    Промпт ответа RAG следует длинной цитате, но игнорирует компактные авторитетные метаданные, определяющие правильный результат. Как изменить работу с доказательствами?

    ragprompting
  • 71

    Одна ссылка прикреплена к абзацу с тремя фактическими утверждениями, но подтверждает только одно. Как обеспечить покрытие ссылками?

    citationscoverage
  • 72

    Промпт получает таблицу цен, где сноска исключает годовые планы, но применяет скидку к годовым планам в 14% из 500 кейсов. Как его переработать?

    promptingpricing
  • 73

    Промпт с 20 документами теряет 21 процентный пункт, когда ключевой источник перемещается из начала в середину. Как изменить порядок контекста?

    promptingcontext
  • 74

    Quote-first промпт для grounding повышает фактическую точность на 8 пунктов, но добавляет 38% output tokens. Как сохранить большую часть прироста?

    promptingtokens
  • 75

    Недоверенное наблюдение инструмента содержит поддельное сообщение об успехе, и промпт финального ответа заявляет, что действие выполнено. Как это предотвратить?

    prompting
  • 76

    Отложенный многоходовый jailbreak оставляет инструкцию в первом сообщении и активирует ее через несколько ходов. Как это тестировать и сдерживать?

    llm-safety
  • 77

    Классификатор отказывает в анализе политики, потому что цитируемый материал содержит вредоносные инструкции. Как отличить анализ от выполнения?

  • 78

    Омоглиф из другой письменности меняет имя инструмента, но нормализация не позволяет безопасно определить нужный идентификатор. Что должны сделать промпт и рантайм?

    promptingnormalization
  • 79

    Шаблон использует customer_name и в данных аккаунта, и во встроенном примере, из-за чего 2,3% отрендеренных промптов обращаются не к тому человеку. Как исправить коллизию переменных?

    prompting
  • 80

    Общий safety-блок требует отказывать в финансовых советах, а продуктовый блок требует давать рекомендации по портфелю, из-за чего 14% тестов противоречивы. Как разрешить конфликт шаблонов?

    testing
  • 81

    Команда не может воспроизвести 12% ошибок промпта прошлой недели, потому что в логах есть только имя шаблона. Что вы будете версионировать и записывать?

    promptingdebugging
  • 82

    System prompt длиной 6000 токенов содержит три конфликтующие инструкции, и 19% ошибок следуют неверной. Как его упростить?

    promptingtokenssystem-prompt
  • 83

    Сжатие контекста отделяет входные данные few-shot примеров от их меток и портит соответствие демонстраций. Как сохранить примеры?

    promptingcontextfew-shot
  • 84

    Ротируемые few-shot примеры поместили в стабильный префикс, поэтому изменения кеша и поведения нельзя объяснить отдельно. Как перестроить промпт?

    promptingfew-shotcaching
  • 85

    Два критерия рубрики, полнота и полезность, коррелируют на 0,86, а судьи повторяют одинаковое обоснование. Как исправить рубрику?

  • 86

    Судья награждает официальный профессиональный тон выше столь же правильного простого языка. Как убрать смещение по тону?

  • 87

    Судья привязывается к формулировке эталона и штрафует правильный ответ с другим способом рассуждения. Как проверить семантическую эквивалентность?

    validationequivalence
  • 88

    LLM-судья согласуется с доменными экспертами лишь умеренно: Cohen's kappa равна 0,42 на 250 случаях. Что вы сделаете до использования в CI?

    llm
  • 89

    Три человеческих оценщика достигают лишь weighted kappa 0,31 на пятибалльной рубрике качества промпта. Как улучшить оценку?

    promptingllm-eval
  • 90

    Примеры разработки семантически перефразировали в релизный eval-набор, создав утечку без точных текстовых совпадений. Как очистить бенчмарк?

    benchmarking
  • 91

    Промпт набирает 96% на synthetic evals, но только 78% на 400 реальных запросах. Как вы перестроите тестовый набор?

    prompting
  • 92

    Запуск promptfoo показывает 37 регрессий после изменения формулировки, но 29 из них являются изменениями judge score менее 0,1. Как решить, что блокирует релиз?

    prompting
  • 93

    LangSmith trace содержит девять этапов промптов и инструментов, а итоговая точность упала на 10 пунктов после релиза. Как локализовать проблемный этап промпта?

    prompting
  • 94

    Назначение A/B-теста указывает вариант B, но в 6% трасс стоит хеш отрендеренного промпта A из-за смешанных bundle. Как поступить с экспериментом?

    promptingexperiments
  • 95

    Парная оценка на 120 случаях показывает прирост промпта на 3 пункта с широким доверительным интервалом от минус 2 до плюс 8. Как решить, собирать ли ещё данные?

    promptingconfidence-intervals
  • 96

    Неизменный набор тестов промпта набирает от 68% до 92% за десять запусков. Как сделать решение по eval надёжным?

    prompting
  • 97

    У вас есть 1200 комментариев thumbs-down, но 64% не содержат причины. Как превратить их в eval cases для промпта?

    prompting
  • 98

    Закрепленные промпт и модель не менялись, но трафик сместился от коротких вопросов об оплате к запросам по нескольким политикам, и успешность упала. Как это диагностировать?

    prompting
  • 99

    Как динамически выбирать небольшой разнообразный набор few-shot примеров в пределах бюджета токенов?

    promptingtokensfew-shot
  • 100

    Изменение промпта junior-инженером на 14 строк выглядит чище, но снижает оценку сложных случаев на 6 пунктов. Как вы проведёте code review и менторство?

    promptingmentoring