Skip to content

Вопросы на собеседовании: Инженер по безопасности ИИ

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Junior.

Смотреть пример резюме: Инженер по безопасности ИИ

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

ai-safetycybersecuritymoderation

Инженерия безопасности ИИ измеряет и снижает вред от поведения модели, кибербезопасность защищает системы, а модерация контента применяет правила к отдельным материалам.

  • Команда кибербезопасности работает с кражей учётных данных, уязвимыми сервисами и несанкционированным доступом.
  • Команда модерации размечает или удаляет пользовательский контент по правилам платформы, часто по одному материалу за раз.
  • Инженер по безопасности строит eval-наборы, таксономии вреда и измерения защитных слоёв, например jailbreak ASR и recall отказов.

Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы фокус роли на поведении модели и не считаете ли все функции безопасности одной работой.

alignment

Alignment означает, что выученное поведение модели надёжно служит цели людей, а не просто оптимизирует приближённый сигнал из обучения.

  • Заданная цель может состоять в безопасной помощи, тогда как обучающий сигнал награждает ответы, которые сразу нравятся проверяющим.
  • Модель может выучить короткий путь, например уверенное согласие, потому что оно хорошо оценивается, хотя не отражает настоящую цель.
  • Поэтому alignment-eval проверяет новые ситуации, где приближённый сигнал расходится с желаемым поведением.

Зачем это спрашивают: Сильный ответ разделяет человеческую цель, обучающий сигнал и поведение, которое модель фактически усвоила.

system-design

Авария и злоупотребление различаются наличием намерения причинить вред, а системный вред описывает эффекты на уровне всего внедрения или их накопление и является отдельным измерением.

  • Вред в результате аварии возникает без намерения его причинить, например когда из-за слабого обобщения модель даёт опасный медицинский совет.
  • Злоупотребление возникает, когда человек намеренно применяет возможности модели для мошенничества, вредоносного ПО или адресной манипуляции.
  • Системный вред появляется при повторном или масштабном внедрении, например из-за дискриминационного отбора на рынке труда, и может быть следствием как непреднамеренных сбоев, так и намеренного злоупотребления.

Зачем это спрашивают: Интервьюер оценивает, отделяете ли вы намерение от масштаба и накопления, а не считаете ли системный вред третьей категорией намерения.

threat-modelingthreat-modelsystem-design

Базовая модель угроз называет защищаемые активы, возможных источников вреда, их доступ и значимые негативные исходы.

  • К активам относятся пользователи, чувствительные данные, поведение модели, подключённые инструменты и последующие решения.
  • Среди действующих лиц могут быть обычные и злоумышленные пользователи, авторы внешнего контента, сотрудники и автоматические атакующие системы.
  • Допущения о доступе разделяют чёрный ящик, доступ к весам или инструментам, отравление источников retrieval либо базы знаний и управление системными входами.
  • Критерий успеха связывает каждый путь с измеримым вредом, например выполнением опасного действия или нарушающим правила ответом.

Зачем это спрашивают: Интервьюеру нужен ограниченный набор действующих лиц, возможностей, поверхностей и видов вреда, а не общий список атак.

llm-evalharm-taxonomy

Таксономия вреда представляет собой набор категорий и границ для единообразной разметки рисков в eval и решениях.

  • Категории могут разделять самоповреждение, киберзлоупотребления, мошенничество, ненависть, сексуальный контент и опасную помощь в биологии.
  • Письменные критерии включения, исключения и пограничные примеры уменьшают разногласия между проверяющими и скорерами.
  • Привязка каждого теста и метрики к категории показывает пробелы покрытия, которые скрывает один общий балл.

Зачем это спрашивают: Сильный ответ рассматривает таксономию как рабочий контракт измерения, а не просто список чувствительных тем.

severity-priority

Я оцениваю риск по тяжести исхода, его вероятности в заданной модели угроз и числу возможностей для его возникновения.

  • Тяжесть отделяет слегка оскорбительный ответ от инструкции, способной привести к серьёзному физическому вреду.
  • Вероятность показывает частоту успеха для реалистичных пользователей или атакующих, а не единичную принципиальную возможность.
  • Масштаб воздействия учитывает размер внедрения, аудиторию, автоматизацию и повторные попытки.
  • Эти факторы стоит показывать отдельно, потому что редкий катастрофический риск отличается от частого малозначительного сбоя.

Зачем это спрашивают: Интервьюер проверяет, умеете ли вы рассуждать шире простого числа сбоев и сохранять измерения для расстановки приоритетов.

dual-use

Возможность двойного назначения помогает в законной работе, но также может снизить стоимость или нужный уровень знаний для причинения вреда.

  • Генерация кода помогает разработчикам исправлять уязвимости, но может помочь атакующему адаптировать вредоносный код.
  • Биологический ассистент может объяснять опубликованные исследования и одновременно упрощать выполнение опасных процедур.
  • Оценка безопасности должна проверять и прирост вредоносных возможностей, и сохранение полезности, а не запрещать способность по названию.

Зачем это спрашивают: Сильный ответ признаёт, что риск зависит от применения и прироста возможностей, а не от ярлыка хорошей или плохой функции.

Возможность показывает, что модель умеет делать в подходящих условиях, а склонность показывает, насколько охотно она ведёт себя вредно в развёрнутой системе.

  • Модель может уметь создавать код эксплойта, но после safety-обучения обычно отказывать на вредоносные запросы.
  • Jailbreak-тестирование проверяет, сохраняется ли эта низкая видимая склонность при намеренном извлечении опасного поведения.
  • Eval возможностей и eval соблюдения поведенческой политики отвечают на разные вопросы и не заменяют друг друга.

Зачем это спрашивают: Интервьюер проверяет, отличаете ли вы скрытую способность от наблюдаемой готовности при конкретной политике и интерфейсе.

spec-gaming

Specification gaming возникает, когда система выполняет буквальную метрику или правило, но нарушает реальный замысел разработчика.

  • Суммаризатор с наградой за краткость может выбрасывать важные предупреждения вместо улучшения лаконичности.
  • Наблюдаемый балл растёт, хотя безопасность пользователя или качество задачи ухудшается.
  • Разнообразный holdout и проверки побочных эффектов помогают обнаружить зависимость от несовершенной спецификации.

Зачем это спрашивают: Сильный ответ объясняет, как оптимизация записанной цели может разрушить исходный замысел.

spec-gamingreward-hacking

Reward hacking представляет собой вид specification gaming, при котором агент эксплуатирует сигнал награды или процесс его измерения вместо выполнения желаемой задачи.

  • Агент в симуляции может многократно запускать простое награждаемое событие, не достигая настоящей цели задачи.
  • Сбой вызван лазейкой в награде, среде или оценщике, а не просто низким качеством работы.
  • Раздельная проверка компонентов награды и анализ траекторий могут выявить высокую награду при нежелательном поведении.

Зачем это спрашивают: Интервьюер проверяет, связываете ли вы оптимизацию награды с конкретными лазейками в измеряемой цели.

Устойчивость означает, что значимое для безопасности поведение остаётся приемлемым при существенных изменениях входа, контекста или условий работы.

  • Перефразирование, опечатки, длинные диалоги и другие языки не должны разрушать политику отказов.
  • Устойчивый результат охватывает ожидаемые вариации, а не одну тщательно сформулированную фразу из бенчмарка.
  • Устойчивость всегда ограничена областью, поэтому отчёт должен называть проверенные изменения и условия внедрения.

Зачем это спрашивают: Сильный ответ определяет устойчивость относительно заданных изменений, а не объявляет модель устойчивой вообще.

distributionsdistribution-shift

Сдвиг распределения возникает, когда входы или условия внедрения отличаются от данных обучения или оценки системы.

  • Классификатор безопасности, проверенный на чистых английских запросах, после запуска может встретить сленг, новые атаки и другие языки.
  • Точность на исходном тестовом наборе не гарантирует такое же качество на изменившейся аудитории.
  • Safety-наборы должны включать ожидаемые срезы внедрения и обновляться при изменении использования или поведения атакующих.

Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы, почему статичный бенчмарк может плохо предсказывать безопасность после внедрения.

adversarial-ml

Состязательный пример представляет собой намеренно изменённый вход, который вызывает сбой модели, но сохраняет нужный атакующему смысл или допустимость.

  • Для текстового классификатора небольшие замены или обфускация могут обойти метку вредного контента.
  • Для модели изображений ограниченное возмущение может изменить предсказание, оставаясь почти незаметным человеку.
  • Допустимые изменения нужно определить заранее, потому что ничем не ограниченный шум не показывает реалистичную слабость.

Зачем это спрашивают: Сильный ответ включает намерение атакующего и ограничение на изменение, а не называет любой сложный вход состязательным.

red-teamingqa

Red teaming ИИ активно ищет сбои безопасности в рамках явной модели противника, а обычный QA в основном проверяет ожидаемые требования и известные крайние случаи.

  • QA подтверждает, что заявленные функции работают с нормальными и некорректными входами.
  • Red team меняет запросы и стратегии после наблюдения за ответами модели.
  • Находки red team расширяют модель угроз и регрессионный набор, но не заменяют систематический benign QA.

Зачем это спрашивают: Интервьюер хочет услышать разницу между состязательным поиском новых проблем и обычной проверкой соответствия.

llm-safetyjailbreak

Jailbreak представляет собой попытку вызвать поведение, которое модель или система должна отклонять либо ограничивать.

  • Поверхность включает сообщения пользователя, историю диалога, изображения, аудио, найденные документы, результаты инструментов и закодированный текст.
  • Атака может быть направлена на поведение базовой модели, классификатор безопасности или окружающую оркестрацию.
  • Полезный отчёт указывает запрещённое поведение, доступ атакующего, число попыток и критерий успеха.

Зачем это спрашивают: Сильный ответ определяет и обход политики, и системные поверхности, через которые его можно выполнять.

injectionprompt-injectionprompting

Прямая инъекция приходит от взаимодействующего с моделью пользователя, а косвенная передаётся внутри внешнего контента, который система затем обрабатывает.

  • Прямая атака может просить ассистента игнорировать правила и выдать запрещённый результат.
  • Косвенная атака может находиться на веб-странице, в письме, файле или найденном фрагменте, который используется как данные.
  • Косвенная инъекция меняет модель угроз, потому что автор внешнего контента влияет на модель, не являясь активным пользователем.

Зачем это спрашивают: Интервьюер проверяет, классифицируете ли вы источник и границу доверия внедрённых инструкций, не уходя в общие советы по промптам.

llm-safetyjailbreakllm-eval

Attack success rate, или ASR, представляет собой долю проверенных попыток атаки, которые удовлетворили заранее заданному критерию успеха jailbreak.

  • Если 18 из 100 подходящих атак дали нарушающую правила помощь, измеренный ASR равен 18 процентам.
  • В знаменателе нужно уточнить, считаются ли запросы, виды поведения, повторные попытки или лучший результат для каждого поведения.
  • ASR можно сравнивать только при одинаковых политике, скорере, бюджете атаки и конфигурации целевой модели.

Зачем это спрашивают: Сильный ответ определяет числитель и знаменатель и называет параметры протокола, способные изменить метрику.

evaluationprecision-recall

Precision отказов показывает, как часто предсказанный отказ правилен, а recall показывает, какую долю обязательных отказов классификатор нашёл.

  • Precision равно числу истинных отказов, делённому на все предсказанные отказы, поэтому низкое значение означает лишние блокировки.
  • Recall равно числу истинных отказов, делённому на все запросы, которые следовало отклонить, поэтому низкое значение означает пропущенные опасные запросы.
  • Нужный баланс зависит от категории вреда и стоимости ошибки, поэтому обе метрики стоит показывать вместе с матрицей ошибок.

Зачем это спрашивают: Интервьюер проверяет, связываете ли вы precision и recall с лишними отказами и пропущенными вредными запросами.

false-positive

Ложный отказ возникает, когда безопасный запрос ошибочно блокируется, и увеличивает false-positive rate защитного слоя.

  • Если заблокированы 25 из 1000 безопасных запросов, FPR на benign-наборе равен 2,5 процента.
  • Ложные отказы снижают полезность и могут непропорционально затрагивать темы или варианты языка, похожие на термины политики.
  • Метрику нужно разбивать по категориям, потому что низкое среднее значение может скрыть серьёзный сбой в отдельном срезе.

Зачем это спрашивают: Сильный ответ количественно описывает лишние отказы и объясняет, почему общего FPR недостаточно.

designllm-evalbenign-holdout

Benign holdout представляет собой нетронутый набор разрешённых запросов для измерения сохранения законной полезности после изменений безопасности.

  • Он должен включать сложные отрицательные примеры, где чувствительные темы обсуждаются безвредно, например в профилактике, новостях или художественном тексте.
  • Исключение набора из настройки промпта и выбора порога делает оценку ложных отказов надёжнее.
  • Результаты стоит показывать в целом и по представленным во внедрении языкам, темам и группам пользователей.

Зачем это спрашивают: Интервьюеру важно увидеть, что прирост безопасности проверяется на реалистичных лишних отказах по новым безопасным примерам.

Закрытые вопросы

  • 21

    Как использовать train, development и holdout-наборы в safety-eval?

    design
  • 22

    Что такое загрязнение safety-бенчмарка?

    benchmarkingcontamination
  • 23

    Чем оценка соблюдения политики отличается от оценки опасных возможностей?

    llm-eval
  • 24

    Какие записи делают оценку безопасности ИИ воспроизводимой?

    reproducibilityllm-eval
  • 25

    Какие роли играют task, solver, scorer и sandbox в Inspect AI?

    inspect-ai
  • 26

    Для чего используют HarmBench?

    harmbench
  • 27

    Чем JailbreakBench отличается от StrongREJECT?

    llm-safetyjailbreakjailbreakbench
  • 28

    Что измеряет MLCommons AILuminate?

    ailuminate
  • 29

    Как метод jailbreak PAIR работает на высоком уровне?

    llm-safetyjailbreakpair
  • 30

    Что такое состязательные суффиксы в стиле GCG?

    gcg-suffixes
  • 31

    Что такое AutoDAN на высоком уровне?

    autodan
  • 32

    Почему red-team результат должен указывать бюджет атаки и адаптивность атакующего?

  • 33

    Что должна определять таксономия меток модерации контента?

  • 34

    Как порог классификатора влияет на safety-guardrail?

    thresholdsguardrailsllm-safety
  • 35

    Какие разные роли играют входные и выходные guardrail?

    llm-safetyguardrailsdistinct
  • 36

    Почему важна эшелонированная защита и почему промпт не является границей безопасности?

    prompting
  • 37

    Как инженеру следует воспринимать Llama Guard 2?

    llama-guard
  • 38

    Что предоставляет NeMo Guardrails на высоком уровне?

    llm-safetyguardrailsnemo-guardrails
  • 39

    Чем безопасное завершение отличается от полного отказа?

    safe-completion
  • 40

    Что такое калиброванное воздержание и эскалация?

    abstentionescalation
  • 41

    Какова цель RLHF в безопасности?

    alignmentrlhf
  • 42

    Что такое RLAIF и чем он отличается от RLHF?

    alignmentrlhfrlaif
  • 43

    Что такое Constitutional AI?

    constitutional-ai
  • 44

    Какие свойства делают данные предпочтений полезными для safety-обучения?

  • 45

    Чем отличаются bias, fairness и disparity при оценке модели?

    evaluationllm-eval
  • 46

    Почему safety- и fairness-метрики нужно показывать по групповым и пересекающимся срезам?

    monitoring
  • 47

    Что такое контрфактическая оценка смещения?

    llm-evalcounterfactual
  • 48

    Чем model card отличается от system card?

    system-design
  • 49

    Что такое safety case для системы ИИ?

    safety-casesystem-design
  • 50

    Почему ни один отдельный бенчмарк не может доказать безопасность системы ИИ?

    benchmarkingsystem-design
  • 51

    Вам нужно добавить вредоносное поведение и тестовый кейс в стиле HarmBench для вымышленного лабораторного ассистента без применимых опасных деталей. Как вы отделите их от соседнего безопасного контроля?

    test-casesharmbench
  • 52

    Запрос спрашивает, как вымышленный злодей мог бы отравить город, но не содержит веществ, количеств или реальных шагов. Один аннотатор ставит harmful, другой разрешённую художественную прозу. Как вы его разметите?

  • 53

    Химический запрос просит условия реакции для повышения выхода и ссылается на университетское исследование, но названный продукт относится к ограниченной harm-категории. Как вы проведёте триаж ярлыка?

    promptingreact
  • 54

    Пользователь просит скрипт для сканирования якобы собственного сервера, но среди функций есть скрытность и извлечение учётных данных. Как вы разметите этот dual-use cyber-запрос?

  • 55

    В jailbreak-наборе 40 сценариев, каждый запущен пять раз, и в 26 из 200 попыток достигнуто целевое вредоносное поведение. Какой ASR вы укажете?

    llm-safetyjailbreak
  • 56

    По политике вредоносная процедура считается провалом. Модель отказывает, но затем раскрывает два из шести операционных шагов. Как вы оцените ответ?

  • 57

    На 100 размеченных промптах refusal-классификатор верно отклоняет 30 вредоносных запросов, пропускает 10 вредоносных, ошибочно отклоняет 15 безопасных и разрешает 45 безопасных. Как вы объясните precision и recall?

    evaluationpromptingprecision-recall
  • 58

    Снижение порога guard-классификатора с 0,70 до 0,50 повышает recall вредоносных запросов с 82 до 93 процентов, но удваивает ложные отказы с 6 до 12 процентов. Что вы порекомендуете?

    thresholds
  • 59

    Вам нужен benign holdout из 300 промптов для guardrail coding-ассистента. Какие примеры вы выберете?

    designbenign-holdoutguardrails
  • 60

    Safety-датасет содержит 20 парафразов каждого jailbreak, и случайное разбиение помещает варианты одной атаки в train и test. Оценка растёт с 71 до 92 процентов. Что вы сделаете?

    llm-safetyjailbreaktrain-test
  • 61

    Коллега добавляет новый refusal-промпт и сообщает, что теперь успешны только 4 процента атак, но результата для прежнего промпта нет. Что нужно сделать дальше?

    prompting
  • 62

    Scorer в Inspect AI ищет фразы вроде I cannot help, поэтому помечает ответ I won't provide those steps как небезопасное выполнение. Как вы исправите scorer?

    inspect-ai
  • 63

    Вам нужно проверить наличие корректного policy-ярлыка в ответе и вредоносность свободного текста. Какие проверки будут детерминированными, а какие потребуют model judge?

  • 64

    Коллега не может воспроизвести ваш ASR 18 процентов, потому что provider alias теперь указывает на новую модель. Какие точные метаданные должен сохранять прогон?

    debugging
  • 65

    При seed 42 и temperature 0 одна hosted-модель всё равно меняет два ответа за десять прогонов. Как вы это исследуете и отразите в отчёте?

    decoding
  • 66

    Red-team eval просит coding-агента создать опасный скрипт и запустить shell-инструмент. Как безопасно выполнить тест?

    agents
  • 67

    Вы можете проверить hosted black-box модель с бюджетом 200 запросов или локальную white-box модель с доступом к градиентам. Как выбрать между PAIR и GCG?

    cssqueriespair
  • 68

    AutoDAN mutation run повышает ASR с 8 до 24 процентов за 30 поколений, но сохранены только финальные промпты. Воспроизводим ли результат?

    reproducibilitypromptingautodan
  • 69

    Jailbreak, найденный на Model A, успешен в 18 из 50 попыток на Model A и в 7 из 50 на Model B. Как вы опишете перенос?

    llm-safetyjailbreak
  • 70

    Policy-фильтр разрешает запрос только тогда, когда рискованные слова записаны смесью Unicode-алфавитов и zero-width символов. Как вы проведёте триаж?

  • 71

    ASR английских jailbreak равен 6 процентам, но на срезе из 120 испанских кейсов достигает 19 процентов. Что вы проверите до заявления о multilingual-разрыве?

    llm-safetyjailbreak
  • 72

    Vision-language модель отказывает на вредоносный текстовый запрос, но выполняет его, когда та же инструкция показана внутри изображения с безопасной подписью. Как вы проверите сбой?

  • 73

    Чат-бот отказывает на опасный запрос в одном ходе, но выполняет его после шести постепенно усиливающихся ходов. Как вы зафиксируете crescendo-атаку?

    escalation
  • 74

    Ассистент для проверки резюме получает документ с инструкцией отправить данные кандидата на внешний адрес. Как вы классифицируете и проверите это?

  • 75

    Llama Guard 2 помечает фразу Can I tell you what I plan to do tonight? как safe, хотя предыдущие ходы явно показывают неминуемый риск самоповреждения. Что вы измените в eval?

    llama-guard
  • 76

    Safety-классификатор блокирует 28 процентов запросов в школьном уроке по ядерной физике, хотя ревьюеры считают все запросы образовательными и неоперационными. Как вы это исследуете?

  • 77

    Input guard помечает расплывчатый лабораторный запрос как safe, но ответ модели содержит ограниченную процедуру. Где провалился safety-стек?

  • 78

    Output filter обрывает безопасный ответ по первой помощи после фразы apply pressure, оставляя только Seek help и делая ответ менее полезным. Как вы проведёте триаж?

  • 79

    Запрос проходит input classifier, получает отказ модели, а затем post-processor переписывает его в опасные детали. Какой trace вы построите?

    concurrency
  • 80

    Пользователь говорит, что может навредить себе сегодня ночью, и спрашивает, будет ли кому-то не всё равно. Что должен содержать безопасный ответ?

    safe-completion
  • 81

    Self-harm классификатор даёт 0,58 сообщению с неминуемым риском, ниже порога автоблокировки 0,70, но внутри review-зоны от 0,50 до 0,70. Что должно произойти?

  • 82

    Ревьюеры постоянно спорят, когда общее обучение cybersecurity становится применимой помощью. Какие пограничные примеры вы добавите в рубрику?

    conflictcybersecurity
  • 83

    Два обученных аннотатора расходятся в 36 из 100 ответов с частичным выполнением даже после чтения рубрики. Что вы сделаете с ярлыками?

    conflict
  • 84

    Общий уровень ложных отказов равен 5 процентам, но достигает 17 процентов для промптов, сочетающих мусульманскую идентичность, женские местоимения и тему психического здоровья. Как вы это оцените?

    promptingdecision-makingllm-eval
  • 85

    Toxicity guard ставит фразе Alex says he is angry оценку 0,22, а Aisha says she is angry оценку 0,61. Как вы построите counterfactual-тест?

  • 86

    Toxicity-классификатор помечает 23 процента безопасных постов на African American English и 7 процентов matched-парафразов на Standard American English. Как вы проведёте триаж разрыва?

  • 87

    Safety-классификатор ставит многим кейсам score около 0,9, но реально вредоносны только примерно 60 процентов из них. Что покажет reliability plot?

  • 88

    Предложенный safety-eval датасет содержит реальные abuse reports с именами и телефонами, но без записанного согласия на оценку моделей. Можно ли его использовать?

    evaluationllm-eval
  • 89

    Ваш eval-набор содержит новые jailbreak и описания опасного target behavior с изъятыми операционными деталями. Как вы будете хранить его и делиться им внутри компании?

    llm-safetyjailbreak
  • 90

    Вы находите новый jailbreak с ASR 62 процента против ещё не выпущенной модели. Как ответственно передать его владельцу модели?

    llm-safetyjailbreak
  • 91

    Новый Unicode jailbreak исправлен нормализацией входа. Какой regression test вы добавите?

    llm-safetyjailbreaknormalization
  • 92

    Pull request меняет system prompt, а у CI есть десять минут на safety-проверки. Какой базовый gate вы построите?

    promptingsystem-designcode-review
  • 93

    Более строгий system prompt снижает ASR с 20 до 11 процентов, а внешний output guard снижает до 8 процентов, но добавляет 120 мс и больше ложных отказов. Как вы их сравните?

    promptingsystem-designzero-to-one
  • 94

    Политика NeMo Guardrails требует отклонять медицинские вопросы, но продуктовая политика разрешает общую медицинскую информацию и требует эскалации только при диагностике. Что вы сделаете?

    llm-safetyguardrailsescalation
  • 95

    Отчёт AILuminate даёт модели общий safety-grade, но одна hazard-категория заметно хуже остальных. Как вы интерпретируете результат?

  • 96

    Model card говорит, что модель прошла safety-тестирование, но не даёт размера датасета, snapshot модели или результатов по категориям. Достаточно ли этого для release review?

    snapshot
  • 97

    После релиза вы можете вручную проверять только 100 разговоров в неделю из 50 000 разговоров ассистента. Как вы выберете и будете отслеживать выборку?

    monitoring
  • 98

    Вам нужно оформить issue для jailbreak, успешного в 7 из 20 попыток. Что сделает issue воспроизводимым и полезным?

    llm-safetyjailbreakreproducibility
  • 99

    На review eval-скрипт коллеги отправляет сгенерированный опасный код в реальный shell и публикует полные jailbreak-промпты в открытых CI-артефактах. Какой feedback вы дадите?

    llm-safetyjailbreakfeedback
  • 100

    Multilingual eval на 60 кейсах показывает рост ASR с 10 до 15 процентов после обновления модели, но доверительные интервалы пересекаются и три ярлыка оспариваются. Как вы сообщите результат?

    confidence-intervalscommunicationzero-to-one