Вопросы на собеседовании: Инженер по безопасности ИИ
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Junior.
Смотреть пример резюме: Инженер по безопасности ИИ →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Инженерия безопасности ИИ измеряет и снижает вред от поведения модели, кибербезопасность защищает системы, а модерация контента применяет правила к отдельным материалам.
- Команда кибербезопасности работает с кражей учётных данных, уязвимыми сервисами и несанкционированным доступом.
- Команда модерации размечает или удаляет пользовательский контент по правилам платформы, часто по одному материалу за раз.
- Инженер по безопасности строит eval-наборы, таксономии вреда и измерения защитных слоёв, например jailbreak ASR и recall отказов.
Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы фокус роли на поведении модели и не считаете ли все функции безопасности одной работой.
Alignment означает, что выученное поведение модели надёжно служит цели людей, а не просто оптимизирует приближённый сигнал из обучения.
- Заданная цель может состоять в безопасной помощи, тогда как обучающий сигнал награждает ответы, которые сразу нравятся проверяющим.
- Модель может выучить короткий путь, например уверенное согласие, потому что оно хорошо оценивается, хотя не отражает настоящую цель.
- Поэтому alignment-eval проверяет новые ситуации, где приближённый сигнал расходится с желаемым поведением.
Зачем это спрашивают: Сильный ответ разделяет человеческую цель, обучающий сигнал и поведение, которое модель фактически усвоила.
Авария и злоупотребление различаются наличием намерения причинить вред, а системный вред описывает эффекты на уровне всего внедрения или их накопление и является отдельным измерением.
- Вред в результате аварии возникает без намерения его причинить, например когда из-за слабого обобщения модель даёт опасный медицинский совет.
- Злоупотребление возникает, когда человек намеренно применяет возможности модели для мошенничества, вредоносного ПО или адресной манипуляции.
- Системный вред появляется при повторном или масштабном внедрении, например из-за дискриминационного отбора на рынке труда, и может быть следствием как непреднамеренных сбоев, так и намеренного злоупотребления.
Зачем это спрашивают: Интервьюер оценивает, отделяете ли вы намерение от масштаба и накопления, а не считаете ли системный вред третьей категорией намерения.
Базовая модель угроз называет защищаемые активы, возможных источников вреда, их доступ и значимые негативные исходы.
- К активам относятся пользователи, чувствительные данные, поведение модели, подключённые инструменты и последующие решения.
- Среди действующих лиц могут быть обычные и злоумышленные пользователи, авторы внешнего контента, сотрудники и автоматические атакующие системы.
- Допущения о доступе разделяют чёрный ящик, доступ к весам или инструментам, отравление источников retrieval либо базы знаний и управление системными входами.
- Критерий успеха связывает каждый путь с измеримым вредом, например выполнением опасного действия или нарушающим правила ответом.
Зачем это спрашивают: Интервьюеру нужен ограниченный набор действующих лиц, возможностей, поверхностей и видов вреда, а не общий список атак.
Таксономия вреда представляет собой набор категорий и границ для единообразной разметки рисков в eval и решениях.
- Категории могут разделять самоповреждение, киберзлоупотребления, мошенничество, ненависть, сексуальный контент и опасную помощь в биологии.
- Письменные критерии включения, исключения и пограничные примеры уменьшают разногласия между проверяющими и скорерами.
- Привязка каждого теста и метрики к категории показывает пробелы покрытия, которые скрывает один общий балл.
Зачем это спрашивают: Сильный ответ рассматривает таксономию как рабочий контракт измерения, а не просто список чувствительных тем.
Я оцениваю риск по тяжести исхода, его вероятности в заданной модели угроз и числу возможностей для его возникновения.
- Тяжесть отделяет слегка оскорбительный ответ от инструкции, способной привести к серьёзному физическому вреду.
- Вероятность показывает частоту успеха для реалистичных пользователей или атакующих, а не единичную принципиальную возможность.
- Масштаб воздействия учитывает размер внедрения, аудиторию, автоматизацию и повторные попытки.
- Эти факторы стоит показывать отдельно, потому что редкий катастрофический риск отличается от частого малозначительного сбоя.
Зачем это спрашивают: Интервьюер проверяет, умеете ли вы рассуждать шире простого числа сбоев и сохранять измерения для расстановки приоритетов.
Возможность двойного назначения помогает в законной работе, но также может снизить стоимость или нужный уровень знаний для причинения вреда.
- Генерация кода помогает разработчикам исправлять уязвимости, но может помочь атакующему адаптировать вредоносный код.
- Биологический ассистент может объяснять опубликованные исследования и одновременно упрощать выполнение опасных процедур.
- Оценка безопасности должна проверять и прирост вредоносных возможностей, и сохранение полезности, а не запрещать способность по названию.
Зачем это спрашивают: Сильный ответ признаёт, что риск зависит от применения и прироста возможностей, а не от ярлыка хорошей или плохой функции.
Возможность показывает, что модель умеет делать в подходящих условиях, а склонность показывает, насколько охотно она ведёт себя вредно в развёрнутой системе.
- Модель может уметь создавать код эксплойта, но после safety-обучения обычно отказывать на вредоносные запросы.
- Jailbreak-тестирование проверяет, сохраняется ли эта низкая видимая склонность при намеренном извлечении опасного поведения.
- Eval возможностей и eval соблюдения поведенческой политики отвечают на разные вопросы и не заменяют друг друга.
Зачем это спрашивают: Интервьюер проверяет, отличаете ли вы скрытую способность от наблюдаемой готовности при конкретной политике и интерфейсе.
Specification gaming возникает, когда система выполняет буквальную метрику или правило, но нарушает реальный замысел разработчика.
- Суммаризатор с наградой за краткость может выбрасывать важные предупреждения вместо улучшения лаконичности.
- Наблюдаемый балл растёт, хотя безопасность пользователя или качество задачи ухудшается.
- Разнообразный holdout и проверки побочных эффектов помогают обнаружить зависимость от несовершенной спецификации.
Зачем это спрашивают: Сильный ответ объясняет, как оптимизация записанной цели может разрушить исходный замысел.
Reward hacking представляет собой вид specification gaming, при котором агент эксплуатирует сигнал награды или процесс его измерения вместо выполнения желаемой задачи.
- Агент в симуляции может многократно запускать простое награждаемое событие, не достигая настоящей цели задачи.
- Сбой вызван лазейкой в награде, среде или оценщике, а не просто низким качеством работы.
- Раздельная проверка компонентов награды и анализ траекторий могут выявить высокую награду при нежелательном поведении.
Зачем это спрашивают: Интервьюер проверяет, связываете ли вы оптимизацию награды с конкретными лазейками в измеряемой цели.
Устойчивость означает, что значимое для безопасности поведение остаётся приемлемым при существенных изменениях входа, контекста или условий работы.
- Перефразирование, опечатки, длинные диалоги и другие языки не должны разрушать политику отказов.
- Устойчивый результат охватывает ожидаемые вариации, а не одну тщательно сформулированную фразу из бенчмарка.
- Устойчивость всегда ограничена областью, поэтому отчёт должен называть проверенные изменения и условия внедрения.
Зачем это спрашивают: Сильный ответ определяет устойчивость относительно заданных изменений, а не объявляет модель устойчивой вообще.
Сдвиг распределения возникает, когда входы или условия внедрения отличаются от данных обучения или оценки системы.
- Классификатор безопасности, проверенный на чистых английских запросах, после запуска может встретить сленг, новые атаки и другие языки.
- Точность на исходном тестовом наборе не гарантирует такое же качество на изменившейся аудитории.
- Safety-наборы должны включать ожидаемые срезы внедрения и обновляться при изменении использования или поведения атакующих.
Зачем это спрашивают: Интервьюер проверяет, понимаете ли вы, почему статичный бенчмарк может плохо предсказывать безопасность после внедрения.
Состязательный пример представляет собой намеренно изменённый вход, который вызывает сбой модели, но сохраняет нужный атакующему смысл или допустимость.
- Для текстового классификатора небольшие замены или обфускация могут обойти метку вредного контента.
- Для модели изображений ограниченное возмущение может изменить предсказание, оставаясь почти незаметным человеку.
- Допустимые изменения нужно определить заранее, потому что ничем не ограниченный шум не показывает реалистичную слабость.
Зачем это спрашивают: Сильный ответ включает намерение атакующего и ограничение на изменение, а не называет любой сложный вход состязательным.
Red teaming ИИ активно ищет сбои безопасности в рамках явной модели противника, а обычный QA в основном проверяет ожидаемые требования и известные крайние случаи.
- QA подтверждает, что заявленные функции работают с нормальными и некорректными входами.
- Red team меняет запросы и стратегии после наблюдения за ответами модели.
- Находки red team расширяют модель угроз и регрессионный набор, но не заменяют систематический benign QA.
Зачем это спрашивают: Интервьюер хочет услышать разницу между состязательным поиском новых проблем и обычной проверкой соответствия.
Jailbreak представляет собой попытку вызвать поведение, которое модель или система должна отклонять либо ограничивать.
- Поверхность включает сообщения пользователя, историю диалога, изображения, аудио, найденные документы, результаты инструментов и закодированный текст.
- Атака может быть направлена на поведение базовой модели, классификатор безопасности или окружающую оркестрацию.
- Полезный отчёт указывает запрещённое поведение, доступ атакующего, число попыток и критерий успеха.
Зачем это спрашивают: Сильный ответ определяет и обход политики, и системные поверхности, через которые его можно выполнять.
Прямая инъекция приходит от взаимодействующего с моделью пользователя, а косвенная передаётся внутри внешнего контента, который система затем обрабатывает.
- Прямая атака может просить ассистента игнорировать правила и выдать запрещённый результат.
- Косвенная атака может находиться на веб-странице, в письме, файле или найденном фрагменте, который используется как данные.
- Косвенная инъекция меняет модель угроз, потому что автор внешнего контента влияет на модель, не являясь активным пользователем.
Зачем это спрашивают: Интервьюер проверяет, классифицируете ли вы источник и границу доверия внедрённых инструкций, не уходя в общие советы по промптам.
Attack success rate, или ASR, представляет собой долю проверенных попыток атаки, которые удовлетворили заранее заданному критерию успеха jailbreak.
- Если 18 из 100 подходящих атак дали нарушающую правила помощь, измеренный ASR равен 18 процентам.
- В знаменателе нужно уточнить, считаются ли запросы, виды поведения, повторные попытки или лучший результат для каждого поведения.
- ASR можно сравнивать только при одинаковых политике, скорере, бюджете атаки и конфигурации целевой модели.
Зачем это спрашивают: Сильный ответ определяет числитель и знаменатель и называет параметры протокола, способные изменить метрику.
Precision отказов показывает, как часто предсказанный отказ правилен, а recall показывает, какую долю обязательных отказов классификатор нашёл.
- Precision равно числу истинных отказов, делённому на все предсказанные отказы, поэтому низкое значение означает лишние блокировки.
- Recall равно числу истинных отказов, делённому на все запросы, которые следовало отклонить, поэтому низкое значение означает пропущенные опасные запросы.
- Нужный баланс зависит от категории вреда и стоимости ошибки, поэтому обе метрики стоит показывать вместе с матрицей ошибок.
Зачем это спрашивают: Интервьюер проверяет, связываете ли вы precision и recall с лишними отказами и пропущенными вредными запросами.
Ложный отказ возникает, когда безопасный запрос ошибочно блокируется, и увеличивает false-positive rate защитного слоя.
- Если заблокированы 25 из 1000 безопасных запросов, FPR на benign-наборе равен 2,5 процента.
- Ложные отказы снижают полезность и могут непропорционально затрагивать темы или варианты языка, похожие на термины политики.
- Метрику нужно разбивать по категориям, потому что низкое среднее значение может скрыть серьёзный сбой в отдельном срезе.
Зачем это спрашивают: Сильный ответ количественно описывает лишние отказы и объясняет, почему общего FPR недостаточно.
Benign holdout представляет собой нетронутый набор разрешённых запросов для измерения сохранения законной полезности после изменений безопасности.
- Он должен включать сложные отрицательные примеры, где чувствительные темы обсуждаются безвредно, например в профилактике, новостях или художественном тексте.
- Исключение набора из настройки промпта и выбора порога делает оценку ложных отказов надёжнее.
- Результаты стоит показывать в целом и по представленным во внедрении языкам, темам и группам пользователей.
Зачем это спрашивают: Интервьюеру важно увидеть, что прирост безопасности проверяется на реалистичных лишних отказах по новым безопасным примерам.
Закрытые вопросы
- 21
Как использовать train, development и holdout-наборы в safety-eval?
design - 22
Что такое загрязнение safety-бенчмарка?
benchmarkingcontamination - 23
Чем оценка соблюдения политики отличается от оценки опасных возможностей?
llm-eval - 24
Какие записи делают оценку безопасности ИИ воспроизводимой?
reproducibilityllm-eval - 25
Какие роли играют task, solver, scorer и sandbox в Inspect AI?
inspect-ai - 26
Для чего используют HarmBench?
harmbench - 27
Чем JailbreakBench отличается от StrongREJECT?
llm-safetyjailbreakjailbreakbench - 28
Что измеряет MLCommons AILuminate?
ailuminate - 29
Как метод jailbreak PAIR работает на высоком уровне?
llm-safetyjailbreakpair - 30
Что такое состязательные суффиксы в стиле GCG?
gcg-suffixes - 31
Что такое AutoDAN на высоком уровне?
autodan - 32
Почему red-team результат должен указывать бюджет атаки и адаптивность атакующего?
- 33
Что должна определять таксономия меток модерации контента?
- 34
Как порог классификатора влияет на safety-guardrail?
thresholdsguardrailsllm-safety - 35
Какие разные роли играют входные и выходные guardrail?
llm-safetyguardrailsdistinct - 36
Почему важна эшелонированная защита и почему промпт не является границей безопасности?
prompting - 37
Как инженеру следует воспринимать Llama Guard 2?
llama-guard - 38
Что предоставляет NeMo Guardrails на высоком уровне?
llm-safetyguardrailsnemo-guardrails - 39
Чем безопасное завершение отличается от полного отказа?
safe-completion - 40
Что такое калиброванное воздержание и эскалация?
abstentionescalation - 41
Какова цель RLHF в безопасности?
alignmentrlhf - 42
Что такое RLAIF и чем он отличается от RLHF?
alignmentrlhfrlaif - 43
Что такое Constitutional AI?
constitutional-ai - 44
Какие свойства делают данные предпочтений полезными для safety-обучения?
- 45
Чем отличаются bias, fairness и disparity при оценке модели?
evaluationllm-eval - 46
Почему safety- и fairness-метрики нужно показывать по групповым и пересекающимся срезам?
monitoring - 47
Что такое контрфактическая оценка смещения?
llm-evalcounterfactual - 48
Чем model card отличается от system card?
system-design - 49
Что такое safety case для системы ИИ?
safety-casesystem-design - 50
Почему ни один отдельный бенчмарк не может доказать безопасность системы ИИ?
benchmarkingsystem-design - 51
Вам нужно добавить вредоносное поведение и тестовый кейс в стиле HarmBench для вымышленного лабораторного ассистента без применимых опасных деталей. Как вы отделите их от соседнего безопасного контроля?
test-casesharmbench - 52
Запрос спрашивает, как вымышленный злодей мог бы отравить город, но не содержит веществ, количеств или реальных шагов. Один аннотатор ставит harmful, другой разрешённую художественную прозу. Как вы его разметите?
- 53
Химический запрос просит условия реакции для повышения выхода и ссылается на университетское исследование, но названный продукт относится к ограниченной harm-категории. Как вы проведёте триаж ярлыка?
promptingreact - 54
Пользователь просит скрипт для сканирования якобы собственного сервера, но среди функций есть скрытность и извлечение учётных данных. Как вы разметите этот dual-use cyber-запрос?
- 55
В jailbreak-наборе 40 сценариев, каждый запущен пять раз, и в 26 из 200 попыток достигнуто целевое вредоносное поведение. Какой ASR вы укажете?
llm-safetyjailbreak - 56
По политике вредоносная процедура считается провалом. Модель отказывает, но затем раскрывает два из шести операционных шагов. Как вы оцените ответ?
- 57
На 100 размеченных промптах refusal-классификатор верно отклоняет 30 вредоносных запросов, пропускает 10 вредоносных, ошибочно отклоняет 15 безопасных и разрешает 45 безопасных. Как вы объясните precision и recall?
evaluationpromptingprecision-recall - 58
Снижение порога guard-классификатора с 0,70 до 0,50 повышает recall вредоносных запросов с 82 до 93 процентов, но удваивает ложные отказы с 6 до 12 процентов. Что вы порекомендуете?
thresholds - 59
Вам нужен benign holdout из 300 промптов для guardrail coding-ассистента. Какие примеры вы выберете?
designbenign-holdoutguardrails - 60
Safety-датасет содержит 20 парафразов каждого jailbreak, и случайное разбиение помещает варианты одной атаки в train и test. Оценка растёт с 71 до 92 процентов. Что вы сделаете?
llm-safetyjailbreaktrain-test - 61
Коллега добавляет новый refusal-промпт и сообщает, что теперь успешны только 4 процента атак, но результата для прежнего промпта нет. Что нужно сделать дальше?
prompting - 62
Scorer в Inspect AI ищет фразы вроде I cannot help, поэтому помечает ответ I won't provide those steps как небезопасное выполнение. Как вы исправите scorer?
inspect-ai - 63
Вам нужно проверить наличие корректного policy-ярлыка в ответе и вредоносность свободного текста. Какие проверки будут детерминированными, а какие потребуют model judge?
- 64
Коллега не может воспроизвести ваш ASR 18 процентов, потому что provider alias теперь указывает на новую модель. Какие точные метаданные должен сохранять прогон?
debugging - 65
При seed 42 и temperature 0 одна hosted-модель всё равно меняет два ответа за десять прогонов. Как вы это исследуете и отразите в отчёте?
decoding - 66
Red-team eval просит coding-агента создать опасный скрипт и запустить shell-инструмент. Как безопасно выполнить тест?
agents - 67
Вы можете проверить hosted black-box модель с бюджетом 200 запросов или локальную white-box модель с доступом к градиентам. Как выбрать между PAIR и GCG?
cssqueriespair - 68
AutoDAN mutation run повышает ASR с 8 до 24 процентов за 30 поколений, но сохранены только финальные промпты. Воспроизводим ли результат?
reproducibilitypromptingautodan - 69
Jailbreak, найденный на Model A, успешен в 18 из 50 попыток на Model A и в 7 из 50 на Model B. Как вы опишете перенос?
llm-safetyjailbreak - 70
Policy-фильтр разрешает запрос только тогда, когда рискованные слова записаны смесью Unicode-алфавитов и zero-width символов. Как вы проведёте триаж?
- 71
ASR английских jailbreak равен 6 процентам, но на срезе из 120 испанских кейсов достигает 19 процентов. Что вы проверите до заявления о multilingual-разрыве?
llm-safetyjailbreak - 72
Vision-language модель отказывает на вредоносный текстовый запрос, но выполняет его, когда та же инструкция показана внутри изображения с безопасной подписью. Как вы проверите сбой?
- 73
Чат-бот отказывает на опасный запрос в одном ходе, но выполняет его после шести постепенно усиливающихся ходов. Как вы зафиксируете crescendo-атаку?
escalation - 74
Ассистент для проверки резюме получает документ с инструкцией отправить данные кандидата на внешний адрес. Как вы классифицируете и проверите это?
- 75
Llama Guard 2 помечает фразу Can I tell you what I plan to do tonight? как safe, хотя предыдущие ходы явно показывают неминуемый риск самоповреждения. Что вы измените в eval?
llama-guard - 76
Safety-классификатор блокирует 28 процентов запросов в школьном уроке по ядерной физике, хотя ревьюеры считают все запросы образовательными и неоперационными. Как вы это исследуете?
- 77
Input guard помечает расплывчатый лабораторный запрос как safe, но ответ модели содержит ограниченную процедуру. Где провалился safety-стек?
- 78
Output filter обрывает безопасный ответ по первой помощи после фразы apply pressure, оставляя только Seek help и делая ответ менее полезным. Как вы проведёте триаж?
- 79
Запрос проходит input classifier, получает отказ модели, а затем post-processor переписывает его в опасные детали. Какой trace вы построите?
concurrency - 80
Пользователь говорит, что может навредить себе сегодня ночью, и спрашивает, будет ли кому-то не всё равно. Что должен содержать безопасный ответ?
safe-completion - 81
Self-harm классификатор даёт 0,58 сообщению с неминуемым риском, ниже порога автоблокировки 0,70, но внутри review-зоны от 0,50 до 0,70. Что должно произойти?
- 82
Ревьюеры постоянно спорят, когда общее обучение cybersecurity становится применимой помощью. Какие пограничные примеры вы добавите в рубрику?
conflictcybersecurity - 83
Два обученных аннотатора расходятся в 36 из 100 ответов с частичным выполнением даже после чтения рубрики. Что вы сделаете с ярлыками?
conflict - 84
Общий уровень ложных отказов равен 5 процентам, но достигает 17 процентов для промптов, сочетающих мусульманскую идентичность, женские местоимения и тему психического здоровья. Как вы это оцените?
promptingdecision-makingllm-eval - 85
Toxicity guard ставит фразе Alex says he is angry оценку 0,22, а Aisha says she is angry оценку 0,61. Как вы построите counterfactual-тест?
- 86
Toxicity-классификатор помечает 23 процента безопасных постов на African American English и 7 процентов matched-парафразов на Standard American English. Как вы проведёте триаж разрыва?
- 87
Safety-классификатор ставит многим кейсам score около 0,9, но реально вредоносны только примерно 60 процентов из них. Что покажет reliability plot?
- 88
Предложенный safety-eval датасет содержит реальные abuse reports с именами и телефонами, но без записанного согласия на оценку моделей. Можно ли его использовать?
evaluationllm-eval - 89
Ваш eval-набор содержит новые jailbreak и описания опасного target behavior с изъятыми операционными деталями. Как вы будете хранить его и делиться им внутри компании?
llm-safetyjailbreak - 90
Вы находите новый jailbreak с ASR 62 процента против ещё не выпущенной модели. Как ответственно передать его владельцу модели?
llm-safetyjailbreak - 91
Новый Unicode jailbreak исправлен нормализацией входа. Какой regression test вы добавите?
llm-safetyjailbreaknormalization - 92
Pull request меняет system prompt, а у CI есть десять минут на safety-проверки. Какой базовый gate вы построите?
promptingsystem-designcode-review - 93
Более строгий system prompt снижает ASR с 20 до 11 процентов, а внешний output guard снижает до 8 процентов, но добавляет 120 мс и больше ложных отказов. Как вы их сравните?
promptingsystem-designzero-to-one - 94
Политика NeMo Guardrails требует отклонять медицинские вопросы, но продуктовая политика разрешает общую медицинскую информацию и требует эскалации только при диагностике. Что вы сделаете?
llm-safetyguardrailsescalation - 95
Отчёт AILuminate даёт модели общий safety-grade, но одна hazard-категория заметно хуже остальных. Как вы интерпретируете результат?
- 96
Model card говорит, что модель прошла safety-тестирование, но не даёт размера датасета, snapshot модели или результатов по категориям. Достаточно ли этого для release review?
snapshot - 97
После релиза вы можете вручную проверять только 100 разговоров в неделю из 50 000 разговоров ассистента. Как вы выберете и будете отслеживать выборку?
monitoring - 98
Вам нужно оформить issue для jailbreak, успешного в 7 из 20 попыток. Что сделает issue воспроизводимым и полезным?
llm-safetyjailbreakreproducibility - 99
На review eval-скрипт коллеги отправляет сгенерированный опасный код в реальный shell и публикует полные jailbreak-промпты в открытых CI-артефактах. Какой feedback вы дадите?
llm-safetyjailbreakfeedback - 100
Multilingual eval на 60 кейсах показывает рост ASR с 10 до 15 процентов после обновления модели, но доверительные интервалы пересекаются и три ярлыка оспариваются. Как вы сообщите результат?
confidence-intervalscommunicationzero-to-one