Skip to content

Вопросы на собеседовании: Agentic AI Engineer

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Senior.

Смотреть пример резюме: Agentic AI Engineer

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

designruntimeasync

Я бы сделал состояние задач долговечным, а выполнение моделей и инструментов вынес в заменяемые идемпотентные воркеры.

  • 10 миллионов задач в месяц дают в среднем 3,9 задачи в секунду, поэтому мощность я проверял бы на измеренном часовом пике с двукратным запасом, а не по среднему.
  • Workflow engine хранит попытки, дедлайны, бюджеты, аренды и типизированные события; чтения можно повторять, а побочные эффекты требуют ключей идемпотентности.
  • Задача считается принятой только после проверки identity и начальной политики, резервирования квоты и дедлайна и кворумного подтверждения долговечного события; предложенная, отклоненная и принятая нагрузка показываются отдельно.
  • Каждая долговечно принятая задача остается в знаменателе завершения, поэтому последующий отказ политики, деградация или исчерпание ресурсов считаются незавершением; отмены пользователя следуют одному заранее объявленному и отдельно показываемому правилу.

Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат превратить автономность агентов в долговечное выполнение, ограниченные повторы и измеримую мощность.

agentsfinancial-agentdesign

Я бы разделил рекомендацию и исполнение, поставив детерминированный сервис транзакций за жесткой границей авторизации.

  • Агент создает типизированное намерение перевода, а сервис заново проверяет получателя, сумму, валюту, лимиты, санкционный результат и владельца счета по свежим данным.
  • Переводу нужны уникальный ключ идемпотентности и подписанное одобрение, привязанное к хешу точного намерения; изменение любого поля отменяет одобрение.
  • Двойной контроль включается выше порога риска, выведенного из потерь от мошенничества и требований регулятора; новый получатель всегда требует внешнего подтверждения.
  • Сверка сопоставляет банковские подтверждения с ledger побочных эффектов, а неопределенный исход уходит на ручное расследование, не в автоматический повтор.

Зачем это спрашивают: Сильный ответ не дает модели напрямую распоряжаться необратимыми переводами и безопасно обрабатывает неопределенные исходы.

agentsdesignmutations

Я бы предоставил агенту целевые бизнес-возможности вместо разрешения компоновать сырые API всех 20 систем.

  • Tool gateway унифицирует identity, схемы, таймауты, идемпотентность и квитанции, сохраняя раздельными поиск и изменяющие операции.
  • Агент автоматически выполняет обратимые чтения и черновики; возвраты, отмены и изменения прав проходят детерминированные предусловия и одобрение по риску.
  • Знаменатель возможностей изменения включает каждое намерение изменить аккаунт, дошедшее до детерминированной границы решения, включая воздержания и отказы; онлайн-квитанции дают предварительные метки, а отложенная проверка провайдером или человеком делает их окончательными.
  • Продвижение требует, чтобы односторонняя верхняя 95% доверительная граница ошибочных изменений была ниже 0,1% в целом и по существенным срезам риска после созревания меток; ожидающие и пересмотренные production-метки явно показываются рядом с SLO 10 минут.

Зачем это спрашивают: Интервьюер проверяет наличие стабильных контрактов возможностей, состояния и контроля изменений у агента с множеством инструментов.

leakageagentsdesign

Я бы создавал для каждой задачи временное workspace в границах репозитория, а тесты и доказательства ревью сделал обязательными результатами.

  • Manifest фиксирует commit SHA, build image, кеши зависимостей, сетевую политику, учетные данные и разрешенные пути; ключи кеша включают tenant и репозиторий.
  • Индекс обновляется по коммитам, но код и символы фильтруются до сборки контекста модели по разрешенному набору репозиториев.
  • Агент выполняет ограниченные циклы правки и теста, публикует патч и квитанции команд, но не может merge или push без отдельного права репозитория.
  • Тест мощности на 650 разноязычных задачах измеряет очередь, запуск sandbox, тесты, приемку патча и утечки относительно SLO 20 минут.

Зачем это спрашивают: Сильный ответ объединяет изоляцию репозитория, воспроизводимое выполнение, ограниченные полномочия и доказательства качества патча.

agentscomputer-usesessions

Я бы расширял rollout по возможностям и уровням риска, а не выдавал неограниченное управление компьютером случайному проценту пользователей.

  • На первой неделе сотрудники выполняют read-only задачи в браузере; затем когорты получают формы и обратимые записи, а платежи и настройки безопасности остаются закрытыми.
  • Удаленный policy service ограничивает домены, UI-действия, загрузки, буфер обмена и credentials, а запись сессии хранит скриншоты и квитанции действий.
  • При нуле тяжелых событий для односторонней верхней 95% границы ниже 1 на 100 000 нужно примерно 300 000 репрезентативных независимых сессий; срезы и зависимость увеличивают требуемую эффективную выборку, поэтому детерминированные тесты запрещенных действий остаются отдельными гейтами.
  • Серверный kill switch отзывает manifest возможностей и останавливает активные сессии за 15 минут, что проверяется на каждом этапе rollout.

Зачем это спрашивают: Интервьюер оценивает, следуют ли гейты rollout риску возможностей и статистически значимым данным.

designmcp-platformagents

Я бы отделил discovery и governance MCP от data plane, который вызывает каждый tool server.

  • Подписанный каталог хранит identity сервера, схемы, владельца, scopes, классы данных, уровень риска и версии совместимости; агент видит только разрешенный набор.
  • Gateway применяет аутентификацию, политику, квоты, дедлайны и trace propagation, не скрывая семантику ошибок MCP.
  • Собственный подписанный каталог использует кешированные снимки и отдельный канал срочных запретов; привилегированная маршрутизация запрещается, если нельзя подтвердить подпись, корректность часов, работоспособность канала запретов или допустимый максимальный возраст пакета.
  • 650 tools дают 30% сверх текущих 500 для прогнозного роста и перекрытия версий; бюджет 40 мс оставляет измеренный сетевой запас.

Зачем это спрашивают: Сильный ответ масштабирует MCP через управляемый каталог и тонкий invocation plane, а не через безграничный список инструментов в промпте.

deploymentrollbackregistries

Я бы сделал каждую опубликованную версию инструмента неизменяемой и требовал явную декларацию совместимости до продвижения alias.

  • Registry хранит JSON Schema входа и выхода, класс побочного эффекта, auth scopes, таймаут, владельца, дату deprecation и digest реализации.
  • Contract-тесты повторяют характерные вызовы на старой и новой версиях; удаление поля или смена семантики требует major-версии и миграции потребителей.
  • Агент закрепляет snapshot registry на задачу, чтобы 24-часовой workflow не получил другую схему посередине выполнения.
  • Откат переводит подписанный alias на прошлую проверенную версию, а ежедневный деплой разрешается только после drill восстановления за 10 минут.

Зачем это спрашивают: Интервьюер проверяет, остаются ли изменения инструментов неизменяемыми, проверенными на совместимость и безопасными для активных агентов.

oauthdesigndelegation

Runtime получает внутренний capability handle на один вызов; provider OAuth tokens остаются на сервере с TTL и audience провайдера.

  • Runtime агента получает непрозрачный grant handle, но не refresh token; broker проверяет пользователя, tenant, consent, scopes, audience и намерение вызова.
  • Incremental consent запрашивает узкий scope по необходимости, а рискованное действие привязывает свежее подтверждение к хешу нормализованного вызова.
  • Gateway проверяет resource, tenant, audience и replay; провайдер обязан поддерживать exchange или revocation за пять минут, иначе delegated actions закрываются.
  • Тесты cross-audience, replay, просроченного consent и confused deputy служат релизными гейтами для всех 12 интеграций.

Зачем это спрашивают: Сильный ответ сохраняет полномочия пользователя через узкое отзываемое делегирование, не передавая модели долгоживущие OAuth-токены.

agentsdesignpolicy

Я бы поставил детерминированную проверку политики на каждую границу инструмента и распространял подписанные пакеты для локального вычисления.

  • Входы включают principal, tenant, версию агента, инструмент, нормализованные аргументы, класс данных, уровень риска и прошлые одобрения.
  • Критические пакеты политик имеют TTL 60 секунд и отдельный канал срочных запретов; только низкорисковые чтения могут использовать заранее объявленный более долгий TTL последней заведомо исправной версии.
  • При отсутствии identity, устаревшей критической политике или неизвестном действии система запрещает вызов; низкорисковые чтения могут ограниченно использовать последнюю заведомо исправную версию.
  • После истечения срока актуальности критические решения считаются недоступными; доступность нужно отдельно считать для свежих критических политик и классов, которым разрешена последняя исправная версия.

Зачем это спрашивают: Интервьюер оценивает, является ли политика централизованной по смыслу, но отказоустойчивой и неизбежной при исполнении.

promptingagentssecrets

Я бы обменивал подтвержденную workload identity и одобренное намерение на короткоживущие credentials на границе инструмента.

  • Строгие разрешительные схемы отклоняют значения с секретами до сериализации промпта, события или trace; модель и телеметрия получают только непрозрачные grant handles, ID и reason codes.
  • Региональные stateless brokers проверяют tenant, инструмент, scope, политику, аренду задачи и состояние отзыва, затем вводят ограниченные аудиторией и одной задачей credentials прямо в защищенный канал адаптера.
  • Размещённые рядом снимки политик и региональные подписывающие сервисы на базе HSM обеспечивают p95 ниже 100 мс в указанных исправных регионах от аутентифицированного запроса до получения адаптером.
  • Если broker, подписывающий сервис, свежесть политики или проверка отзыва недоступны, выдача и погашение запрещаются; canary scanners остаются дополнительной защитой, а не гарантией отсутствия открытых секретов.

Зачем это спрашивают: Сильный ответ убирает секреты из видимого модели состояния, сохраняя быстрый, атрибутируемый доступ с минимальными правами.

probabilitydesignbreakout

Я бы использовал одноразовые microVM с отдельными профилями для исполнения кода и работы браузера.

  • Каждый запуск получает свежую границу ядра, read-only base image, лимиты CPU и памяти, временный диск, отсутствие host sockets и default-deny egress proxy.
  • Browser-сессии изолируют профиль, downloads, clipboard, extensions и доступ к локальной сети; code-сессии монтируют только объявленные входы и каталог результата.
  • Images и browser builds закреплены по digest, сканируются и меняются, а события syscall, DNS, файлов и процессов поступают в containment alerts.
  • Запуск быстрее двух секунд проверяется на warm pools, но escape-тесты и tenant-crossing probes важнее цели latency.

Зачем это спрашивают: Интервьюер проверяет, выполняются ли враждебные результаты инструментов и сгенерированный код за реальной границей изоляции с лимитами ресурсов.

migrationsreplay

Сохраняйте недетерминированные результаты как workflow events.

  • Completed node хранит normalized input, manifest, model output, provider metadata и validation; replay потребляет его без нового вызова модели.
  • Только отсутствие terminal event создает новую attempt, а неоднозначные effects сначала требуют provider idempotency или reconciliation.
  • Детерминированные migrators могут менять форму старого state, но не записанное решение.

Зачем это спрашивают: Сильный ответ отделяет детерминированный replay от намеренно нового inference.

agentsdesignevent-log

Я бы использовал append-only event log как источник истины, а периодические типизированные snapshots только для ускорения replay.

  • События содержат task, sequence, версию схемы, command ID, actor, timestamps и hashes; optimistic sequence checks предотвращают split-brain writers.
  • Событие считается принятым после локальной кворумной записи, а задержка межрегиональной репликации жестко ограничена 30 секундами; прием останавливается, если границу нельзя удержать, что задает RPO не более 30 секунд.
  • Snapshots создаются по измеренному порогу стоимости replay, сначала каждые 200 событий, а крупные artifacts используют content-addressed ссылки; ни частота snapshots, ни копирование artifacts не задают RPO.
  • Recovery drills восстанавливают выборку длинных задач на свежей инфраструктуре и отдельно измеряют потерю подтвержденных событий и время replay, которое должно оставаться ниже пяти минут.

Зачем это спрашивают: Интервьюер оценивает, ускоряют ли checkpoints полную упорядоченную историю событий, а не заменяют ее.

ledgerdesign

Я бы назначал каждому планируемому эффекту стабильную identity до вызова внешней системы.

  • Ledger хранит хеш нормализованного намерения, tenant, principal, версию tool, approval, ключ идемпотентности, попытку, статус и receipt провайдера.
  • Состояния различают prepared, dispatched, confirmed, rejected и unknown; неизвестный исход блокирует повтор, пока точная сверка с провайдером не разрешит его.
  • Outbox закрывает атомарность между базой данных и очередью, но не между базой и сторонней системой; денежное, коммуникационное или data-изменение допустимо только при нативной идемпотентности провайдера или точной сверке чтением после записи по стабильному бизнес-ключу.
  • Частота дублей измеряется по семантическому эффекту среди всех покрытых изменений, а не по HTTP-попыткам; провайдеры без обоих механизмов не могут выполнять ни один покрытый эффект.

Зачем это спрашивают: Сильный ответ превращает внешние изменения в явные атрибутируемые state machines и осторожно обрабатывает неясный исход.

agentserror-handling

Считайте override ограниченным и истекающим policy artifact.

  • Свяжите reviewer, case, intent hash, отклоненное правило, rationale, лимит effect, expiry и второе approval; dispatch заново проверяет state.
  • Аудируйте исходное решение и outcome; новые arguments требуют reapproval.
  • Training хранит его как исключение до независимого adjudication изменения правила владельцами policy.

Зачем это спрашивают: Сильный ответ управляет исключениями человека без тихого изменения policy.

agentsdecision-making

Я бы потребовал от каждого изменяющего tool объявить прямой эффект, поведение идемпотентности, класс обратимости и проверенную компенсацию.

  • Полностью обратимые вызовы дают версионируемую undo-команду; условно обратимые указывают срок и предусловия; необратимые требуют approval до отправки.
  • Saga записывает завершенные эффекты и выполняет компенсации в обратном порядке зависимостей, каждая со своим idempotency key и receipt.
  • Сбой компенсации ставит workflow на паузу и вызывает owning team, а не просит модель импровизировать новое изменение.
  • Гейт восстановления 30 минут применяется только к цепочкам tools, чье худшее время компенсации прошло fault-injection tests.

Зачем это спрашивают: Сильный ответ превращает обещание rollback в явные контракты tools и проверенное поведение saga.

agentsdesignactivation

Я бы считал сгенерированный код недоверенным предложением, которое может запросить проверку, но не может само себя опубликовать или авторизовать.

  • Для каждого предложения записываются исходный код, создавшие его агент и задача, происхождение входных данных, воспроизводимая сборка, схемы, запрошенные права, классы данных, сетевые назначения, класс побочных эффектов, владелец и срок действия; изолированная сборка создает digest артефакта.
  • Автоматические тесты и независимый reviewer одобряют точный digest и manifest возможностей; registry и broker учетных данных принимают подписи только от субъектов, недоступных предложившему инструмент агенту.
  • Подписанный артефакт работает в sandbox с запретом по умолчанию, а каждый вызов проходит через policy gateway с учетными данными в границах задачи; по истечении срока временный alias удаляется, а активные задачи остаются привязаны к проверяемой версии.
  • p95 активации измеряется от окончательного одобрения до появления в каталоге, без времени review; срочный запрет отзывает маршрутизацию и новые учетные данные за пять минут, а откат возвращает предыдущий подписанный артефакт, сохраняя квитанции предложения, проверки и исполнения.

Зачем это спрашивают: Интервьюер оценивает, есть ли у рекурсивного создания инструментов независимая цепочка полномочий, ограниченное исполнение, происхождение, срок действия и операционный откат.

promptingtokensdesign

Я бы представил задачу milestones, которые раскрываются в малые исполняемые подпланы только после готовности предусловий.

  • Верхний уровень хранит цели, acceptance tests, бюджеты и зависимости; leaf plans содержат примерно 5-10 шагов, чтобы сбой не обесценивал 100 решений.
  • Каждый завершенный leaf записывает structured findings, provenance и открытые вопросы в durable state вместо добавления сырой истории.
  • Детерминированный packer упорядочивает доказательства по объявленному приоритету, удаляет дубли и считает system text, user input, summaries, найденные доказательства, выбранные tool schemas и резерв output tokens в жестком лимите 32 000 токенов для каждого вызова.
  • Ветви critical path работают параллельно только в общих лимитах tools, tokens и двух часов; если вызов нельзя упаковать без удаления обязательных доказательств или резерва ответа, validation завершается ошибкой вместо неявного обрезания.

Зачем это спрашивают: Сильный ответ сдерживает отклонение длинного плана через декомпозицию, долговечные доказательства и явное расписание зависимостей.

designmulti-agentagents

Я бы использовал supervisor над ограниченными capability специалистами, а не полностью связанную беседу 30 агентов.

  • Router выбирает лишь несколько ролей, обоснованных типом кейса; у каждой свои tools, data scope, output schema и budget.
  • Специалисты обмениваются подписанными artifacts через workflow state, не свободными peer messages, что ограничивает рост промпта и подделку полномочий.
  • Action service выводит approver и executor из разных principals с непересекающимися grants, отклоняет одного principal или владельца credentials в обеих позициях и не позволяет supervisor переназначать credentials или создавать право approval.
  • Replay tests измеряют точность routing, число handoffs, latency, conflicts и попытки обойти разделение обязанностей до добавления роли.

Зачем это спрашивают: Интервьюер проверяет, снижает ли multi-agent специализация сложность, не создавая неконтролируемые полномочия и коммуникацию.

agentsdesignmemory

Я бы сделал blackboard типизированным tenant-partitioned состоянием workflow, а не общим документом на естественном языке.

  • Записи объявляют owner, schema, task scope, provenance, version, expiry и read-write capability; авторизация идет до query или subscription.
  • Compare-and-swap версии не дают агентам тихо перезаписывать друг друга, а append-only findings сохраняют конкурирующие гипотезы.
  • Порядок гарантируется внутри раздела tenant-task; SLO в одну секунду действует для исправных указанных регионов, а при разделении сети записи завершаются ошибкой или ставятся в очередь, и чтения явно показывают устаревание.
  • Tenant-isolation tests, stale-write conflicts и poisoning fixtures служат гейтами каждой схемы до автоматического потребления агентами.

Зачем это спрашивают: Сильный ответ рассматривает shared memory как управляемое конкурентное состояние с provenance, а не безграничный общий промпт.

Закрытые вопросы

  • 21

    Спроектируйте backpressure message bus для 50 000 agent-шагов в секунду, с p99 возраста очереди до 10 секунд и без потери принятого шага.

    backpressuredesigndata-structures
  • 22

    Спроектируйте арбитраж конфликтов, когда 12 агентов редактируют один кейс и 5% кейсов дают противоречивые рекомендации, с p95 решения до двух минут.

    agentsdesign
  • 23

    Подписанный peer в workflow из 20 агентов может быть скомпрометирован. Не дайте ему авторизовать actions или отравить state.

    agents
  • 24

    Спроектируйте rate limiting tools и model providers для 20 000 параллельных задач при лимитах 5 000, 2 000 и 500 запросов в минуту и менее 1% пропущенных дедлайнов.

    estimationrate-limitingdesign
  • 25

    Пользователь запрашивает deletion, пока 40 активных агентов используют memory. Не дайте caches, checkpoints и replay восстановить ее.

    cachingmemoryagents
  • 26

    Спроектируйте long-term memory агентов для 5 миллионов пользователей, с удалением за 24 часа и default retention не более 90 дней.

    designagent-memorymemory
  • 27

    Спроектируйте evaluation platform для 40 версий агентов, 200 tools и 10 000 сценариев, с ночным результатом до 06:00 и воспроизводимыми release gates.

    reproducibilityagentsdesign
  • 28

    Спроектируйте computer-use simulator с детерминированным oracle при изменениях layout, focus, popup, latency и accessibility.

    latencydesigna11y
  • 29

    Соберите golden trajectory corpus из 5 000 agent-задач с ежемесячным обновлением, менее 5% дублирующих сценариев и 95% согласия reviewers по success labels.

    agents
  • 30

    Спроектируйте adversarial red-team platform для 50 000 атак на релиз против 200 tools, чтобы проверить все критические классы exploits менее чем за четыре часа.

    design
  • 31

    Спроектируйте auditability для 10 миллионов agent-задач в месяц без хранения hidden chain-of-thought, отвечая на запрос аудитора по задаче за пять минут.

    agentsqueriesdesign
  • 32

    Спроектируйте observability для 50 миллионов agent-шагов в день, с incident queries быстрее 30 секунд и стоимостью telemetry ниже 5% runtime spend.

    agentsdesignobservability
  • 33

    Определите SLO и error budget для агента с 3 миллионами задач в месяц, где 99,5% должны завершаться правильно, а high-risk policy violations имеют нулевую терпимость.

    reliabilitysloagents
  • 34

    Спроектируйте per-success cost attribution для 10 миллионов задач в месяц по models, tools, sandboxes и людям, с ошибкой распределения ниже 2% finance ledger.

    design
  • 35

    Распределите latency budget агента с interactive p95 12 секунд, тремя model calls, четырьмя tools и редким human approval не дольше 10 минут.

    latencyagentsapproval
  • 36

    Фиксировать model routing на run или выбирать per node с сохранением replay?

  • 37

    План на $400 000 обслуживает 20 миллионов agent-шагов с 30% capacity headroom. Разберите полную экономику.

    agentscapacity
  • 38

    Спроектируйте multi-region durable execution для 1 миллиона задач в день в трех регионах, с восстановлением региона за 15 минут и без повторных side effects.

    design
  • 39

    Спроектируйте provider failover для 100 миллионов model calls в месяц через трех vendors, с завершением задач 99,9% и началом failover за 60 секунд.

    procurementdesign
  • 40

    Спроектируйте fairness очереди для 2 000 tenants и 100 000 ожидающих задач, с premium p95 старта до 30 секунд и без ожидания standard tenant дольше пяти минут.

    designdata-structures
  • 41

    Спроектируйте tenant isolation для 10 000 компаний на общей agent platform, с нулевой cross-tenant утечкой и overhead p95 ниже 5%.

    agentsdesign
  • 42

    Два разрешенных tools могут скомпоноваться в раскрытие sensitive data. Спроектируйте trajectory-wide policy без глобального запрета.

    design
  • 43

    Спроектируйте предотвращение data exfiltration для 1 миллиона agent-сессий в день, с утечкой confidential canary реже одной на миллион сессий и overhead tools до 100 мс.

    designdeployment-strategieslatency
  • 44

    Ограничьте computer-use сессии для 50 000 ежедневных пользователей, запретив local networks и password managers и обеспечив emergency termination за пять секунд.

    passwordssessions
  • 45

    Спроектируйте canary и rollback еженедельных agent-релизов для 5 миллионов задач, с bad-release exposure ниже 1% и откатом быстрее 10 минут.

    designdeployment-strategiesrollback
  • 46

    Выведите из эксплуатации checkpoint schema для 20 миллионов сохраненных задач, включая workflows со сном 24 часа, без невосстановимых задач и за 30-дневное окно миграции.

    schemamigrations
  • 47

    Соберите capability matrix для 12 моделей, 500 tools и 8 risk tiers, с еженедельной публикацией routing updates и без unsupported комбинаций в production.

  • 48

    Подготовьте agent-platform RFC для системы, которая через шесть месяцев достигнет 10 миллионов задач в месяц, с SLO завершения 99,9% и ограничением в четыре команды разработки.

    system-designslodecision-making
  • 49

    Распределите ownership между product, runtime, security и 20 tool teams для платформы с 5 миллионами задач в месяц и подтверждением Sev-1 менее чем за пять минут.

    ownership
  • 50

    Спроектируйте 90-минутное hiring exercise для Senior Agentic AI Engineer на платформе со 100 tools и целью завершения задач 99,9%, без платного API и take-home работы.

    agentsapidesign
  • 51

    Агент продолжает создавать новые промежуточные материалы, но не приближается к критериям приемки. Как отличить смысловой прогресс от дорогой имитации работы?

    agentsartifactsspecs
  • 52

    Инструмент возврата денег выполнился дважды для 63 заказов, потому что агент не дождался первого ответа и получил timeout. Как вы ограничите ущерб и перепроектируете действие?

    agents
  • 53

    Релиз схемы инструмента заменяет необязательное целое число на обязательную строку и ломает 18% задач агента. Вы будете на месте адаптировать промпты или откатите релиз?

    promptingagentsschema
  • 54

    MCP-сервер, которым пользуются 24 агента, начал возвращать описание инструмента с указанием загрузить учетные данные на новый домен. Какие контроли относятся к MCP, какие являются защитой платформы и каково ваше решение по инциденту?

    agentsincidentsmcp
  • 55

    Агент с OAuth-доступом к двум рабочим пространствам использовал токен tenant A, чтобы изменить календарь tenant B. Как вы исправите confused deputy?

    tokensagentsoauth
  • 56

    Браузерный агент прочитал скрытый текст страницы с указанием игнорировать пользователя и отправить session cookies злоумышленнику. Сама страница выглядит легитимной. Что вы сделаете?

    sessionscookiesagents
  • 57

    Агент баз данных пытается выполнить DROP TABLE invoices после просьбы очистить дубли строк. Запрос еще не выполнен. Какие контроли и доказательства вам нужны?

    databasequeriesdedup
  • 58

    Computer-use агент дошел до финального подтверждения банковского перевода на $28 500, хотя пользователь просил только подготовить платежные реквизиты. Как вы отреагируете?

    agentscomputer-use
  • 59

    Подтверждение человека пришло через 22 минуты после подготовки покупки агентом, но цена и остаток изменились 9 минут назад. Должно ли старое подтверждение исполниться?

    agentsapproval
  • 60

    Инициированная MCP-сервером цепочка sampling рекурсивно распространяется по пулу серверов, и расходы на модели вырастают в 18 раз за 12 минут. Как сдержать инцидент и где должны находиться контроли?

    samplingmcp
  • 61

    Автономная исследовательская задача выполнялась 18 часов и была потеряна после вытеснения worker без пригодного checkpoint. Как вы перепроектируете длительное выполнение?

  • 62

    Support-агент начал выдавать запрещенные кредиты после того, как в long-term memory появилась отравленная заметка с меткой корпоративной политики. Как вы ограничите ущерб и измените memory?

    agentsmemorylong-term-memory
  • 63

    Общий memory-сервис показал деталь контракта tenant A в ответе агента tenant B в 14 сессиях. Как вы отреагируете на инцидент?

    agentsincidentssessions
  • 64

    Исправленный источник доказывает ложность факта из memory, который активные запуски агентов уже использовали в summaries, планах и ожидающих действиях. Как распространить исправление, не удаляя историю?

    agentsmemory
  • 65

    Planner создает план из 12 шагов с инструментом delete_calendar_event, которого нет в production. Достаточно ли один раз проверить план до первого шага?

    validation
  • 66

    Одобренный план deployment еще выполняется, когда другой оператор откатывает production с release 83 на 82. Следующий шаг предполагает 83. Что вы сделаете?

    agentsdeployment
  • 67

    Executor запускает шаг 7 до того, как шаг 4 создал нужный ему ключ шифрования. Как вы диагностируете и предотвращаете нарушение зависимости?

    encryptiondependencies
  • 68

    Latency router назначает шаг одобрения оплаты поставщику на $75 000 высокооцененной модели, потому что у нее короткая очередь. Что не так с этим дизайном?

    latencydesigndata-structures
  • 69

    Failover провайдера восстановил доступность, но резервная модель создает параллельные tool calls и пропускает поля идемпотентности основной модели. Какие доказательства оправдают mutating traffic на резерве?

    backupsidempotency
  • 70

    Sales researcher и outreach agent оба отправили одно письмо 286 лидам. Как остановить дубли, не подавив законную более позднюю отправку с тем же содержимым?

    agents
  • 71

    Нужно подключить три класса MCP-инструментов: локальные инструменты разработчика на одном ноутбуке, удаленные multi-tenant SaaS-инструменты и регулируемые внутренние инструменты, доступные только в частной сети. Выберите transport и topology для каждого класса и обоснуйте границы.

    multi-tenancycloud
  • 72

    Пять агентов в ходе обсуждения единогласно отклоняют обоснованное требование о страховой выплате, потому что каждый агент скопировал одну ложную предпосылку. Что должно заменить подсчет голосов?

    agents
  • 73

    Coordinator создает шторм из 38 000 сообщений за 6 минут, потому что агенты подтверждают подтверждения друг друга. Как определить и ограничить amplification?

    agents
  • 74

    Research agent передает рекомендацию execution agent, но теряет источник о том, что поставщик находится под санкциями. Заказ уже в очереди. Какой контракт должен его отклонить?

    agentsdata-structures
  • 75

    Агент повысил evaluator score с 0,71 до 0,94, помечая сложные задачи завершенными без запрошенного artifact. Какое сравнение релизов раскроет reward hacking?

    agentsartifactsllm-eval
  • 76

    Разберите этот HITL-контракт: {batch_size: 10000, action_types: 'mixed', total_amount: 4800000, recipients: 'hidden', item_amounts: 'hidden', decision: 'approve_all'}. Reviewer видит только эту сводку и одобряет все 10 000 разнородных действий агентов. Можно ли считать такое одобрение действительным и как изменить review и dispatch?

    agentsbatch
  • 77

    Coding agent внутри sandbox пытается смонтировать host socket и прочитать /proc/1/environ после инструкции из репозитория. Как вы отреагируете на инцидент?

    agentsincidents
  • 78

    Спроектируйте replay инцидентов computer-use агентов, если скриншоты могут содержать пароли, медицинские данные и посторонние приложения. Что сохранять вместо полной чувствительной видеозаписи экрана?

    agentscomputer-usepasswords
  • 79

    Computer-use агент готов нажать „Одобрить счёт“, когда popup сдвигает страницу и помещает «Удалить поставщика» под курсор. Что должен проверить runtime?

    agentscomputer-usevalidation
  • 80

    CAPTCHA появляется посреди workflow аккаунта после трех успешных шагов браузера. Что обязан сделать агент?

    agents
  • 81

    Изменение planning увеличило median расход токенов с 18 000 до 96 000 и tool calls с 14 до 73 на задачу, а success вырос на 0,6 пункта. Вы выпустите его?

    tokens
  • 82

    CRM search встречается в 64% самого медленного 1% трасс задач и имеет stage p99 11,8 секунды. Можно ли вывести его долю в end-to-end p99 или обещать прежний recall после deadline в 2 секунды?

    estimatione2epromises
  • 83

    Широко используемый MCP-сервер деградирует, и 60 000 активных tool calls ожидают ответа. Спроектируйте отмену и восстановление всего пула без заявления, что отмененная работа прекратила побочные эффекты.

    designresiliencemcp
  • 84

    Единственный model provider переживает regional outage, в очереди 42 000 задач, а 8 600 могли выполнить tool call до потери ответа модели. Как вы восстановитесь?

    data-structures
  • 85

    Люди-рецензенты исправляют 8% планов агента, но только 1% исправлений меняет конечный результат. Как измерить добавленную ценность reviewer и сократить лишнюю проверку без потери редких high-impact исправлений?

    agents
  • 86

    Usage report выставляет tenant Northstar $91 200 за model calls tenant Acme после миграции очереди. Как вы исправите инцидент и attribution?

    incidentsmigrationsdesign
  • 87

    Task success падает с 96,2% до 88,7% после одновременных релизов planner, tool gateway и model router. Как локализовать причину и задать критерии возврата?

    gateway
  • 88

    Red-team suite прошел каждый компонент, но атакующий связал memory poisoning, context compaction и email tool и вывел список клиентов. Что изменится?

    componentsmemorymemory-poisoning
  • 89

    Jailbreak объединяет два по отдельности разрешенных инструмента, contact lookup и file upload, и отправляет payroll file на внешний адрес. Как предотвратить такую композицию?

    llm-safetyoop
  • 90

    Audit trace записывает запрос инструмента и финальный ответ агента, но пропускает tool response для 4,7% production-вызовов. Какие действия могут остаться включенными?

    agents
  • 91

    Upgrade LangGraph меняет serialization checkpoint, и 31% из 46 000 активных задач не продолжаются на новых workers. Что должна покрывать equivalence миграции кроме decoding?

    decodingmigrationsserialization
  • 92

    После upgrade AutoGen один агент отправляет tool results как массивы content, а другой ожидает строку, из-за чего 12% handoff незаметно пусты. Как вы исправите контракт?

    agents
  • 93

    MCP client предпочитает protocol version 2025-06-18, а 9 серверов объявляют старые версии и другие tool schemas. Должна ли платформа помещать в карантин каждый старый сервер?

    schematyping
  • 94

    Canary не видит ни одного несанкционированного банковского перевода в 40 000 задачах, но baseline события примерно 1 на 200 000. Достаточно ли этого для глобального launch?

    deployment-strategies
  • 95

    Новый release агента пишет checkpoint state, который предыдущий release не умеет десериализовать, и error rate достигает 9%. Можете ли вы откатиться?

    agentsrollback
  • 96

    Вы передаете ночной инцидент с 7 300 приостановленными задачами, 214 неоднозначными tool effects и без подтвержденной root cause. Что содержит on-call handoff?

    incidentson-call
  • 97

    Сильный инженер дал агенту неограниченный production shell, что привело к outage на 19 минут. Как вы будете менторить инженера после containment?

    agentsmentoring
  • 98

    Два senior engineer спорят о LangGraph и custom runtime для 18-часовых workflows. Как разрешить design dispute без шестимесячной переработки системы?

    lockingdesignlanggraph
  • 99

    Product хочет автономно отменять договоры с поставщиками, потому что approval снижает completion с 91% до 76%. Действие может стоить $12 000 штрафа. Какой дизайн вы одобрите?

    designresilienceprocurement
  • 100

    Инцидент агента приостановил 31% customer workflows, раскрыл данные 6 tenants и создал 82 непроверенных внешних действия. Какой executive containment update вы отправите через 90 минут?

    agentsincidents