Вопросы на собеседовании: Agentic AI Engineer
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Senior.
Смотреть пример резюме: Agentic AI Engineer →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Я бы сделал состояние задач долговечным, а выполнение моделей и инструментов вынес в заменяемые идемпотентные воркеры.
- 10 миллионов задач в месяц дают в среднем 3,9 задачи в секунду, поэтому мощность я проверял бы на измеренном часовом пике с двукратным запасом, а не по среднему.
- Workflow engine хранит попытки, дедлайны, бюджеты, аренды и типизированные события; чтения можно повторять, а побочные эффекты требуют ключей идемпотентности.
- Задача считается принятой только после проверки identity и начальной политики, резервирования квоты и дедлайна и кворумного подтверждения долговечного события; предложенная, отклоненная и принятая нагрузка показываются отдельно.
- Каждая долговечно принятая задача остается в знаменателе завершения, поэтому последующий отказ политики, деградация или исчерпание ресурсов считаются незавершением; отмены пользователя следуют одному заранее объявленному и отдельно показываемому правилу.
Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат превратить автономность агентов в долговечное выполнение, ограниченные повторы и измеримую мощность.
Я бы разделил рекомендацию и исполнение, поставив детерминированный сервис транзакций за жесткой границей авторизации.
- Агент создает типизированное намерение перевода, а сервис заново проверяет получателя, сумму, валюту, лимиты, санкционный результат и владельца счета по свежим данным.
- Переводу нужны уникальный ключ идемпотентности и подписанное одобрение, привязанное к хешу точного намерения; изменение любого поля отменяет одобрение.
- Двойной контроль включается выше порога риска, выведенного из потерь от мошенничества и требований регулятора; новый получатель всегда требует внешнего подтверждения.
- Сверка сопоставляет банковские подтверждения с ledger побочных эффектов, а неопределенный исход уходит на ручное расследование, не в автоматический повтор.
Зачем это спрашивают: Сильный ответ не дает модели напрямую распоряжаться необратимыми переводами и безопасно обрабатывает неопределенные исходы.
Я бы предоставил агенту целевые бизнес-возможности вместо разрешения компоновать сырые API всех 20 систем.
- Tool gateway унифицирует identity, схемы, таймауты, идемпотентность и квитанции, сохраняя раздельными поиск и изменяющие операции.
- Агент автоматически выполняет обратимые чтения и черновики; возвраты, отмены и изменения прав проходят детерминированные предусловия и одобрение по риску.
- Знаменатель возможностей изменения включает каждое намерение изменить аккаунт, дошедшее до детерминированной границы решения, включая воздержания и отказы; онлайн-квитанции дают предварительные метки, а отложенная проверка провайдером или человеком делает их окончательными.
- Продвижение требует, чтобы односторонняя верхняя 95% доверительная граница ошибочных изменений была ниже 0,1% в целом и по существенным срезам риска после созревания меток; ожидающие и пересмотренные production-метки явно показываются рядом с SLO 10 минут.
Зачем это спрашивают: Интервьюер проверяет наличие стабильных контрактов возможностей, состояния и контроля изменений у агента с множеством инструментов.
Я бы создавал для каждой задачи временное workspace в границах репозитория, а тесты и доказательства ревью сделал обязательными результатами.
- Manifest фиксирует commit SHA, build image, кеши зависимостей, сетевую политику, учетные данные и разрешенные пути; ключи кеша включают tenant и репозиторий.
- Индекс обновляется по коммитам, но код и символы фильтруются до сборки контекста модели по разрешенному набору репозиториев.
- Агент выполняет ограниченные циклы правки и теста, публикует патч и квитанции команд, но не может merge или push без отдельного права репозитория.
- Тест мощности на 650 разноязычных задачах измеряет очередь, запуск sandbox, тесты, приемку патча и утечки относительно SLO 20 минут.
Зачем это спрашивают: Сильный ответ объединяет изоляцию репозитория, воспроизводимое выполнение, ограниченные полномочия и доказательства качества патча.
Я бы расширял rollout по возможностям и уровням риска, а не выдавал неограниченное управление компьютером случайному проценту пользователей.
- На первой неделе сотрудники выполняют read-only задачи в браузере; затем когорты получают формы и обратимые записи, а платежи и настройки безопасности остаются закрытыми.
- Удаленный policy service ограничивает домены, UI-действия, загрузки, буфер обмена и credentials, а запись сессии хранит скриншоты и квитанции действий.
- При нуле тяжелых событий для односторонней верхней 95% границы ниже 1 на 100 000 нужно примерно 300 000 репрезентативных независимых сессий; срезы и зависимость увеличивают требуемую эффективную выборку, поэтому детерминированные тесты запрещенных действий остаются отдельными гейтами.
- Серверный kill switch отзывает manifest возможностей и останавливает активные сессии за 15 минут, что проверяется на каждом этапе rollout.
Зачем это спрашивают: Интервьюер оценивает, следуют ли гейты rollout риску возможностей и статистически значимым данным.
Я бы отделил discovery и governance MCP от data plane, который вызывает каждый tool server.
- Подписанный каталог хранит identity сервера, схемы, владельца, scopes, классы данных, уровень риска и версии совместимости; агент видит только разрешенный набор.
- Gateway применяет аутентификацию, политику, квоты, дедлайны и trace propagation, не скрывая семантику ошибок MCP.
- Собственный подписанный каталог использует кешированные снимки и отдельный канал срочных запретов; привилегированная маршрутизация запрещается, если нельзя подтвердить подпись, корректность часов, работоспособность канала запретов или допустимый максимальный возраст пакета.
- 650 tools дают 30% сверх текущих 500 для прогнозного роста и перекрытия версий; бюджет 40 мс оставляет измеренный сетевой запас.
Зачем это спрашивают: Сильный ответ масштабирует MCP через управляемый каталог и тонкий invocation plane, а не через безграничный список инструментов в промпте.
Я бы сделал каждую опубликованную версию инструмента неизменяемой и требовал явную декларацию совместимости до продвижения alias.
- Registry хранит JSON Schema входа и выхода, класс побочного эффекта, auth scopes, таймаут, владельца, дату deprecation и digest реализации.
- Contract-тесты повторяют характерные вызовы на старой и новой версиях; удаление поля или смена семантики требует major-версии и миграции потребителей.
- Агент закрепляет snapshot registry на задачу, чтобы 24-часовой workflow не получил другую схему посередине выполнения.
- Откат переводит подписанный alias на прошлую проверенную версию, а ежедневный деплой разрешается только после drill восстановления за 10 минут.
Зачем это спрашивают: Интервьюер проверяет, остаются ли изменения инструментов неизменяемыми, проверенными на совместимость и безопасными для активных агентов.
Runtime получает внутренний capability handle на один вызов; provider OAuth tokens остаются на сервере с TTL и audience провайдера.
- Runtime агента получает непрозрачный grant handle, но не refresh token; broker проверяет пользователя, tenant, consent, scopes, audience и намерение вызова.
- Incremental consent запрашивает узкий scope по необходимости, а рискованное действие привязывает свежее подтверждение к хешу нормализованного вызова.
- Gateway проверяет resource, tenant, audience и replay; провайдер обязан поддерживать exchange или revocation за пять минут, иначе delegated actions закрываются.
- Тесты cross-audience, replay, просроченного consent и confused deputy служат релизными гейтами для всех 12 интеграций.
Зачем это спрашивают: Сильный ответ сохраняет полномочия пользователя через узкое отзываемое делегирование, не передавая модели долгоживущие OAuth-токены.
Я бы поставил детерминированную проверку политики на каждую границу инструмента и распространял подписанные пакеты для локального вычисления.
- Входы включают principal, tenant, версию агента, инструмент, нормализованные аргументы, класс данных, уровень риска и прошлые одобрения.
- Критические пакеты политик имеют TTL 60 секунд и отдельный канал срочных запретов; только низкорисковые чтения могут использовать заранее объявленный более долгий TTL последней заведомо исправной версии.
- При отсутствии identity, устаревшей критической политике или неизвестном действии система запрещает вызов; низкорисковые чтения могут ограниченно использовать последнюю заведомо исправную версию.
- После истечения срока актуальности критические решения считаются недоступными; доступность нужно отдельно считать для свежих критических политик и классов, которым разрешена последняя исправная версия.
Зачем это спрашивают: Интервьюер оценивает, является ли политика централизованной по смыслу, но отказоустойчивой и неизбежной при исполнении.
Я бы обменивал подтвержденную workload identity и одобренное намерение на короткоживущие credentials на границе инструмента.
- Строгие разрешительные схемы отклоняют значения с секретами до сериализации промпта, события или trace; модель и телеметрия получают только непрозрачные grant handles, ID и reason codes.
- Региональные stateless brokers проверяют tenant, инструмент, scope, политику, аренду задачи и состояние отзыва, затем вводят ограниченные аудиторией и одной задачей credentials прямо в защищенный канал адаптера.
- Размещённые рядом снимки политик и региональные подписывающие сервисы на базе HSM обеспечивают p95 ниже 100 мс в указанных исправных регионах от аутентифицированного запроса до получения адаптером.
- Если broker, подписывающий сервис, свежесть политики или проверка отзыва недоступны, выдача и погашение запрещаются; canary scanners остаются дополнительной защитой, а не гарантией отсутствия открытых секретов.
Зачем это спрашивают: Сильный ответ убирает секреты из видимого модели состояния, сохраняя быстрый, атрибутируемый доступ с минимальными правами.
Я бы использовал одноразовые microVM с отдельными профилями для исполнения кода и работы браузера.
- Каждый запуск получает свежую границу ядра, read-only base image, лимиты CPU и памяти, временный диск, отсутствие host sockets и default-deny egress proxy.
- Browser-сессии изолируют профиль, downloads, clipboard, extensions и доступ к локальной сети; code-сессии монтируют только объявленные входы и каталог результата.
- Images и browser builds закреплены по digest, сканируются и меняются, а события syscall, DNS, файлов и процессов поступают в containment alerts.
- Запуск быстрее двух секунд проверяется на warm pools, но escape-тесты и tenant-crossing probes важнее цели latency.
Зачем это спрашивают: Интервьюер проверяет, выполняются ли враждебные результаты инструментов и сгенерированный код за реальной границей изоляции с лимитами ресурсов.
Сохраняйте недетерминированные результаты как workflow events.
- Completed node хранит normalized input, manifest, model output, provider metadata и validation; replay потребляет его без нового вызова модели.
- Только отсутствие terminal event создает новую attempt, а неоднозначные effects сначала требуют provider idempotency или reconciliation.
- Детерминированные migrators могут менять форму старого state, но не записанное решение.
Зачем это спрашивают: Сильный ответ отделяет детерминированный replay от намеренно нового inference.
Я бы использовал append-only event log как источник истины, а периодические типизированные snapshots только для ускорения replay.
- События содержат task, sequence, версию схемы, command ID, actor, timestamps и hashes; optimistic sequence checks предотвращают split-brain writers.
- Событие считается принятым после локальной кворумной записи, а задержка межрегиональной репликации жестко ограничена 30 секундами; прием останавливается, если границу нельзя удержать, что задает RPO не более 30 секунд.
- Snapshots создаются по измеренному порогу стоимости replay, сначала каждые 200 событий, а крупные artifacts используют content-addressed ссылки; ни частота snapshots, ни копирование artifacts не задают RPO.
- Recovery drills восстанавливают выборку длинных задач на свежей инфраструктуре и отдельно измеряют потерю подтвержденных событий и время replay, которое должно оставаться ниже пяти минут.
Зачем это спрашивают: Интервьюер оценивает, ускоряют ли checkpoints полную упорядоченную историю событий, а не заменяют ее.
Я бы назначал каждому планируемому эффекту стабильную identity до вызова внешней системы.
- Ledger хранит хеш нормализованного намерения, tenant, principal, версию tool, approval, ключ идемпотентности, попытку, статус и receipt провайдера.
- Состояния различают prepared, dispatched, confirmed, rejected и unknown; неизвестный исход блокирует повтор, пока точная сверка с провайдером не разрешит его.
- Outbox закрывает атомарность между базой данных и очередью, но не между базой и сторонней системой; денежное, коммуникационное или data-изменение допустимо только при нативной идемпотентности провайдера или точной сверке чтением после записи по стабильному бизнес-ключу.
- Частота дублей измеряется по семантическому эффекту среди всех покрытых изменений, а не по HTTP-попыткам; провайдеры без обоих механизмов не могут выполнять ни один покрытый эффект.
Зачем это спрашивают: Сильный ответ превращает внешние изменения в явные атрибутируемые state machines и осторожно обрабатывает неясный исход.
Считайте override ограниченным и истекающим policy artifact.
- Свяжите reviewer, case, intent hash, отклоненное правило, rationale, лимит effect, expiry и второе approval; dispatch заново проверяет state.
- Аудируйте исходное решение и outcome; новые arguments требуют reapproval.
- Training хранит его как исключение до независимого adjudication изменения правила владельцами policy.
Зачем это спрашивают: Сильный ответ управляет исключениями человека без тихого изменения policy.
Я бы потребовал от каждого изменяющего tool объявить прямой эффект, поведение идемпотентности, класс обратимости и проверенную компенсацию.
- Полностью обратимые вызовы дают версионируемую undo-команду; условно обратимые указывают срок и предусловия; необратимые требуют approval до отправки.
- Saga записывает завершенные эффекты и выполняет компенсации в обратном порядке зависимостей, каждая со своим idempotency key и receipt.
- Сбой компенсации ставит workflow на паузу и вызывает owning team, а не просит модель импровизировать новое изменение.
- Гейт восстановления 30 минут применяется только к цепочкам tools, чье худшее время компенсации прошло fault-injection tests.
Зачем это спрашивают: Сильный ответ превращает обещание rollback в явные контракты tools и проверенное поведение saga.
Я бы считал сгенерированный код недоверенным предложением, которое может запросить проверку, но не может само себя опубликовать или авторизовать.
- Для каждого предложения записываются исходный код, создавшие его агент и задача, происхождение входных данных, воспроизводимая сборка, схемы, запрошенные права, классы данных, сетевые назначения, класс побочных эффектов, владелец и срок действия; изолированная сборка создает digest артефакта.
- Автоматические тесты и независимый reviewer одобряют точный digest и manifest возможностей; registry и broker учетных данных принимают подписи только от субъектов, недоступных предложившему инструмент агенту.
- Подписанный артефакт работает в sandbox с запретом по умолчанию, а каждый вызов проходит через policy gateway с учетными данными в границах задачи; по истечении срока временный alias удаляется, а активные задачи остаются привязаны к проверяемой версии.
- p95 активации измеряется от окончательного одобрения до появления в каталоге, без времени review; срочный запрет отзывает маршрутизацию и новые учетные данные за пять минут, а откат возвращает предыдущий подписанный артефакт, сохраняя квитанции предложения, проверки и исполнения.
Зачем это спрашивают: Интервьюер оценивает, есть ли у рекурсивного создания инструментов независимая цепочка полномочий, ограниченное исполнение, происхождение, срок действия и операционный откат.
Я бы представил задачу milestones, которые раскрываются в малые исполняемые подпланы только после готовности предусловий.
- Верхний уровень хранит цели, acceptance tests, бюджеты и зависимости; leaf plans содержат примерно 5-10 шагов, чтобы сбой не обесценивал 100 решений.
- Каждый завершенный leaf записывает structured findings, provenance и открытые вопросы в durable state вместо добавления сырой истории.
- Детерминированный packer упорядочивает доказательства по объявленному приоритету, удаляет дубли и считает system text, user input, summaries, найденные доказательства, выбранные tool schemas и резерв output tokens в жестком лимите 32 000 токенов для каждого вызова.
- Ветви critical path работают параллельно только в общих лимитах tools, tokens и двух часов; если вызов нельзя упаковать без удаления обязательных доказательств или резерва ответа, validation завершается ошибкой вместо неявного обрезания.
Зачем это спрашивают: Сильный ответ сдерживает отклонение длинного плана через декомпозицию, долговечные доказательства и явное расписание зависимостей.
Я бы использовал supervisor над ограниченными capability специалистами, а не полностью связанную беседу 30 агентов.
- Router выбирает лишь несколько ролей, обоснованных типом кейса; у каждой свои tools, data scope, output schema и budget.
- Специалисты обмениваются подписанными artifacts через workflow state, не свободными peer messages, что ограничивает рост промпта и подделку полномочий.
- Action service выводит approver и executor из разных principals с непересекающимися grants, отклоняет одного principal или владельца credentials в обеих позициях и не позволяет supervisor переназначать credentials или создавать право approval.
- Replay tests измеряют точность routing, число handoffs, latency, conflicts и попытки обойти разделение обязанностей до добавления роли.
Зачем это спрашивают: Интервьюер проверяет, снижает ли multi-agent специализация сложность, не создавая неконтролируемые полномочия и коммуникацию.
Я бы сделал blackboard типизированным tenant-partitioned состоянием workflow, а не общим документом на естественном языке.
- Записи объявляют owner, schema, task scope, provenance, version, expiry и read-write capability; авторизация идет до query или subscription.
- Compare-and-swap версии не дают агентам тихо перезаписывать друг друга, а append-only findings сохраняют конкурирующие гипотезы.
- Порядок гарантируется внутри раздела tenant-task; SLO в одну секунду действует для исправных указанных регионов, а при разделении сети записи завершаются ошибкой или ставятся в очередь, и чтения явно показывают устаревание.
- Tenant-isolation tests, stale-write conflicts и poisoning fixtures служат гейтами каждой схемы до автоматического потребления агентами.
Зачем это спрашивают: Сильный ответ рассматривает shared memory как управляемое конкурентное состояние с provenance, а не безграничный общий промпт.
Закрытые вопросы
- 21
Спроектируйте backpressure message bus для 50 000 agent-шагов в секунду, с p99 возраста очереди до 10 секунд и без потери принятого шага.
backpressuredesigndata-structures - 22
Спроектируйте арбитраж конфликтов, когда 12 агентов редактируют один кейс и 5% кейсов дают противоречивые рекомендации, с p95 решения до двух минут.
agentsdesign - 23
Подписанный peer в workflow из 20 агентов может быть скомпрометирован. Не дайте ему авторизовать actions или отравить state.
agents - 24
Спроектируйте rate limiting tools и model providers для 20 000 параллельных задач при лимитах 5 000, 2 000 и 500 запросов в минуту и менее 1% пропущенных дедлайнов.
estimationrate-limitingdesign - 25
Пользователь запрашивает deletion, пока 40 активных агентов используют memory. Не дайте caches, checkpoints и replay восстановить ее.
cachingmemoryagents - 26
Спроектируйте long-term memory агентов для 5 миллионов пользователей, с удалением за 24 часа и default retention не более 90 дней.
designagent-memorymemory - 27
Спроектируйте evaluation platform для 40 версий агентов, 200 tools и 10 000 сценариев, с ночным результатом до 06:00 и воспроизводимыми release gates.
reproducibilityagentsdesign - 28
Спроектируйте computer-use simulator с детерминированным oracle при изменениях layout, focus, popup, latency и accessibility.
latencydesigna11y - 29
Соберите golden trajectory corpus из 5 000 agent-задач с ежемесячным обновлением, менее 5% дублирующих сценариев и 95% согласия reviewers по success labels.
agents - 30
Спроектируйте adversarial red-team platform для 50 000 атак на релиз против 200 tools, чтобы проверить все критические классы exploits менее чем за четыре часа.
design - 31
Спроектируйте auditability для 10 миллионов agent-задач в месяц без хранения hidden chain-of-thought, отвечая на запрос аудитора по задаче за пять минут.
agentsqueriesdesign - 32
Спроектируйте observability для 50 миллионов agent-шагов в день, с incident queries быстрее 30 секунд и стоимостью telemetry ниже 5% runtime spend.
agentsdesignobservability - 33
Определите SLO и error budget для агента с 3 миллионами задач в месяц, где 99,5% должны завершаться правильно, а high-risk policy violations имеют нулевую терпимость.
reliabilitysloagents - 34
Спроектируйте per-success cost attribution для 10 миллионов задач в месяц по models, tools, sandboxes и людям, с ошибкой распределения ниже 2% finance ledger.
design - 35
Распределите latency budget агента с interactive p95 12 секунд, тремя model calls, четырьмя tools и редким human approval не дольше 10 минут.
latencyagentsapproval - 36
Фиксировать model routing на run или выбирать per node с сохранением replay?
- 37
План на $400 000 обслуживает 20 миллионов agent-шагов с 30% capacity headroom. Разберите полную экономику.
agentscapacity - 38
Спроектируйте multi-region durable execution для 1 миллиона задач в день в трех регионах, с восстановлением региона за 15 минут и без повторных side effects.
design - 39
Спроектируйте provider failover для 100 миллионов model calls в месяц через трех vendors, с завершением задач 99,9% и началом failover за 60 секунд.
procurementdesign - 40
Спроектируйте fairness очереди для 2 000 tenants и 100 000 ожидающих задач, с premium p95 старта до 30 секунд и без ожидания standard tenant дольше пяти минут.
designdata-structures - 41
Спроектируйте tenant isolation для 10 000 компаний на общей agent platform, с нулевой cross-tenant утечкой и overhead p95 ниже 5%.
agentsdesign - 42
Два разрешенных tools могут скомпоноваться в раскрытие sensitive data. Спроектируйте trajectory-wide policy без глобального запрета.
design - 43
Спроектируйте предотвращение data exfiltration для 1 миллиона agent-сессий в день, с утечкой confidential canary реже одной на миллион сессий и overhead tools до 100 мс.
designdeployment-strategieslatency - 44
Ограничьте computer-use сессии для 50 000 ежедневных пользователей, запретив local networks и password managers и обеспечив emergency termination за пять секунд.
passwordssessions - 45
Спроектируйте canary и rollback еженедельных agent-релизов для 5 миллионов задач, с bad-release exposure ниже 1% и откатом быстрее 10 минут.
designdeployment-strategiesrollback - 46
Выведите из эксплуатации checkpoint schema для 20 миллионов сохраненных задач, включая workflows со сном 24 часа, без невосстановимых задач и за 30-дневное окно миграции.
schemamigrations - 47
Соберите capability matrix для 12 моделей, 500 tools и 8 risk tiers, с еженедельной публикацией routing updates и без unsupported комбинаций в production.
- 48
Подготовьте agent-platform RFC для системы, которая через шесть месяцев достигнет 10 миллионов задач в месяц, с SLO завершения 99,9% и ограничением в четыре команды разработки.
system-designslodecision-making - 49
Распределите ownership между product, runtime, security и 20 tool teams для платформы с 5 миллионами задач в месяц и подтверждением Sev-1 менее чем за пять минут.
ownership - 50
Спроектируйте 90-минутное hiring exercise для Senior Agentic AI Engineer на платформе со 100 tools и целью завершения задач 99,9%, без платного API и take-home работы.
agentsapidesign - 51
Агент продолжает создавать новые промежуточные материалы, но не приближается к критериям приемки. Как отличить смысловой прогресс от дорогой имитации работы?
agentsartifactsspecs - 52
Инструмент возврата денег выполнился дважды для 63 заказов, потому что агент не дождался первого ответа и получил timeout. Как вы ограничите ущерб и перепроектируете действие?
agents - 53
Релиз схемы инструмента заменяет необязательное целое число на обязательную строку и ломает 18% задач агента. Вы будете на месте адаптировать промпты или откатите релиз?
promptingagentsschema - 54
MCP-сервер, которым пользуются 24 агента, начал возвращать описание инструмента с указанием загрузить учетные данные на новый домен. Какие контроли относятся к MCP, какие являются защитой платформы и каково ваше решение по инциденту?
agentsincidentsmcp - 55
Агент с OAuth-доступом к двум рабочим пространствам использовал токен tenant A, чтобы изменить календарь tenant B. Как вы исправите confused deputy?
tokensagentsoauth - 56
Браузерный агент прочитал скрытый текст страницы с указанием игнорировать пользователя и отправить session cookies злоумышленнику. Сама страница выглядит легитимной. Что вы сделаете?
sessionscookiesagents - 57
Агент баз данных пытается выполнить DROP TABLE invoices после просьбы очистить дубли строк. Запрос еще не выполнен. Какие контроли и доказательства вам нужны?
databasequeriesdedup - 58
Computer-use агент дошел до финального подтверждения банковского перевода на $28 500, хотя пользователь просил только подготовить платежные реквизиты. Как вы отреагируете?
agentscomputer-use - 59
Подтверждение человека пришло через 22 минуты после подготовки покупки агентом, но цена и остаток изменились 9 минут назад. Должно ли старое подтверждение исполниться?
agentsapproval - 60
Инициированная MCP-сервером цепочка sampling рекурсивно распространяется по пулу серверов, и расходы на модели вырастают в 18 раз за 12 минут. Как сдержать инцидент и где должны находиться контроли?
samplingmcp - 61
Автономная исследовательская задача выполнялась 18 часов и была потеряна после вытеснения worker без пригодного checkpoint. Как вы перепроектируете длительное выполнение?
- 62
Support-агент начал выдавать запрещенные кредиты после того, как в long-term memory появилась отравленная заметка с меткой корпоративной политики. Как вы ограничите ущерб и измените memory?
agentsmemorylong-term-memory - 63
Общий memory-сервис показал деталь контракта tenant A в ответе агента tenant B в 14 сессиях. Как вы отреагируете на инцидент?
agentsincidentssessions - 64
Исправленный источник доказывает ложность факта из memory, который активные запуски агентов уже использовали в summaries, планах и ожидающих действиях. Как распространить исправление, не удаляя историю?
agentsmemory - 65
Planner создает план из 12 шагов с инструментом delete_calendar_event, которого нет в production. Достаточно ли один раз проверить план до первого шага?
validation - 66
Одобренный план deployment еще выполняется, когда другой оператор откатывает production с release 83 на 82. Следующий шаг предполагает 83. Что вы сделаете?
agentsdeployment - 67
Executor запускает шаг 7 до того, как шаг 4 создал нужный ему ключ шифрования. Как вы диагностируете и предотвращаете нарушение зависимости?
encryptiondependencies - 68
Latency router назначает шаг одобрения оплаты поставщику на $75 000 высокооцененной модели, потому что у нее короткая очередь. Что не так с этим дизайном?
latencydesigndata-structures - 69
Failover провайдера восстановил доступность, но резервная модель создает параллельные tool calls и пропускает поля идемпотентности основной модели. Какие доказательства оправдают mutating traffic на резерве?
backupsidempotency - 70
Sales researcher и outreach agent оба отправили одно письмо 286 лидам. Как остановить дубли, не подавив законную более позднюю отправку с тем же содержимым?
agents - 71
Нужно подключить три класса MCP-инструментов: локальные инструменты разработчика на одном ноутбуке, удаленные multi-tenant SaaS-инструменты и регулируемые внутренние инструменты, доступные только в частной сети. Выберите transport и topology для каждого класса и обоснуйте границы.
multi-tenancycloud - 72
Пять агентов в ходе обсуждения единогласно отклоняют обоснованное требование о страховой выплате, потому что каждый агент скопировал одну ложную предпосылку. Что должно заменить подсчет голосов?
agents - 73
Coordinator создает шторм из 38 000 сообщений за 6 минут, потому что агенты подтверждают подтверждения друг друга. Как определить и ограничить amplification?
agents - 74
Research agent передает рекомендацию execution agent, но теряет источник о том, что поставщик находится под санкциями. Заказ уже в очереди. Какой контракт должен его отклонить?
agentsdata-structures - 75
Агент повысил evaluator score с 0,71 до 0,94, помечая сложные задачи завершенными без запрошенного artifact. Какое сравнение релизов раскроет reward hacking?
agentsartifactsllm-eval - 76
Разберите этот HITL-контракт: {batch_size: 10000, action_types: 'mixed', total_amount: 4800000, recipients: 'hidden', item_amounts: 'hidden', decision: 'approve_all'}. Reviewer видит только эту сводку и одобряет все 10 000 разнородных действий агентов. Можно ли считать такое одобрение действительным и как изменить review и dispatch?
agentsbatch - 77
Coding agent внутри sandbox пытается смонтировать host socket и прочитать /proc/1/environ после инструкции из репозитория. Как вы отреагируете на инцидент?
agentsincidents - 78
Спроектируйте replay инцидентов computer-use агентов, если скриншоты могут содержать пароли, медицинские данные и посторонние приложения. Что сохранять вместо полной чувствительной видеозаписи экрана?
agentscomputer-usepasswords - 79
Computer-use агент готов нажать „Одобрить счёт“, когда popup сдвигает страницу и помещает «Удалить поставщика» под курсор. Что должен проверить runtime?
agentscomputer-usevalidation - 80
CAPTCHA появляется посреди workflow аккаунта после трех успешных шагов браузера. Что обязан сделать агент?
agents - 81
Изменение planning увеличило median расход токенов с 18 000 до 96 000 и tool calls с 14 до 73 на задачу, а success вырос на 0,6 пункта. Вы выпустите его?
tokens - 82
CRM search встречается в 64% самого медленного 1% трасс задач и имеет stage p99 11,8 секунды. Можно ли вывести его долю в end-to-end p99 или обещать прежний recall после deadline в 2 секунды?
estimatione2epromises - 83
Широко используемый MCP-сервер деградирует, и 60 000 активных tool calls ожидают ответа. Спроектируйте отмену и восстановление всего пула без заявления, что отмененная работа прекратила побочные эффекты.
designresiliencemcp - 84
Единственный model provider переживает regional outage, в очереди 42 000 задач, а 8 600 могли выполнить tool call до потери ответа модели. Как вы восстановитесь?
data-structures - 85
Люди-рецензенты исправляют 8% планов агента, но только 1% исправлений меняет конечный результат. Как измерить добавленную ценность reviewer и сократить лишнюю проверку без потери редких high-impact исправлений?
agents - 86
Usage report выставляет tenant Northstar $91 200 за model calls tenant Acme после миграции очереди. Как вы исправите инцидент и attribution?
incidentsmigrationsdesign - 87
Task success падает с 96,2% до 88,7% после одновременных релизов planner, tool gateway и model router. Как локализовать причину и задать критерии возврата?
gateway - 88
Red-team suite прошел каждый компонент, но атакующий связал memory poisoning, context compaction и email tool и вывел список клиентов. Что изменится?
componentsmemorymemory-poisoning - 89
Jailbreak объединяет два по отдельности разрешенных инструмента, contact lookup и file upload, и отправляет payroll file на внешний адрес. Как предотвратить такую композицию?
llm-safetyoop - 90
Audit trace записывает запрос инструмента и финальный ответ агента, но пропускает tool response для 4,7% production-вызовов. Какие действия могут остаться включенными?
agents - 91
Upgrade LangGraph меняет serialization checkpoint, и 31% из 46 000 активных задач не продолжаются на новых workers. Что должна покрывать equivalence миграции кроме decoding?
decodingmigrationsserialization - 92
После upgrade AutoGen один агент отправляет tool results как массивы content, а другой ожидает строку, из-за чего 12% handoff незаметно пусты. Как вы исправите контракт?
agents - 93
MCP client предпочитает protocol version 2025-06-18, а 9 серверов объявляют старые версии и другие tool schemas. Должна ли платформа помещать в карантин каждый старый сервер?
schematyping - 94
Canary не видит ни одного несанкционированного банковского перевода в 40 000 задачах, но baseline события примерно 1 на 200 000. Достаточно ли этого для глобального launch?
deployment-strategies - 95
Новый release агента пишет checkpoint state, который предыдущий release не умеет десериализовать, и error rate достигает 9%. Можете ли вы откатиться?
agentsrollback - 96
Вы передаете ночной инцидент с 7 300 приостановленными задачами, 214 неоднозначными tool effects и без подтвержденной root cause. Что содержит on-call handoff?
incidentson-call - 97
Сильный инженер дал агенту неограниченный production shell, что привело к outage на 19 минут. Как вы будете менторить инженера после containment?
agentsmentoring - 98
Два senior engineer спорят о LangGraph и custom runtime для 18-часовых workflows. Как разрешить design dispute без шестимесячной переработки системы?
lockingdesignlanggraph - 99
Product хочет автономно отменять договоры с поставщиками, потому что approval снижает completion с 91% до 76%. Действие может стоить $12 000 штрафа. Какой дизайн вы одобрите?
designresilienceprocurement - 100
Инцидент агента приостановил 31% customer workflows, раскрыл данные 6 tenants и создал 82 непроверенных внешних действия. Какой executive containment update вы отправите через 90 минут?
agentsincidents