Skip to content

Вопросы на собеседовании: AWS-инженер

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Облачный инженер.

Смотреть пример резюме: AWS-инженер

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

networkingavailability

Я бы выделил в каждой зоне доступности отдельные публичные, приватные прикладные и изолированные подсети данных из непересекающегося CIDR.

  • В VPC с сетью /16 можно зарезервировать по /20 на каждый тип подсети и зону, оставив адресное пространство для роста без перенумерации.
  • Публичные подсети используются для внешних балансировщиков, приватные для приложений, а базы данных остаются в изолированных подсетях без маршрута в интернет по умолчанию.
  • Каждая приватная подсеть выходит через NAT Gateway в своей зоне, чтобы отказ зоны не создавал межзональную зависимость для исходящего трафика.

Зачем это спрашивают: Интервьюер проверяет, умеете ли вы превратить требования к доступности, запасу адресов и изоляции трафика в конкретный план подсетей.

AWS сначала выбирает самый специфичный совпавший префикс, а при одинаковых префиксах применяет правила приоритета маршрутов.

  • Маршрут 10.20.4.0/24 выигрывает у 10.20.0.0/16 независимо от того, ведет ли он в Transit Gateway, peering-соединение или сетевой интерфейс.
  • При одинаковом префиксе статический маршрут обычно выигрывает у распространяемого, а локальный маршрут VPC нельзя удалить или перекрыть менее специфичной записью.
  • Я проверяю таблицы прямого и обратного пути, потому что stateful security groups не исправляют асимметричную маршрутизацию через stateful appliance.

Зачем это спрашивают: Сильный ответ отделяет выбор самого длинного префикса от приоритета при равных префиксах и учитывает обратный путь.

gatewaynetworkingendpoints

Я использую gateway endpoints для приватного доступа к S3 или DynamoDB, а interface endpoints для сервисов, доступных через AWS PrivateLink.

  • Gateway endpoint добавляет маршруты с prefix list в выбранные таблицы и не имеет почасовой платы за endpoint.
  • Interface endpoint создает приватные IP-адреса в выбранных подсетях, использует security groups и private DNS, а также тарифицируется по часам и объему данных.
  • Endpoint policy ограничивает доступные вызывающей стороне ресурсы, но IAM и resource policies по-прежнему определяют разрешение каждого API-вызова.

Зачем это спрашивают: Интервьюер проверяет знание механики, стоимости и DNS endpoints, а также различие между сетевой доступностью и авторизацией.

private-connectivity

Я бы разместил сервис провайдера за Network Load Balancer и опубликовал VPC endpoint service для одобренных потребителей.

  • Потребители создают interface endpoints в своих подсетях, поэтому сторонам не нужны маршрутизируемые CIDR, VPC peering или широкий сетевой доступ.
  • Я требую явного принятия endpoint connection, если его нельзя безопасно автоматизировать списком разрешений, и по возможности ограничиваю сервис IAM-принципалами.
  • Для private DNS нужно подтвердить владение доменом, а потребителю включить private DNS, чтобы имя сервиса разрешалось в IP-адреса endpoint.

Зачем это спрашивают: Вопрос проверяет умение спроектировать узкое приватное подключение к сервису, не превращая PrivateLink в обычную маршрутизацию между VPC.

gatewaynetworking

Я бы разделил домены маршрутизации несколькими таблицами Transit Gateway и связал каждое подключение с таблицей его доверенной зоны.

  • Подключения spoke распространяют маршруты в таблицу shared services только там, где нужна связность, вместо одной таблицы с полносвязной сетью.
  • Таблица production может направлять префиксы общих сервисов к нужному подключению и не содержать маршрутов к development VPC, изолируя их отсутствием маршрута.
  • Я проектирую симметричные пути через appliances в inspection VPC и включаю appliance mode, когда поток должен оставаться на одном зональном пути через firewall.

Зачем это спрашивают: Сильный ответ показывает понимание associations, propagations и путей инспекции без ухода в управление инфраструктурой всей организации.

dnslatency

Я выбираю политику по требуемому решению о направлении трафика, а не по количеству endpoints.

  • Weighted records распределяют трафик по заданным долям для canary, а latency records выбирают регион AWS с наименьшей измеренной сетевой задержкой.
  • Failover records объединяют основной и резервный targets с проверкой здоровья, а geolocation records выбирают по географии клиента и требуют запись по умолчанию.
  • DNS TTL определяет скорость появления изменений у клиентов, но кэш рекурсивных резолверов не позволяет Route 53 мгновенно остановить новые подключения.

Зачем это спрашивают: Интервьюер ищет точное понимание политик и осознание того, что DNS-кэширование ограничивает точность управления трафиком.

designdnsnetworking

Я бы использовал inbound и outbound endpoints Route 53 Resolver с правилами условной пересылки через Direct Connect или VPN.

  • Локальный DNS пересылает запросы к приватным зонам AWS на IP-адреса inbound endpoints, размещенных минимум в двух зонах доступности.
  • К VPC привязываются outbound rules, например для corp.example.com, которые через outbound endpoints отправляют запросы локальным DNS-серверам.
  • Security groups разрешают UDP и TCP на порту 53 в нужном направлении, а stateless network ACL также должны пропускать DNS-запросы на порт назначения 53 и обратный трафик к ephemeral ports клиента.

Зачем это спрашивают: Вопрос проверяет, можете ли вы описать оба направления резолвинга и сетевые детали надежного гибридного DNS.

tls

Я выбираю ALB для маршрутизации с пониманием HTTP, а NLB для производительности четвертого уровня, статических IP или протоколов помимо HTTP.

  • ALB маршрутизирует по host, path, header или query string и интегрируется с WAF, а NLB передает TCP, TLS, UDP или TCP_UDP потоки.
  • Завершение TLS на балансировщике централизует ACM-сертификаты и политики, а повторное шифрование до HTTPS targets защищает участок до приложения.
  • TLS passthrough на NLB сохраняет end-to-end завершение в приложении, но лишает возможности инспекции запросов ALB и управляемой HTTP-маршрутизации.

Зачем это спрашивают: Сильный ответ связывает возможности балансировщиков с требованиями к протоколу, адресам, инспекции и сертификатам.

iam

Trust policy определяет, кто может принять роль, а permissions policies определяют действия, доступные сессии принятой роли.

  • Trust policy является resource-based policy роли и задает principals и условия, например ExternalId, исходный аккаунт или OIDC claims.
  • Для IAM user или role из того же аккаунта, прямо указанного как principal, trust policy может быть достаточно для AssumeRole без отдельного разрешения в identity policy при выполнении ее условий.
  • Cross-account принятие роли обычно требует sts:AssumeRole в identity policy вызывающей стороны и совпадающего доверия целевой роли; permissions boundaries, SCP, session policies и любой explicit deny могут ограничить принятие роли или полученную сессию.

Зачем это спрашивают: Интервьюер проверяет, умеете ли вы рассуждать об обоих этапах принятия роли и не смешиваете ли идентификацию с авторизацией.

sessions

Role chaining создает новую сессию роли из временных учетных данных, а session policy может только сузить разрешения новой сессии.

  • Продолжительность сессии при chaining ограничена одним часом, даже если целевая роль допускает более долгую сессию.
  • Итоговые разрешения являются пересечением policies роли и inline либо managed session policies, переданных в STS.
  • Я передаю session tags для атрибутного контроля и делаю transitive только те теги, которые действительно нужны следующей роли в цепочке.

Зачем это спрашивают: Сильный ответ включает часовой лимит chaining и понимает session policy как ограничивающее пересечение, а не дополнительное разрешение.

iam

Я использую permissions boundary как максимальный набор разрешений при делегированном создании ролей или пользователей, а не как policy, которая сама выдает доступ.

  • Платформенная роль может позволить команде создавать прикладные роли только при наличии предписанной boundary у каждой новой роли.
  • Итоговые identity permissions являются пересечением attached identity policies и boundary, поэтому AdministratorAccess не может выйти за ее пределы.
  • Resource policies, SCP, session policies и explicit denies участвуют отдельно, поэтому полный путь авторизации я проверяю через Policy Simulator или CloudTrail.

Зачем это спрашивают: Интервьюер хочет увидеть понимание boundaries как ограничителей делегирования, а не замены обычных permissions policies.

iamlinux

SCP задает максимум доступных разрешений для principals в member accounts, но сам не разрешает ни одного API-действия.

  • Действие должно быть разрешено применимым SCP и IAM, а explicit deny на любом из этих уровней имеет приоритет.
  • Permissions boundary ограничивает конкретный principal, а SCP ограничивает затронутые аккаунты или organizational units, включая создаваемые в них роли.
  • SCP не ограничивает management account и не изменяет напрямую resource-based permissions для principals за пределами организации.

Зачем это спрашивают: Сильный ответ правильно помещает SCP в пересечение авторизации и называет важные границы его области действия.

forms

Я предпочитаю роль в целевом аккаунте с узкой trust policy и минимальными permissions, которую принимает именованный principal исходного аккаунта.

  • Исходному principal нужен доступ sts:AssumeRole, а целевая trust policy ограничивает principal и добавляет условия вроде aws:PrincipalOrgID там, где это уместно.
  • Для стороннего клиента я требую уникальный ExternalId против confused deputy, но не считаю его секретом или заменой ограничения principal.
  • Прямая resource policy подходит для S3 или KMS, но принятая роль дает единообразные временные credentials и ясную session identity в CloudTrail.

Зачем это спрашивают: Вопрос проверяет умение построить межаккаунтный доступ с точными условиями доверия и временными учетными данными.

encryption

Envelope encryption шифрует данные сгенерированным data key, а сам data key шифруется ключом KMS.

  • Приложение вызывает GenerateDataKey, локально шифрует payload открытым data key, хранит зашифрованный data key рядом с ciphertext и удаляет открытый ключ.
  • При расшифровке зашифрованный data key отправляется в KMS, после чего возвращенный открытый ключ используется локально без KMS-вызова для каждого блока данных.
  • Key policy KMS должна разрешать principal или делегирование через IAM, а условия encryption context могут привязать Decrypt к конкретному приложению или ресурсу.

Зачем это спрашивают: Интервьюер оценивает понимание пути данных и особой роли key policy KMS в авторизации.

secretsdatabasedesign

Я бы хранил учетные данные в Secrets Manager и использовал rotation Lambda, которая последовательно меняет secret по документированным staging labels.

  • Функция создает AWSPENDING, обновляет пользователя базы, проверяет ожидающие credentials и переносит AWSCURRENT только после успешного теста.
  • Ротация с чередующимися пользователями уменьшает промежуток конфликта старых подключений и новых данных, если привилегии пользователей одинаковы.
  • Приложения получают текущий secret во время работы с ограниченным кэшем и при ошибке авторизации повторяют запрос после обновления кэша, а не встраивают значение при деплое.

Зачем это спрашивают: Сильный ответ объясняет state machine ротации и то, как приложение переносит смену учетных данных без жестко заданных секретов.

scalingdesigncompute

Я бы задал несколько совместимых типов инстансов и объединил стабильную базу On-Demand с диверсифицированной Spot capacity.

  • Attribute-based instance selection или явные overrides сохраняют совместимость vCPU, памяти и архитектуры с образом приложения.
  • Capacity-optimized распределение Spot снижает риск прерываний, а база On-Demand покрывает минимальную capacity для постоянной нагрузки.
  • Масштабирование опирается на целевую метрику вроде ALB requests per target, а instance refresh раскатывает версии с сохранением заданного процента здоровых инстансов.

Зачем это спрашивают: Интервьюер проверяет, можете ли вы сбалансировать доступность, совместимость, масштабирование и экономию Spot в одном проекте.

scalingautoscalingdeployment

Я бы считал каждую номерную версию launch template неизменяемым артефактом релиза и при каждом продвижении явно закреплял Auto Scaling group за конкретной версией.

  • Pipeline создает новую номерную версию с протестированными AMI и конфигурацией, записывает ее номер вместе с релизом и обновляет ASG только после проверки; production никогда не ссылается на `$Latest` или `$Default`.
  • При каждом продвижении запускается instance refresh с заданной минимальной долей здоровых инстансов, временем прогрева, alarms и checkpoints после небольших долей замены, чтобы pipeline проверял здоровье сервиса во время каждой паузы и останавливал неудачную раскатку.
  • Если checkpoint или alarm отклоняет релиз, я откатываю refresh к последней заведомо исправной закрепленной версии и сверяю с ней каждый инстанс; automatic rollback может выполнять тот же сценарий, поскольку ни одно состояние ASG не использует динамическую ссылку на версию.

Зачем это спрашивают: Интервьюер проверяет, умеете ли вы сделать продвижение AMI детерминированным и использовать средства instance refresh для предотвращения или устранения парка из разных версий.

hooksscaling

Lifecycle hooks приостанавливают запуск или завершение инстанса, чтобы автоматизация успела закончить работу до продолжения Auto Scaling.

  • Launch hook может установить конфигурацию, зарегистрировать внешний агент или прогреть большой кэш перед ответом CONTINUE.
  • Termination hook может завершить прием задач или выгрузить локальное состояние, а deregistration delay балансировщика отдельно обслуживает текущие запросы.
  • EventBridge или SNS доставляет событие автоматизации, а heartbeat продлевает timeout только для ограниченной работы, а не скрывает зависший процесс.

Зачем это спрашивают: Интервьюер хочет увидеть четкое различие между lifecycle orchestration, health checks и завершением соединений балансировщика.

awscontainerscompute

Я выбираю Fargate, когда важны изоляция задач и минимум работы с хостами, а ECS на EC2, когда контроль хоста или постоянная загрузка оправдывают управление fleet.

  • Fargate тарифицирует заказанные task vCPU и память, снимает патчинг узлов и поддерживает простые capacity providers для serverless tasks.
  • EC2 может быть дешевле при плотной постоянной нагрузке и поддерживает специальные AMI, GPU, daemon-агенты и больший выбор инстансов.
  • Оба варианта используют ECS services, task definitions, IAM task roles и балансировку, поэтому я сохраняю переносимость deployment artifacts там, где позволяют возможности платформы.

Зачем это спрашивают: Сильный ответ сравнивает операционную нагрузку, структуру стоимости и требования к хосту, не объявляя один тип запуска всегда лучшим.

kubernetes

AWS запускает высокодоступные Kubernetes API server и etcd control plane, а я отвечаю за доступ к кластеру, workloads, сеть, add-ons и worker capacity.

  • Control plane работает в нескольких зонах доступности и имеет настраиваемые публичный и приватный API endpoints, а audit и API logs можно отправить в CloudWatch.
  • Я по-прежнему настраиваю EKS access entries и access policies, RBAC, Pod Security controls, network policies и работу с secrets.
  • Основным add-ons VPC CNI, CoreDNS и kube-proxy нужны совместимые версии и плановые обновления, даже если они установлены как EKS managed add-ons.

Зачем это спрашивают: Интервьюер проверяет понимание границы ответственности: managed Kubernetes упрощает control plane, но не отменяет эксплуатацию кластера.

Закрытые вопросы

  • 21

    Когда использовать EKS managed node groups, а когда Karpenter?

    kuberneteskubernetes-autoscaling
  • 22

    Как предоставить pod в EKS разрешения AWS без credentials узла?

    kubernetes
  • 23

    Как управлять контейнерными образами в ECR для безопасных и воспроизводимых деплоев?

    containersdeploymentregistries
  • 24

    Чем RDS Multi-AZ deployments отличаются от read replicas?

    replicationrdsdeployment
  • 25

    Как приложение должно использовать cluster, reader и custom endpoints Aurora?

    endpoints
  • 26

    Какие решения в приложении делают failover RDS или Aurora безопаснее?

    rdsdesign
  • 27

    Когда помогает RDS Proxy и какие ограничения нужно учитывать?

    rdsproxy
  • 28

    Как спроектировать partition key DynamoDB для высоконагруженного сценария?

    dynamodbpartitioningdesign
  • 29

    Что нужно оценить перед добавлением global secondary index в DynamoDB?

    indexesdynamodbdecision-making
  • 30

    Как on-demand, provisioned и adaptive capacity влияют на проектирование DynamoDB?

    dynamodbdesigncapacity
  • 31

    Когда стоит совместно использовать транзакции DynamoDB и Streams?

    transactionsdynamodb
  • 32

    Как поддерживать согласованность данных ElastiCache с реляционной базой?

    databasecaching
  • 33

    Как reserved concurrency и account concurrency взаимодействуют в Lambda?

    concurrencylambdaserverless
  • 34

    Когда оправдано использование provisioned concurrency в Lambda?

    concurrencylambdaserverless
  • 35

    Как настроить visibility timeout SQS и политику dead-letter queue?

    resiliencequeuescss
  • 36

    Какие гарантии дает FIFO-очередь SQS и как message groups влияют на throughput?

    queuesthroughputdata-structures
  • 37

    Когда выбрать EventBridge вместо SNS или SQS?

    queuespub-subevents
  • 38

    Как выбирать между Standard и Express workflows в Step Functions?

  • 39

    Как объединить throttling API Gateway с идемпотентными write API?

    idempotencyapi-gatewaygateway
  • 40

    Как настроить remote state Terraform для команды, работающей с AWS?

    terraformconfig
  • 41

    Каким должен быть полезный Terraform-модуль для AWS-инфраструктуры?

    terraform
  • 42

    Как настройки lifecycle Terraform меняют поведение ресурсов?

    terraform
  • 43

    Как change sets CloudFormation и drift detection дополняют друг друга?

    iac
  • 44

    Что происходит при synthesis AWS CDK и что нужно проверять?

  • 45

    Как построить CI-проверки и контроль деплоя для AWS infrastructure as code?

    deploymentiac
  • 46

    Как объединить CloudWatch с X-Ray или OpenTelemetry для распределенного AWS-приложения?

    observabilitymonitoringdistributed
  • 47

    Как превратить SLO в полезные alarms CloudWatch?

    slomonitoring
  • 48

    Как выбрать уровни backup и disaster recovery для AWS workload?

    backups
  • 49

    Как сочетать Savings Plans с rightsizing для переменной compute-инфраструктуры?

    finops
  • 50

    Как использовать AWS Well-Architected Framework для оценки предложенного дизайна сервиса?

    decision-makingdesign
  • 51

    Две VPC приобретенных компаний используют один диапазон 10.20.0.0/16, но двенадцать сервисов должны приватно взаимодействовать уже через шесть недель. Как вы их соедините?

    communication
  • 52

    После подключения новой инспекционной VPC к Transit Gateway TCP-рукопожатия периодически не проходят, а flow logs показывают, что ответы уходят через другой firewall. Что вы проверите?

    gatewaynetworking
  • 53

    Инстансы обращаются к S3 через gateway endpoint, но PutObject возвращает 403 только для arn:aws:s3:::reports-prod, а другие бакеты работают. Как вы будете искать причину?

    gatewayobject-storageendpoints
  • 54

    Потребитель PrivateLink в одной VPC получает для api.internal.example.com публичные IP, а в другой VPC получает адреса interface endpoint. Обе должны использовать приватный DNS. Что вы измените?

    dnsnetworkingprivate-connectivity
  • 55

    У failover-записи Route 53 TTL равен 60 секундам, но после сбоя ALB клиенты еще девять минут обращаются к неработающему primary. Как вы исследуете проблему?

    dns
  • 56

    После деплоя ALB начинает возвращать 502 для 8% запросов, при этом target 5xx остается около нуля, а target response time резко снижается. Что вы проверите сначала?

    deployment
  • 57

    TLS listener на NLB работает для современных клиентов, но после ротации сертификата 15% старых устройств не проходят handshake. Как вы найдете причину?

    tls
  • 58

    Три приватные подсети используют один NAT gateway; ErrorPortAllocation становится выше нуля при 6000 одновременных исходящих соединениях, а расходы на NAT за месяц достигли $4800. Что вы сделаете?

    gatewaynetworkingconcurrency
  • 59

    У EC2 API загрузка CPU составляет 18%, но p99 latency удвоилась, а NetworkPacketsIn достигает лимита семейства инстансов во время пиков. Как вы отреагируете?

    computeapilatency
  • 60

    Mixed-instances Auto Scaling group должна предоставлять 40 единиц vCPU, но при DesiredCapacity 40 запускает 40 инстансов по 16 vCPU, из-за чего резко растут расходы. Как найти ошибку и безопасно ее исправить?

    scalingautoscaling
  • 61

    Spot-ноды экономят 65%, но двухминутное предупреждение о прерывании приводит к перезапуску 4% batch jobs с начала. Как сократить потерянную работу?

    batch
  • 62

    Scale-in завершает EC2 workers, пока они еще обрабатывают запросы длительностью до семи минут, из-за чего 1,5% запросов падают. Как вы примените lifecycle hook?

    hooksconcurrencyaws
  • 63

    ECS service запрашивает десять tasks, но шесть остаются PENDING 20 минут, а events сообщают, что ни один container instance не удовлетворяет всем требованиям. Что вы проверите?

    containers
  • 64

    ECS tasks завершаются с кодом 137 дважды в час; memory utilization достигает 100%, а CPU остается ниже 25%. Как вы подойдете к проблеме?

    memory
  • 65

    Fargate service работает при 22% CPU и 78% памяти, стоит $3200 в месяц и должен держать p95 ниже 250 мс. Как вы подберете размер?

    memorycontainers
  • 66

    После консолидации трех нод Karpenter пять EKS pods остаются Pending 12 минут с events о topology spread и нехватке памяти. Что вы измените?

    kuberneteskubernetes-autoscalingspread
  • 67

    После релиза EKS 30 pods показывают ImagePullBackOff, а немногие запустившиеся переходят в CrashLoopBackOff за 40 секунд. Как вы разделите причины?

    kubernetes
  • 68

    RDS PostgreSQL достигает 500 соединений, CPU загружен только на 35%, а новые API-запросы на пике падают с too many connections. Что вы сделаете?

    postgresrdsapi
  • 69

    Failover Multi-AZ RDS завершается за 95 секунд, но приложение работает нестабильно восемь минут, а read replica отстает на 14 ГБ. Как вы исследуете проблему?

    replicationrds
  • 70

    Свободное место RDS упало со 180 ГБ до 25 ГБ за два дня, хотя число транзакций не изменилось. Что вы проверите до увеличения storage?

    transactionsrds
  • 71

    Один запрос RDS замедлился с 80 мс до 4,6 секунды после роста таблицы до 90 миллионов строк, а CPU поднялся до 70%. Как вы его оптимизируете?

    queriesrds
  • 72

    В custom endpoint Aurora по ошибке включили writer, и каждое утро 30 reporting jobs насыщают этот инстанс. Как исправить и проверить путь отчетов?

    endpoints
  • 73

    Таблица DynamoDB в среднем использует 20% provisioned capacity, но один tenant получает throttling на 12% записей во время всплеска в 3000 запросов. Что происходит?

    dynamodbcapacity
  • 74

    Добавление DynamoDB GSI к таблице размером 1,2 ТБ вызывает online index throttling и повышает latency записи в базовую таблицу. Как безопасно завершить backfill?

    indexesdynamodblatency
  • 75

    ElastiCache показывает 40000 evictions в минуту, а QPS базы данных утраивается при истечении популярного ключа. Как остановить этот цикл?

    databasecaching
  • 76

    Lambda достигает региональной квоты concurrency 1000, throttles 7% invocations и доводит RDS до 450 соединений. Как вы стабилизируете систему?

    concurrencylambdathrottle
  • 77

    Lambda получает timeout через 30 секунд на 2% запросов, а traces показывают, что внешний API иногда отвечает 27 секунд. Что вы измените?

    serverlessapilambda
  • 78

    У Java Lambda p95 cold start равен 1,8 секунды при целевой latency 300 мс и всего 20 запросах в минуту ночью. Как вы ее ускорите?

    serverlesslatencylambda
  • 79

    Event source Lambda читает SQS пакетами по 10 сообщений, но при сбое 1 poison item остальные 9 успешных сообщений доставляются и обрабатываются повторно. Как остановить лишнюю работу?

    batchserverlessqueues
  • 80

    Одно poison message блокирует message group SQS FIFO уже 18 минут, а producers десять минут повторяют отправку с тем же deduplication ID. Как вы восстановите обработку?

    resiliencequeuesqueries
  • 81

    EventBridge доставляет 0,4% дубликатов order events, а события одного заказа иногда приходят не по порядку с разницей в две секунды. Как обеспечить корректность consumer?

    events
  • 82

    Task в Step Functions вызывает платежный API, который возвращает 429 в течение 20 секунд, а текущая retry policy создает повторные списания. Как исправить workflow?

    resilienceapi
  • 83

    API Gateway возвращает 429 во время запуска на 900 RPS, хотя квота аккаунта равна 10000 RPS, а 1 клиент отправляет 70% трафика. Что вы проверите?

    api-gatewaygateway
  • 84

    Deployment role в аккаунте B можно принять из аккаунта A в staging, но production возвращает AccessDenied после переноса в другую organization unit. Как диагностировать AssumeRole?

    deployment
  • 85

    IAM Policy Simulator показывает allow для s3:GetObject, но production все равно получает AccessDenied, а CloudTrail упоминает explicit deny. Где вы будете искать?

    iamawsobject-storage
  • 86

    Application role может прочитать зашифрованный объект S3, но после замены ключа 24 часа назад получает KMS AccessDenied при decrypt. Что вы проверите?

    encryptionawsobject-storage
  • 87

    Secrets Manager сообщает об успешной ротации, но 12% входов в базу падают пять минут после каждой ротации. Как это исправить?

    secretsdatabase
  • 88

    Access Analyzer сообщает о bucket policy S3, разрешающей GetObject для Principal * при наличии угадываемого referrer header. В бакете 80000 клиентских экспортов. Что вы сделаете?

    object-storageaws
  • 89

    GuardDuty сообщает, что EC2-инстанс обращается к известному command-and-control адресу каждые 60 секунд, но инстанс обслуживает 20% production-трафика. Как вы отреагируете?

    computeaws
  • 90

    Оператор попытался переименовать production security group в console, но security groups нельзя переименовать, поэтому появился другой SG ID с тем же Name tag, а 10 сервисов продолжают ссылаться на старый ID. Как согласовать Terraform?

    terraformnetworking
  • 91

    Terraform pipeline держит remote state lock уже 47 минут после падения runner, а hotfix нужно выпустить через 20 минут. Что вы сделаете?

    terraformci-cd
  • 92

    Обновление общего Terraform module меняет 24 сервиса, но на этой неделе провести тесты могут только две команды, а plan показывает replacement одного ресурса. Как выполнить rollout?

    terraform
  • 93

    CloudFormation update откатывается после создания 18 из 25 ресурсов, но rollback переходит в UPDATE_ROLLBACK_FAILED из-за статуса DELETE_FAILED у непустого S3 bucket. Как восстановиться?

    rollbackiacaws
  • 94

    CDK diff для обычного релиза показывает wildcard IAM и замену production DynamoDB table с 600 ГБ данных. Что вы сделаете до deployment?

    dynamodbdeploymentiam
  • 95

    CI job с OIDC может делать deployment из pull requests, но production должен развертываться только из защищенного main environment, а выданные credentials должны истекать менее чем за 60 минут. Как это ограничить?

    code-reviewdeployment
  • 96

    API возвращал 14% ошибок 11 минут, но alarm CloudWatch оставался OK, а X-Ray показывает traces только для одного из шести сервисов. Как исправить observability?

    observabilitymonitoringapi
  • 97

    AWS Cost Anomaly Detection сообщает о ежедневном росте data transfer на $1900 в одном аккаунте, начавшемся в 02:00 после релиза. Как вы исследуете и остановите его?

  • 98

    Квартальная restore drill должна восстановить базу RDS размером 2 ТБ с RTO четыре часа и потерей не более 15 минут данных. Как вы ее проведете?

    databaserds
  • 99

    On-premises приложение с 600 ГБ данных нужно перенести в AWS с downtime не более 20 минут, но file store и database нельзя мигрировать за один уикенд. Как разбить миграцию на этапы?

    database
  • 100

    Junior предлагает устранить повторяющиеся S3 AccessDenied, подключив AdministratorAccess к ECS task role на 48 часов. До релиза два часа. Как вы отреагируете?

    object-storageaws