Вопросы на собеседовании: AWS-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Облачный инженер.
Смотреть пример резюме: AWS-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Я бы выделил в каждой зоне доступности отдельные публичные, приватные прикладные и изолированные подсети данных из непересекающегося CIDR.
- В VPC с сетью /16 можно зарезервировать по /20 на каждый тип подсети и зону, оставив адресное пространство для роста без перенумерации.
- Публичные подсети используются для внешних балансировщиков, приватные для приложений, а базы данных остаются в изолированных подсетях без маршрута в интернет по умолчанию.
- Каждая приватная подсеть выходит через NAT Gateway в своей зоне, чтобы отказ зоны не создавал межзональную зависимость для исходящего трафика.
Зачем это спрашивают: Интервьюер проверяет, умеете ли вы превратить требования к доступности, запасу адресов и изоляции трафика в конкретный план подсетей.
AWS сначала выбирает самый специфичный совпавший префикс, а при одинаковых префиксах применяет правила приоритета маршрутов.
- Маршрут 10.20.4.0/24 выигрывает у 10.20.0.0/16 независимо от того, ведет ли он в Transit Gateway, peering-соединение или сетевой интерфейс.
- При одинаковом префиксе статический маршрут обычно выигрывает у распространяемого, а локальный маршрут VPC нельзя удалить или перекрыть менее специфичной записью.
- Я проверяю таблицы прямого и обратного пути, потому что stateful security groups не исправляют асимметричную маршрутизацию через stateful appliance.
Зачем это спрашивают: Сильный ответ отделяет выбор самого длинного префикса от приоритета при равных префиксах и учитывает обратный путь.
Я использую gateway endpoints для приватного доступа к S3 или DynamoDB, а interface endpoints для сервисов, доступных через AWS PrivateLink.
- Gateway endpoint добавляет маршруты с prefix list в выбранные таблицы и не имеет почасовой платы за endpoint.
- Interface endpoint создает приватные IP-адреса в выбранных подсетях, использует security groups и private DNS, а также тарифицируется по часам и объему данных.
- Endpoint policy ограничивает доступные вызывающей стороне ресурсы, но IAM и resource policies по-прежнему определяют разрешение каждого API-вызова.
Зачем это спрашивают: Интервьюер проверяет знание механики, стоимости и DNS endpoints, а также различие между сетевой доступностью и авторизацией.
Я бы разместил сервис провайдера за Network Load Balancer и опубликовал VPC endpoint service для одобренных потребителей.
- Потребители создают interface endpoints в своих подсетях, поэтому сторонам не нужны маршрутизируемые CIDR, VPC peering или широкий сетевой доступ.
- Я требую явного принятия endpoint connection, если его нельзя безопасно автоматизировать списком разрешений, и по возможности ограничиваю сервис IAM-принципалами.
- Для private DNS нужно подтвердить владение доменом, а потребителю включить private DNS, чтобы имя сервиса разрешалось в IP-адреса endpoint.
Зачем это спрашивают: Вопрос проверяет умение спроектировать узкое приватное подключение к сервису, не превращая PrivateLink в обычную маршрутизацию между VPC.
Я бы разделил домены маршрутизации несколькими таблицами Transit Gateway и связал каждое подключение с таблицей его доверенной зоны.
- Подключения spoke распространяют маршруты в таблицу shared services только там, где нужна связность, вместо одной таблицы с полносвязной сетью.
- Таблица production может направлять префиксы общих сервисов к нужному подключению и не содержать маршрутов к development VPC, изолируя их отсутствием маршрута.
- Я проектирую симметричные пути через appliances в inspection VPC и включаю appliance mode, когда поток должен оставаться на одном зональном пути через firewall.
Зачем это спрашивают: Сильный ответ показывает понимание associations, propagations и путей инспекции без ухода в управление инфраструктурой всей организации.
Я выбираю политику по требуемому решению о направлении трафика, а не по количеству endpoints.
- Weighted records распределяют трафик по заданным долям для canary, а latency records выбирают регион AWS с наименьшей измеренной сетевой задержкой.
- Failover records объединяют основной и резервный targets с проверкой здоровья, а geolocation records выбирают по географии клиента и требуют запись по умолчанию.
- DNS TTL определяет скорость появления изменений у клиентов, но кэш рекурсивных резолверов не позволяет Route 53 мгновенно остановить новые подключения.
Зачем это спрашивают: Интервьюер ищет точное понимание политик и осознание того, что DNS-кэширование ограничивает точность управления трафиком.
Я бы использовал inbound и outbound endpoints Route 53 Resolver с правилами условной пересылки через Direct Connect или VPN.
- Локальный DNS пересылает запросы к приватным зонам AWS на IP-адреса inbound endpoints, размещенных минимум в двух зонах доступности.
- К VPC привязываются outbound rules, например для corp.example.com, которые через outbound endpoints отправляют запросы локальным DNS-серверам.
- Security groups разрешают UDP и TCP на порту 53 в нужном направлении, а stateless network ACL также должны пропускать DNS-запросы на порт назначения 53 и обратный трафик к ephemeral ports клиента.
Зачем это спрашивают: Вопрос проверяет, можете ли вы описать оба направления резолвинга и сетевые детали надежного гибридного DNS.
Я выбираю ALB для маршрутизации с пониманием HTTP, а NLB для производительности четвертого уровня, статических IP или протоколов помимо HTTP.
- ALB маршрутизирует по host, path, header или query string и интегрируется с WAF, а NLB передает TCP, TLS, UDP или TCP_UDP потоки.
- Завершение TLS на балансировщике централизует ACM-сертификаты и политики, а повторное шифрование до HTTPS targets защищает участок до приложения.
- TLS passthrough на NLB сохраняет end-to-end завершение в приложении, но лишает возможности инспекции запросов ALB и управляемой HTTP-маршрутизации.
Зачем это спрашивают: Сильный ответ связывает возможности балансировщиков с требованиями к протоколу, адресам, инспекции и сертификатам.
Trust policy определяет, кто может принять роль, а permissions policies определяют действия, доступные сессии принятой роли.
- Trust policy является resource-based policy роли и задает principals и условия, например ExternalId, исходный аккаунт или OIDC claims.
- Для IAM user или role из того же аккаунта, прямо указанного как principal, trust policy может быть достаточно для AssumeRole без отдельного разрешения в identity policy при выполнении ее условий.
- Cross-account принятие роли обычно требует sts:AssumeRole в identity policy вызывающей стороны и совпадающего доверия целевой роли; permissions boundaries, SCP, session policies и любой explicit deny могут ограничить принятие роли или полученную сессию.
Зачем это спрашивают: Интервьюер проверяет, умеете ли вы рассуждать об обоих этапах принятия роли и не смешиваете ли идентификацию с авторизацией.
Role chaining создает новую сессию роли из временных учетных данных, а session policy может только сузить разрешения новой сессии.
- Продолжительность сессии при chaining ограничена одним часом, даже если целевая роль допускает более долгую сессию.
- Итоговые разрешения являются пересечением policies роли и inline либо managed session policies, переданных в STS.
- Я передаю session tags для атрибутного контроля и делаю transitive только те теги, которые действительно нужны следующей роли в цепочке.
Зачем это спрашивают: Сильный ответ включает часовой лимит chaining и понимает session policy как ограничивающее пересечение, а не дополнительное разрешение.
Я использую permissions boundary как максимальный набор разрешений при делегированном создании ролей или пользователей, а не как policy, которая сама выдает доступ.
- Платформенная роль может позволить команде создавать прикладные роли только при наличии предписанной boundary у каждой новой роли.
- Итоговые identity permissions являются пересечением attached identity policies и boundary, поэтому AdministratorAccess не может выйти за ее пределы.
- Resource policies, SCP, session policies и explicit denies участвуют отдельно, поэтому полный путь авторизации я проверяю через Policy Simulator или CloudTrail.
Зачем это спрашивают: Интервьюер хочет увидеть понимание boundaries как ограничителей делегирования, а не замены обычных permissions policies.
SCP задает максимум доступных разрешений для principals в member accounts, но сам не разрешает ни одного API-действия.
- Действие должно быть разрешено применимым SCP и IAM, а explicit deny на любом из этих уровней имеет приоритет.
- Permissions boundary ограничивает конкретный principal, а SCP ограничивает затронутые аккаунты или organizational units, включая создаваемые в них роли.
- SCP не ограничивает management account и не изменяет напрямую resource-based permissions для principals за пределами организации.
Зачем это спрашивают: Сильный ответ правильно помещает SCP в пересечение авторизации и называет важные границы его области действия.
Я предпочитаю роль в целевом аккаунте с узкой trust policy и минимальными permissions, которую принимает именованный principal исходного аккаунта.
- Исходному principal нужен доступ sts:AssumeRole, а целевая trust policy ограничивает principal и добавляет условия вроде aws:PrincipalOrgID там, где это уместно.
- Для стороннего клиента я требую уникальный ExternalId против confused deputy, но не считаю его секретом или заменой ограничения principal.
- Прямая resource policy подходит для S3 или KMS, но принятая роль дает единообразные временные credentials и ясную session identity в CloudTrail.
Зачем это спрашивают: Вопрос проверяет умение построить межаккаунтный доступ с точными условиями доверия и временными учетными данными.
Envelope encryption шифрует данные сгенерированным data key, а сам data key шифруется ключом KMS.
- Приложение вызывает GenerateDataKey, локально шифрует payload открытым data key, хранит зашифрованный data key рядом с ciphertext и удаляет открытый ключ.
- При расшифровке зашифрованный data key отправляется в KMS, после чего возвращенный открытый ключ используется локально без KMS-вызова для каждого блока данных.
- Key policy KMS должна разрешать principal или делегирование через IAM, а условия encryption context могут привязать Decrypt к конкретному приложению или ресурсу.
Зачем это спрашивают: Интервьюер оценивает понимание пути данных и особой роли key policy KMS в авторизации.
Я бы хранил учетные данные в Secrets Manager и использовал rotation Lambda, которая последовательно меняет secret по документированным staging labels.
- Функция создает AWSPENDING, обновляет пользователя базы, проверяет ожидающие credentials и переносит AWSCURRENT только после успешного теста.
- Ротация с чередующимися пользователями уменьшает промежуток конфликта старых подключений и новых данных, если привилегии пользователей одинаковы.
- Приложения получают текущий secret во время работы с ограниченным кэшем и при ошибке авторизации повторяют запрос после обновления кэша, а не встраивают значение при деплое.
Зачем это спрашивают: Сильный ответ объясняет state machine ротации и то, как приложение переносит смену учетных данных без жестко заданных секретов.
Я бы задал несколько совместимых типов инстансов и объединил стабильную базу On-Demand с диверсифицированной Spot capacity.
- Attribute-based instance selection или явные overrides сохраняют совместимость vCPU, памяти и архитектуры с образом приложения.
- Capacity-optimized распределение Spot снижает риск прерываний, а база On-Demand покрывает минимальную capacity для постоянной нагрузки.
- Масштабирование опирается на целевую метрику вроде ALB requests per target, а instance refresh раскатывает версии с сохранением заданного процента здоровых инстансов.
Зачем это спрашивают: Интервьюер проверяет, можете ли вы сбалансировать доступность, совместимость, масштабирование и экономию Spot в одном проекте.
Я бы считал каждую номерную версию launch template неизменяемым артефактом релиза и при каждом продвижении явно закреплял Auto Scaling group за конкретной версией.
- Pipeline создает новую номерную версию с протестированными AMI и конфигурацией, записывает ее номер вместе с релизом и обновляет ASG только после проверки; production никогда не ссылается на `$Latest` или `$Default`.
- При каждом продвижении запускается instance refresh с заданной минимальной долей здоровых инстансов, временем прогрева, alarms и checkpoints после небольших долей замены, чтобы pipeline проверял здоровье сервиса во время каждой паузы и останавливал неудачную раскатку.
- Если checkpoint или alarm отклоняет релиз, я откатываю refresh к последней заведомо исправной закрепленной версии и сверяю с ней каждый инстанс; automatic rollback может выполнять тот же сценарий, поскольку ни одно состояние ASG не использует динамическую ссылку на версию.
Зачем это спрашивают: Интервьюер проверяет, умеете ли вы сделать продвижение AMI детерминированным и использовать средства instance refresh для предотвращения или устранения парка из разных версий.
Lifecycle hooks приостанавливают запуск или завершение инстанса, чтобы автоматизация успела закончить работу до продолжения Auto Scaling.
- Launch hook может установить конфигурацию, зарегистрировать внешний агент или прогреть большой кэш перед ответом CONTINUE.
- Termination hook может завершить прием задач или выгрузить локальное состояние, а deregistration delay балансировщика отдельно обслуживает текущие запросы.
- EventBridge или SNS доставляет событие автоматизации, а heartbeat продлевает timeout только для ограниченной работы, а не скрывает зависший процесс.
Зачем это спрашивают: Интервьюер хочет увидеть четкое различие между lifecycle orchestration, health checks и завершением соединений балансировщика.
Я выбираю Fargate, когда важны изоляция задач и минимум работы с хостами, а ECS на EC2, когда контроль хоста или постоянная загрузка оправдывают управление fleet.
- Fargate тарифицирует заказанные task vCPU и память, снимает патчинг узлов и поддерживает простые capacity providers для serverless tasks.
- EC2 может быть дешевле при плотной постоянной нагрузке и поддерживает специальные AMI, GPU, daemon-агенты и больший выбор инстансов.
- Оба варианта используют ECS services, task definitions, IAM task roles и балансировку, поэтому я сохраняю переносимость deployment artifacts там, где позволяют возможности платформы.
Зачем это спрашивают: Сильный ответ сравнивает операционную нагрузку, структуру стоимости и требования к хосту, не объявляя один тип запуска всегда лучшим.
AWS запускает высокодоступные Kubernetes API server и etcd control plane, а я отвечаю за доступ к кластеру, workloads, сеть, add-ons и worker capacity.
- Control plane работает в нескольких зонах доступности и имеет настраиваемые публичный и приватный API endpoints, а audit и API logs можно отправить в CloudWatch.
- Я по-прежнему настраиваю EKS access entries и access policies, RBAC, Pod Security controls, network policies и работу с secrets.
- Основным add-ons VPC CNI, CoreDNS и kube-proxy нужны совместимые версии и плановые обновления, даже если они установлены как EKS managed add-ons.
Зачем это спрашивают: Интервьюер проверяет понимание границы ответственности: managed Kubernetes упрощает control plane, но не отменяет эксплуатацию кластера.
Закрытые вопросы
- 21
Когда использовать EKS managed node groups, а когда Karpenter?
kuberneteskubernetes-autoscaling - 22
Как предоставить pod в EKS разрешения AWS без credentials узла?
kubernetes - 23
Как управлять контейнерными образами в ECR для безопасных и воспроизводимых деплоев?
containersdeploymentregistries - 24
Чем RDS Multi-AZ deployments отличаются от read replicas?
replicationrdsdeployment - 25
Как приложение должно использовать cluster, reader и custom endpoints Aurora?
endpoints - 26
Какие решения в приложении делают failover RDS или Aurora безопаснее?
rdsdesign - 27
Когда помогает RDS Proxy и какие ограничения нужно учитывать?
rdsproxy - 28
Как спроектировать partition key DynamoDB для высоконагруженного сценария?
dynamodbpartitioningdesign - 29
Что нужно оценить перед добавлением global secondary index в DynamoDB?
indexesdynamodbdecision-making - 30
Как on-demand, provisioned и adaptive capacity влияют на проектирование DynamoDB?
dynamodbdesigncapacity - 31
Когда стоит совместно использовать транзакции DynamoDB и Streams?
transactionsdynamodb - 32
Как поддерживать согласованность данных ElastiCache с реляционной базой?
databasecaching - 33
Как reserved concurrency и account concurrency взаимодействуют в Lambda?
concurrencylambdaserverless - 34
Когда оправдано использование provisioned concurrency в Lambda?
concurrencylambdaserverless - 35
Как настроить visibility timeout SQS и политику dead-letter queue?
resiliencequeuescss - 36
Какие гарантии дает FIFO-очередь SQS и как message groups влияют на throughput?
queuesthroughputdata-structures - 37
Когда выбрать EventBridge вместо SNS или SQS?
queuespub-subevents - 38
Как выбирать между Standard и Express workflows в Step Functions?
- 39
Как объединить throttling API Gateway с идемпотентными write API?
idempotencyapi-gatewaygateway - 40
Как настроить remote state Terraform для команды, работающей с AWS?
terraformconfig - 41
Каким должен быть полезный Terraform-модуль для AWS-инфраструктуры?
terraform - 42
Как настройки lifecycle Terraform меняют поведение ресурсов?
terraform - 43
Как change sets CloudFormation и drift detection дополняют друг друга?
iac - 44
Что происходит при synthesis AWS CDK и что нужно проверять?
- 45
Как построить CI-проверки и контроль деплоя для AWS infrastructure as code?
deploymentiac - 46
Как объединить CloudWatch с X-Ray или OpenTelemetry для распределенного AWS-приложения?
observabilitymonitoringdistributed - 47
Как превратить SLO в полезные alarms CloudWatch?
slomonitoring - 48
Как выбрать уровни backup и disaster recovery для AWS workload?
backups - 49
Как сочетать Savings Plans с rightsizing для переменной compute-инфраструктуры?
finops - 50
Как использовать AWS Well-Architected Framework для оценки предложенного дизайна сервиса?
decision-makingdesign - 51
Две VPC приобретенных компаний используют один диапазон 10.20.0.0/16, но двенадцать сервисов должны приватно взаимодействовать уже через шесть недель. Как вы их соедините?
communication - 52
После подключения новой инспекционной VPC к Transit Gateway TCP-рукопожатия периодически не проходят, а flow logs показывают, что ответы уходят через другой firewall. Что вы проверите?
gatewaynetworking - 53
Инстансы обращаются к S3 через gateway endpoint, но PutObject возвращает 403 только для arn:aws:s3:::reports-prod, а другие бакеты работают. Как вы будете искать причину?
gatewayobject-storageendpoints - 54
Потребитель PrivateLink в одной VPC получает для api.internal.example.com публичные IP, а в другой VPC получает адреса interface endpoint. Обе должны использовать приватный DNS. Что вы измените?
dnsnetworkingprivate-connectivity - 55
У failover-записи Route 53 TTL равен 60 секундам, но после сбоя ALB клиенты еще девять минут обращаются к неработающему primary. Как вы исследуете проблему?
dns - 56
После деплоя ALB начинает возвращать 502 для 8% запросов, при этом target 5xx остается около нуля, а target response time резко снижается. Что вы проверите сначала?
deployment - 57
TLS listener на NLB работает для современных клиентов, но после ротации сертификата 15% старых устройств не проходят handshake. Как вы найдете причину?
tls - 58
Три приватные подсети используют один NAT gateway; ErrorPortAllocation становится выше нуля при 6000 одновременных исходящих соединениях, а расходы на NAT за месяц достигли $4800. Что вы сделаете?
gatewaynetworkingconcurrency - 59
У EC2 API загрузка CPU составляет 18%, но p99 latency удвоилась, а NetworkPacketsIn достигает лимита семейства инстансов во время пиков. Как вы отреагируете?
computeapilatency - 60
Mixed-instances Auto Scaling group должна предоставлять 40 единиц vCPU, но при DesiredCapacity 40 запускает 40 инстансов по 16 vCPU, из-за чего резко растут расходы. Как найти ошибку и безопасно ее исправить?
scalingautoscaling - 61
Spot-ноды экономят 65%, но двухминутное предупреждение о прерывании приводит к перезапуску 4% batch jobs с начала. Как сократить потерянную работу?
batch - 62
Scale-in завершает EC2 workers, пока они еще обрабатывают запросы длительностью до семи минут, из-за чего 1,5% запросов падают. Как вы примените lifecycle hook?
hooksconcurrencyaws - 63
ECS service запрашивает десять tasks, но шесть остаются PENDING 20 минут, а events сообщают, что ни один container instance не удовлетворяет всем требованиям. Что вы проверите?
containers - 64
ECS tasks завершаются с кодом 137 дважды в час; memory utilization достигает 100%, а CPU остается ниже 25%. Как вы подойдете к проблеме?
memory - 65
Fargate service работает при 22% CPU и 78% памяти, стоит $3200 в месяц и должен держать p95 ниже 250 мс. Как вы подберете размер?
memorycontainers - 66
После консолидации трех нод Karpenter пять EKS pods остаются Pending 12 минут с events о topology spread и нехватке памяти. Что вы измените?
kuberneteskubernetes-autoscalingspread - 67
После релиза EKS 30 pods показывают ImagePullBackOff, а немногие запустившиеся переходят в CrashLoopBackOff за 40 секунд. Как вы разделите причины?
kubernetes - 68
RDS PostgreSQL достигает 500 соединений, CPU загружен только на 35%, а новые API-запросы на пике падают с too many connections. Что вы сделаете?
postgresrdsapi - 69
Failover Multi-AZ RDS завершается за 95 секунд, но приложение работает нестабильно восемь минут, а read replica отстает на 14 ГБ. Как вы исследуете проблему?
replicationrds - 70
Свободное место RDS упало со 180 ГБ до 25 ГБ за два дня, хотя число транзакций не изменилось. Что вы проверите до увеличения storage?
transactionsrds - 71
Один запрос RDS замедлился с 80 мс до 4,6 секунды после роста таблицы до 90 миллионов строк, а CPU поднялся до 70%. Как вы его оптимизируете?
queriesrds - 72
В custom endpoint Aurora по ошибке включили writer, и каждое утро 30 reporting jobs насыщают этот инстанс. Как исправить и проверить путь отчетов?
endpoints - 73
Таблица DynamoDB в среднем использует 20% provisioned capacity, но один tenant получает throttling на 12% записей во время всплеска в 3000 запросов. Что происходит?
dynamodbcapacity - 74
Добавление DynamoDB GSI к таблице размером 1,2 ТБ вызывает online index throttling и повышает latency записи в базовую таблицу. Как безопасно завершить backfill?
indexesdynamodblatency - 75
ElastiCache показывает 40000 evictions в минуту, а QPS базы данных утраивается при истечении популярного ключа. Как остановить этот цикл?
databasecaching - 76
Lambda достигает региональной квоты concurrency 1000, throttles 7% invocations и доводит RDS до 450 соединений. Как вы стабилизируете систему?
concurrencylambdathrottle - 77
Lambda получает timeout через 30 секунд на 2% запросов, а traces показывают, что внешний API иногда отвечает 27 секунд. Что вы измените?
serverlessapilambda - 78
У Java Lambda p95 cold start равен 1,8 секунды при целевой latency 300 мс и всего 20 запросах в минуту ночью. Как вы ее ускорите?
serverlesslatencylambda - 79
Event source Lambda читает SQS пакетами по 10 сообщений, но при сбое 1 poison item остальные 9 успешных сообщений доставляются и обрабатываются повторно. Как остановить лишнюю работу?
batchserverlessqueues - 80
Одно poison message блокирует message group SQS FIFO уже 18 минут, а producers десять минут повторяют отправку с тем же deduplication ID. Как вы восстановите обработку?
resiliencequeuesqueries - 81
EventBridge доставляет 0,4% дубликатов order events, а события одного заказа иногда приходят не по порядку с разницей в две секунды. Как обеспечить корректность consumer?
events - 82
Task в Step Functions вызывает платежный API, который возвращает 429 в течение 20 секунд, а текущая retry policy создает повторные списания. Как исправить workflow?
resilienceapi - 83
API Gateway возвращает 429 во время запуска на 900 RPS, хотя квота аккаунта равна 10000 RPS, а 1 клиент отправляет 70% трафика. Что вы проверите?
api-gatewaygateway - 84
Deployment role в аккаунте B можно принять из аккаунта A в staging, но production возвращает AccessDenied после переноса в другую organization unit. Как диагностировать AssumeRole?
deployment - 85
IAM Policy Simulator показывает allow для s3:GetObject, но production все равно получает AccessDenied, а CloudTrail упоминает explicit deny. Где вы будете искать?
iamawsobject-storage - 86
Application role может прочитать зашифрованный объект S3, но после замены ключа 24 часа назад получает KMS AccessDenied при decrypt. Что вы проверите?
encryptionawsobject-storage - 87
Secrets Manager сообщает об успешной ротации, но 12% входов в базу падают пять минут после каждой ротации. Как это исправить?
secretsdatabase - 88
Access Analyzer сообщает о bucket policy S3, разрешающей GetObject для Principal * при наличии угадываемого referrer header. В бакете 80000 клиентских экспортов. Что вы сделаете?
object-storageaws - 89
GuardDuty сообщает, что EC2-инстанс обращается к известному command-and-control адресу каждые 60 секунд, но инстанс обслуживает 20% production-трафика. Как вы отреагируете?
computeaws - 90
Оператор попытался переименовать production security group в console, но security groups нельзя переименовать, поэтому появился другой SG ID с тем же Name tag, а 10 сервисов продолжают ссылаться на старый ID. Как согласовать Terraform?
terraformnetworking - 91
Terraform pipeline держит remote state lock уже 47 минут после падения runner, а hotfix нужно выпустить через 20 минут. Что вы сделаете?
terraformci-cd - 92
Обновление общего Terraform module меняет 24 сервиса, но на этой неделе провести тесты могут только две команды, а plan показывает replacement одного ресурса. Как выполнить rollout?
terraform - 93
CloudFormation update откатывается после создания 18 из 25 ресурсов, но rollback переходит в UPDATE_ROLLBACK_FAILED из-за статуса DELETE_FAILED у непустого S3 bucket. Как восстановиться?
rollbackiacaws - 94
CDK diff для обычного релиза показывает wildcard IAM и замену production DynamoDB table с 600 ГБ данных. Что вы сделаете до deployment?
dynamodbdeploymentiam - 95
CI job с OIDC может делать deployment из pull requests, но production должен развертываться только из защищенного main environment, а выданные credentials должны истекать менее чем за 60 минут. Как это ограничить?
code-reviewdeployment - 96
API возвращал 14% ошибок 11 минут, но alarm CloudWatch оставался OK, а X-Ray показывает traces только для одного из шести сервисов. Как исправить observability?
observabilitymonitoringapi - 97
AWS Cost Anomaly Detection сообщает о ежедневном росте data transfer на $1900 в одном аккаунте, начавшемся в 02:00 после релиза. Как вы исследуете и остановите его?
- 98
Квартальная restore drill должна восстановить базу RDS размером 2 ТБ с RTO четыре часа и потерей не более 15 минут данных. Как вы ее проведете?
databaserds - 99
On-premises приложение с 600 ГБ данных нужно перенести в AWS с downtime не более 20 минут, но file store и database нельзя мигрировать за один уикенд. Как разбить миграцию на этапы?
database - 100
Junior предлагает устранить повторяющиеся S3 AccessDenied, подключив AdministratorAccess к ECS task role на 48 часов. До релиза два часа. Как вы отреагируете?
object-storageaws