Вопросы на собеседовании: Облачный архитектор
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.
Смотреть пример резюме: Облачный архитектор →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
План адресов VPC задаёт непересекающиеся CIDR-диапазоны с запасом для текущих и будущих подсетей.
- План должен учитывать зоны доступности, окружения, уровни нагрузок и ожидаемый рост.
- Диапазоны не должны пересекаться с сетями, которые будут подключены через peering, transit routing, VPN или частные каналы.
- Документированная схема выделения IP упрощает агрегацию маршрутов, диагностику и дальнейшее расширение.
Зачем это спрашивают: Интервьюер проверяет, считаете ли вы адресный план долгосрочным ограничением связности, а не разовым выбором подсети.
Подсети делят адресное пространство VPC, а таблицы маршрутов определяют доступные направления трафика каждой подсети.
- Каждая подсеть связана с таблицей, содержащей локальный маршрут VPC и дополнительные направления.
- Маршрут к internet gateway делает интернет-маршрутизацию возможной для ресурсов публичной подсети с подходящими адресами.
- Частные подсети обычно отправляют исходящий трафик через NAT и не дают базам или внутренним сервисам прямого маршрута в интернет.
Зачем это спрашивают: Сильный ответ связывает тип подсети с маршрутизацией и не считает, что доступ задаёт само название подсети.
Security groups представляют stateful-контроль на уровне ресурса, а network ACL представляют stateless-контроль на уровне подсети.
- Security group автоматически разрешает ответный трафик для допустимого соединения и содержит разрешающие правила.
- Network ACL отдельно проверяет входящие и исходящие правила по номеру и может явно разрешать или запрещать трафик.
- Security groups служат основной границей нагрузки, а ACL добавляют грубые ограничения подсети.
Зачем это спрашивают: Интервьюер оценивает понимание области, учёта состояния и поведения правил обоих средств.
VPC peering создаёт связь по частным IP между двумя VPC через сеть провайдера.
- Маршруты нужно добавить с обеих сторон, а средства безопасности должны разрешать нужный трафик.
- Peering не поддерживает пересекающиеся CIDR и транзитную маршрутизацию через третью VPC.
- Большими peering-сетями сложно управлять, потому что каждой нужной паре VPC требуются отдельная связь и маршруты.
Зачем это спрашивают: Сильный ответ учитывает нетранзитивность и запрет пересекающихся диапазонов, которые определяют топологию peering.
AWS Transit Gateway предоставляет региональный узел маршрутизации между множеством VPC и локальных сетей.
- Подключения VPC, VPN и Direct Connect соединяются с узлом вместо построения полной сетки.
- Таблицы маршрутов Transit Gateway могут сегментировать подключения и управлять доступностью сетей друг для друга.
- Централизованная маршрутизация сокращает число связей, но адресный план и распространение маршрутов всё равно требуют управления.
Зачем это спрашивают: Интервьюер проверяет понимание Transit Gateway как управляемого узла маршрутизации с контролем сегментации.
AWS PrivateLink открывает сервис через частные interface endpoints без объединения сетей потребителя и провайдера.
- Провайдер публикует endpoint service, обычно за Network Load Balancer.
- Потребитель создаёт interface endpoints с частными IP-адресами в выбранных подсетях.
- Трафик остаётся в сети AWS, а диапазоны VPC могут пересекаться, поскольку полная двусторонняя маршрутизация не создаётся.
Зачем это спрашивают: Сильный ответ отличает частную публикацию сервиса от peering целой сети.
Internet gateway обеспечивает прямую интернет-маршрутизацию VPC, а NAT gateway позволяет частным IPv4-ресурсам создавать исходящие соединения с преобразованием адресов.
- Публичному ресурсу нужны маршрут к internet gateway, публичный адрес и подходящие правила безопасности.
- Частные ресурсы отправляют IPv4-трафик в интернет через NAT gateway в публичной подсети.
- NAT gateway не принимает незапрошенные входящие соединения, созданные из интернета.
Зачем это спрашивают: Интервьюер оценивает понимание прямой публичной маршрутизации и преобразованного доступа только наружу.
Site-to-site VPN шифрует трафик поверх публичного интернета, а выделенное подключение использует частный канал провайдера.
- VPN быстрее подключить, и он часто служит резервным или менее нагруженным гибридным соединением.
- AWS Direct Connect и Google Cloud Interconnect дают более предсказуемые пропускную способность и задержку, чем интернет-маршруты.
- Выделенным линиям всё равно нужны резервные каналы, продуманная маршрутизация и часто VPN для шифрования или резерва.
Зачем это спрашивают: Сильный ответ различает пути передачи и эксплуатационные свойства, не превращая вопрос в сценарий выбора.
Частная DNS-зона разрешает выбранные доменные имена только для связанных частных сетей.
- Она сопоставляет внутренние имена сервисов с частными адресами или endpoints, не публикуя их в публичном DNS.
- Привязки или правила пересылки расширяют разрешение имён между VPC, проектами и гибридными сетями.
- Split-horizon DNS может возвращать разные записи одного имени в зависимости от частного или публичного источника запроса.
Зачем это спрашивают: Интервьюер проверяет понимание внутреннего разрешения имён и его связей с сетями.
Gateway endpoints добавляют маршруты к поддерживаемым сервисам AWS, а interface endpoints создают частные сетевые интерфейсы на основе PrivateLink.
- Gateway endpoints поддерживают Amazon S3 и DynamoDB и не требуют NAT для подходящего трафика.
- Interface endpoints предоставляют частные IP и DNS для многих сервисов AWS и пользовательских endpoint services.
- Endpoint policies, security groups там, где они применимы, маршрутизация и private DNS управляют доступными операциями сервиса.
Зачем это спрашивают: Сильный ответ отличает модель на основе маршрута от модели на основе сетевого интерфейса.
Объектное, блочное и файловое хранилища предоставляют разные модели данных и интерфейсы доступа.
- Объектное хранилище использует объекты с доступом по API и метаданными и подходит для медиа, резервных копий, логов и озёр данных.
- Блочное хранилище предоставляет тома одному или нескольким поддерживаемым вычислительным инстансам для файловых систем и баз.
- Файловое хранилище предоставляет общие иерархические файлы по протоколам вроде NFS или SMB.
Зачем это спрашивают: Интервьюер проверяет, можете ли вы классифицировать облачное хранилище по модели доступа и характеру нагрузки.
Уровни объектного хранения тарифицируют хранение данных с учётом частоты доступа, способа извлечения и ожидаемого срока.
- Уровни частого доступа имеют более высокую стоимость хранения и немедленный доступ, а архивные уровни снижают стоимость с ограничениями извлечения.
- Lifecycle policies перемещают объекты между уровнями или удаляют их по возрасту и метаданным.
- Минимальный срок, плата за извлечение и запросы и время восстановления влияют на реальную стоимость холодных уровней.
Зачем это спрашивают: Сильный ответ идёт дальше названий уровней и объясняет стоящие за ними стоимость и извлечение.
Версионирование сохраняет редакции объектов, а межрегиональная репликация копирует подходящие объекты в бакет другого региона.
- Версионирование помогает восстановиться после случайной перезаписи или удаления, но увеличивает объём хранения.
- Репликация создаёт отдельную региональную копию для локальности, требований или целей восстановления.
- Репликации нужны права, версионирование, мониторинг и явная обработка существующих объектов и удаления.
Зачем это спрашивают: Интервьюер оценивает, отличаете ли вы историю объекта от регионального дублирования.
Снимок блочного хранилища сохраняет состояние тома на определённый момент в управляемом долговечном хранилище провайдера.
- Облачные снимки обычно инкрементальны, поэтому последующие снимки хранят изменённые блоки, оставаясь независимо восстанавливаемыми.
- Восстановление создаёт новый том, а производительность первых чтений может отличаться, пока блоки не будут загружены.
- Для согласованного снимка приложения нужна координация с файловой системой или базой, а не только crash-consistent образ тома.
Зачем это спрашивают: Сильный ответ учитывает инкрементальность, поведение восстановления и согласованность приложения.
Amazon CloudFront отдаёт кешируемый контент через распределённые пограничные узлы перед origin.
- Ключ кеша обычно включает путь и выбранные query strings, заголовки или cookie.
- TTL и заголовки cache-control определяют свежесть, а invalidation досрочно удаляет выбранные объекты.
- Origin Access Control позволяет оставить S3 origin частным, чтобы пользователи получали контент только через CloudFront.
Зачем это спрашивают: Интервьюер проверяет понимание пограничного кеширования, ключей кеша и защищённого доступа к origin.
RDS Multi-AZ повышает доступность, а read replicas прежде всего добавляют ёмкость чтения и отдельные копии.
- Стандартный Multi-AZ deployment синхронно поддерживает standby для управляемого переключения, а не для чтения приложением.
- Read replicas получают изменения асинхронно и могут обслуживать чтение с возможной задержкой репликации.
- Резервные копии всё равно нужны, поскольку репликация может перенести случайные изменения или повреждение в другую копию базы.
Зачем это спрашивают: Сильный ответ разделяет переключение, масштабирование чтения и резервное копирование.
Amazon Aurora отделяет вычислительные инстансы базы от распределённого тома хранения, реплицируемого между зонами доступности.
- Слой хранения поддерживает несколько копий в трёх зонах и автоматически растёт в пределах лимитов сервиса.
- Writer и reader instances подключаются к общему тому кластера вместо отдельных полных копий хранилища.
- Cluster endpoints и replica endpoints направляют соединения по ролям записи и чтения.
Зачем это спрашивают: Интервьюер оценивает понимание общего распределённого хранилища Aurora и модели endpoints.
DynamoDB использует ключ партиционирования для распределения элементов и маршрутизации запросов по внутренним разделам.
- Ключи с высокой кардинальностью и равномерным доступом лучше распределяют хранение и пропускную способность.
- Небольшой набор очень популярных ключей создаёт горячие разделы, даже если общей ёмкости таблицы достаточно.
- Составной первичный ключ добавляет sort key и позволяет хранить несколько упорядоченных элементов для одного значения partition key.
Зачем это спрашивают: Сильный ответ связывает дизайн ключа с распределением, горячими точками и структурой запросов.
BigQuery представляет управляемое аналитическое хранилище данных для масштабных SQL-запросов по колоночным данным.
- Вычисления отделены от управляемого хранилища, поэтому аналитика масштабируется без администрирования серверов базы.
- Колоночное хранение и распределённое выполнение подходят для сканирования, агрегации, отчётности и анализа данных.
- Партиционирование, кластеризация и ограничение сканируемых столбцов уменьшают объём работы и стоимость запросов.
Зачем это спрашивают: Интервьюер проверяет, классифицируете ли вы BigQuery как аналитическую платформу, а не транзакционную базу.
Автоматические резервные копии и журналы транзакций позволяют восстановить управляемую базу на выбранный момент в пределах срока хранения.
- Плановые снимки дают базовые копии, а журналы фиксируют изменения между ними.
- Point-in-time recovery во многих сервисах создаёт восстановленную базу, а не перематывает работающий инстанс на месте.
- Срок хранения, ключи шифрования, межрегиональные копии и тесты восстановления определяют соответствие требованиям.
Зачем это спрашивают: Сильный ответ связывает механику резервного копирования с реальной восстановимостью и целями восстановления.
Закрытые вопросы
- 21
Как EC2 Auto Scaling group управляет вычислительной ёмкостью?
scalingcapacityaws - 22
Чем target tracking, step scaling и scheduled scaling отличаются друг от друга?
scaling - 23
Чем Kubernetes HPA, VPA и Cluster Autoscaler отличаются друг от друга?
kubernetesscaling - 24
Как работают управление параллелизмом и масштабирование serverless?
scalingserverlessconcurrency - 25
Какие метрики полезны для облачного автомасштабирования?
scalingmonitoring - 26
Как роли и политики IAM предоставляют доступ нагрузкам в AWS?
identity-access - 27
Как работает envelope encryption с облачным KMS?
encryption - 28
Что должна предоставлять облачная система управления секретами?
secretssystem-design - 29
Чем облачный WAF отличается от защиты от DDoS?
- 30
Что mTLS добавляет к обычному TLS?
tls - 31
Что такое policy as code и как OPA поддерживает этот подход?
policy - 32
Как работает модель выполнения AWS Lambda?
lambda - 33
Из каких компонентов обычно состоит событийная serverless-архитектура?
eventsserverlessevent-driven - 34
Какую роль API Gateway играет в serverless-архитектуре?
gatewayserverlessapi-gateway - 35
Что вызывает cold start в serverless и как уменьшить его влияние?
serverless - 36
Чем Amazon ECS отличается от Amazon EKS?
kubernetes - 37
Какие обязанности остаются у клиента при использовании GKE или EKS?
kubernetes - 38
Что такое control plane и data plane Kubernetes?
kubernetes - 39
Как Helm и Kustomize управляют конфигурацией Kubernetes?
kubernetesconfighelm - 40
Зачем Terraform хранит state?
terraform - 41
Как Terraform plan и apply входят в процесс IaC?
terraformiac - 42
Что такое stacks и change sets в CloudFormation?
iaccloudformation - 43
Как Pulumi и Crossplane подходят к управлению облачной инфраструктурой?
iac - 44
Что означает GitOps с Argo CD для cloud-native деплоев?
deploymentgitopscloud-native - 45
Какие механизмы снижают стоимость облачных вычислений?
- 46
Почему затраты на хранение и передачу данных важны в управлении стоимостью облака?
- 47
Какие возможности соединяют гибридную облачную среду и управляют ею?
hybrid-cloud - 48
Чем гибридное облако отличается от мультиоблака?
multi-cloudhybrid-cloud - 49
Как метрики, логи и трейсы дополняют друг друга в облачной наблюдаемости?
observabilitymonitoring - 50
Чем CloudWatch, CloudTrail и AWS Config отличаются по задачам наблюдаемости и управления?
observabilityconfig - 51
Как спроектировать региональное e-commerce приложение, которое должно пережить потерю одной зоны доступности?
designavailabilitycloud-regions - 52
У нового API резкие непредсказуемые всплески, а каждый запрос выполняется меньше двух секунд. Что выбрать: Lambda, контейнеры или виртуальные машины?
containersapilambda - 53
Сервис постоянно работает под высокой нагрузкой и требует нестандартных пакетов операционной системы. Какую вычислительную модель вы выберете?
system-design - 54
Как запускать ежедневную вычислительно тяжёлую задачу, которая длится три часа и умеет продолжать работу с контрольной точки?
- 55
У команды четыре stateless-сервиса в контейнерах и мало опыта с Kubernetes. Как выбрать между GKE или EKS и Cloud Run?
kubernetescontainers - 56
Приложение на RDS должно вырасти с 500 до 10 000 запросов в секунду. Как вы подойдёте к слою базы данных?
zero-to-onedatabase - 57
Как организовать глобальную доставку веб-приложения, если статический контент большой, а API и пользовательские данные остаются в одном регионе?
cloud-regionsapi - 58
Как спроектировать загрузку больших файлов клиентами, не масштабируя серверы приложения вместе с размером файлов?
scalingdesign - 59
Всплеск трафика приводит к тайм-аутам синхронной обработки заказов. Как изменить облачную архитектуру?
concurrency - 60
Как изолировать клиентов в облачной SaaS-платформе, не создавая отдельный стек для каждого небольшого клиента?
cloud-modelscloud - 61
Кластер EKS стоит намного дороже ожидаемого, а большинство узлов недогружено. Как сократить расходы?
kubernetes - 62
Lambda использует мало вычислительного времени, но её счёт быстро растёт. Что вы проверите?
lambda - 63
Production RDS стоит дорого, но её нельзя выключить. Как оптимизировать стоимость?
computeoptimization - 64
После изменения платформы расходы на сетевую передачу удвоились. Как найти причину?
- 65
Стоимость объектного хранилища растёт, хотя общий объём данных стабилен. Что вы проверите?
- 66
Централизованное облачное логирование стало одной из крупнейших статей расходов. Как безопасно сократить стоимость?
logging - 67
Компания планирует перенести пятьдесят локальных приложений в облако. Как организовать исследование?
- 68
Как выбрать подход миграции для разных компонентов legacy-приложения?
componentsmigrationscloud-migration - 69
Как перенести большую транзакционную базу в RDS с простоем меньше пятнадцати минут?
databasetransactions - 70
Как перенести тесно связанный монолит на облачные управляемые сервисы без рискованного полного переписывания?
monolithmicroservices - 71
Что нужно создать в cloud landing zone до первой волны миграции?
cloud-migrationlanding-zonemigrations - 72
Как подготовить откат миграции, которая меняет и трафик, и запись данных?
migrationsrollbackcloud-migration - 73
Для миграции нужно перенести сотни терабайт в облако по ограниченному сетевому каналу. Как спланировать передачу?
migrationscloud-migration - 74
Как спроектировать active-passive multi-region сервис для аварийного восстановления?
designcloud-regionsmulti-region - 75
Что нужно решить до включения записи в обоих регионах active-active сервиса?
designcloud-regions - 76
После регионального сбоя workload нужно восстановить за 30 минут с потерей не более пяти минут данных. Какой DR-подход вы предложите?
cloud-regions - 77
Multi-region переключение использует DNS, но клиенты продолжают обращаться к упавшему адресу. Как улучшить архитектуру?
designdnscloud-regions - 78
Как выбрать репликацию данных для multi-region сервиса профилей клиентов?
replicationcloud-regionsmulti-region - 79
Как протестировать региональное переключение в облаке, не превратив учение в неконтролируемый сбой?
cloud-regionsfailover - 80
Как защитить облачные резервные копии от случайного удаления или компрометации production-аккаунта?
backups - 81
Как защитить доступное из интернета облачное приложение, которое хранит чувствительные данные клиентов?
- 82
Workload в одном AWS-аккаунте должен читать конкретный бакет другого аккаунта. Как выдать доступ?
- 83
Несколько Kubernetes workloads используют общие статические облачные учётные данные в Secrets. Как изменить доступ к секретам?
kubernetessecrets - 84
Как сегментировать VPC с публичными API, внутренними сервисами, базами данных и административными инструментами?
networkingdatabaseapi - 85
Регулируемая платформа EKS требует аутентифицированного и зашифрованного трафика между сервисами. Как вы подойдёте к задаче?
encryptionkubernetes - 86
Как запретить командам разворачивать публичные бакеты и workloads с избыточными правами?
deployment - 87
Как снизить риски цепочки поставки контейнеров до деплоя образов в GKE или EKS?
containersdeploymentkubernetes - 88
У кластера EKS публичный API endpoint, а у рабочих узлов публичные адреса. Как усилить архитектуру?
endpointsarchitecturekubernetes - 89
Публичный workload сталкивается с масштабной DDoS-атакой и дорогими запросами уровня приложения. Как спроектировать защиту?
design - 90
У облачного приложения высокая p99 задержка при низкой средней. Как найти архитектурное узкое место?
trackingarchitecturelatency - 91
Автоскейлинг по CPU слишком поздно добавляет мощность для workload с очередью. Что вы измените?
capacityscalingdata-structures - 92
Из-за холодных запусков Lambda API не укладывается в целевую задержку. Как решить проблему?
latencyapilambda - 93
Новые Pods остаются Pending в EKS, хотя cluster autoscaler включён. Как провести диагностику?
scalingkubernetes - 94
CPU RDS загружен умеренно, но запросы приложения ждут подключений к базе. Как решить проблему?
database - 95
У CloudFront низкий cache hit ratio, а origin перегружен. Что вы проверите?
cachingaws - 96
Как выбрать между site-to-site VPN и выделенным облачным соединением для гибридной нагрузки?
- 97
Сеть приобретённой компании пересекается по адресам с вашими облачными VPC. Как соединить окружения?
networking - 98
Как спроектировать DNS resolution между локальными сетями и несколькими облачными VPC?
designdns - 99
Terraform показывает массовый drift после ручных изменений администраторов в production. Как вернуть контроль?
terraformiac - 100
Well-Architected review нашёл десятки облачных рисков. Как расставить приоритеты исправлений?
well-architected