Skip to content

Вопросы на собеседовании: Облачный архитектор

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Middle.

Смотреть пример резюме: Облачный архитектор

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

networking

План адресов VPC задаёт непересекающиеся CIDR-диапазоны с запасом для текущих и будущих подсетей.

  • План должен учитывать зоны доступности, окружения, уровни нагрузок и ожидаемый рост.
  • Диапазоны не должны пересекаться с сетями, которые будут подключены через peering, transit routing, VPN или частные каналы.
  • Документированная схема выделения IP упрощает агрегацию маршрутов, диагностику и дальнейшее расширение.

Зачем это спрашивают: Интервьюер проверяет, считаете ли вы адресный план долгосрочным ограничением связности, а не разовым выбором подсети.

networking

Подсети делят адресное пространство VPC, а таблицы маршрутов определяют доступные направления трафика каждой подсети.

  • Каждая подсеть связана с таблицей, содержащей локальный маршрут VPC и дополнительные направления.
  • Маршрут к internet gateway делает интернет-маршрутизацию возможной для ресурсов публичной подсети с подходящими адресами.
  • Частные подсети обычно отправляют исходящий трафик через NAT и не дают базам или внутренним сервисам прямого маршрута в интернет.

Зачем это спрашивают: Сильный ответ связывает тип подсети с маршрутизацией и не считает, что доступ задаёт само название подсети.

networking

Security groups представляют stateful-контроль на уровне ресурса, а network ACL представляют stateless-контроль на уровне подсети.

  • Security group автоматически разрешает ответный трафик для допустимого соединения и содержит разрешающие правила.
  • Network ACL отдельно проверяет входящие и исходящие правила по номеру и может явно разрешать или запрещать трафик.
  • Security groups служат основной границей нагрузки, а ACL добавляют грубые ограничения подсети.

Зачем это спрашивают: Интервьюер оценивает понимание области, учёта состояния и поведения правил обоих средств.

networking

VPC peering создаёт связь по частным IP между двумя VPC через сеть провайдера.

  • Маршруты нужно добавить с обеих сторон, а средства безопасности должны разрешать нужный трафик.
  • Peering не поддерживает пересекающиеся CIDR и транзитную маршрутизацию через третью VPC.
  • Большими peering-сетями сложно управлять, потому что каждой нужной паре VPC требуются отдельная связь и маршруты.

Зачем это спрашивают: Сильный ответ учитывает нетранзитивность и запрет пересекающихся диапазонов, которые определяют топологию peering.

gateway

AWS Transit Gateway предоставляет региональный узел маршрутизации между множеством VPC и локальных сетей.

  • Подключения VPC, VPN и Direct Connect соединяются с узлом вместо построения полной сетки.
  • Таблицы маршрутов Transit Gateway могут сегментировать подключения и управлять доступностью сетей друг для друга.
  • Централизованная маршрутизация сокращает число связей, но адресный план и распространение маршрутов всё равно требуют управления.

Зачем это спрашивают: Интервьюер проверяет понимание Transit Gateway как управляемого узла маршрутизации с контролем сегментации.

AWS PrivateLink открывает сервис через частные interface endpoints без объединения сетей потребителя и провайдера.

  • Провайдер публикует endpoint service, обычно за Network Load Balancer.
  • Потребитель создаёт interface endpoints с частными IP-адресами в выбранных подсетях.
  • Трафик остаётся в сети AWS, а диапазоны VPC могут пересекаться, поскольку полная двусторонняя маршрутизация не создаётся.

Зачем это спрашивают: Сильный ответ отличает частную публикацию сервиса от peering целой сети.

gatewaynetworking

Internet gateway обеспечивает прямую интернет-маршрутизацию VPC, а NAT gateway позволяет частным IPv4-ресурсам создавать исходящие соединения с преобразованием адресов.

  • Публичному ресурсу нужны маршрут к internet gateway, публичный адрес и подходящие правила безопасности.
  • Частные ресурсы отправляют IPv4-трафик в интернет через NAT gateway в публичной подсети.
  • NAT gateway не принимает незапрошенные входящие соединения, созданные из интернета.

Зачем это спрашивают: Интервьюер оценивает понимание прямой публичной маршрутизации и преобразованного доступа только наружу.

Site-to-site VPN шифрует трафик поверх публичного интернета, а выделенное подключение использует частный канал провайдера.

  • VPN быстрее подключить, и он часто служит резервным или менее нагруженным гибридным соединением.
  • AWS Direct Connect и Google Cloud Interconnect дают более предсказуемые пропускную способность и задержку, чем интернет-маршруты.
  • Выделенным линиям всё равно нужны резервные каналы, продуманная маршрутизация и часто VPN для шифрования или резерва.

Зачем это спрашивают: Сильный ответ различает пути передачи и эксплуатационные свойства, не превращая вопрос в сценарий выбора.

dns

Частная DNS-зона разрешает выбранные доменные имена только для связанных частных сетей.

  • Она сопоставляет внутренние имена сервисов с частными адресами или endpoints, не публикуя их в публичном DNS.
  • Привязки или правила пересылки расширяют разрешение имён между VPC, проектами и гибридными сетями.
  • Split-horizon DNS может возвращать разные записи одного имени в зависимости от частного или публичного источника запроса.

Зачем это спрашивают: Интервьюер проверяет понимание внутреннего разрешения имён и его связей с сетями.

gatewayendpointstypes

Gateway endpoints добавляют маршруты к поддерживаемым сервисам AWS, а interface endpoints создают частные сетевые интерфейсы на основе PrivateLink.

  • Gateway endpoints поддерживают Amazon S3 и DynamoDB и не требуют NAT для подходящего трафика.
  • Interface endpoints предоставляют частные IP и DNS для многих сервисов AWS и пользовательских endpoint services.
  • Endpoint policies, security groups там, где они применимы, маршрутизация и private DNS управляют доступными операциями сервиса.

Зачем это спрашивают: Сильный ответ отличает модель на основе маршрута от модели на основе сетевого интерфейса.

cloud-storage

Объектное, блочное и файловое хранилища предоставляют разные модели данных и интерфейсы доступа.

  • Объектное хранилище использует объекты с доступом по API и метаданными и подходит для медиа, резервных копий, логов и озёр данных.
  • Блочное хранилище предоставляет тома одному или нескольким поддерживаемым вычислительным инстансам для файловых систем и баз.
  • Файловое хранилище предоставляет общие иерархические файлы по протоколам вроде NFS или SMB.

Зачем это спрашивают: Интервьюер проверяет, можете ли вы классифицировать облачное хранилище по модели доступа и характеру нагрузки.

Уровни объектного хранения тарифицируют хранение данных с учётом частоты доступа, способа извлечения и ожидаемого срока.

  • Уровни частого доступа имеют более высокую стоимость хранения и немедленный доступ, а архивные уровни снижают стоимость с ограничениями извлечения.
  • Lifecycle policies перемещают объекты между уровнями или удаляют их по возрасту и метаданным.
  • Минимальный срок, плата за извлечение и запросы и время восстановления влияют на реальную стоимость холодных уровней.

Зачем это спрашивают: Сильный ответ идёт дальше названий уровней и объясняет стоящие за ними стоимость и извлечение.

replicationcloud-regionscloud-storage

Версионирование сохраняет редакции объектов, а межрегиональная репликация копирует подходящие объекты в бакет другого региона.

  • Версионирование помогает восстановиться после случайной перезаписи или удаления, но увеличивает объём хранения.
  • Репликация создаёт отдельную региональную копию для локальности, требований или целей восстановления.
  • Репликации нужны права, версионирование, мониторинг и явная обработка существующих объектов и удаления.

Зачем это спрашивают: Интервьюер оценивает, отличаете ли вы историю объекта от регионального дублирования.

snapshot

Снимок блочного хранилища сохраняет состояние тома на определённый момент в управляемом долговечном хранилище провайдера.

  • Облачные снимки обычно инкрементальны, поэтому последующие снимки хранят изменённые блоки, оставаясь независимо восстанавливаемыми.
  • Восстановление создаёт новый том, а производительность первых чтений может отличаться, пока блоки не будут загружены.
  • Для согласованного снимка приложения нужна координация с файловой системой или базой, а не только crash-consistent образ тома.

Зачем это спрашивают: Сильный ответ учитывает инкрементальность, поведение восстановления и согласованность приложения.

cachingaws

Amazon CloudFront отдаёт кешируемый контент через распределённые пограничные узлы перед origin.

  • Ключ кеша обычно включает путь и выбранные query strings, заголовки или cookie.
  • TTL и заголовки cache-control определяют свежесть, а invalidation досрочно удаляет выбранные объекты.
  • Origin Access Control позволяет оставить S3 origin частным, чтобы пользователи получали контент только через CloudFront.

Зачем это спрашивают: Интервьюер проверяет понимание пограничного кеширования, ключей кеша и защищённого доступа к origin.

replicationdeployment

RDS Multi-AZ повышает доступность, а read replicas прежде всего добавляют ёмкость чтения и отдельные копии.

  • Стандартный Multi-AZ deployment синхронно поддерживает standby для управляемого переключения, а не для чтения приложением.
  • Read replicas получают изменения асинхронно и могут обслуживать чтение с возможной задержкой репликации.
  • Резервные копии всё равно нужны, поскольку репликация может перенести случайные изменения или повреждение в другую копию базы.

Зачем это спрашивают: Сильный ответ разделяет переключение, масштабирование чтения и резервное копирование.

distinctarchitecture

Amazon Aurora отделяет вычислительные инстансы базы от распределённого тома хранения, реплицируемого между зонами доступности.

  • Слой хранения поддерживает несколько копий в трёх зонах и автоматически растёт в пределах лимитов сервиса.
  • Writer и reader instances подключаются к общему тому кластера вместо отдельных полных копий хранилища.
  • Cluster endpoints и replica endpoints направляют соединения по ролям записи и чтения.

Зачем это спрашивают: Интервьюер оценивает понимание общего распределённого хранилища Aurora и модели endpoints.

dynamodbpartitioning

DynamoDB использует ключ партиционирования для распределения элементов и маршрутизации запросов по внутренним разделам.

  • Ключи с высокой кардинальностью и равномерным доступом лучше распределяют хранение и пропускную способность.
  • Небольшой набор очень популярных ключей создаёт горячие разделы, даже если общей ёмкости таблицы достаточно.
  • Составной первичный ключ добавляет sort key и позволяет хранить несколько упорядоченных элементов для одного значения partition key.

Зачем это спрашивают: Сильный ответ связывает дизайн ключа с распределением, горячими точками и структурой запросов.

bigquerydesign

BigQuery представляет управляемое аналитическое хранилище данных для масштабных SQL-запросов по колоночным данным.

  • Вычисления отделены от управляемого хранилища, поэтому аналитика масштабируется без администрирования серверов базы.
  • Колоночное хранение и распределённое выполнение подходят для сканирования, агрегации, отчётности и анализа данных.
  • Партиционирование, кластеризация и ограничение сканируемых столбцов уменьшают объём работы и стоимость запросов.

Зачем это спрашивают: Интервьюер проверяет, классифицируете ли вы BigQuery как аналитическую платформу, а не транзакционную базу.

databasebackups

Автоматические резервные копии и журналы транзакций позволяют восстановить управляемую базу на выбранный момент в пределах срока хранения.

  • Плановые снимки дают базовые копии, а журналы фиксируют изменения между ними.
  • Point-in-time recovery во многих сервисах создаёт восстановленную базу, а не перематывает работающий инстанс на месте.
  • Срок хранения, ключи шифрования, межрегиональные копии и тесты восстановления определяют соответствие требованиям.

Зачем это спрашивают: Сильный ответ связывает механику резервного копирования с реальной восстановимостью и целями восстановления.

Закрытые вопросы

  • 21

    Как EC2 Auto Scaling group управляет вычислительной ёмкостью?

    scalingcapacityaws
  • 22

    Чем target tracking, step scaling и scheduled scaling отличаются друг от друга?

    scaling
  • 23

    Чем Kubernetes HPA, VPA и Cluster Autoscaler отличаются друг от друга?

    kubernetesscaling
  • 24

    Как работают управление параллелизмом и масштабирование serverless?

    scalingserverlessconcurrency
  • 25

    Какие метрики полезны для облачного автомасштабирования?

    scalingmonitoring
  • 26

    Как роли и политики IAM предоставляют доступ нагрузкам в AWS?

    identity-access
  • 27

    Как работает envelope encryption с облачным KMS?

    encryption
  • 28

    Что должна предоставлять облачная система управления секретами?

    secretssystem-design
  • 29

    Чем облачный WAF отличается от защиты от DDoS?

  • 30

    Что mTLS добавляет к обычному TLS?

    tls
  • 31

    Что такое policy as code и как OPA поддерживает этот подход?

    policy
  • 32

    Как работает модель выполнения AWS Lambda?

    lambda
  • 33

    Из каких компонентов обычно состоит событийная serverless-архитектура?

    eventsserverlessevent-driven
  • 34

    Какую роль API Gateway играет в serverless-архитектуре?

    gatewayserverlessapi-gateway
  • 35

    Что вызывает cold start в serverless и как уменьшить его влияние?

    serverless
  • 36

    Чем Amazon ECS отличается от Amazon EKS?

    kubernetes
  • 37

    Какие обязанности остаются у клиента при использовании GKE или EKS?

    kubernetes
  • 38

    Что такое control plane и data plane Kubernetes?

    kubernetes
  • 39

    Как Helm и Kustomize управляют конфигурацией Kubernetes?

    kubernetesconfighelm
  • 40

    Зачем Terraform хранит state?

    terraform
  • 41

    Как Terraform plan и apply входят в процесс IaC?

    terraformiac
  • 42

    Что такое stacks и change sets в CloudFormation?

    iaccloudformation
  • 43

    Как Pulumi и Crossplane подходят к управлению облачной инфраструктурой?

    iac
  • 44

    Что означает GitOps с Argo CD для cloud-native деплоев?

    deploymentgitopscloud-native
  • 45

    Какие механизмы снижают стоимость облачных вычислений?

  • 46

    Почему затраты на хранение и передачу данных важны в управлении стоимостью облака?

  • 47

    Какие возможности соединяют гибридную облачную среду и управляют ею?

    hybrid-cloud
  • 48

    Чем гибридное облако отличается от мультиоблака?

    multi-cloudhybrid-cloud
  • 49

    Как метрики, логи и трейсы дополняют друг друга в облачной наблюдаемости?

    observabilitymonitoring
  • 50

    Чем CloudWatch, CloudTrail и AWS Config отличаются по задачам наблюдаемости и управления?

    observabilityconfig
  • 51

    Как спроектировать региональное e-commerce приложение, которое должно пережить потерю одной зоны доступности?

    designavailabilitycloud-regions
  • 52

    У нового API резкие непредсказуемые всплески, а каждый запрос выполняется меньше двух секунд. Что выбрать: Lambda, контейнеры или виртуальные машины?

    containersapilambda
  • 53

    Сервис постоянно работает под высокой нагрузкой и требует нестандартных пакетов операционной системы. Какую вычислительную модель вы выберете?

    system-design
  • 54

    Как запускать ежедневную вычислительно тяжёлую задачу, которая длится три часа и умеет продолжать работу с контрольной точки?

  • 55

    У команды четыре stateless-сервиса в контейнерах и мало опыта с Kubernetes. Как выбрать между GKE или EKS и Cloud Run?

    kubernetescontainers
  • 56

    Приложение на RDS должно вырасти с 500 до 10 000 запросов в секунду. Как вы подойдёте к слою базы данных?

    zero-to-onedatabase
  • 57

    Как организовать глобальную доставку веб-приложения, если статический контент большой, а API и пользовательские данные остаются в одном регионе?

    cloud-regionsapi
  • 58

    Как спроектировать загрузку больших файлов клиентами, не масштабируя серверы приложения вместе с размером файлов?

    scalingdesign
  • 59

    Всплеск трафика приводит к тайм-аутам синхронной обработки заказов. Как изменить облачную архитектуру?

    concurrency
  • 60

    Как изолировать клиентов в облачной SaaS-платформе, не создавая отдельный стек для каждого небольшого клиента?

    cloud-modelscloud
  • 61

    Кластер EKS стоит намного дороже ожидаемого, а большинство узлов недогружено. Как сократить расходы?

    kubernetes
  • 62

    Lambda использует мало вычислительного времени, но её счёт быстро растёт. Что вы проверите?

    lambda
  • 63

    Production RDS стоит дорого, но её нельзя выключить. Как оптимизировать стоимость?

    computeoptimization
  • 64

    После изменения платформы расходы на сетевую передачу удвоились. Как найти причину?

  • 65

    Стоимость объектного хранилища растёт, хотя общий объём данных стабилен. Что вы проверите?

  • 66

    Централизованное облачное логирование стало одной из крупнейших статей расходов. Как безопасно сократить стоимость?

    logging
  • 67

    Компания планирует перенести пятьдесят локальных приложений в облако. Как организовать исследование?

  • 68

    Как выбрать подход миграции для разных компонентов legacy-приложения?

    componentsmigrationscloud-migration
  • 69

    Как перенести большую транзакционную базу в RDS с простоем меньше пятнадцати минут?

    databasetransactions
  • 70

    Как перенести тесно связанный монолит на облачные управляемые сервисы без рискованного полного переписывания?

    monolithmicroservices
  • 71

    Что нужно создать в cloud landing zone до первой волны миграции?

    cloud-migrationlanding-zonemigrations
  • 72

    Как подготовить откат миграции, которая меняет и трафик, и запись данных?

    migrationsrollbackcloud-migration
  • 73

    Для миграции нужно перенести сотни терабайт в облако по ограниченному сетевому каналу. Как спланировать передачу?

    migrationscloud-migration
  • 74

    Как спроектировать active-passive multi-region сервис для аварийного восстановления?

    designcloud-regionsmulti-region
  • 75

    Что нужно решить до включения записи в обоих регионах active-active сервиса?

    designcloud-regions
  • 76

    После регионального сбоя workload нужно восстановить за 30 минут с потерей не более пяти минут данных. Какой DR-подход вы предложите?

    cloud-regions
  • 77

    Multi-region переключение использует DNS, но клиенты продолжают обращаться к упавшему адресу. Как улучшить архитектуру?

    designdnscloud-regions
  • 78

    Как выбрать репликацию данных для multi-region сервиса профилей клиентов?

    replicationcloud-regionsmulti-region
  • 79

    Как протестировать региональное переключение в облаке, не превратив учение в неконтролируемый сбой?

    cloud-regionsfailover
  • 80

    Как защитить облачные резервные копии от случайного удаления или компрометации production-аккаунта?

    backups
  • 81

    Как защитить доступное из интернета облачное приложение, которое хранит чувствительные данные клиентов?

  • 82

    Workload в одном AWS-аккаунте должен читать конкретный бакет другого аккаунта. Как выдать доступ?

  • 83

    Несколько Kubernetes workloads используют общие статические облачные учётные данные в Secrets. Как изменить доступ к секретам?

    kubernetessecrets
  • 84

    Как сегментировать VPC с публичными API, внутренними сервисами, базами данных и административными инструментами?

    networkingdatabaseapi
  • 85

    Регулируемая платформа EKS требует аутентифицированного и зашифрованного трафика между сервисами. Как вы подойдёте к задаче?

    encryptionkubernetes
  • 86

    Как запретить командам разворачивать публичные бакеты и workloads с избыточными правами?

    deployment
  • 87

    Как снизить риски цепочки поставки контейнеров до деплоя образов в GKE или EKS?

    containersdeploymentkubernetes
  • 88

    У кластера EKS публичный API endpoint, а у рабочих узлов публичные адреса. Как усилить архитектуру?

    endpointsarchitecturekubernetes
  • 89

    Публичный workload сталкивается с масштабной DDoS-атакой и дорогими запросами уровня приложения. Как спроектировать защиту?

    design
  • 90

    У облачного приложения высокая p99 задержка при низкой средней. Как найти архитектурное узкое место?

    trackingarchitecturelatency
  • 91

    Автоскейлинг по CPU слишком поздно добавляет мощность для workload с очередью. Что вы измените?

    capacityscalingdata-structures
  • 92

    Из-за холодных запусков Lambda API не укладывается в целевую задержку. Как решить проблему?

    latencyapilambda
  • 93

    Новые Pods остаются Pending в EKS, хотя cluster autoscaler включён. Как провести диагностику?

    scalingkubernetes
  • 94

    CPU RDS загружен умеренно, но запросы приложения ждут подключений к базе. Как решить проблему?

    database
  • 95

    У CloudFront низкий cache hit ratio, а origin перегружен. Что вы проверите?

    cachingaws
  • 96

    Как выбрать между site-to-site VPN и выделенным облачным соединением для гибридной нагрузки?

  • 97

    Сеть приобретённой компании пересекается по адресам с вашими облачными VPC. Как соединить окружения?

    networking
  • 98

    Как спроектировать DNS resolution между локальными сетями и несколькими облачными VPC?

    designdns
  • 99

    Terraform показывает массовый drift после ручных изменений администраторов в production. Как вернуть контроль?

    terraformiac
  • 100

    Well-Architected review нашёл десятки облачных рисков. Как расставить приоритеты исправлений?

    well-architected