Skip to content

Вопросы на собеседовании: GCP-инженер

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Senior Cloud-инженер.

Смотреть пример резюме: GCP-инженер

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

kubernetes

Я бы начал с Autopilot, потому что эти нагрузки подходят для его управляемой модели и не требуют контроля над узлами.

  • Google управляет узлами, масштабированием и многими настройками безопасности, но я все равно проверил бы нужные DaemonSets и admission policies на совместимость с ограничениями Autopilot.
  • Для general-purpose workloads на стандартной платформе Autopilot или в ComputeClasses Balanced и Scale-Out действует Pod-based billing по resource requests, поэтому их нужно точно подобрать.
  • Нагрузки с выбранными machine series или accelerators используют node-based billing за целые узлы плюс management premium Autopilot.
  • Standard я бы выбрал для привилегированного доступа к хостам, специальной настройки узлов или более точного контроля времени обновлений.

Зачем это спрашивают: Интервьюер оценивает, выбирает ли кандидат режим GKE по ограничениям нагрузки и стоимости эксплуатации, а не считает ли Autopilot всегда лучшим.

configkubernetes

Я бы использовал региональный кластер GKE с рабочими узлами как минимум в трех зонах.

  • Control plane реплицируется между зонами, поэтому отказ одной зоны не лишает кластер доступа к Kubernetes API.
  • Node pools я бы рассчитал так, чтобы после потери зоны оставшейся емкости хватало для requests критичных приложений.
  • Число региональных узлов и квоты могут умножаться на количество зон, поэтому до создания я бы проверил итоговое число узлов и стоимость.
  • Для приложений я бы также задал topology spread constraints и выбрал реплицируемое хранилище под требуемый уровень доступности.

Зачем это спрашивают: Интервьюер хочет увидеть, что кандидат учитывает доступность и control plane, и рабочей нагрузки, а не полагается только на тип регионального кластера.

system-designdesignbatch

Я бы разделил эти классы нагрузки по node pools с явными labels, taints и tolerations.

  • Небольшой системный пул на обычных VM размещал бы DNS, метрики и контроллеры, чтобы batch-нагрузка не вытесняла сервисы кластера.
  • Обычные API работали бы в general-purpose пуле на непрерываемых VM, подобранных под их профиль CPU и памяти.
  • Batch-задачи допускали бы Spot VM и корректно обрабатывали остановку, снижая стоимость без ущерба для доступности API.
  • У каждого пула были бы собственные границы автомасштабирования, настройки обновлений и типы машин, поскольку одна политика не подходит всем нагрузкам.

Зачем это спрашивают: Интервьюер проверяет, использует ли кандидат node pools для практической изоляции стоимости, надежности и требований к оборудованию.

kubernetesapimemory

Начальные requests я бы получил из нагрузочных тестов и наблюдаемых перцентилей, а затем уточнил по продакшн-метрикам.

  • Requests должны покрывать обычное потребление CPU и памяти, поскольку scheduler и cluster autoscaler используют их при размещении.
  • Лимит памяти я бы установил выше рабочего набора, чтобы сдерживать утечки, понимая, что превышение приведет к OOM kill.
  • Для чувствительного к задержке API я бы избегал жесткого CPU limit, поскольку CFS throttling ухудшает время ответа даже при свободном CPU на узле.
  • Перед изменением значений я бы настроил алерты на throttling, OOM kills и отношение requests к фактическому потреблению.

Зачем это спрашивают: Интервьюер проверяет понимание влияния ресурсов на планирование, стоимость, throttling и автомасштабирование.

httpdata-structures

Я бы поручил HPA менять число реплик по сигналам трафика, а VPA сначала использовал бы в режиме рекомендаций для подбора ресурсов.

  • HPA мог бы учитывать CPU utilization и внешнюю метрику глубины очереди, чтобы реагировать до накопления запросов.
  • Процент CPU считается относительно CPU requests, поэтому нереалистичные requests сделают поведение HPA таким же нереалистичным.
  • Я бы не разрешал VPA автоматически менять тот же ресурс CPU или памяти, по которому масштабирует HPA, иначе два контура начнут конфликтовать.
  • Изучив рекомендации, я бы обновлял requests через деплой или оставил VPA только для ресурса, который HPA не использует.

Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат совмещать автомасштабирование подов без конфликтующих контуров управления.

configkubernetesreplication

Я бы задал минимум и максимум узлов каждого пула с учетом резервной емкости, квот и размера самого крупного пода.

  • Cluster autoscaler добавляет узлы, когда поды не размещаются из-за requests, а не просто при высоком среднем CPU узлов.
  • В пуле должен быть тип машины, на котором помещается самый крупный под, иначе реплики останутся pending даже до достижения максимума узлов.
  • Если запуск узла слишком медленный для всплеска, я бы оставил небольшой резерв или использовал overprovisioning-поды.
  • Настройки scale-down должны учитывать PDB и долгие задачи, чтобы экономия не создавала лишних прерываний.

Зачем это спрашивают: Интервьюер проверяет понимание сигнала планирования и ограничений емкости, на которых основано масштабирование кластера.

kubernetesreplication

Я бы совместил PodDisruptionBudget с topology spread constraints по зонам и узлам.

  • PDB с maxUnavailable: 1 сохраняет две реплики при добровольных прерываниях, например при drain узла.
  • Ограничение по зонам с maxSkew: 1 не дает всем репликам попасть в один домен отказа.
  • Ограничение по hostname снижает вероятность размещения двух реплик на одном узле.
  • Я бы проверил наличие свободной емкости, поскольку строгий PDB защищает доступность, но блокирует drain, если новый под негде разместить.

Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат защиту от прерываний от реального размещения реплик и наличия емкости.

kubernetesidentityobject-storage

Я бы использовал Workload Identity Federation for GKE и связал Kubernetes-нагрузку с IAM-идентичностью с минимальными правами.

  • Под получает краткоживущие учетные данные через metadata path GKE вместо подключения JSON-ключа.
  • Я бы выдал objectViewer только на нужный бакет, а не проектную роль для всего Cloud Storage.
  • Namespace и Kubernetes service account были бы выделены этому приложению, чтобы граница principal оставалась ясной.
  • Я бы проверил binding из пода и убедился, что legacy metadata access или секреты с ключами не остались резервным способом входа.

Зачем это спрашивают: Интервьюер хочет увидеть, умеет ли кандидат реализовать в GKE беспарольную аутентификацию в GCP с правами на уровне конкретной нагрузки.

kubernetessqlapi

Я бы применил default-deny NetworkPolicies для ingress и egress, а затем добавил узкие разрешения для нужных путей.

  • API и внутренний сервис выбирались бы по labels подов и namespace, а не по меняющимся IP подов.
  • Отдельное egress-правило разрешало бы kube-dns по UDP и TCP 53, чтобы продолжал работать DNS.
  • Доступ к Cloud SQL был бы ограничен путем через connector или private endpoint и необходимым портом.
  • Я бы использовал enforcement через GKE Dataplane V2 и помнил, что VPC firewall rules продолжают управлять трафиком вне кластера.

Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат построить рабочий allowlist и понимает ли границу между средствами Kubernetes и VPC.

kuberneteshttpapi

Я бы выбрал Gateway API, потому что он лучше разделяет владение балансировщиком и маршрутами отдельных приложений.

  • Платформенная команда может владеть Gateway и TLS policy, а команды приложений подключать HTTPRoutes в своих namespaces.
  • Правила подключения маршрутов явно оформляют делегирование между namespaces вместо одного большого общего Ingress.
  • GKE Ingress я бы сохранил для простого существующего приложения, если поддерживаемые annotations уже закрывают все требования.
  • Перед миграцией я бы сравнил конкретные возможности GKE GatewayClass для сертификатов, redirects и backend policies.

Зачем это спрашивают: Интервьюер проверяет, выбирает ли кандидат L7 API по требованиям к владению и функциям, а не по новизне.

deploymentartifactsregistries

Я бы продвигал между окружениями один неизменяемый digest образа, а не пересобирал его для каждого окружения.

  • Cloud Build отправлял бы образ в региональный Docker-репозиторий рядом с нагрузками и записывал sha256 digest.
  • Deployment manifests ссылались бы на digest, поэтому перенос тега не мог бы незаметно изменить production.
  • Право записи было бы только у build identities, а runtime identities получили бы repository reader.
  • Cleanup policies сохраняли бы выпущенные и недавно использованные образы, удаляя старые untagged-артефакты сборок.

Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат организовать продвижение артефактов с учетом происхождения, минимальных прав и роста хранилища.

deploymentci-cdkubernetes

Я бы включил Binary Authorization с attestations, которые создаются только после успешной одобренной сборки и проверок безопасности.

  • Пайплайн подписывал бы digest образа, а не изменяемый тег, с помощью защищенного ключа attestor.
  • Production policy требовала бы эту attestation и разрешала только явно одобренные registries.
  • Сначала я бы запустил policy в режиме аудита, чтобы найти системные образы и законные исключения до включения enforcement.
  • Break-glass деплой требовал бы контролируемой причины, узкого IAM-доступа и последующего аудита, а не постоянного обхода.

Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат превратить происхождение контейнера в обязательный контроль деплоя с безопасным внедрением.

deploymenthelmkubernetes

Я бы использовал Helm для переиспользуемого пакета приложения, а Kustomize для небольших environment overlays, если оба инструмента действительно полезны.

  • Helm chart подходит для повторяющихся объектов, опциональных компонентов и версионированных релизов для нескольких команд.
  • Kustomize подходит для patches вроде числа реплик, имен проектов и ссылок на Gateway без превращения каждого поля в параметр шаблона.
  • Для простого приложения я бы выбрал один инструмент, поскольку многоступенчатый рендеринг усложняет проверку итогового manifest.
  • CI рендерил бы каждое окружение и валидировал готовый YAML до передачи в Argo CD или Cloud Deploy.

Зачем это спрашивают: Интервьюер хочет увидеть поддерживаемый выбор конфигурации, а не автоматическое нагромождение инструментов.

designnetworkingci-cd

Я бы использовал региональный private pool Cloud Build, подключенный к VPC с приватными зависимостями.

  • Сетевой путь и firewall rules пула разрешали бы только репозиторий, зеркало пакетов, Artifact Registry и нужные Google APIs.
  • Если нужны публичные зависимости, я бы зеркалировал их или использовал одобренный proxy, поскольку отключение внешних IP у workers убирает прямой доступ в интернет.
  • Build service account имел бы узкие роли для артефактов и логов без широкой проектной роли Editor.
  • Размер машин и concurrency пула я бы определил по измеренному спросу на сборки, поскольку емкость private pool напрямую влияет на стоимость.

Зачем это спрашивают: Интервьюер оценивает понимание приватной связности сборок, идентичности, egress и компромиссов емкости.

deploymentkubernetesapi

Я бы создал delivery pipeline Cloud Deploy с canary strategy и явным подтверждением перед полным rollout.

  • Skaffold рендерил бы один и тот же релизный артефакт для target без пересборки между процентами.
  • Canary phases переводили бы 10%, затем 30% и 100% через поддерживаемую сетевую конфигурацию GKE-сервиса.
  • Verification jobs сравнивали бы error rate и latency со стабильной версией на каждой фазе.
  • Ошибка verification останавливает продвижение, но сама не возвращает стабильный трафик, поэтому я бы явно запускал rollback или заранее настроил repair automation Cloud Deploy по заданным критериям.

Зачем это спрашивают: Интервьюер проверяет, может ли кандидат описать контролируемую постепенную поставку, а не только назвать canary deployment.

gitgitopskubernetes

Я бы сделал Git источником desired state и выдал Argo CD только необходимые права в закрепленных за ним namespaces.

  • Отдельные проекты Argo CD ограничивали бы разрешенные репозитории, destinations, namespaces и виды ресурсов каждой команды.
  • Protected branches и проверенные pull requests контролировали бы production-изменения до reconciliation.
  • Auto-sync мог бы работать в окружениях низкого риска, а production использовал бы sync windows или явное продвижение по принятой policy.
  • Drift был бы виден в Argo CD, а экстренные ручные изменения либо откатывались бы, либо сразу фиксировались обратно в Git.

Зачем это спрашивают: Интервьюер оценивает практический контроль доступа и владения изменениями в GitOps, а не только механизм reconciliation.

containersconfigkubernetes

Я бы хранил environment-конфигурацию вне образа и рендерил версионированные ConfigMaps через deployment pipeline.

  • Один digest образа проходил бы через dev и production, а overlays задавали endpoints, flags и настройки ресурсов.
  • Checksum ConfigMap помещался бы в pod template, чтобы изменение конфигурации запускало контролируемый rollout.
  • Крупную или часто меняющуюся конфигурацию я бы передавал через отдельный configuration service или mounted file, а не сотни environment variables.
  • Schema validation в CI отклоняла бы отсутствующие ключи и неверные значения до принятия manifest Kubernetes.

Зачем это спрашивают: Интервьюер проверяет, отделяет ли кандидат build artifacts от environment-конфигурации и делает ли изменения безопасно наблюдаемыми.

secretspasswordskubernetes

Я бы использовал Secret Manager add-on или CSI driver вместе с Workload Identity Federation for GKE и никогда не хранил пароль в Git.

  • Роль roles/secretmanager.secretAccessor я бы выдал workload principal на сам ресурс секрета, потому что IAM-доступ нельзя назначить отдельной версии секрета.
  • В SecretProviderClass или конфигурации add-on я бы указал явную версию ресурса, например versions/7, вместо latest, чтобы потребляемое значение было детерминированным.
  • При ротации я бы создал новые учетные данные БД и версию секрета, обновил закрепленную ссылку, перезапустил и проверил consumers и только затем отключил старые данные и версию.
  • Data Access logs Secret Manager подтвердили бы, какой principal прочитал значение во время замены.

Зачем это спрашивают: Интервьюер оценивает полный процесс доставки секрета, минимальные права и ротацию, а не только место его хранения.

networking

Я бы разместил VPC, подсети, маршруты и центральные firewall controls в host project и подключил три service projects.

  • Ресурсы приложений остаются в service projects для разделения billing и IAM, но используют подсети host project.
  • Network administrators управляют host, а deployers приложений получают только Network User на нужных подсетях.
  • Я бы выделил непересекающиеся региональные CIDR с запасом для GKE pods, services и будущего роста.
  • Центральное владение не заменяет IAM в service projects, поэтому права на ресурсы и сеть остаются разными зонами ответственности.

Зачем это спрашивают: Интервьюер проверяет понимание владения Shared VPC, делегированного использования и планирования адресов.

networkingssh

Я бы применил общий deny на уровне папки и добавил более приоритетное узкое разрешение для одобренного пути администрирования.

  • Allow rule выбирало бы защищенные ресурсы по service accounts или secure tags, а не по широкому сетевому CIDR.
  • SSH из 0.0.0.0/0 запрещался бы централизованно, чтобы владельцы проектов не обходили правило через VPC rule нижнего уровня.
  • Приоритеты и наследование правил были бы документированы, поскольку совпадение на верхнем уровне может не дать сработать дочерним policies.
  • До применения ко всей папке я бы проверил влияние policy на непродакшн-проекте.

Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат применять наследуемые сетевые ограничения без удаления законного делегированного доступа.

Закрытые вопросы

  • 21

    Приватные VM без внешних IP должны обращаться к Cloud Storage и Artifact Registry. Какой сетевой путь настроить?

    configartifactsregistries
  • 22

    Consumer VPC должна обращаться к управляемому сервису в producer VPC без peering двух сетей. Как использовать Private Service Connect?

    networkingprivate-connectivity
  • 23

    Приватный node pool GKE открывает много коротких исходящих соединений. Как рассчитать Cloud NAT?

    networkingkubernetes
  • 24

    Компании сейчас нужна гибридная связь на 2 Gbps, а через год ожидается 10 Gbps. Как выбрать между HA VPN и Cloud Interconnect?

    hybrid-networking
  • 25

    Две VPC должны разрешать имена из приватной зоны центральной DNS VPC. Как спроектировать Cloud DNS peering?

    designdnsnetworking
  • 26

    Как анонсировать подсети GCP двум on-premises роутерам, предпочитая один гибридный путь, но сохраняя failover?

    networking
  • 27

    Какие балансировщики Google Cloud выбрать для публичного HTTPS API, приватного HTTP-сервиса и UDP endpoint игры?

    httphttpsendpoints
  • 28

    Сервису деплоя нужны 14 permissions, но ни одна predefined IAM role не подходит. Как создать и поддерживать custom role?

    deployment
  • 29

    Как разрешить подрядчикам администрировать тестовые ресурсы только до заданной даты и сохранить audit logs, даже если администратор проекта действует злоумышленно?

  • 30

    GitHub Actions должен деплоить в GCP без ключа сервисного аккаунта, а инженерам иногда нужна та же deployment identity. Как настроить доступ?

    ci-cddeploymentconfig
  • 31

    Команда говорит, что VPC Service Controls заменит IAM и firewall rules вокруг BigQuery и Cloud Storage. Как исправить дизайн?

    designnetworkingobject-storage
  • 32

    Публичному приложению за Google Cloud Application Load Balancer нужна WAF-защита и rate limiting входа. Как настроить Cloud Armor?

    load-balancingrate-limitingconfig
  • 33

    Как открыть внутреннее административное веб-приложение сотрудникам без публичных IP у VM и без VPN для всех?

  • 34

    Как внедрить Security Command Center для папки с 20 GCP-проектами и не перегрузить команды findings?

  • 35

    Как спроектировать Terraform modules для повторяющихся GCP-проектов без одного гигантского platform module?

    terraformdesign
  • 36

    У компании есть Terraform stacks для dev, staging и production. Как изолировать их state?

    terraform
  • 37

    Нужно взять существующую VPC под управление Terraform, а затем переименовать адрес ее ресурса без пересоздания. Что вы сделаете?

    networkingterraform
  • 38

    Как фиксировать версии Terraform и Google provider, но продолжать получать исправления?

    terraform
  • 39

    Какие проверки нужны в CI перед применением Terraform-изменения к production-проекту GCP?

    terraform
  • 40

    Когда использовать Google Cloud Infrastructure Manager для нового окружения на Terraform?

    terraform
  • 41

    В legacy-проекте остались ресурсы, созданные Deployment Manager. Какой путь миграции предложить в 2026 году?

    migrationsdeployment
  • 42

    Сервису Cloud Run нужен приватный доступ к Cloud SQL и внутреннему HTTP-сервису. Как настроить Direct VPC egress?

    networkingserverless-containerssql
  • 43

    Чувствительный к задержке Cloud Run API получает 40 запросов в секунду, и каждый запрос значительно нагружает CPU. Как настроить minimum instances и concurrency?

    serverless-containersapilatency
  • 44

    Для обработки изображений длительностью от 5 до 90 секунд выбрать push или pull subscription Pub/Sub, и как исключить повторную обработку?

    messagingconcurrency
  • 45

    Как запускать thumbnail-сервис Cloud Run при финализации объекта в одном бакете Cloud Storage?

    object-storageserverless-containers
  • 46

    Команде нужно агрегировать события Pub/Sub в пятиминутные метрики BigQuery с учетом опоздавших данных. Когда подходит Dataflow?

    aggregationbigquerymonitoring
  • 47

    Как спроектировать Cloud SQL для регионального web API, которому нужны высокая доступность, 400 соединений приложений и read-heavy отчеты?

    sqlapidesign
  • 48

    Таблица Spanner получает 20 000 записей в секунду с последовательными номерами заказов. Как выбрать primary key?

    primary-keys
  • 49

    Таблицу событий BigQuery на 30 TB запрашивают по event date, customer ID и event type. Как контролировать scan cost и емкость slots?

    bigquerycapacity
  • 50

    Бакет Cloud Storage годами хранит пользовательские загрузки, но частота доступа неизвестна. Использовать lifecycle rules или Autoclass?

    object-storage
  • 51

    Новый под GKE остается в состоянии Pending, хотя в кластере есть свободные CPU и память. Как диагностировать taints и affinity?

    kubernetesmemory
  • 52

    Deployment GKE с высокой нагрузкой на CPU перегружен, но HPA сохраняет прежнее число реплик. Что вы проверите?

    deploymentkubernetesreplication
  • 53

    Cluster autoscaling GKE оставляет один узел недогруженным, а часть реплик остается Pending. Как PDB и topology constraints влияют на диагностику?

    kubernetesreplicationscaling
  • 54

    Rollout Deployment в GKE завис: новые поды имеют состояние Running, но не Ready. Как это отлаживать?

    deploymentkubernetesproblem-solving
  • 55

    Несколько подов GKE были вытеснены после появления memory pressure на узле. Как расследовать и предотвратить повторение?

    kubernetesmemory
  • 56

    Поды в одном node pool GKE периодически не разрешают DNS-имена, хотя другие поды работают. Как локализовать неисправность?

    kubernetesdns
  • 57

    Сервис GKE потерял доступ к одной зависимости сразу после внедрения default-deny NetworkPolicy. Как это отлаживать?

    deploymentdependencieskubernetes
  • 58

    Сервис GKE через Gateway API или Ingress после релиза возвращает 502, хотя прямые запросы к подам успешны. Что вы проверите?

    kubernetesapigateway-api
  • 59

    Под с Workload Identity Federation for GKE получает 403 от Cloud Storage. Как найти недостающее разрешение?

    kubernetesidentityobject-storage
  • 60

    Нагрузка, которую принимает GKE Standard, отклоняется admission в Autopilot. Как провести миграцию?

    kubernetesmigrations
  • 61

    Binary Authorization отклоняет deployment GKE, хотя образ существует в Artifact Registry. Что вы проверите?

    deploymentartifactsregistries
  • 62

    Argo CD постоянно сообщает о drift и откатывает поле, которое меняет другой контроллер. Как разрешить конфликт ownership?

    iacgitopsownership
  • 63

    Canary в Cloud Deploy на 30% трафика показывает резкий рост ошибок. Как безопасно откатить его?

    deploymentdeployment-strategies
  • 64

    Удаленный state в GCS исправен и не заблокирован, но Terraform apply завершился после создания только части запланированной инфраструктуры. Как восстановиться?

    terraform
  • 65

    Google provider Terraform завершился по timeout при создании regional GKE cluster, но операция GCP все еще выполняется. Как восстановить partial apply?

    terraformkubernetes
  • 66

    Обновление Google provider для Terraform внезапно предлагает replacements и меняет поведение IAM. Как расследовать регрессию?

    terraform
  • 67

    Платформенной команде нужно применить одинаковые labels и включить API в 80 GCP-проектах. Как построить переиспользуемую автоматизацию на Go или Python вместо одноразового скрипта?

    python
  • 68

    Deployment в service project Shared VPC получает permission denied при выборе subnet из host project. Как это исправить?

    networkingdeployment
  • 69

    API работает в двух кластерах GKE, но после отказа одного кластера внешние клиенты и внутрикластерные callers остаются на нем. Как спроектировать и проверить failover и service discovery?

    kubernetesapidesign
  • 70

    Оба туннеля HA VPN выглядят активными, но GCP внезапно потерял on-premises prefix. Как отлаживать Cloud Router и BGP?

  • 71

    Endpoint Private Service Connect остается в состоянии REJECTED при подключении consumer project к producer service. Что вы проверите?

    private-connectivityendpoints
  • 72

    Job BigQuery работает в dry-run perimeter VPC Service Controls, но отклоняется после включения enforcement. Как это диагностировать?

    bigquerynetworking
  • 73

    Cloud Armor начал блокировать законные checkout-запросы после включения managed WAF rule. Как настроить false positive?

  • 74

    Сотрудник получает 403 от приложения под защитой IAP, хотя коллеги входят успешно. Что вы проверите?

  • 75

    Сервис Cloud Run возвращает HTTP-ответ, а затем продолжает CPU-heavy работу в фоне, но эта работа останавливается или исчезает. Как изменить конфигурацию и дизайн?

    serverless-containershttpconfig
  • 76

    Сервис Cloud Run с Direct VPC egress разрешает внутреннее имя, но не достигает его on-premises IP. Как это отлаживать?

    networkingserverless-containers
  • 77

    Custom CloudEvent проходит через Eventarc и требует изменения schema, пока несколько consumers Cloud Run деплоятся независимо. Как развивать event contract?

    serverless-containerseventsschema
  • 78

    В subscription Pub/Sub накопилось девять миллионов сообщений, publishers отправляют 8 000 в секунду, а один worker обрабатывает 40 в секунду. Как рассчитать восстановление?

    backlogmessaging
  • 79

    Команда включает exactly-once delivery Pub/Sub и планирует активные pull subscribers в двух регионах. На какое ограничение вы укажете?

    messaging
  • 80

    Watermark streaming job Dataflow перестал двигаться, и множество записей стало late. Как это расследовать?

    streaming
  • 81

    Cloud SQL начинает отклонять соединения после масштабирования нового deployment Cloud Run. Как стабилизировать систему?

    sqldeploymentserverless-containers
  • 82

    Read replica Cloud SQL отстает на несколько минут во время отчетного окна. Что вы проверите и измените?

    sqlreplication
  • 83

    Как проверить regional HA failover Cloud SQL до запуска production?

    sqlvalidation
  • 84

    Запрос истории заказов в Spanner замедлился с 90 мс до 1,2 секунды после роста таблицы до 2 ТБ, хотя writes остаются стабильными; как его диагностировать и ускорить?

    queries
  • 85

    Join в BigQuery сканирует ожидаемые partitions, но одна execution stage занимает основное slot time и создает большой shuffle spill. Как диагностировать и исправить skew?

    joinspartitioningbigquery
  • 86

    Scheduled ETL каждое утро заставляет интерактивные dashboards BigQuery ждать slots. Как снизить contention?

    bigqueryetl
  • 87

    Объект Cloud Storage был перезаписан, а в бакете включены retention controls и Object Versioning. Как его восстановить?

    retentionversioningobject-storage
  • 88

    Создание GCP-ресурса с CMEK завершается ошибкой permissions Cloud KMS. Как это отлаживать?

  • 89

    Объем и стоимость Cloud Logging удвоились после релиза. Как найти и сократить шумный source?

    logging
  • 90

    Custom metric Cloud Monitoring внезапно создает сотни тысяч time series. Как контролировать cardinality?

    monitoring
  • 91

    Как построить multi-window burn-rate alert для сервиса с availability SLO 99,9% за 30 дней?

    sloalerting
  • 92

    Объем traces слишком дорог, но редкие p99 failures должны оставаться доступными для диагностики. Как изменить sampling?

    sampling
  • 93

    Дневная стоимость одного GCP-проекта за ночь выросла на 40%. Какое расследование вы начнете?

  • 94

    У нагрузки стабильный compute baseline 60% и прерываемые ночные batch-пики. Как выбрать rightsizing, CUDs и Spot VMs?

    spotbatchfinops
  • 95

    Cloud Service Mesh показывает исправный mTLS для вызова в GKE, но один service account после изменения AuthorizationPolicy получает HTTP 403; как это диагностировать?

    authmtlsidentity
  • 96

    Release policy требует build provenance и SBOM до допуска контейнера в production. Как реализовать gate?

    supply-chaincontainers
  • 97

    В Cloud Composer растет backlog DAG, хотя CPU workers остается умеренным. Что вы проверите?

    backlog
  • 98

    On-premises приложение нужно перенести в GCP с двухчасовым cutover, но его зависимости плохо документированы. Как провести репетицию?

    dependencies
  • 99

    Что включить в практический runbook обновления production-кластера GKE?

    kubernetesrunbooks
  • 100

    Security просит до конца дня удалить один устаревший IAM binding из 240 GCP-проектов. Как безопасно запустить автоматизацию на Go или Python?

    python