Вопросы на собеседовании: GCP-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Senior Cloud-инженер.
Смотреть пример резюме: GCP-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Я бы начал с Autopilot, потому что эти нагрузки подходят для его управляемой модели и не требуют контроля над узлами.
- Google управляет узлами, масштабированием и многими настройками безопасности, но я все равно проверил бы нужные DaemonSets и admission policies на совместимость с ограничениями Autopilot.
- Для general-purpose workloads на стандартной платформе Autopilot или в ComputeClasses Balanced и Scale-Out действует Pod-based billing по resource requests, поэтому их нужно точно подобрать.
- Нагрузки с выбранными machine series или accelerators используют node-based billing за целые узлы плюс management premium Autopilot.
- Standard я бы выбрал для привилегированного доступа к хостам, специальной настройки узлов или более точного контроля времени обновлений.
Зачем это спрашивают: Интервьюер оценивает, выбирает ли кандидат режим GKE по ограничениям нагрузки и стоимости эксплуатации, а не считает ли Autopilot всегда лучшим.
Я бы использовал региональный кластер GKE с рабочими узлами как минимум в трех зонах.
- Control plane реплицируется между зонами, поэтому отказ одной зоны не лишает кластер доступа к Kubernetes API.
- Node pools я бы рассчитал так, чтобы после потери зоны оставшейся емкости хватало для requests критичных приложений.
- Число региональных узлов и квоты могут умножаться на количество зон, поэтому до создания я бы проверил итоговое число узлов и стоимость.
- Для приложений я бы также задал topology spread constraints и выбрал реплицируемое хранилище под требуемый уровень доступности.
Зачем это спрашивают: Интервьюер хочет увидеть, что кандидат учитывает доступность и control plane, и рабочей нагрузки, а не полагается только на тип регионального кластера.
Я бы разделил эти классы нагрузки по node pools с явными labels, taints и tolerations.
- Небольшой системный пул на обычных VM размещал бы DNS, метрики и контроллеры, чтобы batch-нагрузка не вытесняла сервисы кластера.
- Обычные API работали бы в general-purpose пуле на непрерываемых VM, подобранных под их профиль CPU и памяти.
- Batch-задачи допускали бы Spot VM и корректно обрабатывали остановку, снижая стоимость без ущерба для доступности API.
- У каждого пула были бы собственные границы автомасштабирования, настройки обновлений и типы машин, поскольку одна политика не подходит всем нагрузкам.
Зачем это спрашивают: Интервьюер проверяет, использует ли кандидат node pools для практической изоляции стоимости, надежности и требований к оборудованию.
Начальные requests я бы получил из нагрузочных тестов и наблюдаемых перцентилей, а затем уточнил по продакшн-метрикам.
- Requests должны покрывать обычное потребление CPU и памяти, поскольку scheduler и cluster autoscaler используют их при размещении.
- Лимит памяти я бы установил выше рабочего набора, чтобы сдерживать утечки, понимая, что превышение приведет к OOM kill.
- Для чувствительного к задержке API я бы избегал жесткого CPU limit, поскольку CFS throttling ухудшает время ответа даже при свободном CPU на узле.
- Перед изменением значений я бы настроил алерты на throttling, OOM kills и отношение requests к фактическому потреблению.
Зачем это спрашивают: Интервьюер проверяет понимание влияния ресурсов на планирование, стоимость, throttling и автомасштабирование.
Я бы поручил HPA менять число реплик по сигналам трафика, а VPA сначала использовал бы в режиме рекомендаций для подбора ресурсов.
- HPA мог бы учитывать CPU utilization и внешнюю метрику глубины очереди, чтобы реагировать до накопления запросов.
- Процент CPU считается относительно CPU requests, поэтому нереалистичные requests сделают поведение HPA таким же нереалистичным.
- Я бы не разрешал VPA автоматически менять тот же ресурс CPU или памяти, по которому масштабирует HPA, иначе два контура начнут конфликтовать.
- Изучив рекомендации, я бы обновлял requests через деплой или оставил VPA только для ресурса, который HPA не использует.
Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат совмещать автомасштабирование подов без конфликтующих контуров управления.
Я бы задал минимум и максимум узлов каждого пула с учетом резервной емкости, квот и размера самого крупного пода.
- Cluster autoscaler добавляет узлы, когда поды не размещаются из-за requests, а не просто при высоком среднем CPU узлов.
- В пуле должен быть тип машины, на котором помещается самый крупный под, иначе реплики останутся pending даже до достижения максимума узлов.
- Если запуск узла слишком медленный для всплеска, я бы оставил небольшой резерв или использовал overprovisioning-поды.
- Настройки scale-down должны учитывать PDB и долгие задачи, чтобы экономия не создавала лишних прерываний.
Зачем это спрашивают: Интервьюер проверяет понимание сигнала планирования и ограничений емкости, на которых основано масштабирование кластера.
Я бы совместил PodDisruptionBudget с topology spread constraints по зонам и узлам.
- PDB с maxUnavailable: 1 сохраняет две реплики при добровольных прерываниях, например при drain узла.
- Ограничение по зонам с maxSkew: 1 не дает всем репликам попасть в один домен отказа.
- Ограничение по hostname снижает вероятность размещения двух реплик на одном узле.
- Я бы проверил наличие свободной емкости, поскольку строгий PDB защищает доступность, но блокирует drain, если новый под негде разместить.
Зачем это спрашивают: Интервьюер проверяет, отличает ли кандидат защиту от прерываний от реального размещения реплик и наличия емкости.
Я бы использовал Workload Identity Federation for GKE и связал Kubernetes-нагрузку с IAM-идентичностью с минимальными правами.
- Под получает краткоживущие учетные данные через metadata path GKE вместо подключения JSON-ключа.
- Я бы выдал objectViewer только на нужный бакет, а не проектную роль для всего Cloud Storage.
- Namespace и Kubernetes service account были бы выделены этому приложению, чтобы граница principal оставалась ясной.
- Я бы проверил binding из пода и убедился, что legacy metadata access или секреты с ключами не остались резервным способом входа.
Зачем это спрашивают: Интервьюер хочет увидеть, умеет ли кандидат реализовать в GKE беспарольную аутентификацию в GCP с правами на уровне конкретной нагрузки.
Я бы применил default-deny NetworkPolicies для ingress и egress, а затем добавил узкие разрешения для нужных путей.
- API и внутренний сервис выбирались бы по labels подов и namespace, а не по меняющимся IP подов.
- Отдельное egress-правило разрешало бы kube-dns по UDP и TCP 53, чтобы продолжал работать DNS.
- Доступ к Cloud SQL был бы ограничен путем через connector или private endpoint и необходимым портом.
- Я бы использовал enforcement через GKE Dataplane V2 и помнил, что VPC firewall rules продолжают управлять трафиком вне кластера.
Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат построить рабочий allowlist и понимает ли границу между средствами Kubernetes и VPC.
Я бы выбрал Gateway API, потому что он лучше разделяет владение балансировщиком и маршрутами отдельных приложений.
- Платформенная команда может владеть Gateway и TLS policy, а команды приложений подключать HTTPRoutes в своих namespaces.
- Правила подключения маршрутов явно оформляют делегирование между namespaces вместо одного большого общего Ingress.
- GKE Ingress я бы сохранил для простого существующего приложения, если поддерживаемые annotations уже закрывают все требования.
- Перед миграцией я бы сравнил конкретные возможности GKE GatewayClass для сертификатов, redirects и backend policies.
Зачем это спрашивают: Интервьюер проверяет, выбирает ли кандидат L7 API по требованиям к владению и функциям, а не по новизне.
Я бы продвигал между окружениями один неизменяемый digest образа, а не пересобирал его для каждого окружения.
- Cloud Build отправлял бы образ в региональный Docker-репозиторий рядом с нагрузками и записывал sha256 digest.
- Deployment manifests ссылались бы на digest, поэтому перенос тега не мог бы незаметно изменить production.
- Право записи было бы только у build identities, а runtime identities получили бы repository reader.
- Cleanup policies сохраняли бы выпущенные и недавно использованные образы, удаляя старые untagged-артефакты сборок.
Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат организовать продвижение артефактов с учетом происхождения, минимальных прав и роста хранилища.
Я бы включил Binary Authorization с attestations, которые создаются только после успешной одобренной сборки и проверок безопасности.
- Пайплайн подписывал бы digest образа, а не изменяемый тег, с помощью защищенного ключа attestor.
- Production policy требовала бы эту attestation и разрешала только явно одобренные registries.
- Сначала я бы запустил policy в режиме аудита, чтобы найти системные образы и законные исключения до включения enforcement.
- Break-glass деплой требовал бы контролируемой причины, узкого IAM-доступа и последующего аудита, а не постоянного обхода.
Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат превратить происхождение контейнера в обязательный контроль деплоя с безопасным внедрением.
Я бы использовал Helm для переиспользуемого пакета приложения, а Kustomize для небольших environment overlays, если оба инструмента действительно полезны.
- Helm chart подходит для повторяющихся объектов, опциональных компонентов и версионированных релизов для нескольких команд.
- Kustomize подходит для patches вроде числа реплик, имен проектов и ссылок на Gateway без превращения каждого поля в параметр шаблона.
- Для простого приложения я бы выбрал один инструмент, поскольку многоступенчатый рендеринг усложняет проверку итогового manifest.
- CI рендерил бы каждое окружение и валидировал готовый YAML до передачи в Argo CD или Cloud Deploy.
Зачем это спрашивают: Интервьюер хочет увидеть поддерживаемый выбор конфигурации, а не автоматическое нагромождение инструментов.
Я бы использовал региональный private pool Cloud Build, подключенный к VPC с приватными зависимостями.
- Сетевой путь и firewall rules пула разрешали бы только репозиторий, зеркало пакетов, Artifact Registry и нужные Google APIs.
- Если нужны публичные зависимости, я бы зеркалировал их или использовал одобренный proxy, поскольку отключение внешних IP у workers убирает прямой доступ в интернет.
- Build service account имел бы узкие роли для артефактов и логов без широкой проектной роли Editor.
- Размер машин и concurrency пула я бы определил по измеренному спросу на сборки, поскольку емкость private pool напрямую влияет на стоимость.
Зачем это спрашивают: Интервьюер оценивает понимание приватной связности сборок, идентичности, egress и компромиссов емкости.
Я бы создал delivery pipeline Cloud Deploy с canary strategy и явным подтверждением перед полным rollout.
- Skaffold рендерил бы один и тот же релизный артефакт для target без пересборки между процентами.
- Canary phases переводили бы 10%, затем 30% и 100% через поддерживаемую сетевую конфигурацию GKE-сервиса.
- Verification jobs сравнивали бы error rate и latency со стабильной версией на каждой фазе.
- Ошибка verification останавливает продвижение, но сама не возвращает стабильный трафик, поэтому я бы явно запускал rollback или заранее настроил repair automation Cloud Deploy по заданным критериям.
Зачем это спрашивают: Интервьюер проверяет, может ли кандидат описать контролируемую постепенную поставку, а не только назвать canary deployment.
Я бы сделал Git источником desired state и выдал Argo CD только необходимые права в закрепленных за ним namespaces.
- Отдельные проекты Argo CD ограничивали бы разрешенные репозитории, destinations, namespaces и виды ресурсов каждой команды.
- Protected branches и проверенные pull requests контролировали бы production-изменения до reconciliation.
- Auto-sync мог бы работать в окружениях низкого риска, а production использовал бы sync windows или явное продвижение по принятой policy.
- Drift был бы виден в Argo CD, а экстренные ручные изменения либо откатывались бы, либо сразу фиксировались обратно в Git.
Зачем это спрашивают: Интервьюер оценивает практический контроль доступа и владения изменениями в GitOps, а не только механизм reconciliation.
Я бы хранил environment-конфигурацию вне образа и рендерил версионированные ConfigMaps через deployment pipeline.
- Один digest образа проходил бы через dev и production, а overlays задавали endpoints, flags и настройки ресурсов.
- Checksum ConfigMap помещался бы в pod template, чтобы изменение конфигурации запускало контролируемый rollout.
- Крупную или часто меняющуюся конфигурацию я бы передавал через отдельный configuration service или mounted file, а не сотни environment variables.
- Schema validation в CI отклоняла бы отсутствующие ключи и неверные значения до принятия manifest Kubernetes.
Зачем это спрашивают: Интервьюер проверяет, отделяет ли кандидат build artifacts от environment-конфигурации и делает ли изменения безопасно наблюдаемыми.
Я бы использовал Secret Manager add-on или CSI driver вместе с Workload Identity Federation for GKE и никогда не хранил пароль в Git.
- Роль roles/secretmanager.secretAccessor я бы выдал workload principal на сам ресурс секрета, потому что IAM-доступ нельзя назначить отдельной версии секрета.
- В SecretProviderClass или конфигурации add-on я бы указал явную версию ресурса, например versions/7, вместо latest, чтобы потребляемое значение было детерминированным.
- При ротации я бы создал новые учетные данные БД и версию секрета, обновил закрепленную ссылку, перезапустил и проверил consumers и только затем отключил старые данные и версию.
- Data Access logs Secret Manager подтвердили бы, какой principal прочитал значение во время замены.
Зачем это спрашивают: Интервьюер оценивает полный процесс доставки секрета, минимальные права и ротацию, а не только место его хранения.
Я бы разместил VPC, подсети, маршруты и центральные firewall controls в host project и подключил три service projects.
- Ресурсы приложений остаются в service projects для разделения billing и IAM, но используют подсети host project.
- Network administrators управляют host, а deployers приложений получают только Network User на нужных подсетях.
- Я бы выделил непересекающиеся региональные CIDR с запасом для GKE pods, services и будущего роста.
- Центральное владение не заменяет IAM в service projects, поэтому права на ресурсы и сеть остаются разными зонами ответственности.
Зачем это спрашивают: Интервьюер проверяет понимание владения Shared VPC, делегированного использования и планирования адресов.
Я бы применил общий deny на уровне папки и добавил более приоритетное узкое разрешение для одобренного пути администрирования.
- Allow rule выбирало бы защищенные ресурсы по service accounts или secure tags, а не по широкому сетевому CIDR.
- SSH из 0.0.0.0/0 запрещался бы централизованно, чтобы владельцы проектов не обходили правило через VPC rule нижнего уровня.
- Приоритеты и наследование правил были бы документированы, поскольку совпадение на верхнем уровне может не дать сработать дочерним policies.
- До применения ко всей папке я бы проверил влияние policy на непродакшн-проекте.
Зачем это спрашивают: Интервьюер оценивает, умеет ли кандидат применять наследуемые сетевые ограничения без удаления законного делегированного доступа.
Закрытые вопросы
- 21
Приватные VM без внешних IP должны обращаться к Cloud Storage и Artifact Registry. Какой сетевой путь настроить?
configartifactsregistries - 22
Consumer VPC должна обращаться к управляемому сервису в producer VPC без peering двух сетей. Как использовать Private Service Connect?
networkingprivate-connectivity - 23
Приватный node pool GKE открывает много коротких исходящих соединений. Как рассчитать Cloud NAT?
networkingkubernetes - 24
Компании сейчас нужна гибридная связь на 2 Gbps, а через год ожидается 10 Gbps. Как выбрать между HA VPN и Cloud Interconnect?
hybrid-networking - 25
Две VPC должны разрешать имена из приватной зоны центральной DNS VPC. Как спроектировать Cloud DNS peering?
designdnsnetworking - 26
Как анонсировать подсети GCP двум on-premises роутерам, предпочитая один гибридный путь, но сохраняя failover?
networking - 27
Какие балансировщики Google Cloud выбрать для публичного HTTPS API, приватного HTTP-сервиса и UDP endpoint игры?
httphttpsendpoints - 28
Сервису деплоя нужны 14 permissions, но ни одна predefined IAM role не подходит. Как создать и поддерживать custom role?
deployment - 29
Как разрешить подрядчикам администрировать тестовые ресурсы только до заданной даты и сохранить audit logs, даже если администратор проекта действует злоумышленно?
- 30
GitHub Actions должен деплоить в GCP без ключа сервисного аккаунта, а инженерам иногда нужна та же deployment identity. Как настроить доступ?
ci-cddeploymentconfig - 31
Команда говорит, что VPC Service Controls заменит IAM и firewall rules вокруг BigQuery и Cloud Storage. Как исправить дизайн?
designnetworkingobject-storage - 32
Публичному приложению за Google Cloud Application Load Balancer нужна WAF-защита и rate limiting входа. Как настроить Cloud Armor?
load-balancingrate-limitingconfig - 33
Как открыть внутреннее административное веб-приложение сотрудникам без публичных IP у VM и без VPN для всех?
- 34
Как внедрить Security Command Center для папки с 20 GCP-проектами и не перегрузить команды findings?
- 35
Как спроектировать Terraform modules для повторяющихся GCP-проектов без одного гигантского platform module?
terraformdesign - 36
У компании есть Terraform stacks для dev, staging и production. Как изолировать их state?
terraform - 37
Нужно взять существующую VPC под управление Terraform, а затем переименовать адрес ее ресурса без пересоздания. Что вы сделаете?
networkingterraform - 38
Как фиксировать версии Terraform и Google provider, но продолжать получать исправления?
terraform - 39
Какие проверки нужны в CI перед применением Terraform-изменения к production-проекту GCP?
terraform - 40
Когда использовать Google Cloud Infrastructure Manager для нового окружения на Terraform?
terraform - 41
В legacy-проекте остались ресурсы, созданные Deployment Manager. Какой путь миграции предложить в 2026 году?
migrationsdeployment - 42
Сервису Cloud Run нужен приватный доступ к Cloud SQL и внутреннему HTTP-сервису. Как настроить Direct VPC egress?
networkingserverless-containerssql - 43
Чувствительный к задержке Cloud Run API получает 40 запросов в секунду, и каждый запрос значительно нагружает CPU. Как настроить minimum instances и concurrency?
serverless-containersapilatency - 44
Для обработки изображений длительностью от 5 до 90 секунд выбрать push или pull subscription Pub/Sub, и как исключить повторную обработку?
messagingconcurrency - 45
Как запускать thumbnail-сервис Cloud Run при финализации объекта в одном бакете Cloud Storage?
object-storageserverless-containers - 46
Команде нужно агрегировать события Pub/Sub в пятиминутные метрики BigQuery с учетом опоздавших данных. Когда подходит Dataflow?
aggregationbigquerymonitoring - 47
Как спроектировать Cloud SQL для регионального web API, которому нужны высокая доступность, 400 соединений приложений и read-heavy отчеты?
sqlapidesign - 48
Таблица Spanner получает 20 000 записей в секунду с последовательными номерами заказов. Как выбрать primary key?
primary-keys - 49
Таблицу событий BigQuery на 30 TB запрашивают по event date, customer ID и event type. Как контролировать scan cost и емкость slots?
bigquerycapacity - 50
Бакет Cloud Storage годами хранит пользовательские загрузки, но частота доступа неизвестна. Использовать lifecycle rules или Autoclass?
object-storage - 51
Новый под GKE остается в состоянии Pending, хотя в кластере есть свободные CPU и память. Как диагностировать taints и affinity?
kubernetesmemory - 52
Deployment GKE с высокой нагрузкой на CPU перегружен, но HPA сохраняет прежнее число реплик. Что вы проверите?
deploymentkubernetesreplication - 53
Cluster autoscaling GKE оставляет один узел недогруженным, а часть реплик остается Pending. Как PDB и topology constraints влияют на диагностику?
kubernetesreplicationscaling - 54
Rollout Deployment в GKE завис: новые поды имеют состояние Running, но не Ready. Как это отлаживать?
deploymentkubernetesproblem-solving - 55
Несколько подов GKE были вытеснены после появления memory pressure на узле. Как расследовать и предотвратить повторение?
kubernetesmemory - 56
Поды в одном node pool GKE периодически не разрешают DNS-имена, хотя другие поды работают. Как локализовать неисправность?
kubernetesdns - 57
Сервис GKE потерял доступ к одной зависимости сразу после внедрения default-deny NetworkPolicy. Как это отлаживать?
deploymentdependencieskubernetes - 58
Сервис GKE через Gateway API или Ingress после релиза возвращает 502, хотя прямые запросы к подам успешны. Что вы проверите?
kubernetesapigateway-api - 59
Под с Workload Identity Federation for GKE получает 403 от Cloud Storage. Как найти недостающее разрешение?
kubernetesidentityobject-storage - 60
Нагрузка, которую принимает GKE Standard, отклоняется admission в Autopilot. Как провести миграцию?
kubernetesmigrations - 61
Binary Authorization отклоняет deployment GKE, хотя образ существует в Artifact Registry. Что вы проверите?
deploymentartifactsregistries - 62
Argo CD постоянно сообщает о drift и откатывает поле, которое меняет другой контроллер. Как разрешить конфликт ownership?
iacgitopsownership - 63
Canary в Cloud Deploy на 30% трафика показывает резкий рост ошибок. Как безопасно откатить его?
deploymentdeployment-strategies - 64
Удаленный state в GCS исправен и не заблокирован, но Terraform apply завершился после создания только части запланированной инфраструктуры. Как восстановиться?
terraform - 65
Google provider Terraform завершился по timeout при создании regional GKE cluster, но операция GCP все еще выполняется. Как восстановить partial apply?
terraformkubernetes - 66
Обновление Google provider для Terraform внезапно предлагает replacements и меняет поведение IAM. Как расследовать регрессию?
terraform - 67
Платформенной команде нужно применить одинаковые labels и включить API в 80 GCP-проектах. Как построить переиспользуемую автоматизацию на Go или Python вместо одноразового скрипта?
python - 68
Deployment в service project Shared VPC получает permission denied при выборе subnet из host project. Как это исправить?
networkingdeployment - 69
API работает в двух кластерах GKE, но после отказа одного кластера внешние клиенты и внутрикластерные callers остаются на нем. Как спроектировать и проверить failover и service discovery?
kubernetesapidesign - 70
Оба туннеля HA VPN выглядят активными, но GCP внезапно потерял on-premises prefix. Как отлаживать Cloud Router и BGP?
- 71
Endpoint Private Service Connect остается в состоянии REJECTED при подключении consumer project к producer service. Что вы проверите?
private-connectivityendpoints - 72
Job BigQuery работает в dry-run perimeter VPC Service Controls, но отклоняется после включения enforcement. Как это диагностировать?
bigquerynetworking - 73
Cloud Armor начал блокировать законные checkout-запросы после включения managed WAF rule. Как настроить false positive?
- 74
Сотрудник получает 403 от приложения под защитой IAP, хотя коллеги входят успешно. Что вы проверите?
- 75
Сервис Cloud Run возвращает HTTP-ответ, а затем продолжает CPU-heavy работу в фоне, но эта работа останавливается или исчезает. Как изменить конфигурацию и дизайн?
serverless-containershttpconfig - 76
Сервис Cloud Run с Direct VPC egress разрешает внутреннее имя, но не достигает его on-premises IP. Как это отлаживать?
networkingserverless-containers - 77
Custom CloudEvent проходит через Eventarc и требует изменения schema, пока несколько consumers Cloud Run деплоятся независимо. Как развивать event contract?
serverless-containerseventsschema - 78
В subscription Pub/Sub накопилось девять миллионов сообщений, publishers отправляют 8 000 в секунду, а один worker обрабатывает 40 в секунду. Как рассчитать восстановление?
backlogmessaging - 79
Команда включает exactly-once delivery Pub/Sub и планирует активные pull subscribers в двух регионах. На какое ограничение вы укажете?
messaging - 80
Watermark streaming job Dataflow перестал двигаться, и множество записей стало late. Как это расследовать?
streaming - 81
Cloud SQL начинает отклонять соединения после масштабирования нового deployment Cloud Run. Как стабилизировать систему?
sqldeploymentserverless-containers - 82
Read replica Cloud SQL отстает на несколько минут во время отчетного окна. Что вы проверите и измените?
sqlreplication - 83
Как проверить regional HA failover Cloud SQL до запуска production?
sqlvalidation - 84
Запрос истории заказов в Spanner замедлился с 90 мс до 1,2 секунды после роста таблицы до 2 ТБ, хотя writes остаются стабильными; как его диагностировать и ускорить?
queries - 85
Join в BigQuery сканирует ожидаемые partitions, но одна execution stage занимает основное slot time и создает большой shuffle spill. Как диагностировать и исправить skew?
joinspartitioningbigquery - 86
Scheduled ETL каждое утро заставляет интерактивные dashboards BigQuery ждать slots. Как снизить contention?
bigqueryetl - 87
Объект Cloud Storage был перезаписан, а в бакете включены retention controls и Object Versioning. Как его восстановить?
retentionversioningobject-storage - 88
Создание GCP-ресурса с CMEK завершается ошибкой permissions Cloud KMS. Как это отлаживать?
- 89
Объем и стоимость Cloud Logging удвоились после релиза. Как найти и сократить шумный source?
logging - 90
Custom metric Cloud Monitoring внезапно создает сотни тысяч time series. Как контролировать cardinality?
monitoring - 91
Как построить multi-window burn-rate alert для сервиса с availability SLO 99,9% за 30 дней?
sloalerting - 92
Объем traces слишком дорог, но редкие p99 failures должны оставаться доступными для диагностики. Как изменить sampling?
sampling - 93
Дневная стоимость одного GCP-проекта за ночь выросла на 40%. Какое расследование вы начнете?
- 94
У нагрузки стабильный compute baseline 60% и прерываемые ночные batch-пики. Как выбрать rightsizing, CUDs и Spot VMs?
spotbatchfinops - 95
Cloud Service Mesh показывает исправный mTLS для вызова в GKE, но один service account после изменения AuthorizationPolicy получает HTTP 403; как это диагностировать?
authmtlsidentity - 96
Release policy требует build provenance и SBOM до допуска контейнера в production. Как реализовать gate?
supply-chaincontainers - 97
В Cloud Composer растет backlog DAG, хотя CPU workers остается умеренным. Что вы проверите?
backlog - 98
On-premises приложение нужно перенести в GCP с двухчасовым cutover, но его зависимости плохо документированы. Как провести репетицию?
dependencies - 99
Что включить в практический runbook обновления production-кластера GKE?
kubernetesrunbooks - 100
Security просит до конца дня удалить один устаревший IAM binding из 240 GCP-проектов. Как безопасно запустить автоматизацию на Go или Python?
python