Вопросы на собеседовании: DevOps-инженер
100 реальных вопросов с образцовыми ответами и пояснениями для уровня Senior.
Смотреть пример резюме: DevOps-инженер →Тренировка флешкарточками
Интервальное повторение · Hunter Pass
Вопросы
Я использую переиспользуемые pipeline templates с независимыми builds сервисов и собираю каждый commit только один раз.
- Pull requests запускают затронутые lint, unit и policy checks меньше чем за пять минут с dependency-aware caching.
- Merge создаёт immutable image, сканирует его через Trivy, подписывает Cosign и продвигает один digest по окружениям.
- Production использует automated canaries с SLO gates, а runner concurrency и deployment queues рассчитаны на измеренный пик 600 deploy.
Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат превратить delivery volume и latency в безопасную переиспользуемую pipeline architecture.
Я собираю только затронутый dependency graph и делаю cache keys воспроизводимыми из inputs.
- Bazel, Nx или Pants связывает changed files с сервисами и включает reverse dependencies, которые нужно повторно тестировать.
- Remote caches хранят compiled layers и test outputs по hash source, lockfile, toolchain и build configuration.
- Nightly full build ловит ошибки graph, а p95 pull request должен упасть ниже десяти минут без сокращения required tests.
Зачем это спрашивают: Сильный ответ сочетает change detection, правильную cache invalidation и safety net полной build.
Я provision примерно 150 concurrent ephemeral runners сверх среднего требования 100 runners для этой нагрузки.
- Autoscaling держит около 20% warm capacity, чтобы queue p95 оставался меньше двух минут во время bursts.
- Недоверенные pull requests работают без cloud credentials на отдельных node pools или accounts от signed release jobs.
- Каждый job получает чистую VM или Pod, максимум 30 минут жизни, restricted egress и отсутствие shared Docker socket.
Зачем это спрашивают: Интервьюер оценивает concurrency math, burst headroom и security separation между trusted и untrusted jobs.
Я запускаю green на полной production capacity до переключения traffic, принимая временную стоимость compute 2x.
- Green получает smoke и synthetic tests, затем 5% shadow или live traffic со сравнением latency, errors и saturation с blue.
- Load balancer перемещает traffic контролируемыми шагами и держит connection draining внутри десятиминутного rollback window.
- Blue остаётся deployable и подключённым к backward-compatible data layer, пока green не удержит SLO минимум 30 минут.
Зачем это спрашивают: Сильный ответ явно описывает duplication capacity, traffic control, data compatibility и timing rollback.
Я прохожу 5%, 25%, 50% и 100% traffic, только пока canary signals остаются рядом с baseline.
- Каждый этап длится минимум десять минут и сравнивает error rate, p95 latency, saturation и business metric вроде checkout success.
- Automatic rollback срабатывает выше 0,5% errors, при regression latency 20% или двух fast burn-rate windows.
- Минимум три canary replicas не дают судить по одному noisy instance, а rollout pause-ится при малом sample volume.
Зачем это спрашивают: Интервьюер проверяет численно обоснованные canary stages, sample size и rollback gates.
Я использую expand-and-contract sequence из минимум трёх независимо deployable changes.
- Сначала добавляю nullable column или совместимый default без долгой table rewrite, затем deploy кода с записью в оба представления.
- Backfill идёт ограниченными batches при monitoring lock time, replica lag и CPU базы ниже согласованных limits.
- Только после перехода всех readers новый pipeline проверяет completeness, добавляет constraint и удаляет старый path.
Зачем это спрашивают: Сильный ответ встраивает database compatibility и измеримую безопасность backfill в continuous delivery.
Я создаю один signed image digest после merge и продвигаю metadata со ссылкой на этот digest.
- Tests, SBOM, provenance и vulnerability results привязываются к immutable digest в registry.
- Environment-specific configuration остаётся вне image в Helm values, Kustomize overlays или runtime configuration.
- Admission отклоняет mutable tags в production, поэтому все восемь окружений запускают прошедший ранние gates artifact.
Зачем это спрашивают: Интервьюер оценивает artifact immutability и разделение deployable code от environment configuration.
Я делаю rollback заранее вычисленным deployment action, а не rebuild или ручным изменением manifest.
- Registry хранит недавние signed digests, а GitOps history фиксирует точные image и configuration revision каждого release.
- Database changes остаются backward-compatible минимум одно release window, иначе application rollback небезопасен.
- Quarterly exercise откатывает representative services и измеряет traffic recovery меньше пяти минут вместе с readiness и connection draining.
Зачем это спрашивают: Сильный ответ считает rollback capability артефактов, configuration и data compatibility, которую нужно измерять.
Сначала я сокращаю 18-минутный test path, потому что он доминирует в critical path.
- Tests делятся по historical duration между parallel workers, а flaky tests quarantined с owners вместо blind retry.
- BuildKit layer caching и prebuilt toolchain images сокращают шестиминутную build без потери reproducibility.
- Deploy начинается после required gates, а p95 duration по stage доказывает общий результат ниже 12 минут две недели.
Зачем это спрашивают: Интервьюер проверяет, следует ли optimization измеренному critical-path time, а не общему pipeline tuning.
Я использую native builders для каждой architecture и объединяю manifests в один multi-architecture digest.
- BuildKit выполняет architecture-independent stages один раз, где возможно, и делит remote cache layers между runner pools.
- Native arm64 runners избегают большого и нестабильного emulation cost QEMU для compile-heavy services.
- CI запускает smoke tests на обоих images и принимает дизайн только при p95 build time меньше 18 минут.
Зачем это спрашивают: Сильный ответ балансирует multi-architecture correctness с native execution и переиспользуемыми build layers.
Средняя потребность около 54 concurrent runners, поэтому я начну примерно с 80 для bursts и maintenance.
- Расчёт: 400 умножить на восемь и разделить на 60, затем headroom проверяется по arrival peaks, а не плоскому часовому average.
- Autoscaling использует queue depth и oldest-job age с целью p95 queue две минуты.
- Per-repository concurrency и cancellation superseded commits не дают одной busy branch занять все 80 runners.
Зачем это спрашивают: Интервьюер оценивает capacity math, fair scheduling и burst controls общего CI fleet.
Я использую risk-based automated gates и сохраняю human approval для high-impact changes.
- Signed artifacts с passing tests, policy checks и canary evidence могут auto-promote для low-risk services.
- IAM, database, public-network или tier-0 changes требуют двух named approvers и expiring deployment window.
- Platform записывает approver, digest, policy result и rollback link с целью median wait меньше десяти минут без ослабления tier-0 control.
Зачем это спрашивают: Сильный ответ масштабирует governance по change risk и сохраняет auditable production path.
Я публикую небольшие versioned modules и собираю из них поддерживаемые account и environment stacks.
- VPC module владеет networking primitives и отдаёт stable contract, но не создаёт одновременно EKS, databases и application IAM.
- Opinionated wrapper modules дают approved defaults common path, открывая только реально меняющиеся teams inputs.
- CI тестирует examples, upgrade paths, policy compliance и plans минимум для двух реальных account classes до release.
Зачем это спрашивают: Интервьюер проверяет module boundaries, supported defaults и evidence безопасной эволюции reusable IaC.
Я делю state по lifecycle, blast radius, ownership и change frequency, а не произвольному числу ресурсов.
- Network, shared identity, clusters, data services и application stacks получают отдельные states с явными remote outputs.
- Я избегаю длинных chains terraform_remote_state, публикуя stable values через parameter store или platform API там, где уместно.
- Migration использует moved blocks или state moves в reviewed batches с целевыми lock time и plan p95 ниже пяти минут.
Зачем это спрашивают: Сильный ответ улучшает plan scale, не заменяя один monolith хрупким graph state dependencies.
Я использую remote encrypted backend с locking, versioning, audit logs и узкими identities.
- S3 native lockfiles с versioning или Terraform Cloud предотвращают concurrent writes и хранят recoverable state versions.
- Каждый state имеет dedicated apply identity; plan jobs получают read access и short-lived OIDC credentials.
- CI сериализует applies на state, снимает stale locks через audited procedure и quarterly тестирует restoration.
Зачем это спрашивают: Интервьюер оценивает state durability, concurrency control, identity scope и recoverability при реальном change volume.
Я использую отдельные root configurations и state backends для account и production boundaries, а не 90 CLI workspaces.
- Directory или generated-stack structure делает account, region и environment видимыми в review и access policy.
- Production получает отдельные apply identity и approval path, поэтому выбор неверного workspace не может попасть в него.
- Workspaces остаются для short-lived identical preview environments с действительно одинаковыми isolation и configuration.
Зачем это спрашивают: Сильный ответ выбирает видимую access-controlled isolation для long-lived environments и ограничивает workspaces однородными копиями.
Я запускаю scheduled read-only plans для каждого state и направляю actionable drift owning team.
- High-risk states планируются hourly, обычные daily, а cloud audit events запускают targeted plans после console changes.
- Report отделяет provider normalization от реальных create, update и delete actions, удерживая false positives ниже 5%.
- Emergency changes получают owner и expiry, затем импортируются в code или reverted в течение 24 часов.
Зачем это спрашивают: Интервьюер проверяет, является ли drift detection частым, attributable, low-noise и связанным с remediation path.
Я публикую новую major version и поддерживаю старый contract в течение измеренного migration window.
- Upgrade tests запускают representative consumer plans и документируют state moves, renamed inputs и provider-version requirements.
- Renovate или похожий bot открывает pinned-version pull requests группами по пять consumers, начиная с non-production.
- Старый major удаляется только после migration всех 60 states и одной проверки rollback instructions.
Зачем это спрашивают: Сильный ответ считает module versioned product с consumer testing и контролируемой migration.
Я создаю plan из reviewed commit и применяю именно этот approved plan через short-lived production identity.
- CI хранит binary plan, human-readable summary, provider lockfile и commit SHA как один immutable review artifact.
- Apply отклоняет changed branch head, stale plan, policy failure или expired approval вместо silent replan.
- Production plans истекают через короткое окно, например четыре часа, потому что external state может измениться.
Зачем это спрашивают: Интервьюер оценивает integrity review и защиту от применения инфраструктуры, отличной от одобренной.
Я мигрирую по service boundary и risk tier, а не делаю один bulk import.
- Inventory и cloud tags определяют owner, dependencies и решение import, replace или retire для каждого ресурса.
- Generated import blocks ускоряют capture, но каждый imported state должен получить zero-change plan до обычных applies.
- Cohorts начинают с non-production и идут примерно по 100 ресурсов в неделю с monitoring unintended replacement и access changes.
Зачем это спрашивают: Сильный ответ сочетает inventory, import verification и устойчивый migration rate существующей infrastructure.
Закрытые вопросы
- 21
40 команд знают TypeScript, но platform group эксплуатирует 15 000 Terraform resources. Добавлять CDK или Pulumi?
terraformiactypescript - 22
Security требует encryption, private access и backup 30 дней для каждой новой cloud database. Где enforce это в IaC?
databaseencryptioniac - 23
Спроектируйте Prometheus monitoring для 30 Kubernetes clusters с 12 миллионами active series и retention 13 месяцев.
kubernetesmonitoringdesign - 24
Platform ingest-ит 20 TB logs в день от 800 сервисов. Как спроектировать storage и querying?
queriesdesign - 25
Tracing backend не может хранить все 2 миллиона spans в секунду. Какую sampling architecture выбрать?
samplingarchitecture - 26
Как развернуть OpenTelemetry collectors для 500 сервисов в 20 clusters без одного global bottleneck?
deploymentobservabilitytracking - 27
Определите SLIs для checkout API на 5 000 requests в секунду с availability target 99,95%.
api - 28
У сервиса monthly availability SLO 99,9%. Какой error budget он имеет и как releases его расходуют?
reliabilityslo - 29
Спроектируйте burn-rate alerts для SLO 99,9% без page на каждый короткий error spike.
designsloalerting - 30
Prometheus растёт с 4 до 18 миллионов series после добавления teams labels user_id. Какие guardrails нужны?
guardrailsdesignmonitoring - 31
Metrics, logs и traces стоят $140 000 в месяц. Как задать retention без ослабления audit requirement 90 дней?
retentionmonitoring - 32
Release dashboard сравнивает 2 versions, но не связывает errors с traces и deployed digest. Как переделать telemetry correlation?
correlationdeployment - 33
Вы строите internal developer platform для 300 инженеров и имеете 90 дней на первый release. Что выпустить?
- 34
Спроектируйте golden path для 80 Go services, которым сейчас нужно пять дней до production.
design - 35
Организация из 500 инженеров хочет Backstage, но service catalog точен только на 40%. Что внедрить первым?
- 36
Команды запрашивают 50 development databases в день. Как дать self-service без unrestricted cloud access?
database - 37
Спроектируйте Crossplane platform API для трёх clouds без открытия application teams 200 provider fields.
designapiiac - 38
Как измерять internal platform для 45 команд вместо подсчёта shipped features?
- 39
Product должен работать в AWS и GCP, но 85% workloads используют только basic compute, database и object storage. Что abstract в platform?
database - 40
GitHub Actions deploy-ит в 25 AWS accounts через годовые access keys. Спроектируйте замену на OIDC.
ci-cddeploymentdesign - 41
200 сервисам нужны database credentials с rotation каждый час. Как Vault будет их доставлять?
databasesecrets - 42
ArgoCD управляет 20 clusters, а security запрещает plaintext secrets в Git. Выбрать SOPS или External Secrets?
gitgitopssecrets - 43
Спроектируйте software supply-chain controls для 300 container builds в день без добавления больше трёх минут к CI.
designcontainers - 44
Public pull requests требуют CI, но release runners могут deploy в 12 production accounts. Как предотвратить credential theft?
code-reviewdeployment - 45
Спроектируйте ArgoCD repository structure для 100 teams, 20 clusters и четырёх environments без одного root application на всё.
designgitops - 46
Release должен пройти 3 окружения с одним image digest. Как работает GitOps promotion?
gitops - 47
Application требует database migration, Deployment и smoke test внутри 15-минутного ArgoCD sync. Как задать порядок?
databasemigrationsdeployment - 48
ArgoCD находит 300 drifted resources в день, но 70% являются fields других controllers. Как безопасно настроить sync?
configiacgitops - 49
Container registry хранит 200 TB, растёт на 12 TB ежемесячно и должен сохранять каждый production artifact год. Какой retention policy нужен?
containersartifactsregistries - 50
Teams в трёх регионах ежедневно pull 8 TB images из одного registry, а deployments должны работать при regional outage. Какую architecture выбрать?
deploymentregistriesarchitecture - 51
Canary прошёл на 5% traffic, но после promotion checkout errors выросли с 0,2% до 3%. Что откатывать и проверять?
deployment-strategiesrollback - 52
Release сохраняет прежний error rate, но повышает API p99 с 240 мс до 1,8 секунды на 50% traffic. Продвигать?
api - 53
Deployments падают, потому что database migration длится 22 минуты при timeout pipeline 15 минут. Как восстановиться?
databasemigrationsdeployment - 54
Feature flag включает новый код для 30% users, и errors растут до 6% без нового deploy. Каков rollback path?
deploymentfeature-flagsrollback - 55
Build time monorepo растёт с 11 до 46 минут за одну неделю. Как найти regression?
monorepo - 56
CI queue p95 растёт с 2 до 35 минут в рабочее время, но runner CPU в среднем только 40%. Что проверять?
data-structures - 57
После toolchain update remote build cache hit rate падает с 82% до 9%. Как безопасно восстановить его?
caching - 58
Flaky tests ломают 18% pipelines, и teams rerun jobs до success. Что изменить на этой неделе?
flakyci-cd - 59
Artifact uploads добавляют 14 минут каждой build после роста image с 600 MB до 4 GB. Что делать?
artifacts - 60
Runner image update ломает 70% pipelines у 50 teams. Как восстановить service?
ci-cd - 61
Открытый вручную security group создаёт public database path на 47 минут. Terraform замечает его только на следующий день. Что делать?
databaseterraformnetworking - 62
После provider upgrade Terraform планирует replacement 400 production resources. Как принять решение?
terraformconcurrency - 63
Terraform apply теряет lock после создания 60 из 100 ресурсов. Второй pipeline ждёт. Что делать?
terraformci-cd - 64
Refactor перемещает Terraform resources между states, и production теряет 12 IAM bindings. Как восстановиться?
refactoringterraform - 65
Drift job показывает 3 000 changes, но 95% являются provider-generated ordering noise. Как вернуть signal?
iac - 66
CI token с admin access к 18 AWS accounts опубликован в public repository на 26 минут. Что происходит первым?
tokens - 67
Database password найден в 240 commits и 35 release artifacts. Удаления последнего файла недостаточно. Что делать?
databasepasswordsartifacts - 68
GitHub OIDC trust policy случайно позволяет каждому repository организации assume production role. Как сдержать это?
- 69
Vault недоступен 25 минут, и credentials 80 сервисов начинают истекать. Как безопасно сохранить работу?
secrets - 70
Trivy блокирует 65% builds после vulnerability database update, включая 900 findings без available fix. Что изменить?
databasevulnerabilities - 71
Во время 40-минутного checkout outage есть CPU и error metrics, но нет queue-depth metric. Как закрыть observability gap?
observabilitymonitoringdata-structures - 72
API p99 утраивается после deploy, но traces есть только для 4% requests и ни одного для slow endpoint. Что исправить?
endpointsdeployment - 73
Logging pipeline теряет 18% production logs на пике без единого page. Как вернуть trust?
loggingci-cd - 74
Prometheus query p95 растёт до 28 секунд во время incidents, делая dashboards бесполезными. Что изменить первым?
incidentsqueriesmonitoring - 75
Platform отправляет 600 alerts в день, но actions требуют только 14. Что удалить первым?
alerting - 76
Стоимость self-hosted runners растёт с $70 000 до $190 000 в месяц при росте job volume только 8%. Как расследовать?
ci-cd - 77
CI job скачивает 6 GB dependencies 20 000 раз в месяц и создаёт network bill $38 000. Что изменить?
dependencies - 78
Observability spend растёт со $110 000 до $260 000 в месяц после high-cardinality labels трёх teams. Что делать?
observability - 79
Log storage достигает 4 PB и растёт на 200 TB в месяц, но searches старше 14 дней составляют 0,3%. Что изменить?
queries - 80
Release создаёт 900 idle GPU instances за ночь и добавляет $54 000 до detection. Как сдержать и предотвратить?
- 81
В 02:00 artifact registry отвечает 503 на 70% pulls, блокируя все новые Pods. Вы platform on-call. Что делать?
artifactsregistrieson-call - 82
В 03:00 Terraform Cloud не запускает applies, а production ждёт network fix. Как решить вопрос break-glass?
terraform - 83
Platform API для 45 teams возвращает 30% errors после rotation certificate. Как вести on-call response?
on-callapi - 84
Error budget исчерпан, но marketing хочет launch с ожидаемым 3x traffic завтра. Какую рекомендацию дать?
reliability - 85
Chaos test отключает одну availability zone, и recovery занимает 19 минут при objective пять минут. Что дальше?
availability - 86
Traffic forecast ожидал рост 30%, но partner launch создаёт 4x load и исчерпывает capacity за 12 минут. Что изменить?
capacity - 87
Platform team тратит 140 часов в месяц на manual access provisioning по 25 минут на request. Что автоматизировать?
- 88
Jenkins migration переносит 80 из 800 jobs, но failure rate растёт с 2% до 14%. Продолжать?
migrations - 89
Во время VM-to-Kubernetes cutover 10% traffic даёт 4% errors, а VM path держит 0,3%. Что делать?
kubernetes - 90
Cross-cloud migration PostgreSQL 2 TB подходит к cutover с replica lag 18 минут при окне пять минут. Продолжать?
postgresmigrationsreplication - 91
ArgoCD sync неожиданно удаляет 120 resources, потому что ApplicationSet generator возвращает empty list. Что делать?
gitopsgenerators - 92
ArgoCD PreSync hook зависает на 20 минут и блокирует 60 application releases. Как восстановиться?
hooksgitops - 93
Critical CVE появляется за четыре часа до release, затрагивает 300 images и не имеет patch. Какой standard применить?
- 94
У 50 teams уникальные pipelines, а shared security fix дошёл только до 12 за две недели. Как стандартизировать сейчас?
ci-cd - 95
Сильный operations engineer закрывает 20 pages в месяц, но повторяет один manual fix. Как его менторить?
mentoring - 96
Middle-инженер хочет apply Terraform plan с 30 replacements ради deadline. Как coach решение?
estimationterraform - 97
В team из шести человек один Vault expert обработал 9 из последних 10 secret incidents. Что изменить за quarter?
secretsincidents - 98
Во время sev1 для 40% customers executive пишет fixes каждые две минуты и требует constant updates. Как действовать?
soft-skills - 99
CFO требует cut infrastructure 40%, но services с SLO 99,95% уже используют 70% peak capacity. Что предложить?
capacityslo - 100
AI-generated Terraform pull request предлагает 180 resources и проходит syntax checks, но 12 IAM policies содержат wildcards. Какой standard применить?
code-reviewterraform