Skip to content

Вопросы на собеседовании: DevOps-инженер

100 реальных вопросов с образцовыми ответами и пояснениями для уровня Senior.

Смотреть пример резюме: DevOps-инженер

Тренировка флешкарточками

Интервальное повторение · Hunter Pass

Вопросы

microservicesdesignci-cd

Я использую переиспользуемые pipeline templates с независимыми builds сервисов и собираю каждый commit только один раз.

  • Pull requests запускают затронутые lint, unit и policy checks меньше чем за пять минут с dependency-aware caching.
  • Merge создаёт immutable image, сканирует его через Trivy, подписывает Cosign и продвигает один digest по окружениям.
  • Production использует automated canaries с SLO gates, а runner concurrency и deployment queues рассчитаны на измеренный пик 600 deploy.

Зачем это спрашивают: Интервьюер проверяет, умеет ли кандидат превратить delivery volume и latency в безопасную переиспользуемую pipeline architecture.

monorepo

Я собираю только затронутый dependency graph и делаю cache keys воспроизводимыми из inputs.

  • Bazel, Nx или Pants связывает changed files с сервисами и включает reverse dependencies, которые нужно повторно тестировать.
  • Remote caches хранят compiled layers и test outputs по hash source, lockfile, toolchain и build configuration.
  • Nightly full build ловит ошибки graph, а p95 pull request должен упасть ниже десяти минут без сокращения required tests.

Зачем это спрашивают: Сильный ответ сочетает change detection, правильную cache invalidation и safety net полной build.

Я provision примерно 150 concurrent ephemeral runners сверх среднего требования 100 runners для этой нагрузки.

  • Autoscaling держит около 20% warm capacity, чтобы queue p95 оставался меньше двух минут во время bursts.
  • Недоверенные pull requests работают без cloud credentials на отдельных node pools или accounts от signed release jobs.
  • Каждый job получает чистую VM или Pod, максимум 30 минут жизни, restricted egress и отсутствие shared Docker socket.

Зачем это спрашивают: Интервьюер оценивает concurrency math, burst headroom и security separation между trusted и untrusted jobs.

designdeployment-strategiesdeployment

Я запускаю green на полной production capacity до переключения traffic, принимая временную стоимость compute 2x.

  • Green получает smoke и synthetic tests, затем 5% shadow или live traffic со сравнением latency, errors и saturation с blue.
  • Load balancer перемещает traffic контролируемыми шагами и держит connection draining внутри десятиминутного rollback window.
  • Blue остаётся deployable и подключённым к backward-compatible data layer, пока green не удержит SLO минимум 30 минут.

Зачем это спрашивают: Сильный ответ явно описывает duplication capacity, traffic control, data compatibility и timing rollback.

replicationdeployment-strategies

Я прохожу 5%, 25%, 50% и 100% traffic, только пока canary signals остаются рядом с baseline.

  • Каждый этап длится минимум десять минут и сравнивает error rate, p95 latency, saturation и business metric вроде checkout success.
  • Automatic rollback срабатывает выше 0,5% errors, при regression latency 20% или двух fast burn-rate windows.
  • Минимум три canary replicas не дают судить по одному noisy instance, а rollout pause-ится при малом sample volume.

Зачем это спрашивают: Интервьюер проверяет численно обоснованные canary stages, sample size и rollback gates.

databaseschemadeployment

Я использую expand-and-contract sequence из минимум трёх независимо deployable changes.

  • Сначала добавляю nullable column или совместимый default без долгой table rewrite, затем deploy кода с записью в оба представления.
  • Backfill идёт ограниченными batches при monitoring lock time, replica lag и CPU базы ниже согласованных limits.
  • Только после перехода всех readers новый pipeline проверяет completeness, добавляет constraint и удаляет старый path.

Зачем это спрашивают: Сильный ответ встраивает database compatibility и измеримую безопасность backfill в continuous delivery.

Я создаю один signed image digest после merge и продвигаю metadata со ссылкой на этот digest.

  • Tests, SBOM, provenance и vulnerability results привязываются к immutable digest в registry.
  • Environment-specific configuration остаётся вне image в Helm values, Kustomize overlays или runtime configuration.
  • Admission отклоняет mutable tags в production, поэтому все восемь окружений запускают прошедший ранние gates artifact.

Зачем это спрашивают: Интервьюер оценивает artifact immutability и разделение deployable code от environment configuration.

rollback

Я делаю rollback заранее вычисленным deployment action, а не rebuild или ручным изменением manifest.

  • Registry хранит недавние signed digests, а GitOps history фиксирует точные image и configuration revision каждого release.
  • Database changes остаются backward-compatible минимум одно release window, иначе application rollback небезопасен.
  • Quarterly exercise откатывает representative services и измеряет traffic recovery меньше пяти минут вместе с readiness и connection draining.

Зачем это спрашивают: Сильный ответ считает rollback capability артефактов, configuration и data compatibility, которую нужно измерять.

deploymentci-cdtesting

Сначала я сокращаю 18-минутный test path, потому что он доминирует в critical path.

  • Tests делятся по historical duration между parallel workers, а flaky tests quarantined с owners вместо blind retry.
  • BuildKit layer caching и prebuilt toolchain images сокращают шестиминутную build без потери reproducibility.
  • Deploy начинается после required gates, а p95 duration по stage доказывает общий результат ниже 12 минут две недели.

Зачем это спрашивают: Интервьюер проверяет, следует ли optimization измеренному critical-path time, а не общему pipeline tuning.

Я использую native builders для каждой architecture и объединяю manifests в один multi-architecture digest.

  • BuildKit выполняет architecture-independent stages один раз, где возможно, и делит remote cache layers между runner pools.
  • Native arm64 runners избегают большого и нестабильного emulation cost QEMU для compile-heavy services.
  • CI запускает smoke tests на обоих images и принимает дизайн только при p95 build time меньше 18 минут.

Зачем это спрашивают: Сильный ответ балансирует multi-architecture correctness с native execution и переиспользуемыми build layers.

ci-cdconcurrency

Средняя потребность около 54 concurrent runners, поэтому я начну примерно с 80 для bursts и maintenance.

  • Расчёт: 400 умножить на восемь и разделить на 60, затем headroom проверяется по arrival peaks, а не плоскому часовому average.
  • Autoscaling использует queue depth и oldest-job age с целью p95 queue две минуты.
  • Per-repository concurrency и cancellation superseded commits не дают одной busy branch занять все 80 runners.

Зачем это спрашивают: Интервьюер оценивает capacity math, fair scheduling и burst controls общего CI fleet.

designdeployment

Я использую risk-based automated gates и сохраняю human approval для high-impact changes.

  • Signed artifacts с passing tests, policy checks и canary evidence могут auto-promote для low-risk services.
  • IAM, database, public-network или tier-0 changes требуют двух named approvers и expiring deployment window.
  • Platform записывает approver, digest, policy result и rollback link с целью median wait меньше десяти минут без ослабления tier-0 control.

Зачем это спрашивают: Сильный ответ масштабирует governance по change risk и сохраняет auditable production path.

networkingterraform

Я публикую небольшие versioned modules и собираю из них поддерживаемые account и environment stacks.

  • VPC module владеет networking primitives и отдаёт stable contract, но не создаёт одновременно EKS, databases и application IAM.
  • Opinionated wrapper modules дают approved defaults common path, открывая только реально меняющиеся teams inputs.
  • CI тестирует examples, upgrade paths, policy compliance и plans минимум для двух реальных account classes до release.

Зачем это спрашивают: Интервьюер проверяет module boundaries, supported defaults и evidence безопасной эволюции reusable IaC.

terraform

Я делю state по lifecycle, blast radius, ownership и change frequency, а не произвольному числу ресурсов.

  • Network, shared identity, clusters, data services и application stacks получают отдельные states с явными remote outputs.
  • Я избегаю длинных chains terraform_remote_state, публикуя stable values через parameter store или platform API там, где уместно.
  • Migration использует moved blocks или state moves в reviewed batches с целевыми lock time и plan p95 ниже пяти минут.

Зачем это спрашивают: Сильный ответ улучшает plan scale, не заменяя один monolith хрупким graph state dependencies.

designterraform

Я использую remote encrypted backend с locking, versioning, audit logs и узкими identities.

  • S3 native lockfiles с versioning или Terraform Cloud предотвращают concurrent writes и хранят recoverable state versions.
  • Каждый state имеет dedicated apply identity; plan jobs получают read access и short-lived OIDC credentials.
  • CI сериализует applies на state, снимает stale locks через audited procedure и quarterly тестирует restoration.

Зачем это спрашивают: Интервьюер оценивает state durability, concurrency control, identity scope и recoverability при реальном change volume.

terraformconfig

Я использую отдельные root configurations и state backends для account и production boundaries, а не 90 CLI workspaces.

  • Directory или generated-stack structure делает account, region и environment видимыми в review и access policy.
  • Production получает отдельные apply identity и approval path, поэтому выбор неверного workspace не может попасть в него.
  • Workspaces остаются для short-lived identical preview environments с действительно одинаковыми isolation и configuration.

Зачем это спрашивают: Сильный ответ выбирает видимую access-controlled isolation для long-lived environments и ограничивает workspaces однородными копиями.

terraformiac

Я запускаю scheduled read-only plans для каждого state и направляю actionable drift owning team.

  • High-risk states планируются hourly, обычные daily, а cloud audit events запускают targeted plans после console changes.
  • Report отделяет provider normalization от реальных create, update и delete actions, удерживая false positives ниже 5%.
  • Emergency changes получают owner и expiry, затем импортируются в code или reverted в течение 24 часов.

Зачем это спрашивают: Интервьюер проверяет, является ли drift detection частым, attributable, low-noise и связанным с remediation path.

terraform

Я публикую новую major version и поддерживаю старый contract в течение измеренного migration window.

  • Upgrade tests запускают representative consumer plans и документируют state moves, renamed inputs и provider-version requirements.
  • Renovate или похожий bot открывает pinned-version pull requests группами по пять consumers, начиная с non-production.
  • Старый major удаляется только после migration всех 60 states и одной проверки rollback instructions.

Зачем это спрашивают: Сильный ответ считает module versioned product с consumer testing и контролируемой migration.

code-reviewterraform

Я создаю plan из reviewed commit и применяю именно этот approved plan через short-lived production identity.

  • CI хранит binary plan, human-readable summary, provider lockfile и commit SHA как один immutable review artifact.
  • Apply отклоняет changed branch head, stale plan, policy failure или expired approval вместо silent replan.
  • Production plans истекают через короткое окно, например четыре часа, потому что external state может измениться.

Зачем это спрашивают: Интервьюер оценивает integrity review и защиту от применения инфраструктуры, отличной от одобренной.

ownershipmigrationsdesign

Я мигрирую по service boundary и risk tier, а не делаю один bulk import.

  • Inventory и cloud tags определяют owner, dependencies и решение import, replace или retire для каждого ресурса.
  • Generated import blocks ускоряют capture, но каждый imported state должен получить zero-change plan до обычных applies.
  • Cohorts начинают с non-production и идут примерно по 100 ресурсов в неделю с monitoring unintended replacement и access changes.

Зачем это спрашивают: Сильный ответ сочетает inventory, import verification и устойчивый migration rate существующей infrastructure.

Закрытые вопросы

  • 21

    40 команд знают TypeScript, но platform group эксплуатирует 15 000 Terraform resources. Добавлять CDK или Pulumi?

    terraformiactypescript
  • 22

    Security требует encryption, private access и backup 30 дней для каждой новой cloud database. Где enforce это в IaC?

    databaseencryptioniac
  • 23

    Спроектируйте Prometheus monitoring для 30 Kubernetes clusters с 12 миллионами active series и retention 13 месяцев.

    kubernetesmonitoringdesign
  • 24

    Platform ingest-ит 20 TB logs в день от 800 сервисов. Как спроектировать storage и querying?

    queriesdesign
  • 25

    Tracing backend не может хранить все 2 миллиона spans в секунду. Какую sampling architecture выбрать?

    samplingarchitecture
  • 26

    Как развернуть OpenTelemetry collectors для 500 сервисов в 20 clusters без одного global bottleneck?

    deploymentobservabilitytracking
  • 27

    Определите SLIs для checkout API на 5 000 requests в секунду с availability target 99,95%.

    api
  • 28

    У сервиса monthly availability SLO 99,9%. Какой error budget он имеет и как releases его расходуют?

    reliabilityslo
  • 29

    Спроектируйте burn-rate alerts для SLO 99,9% без page на каждый короткий error spike.

    designsloalerting
  • 30

    Prometheus растёт с 4 до 18 миллионов series после добавления teams labels user_id. Какие guardrails нужны?

    guardrailsdesignmonitoring
  • 31

    Metrics, logs и traces стоят $140 000 в месяц. Как задать retention без ослабления audit requirement 90 дней?

    retentionmonitoring
  • 32

    Release dashboard сравнивает 2 versions, но не связывает errors с traces и deployed digest. Как переделать telemetry correlation?

    correlationdeployment
  • 33

    Вы строите internal developer platform для 300 инженеров и имеете 90 дней на первый release. Что выпустить?

  • 34

    Спроектируйте golden path для 80 Go services, которым сейчас нужно пять дней до production.

    design
  • 35

    Организация из 500 инженеров хочет Backstage, но service catalog точен только на 40%. Что внедрить первым?

  • 36

    Команды запрашивают 50 development databases в день. Как дать self-service без unrestricted cloud access?

    database
  • 37

    Спроектируйте Crossplane platform API для трёх clouds без открытия application teams 200 provider fields.

    designapiiac
  • 38

    Как измерять internal platform для 45 команд вместо подсчёта shipped features?

  • 39

    Product должен работать в AWS и GCP, но 85% workloads используют только basic compute, database и object storage. Что abstract в platform?

    database
  • 40

    GitHub Actions deploy-ит в 25 AWS accounts через годовые access keys. Спроектируйте замену на OIDC.

    ci-cddeploymentdesign
  • 41

    200 сервисам нужны database credentials с rotation каждый час. Как Vault будет их доставлять?

    databasesecrets
  • 42

    ArgoCD управляет 20 clusters, а security запрещает plaintext secrets в Git. Выбрать SOPS или External Secrets?

    gitgitopssecrets
  • 43

    Спроектируйте software supply-chain controls для 300 container builds в день без добавления больше трёх минут к CI.

    designcontainers
  • 44

    Public pull requests требуют CI, но release runners могут deploy в 12 production accounts. Как предотвратить credential theft?

    code-reviewdeployment
  • 45

    Спроектируйте ArgoCD repository structure для 100 teams, 20 clusters и четырёх environments без одного root application на всё.

    designgitops
  • 46

    Release должен пройти 3 окружения с одним image digest. Как работает GitOps promotion?

    gitops
  • 47

    Application требует database migration, Deployment и smoke test внутри 15-минутного ArgoCD sync. Как задать порядок?

    databasemigrationsdeployment
  • 48

    ArgoCD находит 300 drifted resources в день, но 70% являются fields других controllers. Как безопасно настроить sync?

    configiacgitops
  • 49

    Container registry хранит 200 TB, растёт на 12 TB ежемесячно и должен сохранять каждый production artifact год. Какой retention policy нужен?

    containersartifactsregistries
  • 50

    Teams в трёх регионах ежедневно pull 8 TB images из одного registry, а deployments должны работать при regional outage. Какую architecture выбрать?

    deploymentregistriesarchitecture
  • 51

    Canary прошёл на 5% traffic, но после promotion checkout errors выросли с 0,2% до 3%. Что откатывать и проверять?

    deployment-strategiesrollback
  • 52

    Release сохраняет прежний error rate, но повышает API p99 с 240 мс до 1,8 секунды на 50% traffic. Продвигать?

    api
  • 53

    Deployments падают, потому что database migration длится 22 минуты при timeout pipeline 15 минут. Как восстановиться?

    databasemigrationsdeployment
  • 54

    Feature flag включает новый код для 30% users, и errors растут до 6% без нового deploy. Каков rollback path?

    deploymentfeature-flagsrollback
  • 55

    Build time monorepo растёт с 11 до 46 минут за одну неделю. Как найти regression?

    monorepo
  • 56

    CI queue p95 растёт с 2 до 35 минут в рабочее время, но runner CPU в среднем только 40%. Что проверять?

    data-structures
  • 57

    После toolchain update remote build cache hit rate падает с 82% до 9%. Как безопасно восстановить его?

    caching
  • 58

    Flaky tests ломают 18% pipelines, и teams rerun jobs до success. Что изменить на этой неделе?

    flakyci-cd
  • 59

    Artifact uploads добавляют 14 минут каждой build после роста image с 600 MB до 4 GB. Что делать?

    artifacts
  • 60

    Runner image update ломает 70% pipelines у 50 teams. Как восстановить service?

    ci-cd
  • 61

    Открытый вручную security group создаёт public database path на 47 минут. Terraform замечает его только на следующий день. Что делать?

    databaseterraformnetworking
  • 62

    После provider upgrade Terraform планирует replacement 400 production resources. Как принять решение?

    terraformconcurrency
  • 63

    Terraform apply теряет lock после создания 60 из 100 ресурсов. Второй pipeline ждёт. Что делать?

    terraformci-cd
  • 64

    Refactor перемещает Terraform resources между states, и production теряет 12 IAM bindings. Как восстановиться?

    refactoringterraform
  • 65

    Drift job показывает 3 000 changes, но 95% являются provider-generated ordering noise. Как вернуть signal?

    iac
  • 66

    CI token с admin access к 18 AWS accounts опубликован в public repository на 26 минут. Что происходит первым?

    tokens
  • 67

    Database password найден в 240 commits и 35 release artifacts. Удаления последнего файла недостаточно. Что делать?

    databasepasswordsartifacts
  • 68

    GitHub OIDC trust policy случайно позволяет каждому repository организации assume production role. Как сдержать это?

  • 69

    Vault недоступен 25 минут, и credentials 80 сервисов начинают истекать. Как безопасно сохранить работу?

    secrets
  • 70

    Trivy блокирует 65% builds после vulnerability database update, включая 900 findings без available fix. Что изменить?

    databasevulnerabilities
  • 71

    Во время 40-минутного checkout outage есть CPU и error metrics, но нет queue-depth metric. Как закрыть observability gap?

    observabilitymonitoringdata-structures
  • 72

    API p99 утраивается после deploy, но traces есть только для 4% requests и ни одного для slow endpoint. Что исправить?

    endpointsdeployment
  • 73

    Logging pipeline теряет 18% production logs на пике без единого page. Как вернуть trust?

    loggingci-cd
  • 74

    Prometheus query p95 растёт до 28 секунд во время incidents, делая dashboards бесполезными. Что изменить первым?

    incidentsqueriesmonitoring
  • 75

    Platform отправляет 600 alerts в день, но actions требуют только 14. Что удалить первым?

    alerting
  • 76

    Стоимость self-hosted runners растёт с $70 000 до $190 000 в месяц при росте job volume только 8%. Как расследовать?

    ci-cd
  • 77

    CI job скачивает 6 GB dependencies 20 000 раз в месяц и создаёт network bill $38 000. Что изменить?

    dependencies
  • 78

    Observability spend растёт со $110 000 до $260 000 в месяц после high-cardinality labels трёх teams. Что делать?

    observability
  • 79

    Log storage достигает 4 PB и растёт на 200 TB в месяц, но searches старше 14 дней составляют 0,3%. Что изменить?

    queries
  • 80

    Release создаёт 900 idle GPU instances за ночь и добавляет $54 000 до detection. Как сдержать и предотвратить?

  • 81

    В 02:00 artifact registry отвечает 503 на 70% pulls, блокируя все новые Pods. Вы platform on-call. Что делать?

    artifactsregistrieson-call
  • 82

    В 03:00 Terraform Cloud не запускает applies, а production ждёт network fix. Как решить вопрос break-glass?

    terraform
  • 83

    Platform API для 45 teams возвращает 30% errors после rotation certificate. Как вести on-call response?

    on-callapi
  • 84

    Error budget исчерпан, но marketing хочет launch с ожидаемым 3x traffic завтра. Какую рекомендацию дать?

    reliability
  • 85

    Chaos test отключает одну availability zone, и recovery занимает 19 минут при objective пять минут. Что дальше?

    availability
  • 86

    Traffic forecast ожидал рост 30%, но partner launch создаёт 4x load и исчерпывает capacity за 12 минут. Что изменить?

    capacity
  • 87

    Platform team тратит 140 часов в месяц на manual access provisioning по 25 минут на request. Что автоматизировать?

  • 88

    Jenkins migration переносит 80 из 800 jobs, но failure rate растёт с 2% до 14%. Продолжать?

    migrations
  • 89

    Во время VM-to-Kubernetes cutover 10% traffic даёт 4% errors, а VM path держит 0,3%. Что делать?

    kubernetes
  • 90

    Cross-cloud migration PostgreSQL 2 TB подходит к cutover с replica lag 18 минут при окне пять минут. Продолжать?

    postgresmigrationsreplication
  • 91

    ArgoCD sync неожиданно удаляет 120 resources, потому что ApplicationSet generator возвращает empty list. Что делать?

    gitopsgenerators
  • 92

    ArgoCD PreSync hook зависает на 20 минут и блокирует 60 application releases. Как восстановиться?

    hooksgitops
  • 93

    Critical CVE появляется за четыре часа до release, затрагивает 300 images и не имеет patch. Какой standard применить?

  • 94

    У 50 teams уникальные pipelines, а shared security fix дошёл только до 12 за две недели. Как стандартизировать сейчас?

    ci-cd
  • 95

    Сильный operations engineer закрывает 20 pages в месяц, но повторяет один manual fix. Как его менторить?

    mentoring
  • 96

    Middle-инженер хочет apply Terraform plan с 30 replacements ради deadline. Как coach решение?

    estimationterraform
  • 97

    В team из шести человек один Vault expert обработал 9 из последних 10 secret incidents. Что изменить за quarter?

    secretsincidents
  • 98

    Во время sev1 для 40% customers executive пишет fixes каждые две минуты и требует constant updates. Как действовать?

    soft-skills
  • 99

    CFO требует cut infrastructure 40%, но services с SLO 99,95% уже используют 70% peak capacity. Что предложить?

    capacityslo
  • 100

    AI-generated Terraform pull request предлагает 180 resources и проходит syntax checks, но 12 IAM policies содержат wildcards. Какой standard применить?

    code-reviewterraform