Эти навыки не влияют на основной грейд, но покажут полноту вашего профиля.
AI-ассистенты кодирования
▼
Использует AI для SRE-задач: анализ логов, troubleshooting incidents, генерация runbooks. Проверяет AI-рекомендации перед применением в production.
Применяет LLM для SRE: automated incident analysis, root cause suggestion, runbook generation. Критически оценивает AI-предложения по infrastructure changes.
Интегрирует AI в SRE-операции: AIOps для anomaly detection, intelligent alerting, automated incident response drafts. Определяет границы AI-automation.
Определяет AI-стратегию для SRE: AIOps tool selection, automated analysis pipelines, AI-assisted incident response. Обучает команду эффективному использованию.
Использует Cursor IDE для SRE: AI-assisted написание Terraform/Python automation, автокомплит для cloud SDK. Ускоряет написание monitoring configs.
Настраивает Cursor для SRE-workflow: custom rules для IaC patterns, multi-file editing для Terraform modules. Интегрирует с infrastructure CLI tools.
Оптимизирует Cursor для SRE-команды: shared configurations, prompts для reliability patterns, integration со SRE-специфичными tools.
Определяет стандарты AI IDE для SRE: approved configurations, security policies для infrastructure code. Обучает команду эффективному использованию.
Использует Copilot для SRE-задач: генерация Terraform конфигов, Kubernetes manifests, shell-скриптов для automation. Понимает когда подсказка корректна для infrastructure кода.
Продуктивно работает с Copilot: генерирует Helm values, Prometheus alerting rules, Python scripts для automation. Использует Chat для анализа error logs и troubleshooting.
Максимизирует продуктивность: генерация сложных Terraform modules, K8s operators, monitoring dashboards-as-code. Workflow: AI для boilerplate, инженер для architecture и security review.
Внедряет Copilot в SRE-команде: границы использования (configs да, security policies — review), best practices для infrastructure code generation. Оценивает ROI и security risks.
CI/CD
▼
Понимает CI/CD pipeline: этапы build, test, deploy. Запускает и мониторит pipeline runs. Дебажит failed jobs через логи. Понимает triggers и environments.
Настраивает CI/CD для infrastructure: Terraform plan/apply, Helm upgrades, container builds. Автоматизирует testing: infra unit tests, integration tests. Реализует approval gates для production.
Проектирует CI/CD для platform: multi-stage deployments, canary/blue-green, rollback automation. Внедряет progressive delivery (Argo Rollouts, Flagger). Оптимизирует pipeline performance.
Определяет CI/CD-стандарты: deployment policies, approval workflows, rollback procedures. Внедряет deployment metrics (DORA). Координирует deployment practices между командами.
Code Review
▼
Участвует в review инфраструктурных изменений: проверяет Terraform plans, Helm values, K8s manifests. Оставляет конструктивные комментарии. Учится на feedback.
Проводит review: проверяет Terraform модули на security, K8s configs на reliability (resource limits, probes), networking на blast radius. Предлагает best practices.
Проводит архитектурный review: оценивает infrastructure design, blast radius, failure modes. Ревьюит capacity planning, security implications, cost impact изменений.
Формирует review-культуру: определяет checklist для infra review (security, reliability, cost), SLA на review time. Автоматизирует checks (tfsec, conftest, kube-linter).
Distributed Tracing
▼
Понимает основы Jaeger / Grafana Tempo. Читает логи и метрики. Использует готовые dashboards для мониторинга.
Настраивает Jaeger / Grafana Tempo для сервисов. Создаёт dashboards и алерты. Участвует в on-call ротации. Анализирует инциденты.
Проектирует observability стратегию с Jaeger / Grafana Tempo. Внедряет distributed tracing. Определяет SLI/SLO. Проводит post-mortems.
Определяет tracing-стандарты: mandatory spans, sampling rates, retention policies. Внедряет Tempo/Jaeger для distributed tracing. Использует traces для dependency mapping и bottleneck analysis.
Понимает OpenTelemetry: traces, metrics, logs — три столпа observability. Подключает auto-instrumentation к сервисам. Видит traces в Jaeger/Tempo. Понимает context propagation.
Настраивает OpenTelemetry: collector deployment (sidecar/daemonset), processor pipeline, exporter configuration. Добавляет custom spans и attributes. Интегрирует traces + metrics + logs.
Проектирует OTel-архитектуру: collector fleet management, sampling strategies, tail-based sampling. Оптимизирует overhead и storage costs. Реализует custom processors для enrichment.
Определяет OTel-стандарты: collector configuration, resource attributes policy, instrumentation requirements per service. Внедряет observability-as-code подход.
DNS и сетевая инфраструктура
▼
Понимает VPN для secure connectivity: site-to-site для data centers, client VPN для remote access. Настраивает и тестирует VPN-подключения. Диагностирует connection issues.
Управляет VPN-инфраструктурой: IPSec tunnels, WireGuard для internal connectivity, split tunneling. Мониторит tunnel health и latency. Настраивает failover между VPN endpoints.
Проектирует VPN-архитектуру: hub-and-spoke vs mesh, Transit Gateway VPN attachments, automated tunnel management. Оптимизирует throughput. Планирует migration на zero-trust (BeyondCorp).
Определяет VPN-стандарты: encryption requirements, tunnel monitoring SLA, access policies. Координирует VPN infrastructure между cloud и on-premise. Внедряет automated provisioning.
Понимает load balancing: Layer 4 vs Layer 7, health checks, round-robin. Настраивает ALB/NLB в AWS. Мониторит load balancer метрики: request count, latency, error rate.
Управляет load balancers: target groups, weighted routing, TLS termination. Настраивает advanced health checks. Реализует canary deployments через traffic shifting. Диагностирует 502/503 errors.
Проектирует load balancing архитектуру: global load balancing (Route53, Cloudflare), internal LB для microservices, gRPC balancing. Оптимизирует connection draining, session affinity, retry policies.
Определяет LB-стандарты: health check requirements, failover procedures, capacity planning. Внедряет automated traffic management. Проводит load testing и failure mode analysis.
E2E-тестирование
▼
Тестирует SRE-инструменты end-to-end: проверяет полный incident response flow, monitoring → alerting → notification pipeline. Участвует в game days.
Проектирует e2e тесты для SRE: disaster recovery drills, failover testing, monitoring validation. Автоматизирует reliability validation в CI.
Определяет e2e testing стратегию SRE: chaos engineering, game day framework, production readiness testing. Внедряет automated reliability validation.
Внедряет e2e testing стандарты: mandatory DR drills, game day cadence, failover testing requirements. Определяет testing infrastructure.
Git и workflow
▼
Работает с Git для infrastructure: commit, push, pull для Terraform, K8s manifests, configs. Следует GitOps-workflow команды. Пишет понятные commit-сообщения.
Использует Git для IaC: feature branches, rebasing, squash для clean history. Работает с mono-repo для infrastructure. Настраивает git hooks для terraform fmt, yaml lint.
Определяет Git-стратегию для infrastructure: trunk-based для configs, release branches для infrastructure versions. Настраивает branch protection, CODEOWNERS для critical infrastructure.
Формирует Git-workflow для SRE: GitOps standards, PR review requirements для infra changes, automated checks. Определяет mono vs multi-repo strategy для infrastructure.
GitOps
▼
Понимает базовые концепции ArgoCD для управления деплоями сервисов и reconciliation инфраструктуры. Следует runbooks команды для проверки статуса синхронизации Applications, идентификации рассинхронизированных ресурсов во время инцидентов и верификации здоровья деплоев. Использует UI и CLI ArgoCD для наблюдения за состояниями деплоев и корреляции событий синхронизации с проблемами доступности сервисов.
Самостоятельно настраивает ArgoCD для надёжных деплоев сервисов с health checks, sync windows и автоматическим откатом при нарушении SLO. Пишет ApplicationSets для консистентного деплоя инфраструктуры по зонам надёжности и регионам. Реализует мониторинг ArgoCD с метриками Prometheus, алертинг на сбои синхронизации и интеграцию с процессами управления инцидентами.
Проектирует архитектуру ArgoCD для высокодоступной доставки сервисов с мультикластерным failover и паттернами disaster recovery. Внедряет GitOps-управляемые практики надёжности, включая автоматизированный canary-анализ, гейты деплоя на основе SLO и интеграцию chaos engineering для валидации деплоев. Оптимизирует ArgoCD для продакшн-надёжности с HA контроллеров, webhook-управляемой reconciliation и пайплайнами алертинга дрифта.
Определяет стандарты надёжности деплоев на базе ArgoCD для флота сервисов организации. Формирует governance для безопасности деплоев, включая политики прогрессивного раскатки, контроль радиуса поражения и процессы согласования деплоев, интегрированные с SLO. Проводит архитектурные ревью конфигураций ArgoCD с перспективы надёжности и продвигает внедрение паттернов GitOps-ремедиации инцидентов.
GraphQL
▼
Понимает GraphQL для SRE: мониторит GraphQL-сервисы, понимает query complexity. Настраивает health checks и alerting для GraphQL endpoints.
Обеспечивает reliability GraphQL: performance monitoring, query depth limiting, rate limiting. Настраивает SLI для GraphQL (latency, error rate).
Проектирует reliability для GraphQL-инфраструктуры: caching strategy, CDN integration, federation monitoring. Определяет performance budgets.
Определяет reliability стандарты для GraphQL: SLO requirements, monitoring coverage, capacity planning. Координирует с development командами.
Infrastructure as Code
▼
Использует Terraform для SRE-инфраструктуры: EC2, VPC, S3, RDS. Понимает plan/apply workflow. Читает существующие модули. Следует IaC-practices команды.
Пишет Terraform-модули для мониторинг-инфраструктуры: Prometheus на EKS, Grafana Cloud, CloudWatch alarms. Управляет state: remote backend, state locking. Настраивает CI/CD для Terraform.
Проектирует IaC для platform: reusable модули, composition patterns, Terragrunt для DRY конфигурации. Автоматизирует infrastructure drift detection. Реализует blast radius reduction через workspace isolation.
Определяет IaC-стандарты: module registry, review процесс, change management. Внедряет policy-as-code (Sentinel/OPA). Координирует Terraform adoption между командами.
Kubernetes и оркестрация
▼
Устанавливает и обновляет Helm-чарты: Prometheus stack, Grafana, Loki, cert-manager. Понимает values.yaml, release management. Дебажит failed deployments через helm status.
Создаёт Helm-чарты для SRE-инструментов: кастомные exporters, alerting rules, dashboards-as-code. Управляет dependencies и chart repositories. Настраивает environments через value overrides.
Проектирует Helm-стратегию: library charts для shared components, umbrella charts для full stack deployment. Автоматизирует chart testing (helm unittest, ct lint). Внедряет GitOps workflow для Helm releases.
Определяет Helm-стандарты: chart structure, templating best practices, review process. Координирует chart development между SRE и product teams. Внедряет automated chart upgrades.
Работает с Kubernetes для SRE: kubectl для диагностики, pod logs, describe для troubleshooting. Понимает deployments, services, configmaps. Следует runbooks при инцидентах.
Администрирует Kubernetes: RBAC, network policies, resource quotas. Настраивает HPA/VPA для автоскейлинга. Диагностирует сложные проблемы: CrashLoopBackOff, evictions, networking issues.
Проектирует Kubernetes reliability: pod disruption budgets, topology spread constraints, custom operators для automation. Настраивает multi-zone deployment, graceful shutdown. Оптимизирует cluster performance.
Определяет K8s-стандарты: cluster configuration baselines, security hardening, upgrade procedures. Внедряет policy engines (Kyverno/OPA Gatekeeper). Координирует cluster lifecycle management.
Понимает базовые K8s-концепции: pods, deployments, services, namespaces. Деплоит monitoring stack через kubectl/Helm. Читает pod логи и events для troubleshooting.
Управляет K8s-ресурсами: ConfigMaps для конфигурации, Secrets management, Ingress для routing. Настраивает liveness/readiness probes. Понимает scheduling: nodeSelector, affinity, tolerations.
Проектирует K8s-инфраструктуру для reliability: StatefulSets для stateful workloads, DaemonSets для node-level monitoring, Jobs/CronJobs для maintenance. Настраивает service mesh (Istio/Linkerd).
Определяет K8s core стандарты: namespace strategy, label/annotation conventions, resource limits guidelines. Внедряет admission webhooks для policy enforcement. Проводит capacity planning.
Prompt Engineering
▼
Составляет промпты для SRE-задач: анализ error logs, генерация alerting rules, troubleshooting guides. Формулирует контекст для incident analysis.
Создаёт structured промпты: шаблоны для incident postmortem, capacity planning analysis, runbook generation. Использует chain-of-thought для root cause analysis.
Проектирует prompt-системы для SRE: automated incident analysis pipelines, systematic prompts для architecture review. Оценивает AI reliability.
Определяет prompt-стандарты для SRE: библиотека промптов для incident response, evaluation criteria, security guidelines для AI в operations.
REST API
▼
Работает с REST API для SRE: использует API мониторинг-систем (Prometheus, PagerDuty, Grafana), автоматизирует рутинные операции через API. Понимает HTTP-коды и authentication.
Разрабатывает API для SRE-автоматизации: runbook endpoints, deployment triggers, health-check aggregators. Интегрирует через API: PagerDuty, Slack, Jira для incident management workflow.
Проектирует API для SRE-платформы: self-service infrastructure provisioning, SLO management API, incident orchestration. Реализует idempotency для critical operations (rollback, scaling).
Определяет API-стандарты SRE-платформы: OpenAPI для internal tools, versioning strategy, rate limiting. Внедряет API-first approach для SRE automation.
System Design
▼
Понимает основы capacity planning: CPU, memory, disk, network usage. Мониторит resource utilization через dashboards. Создаёт алерты на высокую утилизацию.
Проводит capacity planning для сервисов: trend analysis, growth prediction, resource right-sizing. Настраивает HPA/VPA. Создаёт capacity dashboards. Планирует seasonal load changes.
Проектирует capacity management: predictive scaling, load testing для capacity validation, cost-aware autoscaling. Реализует automated right-sizing рекомендации. Моделирует growth scenarios.
Определяет capacity planning процесс: periodic reviews, headroom policy, growth budgets. Координирует capacity requests между командами. Внедряет automated capacity reporting.
Понимает DR-концепции: RPO, RTO, backup types. Следует DR-процедурам: failover runbooks, backup verification. Участвует в DR-drills.
Реализует DR-решения: automated backups, cross-region replication, failover testing. Документирует DR-планы. Настраивает backup monitoring и alerting на backup failures.
Проектирует DR-архитектуру: active-passive vs active-active, pilot light, warm standby. Реализует automated failover. Проводит chaos engineering для DR validation. Определяет RTO/RPO по tier-ам.
Определяет DR-стандарты организации: tiered recovery model, mandatory DR-testing schedule, communication plan. Координирует cross-team DR drills. Внедряет DR metrics.
Понимает принципы high-load: горизонтальное масштабирование, кеширование, load balancing. Мониторит high-load метрики: RPS, latency percentiles, error rates.
Поддерживает high-load системы: autoscaling policies, connection pool tuning, cache optimization. Проводит load testing (k6, Locust). Диагностирует bottlenecks через profiling.
Проектирует high-load архитектуру: sharding strategies, CQRS для read-heavy workloads, queue-based decoupling. Оптимизирует: connection pooling, batch processing, async communication.
Определяет scalability-стандарты: performance budgets, mandatory load testing, architecture review для high-load. Координирует capacity planning. Формирует best practices для scaling.
Понимает архитектуру production-систем: load balancer → app servers → database, caching layer, message queues. Знает failure modes каждого компонента.
Проектирует reliable systems: redundancy patterns (active-passive, active-active), circuit breakers, retry with backoff. Проводит failure mode analysis. Выбирает sync vs async communication.
Проектирует distributed systems: CAP theorem trade-offs, consensus protocols, eventual consistency patterns. Определяет data replication strategy. Проектирует cross-service communication (mesh, events).
Определяет архитектурные стандарты reliability: mandatory design reviews, failure budget, architecture templates. Проводит architecture review с фокусом на failure modes и scalability.
Unit-тестирование
▼
Пишет unit-тесты для SRE-инструментов: тестирует alerting rules, automation скрипты, health checks. Использует pytest/jest для infrastructure кода.
Тестирует SRE-automation: unit-тесты для runbook scripts, alerting logic, custom exporters. Использует mocks для cloud API и infrastructure components.
Проектирует testing стратегию для SRE: тесты reliability tools, chaos engineering validation, policy-as-code testing. Внедряет CI для infrastructure code.
Определяет testing стандарты SRE: mandatory тесты для automation, alerting validation, runbook testing. Внедряет quality gates для infrastructure changes.
Алгоритмы и структуры данных
▼
Понимает базовые алгоритмические концепции для SRE: простая агрегация метрик, базовая оценка порогов алертов, фильтрация и сортировка логов. Следует руководству команды по выбору алгоритмов для скриптов мониторинга и операционной автоматизации.
Самостоятельно применяет алгоритмическое мышление в SRE: оценивает компромиссы чувствительности алгоритмов алертинга, выбирает алгоритмы балансировки нагрузки для распределения трафика, понимает подходы алгоритмов предсказания ёмкости. Анализирует сложность обработки данных мониторинга и операций обнаружения инцидентов.
Применяет алгоритмическое мышление к SRE: алгоритмы обнаружения аномалий для проактивного предотвращения инцидентов, алгоритмы load shedding для graceful degradation, алгоритмы предсказания ёмкости на основе исторических трендов. Проектирует эффективные алгоритмы алертинга, минимизирующие шум при сохранении чувствительности детекции.
Устанавливает performance-бюджеты для критических сервисов. Проводит review с фокусом на latency-чувствительные алгоритмы. Внедряет benchmarking и capacity testing в CI для обнаружения регрессий.
Понимает базовые структуры данных для SRE-работы: схемы меток метрик, объекты конфигурации правил алертинга, структуры параметров runbook. Следует командным конвенциям организации конфигураций мониторинга и данных реагирования на инциденты.
Самостоятельно выбирает подходящие структуры данных для SRE-работы: структуры меток метрик для эффективного запроса, модели данных правил алертинга, схемы параметров runbook. Понимает компромиссы между кардинальностью данных мониторинга и производительностью запросов для платформ observability.
Выбирает оптимальные структуры данных для SRE-инструментов: базы данных временных рядов для хранения метрик, структуры данных с эффективной кардинальностью для многомерного мониторинга, кольцевые буферы для окон последних событий. Оптимизирует структуры данных оценки алертов для минимальной задержки обработки правил. Проектирует эффективные модели данных для реконструкции таймлайна инцидентов и post-mortem анализа.
Определяет стандарты моделирования конфигов и состояний: structured configs (YAML/JSON schemas), typed metrics labels. Ревьюит data models для monitoring и alerting систем на предмет cardinality.
Алертинг и on-call
▼
Понимает SLI/SLO/SLA: availability, latency, error rate как индикаторы. Мониторит SLO-дашборды. Понимает error budgets. Реагирует на SLO burn rate alerts.
Определяет SLI для сервисов: availability (successful requests / total), latency (p99 < threshold), качество. Настраивает SLO tracking в Prometheus/Grafana. Рассчитывает error budgets.
Проектирует SLO framework: multi-window burn rate alerting, SLO-based pages, error budget policies. Реализует automated SLO reporting. Интегрирует SLO с deployment decisions.
Определяет SLO-стандарты организации: SLO requirements per tier, error budget governance, SLO review cadence. Обучает команды SRE-practices. Координирует SLO adoption.
Аутентификация и авторизация
▼
Понимает JWT/OAuth для SRE: мониторит auth-сервисы, настраивает alerting на auth failures. Управляет service account tokens для automation.
Обеспечивает reliability auth-систем: monitoring token expiration, auth service SLI, certificate management. Автоматизирует token rotation.
Проектирует auth reliability: HA auth infrastructure, token caching strategy, certificate automation (cert-manager). Определяет auth SLO.
Определяет auth operations стандарты: certificate lifecycle management, token policies, auth monitoring requirements. Координирует с security team.
Безопасность инфраструктуры
▼
Работает с HashiCorp Vault для получения секретов: CLI для чтения, environment injection через sidecar. Понимает пути секретов и access policies. Не хардкодит credentials.
Управляет Vault: настраивает secret engines (KV, database, PKI), auth methods (K8s, OIDC). Ротирует секреты. Интегрирует Vault с CI/CD и Kubernetes (CSI driver, injector).
Проектирует secrets management: Vault HA cluster (Raft), dynamic secrets для databases, PKI infrastructure. Автоматизирует certificate rotation. Реализует audit logging и compliance monitoring.
Определяет secrets management стандарты: Vault architecture, access policies, rotation schedule. Внедряет secret scanning в CI. Координирует secrets infrastructure между командами.
Безопасность приложений
▼
Понимает базовые security-практики для инфраструктуры: принцип least privilege, secure defaults. Следует security runbooks. Мониторит security alerts от CloudWatch/GuardDuty.
Применяет security в infrastructure: hardening guides для OS и containers, security scanning в CI (Trivy, Snyk), audit logging. Настраивает WAF-правила и реагирует на security alerts.
Проектирует infrastructure security: network segmentation, runtime protection (Falco), vulnerability management pipeline. Реализует security-as-code: policy enforcement, compliance scanning.
Определяет security-стандарты инфраструктуры: hardening baselines, vulnerability SLA, security monitoring requirements. Координирует с security-командой. Проводит threat modeling для infrastructure.
Применяет secure coding для SRE: не хардкодит credentials, безопасная работа с secrets в automation. Использует vault/secrets manager в скриптах.
Реализует security для infrastructure code: encrypted secrets, secure CI/CD pipelines, least privilege для automation. Сканирует IaC через security tools.
Проектирует secure infrastructure automation: secrets rotation automation, secure bootstrapping, compliance-as-code. Внедряет security scanning в infrastructure CI.
Определяет security стандарты SRE: infrastructure security policies, secrets management, access control review. Внедряет security-as-code.
Веб-фреймворки
▼
Использует Python Web Frameworks на базовом уровне в Kubernetes/Terraform. Выполняет простые задачи по готовым шаблонам. Понимает базовые концепции и следует принятым в команде практикам.
Самостоятельно реализует задачи с Python Web Frameworks в Kubernetes/Terraform. Понимает внутреннее устройство и оптимизирует производительность. Пишет тесты с помощью chaos engineering.
Разрабатывает SRE-сервисы на Flask/FastAPI: status pages, runbook automation API, custom webhook receivers для alerting integration. Реализует health-check endpoints для internal tooling.
Определяет стандарты SRE-сервисов: FastAPI для automation API, internal dashboards, incident bot backends. Выбирает между Python и Go для SRE tooling по performance и maintainability.
Интеграционное тестирование
▼
Тестирует интеграцию SRE-инструментов: проверяет alerting → PagerDuty связку, monitoring stack connectivity. Использует test environments для validation.
Проектирует integration тесты для SRE: тестирование monitoring pipeline, alerting rules validation, deployment verification. Автоматизирует в CI/CD.
Определяет integration testing стратегию: end-to-end monitoring validation, disaster recovery testing, failover verification. Внедряет game days.
Внедряет стандарты integration testing для SRE: mandatory failover tests, monitoring validation, change verification procedures.
Контейнеризация
▼
Работает с Docker для SRE: запускает мониторинг-стек (Prometheus, Grafana, AlertManager), дебажит container issues. Понимает layers, volumes, networking. Читает container logs.
Управляет Docker в production: multi-stage builds для SRE tools, security scanning (Trivy), resource limits. Настраивает logging drivers, health checks. Диагностирует container runtime issues.
Проектирует container runtime standards: image security pipeline, registry management, runtime security (seccomp, AppArmor). Оптимизирует container performance: cgroup limits, OOM handling, filesystem layers.
Определяет container-стандарты организации: base image policy, vulnerability management SLA, runtime configuration guidelines. Внедряет container observability и security scanning в CI.
Кэширование
▼
Использует Redis на базовом уровне в Kubernetes/Terraform. Выполняет простые задачи по готовым шаблонам. Понимает базовые концепции и следует принятым в команде практикам.
Самостоятельно реализует задачи с Redis в Kubernetes/Terraform. Понимает внутреннее устройство и оптимизирует производительность. Пишет тесты с помощью chaos engineering.
Использует Redis для SRE-инструментов: rate limiting для alert deduplication, distributed locks для deployments, caching для status page. Мониторит Redis performance и memory usage.
Определяет caching-стратегию SRE-платформы: Redis для alert state management, distributed locking, session cache для internal tools. Устанавливает SLA и monitoring для Redis infrastructure.
Логирование
▼
Использует Kibana для поиска логов: KQL-запросы, фильтры по уровню и сервису. Создаёт saved searches для типичных проблем. Понимает структуру log entries.
Настраивает ELK pipeline: Filebeat/Fluentbit для сбора, Logstash для parsing и enrichment, index patterns в Elasticsearch. Создаёт Kibana dashboards для operational monitoring.
Проектирует ELK-архитектуру: cluster sizing, ILM для retention management, cross-cluster search. Оптимизирует: index templates, mapping, ingest pipelines. Настраивает alerting через ElastAlert.
Определяет ELK-стандарты: log format requirements, retention policies, access control. Внедряет cost management (hot/warm/cold nodes). Координирует централизованное логирование.
Использует Grafana Loki для поиска и фильтрации логов при расследовании инцидентов. Понимает политики хранения логов и концепции хранилища. Следует ранбукам, ссылающимся на Loki-запросы, для типовых сценариев траблшутинга.
Настраивает Loki для мультитенантной агрегации логов между сервисами. Создаёт продвинутые LogQL-запросы с извлечением метрик для отслеживания SLI. Строит правила алертинга по паттернам логов и участвует в дежурствах, используя лог-диагностику.
Проектирует организационную стратегию логирования с Loki в качестве централизованной лог-платформы. Определяет SLI/SLO на основе метрик из логов и автоматизирует алертинг по error budget. Ведёт post-mortem, используя корреляцию Loki с распределёнными трассировками и данными APM.
Определяет Loki-стандарты: label strategy (low cardinality), retention policies, query patterns. Внедряет Loki для cost-effective log aggregation. Сравнивает Loki vs ELK по сценариям.
Настраивает структурированное логирование: JSON-формат, обязательные поля (timestamp, level, service, trace_id). Понимает уровни логирования. Не логирует sensitive данные.
Проектирует logging pipeline: structured JSON logs, correlation ID propagation, log enrichment (metadata). Интегрирует логирование с tracing. Настраивает log shipping (Fluentbit/Vector).
Проектирует logging-архитектуру: unified log format для всех сервисов, sampling strategy для high-volume, log-based metrics extraction. Интегрирует с OpenTelemetry logs API.
Определяет logging-стандарты организации: mandatory fields, format specification, privacy compliance. Внедряет automated log quality checks. Формирует logging best practices.
Метрики и мониторинг
▼
Работает с Prometheus/Grafana: читает метрики, создаёт базовые dashboards. Понимает metric types: counter, gauge, histogram, summary. Настраивает простые alerting rules.
Настраивает Prometheus monitoring: service discovery, recording rules для агрегатов, alerting rules с правильным severity. Создаёт comprehensive Grafana dashboards. Настраивает AlertManager routing.
Проектирует Prometheus-архитектуру: federation, Thanos/Mimir для long-term storage и global view. Оптимизирует cardinality, retention. Внедряет multi-cluster monitoring.
Определяет metrics-стандарты: mandatory metrics per service, naming conventions, dashboard templates. Управляет Prometheus infrastructure costs. Координирует monitoring adoption.
Создаёт custom метрики: application counters, business KPIs через Prometheus client libraries. Понимает метрики RED (Rate, Errors, Duration) и USE (Utilization, Saturation, Errors).
Проектирует custom metrics: SLI-метрики для SLO tracking, detailed latency histograms, business metrics. Настраивает recording rules для агрегации. Создаёт alerting на custom metrics.
Определяет metrics framework: standard instrumentation library, metric naming conventions, cardinality management. Реализует derived metrics через recording rules. Интегрирует с SLO tooling.
Определяет metrics-стандарты для SRE: mandatory SLI metrics, dashboard templates, alerting best practices. Внедряет metric catalogs и automated cardinality monitoring.
Многопоточность и конкурентность
▼
Понимает основы Асинхронное программирование на базовом уровне. Применяет простые концепции в рабочих задачах с использованием Python/Go. Следует рекомендациям senior-разработчиков при решении задач.
Самостоятельно применяет асинхронное программирование в SRE-инструментах: конкурентные запросы мониторинга, async-автоматизация реагирования на инциденты, неблокирующая оркестрация health checks. Понимает компромиссы между параллельным и последовательным выполнением в операционной автоматизации.
Проектирует async-архитектуры для SRE-систем: конкурентный мониторинг в масштабе, async-оркестрация реагирования на инциденты, неблокирующая корреляция и маршрутизация алертов. Менторит команду по async-паттернам для надёжности операционных систем.
Определяет стандарты async для SRE-tooling: asyncio для массового опроса endpoint-ов, concurrent health checks, parallel remediation scripts. Внедряет таймауты и circuit breakers в automation.
Понимает основы Многопоточное программирование на базовом уровне. Применяет простые концепции в рабочих задачах с использованием Python/Go. Следует рекомендациям senior-разработчиков при решении задач.
Самостоятельно применяет знания многопоточности для SRE: диагностика contention потоков и deadlock в продакшен-системах, анализ thread dumps для разрешения инцидентов, тюнинг конфигураций пулов потоков для производительности сервисов. Обосновывает компромиссы конкурентности для оптимизации надёжности и пропускной способности.
Обладает глубокой экспертизой в диагностике проблем многопоточности: анализирует contention потоков и deadlock в продакшен-системах в масштабе, внедряет мониторинг индикаторов здоровья конкурентных систем, оптимизирует конфигурации потоков по флотам сервисов. Менторит команду по отладке продакшен конкурентных систем и тюнингу производительности.
Определяет concurrency-стандарты для SRE-инструментов: thread pools для parallel deployments, lock-free metrics collection, concurrent log processing. Внедряет практики safe concurrency в automation scripts.
Облачные провайдеры
▼
Работает с AWS для SRE: EC2 для мониторинга, S3 для логов, CloudWatch для базовых алертов. Понимает IAM, VPC, security groups. Использует AWS Console и CLI.
Администрирует AWS-инфраструктуру: EKS cluster management, ALB/NLB configuration, Route53 для DNS failover. Настраивает CloudWatch alarms, SNS для notifications. Оптимизирует costs через Reserved/Spot instances.
Проектирует AWS-платформу для reliability: multi-AZ architecture, cross-region DR, AWS Organizations для multi-account. Настраивает GuardDuty, Config Rules для security. Автоматизирует через AWS CDK/Lambda.
Определяет AWS-стратегию: Landing Zone, account structure, cost management. Внедряет Well-Architected Framework review. Координирует cloud operations между SRE и product teams.
ООП и паттерны проектирования
▼
Применяет паттерны в SRE-контексте: Circuit Breaker для resilience, Retry для fault tolerance. Понимает архитектурные паттерны для надёжных систем.
Использует reliability паттерны: Bulkhead для isolation, Saga для distributed recovery, Sidecar для observability. Реализует self-healing patterns.
Проектирует архитектуру надёжности: cell-based architecture, shuffle sharding, backpressure patterns. Комбинирует паттерны для multi-layer resilience.
Определяет reliability patterns для организации: pattern catalog, reference architectures для resilience. Проводит design reviews с фокусом на reliability.
Понимает базовые концепции ООП в Python/Go: классы, интерфейсы, композиция структур. Применяет простые принципы SOLID при написании инструментов операционной автоматизации. Следует командным паттернам классов клиентов мониторинга и структуры модулей автоматизации runbook.
Самостоятельно применяет ООП/SOLID в SRE-инструментарии и автоматизации: правильная абстракция для клиентов мониторинга, бэкенды алертинга на основе интерфейсов, единственная ответственность в модулях автоматизации runbook. Понимает компромиссы между ООП-паттернами и скриптовыми подходами для операционного инструментария.
Применяет ООП/SOLID в архитектуре SRE-инструментов: абстрактные интерфейсы для бэкендов мониторинга, strategy pattern для маршрутизации алертов, template method для стандартизированной автоматизации runbook. Проектирует расширяемые фреймворки observability с чистым разделением между слоями сбора данных, обработки и алертинга.
Определяет стандарты кода SRE-инструментария: модульные health checks, abstract provider interfaces для multi-cloud. Обучает команду паттернам для infrastructure automation (Strategy для разных облаков, Template для runbooks).
Оптимизация
▼
Понимает latency: p50, p95, p99 percentiles. Мониторит latency через dashboards. Определяет медленные эндпоинты. Понимает impact networking, DB queries, external calls на latency.
Диагностирует latency проблемы: distributed tracing для bottleneck detection, flame graphs для CPU profiling, connection pool analysis. Оптимизирует: caching, connection reuse, async processing.
Проектирует low-latency архитектуру: CDN placement, edge caching, connection pooling optimization, tail-latency management. Реализует latency budgets per service. Внедряет automated regression detection.
Определяет latency-стандарты: performance budgets per endpoint, mandatory profiling, latency regression policy. Внедряет SLO-based latency tracking и automated alerting.
Оптимизация БД
▼
Понимает indexing для SRE: мониторит index usage, настраивает alerting на missing indexes. Проверяет index health через database monitoring tools.
Управляет database indexing: automated index recommendations, monitoring index bloat, performance impact analysis. Настраивает alerting на index issues.
Проектирует index monitoring стратегию: automated missing index detection, index maintenance schedules, performance regression alerting.
Определяет database indexing стандарты для operations: monitoring requirements, maintenance procedures, escalation policies. Координирует с DBA.
Понимает query optimization для SRE: мониторит slow queries, настраивает alerting на performance degradation. Использует database monitoring tools.
Оптимизирует database performance: automated slow query detection, query plan analysis, connection pool monitoring. Настраивает performance dashboards.
Проектирует database performance monitoring: automated query analysis, performance regression detection, capacity planning tools. Определяет performance SLO.
Определяет database performance стандарты: query latency budgets, monitoring requirements, escalation procedures. Внедряет automated optimization.
Очереди сообщений
▼
Использует Apache Kafka на базовом уровне в Kubernetes/Terraform. Выполняет простые задачи по готовым шаблонам. Понимает базовые концепции и следует принятым в команде практикам.
Самостоятельно реализует задачи с Apache Kafka в Kubernetes/Terraform. Понимает внутреннее устройство и оптимизирует производительность. Пишет тесты с помощью chaos engineering.
Использует Kafka для SRE-задач: streaming metrics processing, alert aggregation, audit log collection. Настраивает consumer groups для distributed alert processing. Мониторит Kafka cluster health.
Определяет Kafka-стратегию для observability: metrics streaming pipeline, log aggregation, event-driven incident management. Внедряет мониторинг Kafka infrastructure как критического компонента.
Профилирование
▼
Работает с APM-дашбордами для проверки состояния сервисов и уровня ошибок. Понимает базовые метрики: задержку, пропускную способность, процент ошибок. Эскалирует аномалии, обнаруженные через APM-алерты, старшим инженерам.
Настраивает APM-инструментирование в микросервисах для продакшн-мониторинга. Создаёт дашборды для отслеживания golden signals и соответствия SLI. Участвует в дежурствах, используя данные APM для триажа и разрешения инцидентов.
Проектирует платформу наблюдаемости, интегрирующую APM, логирование и трассировку. Определяет SLI/SLO для критичных сервисов и автоматизирует отслеживание error budget. Ведёт процессы post-mortem и инициирует улучшения надёжности на основе данных APM.
Определяет APM-стратегию: Datadog vs New Relic vs open-source (OTel + backends), feature comparison, cost analysis. Внедряет APM для critical services. Определяет instrumentation requirements.
Понимает основы Continuous Profiling. Читает логи и метрики. Использует готовые dashboards для мониторинга.
Настраивает Continuous Profiling для сервисов. Создаёт dashboards и алерты. Участвует в on-call ротации. Анализирует инциденты.
Проектирует observability стратегию с Continuous Profiling. Внедряет distributed tracing. Определяет SLI/SLO. Проводит post-mortems.
Определяет profiling-стандарты: always-on profiling (Pyroscope/Parca), CPU/memory flame graphs, production profiling safety. Внедряет profiling-driven optimization workflow.
Реагирование на инциденты
▼
Следует incident response процессу: escalation по severity, communication в dedicated каналах. Документирует timeline инцидента. Участвует в post-mortem разборах.
Управляет инцидентами: severity classification, stakeholder communication, координация между командами. Проводит root cause analysis. Ведёт post-mortem с actionable follow-ups.
Проектирует incident response процесс: automated severity detection, runbook automation, war room orchestration. Реализует SLO-based alerting для proactive incident detection.
Определяет incident management стандарты: severity matrix, communication templates, post-mortem requirements. Внедряет incident metrics (MTTD, MTTR). Обучает команды incident response.
Реляционные БД
▼
Пишет SQL-запросы для SRE-задач: анализ инцидентов, extraction метрик из operational DB. Работает с PostgreSQL для хранения конфигураций и audit logs. Понимает базовый мониторинг БД.
Администрирует PostgreSQL для SRE: мониторинг через pg_stat_statements, connection pool tuning (PgBouncer), backup verification. Настраивает alerting на slow queries, connection exhaustion, replication lag.
Проектирует PostgreSQL reliability: streaming replication setup, automated failover (Patroni), point-in-time recovery. Оптимизирует для operational workloads: vacuum tuning, index maintenance, connection pooling.
Определяет PostgreSQL-стандарты: HA-конфигурации, backup/recovery SLA, monitoring checklist. Проводит capacity planning и failure mode analysis. Планирует PostgreSQL upgrades с zero-downtime.
Сети
▼
Понимает сетевые основы для SRE: TCP/IP, DNS, HTTP. Диагностирует network issues: ping, traceroute, dig, curl. Понимает VPC, subnets, security groups.
Диагностирует сетевые проблемы: MTU issues, connection timeouts, DNS resolution failures. Настраивает network monitoring: packet loss, latency. Понимает CDN, reverse proxy, TLS termination.
Проектирует network reliability: multi-AZ networking, failover strategies, BGP для multi-homing. Оптимизирует network performance: connection pooling, keep-alive tuning, TCP optimization.
Определяет network-стандарты: security baselines, network segmentation policy, monitoring requirements. Внедряет network performance budgets и automated testing.
Системы типов
▼
Применяет type safety в SRE-коде: TypeScript для automation, typed Python для tooling. Использует типизированные конфигурации (Jsonnet, CUE).
Обеспечивает type safety инфраструктурного кода: typed Terraform (CDK/Pulumi), strict Python для automation, JSON Schema для configs.
Проектирует type-safe infrastructure: CUE для configuration validation, typed deployment pipelines, schema validation для infrastructure-as-data.
Определяет type safety стандарты SRE: typed IaC requirements, configuration validation policies. Внедряет automated type checking для infrastructure code.
Специализированное тестирование
▼
Понимает chaos engineering как SRE-практику: знает связь с error budgets (chaos для verification что system stays within SLO), понимает game day формат. Участвует в проведении экспериментов как наблюдатель и помогает документировать результаты.
Проводит chaos эксперименты для validation SLOs: создаёт hypothesis-driven experiments с чёткими steady-state metrics, использует Chaos Mesh/Litmus для Kubernetes failures. Анализирует impact на SLIs и определяет remediation actions на основе findings.
Проектирует chaos программу linked с SRE practices: интегрирует chaos experiments в post-mortem follow-ups, создаёт continuous verification для critical paths. Реализует sophisticated experiments: clock skew, DNS failures, TLS certificate expiry, cascading failure scenarios.
Определяет chaos engineering стратегию для SRE-организации: создаёт chaos maturity assessment, проектирует automated resilience scoring per service. Внедряет chaos experiments как prerequisite для production readiness review и определяет escalation procedures.
Управление API
▼
Документирует SRE API и tools: описывает internal API endpoints, runbook procedures, monitoring setup. Пишет README для infrastructure repos.
Создаёт SRE documentation: runbooks, architecture diagrams, on-call guides, monitoring setup docs. Автоматизирует documentation generation.
Проектирует documentation strategy для SRE: living runbooks, automated architecture diagrams, incident response playbooks. Внедряет docs-as-code.
Определяет documentation стандарты SRE: mandatory runbooks, postmortem templates, review process. Внедряет documentation culture и quality metrics.
Управление инцидентами
▼
Участвует в on-call: следует escalation procedures, использует PagerDuty для alert management. Документирует инциденты. Передаёт дежурство с handoff notes.
Управляет on-call процессом: настраивает PagerDuty schedules и escalation policies, пишет runbooks для типичных алертов. Анализирует on-call burden: toil, alert quality, false positive rate.
Оптимизирует on-call: alert tuning для снижения noise, automated remediation для типичных проблем. Проектирует runbook automation. Анализирует on-call metrics и формирует improvement plan.
Определяет on-call стандарты: rotation policies, compensation, workload balance. Внедряет on-call metrics (interruptions, sleep impact). Формирует sustainable on-call culture.
Управление памятью
▼
Понимает memory management для SRE: мониторит memory usage, настраивает OOM alerting. Диагностирует memory leaks через basic tools.
Управляет memory в production: container memory limits, swap management, memory leak detection. Настраивает dashboards и alerting для memory metrics.
Проектирует memory monitoring strategy: JVM/runtime-specific memory tracking, automated leak detection, capacity planning. Определяет memory budgets.
Определяет memory management стандарты: container resource limits policies, memory monitoring requirements, incident response для OOM. Проводит capacity reviews.
Чистый код и рефакторинг
▼
Понимает базовые принципы качества кода для операционных скриптов и конфигураций мониторинга. Следует командным конвенциям структуры правил алертинга и форматирования runbook. Пишет простые, чистые скрипты автоматизации для операционных задач. Принимает обратную связь на код-ревью по ясности кода мониторинга.
Самостоятельно применяет практики качества кода в SRE-автоматизации. Пишет чистые конфигурации мониторинга, правила алертинга и автоматизацию runbook с правильной обработкой ошибок. Понимает компромиссы между гранулярностью observability и нагрузкой на систему. Ревьюит операционный код на actionability алертов, ясность дашбордов и надёжность реагирования на инциденты.
Проектирует стандарты качества кода для SRE-инструментария: структура автоматизации runbook, код пайплайнов observability, скрипты chaos engineering. Рефакторит автоматизацию управления инцидентами для надёжности и аудируемости. Устанавливает практики ревью для операционного кода: error budgets, мониторинг SLO, инструменты дежурств.
Формирует стандарты качества SRE-кода: linting для Terraform/HCL, policy testing (OPA), unit-тесты для automation scripts. Внедряет code review для infrastructure changes.