Portal
Все карьерные путиИНЖЕНЕР ПО НАДЁЖНОСТИ СИСТЕМ (SRE) КАРЬЕРНЫЙ ПУТЬ

От основ систем до проектирования надёжных сервисов в продакшене.

Структурированный путь от основ Linux и сетей до проектирования и руководства практиками обеспечения надёжности для крупномасштабных продакшен-систем.

Изучить дорожную карту
♻️DEVOPS
CI/CD
Docker
Kubernetes
Cloud
ВАША ЦЕЛЬИнженер по надёжности систем (SRE)
Высокий спрос в индустрииБольшинство cloud-native компаний нанимают выделенных SRE для обеспечения надёжности продакшен-систем.
Высокая оплата трудаРоли SRE стабильно входят в число наиболее высокооплачиваемых инженерных позиций благодаря их критичной зоне ответственности.
Чёткий карьерный ростПуть развивается от практической эксплуатации до архитектуры, руководства инцидентами и стратегии.
Широкие переносимые навыкиВы получаете навыки Linux, сетей, автоматизации, наблюдаемости и облачных технологий, применимые во многих ролях.
ВАША ДОРОЖНАЯ КАРТА

Одна профессия. 4 уровней.
Ясный следующий шаг на каждом этапе.

Каждый уровень объединяет ключевые навыки — и подобранные под них курсы Ingress.

01
Основы
Далее: Junior

Заложите фундамент систем и программного обеспечения

  • Уверенно работать с Linux и командной строкой
  • Управлять файлами, пользователями, правами, пакетами и службами
  • Понимать процессы, systemd и логи операционной системы
  • Понимать основы работы CPU, памяти, хранилища и сетевых ресурсов
  • Понимать TCP/IP, DNS, HTTP, HTTPS и TLS
  • Понимать прокси, балансировщики нагрузки и взаимодействие клиент-сервер
  • Диагностировать проблемы подключения с помощью curl, dig, ping, traceroute и ss
  • Писать скрипты автоматизации на Bash и базовом Python
  • Использовать Git и совместные рабочие процессы контроля версий
  • Понимать API, структурированные данные и базовую архитектуру приложений
  • Понимать основы контейнеров, облачной инфраструктуры и Kubernetes
  • Понимать метрики, логи и распределённую трассировку
  • Понимать доступность, задержку, пропускную способность и частоту ошибок
  • Применять структурированную диагностику и документировать операционные результаты
Рекомендуемые курсы
02
Junior
Далее: Mid-level

Наблюдайте и эксплуатируйте продакшен-сервисы

  • Эксплуатировать нагрузки на Linux, в контейнерах и на базе Kubernetes
  • Мониторить инфраструктуру и приложения с помощью Prometheus
  • Создавать операционные дашборды с Grafana
  • Централизовать и искать логи приложений и инфраструктуры
  • Инструментировать сервисы с помощью OpenTelemetry
  • Анализировать распределённые запросы с помощью Jaeger или Grafana Tempo
  • Мониторить задержку, трафик, ошибки и насыщенность (RED/USE)
  • Применять методы мониторинга RED и USE
  • Определять базовые индикаторы и цели уровня обслуживания
  • Создавать полезные оповещения и снижать их шум
  • Создавать runbook'и для типичных операционных сбоев
  • Участвовать в дежурствах on-call и реагировании на инциденты
  • Проводить триаж инцидентов и корректно эскалировать их
  • Строить хронологию инцидентов и поддерживать техническую коммуникацию
  • Участвовать в безоценочных разборах инцидентов (post-mortem)
  • Безопасно разворачивать, откатывать и проверять изменения приложений
  • Понимать rolling, blue-green и canary-развёртывания
  • Автоматизировать повторяющиеся операционные задачи
  • Проводить базовое нагрузочное тестирование и выявлять узкие места
  • Проверять резервные копии и выполнять базовые процедуры восстановления
Рекомендуемые курсы
03
Mid-level
Далее: Senior

Проектируйте надёжность через автоматизацию и устойчивость

  • Выбирать значимые SLI на основе пользовательского опыта
  • Проектировать измеримые и реалистичные SLO
  • Рассчитывать доступность и надёжность за скользящие периоды
  • Определять и управлять бюджетами ошибок
  • Связывать расход бюджета ошибок с решениями о релизах
  • Внедрять оповещения на основе burn-rate и нескольких временных окон
  • Проектировать наблюдаемость на уровне метрик, логов и трассировки
  • Улучшать качество оповещений и устранять избыточные алерты
  • Руководить триажем инцидентов и координировать технических специалистов
  • Устанавливать чёткие роли, эскалацию и коммуникацию при инцидентах
  • Проводить безоценочные постмортемы
  • Превращать выводы из инцидентов в измеримые улучшения
  • Выявлять, измерять и системно снижать операционную рутину
  • Проводить нагрузочное, стресс-, пиковое и продолжительное тестирование
  • Моделировать ёмкость системы и прогнозировать инфраструктурный спрос
  • Настраивать автомасштабирование на основе значимых сигналов нагрузки
  • Применять тайм-ауты, дедлайны и ограниченные повторные попытки
  • Применять circuit breaker'ы, bulkhead'ы и сброс нагрузки
  • Понимать обратное давление, очереди и приоритизацию трафика
  • Понимать компромиссы кэширования, репликации и согласованности
Рекомендуемые курсы
04
Senior
Далее: Лидерство в надёжности

Руководите инженерией надёжности в масштабе

  • Определять стратегию надёжности для продуктов и платформ
  • Классифицировать сервисы по бизнес-критичности
  • Устанавливать единые стандарты SLI и SLO для всей организации
  • Создавать политики бюджета ошибок и управления релизами
  • Моделировать сквозную доступность с учётом зависимостей сервисов
  • Выявлять критические зависимости и системные риски отказов
  • Проектировать отказоустойчивые мультизональные и мультирегиональные системы
  • Оценивать архитектуры active-active и active-passive
  • Устанавливать стандарты аварийного восстановления и график тестирования
  • Возглавлять реагирование на крупные инциденты и кросс-командную техническую координацию
  • Проектировать устойчивые графики дежурств и модели эскалации
  • Улучшать коммуникацию по инцидентам с техническими и бизнес-заинтересованными сторонами
  • Формировать эффективную культуру обучения после инцидентов
  • Приоритизировать работу по надёжности на основе рисков и влияния на бизнес
  • Строить долгосрочные прогнозы ёмкости и спроса
  • Руководить инженерией производительности и масштабируемости
  • Проектировать централизованные платформы наблюдаемости
  • Устанавливать стандарты телеметрии, хранения данных и кардинальности
  • Создавать самообслуживаемые возможности надёжности для команд разработки
  • Создавать переиспользуемые дашборды, оповещения, runbook'и и шаблоны сервисов
Рекомендуемые курсы
КОМАНДА ПРЕПОДАВАТЕЛЕЙ

Учитесь у инженеров, которые создают и эксплуатируют production-системы.

Этот путь объединяет специалистов, которые ежедневно работают в отрасли — в разработке, архитектуре, эксплуатации и техническом руководстве.

БЛИЖАЙШИЙ ПОТОК

Присоединяйтесь к следующей группе Инженер по надёжности систем (SRE).

Небольшие группы, занятия с наставником и фиксированное расписание — чтобы вы действительно дошли до конца.

Дата стартаСкоро объявим
РасписаниеВечерами · 2 раза в неделю
МестаОграничено
Оставить заявку
Напишите нам в WhatsApp