ГКУ Ресурсы Ямала оператор цифровой инфраструктуры Ямало-Ненецкого автономного округа: региональный дата-центр, магистральные и защищённые сети для органов власти и государственные информационные системы, которыми ежедневно пользуются десятки ведомств и сотни тысяч жителей округа.
Постройте и держите платформу, на которой работает вся цифровая инфраструктура Ямала: виртуализация, Kubernetes, enterprise-СХД и практики SRE регионального масштаба.
Это самая экспертная инженерная роль в команде с прямым влиянием на архитектуру вычислительного слоя и мандатом выстроить процессы DevOps/SRE так, как считаете правильным.
Обязанности: Администрировать платформы виртуализации (zVirt, Proxmox VE, OpenStack) и Kubernetes, включая компоненты CNI/CSI и Helm.
Управлять гипервизорами, кластерами, живой миграцией виртуальных машин и высокодоступными конфигурациями.
Управлять физическими серверами через подсистемы внеполосного управления (OOB: iLO, iDRAC, IPMI), мониторить аппаратное состояние и прошивки.
Администрировать enterprise-системы хранения данных, а также Ceph и MinIO.
Вести резервное копирование (Кибер Бэкап, Veeam, Exagrid), управлять политиками бэкапа и предоставлять внутренним командам backup-as-a-service.
Разрабатывать и сопровождать планы аварийного восстановления (DR) по критичным сервисам, регулярно проводить тестовые восстановления, контролировать RPO/RTO и вести отчётность о DR-готовности.
Описывать инфраструктуру как код: роли и плейбуки Ansible, модули Terraform/OpenTofu, образы Packer.
Эксплуатировать пайплайны CI/CD (GitLab CI) для инфраструктурных изменений и применять GitOps: декларативные конфигурации в системе контроля версий, ревью через pull request, автоматическое приведение целевого состояния.
Внедрять практики SRE: определять SLI/SLO по инфраструктурным сервисам, управлять бюджетами ошибок, системно сокращать toil автоматизацией.
Выстраивать инженерную культуру: blameless postmortem, game days, chaos-эксперименты и Change Advisory Board (CAB) по инфраструктурным изменениям.
Вести программу импортозамещения платформы виртуализации и базовых сервисов вычислительной платформы.
Требования
Релевантный опыт от 3 лет по одному из направлений: виртуализация, системы хранения данных, инфраструктура как код (IaC/DevOps) или системное администрирование.
Экспертное владение Linux это ядро роли.
Глубокая экспертиза минимум в одном-двух ядрах платформы: виртуализация (zVirt, Proxmox VE, OpenStack) и/или Kubernetes (CNI/CSI, Helm); остальные направления сильный плюс.
Сильный уровень инфраструктуры как код: Ansible и Terraform/OpenTofu; Packer плюс.
Опыт с системами хранения данных и резервным копированием/аварийным восстановлением с контролем RPO/RTO (enterprise-СХД, Ceph, MinIO по одному из направлений).
Python и Bash на уровне уверенной автоматизации.
Знание принципов GitOps и построения CI/CD для инфраструктуры.
Понимание методологии SRE (SLI/SLO, бюджеты ошибок, toil, blameless postmortem) и готовность внедрять её на практике.
Высшее техническое образование или эквивалентный подтверждённый практический опыт.
Будет плюсом: Сертификации CKA/CKAD, HashiCorp Terraform Associate, RHCE/RHCSA или аналогичные.
Опыт внедрения практик SRE в других организациях.
Опыт наставничества и технического лидерства в команде.
Участие в профильных сообществах, конференциях, open-source проектах.
Чтение технической документации на английском.
Квалификация
Релевантный опыт от 3 лет по одному из направлений: виртуализация, системы хранения данных, инфраструктура как код (IaC/DevOps) или системное администрирование.