- Проектирование и разработка ETL/ELT-пайплайнов: сбор, обработка и трансформация больших объёмов данных из различных источников (API, баз данных, логов, внешних систем) в хранилище.
- Разработка и сопровождение ML-пайплайнов: автоматизация процессов обучения, валидации, деплоя и мониторинга моделей машинного обучения (MLOps).
Внедрение моделей в продуктовую среду через API-сервисы (REST, gRPC).
- Работа с данными: написание высокопроизводительных SQL-запросов, оптимизация работы с большими таблицами (миллиарды строк, терабайты данных), партиционирование, индексация, настройка кластеров.
- Поддержка инфраструктуры: сопровождение кластеров баз данных, очередей сообщений (Kafka, RabbitMQ), объектных хранилищ.
Участие в выборе технологий и проектировании архитектуры решений.
- Оптимизация производительности: устранение узких мест в пайплайнах, профилирование и тюнинг запросов, настройка параметров сред выполнения (JVM, Python, контейнеры).
- Разработка и рефакторинг кода: написание высококачественного кода на Python, Java, Scala или Go.
Чтение и правка чужого кода, рефакторинг легаси-решений.
- Ведение технической документации: описание архитектурных решений, схем данных, API-интерфейсов, инструкций по развёртыванию и эксплуатации сервисов.
Требования
- Опыт в инженерии данных от 3+ лет: разработка и поддержка ETL-процессов в продакшене, работа с большими объёмами данных.
- Опыт разработки на Python: уверенное владение Python для написания пайплайнов, API-сервисов, скриптов обработки данных.
Опыт работы с Pandas, NumPy, PySpark, Dask.
- Глубокое знание SQL: сложные запросы, оконные функции, оптимизация, работа с различными СУБД (Oracle, PostgreSQL, ClickHouse, Greenplum).
- Опыт работы с распределёнными системами: понимание архитектуры и принципов работы ClickHouse, Apache Spark, Hadoop.
Настройка кластеров, управление ресурсами.
- Опыт построения ML-пайплайнов: работа с фреймворками машинного обучения (scikit-learn, XGBoost, LightGBM, CatBoost), опыт внедрения моделей в продукт.
- Опыт работы с облачными технологиями и контейнеризацией: Docker, Kubernetes, Yandex Cloud, AWS, GCP или аналоги.
- Понимание архитектуры микросервисов: опыт разработки REST/gRPC API, работа с очередями сообщений (Apache Kafka, RabbitMQ).
- Системное мышление: умение видеть систему целиком, понимание компромиссов между производительностью, стоимостью и надёжностью.
- Работа с кодировками и локализацией: понимание работы с многобайтовыми кодировками (UTF-8), проблемы с данными из разных источников.
Будет плюсом - Опыт работы с MLOps-инструментами (MLflow, Kubeflow, Airflow для управления пайплайнами, DVC для версионирования данных и моделей).
- Опыт разработки на Java, Scala, Go для высоконагруженных систем.
- Опыт работы с NoSQL-базами (MongoDB, Redis, Cassandra, Elasticsearch).
- Знание Data Lake / Data Lakehouse архитектур (Delta Lake, Iceberg, Hudi).
- Опыт работы с BI-инструментами (Power BI, Tableau, DataLens) для валидации данных на выходе из пайплайнов.
- Опыт миграции систем между платформами и версиями (например, с on-premise в облако, с Hadoop на ClickHouse).
- Опыт работы с Git и CI/CD (GitLab CI, Jenkins, GitHub Actions).
- Опыт менторства младших инженеров, проведение Code Review.
- Знание Oracle BI EE (репозиторий и его слои, Administration Tool, веб-каталог, пулы соединений).
- Архитектурное проектирование: опыт проектирования систем с нуля, выбор технологического стека, оценка стоимости владения (TCO), разработка стратегии масштабирования.
- Безопасность: глубокое понимание вопросов безопасности данных, управление доступом, шифрование, аудит.
- Управление командой: опыт руководства командой инженеров (от 3 человек), распределение задач, участие в найме, проведение техсобеседований.
- Стратегическое планирование: участие в дорожной карте развития платформы данных на 1-2 года вперёд.
Мы предлагаем Оформление по ТК РФ, полный социальный пакет.
Конкурентная заработная плата (обсуждается по итогам собеседования).
Интересные проекты федерального масштаба информационные системы ФТС России.
Квалификация
- Опыт в инженерии данных от 3+ лет: разработка и поддержка ETL-процессов в продакшене, работа с большими объёмами данных.