Анализировать большие объемы аудиоданных (работа с ClickHouse) и проводить EDA для поиска неочевидных закономерностей; Формулировать гипотезы, жестко привязанные к бизнес-метрикам (снижение операционных расходов, рост точности детекта); Работать с сильным дисбалансом классов при классификации аудио; Настраивать и применять алгоритмы кластеризации данных для выявления скрытых паттернов; Исследование и применение современных архитектур нейронных сетей (CNN, RNN, LSTM, TCN и др.); Работать над задачами коррекции аудио (шумоподавление) с применением современных архитектур; Управлять ML-экспериментами через ClearML, обеспечивая воспроизводимость результатов.
Требования
Опыт в DS/ML от 3 лет, с фокусом на результат, а не на процесс; Умение работать с большими базами данных (ClickHouse) и писать сложные аналитические запросы; Опыт кластеризации данных (K-Means, DBSCAN, иерархические методы) и настройки этих алгоритмов; Умение выбирать и настраивать архитектуры нейронных сетей для задач классификации (CNN, RNN, LSTM, Transformer и др.); Опыт решения задач классификации с сильным дисбалансом классов (sampling, weighted loss, синтетические данные); Python, Pandas/NumPy, Scikit-learn, PyTorch/TensorFlow; Библиотеки для аудио: Librosa, torchaudio; Опыт работы с ClearML (MLflow, Weights Biases как альтернатива, но плюсом именно ClearML); Опыт разработки систем автоматического алертинга (мониторинг дрифта, аномалий, падения метрик в проде с автореакцией); Git, Docker, Kubernetes (понимание CI/CD для ML).
Будет плюсом: Опыт с архитектурами RNN, LSTM, TCN, Transformer, WaveNet; Решения задач Source Separation или шумоподавления; Участие в Kaggle с задачами классификации небалансированных классов; Опыт работы с потоковыми данными и реальными production-системами.