Максим Щ. Data инженер, Middle+
ID 50053

Фото доступно после регистрации
Максим Щ.
Middle+
Россия, Москва, UTC+3
2 597,4 Р/час
НДС не облагается
Специалист доступен с 6 сентября 2026 г.
О специалисте
Специализация
Data инженер
Грейд
Middle+
Навыки
Отрасли
Главное о специалисте
Максим — Data инженер уровня Middle+ из Москвы с опытом работы в отрасли IoT. Специализируется на проектировании и оптимизации ETL/ELT-пайплайнов, работе с базами данных и аналитическими системами. Имеет опыт работы с Apache Spark, PySpark, Kafka, Apache Airflow, Greenplum, PostgreSQL, ClickHouse и другими технологиями.
Участвовал в проекте по развитию корпоративной data-платформы для batch- и streaming-обработки данных, построения Data Lake, аналитических витрин и доставки данных в DWH и downstream-системы. В рамках проекта занимался разработкой и оптимизацией ETL/ELT-пайплайнов на Apache Spark и PySpark, работой с batch- и streaming-обработкой данных, оптимизацией чтения и записи данных в HDFS, разработкой CDC-пайплайнов на связке Debezium → Kafka → Spark Streaming и другими задачами.
Также участвовал в проекте по построению корпоративного DWH на базе Greenplum для консолидации данных из нескольких операционных систем и подготовки аналитических данных для отчётности. В рамках проекта занимался проектированием архитектуры DWH на Greenplum, разработкой структуры таблиц хранилища, настройкой распределения данных в Greenplum и другими задачами.
Решаемые задачи
18
Настроить ETL-процессы
Настроить систему мониторинга и алертинга
Внедрить систему контроля качества данных (Data Quality)
Настроить CI/CD пайплайнов
Автоматизировать бизнес-процесс в информационной системе
Спроектировать структуру базы данных
Выполнить очистку и предобработку данных
Спроектировать архитектуру хранения данных
Настроить ETL-процессы для системы аналитики
Настроить ETL-процессы сбора данных
Проекты
(4 года)Развитие Data Lake, DWH и streaming-пайплайнов корпоративной data-платформы
Роль
Data Engineer
Обязанности
Проект по развитию корпоративной data-платформы для batch- и streaming-обработки данных, построения Data Lake, аналитических витрин и доставки данных в DWH и downstream-системы.
Обязанности и задачи:
Разработка и оптимизация ETL/ELT-пайплайнов на Apache Spark и PySpark.
Работа с batch- и streaming-обработкой данных.
Оптимизация чтения и записи данных в HDFS.
Работа с Parquet и оптимизация структуры хранения данных.
Разработка CDC-пайплайнов на связке Debezium → Kafka → Spark Streaming.
Обработка insert/update/delete из OLTP-систем и доставка изменений в Data Lake.
Разработка и сопровождение DAG в Apache Airflow.
Настройка dependencies, retries, error handling и logging.
Автоматизация ETL-процессов и мониторинга загрузок.
Работа с Data Quality: Data Contracts, schema validation, NULL-checks, дедупликация.
Настройка автоматических проверок и алертов в Airflow.
Оптимизация хранения в S3 / Apache Iceberg / Parquet.
Настройка партиционирования, компрессии и lifecycle-подходов.
Оптимизация Spark Jobs и контроль размера файлов.
Работа с HDFS и Apache Ranger audit logs.
Автоматизация обработки FSImage.
Разработка SQL-контроля метаданных хранения и доступа к данным.
Подготовка данных для 50+ аналитических витрин.
Работа с Greenplum, PostgreSQL, ClickHouse и dbt.
Оптимизация ETL/ELT-трансформаций для DWH и аналитики.
Разработка внутренних data-сервисов на FastAPI.
Разработка REST API для интеграции источников и компонентов платформы.
Автоматизация CI/CD в GitLab.
Работа с Docker и Kubernetes.
Стандартизация сборки, тестирования и деплоя data-компонентов.
Команда проекта
Работа в составе команды Data Engineering во взаимодействии с разработчиками, DevOps и потребителями данных.
Достижения
Ускорил Spark / PySpark ETL-пайплайны на 55% за счёт оптимизации работы с HDFS и Parquet.
Снизил нагрузку на ClickHouse на 65% за счёт внедрения Spark compute layer для предагрегации, фильтрации и очистки данных.
Сократил задержку получения изменений на 75%, реализовав CDC-пайплайн Debezium → Kafka → Spark Streaming.
Сократил ручные операции на 70% и повторные сбои на 25% за счёт автоматизации ETL в Apache Airflow.
Сократил время диагностики HDFS на 65% за счёт автоматизации обработки FSImage и интеграции Ranger audit logs.
Снизил количество Data Quality-инцидентов на 40%.
Ускорил обнаружение ошибок на 20% за счёт автоматических проверок и алертов.
Сократил избыточное хранение данных на 35% за счёт оптимизации S3 / Iceberg / Parquet.
Повысил эффективность Spark Jobs на 15%.
Обеспечил доставку данных для 50+ аналитических витрин.
Разработал 10+ API-эндпоинтов на FastAPI для внутренних data-сервисов.
Сократил время деплоя на 40% за счёт автоматизации CI/CD.
Стек специалиста на проекте
PostgreSQL, Git, Docker, SQL, Python, REST API, Kubernetes, GitLab, Apache, ClickHouse, FastAPI, GreenPlum, Apache Hadoop, Apache Spark, Kafka, Apache AirFlow, CI/CD, S3, HDFS, PySpark, apache hive, DBT, debezium, Spark Streaming, Trino, Parquet, Apache Iceberg
Отрасль проекта
IoT
Начало работы
Май 2023 - Июнь 2026
(3 года 2 месяца)
Построение DWH на Greenplum и автоматизация ETL-процессов
Роль
Data Engineer
Обязанности
Проект по построению корпоративного DWH на базе Greenplum для консолидации данных из нескольких операционных систем и подготовки аналитических данных для отчётности.
Обязанности и задачи:
Проектирование архитектуры DWH на Greenplum.
Разработка структуры таблиц хранилища.
Настройка распределения данных в Greenplum.
Проектирование базового партиционирования.
Интеграция данных из 5+ операционных систем.
Разработка ETL-скриптов на Python.
Использование Pandas и SQLAlchemy для обработки и загрузки данных.
Загрузка данных из REST API.
Интеграция с OLTP-системами.
Разработка процессов загрузки в Greenplum.
Разработка и оптимизация SQL-запросов.
Работа с PostgreSQL и Greenplum.
Анализ планов выполнения SQL-запросов.
Оптимизация аналитических витрин и выгрузок.
Автоматизация регулярного запуска ETL через Bash и cron.
Настройка логирования и обработки ошибок.
Обеспечение доступности исторических данных в DWH.
Команда проекта
Работа в составе команды Data Engineering.
Достижения
Спроектировал и построил DWH на Greenplum для данных из 5+ операционных систем.
Разработал структуру таблиц, распределение данных и базовое партиционирование.
Разработал ETL-процессы на Python для интеграции REST API и OLTP-систем.
Сократил объём ручной работы при загрузках на 20%.
Ускорил процесс обработки данных на 15%.
Оптимизировал SQL-запросы в PostgreSQL и Greenplum и ускорил формирование отчётов на 15%.
Автоматизировал ETL-процессы через Bash/cron, сократив количество пропущенных загрузок на 20%.
Повысил доступность данных на 20%.
Стек специалиста на проекте
PostgreSQL, SQL, Python, Bash, REST API, Pandas, SQLAlchemy, Cron, GreenPlum
Отрасль проекта
IoT
Начало работы
Июль 2022 - Апрель 2023
(10 месяцев)
Формат работы
Объем участия в проекте
Высокая нагрузка
Формат взаимодействия
Удаленный
Командировки
Не готов
Релокация
Не готов
Готов работать на зарубежных проектах
Нет
Образование
Высшее
Учебное заведение
ХТУ
Специальность
Информационная безопасность
Завершение учебы
2027 г.
