Максим Щ. Data инженер, Middle+

ID 50053
Максим Щ.
Фото доступно после регистрации
Максим Щ.
Middle+
Мужчина, 21 год
Россия, Москва, UTC+3
2 597,4 Р/час
НДС не облагается
Специалист доступен с 6 сентября 2026 г.

О специалисте

Специализация
Data инженер
Грейд
Middle+
Навыки
monitoring
Validation
batch
quality
debezium
DWH ETL
Базы данных
Spark Streaming
опыт проектирования
ClickHouse
Оптимизация запросов
Spark
OLAP
Hive
Data
REST
Git
Bash
API
Apache Spark
Apache Hadoop
PySpark
SQL
GreenPlum
ELT
Logging
apache hive
Iceberg
engineer
Apache
streaming
Parquet
cdc
DBT
Processing
schema
dag
Автоматизация сборки
REST API
GitLab
ETL
Docker
CI/CD
Apache Iceberg
FastAPI
GitLab CI/CD
Python
Kafka
HDFS
DWH
Apache AirFlow
Data Contracts
Gitlab CI
Linux
PostgreSQL
Data engineering
Data Quality
Data Lake
Trino
Kubernetes
Pathon
psql
apacheairflow
S3
clockhouse
PosrgteSQL
hdf5
doker
kubrrnetis
RESP API
Fastai
Gift
gilab
Delta Lake
Scheme
dagu
oltp
дедупликация
Отрасли
IoT
Главное о специалисте
Максим — Data инженер уровня Middle+ из Москвы с опытом работы в отрасли IoT. Специализируется на проектировании и оптимизации ETL/ELT-пайплайнов, работе с базами данных и аналитическими системами. Имеет опыт работы с Apache Spark, PySpark, Kafka, Apache Airflow, Greenplum, PostgreSQL, ClickHouse и другими технологиями. Участвовал в проекте по развитию корпоративной data-платформы для batch- и streaming-обработки данных, построения Data Lake, аналитических витрин и доставки данных в DWH и downstream-системы. В рамках проекта занимался разработкой и оптимизацией ETL/ELT-пайплайнов на Apache Spark и PySpark, работой с batch- и streaming-обработкой данных, оптимизацией чтения и записи данных в HDFS, разработкой CDC-пайплайнов на связке Debezium → Kafka → Spark Streaming и другими задачами. Также участвовал в проекте по построению корпоративного DWH на базе Greenplum для консолидации данных из нескольких операционных систем и подготовки аналитических данных для отчётности. В рамках проекта занимался проектированием архитектуры DWH на Greenplum, разработкой структуры таблиц хранилища, настройкой распределения данных в Greenplum и другими задачами.

Решаемые задачи

18
Настроить ETL-процессы
Настроить систему мониторинга и алертинга
Внедрить систему контроля качества данных (Data Quality)
Настроить CI/CD пайплайнов
Автоматизировать бизнес-процесс в информационной системе
Спроектировать структуру базы данных
Выполнить очистку и предобработку данных
Спроектировать архитектуру хранения данных
Настроить ETL-процессы для системы аналитики
Настроить ETL-процессы сбора данных

Проекты

(4 года)

Развитие Data Lake, DWH и streaming-пайплайнов корпоративной data-платформы

Роль
Data Engineer
Обязанности
Проект по развитию корпоративной data-платформы для batch- и streaming-обработки данных, построения Data Lake, аналитических витрин и доставки данных в DWH и downstream-системы. Обязанности и задачи: Разработка и оптимизация ETL/ELT-пайплайнов на Apache Spark и PySpark. Работа с batch- и streaming-обработкой данных. Оптимизация чтения и записи данных в HDFS. Работа с Parquet и оптимизация структуры хранения данных. Разработка CDC-пайплайнов на связке Debezium → Kafka → Spark Streaming. Обработка insert/update/delete из OLTP-систем и доставка изменений в Data Lake. Разработка и сопровождение DAG в Apache Airflow. Настройка dependencies, retries, error handling и logging. Автоматизация ETL-процессов и мониторинга загрузок. Работа с Data Quality: Data Contracts, schema validation, NULL-checks, дедупликация. Настройка автоматических проверок и алертов в Airflow. Оптимизация хранения в S3 / Apache Iceberg / Parquet. Настройка партиционирования, компрессии и lifecycle-подходов. Оптимизация Spark Jobs и контроль размера файлов. Работа с HDFS и Apache Ranger audit logs. Автоматизация обработки FSImage. Разработка SQL-контроля метаданных хранения и доступа к данным. Подготовка данных для 50+ аналитических витрин. Работа с Greenplum, PostgreSQL, ClickHouse и dbt. Оптимизация ETL/ELT-трансформаций для DWH и аналитики. Разработка внутренних data-сервисов на FastAPI. Разработка REST API для интеграции источников и компонентов платформы. Автоматизация CI/CD в GitLab. Работа с Docker и Kubernetes. Стандартизация сборки, тестирования и деплоя data-компонентов. Команда проекта Работа в составе команды Data Engineering во взаимодействии с разработчиками, DevOps и потребителями данных.
Достижения
Ускорил Spark / PySpark ETL-пайплайны на 55% за счёт оптимизации работы с HDFS и Parquet. Снизил нагрузку на ClickHouse на 65% за счёт внедрения Spark compute layer для предагрегации, фильтрации и очистки данных. Сократил задержку получения изменений на 75%, реализовав CDC-пайплайн Debezium → Kafka → Spark Streaming. Сократил ручные операции на 70% и повторные сбои на 25% за счёт автоматизации ETL в Apache Airflow. Сократил время диагностики HDFS на 65% за счёт автоматизации обработки FSImage и интеграции Ranger audit logs. Снизил количество Data Quality-инцидентов на 40%. Ускорил обнаружение ошибок на 20% за счёт автоматических проверок и алертов. Сократил избыточное хранение данных на 35% за счёт оптимизации S3 / Iceberg / Parquet. Повысил эффективность Spark Jobs на 15%. Обеспечил доставку данных для 50+ аналитических витрин. Разработал 10+ API-эндпоинтов на FastAPI для внутренних data-сервисов. Сократил время деплоя на 40% за счёт автоматизации CI/CD.
Стек специалиста на проекте
PostgreSQL, Git, Docker, SQL, Python, REST API, Kubernetes, GitLab, Apache, ClickHouse, FastAPI, GreenPlum, Apache Hadoop, Apache Spark, Kafka, Apache AirFlow, CI/CD, S3, HDFS, PySpark, apache hive, DBT, debezium, Spark Streaming, Trino, Parquet, Apache Iceberg
Отрасль проекта
IoT
Начало работы
Май 2023 - Июнь 2026  (3 года 2 месяца)

Построение DWH на Greenplum и автоматизация ETL-процессов

Роль
Data Engineer
Обязанности
Проект по построению корпоративного DWH на базе Greenplum для консолидации данных из нескольких операционных систем и подготовки аналитических данных для отчётности. Обязанности и задачи: Проектирование архитектуры DWH на Greenplum. Разработка структуры таблиц хранилища. Настройка распределения данных в Greenplum. Проектирование базового партиционирования. Интеграция данных из 5+ операционных систем. Разработка ETL-скриптов на Python. Использование Pandas и SQLAlchemy для обработки и загрузки данных. Загрузка данных из REST API. Интеграция с OLTP-системами. Разработка процессов загрузки в Greenplum. Разработка и оптимизация SQL-запросов. Работа с PostgreSQL и Greenplum. Анализ планов выполнения SQL-запросов. Оптимизация аналитических витрин и выгрузок. Автоматизация регулярного запуска ETL через Bash и cron. Настройка логирования и обработки ошибок. Обеспечение доступности исторических данных в DWH. Команда проекта Работа в составе команды Data Engineering.
Достижения
Спроектировал и построил DWH на Greenplum для данных из 5+ операционных систем. Разработал структуру таблиц, распределение данных и базовое партиционирование. Разработал ETL-процессы на Python для интеграции REST API и OLTP-систем. Сократил объём ручной работы при загрузках на 20%. Ускорил процесс обработки данных на 15%. Оптимизировал SQL-запросы в PostgreSQL и Greenplum и ускорил формирование отчётов на 15%. Автоматизировал ETL-процессы через Bash/cron, сократив количество пропущенных загрузок на 20%. Повысил доступность данных на 20%.
Стек специалиста на проекте
PostgreSQL, SQL, Python, Bash, REST API, Pandas, SQLAlchemy, Cron, GreenPlum
Отрасль проекта
IoT
Начало работы
Июль 2022 - Апрель 2023  (10 месяцев)

Формат работы

Объем участия в проекте
Высокая нагрузка
Формат взаимодействия
Удаленный
Командировки
Не готов
Релокация
Не готов
Готов работать на зарубежных проектах
Нет

Образование

Высшее

Учебное заведение
ХТУ
Специальность
Информационная безопасность
Завершение учебы
2027 г.

Похожие специалисты

Finance&Taxes • Media
ИК
Иван К.
Data инженер
Москва
Senior
2 597,4 Р/час
PostgreSQL
Git
MySQL
Docker
REST
API
SQL
Agile
Python
Bash
+96

Иван — Data инженер уровня Senior из Москвы с высшим образованием по специальности «Биоинженерия и биоинформатика» Московского государственного университета имени М. В. Ломоносова. Владеет английским языком на уровне B2. Имеет опыт работы на проектах в отраслях Media и Finance&Taxes. Участвовал в проекте по развитию высоконагруженной data-платформы RUTUBE, где занимался разработкой и оптимизацией ETL/ELT-пайплайнов, развитием аналитических витрин, работой с batch- и streaming-обработкой, миграцией компонентов data-платформы и обеспечением качества и стабильности данных. Также участвовал в проекте по развитию корпоративного DWH и data-пайплайнов для моделей расчёта клиентских коммуникаций крупного банка. Ключевые навыки: PostgreSQL, Git, MySQL, Docker, REST API, SQL, Agile, Python, Bash, Linux, Grafana, DBeaver, Kubernetes, Apache, Yarn, GitHub, VS Code, Hive, Data, Jupiter, Spark, ClickHouse, Pandas, SciPy, Numpy, Matplotlib, CLI, GreenPlum, ETL, Apache Hadoop, Kafka, Jupyter Notebook, Big Data, DWH, Apache 2, Compose, Zeppelin, Pentaho, Docker Compose, Apache AirFlow, SLA, S3, HDFS, Визуализация данных, Apache NiFi, Superset, PySpark, MapReduce, DBT, batch, Data Vault, ELT, Data engineering, big data технологии, Jupyter notebooks.

Подробнее
E-commerce & Retail • Finance&Taxes
Мария Б.
Фото доступно после регистрации
Мария Б.
Data инженер
Москва
Middle+
2 597,4 Р/час
PostgreSQL
Git
Docker
Jira
Confluence
SQL
Python
Oracle
REST API
Linux
+59

Data инженер с грейдом Middle+ из Москвы, специализация — работа с данными. Имеет высшее образование по направлению «Экономика» в Национальном исследовательском ядерном университете «МИФИ». Обладает широким спектром навыков, включая работу с PostgreSQL, Git, Docker, Jira, Confluence, SQL, Python, Oracle, REST API, Linux, Grafana, Kubernetes, GitLab, Apache, Hive, Spark, ClickHouse, Pandas, ETL, Apache Hadoop, Apache Spark, Kafka, Tableau, Apache AirFlow, CI/CD, PySpark, DBT, а также опыт в области математической статистики, Big Data, DWH, E-commerce. Имеет опыт работы на проектах в отраслях Finance&Taxes и E-commerce & Retail. Участвовал в проекте по автоматизации отчётности по процессу секьюритизации, где занимался разработкой и поддержкой ETL/ELT-пайплайнов, интеграцией данных, разработкой витрин в ClickHouse, внедрением Data Quality-проверок и автоматизацией формирования отчётности. Также участвовал в проекте по развитию корпоративного DWH и автоматизации аналитической отчётности для логистики и e-commerce, где занимался разработкой и поддержкой ETL/ELT-процессов, оркестровкой расчётов и загрузок через Apache Airflow, разработкой аналитических витрин в ClickHouse и PostgreSQL, оптимизацией структуры таблиц и переносом расчётной логики из Excel/VBA в PostgreSQL + Airflow.

Подробнее
Отрасли не указаны
МН
Максим Н.
Data инженер
Москва
Senior
2 857,14 Р/час
debezium
ClickHouse
Spark
Hive
SQLAlchemy
Java
REST
Git
Bash
Pandas
+138

Data Engineer с более чем 10-летним опытом в проектировании и развитии масштабируемых data-платформ, с основной специализацией в финтех и банковской сфере (Росбанк, Axenix, корпоративные банковские ETL/CDC платформы). Дополнительно имею опыт построения маркетинговых data-платформ и интеграционных решений уровня enterprise. Ключевая экспертиза — построение высоконагруженных потоковых и batch data-архитектур: CDC-пайплайны, streaming ingestion, Data Lake/Lakehouse решения, а также end-to-end ETL/ELT платформы. Основной фокус — надежная доставка и синхронизация данных в распределённых системах с использованием Kafka, Spark и Airflow. Работал в финтех-домене с большими объёмами транзакционных и банковских данных, включая интеграцию разнородных систем (core banking, маркетинг, транзакционные источники), построение витрин данных и обеспечение BI-слоя для аналитики.

Подробнее
E-commerce & Retail • Marketing, Advertising & Design
ДП
Даниил П.
Data инженер
Денпасар
Senior
3 311,69 Р/час
Jira
аутентификация
Работа с интеграциями
Разработка
Agile
Root cause analysis
Scrum
CI/CD
GitLab
Git
+122

Даниил — Data инженер уровня Senior с опытом работы 11 лет 2 месяца. Специализируется на разработке и оптимизации data-платформ, обработке и анализе больших объёмов данных. Владеет английским языком на уровне C1. Имеет опыт работы с технологиями: Apache Kafka, PySpark, Apache AirFlow, ClickHouse, GreenPlum, PostgreSQL, Oracle, MySQL, MS SQL Server, SAS Data Integration Studio (SAS DIS), Informatica PowerCenter, Apache NiFi, Sqoop, Apache Flume, Hadoop ecosystem, Kafka, Flink, Cosmos DB, Prometheus, Grafana, VictoriaMetrics, Zabbix, GitHub Actions, pytest, DBT, Confluence, Debezium. Участвовал в проектах в отраслях E-commerce & Retail и Marketing, Advertising & Design. В рамках проекта по созданию платформы обработки рыночных данных для алгоритмической торговли Даниил построил data-платформу с нуля, реализовал потоковую обработку данных через Kafka (Redpanda), разработал и оптимизировал PySpark-пайплайны, работал с внутренней архитектурой Apache Spark, построил Data Lake на базе S3/HDFS, разработал витрины данных и трансформационную логику в различных системах, реализовывал orchestration загрузок, разрабатывал кастомные операторы и hooks для Apache Airflow, настраивал интеграционные потоки между системами. Также участвовал в проекте по созданию платформы маркетинговой аналитики и обработки пользовательских данных, где анализировал большие объёмы данных, разрабатывал аналитические модели и метрики, использовал Pandas/NumPy для обработки данных, автоматизировал отчётность и обработку данных, работал с BI-инструментами.

Подробнее
FinTech & Banking • RnD
ИХ
Ильсаф Х.
Data инженер
Казань
Senior
3 636,36 Р/час
Bash
Groovy
hiveql
Java
Python
Spark SQL
SQL
Airbyte
Apache AirFlow
Apache NiFi
+123

Ильсаф — Data инженер уровня Senior из Казани с опытом работы 5 лет 9 месяцев. Специализируется на разработке и сопровождении корпоративных платформ данных. Имеет опыт работы с различными технологиями и инструментами, включая Apache Spark, Kafka, Airflow, ClickHouse, Greenplum, Hadoop, Hive, Trino, Docker, Kubernetes и другие. Участвовал в проектировании и развитии DWH и Data Lake-архитектуры, анализировал и оптимизировал SQL-скрипты, интегрировал корпоративные источники данных, разрабатывал и сопровождал загрузки в S3-compatible storage, работал с Apache NiFi, развивал витрины данных в ClickHouse, продуктивизировал сборку аналитических витрин. Имеет опыт работы в отраслях RnD и FinTech & Banking. Участвовал в проектах по развитию ETL-фреймворков, интеграции источников, обработке потоков данных, подготовке данных для аналитики и оптимизации аналитического хранения.

Подробнее

Недавно просмотренные специалисты

IoT
Максим Щ.
Фото доступно после регистрации
Максим Щ.
Data инженер
Москва
Middle+
2 597,4 Р/час
PostgreSQL
Git
Docker
REST
API
SQL
Python
Bash
REST API
Linux
+78

Максим — Data инженер уровня Middle+ из Москвы с опытом работы в отрасли IoT. Специализируется на проектировании и оптимизации ETL/ELT-пайплайнов, работе с базами данных и аналитическими системами. Имеет опыт работы с Apache Spark, PySpark, Kafka, Apache Airflow, Greenplum, PostgreSQL, ClickHouse и другими технологиями. Участвовал в проекте по развитию корпоративной data-платформы для batch- и streaming-обработки данных, построения Data Lake, аналитических витрин и доставки данных в DWH и downstream-системы. В рамках проекта занимался разработкой и оптимизацией ETL/ELT-пайплайнов на Apache Spark и PySpark, работой с batch- и streaming-обработкой данных, оптимизацией чтения и записи данных в HDFS, разработкой CDC-пайплайнов на связке Debezium → Kafka → Spark Streaming и другими задачами. Также участвовал в проекте по построению корпоративного DWH на базе Greenplum для консолидации данных из нескольких операционных систем и подготовки аналитических данных для отчётности. В рамках проекта занимался проектированием архитектуры DWH на Greenplum, разработкой структуры таблиц хранилища, настройкой распределения данных в Greenplum и другими задачами.

Подробнее