other

Data Engineer

20 июля 2026

З/П не указана

Город: Москва. Станции метро: Войковская

Лоция

Тип занятости: Удаленная работа

Требуемый опыт: Опыт от 3 лет

Обязанности:

Цели проекта: участие в развитии сбора, обработки, трансформации и представления данных. Чем предстоит заниматься: проектированием и разработкой слоев данных (Raw, Clean, Enriched/Presentation) с учетом лучших практик моделирования (Data Vault 2.0 / 3NF для хранилища, Star Schema для витрин); разработкой и внедрением кастомных алгоритмов дедупликации и Entity Resolution (Fuzzy Matching) на Python; формализацией бизнес-правил качества данных в код, настройкой уровней доверия к источникам и правил выживания (survivorship rules); внедрением Data Contracts и механизмов карантина (quarantine) для некачественных данных с возможностью их последующего разбора; настройкой автоматизированного тестирования данных (Data Quality checks) в пайплайнах. Чего мы ждем от тебя: SQL и трансформации: продвинутый уровень SQL и опыт работы с dbt (или аналогами) для построения слоев данных; Python для данных: уверенное владение PySpark и/или pandas для обработки больших объемов данных и реализации логики матчинга; Fuzzy Matching: практический опыт применения библиотек нечёткого поиска и связывания записей (например, Splink, recordlinkage, dedupe, theFuzz); алгоритмы: понимание принципов работы алгоритмов сравнения строк (Левенштейн, Джаро-Винклер, косинусное сходство на TF-IDF/эмбеддингах); моделирование данных: глубокое понимание 2-3NF, Data Vault 2.0 и различий между слоями сырых, очищенных и обогащенных данных; Data Quality: Опыт внедрения инструментов тестирования данных (Great Expectations, Soda, dbt tests, deequ или аналоги); оркестрация и DevOps: опыт работы с оркестраторами (Airflow, Dagster или Prefect), уверенное использование Git и базовые навыки CI/CD для дата-пайплайнов. Будет существенным преимуществом: опыт обучения простых ML-моделей (Logistic Regression, XGBoost) или использование Active Learning для классификации дублей; понимание принципов вероятностного связывания записей (Probabilistic Record Linkage, модель Фелледжи-Сантера); опыт работы с графовыми базами данных или графовыми алгоритмами (Connected Components) для разрешения сущностей; знание специфики работы с Greenplum и stream lakehouse.

Показать контакты

Имя не указано

Пожаловаться ID: 156546862

Похожие вакансии

Data Engineer

Договорная

Москва. Станции метро: Войковская

ГЛОБУС

Data Engineer

Договорная

Москва. Станции метро: Войковская

Группа НЛМК

Data Engineer

Договорная

Москва. Станции метро: Войковская

Aston

Data Engineer

Договорная

Москва. Станции метро: Войковская

Рестрим Медиа

Data Engineer

Договорная

Москва. Станции метро: Войковская

Employcity

Data Engineer

Договорная

Москва. Станции метро: Войковская

СБЕР