Senior Data Engineer
Numer referencyjny: SDE/Adm
W Comarch dbamy o to, aby dane stanowiły stabilny i bezpieczny krwioobieg organizacji. Żeby jednak mogły stać się fundamentem trafnych decyzji i nowoczesnych procesów, potrzebują technicznej doskonałości, sprawnej orkiestracji i najwyższej jakości. Dlatego, jeśli potrafisz budować skalowalne architektury danych, tworzyć zaawansowane potoki przetwarzania oraz przekładać zawiłe koncepty na język biznesu - szukamy właśnie Ciebie!
Przechodzimy przez kluczowy etap transformacji cyfrowej i finansowej (projekt F1) i poszukujemy osoby na stanowisko Senior Data Engineer, która przejmie techniczną odpowiedzialność za rozwój naszej platformy danych (Data Hub) w obszarze Master Data Management (MDM) oraz Data Quality.
Zrób kolejny krok w karierze i buduj nowoczesne środowisko danych od podstaw w międzynarodowej firmie technologicznej!
Profil stanowiska
- Min. 4-5 lat komercyjnego doświadczenia na stanowisku Data Engineer
- Bardzo dobra znajomość SQL (w tym funkcje analityczne, optymalizacja zapytań, projektowanie widoków i struktur tabelarycznych) oraz Pythona (przetwarzanie danych, biblioteki pandas/polars, integracje API)
- Praktyczna znajomość narzędzi orkiestracji danych (np. Apache Airflow) oraz doświadczenie w budowie hurtowni danych lub Data Hubów
- Doświadczenie w obszarze MDM / Record Linkage (deduplikacja danych, silniki matchowania) lub silna motywacja do rozwoju w tym kierunku
- Znajomość dobrych praktyk inżynierskich: kontrola wersji (Git), konteneryzacja (Docker), automatyzacja wdrożeń (CI/CD) oraz testy jednostkowe
- Umiejętność płynnej komunikacji i tłumaczenia zawiłych zagadnień technicznych na język biznesowy
- Biegła znajomość języka polskiego (ojczysty) oraz dobra znajomość języka angielskiego (min. B2)
Twoje zadania
- Projektowanie i wdrażanie architektury warstw danych (staging, raw, golden record, presentation) w Data Hubie
- Tworzenie i automatyzacja potoków danych (ETL/ELT) z użyciem Apache Airflow, Spark, dbt oraz zaawansowanego SQL
- Implementacja i optymalizacja potoków tworzenia „Złotego Rekordu” (Golden Record) przy użyciu biblioteki Splink (Python) oraz reguł deterministycznych i probabilistycznych
- Zarządzanie regułami scalania i pierwszeństwa danych (survivorship rules) dla klientów i dostawców
- Wdrażanie i obsługa frameworka Great Expectations do automatycznej walidacji jakości danych
- Przejęcie repozytoriów kodu od dostawców zewnętrznych oraz ich standaryzacja in-house przy zachowaniu dobrych praktyk (Git, Docker, CI/CD)
Dla Ciebie
- Udział w jednej z największych transformacji cyfrowych i procesowych w Polsce oraz decyzyjność w zakresie architektury data pipelines i orkiestracji danych
- Dostęp do szkoleń wewnętrznych i zewnętrznych, udział w konferencjach branżowych, praca z nowoczesnymi technologiami i AI oraz jasna ścieżka awansu (np. w kierunku Lead Data Architect)
- Zaufanie, wysoki poziom autonomii i otwartość na eksperymenty oraz nowe pomysły
- Hybrydowy model pracy oraz elastyczne godziny rozpoczęcia pracy
- System kafeteryjny - możesz wybrać pełne dofinansowanie do karty Multisport, przeznaczyć środki na kulturę, wypoczynek lub sport i zakupy
- Dogodny dojazd - miejsca parkingowe dostępne dla wszystkich oraz pełne zaplecze dla osób dojeżdżających do pracy na rowerze