Pracuj.pl Praca zdalna Mid

Spark / Data Lakehouse Developer

HIBERUS POLAND SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ

⚲ Wrocław, Stare Miasto

20 160–26 880 zł netto (+ VAT) / mies.

Wymagania

  • PySpark
  • Spark SQL
  • Apache Spark
  • MongoDB
  • Jenkins
  • Python
  • Prometheus
  • Grafana
  • Jira
  • Confluence

Opis stanowiska

Nasze wymagania:
4+ lata doświadczenia w pracy z Apache Spark w środowisku produkcyjnym.
Bardzo dobra znajomość PySpark, Spark SQL, DataFrames i Structured Streaming.
Doświadczenie z MongoDB i Spark Connector oraz znajomość modelowania i indeksowania danych.
Praktyczna znajomość Apache Iceberg i architektury Data Lakehouse (upsert/merge, optymalizacja zapisów).
Doświadczenie w CI/CD z Jenkins, w tym automatyzacji testów i deploymentów aplikacji Spark.
Bardzo dobra znajomość Python oraz Spark SQL.
Znajomość Prometheus i Grafana w obszarze monitoringu i observability.
Doświadczenie w pracy w Scrum/Kanban oraz znajomość Jira i Confluence.

O projekcie:
Dla naszego Klienta z sektora finansowego poszukujemy doświadczonego Spark / Data Lakehouse Developera, który dołączy do zespołu Data Platform.
Osoba na tym stanowisku będzie odpowiedzialna za projektowanie i rozwój rozwiązań do rekoncyliacji i synchronizacji danych w warstwie ODS (Operational Data Store), opartych na MongoDB, a także za budowę i utrzymanie warstw danych w architekturze Data Lakehouse – od surowych danych po warstwy Curated, Silver i Gold.

Zakres obowiązków:
Projektowanie i implementacja procesów Spark SQL/PySpark do walidacji i porównywania danych (MongoDB/ODS).
Implementacja reguł jakości danych, detekcji duplikatów, anomalii i braków oraz raportowania/alertowania.
Integracja i optymalizacja Spark–MongoDB (MongoDB Spark Connector, partitioning, push-down, schema-aware reads).
Projektowanie warstwy danych Raw → Bronze → Silver → Gold z wykorzystaniem Delta Lake/Iceberg/Hudi oraz CI/CD dla schematów i migracji.
Monitoring i observability procesów Spark/batch/stream (Prometheus, Grafana, OpenTelemetry, Dynatrace) oraz definiowanie SLA/SLO.
Automatyzacja deploymentów Spark na Docker/Kubernetes (Spark Operator).
Diagnozowanie problemów z danymi, wydajnością i opóźnieniami procesów.
Tworzenie dokumentacji technicznej, runbooków i diagramów przepływu danych.
Współpraca w Scrum/Kanban z Data Engineerami, BA, testerami i DevOps; prowadzenie warsztatów i code review.

Oferujemy:
Karta Multisport
Prywatna opieka medyczna

🔍 Dekoder Ogłoszenia

🔴
projektowanie i rozwój rozwiązań do rekoncyliacji i synchronizacji danych w warstwie ODS (Operational Data Store), opartych na MongoDB
Może oznaczać pracę z istniejącymi, potencjalnie skomplikowanymi i słabo udokumentowanymi systemami, a nie budowanie czegoś od zera.
🔴
budowę i utrzymanie warstw danych w architekturze Data Lakehouse – od surowych danych po warstwy Curated, Silver i Gold
Wymaga nie tylko tworzenia nowych rozwiązań, ale także bieżącego wsparcia i naprawy istniejących, co może być czasochłonne.
🔴
Implementacja reguł jakości danych, detekcji duplikatów, anomalii i braków oraz raportowania/alertowania.
Może oznaczać dużą ilość pracy związanej z czyszczeniem i walidacją danych, która jest często żmudna i powtarzalna.
🔴
Integracja i optymalizacja Spark–MongoDB (MongoDB Spark Connector, partitioning, push-down, schema-aware reads).
Wymaga głębokiego zrozumienia specyfiki integracji tych dwóch technologii, co może być wyzwaniem, jeśli nie ma gotowych, sprawdzonych wzorców.