JustJoin.IT Hybrydowo Senior

Senior Data Engineer / Spark Developer

Upvanta sp. z o.o.

⚲ Wrocław

23 100 - 27 300 PLN netto (B2B)

Wymagania

  • Structured Streaming
  • DataFrame API
  • Spark SQL
  • PySpark
  • Apache Spark
  • Python
  • Data Lake
  • Apache Iceberg
  • Jenkins
  • CI/CD

Opis stanowiska

O projekcie
Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.

Zakres obowiązków
• Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL).
• Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności.
• Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii.
• Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold.
• Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych.
• Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych.
• Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark.
• Implementacja monitoringu, metryk i alertowania dla procesów danych.
• Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator.
• Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych.
• Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków.
• Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi.
• Udział w code review oraz mentoring mniej doświadczonych członków zespołu.

Wymagania
• Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.
• Bardzo dobra znajomość PySpark, Spark SQL, DataFrame API oraz Structured Streaming.
• Doświadczenie w integracji Apache Spark z MongoDB przy wykorzystaniu MongoDB Spark Connector.
• Praktyczna znajomość Apache Iceberg oraz zarządzania wersjonowanymi tabelami danych.
• Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse.
• Dobra znajomość języka Python.
• Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD.
• Znajomość narzędzi monitoringu i observability, w szczególności Prometheus oraz Grafana.
• Doświadczenie w pracy zgodnie z metodykami Agile (Scrum lub Kanban).
• Praktyczna znajomość Jira i Confluence.


Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)

Mile widziane
• Doświadczenie z Delta Lake lub Apache Hudi.
• Znajomość Kubernetes, Docker oraz Spark Operator.
• Doświadczenie w pracy z rozwiązaniami OpenTelemetry lub Dynatrace.
• Znajomość zagadnień Data Quality, Data Governance oraz Data Observability.
• Doświadczenie w środowiskach chmurowych (Azure, AWS, GCP).

🔍 Dekoder Ogłoszenia

🔴
doświadczonego Spark / Data Lakehouse Developera
Oczekuje się głębokiej wiedzy i praktycznego doświadczenia w pracy z Apache Spark oraz koncepcją Data Lakehouse, a nie tylko podstawowej znajomości.
🔴
współtworzyć nowoczesną architekturę Data Lakehouse
Może oznaczać zarówno budowanie od zera, jak i znaczące modyfikacje istniejącej, potencjalnie niedopracowanej architektury.
🔴
dbając o jakość, wydajność i niezawodność procesów danych
Oznacza to, że będziesz odpowiedzialny za rozwiązywanie problemów związanych z tymi aspektami, a nie tylko za ich tworzenie.
🔴
Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności.
Może to oznaczać ręczne lub półautomatyczne porównywanie danych, co może być czasochłonne i frustrujące.
🔴
Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych.
Duża część pracy może polegać na gaszeniu pożarów i naprawianiu istniejących problemów, a nie tylko na tworzeniu nowych rozwiązań.