NoFluffJobs Hybrydowo Senior

Senior Data Engineer / Spark Developer

Upvanta

⚲ Wrocław

23 100 - 27 300 PLN (B2B)

Wymagania

  • Apache Spark
  • PySpark
  • Spark
  • SQL
  • API
  • MongoDB
  • Prometheus
  • Jenkins
  • Jira
  • Kubernetes (nice to have)
  • Docker (nice to have)
  • Azure (nice to have)
  • AWS (nice to have)
  • GCP (nice to have)

Opis stanowiska

O projekcie:
O projekcie

Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.

Wymagania:
- Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.- Bardzo dobra znajomość PySpark, Spark SQL, DataFrame API oraz Structured Streaming.- Doświadczenie w integracji Apache Spark z MongoDB przy wykorzystaniu MongoDB Spark Connector.- Praktyczna znajomość Apache Iceberg oraz zarządzania wersjonowanymi tabelami danych.- Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse.- Dobra znajomość języka Python.- Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD.- Znajomość narzędzi monitoringu i observability, w szczególności Prometheus oraz Grafana.- Doświadczenie w pracy zgodnie z metodykami Agile (Scrum lub Kanban).- Praktyczna znajomość Jira i Confluence.- Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)

Mile widziane
- Doświadczenie z Delta Lake lub Apache Hudi.- Znajomość Kubernetes, Docker oraz Spark Operator.- Doświadczenie w pracy z rozwiązaniami OpenTelemetry lub Dynatrace.- Znajomość zagadnień Data Quality, Data Governance oraz Data Observability.- Doświadczenie w środowiskach chmurowych (Azure, AWS, GCP).

Codzienne zadania:
- Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL).
- Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności.
- Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii.
- Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold.
- Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych.
- Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych.
- Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark.
- Implementacja monitoringu, metryk i alertowania dla procesów danych.
- Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator.
- Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych.
- Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków.
- Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi.
- Udział w code review oraz mentoring mniej doświadczonych członków zespołu.

🔍 Dekoder Ogłoszenia

🔴
współtworzyć nowoczesną architekturę Data Lakehouse
Może oznaczać, że architektura jest w fazie rozwoju i kandydat będzie miał duży wpływ, ale też że może być niedopracowana i wymagać dużo pracy od podstaw.
🟡
Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark
Choć podane jest 'komercyjnego', może to oznaczać również projekty akademickie lub własne, jeśli były znaczące i udokumentowane.
🔴
Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)
Choć brzmi elastycznie, może oznaczać, że firma preferuje obecność w biurze i może naciskać na częstsze wizyty, jeśli uzna to za potrzebne.
🟡
Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD
Może oznaczać zarówno zaawansowane zarządzanie infrastrukturą CI/CD, jak i proste tworzenie skryptów w Jenkinsie.
🟡
Znajomość zagadnień Data Quality, Data Governance oraz Data Observability
Jest to lista obszarów, które mogą być wymagane w różnym stopniu, od podstawowej wiedzy po faktyczne wdrażanie i zarządzanie.