Pracuj.pl Hybrydowo Senior

Senior Data Engineer / Spark Developer (m/k/n)

UPVANTA SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ

⚲ Wrocław, Fabryczna

Do uzgodnienia

Wymagania

  • Apache Spark
  • PySpark
  • Spark SQL
  • MongoDB
  • Python
  • Jenkins
  • Prometheus
  • Grafana
  • Jira
  • Confluence
  • Kubernetes
  • Docker
  • OpenTelemetry
  • Dynatrace
  • Azure
  • AWS
  • Google Cloud Platform

Opis stanowiska

Nasze wymagania:
Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.
Bardzo dobra znajomość PySpark, Spark SQL, DataFrame API oraz Structured Streaming.
Doświadczenie w integracji Apache Spark z MongoDB przy wykorzystaniu MongoDB Spark Connector.
Praktyczna znajomość Apache Iceberg oraz zarządzania wersjonowanymi tabelami danych.
Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse.
Dobra znajomość języka Python.
Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD.
Znajomość narzędzi monitoringu i observability, w szczególności Prometheus oraz Grafana.
Doświadczenie w pracy zgodnie z metodykami Agile (Scrum lub Kanban).
Praktyczna znajomość Jira i Confluence.
Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)

Mile widziane:
Doświadczenie z Delta Lake lub Apache Hudi.
Znajomość Kubernetes, Docker oraz Spark Operator.
Doświadczenie w pracy z rozwiązaniami OpenTelemetry lub Dynatrace.
Znajomość zagadnień Data Quality, Data Governance oraz Data Observability.
Doświadczenie w środowiskach chmurowych (Azure, AWS, GCP).

O projekcie:
Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.

Zakres obowiązków:
Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL).
Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności.
Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii.
Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold.
Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych.
Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych.
Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark.
Implementacja monitoringu, metryk i alertowania dla procesów danych.
Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator.
Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych.
Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków.
Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi.
Udział w code review oraz mentoring mniej doświadczonych członków zespołu.

Oferujemy:
budżet: B2B, 1100-1300 zł/MD
Praca hybrydowa - Wrocław

🔍 Dekoder Ogłoszenia

🔴
Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.
Oczekiwane jest, że te 4 lata to faktyczne, udokumentowane doświadczenie w projektach, a nie tylko nauka czy krótkie epizody.
🟡
Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse.
Może oznaczać zarówno budowę od zera, jak i pracę z istniejącymi, być może niedoskonałymi, rozwiązaniami.
🔴
Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)
Choć brzmi elastycznie, może oznaczać, że oczekiwana jest fizyczna obecność w biurze w te dni, a nie tylko możliwość pracy zdalnej.
🟡
Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD.
Może oznaczać zarówno tworzenie od podstaw, jak i utrzymanie istniejących, potencjalnie skomplikowanych i trudnych w modyfikacji pipeline'ów.
🔴
Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.
Choć brzmi ambitnie, może oznaczać, że architektura jest w fazie rozwoju i wymagać będzie rozwiązywania wielu problemów technicznych i integracyjnych.