Senior Data Engineer – Spark / Data Lakehouse
⚲ Wrocław
24 360 - 26 880 PLN netto (B2B)
Wymagania
- Python
- Apache Spark
- PySpark
- MongoDB
- Jenkins
- Prometheus
- Grafana
- Docker
- Kubernetes
Opis stanowiska
Clurgo to firma stworzona przez developerów dla developerów. Nasze zespoły łączą pełne spektrum kompetencji - od rozwoju oprogramowania i infrastruktury, przez analizę oraz testy, aż po strategiczne zarządzanie produktem i procesami. Realizujemy różnorodne projekty IT dla klientów z wielu branż, dbając o dobre praktyki programistyczne i zachowanie work-life balance. Tworzymy rozwiązania, które mają znaczenie - dla firm w Polsce i na całym świecie.
✅Dołącz do zespołu Data Platform naszego Klienta z sektora bankowego, gdzie będziesz projektować i wdrażać rozwiązania do rekoncyliacji danych w ODS opartym o MongoDB oraz budować warstwy danych w architekturze Data Lakehouse. Rola łączy rozwój rozwiązań opartych o Apache Spark, PySpark i Spark SQL z optymalizacją przetwarzania danych, wdrażaniem CI/CD oraz monitoringiem procesów batch i streamingowych. Będziesz mieć wpływ na jakość, wydajność i niezawodność kluczowych procesów danych w środowisku dużej organizacji bankowej.
✅Technologie i narzędzia: Python, Apache Spark, PySpark, Spark-SQL, DataFrames, Structured Streaming, MongoDB, MongoDB Spark Connector, Delta Lake, Apache Iceberg, Hudi, Jenkins, Prometheus, Grafana, OpenTelemetry, Dynatrace, Kubernetes, Docker, Spark Operator
Szukamy Ciebie, jeśli:
👉 Posiadasz min. 4 lata praktycznego doświadczenia w środowiskach produkcyjnych z wykorzystaniem Apache Spark
👉 Masz doświadczenie z PySpark, Spark-SQL, DataFrames oraz Structured Streaming
👉 Posiadasz doświadczenie w odczycie i zapisie danych z/do MongoDB przy użyciu MongoDB Spark Connector
👉 Posiadasz praktyczne doświadczenie z architekturą Data Lakehouse (zarządzanie tabelami wersjonowanymi przy użyciu Iceberg, Delta Lake lub Hudi)
👉 Znasz Jenkinsa i potrafisz automatyzować testy (unit/integration) oraz procesy deploymentu aplikacji Spark
👉 Znasz narzędzia do monitoringu i obserwowalności (Prometheus, Grafana)
👉 Swobodnie komunikujesz się w języku angielskim (min. B2) i efektywnie pracujesz w metodykach Agile (Scrum/Kanban)
Mile widziane:
• Praktyczna znajomość Dynatrace i OpenTelemetry
• Doświadczenie z Docker oraz Spark Operator w środowisku Kubernetes
Zadania:
• Projektowanie i implementacja zadań Spark-SQL/PySpark do weryfikacji spójności danych między ODS (MongoDB) a systemami źródłowymi
• Łączenie Spark z MongoDB przy użyciu MongoDB Spark Connector
• Optymalizacja odczytów z MongoDB
• Budowa architektury medalionowej z wykorzystaniem technologii Iceberg/Delta Lake/Hudi
• Implementacja CI/CD dla schematów tabel, migracji i wersjonowania
• Kosztowa optymalizacja zapytań w środowisku Data Lakehouse
• Konfiguracja metryk (Prometheus + Grafana), logów oraz śledzenia (OpenTelemetry, Dynatrace) dla Spark i procesów batch/stream
• Definiowanie SLA/SLO oraz alertów
• Diagnoza problemów z rekordami, opóźnieniami i niezgodnościami danych
• Praca z Data Engineerami, Business Analystami, testerami i zespołem DevOps
Czego możesz się spodziewać:
• współpracy w oparciu o kontrakt B2B
• modelu hybrydowego: raz w tygodniu z biura we Wrocławiu
• profesjonalnego procesu rekrutacyjnego – zawsze otrzymasz od nas feedback niezależnie od decyzji
Poznaj nas lepiej👉 https://www.facebook.com/clurgo/
✅Dołącz do zespołu Data Platform naszego Klienta z sektora bankowego, gdzie będziesz projektować i wdrażać rozwiązania do rekoncyliacji danych w ODS opartym o MongoDB oraz budować warstwy danych w architekturze Data Lakehouse. Rola łączy rozwój rozwiązań opartych o Apache Spark, PySpark i Spark SQL z optymalizacją przetwarzania danych, wdrażaniem CI/CD oraz monitoringiem procesów batch i streamingowych. Będziesz mieć wpływ na jakość, wydajność i niezawodność kluczowych procesów danych w środowisku dużej organizacji bankowej.
✅Technologie i narzędzia: Python, Apache Spark, PySpark, Spark-SQL, DataFrames, Structured Streaming, MongoDB, MongoDB Spark Connector, Delta Lake, Apache Iceberg, Hudi, Jenkins, Prometheus, Grafana, OpenTelemetry, Dynatrace, Kubernetes, Docker, Spark Operator
Szukamy Ciebie, jeśli:
👉 Posiadasz min. 4 lata praktycznego doświadczenia w środowiskach produkcyjnych z wykorzystaniem Apache Spark
👉 Masz doświadczenie z PySpark, Spark-SQL, DataFrames oraz Structured Streaming
👉 Posiadasz doświadczenie w odczycie i zapisie danych z/do MongoDB przy użyciu MongoDB Spark Connector
👉 Posiadasz praktyczne doświadczenie z architekturą Data Lakehouse (zarządzanie tabelami wersjonowanymi przy użyciu Iceberg, Delta Lake lub Hudi)
👉 Znasz Jenkinsa i potrafisz automatyzować testy (unit/integration) oraz procesy deploymentu aplikacji Spark
👉 Znasz narzędzia do monitoringu i obserwowalności (Prometheus, Grafana)
👉 Swobodnie komunikujesz się w języku angielskim (min. B2) i efektywnie pracujesz w metodykach Agile (Scrum/Kanban)
Mile widziane:
• Praktyczna znajomość Dynatrace i OpenTelemetry
• Doświadczenie z Docker oraz Spark Operator w środowisku Kubernetes
Zadania:
• Projektowanie i implementacja zadań Spark-SQL/PySpark do weryfikacji spójności danych między ODS (MongoDB) a systemami źródłowymi
• Łączenie Spark z MongoDB przy użyciu MongoDB Spark Connector
• Optymalizacja odczytów z MongoDB
• Budowa architektury medalionowej z wykorzystaniem technologii Iceberg/Delta Lake/Hudi
• Implementacja CI/CD dla schematów tabel, migracji i wersjonowania
• Kosztowa optymalizacja zapytań w środowisku Data Lakehouse
• Konfiguracja metryk (Prometheus + Grafana), logów oraz śledzenia (OpenTelemetry, Dynatrace) dla Spark i procesów batch/stream
• Definiowanie SLA/SLO oraz alertów
• Diagnoza problemów z rekordami, opóźnieniami i niezgodnościami danych
• Praca z Data Engineerami, Business Analystami, testerami i zespołem DevOps
Czego możesz się spodziewać:
• współpracy w oparciu o kontrakt B2B
• modelu hybrydowego: raz w tygodniu z biura we Wrocławiu
• profesjonalnego procesu rekrutacyjnego – zawsze otrzymasz od nas feedback niezależnie od decyzji
Poznaj nas lepiej👉 https://www.facebook.com/clurgo/
🔍 Dekoder Ogłoszenia
🟡
dbając o dobre praktyki programistyczne i zachowanie work-life balance
Standardowa deklaracja — samo wspomnienie work-life balance nie gwarantuje realnego balansu, ale brak tu sygnałów ostrzegawczych. Zwrot neutralny, często pojawia się w ogłoszeniach jako wartość firmowa.