Spark / Data Lakehouse Developer
⚲ Wrocław
20 160 - 26 880 PLN netto (B2B)
Wymagania
- MongoDB
- Jenkins
- Python
- Apache Spark
- PySpark
- Prometheus
- Grafana
- Apache Iceberg
Opis stanowiska
Więcej niż jeden projekt. Więcej niż jeden rynek.
Jesteśmy częścią Hiberus, firmy technologicznej wywodzącej się z Hiszpanii z silną pozycją na rynku polskim: 4700+ specjalistów, obecnej w 14+ krajach i realizującej projekty dla klientów na całym świecie.
Pracujemy z technologiami AI, Data, Cloud, Software Development, BI i Cybersecurity. Ale przede wszystkim stawiamy na ludzi – gdy jeden projekt się kończy, szukamy kolejnych możliwości w ramach Hiberus, również w innych krajach.
Naszą wartość dodatkową stanowi Hiberus University - międzynarodowe środowisko i realna możliwość rozwijania swoich kompetencji. Ponad tysiąc osób przeszkolonych w zeszłym roku z wybranych technologii.
Pierwszy projekt to początek. Z Hiberus możesz budować swoją karierę długoterminowo.
Dla naszego Klienta z sektora finansowego poszukujemy doświadczonego Spark / Data Lakehouse Developera, który dołączy do zespołu Data Platform.
Osoba na tym stanowisku będzie odpowiedzialna za projektowanie i rozwój rozwiązań do rekoncyliacji i synchronizacji danych w warstwie ODS (Operational Data Store), opartych na MongoDB, a także za budowę i utrzymanie warstw danych w architekturze Data Lakehouse – od surowych danych po warstwy Curated, Silver i Gold.
Główne obowiązki :
• Projektowanie i implementacja procesów Spark SQL/PySpark do walidacji i porównywania danych (MongoDB/ODS).
• Implementacja reguł jakości danych, detekcji duplikatów, anomalii i braków oraz raportowania/alertowania.
• Integracja i optymalizacja Spark–MongoDB (MongoDB Spark Connector, partitioning, push-down, schema-aware reads).
• Projektowanie warstwy danych Raw → Bronze → Silver → Gold z wykorzystaniem Delta Lake/Iceberg/Hudi oraz CI/CD dla schematów i migracji.
• Monitoring i observability procesów Spark/batch/stream (Prometheus, Grafana, OpenTelemetry, Dynatrace) oraz definiowanie SLA/SLO.
• Automatyzacja deploymentów Spark na Docker/Kubernetes (Spark Operator).
• Diagnozowanie problemów z danymi, wydajnością i opóźnieniami procesów.
• Tworzenie dokumentacji technicznej, runbooków i diagramów przepływu danych.
• Współpraca w Scrum/Kanban z Data Engineerami, BA, testerami i DevOps; prowadzenie warsztatów i code review.
Kluczowe wymagania :
• 4+ lata doświadczenia w pracy z Apache Spark w środowisku produkcyjnym.
• Bardzo dobra znajomość PySpark, Spark SQL, DataFrames i Structured Streaming.
• Doświadczenie z MongoDB i Spark Connector oraz znajomość modelowania i indeksowania danych.
• Praktyczna znajomość Apache Iceberg i architektury Data Lakehouse (upsert/merge, optymalizacja zapisów).
• Doświadczenie w CI/CD z Jenkins, w tym automatyzacji testów i deploymentów aplikacji Spark.
• Bardzo dobra znajomość Python oraz Spark SQL.
• Znajomość Prometheus i Grafana w obszarze monitoringu i observability.
• Doświadczenie w pracy w Scrum/Kanban oraz znajomość Jira i Confluence.
Jesteśmy częścią Hiberus, firmy technologicznej wywodzącej się z Hiszpanii z silną pozycją na rynku polskim: 4700+ specjalistów, obecnej w 14+ krajach i realizującej projekty dla klientów na całym świecie.
Pracujemy z technologiami AI, Data, Cloud, Software Development, BI i Cybersecurity. Ale przede wszystkim stawiamy na ludzi – gdy jeden projekt się kończy, szukamy kolejnych możliwości w ramach Hiberus, również w innych krajach.
Naszą wartość dodatkową stanowi Hiberus University - międzynarodowe środowisko i realna możliwość rozwijania swoich kompetencji. Ponad tysiąc osób przeszkolonych w zeszłym roku z wybranych technologii.
Pierwszy projekt to początek. Z Hiberus możesz budować swoją karierę długoterminowo.
Dla naszego Klienta z sektora finansowego poszukujemy doświadczonego Spark / Data Lakehouse Developera, który dołączy do zespołu Data Platform.
Osoba na tym stanowisku będzie odpowiedzialna za projektowanie i rozwój rozwiązań do rekoncyliacji i synchronizacji danych w warstwie ODS (Operational Data Store), opartych na MongoDB, a także za budowę i utrzymanie warstw danych w architekturze Data Lakehouse – od surowych danych po warstwy Curated, Silver i Gold.
Główne obowiązki :
• Projektowanie i implementacja procesów Spark SQL/PySpark do walidacji i porównywania danych (MongoDB/ODS).
• Implementacja reguł jakości danych, detekcji duplikatów, anomalii i braków oraz raportowania/alertowania.
• Integracja i optymalizacja Spark–MongoDB (MongoDB Spark Connector, partitioning, push-down, schema-aware reads).
• Projektowanie warstwy danych Raw → Bronze → Silver → Gold z wykorzystaniem Delta Lake/Iceberg/Hudi oraz CI/CD dla schematów i migracji.
• Monitoring i observability procesów Spark/batch/stream (Prometheus, Grafana, OpenTelemetry, Dynatrace) oraz definiowanie SLA/SLO.
• Automatyzacja deploymentów Spark na Docker/Kubernetes (Spark Operator).
• Diagnozowanie problemów z danymi, wydajnością i opóźnieniami procesów.
• Tworzenie dokumentacji technicznej, runbooków i diagramów przepływu danych.
• Współpraca w Scrum/Kanban z Data Engineerami, BA, testerami i DevOps; prowadzenie warsztatów i code review.
Kluczowe wymagania :
• 4+ lata doświadczenia w pracy z Apache Spark w środowisku produkcyjnym.
• Bardzo dobra znajomość PySpark, Spark SQL, DataFrames i Structured Streaming.
• Doświadczenie z MongoDB i Spark Connector oraz znajomość modelowania i indeksowania danych.
• Praktyczna znajomość Apache Iceberg i architektury Data Lakehouse (upsert/merge, optymalizacja zapisów).
• Doświadczenie w CI/CD z Jenkins, w tym automatyzacji testów i deploymentów aplikacji Spark.
• Bardzo dobra znajomość Python oraz Spark SQL.
• Znajomość Prometheus i Grafana w obszarze monitoringu i observability.
• Doświadczenie w pracy w Scrum/Kanban oraz znajomość Jira i Confluence.
🔍 Dekoder Ogłoszenia
🔴
Więcej niż jeden projekt. Więcej niż jeden rynek.
Możesz być przenoszony między różnymi projektami i klientami, co może oznaczać brak stabilności lub ciągłe uczenie się nowych rzeczy.
🔴
gdy jeden projekt się kończy, szukamy kolejnych możliwości w ramach Hiberus, również w innych krajach.
Twoja praca może być projektowa, a po zakończeniu jednego projektu będziesz musiał szukać kolejnego w ramach firmy, co może oznaczać okresy niepewności.
🟡
Hiberus University - międzynarodowe środowisko i realna możliwość rozwijania swoich kompetencji.
Choć brzmi to pozytywnie, może oznaczać, że firma wykorzystuje szkolenia jako sposób na zatrzymanie pracowników i rozwijanie ich pod kątem własnych potrzeb, a niekoniecznie na ich indywidualne ścieżki kariery.
🟡
Pierwszy projekt to początek. Z Hiberus możesz budować swoją karierę długoterminowo.
Sugestia długoterminowej kariery może być obietnicą, ale rzeczywistość zależy od rotacji projektów i możliwości rozwoju wewnątrz firmy.
🟡
Poszukujemy doświadczonego Spark / Data Lakehouse Developera
Wymagane jest znaczące doświadczenie, co może oznaczać, że firma szuka kogoś, kto od razu będzie samodzielny i nie będzie wymagał intensywnego wdrożenia.