Data Engineer – Azure / Databricks / AWS
⚲ Warszawa, Śródmieście
150–180 zł netto (+ VAT) / godz.
Wymagania
- SQL
- Azure Data Platform
- Python
- Azure Databricks
- Apache Spark
- AWS
- Git
Opis stanowiska
Nasze wymagania:
Minimum 3–5 lat doświadczenia na stanowisku Data Engineer lub pokrewnym.
Bardzo dobra znajomość SQL oraz modelowania danych.
Doświadczenie w tworzeniu i utrzymaniu procesów ETL/ELT.
Praktyczna znajomość Azure Data Platform.
Doświadczenie komercyjne z Azure Databricks oraz Apache Spark (PySpark).
Bardzo dobra znajomość języka Python.
Doświadczenie w pracy z usługami danych AWS:
S3
Glue
Athena
Redshift
EMR
Lambda
Znajomość architektury Data Lake, Data Warehouse oraz Lakehouse.
Doświadczenie z narzędziami kontroli wersji (Git).
Znajomość zagadnień związanych z wydajnością, skalowalnością oraz bezpieczeństwem danych.
Umiejętność pracy w środowisku Agile/Scrum.
O projekcie:
Data Engineer będzie odpowiedzialny za projektowanie, budowę oraz rozwój nowoczesnych platform danych opartych o technologie chmurowe Microsoft Azure, AWS oraz Databricks. Rola koncentruje się na tworzeniu wydajnych procesów przetwarzania danych, wdrażaniu architektury Lakehouse oraz zapewnieniu wysokiej jakości i dostępności danych dla zespołów analitycznych, biznesowych i AI.
Zakres obowiązków:
Projektowanie, rozwój i utrzymanie procesów ETL/ELT dla danych pochodzących z różnych systemów źródłowych.
Budowa i rozwój rozwiązań Data Lake, Data Warehouse oraz Lakehouse w środowiskach Azure i AWS.
Tworzenie oraz optymalizacja pipeline’ów danych z wykorzystaniem Databricks i Apache Spark (PySpark).
Modelowanie danych oraz implementacja warstw Bronze, Silver i Gold zgodnie z architekturą Medallion.
Integracja danych z systemów ERP, CRM, aplikacji biznesowych, API oraz źródeł zewnętrznych.
Wykorzystanie usług chmurowych do przetwarzania i przechowywania danych:
Azure: Data Factory, Data Lake Storage Gen2, Synapse Analytics, Databricks
AWS: S3, Glue, Athena, Redshift, EMR, Lambda
Zapewnienie jakości danych poprzez wdrażanie mechanizmów walidacji, monitoringu i kontroli procesów.
Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych w chmurze.
Automatyzacja wdrożeń i zarządzanie środowiskami z wykorzystaniem narzędzi CI/CD.
Współpraca z zespołami Data Science, BI, Analityki oraz Architektury IT.
Tworzenie dokumentacji technicznej oraz standardów przetwarzania danych.
Wsparcie inicjatyw związanych z Data Governance, Data Security oraz Data Lineage.
Minimum 3–5 lat doświadczenia na stanowisku Data Engineer lub pokrewnym.
Bardzo dobra znajomość SQL oraz modelowania danych.
Doświadczenie w tworzeniu i utrzymaniu procesów ETL/ELT.
Praktyczna znajomość Azure Data Platform.
Doświadczenie komercyjne z Azure Databricks oraz Apache Spark (PySpark).
Bardzo dobra znajomość języka Python.
Doświadczenie w pracy z usługami danych AWS:
S3
Glue
Athena
Redshift
EMR
Lambda
Znajomość architektury Data Lake, Data Warehouse oraz Lakehouse.
Doświadczenie z narzędziami kontroli wersji (Git).
Znajomość zagadnień związanych z wydajnością, skalowalnością oraz bezpieczeństwem danych.
Umiejętność pracy w środowisku Agile/Scrum.
O projekcie:
Data Engineer będzie odpowiedzialny za projektowanie, budowę oraz rozwój nowoczesnych platform danych opartych o technologie chmurowe Microsoft Azure, AWS oraz Databricks. Rola koncentruje się na tworzeniu wydajnych procesów przetwarzania danych, wdrażaniu architektury Lakehouse oraz zapewnieniu wysokiej jakości i dostępności danych dla zespołów analitycznych, biznesowych i AI.
Zakres obowiązków:
Projektowanie, rozwój i utrzymanie procesów ETL/ELT dla danych pochodzących z różnych systemów źródłowych.
Budowa i rozwój rozwiązań Data Lake, Data Warehouse oraz Lakehouse w środowiskach Azure i AWS.
Tworzenie oraz optymalizacja pipeline’ów danych z wykorzystaniem Databricks i Apache Spark (PySpark).
Modelowanie danych oraz implementacja warstw Bronze, Silver i Gold zgodnie z architekturą Medallion.
Integracja danych z systemów ERP, CRM, aplikacji biznesowych, API oraz źródeł zewnętrznych.
Wykorzystanie usług chmurowych do przetwarzania i przechowywania danych:
Azure: Data Factory, Data Lake Storage Gen2, Synapse Analytics, Databricks
AWS: S3, Glue, Athena, Redshift, EMR, Lambda
Zapewnienie jakości danych poprzez wdrażanie mechanizmów walidacji, monitoringu i kontroli procesów.
Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych w chmurze.
Automatyzacja wdrożeń i zarządzanie środowiskami z wykorzystaniem narzędzi CI/CD.
Współpraca z zespołami Data Science, BI, Analityki oraz Architektury IT.
Tworzenie dokumentacji technicznej oraz standardów przetwarzania danych.
Wsparcie inicjatyw związanych z Data Governance, Data Security oraz Data Lineage.
🔍 Dekoder Ogłoszenia
🔴
nowoczesnych platform danych
Może oznaczać zarówno innowacyjne rozwiązania, jak i po prostu wykorzystanie aktualnych technologii bez głębszego przemyślenia architektury.
🔴
Rola koncentruje się na tworzeniu wydajnych procesów przetwarzania danych
Może oznaczać, że głównym zadaniem będzie optymalizacja istniejących procesów, a nie budowanie ich od zera.
🔴
zapewnieniu wysokiej jakości i dostępności danych
Może oznaczać, że duża część pracy będzie polegała na naprawianiu problemów z jakością i dostępnością danych, a nie na ich proaktywnym zapewnianiu.
🔴
implementacja warstw Bronze, Silver i Gold zgodnie z architekturą Medallion
Wymaga to nie tylko znajomości koncepcji, ale też doświadczenia w faktycznym jej wdrażaniu i zarządzaniu, co może być bardziej złożone niż się wydaje.