Data Engineer
⚲ Kraków
11 500–22 000 zł / mies. (zal. od umowy)
Wymagania
- PyTorch
- Azure DevOps
- Databricks
- Microsoft Azure
- SQL
- Python
Opis stanowiska
Nasze wymagania:
6–10 lat doświadczenia w IT
4–5 lat praktycznego doświadczenia w pracy z PySpark i Python
Bardzo dobra znajomość zasad data engineeringu oraz nowoczesnych architektur przetwarzania danych
Udokumentowane doświadczenie w zakresie PySpark (Spark SQL, DataFrames, optymalizacja wydajności)
Udokumentowane doświadczenie w programowaniu i tworzeniu aplikacji w Pythonie
Udokumentowane doświadczenie w budowie i orkiestracji procesów w Azure Data Factory (ADF)
Dobra znajomość technik optymalizacji danych: partycjonowanie, cache’owanie, optymalizacja joinów, optymalizacja zapytań
Doświadczenie w pracy z rozproszonymi systemami przetwarzania dużych zbiorów danych
Dobra znajomość SQL, baz danych oraz modelowania danych
Bardzo dobre umiejętności analityczne i rozwiązywania problemów
Mile widziane:
Praktyczne doświadczenie z Azure Databricks (ADB)
Znajomość technologii chmurowych, preferencyjnie Microsoft Azure
Doświadczenie z procesami CI/CD oraz praktykami DevOps w obszarze data engineering
Znajomość architektur Data Lake oraz Lakehouse
Wiedza z zakresu nowoczesnego zarządzania danymi (Data Governance) i monitoringu danych
Zakres obowiązków:
Praca z biura 3 razy w tygodniu
Projektowanie, rozwijanie i utrzymywanie skalowalnych potoków danych z wykorzystaniem PySpark i Python
Budowanie i optymalizacja procesów ETL/ELT do przetwarzania dużych wolumenów danych
Tworzenie wydajnego, wielokrotnego użytku kodu z naciskiem na optymalizację
Przetwarzanie i zarządzanie danymi strukturalnymi oraz niestrukturalnymi pochodzącymi z różnych źródeł
Wdrażanie najlepszych praktyk związanych z data engineeringiem, optymalizacją wydajności i jakością kodu
Tworzenie, orkiestracja i monitorowanie procesów danych przy użyciu Azure Data Factory (ADF)
Współpraca z Data Scientistami, Data Analystami, Architektami Rozwiązań oraz innymi interesariuszami
Zapewnienie jakości, niezawodności i integralności danych na wszystkich platformach danych
Identyfikowanie i rozwiązywanie problemów wydajnościowych w potokach przetwarzania danych
Udział w dyskusjach dotyczących architektury danych oraz inicjatywach związanych z ciągłym doskonaleniem
6–10 lat doświadczenia w IT
4–5 lat praktycznego doświadczenia w pracy z PySpark i Python
Bardzo dobra znajomość zasad data engineeringu oraz nowoczesnych architektur przetwarzania danych
Udokumentowane doświadczenie w zakresie PySpark (Spark SQL, DataFrames, optymalizacja wydajności)
Udokumentowane doświadczenie w programowaniu i tworzeniu aplikacji w Pythonie
Udokumentowane doświadczenie w budowie i orkiestracji procesów w Azure Data Factory (ADF)
Dobra znajomość technik optymalizacji danych: partycjonowanie, cache’owanie, optymalizacja joinów, optymalizacja zapytań
Doświadczenie w pracy z rozproszonymi systemami przetwarzania dużych zbiorów danych
Dobra znajomość SQL, baz danych oraz modelowania danych
Bardzo dobre umiejętności analityczne i rozwiązywania problemów
Mile widziane:
Praktyczne doświadczenie z Azure Databricks (ADB)
Znajomość technologii chmurowych, preferencyjnie Microsoft Azure
Doświadczenie z procesami CI/CD oraz praktykami DevOps w obszarze data engineering
Znajomość architektur Data Lake oraz Lakehouse
Wiedza z zakresu nowoczesnego zarządzania danymi (Data Governance) i monitoringu danych
Zakres obowiązków:
Praca z biura 3 razy w tygodniu
Projektowanie, rozwijanie i utrzymywanie skalowalnych potoków danych z wykorzystaniem PySpark i Python
Budowanie i optymalizacja procesów ETL/ELT do przetwarzania dużych wolumenów danych
Tworzenie wydajnego, wielokrotnego użytku kodu z naciskiem na optymalizację
Przetwarzanie i zarządzanie danymi strukturalnymi oraz niestrukturalnymi pochodzącymi z różnych źródeł
Wdrażanie najlepszych praktyk związanych z data engineeringiem, optymalizacją wydajności i jakością kodu
Tworzenie, orkiestracja i monitorowanie procesów danych przy użyciu Azure Data Factory (ADF)
Współpraca z Data Scientistami, Data Analystami, Architektami Rozwiązań oraz innymi interesariuszami
Zapewnienie jakości, niezawodności i integralności danych na wszystkich platformach danych
Identyfikowanie i rozwiązywanie problemów wydajnościowych w potokach przetwarzania danych
Udział w dyskusjach dotyczących architektury danych oraz inicjatywach związanych z ciągłym doskonaleniem
🔍 Dekoder Ogłoszenia
✓ Ogłoszenie wygląda transparentnie — brak typowych czerwonych flag.