Data Engineer z GCP (f/m/x)
⚲ Lublin, Warszawa, Bydgoszcz, Kraków, Gdańsk, Katowice, Łódź, Poznań, Rzeszów, Szczecin
12 000 – 20 000 zł / mies.
Wymagania
- GCP
- BigQuery
- Cloud Computing
- SQL
- Python
- IaC (Infrastructure as Code)
- CI/CD
- Apache Airflow / Cloud Composer
- Terraform
- Data Built Tool
Opis stanowiska
Chcesz rozwijać się w technologiach chmurowych i pracować na realnych danych? Dołącz do naszego zespołu Data & Analytics, gdzie budujemy i rozwijamy rozwiązania oparte na GCP. Pracuj z ekspertami, rozwijaj się w kierunku Data Engineeringu, Big Data lub Machine Learningu i miej realny wpływ na projekty.
Twoje Zadania
• Projektowanie, implementacja i utrzymanie skalowalnych pipeline’ów danych w oparciu o Google Cloud Platform
• Praca z BigQuery jako główną hurtownią danych: modelowanie danych, optymalizacja zapytań i kosztów, dbanie o wydajność oraz niezawodność rozwiązań
• Integracja danych z różnych źródeł (pliki, bazy danych, API, eventy) oraz ich przetwarzanie i transformacja
• Orkiestracja workflow danych przy użyciu Apache Airflow / Cloud Composer
• Tworzenie i utrzymanie rozwiązań CI/CD dla pipeline’ów danych oraz infrastruktury
• Zarządzanie infrastrukturą w chmurze zgodnie z podejściem Infrastructure as Code (Terraform)
• Zapewnienie jakości danych, monitoringu pipeline’ów oraz szybkiego reagowania na incydenty
• Współpraca z zespołami analitycznymi, BI i produktowymi w celu dostarczania stabilnych i dobrze udokumentowanych danych
• Udział w rozwoju architektury danych oraz wspólne definiowanie dobrych praktyk data engineeringowych
Wymagania
• Min. 4 lata doświadczenia w roli Data Engineer lub na podobnym stanowisku przy pracy z danymi w środowisku produkcyjnym
• Bardzo dobra znajomość Google Cloud Platform, w szczególności: BigQuery (modelowanie danych, optymalizacja zapytań) oraz Cloud Storage
• Umiejętność projektowania, budowy i utrzymania pipeline’ów danych (batch i/lub streaming)
• Bardzo dobra znajomość SQL oraz Pythona w kontekście przetwarzania i orkiestracji danych
• Doświadczenie w obszarze orkiestracji workflow (Apache Airflow / Cloud Composer)
• Praktyka w implementacji CI/CD dla rozwiązań data, np. GitHub Actions, GitLab CI, Cloud Build
• Znajomość podejścia Infrastructure as Code, ze wskazaniem na Terraform
• Wcześniejsza praca z dużymi wolumenami danych, z uwzględnieniem wydajności i niezawodności rozwiązań
• Swobodna komunikacja w języku angielskim
• Wymagane przebywanie na terenie Polski oraz płynna znajomość języka polskiego
Mile widziane
• Praktyczne doświadczenie w przetwarzaniu danych streamingowych (np. Dataflow / Apache Beam, Pub/Sub)
• Biegłość w Apache Spark / PySpark przy pracy z dużymi wolumenami danych
• Kompetencje w zakresie transformacji i modelowania danych z wykorzystaniem narzędzi takich jak dbt
• Umiejętność pracy z różnorodnymi platformami danych (np. Databricks, Snowflake, MS Fabric)
• Orientacja w narzędziach oraz dobrych praktykach z obszaru Data Governance, Data Lineage i Data Quality
Twoje Zadania
• Projektowanie, implementacja i utrzymanie skalowalnych pipeline’ów danych w oparciu o Google Cloud Platform
• Praca z BigQuery jako główną hurtownią danych: modelowanie danych, optymalizacja zapytań i kosztów, dbanie o wydajność oraz niezawodność rozwiązań
• Integracja danych z różnych źródeł (pliki, bazy danych, API, eventy) oraz ich przetwarzanie i transformacja
• Orkiestracja workflow danych przy użyciu Apache Airflow / Cloud Composer
• Tworzenie i utrzymanie rozwiązań CI/CD dla pipeline’ów danych oraz infrastruktury
• Zarządzanie infrastrukturą w chmurze zgodnie z podejściem Infrastructure as Code (Terraform)
• Zapewnienie jakości danych, monitoringu pipeline’ów oraz szybkiego reagowania na incydenty
• Współpraca z zespołami analitycznymi, BI i produktowymi w celu dostarczania stabilnych i dobrze udokumentowanych danych
• Udział w rozwoju architektury danych oraz wspólne definiowanie dobrych praktyk data engineeringowych
Wymagania
• Min. 4 lata doświadczenia w roli Data Engineer lub na podobnym stanowisku przy pracy z danymi w środowisku produkcyjnym
• Bardzo dobra znajomość Google Cloud Platform, w szczególności: BigQuery (modelowanie danych, optymalizacja zapytań) oraz Cloud Storage
• Umiejętność projektowania, budowy i utrzymania pipeline’ów danych (batch i/lub streaming)
• Bardzo dobra znajomość SQL oraz Pythona w kontekście przetwarzania i orkiestracji danych
• Doświadczenie w obszarze orkiestracji workflow (Apache Airflow / Cloud Composer)
• Praktyka w implementacji CI/CD dla rozwiązań data, np. GitHub Actions, GitLab CI, Cloud Build
• Znajomość podejścia Infrastructure as Code, ze wskazaniem na Terraform
• Wcześniejsza praca z dużymi wolumenami danych, z uwzględnieniem wydajności i niezawodności rozwiązań
• Swobodna komunikacja w języku angielskim
• Wymagane przebywanie na terenie Polski oraz płynna znajomość języka polskiego
Mile widziane
• Praktyczne doświadczenie w przetwarzaniu danych streamingowych (np. Dataflow / Apache Beam, Pub/Sub)
• Biegłość w Apache Spark / PySpark przy pracy z dużymi wolumenami danych
• Kompetencje w zakresie transformacji i modelowania danych z wykorzystaniem narzędzi takich jak dbt
• Umiejętność pracy z różnorodnymi platformami danych (np. Databricks, Snowflake, MS Fabric)
• Orientacja w narzędziach oraz dobrych praktykach z obszaru Data Governance, Data Lineage i Data Quality
🔍 Dekoder Ogłoszenia
🟢
Chcesz rozwijać się w technologiach chmurowych i pracować na realnych danych?
Oznacza to, że będziesz pracować z danymi, które są faktycznie używane w biznesie, a nie tylko z danymi testowymi.
🟡
Pracuj z ekspertami
Będziesz miał okazję uczyć się od doświadczonych kolegów, ale nie ma gwarancji, że wszyscy w zespole są ekspertami w danej dziedzinie.
🟡
rozwijaj się w kierunku Data Engineeringu, Big Data lub Machine Learningu
Firma oferuje ścieżki rozwoju, ale niekoniecznie oznacza to dedykowane szkolenia lub czas na naukę, może być to po prostu możliwość pracy nad projektami z tych obszarów.
🟢
mieć realny wpływ na projekty
Twoja praca będzie miała znaczenie dla firmy, ale skala tego wpływu może być różna i zależy od konkretnych zadań.
🔴
Zapewnienie jakości danych, monitoringu pipeline’ów oraz szybkiego reagowania na incydenty
Oczekuje się od Ciebie proaktywnego podejścia do problemów i gotowości do pracy w sytuacjach awaryjnych, co może oznaczać dyżury lub pracę poza standardowymi godzinami.