Data Engineer ze znajomością przetwarzania danych niestrukturalnych
⚲ Warszawa
Do uzgodnienia
Wymagania
- Data Lake
- Python
- Kafka
Opis stanowiska
Wraz z rozwojem zespołu w banku PKO BP poszukujemy Data Engineera ze znajomością przetwarzania danych niestrukturalnych – audio, obrazy, dokumenty tekstowe
Forma współpracy: B2B
Tryb: hybrydowo (Warszawa, Chmielna 89)/ zdalnie - do ustalenia
Wymagania
• doświadczenie w budowaniu i projektowaniu rozwiązań Data Lake,
• doświadczenie w programowaniu w językach programowania typu: Python i/lub Rust,
• znajomość technologii wykorzystywanych w ramach architektury sterowanej zdarzeniami takie jak np. Kafka, Pub/Sub
• dobra znajomość baz danych GCP: GCP Big Query (projektowanie, budowa i tuning baz danych),
• znajomość Oracle, PostgreSQL (projektowanie, budowa i tuning baz danych),
• znajomość systemu operacyjnego Linux na poziomie zaawansowanego użytkownika
Mile widziana znajomość:
• aspektów związanych z budową rozwiązań BigData wykorzystujących możliwości GenAI (przetwarzania danych niestrukturyzowanych takie jak transkrypcje audio, konwersje dokumentów tekstowych, obrazów itp.)
• Automate Now,
• AirFlow
• Apache Spark - najlepiej GCP Data Proc
• Apache Beam – najlepiej GCP DataFlow
• Informatica Power Center
Forma współpracy: B2B
Tryb: hybrydowo (Warszawa, Chmielna 89)/ zdalnie - do ustalenia
Wymagania
• doświadczenie w budowaniu i projektowaniu rozwiązań Data Lake,
• doświadczenie w programowaniu w językach programowania typu: Python i/lub Rust,
• znajomość technologii wykorzystywanych w ramach architektury sterowanej zdarzeniami takie jak np. Kafka, Pub/Sub
• dobra znajomość baz danych GCP: GCP Big Query (projektowanie, budowa i tuning baz danych),
• znajomość Oracle, PostgreSQL (projektowanie, budowa i tuning baz danych),
• znajomość systemu operacyjnego Linux na poziomie zaawansowanego użytkownika
Mile widziana znajomość:
• aspektów związanych z budową rozwiązań BigData wykorzystujących możliwości GenAI (przetwarzania danych niestrukturyzowanych takie jak transkrypcje audio, konwersje dokumentów tekstowych, obrazów itp.)
• Automate Now,
• AirFlow
• Apache Spark - najlepiej GCP Data Proc
• Apache Beam – najlepiej GCP DataFlow
• Informatica Power Center
🔍 Dekoder Ogłoszenia
🔴
Data Engineer ze znajomością przetwarzania danych niestrukturalnych
Może oznaczać zarówno zaawansowane techniki przetwarzania audio/obrazów/tekstu, jak i podstawowe operacje na plikach.
🔴
hybrydowo (Warszawa, Chmielna 89)/ zdalnie - do ustalenia
Początkowo może być wymagana większa obecność w biurze, niż sugeruje opcja zdalna.
🔴
doświadczenie w budowaniu i projektowaniu rozwiązań Data Lake
Może dotyczyć zarówno projektowania od podstaw, jak i pracy z istniejącymi, być może niedoskonałymi, rozwiązaniami.
🟡
Python i/lub Rust
Jeśli nie jest jasno określone, może oznaczać, że znajomość jednego z nich jest wystarczająca, nawet jeśli drugi jest tylko opcjonalny.
🟡
aspektów związanych z budową rozwiązań BigData wykorzystujących możliwości GenAI
Może oznaczać zarówno pracę z najnowszymi modelami, jak i integrację z gotowymi narzędziami AI.