Data Engineer
⚲ Katowice, Warsaw, Kraków, Gdańsk, Wrocław, Poznań
25 200 - 28 560 PLN (B2B)
Wymagania
- Python
- Docker
- SQL
- Databricks
- PySpark
- CI/CD
- Spark
- GCP (nice to have)
- Airflow (nice to have)
- BigQuery (nice to have)
- API (nice to have)
- FastAPI (nice to have)
- Azure Databricks (nice to have)
- Azure (nice to have)
- Kubernetes (nice to have)
Opis stanowiska
O projekcie:
[zdalnie] Senior Data Engineer LLM & RAG
🚀 Rozwijamy nasz zespół AI Data Engineering w DS STREAM!
Poszukujemy Senior Data Engineera, który dołączy do naszego zespołu i będzie rozwijał nowoczesne rozwiązania chmurowe zasilające systemy Generative AI, duże modele językowe (LLM) oraz architektury RAG (Retrieval-Augmented Generation).
📍 Praca w 100% zdalna na terenie Polski (z możliwością korzystania z biura w Warszawie).
O projekcie
Dołączysz do projektu budującego zaawansowany ekosystem danych w środowisku multicloud (Azure oraz GCP), który stanowi fundament dla produkcyjnych wdrożeń LLM/RAG i wyszukiwania kontekstowego.
Środowisko wykorzystuje m.in. Azure Databricks, GCP Vertex AI (Vector Search), Unity Catalog, Spark Structured Streaming oraz Databricks, zapewniając wysoką wydajność, bezpieczeństwo i skuteczne zarządzanie danymi. Architektura rozwiązania oparta jest na modelu Medallion Architecture, połączonym z nowoczesnym przetwarzaniem danych niestrukturyzowanych (chunking, embeddingi) oraz orkiestracją LLM (LangChain / LlamaIndex).
Wymagania:
Czego oczekujemy?- Python & SQL: Bardzo dobra, zaawansowana znajomość Pythona oraz SQL w kontekście budowania skalowalnych potoków danych.- Databricks & Spark: Min. 3 lata praktycznego doświadczenia w pracy z platformą Databricks, PySpark, Delta Lake oraz znajomość Unity Catalog i Databricks Asset Bundles.- Orkiestracja: Doświadczenie w tworzeniu i produkcyjnym utrzymaniu DAG-ów w Apache Airflow.- Doświadczenie Chmurowe (Azure / GCP): Praktyczna znajomość komponentów danych w Azure (Data Factory, Databricks, Blob/ADLS, AI Search) i/lub GCP (BigQuery, Cloud Composer, Vertex AI, Cloud Storage).- Streaming & API: Doświadczenie w integracji danych z interfejsów API oraz przetwarzania danych w czasie rzeczywistym (Spark Structured Streaming).- LLM/RAG Znajomość architektur LLM/RAG, technik podziału dokumentów (chunking), pracy z embeddings oraz bazami wektorowymi.- Inżynieria Oprogramowania: Znajomość Git, Docker, CI/CD oraz narzędzi IaC (Terraform).Mile widziane- Certyfikaty: Databricks Certified Data Engineer Senior/Associate, Azure Data Engineer Associate (DP-203) lub Google Cloud Professional Data Engineer.
Codzienne zadania:
- Rozwój platformy danych: Rozwój oprogramowania do wydajnego przetwarzania dużych wolumenów danych, zasilających zarówno procesy analityczne, jak i modele AI.
- Databricks & Spark: Projektowanie oraz rozwój pipeline'ów danych w Databricks z wykorzystaniem PySpark i SQL.
- Streaming Data: Tworzenie i utrzymywanie pipeline'ów opartych na Spark Structured Streaming.
- Zarządzanie i Architektura: Projektowanie oraz zarządzanie obiektami w Unity Catalog zgodnie z założeniami Medallion Architecture (Bronze, Silver, Gold).
- Integracja systemów: Integracja i optymalne pobieranie danych z różnorodnych interfejsów API, w tym przygotowywanie danych pochodzących z systemów zewnętrznych pod kątem AI.
- Zasilanie systemów LLM/RAG: Tworzenie procesów ETL/ELT wspierających ekstrakcję, czyszczenie, podział tekstu (chunking) i embeddowanie danych do wektorowych baz danych w chmurze (Azure AI Search / GCP Vertex AI).
[zdalnie] Senior Data Engineer LLM & RAG
🚀 Rozwijamy nasz zespół AI Data Engineering w DS STREAM!
Poszukujemy Senior Data Engineera, który dołączy do naszego zespołu i będzie rozwijał nowoczesne rozwiązania chmurowe zasilające systemy Generative AI, duże modele językowe (LLM) oraz architektury RAG (Retrieval-Augmented Generation).
📍 Praca w 100% zdalna na terenie Polski (z możliwością korzystania z biura w Warszawie).
O projekcie
Dołączysz do projektu budującego zaawansowany ekosystem danych w środowisku multicloud (Azure oraz GCP), który stanowi fundament dla produkcyjnych wdrożeń LLM/RAG i wyszukiwania kontekstowego.
Środowisko wykorzystuje m.in. Azure Databricks, GCP Vertex AI (Vector Search), Unity Catalog, Spark Structured Streaming oraz Databricks, zapewniając wysoką wydajność, bezpieczeństwo i skuteczne zarządzanie danymi. Architektura rozwiązania oparta jest na modelu Medallion Architecture, połączonym z nowoczesnym przetwarzaniem danych niestrukturyzowanych (chunking, embeddingi) oraz orkiestracją LLM (LangChain / LlamaIndex).
Wymagania:
Czego oczekujemy?- Python & SQL: Bardzo dobra, zaawansowana znajomość Pythona oraz SQL w kontekście budowania skalowalnych potoków danych.- Databricks & Spark: Min. 3 lata praktycznego doświadczenia w pracy z platformą Databricks, PySpark, Delta Lake oraz znajomość Unity Catalog i Databricks Asset Bundles.- Orkiestracja: Doświadczenie w tworzeniu i produkcyjnym utrzymaniu DAG-ów w Apache Airflow.- Doświadczenie Chmurowe (Azure / GCP): Praktyczna znajomość komponentów danych w Azure (Data Factory, Databricks, Blob/ADLS, AI Search) i/lub GCP (BigQuery, Cloud Composer, Vertex AI, Cloud Storage).- Streaming & API: Doświadczenie w integracji danych z interfejsów API oraz przetwarzania danych w czasie rzeczywistym (Spark Structured Streaming).- LLM/RAG Znajomość architektur LLM/RAG, technik podziału dokumentów (chunking), pracy z embeddings oraz bazami wektorowymi.- Inżynieria Oprogramowania: Znajomość Git, Docker, CI/CD oraz narzędzi IaC (Terraform).Mile widziane- Certyfikaty: Databricks Certified Data Engineer Senior/Associate, Azure Data Engineer Associate (DP-203) lub Google Cloud Professional Data Engineer.
Codzienne zadania:
- Rozwój platformy danych: Rozwój oprogramowania do wydajnego przetwarzania dużych wolumenów danych, zasilających zarówno procesy analityczne, jak i modele AI.
- Databricks & Spark: Projektowanie oraz rozwój pipeline'ów danych w Databricks z wykorzystaniem PySpark i SQL.
- Streaming Data: Tworzenie i utrzymywanie pipeline'ów opartych na Spark Structured Streaming.
- Zarządzanie i Architektura: Projektowanie oraz zarządzanie obiektami w Unity Catalog zgodnie z założeniami Medallion Architecture (Bronze, Silver, Gold).
- Integracja systemów: Integracja i optymalne pobieranie danych z różnorodnych interfejsów API, w tym przygotowywanie danych pochodzących z systemów zewnętrznych pod kątem AI.
- Zasilanie systemów LLM/RAG: Tworzenie procesów ETL/ELT wspierających ekstrakcję, czyszczenie, podział tekstu (chunking) i embeddowanie danych do wektorowych baz danych w chmurze (Azure AI Search / GCP Vertex AI).
🔍 Dekoder Ogłoszenia
✓ Ogłoszenie wygląda transparentnie — brak typowych czerwonych flag.