Data Engineer
20 000 – 32 000 zł / mies.
Wymagania
- doświadczenie w budowie pipeline'ów danych z nieustrukturyzowanych źródeł (transkrypcje, maile, Slack, dokumenty)
- doświadczenie w entity resolution i deduplikacji danych
- doświadczenie w parsowaniu dokumentów (PDF, skany, arkusze, prezentacje)
- doświadczenie w budowie pipeline'ów chunkingu i embeddingów oraz ładowaniu danych do vector i graph store
- doświadczenie w implementacji przyrostowej synchronizacji przez warstwę connectorów (MCP / Composio-class)
- doświadczenie w obsłudze PII (detekcja, redakcja, retencja)
- znajomość Airflow / Step Functions i budowy monitorowanych, powtarzalnych pipeline'ów
- znajomość Pythona, SQL oraz AWS/GCP
Opis stanowiska
Rola Data Engineer (part-time, 20h/tydzień) w Neurons Lab przy projekcie dla europejskiej grupy inwestycyjnej — budowa warstwy danych pod agentów AI. To rola świadomie 'unstructured-first': surowcem są transkrypcje rozmów, wątki mailowe, Slack, protokoły zarządu i wieloletnie archiwa, a twarde problemy to entity resolution, deduplikacja, przyrostowa synchronizacja, obsługa PII i kontrola kosztów przy dużej skali. Obciążenie jest front-weighted — pierwsze 4-5 sprintów (Capture i Connect) może wymagać więcej niż 0,5 FTE. Dla inżyniera, który lubi sprzątać bałagan od zera i budować pipeline'y od podstaw, a nie modelować gotowy hurtowni.
🔍 Dekoder Ogłoszenia
🟡
flagship engagement
Brzmi prestiżowo, ale może oznaczać projekt o wysokiej widoczności i presji — błędy są bardziej widoczne, a oczekiwania wyższe
🔴
deliberately an unstructured-first data-engineering role
Ładne określenie na to, że dane są w chaosie — brak czystego modelu, trzeba improwizować i sprzątać bałagan od zera