Site Reliability Engineer – Data & AI
⚲ Warsaw
Do uzgodnienia
Wymagania
- budowa LLM-enabled agentów AI do wykrywania, klasyfikacji i diagnozy problemów w pipeline'ach danych
- pisanie produkcyjnej jakości kodu
- współpraca z zespołami engineering przy wbudowywaniu observability, reliability i resilience od fazy designu
- budowa proaktywnych systemów kontroli jakości danych (automatyczne sprawdzenia w trakcie przepływu)
- budowa narzędzi logging i monitoring ujawniających problemy przed wpływem na downstream
- prowadzenie post-mortemów, identyfikacja root cause i przekuwanie wniosków w lepsze systemy
Opis stanowiska
Site Reliability Engineer w P&G, który buduje agentów AI, automatyzacje i narzędzia utrzymujące enterprise'owe pipeline'y danych w skali. Tworzysz LLM-enabled agentów wykrywających, klasyfikujących i diagnozujących problemy w pipeline'ach, zastępując ręczne śledztwa automatycznym reasoningiem i self-healing workflowami. Budujesz też systemy proaktywnej kontroli jakości danych, logging i monitoring, które ujawniają problemy zanim dotkną downstream użytkowników, oraz prowadzisz post-mortemy i przekuwasz wnioski w lepsze systemy. To rola dla kogoś, kto pisze produkcyjny kod i chce budować systemy AI zamiast tylko utrzymywać infrastrukturę. Uwaga: sformułowanie 'not add it after things break' sugeruje, że obecnie występują problemy z niezawodnością — warto dopytać o stan systemów.
🔍 Dekoder Ogłoszenia
🟡
build things — AI agents, automations, and tools
Może oznaczać szeroki zakres obowiązków bez jasno określonych priorytetów.
🟡
self-healing workflows
Modny termin, który może być trudny do zrealizowania w praktyce.
🔴
not add it after things break
Sugeruje, że obecnie występują problemy z niezawodnością, co może oznaczać pracę w stresującym środowisku.