Senior Site Reliability Engineer
⚲ Warsaw
Do uzgodnienia
Wymagania
- 5+ lat doświadczenia w utrzymaniu produkcyjnych systemów chmurowych (skalowanie, definiowanie SLO, on-call, automatyzacja)
- ekspertyza w operacjach Azure IaaS/PaaS oraz IaC (Terraform/Bicep)
- znajomość observability z tracingiem LLM, orkiestracji kontenerów oraz automatyzacji w Python/Bash
- znajomość podstaw FinOps dla workloadów AI
- codzienne korzystanie z AI w pracy operacyjnej (triage incydentów, runbooki, analiza logów)
Opis stanowiska
Rola SRE przy produkcji systemów AI na Azure — odpowiedzialność za deployment end-to-end (IaC, CI/CD, zarządzanie środowiskami), budowę observability z tracingiem wywołań modeli LLM, definiowanie i egzekwowanie SLO oraz zarządzanie incydentami i kosztami (FinOps dla AI). Praca hybrydowa w Polsce z możliwością pracy zdalnej do 60 dni w roku za granicą. To oferta dla doświadczonego inżyniera, który lubi łączyć utrzymanie produkcji z tematyką AI. Uwaga: rola zakłada pełną odpowiedzialność za niezawodność systemów AI w produkcji oraz negocjowanie SLO, które mogą być sprzeczne z presją na szybkie dostarczanie funkcji — to może oznaczać dużą presję i szeroki zakres obowiązków.
🔍 Dekoder Ogłoszenia
🔴
own the reliability, observability, and operational health of production AI systems
Oczekuje się, że będziesz odpowiedzialny za wszystko związane z działaniem systemów AI w produkcji, co może oznaczać dużą presję i szeroki zakres obowiązków.
🔴
bridging the gap between deployment and long-term operability
Może oznaczać, że obecne procesy wdrażania i utrzymania są słabo zintegrowane i wymagają znaczącej pracy naprawczej.
🔴
embedding cost, security, and quality discipline into every solution's lifecycle
Może sugerować, że te aspekty nie są obecnie priorytetem lub są zaniedbywane, co wymaga ich aktywnego wprowadzania od podstaw.
🔴
Define and defend SLOs covering availability, latency, and quality objectives per solution, balancing delivery speed against stability with data-driven error budgets
Może oznaczać, że będziesz musiał negocjować i egzekwować standardy, które mogą być sprzeczne z presją na szybkie dostarczanie nowych funkcji.
🔴
Shape operability requirements before handover, ensuring they land in the pod's definition of done, and run hypercare jointly with sign-off on what will be operated
Może wskazywać na brak jasno zdefiniowanych procesów przekazywania odpowiedzialności za systemy, co wymaga Twojego aktywnego udziału w ich tworzeniu.