Senior Site Reliability Engineer (AI/ML Platform)
⚲ Warszawa, Gdańsk, Kraków, Wrocław, Poznań, Lublin, Łódź, Białystok, Olsztyn, Szczecin
20 000 - 27 000 PLN brutto (UoP)
Wymagania
- udokumentowane doświadczenie w zarządzaniu złożonymi, rozproszonymi systemami na dużą skalę
- głęboka praktyczna znajomość Kubernetes w środowiskach kontenerowych pod dużym obciążeniem
- gotowość do udziału w rotacji on-call
- doświadczenie w observability (Prometheus, Grafana, distributed tracing)
- doświadczenie w programowaniu w Pythonie lub Go oraz IaC (Terraform)
Opis stanowiska
Rola SRE przy globalnej, rozproszonej platformie obliczeniowej AI/ML przetwarzającej workloady na dużą skalę, z infrastrukturą opartą na GPU. Będziesz budować observability (Prometheus, Grafana, tracing), automatyzować w Pythonie/Go, prowadzić incident response w rotacji on-call oraz współtworzyć CI/CD i doradzać zespołom produktowym w kwestiach niezawodności. To oferta dla doświadczonego SRE/platformowca, który chce pracować z AI/ML na poziomie infrastruktury. Uwaga: ogłoszenie wprost mówi o byciu 'strażnikiem' krytycznej platformy i rotacji on-call — realnie oznacza to odpowiedzialność 24/7 i zakres szerszy niż typowe SRE.
🔍 Dekoder Ogłoszenia
🔴
This isn't your typical SRE role
Zakres obowiązków może wykraczać poza standardowe SRE — możliwy szerszy zakres odpowiedzialności niż sugeruje tytuł
🔴
guardian of a massive, distributed AI compute platform
Retoryczne określenie — w praktyce oznacza bycie na dyżurze/odpowiedzialność za krytyczne systemy 24/7
🟡
Build Bulletproof Observability
Wysokie oczekiwania co do niezawodności monitoringu — może oznaczać presję na zero błędów
🟡
incredible scale
Typowy marketingowy zwrot — nie daje konkretów co do rzeczywistej skali systemów