JustJoin.IT Praca zdalna Senior

Senior Site Reliability Engineer (AI/ML Platform)

Link Group

⚲ Warszawa, Gdańsk, Kraków, Wrocław, Poznań, Lublin, Łódź, Białystok, Olsztyn, Szczecin

20 000 - 27 000 PLN brutto (UoP)

Wymagania

  • udokumentowane doświadczenie w zarządzaniu złożonymi, rozproszonymi systemami na dużą skalę
  • głęboka praktyczna znajomość Kubernetes w środowiskach kontenerowych pod dużym obciążeniem
  • gotowość do udziału w rotacji on-call
  • doświadczenie w observability (Prometheus, Grafana, distributed tracing)
  • doświadczenie w programowaniu w Pythonie lub Go oraz IaC (Terraform)

Opis stanowiska

Rola SRE przy globalnej, rozproszonej platformie obliczeniowej AI/ML przetwarzającej workloady na dużą skalę, z infrastrukturą opartą na GPU. Będziesz budować observability (Prometheus, Grafana, tracing), automatyzować w Pythonie/Go, prowadzić incident response w rotacji on-call oraz współtworzyć CI/CD i doradzać zespołom produktowym w kwestiach niezawodności. To oferta dla doświadczonego SRE/platformowca, który chce pracować z AI/ML na poziomie infrastruktury. Uwaga: ogłoszenie wprost mówi o byciu 'strażnikiem' krytycznej platformy i rotacji on-call — realnie oznacza to odpowiedzialność 24/7 i zakres szerszy niż typowe SRE.

🔍 Dekoder Ogłoszenia

🔴
This isn't your typical SRE role
Zakres obowiązków może wykraczać poza standardowe SRE — możliwy szerszy zakres odpowiedzialności niż sugeruje tytuł
🔴
guardian of a massive, distributed AI compute platform
Retoryczne określenie — w praktyce oznacza bycie na dyżurze/odpowiedzialność za krytyczne systemy 24/7
🟡
Build Bulletproof Observability
Wysokie oczekiwania co do niezawodności monitoringu — może oznaczać presję na zero błędów
🟡
incredible scale
Typowy marketingowy zwrot — nie daje konkretów co do rzeczywistej skali systemów