Senior Site Reliability Engineer (AI/ML Platform)
⚲ Remote
20 000 - 27 000 PLN (PERMANENT)
Wymagania
- udokumentowane doświadczenie w zarządzaniu złożonymi, dużymi systemami rozproszonymi w roli SRE, Platform lub Infrastructure Engineer
- głębokie, praktyczne doświadczenie z Kubernetes w środowiskach kontenerowych dużej skali
- hands-on doświadczenie z Prometheus, Grafana i systemami distributed tracing
- umiejętność pisania czystej, skalowalnej automatyzacji i IaC w Pythonie lub Go oraz narzędziami takimi jak Terraform
- gotowość do udziału w blameless on-call rotation i prowadzenia incident management
Mile widziane
- doświadczenie lub szczere zainteresowanie specyfiką infrastruktury AI/ML: model serving pipelines, inference engines, GPU-accelerated workloads
Opis stanowiska
Rola Senior SRE w Link Group przy globalnej platformie AI/ML — nie chodzi o utrzymanie systemów, lecz o bycie strażnikiem rozproszonej platformy AI compute przetwarzającej workloady na ogromną skalę. Będziesz budować observability, automatyzować w Pythonie lub Go, prowadzić incident response i definiować SLO/SLI. Uwaga: oferta mówi o 'guardian of a massive, distributed AI compute platform' — może to sugerować odpowiedzialność 24/7 za krytyczną infrastrukturę, potencjalne dyżury i on-call.
🔍 Dekoder Ogłoszenia
🟡
This isn't your typical SRE role
Niestandardowy zakres obowiązków — warto doprecyzować na rozmowie, czego dokładnie dotyczy
🔴
guardian of a massive, distributed AI compute platform
Może sugerować odpowiedzialność 24/7 za krytyczną infrastrukturę — potencjalne dyżury i on-call
🟡
processes workloads at an incredible scale
Marketingowy opis skali bez konkretnych liczb — trudno ocenić realne obciążenie