NoFluffJobs Praca zdalna Senior

Senior Site Reliability Engineer (AI/ML Platform)

Link Group

⚲ Remote

20 000 - 27 000 PLN (PERMANENT)

Wymagania

  • udokumentowane doświadczenie w zarządzaniu złożonymi, dużymi systemami rozproszonymi w roli SRE, Platform lub Infrastructure Engineer
  • głębokie, praktyczne doświadczenie z Kubernetes w środowiskach kontenerowych dużej skali
  • hands-on doświadczenie z Prometheus, Grafana i systemami distributed tracing
  • umiejętność pisania czystej, skalowalnej automatyzacji i IaC w Pythonie lub Go oraz narzędziami takimi jak Terraform
  • gotowość do udziału w blameless on-call rotation i prowadzenia incident management

Mile widziane

  • doświadczenie lub szczere zainteresowanie specyfiką infrastruktury AI/ML: model serving pipelines, inference engines, GPU-accelerated workloads

Opis stanowiska

Rola Senior SRE w Link Group przy globalnej platformie AI/ML — nie chodzi o utrzymanie systemów, lecz o bycie strażnikiem rozproszonej platformy AI compute przetwarzającej workloady na ogromną skalę. Będziesz budować observability, automatyzować w Pythonie lub Go, prowadzić incident response i definiować SLO/SLI. Uwaga: oferta mówi o 'guardian of a massive, distributed AI compute platform' — może to sugerować odpowiedzialność 24/7 za krytyczną infrastrukturę, potencjalne dyżury i on-call.

🔍 Dekoder Ogłoszenia

🟡
This isn't your typical SRE role
Niestandardowy zakres obowiązków — warto doprecyzować na rozmowie, czego dokładnie dotyczy
🔴
guardian of a massive, distributed AI compute platform
Może sugerować odpowiedzialność 24/7 za krytyczną infrastrukturę — potencjalne dyżury i on-call
🟡
processes workloads at an incredible scale
Marketingowy opis skali bez konkretnych liczb — trudno ocenić realne obciążenie