JustJoin.IT Hybrydowo Senior

Site Reliability Engineer, Senior

Webellian Sp.z o o

⚲ Warszawa

Do uzgodnienia

Wymagania

  • doświadczenie w roli SRE
  • gotowość do uczestnictwa w rotacji on-call jako tier eskalacji infrastruktury
  • doświadczenie w definiowaniu i utrzymaniu SLO/SLI oraz error budget
  • doświadczenie w zarządzaniu klastrami Kubernetes (AKS)
  • doświadczenie z Terraform
  • doświadczenie z observability (Prometheus, Grafana, Azure Monitor, Application Insights)
  • doświadczenie z CI/CD i GitOps (GitHub Actions, ArgoCD)

Opis stanowiska

SRE w zespole Advanced Analytics — odpowiadasz za niezawodność i zdrowie operacyjne platformy obejmującej usługi AI, API Java i aplikacje frontendowe na Azure (AKS). Definiujesz SLO/SLI, prowadzisz incident response jako najwyższy tier eskalacji infrastruktury, budujesz observability (Prometheus, Grafana, Azure Monitor) i eliminujesz toil przez automatyzację. Uwaga: 'own the reliability and operational health of the platform' oznacza pełną odpowiedzialność za stabilność — w praktyce presję i możliwe dyżury poza standardowymi godzinami. Wymagane uczestnictwo w on-call.

🔍 Dekoder Ogłoszenia

🔴
meaningful difference
Może oznaczać, że praca będzie miała realny wpływ, ale równie dobrze może być pustym frazesem marketingowym.
🔴
cutting-edge and disruptive technologies
Może oznaczać pracę z nowymi technologiami, ale też potencjalnie z niestabilnymi lub słabo udokumentowanymi rozwiązaniami.
🔴
accelerating and realizing their vision and strategy
Może oznaczać wspieranie klientów w innowacjach, ale też realizację ich często nierealistycznych lub chaotycznych celów.
🔴
own the reliability and operational health of the platform
Oznacza pełną odpowiedzialność za stabilność i działanie platformy, co może wiązać się z dużą presją i koniecznością pracy poza standardowymi godzinami.
🔴
systematically eliminate operational toil through automation
Sugestia, że obecne procesy są uciążliwe i wymagają gruntownej przebudowy, co może być czasochłonne i frustrujące.