Site Reliability Engineer, Senior
⚲ Warszawa
Do uzgodnienia
Wymagania
- doświadczenie w roli SRE
- gotowość do uczestnictwa w rotacji on-call jako tier eskalacji infrastruktury
- doświadczenie w definiowaniu i utrzymaniu SLO/SLI oraz error budget
- doświadczenie w zarządzaniu klastrami Kubernetes (AKS)
- doświadczenie z Terraform
- doświadczenie z observability (Prometheus, Grafana, Azure Monitor, Application Insights)
- doświadczenie z CI/CD i GitOps (GitHub Actions, ArgoCD)
Opis stanowiska
SRE w zespole Advanced Analytics — odpowiadasz za niezawodność i zdrowie operacyjne platformy obejmującej usługi AI, API Java i aplikacje frontendowe na Azure (AKS). Definiujesz SLO/SLI, prowadzisz incident response jako najwyższy tier eskalacji infrastruktury, budujesz observability (Prometheus, Grafana, Azure Monitor) i eliminujesz toil przez automatyzację. Uwaga: 'own the reliability and operational health of the platform' oznacza pełną odpowiedzialność za stabilność — w praktyce presję i możliwe dyżury poza standardowymi godzinami. Wymagane uczestnictwo w on-call.
🔍 Dekoder Ogłoszenia
🔴
meaningful difference
Może oznaczać, że praca będzie miała realny wpływ, ale równie dobrze może być pustym frazesem marketingowym.
🔴
cutting-edge and disruptive technologies
Może oznaczać pracę z nowymi technologiami, ale też potencjalnie z niestabilnymi lub słabo udokumentowanymi rozwiązaniami.
🔴
accelerating and realizing their vision and strategy
Może oznaczać wspieranie klientów w innowacjach, ale też realizację ich często nierealistycznych lub chaotycznych celów.
🔴
own the reliability and operational health of the platform
Oznacza pełną odpowiedzialność za stabilność i działanie platformy, co może wiązać się z dużą presją i koniecznością pracy poza standardowymi godzinami.
🔴
systematically eliminate operational toil through automation
Sugestia, że obecne procesy są uciążliwe i wymagają gruntownej przebudowy, co może być czasochłonne i frustrujące.