Senior Site Reliability Engineer
⚲ Warsaw
Do uzgodnienia
Wymagania
- min. 5 lat doświadczenia w operowaniu produkcyjnymi systemami w chmurze
- doświadczenie w skalowaniu, definiowaniu SLO i zarządzaniu on-call rotations
- doświadczenie w Azure IaaS/PaaS operations
- doświadczenie w IaC (Terraform/Bicep) i CI/CD
- doświadczenie w observability stacks z LLM tracing i container orchestration
- znajomość Python/Bash do automatyzacji
- znajomość podstaw FinOps dla workloads AI
- doświadczenie w codziennym użyciu AI w pracy operacyjnej (incident triage, runbooki, analiza logów)
Opis stanowiska
Senior SRE w EPAM — będziesz odpowiadać za niezawodność, observability i zdrowie operacyjne produkcyjnych systemów AI na Azure. W zakres wchodzi IaC, CI/CD, LLM-aware observability (tracing, drift detection, guardrails), definiowanie SLO, incident management, on-call, FinOps dla AI oraz bezpieczeństwo. Uwaga: opis wprost mówi o 'embedding cost, security, and quality discipline into every solution's lifecycle' — zakres odpowiedzialności jest bardzo szeroki, warto dopytać o realne obciążenie i podział zadań w zespole.
🔍 Dekoder Ogłoszenia
🟡
bridging the gap between deployment and long-term operability
Ogólnikowe sformułowanie — może oznaczać, że rola łączy wiele odpowiedzialności bez jasno określonych granic
🔴
embedding cost, security, and quality discipline into every solution's lifecycle
Szeroki zakres odpowiedzialności — ryzyko przeciążenia obowiązkami