Senior Site Reliability Engineer
⚲ Warsaw
Do uzgodnienia
Wymagania
- min. 5 lat doświadczenia w eksploatacji produkcyjnych systemów chmurowych, w tym skalowanie, definiowanie SLO, zarządzanie dyżurami on-call i automatyzacja pracy manualnej
- biegłość w operacjach Azure IaaS/PaaS, IaC (Terraform/Bicep) i narzędziach CI/CD
- biegłość w stackach observability z tracingiem LLM, orkiestracji kontenerów oraz automatyzacji w Python/Bash
- znajomość podstaw FinOps dla obciążeń AI
- znajomość codziennego użycia AI w pracy operacyjnej (triage incydentów, tworzenie runbooków, analiza logów, kod automatyzacji)
Opis stanowiska
Rola w EPAM Systems dla Senior SRE odpowiedzialnego za niezawodność, observability i zdrowie operacyjne produkcyjnych systemów AI. Będziesz zarządzać wdrożeniami end-to-end (IaC, CI/CD, środowiska na Azure), budować observability świadome LLM (traces, ewaluacje, drift, guardrails, koszty, latencja), definiować i egzekwować SLO, prowadzić incident management oraz zarządzać kosztami tokenów. To oferta dla doświadczonego SRE, który chce pracować na styku AI i operacji, z realnym wpływem na standardy operacyjne. Uwaga: rola obejmuje szeroki zakres odpowiedzialności i wymaga negocjowania SLO z zespołami deweloperskimi oraz wczesnego angażowania się w procesy wytwórcze, co może prowadzić do napięć między szybkością dostarczania a stabilnością.
🔍 Dekoder Ogłoszenia
🔴
own the reliability, observability, and operational health of production AI systems
Oczekuje się, że będziesz w pełni odpowiedzialny za wszystkie aspekty działania systemów AI, co może oznaczać szeroki zakres obowiązków i potencjalne przeciążenie.
🔴
bridging the gap between deployment and long-term operability
Może oznaczać, że obecne procesy wdrożeniowe nie są wystarczająco dojrzałe i będziesz musiał je naprawiać.
🔴
embedding cost, security, and quality discipline into every solution's lifecycle
Wymaga to nie tylko technicznych umiejętności, ale także umiejętności wpływania na procesy i kulturę organizacji, co może być trudne.
🔴
Define and defend SLOs covering availability, latency, and quality objectives per solution, balancing delivery speed against stability with data-driven error budgets
Będziesz musiał negocjować i egzekwować standardy, co może prowadzić do konfliktów z zespołami deweloperskimi dążącymi do szybszego dostarczania funkcji.
🔴
Shape operability requirements before handover, ensuring they land in the pod's definition of done, and run hypercare jointly with sign-off on what will be operated
Oznacza to konieczność wczesnego angażowania się w procesy deweloperskie i przejmowania odpowiedzialności za systemy, które nie zostały jeszcze w pełni przetestowane pod kątem operacyjnym.