JustJoin.IT Hybrydowo Senior

Senior Site Reliability Engineer

EPAM Systems

⚲ Warsaw

Do uzgodnienia

Wymagania

  • 5+ lat doświadczenia w utrzymaniu produkcyjnych systemów chmurowych (skalowanie, definiowanie SLO, on-call, automatyzacja)
  • ekspertyza w operacjach Azure IaaS/PaaS oraz IaC (Terraform/Bicep)
  • znajomość observability z tracingiem LLM, orkiestracji kontenerów oraz automatyzacji w Python/Bash
  • znajomość podstaw FinOps dla workloadów AI
  • codzienne korzystanie z AI w pracy operacyjnej (triage incydentów, runbooki, analiza logów)

Opis stanowiska

Rola SRE przy produkcji systemów AI na Azure — odpowiedzialność za deployment end-to-end (IaC, CI/CD, zarządzanie środowiskami), budowę observability z tracingiem wywołań modeli LLM, definiowanie i egzekwowanie SLO oraz zarządzanie incydentami i kosztami (FinOps dla AI). Praca hybrydowa w Polsce z możliwością pracy zdalnej do 60 dni w roku za granicą. To oferta dla doświadczonego inżyniera, który lubi łączyć utrzymanie produkcji z tematyką AI. Uwaga: rola zakłada pełną odpowiedzialność za niezawodność systemów AI w produkcji oraz negocjowanie SLO, które mogą być sprzeczne z presją na szybkie dostarczanie funkcji — to może oznaczać dużą presję i szeroki zakres obowiązków.

🔍 Dekoder Ogłoszenia

🔴
own the reliability, observability, and operational health of production AI systems
Oczekuje się, że będziesz odpowiedzialny za wszystko związane z działaniem systemów AI w produkcji, co może oznaczać dużą presję i szeroki zakres obowiązków.
🔴
bridging the gap between deployment and long-term operability
Może oznaczać, że obecne procesy wdrażania i utrzymania są słabo zintegrowane i wymagają znaczącej pracy naprawczej.
🔴
embedding cost, security, and quality discipline into every solution's lifecycle
Może sugerować, że te aspekty nie są obecnie priorytetem lub są zaniedbywane, co wymaga ich aktywnego wprowadzania od podstaw.
🔴
Define and defend SLOs covering availability, latency, and quality objectives per solution, balancing delivery speed against stability with data-driven error budgets
Może oznaczać, że będziesz musiał negocjować i egzekwować standardy, które mogą być sprzeczne z presją na szybkie dostarczanie nowych funkcji.
🔴
Shape operability requirements before handover, ensuring they land in the pod's definition of done, and run hypercare jointly with sign-off on what will be operated
Może wskazywać na brak jasno zdefiniowanych procesów przekazywania odpowiedzialności za systemy, co wymaga Twojego aktywnego udziału w ich tworzeniu.