Senior Site Reliability Engineer
⚲ Kraków
Do uzgodnienia
Wymagania
- doświadczenie w SRE / infrastructure / platform engineering przy dużych rozproszonych systemach
- ekspercka znajomość Kubernetes i systemów konteneryzacji w dużej skali
- doświadczenie w definiowaniu SLO oraz pracy z Prometheus, Grafana i distributed tracing
- biegłość w Python lub Go (automatyzacja, CI/CD, IaC np. Terraform)
- doświadczenie w on-call, incident management i blameless post-mortem
- umiejętność samodzielnego rozwiązywania problemów i współpracy z zespołami nietechnicznymi w SRE
Mile widziane
- zainteresowanie lub doświadczenie z AI/ML infrastructure, model serving lub GPU workloads
Opis stanowiska
Stanowisko Senior SRE w itMatch, gdzie będziesz odpowiadać za niezawodność platformy serverless inference Akamai — czyli infrastruktury GPU pod workloads AI/ML. W praktyce: budowa observability (SLO/SLI, alerty, dashboardy), automatyzacja deploymentów i incident response, on-call, post-mortemy, capacity planning i autoscaling. To oferta dla kogoś, kto ma już duże doświadczenie operacyjne z rozproszonymi systemami i Kubernetes w skali, a jednocześnie chce wejść w temat AI/ML infrastructure. Szczera uwaga: opis zapowiada 'ownership of critical reliability problems end-to-end' — realnie oznacza to pełną odpowiedzialność za trudne, często długotrwałe problemy bez jasnego końca, plus konieczność aktywnego działania, gdy cele niezawodności nie są osiągane.
🔍 Dekoder Ogłoszenia
🔴
Do you enjoy solving complex reliability challenges for cutting-edge technology?
Oczekuje się, że będziesz rozwiązywać trudne problemy z niezawodnością, które mogą być czasochłonne i frustrujące.
🔴
Opportunities exist to take ownership of critical reliability problems end-to-end
Możesz zostać obarczony pełną odpowiedzialnością za rozwiązywanie problemów, które mogą być bardzo wymagające i nie mieć jasnego końca.
🟡
contributing to architecture and operational decisions
Twoje opinie i decyzje mogą być brane pod uwagę, ale ostateczne decyzje mogą należeć do innych, bardziej doświadczonych osób.
🔴
driving improvements when targets are missed
Będziesz musiał aktywnie działać i szukać rozwiązań, gdy cele niezawodności nie zostaną osiągnięte.
🔴
reduce operational toil
Oczekuje się, że będziesz automatyzować powtarzalne i nudne zadania, co może wymagać znacznego nakładu pracy.