JustJoin.IT Praca zdalna Senior New

Senior Site Reliability Engineer

itMatch

⚲ Kraków

Do uzgodnienia

Wymagania

  • doświadczenie w SRE / infrastructure / platform engineering przy dużych rozproszonych systemach
  • ekspercka znajomość Kubernetes i systemów konteneryzacji w dużej skali
  • doświadczenie w definiowaniu SLO oraz pracy z Prometheus, Grafana i distributed tracing
  • biegłość w Python lub Go (automatyzacja, CI/CD, IaC np. Terraform)
  • doświadczenie w on-call, incident management i blameless post-mortem
  • umiejętność samodzielnego rozwiązywania problemów i współpracy z zespołami nietechnicznymi w SRE

Mile widziane

  • zainteresowanie lub doświadczenie z AI/ML infrastructure, model serving lub GPU workloads

Opis stanowiska

Stanowisko Senior SRE w itMatch, gdzie będziesz odpowiadać za niezawodność platformy serverless inference Akamai — czyli infrastruktury GPU pod workloads AI/ML. W praktyce: budowa observability (SLO/SLI, alerty, dashboardy), automatyzacja deploymentów i incident response, on-call, post-mortemy, capacity planning i autoscaling. To oferta dla kogoś, kto ma już duże doświadczenie operacyjne z rozproszonymi systemami i Kubernetes w skali, a jednocześnie chce wejść w temat AI/ML infrastructure. Szczera uwaga: opis zapowiada 'ownership of critical reliability problems end-to-end' — realnie oznacza to pełną odpowiedzialność za trudne, często długotrwałe problemy bez jasnego końca, plus konieczność aktywnego działania, gdy cele niezawodności nie są osiągane.

🔍 Dekoder Ogłoszenia

🔴
Do you enjoy solving complex reliability challenges for cutting-edge technology?
Oczekuje się, że będziesz rozwiązywać trudne problemy z niezawodnością, które mogą być czasochłonne i frustrujące.
🔴
Opportunities exist to take ownership of critical reliability problems end-to-end
Możesz zostać obarczony pełną odpowiedzialnością za rozwiązywanie problemów, które mogą być bardzo wymagające i nie mieć jasnego końca.
🟡
contributing to architecture and operational decisions
Twoje opinie i decyzje mogą być brane pod uwagę, ale ostateczne decyzje mogą należeć do innych, bardziej doświadczonych osób.
🔴
driving improvements when targets are missed
Będziesz musiał aktywnie działać i szukać rozwiązań, gdy cele niezawodności nie zostaną osiągnięte.
🔴
reduce operational toil
Oczekuje się, że będziesz automatyzować powtarzalne i nudne zadania, co może wymagać znacznego nakładu pracy.