Pracuj.pl Praca zdalna Senior

Senior Site Reliability Engineer

Akamai Technologies

⚲ Kraków, Prądnik Biały

Do uzgodnienia

Wymagania

  • solidne podstawy informatyki (wykształcenie kierunkowe lub równoważne doświadczenie w SRE/Production Engineering na dużą skalę)
  • biegłość w Pythonie do budowy skalowalnych narzędzi operacyjnych i automatyzacji
  • praktyczna znajomość nowoczesnych stacków observability: Prometheus, Grafana, OpenTelemetry, Loki
  • znajomość zaawansowanych topologii sieciowych, routingu/przełączania o wysokiej przepustowości, BGP, sieci dual-stack IPv4/IPv6
  • doświadczenie w projektowaniu rolloutów usług, kryteriów operational readiness i progów alertowania
  • doświadczenie w tworzeniu runbooków, prowadzeniu incident response i blameless post-mortem
  • gotowość do udziału w rotacji on-call 24x7x365

Opis stanowiska

Zespół AI Hardware SRE odpowiada za niezawodność i skalowanie dedykowanej infrastruktury sprzętowej pod AI w regionalnych centrach danych. Będziesz budować narzędzia w Pythonie automatyzujące provisioning floty, integrować workflow między systemami ticketowymi (JIRA, Siebel, PagerDuty), projektować pipeline'y telemetryczne i dashboardy Prometheus/Grafana oraz prowadzić incident management w trybie 24x7. To rola dla osoby, która łączy głęboką wiedzę o sieciach i systemach z umiejętnością kodowania i samodzielnego rozwiązywania niejednoznacznych problemów.

🔍 Dekoder Ogłoszenia

✓ Ogłoszenie wygląda transparentnie — brak typowych czerwonych flag.