Senior Site Reliability Engineer
⚲ Kraków, Prądnik Biały
Do uzgodnienia
Wymagania
- solidne podstawy informatyki (wykształcenie kierunkowe lub równoważne doświadczenie w SRE/Production Engineering na dużą skalę)
- biegłość w Pythonie do budowy skalowalnych narzędzi operacyjnych i automatyzacji
- praktyczna znajomość nowoczesnych stacków observability: Prometheus, Grafana, OpenTelemetry, Loki
- znajomość zaawansowanych topologii sieciowych, routingu/przełączania o wysokiej przepustowości, BGP, sieci dual-stack IPv4/IPv6
- doświadczenie w projektowaniu rolloutów usług, kryteriów operational readiness i progów alertowania
- doświadczenie w tworzeniu runbooków, prowadzeniu incident response i blameless post-mortem
- gotowość do udziału w rotacji on-call 24x7x365
Opis stanowiska
Zespół AI Hardware SRE odpowiada za niezawodność i skalowanie dedykowanej infrastruktury sprzętowej pod AI w regionalnych centrach danych. Będziesz budować narzędzia w Pythonie automatyzujące provisioning floty, integrować workflow między systemami ticketowymi (JIRA, Siebel, PagerDuty), projektować pipeline'y telemetryczne i dashboardy Prometheus/Grafana oraz prowadzić incident management w trybie 24x7. To rola dla osoby, która łączy głęboką wiedzę o sieciach i systemach z umiejętnością kodowania i samodzielnego rozwiązywania niejednoznacznych problemów.
🔍 Dekoder Ogłoszenia
✓ Ogłoszenie wygląda transparentnie — brak typowych czerwonych flag.