Senior Site Reliability Engineer (AI Hardware & Infrastructure)
⚲ Warszawa, Gdańsk, Kraków, Wrocław, Poznań, Lublin, Łódź, Białystok, Olsztyn, Szczecin
20 000 - 27 000 PLN brutto (UoP)
Wymagania
- doświadczenie w Site Reliability lub Production Engineering przy dużej, misyjnie krytycznej infrastrukturze
- wyjątkowe umiejętności programowania w Pythonie — budowa skalowalnych narzędzi operacyjnych i frameworków automatyzacji
- ekspercka znajomość sieci: zaawansowane topologie, routing i switching o wysokiej przepustowości, BGP, dual-stack IPv4/IPv6
- hands-on, eksperckie doświadczenie z Prometheus, Grafana, OpenTelemetry i Loki
- gotowość do udziału w rotacji on-call 24/7 i prowadzenia response przy awariach wysokiej wagi
- doświadczenie w prowadzeniu blameless post-mortemów skutkujących konkretnymi zmianami architektonicznymi
- wykorzystywanie narzędzi AI/LLM do wsparcia własnej pracy technicznej
Opis stanowiska
Rola w zespole odpowiedzialnym za globalną infrastrukturę AI compute — bare-metal serwery, gęste szafy GPU i sieć je łączącą. Będziesz pisać automatyzację w Pythonie do zarządzania cyklem życia floty serwerów, integrować systemy operacyjne (JIRA, Siebel, PagerDuty) przez API, budować stack observability dla bare-metal i wdrażać AI-driven anomaly detection. To oferta dla seniora SRE, który łączy programowanie, sieć (BGP, IPv4/IPv6) i gotowość do on-call 24/7. Wymagana biegłość w Prometheus, Grafana, OpenTelemetry i Loki.
🔍 Dekoder Ogłoszenia
🟡
elite Site Reliability Engineer
Mocno podkreślane oczekiwanie wysokiego poziomu — mogą wymagać ponadprzeciętnych kompetencji bez adekwatnej gratyfikacji
🟡
Become a Master of Fleet Automation
Retoryczne wzmocnienie — w praktyce oznacza dużą odpowiedzialność za automatyzację całej infrastruktury