Senior Site Reliability Engineer (AI Hardware & Infrastructure)
⚲ Remote
20 000 - 27 000 PLN (PERMANENT)
Wymagania
- głębokie doświadczenie w Site Reliability lub Production Engineering na dużą skalę, mission-critical
- wybitne umiejętności programowania w Pythonie — budowa skalowalnych narzędzi operacyjnych i frameworków automatyzacji od podstaw
- ekspercka wiedza sieciowa: zaawansowane topologie, high-bandwidth routing i switching, BGP, dual-stack IPv4/IPv6
- hands-on, ekspercki poziom z Prometheus, Grafana, OpenTelemetry i Loki
- doświadczenie w projektowaniu strategii rolloutów, definiowaniu progów alertowania, tworzeniu runbooków i prowadzeniu incident response war rooms
- doświadczenie we współpracy z zewnętrznymi dostawcami data center i koordynacji z technikami na miejscu
Opis stanowiska
Rola Senior SRE w zespole odpowiedzialnym za globalną infrastrukturę AI compute — bare-metal serwery, gęste szafy GPU i zaawansowaną sieć. Będziesz pisać automatyzację w Pythonie do zarządzania cyklem życia floty serwerów, integrować systemy operacyjne przez API (JIRA, Siebel, PagerDuty) i budować observability dla sprzętu bare-metal. Uwaga: oferta oczekuje osoby równie biegłej w Pythonie, co w projektowaniu BGP — tak szeroki zakres kompetencji w jednej osobie sugeruje mały zespół i brak wsparcia specjalistów.
🔍 Dekoder Ogłoszenia
🟡
elite Site Reliability Engineer
Wysokie oczekiwania rekrutacyjne — mogą wymagać ponadprzeciętnych kompetencji już od pierwszego dnia
🔴
as comfortable writing Python automation... as they are designing BGP routing
Bardzo szeroki zakres kompetencji w jednej osobie — możliwe, że zespół jest mały i brak wsparcia specjalistów
🟡
hands-on engineer
Może sugerować brak dedykowanego zespołu wsparcia — samodzielne rozwiązywanie wszystkich problemów