Senior Site Reliability Engineer
⚲ Krakow
Do uzgodnienia
Wymagania
- doświadczenie w SRE / inżynierii niezawodności systemów produkcyjnych
- gotowość do pełnienia dyżurów on-call i roli Incident Command
- doświadczenie w monitoringu, observability i utrzymaniu playbooków reakcji na alerty
- praktyka w definiowaniu i raportowaniu SLO oraz error budgetów
- doświadczenie w prowadzeniu Chaos Engineering i analiz FMEA z zespołami inżynierskimi
- umiejętność triage'u incydentów zgłaszanych przez klientów i przekazywania ich do właściwych zespołów
- doświadczenie w tworzeniu dokumentacji komunikacyjnej dla klientów (wymagane silne umiejętności komunikacyjne)
Opis stanowiska
Praca w zespole SRE odpowiedzialnym za systemy obsługi zgłoszeń alarmowych (Emergency Call Management) w chmurze publicznej — czyli infrastrukturę, od której zależą służby ratunkowe. Będziesz zajmować się monitoringiem, strategią wysokiej dostępności, triage'em incydentów, utrzymaniem SLO i error budgetów, prowadzeniem ćwiczeń Chaos Engineering oraz pełnieniem roli Incident Command podczas dyżurów on-call. To oferta dla doświadczonego inżyniera, który lubi obserwowalność, automatyzację i reagowanie na incydenty w środowisku o krytycznym znaczeniu. Uwaga: wymagana dostępność na poziomie 99,999% oznacza realną presję i wysoką odpowiedzialność za każdą minutę przestoju.
🔍 Dekoder Ogłoszenia
🟢
relentless pursuit to help keep people safer everywhere
Firma ma silną misję społeczną, która może wpływać na kulturę pracy i priorytety.
🔴
99.999% or greater availability
Oczekiwana jest ekstremalnie wysoka dostępność systemów, co oznacza dużą presję i odpowiedzialność.
🟡
work directly with product and engineering teams
Będziesz musiał blisko współpracować z różnymi zespołami, co może wymagać dobrej komunikacji i umiejętności rozwiązywania konfliktów.
🟡
Implementation of Monitoring/Observability objectives
Obejmuje to nie tylko tworzenie, ale także utrzymanie i reagowanie na alerty, co może być czasochłonne.
🟡
maintenance of Alert response playbooks
Oznacza to, że będziesz musiał aktywnie reagować na incydenty i utrzymywać dokumentację procedur reagowania.