Bulldogjob Praca zdalna Senior

Senior Site Reliability Engineer

100031 Pelco Inc.

⚲ Krakow

Do uzgodnienia

Wymagania

  • doświadczenie w SRE / inżynierii niezawodności systemów produkcyjnych
  • gotowość do pełnienia dyżurów on-call i roli Incident Command
  • doświadczenie w monitoringu, observability i utrzymaniu playbooków reakcji na alerty
  • praktyka w definiowaniu i raportowaniu SLO oraz error budgetów
  • doświadczenie w prowadzeniu Chaos Engineering i analiz FMEA z zespołami inżynierskimi
  • umiejętność triage'u incydentów zgłaszanych przez klientów i przekazywania ich do właściwych zespołów
  • doświadczenie w tworzeniu dokumentacji komunikacyjnej dla klientów (wymagane silne umiejętności komunikacyjne)

Opis stanowiska

Praca w zespole SRE odpowiedzialnym za systemy obsługi zgłoszeń alarmowych (Emergency Call Management) w chmurze publicznej — czyli infrastrukturę, od której zależą służby ratunkowe. Będziesz zajmować się monitoringiem, strategią wysokiej dostępności, triage'em incydentów, utrzymaniem SLO i error budgetów, prowadzeniem ćwiczeń Chaos Engineering oraz pełnieniem roli Incident Command podczas dyżurów on-call. To oferta dla doświadczonego inżyniera, który lubi obserwowalność, automatyzację i reagowanie na incydenty w środowisku o krytycznym znaczeniu. Uwaga: wymagana dostępność na poziomie 99,999% oznacza realną presję i wysoką odpowiedzialność za każdą minutę przestoju.

🔍 Dekoder Ogłoszenia

🟢
relentless pursuit to help keep people safer everywhere
Firma ma silną misję społeczną, która może wpływać na kulturę pracy i priorytety.
🔴
99.999% or greater availability
Oczekiwana jest ekstremalnie wysoka dostępność systemów, co oznacza dużą presję i odpowiedzialność.
🟡
work directly with product and engineering teams
Będziesz musiał blisko współpracować z różnymi zespołami, co może wymagać dobrej komunikacji i umiejętności rozwiązywania konfliktów.
🟡
Implementation of Monitoring/Observability objectives
Obejmuje to nie tylko tworzenie, ale także utrzymanie i reagowanie na alerty, co może być czasochłonne.
🟡
maintenance of Alert response playbooks
Oznacza to, że będziesz musiał aktywnie reagować na incydenty i utrzymywać dokumentację procedur reagowania.