JustJoin.IT Hybrydowo Senior

Senior Site Reliability Engineer

Allegro

⚲ Warszawa, Kraków

Do uzgodnienia

Wymagania

  • głębokie zrozumienie systemów rozproszonych i architektury mikroserwisów
  • biegłość w co najmniej jednym z języków: Kotlin, Java, Python lub Go (do automatyzacji infrastruktury, narzędzi i backendu)
  • zaawansowane, praktyczne doświadczenie z Kubernetes i Docker oraz sieciami i service mesh
  • praktyczne doświadczenie z chaos engineering (fault injection, scenariusze awarii)
  • doświadczenie w konfiguracji stacków monitoringu i observability (Prometheus, Grafana, ELK)
  • doświadczenie w roli Incident Commandera podczas poważnych awarii
  • praktyczna znajomość budowy i utrzymania pipeline'ów CI/CD oraz zarządzania infrastrukturą z użyciem IaC
  • doświadczenie w mentoringu mniej doświadczonych inżynierów i kształtowaniu standardów jakości kodu

Opis stanowiska

Allegro szuka inżyniera, który obejmie odpowiedzialność za niezawodność systemów w skali ogromnej architektury rozproszonej — w praktyce oznacza to zarówno codzienne utrzymanie i automatyzację infrastruktury, jak i prowadzenie eksperymentów z awariami (chaos engineering, kwartalne failover całego data center). Część roli to budowa platform self-service do testów wydajnościowych oraz — co warto podkreślić — tworzenie agenta AI do obsługi incydentów, co sugeruje, że ten obszar jest na wczesnym etapie i możesz go współtworzyć od podstaw. To oferta dla doświadczonego inżyniera, który lubi łączyć głęboką pracę techniczną z mentoringiem i realnym wpływem na decyzje architektoniczne. Uwaga na sformułowania typu 'leading' i 'influencing' — w praktyce zakres wpływu na decyzje może być węższy, niż sugeruje opis, a odpowiedzialność za niezawodność może wiązać się z presją przy ograniczonych zasobach.

🔍 Dekoder Ogłoszenia

🔴
Leading and coordinating team-level projects to improve system reliability across our massive distributed architecture.
Może oznaczać faktyczne przywództwo i koordynację, ale równie dobrze może być to tylko formalne określenie na wykonywanie zadań przydzielonych przez przełożonego.
🔴
Driving the design and implementation of complex reliability solutions and internal platforms, heavily utilizing our core ecosystem.
Może oznaczać realny wpływ na architekturę i wybór technologii, ale równie dobrze może ograniczać się do implementacji rozwiązań w ramach narzuconego ekosystemu.
🔴
Designing and building an AI agent to revolutionize our incident response workflow, alongside acting as a senior Incident Commander during major outages and leading blameless post-mortems.
Choć brzmi ekscytująco, może oznaczać, że zespół jest w początkowej fazie rozwoju tych obszarów, a kandydat będzie musiał zbudować je od podstaw bez dużego wsparcia.
🔴
Owning the reliability of the team's systems, managing technical debt, and automating infrastructure.
Określenie 'owning' może oznaczać pełną odpowiedzialność, ale także brak zasobów lub wsparcia do efektywnego rozwiązywania problemów.
🔴
Influencing how the team communicates and makes decisions on difficult system architecture problems at the Allegro scale.
Może oznaczać realny wpływ na procesy decyzyjne, ale równie dobrze może być to tylko aspiracja, a faktyczne decyzje będą podejmowane na wyższych szczeblach.