NoFluffJobs Praca zdalna Senior New

Senior SRE / DevOps Engineer (Kubernetes / A2P Messaging)

Digital New Agency Poland

⚲ Łódź

25 200 - 31 920 PLN (B2B)

Wymagania

  • doświadczenie w środowiskach telekomunikacyjnych, operatorskich, messagingowych lub innych opartych na trwałych połączeniach sieciowych
  • znajomość protokołów SMPP, SIP, SS7 lub podobnych
  • doświadczenie produkcyjne w utrzymaniu Kubernetes w środowiskach self-managed, on-premise lub infrastrukturalnie złożonych (nie tylko managed cloud)
  • doświadczenie z stateful, długotrwałymi obciążeniami TCP na Kubernetes (connection draining, stabilny ingress/egress, L4 load balancing)
  • mocne podstawy Linux i sieci (routing, NAT, firewalle, MTU, TLS, diagnostyka pakietowa)
  • praktyczne doświadczenie w troubleshootingu z użyciem tcpdump i narzędzi diagnostyki sieci produkcyjnej
  • doświadczenie w projektowaniu monitoringu i alertingu (nie tylko utrzymanie cudzych dashboardów)
  • doświadczenie produkcyjne w on-call i reagowaniu na incydenty

Opis stanowiska

Budujesz i utrzymujesz infrastrukturę nowej platformy do masowego przetwarzania wiadomości (ok. 1 mln wiadomości dziennie, ~175 klientów, ~120 dostawców, ponad 300 długotrwałych połączeń). To nie jest typowe środowisko webowe — platforma opiera się na długotrwałych sesjach TCP, więc kluczowe będą stabilne endpointy sieciowe, Layer 4 load balancing, connection draining i przewidywalne zachowanie podczas wdrożeń i awarii. Praca obejmuje dwa ośrodki infrastrukturalne i pełny cykl: production readiness, migracja, hypercare, steady-state. Uwaga: opis sugeruje, że infrastruktura jest budowana od zera, a zakres odpowiedzialności jednej osoby jest bardzo szeroki (od sieci po obsługę incydentów) — realnie może to oznaczać pracę bez wsparcia i dokumentacji oraz dyżury i reagowanie na incydenty poza godzinami pracy.

🔍 Dekoder Ogłoszenia

🔴
This environment will suit you if you enjoy building infrastructure from the ground up
Sugeruje brak istniejącej infrastruktury lub jej dużą niedojrzałość — czeka Cię praca od zera, często bez wsparcia i dokumentacji.
🔴
solving hard reliability problems
System ma problemy z niezawodnością; możliwe częste incydenty i presja operacyjna.
🔴
staying close to the systems you operate in production
Oczekiwana gotowość do pracy operacyjnej, w tym dyżurów i reagowania na incydenty poza godzinami pracy.
🟡
This is not a typical stateless web environment
Podkreślenie złożoności technicznej — może oznaczać trudne w utrzymaniu, nietypowe rozwiązania i długi onboarding.
🔴
taking ownership from the Kubernetes cluster and networking layer through observability, deployment and incident response
Bardzo szeroki zakres odpowiedzialności jednej osoby — od sieci po obsługę incydentów; ryzyko przeciążenia.