JustJoin.IT Praca zdalna Senior New

Senior Engineer - SRE & Infrastructure Services

EPAM Systems

⚲ Lodz

Do uzgodnienia

Wymagania

  • min. 7 lat doświadczenia zawodowego w software development, DevOps i/lub Site Reliability Engineering
  • min. 3 lata doświadczenia w budowie i utrzymaniu pipeline'ów CI/CD oraz automatyzacji SRE w środowiskach chmurowych na skalę
  • doświadczenie z platformami monitoringu i alertingu (PagerDuty, Prometheus, Grafana)
  • praktyczne doświadczenie we wdrażaniu i zarządzaniu infrastrukturą chmurową
  • doświadczenie z Amazon Web Services (EC2, Elasticsearch, Lambda, CloudFormation)
  • doświadczenie z co najmniej jednym dodatkowym dostawcą chmury (GCP, Azure lub OCI)
  • biegłość w jednym z języków: Python, Go, Java lub C
  • angielski na poziomie min. B1+

Opis stanowiska

Rola w EPAM Systems w organizacji SRE/DevOps, gdzie będziesz projektować i wdrażać zautomatyzowane rozwiązania do provisioningu, wdrożeń, zarządzania i monitoringu dla dużego, szybko zmieniającego się portfolio usług SaaS. Będziesz budować pipeline'y CI/CD z Kubernetes i Flux, wdrażać monitoring i alerting, współpracować z architektami i zespołami deweloperskimi nad standardami oraz uczestniczyć w reagowaniu na incydenty i analizach post-mortem. To oferta dla doświadczonego inżyniera SRE, który ma za sobą pracę z wieloma chmurami i chce wpływać na standardy inżynierskie. Uwaga: ogłoszenie sugeruje, że obecne standardy i środowisko operacyjne mogą wymagać uporządkowania, a część pracy będzie polegać na eksperymentowaniu z narzędziami AI w obszarze observability i SRE.

🔍 Dekoder Ogłoszenia

🔴
large-scale, rapidly evolving portfolio of SaaS services
Może oznaczać, że systemy są złożone i często się zmieniają, co wymaga ciągłego dostosowywania i potencjalnie pracy pod presją czasu.
🔴
contribute to engineering standards and best practices
Może oznaczać, że obecne standardy są niejasne lub nieistniejące, a Ty będziesz musiał je tworzyć od podstaw.
🔴
AI-enabled tooling across observability, pipeline efficiency, and SRE troubleshooting workflows
Może to oznaczać, że firma dopiero zaczyna eksplorować AI w tych obszarach, a Ty będziesz musiał eksperymentować i wdrażać nie w pełni sprawdzone rozwiązania.
🔴
Develop DevOps tooling that reduces manual toil, strengthens security posture, and minimizes human error
Sugestia, że obecne procesy są podatne na błędy i wymagają znaczącej automatyzacji, co może być czasochłonne.
🔴
sustainable operational environment
Może oznaczać, że obecne środowisko operacyjne jest przeciążone lub nieefektywne, a Ty będziesz musiał pracować nad jego stabilizacją.