Senior Engineer - SRE & Infrastructure Services
⚲ Lodz
Do uzgodnienia
Wymagania
- min. 7 lat doświadczenia zawodowego w software development, DevOps i/lub Site Reliability Engineering
- min. 3 lata doświadczenia w budowie i utrzymaniu pipeline'ów CI/CD oraz automatyzacji SRE w środowiskach chmurowych na skalę
- doświadczenie z platformami monitoringu i alertingu (PagerDuty, Prometheus, Grafana)
- praktyczne doświadczenie we wdrażaniu i zarządzaniu infrastrukturą chmurową
- doświadczenie z Amazon Web Services (EC2, Elasticsearch, Lambda, CloudFormation)
- doświadczenie z co najmniej jednym dodatkowym dostawcą chmury (GCP, Azure lub OCI)
- biegłość w jednym z języków: Python, Go, Java lub C
- angielski na poziomie min. B1+
Opis stanowiska
Rola w EPAM Systems w organizacji SRE/DevOps, gdzie będziesz projektować i wdrażać zautomatyzowane rozwiązania do provisioningu, wdrożeń, zarządzania i monitoringu dla dużego, szybko zmieniającego się portfolio usług SaaS. Będziesz budować pipeline'y CI/CD z Kubernetes i Flux, wdrażać monitoring i alerting, współpracować z architektami i zespołami deweloperskimi nad standardami oraz uczestniczyć w reagowaniu na incydenty i analizach post-mortem. To oferta dla doświadczonego inżyniera SRE, który ma za sobą pracę z wieloma chmurami i chce wpływać na standardy inżynierskie. Uwaga: ogłoszenie sugeruje, że obecne standardy i środowisko operacyjne mogą wymagać uporządkowania, a część pracy będzie polegać na eksperymentowaniu z narzędziami AI w obszarze observability i SRE.
🔍 Dekoder Ogłoszenia
🔴
large-scale, rapidly evolving portfolio of SaaS services
Może oznaczać, że systemy są złożone i często się zmieniają, co wymaga ciągłego dostosowywania i potencjalnie pracy pod presją czasu.
🔴
contribute to engineering standards and best practices
Może oznaczać, że obecne standardy są niejasne lub nieistniejące, a Ty będziesz musiał je tworzyć od podstaw.
🔴
AI-enabled tooling across observability, pipeline efficiency, and SRE troubleshooting workflows
Może to oznaczać, że firma dopiero zaczyna eksplorować AI w tych obszarach, a Ty będziesz musiał eksperymentować i wdrażać nie w pełni sprawdzone rozwiązania.
🔴
Develop DevOps tooling that reduces manual toil, strengthens security posture, and minimizes human error
Sugestia, że obecne procesy są podatne na błędy i wymagają znaczącej automatyzacji, co może być czasochłonne.
🔴
sustainable operational environment
Może oznaczać, że obecne środowisko operacyjne jest przeciążone lub nieefektywne, a Ty będziesz musiał pracować nad jego stabilizacją.