Senior Site Reliability Engineer [M/F]
⚲ Remote
25 200 - 30 240 PLN (B2B)
Wymagania
- Azure
- AKS
- Apache Kafka
- Terraform
Opis stanowiska
O projekcie:
Poszukujemy doświadczonego Senior Site Reliability Engineer, który będzie współtworzyć platformę Monitoring & Observability dla środowiska Azure oraz odpowiadać za niezawodność, wydajność i obserwowalność systemów danych.
Będziesz projektować rozwiązania monitorujące całą platformę danych, wdrażać praktyki SRE oraz automatyzować procesy operacyjne, zapewniając wysoką dostępność usług i optymalne wykorzystanie zasobów chmurowych.
Wymagania:
- Minimum 6 lat doświadczenia na stanowisku Site Reliability Engineer, DevOps Engineer lub Platform Engineer.- Bardzo dobra znajomość Microsoft Azure.- Doświadczenie z Azure Kubernetes Service (AKS).- Znajomość Apache Kafka.- Doświadczenie z Grafana, Prometheus, Loki oraz Thanos.- Znajomość Terraform oraz Infrastructure as Code.- Doświadczenie z GitHub Actions lub Azure DevOps Pipelines.- Bardzo dobra znajomość Python oraz Shell Scripting.- Doświadczenie w projektowaniu i utrzymaniu procesów CI/CD.- Znajomość praktyk Site Reliability Engineering.- Znajomość języka angielskiego umożliwiająca swobodną komunikację
Codzienne zadania:
- projektowanie oraz rozwój platformy Monitoring & Observability;
- wdrażanie praktyk Site Reliability Engineering;
- budowa systemów monitoringu infrastruktury, aplikacji oraz pipeline'ów danych;
- implementacja monitoringu metryk, logów i trace'ów;
- konfiguracja alertów oraz automatycznych mechanizmów reagowania na incydenty;
- rozwój dashboardów operacyjnych i FinOps;
- automatyzacja infrastruktury z wykorzystaniem Terraform;
- rozwój pipeline'ów CI/CD;
- optymalizacja wydajności środowiska Azure;
- analiza przyczyn awarii oraz przygotowywanie działań zapobiegawczych;
- współpraca z zespołami Data Engineering, Platform Engineering oraz Software Development.
Poszukujemy doświadczonego Senior Site Reliability Engineer, który będzie współtworzyć platformę Monitoring & Observability dla środowiska Azure oraz odpowiadać za niezawodność, wydajność i obserwowalność systemów danych.
Będziesz projektować rozwiązania monitorujące całą platformę danych, wdrażać praktyki SRE oraz automatyzować procesy operacyjne, zapewniając wysoką dostępność usług i optymalne wykorzystanie zasobów chmurowych.
Wymagania:
- Minimum 6 lat doświadczenia na stanowisku Site Reliability Engineer, DevOps Engineer lub Platform Engineer.- Bardzo dobra znajomość Microsoft Azure.- Doświadczenie z Azure Kubernetes Service (AKS).- Znajomość Apache Kafka.- Doświadczenie z Grafana, Prometheus, Loki oraz Thanos.- Znajomość Terraform oraz Infrastructure as Code.- Doświadczenie z GitHub Actions lub Azure DevOps Pipelines.- Bardzo dobra znajomość Python oraz Shell Scripting.- Doświadczenie w projektowaniu i utrzymaniu procesów CI/CD.- Znajomość praktyk Site Reliability Engineering.- Znajomość języka angielskiego umożliwiająca swobodną komunikację
Codzienne zadania:
- projektowanie oraz rozwój platformy Monitoring & Observability;
- wdrażanie praktyk Site Reliability Engineering;
- budowa systemów monitoringu infrastruktury, aplikacji oraz pipeline'ów danych;
- implementacja monitoringu metryk, logów i trace'ów;
- konfiguracja alertów oraz automatycznych mechanizmów reagowania na incydenty;
- rozwój dashboardów operacyjnych i FinOps;
- automatyzacja infrastruktury z wykorzystaniem Terraform;
- rozwój pipeline'ów CI/CD;
- optymalizacja wydajności środowiska Azure;
- analiza przyczyn awarii oraz przygotowywanie działań zapobiegawczych;
- współpraca z zespołami Data Engineering, Platform Engineering oraz Software Development.
🔍 Dekoder Ogłoszenia
🔴
współtworzyć platformę Monitoring & Observability
Może oznaczać zarówno budowanie od podstaw, jak i pracę nad istniejącą, ale wymagającą ulepszeń platformą.
🔴
odpowiadać za niezawodność, wydajność i obserwowalność systemów danych
Może oznaczać szeroki zakres odpowiedzialności, od infrastruktury po same aplikacje i dane, wymagający wszechstronności.
🔴
wdrażać praktyki SRE
Może sugerować, że firma dopiero zaczyna wdrażać SRE, co może oznaczać budowanie procesów od zera lub pracę w środowisku, gdzie te praktyki nie są jeszcze w pełni ugruntowane.
🔴
automatyzować procesy operacyjne
Może oznaczać, że obecne procesy są w dużej mierze manualne i wymagają znaczącej pracy nad ich usprawnieniem.
🟡
rozwój dashboardów operacyjnych i FinOps
Oprócz tradycyjnego monitoringu, może wymagać zaangażowania w zarządzanie kosztami chmury i optymalizację wydatków.