DevOps Engineer (AI Inference)
G-CORE INNOVATIONS SOCIETE A RESPONSABILITE LIMITEE
⚲ Kraków
Do uzgodnienia
Wymagania
- silne rozumienie architektury Kubernetes (CNI, CSI, operatory, ingress/gateway, control plane)
- praktyczne doświadczenie w obsłudze i troubleshootingu produkcyjnych klastrów Kubernetes
- silne umiejętności troubleshootingu Linuxa i sieci (DNS, routing, firewalling, TLS, MTU)
- umiejętność tworzenia automatyzacji i narzędzi operacyjnych w Pythonie, Go lub Bashu
- doświadczenie z Terraform, Ansible lub podobnymi narzędziami IaC
- doświadczenie z VictoriaMetrics/Grafana lub podobnymi narzędziami monitoringu i alertingu
Mile widziane
- doświadczenie z Cluster API lub podobnymi technologiami zarządzania cyklem życia klastrów
- znajomość Argo CD, GitOps, Helm lub Helmfile
Opis stanowiska
Projektowanie, wdrażanie i utrzymanie infrastruktury dla workloadów AI inference on-premises w Gcore — w tym scheduling GPU, pipeline'y wdrażania modeli i observability platformy. Będziesz współpracować z inżynierami ML i zespołami platformowymi przy architekturze systemów i testach wydajności na skalę. Uwaga: praca z produkcyjnymi klastrami Kubernetes oznacza dyżury i reagowanie na awarie poza standardowymi godzinami.
🔍 Dekoder Ogłoszenia
🔴
Hands-on experience operating and troubleshooting production Kubernetes clusters
'Operating and troubleshooting' klastrów produkcyjnych często oznacza dyżury i reagowanie na awarie poza standardowymi godzinami pracy