Lead HPC Kubernetes Engineer
⚲ Gdansk
Do uzgodnienia
Wymagania
- min. 5 lat doświadczenia w inżynierii infrastruktury, platformach chmurowych lub HPC
- ekspercka znajomość Kubernetes z praktyką operowania klastrami na dużą skalę (node pool sizing, debugowanie schedulera, troubleshooting CNI, rolling upgrades)
- biegłość w Terraform — codzienne pisanie i przegląd infrastruktury jako kod
- praktyczna znajomość AWS (EC2, S3, EFS, FSx for Lustre)
- znajomość Pythona do narzędzi i automatyzacji
- angielski na poziomie min. B2
Mile widziane
- znajomość Google Kubernetes Engine
- znajomość Amazon Elastic Kubernetes Service
Opis stanowiska
EPAM szuka inżyniera, który obejmie odpowiedzialność za platformy Kubernetes obsługujące klastry HPC z kilkoma tysiącami GPU na AWS, CoreWeave, GCP i OCI, z planem skalowania do 10x w 2026 roku. W praktyce oznacza to codzienną operację klastrami (EKS, CKS, GKE), zarządzanie cyklem życia nodów, siecią, harmonogramowaniem zadań GPU oraz reagowanie na incydenty o wysokiej wadze — błąd w konfiguracji lub nieudany upgrade przekłada się bezpośrednio na tysiące straconych GPU-godzin. To oferta dla doświadczonego inżyniera infrastruktury, który lubi pracę operacyjną na dużą skalę i jest gotowy na współpracę z zespołami Networking, Storage, Security i AI/ML. Szczera uwaga: sam opis sugeruje, że nietypowe awarie będą codziennością, a ambicja szybkiego skalowania może oznaczać wysoką presję i rosnące obciążenie zespołu — warto dopytać o model dyżurów i realne tempo zatrudnienia.
🔍 Dekoder Ogłoszenia
🔴
novel failure modes are routine
Sygnał, że rola wiąże się z ciągłym gaszeniem nieprzewidzianych pożarów i pracą w warunkach wysokiej niepewności operacyjnej — może oznaczać częste dyżury i pracę poza standardowymi godzinami.
🔴
scaling to 10x in 2026 and beyond
Ambicja szybkiego skalowania sugeruje wysoki tempa pracy, presję na wyniki i prawdopodobnie rosnące obciążenie zespołu bez proporcjonalnego wzrostu zatrudnienia.
🟡
misconfigurations or failed upgrades translate directly into thousands of lost GPU-hours
Podkreślenie wysokiej stawki błędów — może oznaczać kulturę dużej odpowiedzialności i stresu, ale też realny wpływ pracy na biznes.
🟢
Kubernetes-heavy
Jasno określony profil technologiczny — konkretna, transparentna informacja o oczekiwaniach.
🟢
Take ownership of cluster lifecycle, node pool management, networking policy, and stability maintenance
Konkretny zakres obowiązków bez marketingowego lania wody — dobrze zdefiniowana rola.