JustJoin.IT Praca zdalna Senior

Lead HPC Kubernetes Engineer

EPAM Systems

⚲ Gdansk

Do uzgodnienia

Wymagania

  • min. 5 lat doświadczenia w inżynierii infrastruktury, platformach chmurowych lub HPC
  • ekspercka znajomość Kubernetes z praktyką operowania klastrami na dużą skalę (node pool sizing, debugowanie schedulera, troubleshooting CNI, rolling upgrades)
  • biegłość w Terraform — codzienne pisanie i przegląd infrastruktury jako kod
  • praktyczna znajomość AWS (EC2, S3, EFS, FSx for Lustre)
  • znajomość Pythona do narzędzi i automatyzacji
  • angielski na poziomie min. B2

Mile widziane

  • znajomość Google Kubernetes Engine
  • znajomość Amazon Elastic Kubernetes Service

Opis stanowiska

EPAM szuka inżyniera, który obejmie odpowiedzialność za platformy Kubernetes obsługujące klastry HPC z kilkoma tysiącami GPU na AWS, CoreWeave, GCP i OCI, z planem skalowania do 10x w 2026 roku. W praktyce oznacza to codzienną operację klastrami (EKS, CKS, GKE), zarządzanie cyklem życia nodów, siecią, harmonogramowaniem zadań GPU oraz reagowanie na incydenty o wysokiej wadze — błąd w konfiguracji lub nieudany upgrade przekłada się bezpośrednio na tysiące straconych GPU-godzin. To oferta dla doświadczonego inżyniera infrastruktury, który lubi pracę operacyjną na dużą skalę i jest gotowy na współpracę z zespołami Networking, Storage, Security i AI/ML. Szczera uwaga: sam opis sugeruje, że nietypowe awarie będą codziennością, a ambicja szybkiego skalowania może oznaczać wysoką presję i rosnące obciążenie zespołu — warto dopytać o model dyżurów i realne tempo zatrudnienia.

🔍 Dekoder Ogłoszenia

🔴
novel failure modes are routine
Sygnał, że rola wiąże się z ciągłym gaszeniem nieprzewidzianych pożarów i pracą w warunkach wysokiej niepewności operacyjnej — może oznaczać częste dyżury i pracę poza standardowymi godzinami.
🔴
scaling to 10x in 2026 and beyond
Ambicja szybkiego skalowania sugeruje wysoki tempa pracy, presję na wyniki i prawdopodobnie rosnące obciążenie zespołu bez proporcjonalnego wzrostu zatrudnienia.
🟡
misconfigurations or failed upgrades translate directly into thousands of lost GPU-hours
Podkreślenie wysokiej stawki błędów — może oznaczać kulturę dużej odpowiedzialności i stresu, ale też realny wpływ pracy na biznes.
🟢
Kubernetes-heavy
Jasno określony profil technologiczny — konkretna, transparentna informacja o oczekiwaniach.
🟢
Take ownership of cluster lifecycle, node pool management, networking policy, and stability maintenance
Konkretny zakres obowiązków bez marketingowego lania wody — dobrze zdefiniowana rola.