Software Golang Engineer (Slurm)
⚲ Kraków, Warszawa, Gdańsk, Wrocław, Poznań
16 500 zł / mies.
Wymagania
- praktyczne doświadczenie z Slurm w produkcji z perspektywy użytkownika (sbatch, srun, squeue, sinfo, debugowanie zadań)
- doświadczenie w budowaniu produkcyjnych operatorów Kubernetes, kontrolerów, CRD i pętli rekonsyliacji w Go
- doświadczenie w utrzymaniu zachowania klasycznego klastra Slurm przy infrastrukturze na Kubernetes
- doświadczenie w diagnozowaniu problemów wydajności i niezawodności GPU, schedulerów, sieci HPC i pamięci rozproszonej
Mile widziane
- doświadczenie w obsłudze klastrów HPC/GPU na dużą skalę dla klientów zewnętrznych
- doświadczenie z PyTorch distributed training i frameworkami AI/ML na dużą skalę
- znajomość InfiniBand, RoCE, RDMA, GPUDirect, Lustre, WEKA, Ceph lub podobnej infrastruktury HPC
- wkład w projekty open-source Slurm, Kubernetes, Soperator lub inne cloud-native/HPC
Opis stanowiska
Gcore buduje zarządzaną usługę Slurm działającą na Kubernetes, przeznaczoną do obsługi obciążeń GPU i treningu rozproszonego. Będziesz projektować operatory i pętle rekonsyliacji w Go, rozwijać harmonogramowanie zadań oraz observability i automatyczne naprawianie awarii GPU, węzłów i sieci. To oferta dla kogoś, kto łączy doświadczenie z HPC/Slurm z nowoczesnym podejściem cloud-native i chce traktować Slurm jak produkt dla klientów, a nie wewnętrznego demona.
🔍 Dekoder Ogłoszenia
🟡
The world’s digital experiences run on something invisible
Marketingowy wstęp, który nie wnosi żadnych konkretów o roli ani projekcie.
🟡
help design and deliver that foundation for an AI-driven world
Ogólnikowe hasło o 'AI-driven world' — brak informacji o realnym zakresie obowiązków.
🟡
your work here can reach users and businesses across the globe
Brzmi imponująco, ale nie mówi nic o codziennej pracy ani zespole.
🟡
Our vision is simple: to connect the world to AI, anywhere, anytime
Korporacyjna wizja zamiast konkretów o projekcie i stacku technologicznym.