NoFluffJobs Praca zdalna Mid

ML/AI Infrastructure Engineer

Square One Resources

⚲ Poznan

30 240 - 31 920 PLN (B2B)

Wymagania

  • GPU
  • AI
  • Ansible
  • Terraform
  • HPC

Opis stanowiska

O projekcie:
Dołącz do projektu, którego celem jest budowa nowoczesnej infrastruktury AI/ML opartej na GPU. Będziesz mieć realny wpływ na projektowanie, wdrażanie i rozwój środowisk High Performance Computing (HPC), wykorzystywanych do trenowania modeli sztucznej inteligencji oraz realizacji zaawansowanych obliczeń.

Wymagania:
Nasze wymagania
- Praktyczne doświadczenie w projektowaniu i administracji środowisk HPC.- Bardzo dobra znajomość systemu Linux.- Bardzo dobra znajomość Kubernetes.- Doświadczenie z systemem kolejkowania Slurm.- Znajomość technologii InfiniBand.- Doświadczenie z systemami plików Ceph i/lub Lustre.- Umiejętność optymalizacji wydajności infrastruktury oraz aplikacji HPC.- Umiejętność diagnozowania problemów w środowiskach o wysokiej dostępności.
Mile widziane
- Doświadczenie z platformami GPU dla AI.- Znajomość NVIDIA AI Enterprise.- Doświadczenie z GPUaaS lub Run.- Znajomość Ansible i Terraform.- Doświadczenie w automatyzacji oraz Infrastructure as Code.

Codzienne zadania:
- Projektowanie, wdrażanie i rozwój środowisk HPC.
- Budowa oraz administracja klastrami GPU dla obciążeń AI/ML.
- Zarządzanie i optymalizacja środowisk opartych o Linux i Kubernetes.
- Konfiguracja oraz administracja schedulerem Slurm.
- Wdrażanie i utrzymanie wydajnych systemów storage (Ceph i/lub Lustre).
- Optymalizacja wydajności infrastruktury oraz profilowanie aplikacji HPC.
- Monitoring, diagnozowanie i rozwiązywanie problemów w środowiskach produkcyjnych.
- Automatyzacja wdrożeń z wykorzystaniem Ansible i Terraform.
- Współpraca z zespołami odpowiedzialnymi za rozwiązania AI oraz infrastrukturę centrów danych.

🔍 Dekoder Ogłoszenia

🔴
Będziesz mieć realny wpływ na projektowanie, wdrażanie i rozwój środowisk High Performance Computing (HPC), wykorzystywanych do trenowania modeli sztucznej inteligencji oraz realizacji zaawansowanych obliczeń.
Oznacza to, że będziesz miał dużą swobodę w kształtowaniu architektury i technologii, ale też ponosisz pełną odpowiedzialność za jej sukces.
🔴
Praktyczne doświadczenie w projektowaniu i administracji środowisk HPC.
Oczekują od Ciebie nie tylko teoretycznej wiedzy, ale przede wszystkim udokumentowanych projektów, w których faktycznie budowałeś i zarządzałeś takimi systemami.
🔴
Bardzo dobra znajomość systemu Linux.
Oczekują od Ciebie poziomu eksperckiego, który pozwoli na samodzielne rozwiązywanie nawet bardzo złożonych problemów systemowych.
🔴
Bardzo dobra znajomość Kubernetes.
Podobnie jak w przypadku Linuksa, oczekują głębokiej wiedzy i umiejętności praktycznych w zarządzaniu i optymalizacji klastrów Kubernetes.
🔴
Umiejętność optymalizacji wydajności infrastruktury oraz aplikacji HPC.
Nie wystarczy, że coś będzie działać; musisz umieć sprawić, by działało jak najszybciej i najefektywniej, co może wymagać głębokiego analizowania kodu i konfiguracji.