ML/AI Infrastructure Engineer
SQUARE ONE RESOURCES sp. z o.o.
⚲ Warszawa, Mokotów
180–190 zł netto (+ VAT) / godz.
Wymagania
- GPU
- Ansible
- Terraform
- Linux
- Kubernetes
- Slurm
- HPC
Opis stanowiska
Nasze wymagania:
Praktyczne doświadczenie w projektowaniu i administracji środowisk HPC.
Bardzo dobra znajomość systemu Linux.
Bardzo dobra znajomość Kubernetes.
Doświadczenie z systemem kolejkowania Slurm.
Znajomość technologii InfiniBand.
Doświadczenie z systemami plików Ceph i/lub Lustre.
Umiejętność optymalizacji wydajności infrastruktury oraz aplikacji HPC.
Umiejętność diagnozowania problemów w środowiskach o wysokiej dostępności.
Mile widziane:
Doświadczenie z platformami GPU dla AI.
Znajomość NVIDIA AI Enterprise.
Doświadczenie z GPUaaS lub Run.
Znajomość Ansible i Terraform.
Doświadczenie w automatyzacji oraz Infrastructure as Code.
Wiedza z zakresu monitoringu i wydajności środowisk produkcyjnych.
O projekcie:
Dołącz do projektu, którego celem jest budowa nowoczesnej infrastruktury AI/ML opartej na GPU. Będziesz mieć realny wpływ na projektowanie, wdrażanie i rozwój środowisk High Performance Computing (HPC), wykorzystywanych do trenowania modeli sztucznej inteligencji oraz realizacji zaawansowanych obliczeń.
Zakres obowiązków:
Projektowanie, wdrażanie i rozwój środowisk HPC.
Budowa oraz administracja klastrami GPU dla obciążeń AI/ML.
Zarządzanie i optymalizacja środowisk opartych o Linux i Kubernetes.
Konfiguracja oraz administracja schedulerem Slurm.
Wdrażanie i utrzymanie wydajnych systemów storage (Ceph i/lub Lustre).
Optymalizacja wydajności infrastruktury oraz profilowanie aplikacji HPC.
Monitoring, diagnozowanie i rozwiązywanie problemów w środowiskach produkcyjnych.
Automatyzacja wdrożeń z wykorzystaniem Ansible i Terraform.
Współpraca z zespołami odpowiedzialnymi za rozwiązania AI oraz infrastrukturę centrów danych.
Oferujemy:
Praca w pełni zdalnie
Zatrudnienie na B2B
Długoterminowa współpraca
Praktyczne doświadczenie w projektowaniu i administracji środowisk HPC.
Bardzo dobra znajomość systemu Linux.
Bardzo dobra znajomość Kubernetes.
Doświadczenie z systemem kolejkowania Slurm.
Znajomość technologii InfiniBand.
Doświadczenie z systemami plików Ceph i/lub Lustre.
Umiejętność optymalizacji wydajności infrastruktury oraz aplikacji HPC.
Umiejętność diagnozowania problemów w środowiskach o wysokiej dostępności.
Mile widziane:
Doświadczenie z platformami GPU dla AI.
Znajomość NVIDIA AI Enterprise.
Doświadczenie z GPUaaS lub Run.
Znajomość Ansible i Terraform.
Doświadczenie w automatyzacji oraz Infrastructure as Code.
Wiedza z zakresu monitoringu i wydajności środowisk produkcyjnych.
O projekcie:
Dołącz do projektu, którego celem jest budowa nowoczesnej infrastruktury AI/ML opartej na GPU. Będziesz mieć realny wpływ na projektowanie, wdrażanie i rozwój środowisk High Performance Computing (HPC), wykorzystywanych do trenowania modeli sztucznej inteligencji oraz realizacji zaawansowanych obliczeń.
Zakres obowiązków:
Projektowanie, wdrażanie i rozwój środowisk HPC.
Budowa oraz administracja klastrami GPU dla obciążeń AI/ML.
Zarządzanie i optymalizacja środowisk opartych o Linux i Kubernetes.
Konfiguracja oraz administracja schedulerem Slurm.
Wdrażanie i utrzymanie wydajnych systemów storage (Ceph i/lub Lustre).
Optymalizacja wydajności infrastruktury oraz profilowanie aplikacji HPC.
Monitoring, diagnozowanie i rozwiązywanie problemów w środowiskach produkcyjnych.
Automatyzacja wdrożeń z wykorzystaniem Ansible i Terraform.
Współpraca z zespołami odpowiedzialnymi za rozwiązania AI oraz infrastrukturę centrów danych.
Oferujemy:
Praca w pełni zdalnie
Zatrudnienie na B2B
Długoterminowa współpraca
🔍 Dekoder Ogłoszenia
🔴
Praktyczne doświadczenie w projektowaniu i administracji środowisk HPC.
Oczekują, że będziesz w stanie samodzielnie zaprojektować i utrzymać złożone systemy obliczeniowe wysokiej wydajności, a nie tylko wykonywać polecenia.
🔴
Umiejętność optymalizacji wydajności infrastruktury oraz aplikacji HPC.
Nie wystarczy, że coś będzie działać, musisz umieć sprawić, żeby działało jak najszybciej i najefektywniej, co może wymagać głębokiej analizy i eksperymentów.
🔴
Umiejętność diagnozowania problemów w środowiskach o wysokiej dostępności.
Oczekują, że będziesz w stanie szybko i skutecznie rozwiązywać skomplikowane problemy, które mogą wpływać na ciągłość działania systemu.
🟡
Doświadczenie z platformami GPU dla AI.
Może oznaczać zarówno pracę z gotowymi rozwiązaniami, jak i konieczność konfiguracji i optymalizacji sprzętu i oprogramowania pod kątem specyficznych potrzeb.
🔴
Doświadczenie w automatyzacji oraz Infrastructure as Code.
Oczekują, że będziesz tworzyć i utrzymywać kod definiujący infrastrukturę, co wymaga nie tylko znajomości narzędzi, ale też umiejętności projektowania skalowalnych i powtarzalnych rozwiązań.