Senior Solutions Architect – Large Scale AI Inference
From 24 300 PLN (UoP)
Wymagania
- doświadczenie w wielkoskalowej produkcyjnej inferencji AI
- praca z wielowęzłowymi klastrami GPU i rozproszonym obciążeniem (tysiące GPU)
- znajomość optymalizacji inferencji: kwantyzacja (INT4/FP8), speculative decoding, KV cache management
- architektura pipeline'ów dla modeli MoE (dense i sparse/latent)
- prowadzenie warsztatów i budowanie społeczności deweloperów w regionie EMEA
Opis stanowiska
NVIDIA szuka architekta z doświadczeniem w wielkoskalowej produkcyjnej inferencji AI. Będziesz wspierać klientów z EMEA (AI Native, dostawcy infrastruktury AI, przedsiębiorstwa) w deployu i optymalizacji obciążeń inferencyjnych na wielowęzłowych klastrach GPU, projektować pipeline'y dla modeli MoE rozłożonych na tysiące GPU oraz optymalizować wydajność przez kwantyzację, speculative decoding i zarządzanie KV cache. To rola dla kogoś z ekspertyzą na styku AI i HPC. Uwaga: oferta mówi o 'najtrudniejszych wyzwaniach inferencji AI w branży', co może wiązać się z presją i długimi godzinami.
🔍 Dekoder Ogłoszenia
🔴
the industry's toughest AI inference challenges
Praca nad bardzo wymagającymi problemami, potencjalnie wiążąca się z presją i długimi godzinami.
🟡
trusted technical leader
Oczekiwanie przywództwa technicznego i mentorska, nie tylko indywidualnej pracy.
🟢
establish the technical direction
Wpływ na strategię techniczną, ale też odpowiedzialność za kierunek rozwoju.