Python Inference Engineer
⚲ Kraków, Warszawa, Gdańsk, Poznań, Łódź
16 500 zł / mies.
Wymagania
- 5+ lat doświadczenia w pisaniu niezawodnego, dobrze przetestowanego kodu produkcyjnego
- doświadczenie w projektowaniu systemów produkcyjnych w Pythonie
- praktyczne doświadczenie z PyTorch i wdrażaniem modeli ML
- doświadczenie z Linux, Docker i Kubernetes
- doświadczenie w co najmniej jednym obszarze: systemy rozproszone, GPU computing, runtime ML, optymalizacja modeli lub scheduling klastrów
Mile widziane
- doświadczenie z vLLM, SGLang, NVIDIA Dynamo, TensorRT-LLM lub podobnym frameworkiem inferencyjnym
- doświadczenie w uruchamianiu workloadów GPU w produkcji
- znajomość technik inferencyjnych: kwantyzacja, continuous batching, speculative decoding, prefix caching, chunked prefill, LoRA serving
Opis stanowiska
Rozwój warstwy inferencji platformy AI — integracja i operowanie frameworkami takimi jak vLLM, SGLang, NVIDIA Dynamo i TensorRT-LLM, wprowadzanie nowych modeli językowych i multimodalnych do produkcji oraz optymalizacja opóźnień, przepustowości i zużycia GPU. Praca wymaga debugowania problemów na styku kodu modelu, frameworków inferencyjnych, wykonania na GPU, sieci i Kubernetesa. Nie musisz mieć doświadczenia z silnikami inferencyjnymi, ale musisz chcieć się ich nauczyć i mieć solidne podstawy w Pythonie, PyTorchu i systemach produkcyjnych.
🔍 Dekoder Ogłoszenia
🟡
The world's digital experiences run on something invisible
Marketingowy wstęp — brak konkretów o roli
🟡
your work here can reach users and businesses across the globe
Ogólnikowy slogan o skali
🟡
Our vision is simple: to connect the world to AI, anywhere, anytime
Wizja korporacyjna bez przełożenia na konkretne zadania