Python Inference Engineer
⚲ Kraków, Warszawa, Gdańsk, Poznań, Łódź
16 500 zł / mies.
Wymagania
- min. 5 lat doświadczenia w pisaniu niezawodnego, dobrze przetestowanego kodu produkcyjnego
- praktyczne doświadczenie z PyTorch i wdrażaniem modeli ML
- doświadczenie z Linux, Docker i Kubernetes
- doświadczenie w co najmniej jednym obszarze: systemy rozproszone, GPU computing, runtime ML, optymalizacja modeli lub scheduling klastrów
Mile widziane
- doświadczenie z vLLM, SGLang, NVIDIA Dynamo, TensorRT-LLM lub podobnym frameworkiem inferencyjnym
- doświadczenie w uruchamianiu obciążeń GPU w produkcji
- znajomość technik inferencyjnych: kwantyzacja, continuous batching, speculative decoding, prefix caching, chunked prefill, LoRA serving
Opis stanowiska
Gcore rozwija platformę Inference — warstwę obsługującą wnioskowanie modeli językowych i multimodalnych. Będziesz integrować i utrzymywać frameworki inferencyjne (vLLM, SGLang, NVIDIA Dynamo, TensorRT-LLM), wprowadzać nowe modele do produkcji oraz optymalizować opóźnienia, przepustowość, zużycie pamięci i koszty. Nie musisz mieć doświadczenia z silnikami inferencyjnymi, ale musisz być zmotywowany, by się ich nauczyć — liczy się solidny Python, PyTorch i debugowanie przez warstwy kodu, GPU i Kubernetes.
🔍 Dekoder Ogłoszenia
🟡
The world’s digital experiences run on something invisible
Marketingowy wstęp, który nie wnosi żadnych konkretów o roli ani projekcie.
🟡
help design and deliver that foundation for an AI-driven world
Ogólnikowe hasło o 'AI-driven world' — brak informacji o realnym zakresie obowiązków.
🟡
your work here can reach users and businesses across the globe
Brzmi imponująco, ale nie mówi nic o codziennej pracy ani zespole.
🟡
Our vision is simple: to connect the world to AI, anywhere, anytime
Korporacyjna wizja zamiast konkretów o projekcie i stacku technologicznym.