JustJoin.IT Praca zdalna Senior New

Python Inference Engineer

Gcore

⚲ Kraków, Warszawa, Gdańsk, Poznań, Łódź

16 500 zł / mies.

Wymagania

  • 5+ lat doświadczenia w pisaniu niezawodnego, dobrze przetestowanego kodu produkcyjnego
  • doświadczenie w projektowaniu systemów produkcyjnych w Pythonie
  • praktyczne doświadczenie z PyTorch i wdrażaniem modeli ML
  • doświadczenie z Linux, Docker i Kubernetes
  • doświadczenie w co najmniej jednym obszarze: systemy rozproszone, GPU computing, runtime ML, optymalizacja modeli lub scheduling klastrów

Mile widziane

  • doświadczenie z vLLM, SGLang, NVIDIA Dynamo, TensorRT-LLM lub podobnym frameworkiem inferencyjnym
  • doświadczenie w uruchamianiu workloadów GPU w produkcji
  • znajomość technik inferencyjnych: kwantyzacja, continuous batching, speculative decoding, prefix caching, chunked prefill, LoRA serving

Opis stanowiska

Rozwój warstwy inferencji platformy AI — integracja i operowanie frameworkami takimi jak vLLM, SGLang, NVIDIA Dynamo i TensorRT-LLM, wprowadzanie nowych modeli językowych i multimodalnych do produkcji oraz optymalizacja opóźnień, przepustowości i zużycia GPU. Praca wymaga debugowania problemów na styku kodu modelu, frameworków inferencyjnych, wykonania na GPU, sieci i Kubernetesa. Nie musisz mieć doświadczenia z silnikami inferencyjnymi, ale musisz chcieć się ich nauczyć i mieć solidne podstawy w Pythonie, PyTorchu i systemach produkcyjnych.

🔍 Dekoder Ogłoszenia

🟡
The world's digital experiences run on something invisible
Marketingowy wstęp — brak konkretów o roli
🟡
your work here can reach users and businesses across the globe
Ogólnikowy slogan o skali
🟡
Our vision is simple: to connect the world to AI, anywhere, anytime
Wizja korporacyjna bez przełożenia na konkretne zadania