JustJoin.IT Praca zdalna Senior

Python Inference Engineer

Gcore

⚲ Kraków, Warszawa, Gdańsk, Poznań, Łódź

16 500 zł / mies.

Wymagania

  • min. 5 lat doświadczenia w pisaniu niezawodnego, dobrze przetestowanego kodu produkcyjnego
  • praktyczne doświadczenie z PyTorch i wdrażaniem modeli ML
  • doświadczenie z Linux, Docker i Kubernetes
  • doświadczenie w co najmniej jednym obszarze: systemy rozproszone, GPU computing, runtime ML, optymalizacja modeli lub scheduling klastrów

Mile widziane

  • doświadczenie z vLLM, SGLang, NVIDIA Dynamo, TensorRT-LLM lub podobnym frameworkiem inferencyjnym
  • doświadczenie w uruchamianiu obciążeń GPU w produkcji
  • znajomość technik inferencyjnych: kwantyzacja, continuous batching, speculative decoding, prefix caching, chunked prefill, LoRA serving

Opis stanowiska

Gcore rozwija platformę Inference — warstwę obsługującą wnioskowanie modeli językowych i multimodalnych. Będziesz integrować i utrzymywać frameworki inferencyjne (vLLM, SGLang, NVIDIA Dynamo, TensorRT-LLM), wprowadzać nowe modele do produkcji oraz optymalizować opóźnienia, przepustowość, zużycie pamięci i koszty. Nie musisz mieć doświadczenia z silnikami inferencyjnymi, ale musisz być zmotywowany, by się ich nauczyć — liczy się solidny Python, PyTorch i debugowanie przez warstwy kodu, GPU i Kubernetes.

🔍 Dekoder Ogłoszenia

🟡
The world’s digital experiences run on something invisible
Marketingowy wstęp, który nie wnosi żadnych konkretów o roli ani projekcie.
🟡
help design and deliver that foundation for an AI-driven world
Ogólnikowe hasło o 'AI-driven world' — brak informacji o realnym zakresie obowiązków.
🟡
your work here can reach users and businesses across the globe
Brzmi imponująco, ale nie mówi nic o codziennej pracy ani zespole.
🟡
Our vision is simple: to connect the world to AI, anywhere, anytime
Korporacyjna wizja zamiast konkretów o projekcie i stacku technologicznym.