JustJoin.IT Praca zdalna Senior New

LLM Engineer

Struct4

⚲ Kraków, Warszawa, Gdańsk, Wrocław, Poznań

23 520 - 31 920 PLN netto (B2B)

Wymagania

  • doświadczenie we wdrażaniu i konfiguracji modeli LLM (Llama, Mistral, Qwen) z użyciem vLLM
  • umiejętność optymalizacji inferencji: batching, kwantyzacja, zarządzanie pamięcią GPU i KV cache
  • doświadczenie w przygotowaniu i utrzymaniu endpointów zgodnych z OpenAI API
  • doświadczenie w testowaniu i ewaluacji modeli pod kątem latencji, przepustowości i kosztów
  • udział w projektowaniu rozwiązań RAG (przetwarzanie dokumentów, embeddingi, bazy wektorowe, retrieval)
  • współpraca z zespołami MLOps/DevOps przy wdrożeniach produkcyjnych
  • gotowość do zaangażowania ok. 80–90 godzin miesięcznie

Opis stanowiska

Struct4 buduje własną platformę do serwowania modeli językowych opartą na vLLM i szuka inżyniera, który zajmie się wdrażaniem, optymalizacją i udostępnianiem LLM jako endpointów API. Będziesz pracować z modelami Llama, Mistral, Qwen, optymalizować inferencję (batching, kwantyzacja, pamięć GPU, KV cache) i współtworzyć rozwiązania RAG na tej platformie. Zaangażowanie to ok. 80–90 godzin miesięcznie, tylko jedno spotkanie synchroniczne w tygodniu — to oferta dla osoby, która chce pracować przy niskopoziomowej optymalizacji LLM na GPU w elastycznym, zdalnym trybie.

🔍 Dekoder Ogłoszenia

✓ Ogłoszenie wygląda transparentnie — brak typowych czerwonych flag.