LLM Engineer
⚲ Kraków, Warszawa, Gdańsk, Wrocław, Poznań
23 520 - 31 920 PLN netto (B2B)
Wymagania
- doświadczenie we wdrażaniu i konfiguracji modeli LLM (Llama, Mistral, Qwen) z użyciem vLLM
- umiejętność optymalizacji inferencji: batching, kwantyzacja, zarządzanie pamięcią GPU i KV cache
- doświadczenie w przygotowaniu i utrzymaniu endpointów zgodnych z OpenAI API
- doświadczenie w testowaniu i ewaluacji modeli pod kątem latencji, przepustowości i kosztów
- udział w projektowaniu rozwiązań RAG (przetwarzanie dokumentów, embeddingi, bazy wektorowe, retrieval)
- współpraca z zespołami MLOps/DevOps przy wdrożeniach produkcyjnych
- gotowość do zaangażowania ok. 80–90 godzin miesięcznie
Opis stanowiska
Struct4 buduje własną platformę do serwowania modeli językowych opartą na vLLM i szuka inżyniera, który zajmie się wdrażaniem, optymalizacją i udostępnianiem LLM jako endpointów API. Będziesz pracować z modelami Llama, Mistral, Qwen, optymalizować inferencję (batching, kwantyzacja, pamięć GPU, KV cache) i współtworzyć rozwiązania RAG na tej platformie. Zaangażowanie to ok. 80–90 godzin miesięcznie, tylko jedno spotkanie synchroniczne w tygodniu — to oferta dla osoby, która chce pracować przy niskopoziomowej optymalizacji LLM na GPU w elastycznym, zdalnym trybie.
🔍 Dekoder Ogłoszenia
✓ Ogłoszenie wygląda transparentnie — brak typowych czerwonych flag.