Principal ML Ops Engineer
30 000 – 40 000 zł / mies.
Wymagania
- doświadczenie w budowie i operowaniu produkcyjnej infrastruktury do serwowania modeli (vLLM, TGI, Triton lub podobne)
- doświadczenie w projektowaniu pipeline'ów wdrożeniowych ze strategiami blue/green i canary
- doświadczenie w budowie systemów auto-skalowania, architektur multi-model serving i warstw routingu requestów
- doświadczenie w optymalizacji wykorzystania GPU, pamięci, przepustowości sieci i storage'u artefaktów modeli
- doświadczenie w projektowaniu systemów observability dla inferencji (latencja, throughput, użycie GPU, koszty)
- doświadczenie w zarządzaniu model registry i pipeline'ami CI/CD dla reprodukowalnych wdrożeń modeli
- gotowość do pełnej odpowiedzialności za cykl życia systemów ML, w tym on-call
- znajomość Pythona, Terraform, Kubeflow
Opis stanowiska
Rola Principal ML Ops Engineer w Pragmatike, rekrutacja na rzecz szybko skalującego się startupu budującego rozproszoną infrastrukturę chmurową dla workloadów AI/ML (GPU-powered infrastructure). Będziesz projektować i operować infrastrukturą do serwowania modeli ML na skalę — z użyciem vLLM, TGI, Triton — wdrażać strategie blue/green i canary, budować systemy auto-skalowania i inteligentnego routingu requestów oraz optymalizować wykorzystanie GPU, pamięci i przepustowości sieci. To wysoce techniczna, hands-on rola z pełną odpowiedzialnością za cykl życia systemów ML, w tym on-call. Dla osoby z doświadczeniem w rozproszonych systemach GPU, gotowej na tempo i zmienność startupu.
🔍 Dekoder Ogłoszenia
🔴
fast-scaling, well-funded distributed cloud infrastructure startup
Startup — może oznaczać szybko zmieniające się priorytety, brak stabilnych procesów i dużą presję na tempo
🟡
highly technical, hands-on role
Prawdopodobnie brak zespołu wsparcia — samodzielne wykonywanie zadań, które w większej firmie robiłyby 2-3 osoby
🟡
redefining how compute is delivered
Marketingowy frazes bez konkretów — nie mówi nic o faktycznej pracy ani technologii