Principal ML Ops Engineer
Do uzgodnienia
Wymagania
- doświadczenie w produkcyjnym serwowaniu modeli (vLLM, TGI, Triton lub podobne)
- doświadczenie z rozproszonymi systemami GPU
- doświadczenie w projektowaniu pipeline'ów wdrożeniowych (blue/green, canary)
- doświadczenie w budowie systemów autoskalowania i multi-model serving
- doświadczenie w observability systemów ML (latency, throughput, GPU usage, koszty)
- zarządzanie model registry i CI/CD dla modeli
- gotowość do pełnej odpowiedzialności operacyjnej, w tym on-call
- doświadczenie w pracy w środowisku startupowym o wysokim tempie
Opis stanowiska
Dołączysz do rozwijającego się startupu infrastruktury chmurowej, który buduje platformę GPU do obsługi modeli AI/ML w rozproszonej architekturze. Twoim zadaniem będzie projektowanie i utrzymanie produkcyjnej infrastruktury serwowania modeli — od pipeline'ów wdrożeniowych, przez autoskalowanie i routing zapytań, po optymalizację wykorzystania GPU i observability. To rola dla doświadczonego inżyniera, który lubi pracować blisko infrastruktury i chce mieć realny wpływ na kształt platformy. Uwaga: firma deklaruje, że 'redefiniuje sposób dostarczania mocy obliczeniowej' — w praktyce oznacza to pracę z nowymi, potencjalnie jeszcze niestabilnymi technologiami, więc warto być gotowym na zmienność i wysoki poziom samodzielności.
🔍 Dekoder Ogłoszenia
🔴
fast-scaling, well-funded distributed cloud infrastructure startup building next-generation AI-native cloud services
Firma szybko rośnie i ma finansowanie, ale może to oznaczać, że procesy są jeszcze w fazie tworzenia, a oczekiwania co do tempa pracy są wysokie.
🔴
redefining how compute is delivered
Firma twierdzi, że wprowadza innowacje, co może oznaczać, że pracujesz z nowymi, potencjalnie niestabilnymi technologiami lub rozwiązaniami.
🟡
highly technical, hands-on role
Oczekuje się, że będziesz aktywnie kodować i rozwiązywać problemy techniczne, a nie tylko zarządzać zespołem lub strategią.
🟡
Strong ownership
Będziesz w pełni odpowiedzialny za swoje zadania i projekty, co może oznaczać dużą autonomię, ale także presję.
🟢
production mindset
Oczekuje się, że będziesz myśleć o stabilności, niezawodności i skalowalności systemów produkcyjnych od samego początku.