JustJoin.IT Praca zdalna Senior

DevOps / MLOps Engineer

Numlabs

⚲ Kraków, Warszawa, Gdańsk, Wrocław, Poznań

Do uzgodnienia

Wymagania

  • DevOps
  • SRE
  • Platform Engineering
  • Kubernetes
  • Terraform
  • Helm
  • GitHub Actions
  • AWS
  • Azure
  • Google Cloud Platform

Opis stanowiska

Opis stanowiska
Dołączysz do organizacji, w której zespoły Data Science i AI budują rozwiązania oparte o modele ML i LLM — od klasycznych pipeline'ów predykcyjnych po systemy agentowe. Twoją rolą będzie zapewnienie im solidnego fundamentu inżynierskiego: infrastruktury, automatyzacji i standardów, dzięki którym modele i aplikacje AI trafiają na produkcję szybko, powtarzalnie i bezpiecznie.
To rola na styku DevOps i MLOps, z dużą samodzielnością i realnym wpływem na architekturę. Będziesz właścicielem infrastruktury jako kodu, pipeline'ów CI/CD, obrazów kontenerowych i decyzji architektonicznych. Zamiast gasić pożary — będziesz projektować platformę tak, żeby pożarów było jak najmniej: przez automatyzację, standaryzację wdrożeń, monitoring i hardening środowisk.
Jeśli lubisz pracować blisko zespołów data science, tłumaczyć potrzeby ML na architekturę infrastruktury i podnosić dojrzałość operacyjną organizacji — ta rola jest dla Ciebie.

Zakres obowiązków
• Projektowanie, wdrażanie i utrzymanie infrastruktury dla workloadów DS/AI (trening, serwowanie modeli, aplikacje LLM, przetwarzanie danych)
• Budowa i rozwój pipeline'ów CI/CD (GitHub Actions) dla aplikacji i modeli — od buildu obrazów, przez testy, po automatyczne wdrożenia
• Utrzymanie i rozwój kodu infrastruktury (Terraform), chartów Helm i manifestów Kubernetes
• Standaryzacja i automatyzacja procesu wdrażania modeli i usług AI na produkcję (konteneryzacja, wersjonowanie, rollback)
• Zapewnienie niezawodności i skalowalności środowisk: autoskalowanie, HA, zarządzanie zasobami (w tym GPU), optymalizacja kosztów
• Bezpieczeństwo platformy: RBAC, Network Policies, zarządzanie sekretami i certyfikatami, tożsamość, izolacja środowisk
• Wdrażanie i rozwój observability (OpenTelemetry, Prometheus, Grafana): metryki, logi, tracing, alerting — także dla usług ML
• Wsparcie zespołów DS/AI w codziennej pracy: debugowanie, code review infrastruktury, dobre praktyki, dokumentacja
• Współudział w decyzjach architektonicznych dotyczących platformy danych i AI w organizacji

Wymagania
• Min. 5 lat doświadczenia w obszarze DevOps / platform engineering / SRE
• Produkcyjne doświadczenie z Kubernetes: Deployments, Services, HPA, RBAC, ConfigMaps/Secrets, CRDs, Network Policies, operatory
• Infrastructure as Code: Terraform (preferowany) lub równoważne narzędzie; Helm dla workloadów klastrowych
• Doświadczenie z CI/CD (GitHub Actions lub podobne)
• Produkcyjne doświadczenie z co najmniej jedną chmurą publiczną (AWS / GCP / Azure): IAM, networking, usługi kontenerowe, managed databases
• Programowanie w Pythonie na poziomie pozwalającym na budowę narzędzi, automatyzacji i współpracę z kodem zespołów DS
• Doświadczenie z observability: OpenTelemetry / Prometheus / Grafana
• Sprawne debugowanie i operacje produkcyjne (kubectl, eventy, logi)
• Podstawy zarządzania danymi i projektowania pod stabilne, skalowalne workloady
• Umiejętność współpracy z zespołami nietechnicznymi po stronie infrastruktury (DS/analitycy) i tłumaczenia ich potrzeb na rozwiązania

Mile widziane
• Doświadczenie MLOps: MLflow, model registry, feature store, serwowanie modeli (KServe, Seldon, vLLM, Triton), orkiestracja pipeline'ów ML (Airflow, Kubeflow, Prefect)
• Doświadczenie z infrastrukturą dla LLM: GPU scheduling, inference serving, zarządzanie kosztami API
• GitOps w praktyce: Argo CD lub Flux
• Architektury multi-tenant i izolacja środowisk dla wielu zespołów
• Service mesh / izolacja sieciowa (Istio, traffic policies)
• Zasady supply-chain security (podpisywanie obrazów, SBOM, skanowanie zależności)
• Crossplane / KubeVela
• Znajomość ekosystemu danych (Spark, Delta Lake, platformy typu Databricks / Microsoft Fabric)

Oferujemy: 
• Roczny budżet na kursy i szkolenia.
• Elastyczne środowisko pracy - 100% zdalnie.
• Dofinansowanie do karty Multisport.
• Solidne wsparcie merytoryczne i praktyczne – jesteśmy oddani ciągłemu uczeniu się.
• Pracę w szybko rozwijającej się branży związanej z AI, ML i Data Science.

🔍 Dekoder Ogłoszenia

🔴
z dużą samodzielnością i realnym wpływem na architekturę
Oczekuje się, że będziesz podejmować kluczowe decyzje techniczne i zarządzać projektami bez ciągłego nadzoru, co może oznaczać mniejszą strukturę i wsparcie.
🔴
Będziesz właścicielem infrastruktury jako kodu, pipeline'ów CI/CD, obrazów kontenerowych i decyzji architektonicznych.
Oznacza to pełną odpowiedzialność za te obszary, od projektowania po utrzymanie, co może być obciążające.
🔴
Zamiast gasić pożary — będziesz projektować platformę tak, żeby pożarów było jak najmniej
Choć brzmi to proaktywnie, może sugerować, że obecna sytuacja wymaga znaczących usprawnień i że początkowo może być sporo 'gaszenia pożarów'.
🔴
Jeśli lubisz pracować blisko zespołów data science, tłumaczyć potrzeby ML na architekturę infrastruktury
Może oznaczać, że będziesz musiał często negocjować i przekonywać zespoły DS/AI, których potrzeby mogą być trudne do przełożenia na realia infrastrukturalne.
🔴
podnosić dojrzałość operacyjną organizacji
Sugeruje, że obecne procesy operacyjne są na niskim poziomie i będziesz musiał je budować od podstaw, co może być czasochłonne i frustrujące.