Senior Data Scientist — AI Evaluation & Quality
⚲ Krakow
Do uzgodnienia
Wymagania
- doświadczenie w budowie i utrzymaniu zestawów ewaluacyjnych dla systemów LLM/GenAI
- praktyka z narzędziami ewaluacyjnymi (np. DeepEval) i podejściem LLM-as-judge
- doświadczenie w budowie dashboardów jakości online (resolution rate, CSAT, error rate, latency)
- umiejętność zamiany wzorców błędów produkcyjnych w przypadki regresyjne
- doświadczenie w pracy z Databricks i SQL
- umiejętność przekładania metryk na decyzje produktowe i komunikacji trade-offów
Opis stanowiska
W zespole AI Finom odpowiadasz za pętlę ewaluacji wszystkich produktów AI — copilota finansowego, agenta głosowego i procesów wewnętrznych. Budujesz i rozwijasz offline'owe zestawy ewaluacyjne (datasety, judges, metryki) oraz online'owe dashboardy jakości, a wzorce błędów z produkcji zamieniasz w przypadki regresyjne. Dla data scientista, który rozumie, że jakość agenta AI zależy od jakości ewaluacji, a nie od samego modelu.
🔍 Dekoder Ogłoszenia
🟡
we’re not just redefining the entrepreneurial experience — we’re empowering our employees to make a real difference
Brzmi jak misja, ale nie mówi nic konkretnego o roli, zespole ani warunkach pracy.
🟡
on a journey towards revolutionizing the financial landscape
Typowy startupowy język — 'rewolucjonizujemy' bywa używane zamiast konkretów o produkcie i organizacji pracy.
🟡
seamless, mobile-first platform
Marketingowy opis produktu; nie wpływa na ocenę oferty pracy.