Frederik Rybansky

AI infrastrukturaAI agentiBratislava, SK

Služba 05

Evaluace a observabilita LLM

Rozdíl mezi „myslíme si, že AI je dobrá“ a „umíme to doložit a víme, kdy to přestane platit“. Evals, guardrails a trasování v produkci — nejlevnější pojištění v AI.

Nedeterministické systémy potřebují jiný přístup ke kvalitě. Nemůžete tvrdit, že odpověď se rovná řetězci. Potřebujete testovací sadu postavenou kolem chování, spouštěnou při každé změně, a trasu v produkci pro každou reálnou konverzaci.

Tuto službu doporučuji téměř všem, kdo už něco mají v produkci. Je to pár týdnů práce, které se vrátí při první změně promptu, která potichu zhorší zákaznickou funkci.

Výstupy

Golden datasets

Pečlivě vybrané sady vstupů s referenčními odpověďmi a pravidly přijatelných odchylek, odebrané z reálného provozu a zkontrolované lidmi, kteří doménu znají.

Automatické skórování

Metriky pro konkrétní úkol, LLM-as-judge kalibrovaný na lidských recenzentech a deterministické kontroly pro části, které musí být přesné.

Regresní testování v CI

Každá změna promptu, modelu nebo retrievalu spustí sadu a nahlásí delta. Pod prahem se merge zablokuje.

Trasování v produkci

Úplné span-y pro každé volání — prompt, načtený kontext, model, tokeny, latence, náklady — vyhledatelné po incidentu místo rekonstrukce z paměti.

Guardrails

Filtry na vstupu a výstupu, chování při odmítání, maskování PII a obrana proti injection, každý s vlastním testovacím případem.

Dashboardy

Kvalita, latence, náklady a míra chyb po jednotlivých funkcích a jazycích, s alertingem na drift. Každý týden, ne na vyžádání.

Jak to nastavuji

Domluvte se na metrice

Ne přesnost — to, co by vaši uživatelé nazvali správně. Musí to být napsané a odsouhlasené dřív, než vznikne jakékoli číslo.

Odeberte vzorek reálného provozu

Sestavte dataset z reálných konverzací, vyfiltrovaný na případy, na kterých záleží, a odpovídající vašemu skutečnému rozložení.

Kalibrujte sudce

Spusťte LLM-as-judge a lidskou kontrolu vedle sebe na podmnožině. Sudce si ponechte jen tam, kde souhlasí.

Automatizujte a hlídejte

Sada běží na pull requestech. Reporty ukáží delta, selhané případy a pravděpodobnou příčinu.

Sledujte produkci

Trasujte vše, průběžně odeberte vzorek živého provozu a ohodnoťte jej a alertujte na drift, ne na výpadky.

Výsledek

  • Změny modelu nebo promptu přestanou být strašidelné, protože evals řeknou, co se pohnulo.
  • Můžete uvést číslo o kvalitě zákazníkům, auditorům nebo představenstvu.
  • Incidenty začínají trasou místo hádky o tom, co model viděl.
  • Regrese nákladů a latence se zachytí v CI, ne na měsíční faktuře.
  • Guardrails mají testy, takže „máme filtr“ je ověřitelné, ne jen předpokládané.

Běžný stack

Python · TypeScript · pytest / Vitest · OpenTelemetry · Prometheus · Grafana · CI pipeline

Časté dotazy

Je LLM-as-judge dost spolehlivý na to, aby blokoval release?

Jako první filtr ano — je výrazně lepší než posouzení od oka. Ale jen pokud je kalibrovaný: na podmnožině ho porovnám s lidskou kontrolou, změřím shodu a ponechám ho přísně jako bránu tam, kde souhlasí. Cokoli s vysokými sázkami zůstává u lidí.

Nemáme testovací data.

Pak začneme jejich vytvořením: odebereme vzorek reálného produkčního provozu, shlukneme ho a vaši experti označí dvě až tři sta nejdůležitějších případů. Z toho vznikne dataset a obvykle se stane nejhodnotnějším artefaktem projektu.

Zpomalí nás to?

Jakmile sada existuje, naopak urychlí. Bez ní je každá změna promptu ruční regresní test, který provede ten nejodvážnější v daném týdnu.

Další služby