Frederik Rybansky

AI infraštruktúraAI agentiBratislava, SK

Služba 05

Evaluácia a observabilita LLM

Rozdiel medzi „myslíme si, že AI je dobrá" a „vieme to dokázať a vieme, kedy to prestane platiť". Evaly, guardrails a tracing v produkcii — najlacnejšie poistenie v AI.

Nedeterministické systémy potrebujú iný prístup k kvalite. Nemôžete tvrdiť, že odpoveď sa rovná reťazcu. Potrebujete testovaciu sadu postavenú okolo správania, spúšťanú pri každej zmene, a produkčnú stopu pre každú reálnu konverzáciu.

Toto je služba, ktorú odporúčam takmer každému, kto už niečo má v produkcii. Je to pár týždňov práce, ktoré sa vrátia pri prvej zmene promptu, ktorá potichu pokazí zákaznícku funkciu.

Výstupy

Zlaté datasety

Upravené sady vstupov s referenčnými odpoveďami a pravidlami prijateľnej variácie, čerpané z reálnej prevádzky a skontrolované ľuďmi, ktorí poznajú doménu.

Automatizované skórovanie

Metriky špecifické pre úlohu, LLM-as-judge kalibrovaný oproti ľudským recenzentom a deterministické kontroly pre časti, ktoré musia byť presné.

Regresné testovanie v CI

Každá zmena promptu, modelu alebo retrievalu spustí sadu a nahlási deltu. Pod prahom je merge zablokovaný.

Produkčný tracing

Úplné stopy pre každé volanie — prompt, načítaný kontext, model, tokeny, latencia, náklady — vyhľadateľné po incidente namiesto rekonštrukcie z pamäte.

Guardrails

Filtre vstupov a výstupov, správanie pri odmietnutí, maskovanie PII a obrana proti injekcii, každý s vlastným testovacím prípadom.

Dashboarde

Kvalita, latencia, náklady a miera chýb po funkciách a jazykoch, s alarmovaním na drift. Týždenne, nie na požiadanie.

Ako to nastavujem

Dohodnúť metriku

Nie presnosť — to, čo by vaši používatelia nazvali správne. Musí to byť napísané a dohodnuté skôr, než vznikne akékoľvek číslo.

Odobrať vzorku reálnej prevádzky

Vytvorte dataset z reálnych konverzácií, prefiltrovaný pre prípady, na ktorých záleží, a vážený podľa vašej skutočnej distribúcie.

Kalibrovať sudcu

Spustite LLM-as-judge a ľudskú revíziu paralelne na podmnožine. Sudcu si ponechajte tam, kde súhlasí.

Automatizovať a strážiť

Sada beží na pull requestoch. Reporty ukazujú deltu, zlyhané prípady a pravdepodobnú príčinu.

Sledovať produkciu

Sledujte všetko, priebežne vzorkujte a skórujte časť živej prevádzky a alarmujte na drift, nie na výpadky.

Výsledok

  • Zmeny modelu alebo promptu prestanú byť desivé, pretože evaly vám povedia, čo sa pohlo.
  • Môžete zákazníkom, auditorom alebo vášmu vedeniu uviesť číslo kvality.
  • Incidenty začínajú stopou namiesto hádky o tom, čo model videl.
  • Regresie nákladov a latencie sa zachytia v CI, nie v mesačnej faktúre.
  • Guardrails majú testy, takže „máme filter" je overiteľné, nie predpokladané.

Bežný stack

Python · TypeScript · pytest / Vitest · OpenTelemetry · Prometheus · Grafana · CI pipeline

Časté otázky

Je LLM-as-judge spoľahlivý dosť na to, aby blokoval release?

Ako prvý filter áno — je oveľa lepší než posudzovanie okom. Ale len ak je kalibrovaný: spustím na podmnožine ľudskú revíziu oproti nemu, zmeriam zhodu a použijem ho striktne ako bránu tam, kde súhlasí. Čokoľvek s vysokou stávkou zostáva pod ľudskou kontrolou.

Nemáme testovacie dáta.

Potom ich začneme vyrábať: odoberieme vzorku reálnej produkčnej prevádzky, zoskupíme ju a vaši odborníci na doménu označia dvesto až tristo prípadov, na ktorých najviac záleží. Z toho vznikne dataset a zvyčajne sa stane najcennejším artefaktom projektu.

Spomaľuje nás to?

Urýchli vás to, keď sada existuje. Bez nej je každá zmena promptu manuálny regresný test, ktorý vykoná ten najodvážnejší v danom týždni.

Ďalšie služby