Zlaté datasety
Upravené sady vstupov s referenčnými odpoveďami a pravidlami prijateľnej variácie, čerpané z reálnej prevádzky a skontrolované ľuďmi, ktorí poznajú doménu.
AI infraštruktúraAI agentiBratislava, SK
Služba 05
Rozdiel medzi „myslíme si, že AI je dobrá" a „vieme to dokázať a vieme, kedy to prestane platiť". Evaly, guardrails a tracing v produkcii — najlacnejšie poistenie v AI.
Nedeterministické systémy potrebujú iný prístup k kvalite. Nemôžete tvrdiť, že odpoveď sa rovná reťazcu. Potrebujete testovaciu sadu postavenú okolo správania, spúšťanú pri každej zmene, a produkčnú stopu pre každú reálnu konverzáciu.
Toto je služba, ktorú odporúčam takmer každému, kto už niečo má v produkcii. Je to pár týždňov práce, ktoré sa vrátia pri prvej zmene promptu, ktorá potichu pokazí zákaznícku funkciu.
Upravené sady vstupov s referenčnými odpoveďami a pravidlami prijateľnej variácie, čerpané z reálnej prevádzky a skontrolované ľuďmi, ktorí poznajú doménu.
Metriky špecifické pre úlohu, LLM-as-judge kalibrovaný oproti ľudským recenzentom a deterministické kontroly pre časti, ktoré musia byť presné.
Každá zmena promptu, modelu alebo retrievalu spustí sadu a nahlási deltu. Pod prahom je merge zablokovaný.
Úplné stopy pre každé volanie — prompt, načítaný kontext, model, tokeny, latencia, náklady — vyhľadateľné po incidente namiesto rekonštrukcie z pamäte.
Filtre vstupov a výstupov, správanie pri odmietnutí, maskovanie PII a obrana proti injekcii, každý s vlastným testovacím prípadom.
Kvalita, latencia, náklady a miera chýb po funkciách a jazykoch, s alarmovaním na drift. Týždenne, nie na požiadanie.
Nie presnosť — to, čo by vaši používatelia nazvali správne. Musí to byť napísané a dohodnuté skôr, než vznikne akékoľvek číslo.
Vytvorte dataset z reálnych konverzácií, prefiltrovaný pre prípady, na ktorých záleží, a vážený podľa vašej skutočnej distribúcie.
Spustite LLM-as-judge a ľudskú revíziu paralelne na podmnožine. Sudcu si ponechajte tam, kde súhlasí.
Sada beží na pull requestoch. Reporty ukazujú deltu, zlyhané prípady a pravdepodobnú príčinu.
Sledujte všetko, priebežne vzorkujte a skórujte časť živej prevádzky a alarmujte na drift, nie na výpadky.
Python · TypeScript · pytest / Vitest · OpenTelemetry · Prometheus · Grafana · CI pipeline
Ako prvý filter áno — je oveľa lepší než posudzovanie okom. Ale len ak je kalibrovaný: spustím na podmnožine ľudskú revíziu oproti nemu, zmeriam zhodu a použijem ho striktne ako bránu tam, kde súhlasí. Čokoľvek s vysokou stávkou zostáva pod ľudskou kontrolou.
Potom ich začneme vyrábať: odoberieme vzorku reálnej produkčnej prevádzky, zoskupíme ju a vaši odborníci na doménu označia dvesto až tristo prípadov, na ktorých najviac záleží. Z toho vznikne dataset a zvyčajne sa stane najcennejším artefaktom projektu.
Urýchli vás to, keď sada existuje. Bez nej je každá zmena promptu manuálny regresný test, ktorý vykoná ten najodvážnejší v danom týždni.