Golden datasets
Pečlivě vybrané sady vstupů s referenčními odpověďmi a pravidly přijatelných odchylek, odebrané z reálného provozu a zkontrolované lidmi, kteří doménu znají.
AI infrastrukturaAI agentiBratislava, SK
Služba 05
Rozdíl mezi „myslíme si, že AI je dobrá“ a „umíme to doložit a víme, kdy to přestane platit“. Evals, guardrails a trasování v produkci — nejlevnější pojištění v AI.
Nedeterministické systémy potřebují jiný přístup ke kvalitě. Nemůžete tvrdit, že odpověď se rovná řetězci. Potřebujete testovací sadu postavenou kolem chování, spouštěnou při každé změně, a trasu v produkci pro každou reálnou konverzaci.
Tuto službu doporučuji téměř všem, kdo už něco mají v produkci. Je to pár týdnů práce, které se vrátí při první změně promptu, která potichu zhorší zákaznickou funkci.
Pečlivě vybrané sady vstupů s referenčními odpověďmi a pravidly přijatelných odchylek, odebrané z reálného provozu a zkontrolované lidmi, kteří doménu znají.
Metriky pro konkrétní úkol, LLM-as-judge kalibrovaný na lidských recenzentech a deterministické kontroly pro části, které musí být přesné.
Každá změna promptu, modelu nebo retrievalu spustí sadu a nahlásí delta. Pod prahem se merge zablokuje.
Úplné span-y pro každé volání — prompt, načtený kontext, model, tokeny, latence, náklady — vyhledatelné po incidentu místo rekonstrukce z paměti.
Filtry na vstupu a výstupu, chování při odmítání, maskování PII a obrana proti injection, každý s vlastním testovacím případem.
Kvalita, latence, náklady a míra chyb po jednotlivých funkcích a jazycích, s alertingem na drift. Každý týden, ne na vyžádání.
Ne přesnost — to, co by vaši uživatelé nazvali správně. Musí to být napsané a odsouhlasené dřív, než vznikne jakékoli číslo.
Sestavte dataset z reálných konverzací, vyfiltrovaný na případy, na kterých záleží, a odpovídající vašemu skutečnému rozložení.
Spusťte LLM-as-judge a lidskou kontrolu vedle sebe na podmnožině. Sudce si ponechte jen tam, kde souhlasí.
Sada běží na pull requestech. Reporty ukáží delta, selhané případy a pravděpodobnou příčinu.
Trasujte vše, průběžně odeberte vzorek živého provozu a ohodnoťte jej a alertujte na drift, ne na výpadky.
Python · TypeScript · pytest / Vitest · OpenTelemetry · Prometheus · Grafana · CI pipeline
Jako první filtr ano — je výrazně lepší než posouzení od oka. Ale jen pokud je kalibrovaný: na podmnožině ho porovnám s lidskou kontrolou, změřím shodu a ponechám ho přísně jako bránu tam, kde souhlasí. Cokoli s vysokými sázkami zůstává u lidí.
Pak začneme jejich vytvořením: odebereme vzorek reálného produkčního provozu, shlukneme ho a vaši experti označí dvě až tři sta nejdůležitějších případů. Z toho vznikne dataset a obvykle se stane nejhodnotnějším artefaktem projektu.
Jakmile sada existuje, naopak urychlí. Bez ní je každá změna promptu ruční regresní test, který provede ten nejodvážnější v daném týdnu.