Ingest pipeline
Konektory pre SharePoint, Confluence, Notion, Google Drive, Git, PDF a HTML. Incrementálne aktualizácie, riešenie mazania a cesta preindexovania, ktorá nevyžaduje prestávku.
AI infraštruktúraAI agentiBratislava, SK
Služba 04
Retrieval rozšírená generácia, ako má byť: dátový pipeline, vyhľadávanie, reranking a citácie. Časť vášho AI systému, ktorá rozhoduje, či sú odpovede správne alebo sebavedomo nesprávne.
RAG sa označuje za riešenie firemných znalostí, pretože je lacný a flexibilný. Je to zároveň najčastejší dôvod, prečo firemné AI sklamá: zlý retrieval produkuje zlé odpovede bez ohľadu na to, aký je model dobrý.
Moja práca zvyčajne vôbec nie je v modeli. Je v tom, aby správny odstavec dorazil, z aktuálnej verzie dokumentu, s odkazom, ktorý si používateľ môže skontrolovať.
Konektory pre SharePoint, Confluence, Notion, Google Drive, Git, PDF a HTML. Incrementálne aktualizácie, riešenie mazania a cesta preindexovania, ktorá nevyžaduje prestávku.
Štruktúrou riadené delenie nastavené na vaše dokumenty — nadpisy, tabuľky, zmluvné ustanovenia — pretože najlacnejšie zlepšenie kvality v RAG je miesto, kde text rozsekáte.
BM25 plus husté vektory, zlúčené a prerankované. Čisté vektorové vyhľadávanie prehliada kódy produktov a právne odkazy; čisté kľúčové slová prehliada parafrázy. Potrebujete oboje.
Fáza rerankingu cross-encoderom, prepísanie a rozloženie dopytu pre viackrokové otázky a metadata filtre, ktoré kódujú, kto smie vidieť čo.
Každá odpoveď prepojená na presný zdroj a sekciu s viditeľným dátumom vyhľadania. Keď sa dokument opraví, odpoveď sa zmení — nie o šesť týždňov.
Recall@k, faithfulness a relevancia odpovede hodnotené na otázkach z vašej reálnej prevádzky, sledované po jednotlivých vydaniach, aby bola regresia viditeľná okamžite.
Sto skutočných otázok z ticketov podpory, obchodných hovorov a interného Slacku. Z nich vznikne benchmark retrievalu.
Čisté vektorové vyhľadávanie, zmerané. Väčšina klientov je tu na 60–75 % recall@5 a nemali o tom ani tušenie.
Členenie, potom metadata filtre, potom hybridné vyhľadávanie, potom reranking. V tomto poradí — zmeny modelu pomáhajú najmenej a stoja najviac.
Incrementálne preindexovanie a detekcia zastaralých odpovedí, aby bol systém dôveryhodný aj po roku, nielen v prvom týždni.
Dostanete dashboard s recall, faithfulness, latenciou a nákladmi na dotaz — a testovaciu sadu, aby ste regresie zachytili sami.
Python · TypeScript · pgvector / Qdrant / OpenSearch · PostgreSQL · BM25 · cross-encoder rerankery · OpenTelemetry
Takmer vždy RAG pre firemné znalosti. Fine-tuning mení správanie modelu; nenaučí ho, čo hovorí vaša aktualizovaná politika. RAG použite pre fakty, ktoré sa menia, fine-tuning pre štýl, formát a správanie. Dlhšiu verziu som napísal v článku uvedenom nižšie.
Tú, ktorá je najbližšie k vašim dátam. Ak už bežíte PostgreSQL, pgvector ušetrí novú prevádzkovú závislosť pre väčšinu záťaží. Samostatné vektorové databázy si miesto zaslúžia pri väčšom rozsahu alebo so špecifickými filtrami.
Filtre sa použijú v čase dopytu z vlastnej autorizácie používateľa, nie z promptu. Retriever nikdy nevidí dokumenty, ktoré žiadateľ nemá prístup, a to znamená, že ich nemôže úniknúť ani model.
Potom počítajte s tým, že prvá fáza bude väčšinou práca s obsahom: PDF, ktoré sú v skutočnosti skeny, tabuľky, ktoré sa pri delení rozpadnú, duplicitné stránky naprieč systémami. Je to bežné a opraviteľné — zvyčajne to zlepší život aj ľuďom.