Frederik Rybansky

AI infrastrukturaAI agentiBratislava, SK

Služba 04

RAG a knowledge systémy

Retrieval augmented generation, jak má být: datová pipeline, vyhledávání, reranking a citace. Část vašeho AI systému, která rozhoduje o tom, jestli jsou odpovědi správné, nebo sebevědomě špatné.

RAG se označuje za řešení firemních znalostí, protože je levný a flexibilní. Zároveň je to nejčastější důvod, proč firemní AI zklamává: špatný retrieval dělá špatné odpovědi, ať je model sebelepší.

Moje práce obvykle v modelu vůbec není. Je v tom, aby dorazil správný odstavec, z aktuální verze dokumentu, s odkazem, který si uživatel může ověřit.

Výstupy

Ingestion pipeline

Konektory pro SharePoint, Confluence, Notion, Google Drive, Git, PDF a HTML. Incrementální aktualizace, zpracování smazání a reindexace bez výpadku.

Strategie členění textu

Dělení podle struktury, naladěné na vaše dokumenty — nadpisy, tabulky, smluvní ustanovení — protože nejlevnější zlepšení kvality v RAGu je to, kde text rozřežete.

Hybridní retrieval

BM25 plus husté vektory, sloučené a přerankované. Čisté vektorové vyhledávání mine produktové kódy a právní odkazy; čisté vyhledávání podle klíčových slov mine parafrázi. Potřebujete obojí.

Reranking a zpracování dotazů

Fáze rerankingu cross-encoderem, přepis a rozklad dotazů pro vícekrokové otázky a metadata filtry, které zakódují, kdo smí vidět co.

Aktuálnost a citace

Každá odpověď propojená s přesným zdrojem a sekcí, s viditelným datem vyhledání. Když se dokument opraví, změní se odpověď — ne až za šest týdnů.

Evaluace

Recall@k, faithfulness a relevance odpovědi hodnocené na otázkách sestavených z vašeho reálného provozu, sledované po relesech, aby byla regrese vidět okamžitě.

Retrieval smyčka

Sestavte sadu otázek

Stovka reálných otázek z ticketů podpory, obchodních hovorů a interního Slacku. Z nich vznikne retrieval benchmark.

Poctivá baseline

Čisté vektorové vyhledávání, změřené. Většina klientů je na 60–75 % recall@5 a vůbec o tom nevěděla.

Zlepšujte ve správném pořadí

Členění textu, potom metadata filtry, potom hybridní vyhledávání, potom reranking. Přesně v tomhle pořadí — změna modelu pomůže nejmíň a stojí nejvíc.

Přidejte aktuálnost

Incrementální reindexace a detekce zastaralých odpovědí, aby byl systém důvěryhodný i za rok, ne jen v prvním týdnu.

Předejte čísla

Dostanete dashboard s recall, faithfulness, latencí a náklady na dotaz — a testovací sadu, abyste regrese chytali sami.

Výsledek

  • Odpovědi citují zdrojový dokument a sekci, takže si je uživatelé ověří jedním kliknutím.
  • Opravy se šíří: aktualizujete pravidlo a asistent se přizpůsobí.
  • Filtrování podle oprávnění znamená, že lidé nevyzvednou dokumenty, které nemají vidět.
  • Měřitelná čísla recall a faithfulness po jednotlivých relesech.
  • Jasná odpověď, u kterých otázek stačí práce s obsahem a kde je potřeba inženýrství.

Běžný stack

Python · TypeScript · pgvector / Qdrant / OpenSearch · PostgreSQL · BM25 · cross-encoder rerankery · OpenTelemetry

Časté dotazy

RAG, nebo fine-tuning?

Pro firemní znalosti téměř vždy RAG. Fine-tuning mění chování modelu; nenaučí ho, co říká vaše aktualizované pravidlo. RAG pro fakta, která se mění, fine-tuning pro styl, formát a chování. Delší verzi tohoto jsem napsal v článku níže.

Jakou vektorovou databázi máme použít?

Ta, která je nejblíž vašim datům. Pokud už provozujete PostgreSQL, pgvector u většiny zátěží ušetří novou provozní závislost. Samostatné vektorové databáze si místo zaslouží při větším měřítku nebo specifických požadavcích na filtrování.

Jak řešíte dokumenty s oprávněními?

Filtry se aplikují v okamžiku dotazu na základě vlastní autorizace uživatele, ne z promptu. Retriever nikdy nevidí dokumenty, ke kterým se žadatel nedostane, a model je tedy nemůže prozradit.

A co když jsou naše dokumenty nepořádek?

Pak počítejte s tím, že první fáze bude hlavně práce s obsahem: PDF, které jsou ve skutečnosti skeny, tabulky, které se při dělení rozpadnou, duplicitní stránky napříč systémy. Je to běžné a opravitelné — obvykle se tím zlepší život i lidem.

Další služby