Ingestion pipeline
Konektory pro SharePoint, Confluence, Notion, Google Drive, Git, PDF a HTML. Incrementální aktualizace, zpracování smazání a reindexace bez výpadku.
AI infrastrukturaAI agentiBratislava, SK
Služba 04
Retrieval augmented generation, jak má být: datová pipeline, vyhledávání, reranking a citace. Část vašeho AI systému, která rozhoduje o tom, jestli jsou odpovědi správné, nebo sebevědomě špatné.
RAG se označuje za řešení firemních znalostí, protože je levný a flexibilní. Zároveň je to nejčastější důvod, proč firemní AI zklamává: špatný retrieval dělá špatné odpovědi, ať je model sebelepší.
Moje práce obvykle v modelu vůbec není. Je v tom, aby dorazil správný odstavec, z aktuální verze dokumentu, s odkazem, který si uživatel může ověřit.
Konektory pro SharePoint, Confluence, Notion, Google Drive, Git, PDF a HTML. Incrementální aktualizace, zpracování smazání a reindexace bez výpadku.
Dělení podle struktury, naladěné na vaše dokumenty — nadpisy, tabulky, smluvní ustanovení — protože nejlevnější zlepšení kvality v RAGu je to, kde text rozřežete.
BM25 plus husté vektory, sloučené a přerankované. Čisté vektorové vyhledávání mine produktové kódy a právní odkazy; čisté vyhledávání podle klíčových slov mine parafrázi. Potřebujete obojí.
Fáze rerankingu cross-encoderem, přepis a rozklad dotazů pro vícekrokové otázky a metadata filtry, které zakódují, kdo smí vidět co.
Každá odpověď propojená s přesným zdrojem a sekcí, s viditelným datem vyhledání. Když se dokument opraví, změní se odpověď — ne až za šest týdnů.
Recall@k, faithfulness a relevance odpovědi hodnocené na otázkách sestavených z vašeho reálného provozu, sledované po relesech, aby byla regrese vidět okamžitě.
Stovka reálných otázek z ticketů podpory, obchodních hovorů a interního Slacku. Z nich vznikne retrieval benchmark.
Čisté vektorové vyhledávání, změřené. Většina klientů je na 60–75 % recall@5 a vůbec o tom nevěděla.
Členění textu, potom metadata filtry, potom hybridní vyhledávání, potom reranking. Přesně v tomhle pořadí — změna modelu pomůže nejmíň a stojí nejvíc.
Incrementální reindexace a detekce zastaralých odpovědí, aby byl systém důvěryhodný i za rok, ne jen v prvním týdnu.
Dostanete dashboard s recall, faithfulness, latencí a náklady na dotaz — a testovací sadu, abyste regrese chytali sami.
Python · TypeScript · pgvector / Qdrant / OpenSearch · PostgreSQL · BM25 · cross-encoder rerankery · OpenTelemetry
Pro firemní znalosti téměř vždy RAG. Fine-tuning mění chování modelu; nenaučí ho, co říká vaše aktualizované pravidlo. RAG pro fakta, která se mění, fine-tuning pro styl, formát a chování. Delší verzi tohoto jsem napsal v článku níže.
Ta, která je nejblíž vašim datům. Pokud už provozujete PostgreSQL, pgvector u většiny zátěží ušetří novou provozní závislost. Samostatné vektorové databáze si místo zaslouží při větším měřítku nebo specifických požadavcích na filtrování.
Filtry se aplikují v okamžiku dotazu na základě vlastní autorizace uživatele, ne z promptu. Retriever nikdy nevidí dokumenty, ke kterým se žadatel nedostane, a model je tedy nemůže prozradit.
Pak počítejte s tím, že první fáze bude hlavně práce s obsahem: PDF, které jsou ve skutečnosti skeny, tabulky, které se při dělení rozpadnou, duplicitní stránky napříč systémy. Je to běžné a opravitelné — obvykle se tím zlepší život i lidem.