RAG, nebo fine-tuning? Volba správného přístupu k znalostem
Fine-tuning dostává pozornost a položku v rozpočtu. Retrieval přináší výsledky. Pro cokoli, co se mění — ceny, pravidla, sklad, specifikace — je odpovědí téměř vždy retrieval.
Téměř každá debata o firemní AI začíná jako spor mezi fine-tuningem a retrievalem, jako by to byli konkurenti. Nejsou. Odpovídají na různé otázky a většina projektů, které uváznou, je pomíchala.
Otázka za otázkou
Zeptejte se, co dnes selhává. Obvykle je to jedna ze tří věcí:
- Model něco neví. Jde o problém znalostí a ten řeší retrieval.
- Model to ví, ale chová se špatně — špatný formát, špatný tón, špatná struktura, ignorované kroky. Jde o problém chování a ten řeší fine-tuning nebo lepší promptování.
- Model to ví a chová se správně, ale odpověď je drahá nebo pomalá. Jde o problém architektury a ani jedno z těchto dvou není oprava.
Fine-tuning nemůže modelu zprostředkovat pravidlo, které jste revidovali minulé úterý. Nemá žádný mechanismus, jak něco vyhledat. Odpoví ze svých vah, což je snímek, a odpoví s totožnou sebejistotou. To je nejdůležitější věta v tomhle článku.
Co fine-tuning skutečně mění
Fine-tuning upravuje distribuci. Mění, co model má tendenci produkovat — formát, tón, strukturu, chování při odmítání, oborovou slovní zásobu. S dobrými daty spolehlivě dělá tvar výstupu předvídatelný, což záleží, když ho kód níže po řetězci parsuje.
Nepřidává znalosti. Nepřidává fakta o vaší firmě. Nemůže odkazovat na dokument, který nikdy neviděl, a neřekne vám, odkud odpověď přišla.
Co retrieval skutečně mění
Retrieval mění vstup. Než model odpoví, váš systém vyzvedne relevantní pasáže z korpusu, který kontrolujete, a vloží je do kontextového okna s instrukcí odpovídat pouze z nich.
To vám dá tři věci, které fine-tuning nemůže: aktuálnost, protože korpus se aktualizuje, když se aktualizují dokumenty; původ, protože přesně víte, která pasáž byla použita; a vratnost, protože oprava odpovědi znamená opravit dokument, ne přetrénovat model.
Cenou je kvalita retrievu. Pokud dorazí špatný odstavec, žádný model vás nezachrání.
Volba podle požadavku
| Požadavek | Retrieval | Fine-tuning |
|---|---|---|
| Odpovědi odrážejí pravidlo revidované tento týden | Ano | Ne |
| Každá odpověď cituje zdroj | Ano | Ne |
| Konzistentní JSON nebo pevný tvar výstupu | Částečně | Ano |
| Konkrétní tón nebo domácí styl | Částečně | Ano |
| Spolehlivě odmítnout otázky mimo rozsah | S guardrails | Ano |
| Odstranit citlivá data před inference | Ano | Ne |
| Náklady na dotaz výrazně klesnou | Ano | Někdy |
| Zlepšit schopnost bez korpusu | Ne | Ano |
Pořadí, ve kterém zkoušet
Mám pevné pořadí a přeskočení raných kroků je důvod, proč projekty končí fine-tuningem problému retrievu.
- Promptujte správně. Jasné instrukce systému, oddělovače pro načtený kontext a explicitní instrukce odmítnout, když kontext neodpovídá na otázku. To samo o sobě opraví překvapivý podíl stížností „AI je špatná“.
- Opravte retrieval. Členění podle struktury, hybridní vyhledávání podle klíčových slov i vektorů, fáze rerankingu, metadata filtry pro oprávnění.
- Přidejte citace a ověřujte faithfulness. Pokud umíte změřit, jestli odpověď vyplývá z načteného textu, můžete zlepšit všechno ostatní.
- Směrujte mezi modely. Levný model pro klasifikaci a směrování, drahý pro těžké odpovědi. Náklady klesnou, kvalita zůstane.
- Fine-tuneujte. Teď a jen pro chování: formát výstupu, klasifikace, tón, odmítání.
Pokud dojdete do pátého kroku a pořád nejste spokojeni, problém je s největší pravděpodobností ve druhém kroku.
Kde fine-tuning skutečně vyhrává
Existují reálné případy a jsou užší, než naznačuje marketing.
Dodržování formátu ve velkém: potřebujete, aby se dal parsovat každý výstup, máte tisíce příkladů a malý fine-tuning nahrazuje akrobacii s promptem. Oborová klasifikace a směrování, kde klasifikátor s fine-tuningem porazí obecný model plus prompt. Tón, který musí být přesně správný, například právní nebo lékařský rejstřík. Odstranění chování — zastavení konkrétního nežádoucího vzoru spolehlivěji, než to umí instrukce.
Ve všech čtyřech případech fine-tuning mění chování modelu a fakta stále dodává retrieval. Vzor není buď/anebo.
Hybridní vzor
Systémy, které v produkci obstojí, vypadají takhle: retrieval vrstva dodává čerstvý, filtrový podle oprávnění a citovaný kontext; gateway modelů směruje požadavek na nejmenší model, který ho zvládne; vrstva s fine-tuningem vynucuje tvar výstupu a chování při odmítání; evaluation harness to všechno dokazuje při každém relezu.
Každá část dělá to, na co je skutečně dobrá. Fine-tuning je v tom, ale nenese znalosti a nikdo nepředstírá opak.
Jak poznat, které potřebujete
Tři otázky, v pořadí.
Potřebuje být odpověď aktuální? Retrieval.
Potřebuje odpověď zdroj, který si člověk může ověřit? Retrieval.
Potřebuje výstup vypadat nebo se chovat konkrétním způsobem? Fine-tuning, promptování, nebo obyčejný kód.
Pokud je vaše poctivá odpověď na první dvě ne, možná nepotřebujete ani jedno — možná potřebujete pravidlový engine, obyčejný dotaz do databáze a značně míň infrastruktury. To je legitimní a podceňovaná odpověď.