Platformová vrstva: vše mezi kódem vašeho produktu a jazykovým modelem. Postavená tak, aby změna modelu byla konfigurace, kvalita měřitelná a náklady byly na dashboardu, ne překvapením z faktury.
AI projekty málokdy selhávají kvůli špatnému modelu. Selhávají proto, že chybí potrubí — není kde opakovat pokus, nevidíte, co model viděl, nelze přepnout poskytovatele a neumíte odpovědět na otázku „kolik nás tato funkce minulý měsíc stála“.
AI infrastruktura je práce, která to všechno napraví. Je to nevděčná práce, je důvodem, proč je zbytek vašeho AI roadmapu možný, a je to část, na které trávím nejvíc času.
Výstupy
Gateway modelů a směrování
Jedno rozhraní před každým poskytovatelem. Směrování podle úkolu mezi modely, automatický fallback při zhoršení poskytovatele, politika opakování a timeoutů a streamování tam, kde pomáhá. Vyměníte model, aniž byste sáhli na kód produktu.
Retrieval a datová vrstva
Ingestion pipeline, strategie členění textu, embeddings a vektorové úložiště vedle vašich relačních dat. Hybridní vyhledávání podle klíčových slov i vektorů, reranking, incrementální reindexace a citace zdroje u každé odpovědi.
Evaluation harness
Golden datasets z vašeho vlastního provozu, LLM-as-judge kalibrovaný na lidech, regresní sady běžící v CI a číslo, které předložíte představenstvu místo dojmu.
Observabilita a trasování
OpenTelemetry trasy pro každé volání: prompt, načtené chunky, model, tokeny, latence, náklady. Zalogujte přesný vstup, který vygeneroval špatnou odpověď, reprodukujte ho a opravu znovu otestujte.
Kontrola nákladů a výkonu
Rozpočty na prompt a kontext, cacheování, směrování nejdřív na malé modely, dávkové a asynchronní cesty. Většina klientů v prvním čtvrtletí sníží výdaje o 40–70 %, aniž by sáhla na kvalitu odpovědí.
Nasazení a bezpečnost
Docker a Kubernetes, prostředí oddělená podle očekávání vašeho bezpečnostního týmu, správa tajemství, redakce PII na hranici a volitelný plně on-premise inference pro data, která nesmějí odejít.
Jak to stavím
Zmapovat rozsah
Které funkce volají model, jaká data mohou zpracovávat, které jsou zákaznické, jakou latenci a náklady snesete. Z toho vznikne písemný plán.
Rozjet gateway
Jednotný vstupní bod pro modely, prompt a nástroje. Vše ostatní komunikuje s ním, takže nikde není zapečetěné SDK konkrétního dodavatele.
Postavit datovou cestu
Ingestion, členění, embedding, indexace, citace. Nudné, testovatelné — a to, co uživatelé poznají, když to chybí.
Změřit to
Evals v CI, trasy v produkci, náklady na funkci na dashboardu. Potom ladění: směrování, cacheování, délka kontextu.
Zpevnit a předat
Zátěžové testy, nácviky výpadků, runbooky a procházka s vaším týmem, abyste to po mém odchodu vlastnili sami.
Výsledek
Jedno rozhraní gatewaye pro každý model a poskytovatele.
Každá odpověď dohledatelná ke zdrojovým dokumentům, s logem přesně toho, co model přečetl.
Kvalita, latence a náklady sledované po jednotlivých funkcích a regresně testované v CI.
Přepnutí poskytovatele nebo fallback je změna konfigurace, ne přepis.
Volba self-hostingu nebo on-premise pro citlivá data.
Jako ten, kdo zná specifické způsoby selhávání LLM — nedeterminismus, drift retrievalu, změny promptu a kontextu, tokenovou ekonomiku, evaluaci. Obvykle pracuji uvnitř vaší stávající infrastruktury a CI, ne kolem ní.
Potřebujeme vlastní GPU cluster?
Obvykle ne na začátku. Hostované API a dobrá gateway pokryjí většinu firemních případů a řeknu vám, kdy se self-hosting skutečně vyplatí, místo abych k němu defaultoval. Pokud vaše data nesmějí opustit síť, je self-hosting jedinou možností a umím ho nacenit.
Jak dokážete, že platforma funguje?
Každá platformová spolupráce obsahuje evaluation harness. Metriky si domluvíme dřív, než začneme stavět, spustíme je proti baseline a při každé změně znovu. Stane se z něj i regresní sada pro vše, co postavíme dál.
A co deprekace modelů?
To je běžný provozní náklad a přesně na to gateway slouží. Migrace modelu je změna mapování a opětovné spuštění eval sady; pokud migrace zhorší kvalitu, evals ji zachytí dřív než zákazníci.