Co je RAG a proč mění pravidla hry
Retrieval-Augmented Generation (RAG) je architektura, ve které velký jazykový model (LLM) generuje odpověď teprve poté, co na základě uživatelského dotazu vyhledá relevantní fakta v externích zdrojích. Spojení vyhledávání a generování zásadně snižuje halucinace, zlepšuje aktuálnost a umožňuje citovat zdroje. V kontextu optimalizace webů pro ChatGPT/LLM (AIO/AEO) a moderního SEO je RAG mostem mezi autoritativním obsahem na webu a modely, které odpovědi zprostředkovávají.
Komponenty RAG: end-to-end pohled
- Ingest a normalizace: extrakce z HTML/API/CSV/PDF, čištění, deduplikace, generování metadat.
- Indexace: vektorový index (embeddingy) + textový index (BM25) + metadatové filtry.
- Retrieval: výběr pasáží podle dotazu (dense, sparse, hybridní), reranking a diverzifikace.
- Orchestrace promptu: vložení vybraných pasáží a instrukcí do systému (templating, role).
- Generování s citacemi: LLM tvoří odpověď, odkazuje na
source_url, shrnuje a uvádí omezení. - Feedback a monitoring: měření kvality, výpadků, latence, aktualizace indexu (freshness).
Propojení s AIO/AEO a moderním SEO
RAG posouvá SEO od klíčových slov k citovatelným faktům a dostupným datům. Pro vlastníky webů je cíl jasný: poskytovat strojově čitelný, stabilně adresovatelný a licencovaný obsah, který lze bezpečně načíst do RAG řetězců asistentů. Pro marketéry to znamená měřit share-of-voice v AI odpovědích a optimalizovat sourceability (schopnost být vybrán jako zdroj).
Ingest: z HTML k čistým pasážím
- Extrahujte „content_text“: verzi bez navigace, reklamy a boilerplate; originál uchovejte pro citaci.
- Stabilní URL a kotvy: generujte per-sekční kotvy (
#kapitola-tema) pro hluboké citace. - Normalizujte jednotky a data: ISO 8601, SI jednotky, míry a lokální formáty vyznačte v metadatech.
- Odstraňte duplicity: kanonikalizujte verze, jazykové mutace propojíte přes
hreflang.
Chunking a kontextová okna
- Velikost chunku: 300–1 200 tokenů podle domény; kratší pro definice, delší pro metodiky.
- Překryv: 10–20 % pro zachování souvislostí (slovníky pojmů, vzorce, definice).
- Semantický vs. pevný chunking: segmentujte podle nadpisů a logických celků, nikoli fixní délky.
- Bohatá metadata: jazyk, autor, datum, verze, typ obsahu, schéma kategorií, licenční omezení.
Embeddingy a indexy: hybrid je základ
- Dense (vektorové) vyhledávání: zachytí sémantiku, synonyma, parafráze.
- Sparse (BM25): přesná klíčová slova, kódy norem, zkratky, čísla modelů.
- Hybrid: spojte skóre (např. vážený součet) a aplikujte MMR nebo diversifikaci, aby bylo pokryto více úhlů pohledu.
- Reranking: malý cross-encoder na 10–50 kandidátů výrazně zvyšuje přesnost top-k.
Retrieval: od dotazu k důkazům
- Query reformulation: přejmenování nejednoznačných dotazů (agent „query-rewriter“).
- Filtry a facetová pole: obor/jazyk/rok; u norem a zákonů je filtr na verzi nutností.
- Temporal awareness: upřednostněte novější verze (pole
valid_from,valid_to) ale zachovejte historické citace. - Citovatelné snippety: vraťte URL + kotvu + krátký úryvek (2–3 věty) jako evidence.
Orchestrace promptu a řízení generování
- Instrukce pro „grounded answers“: model smí tvrdit pouze to, co je podpořeno v důkazech; jinak má odpovědět „nevím“ + doporučit další zdroje.
- Striktní citace: u každého tvrzení s čísly/terminologií přiložte
[1]… s URL a verzí dokumentu. - Formát odpovědi: nejprve stručná odpověď, poté zdůvodnění a citace, nakonec omezení a datum platnosti.
- Kontrola délky: přizpůsobte výstup 50/150/300-slovným režimům pro „answer-first“ spotřebu.
Minimalizace halucinací
- Strict mode: vynucujte „no-source → no-claim“; pokud důkaz chybí, požadujte doplňující vyhledávání.
- Konflikt zdrojů: při rozporu uveďte obě verze, data a vysvětlení, která platí (lex posterior, lex specialis).
- Numerické fakty: požadujte shodu alespoň ve dvou nezávislých pasážích nebo v primární tabulce.
Aktuálnost: freshness, delta a reindex
- Delta ingest: zpracujte pouze změněné dokumenty podle
ETagnebolast_modified. - Priority fronty: preferujte autoritativní domény, sekce „novinky“, changelogy, ceníky a normy.
- Expirace embeddingů: re-embed po změně nebo po době (např. 30–90 dní) podle volatility domény.
Licence, TDM a compliance
- Legální přístup: respektujte autorská práva, licence (CC-BY, ODbL) a TDM výjimky.
- PII a citlivá data: odstraňujte osobní údaje z indexu; logy pseudonymizujte.
- Auditovatelnost: ukládejte verzi zdroje, čas retrievalu a hash pasáže pro následné ověření.
UX výstupu: jak servírovat odpověď
- Answer-first: 1–2 věty shrnutí, poté „Jak jsme na to přišli“ se zdroji.
- Citace s kotvami: místo odkazu na úvodní stránku odkazujte přímo na sekci; zobrazujte název dokumentu a datum.
- Stupeň jistoty: odhad důvěry (např. nízký/střední/vysoký) podle skóre retrievalu a počtu shodujících se zdrojů.
Měření kvality RAG (KPI a offline/online evaluace)
- Retrieval Recall@k: zda se v top-k nachází pasáž s odpovědí (gold label).
- Groundedness/Attribution: podíl tvrzení podložených citacemi, penalizace za „unattributed claims“.
- Factuality/Exact Match: shoda čísel, definic a závěrů s referencí.
- Latency p95: čas od dotazu po odpověď; sledujte zvlášť vyhledávání, rerank, generování.
- Úspěšnost na straně uživatele: kliky na zdroje, „was this helpful“, následné akce a konverze.
Architektonické vzory v praxi
- Classic RAG: jeden dotaz → hybrid retrieval → 3–8 pasáží → LLM.
- Multi-hop RAG: postupné otázky, když je potřeba složit odpověď z více dokumentů.
- Toolformer RAG: LLM rozhoduje o voláních nástrojů (tabulkový výpočet, graf, překlad) vedle čtení zdrojů.
- Agentní RAG: plán → vyhledání → validace → syntéza → citace → kontrola kvality.
Optimalizace nákladů a výkonu
- Cache retrievalu: kešujte
(dotaz → kandidáti)s normalizovaným dotazem; invalidujte při velkých změnách indexu. - Prompt caching: často kladené otázky držte v krátkých odpovědích s referencemi.
- Kompresí kontextu: před generováním shrňte dlouhé pasáže (map-reduce summarization) a ponechejte citace.
- Rerank jen když je potřeba: u známých vzorů dotazů obejděte rerank nebo snižte počet kandidátů.
Obsahové požadavky na „být zdrojem pro RAG“
- Jasné definice a metodiky: citovatelné bloky s nadpisy a jednoznačnými tvrzeními.
- Strukturovaná data: tabulky, JSON/CSV exporty, DataDownload v schema.org.
- Verze a data: „platí od“, „revize“, changelog; aby LLM věděly, co je aktuální.
- Per-sekční URL: každá klíčová pasáž má vlastní odkaz a stabilní identifikátor.
Technická příprava webu pro AIO/AEO
- Schema.org: Article/TechArticle/HowTo s author, dateModified, citation, isBasedOn.
- Dataset sitemap: zahrňte datasety, CSV/JSON a jejich
lastmod. - Rychlost a dostupnost: CDN, stabilní 200/304 odpovědi, bez agresivních anti-bot bran pro veřejné zdroje.
- Licenční hlavičky:
X-Robots-Tagpro TDM, jasné podmínky použití.
Bezpečnost a ochrana před zneužitím
- Rate limiting a kvóty: chraňte zdroje, ale umožněte férový přístup asistentům.
- Signed URLs a hot-pathy: pro nákladné výpočty používejte krátkodobé podepsané odkazy.
- Detekce prompt-injection: čistěte pasáže od instrukcí pokoušejících se měnit chování modelu.
Příklady použití podle domény
- E-commerce: odpověď o kompatibilitě produktu s citací z technického listu a dostupnosti z API skladu.
- Právo a normy: generování s výběrem poslední účinné verze a jasným disclaimerem „špatné právní poradenství“.
- Zdravotnictví (neklinické): edukativní obsah s odkazy na směrnice a datum revize.
Kontrolní seznam pro nasazení RAG
- Máte hybridní retrieval s rerankingem a MMR?
- Jsou pasáže chunkovány semanticky, s metadata a stabilními URL?
- Vynucujete pravidlo „no-source → no-claim“ a generujete citace?
- Běží delta ingest a pravidelný re-embed podle volatility?
- Měříte Recall@k, groundedness a p95 latenci?
- Řešíte licence, TDM, PII a auditovatelnost?
RAG je praktický způsob, jak propojit sílu LLM s důvěryhodnými zdroji. V optimalizaci webů pro ChatGPT/LLM (AIO/AEO) přináší dvojí efekt: uživatelům poskytuje přesné, aktuální a citované odpovědi a vydavatelům umožňuje stát se „preferovanými“ zdroji. Kdo připraví obsah pro citování (struktura, metadata, verze, per-sekční URL) a nasadí robustní retrieval, získá náskok v éře odpovědového webu.



























