RAG (retrieval-augmented generation)

Co je RAG a proč mění pravidla hry

Retrieval-Augmented Generation (RAG) je architektura, ve které velký jazykový model (LLM) generuje odpověď teprve poté, co na základě uživatelského dotazu vyhledá relevantní fakta v externích zdrojích. Spojení vyhledávání a generování zásadně snižuje halucinace, zlepšuje aktuálnost a umožňuje citovat zdroje. V kontextu optimalizace webů pro ChatGPT/LLM (AIO/AEO) a moderního SEO je RAG mostem mezi autoritativním obsahem na webu a modely, které odpovědi zprostředkovávají.

Komponenty RAG: end-to-end pohled

  • Ingest a normalizace: extrakce z HTML/API/CSV/PDF, čištění, deduplikace, generování metadat.
  • Indexace: vektorový index (embeddingy) + textový index (BM25) + metadatové filtry.
  • Retrieval: výběr pasáží podle dotazu (dense, sparse, hybridní), reranking a diverzifikace.
  • Orchestrace promptu: vložení vybraných pasáží a instrukcí do systému (templating, role).
  • Generování s citacemi: LLM tvoří odpověď, odkazuje na source_url, shrnuje a uvádí omezení.
  • Feedback a monitoring: měření kvality, výpadků, latence, aktualizace indexu (freshness).

Propojení s AIO/AEO a moderním SEO

RAG posouvá SEO od klíčových slov k citovatelným faktům a dostupným datům. Pro vlastníky webů je cíl jasný: poskytovat strojově čitelný, stabilně adresovatelný a licencovaný obsah, který lze bezpečně načíst do RAG řetězců asistentů. Pro marketéry to znamená měřit share-of-voice v AI odpovědích a optimalizovat sourceability (schopnost být vybrán jako zdroj).

Ingest: z HTML k čistým pasážím

  • Extrahujte „content_text“: verzi bez navigace, reklamy a boilerplate; originál uchovejte pro citaci.
  • Stabilní URL a kotvy: generujte per-sekční kotvy (#kapitola-tema) pro hluboké citace.
  • Normalizujte jednotky a data: ISO 8601, SI jednotky, míry a lokální formáty vyznačte v metadatech.
  • Odstraňte duplicity: kanonikalizujte verze, jazykové mutace propojíte přes hreflang.

Chunking a kontextová okna

  • Velikost chunku: 300–1 200 tokenů podle domény; kratší pro definice, delší pro metodiky.
  • Překryv: 10–20 % pro zachování souvislostí (slovníky pojmů, vzorce, definice).
  • Semantický vs. pevný chunking: segmentujte podle nadpisů a logických celků, nikoli fixní délky.
  • Bohatá metadata: jazyk, autor, datum, verze, typ obsahu, schéma kategorií, licenční omezení.

Embeddingy a indexy: hybrid je základ

  • Dense (vektorové) vyhledávání: zachytí sémantiku, synonyma, parafráze.
  • Sparse (BM25): přesná klíčová slova, kódy norem, zkratky, čísla modelů.
  • Hybrid: spojte skóre (např. vážený součet) a aplikujte MMR nebo diversifikaci, aby bylo pokryto více úhlů pohledu.
  • Reranking: malý cross-encoder na 10–50 kandidátů výrazně zvyšuje přesnost top-k.

Retrieval: od dotazu k důkazům

  • Query reformulation: přejmenování nejednoznačných dotazů (agent „query-rewriter“).
  • Filtry a facetová pole: obor/jazyk/rok; u norem a zákonů je filtr na verzi nutností.
  • Temporal awareness: upřednostněte novější verze (pole valid_from, valid_to) ale zachovejte historické citace.
  • Citovatelné snippety: vraťte URL + kotvu + krátký úryvek (2–3 věty) jako evidence.

Orchestrace promptu a řízení generování

  • Instrukce pro „grounded answers“: model smí tvrdit pouze to, co je podpořeno v důkazech; jinak má odpovědět „nevím“ + doporučit další zdroje.
  • Striktní citace: u každého tvrzení s čísly/terminologií přiložte [1]… s URL a verzí dokumentu.
  • Formát odpovědi: nejprve stručná odpověď, poté zdůvodnění a citace, nakonec omezení a datum platnosti.
  • Kontrola délky: přizpůsobte výstup 50/150/300-slovným režimům pro „answer-first“ spotřebu.

Minimalizace halucinací

  • Strict mode: vynucujte „no-source → no-claim“; pokud důkaz chybí, požadujte doplňující vyhledávání.
  • Konflikt zdrojů: při rozporu uveďte obě verze, data a vysvětlení, která platí (lex posterior, lex specialis).
  • Numerické fakty: požadujte shodu alespoň ve dvou nezávislých pasážích nebo v primární tabulce.

Aktuálnost: freshness, delta a reindex

  • Delta ingest: zpracujte pouze změněné dokumenty podle ETag nebo last_modified.
  • Priority fronty: preferujte autoritativní domény, sekce „novinky“, changelogy, ceníky a normy.
  • Expirace embeddingů: re-embed po změně nebo po době (např. 30–90 dní) podle volatility domény.

Licence, TDM a compliance

  • Legální přístup: respektujte autorská práva, licence (CC-BY, ODbL) a TDM výjimky.
  • PII a citlivá data: odstraňujte osobní údaje z indexu; logy pseudonymizujte.
  • Auditovatelnost: ukládejte verzi zdroje, čas retrievalu a hash pasáže pro následné ověření.

UX výstupu: jak servírovat odpověď

  • Answer-first: 1–2 věty shrnutí, poté „Jak jsme na to přišli“ se zdroji.
  • Citace s kotvami: místo odkazu na úvodní stránku odkazujte přímo na sekci; zobrazujte název dokumentu a datum.
  • Stupeň jistoty: odhad důvěry (např. nízký/střední/vysoký) podle skóre retrievalu a počtu shodujících se zdrojů.

Měření kvality RAG (KPI a offline/online evaluace)

  • Retrieval Recall@k: zda se v top-k nachází pasáž s odpovědí (gold label).
  • Groundedness/Attribution: podíl tvrzení podložených citacemi, penalizace za „unattributed claims“.
  • Factuality/Exact Match: shoda čísel, definic a závěrů s referencí.
  • Latency p95: čas od dotazu po odpověď; sledujte zvlášť vyhledávání, rerank, generování.
  • Úspěšnost na straně uživatele: kliky na zdroje, „was this helpful“, následné akce a konverze.

Architektonické vzory v praxi

  • Classic RAG: jeden dotaz → hybrid retrieval → 3–8 pasáží → LLM.
  • Multi-hop RAG: postupné otázky, když je potřeba složit odpověď z více dokumentů.
  • Toolformer RAG: LLM rozhoduje o voláních nástrojů (tabulkový výpočet, graf, překlad) vedle čtení zdrojů.
  • Agentní RAG: plán → vyhledání → validace → syntéza → citace → kontrola kvality.

Optimalizace nákladů a výkonu

  • Cache retrievalu: kešujte (dotaz → kandidáti) s normalizovaným dotazem; invalidujte při velkých změnách indexu.
  • Prompt caching: často kladené otázky držte v krátkých odpovědích s referencemi.
  • Kompresí kontextu: před generováním shrňte dlouhé pasáže (map-reduce summarization) a ponechejte citace.
  • Rerank jen když je potřeba: u známých vzorů dotazů obejděte rerank nebo snižte počet kandidátů.

Obsahové požadavky na „být zdrojem pro RAG“

  • Jasné definice a metodiky: citovatelné bloky s nadpisy a jednoznačnými tvrzeními.
  • Strukturovaná data: tabulky, JSON/CSV exporty, DataDownload v schema.org.
  • Verze a data: „platí od“, „revize“, changelog; aby LLM věděly, co je aktuální.
  • Per-sekční URL: každá klíčová pasáž má vlastní odkaz a stabilní identifikátor.

Technická příprava webu pro AIO/AEO

  • Schema.org: Article/TechArticle/HowTo s author, dateModified, citation, isBasedOn.
  • Dataset sitemap: zahrňte datasety, CSV/JSON a jejich lastmod.
  • Rychlost a dostupnost: CDN, stabilní 200/304 odpovědi, bez agresivních anti-bot bran pro veřejné zdroje.
  • Licenční hlavičky: X-Robots-Tag pro TDM, jasné podmínky použití.

Bezpečnost a ochrana před zneužitím

  • Rate limiting a kvóty: chraňte zdroje, ale umožněte férový přístup asistentům.
  • Signed URLs a hot-pathy: pro nákladné výpočty používejte krátkodobé podepsané odkazy.
  • Detekce prompt-injection: čistěte pasáže od instrukcí pokoušejících se měnit chování modelu.

Příklady použití podle domény

  • E-commerce: odpověď o kompatibilitě produktu s citací z technického listu a dostupnosti z API skladu.
  • Právo a normy: generování s výběrem poslední účinné verze a jasným disclaimerem „špatné právní poradenství“.
  • Zdravotnictví (neklinické): edukativní obsah s odkazy na směrnice a datum revize.

Kontrolní seznam pro nasazení RAG

  • Máte hybridní retrieval s rerankingem a MMR?
  • Jsou pasáže chunkovány semanticky, s metadata a stabilními URL?
  • Vynucujete pravidlo „no-source → no-claim“ a generujete citace?
  • Běží delta ingest a pravidelný re-embed podle volatility?
  • Měříte Recall@k, groundedness a p95 latenci?
  • Řešíte licence, TDM, PII a auditovatelnost?

RAG je praktický způsob, jak propojit sílu LLM s důvěryhodnými zdroji. V optimalizaci webů pro ChatGPT/LLM (AIO/AEO) přináší dvojí efekt: uživatelům poskytuje přesné, aktuální a citované odpovědi a vydavatelům umožňuje stát se „preferovanými“ zdroji. Kdo připraví obsah pro citování (struktura, metadata, verze, per-sekční URL) a nasadí robustní retrieval, získá náskok v éře odpovědového webu.