Web optimalizovaný pro RAG

RAG-ready web pro SEO optimalizaci pro ChatGPT: principy, architektura a implementační vzory

„RAG-ready web“ znamená, že vaše webová stránka je od základu navržena pro retrieval-augmented generation (RAG) – tedy pro scénář, kdy generativní model (jako ChatGPT) cíleně vyhledává, cituje a využívá vaše data při odpovědích. Cílem není jen klasická indexace, ale i přesná adresace odstavců, strojově čitelné citace, exportovatelné datasety a stabilní perma-linky na každou logickou sekci obsahu.

Proč „RAG-ready“ přístup patří do SEO pro ChatGPT

  • Zvýšení šance na citaci: Modely preferují zdroje s jasnou strukturou, odkazovatelností a atribučnými metadaty.
  • Kontrola kontextu: Díky jemné granularitě (ID sekcí, odstavce) model přebírá přesné pasáže místo volné parafráze.
  • Měřitelnost: Perma-linky a dataset manifesty umožňují přesně sledovat, co se používá.
  • Škálování: Jednotný formát exportů (CSV/JSONL/Parquet) zkracuje čas integrace kurátory a nástroji RAG.

Informační architektura: od dokumentu po odstavec

Vytvořte konzistentní hierarchii: korpus → dokument → sekce → odstavec → věta. Každá úroveň musí mít stabilní identifikátor a ukotvení v URL.

  • Dokument: trvalé kanonické URL, verzování a metadata souboru (autor, licence, data).
  • Sekce: id u nadpisu druhé (a nižší) úrovně a interní odkaz #id-sekce.
  • Odstavec: krátké, sémanticky soudržné bloky s vlastním id a kotvou (perma-linková ikona).

ID sekcí a perma-linky na odstavce: pravidla generování

  • Deterministická tvorba: Slug z nadpisu/obsahu (např. kebab-case), bez diakritiky a s kontrolou kolizí.
  • Stabilita v čase: Neměňte ID při drobných úpravách textu; při zásadním refaktoringu použijte data-prev-id s přesměrováním.
  • Krátkost: Upřednostněte střídmá, čitelná ID (např. sekce-navrh-rag, ods-citace-format).
  • Ikona kotvy: U každého nadpisu/odstavce zobrazte malou ikonu odkazu s přímou URL na dané #id.

Perex a metadata pro vyhledávání i RAG

Každý dokument by měl mít krátký abstrakt a kompaktní metadata přímo v HTML i v JSON-LD. Perex vytváří kontext, metadata nesou strojově čitelné signály pro sběr a citování.

  • HTML microdata: article s atributy itemscope, itemtype (např. CreativeWork/Article).
  • JSON-LD: headline, datePublished, version, isPartOf, about, license, citation, identifier.
  • Granularita: Doplňujte hasPart seznam sekcí/odstavců s jejich url a text hashem.

Datasety pro RAG: formáty, pole a granularita

Publikujte exporty, které kopírují vaši hierarchii. Minimální pole pro každý řádek (chunk):

  • doc_id: stabilní identifikátor dokumentu (např. UUID nebo deterministický hash kanonického URL).
  • section_id: identifikátor sekce (slug/hash).
  • para_id: identifikátor odstavce.
  • url: úplný perma-link až na odstavec https://…/dokument#para_id.
  • title a section_title: pro snadné zobrazení kontextu.
  • text: čistý text bez HTML; ideálně s normalizací whitespace.
  • tokens: volitelně počet tokenů; vhodné při plánování chunkování.
  • lang: jazyková značka (BCP-47, např. cs).
  • license a attribution: strojově čitelné licenční pravidla a text atribuce.
  • hash: obsahový fingerprint (např. SHA-256 z normalizovaného text).
  • updated_at: ISO 8601 čas poslední změny chunku.

Formáty: CSV (člověku čitelné, pozor na uvozovky), JSONL (standard pro RAG ingestion), Parquet (efektivní ukládání, vhodné pro rozsáhlé korpusy).

Chunkování pro RAG: strategie a limity

  • Přirozené hranice: Primární chunk = odstavec; sekundární sloučení více krátkých odstavců do bloku s limitem tokenů.
  • Tokenový limit: 256–512 tokenů na chunk je běžný kompromis mezi přesností a kontextem.
  • Překryvy: 10–15 % překrytí mezi sousedními chunky zlepšuje koherenci při odpovědích modelu.
  • Vyloučení: Oddělte navigační a právní pasáže (cookies, patičky), aby neskreslovaly retrieval.

Strojově čitelné citace: jak zajistit atribuci

Citace musí být konzistentní v HTML, JSON-LD i datasetech. Základní prvky citace:

  • Autor/organizace s perzistentním identifikátorem (identifier, sameAs na profil, např. ORCID/ISNI).
  • Datum vydání a aktualizace: datePublished, dateModified.
  • Perma-URL na konkrétní odstavec nebo sekci.
  • Licence (URI) a předepsaný atribučný text.

Udržujte i „Suggested citation“ blok s přesnou citací a tlačítkem „Kopírovat“ – pro lidi i nástroje.

Permalinková politika: kanonická URL, verze a přesměrování

  • Kanonické URL: Nechť je od začátku finální a stabilní; rel="canonical" v HTML i HTTP hlavičkách.
  • Verzování: ?v= parametry nepoužívejte pro obsah. Preferujte metadata verze v JSON-LD a dateModified. Při velkých změnách můžete vystavit nový dokument se vztahem isBasedOn nebo hasVersion.
  • Redirecty: 301 na nové umístění při změně struktury; zachovejte #id fragmenty.

HTML značky a atributy, které pomáhají RAG

  • id a data-*: Každý <h2..h4> a <p> má mít id. Doplňkové data-chunk-hash, data-updated-at, data-license.
  • link rel="canonical" a volitelně rel="cite-as" (neoficiálně používané vzory) odkazují na perma-URL.
  • Breadcrumbs: Strukturovaná data pro kontext v hierarchii.

Manifesty a kontrolní součty: důvěra a deduplikace

Vystavte korpusový manifest (např. /dataset/manifest.json) s položkami pro každý dokument a jejich sekce:

  • Obsahové hashe (např. SHA-256) pro dokument, sekce a odstavce – usnadňují detekci změn.
  • Časové razítka: published_at, modified_at.
  • Mapování starých→nových ID při refaktoringu.

XML sitemapy a feedy optimalizované pro RAG

  • Standardní sitemap s granularitou po dokumentech a bohatým <lastmod>.
  • Index dokumentů pro datasety: odkaz na CSV/JSONL export, manifest a licenci.
  • Atom/RSS feedy
  • Per-entry linky na sekce (pokud měníte konkrétní sekci, publikujte záznam s link na daný #id).

Licencování a atribučná pravidla pro bezpečné použití

  • Machine-readable licence (URI), stručné podmínky (např. CC BY 4.0) a předepsaná citace v datasetech i HTML.
  • Právní minimum: Jasně definujte omezení (např. zákaz redistribuce surového korpusu bez souhlasu).
  • Pole v datasetu: license, attribution, terms_url.

Příprava na embeddingy: čistota textu a normalizace

  • Odstranění šumu: Navigace, skripty, reklamy – označte a v exportech vynechejte.
  • Normalizace: Unifikujte uvozovky, mezery, odrážky; konzistentní diakritika.
  • Jazykové značky: lang na elementu i v datasetu – důležité pro vícejazyčné korpusy.

Překlady a paralelní korpusy

  • Propojení mezi jazyky: inLanguage, translationOfWork, workTranslation v JSON-LD.
  • Stejná granularita: Zrcadlete strukturu sekcí/odstavců – usnadníte cross-lingual retrieval.

Verzování dokumentů a odstavců: auditovatelnost

  • Semver-like pole version v JSON-LD; při major změně nové perma-URL nebo explicitní hasVersion.
  • Changelog dostupný přes link rel="alternate" type="application/json" s diffy hashů odstavců.

Monitoring a metriky „RAG-readiness“

  • Coverage: % dokumentů se sekčními a odstavcovými id a perma-linkami.
  • Dataset freshness: průměrný rozdíl mezi modified_at na webu a v exportu.
  • Chunk quality: distribuce délek, tokenů a poměr překryvů.
  • Citation hit-rate: počet externích citací odkazujících na #id fragmenty.

Bezpečnost a anti-scrape při zachování RAG funkčnosti

  • Rate-limity a robot policy: Chraňte server, ale neblokujte legitimní sběrače exportů a sitemap.
  • Obsahové hashe: Usnadňují deduplikaci a dokazování původu; vhodné i pro partnery.
  • Digitální podpisy: Volitelné podepisování exportů (např. detached signature) pro integritu.

UX vzory pro perma-linky a citace

  • Hover/Focus odhalení ikony kotvy u nadpisů a odstavců.
  • Kopírovací tlačítko u citace a u ID odstavce; zkopíruje přesnou URL #para_id.
  • „Link to this“ akce po výběru textu – vygeneruje URL s #para_id a volitelným ?q= pro zvýraznění.

Praktický exportní balíček

  • /dataset/manifest.json: index dokumentů, verze, per-doc a per-section hashe.
  • /dataset/corpus.jsonl: jeden řádek = chunk (odstavec), pole popsaná výše.
  • /dataset/corpus.parquet: stejná schéma pro velké ingestion pipeline.
  • /dataset/LICENSE: podmínky použití, atribuce, kontaktní bod.

On-page SEO pro ChatGPT a RAG

  • H2/H3 hierarchie s jednoznačnými názvy sekcí.
  • Entity-rich text: pojmenované entity s odkazy na autoritativní zdroje (sameAs v JSON-LD).
  • Interní prolinkování: seznam „Související odstavce“ s přímými linky na #id.

Implementační 30-60-90 plán

  • 0–30 dní: Audit kanonických URL, generování id pro sekce/odstavce, UI kotvy, základní JSON-LD a sitemap.
  • 31–60 dní: Datasety (JSONL/Parquet), manifest s hashy, per-section citace,