RAG-ready web pro SEO optimalizaci pro ChatGPT: principy, architektura a implementační vzory
„RAG-ready web“ znamená, že vaše webová stránka je od základu navržena pro retrieval-augmented generation (RAG) – tedy pro scénář, kdy generativní model (jako ChatGPT) cíleně vyhledává, cituje a využívá vaše data při odpovědích. Cílem není jen klasická indexace, ale i přesná adresace odstavců, strojově čitelné citace, exportovatelné datasety a stabilní perma-linky na každou logickou sekci obsahu.
Proč „RAG-ready“ přístup patří do SEO pro ChatGPT
- Zvýšení šance na citaci: Modely preferují zdroje s jasnou strukturou, odkazovatelností a atribučnými metadaty.
- Kontrola kontextu: Díky jemné granularitě (ID sekcí, odstavce) model přebírá přesné pasáže místo volné parafráze.
- Měřitelnost: Perma-linky a dataset manifesty umožňují přesně sledovat, co se používá.
- Škálování: Jednotný formát exportů (CSV/JSONL/Parquet) zkracuje čas integrace kurátory a nástroji RAG.
Informační architektura: od dokumentu po odstavec
Vytvořte konzistentní hierarchii: korpus → dokument → sekce → odstavec → věta. Každá úroveň musí mít stabilní identifikátor a ukotvení v URL.
- Dokument: trvalé kanonické URL, verzování a metadata souboru (autor, licence, data).
- Sekce:
idu nadpisu druhé (a nižší) úrovně a interní odkaz#id-sekce. - Odstavec: krátké, sémanticky soudržné bloky s vlastním
ida kotvou (perma-linková ikona).
ID sekcí a perma-linky na odstavce: pravidla generování
- Deterministická tvorba: Slug z nadpisu/obsahu (např. kebab-case), bez diakritiky a s kontrolou kolizí.
- Stabilita v čase: Neměňte ID při drobných úpravách textu; při zásadním refaktoringu použijte
data-prev-ids přesměrováním. - Krátkost: Upřednostněte střídmá, čitelná ID (např.
sekce-navrh-rag,ods-citace-format). - Ikona kotvy: U každého nadpisu/odstavce zobrazte malou ikonu odkazu s přímou URL na dané
#id.
Perex a metadata pro vyhledávání i RAG
Každý dokument by měl mít krátký abstrakt a kompaktní metadata přímo v HTML i v JSON-LD. Perex vytváří kontext, metadata nesou strojově čitelné signály pro sběr a citování.
- HTML microdata:
articles atributyitemscope,itemtype(např. CreativeWork/Article). - JSON-LD:
headline,datePublished,version,isPartOf,about,license,citation,identifier. - Granularita: Doplňujte
hasPartseznam sekcí/odstavců s jejichurlatexthashem.
Datasety pro RAG: formáty, pole a granularita
Publikujte exporty, které kopírují vaši hierarchii. Minimální pole pro každý řádek (chunk):
doc_id: stabilní identifikátor dokumentu (např. UUID nebo deterministický hash kanonického URL).section_id: identifikátor sekce (slug/hash).para_id: identifikátor odstavce.url: úplný perma-link až na odstavechttps://…/dokument#para_id.titleasection_title: pro snadné zobrazení kontextu.text: čistý text bez HTML; ideálně s normalizací whitespace.tokens: volitelně počet tokenů; vhodné při plánování chunkování.lang: jazyková značka (BCP-47, např.cs).licenseaattribution: strojově čitelné licenční pravidla a text atribuce.hash: obsahový fingerprint (např. SHA-256 z normalizovanéhotext).updated_at: ISO 8601 čas poslední změny chunku.
Formáty: CSV (člověku čitelné, pozor na uvozovky), JSONL (standard pro RAG ingestion), Parquet (efektivní ukládání, vhodné pro rozsáhlé korpusy).
Chunkování pro RAG: strategie a limity
- Přirozené hranice: Primární chunk = odstavec; sekundární sloučení více krátkých odstavců do bloku s limitem tokenů.
- Tokenový limit: 256–512 tokenů na chunk je běžný kompromis mezi přesností a kontextem.
- Překryvy: 10–15 % překrytí mezi sousedními chunky zlepšuje koherenci při odpovědích modelu.
- Vyloučení: Oddělte navigační a právní pasáže (cookies, patičky), aby neskreslovaly retrieval.
Strojově čitelné citace: jak zajistit atribuci
Citace musí být konzistentní v HTML, JSON-LD i datasetech. Základní prvky citace:
- Autor/organizace s perzistentním identifikátorem (
identifier,sameAsna profil, např. ORCID/ISNI). - Datum vydání a aktualizace:
datePublished,dateModified. - Perma-URL na konkrétní odstavec nebo sekci.
- Licence (URI) a předepsaný atribučný text.
Udržujte i „Suggested citation“ blok s přesnou citací a tlačítkem „Kopírovat“ – pro lidi i nástroje.
Permalinková politika: kanonická URL, verze a přesměrování
- Kanonické URL: Nechť je od začátku finální a stabilní;
rel="canonical"v HTML i HTTP hlavičkách. - Verzování:
?v=parametry nepoužívejte pro obsah. Preferujte metadata verze v JSON-LD adateModified. Při velkých změnách můžete vystavit nový dokument se vztahemisBasedOnnebohasVersion. - Redirecty: 301 na nové umístění při změně struktury; zachovejte
#idfragmenty.
HTML značky a atributy, které pomáhají RAG
idadata-*: Každý<h2..h4>a<p>má mítid. Doplňkovédata-chunk-hash,data-updated-at,data-license.link rel="canonical"a volitelněrel="cite-as"(neoficiálně používané vzory) odkazují na perma-URL.- Breadcrumbs: Strukturovaná data pro kontext v hierarchii.
Manifesty a kontrolní součty: důvěra a deduplikace
Vystavte korpusový manifest (např. /dataset/manifest.json) s položkami pro každý dokument a jejich sekce:
- Obsahové hashe (např. SHA-256) pro dokument, sekce a odstavce – usnadňují detekci změn.
- Časové razítka:
published_at,modified_at. - Mapování starých→nových ID při refaktoringu.
XML sitemapy a feedy optimalizované pro RAG
- Standardní sitemap s granularitou po dokumentech a bohatým
<lastmod>. - Index dokumentů pro datasety: odkaz na CSV/JSONL export, manifest a licenci.
- Atom/RSS feedy
- Per-entry linky na sekce (pokud měníte konkrétní sekci, publikujte záznam s
linkna daný#id).
Licencování a atribučná pravidla pro bezpečné použití
- Machine-readable licence (URI), stručné podmínky (např. CC BY 4.0) a předepsaná citace v datasetech i HTML.
- Právní minimum: Jasně definujte omezení (např. zákaz redistribuce surového korpusu bez souhlasu).
- Pole v datasetu:
license,attribution,terms_url.
Příprava na embeddingy: čistota textu a normalizace
- Odstranění šumu: Navigace, skripty, reklamy – označte a v exportech vynechejte.
- Normalizace: Unifikujte uvozovky, mezery, odrážky; konzistentní diakritika.
- Jazykové značky:
langna elementu i v datasetu – důležité pro vícejazyčné korpusy.
Překlady a paralelní korpusy
- Propojení mezi jazyky:
inLanguage,translationOfWork,workTranslationv JSON-LD. - Stejná granularita: Zrcadlete strukturu sekcí/odstavců – usnadníte cross-lingual retrieval.
Verzování dokumentů a odstavců: auditovatelnost
- Semver-like pole
versionv JSON-LD; při major změně nové perma-URL nebo explicitníhasVersion. - Changelog dostupný přes
link rel="alternate" type="application/json"s diffy hashů odstavců.
Monitoring a metriky „RAG-readiness“
- Coverage: % dokumentů se sekčními a odstavcovými
ida perma-linkami. - Dataset freshness: průměrný rozdíl mezi
modified_atna webu a v exportu. - Chunk quality: distribuce délek, tokenů a poměr překryvů.
- Citation hit-rate: počet externích citací odkazujících na
#idfragmenty.
Bezpečnost a anti-scrape při zachování RAG funkčnosti
- Rate-limity a robot policy: Chraňte server, ale neblokujte legitimní sběrače exportů a sitemap.
- Obsahové hashe: Usnadňují deduplikaci a dokazování původu; vhodné i pro partnery.
- Digitální podpisy: Volitelné podepisování exportů (např. detached signature) pro integritu.
UX vzory pro perma-linky a citace
- Hover/Focus odhalení ikony kotvy u nadpisů a odstavců.
- Kopírovací tlačítko u citace a u ID odstavce; zkopíruje přesnou URL
#para_id. - „Link to this“ akce po výběru textu – vygeneruje URL s
#para_ida volitelným?q=pro zvýraznění.
Praktický exportní balíček
/dataset/manifest.json: index dokumentů, verze, per-doc a per-section hashe./dataset/corpus.jsonl: jeden řádek = chunk (odstavec), pole popsaná výše./dataset/corpus.parquet: stejná schéma pro velké ingestion pipeline./dataset/LICENSE: podmínky použití, atribuce, kontaktní bod.
On-page SEO pro ChatGPT a RAG
- H2/H3 hierarchie s jednoznačnými názvy sekcí.
- Entity-rich text: pojmenované entity s odkazy na autoritativní zdroje (
sameAsv JSON-LD). - Interní prolinkování: seznam „Související odstavce“ s přímými linky na
#id.
Implementační 30-60-90 plán
- 0–30 dní: Audit kanonických URL, generování
idpro sekce/odstavce, UI kotvy, základní JSON-LD a sitemap. - 31–60 dní: Datasety (JSONL/Parquet), manifest s hashy, per-section citace,


























