Index stránek pro AI: proč potřebujeme „sitemap-AI“
Tradiční sitemap.xml vznikly pro webové prohlížeče a klasické vyhledávače. Generativní modely (LLM) však zpracovávají a uchovávají informace jinak: vytvářejí vektorové reprezentace, potřebují bohatší vrstvu metadat a přesnější signály o licenci, granularitě a stabilitě obsahu. „Index stránek pro AI“ (zkráceně sitemap-AI) je konceptuální nadstavba, která poskytuje AI agentům strukturované podklady pro objevování, výběr, transformaci a citování obsahu s ohledem na GEO (Generative Engine Optimization).
Cíle a principy „sitemap-AI“
- Granularita: od sekcí a odstavců až po tabulky, grafy a multimodální přílohy.
- Licence a použití: explicitní pravidla TDM, IPTC, robots a odvolatelná povolení.
- Citovatelnost: stabilní identifikátory verzí, permalinky na části dokumentu, generovatelné citace.
- Semantika: témata, entity, pojmové mapy a prolinkování mezi kontexty.
- Aktualizační signály: data revizí, changelog,
stability_scorepro minimalizaci halucinací. - Efektivita: delta indexy, dávky, priorizace crawl budgetu pro AI agenty.
- Transparentnost: měřitelné experimenty a zpětné vazby pro zlepšování ingest pipeline.
Proč je klasická sitemap nedostačující
Standardní loc, lastmod, changefreq a priority neposkytují AI systémům informace o licenci, citovatelných segmentech, struktuře tabulek či důkazech. LLM nepotřebují jen „adresu dokumentu“, ale také návod, jak ho tokenizovat, segmentovat, kontrolovat a citovat.
Návrh minimálního formátu „sitemap-AI“
Formát může být JSON nebo XML. Důležité je, že neobsahuje plný obsah, ale manifest s pozicemi, které ukazují na přesné úseky (fragmenty) a metadata pro zpracování.
| Pole | Typ | Popis | Příklad |
|---|---|---|---|
id |
string | Stabilní identifikátor položky/fragmentu | art-15172-sec-03 |
url |
string | Permalink na fragment s hash kotvou | https://example.com/geo#index=sec-03 |
type |
enum | Druh zdroje | article|table|figure|dataset|faq |
lang |
string | Jazyk podle BCP-47 | sk |
topics |
array | Tématické štítky a klíčové entity | ["GEO","LLM","sitemaps"] |
license |
string | URI licence a TDM výjimek | https://example.com/license#tdm |
usage |
object | Pravidla použití (train/infer/cache) | {"train":"deny","infer":"allow"} |
checksum |
string | Kontrolní součet fragmentu pro deduplikaci | sha256:… |
version |
string | Verze a datum | v1.3 (2025-10-22) |
stability_score |
number | 0–1, jak často se obsah mění | 0.85 |
evidence |
array | Odkazy na primární zdroje | [{"rel":"standard","url":"…"}] |
schema |
array | Rozšíření schémat (JSON-LD, tabulární schéma) | ["Dataset","HowTo"] |
embedding_hint |
object | Návrhy segmentace a stop sekvencí | {"chunk":"by_h2","max_tokens":800} |
citation |
object | Preferovaný formát citace | {"apa":"…","bibtex":"…"} |
changelog |
array | Poslední revize s důvodem | [{"date":"2025-10-22","desc":"Add FAQ"}] |
signals |
object | Anti-scrape a originální signály | {"canonical":"…","author_id":"ORCID:…"}] |
Granularita: fragmenty, ne jen stránky
Místo jedné položky na URL se indexují fragmenty (sekce, tabulky, obrázky, FAQ). Každý fragment má vlastní id, checksum, license a citation. Tím umožníme AI agentovi:
- rychle přeskočit na citovatelný úsek,
- minimalizovat ingest měněných částí (delta crawling),
- přesněji vyhodnocovat zdroj a stabilitu tvrzení.
Licence, TDM a pravidla použití
Index musí explicitně oddělit povolení pro trénink, inferenci, dočasné cache a redistribuci. Doporučuje se poskytnout URI s lidsky čitelným vysvětlením a strojově čitelná pravidla (např. usage.train="deny", usage.infer="allow-with-citation"). Ve spojení s robots.txt a meta hlavičkami tak AI crawler učiní konzistentní rozhodnutí.
Semantické vrstvy: témata, entity a pro-crosslinking
AI agenti profitují ze semantických map mezi tématy (huby a leafy). topics ukládejte jako normalizované pojmy, přidejte entity_ids (např. Wikidata/Q-ID). Pro-crosslinking vytváří „významové mosty“ mezi fragmenty a podporuje kontextovou navigaci v odpovědích LLM.
Signály kvality a originálu
- Autorské identifikátory: ORCID, profil autora, kontaktní stránka.
- Experimentální metodika: popis měření, datasetů a limitací.
- Changelog: proč se změna stala, nejen že se stala.
- Datasety a přílohy: přímé odkazy na CSV/JSON s kontrolou integrity.
Fragmentové permalinky a citace
Každý fragment musí mít stabilní permalink (např. /clanek#sekce-3) a preferovaný formát citace (APA, BibTeX). Agent tak dokáže generovat citovatelné odpovědi s minimálním třením.
Stability score a plán obnovy
stability_score od 0 do 1 informuje, jak často se fragment mění. AI crawler použije adaptivní intervaly reindexace. Při nízké stabilitě doporučujeme připojit delta feed s identifikací měněných fragmentů a stručným changelogem.
Vektorové nápovědy pro ingest
V poli embedding_hint můžete modelu naznačit způsob segmentace (např. chunk by H2), maximální délku chunku a stop sekvence pro sekce tabulky/FAQ. Tyto signály šetří tokeny a snižují šum.
Specifika pro tabulky a datasety
Tabulky a datasety mají přidaná pole: columns, units, source_method, update_cycle. AI dokáže validovat převod jednotek a ověřovat konzistenci s původními zdroji.
Multimodální prvky: obrázky, grafy, schémata
Pro multimédia určete alt texty, caption, licence, dpi a bounding_boxes (je-li relevantní). Tím umožníte vizuální QA a budoucí VLM modely získají přesnější kontext.
Anti-scrape vs. AI přístup
„Sitemap-AI“ není otevřená pozvánka ke scrapingu. Naopak, je to přesně definovaný kanál, kde určíte povolení, limity a citace. Pro běžné boty můžete zachovat ochranu (rate-limit, tokeny, podpisy), zatímco AI agentům, kteří respektují manifest, poskytnete optimalizovaný přístup.
Verzování a identifikátory
Každý fragment nese version (např. v1.3) a datum poslední změny. Při větších revizích změňte i id nebo vytvořte alias mapu, aby staré citace zůstaly platné.
Mezijazyková propojení
Máte-li více jazykových mutací, přidejte lang a altOf s odkazem na referenční fragment. AI může zvolit preferovaný jazyk nebo spojit důkazy napříč jazyky.
Protokol doručení: full, delta a event-driven
- Full manifest: kompletní seznam fragmentů v dávkách.
- Delta manifest: pouze změněné/nové fragmenty s
checksumachangelog. - Webhook/event: u velkých portálů posílejte notifikace o aktualizacích.
Integrace se schema.org a JSON-LD
Nezdvojte metadata: v sitemap-AI uveďte odkazy na konkrétní <script type="application/ld+json"> bloky a označte, která pole jsou normativní. Pro Dataset, HowTo, ScholarlyArticle či FAQPage je to kritické.
Monitoring a observabilita
Bez logování a metrik experimenty nevyhodnotíte. Sledujte:
- Ingest rate a success ratio podle typu fragmentu.
- Time-to-index: čas od publikace po dostupnost v odpovědích.
- Citation adoption: podíl odpovědí s vaším zdrojem.
- Content drift vs. stability_score.
Experimentální design pro GEO
Doporučená posloupnost experimentů:
- A/B granularita: porovnejte „jen URL“ vs. „fragmenty“ na základě citací v odpovědích.
- Licenční signály: testujte přítomnost/nepřítomnost
usagepolí a vliv na ingest. - Embedding hints: otestujte chunkování podle H2 vs. fixní tokenová okna.
- Delta feed: měřte Time-to-index po aktualizaci.
- Evidence links: sledujte snížení halucinací při připojení primárních zdrojů.
Bezpečnost, soukromí a citlivosti
Manifest nesmí odhalovat interní URL, privátní ID ani osobní údaje. U citlivého obsahu používejte „deny by default“ s explicitními výjimkami. Logy událostí pseudonymizujte a uchovávejte v souladu s právními předpisy.
Praktická implementace na straně serveru
- Generování manifestu: při build-time (statický) nebo on-demand s cache.
- Stránkování: deterministické
page_tokeny, aby agent věděl, kde pokračovat. - Konzistence: snapshot verze během generování, aby se předešlo „trhání“ dávek.
- Validace: interní lint kontrolující povinná pole a URI.
Ukazatele úspěchu pro GEO
| Metrika | Definice | Cíl |
|---|---|---|
| Citation share | Podíl odpovědí AI s citací na váš web | > 25 % v relevantních tématech |
| Evidence coverage | Procento fragmentů s primárním zdrojem | ≥ 90 % |
| Index freshness | Průměrná doba od změny po ingest | < 24 h |
| Drift incidents | Neshody mezi citovanou a aktuální verzí | < 1 % měsíčně |
Roadmapa adopce
- Fáze 1: manifest pro články (H2 fragmenty, licence, citace).
- Fáze 2: rozšíření o tabulky/datasety a delta feed.
- Fáze 3: event-driven notifikace, embedding hints, stability score.
- Fáze 4: multimodální přílohy, bounding boxy, VLM meta.
Kontrolní seznam před nasazením
- Povinná pole:
id,url,type,lang,


























