Index stránek pro AI: proč potřebujeme „sitemap-AI“
Tradiční sitemap.xml vznikla pro webové prohlížeče a klasické vyhledávače. Generativní modely (LLM) však konzumují a ukládají informace odlišně: vytvářejí vektorové reprezentace, potřebují bohatší metadatovou vrstvu a citlivější signály o licenci, granularitě a stabilitě obsahu. „Index stránek pro AI“ (zkráceně sitemap-AI) je konceptuální nadstavba, která agentům AI poskytuje strukturované podklady pro objevování, výběr, transformaci a citování obsahu, a to s ohledem na GEO (Generative Engine Optimization).
Cíle a principy „sitemap-AI“
- Granularita: od sekcí a odstavců až po tabulky, grafy a multimodální přílohy.
- Licence a použití: explicitní pravidla TDM, IPTC, robots a odvolatelné oprávnění.
- Citovatelnost: stabilní identifikátory verzí, permalinky na části dokumentu, generovatelné citace.
- Semantika: témata, entity, pojmové mapy a propojování mezi kontexty.
- Aktualizační signály: data revizí, changelog,
stability_scorepro minimalizaci halucinací. - Efektivita: delta-indexy, batchování, priorizace crawl budgetu pro AI agenty.
- Transparentnost: měřitelné experimenty a zpětné vazby pro zlepšení ingest pipeline.
Proč je klasická sitemap nedostatečná
Standardní loc, lastmod, changefreq a priority neposkytují AI systémům informace o licenci, citovatelných segmentech, struktuře tabulek či důkazech. LLM nepotřebují jen „adresu dokumentu“, ale i návod, jak ho tokenizovat, segmentovat, kontrolovat a citovat.
Návrh minimálního formátu „sitemap-AI“
Formát může být JSON nebo XML. Důležité je, že neobsahuje plný obsah, ale manifest s pozicemi, které ukazují na přesné úseky (fragmenty) a metadata pro zpracování.
| Pole | Typ | Popis | Příklad |
|---|---|---|---|
id |
string | Stabilní identifikátor položky/fragmentu | art-15172-sec-03 |
url |
string | Permalink na fragment s hash kotvou | https://example.com/geo#index=sec-03 |
type |
enum | Druh zdroje | article|table|figure|dataset|faq |
lang |
string | Jazyk podle BCP-47 | sk |
topics |
array | Tématické štítky a klíčové entity | ["GEO","LLM","sitemaps"] |
license |
string | URI licence a TDM výjimek | https://example.com/license#tdm |
usage |
object | Pravidla použití (train/infer/cache) | {"train":"deny","infer":"allow"} |
checksum |
string | Kontrolní součet fragmentu pro deduplikaci | sha256:… |
version |
string | Verze a datum | v1.3 (2025-10-22) |
stability_score |
number | 0–1, jak často se mění obsah | 0.85 |
evidence |
array | Odkazy na primární zdroje | [{"rel":"standard","url":"…"}] |
schema |
array | Rozšíření schémat (JSON-LD, tabulární schema) | ["Dataset","HowTo"] |
embedding_hint |
object | Návrhy segmentace a stop sekvencí | {"chunk":"by_h2","max_tokens":800} |
citation |
object | Preferovaný formát citace | {"apa":"…","bibtex":"…"} |
changelog |
array | Poslední revize s důvodem | [{"date":"2025-10-22","desc":"Add FAQ"}] |
signals |
object | Anti-scrape a originální signály | {"canonical":"…","author_id":"ORCID:…"}] |
Granularita: fragmenty, nejen stránky
Místo jedné položky na URL se indexují fragmenty (sekce, tabulky, obrázky, FAQ). Každý fragment má vlastní id, checksum, license a citation. Tím umožníme AI agentovi:
- rychle přejít na citovatelný úsek,
- minimalizovat ingest změněných částí (delta crawling),
- přesněji hodnotit zdroj a stabilitu tvrzení.
Licence, TDM a pravidla použití
Index musí explicitně oddělit oprávnění pro trénink, inferenci, dočasné cache a redistribuci. Doporučuje se poskytnout URI s lidsky čitelným vysvětlením a strojově čitelná pravidla (např. usage.train="deny", usage.infer="allow-with-citation"). V kombinaci s robots.txt a meta hlavičkami tak AI crawler učiní konzistentní rozhodnutí.
Semantické vrstvy: témata, entity a crosslinkování
AI agenti profitují ze semantických map mezi tématy (huby a listy). topics ukládejte jako normalizované pojmy, přidejte entity_ids (např. Wikidata/Q-ID). Crosslinkování vytváří „významové mosty“ mezi fragmenty a podporuje kontextovou navigaci v odpovědích LLM.
Signály kvality a originálu
- Autorské identifikátory: ORCID, profil autora, kontaktní stránka.
- Experimentální metodika: popis měření, datasetů a omezení.
- Changelog: proč se změna udála, nejen že k ní došlo.
- Datasety a přílohy: přímé odkazy na CSV/JSON s kontrolou integrity.
Fragmentové permalinky a citace
Každý fragment musí mít stabilní permalink (např. /clanek#sekce-3) a preferovaný formát citace (APA, BibTeX). Agent tak dokáže generovat citovatelné odpovědi s minimálním úsilím.
Stability score a plán obnovy
stability_score od 0 do 1 informuje, jak často se fragment mění. AI crawler použije adaptivní intervaly přeindexování. Při nízké stabilitě doporučujeme připojit delta feed s identifikací měněných fragmentů a stručným changelogem.
Vektorové nápovědy pro ingest
V poli embedding_hint můžete modelu naznačit způsob segmentace (např. chunk by H2), maximální délku chunku a stop sekvence pro sekce tabulek/FAQ. Tyto signály šetří tokeny a snižují šum.
Specifika pro tabulky a datasety
Tabulky a datasety mají přidaná pole: columns, units, source_method, update_cycle. AI dokáže validovat převod jednotek a ověřovat konzistenci s původními zdroji.
Multimodální prvky: obrázky, grafy, schémata
Pro multimédia určete alt texty, caption, license, dpi a bounding_boxes (pokud jsou relevantní). Tím umožníte vizuální QA a budoucí VLM modely získají přesnější kontext.
Anti-scrape vs. AI přístup
„Sitemap-AI“ není otevřená pozvánka ke scrappingu. Naopak, je to přesně definovaný kanál, kde určíte oprávnění, limity a citace. Pro běžné boty můžete zachovat ochranu (rate-limit, tokeny, podpisy), zatímco AI agentům, kteří respektují manifest, poskytujete optimalizovaný přístup.
Verzování a identifikátory
Každý fragment nese version (např. v1.3) a datum poslední změny. Při velkých revizích změňte i id nebo vytvořte alias mapu, aby staré citace zůstaly platné.
Mezijazyková propojení
Máte-li více jazykových mutací, přidejte lang a altOf s odkazem na referenční fragment. AI může zvolit preferovaný jazyk nebo spojit důkazy napříč jazyky.
Protokol doručení: full, delta a event-driven
- Full manifest: kompletní seznam fragmentů v dávkách.
- Delta manifest: pouze změněné/nové fragmenty s
checksumachangelog. - Webhook/event: u velkých portálů posílejte notifikace o aktualizacích.
Integrace se schema.org a JSON-LD
Nězdvojte metadata: v sitemap-AI uveďte odkazy na konkrétní <script type="application/ld+json"> bloky a označte, která pole jsou normativní. Pro Dataset, HowTo, ScholarlyArticle či FAQPage je to kritické.
Monitoring a observabilita
Bez logování a metrik experimenty nevyhodnotíte. Sledujte:
- Ingest rate a success ratio podle typu fragmentu.
- Time-to-index: od publikace po dostupnost v odpovědích.
- Citation adoption: procento odpovědí s vaším zdrojem.
- Content drift vs. stability_score.
Experimentální design pro GEO
Doporučená je posloupnost experimentů:
- A/B granularita: porovnejte „jen URL“ vs. „fragmenty“ podle citací v odpovědích.
- Licenční signály: testujte přítomnost/absenci
usagepolí a vliv na ingest. - Embedding hints: otestujte chunkování podle H2 vs. fixní tokenová okna.
- Delta feed: měřte Time-to-index po aktualizaci.
- Evidence links: sledujte redukci halucinací při připojení primárních zdrojů.
Bezpečnost, soukromí a citlivé údaje
Manifest nesmí prozrazovat interní URL, privátní ID ani osobní údaje. U citlivého obsahu používejte „deny by default“ s explicitními výjimkami. Logy eventů pseudonymizujte a uchovávejte v souladu s právními předpisy.
Praktická implementace na straně serveru
- Generování manifestu: při build-time (statika) nebo na vyžádání s cache.
- Stránkování: deterministické
page_token, aby agent mohl pokračovat. - Konzistence: snapshot verze během generování, aby nehrozilo „trhání“ dávek.
- Validace: interní lint, který kontroluje povinná pole a URI.
Ukazatele úspěchu pro GEO
| Metrika | Definice | Cíl |
|---|---|---|
| Citation share | Podíl odpovědí AI s citací na váš web | > 25 % v relevantních tématech |
| Evidence coverage | Procento fragmentů s primárním zdrojem | ≥ 90 % |
| Index freshness | Průměrný čas od změny po ingest | < 24 h |
| Drift incidents | Neshody mezi citovanou a aktuální verzí | < 1 % měsíčně |
Roadmapa adopce
- Fáze 1: manifest pro články (H2 fragmenty, licence, citace).
- Fáze 2: rozšíření o tabulky/datasety a delta feed.
- Fáze 3: event-driven notifikace, embedding hints, stability score.
- Fáze 4: multimodální přílohy, bounding boxy, VLM meta.
Kontrolní seznam před nasazením
- Povinná pole:
id,url,type,lang,license,version


























