Co je „canonical stránka pro téma“ a proč je klíčová v GEO
Canonical stránka pro téma (dále jen „CST“) je autoritativní, jednoznačný a stabilní zdroj znalostí pro konkrétní téma, který slouží jako primární uzel pro generativní modely i pro lidi. V kontextu Generative Engine Optimization (GEO) je cílem CST snížit neurčitost, poskytnout strojově čitelné struktury a zajistit reprodukovatelné odpovědi napříč kanály a modely. CST je optimalizována pro: (a) přesnost a auditovatelnost, (b) kompozici do odpovědí LLM, (c) interní konzistenci v rámci znalostního grafu.
Hlavní principy návrhu CST
- Jednoznačnost a disambiguace: jasné vymezení hranic tématu, alternativních názvů, souvisejících pojmů a rozlišujících znaků.
- Stabilita URI: trvalá, verzionovaná adresa s politikou přesměrování a bez kolize s jazykovými mutacemi.
- Rozložitelnost: modularizované bloky, které lze spolehlivě citovat a extrahovat do promptů.
- Strojová sémantika: použití schema.org, JSON-LD, mikroformátů a kontrolovaných slovníků.
- Měřitelnost: jasné metriky kvality, úplnosti a čerstvosti.
Architektura a informační model CST
Doporučená architektura vychází z vrstev:
- Identita tématu (Core Identity): název, definice, rozsah, alternativní názvy (synonyma), odlišení od blízkých témat.
- Znalostní tvrzení (Claims): evidovatelné věty s atributy zdroje, data a úrovně jistoty.
- Kontext a rámce (Contexts): použití v doménách, příklady, proti-příklady, okrajové případy.
- Operacionalizace (Tasks & Prompts): vzory promptů, kontrolní seznamy, rozhodovací stromy.
- Propojení (Graph Links): nadřazená/podřazená témata, příbuzná témata, entity, taxonomie.
- Metadat a governance: verze, kurátoři, SLA, licence, datum poslední revize.
Standardní struktura CST: doporučené sekce
- Definice a rozsah: stručná, normativní definice (max. 2–3 věty) a vymezené hranice.
- Disambiguace: tabulka rozdílů oproti příbuzným pojmům, s minimálně třemi kontrastními znaky.
- Minimální slovník pojmů: 5–15 termínů s přesnými definicemi.
- Znalostní tvrzení (kernely): očíslovaná, měřitelná, evidovatelná tvrzení s citací a stavem jistoty.
- Procedurální rámce: kroky, kontrolní seznamy, rozhodovací větve.
- Vzorková data a schémata: malé, reprezentativní dataset-y a jejich schémata pro syntézu.
- Testy a anti-příklady: jednotkové testy pro zjištění hranic tématu.
- Metadata a verzování: číslo verze, datum revize, kurátor, zdroje.
URL politika, kanonikalita a jazykové mutace
Každé téma má jeden kanonický URL. Jazykové mutace používají hreflang a zachovávají stejný identifikátor tématu. Přesměrování řeší změny názvu, nikoli významu. Verzionování doporučujeme přes fragmenty nebo query parametry s immutable obsahem pro audit (např. ?v=2025-10-22).
Metadata pro LLM a vyhledávače
- JSON-LD (schema.org/CreativeWork + Thing): klíče
name,alternateName,about,sameAs,citation,version,dateModified,inLanguage,license. - LLM-hints: vlastní
data-atributy pro extrakci bloků (např.data-claim-id,data-confidence). - Robots a cache: kontrola crawl rozpočtu,
ETagaLast-Modifiedpro čerstvost.
Formát „Claim“: evidovatelná tvrzení
Každé tvrzení má identifikátor, text, zdroj, datum, úroveň jistoty a status revize. Doporučená struktura:
- ID: stabilní řetězec např.
claim:topic-slug:0001. - Text tvrzení: jedna věta bez modálů neurčitosti.
- Zdroj: trvalý odkaz, typ zdroje, citace.
- Datum: publikace zdroje a datum posledního ověření.
- Jistota nebo interval jistoty: škála (např. 0.0–1.0) a metoda odhadu.
- Status: confirmed, contested, deprecated.
Blok „Promptability“: připravenost pro vložení do promptů
CST má mít sekci s krátkými, úkolově orientovanými snippet-y přímo použitelnými jako prompt-inserts. Každý snippet je označen účelem (vysvětlit, porovnat, shrnout, odlišit) a obsahuje prostor pro proměnné.
Obsahové prvky: povinné a volitelné bloky
- Povinné: Definice, Disambiguace, Kernely tvrzení, Citace, Metadata, Verze, Propojení v grafu.
- Volitelné: Use-cases, Anti-příklady, FAQ pro modely (krátké Q/A), Minidataset, Referenční implementace (pseudo-kód), Vizualizace.
Šablona CST: kostra HTML sekcí
Doporučená kostra (zkrácená), kterou lze přímo replikovat:
- Header sekce: název tématu, verze, datum, kurátor, licence.
- Core: definice, rozsah, alternativní názvy, rozdíly oproti blízkým pojmům.
- Claims: očíslovaná tvrzení s citací a jistotou.
- Contexts & Frames: domény použití a okrajové případy.
- Operational: kontrolní seznamy, rozhodovací stromy, vzory promptů.
- Data & Schemas: schémata JSON, příklady záznamů.
- Governance: revize, audit trail, kontakt na kurátora.
Minimální schémata a datové struktury
Pro zaručenou extrahovatelnost navrhněte tato schémata:
- ClaimSchema:
{id, text, source.url, source.type, date.published, date.verified, confidence, status} - TermSchema:
{term, definition, aliases[], note} - RelationSchema:
{from, to, type (broader|narrower|related), weight} - PromptSnippetSchema:
{purpose, template, variables[], constraints[]}
Propojení na znalostní graf a ontologie
Každá CST by měla zveřejnit odkazy na nadřazená a podřazená témata a minimálně jedním směrem směřovat do formální ontologie (SKOS, OWL). Minimálně: broader, narrower, related s popisem vztahu a vahou na navigaci LLM během retrieválu.
Vnitřní odkazy a sémantické kotvy
Každý obsahový blok má mít stabilní id atribut (např. #claim-0003), aby ho mohli agenti citovat. Odkazy musí být výrazně rozlišeny a doplněny o aria-label pro asistivní technologie.
Schémata značení: JSON-LD a mikrodata
Implementujte současně schema.org/CreativeWork a specializované typy (např. DefinedTerm pro slovník). Pro citace použijte ScholarlyArticle nebo WebPage podle původu. Pro vazby na dataset-y využijte Dataset s atributy distribution a measurementTechnique.
Příklad obsahových bloků: definice, disambiguace, tvrzení
- Definice: „Canonical stránka pro téma je autoritativní uzel obsahu a metadat, který jednoznačně reprezentuje konkrétní téma, optimalizovaný pro extrakci a kompozici v generativních systémech.“
- Disambiguace: Rozlišení „CST“ vs. „landing page“ (marketingový účel), vs. „wiki článek“ (kolaborativní encyklopedie), vs. „produktová dokumentace“ (funkční specifikace).
- Tvrzení #0001: „CST musí mít stabilní identifikátor a verzování, aby bylo možné auditovat generované výstupy.“
- Tvrzení #0002: „Začlenění JSON-LD výrazně zlepšuje přesnost retrieválu agentů pracujících s webovým obsahem.“
Operacionalizace: kontrolní seznamy pro kurátory
- Je definice stručná, normativní a bez vágnosti?
- Jsou všechna tvrzení evidovatelná a mají zdroj a datum verifikace?
- Existují minimálně tři rozlišující znaky vůči příbuzným pojmům?
- Obsahuje stránka JSON-LD s požadovanými entitami?
- Jsou bloky opatřeny stabilními identifikátory (
id)? - Je přítomna sekce Promptability s alespoň čtyřmi šablonami?
- Je nastavena cache politika a ETag?
Šablony promptů (Promptability) pro LLM
- Vysvětlení: „Vysvětli téma
{topic}v rozsahu 120–160 slov s použitím definic ze sekce#glossary. Vynechej analogie.“ - Porovnání: „Porovnej
{topic}a{nearby_topic}se třemi rozlišujícími znaky z#disambiguation. Vrať tabulku.“ - Ověření tvrzení: „Validuj
{claim_id}proti záznamům v#claims. Vrať status a důvod.“ - Generování kontrolního seznamu: „Sestav checklist úkolů pro aplikaci
{topic}podle#procedures. Omez na 8 bodů.“
Principy přístupnosti a použitelnosti
- Čitelnost: krátké odstavce, maximální šířka textu ~70 znaků, jasné mezititulky.
- ARIA a kontrast: označení pro interní kotvy a odpovídající kontrast textu.
- Klávesová navigace: všechny kotvy a odkazy musí být přístupné bez myši.
Výkonnost a technické požadavky
- Strukturovaná data: vložená jako
<script type="application/ld+json">. - Lazy rendering vizualizací: grafy načítat po interakci, ne při prvním zobrazení.
- HTTP cachování:
Cache-Control,ETaga přesnéLast-Modified.
Governance: revize, audity, odpovědnosti
Každá CST musí mít vlastníka (kurátora), revizní cyklus (např. kvartální), sledování změn (changelog) a mechanismus pro označení sporů (contested). Audit trail uchovává historii tvrzení, přidaných/odstraněných zdrojů a změny v definici.
Metriky kvality CST
- Coverage: podíl pokrytých klíčových aspektů tématu (%).
- Verifiability: podíl tvrzení s platnými citacemi a datem verifikace.
- Stability: frekvence změn v definici (nižší je lepší).
- Retrieval precision: úspěšnost extrakce bloků agenty (testováno prompt-y).
- Latency: čas extrakce JSON-LD při indexování.
Verzionování a životní cyklus
Verze jsou explicitní (např. v1.3.0) a vázané na datum revize. Změny v definici zvyšují minor verzi; změny v rozsahu zvyšují major verzi. Deprecated sekce jsou archivovány a zůstávají dostupné přes stabilní URI s jasnou výstrahou.
Bezpečnost, etika a licencování
Zajistěte, aby zdroje byly legálně licencované, citace úplné a osobní údaje anonymizované. Poskytněte licenci (např. CC BY 4.0) a vyhněte se riziku halucinací tím, že zakážete míchání nepotvrzených tvrzení do „kernels“.
Implementační checklist pro nasazení
- Stabilní URL a správná přesměrování.
- Kompletní JSON-LD s klíčovými schématy.
- Identifikovaná a oceněná tvrzení s citacemi.
- Disambiguace vůči minimálně třem příbuzným tématům.
- Promptability snippet-y a procedurální rámce.
- Propojení do znalostního grafu a datových zdrojů.
- Přístupnost, výkon a cache politika.
- Governance: vlastník, rev



























