Kanonická stránka pro téma: struktura a prvky

Co je „canonical stránka pro téma“ a proč je klíčová v GEO

Canonical stránka pro téma (dále jen „CST“) je autoritativní, jednoznačný a stabilní zdroj znalostí pro konkrétní téma, který slouží jako primární uzel pro generativní modely i pro lidi. V kontextu Generative Engine Optimization (GEO) je cílem CST snížit neurčitost, poskytnout strojově čitelné struktury a zajistit reprodukovatelné odpovědi napříč kanály a modely. CST je optimalizována pro: (a) přesnost a auditovatelnost, (b) kompozici do odpovědí LLM, (c) interní konzistenci v rámci znalostního grafu.

Hlavní principy návrhu CST

  • Jednoznačnost a disambiguace: jasné vymezení hranic tématu, alternativních názvů, souvisejících pojmů a rozlišujících znaků.
  • Stabilita URI: trvalá, verzionovaná adresa s politikou přesměrování a bez kolize s jazykovými mutacemi.
  • Rozložitelnost: modularizované bloky, které lze spolehlivě citovat a extrahovat do promptů.
  • Strojová sémantika: použití schema.org, JSON-LD, mikroformátů a kontrolovaných slovníků.
  • Měřitelnost: jasné metriky kvality, úplnosti a čerstvosti.

Architektura a informační model CST

Doporučená architektura vychází z vrstev:

  1. Identita tématu (Core Identity): název, definice, rozsah, alternativní názvy (synonyma), odlišení od blízkých témat.
  2. Znalostní tvrzení (Claims): evidovatelné věty s atributy zdroje, data a úrovně jistoty.
  3. Kontext a rámce (Contexts): použití v doménách, příklady, proti-příklady, okrajové případy.
  4. Operacionalizace (Tasks & Prompts): vzory promptů, kontrolní seznamy, rozhodovací stromy.
  5. Propojení (Graph Links): nadřazená/podřazená témata, příbuzná témata, entity, taxonomie.
  6. Metadat a governance: verze, kurátoři, SLA, licence, datum poslední revize.

Standardní struktura CST: doporučené sekce

  • Definice a rozsah: stručná, normativní definice (max. 2–3 věty) a vymezené hranice.
  • Disambiguace: tabulka rozdílů oproti příbuzným pojmům, s minimálně třemi kontrastními znaky.
  • Minimální slovník pojmů: 5–15 termínů s přesnými definicemi.
  • Znalostní tvrzení (kernely): očíslovaná, měřitelná, evidovatelná tvrzení s citací a stavem jistoty.
  • Procedurální rámce: kroky, kontrolní seznamy, rozhodovací větve.
  • Vzorková data a schémata: malé, reprezentativní dataset-y a jejich schémata pro syntézu.
  • Testy a anti-příklady: jednotkové testy pro zjištění hranic tématu.
  • Metadata a verzování: číslo verze, datum revize, kurátor, zdroje.

URL politika, kanonikalita a jazykové mutace

Každé téma má jeden kanonický URL. Jazykové mutace používají hreflang a zachovávají stejný identifikátor tématu. Přesměrování řeší změny názvu, nikoli významu. Verzionování doporučujeme přes fragmenty nebo query parametry s immutable obsahem pro audit (např. ?v=2025-10-22).

Metadata pro LLM a vyhledávače

  • JSON-LD (schema.org/CreativeWork + Thing): klíče name, alternateName, about, sameAs, citation, version, dateModified, inLanguage, license.
  • LLM-hints: vlastní data- atributy pro extrakci bloků (např. data-claim-id, data-confidence).
  • Robots a cache: kontrola crawl rozpočtu, ETag a Last-Modified pro čerstvost.

Formát „Claim“: evidovatelná tvrzení

Každé tvrzení má identifikátor, text, zdroj, datum, úroveň jistoty a status revize. Doporučená struktura:

  • ID: stabilní řetězec např. claim:topic-slug:0001.
  • Text tvrzení: jedna věta bez modálů neurčitosti.
  • Zdroj: trvalý odkaz, typ zdroje, citace.
  • Datum: publikace zdroje a datum posledního ověření.
  • Jistota nebo interval jistoty: škála (např. 0.0–1.0) a metoda odhadu.
  • Status: confirmed, contested, deprecated.

Blok „Promptability“: připravenost pro vložení do promptů

CST má mít sekci s krátkými, úkolově orientovanými snippet-y přímo použitelnými jako prompt-inserts. Každý snippet je označen účelem (vysvětlit, porovnat, shrnout, odlišit) a obsahuje prostor pro proměnné.

Obsahové prvky: povinné a volitelné bloky

  • Povinné: Definice, Disambiguace, Kernely tvrzení, Citace, Metadata, Verze, Propojení v grafu.
  • Volitelné: Use-cases, Anti-příklady, FAQ pro modely (krátké Q/A), Minidataset, Referenční implementace (pseudo-kód), Vizualizace.

Šablona CST: kostra HTML sekcí

Doporučená kostra (zkrácená), kterou lze přímo replikovat:

  • Header sekce: název tématu, verze, datum, kurátor, licence.
  • Core: definice, rozsah, alternativní názvy, rozdíly oproti blízkým pojmům.
  • Claims: očíslovaná tvrzení s citací a jistotou.
  • Contexts & Frames: domény použití a okrajové případy.
  • Operational: kontrolní seznamy, rozhodovací stromy, vzory promptů.
  • Data & Schemas: schémata JSON, příklady záznamů.
  • Governance: revize, audit trail, kontakt na kurátora.

Minimální schémata a datové struktury

Pro zaručenou extrahovatelnost navrhněte tato schémata:

  • ClaimSchema: {id, text, source.url, source.type, date.published, date.verified, confidence, status}
  • TermSchema: {term, definition, aliases[], note}
  • RelationSchema: {from, to, type (broader|narrower|related), weight}
  • PromptSnippetSchema: {purpose, template, variables[], constraints[]}

Propojení na znalostní graf a ontologie

Každá CST by měla zveřejnit odkazy na nadřazená a podřazená témata a minimálně jedním směrem směřovat do formální ontologie (SKOS, OWL). Minimálně: broader, narrower, related s popisem vztahu a vahou na navigaci LLM během retrieválu.

Vnitřní odkazy a sémantické kotvy

Každý obsahový blok má mít stabilní id atribut (např. #claim-0003), aby ho mohli agenti citovat. Odkazy musí být výrazně rozlišeny a doplněny o aria-label pro asistivní technologie.

Schémata značení: JSON-LD a mikrodata

Implementujte současně schema.org/CreativeWork a specializované typy (např. DefinedTerm pro slovník). Pro citace použijte ScholarlyArticle nebo WebPage podle původu. Pro vazby na dataset-y využijte Dataset s atributy distribution a measurementTechnique.

Příklad obsahových bloků: definice, disambiguace, tvrzení

  • Definice: „Canonical stránka pro téma je autoritativní uzel obsahu a metadat, který jednoznačně reprezentuje konkrétní téma, optimalizovaný pro extrakci a kompozici v generativních systémech.“
  • Disambiguace: Rozlišení „CST“ vs. „landing page“ (marketingový účel), vs. „wiki článek“ (kolaborativní encyklopedie), vs. „produktová dokumentace“ (funkční specifikace).
  • Tvrzení #0001: „CST musí mít stabilní identifikátor a verzování, aby bylo možné auditovat generované výstupy.“
  • Tvrzení #0002: „Začlenění JSON-LD výrazně zlepšuje přesnost retrieválu agentů pracujících s webovým obsahem.“

Operacionalizace: kontrolní seznamy pro kurátory

  • Je definice stručná, normativní a bez vágnosti?
  • Jsou všechna tvrzení evidovatelná a mají zdroj a datum verifikace?
  • Existují minimálně tři rozlišující znaky vůči příbuzným pojmům?
  • Obsahuje stránka JSON-LD s požadovanými entitami?
  • Jsou bloky opatřeny stabilními identifikátory (id)?
  • Je přítomna sekce Promptability s alespoň čtyřmi šablonami?
  • Je nastavena cache politika a ETag?

Šablony promptů (Promptability) pro LLM

  • Vysvětlení: „Vysvětli téma {topic} v rozsahu 120–160 slov s použitím definic ze sekce #glossary. Vynechej analogie.“
  • Porovnání: „Porovnej {topic} a {nearby_topic} se třemi rozlišujícími znaky z #disambiguation. Vrať tabulku.“
  • Ověření tvrzení: „Validuj {claim_id} proti záznamům v #claims. Vrať status a důvod.“
  • Generování kontrolního seznamu: „Sestav checklist úkolů pro aplikaci {topic} podle #procedures. Omez na 8 bodů.“

Principy přístupnosti a použitelnosti

  • Čitelnost: krátké odstavce, maximální šířka textu ~70 znaků, jasné mezititulky.
  • ARIA a kontrast: označení pro interní kotvy a odpovídající kontrast textu.
  • Klávesová navigace: všechny kotvy a odkazy musí být přístupné bez myši.

Výkonnost a technické požadavky

  • Strukturovaná data: vložená jako <script type="application/ld+json">.
  • Lazy rendering vizualizací: grafy načítat po interakci, ne při prvním zobrazení.
  • HTTP cachování: Cache-Control, ETag a přesné Last-Modified.

Governance: revize, audity, odpovědnosti

Každá CST musí mít vlastníka (kurátora), revizní cyklus (např. kvartální), sledování změn (changelog) a mechanismus pro označení sporů (contested). Audit trail uchovává historii tvrzení, přidaných/odstraněných zdrojů a změny v definici.

Metriky kvality CST

  • Coverage: podíl pokrytých klíčových aspektů tématu (%).
  • Verifiability: podíl tvrzení s platnými citacemi a datem verifikace.
  • Stability: frekvence změn v definici (nižší je lepší).
  • Retrieval precision: úspěšnost extrakce bloků agenty (testováno prompt-y).
  • Latency: čas extrakce JSON-LD při indexování.

Verzionování a životní cyklus

Verze jsou explicitní (např. v1.3.0) a vázané na datum revize. Změny v definici zvyšují minor verzi; změny v rozsahu zvyšují major verzi. Deprecated sekce jsou archivovány a zůstávají dostupné přes stabilní URI s jasnou výstrahou.

Bezpečnost, etika a licencování

Zajistěte, aby zdroje byly legálně licencované, citace úplné a osobní údaje anonymizované. Poskytněte licenci (např. CC BY 4.0) a vyhněte se riziku halucinací tím, že zakážete míchání nepotvrzených tvrzení do „kernels“.

Implementační checklist pro nasazení

  • Stabilní URL a správná přesměrování.
  • Kompletní JSON-LD s klíčovými schématy.
  • Identifikovaná a oceněná tvrzení s citacemi.
  • Disambiguace vůči minimálně třem příbuzným tématům.
  • Promptability snippet-y a procedurální rámce.
  • Propojení do znalostního grafu a datových zdrojů.
  • Přístupnost, výkon a cache politika.
  • Governance: vlastník, rev