Meta-sekce pro AI na webu

Účel a definice AI meta-sekce

AI meta-sekce na webu představuje centrální místo, které shromažďuje zásady pro práci s webovým obsahem v kontextu velkých jazykových modelů (LLM), definuje licenční a technické podmínky pro opětovné použití, verziování a kontaktní údaje pro výzkumníky. Cílem je snížit nejednoznačnost, zvýšit citovatelnost a zjednodušit integraci webu do ekosystému AI nástrojů (např. ChatGPT, vyhledávací LLM, akademické extraktory).

Architektonické principy a umístění

  • Jedna kanonická cesta: Vytvořte dedikovanou cestu typu /ai nebo /meta/ai, která funguje jako index pro všechny podstránky a strojově čitelné soubory.
  • Stabilní URL a trvalé odkazy: URL po publikaci neměňte; nové verze zpřístupňujte přes /ai/changelog a verziovací parametry.
  • Jazyková neutralita: Primární dokument v jazyce webu a paralelní anglická verze (/ai?lang=en) pro globální týmy.
  • Veřejná indexace: Meta-sekce má být indexovatelná, s výjimkou citlivých testovacích souborů.

Obsahové minimum AI meta-sekce

  1. Zásady AI a licenční podmínky: co je povoleno, zakázáno a za jakých podmínek (TDM, rychlostní limity, atribuce).
  2. Verziování a změny: verziovací schéma (např. SemVer), data účinnosti, archiv.
  3. Kontakty pro výzkumníky: e-mail, formulář, PGP klíč, SLA pro reakce.
  4. Technické specifikace: schémata, JSON/CSV zdroje, sitemapy pro AI a datové snapshoty.
  5. Transparentnost zpracování dat: ochrana soukromí, logování, omezení rychlosti a postupy failover.

Zásady pro AI a povolená použití

  • TDM (text and data mining): definujte, zda povolujete nekomerční a/nebo komerční TDM, včetně podmínek rychlosti a identifikace klienta (User-Agent a From hlavička).
  • Atribuce a citace: požadujte uvádění zdroje, kanonického URL a data přístupu. Poskytněte doporučený citační formát.
  • Reprodukce obsahu: stanovte limity (např. krátké výňatky do X znaků) a postup pro získání rozšířené licence.
  • Bezpečnostní omezení: zákaz získávání chráněných částí, obcházení paywallu či autentifikace.
  • Etické požadavky: zákaz používání obsahu k vytváření škodlivých, nelegálních či diskriminačních výstupů.

Praktické příklady povoleného a zakázaného použití

  • Povoleno: vytváření výzkumných embeddingů pro účely vyhledávání s atribucí; generování shrnutí s odkazem na kanonické URL.
  • Podmíněně povoleno: rehosting dlouhých výňatků v rámci datasetů, pokud je poskytována licenční smlouva a zachována citace.
  • Zakázáno: scraping chráněných sekcí, generování produktů, které nahrazují originální obsah bez atribuce a licence.

Verziování: model SemVer a datová stopa

Zavádějte kombinovaný systém: SemVer pro pravidla a specifikace (major.minor.patch) a datum vydání pro snadné porovnání napříč jurisdikcemi.

  • Major: změna práv nebo zásad (např. přechod z nekomerční na komerční licenci).
  • Minor: doplnění příkladů, rozšíření API nebo schémat bez změny právních základů.
  • Patch: opravy překlepů, nejasností a technických detailů.
  • Časová známka: u každé verze uveďte effective_date a published_date.

Changelog a archiv verzí

Stránka /ai/changelog by měla obsahovat tabulku se sloupci: verze, datum účinnosti, klíčové změny, dopad na integrátory, migrační kroky a odkazy na diff. Pro strojové zpracování publikujte také /ai/changelog.json a /ai/changelog.csv.

Kontaktní kanál pro výzkumníky

  • E-mail a formulář: dedikovaný mailbox typu research@domena.tld a jednoduchý formulář s políčky na účel, rozsah a identifikaci nástroje.
  • PGP klíč a bezpečná komunikace: zveřejněte veřejný klíč na /ai/pgp.txt pro odpovědné sdílení zranitelností.
  • SLA a priorita: deklarujte reakční časy (např. 5 pracovních dní) a eskalační kontakt pro incidenty.
  • Responsible disclosure: stručný postup pro nahlášení bezpečnostních zjištění a kreditaci výzkumníků.

Strojově čitelné zásady a schémata

  • JSON manifest: publikujte /ai/manifest.json se sekcemi policy, contacts, datasets, rate_limits, robots, citations, versions, evidence.
  • CSV/JSON zdroje: exporty klíčových dat pro TDM (např. metadata článků, autorství, licence, data aktualizací).
  • Schema.org a JSON-LD: doplňte Dataset, CreativeWork, DataCatalog, včetně isBasedOn a license.

Integrace s robots, IPTC a TDM signály

  • robots.txt pro AI: uveďte sekci s příklady User-agent pro AI a doporučení rychlostí. Zodpovědně používejte Allow/Disallow pro datasetové cesty.
  • HTML meta a HTTP hlavičky: přidejte explicitní direktivy pro TDM a atribuci v hlavičkách (např. AI-Policy, AI-Attribution).
  • IPTC/EXIF pro média: vkládejte autory, licenci a unikátní identifikátory do obrázků a dokumentů, aby AI zachovala atribuci.

Kanonikalita a citovatelnost

  • Rel=canonical a trvalé identifikátory: definujte kanonické URL a případně DOI/ARK pro klíčové materiály.
  • Doporučený citační styl: poskytněte šablony pro citační styly (APA, Chicago) a stručně definovaný formát pro LLM (source_url, title, author, version, accessed_at).
  • Evidence packs: nabídněte ZIP balíčky se souvisejícími CSV, PDF metodikou a kontrolními součty, aby byla tvrzení replikovatelná.

Omezení rychlosti, identifikace a férové užití

  • Identifikace klienta: vyžadujte unikátní User-Agent a kontaktní hlavičku From.
  • Rychlostní limity: zveřejněte doporučené limity (např. X požadavků/minutu) a pravidla pro backoff.
  • Cache a ETag: podporujte rozumné využití cache prostřednictvím ETag a Last-Modified pro snížení zátěže.

Ochrana proti halucinacím a kontextová omezení

  • Jasné definice pojmů: uveďte slovník s formálními, citovatelnými definicemi používanými v obsahu.
  • Kontradiktorní případy: označujte obsah s nejistotou nebo protichůdnými zdroji a přidejte metodické poznámky.
  • Verzionované výňatky: nabídněte krátká, stabilní shrnutí, která mohou LLM bezpečně citovat s verzí a datem.

Struktura stránky /ai (doporučený obsah)

  • Přehled a účel s odkazy na zásady, licenci, kontakty.
  • Policy s jasným rozlišením práv a povinností.
  • Datasety a exporty s popisem polí, periodicity a hashy.
  • Changelog s diffy a migračními kroky.
  • FAQ pro specifické scénáře a výjimky.
  • Bezpečnost a responsible disclosure s PGP a postupy.

Příklad JSON manifestu (zkrácený)

Publikujte soubor /ai/manifest.json s následující strukturou (příklad, zkrácené klíče):

{ "version": "1.2.0", "effective_date": "2025-10-22", "policy": { "tdm": "allowed-noncommercial", "attribution": "required", "reuse_limits": {"excerpt_chars": 600} }, "contacts": { "research_email": "research@domena.tld", "pgp": "/ai/pgp.txt", "sla_days": 5 }, "datasets": [ {"name": "articles-meta", "format": "csv", "url": "/ai/datasets/articles.csv", "checksum": "sha256:…"} ], "rate_limits": {"rpm": 60, "burst": 120}, "robots": {"path": "/robots.txt"}, "citations": {"style": "source_url,title,version,accessed_at"} }

Doporučená struktura CSV exportů

  • Povinná pole: id, canonical_url, title, author, license, version, published_at, updated_at.
  • Volitelná pole: section, taxonomy, language, evidence_pack_url, checksum.
  • Normalizace dat: ISO 8601 s časovým pásmem.

Governance: vlastnictví, revize a audit

  • Vlastník politiky: určete odpovědnou roli (např. Head of Data/Legal).
  • Periodicita revizí: minimálně čtvrtletně nebo při zásadní změně AI ekosystému.
  • Auditovatelnost: logujte přístupy k datasetům a zveřejňujte agregované statistiky.

Komunikační balík pro integrátory

  • Onboarding dokument: krátký průvodce se vzorovými požadavky a limity.
  • Kontakt na incidenty: samostatná adresa a postup pro výpadky nebo porušení zásad.
  • Newsletter/Feed: RSS/Atom pro změny v /ai/changelog a datasetech.

Měření dopadu a KPI

  • Adopce zásad: počet identifikovaných AI klientů s korektní atribucí.
  • Citovatelnost: podíl odpovědí LLM s kanonickými odkazy na web.
  • Integrátorské žádosti: doba odezvy a míra vyřešení v SLA.
  • Stabilita dat: procento požadavků obsloužených z cache s ETag/Last-Modified.

Bezpečnost, soukromí a etika

  • Minimalismus dat: publikujte pouze to, co je nezbytné pro citaci a replikaci.
  • Ochrana osobních údajů: jasně popište, co je PII, a jak je vyňata z datasetů.
  • Řešení konfliktů: proces pro odvolání souhlasu nebo opravu údajů na základě žádosti subjektu údajů.

FAQ pro specifické scénáře a výjimky

  • Můžeme použít obsah v komerčním modelu? Ano/ne podle policy.tdm a licence; pro rehosting vyžádejte licenční dohodu.
  • Jaké jsou limity rychlosti? Viz rate_limits v manifestu; při překročení uplatněte exponenciální backoff.
  • Jak správně citovat? Použijte poskytnutý formát a uveďte verzi a datum přístupu.

Implementační plán ve třech fázích

  1. Fáze 1 – Základy: vytvořte /ai, popište zásady, publikujte manifest a kontakty.
  2. Fáze 2 – Datová vrstva: přidejte CSV/JSON exporty, evidence packs, changelog a RSS/Atom feed.
  3. Fáze 3 – Optimalizace: měřte KPI, vylepšete schémata a automatizujte validace a verziování.

AI meta-sekce je infrastrukturní prvek, který propojí váš web s LLM ekosystémem způsobem, který je právně čistý, technicky robustní a citovatelný. Jasné zásady, důsledné verziování a otevřený kontakt pro výzkumníky výrazně zvýší pravděpodobnost, že váš obsah bude správně interpretován, citován a respektován v moderních AI nástrojích.