Licencování a politika textového a datového dolování (TDM)

Proč licencování a TDM politiky patří do SEO pro ChatGPT

Optimalizace pro konverzační modely (např. ChatGPT) nekončí u meta tagů a strukturovaných dat. Z hlediska vyhledávání a odpovědí generovaných AI je stejně důležité explicitně upravit licencování obsahu a TDM (text & data mining) politiky. Cílem je transparentně definovat, co smí být prohledáváno, citováno, sumarizováno a co nesmí být použito pro trénink modelů, opětovnou publikaci či komerční zpracování. Správně navržené politiky chrání vaše duševní vlastnictví (IP), zároveň ale umožňují omezenou, kontrolovanou viditelnost ve výsledcích AI asistentů, což je dnes integrální součást SEO.

Klíčové pojmy a rozdíly

  • Licence obsahu: právně udělená práva k užívání díla (rozsah, účel, území, doba trvání, odvozená díla).
  • TDM (Text & Data Mining): automatizované získávání znalostí z textů/dat; typicky se jedná o trénink modelů, tvorbu indexů, extrakci entit.
  • Robotické prohledávání: technické povolení nebo zákaz přístupu pro crawlery dle robots.txt a hlaviček X-Robots-Tag.
  • Prezentace vs. trénink: rozdíl mezi krátkodobým zobrazováním/odkazováním (odpovědi, náhledy) a dlouhodobým učením modelu (trénink, jemné ladění, vektorizace do trvalých databází).

Strategie: co povolit a co zakázat (model „controlled openness“)

  • Povolte indexaci a krátké citace pro navigaci, souhrny a odkazování (vyšší dosažitelnost v odpovědích AI).
  • Omezte dlouhé re-publikace a úplné převzetí obsahu (zajištění hodnoty originálu a monetizace).
  • Zakažte trénink modelů a hromadnou vektorizaci bez licence (ochrana IP a hodnoty dat).
  • Podměňte TDM komerční licencí (API/podmínky/platby) nebo atribucí a odkazem zpět (v otevřených režimech).

Architektura politik: vrstvy a jejich role

  1. Technická vrstva: robots.txt, meta robots, X-Robots-Tag, selektivní blokace pro specifické AI user-agenty, rychlostní limity.
  2. Licenční vrstva: smluvní podmínky (ToS), licence (CC, komerční), AI zásady na webu, podmínky TDM.
  3. Metadata vrstva: IPTC Photo/Video Metadata, schémata (např. schema.orglicense, usageInfo), vlastní značky pro AI/TDM.
  4. Provozní vrstva: monitoring crawlerů, logování, dohodové whitelisty, API zrcadla s diferencovanými právy.

Robots.txt pro AI a TDM: vzory a doporučení

Využijte granularitu pravidel pro konkrétní AI user-agenty a jasné oddělení prohledávání (discovery) od těžby (TDM). Ilustrační příklady (zapsané jako řádky v robots.txt):

User-agent: *
Allow: /public/
Disallow: /private/
Crawl-delay: 5

# Selektivní pravidla pro známé AI crawlery (názvy se mohou lišit podle poskytovatelů)
User-agent: gptbot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: other-ai-bot
Allow: /summaries/
Disallow: /fulltext/

# Povolení pouze náhledů a citací (pokud váš systém rozlišuje URL)
User-agent: *
Allow: /snippets/
Disallow: /dataset-exports/

Doporučení: pravidelně auditujte seznam AI user-agentů, které se objevují v logech, a aktualizujte pravidla. Kombinujte s HTTP hlavičkami.

Meta robots a X-Robots-Tag: řízení na úrovni stránek a souborů

  • Meta robots (HTML): <meta name="robots" content="index,follow"> nebo selektivně noindex, noarchive, nosnippet.
  • X-Robots-Tag (HTTP): vhodné pro PDF, obrázky, videa nebo exporty; příklad odpovědi serveru: X-Robots-Tag: noindex, noarchive.
  • AI/TDM rozšíření: někteří vydavatelé používají dodatečné směrnice (např. noai, notrain) přes HTTP hlavičky nebo meta tagy; udržujte je v souladu s vašimi AI zásadami a ToS.

IPTC metadata pro fotografie a multimédia

Standard IPTC Photo/Video Metadata umožňuje přesně vyjádřit práva a omezení. Klíčová pole:

  • Creator/Byline, Credit, Copyright Notice: atribučné informace.
  • Licensor/License: podmínky licencování; URL na licenční text.
  • Web Statement of Rights (URL): strojově čitelný odkaz na podmínky užití.
  • Rights Usage Terms: stručná omezení (např. zákaz TDM bez licence).
  • Digital Source Type: identifikace původu (např. generované AI vs. zachycené kamerou), užitečné pro politiky a důvěru.

Doporučení: při exportu obrázků zachovávejte IPTC metadata a nekonvertujte formáty způsobem, který by metadata vymazal. Pro video využijte ekvivalenty (např. XMP) s obdobnou sémantikou.

AI zásady na webu: dokument, který nesmí chybět

Vytvořte veřejný dokument „AI & TDM Zásady“ a zveřejněte jej v patičce. Měl by obsahovat:

  • Definice: co považujete za TDM, trénink, jemné ladění, vektorizaci, odvozená díla.
  • Rozsah povolení: co je dovoleno prohledávat, citovat, zobrazovat a za jakých podmínek.
  • Explicitní zákazy: trénink a hromadnou extrakci bez souhlasu; redistribuci plných textů.
  • Licenční cesty: jak požádat o komerční TDM licence nebo privilegovaný přístup (API, feedy).
  • Technické signály: prolinkování na robots.txt, příklady HTTP hlaviček, odkazy na metadata (IPTC, schémata).
  • Vymáhání a kontakt: e-mail, proces pro DMCA/notice-and-takedown, SLA pro eskalace.

Schémata a strukturovaná data: signalizace licence a užití

Pro obsah typu článek, dataset, obrázek nebo video doplňte strukturovaná data s odkazem na licenci a podmínky použití. Příklad (vložený do stránky jako JSON-LD – zde znázorněno inline):

{ "@context":"https://schema.org", "@type":"Article", "headline":"Název", "license":"https://example.com/license", "usageInfo":"https://example.com/ai-tdm-policy", "isAccessibleForFree": true }

U datasetů použijte @type: Dataset a přidejte distribution s contentUrl a license. Pro obrázky použijte ImageObject s creator, copyrightNotice a license.

Matice rozhodování: SEO pro ChatGPT vs. ochrana IP

Scénář Cíl Technické kroky Licenční kroky Riziko
Chci, aby AI citovala a odkazovala Viditelnost a referral traffic Povolit indexaci, snippets; blokace tréninku (user-agenty) ToS: povolit citace s atribucí Nízké
Chci plnou kontrolu (bez AI) Maximální ochrana IP Zakázat vybrané AI agenty, noai/notrain, noindex interních sekcí ToS: výslovný zákaz TDM Nižší viditelnost
Chci licencovat TDM Monetizace dat Výchozí blokace; whitelist přes API a klíče Licenční smlouvy, reporting Střední (dohled)

Právní a provozní zásady (neutrální k jurisdikci)

  • Minimalismus tvrzení: vyhněte se nepřesným právním formulacím v uživatelském rozhraní; odkazujte na úplné znění ToS.
  • Oddělení vrstev: technické blokování samo o sobě není licence; vždy mějte písemné podmínky.
  • Důkazová stopa: archivujte verze zásad, hash otisky, logy přístupů a user-agentů.
  • Revize: nastavte cyklus revizí (např. čtvrtletně) a změny komunikujte skrze changelog.

Konfigurace HTTP hlaviček: praktické vzory

Pro soubory, které nechcete, aby AI odpovědi úplně zobrazovaly nebo znovu publikovaly, můžete použít kombinace:

  • X-Robots-Tag: noindex, noarchive, nosnippet (pro PDF/exporty)
  • Cache-Control s krátkou expirací pro dynamické licenční pole
  • Volitelné flagy typu X-Content-Usage: noai; notrain (pokud je vaše systémy a partneři respektují)

Poznámka: názvy nestandardních hlaviček a direktiv jsou vendor-specifické; implementujte je konzistentně a udržujte v AI zásadách.

IPTC/EXIF a retence metadat v publikačním řetězci

  • Zajistěte, aby CMS a CDN neztrácely IPTC při kompresi a transformacích.
  • Vyžadujte validaci metadat při nahrávání (autor, licence, URL zásad).
  • Pro video doplňte i část o původu (záznam vs. syntetika) a omezení dalšího užití.

AI-čitelné zásady: snadná parsovatelnost

Publikujte stránku se strojově zpracovatelným blokem (např. jednoduchý JSON v těle stránky), aby i modely s omezeným HTML parsingem mohly zásady získat:

{ "policyVersion":"1.4", "allowDiscovery":true, "allowSnippets":true, "allowTraining":false, "tdmLicenseUrl":"https://example.com/licensing", "contact":"legal@example.com" }

Vzorové sekce „AI & TDM Zásady“

  • Krátké shrnutí: co povolujeme/zakazujeme jednou větou.
  • Definice pojmů: aby se předešlo sporům o výklad.
  • Technické signály: přehled robots.txt, meta tagů, hlaviček, IPTC polí.
  • Licenční scénáře: otevřené užití, atribučné užití, komerční TDM, zákaz.
  • Proces kontaktu: e-mail, formulář, SLA reakce.

Checklist implementace (SEO pro ChatGPT a AI asistenty)

  1. Má web veřejnou stránku „AI & TDM Zásady“ a je v patičce?
  2. Je robots.txt aktualizovaný o relevantní AI agenty?
  3. Máte hlavičky X-Robots-Tag pro dokumenty a exporty?
  4. Jsou IPTC pole vyplněna a zachována během zpracování médií?
  5. Publikujete schema.org s license/usageInfo?
  6. Je v ToS výslovně upraven trénink a TDM?
  7. Běží monitoring user-agentů a rychlostních limitů?
  8. Existuje proces licencování TDM (API, feed, reporting)?

Modelové politiky: tři úrovně otevřenosti

Úroveň Popis Technická konfigurace Licenční konfigurace
Otevřená Snippety a prohledávání vítané; trénink omezený Allow pro většinu sekcí; Disallow pro exporty CC BY/kompatibilní; zákaz tréninku bez dohody
Kontrolovaná Citace ano, fulltexty ne; TDM přes placenou licenci Selektivní Disallow pro AI boty; noarchive ToS + komerční TDM licence
Uzavřená Minimální AI přístup Disallow pro AI agenty; noindex/nosnippet Zákaz odvozených děl a TDM

Měření dopadu na SEO a rizika

  • Viditelnost v AI odpovědích: počet odkazů a citací směřujících na web.
  • Referral traffic: návštěvnost z AI asistentů a prohlížečových AI přehledů.
  • Dodržování zásad: anomálie v logách (neautoriz