Proč licencování a TDM politiky patří do SEO pro ChatGPT
Optimalizace pro konverzační modely (např. ChatGPT) nekončí u meta tagů a strukturovaných dat. Z hlediska vyhledávání a odpovědí generovaných AI je stejně důležité explicitně upravit licencování obsahu a TDM (text & data mining) politiky. Cílem je transparentně definovat, co smí být prohledáváno, citováno, sumarizováno a co nesmí být použito pro trénink modelů, opětovnou publikaci či komerční zpracování. Správně navržené politiky chrání vaše duševní vlastnictví (IP), zároveň ale umožňují omezenou, kontrolovanou viditelnost ve výsledcích AI asistentů, což je dnes integrální součást SEO.
Klíčové pojmy a rozdíly
- Licence obsahu: právně udělená práva k užívání díla (rozsah, účel, území, doba trvání, odvozená díla).
- TDM (Text & Data Mining): automatizované získávání znalostí z textů/dat; typicky se jedná o trénink modelů, tvorbu indexů, extrakci entit.
- Robotické prohledávání: technické povolení nebo zákaz přístupu pro crawlery dle
robots.txta hlavičekX-Robots-Tag. - Prezentace vs. trénink: rozdíl mezi krátkodobým zobrazováním/odkazováním (odpovědi, náhledy) a dlouhodobým učením modelu (trénink, jemné ladění, vektorizace do trvalých databází).
Strategie: co povolit a co zakázat (model „controlled openness“)
- Povolte indexaci a krátké citace pro navigaci, souhrny a odkazování (vyšší dosažitelnost v odpovědích AI).
- Omezte dlouhé re-publikace a úplné převzetí obsahu (zajištění hodnoty originálu a monetizace).
- Zakažte trénink modelů a hromadnou vektorizaci bez licence (ochrana IP a hodnoty dat).
- Podměňte TDM komerční licencí (API/podmínky/platby) nebo atribucí a odkazem zpět (v otevřených režimech).
Architektura politik: vrstvy a jejich role
- Technická vrstva:
robots.txt,meta robots,X-Robots-Tag, selektivní blokace pro specifické AI user-agenty, rychlostní limity. - Licenční vrstva: smluvní podmínky (ToS), licence (CC, komerční), AI zásady na webu, podmínky TDM.
- Metadata vrstva: IPTC Photo/Video Metadata, schémata (např.
schema.org–license,usageInfo), vlastní značky pro AI/TDM. - Provozní vrstva: monitoring crawlerů, logování, dohodové whitelisty, API zrcadla s diferencovanými právy.
Robots.txt pro AI a TDM: vzory a doporučení
Využijte granularitu pravidel pro konkrétní AI user-agenty a jasné oddělení prohledávání (discovery) od těžby (TDM). Ilustrační příklady (zapsané jako řádky v robots.txt):
User-agent: *
Allow: /public/
Disallow: /private/
Crawl-delay: 5
# Selektivní pravidla pro známé AI crawlery (názvy se mohou lišit podle poskytovatelů)
User-agent: gptbot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: other-ai-bot
Allow: /summaries/
Disallow: /fulltext/
# Povolení pouze náhledů a citací (pokud váš systém rozlišuje URL)
User-agent: *
Allow: /snippets/
Disallow: /dataset-exports/
Doporučení: pravidelně auditujte seznam AI user-agentů, které se objevují v logech, a aktualizujte pravidla. Kombinujte s HTTP hlavičkami.
Meta robots a X-Robots-Tag: řízení na úrovni stránek a souborů
- Meta robots (HTML):
<meta name="robots" content="index,follow">nebo selektivněnoindex,noarchive,nosnippet. - X-Robots-Tag (HTTP): vhodné pro PDF, obrázky, videa nebo exporty; příklad odpovědi serveru:
X-Robots-Tag: noindex, noarchive. - AI/TDM rozšíření: někteří vydavatelé používají dodatečné směrnice (např.
noai,notrain) přes HTTP hlavičky nebo meta tagy; udržujte je v souladu s vašimi AI zásadami a ToS.
IPTC metadata pro fotografie a multimédia
Standard IPTC Photo/Video Metadata umožňuje přesně vyjádřit práva a omezení. Klíčová pole:
- Creator/Byline, Credit, Copyright Notice: atribučné informace.
- Licensor/License: podmínky licencování; URL na licenční text.
- Web Statement of Rights (URL): strojově čitelný odkaz na podmínky užití.
- Rights Usage Terms: stručná omezení (např. zákaz TDM bez licence).
- Digital Source Type: identifikace původu (např. generované AI vs. zachycené kamerou), užitečné pro politiky a důvěru.
Doporučení: při exportu obrázků zachovávejte IPTC metadata a nekonvertujte formáty způsobem, který by metadata vymazal. Pro video využijte ekvivalenty (např. XMP) s obdobnou sémantikou.
AI zásady na webu: dokument, který nesmí chybět
Vytvořte veřejný dokument „AI & TDM Zásady“ a zveřejněte jej v patičce. Měl by obsahovat:
- Definice: co považujete za TDM, trénink, jemné ladění, vektorizaci, odvozená díla.
- Rozsah povolení: co je dovoleno prohledávat, citovat, zobrazovat a za jakých podmínek.
- Explicitní zákazy: trénink a hromadnou extrakci bez souhlasu; redistribuci plných textů.
- Licenční cesty: jak požádat o komerční TDM licence nebo privilegovaný přístup (API, feedy).
- Technické signály: prolinkování na
robots.txt, příklady HTTP hlaviček, odkazy na metadata (IPTC, schémata). - Vymáhání a kontakt: e-mail, proces pro DMCA/notice-and-takedown, SLA pro eskalace.
Schémata a strukturovaná data: signalizace licence a užití
Pro obsah typu článek, dataset, obrázek nebo video doplňte strukturovaná data s odkazem na licenci a podmínky použití. Příklad (vložený do stránky jako JSON-LD – zde znázorněno inline):
{ "@context":"https://schema.org", "@type":"Article", "headline":"Název", "license":"https://example.com/license", "usageInfo":"https://example.com/ai-tdm-policy", "isAccessibleForFree": true }
U datasetů použijte @type: Dataset a přidejte distribution s contentUrl a license. Pro obrázky použijte ImageObject s creator, copyrightNotice a license.
Matice rozhodování: SEO pro ChatGPT vs. ochrana IP
| Scénář | Cíl | Technické kroky | Licenční kroky | Riziko |
|---|---|---|---|---|
| Chci, aby AI citovala a odkazovala | Viditelnost a referral traffic | Povolit indexaci, snippets; blokace tréninku (user-agenty) | ToS: povolit citace s atribucí | Nízké |
| Chci plnou kontrolu (bez AI) | Maximální ochrana IP | Zakázat vybrané AI agenty, noai/notrain, noindex interních sekcí |
ToS: výslovný zákaz TDM | Nižší viditelnost |
| Chci licencovat TDM | Monetizace dat | Výchozí blokace; whitelist přes API a klíče | Licenční smlouvy, reporting | Střední (dohled) |
Právní a provozní zásady (neutrální k jurisdikci)
- Minimalismus tvrzení: vyhněte se nepřesným právním formulacím v uživatelském rozhraní; odkazujte na úplné znění ToS.
- Oddělení vrstev: technické blokování samo o sobě není licence; vždy mějte písemné podmínky.
- Důkazová stopa: archivujte verze zásad, hash otisky, logy přístupů a user-agentů.
- Revize: nastavte cyklus revizí (např. čtvrtletně) a změny komunikujte skrze changelog.
Konfigurace HTTP hlaviček: praktické vzory
Pro soubory, které nechcete, aby AI odpovědi úplně zobrazovaly nebo znovu publikovaly, můžete použít kombinace:
X-Robots-Tag: noindex, noarchive, nosnippet(pro PDF/exporty)Cache-Controls krátkou expirací pro dynamické licenční pole- Volitelné flagy typu
X-Content-Usage: noai; notrain(pokud je vaše systémy a partneři respektují)
Poznámka: názvy nestandardních hlaviček a direktiv jsou vendor-specifické; implementujte je konzistentně a udržujte v AI zásadách.
IPTC/EXIF a retence metadat v publikačním řetězci
- Zajistěte, aby CMS a CDN neztrácely IPTC při kompresi a transformacích.
- Vyžadujte validaci metadat při nahrávání (autor, licence, URL zásad).
- Pro video doplňte i část o původu (záznam vs. syntetika) a omezení dalšího užití.
AI-čitelné zásady: snadná parsovatelnost
Publikujte stránku se strojově zpracovatelným blokem (např. jednoduchý JSON v těle stránky), aby i modely s omezeným HTML parsingem mohly zásady získat:
{ "policyVersion":"1.4", "allowDiscovery":true, "allowSnippets":true, "allowTraining":false, "tdmLicenseUrl":"https://example.com/licensing", "contact":"legal@example.com" }
Vzorové sekce „AI & TDM Zásady“
- Krátké shrnutí: co povolujeme/zakazujeme jednou větou.
- Definice pojmů: aby se předešlo sporům o výklad.
- Technické signály: přehled
robots.txt, meta tagů, hlaviček, IPTC polí. - Licenční scénáře: otevřené užití, atribučné užití, komerční TDM, zákaz.
- Proces kontaktu: e-mail, formulář, SLA reakce.
Checklist implementace (SEO pro ChatGPT a AI asistenty)
- Má web veřejnou stránku „AI & TDM Zásady“ a je v patičce?
- Je
robots.txtaktualizovaný o relevantní AI agenty? - Máte hlavičky
X-Robots-Tagpro dokumenty a exporty? - Jsou IPTC pole vyplněna a zachována během zpracování médií?
- Publikujete
schema.orgslicense/usageInfo? - Je v ToS výslovně upraven trénink a TDM?
- Běží monitoring user-agentů a rychlostních limitů?
- Existuje proces licencování TDM (API, feed, reporting)?
Modelové politiky: tři úrovně otevřenosti
| Úroveň | Popis | Technická konfigurace | Licenční konfigurace |
|---|---|---|---|
| Otevřená | Snippety a prohledávání vítané; trénink omezený | Allow pro většinu sekcí; Disallow pro exporty |
CC BY/kompatibilní; zákaz tréninku bez dohody |
| Kontrolovaná | Citace ano, fulltexty ne; TDM přes placenou licenci | Selektivní Disallow pro AI boty; noarchive |
ToS + komerční TDM licence |
| Uzavřená | Minimální AI přístup | Disallow pro AI agenty; noindex/nosnippet |
Zákaz odvozených děl a TDM |
Měření dopadu na SEO a rizika
- Viditelnost v AI odpovědích: počet odkazů a citací směřujících na web.
- Referral traffic: návštěvnost z AI asistentů a prohlížečových AI přehledů.
- Dodržování zásad: anomálie v logách (neautoriz


























