Proč licencování a TDM politiky patří do SEO pro ChatGPT
Optimalizace pro konverzační modely (např. ChatGPT) nekončí u meta tagů a strukturovaných dat. Z pohledu vyhledávání a odpovědí generovaných AI je stejně důležité explicitně upravit licencování obsahu a TDM (text & data mining) politiky. Cílem je transparentně uvést, co smí být prohledáváno, citováno, shrnuto a co nesmí být použito pro trénink modelů, opětovnou publikaci či komerční zpracování. Správně navržené politiky chrání vaše duševní vlastnictví, zároveň však umožňují omezenou, kontrolovanou viditelnost ve výsledcích AI asistentů, což je dnes nedílnou součástí SEO.
Klíčové pojmy a rozdíly
- Licence obsahu: právně udělená práva k využití díla (rozsah, účel, území, délka, odvozená díla).
- TDM (Text & Data Mining): automatizované získávání znalostí z textů/dat; typicky se jedná o školení modelů, tvorbu indexů, extrakci entit.
- Robotické prohledávání: technické povolení/zakázání přístupu pro crawlovací roboty podle
robots.txta hlavičekX-Robots-Tag. - Prezentace vs. trénink: rozdíl mezi krátkodobým zobrazením/odkazováním (odpovědi, náhledy) a dlouhodobým učením modelu (trénink, jemné doladění, vektorizace do trvalých databází).
Strategie: co povolit a co zakázat (model „controlled openness“)
- Povolte indexaci a krátké citace pro účely navigace, shrnutí a odkazování (vyšší dosažitelnost v odpovědích AI).
- Omezte dlouhé re-publikace a úplné kopírování (zachování hodnoty originálu a monetizace).
- Zakažte trénink modelů a hromadnou vektorizaci bez licence (ochrana duševního vlastnictví a hodnoty dat).
- Podmíněte TDM komerční licencí (API/podmínky/platby) nebo atribucí a odkázáním zpět (u otevřených režimů).
Architektura politik: vrstvy a jejich role
- Technická vrstva:
robots.txt,meta robots,X-Robots-Tag, selektivní bloky pro specifické AI user-agenty, rychlostní limity. - Licenční vrstva: smluvní podmínky (ToS), licence (CC, komerční), AI zásady na webu, podmínky TDM.
- Metadatová vrstva: IPTC Photo/Video Metadata, schémata (např.
schema.org–license,usageInfo), vlastní tagy pro AI/TDM. - Provozní vrstva: monitoring crawlerů, logování, dohodové whitelisty, API zrcadla s diferencovanými právy.
Robots.txt pro AI a TDM: vzory a doporučení
Využijte granulární pravidla pro konkrétní AI user-agenty a jasné oddělení prohledávání (discovery) od těžby (TDM). Ilustrační příklady (zapsané jako řádky v robots.txt):
User-agent: *
Allow: /public/
Disallow: /private/
Crawl-delay: 5
# Selektivní pravidla pro známé AI crawlery (názvy se mohou lišit podle poskytovatelů)
User-agent: gptbot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: other-ai-bot
Allow: /summaries/
Disallow: /fulltext/
# Povolení pouze náhledů a citací (pokud váš systém rozlišuje URL)
User-agent: *
Allow: /snippets/
Disallow: /dataset-exports/
Doporučení: pravidelně auditujte seznam AI user-agentů, kteří se objevují v logách, a aktualizujte pravidla. Kombinujte s HTTP hlavičkami.
Meta robots a X-Robots-Tag: řízení na úrovni stránek a souborů
- Meta robots (HTML):
<meta name="robots" content="index,follow">nebo selektivněnoindex,noarchive,nosnippet. - X-Robots-Tag (HTTP): vhodné pro PDF, obrázky, videa nebo exporty; příklad odpovědi serveru:
X-Robots-Tag: noindex, noarchive. - AI/TDM rozšíření: někteří vydavatelé používají dodatečné směrnice (např.
noai,notrain) prostřednictvím HTTP hlaviček nebo meta tagů; udržujte je v souladu s vašimi AI zásadami a ToS.
IPTC metadata pro fotografie a multimédia
Standard IPTC Photo/Video Metadata umožňuje přesně vyjádřit práva a omezení. Klíčová pole:
- Creator/Byline, Credit, Copyright Notice: atribučné informace.
- Licensor/License: podmínky licencování; URL na licenční text.
- Web Statement of Rights (URL): strojově čitelný odkaz na podmínky užití.
- Rights Usage Terms: stručná omezení (např. zákaz TDM bez licence).
- Digital Source Type: identifikace původu (např. generováno AI vs. zachyceno kamerou), užitečné pro politiky a důvěru.
Doporučení: při exportu obrázků zachovávejte IPTC metadata a nekonvertujte formáty tak, aby metadata byla ztracena. Pro video využijte ekvivalenty (např. XMP) s podobnou semantikou.
AI zásady na webu: dokument, který nesmí chybět
Vytvořte veřejný dokument „AI & TDM Zásady“ a zveřejněte jej v patičce webu. Měl by obsahovat:
- Definice: co považujete za TDM, trénink, jemné doladění, vektorizaci, odvozená díla.
- Rozsah povolení: co je povoleno prohledávat, citovat, zobrazovat a za jakých podmínek.
- Explicitní zákazy: trénink a hromadné získávání dat bez souhlasu; redistribuce plných textů.
- Licenční cesty: jak žádat o komerční TDM licence nebo privilegovaný přístup (API, feedy).
- Technické signály: odkaz na
robots.txt, příklady HTTP hlaviček, odkazy na metadata (IPTC, schémata). - Vymáhání a kontakt: email, proces pro DMCA/notice-and-takedown, SLA pro eskalace.
Schémata a strukturovaná data: signalizace licence a použití
Pro obsah typu článek, dataset, obrázek nebo video doplňte strukturovaná data s odkazem na licenci a podmínky použití. Příklad (vložený do stránky jako JSON-LD – zde znázorněný inline):
{ "@context":"https://schema.org", "@type":"Article", "headline":"Název", "license":"https://example.com/license", "usageInfo":"https://example.com/ai-tdm-policy", "isAccessibleForFree": true }
U datasetů použijte @type: Dataset a přidejte distribution s contentUrl a license. Pro obrázky použijte ImageObject s creator, copyrightNotice a license.
Matice rozhodování: SEO pro ChatGPT vs. ochrana IP
| Scénář | Cíl | Technické kroky | Licenční kroky | Riziko |
|---|---|---|---|---|
| Chci, aby AI citovala a odkazovala | Viditelnost & referral traffic | Povolit indexaci, snippets; blokovat trénink (user-agenty) | ToS: povolit citace s atribucí | Nízké |
| Chci úplnou kontrolu (bez AI) | Maximální ochrana IP | Zakázat vybrané AI agenty, noai/notrain, noindex interních sekcí |
ToS: výslovný zákaz TDM | Nižší viditelnost |
| Chci licencovat TDM | Monetizace dat | Výchozí blokování; whitelist přes API a klíče | Licenční smlouvy, reporting | Střední (dohled) |
Právní a provozní zásady (neutrální k jurisdikci)
- Minimalizmus tvrzení: vyhněte se nepřesným právním formulacím v UI; odkazujte na plné znění ToS.
- Oddělení vrstev: technické blokování samo o sobě není licence; vždy mějte textové podmínky.
- Důkazový záznam: archivujte verze politik, otisky hash, logy přístupů a user-agentů.
- Revize: nastavte cyklus revizí (např. čtvrtletní) a změny komunikujte přes changelog.
Konfigurace HTTP hlaviček: praktické vzory
Pro soubory, které nechcete v AI odpovědích plně zobrazovat nebo re-publikovat, můžete použít kombinace:
X-Robots-Tag: noindex, noarchive, nosnippet(pro PDF/exporty)Cache-Controls krátkou expirací u dynamiky licenčních polí- Volitelné flagy typu
X-Content-Usage: noai; notrain(pokud je respektují vaše systémy a partneři)
Poznámka: názvy nestandardních hlaviček a direktiv jsou vendor-specifické; implementujte je konzistentně a udržujte v AI zásadách.
IPTC/EXIF a retence metadat v publikačním řetězci
- Zajistěte, aby CMS a CDN nezahazovaly IPTC při kompresi a transformacích.
- Vyžadujte validaci metadat při nahrávání (autor, licence, URL zásad).
- Pro video doplňte také část o původu (záznam vs. syntetika) a omezení dalšího použití.
AI-čitelné zásady: snadná parsovatelnost
Publikujte stránku se strojově zpracovatelným blokem (např. jednoduchý JSON v těle stránky), aby i modely s omezeným HTML parsingem mohly zásady načíst:
{ "policyVersion":"1.4", "allowDiscovery":true, "allowSnippets":true, "allowTraining":false, "tdmLicenseUrl":"https://example.com/licensing", "contact":"legal@example.com" }
Vzory pro sekce „AI & TDM Zásady“
- Krátké shrnutí: co povolujeme/zakazujeme v jedné větě.
- Definice pojmů: aby nedocházelo ke sporům o výklad.
- Technické signály: přehled
robots.txt, meta tagů, hlaviček, IPTC polí. - Licenční scénáře: otevřené použití, atribučné použití, komerční TDM, zákaz.
- Proces kontaktu: email, formulář, SLA reakce.
Checklist implementace (SEO pro ChatGPT a AI asistenty)
- Má web veřejnou stránku „AI & TDM Zásady“ a je uvedena v patičce?
- Je
robots.txtaktualizovaný o relevantní AI agenty? - Máte hlavičky
X-Robots-Tagpro dokumenty a exporty? - Jsou IPTC pole vyplněna a zachována během zpracování médií?
- Publikujete
schema.orgslicense/usageInfo? - Je v ToS explicitně řešen trénink a TDM?
- Běží monitoring user-agentů a rychlostních limitů?
- Existuje proces licencování TDM (API, feed, reporting)?
Modelové politiky: tři úrovně otevřenosti
| Úroveň | Popis | Technická konfigurace | Licenční konfigurace |
|---|---|---|---|
| Otevřená | Snippety a prohledávání vítané; trénink limitovaný | Allow pro většinu sekcí; Disallow pro exporty |
CC BY/kompatibilní; zákaz tréninku bez dohody |
| Kontrolovaná | Citace ano, fultexty ne; TDM přes placenou licenci | Selektivní Disallow pro AI boty; noarchive |
ToS + komerční TDM licence |
| Uzavřená | AI přístup minimalizován | Disallow pro AI agenty; noindex/nosnippet |
Zákaz odvozených děl a TDM |
Měření dopadu na SEO a rizika
- Viditelnost v AI odpovědích: počet odkazů a citací směřujících na web.
- Referral traffic: návštěvnost z AI asistentů a prohlížečových AI přehledů.
- Dodržování zásad:


























