Licencování obsahu pro AI: pravidla robots.txt, IPTC a TDM

Přehled: proč licencování obsahu pro AI patří do GEO strategie

Generative Engine Optimization (GEO) není jen „SEO pro LLM“. Aby se obsah bezpečně a výhodně dostal do tréninkových a inference pipeline modelů, musí být jasně licencovaný, strojově čitelně označený a technicky chráněný. Tato kapitola detailně pokrývá tři pilíře: kontrolu indexace a extrakce přes robots a HTTP hlavičky, práva a metadata přes IPTC a práva na textovou a datovou těžbu (TDM) včetně opt-out mechanismů. Cílem je, aby váš obsah byl zároveň nalezen, správně interpretován, spravedlivě zpeněžen a právně obhajitelný.

Taxonomie použití: trénink, fine-tuning, retrieval a inference

Při navrhování licenční politiky rozlišujte čtyři hlavní scénáře: plošné tréninky (foundation model), cílený fine-tuning (adaptace na doménu), retrieval-augmented generation (RAG) s dočasným vektorovým indexem a přímá inference (citování nebo parafrázování). Každý scénář může mít odlišné licenční podmínky (např. zákaz perzistentního ukládání vs. povolení dočasných embeddingů; povinné citování; revenue-share při výpisech nad prahovou délkou).

Právní rámec ve zkratce: EU TDM, autorské právo a databáze

V EU upravuje text-and-data mining (TDM) směrnice DSM (2019/790). Článek 3 zavádí výjimku pro neziskové výzkumné organizace a kulturní instituce; článek 4 umožňuje širší TDM, pokud držitel práv nevyjádří strojově čitelný opt-out. Databázová práva podle směrnice 96/9/ES mohou poskytnout další vrstvu ochrany pro výrazné investice do souborů dat. V USA hraje klíčovou roli fair use, ale je kontextově citlivá; při GEO proto doporučujeme explicitní licence a technické signály, aby byl záměr a podmínky nezaměnitelné.

Licenční modely pro AI: otevřené, podmíněné a komerční

Praktická paleta sahá od otevřených licencí (např. CC BY s omezeními pro trénink) přes podmíněné (povolené RAG a citování, zakázaný trénink) až po komerční smlouvy (dataset subscription, metered API, revenue-share). Pro GEO je vhodné publikovat „licenční matici“: které AI aktivity jsou allowed, allowed with conditions a prohibited, s odkazem na kontaktní bod a strojově čitelný manifest.

Robots.txt jako signál pro crawlery včetně AI botů

Robots.txt zůstává první linií obrany i vyjádřením preferencí. Moderní AI crawlery (např. specializované agentní boty) typicky respektují své user-agenty a pravidla Disallow. Doporučení pro GEO:

  • Definujte segmentovaná pravidla: obecní vyhledávače vs. AI-specifické boty (samostatné User-agent bloky).
  • Zakážete extrakci API a soukromých částí; specifikujte crawl-delay, pokud platforma botů podporuje.
  • Přidejte kontaktní URL a politiku formou komentáře, aby lidské operátoři našli licenční podmínky.

Příklad bez použití předformátovaného bloku: User-agent: *
Allow: /public/
Disallow: /account/
Disallow: /api/

User-agent: AIBot
Disallow: /
# Licensing: https://example.com/ai-licensing

Meta robots a X-Robots-Tag: strojově čitelný opt-out a granularita

Kromě robots.txt je důležité používat meta a serverové hlavičky X-Robots-Tag pro konkrétní URL, typy souborů a odpovědi. Pro AI konzumaci se osvědčuje kombinace klasických direktiv s AI-specifickými značkami, pokud je bot podporuje.

  • Na úrovni HTML: <meta name="robots" content="index,follow,noarchive">
  • Na úrovni HTTP: X-Robots-Tag: noindex, noarchive (aplikovatelné na PDF, CSV a obrázky)
  • Zvýšená explicitnost pro AI: doplňkové signály jako <meta name="ai" content="noai, norag, notrain"> nebo přes X-Robots-Tag: notrain pro klienty, které tyto klíče respektují.

Ačkoliv neexistuje univerzální norma pro klíčová slova noai/notrain, několik AI crawlerů je začalo respektovat. V GEO kontextu je používejte souběžně s právními texty a IPTC metadaty.

Sitemap a manifesty: kde publikovat licence a politiky

Do sitemap.xml přidejte doplňkové prvky s odkazy na licenci a verze datasetů. U statických datasetů použijte také sitemapindex s hashi (integrita) a atributem lastmod pro transparentnost změn. V HTML těle každého obsahu odkazujte na „AI Licensing Policy“ a machine-readable manifest (např. JSON-LD se schématem CreativeWork a vlastním rozšířením pro AI použití).

IPTC metadata: důkaz původu, práva a omezení

IPTC Photo/Video/News Metadata poskytuje robustní pole na vyjádření autorství a licenčních stavů. Klíčové položky, které by měly být vyplněné a zachované během celé pipeline:

  • Creator/Byline, Credit Line, Copyright Notice
  • Licensor a kontaktní údaje, Web Statement of Rights (URL na licenční politiku)
  • Rights Usage Terms (konkrétní podmínky pro AI: povolené/zakázané tréninky, vyžadované citování, omezení RAG)
  • Digital Source Type (k rozlišení originálu, syntetického nebo kompozitního obsahu)
  • Linked Rights Expressions (např. RightsML/ODRL odkazy na strojově čitelná pravidla)

U obrázků a videí kombinujte IPTC s C2PA manifestem pro kryptografické prokázání původu a „policy hints“ v řetězci zpracování. V GEO to zvyšuje šanci, že LLM zdroje budou vaši politiku respektovat a při citování zachovají atribuci.

TDM opt-out: jak splnit „strojově čitelnou“ požadavek

Na právní úrovni EU je platný opt-out vůči TDM, pokud je vyjádřen strojově čitelně. Praktický balíček opatření pro GEO:

  • Robots a X-Robots-Tag s direktivami notrain/noai a noarchive.
  • IPTC/JSON-LD s odkazem na licenci a explicitními AI podmínkami.
  • Podmínky používání na URL stabilní politiky (permalink), na kterou odkazujete z každého dokumentu a sitemap.
  • Hashované otisky datasetů (integrita) a changelog pro doložení, které verze byly kdy dostupné.

HTTP hlavičky a kontrola distribuce souborů

Kromě X-Robots-Tag zaveďte hlavičky, které ztíží masovou redistribuci a usnadní audit:

  • Content-Disposition s rozumným názvem souboru a verzí (např. dataset-v2025-10.csv)
  • ETag pro spolehlivou identifikaci verze
  • Volitelně „policy hint“ hlavičky (např. X-AI-Use-Policy: notrain;norag;contact=https://example.com/ai-licensing)

Schema.org a JSON-LD: licence jako součást datového modelu

Vložte do stránky JSON-LD entitu CreativeWork nebo Dataset s atributy license, creator, isAccessibleForFree, usageInfo a vlastními rozšířeními pro AI použití. Pro CSV a PDF publikujte také odkaz na distribution se contentUrl, encodingFormat a sha256. LLM indexéry z těchto polí dokážou vyvodit, zda mohou obsah bezpečně použít a jak citovat.

Anti-scrape a rate-limiting vs. „dobří“ AI partneři

Technickou ochranu nastavte selektivně: blokujte neidentifikované scrapery (ASN, fingerprinting requestů), ale umožněte whitelisted partnerům přístup přes signované URL, firemní IP a s jasnou smlouvou. GEO tak dosáhne balanc – obsah je využitelný v seriózních modelech, ale není volně extrahovatelný bez dohody.

Licenční manifest pro AI: doporučený formát

Udržujte na stabilní adrese dokument politiky, na který směřují robots, meta, IPTC a JSON-LD. Minimální položky:

  • Název a verze politiky, datum účinnosti a changelog.
  • Matici povolení: training, fine-tuning, RAG, inference-quoting, embedding-persistence, derivative-works.
  • Podmínky atribuce a link-back; pravidla pro citace delší než X znaků.
  • Kontakt pro komerční licence a podmínky reportingu (např. měsíční agregované logy použití).

Changelog a verzování: doložitelnost v čase

Každá změna licence musí být auditovatelná. Vytvořte changelog (ideálně na samostatné URL) a verzujte i manifest a datasety. Doporučuje se semver-styl (např. 1.2.0) a podepisování verzí (PGP nebo v C2PA manifestu). Při sporech můžete doložit, jaká pravidla platila k určitému datu.

Příklady implementace bez předformátovaných bloků

HTML meta: <meta name="robots" content="index,follow,noarchive"> <meta name="ai" content="norag,notrain">

HTTP hlavička pro PDF: X-Robots-Tag: noindex, noarchive, notrain

JSON-LD (zkrácené): { "@context":"https://schema.org", "@type":"Dataset", "name":"Ceníky 2025", "license":"https://example.com/ai-licensing#policy-v1-2", "creator":{"@type":"Organization","name":"Acme"}, "usageInfo":"AI: RAG-only, povinná citace", "distribution":{"@type":"DataDownload","contentUrl":"https://example.com/datasets/ceniky-2025-10.csv","encodingFormat":"text/csv","sha256":"..."} }

IPTC klíčová pole v XMP: dc:rights="© 2025 Acme"; xmpRights:WebStatement="https://example.com/ai-licensing"; photoshop:Credit="Acme Data"; plus:Licensor="Acme"; Iptc4xmpCore:CreatorContactInfo="..."

Měření a audit: jak zjistit, kdo vás používá

Zavádějte jemné značky (např. nenápadné identifikátory v datasetech nebo v HTML komentáři), které nezpůsobují škody, ale pomohou zpětně identifikovat zdroj při úniků. Logujte přístupové vzory, podepisujte vydání a pravidelně kontrolujte modelové výstupy na citace a parafráze. U komerčních partnerů vyžadujte měsíční agregované reporty.

Urovnání sporů a vymáhání

Definujte proces „notice and negotiation“: rychlý kontakt s poskytovatelem modelu, dočasný bezpečnostní režim (snížení přístupu), návrh licenční dohody nebo odstranění materiálů. Mějte připravené důkazní balíčky (hashy, verze, exporty logů, kopie robots a manifestů ke dni incidentu).

Best practices GEO: jak sladit nalezitelnost a kontrolu

  • Jasně oddělte veřejné části pro indexaci a privátní pro prodej či partnerství.
  • U veřejných článků aplikujte atribučné a RAG-friendly licence; u datasetů použijte registraci a API klíče.
  • Každý kus obsahu nese stejný signál: meta/hlavičky, JSON-LD, IPTC/C2PA, interní odkazy na politiku.
  • Partnerům nabídněte „compliance kit“: whitelist user-agentů, IP rozsahy, periodicitu crawl, rozhraní pro citace.

Check-list implementace

  • Robots.txt s AI bloky a odkazem na politiku.
  • Meta a X-Robots-Tag pro stránky a soubory; AI-specifické klíče jako doplňkový signál.
  • JSON-LD s license/usageInfo; hash a verze souborů.
  • IPTC vyplněné a zachované v exportech; C2PA manifest u médií.
  • Sitemap s lastmod a odkazy na licenci; changelog publikovaný veřejně.
  • Monitorování crawlerů, reporting partnerů, připravené šablony smluv a notifikací.

Licencování obsahu pro AI v kontextu GEO spojuje právo, standardy metadat a infrastrukturní signály. Pokud vybudujete konzistentní řetězec od robots až po IPTC/C2PA a JSON-LD manifesty, získáte trojí hodnotu: modely váš obsah správně „vidí“, respektují vaše podmínky a v případě sporu máte měřitelné důkazy. To je základ udržitelné spolupráce mezi vydavateli a vývojáři generativních systémů.