Zásady pro textové a datové těžení (TDM)

Co je TDM (Text and Data Mining) a proč na něj myslet při AI/LLM a moderním SEO

Text and Data Mining (TDM) označuje techniky automatizovaného extrahování poznatků, struktur a vzorů z rozsáhlých souborů textových a datových zdrojů. V kontextu AI/LLM optimalizace webů, AIO/AEO a moderního SEO je TDM základem: modely potřebují data, avšak jejich sběr a využití musí respektovat právní, technické a etické zásady – od licenčních omezení, přes autorská práva a práva k databázím, ochranu osobních údajů až po integritu obsahu a kvalitu datasetů.

Terminologie a rámec: obsah, práva, povolení

  • Obsah: texty, obrázky, videa, zvuk, metadata, strukturovaná data (JSON-LD, schema.org), logy a další signály.
  • Právní titul: licence, zákonná výjimka/povolení, souhlas nebo jiný oprávněný důvod použití.
  • Přístup vs. použití: fakt, že máte k obsahu technický přístup, neznamená, že jej smíte právně těžit.
  • Výstup: odvozené dílo, modelové váhy, embeddingy, statistiky; každý typ má různá rizika z hlediska práv a citlivosti.

TDM a autorské právo: všeobecné zásady

  • Respektujte licence: otevřené licence (CC BY, CC BY-SA, CC0) mají odlišné požadavky (např. uvedení autorství, sdílení za stejných podmínek).
  • Rozlišujte díla a fakta: fakta a myšlenky nejsou chráněny jako díla, ale specifický výběr nebo úprava (např. databáze) mohou být chráněny.
  • Práva k databázím: zvláštní ochrana databází (sui generis) může platit i mimo klasická autorská díla.
  • Dobrá víra a proporcionalita: minimalizujte objem kopírovaného materiálu a vedení logů o původu dat (data lineage).

Výjimky a omezení pro TDM (vysoká úroveň, neutralizace jurisdikcí)

Různé jurisdikce rozlišují mezi výjimkami pro výzkumníky a obecnými výjimkami za určitých podmínek. Praktický dopad pro AI/LLM týmy:

  • Ověřte status „kdo jsme“: akademický výzkum, kulturní instituce, komerční subjekt – platí odlišná pravidla.
  • Ověřte „opt-out/rezervaci“ práva: pokud má držitel práv možnost vyhradit si TDM (strojově čitelně), respektujte to.
  • Implementujte vynucování pravidel (policy enforcement): crawler a pipeline musí číst signály (robots/meta/headers) a jednat podle nich.

Strojově čitelné rezervace a signály pro TDM

V praxi se pro vyjádření přání držitelů práv používají kombinace webových signálů. Ty nejsou plně univerzální, ale představují de facto standardy chování zodpovědných crawlerů a TDM systémů:

  • robots.txt: pravidla User-agent a Disallow pro crawlery; nejde o licenci, ale o signál přístupu. Pro TDM je vhodné číst také agent-specifická pravidla (např. dedikované agent stringy AI crawlerů).
  • Meta tagy v HTML: <meta name="robots"> (indexování/snippety), i neformální dohody pro AI (např. signály typu „noai“), které by měly respektovat „slušní“ crawlery – dokud nevznikne formální standard, jde o politiku dodavatelů.
  • HTTP hlavičky (X-Robots-Tag): použitelné na ne-HTML soubory (PDF, obrázky) a globální pravidla.
  • Sitemapy a licenční příznaky: u mediálních webů a katalogů je vhodné uvádět licenční podmínky u URL (i v feedech/API).

Princip „opt-out“ a jeho důsledky

Pokud držitel práv vyjádří strojově čitelnou rezervaci proti TDM (opt-out), musí robustní TDM systém:

  1. Nezískávat obsah z dotčených URL/domén (vynucení crawlerem).
  2. Odstranit již nasbíraná data z datasetů (retroaktivní hygiena).
  3. Znovu validovat modelové sety/embeddingy, pokud hrozí únik chráněné expresivity.

Licenční modely a due diligence

  • Licence „open content“: ověřujte přesné znění, uvedení autorství, podmínky komerčního použití a povinnosti u odvozených děl.
  • Komerční licence / data smlouvou: doložitelný souhlas pro TDM, definovaná povolená použití (trénink, inference, rešerše), závazek k odstranění na vyžádání.
  • API Terms of Service: mnoho API explicitně zakazuje TDM/trénink LLM; respektujte ToS a nastavte limity pro ukládání.

Ochrana osobních údajů v TDM

  • Minimalizace údajů: sbírejte pouze to, co potřebujete pro daný účel (právní základ, účelová vazba).
  • Pseudonymizace / anonymizace: odstraňujte identifikátory, používejte detekci PII a filtrační pravidla.
  • Práva dotčených osob: vyřizujte žádosti o opravu/odstranění v datasetech i odvodených systémech (např. retrievery).
  • Geografická omezení: při přenosu údajů dodržujte režimy přenosu a smluvní doložky.

Integrita a kvalita datasetu

  • Provenience (data lineage): zaznamenávejte původ zdroje, čas, licenci, signály přístupu a verzi obsahu.
  • Dedup a decontamination: snižujte únik zapamatovaných pasáží a přesných kopií testovacích setů; chraňte proti datovému úniku.
  • Bias a reprezentativnost: auditujte složení domén, jazyků a stylů; korigujte zkreslení.
  • Obsahové filtry: vylučujte malware, spam, pornografii, nenávistný obsah a nezákonné materiály.

Technické zásady pro TDM crawler a pipeline

  1. Identifikace agenta: používejte jasný User-Agent s kontaktem a URL pravidel; respektujte robots.txt.
  2. Rate limiting & etiketa: nepřetěžujte weby, respektujte Crawl-delay (je-li použito) a standardy ohleduplnosti.
  3. Policy enforcement: před stažením čtěte a cacheujte stav robots.txt, meta tagů a hlaviček; aplikujte denylist/allowlist.
  4. Canonical a duplicity: respektujte rel="canonical" při agregaci; snižujte duplicity a parametrický spam.
  5. Šifrování a bezpečnost: přenášejte a ukládejte data bezpečně, auditujte přístupy.
  6. Obsahové vyjmutí: implementujte pravidla pro odstranění částí (např. elementy s data-nosnippet nebo sekce se specifickou licencí).

Policy-ově signály: příklady implementace

  • robots.txt (blokování dedikovaného AI agenta):
    User-agent: MyAICrawler
    Disallow: /private/
    Disallow: /no-tdm/
    Allow: /public/
  • HTTP hlavička pro PDF:
    X-Robots-Tag: noindex, noarchive
  • Meta pro řízení snippetu (neblokuje indexaci):
    <meta name="robots" content="index,follow, max-snippet:160, max-image-preview:large">
  • Strojově čitelný „TDM opt-out“ (neformální signál):
    <meta name="permissions" content="ai: no-train; tdm: opt-out">

    Poznámka: názvy a formát takových polí se liší; důležité je, aby je vaši crawlery uměli číst a respektovat.

Governance: procesy, role a odpovědnosti

  • Data Steward: vlastní pravidla akvizice, filtrování, licenční zápisy a audity.
  • Legal & Compliance: ověřuje právní titul, ToS, jurisdikční dopady a opt-out proces.
  • Security & Privacy: řídí sanitizaci PII, přístupová práva a reakce na incidenty.
  • ML Ops: uplatňuje „data hygiene“ v tréninkové pipeline a eviduje reprodukovatelnost.

Etika TDM: respekt k autorům a ekosystému

  • Recipročnost: uvádějte odkazy na zdroje, zachovávejte uvedení autorství, podporujte otevřená data tam, kde je to možné.
  • Transparentnost: publikujte „dataset cards“/„model cards“ s krátkým popisem původu a omezení.
  • Citlivé domény: zdravotnictví, děti, soukromé komunity – aplikujte přísnější prahy, explicitní souhlasy, nebo úplné vyloučení.

Kontrolní seznam (Checklist) pro TDM projekt

  1. Právní základ pro každý dataset (licence, výjimka, souhlas, kompatibilita s ToS) je zdokumentován?
  2. Opt-out mechanismus (robots/meta/headers) je respektován a technicky vynucován?
  3. Ochrana PII (detekce, maskování, mazání na žádost) je zavedena?
  4. Data lineage a audit trail (čas, zdroj, licence, hash) jsou plně dohledatelné?
  5. Decontamination a deduplikace probíhají před tréninkem?
  6. Rate limiting a ohleduplné prohledávání jsou nastaveny?
  7. Incident response pro nárok držitele práv (takedown, retraining policy) je připravený?

TDM a AIO/AEO: dopady na viditelnost a důvěryhodnost

  • Stránky s jasnými licencemi (např. otevřená učební texty s uvedením autorství) mají vyšší šanci být legálně použitelné v odpovědích AI a vyhledávačů.
  • Správné signály (sitemap, robots, meta) snižují riziko nechtěného použití obsahu nebo naopak pomáhají s jeho kontrolovanou expozicí.
  • Strukturovaná data (schema.org) usnadňují extrakci faktů bez porušení integrálních částí děl.

Praktická architektura TDM: od zdroje po trénink

  1. Discovery: seznam zdrojů, prioritizace, čtení robots.txt, whitelisty/blacklisty.
  2. Acquisition: crawler s vynucováním pravidel, parsování (HTML, PDF), extrakce metadat a licenčních polí.
  3. Sanitization: detekce PII, konverze formátů, deduplikace, toxická data, kvalita skóre.
  4. Catalog: datový katalog s uvedením autorství, hashe, fingerprinty a checksumy.
  5. Training interface: sampling s váhami podle kvality/licence, decontamination vůči eval setům.
  6. Governance & audit: periodické revize, uplatňování opt-out, práva na vymazání.

Vzory komunikace pro držitele práv a provozovatele AI

  • Pro držitele práv: uveďte jasné licenční podmínky, strojově čitelné signály a preferovaný kontakt pro TDM a takedown.
  • Pro AI provozovatele: zveřejněte politiku respektování signálů, reakční doby na žádosti a možnosti opt-out.

Minimalizace rizika při publikování výstupů

  • Memorization tests: testujte model na schopnost citovat tréninkový text; zaveďte antiplagiátorské a anti-leak filtry.
  • Attribution: u faktických výstupů preferujte návrat zdrojových odkazů či citací.
  • Bezpečnostní rozhraní: omezení na dávky, rychlost i obsahová pravidla pro generování.

Shrnutí

TDM zásady pro AI/LLM představují soubor právních, technických a etických pravidel umožňujících těžit data v souladu s právy autorů, ochranou soukromí a kvalitou ekosystému. Klíčem je kombinace policy enforcement (robots/meta/headers), licenční due diligence, hygieny datasetů, ochrany PII a auditovatelnosti. Při důsledné implementaci získáte robustní, udržitelný základ pro trénink a nasazení moderních modelů, který obstojí právně i reputačně.