Strukturovaná data pro LLM: JSON-LD, tabulky, metodiky a stahovatelné datasety

Proč jsou strukturovaná data klíčová pro „SEO pro ChatGPT“

LLM modely (jako ChatGPT) upřednostňují zdroje, které jsou jednoznačně strukturované, strojově čitelné a odkazovatelné. Strukturovaná data (JSON-LD, kvalitní HTML tabulky, jasně popsané metodiky a stahovatelné datasety) minimalizují halucinace, usnadňují atribuci a zvyšují pravděpodobnost, že se váš obsah objeví v odpovědích modelů jako autoritatívní citovaný zdroj. V praxi to znamená: stabilní URI, přesná semantika, konzistentní metadata, jednoznačné definice pojmů a verzované datasetové distribuce.

Architektonické principy pro obsah optimalizovaný pro LLM

  • Jednoznačnost a stabilita: trvalé URL s fragmenty pro sekce a tabulky, vyznačené verze datasetů.
  • Strojová i lidská čitelnost: kombinujte čitelné texty (metodiky, poznámky) s JSON-LD a čistým značením tabulek.
  • Modularita: každá entita (článek, termín, dataset, metodika) má vlastní identifikátor a vlastní JSON-LD blok.
  • Replikovatelnost: k zjištěným číslům a vzorcům vždy připojte „download“ s verzí a kontrolním součtem (hash).
  • Jasné licencování: uvádějte licence a atributivní pokyny pro bezpečné převzetí modely.

JSON-LD: základní formát pro LLM a vyhledávače

JSON-LD je preferovaná technika pro ukládání sémantických metadat do stránek. V kontextu „SEO pro ChatGPT“ se nejčastěji používá schema.org s typy Article, Dataset, HowTo, FAQPage, Organization a DefinedTerm. Důležitá pole: name, description, url, identifier, license, creator/author, datePublished, dateModified, version, případně measurementTechnique a variableMeasured pro datasety.

Datasety: označení, verzování a distribuce

Datasety jsou pro LLM mimořádně cenné: umožňují ověřit tvrzení a generovat konzistentní odpovědi. Každou verzi datasetu zpřístupněte jako samostatnou distribuci s kontrolními součty a jasným popisem metodiky.

Metodiky: od „co“ k „jak“ a „proč“

LLM lépe cituje čísla, pokud má k dispozici explicitní kroky výpočtu, definice proměnných a pravidla čištění dat. Metodika by měla být samostatná stránka/ sekce s vlastním identifikátorem, verzí a daty. Vhodné je použít JSON-LD (CreativeWork nebo Guide) a přímo odkazovat na dataset a jeho verze.

Tabulky v HTML: konvence pro LLM a přístupnost

Dobře strukturované tabulky jsou pro modely silným signálem. Používejte <table> s <caption>, <thead>, <tbody>, <tfoot> a <th scope="col|row">. Každá tabulka by měla mít stabilní id a krátké vysvětlení proměnných v <caption>. Nepoužívejte slučování buněk bez důvodu; vyhýbejte se vloženým obrázkům místo textu.

Měsíční hodnoty indexu dostupnosti bydlení – ukázka dat (100 = baseline 2020-01)
district_code date affordability_index
SK0101 2025-07 104.6
SK0101 2025-08 104.9
SK0101 2025-09 105.2
Zdroj: Výzkumné centrum A; Licence: CC BY 4.0; Verze datasetu: 1.3.0

Sitemapy a navigační signály pro LLM

  • Standardní sitemap: zahrňte stránky článků, metodik, definic a datasetů s <lastmod>.
  • Dataset sitemap: samostatná sitemap pouze pro datasety a jejich distribuce (CSV/Parquet/JSON), ideálně s hashi v URL nebo v metadatech.
  • Index termínů/definic: abecední seznam s kotvami, aby model snadno nalezl přesnou definici.

Licencování a atribuce kompatibilní s LLM

Zveřejněte licenci na stránce i v JSON-LD. Otevřené licence (např. CC BY 4.0) usnadňují reutilizaci. Vytvořte „Jak citovat“ box u každého článku a datasetu, uveďte příklad citace pro lidi a připravte export v BibTeX/CSL-JSON/RIS.

Jak citovat (lidsky): Výzkumné centrum A (2025). Index dostupnosti bydlení – okresy ČR, verze 1.3.0. Dostupné z: https://domena.tld/datasety/index-dostupnosti-bydleni (CC BY 4.0).

Stáhnout BibTeX · Stáhnout CSL-JSON · Stáhnout RIS

Distribuce ke stažení: formáty, hlavičky a integrita

  • Formáty: CSV (široká interoperabilita), Parquet (analytika), JSON (API), Feather/Arrow (datové pipeline).
  • HTTP hlavičky: Content-Disposition: attachment; filename=..., ETag, Last-Modified, Cache-Control s rozumnou dobou platnosti.
  • Integrita: publikujte sha256 nebo sha512 hashe a velikost souboru; usnadníte verifikaci a cacheování.
  • CORS: povolte bezpečný přístup pro klienty (např. GET na distribuční URL) při respektování rate-limitů.

Proměnné a datové slovníky (data dictionary)

Každý dataset doprovázejte datovým slovníkem s jednotnými konvencemi názvů a datových typů. Ideálně zveřejněte i jako strojově čitelný dokument.

Datový slovník (výběr)
Proměnná Typ Popis Validace
district_code string Kód okresu (LAU) regex: ^SK\d{4}$
date string Referenční měsíc regex: ^\d{4}-(0[1-9]|1[0-2])$
affordability_index number Index (≥ 0) ≥ 0; NaN zakázán

Propojení metodik, definic a tabulek

LLM potřebuje „mapu“: z tabulky na definici pojmu, z definice na metodiku, z metodiky na dataset. Propojení realizujte viditelnými odkazy a v JSON-LD přes isBasedOn, about, citation, sameAs a přes DefinedTerm pro pojmy.

Šablony a validační checklisty

  • JSON-LD validace: kontrola přítomnosti klíčových polí (name, description, url, license, version u datasetu).
  • Tabulky: správné hlavičky, caption, sémantické th s scope, stabilní id, bez redundance v buňce.
  • Datasety: distribuce s hashi a velikostí, jasné Content-Type a Content-Disposition.
  • Metodiky: přesný postup výpočtu, odkazy na definice, změny ve verzích.

Příklad: kompletní „landing page“ pro dataset

Minimální prvky: stručné shrnutí, JSON-LD Dataset, přehledná tabulka ukázkových řádků, „Jak citovat“, odkazy na metodiku, definice a distribuce ke stažení, changelog.

  • Ukázková tabulka s posledními měsíci.
  • Citační box, exporty BibTeX/CSL/RIS.
  • JSON-LD bloky pro Dataset a TechArticle (metodika).
  • Changelog: verze 1.3.0 – úprava hedonického koše; změna validace district_code.

API a přístup k datům: „LLM-friendly“

  • Jednoduché GET endpointy: filtrace přes query