Autorství a odbornost

Autorství a odbornost v GEO: proč na nich záleží

Generative Engine Optimization (GEO) pro velké jazykové modely neoptimalizuje pouze dokumenty, ale také signály důvěry. Nejvýznamnějším z nich je prokazatelná identita autora a jeho odbornost. Pro systémy LLM jsou klíčové dobře strukturované autorské profily, konzistentní bibliografie a propojení na perzistentní identifikátory (zejména ORCID) pro disambiguaci, hodnocení kvality a snižování halucinací při citacích.

Základní pojmy: autorství, odbornost, atribuce

  • Autorství: prokazatelné přiřazení obsahu konkrétní osobě nebo organizaci.
  • Odbornost: ověřitelná kompetence autora v dané oblasti (vzdělání, praxe, publikace, granty, patentové přihlášky, vědecká data).
  • Atribuce: technické a textové mechanismy, jimiž se toto přiřazení zobrazí v dokumentu (metadata, schémata, citace, podpisy).

LLM a autor: jak modely čerpají důvěru z metadat

Modely získávají z dokumentů a jejich okolí strukturované i nestrukturované signály. Některé jsou explicitní (schema.org, ORCID, DOI), jiné implicitní (konzistentní jméno, dlouhodobá tematická stopa). GEO proto pracuje se dvěma vrstvami:

  1. Vrstva reprezentace – jak je autor a jeho dílo popsáno v textu, metadatech a propojeních (profil, bibliografie, identifikátory).
  2. Vrstva evidence – jak lze tvrzení o autorství/odbornosti ověřit (perzistentní ID, externí registry, citační grafy, datové sady).

Architektura autorského profilu pro GEO

Doporučená struktura profilu, který lze bezpečně scrapovat a indexovat LLM i vyhledávači:

  • Identita: celé jméno (varianty), profilová fotografie s alt textem, krátká bio věta (jednovětová pozice/odborná specializace), dlouhá bio (zaměřená na měřitelné signály: projekty, publikace, granty).
  • Perzistentní identifikátory: ORCID iD (https URI), ISNI, ROR (pro organizaci), Scopus/Author ID, ResearcherID, Google Scholar profil (pokud relevantní).
  • Afiliace: název, ROR, oddělení, období (od–do), role.
  • Tematické vektory: 5–10 klíčových oblastí s odkazy na reprezentativní práce a datové sady.
  • Publikace: normalizované citace s DOI/ISBN/PMID, propojené na plný text nebo repozitář.
  • Data a kód: odkazy na datové sady (DOI z datového repozitáře), repozitáře kódu (commit podpisy), licence.
  • Kontakt a podpis: profesionální e-mail (doména afiliace), PGP nebo DKIM stopy v newsletterech.

ORCID jako centrální identifikátor

ORCID iD poskytuje globálně jedinečný identifikátor pro výzkumníky a autory. Pro GEO plní tři funkce:

  1. Disambiguace – jediné ID pro všechny varianty jména.
  2. Synchronizace – import/export publikací mezi repozitáři (Crossref, DataCite, Scopus) a weby.
  3. Ověření – OAuth pro ověřené přiřazení profilu k autorovi.

Implementační minimum: uvést ORCID iD jako klikací URL (včetně plné https formy) na každé autorské stránce a ve strukturovaných datech.

Bibliografické normy a konzistence citací

Citace u LLM se opírají o konzistenci. Proto doporučujeme tyto zásady:

  • Perzistentní identifikátory: DOI pro články/data, ISBN pro knihy, arXiv ID pro preprinty.
  • Styl: používat CSL (Citation Style Language) a automatizovat formátování (např. APA, IEEE, Chicago).
  • Metadata: minimální pole – autoři (normalizovaná jména), rok, název, zdroj, rozsah/číslo, rozsah stran, DOI/URL, licence.
  • Propojení: každá citace má být klikací, ideálně s odkazem na záznam s DOI nebo repozitář.

Schema.org a JSON-LD pro autory a díla

Na každé autorské stránce a detailech publikací poskytujte JSON-LD:

  • Person: name, alternateName, identifier (ORCID URL), affiliation (Organization s ROR), knowsAbout, sameAs (Google Scholar, GitHub, LinkedIn, ISNI).
  • ScholarlyArticle | CreativeWork: author (Person s ORCID), datePublished, isPartOf, identifier (DOI), license, about, hasPart/isBasedOn pro data/kód.
  • Dataset: creator, distribution (formát, přístup), citation, identifier (DOI).

Odbornost jako datový model

Odbornost definujte explicitně jako kombinaci:

  1. Kompetenční oblasti (knowsAbout): hierarchie témat, mapovaná na ontologie (např. ACM CCS, MeSH), plus volná klíčová slova.
  2. Výstupy (hasCreativeWork): seznam prací s kvalitativními (recenze, Q1–Q4) a kvantitativními atributy (citace, altmetriky).
  3. Důkazy (evidence): granty, patenty, ocenění, pozvané přednášky, členství v programových výborech.

Disambiguace jmen a variant

Běžná rizika u jmen autorů:

  • Homonyma: rozlišit přes ORCID, afiliaci, témata a jazyk publikací.
  • Díakritika a transliterace: uvést alternateName a pseudonymy.
  • Změny jmen: vyznačit časové intervaly a svázat všechny varianty se stejným ORCID.

Propojení na organizace (ROR) a projekty

Afiliace jsou silným signálem kvality. U každé položky uveďte:

  • Název organizace + ROR identifikátor.
  • Oddělení/laboratoř + interní ID, pokud existuje.
  • Období spolupráce (od–do) a role (postdoc, docent, vedoucí projektu).

Workflow: od profilu k bibliografii a zpět

  1. Identity: vytvoření/ověření ORCID, propojení na jiné registry.
  2. Sběr: harvest z Crossref/DataCite/Scopus/GS; harmonizace autorů, titulů, DOI.
  3. Normalizace: CSL render, doplnění licencí a perzistentních URL.
  4. Publikace: generování statického profilu s JSON-LD a sitemaps.
  5. Validace: kontrola se strukturovanými testery a interními pravidly.
  6. Synchronizace: push do ORCID záznamů a institucionálních repozitářů.

Pravidla pro citování dat a kódu

  • Datové sady citovat jako Dataset s DOI, uvedením verze a data vydání.
  • Kód citovat přes Software záznam: verze (tag), licencování, archivace v repozitáři s DOI (např. Zenodo integrace s GitHub).
  • V publikaci uvést isBasedOn pro datové a softwarové závislosti.

Měření a KPI pro GEO autorství

  • Pokrývání identifikátorů: % publikací s DOI/ISBN/PMID, % autorů s ORCID.
  • Validita JSON-LD: % stránek bez chyb a varování.
  • Disambiguace: míra kolizí jmen před/po zavedení ORCID.
  • Indexovatelnost: čas do reindexace po aktualizaci profilu.
  • LLM retrievability: úspěšnost vyhledání autora podle témat a citací v RAG testech.

Praktické zásady pro autorské profily

  • Jedna kanonická URL na autora, všechny ostatní varianty s rel="canonical" nebo 301.
  • Sekci „About“ psát věcně, s konkrétními výsledky místo marketingu.
  • Každá publikace má mít vlastní stránku s metadaty a propojením na plný text.
  • Pravidelný harvest a deduplikace z externích zdrojů; uchovávat originální identifikátory.

Integrace s RAG a interními vyhledávači

Pro interní LLM a RAG je důležitá chunkovatelnost a rozlišitelnost autorů:

  • Udržovat profily a publikace v samostatných indexech s odkazy přes ID.
  • Ukládat i strojově čitelné abstrakty (structured abstracts) a tematické vektory.
  • Používat author-aware reranking – preferovat obsah od ověřených autorů v tématech, v nichž publikují.

Řízení kvality a kurátorská vrstva

Automatizace nestačí. Zavést kurátorské kontroly:

  1. Přijímání změn: dvoustupňové – strojová validace + kurátor.
  2. Audity: kvartální kontroly náhodné vzorky profilů a citací.
  3. Historie: verzování profilů a publikací, změnové logy.

Soukromí a dodržování pravidel

  • Publikovat pouze pracovní kontakty a údaje potřebné k atribuci.
  • Respektovat licence datasetů a embarga.
  • Poskytnout autorům samoobslužný nástroj na opravy a skrytí údajů citlivé povahy.

Mezijazykové a kulturní specifika

  • Udržovat varianty jmen s diakritikou i bez ní.
  • Překládat klíčové části profilu (bio, oblasti) a svázat je se stejnými identifikátory.
  • Normalizovat daty (ISO 8601) a pořadí jmen (příjmení/jméno) dle konvencí citací.

Okrajové případy a časté chyby

  • Duplicitní publikace z různých zdrojů – řešit přes DOI a fuzzy match titulů.
  • Změny afiliace bez časového intervalu – vždy uvádět od–do.
  • Neaktuální profily bez ORCID – prioritou je získat ORCID nebo ISNI.
  • „Mrtvé“ odkazy – pravidelné kontroly odkazů a archivace (např. perma.cc v metadatech).

Implementační checklist

  1. Zřídit ORCID pro autory a propojit OAuth.
  2. Vytvořit autorské stránky s JSON-LD (Person) a kanonickou URL.
  3. Normalizovat bibliografii (CSL), doplnit DOI/ISBN/PMID.
  4. Pro dataset/kód přidat Dataset/Software záznamy s DOI/verzí.
  5. Propojit afiliace na ROR, organizace na Organization.
  6. Nastavit harvesting (Crossref/DataCite) a deduplikaci.
  7. Validovat strukturovaná data a sitemapu.
  8. Spustit kurátorské audity a monitorování KPI.

Příklady informačních polí v profilu (model)

  • Jméno: „Mgr. Jana Nováková, PhD.“ | alternateName: „J. Novakova“
  • ORCID
  • Afiliace: „Univerzita X, Katedra informatiky (ROR: 05abcde12)“
  • Oblasti: „NLP“, „GEO“, „Vědecká metadata“
  • Publikace: normalizované záznamy s DOI a odkazy
  • Datové sady: DOI, verze, licence

Mini šablona JSON-LD (logická struktura)

Níže je ilustrativní výpis polí (ne kompletní kód):

  • Person: name, alternateName, identifier (ORCID), affiliation (Organization+ROR), sameAs, knowsAbout
  • ScholarlyArticle: author (Person), identifier (DOI), datePublished, isBasedOn (Dataset/Software), license
  • Dataset/Software: creator, version, identifier (DOI), citation, license

Komunikace odbornosti v textu

Kromě metadat má být i samotný text důkazný: jasně uvést metodiky, datové zdroje, omezení a odkazy na otevřená data. Styl má být věcný, auditovatelný a minimalizovat „marketingové“ formulace.

Budování dlouhodobé reputace

  • Konzistentně aktualizovat profily a bibliografii.
  • Publikovat replikovatelné výstupy (data, kód, protokoly).
  • Udržovat souvislou tematickou stopu a propojení na komunitu (programové výbory, recenze).

Autorství a odbornost jsou v