Multimodální obsah: popisy obrázků, přepisy videí a grafy s legendou

Multimodální obsah

Proč multimodální obsah rozhoduje v éře ChatGPT

Optimalizace pro generativní modely (SEO pro ChatGPT) vyžaduje, aby vaše vizuály a multimédia byly nejen estetické, ale také strojově uchopitelné. LLM a multimodální modely potřebují kvalitní textové ukotvení: přesné popisy obrázků, strukturované transkripty videí a grafy s jasně čitelnou legendou. Cílem je umožnit modelům bezpečně extrahovat fakta, vztahy a interpretace bez halucinací a zároveň zlepšit přístupnost pro lidi.

Zásady GEO pro multimodální aktiva

  1. Jednoznačnost: každé médium má mít jasný účel, název a textový popis vázaný na URL/fragment.
  2. Redundance s mírou: krátký popis (alt) + dlouhý popis (dlouhá legenda / longdesc) + strojová metadata.
  3. Mapování na data: pokud vizualizace vznikla z datasetu, zpřístupněte .csv/.json a uveďte verzi.
  4. Verifikovatelnost: popis obsahuje zdroj, datum sběru a metodiku (pokud je relevantní).
  5. Kompozice na retrieval: sekcionování, id kotvy (id=), titulky a prolinkování na související pojmy.

Popisy obrázků: alt, dlouhé popisy a kontext

Popis obrázku plní tři úkoly: přístupnost, indexaci a grounding pro multimodální modely. Nestačí jednovětový alt; důležitý je také dlouhý popis a kontext v textu stránky.

Struktura popisu

  • Alt text (krátký): 80–150 znaků, informuje o tom, co je na obrázku a proč je důležitý v dané sekci.
  • Dlouhý popis: odstavec až dva, shrnuje klíčové prvky, kvantitativní údaje a význam pro čtenáře.
  • Legenda / Caption: stručná citace zdroje, rok, metodický kontext.
  • Metadata: autor, licence, klíčové entity (osoby/místa/produkty) v microdata nebo JSON-LD.

Příklady dobrých alt textů

Scéna Nesprávný alt Správný alt
Sloupcový graf tržeb graf Sloupcový graf: kvartální tržby 2023–Q2 2025, růst z 1,2 na 2,1 mil. €; nejvyšší Q1 2025
Produktová fotografie telefon Smartphone X12, 6,7″ OLED, foto modul 50 MP, barva grafit, zobrazený profil rámu
Mapa hustoty heatmapa Mapa hustoty návštěvnosti: nejvyšší koncentrace v centru Bratislavy, pokles směrem na sever

Kontextové ukotvení

Obrázek umístěte hned za odstavec, který ho vysvětluje. V textu používejte odkazy na kotvy (např. „viz Graf penetrace“), čímž zvýšíte šanci, že retriever vybere správný blok i bez obrázku.

Transkripty videí: přesnost, time kódy, kapitoly

LLM preferují text. Proto u každého videa publikujte úplný transkript a pokud možno i kapitoly s názvy a časovými značkami. To dramaticky zvyšuje šanci na citovatelnost a extrakci faktů.

Požadavky na transkript

  • Přesnost ≥ 95 %: ruční korekce ASR; označte speciální termíny a vlastní jména.
  • Time kódy: každých 20–60 sekund nebo po logickém bloku, formát [mm:ss].
  • Účastníci: tagování řečníků (Moderátor:, Host:), stručné bio při první zmínce.
  • Vizuální prvky: verbálně popište klíčové snímky („[03:12] zobrazený lineární graf s výrazným zlomením v Q4 2024“).
  • Jazykové varianty: pokud je video vícejazyčné, publikujte paralelní transkripty a propojte je rel-linky.

Kapitoly a propojení

Každá kapitola má vlastní kotvu id=, krátký název a odkaz na související sekce článku nebo datasety. Modely tak najdou přesnou pasáž bez přehrávání videa a získají citelný snippet do odpovědí.

Grafy s legendou: čitelnost pro lidi i stroje

Grafy bez legendy nebo s legendou zakódovanou pouze barvou jsou pro stroje „neviditelné“. Přidejte textovou legendu, deklarujte jednotky a popište metodiku agregace. Preferujte SVG s přístupností (title/desc), aby bylo možné extrahovat obsah i bez OCR.

Prvky kvalitního grafu

  1. Název a podnázev: co, kdy, v jakých jednotkách (%, , index=100).
  2. Legenda: pojmenované série, styl a význam zvýraznění (např. „tlustá čára = moving average 3M“).
  3. Osy: jasné označení, intervaly, nulový bod.
  4. Popisky extrémů: max/min, zlomené body, anotace s datem a hodnotou.
  5. Zdroj a metoda: „sezónně očištěno, HICP, zdroj: …, verze datasetu v1.3“.

Konverze grafu na text

Po grafu vždy uveďte 2–3 věty verbální interpretace a shrnutí klíčových čísel, aby retrievery získaly „tlumočníka“ vizuálu.

Schémata, metadata a propojení (Schema.org, IPTC, ARIA)

  • Schema.org: použijte ImageObject, VideoObject, Dataset a CreativeWork v JSON-LD. Zahrňte caption, description, encodingFormat, contentUrl, thumbnailUrl, uploadDate, license, isBasedOn (odkaz na data).
  • IPTC/EXIF: vkládání autora, copyrightu, klíčových slov a popisů přímo do souborů pomáhá zachovat metadata při sdílení.
  • ARIA: pro skupiny grafů použijte landmarky a aria-labelledby/aria-describedby pro čitelnost čtečkami a modely.

Publikování: HTML vzory, feedy a kanonické prvky

Obrázek s krátkým a dlouhým popisem

<figure id="obr-penetracia"><img src="penetracia.svg" alt="Penetrace služby 2022–2025: růst z 12 % na 28 %, prudký skok v Q1 2025"><figcaption>Penetrace služby podle kvartálů; zdroj: Panel N=2 100, metodika: vážení podle věku a regionu.</figcaption></figure>

Video s transkriptem a kapitolami

<section id="video-case"><h3>Demonstrace produktu</h3><video controls src="demo.mp4" poster="demo.jpg"></video><ol><li id="kap-1">[00:00–01:10] Úvod a problém</li><li id="kap-2">[01:10–03:45] Řešení a architektura</li></ol><article id="transkript"><p>[00:12] Moderátor: Představujeme…</p><p>[01:25] Demo: Zobrazený graf…</p></article></section>

Graf se zpřístupněnými daty

<figure id="graf-penetracia"><svg role="img"><title>Penetrace služby 2022–2025</title><desc>Čára ukazuje růst z 12 % na 28 %, skok v Q1 2025</desc>…</svg><figcaption>Série A: Celková populace; Série B: 18–34. Jednotky: %. Zdroj: průzkum, v1.3. <a href="data/penetracia.csv">CSV</a> · <a href="data/penetracia.json">JSON</a></figcaption></figure>

Feedy a indexy

  • Sitemap pro multimédia: zahrňte položky s <image:image>/<video:video>, daty a tituly.
  • Atom/RSS: publikujte novinky o nových videích, grafech a datasetech na jediném kanonickém feedu.

RAG a retrievery: jak strukturovat multimodální korpus

  1. Chunkování: udržujte bloky 500–1 200 tokenů; pro grafy samostatný chunk s legendou a odkazem na data.
  2. Ukotvení entit: používejte konzistentní názvy entit (ISO kódy, SKU, osoby) a vnitřní linky.
  3. Propojení na tvrzení: každé vizualizaci přiřaďte alespoň jedno evidovatelné tvrzení (ID, zdroj, datum, verze).
  4. Vektorizace: ukládejte popisy obrázků, kapitoly videa a legendy grafů do vektorového indexu, ne samotná binární média.

Metiky a experimenty

Metrika Definice Cíl/Interpretace
Caption Recall@K Podíl dotazů, při kterých se správný obrázkový popis objeví v Top-K pasážích. > 0,8 při K=5 po zavedení dlouhých popisů.
Transcript Coverage % videí s úplným, time kódovaným transkriptem. Cíl 100 % u TOP obsahových URL.
Chart Interpretability Score Heuristika: přítomnost legendy, jednotek, popisu extrémů, zdroje, datového odkazu. > 4/5 pro všechny grafy v kanonických článcích.
Data-Link Utilization Počet stažení CSV/JSON připojených ke grafu. Růst o 20–30 % po zveřejnění.
LLM Citation Rate Podíl odpovědí, kde jsou citovány vaše multimodální bloky. Korelace s kvalitou popisů a legendy.

Governance: workflow, kvalita a aktualizace

  • Standardy: styleguide pro alt texty, šablony transkriptů, minima pro legendy grafů.
  • Kontroly: před publikováním běžná kontrola: přítomnost alt, figcaption, zdroje, jednotky, odkazy na data.
  • Verzování: při aktualizaci grafu navyšte verzi dat i vizuálu a uveďte changelog.
  • Licence a práva: jasně komunikujte licencování (CC BY, ODbL, vlastní práva na video/audio).

Implementační checklist

  1. Každý obrázek: krátký alt + dlouhý popis + figcaption se zdrojem a rokem.
  2. Každé video: úplný transkript s time kódy + kapitoly s kotvami + popis vizuálních prvků.
  3. Každý graf: název, jednotky, legenda, anotované extrémy, odkaz na CSV/JSON, verze datasetu.
  4. Vše označené v JSON-LD: ImageObject, VideoObject, Dataset.
  5. Feedy a sitemap: zahrnout multimedi