Anti-halucinace: upozornění a omezení

Anti-halucinace

Anti-halucinace je soubor principů, technik a procesů, které snižují riziko nepravdivých nebo nepodložených výstupů modelů umělé inteligence (LLM) a generativního vyhledávání (AI Overviews/SGE). V prostředí, kde AI shrnuje web, propojuje entity a generuje doporučení, je důležité nejen „zvýšit přesnost“, ale také transparentně komunikovat nejistoty, omezení a zdroje informací. Tento článek představuje praktický rámec anti-halucinace se zaměřením na disclaimery (upozornění) a limity (hranice použití) v kontextu AIO – optimalizace pro AI Overviews/SGE.

Co je halucinace a proč vzniká

Halucinace je stav, kdy model sebevědomě generuje tvrzení, které není fakticky správné nebo není podloženo žádným zdrojem. Příčiny zahrnují:

  • Pravděpodobnostní povahu generování: model vybírá další token podle pravděpodobnostního rozdělení, nikoli podle „pravdy“.
  • Nedostatečné uzemnění (grounding): chybějící propojení na spolehlivé reference během generování.
  • Kompresi znalostí: při učení model aproximuje velké množství faktů a vztahů; při extrapolaci může „dotvořit“ detaily.
  • Nejednoznačný prompt a nekonzistentní data: konfliktní zdroje, neaktuálnost, špatná normalizace entit.

Proč anti-halucinace patří do AIO (AI Overviews/SGE)

AI Overviews/SGE komprimuje web do krátkých přehledů. To zvyšuje dopad každé chyby: nesprávný fakt se okamžitě zobrazuje vysoko ve výsledcích vyhledávání (SERP). Optimalizace pro AIO tedy nespočívá pouze ve schématech a entitách, ale také v řízení rizika obsahu, implementaci disclaimerů, limitů odpovědí a v měření nejistoty.

Rámec anti-halucinace: 6 vrstev obrany

  1. Kurace znalostí: kanonické zdroje, synchronizovaná strukturovaná data, konzistentní entity.
  2. Uzemněné generování (RAG): retrieval s citacemi, verifikace tvrzení během generování.
  3. Kontrola a filtrace: post-generativní fact-checking, detekce tvrzení mimo doménu.
  4. Disclaimery a limity: transparentní komunikační vzory o nejistotě a rozsahu použití.
  5. Měření a evaluace: metriky fakticity, abstinence, „citation coverage“ a užitečnosti.
  6. Monitoring a řízení incidentů: zpětná vazba, rollbacks, korekční release.

Taxonomie disclaimerů (upozornění)

  • Soft disclaimer: jemné upozornění na možnou neúplnost („Může jít o zjednodušený přehled…“). Použití pro nízkoriziková témata.
  • Hard disclaimer: explicitní rámování rizika („Nejedná se o právní radu…“). Povinné v regulovaných doménách.
  • Conditional disclaimer: zobrazuje se dle signálu nejistoty nebo domény („Některé informace se mohly změnit…“).
  • Per-fact disclaimer: lokální označení sporných částí („Tento údaj nemá ověřený zdroj“).
  • Action-gate disclaimer: před akcí s dopadem (např. dávkování, finance) vyžaduje potvrzení/ověření.

Limity a abstinence: kdy raději neodpovídat

Robustní anti-halucinace vyžaduje mechanismus abstinence – vědomě neodpovědět nebo přesměrovat na zdroj, pokud:

  • retrieval nenalezl relevantní a aktuální zdroje,
  • detekce domény zjistila regulovaný kontext (zdraví, finance, právo),
  • kontradiktorní zdroje neumožňují bezpečný souhrn,
  • míra nejistoty překračuje stanovený práh.

Prakticky: definujte confidence_threshold, při kterém model „odmítne“ odpověď a nabídne odkazy na důvěryhodné zdroje nebo kontakt na odborníka.

Signály nejistoty a jejich komunikace

  • Confidence score: interní skóre odvozené z retrievalu (počet, kvalita, shoda zdrojů) a z generativních logitů.
  • Coverage score: procento tvrzení, která mají konkrétní citaci (citation_coverage).
  • Recency score: časová aktuálnost vůči poptávce (např. novinky, ceny, kurzy).

Komunikace navenek: při nízkém skóre zobrazte conditional disclaimer, omezte rozsah tvrzení, zvýšte hustotu citací a doporučte primární zdroj.

Disclaimery jako součást UX mikrotextu

  • Viditelnost bez překážení: umístěte nad shrnutí nebo pod první odstavec, ne do patičky.
  • Jasnost a stručnost: bez žargonu, 1–2 věty, aktivní jazyk.
  • Kontextualizace: proč se zobrazují (např. „Téma se často mění“, „Výsledky závisí na regionu“).
  • Interaktivita: rozbalovací blok „Jak shromažďujeme informace“ s vysvětlením retrieválu, dat a citací.

Šablony disclaimerů (CZ)

  • Soft: „Toto je přehled vytvořený AI na základě veřejných zdrojů. Může být neúplný.“
  • Hard: „Následující informace nepředstavují zdravotní/finanční ani právní radu. Pro odborné vedení kontaktujte kvalifikovaného specialistu.“
  • Conditional: „Některé údaje se naposledy měnily nedávno. Prosím ověřte aktuální podmínky.“
  • Per-fact: „Tento údaj nemá potvrzený zdroj.“
  • Action-gate: „Před pokračováním si ověřte informace v oficiálním zdroji.“

Limity domény a právní hlediska

V regulovaných doménách zavádějte tematické limity (co AI nesmí tvrdit) a regionální omezení (zákony, licence). Logujte kontext, zdroje a verzi modelu pro auditovatelnost. Zajistěte lokalizované disclaimery s ohledem na legislativu a ochranu spotřebitele.

Uzemněné generování (RAG) a citace

  • Retrieval před generováním: vyhledání pasáží z kanonických zdrojů (dokumentace, normy, oficiální databáze).
  • Citace na úrovni tvrzení: vazba alespoň 1:1 pro každý fakt vyššího rizika.
  • Kontrola rozporů: heuristiky penalizující sporné pasáže nebo staré verze.
  • Fallback: pokud retrieval selže, spusťte abstinenci + odkazy na oficiální zdroje.

Strukturovaná data a datová konzistence

Anti-halucinace je výrazně závislá na kvalitě dat. Pro AIO nasazujte:

  • Schema.org: typy jako Organization, Product, HowTo, FAQPage, MedicalEntity s úplnými a konzistentními vlastnostmi (name, description, sameAs, identifier, inLanguage, dateModified).
  • Kanonické identifikátory: ID v interních systémech, Wikidata Q-ID, ISBN, GTIN, ORCID, které usnadňují „entity resolution“.
  • Verzování: udržujte dateModified a historii změn; AI systémy upřednostňují čerstvost a konzistenci.
  • Konvergence kanálů: stejné fakta na webu, API, produktových feedech, GBP a open datech.

Promptové vzory proti halucinaci

  • Instrukce abstinence: „Pokud chybí spolehlivý zdroj, odpověz ‚nevím‘ a navrhni oficiální zdroj.“
  • Povinná citace: „Každé tvrzení o číslech dolož konkrétní citací.“
  • Rozsah domény: „Odpovídej pouze v rámci [domena]; jinak doporuč zdroj.“
  • Verifikační smyčka: „Zkontroluj každou větu; pokud chybí zdroj, přeformuluj nebo odstraň.“

Post-generativní kontroly (guardrails)

  • Claim extraction: extrahujte tvrzení a porovnejte je s retrieved pasážemi.
  • Contradiction check: NLI modely nebo pravidla pro detekci rozporů.
  • Policy check: filtrujte zakázaná doporučení a regulovaná tvrzení bez disclaimeru.
  • Template check: ověřte, že se zobrazil správný disclaimer podle domény a rizika.

Metriky anti-halucinace

  • Hallucination rate (HR): podíl tvrzení bez validního zdroje.
  • Citation coverage (CC): procento vět/faktů se správnou citací.
  • Abstention rate (AR): podíl dotazů, kde AI zvolí „neodpovědět“.
  • Factual Precision/Recall: přesnost a úplnost faktů v testovací sadě.
  • User-reported corrections: počet oprav na 1 000 odpovědí, doba do opravy.
  • Recency fit: shoda s časovou aktuálností (u témat s častými změnami).

Evaluace a testování

  • Golden set: referenční otázky s kanonickými odpověďmi a citacemi.
  • Adverzariální scénáře: záměry s nejednoznačností, zastaralými a konfliktními zdroji.
  • Domain red-teaming: právní, medicínské a finanční hraniční případy.
  • Live shadow eval: pasivní porovnávání variant disclaimerů a prahů abstinence v reálném provozu (bez ovlivnění uživatele).

Monitorování a řízení incidentů

  • Telemetrie: logujte citace, skóre nejistoty, verzi modelu a prompt.
  • Alerty: prahy pro Hallucination rate, pokles CC, nárůst uživatelských hlášení oprav.
  • Playbook: okamžitá deaktivace rizikových odpovědí, rollback modelu/promptu, hotfix disclaimerů.
  • Post-mortem: příčina (data, retrieval, prompt), akční plán, vlastník a termíny.

Implementační plán pro obsahové weby (AIO)

  1. Audit entit a dat: identifikujte kanonické zdroje, odstraňte konflikty, doplňte identifikátory.
  2. Schema.org a feedy: doplňte klíčové vlastnosti, dateModified, sameAs, kontrolujte konzistenci.
  3. RAG infrastruktura: vytvořte index spolehlivých dokumentů, nastavte citace na úrovni tvrzení.
  4. UX disclaimery: navrhněte šablony pro domény, přeložte, A/B testujte viditelnost a délku.
  5. Prahy nejistoty: definujte confidence_threshold a pravidla abstinence.
  6. Guardrails: claim-check, contradiction-check, policy-check v pipelinech.
  7. Měření a alerty: zavedení HR, CC, AR, recency fit; nastavte alerty a dashboardy.
  8. Korekční proces: definujte SLA pro opravy a aktualizace obsahu.

Příklady mikrotextů dle rizika

  • Nízké riziko (cestování): „Jedná se o souhrn vytvořený AI. Zkontrolujte aktuální otevírací hodiny na oficiálním webu.“
  • Střední riziko (technické návody): „Postup je zjednodušený a může se lišit podle verze. Ověřte si dokumentaci výrobce.“
  • Vysoké riziko (zdraví/finance): „Toto není zdravotní/finanční rada. Před rozhodnutím se poraďte s odborníkem.“

Anti-halucinační vzory pro tvůrce obsahu

  • Faktická jádra: krátké pasáže s jedním tvrzením a jednou citací (snadno indexovatelné a znovu použitelné).
  • Verzované sekce: bloky s datem aktualizace a odkazem na changelog.
  • Konfliktní poznámky: explicitně uveďte, kde se autoritativní zdroje liší a proč jste zvolili konkrétní interpretaci.
  • Regionální variace: označte jurisdikci, ve které tvrzení platí (např. „Platí pro EU, 2025“).

Měření dopadu na AI Overviews/SGE

Sledujte změny v zobrazování částí obsahu v AIO (extrahované pasáže, citace), pokrytí entit a trend chybových korekcí. Zaměřte se na:

  • Share of voice v AIO: procento dotazů, kde se váš web objeví v AI přehledu.
  • Quality score interní: poměr citovaných vs. necitovaných tvrzení v pasážích, které AIO přebírá.
  • Casetime to fix: průměrný čas od nahlášení chyby po aktualizaci zdrojů a změnu v AIO.

Časté chyby v praxi