Anti-halucinace: Implementace upozornění a stanovení platnostních limitů

Anti-halucinace

Anti-halucinace je soubor principů, technik a procesů, které snižují riziko nepravdivých nebo nepodložených výstupů modelů umělé inteligence (LLM) a generativního vyhledávání (AI Overviews/SGE). V prostředí, kde AI shrnuje webový obsah, propojuje entity a generuje doporučení, je důležité nejen „zvýšit přesnost“, ale také transparentně komunikovat nejistotu, omezení a zdroje informací. Tento článek představuje praktický rámec anti-halucinace se zaměřením na disclaimery (upozornění) a limity (hranice použitelnosti) v kontextu AIO – optimalizace pro AI Overviews/SGE.

Co je halucinace a proč vzniká

Halucinace je stav, kdy model sebevědomě generuje tvrzení, které není fakticky správné nebo není podloženo žádným zdrojem. Příčiny zahrnují:

  • Pravděpodobnostní povahu generování: model vybírá další token podle rozdělení pravděpodobnosti, nikoli podle „pravdy“.
  • Nedostatečné uzemnění (grounding): chybějící propojení na spolehlivé reference během generování.
  • Kompresi znalostí: při učení model aproximuje velké množství faktů a vztahů; při extrapolaci může „dokončit“ detaily.
  • Nejednoznačný prompt a nekonzistentní data: konfliktní zdroje, neaktuálnost, špatná normalizace entit.

Proč anti-halucinace patří do AIO (AI Overviews/SGE)

AI Overviews/SGE komprimuje web do krátkých přehledů. To zvyšuje dopad každé chyby: nesprávný fakt se okamžitě zobrazuje vysoko ve výsledcích vyhledávání (SERP). Optimalizace pro AIO proto nespočívá pouze ve schématech a entitách, ale i v řízení rizika obsahu, implementaci disclaimerů, limitů odpovědí a v měření nejistoty.

Rámec anti-halucinace: 6 vrstev obrany

  1. Kurace znalostí: kanonické zdroje, synchronizovaná strukturovaná data, konzistentní entity.
  2. Uzemněné generování (RAG): retrieval s citacemi, verifikace tvrzení během generování.
  3. Kontrola a filtrace: post-generativní fact-checking, detekce tvrzení mimo doménu.
  4. Disclaimery a limity: transparentní komunikační vzory o nejistotě a rozsahu použití.
  5. Měření a evaluace: metriky fakticity, abstinence, „citation coverage“ a užitečnosti.
  6. Monitoring a incident management: zpětná vazba, rollbacks, korekční releasy.

Taxonomie disclaimerů (upozornění)

  • Soft disclaimer: jemné upozornění na možnou neúplnost („Může jít o zjednodušený přehled…“). Použití pro nízkoriziková témata.
  • Hard disclaimer: explicitní rámování rizika („Nejedná se o právní radu…“). Povinné v regulovaných oblastech.
  • Conditional disclaimer: zobrazovaný podle signálu nejistoty nebo domény („Některé informace se mohly změnit…“).
  • Per-fact disclaimer: lokální označení sporných částí („Tento údaj nemá ověřený zdroj“).
  • Action-gate disclaimer: před akcí s dopadem (např. dávkování, finance) vyžaduje potvrzení/ověření.

Limity a abstinence: kdy raději neodpovídat

Robustní anti-halucinace vyžaduje mechanismus abstinence – vědomě neodpovídat nebo přesměrovat na zdroj, pokud:

  • retrieval nenašel relevantní a aktuální zdroje,
  • detekce domény zjistila regulovaný kontext (zdraví, finance, právo),
  • kontradiktorní zdroje neumožňují bezpečný souhrn,
  • míra nejistoty překračuje stanovený práh.

Prakticky: definujte confidence_threshold, při kterém model „odmítne“ a nabídne odkazy na důvěryhodné zdroje nebo kontakt na experta.

Signály nejistoty a jejich komunikace

  • Confidence score: interní skóre odvozené z retrievalu (počet, kvalita, shoda zdrojů) a z generativních logitů.
  • Coverage score: procento tvrzení s konkrétní citací (citation_coverage).
  • Recency score: datová aktuálnost vůči poptávce (např. novinky, ceny, kurzy).

Komunikace navenek: při nízkém skóre zobrazte conditional disclaimer, omezte rozsah tvrzení, zvyšte hustotu citací a doporučte primární zdroj.

Disclaimery jako součást UX mikrotextu

  • Viditelnost bez překážení: umístěte nad shrnutí nebo pod první odstavec, nikoli do patičky.
  • Jasnost a stručnost: bez žargonu, 1–2 věty, aktivní jazyk.
  • Kontextualizace: proč se zobrazuje (např. „Téma se často mění“, „Výsledky závisí na regionu“).
  • Interaktivita: rozbalovací blok „Jak shromažďujeme informace“ s vysvětlením retrievalu, dat a citací.

Šablony disclaimerů (CZ)

  • Soft: „Toto je přehled vytvořený AI na základě veřejných zdrojů. Může být neúplný.“
  • Hard: „Následující informace nepředstavují zdravotní/finanční ani právní radu. Pro odborné doporučení kontaktujte kvalifikovaného specialistu.“
  • Conditional: „Některá data se naposledy měnila nedávno. Ověřte si prosím aktuální podmínky.“
  • Per-fact: „Tento údaj nemá potvrzený zdroj.“
  • Action-gate: „Před pokračováním si ověřte informace v oficiálním zdroji.“

Limity domény a právní hlediska

V regulovaných oblastech zavádějte tematické limity (co AI nesmí tvrdit) a regionální omezení (zákony, licence). Logujte kontext, zdroje a verzi modelu pro auditovatelnost. Zajistěte lokalizované disclaimery s ohledem na legislativu a ochranu spotřebitele.

Uzemněné generování (RAG) a citace

  • Retrieval před generováním: vyhledání pasáží z kanonických zdrojů (dokumentace, normy, oficiální databáze).
  • Citace na úrovni tvrzení: vazba minimálně 1:1 pro každý fakt vyššího rizika.
  • Kontrola rozporů: heuristiky penalizující sporné pasáže nebo staré verze.
  • Fallback: pokud retrieval selže, aktivujte abstinenci + odkazy na oficiální zdroje.

Strukturovaná data a datová konzistence

Anti-halucinace je silně závislá na datové hygieně. Pro AIO implementujte:

  • Schema.org: typy jako Organization, Product, HowTo, FAQPage, MedicalEntity s úplnými a konzistentními vlastnostmi (name, description, sameAs, identifier, inLanguage, dateModified).
  • Kanonické identifikátory: ID v interních systémech, Wikidata Q-ID, ISBN, GTIN, ORCID, které usnadňují „entity resolution“.
  • Verzování: udržujte dateModified a historii změn; AI systémy preferují čerstvost a konzistenci.
  • Konvergence kanálů: stejné fakty v webech, API, produktových feedech, GBP a otevřených datech.

Promtové vzory proti halucinaci

  • Instrukce abstinence: „Pokud chybí spolehlivý zdroj, odpověz ‚nevím‘ a navrhni oficiální zdroj.“
  • Citace povinná: „Každé tvrzení o číslech podlož konkrétní citací.“
  • Rozsah domény: „Odpovídej pouze v rámci [doména]; jinak doporuč zdroj.“
  • Verifikační smyčka: „Zkontroluj každou větu; pokud chybí zdroj, přeformuluj nebo odstraň.“

Post-generativní kontroly (guardrails)

  • Claim extraction: extrahujte tvrzení a porovnejte je s retrieved pasážemi.
  • Contradiction check: NLI modely nebo pravidla pro detekci rozporů.
  • Policy check: filtrujte zakázané rady a regulovaná tvrzení bez disclaimeru.
  • Template check: validujte, že se zobrazil správný disclaimer podle domény a rizika.

Metriky anti-halucinace

  • Hallucination rate (HR): podíl tvrzení bez platného zdroje.
  • Citation coverage (CC): procento vět/faktů se správnou citací.
  • Abstention rate (AR): podíl dotazů, kde AI zvolí „neodpovědět“.
  • Factual Precision/Recall: přesnost a úplnost faktů v testovací sadě.
  • User-reported corrections: počet oprav na 1 000 odpovědí, čas do opravy.
  • Recency fit: shoda s časovou aktuálností (u témat s častými změnami).

Evaluace a testování

  • Golden set: referenční otázky s kanonickými odpověďmi a citacemi.
  • Adverzariální scénáře: záměry s nejednoznačností, zastaralými a konfliktními zdroji.
  • Domain red-teaming: právní, medicínské a finanční hraniční případy.
  • Live shadow eval: pasivní porovnávání variant disclaimerů a prahů abstinence v reálném provozu (bez ovlivnění uživatele).

Monitorování a incident management

  • Telemetrie: logujte citace, skóre nejistoty, verzi modelu a prompt.
  • Alerty: prahy pro Hallucination rate, pokles CC, nárůst uživatelem hlášených oprav.
  • Playbook: okamžitá deaktivace rizikových odpovědí, rollback modelu/promptu, hotfix disclaimerů.
  • Post-mortem: kořenová příčina (data, retrieval, prompt), akční plán, odpovědný a termíny.

Implementační plán pro obsahové weby (AIO)

  1. Audit entit a dat: identifikujte kanonické zdroje, odstraňte konflikty, doplňte identifikátory.
  2. Schema.org a feedy: doplňte klíčové vlastnosti, dateModified, sameAs, kontrolujte konzistenci.
  3. RAG infra: vytvořte index spolehlivých dokumentů, nastavte citace na úrovni tvrzení.
  4. UX disclaimery: navrhněte šablony pro domény, přeložte, A/B testujte viditelnost a délku.
  5. Prahy nejistoty: definujte confidence_threshold a pravidla abstinence.
  6. Guardrails: claim-check, contradiction-check, policy-check v pipelines.
  7. Měření a alerty: zavedení HR, CC, AR, recency fit; nastavte alerty a dashboardy.
  8. Korekční proces: definujte SLA na opravy a aktualizace obsahu.

Příklady mikrotextů podle rizika

  • Nízké riziko (cestování): „Jedná se o shrnutí vytvořené AI. Zkontrolujte aktuální otevírací hodiny na oficiálních stránkách.“
  • Střední riziko (technické návody): „Postup je zjednodušený a může se lišit podle verze. Ověřte si dokumentaci výrobce.“
  • Vysoké riziko (zdraví/finance): „Toto není zdravotní/finanční rada. Před rozhodnutím se poraďte s odborníkem.“

Anti-halucinační vzory pro tvůrce obsahu

  • Faktická jádra: krátké pasáže s jedním tvrzením a jednou citací (snadno indexovatelné a opakovaně použitelné).
  • Verzované sekce: bloky s datem aktualizace a odkazem na changelog.
  • Konfliktní poznámky: explicitně uveďte, kde se autoritativní zdroje liší a proč jste zvolili konkrétní interpretaci.
  • Regionální variace: označte jurisdikci, ve které tvrzení platí (např. „Platí pro EU, 2025“).

Měření dopadu na AI Overviews/SGE

Sledujte změny v zobrazování částí obsahu v AIO (extrahované pasáže, citace), pokrytí entit a trend oprav chyb. Zaměřte se na:

  • Share of voice v AIO: procento dotazů, kde se váš web objeví v AI přehledu.
  • Quality score interní: poměr citovaných vs. necitovaných tvrzení v pasážích, které AIO přebírá.
  • Casetime to fix: průměrný čas od nahlášení chyby po aktualizaci zdrojů a změnu v AIO.

Časté chyby v praxi

  • Disclaimery v patičce: uživatel je nevidí v kritickém okamžiku.
  • Generická a dlouhá upozorn