Přehled: co je vektorová databáze a proč je klíčová pro LLM/SEO
Vektorová databáze je specializované úložiště pro ukládání a dotazování embeddingů – vysoce dimenzionálních reprezentací textu, obrázků či multimodálních objektů. Umožňuje vyhledávání podobnosti (k-NN) na základě sémantiky místo přesné shody řetězců. V praxi je základem pro RAG (Retrieval-Augmented Generation), interní vyhledávání, deduplikaci obsahu, doporučování a moderní SEO/AEO (Answer/AI Engine Optimization), kde je nezbytné odpovídat na dotazy „podle významu“.
Embeddingy: význam, typy a vlastnosti
- Definice: vektor reálných čísel (např. d=384–4096), který zachycuje význam jednotky obsahu (slovo, věta, odstavec, dokument, obrázek).
- Typy: sentence a passage embeddingy pro text; multimodální (text↔obrázek); domain-specific (kód, právo, medicína).
- Normalizace: L2-norma na jednotkovou délku je běžná při kosínové podobnosti a usnadňuje metrické porovnávání.
- Stabilita v čase: změny modelů generují odlišné embeddingy; vyžadují versioning a migrační strategie.
Metriky podobnosti: kosín, dot-product a eukleidovská vzdálenost
- Kosínová podobnost: míra úhlu mezi vektory; robustní vůči škálování, preferovaná u L2-normalizovaných embeddingů.
- Dot-product (vnitřní součin): citlivý na délku vektoru; používá se s učením, které optimalizuje skóre přímo.
- L2 vzdálenost: vhodná pro některé knihovny a kvantizační indexy; při normalizaci konverguje ke kosínu.
Indexování: přesné vs. aproximované vyhledávání k-NN
- Přesné (brute-force): 100 % recall, ale nákladné (O(N·d)). Vhodné pro malé kolekce, re-ranking nebo offline dávky.
- ANN indexy (Approximate Nearest Neighbors): HNSW (graf), IVF (k-means cluster-listy), PQ/OPQ (kvantizace), ScaNN (anizotropní vyhledávání). Umožňují kompromis recall↔latence↔paměť.
- Parametry ladění: efSearch/efConstruction pro HNSW, nlist/nprobe pro IVF, bitová hloubka PQ; všechny ovlivňují přesnost a rychlost.
Struktura záznamu: vektor + metadata + obsah
- Primární klíč: stabilní
id(URI/UUID) pro mapování zpět na zdroj (URL, dokument, entita). - Vektor: pole
float32/float16/int8(dle komprese); volitelně více vektorů pro více pohledů (title/body/anchor). - Metadata: filterable vlastnosti (jazyk, datum, autor, téma, region, přístupová práva).
- Payload: zkrácený text/HTML snippet, odkaz, kontrolní součet, verze embeddingu a zdroje.
Komprese a náklady: PQ, SQ a smíšená přesnost
- Product Quantization (PQ/OPQ): snižuje nároky na RAM/SSD, zkracuje latenci za cenu mírné ztráty přesnosti.
- Scalar Quantization (SQ/int8): jednodušší, levná komprese; pozor na citlivost u slabších modelů.
- Float16/BF16: kompromis mezi přesností a náklady při GPU akceleraci.
Filtry a hybridní vyhledávání: BM25 + vektor + re-ranking
- Vektor + metadatové filtry: omezení prostoru (jazyk, časové okno, region) zvyšuje relevanci a rychlost.
- Hybrid: kombinace lexikálního skóre (BM25) a vektorového skóre (např. vážený součet nebo učitelem naučený fúzní model).
- Re-ranking: cross-encoder (nákladnější, přesnější) přeřadí top-k kandidátů; často přináší největší nárůst kvality.
- MMR/Diversity: penalizuje redundanci, vrací rozmanitou sadu pasáží pro RAG.
Chunkování a granularita: jak „krájet“ obsah
- Pasáže 200–400 tokenů: dobrý kompromis pro QA a RAG; zachovávejte překrytí 10–20 % pro kontextovou soudržnost.
- Víceúrovňové embeddingy: nadpis (title), shrnutí (summary), pasáž (passage) – dotaz může různě vážit jednotlivé jednotky.
- Tabulky a kód: používejte specifické tokenizéry a zachovejte strukturu (CSV/JSON ukotvení v metadatech).
RAG pipeline: kde se vektorová DB zapojuje
- Indexace: extrakce → chunk → embed → upsert do vektorové DB (s metadaty, verzí, kontrolním součtem).
- Retrieval: dotaz → embed → vektorové + hybridní vyhledávání → filtry → top-k.
- Orchestrace: re-ranking, MMR, sloučení s pravidly (kompliance), sestavení kontextu.
- Generování: prompt s kontextem, citace/zdroje, post-processing (ověření, redakce).
Správa verzí a migrace embeddingů
- Verze modelu:
embed_model=v3.2v metadatech; umožňuje souběžné používání více generací. - Dvojitý index: paralelní budování nového indexu; přepnutí read-path po validaci.
- Tombstones a TTL: označte zastaralé pasáže; plánované čištění šetří náklady a zlepšuje kvalitu.
Škálování, latence a SLO
- Horizontální škálování: shardování podle
idnebo tématu; repliky pro čtení. - Teplé cache: cache nejčastějších query embeddingů a top-k výsledků; snižuje mezipaměťové výkyvy.
- SLO: cíl P95 latence (např. < 150 ms pro top-k=20) a chybovost; backoff při špičkách.
Evaluace kvality: jak měřit relevanci
- Recall@k / Precision@k: základní metriky návratu relevantních pasáží.
- nDCG@k, MRR: zohledňují pořadí; vhodné při re-rankování.
- Answerability: procento dotazů, kde RAG dokáže spolehlivě odpovědět s poskytnutým kontextem.
- Human-in-the-loop: kurátorská hodnocení, porota, případové záznamy (judgements) pro kalibraci.
Bezpečnost, práva a compliance
- Autorizace na úrovni záznamu: Attribute-Based Access Control v metadatech (tenant, třída dokumentu, region).
- PII a GDPR: maskování/šifrování payloadu, právo na výmaz (kaskádové tombstones) a audit přístupů.
- Izolace tenantů: per-tenant indexy nebo namespace; minimalizace „úniku“ kontextu při RAG.
Nejčastější antivzory a chyby
- Míchání verzí embeddingů: snižuje relevanci a konzistenci výsledků.
- Příliš velké chunky: rozmazání signálu → horší přesnost a zbytečné náklady.
- Nefiltrované zdroje: zastaralé nebo duplicitní pasáže vedou k halucinacím v RAG.
- Ignorování re-rankingu: samotné ANN často nestačí pro špičkovou kvalitu.
- Bez metadat: nemožnost „privacy“ filtrů, regionálních pravidel a časové relevance.
Výběr platformy: open-source, cloud a manažované služby
- Open-source jádro: FAISS/HNSW (knihovny) zabudované do databází (např. Postgres+pgvector) – vhodné pro kontrolu a integraci.
- Vektorové DB: systémy navržené pro vektory (např. grafové/ANN jádro) s nativním filtrem metadat, shardováním a replikací.
- Manažované služby: rychlý start, SLA, automatické škálování, ale vendor lock-in a nákladové limity.
Operativa a observabilita
- Telemetrie: latence, hit rate cache, paměť, stav indexů, drift query embeddingů.
- Detekce driftu: změny distribuce dotazů/obsahu vyžadují re-embedování nebo úpravu chunkování.
- Incident runbook: degradace recallu, rozpad indexu, selhání shardu – definujte postupy a kontakty na SRE.
Multimodální a vícejazyčné scénáře
- Cross-lingual: jednotný embeddingový prostor pro více jazyků; metadatové filtry zabraňují míchání nesouvisejících jazyků v odpovědích.
- Multimodální: vyhledávání obrázek→text, text→obrázek; záznamy nesou typ modality a odkaz na původní asset.
Integrace s moderním SEO/AIO/AEO
- Semantické klastry: skupiny URL/odpovědí reprezentované centrálním vektorem; umožňují analýzu topical authority.
- FAQ a answer-first bloky: embeddingy Q/A zvyšují šanci na přesné odpovědi v Chat/AI rozhraních.
- De-dup a kanibalizace: prahy podobnosti odhalují interní duplicity, které snižují CTR a ranking.
- Personalizace: re-ranking podle profilu/segmentu s respektováním privacy metadat.
Praktický checklist před nasazením
- Definovaná granularita (title/summary/passage) a pravidla chunkování s překrytím.
- Vybraný ANN index (HNSW/IVF+PQ) a metrika (cosine/dot/L2) s odůvodněním.
- Metadatové filtry (jazyk, region, čas, přístup) a hybrid s BM25.
- Implementovaný re-ranking a MMR pro diverzitu.
- Versioning embeddingů, plán migrace a tombstones.
- SLO pro latenci/recall, observabilita a alerty.
- Bezpečnostní vrstva: ABAC, ochrana PII, audit.
- Benchmark: Recall@k, nDCG@k, answerability s kurátorským šetřením.
Vektorová databáze jako infrastruktura sémantické relevance
Vektorová databáze je páteří sémantického vyhledávání a základním stavebním prvkem RAG a moderního SEO/AEO. Její hodnota se naplno projeví až při kombinaci správného embeddingového modelu, dobře navrženého chunkování, vhodného ANN indexu, metadatových filtrů, hybridního skórování a re-rankingu. S jasnou správou verzí, bezpečnostními politikami a kvalitní observabilitou poskytuje konzistentní relevanci při udržitelných nákladech a škálování.


























