Co je latence a proč je klíčová pro SEO, AIO/AEO a LLM
Latence je časové zpoždění mezi podnětem (požadavkem uživatele nebo systému) a pozorovatelnou odezvou. V kontextu webu, vyhledávání a AI odpovědí ovlivňuje latence nejen uživatelskou zkušenost (UX) a konverze, ale také to, zda se váš obsah dostane do výběru odpovědí AI (AIO/AEO) a jak jej interpretuje LLM. Vysoká latence snižuje šanci na interakci, prohlubuje odchodovost a v extrémech způsobuje, že AI systémy upřednostňují rychlejší zdroje.
Druhy latence v digitálním řetězci
- Síťová latence – DNS lookup, TCP/QUIC handshake, TLS, RTT a propustnost trasy (peering, hustota CDN).
- Back-end latence – fronta žádostí, CPU/I/O čekání, databázové dotazy, cache missy, mikroservisy, fronty zpráv.
- Edge/render latence – CDN/edge funkce, prerendering/SSR/ISR, transformace (komprese, obrazové formáty).
- Klientská latence – parsování HTML/CSS/JS, hidratační čas, JS blokování hlavního vlákna, dekódování obrázků, layout/paint.
- LLM/AI latence – vyhledání kontextu (RAG), latence vektorového indexu, inference modelu, tokenizace a streamování odpovědi.
Metabolismus latence: metriky, na kterých záleží
- TTFB (Time to First Byte): součet síťové a serverové latence do prvního bajtu. Silně koreluje s vnímanou rychlostí.
- LCP (Largest Contentful Paint): nepřímé vyjádření latence síť + render; často omezená velikostí a dostupností hlavních zdrojů.
- INP (Interaction to Next Paint): odezva na interakci; citlivá na JS blokování a hlavní vlákno.
- RTT (Round-Trip Time): fyzikální limit trasy; optimalizovatelný umístěním obsahu blíže k uživateli (CDN/edge).
- Jitter: variabilita latence; důležitá pro streaming a interaktivitu.
- Tail latence p95/p99: extrémy, které ničily UX a SLO; důležitější než průměr.
Vztah latence k E-E-A-T, SEO a AIO/AEO
- SEO: pomalé TTFB a vysoká latence zdrojů snižují šance na dobré Core Web Vitals a mohou omezit crawling a efektivní renderování.
- AIO/AEO: Answer engine preferují zdroje, které dodávají text, strukturovaná data a multimédia rychle a stabilně; rychlost je implicitní signál kvality.
- LLM optimalizace webů: nižší latence zvyšuje pravděpodobnost úspěšného stažení a parsování strukturovaných dat (JSON-LD), čímž se zlepšuje mapování entit.
Fronta a vytížení: proč p99 bolí nejvíce
Při vytížení serveru blízko 100 % se podle principů teorie čekacích řad (Littleův zákon, M/M/1) dramaticky zvyšují čekací časy. I malé špičky způsobí skok p95/p99 latence. Proto je kritické dimenzování (capacity planning), back-pressure, circuit-breakery a bulkhead izolace služeb.
Měření latence: RUM vs. syntetika
- RUM (Real User Monitoring): reálná data z prohlížečů (Navigation/Resource/Long Tasks API). Ukazuje regionální a zařízení-specifické rozdíly.
- Syntetické testy: konzistentní laboratorní měření (opakovatelná, profilování, testování změn).
- Tracing (např. OpenTelemetry): koreluje latenci napříč mikroservisy, databázemi a frontami; klíč k p95 korelacím.
Zdrojové závislosti a kritická cesta
Každý zdroj na kritické cestě (HTML → CSS → fonty/JS → hero obrázek) přidává latenci. Cílem je minimalizovat počet RTT (HTTP/2/3), zmenšit objem bajtů a oddálit nekritické úlohy (defer/async). Kritická cesta by měla být explicitně navržena: preload pro nejdůležitější zdroje, server-push je nahrazen precizním preloadingem a edge hinty.
Optimalizační playbook pro síť a edge
- CDN/Edge: nasazení co nejblíže uživateli; inteligentní routing, coalescing, HTTP/3 (QUIC), TLS 1.3, 0-RTT obnova.
- DNS a spojení: snížit CNAME řetězce, využívat dohody o peeringu;
<link rel="preconnect">pro origin a kritické domény. - Kompresion a formáty: texty přes Brotli; obrázky AVIF/WEBP; adaptivní velikosti; serverové
Accept-EncodingaVarysprávně nastavené. - Cache strategie:
Cache-Controlsmax-age,s-maxage,stale-while-revalidate; validátoryETagaLast-Modified. - HTML přenos: early flush (HTML streaming), chunked transfer; minimalizovat blokující meta-refresh a JS.
Optimalizační playbook pro back-end
- Hot paths: identifikovat top endpointy podle RPS a latence; vyhradit jim rozpočty CPU/IO.
- Databáze: indexy podle profilů dotazů, eliminace N+1, connection pooling, read-repliky, CQRS tam, kde to dává smysl.
- Cache vrstvy: výsledkové cache (kvazi-idempotentní odpovědi), memoizace, TTL podle stálosti; negative caching a dogpile prevence.
- Asynchronní zpracování: odložení neinteraktivních procesů do front (e-maily, webhooks, náročné transformace).
- SSR/ISR: u obsahových stránek generovat nebo inkrementálně prerenderovat na edge; vyhnout se cold-start penalizacím.
Optimalizační playbook pro front-end a interaktivitu
- Kritické CSS: inline pouze minimum, zbytek odložit; vyhnout se velkým globálním knihovnám.
- JavaScript: code-splitting, lazy-hydration,
defer/async, odstranit nevyužité moduly; používat islands architekturu. - Obrázky a fonty:
fetchpriority="high"pro LCP obrázek;font-display: swap; subsetting fontů. - Interakční latence: minimalizovat dlouhé úlohy (>50 ms); plánovat práci přes
requestIdleCallback; vyhnout se synchronním XHR.
Latence a LLM/AI: specifika pro AIO a generativní rozhraní
- RAG pipeline: před-cacheovat embeddingy, držet vektory v RAM (HNSW/IVF-PQ), omezovat počet kandidátů, late fusion až po re-rankingu.
- Inference: model s menším kontextem a speculative decoding; streamování tokenů na klienta pro vnímaný čas do první odpovědi.
- Prompt cache: šablony a časté otázky uchovávat v edge cache; ESI/edge compute pro rychlé „AI snippets“.
- Bezpečné timeouts: při degradaci raději vrátit konzervativní odpovědi z cache než čekat na p99 inference.
Rozpočty a SLO: jak nastavovat cíle
Definujte SLI (Service Level Indicators) a SLO (Service Level Objectives) pro p95/p99. Příklad cílů pro veřejný web:
| Metrika | Cíl p95 | Cíl p99 | Poznámka |
|---|---|---|---|
| TTFB (EU) | < 200 ms | < 350 ms | CDN + TLS 1.3 + cache |
| LCP | < 2,5 s | < 4,0 s | optimalizovat hero zdroje |
| INP | < 200 ms | < 300 ms | Long Tasks < 50 ms |
| API (kritické) | < 150 ms | < 300 ms | v regionální blízkosti |
Diagnostika: kde hledat ztracené milisekundy
- Waterfall (síť/zdroje): identifikace blokujících kroků, prázdných RTT a chybějících
preload. - Flamegraphy: CPU „horká místa“ na serveru a klientovi.
- Trace mapy: požadavek přes služby; hledání „nepomalejšího článku řetězce“.
- Percentily: porovnávat p50 vs. p95/p99; p50 skrývá problémy.
- Regionální segmentace: Edge PoP vs. origin; mobil vs. desktop; rozdíly mezi prohlížeči.
Latence a obsah: jak ji reflektovat v architektuře webu
- IA a routování: méně skoků k cíli, méně přesměrování; kanonické URL bez řetězení 302/301.
- Strukturovaná data: JSON-LD podávat spolu s HTML (ne přes opožděný JS), aby je AI/roboti viděli bez čekací penalizace.
- Prerendering/SSR/ISR: obsah, který AI často cituje, připravovat předem; minimalizovat runtime generování.
Antivzory, které zvyšují latenci
- Velké JS frameworky pro statické stránky bez code-splittingu.
- Řetězení proxy vrstev a vícenásobné TLS terminace bez důvodu.
- Chybějící cache hlavičky a ETagy; cache-busting na HTML.
- Požadavky na třetí strany, které blokují vykreslení (tag management bez consent-mode a prioritizace).
- Hydratace celého DOM namísto ostrovů interaktivity.
Kontrolní seznam ke snížení latence
- CDN aktivní, HTTP/3 a TLS 1.3 zapnuté;
preconnectna kritické domény. - HTML streamované; kritické CSS minimalizované; LCP zdroj s
fetchpriority="high". - Obrázky v AVIF/WEBP, správné rozměry a
sizes/srcset. - JS dělený, odložený; žádné long tasks nad 50 ms; interakce asynchronní.
- DB dotazy profilované; cache hit-rate > 90 % pro často čtená data.
- Trasy API regionální; limitované fan-out volání mezi službami.
- Monitorování p95/p99; alerting na regresi > 10 %.
Měření dopadu na byznys a AIO
- UX a konverze: zkrácení TTFB a LCP často zvyšuje míru dokončení cíle; sledujte A/B testy s RUM.
- AIO/AEO viditelnost: rychlejší doručení strukturovaných dat zlepšuje šanci na využití v AI odpovědích.
- Crawl budget: nižší latence znamená více načtených stránek během okna crawl rozpočtu.
Strategické směřování: latence jako produktová vlastnost
Latence není pouze technický parametr, ale také produktová vlastnost. Pro AI-první produkty, obsahové weby a e-commerce je rychlá odezva konkurenční výhodou. Investice do edge architektury, cache politik, profilování a odlehčení JS se promítnou do organického dosahu, v AIO/AEO i v příjmech.
Shrnutí
Latence je nejdražší jednotkou na webu: milisekundy formují vnímání rychlosti, úspěšnost indexace i výběr odpovědí AI. Klíčem je návrh kritické cesty, důsledná cache strategie, edge distribuované doručování a disciplinovaná práce s JS a daty. Optimalizujte p95/p99, nikoli průměr; měřte za reálných podmínek; a z latence udělejte KPI s jasným SLO.




























