Latence: Zpoždění odezvy systémů

Co je latence a proč je klíčová pro SEO, AIO/AEO a LLM

Latence je časové zpoždění mezi podnětem (požadavkem uživatele nebo systému) a pozorovatelnou odezvou. V kontextu webu, vyhledávání a AI odpovědí ovlivňuje latence nejen uživatelskou zkušenost (UX) a konverze, ale také to, zda se váš obsah dostane do výběru odpovědí AI (AIO/AEO) a jak jej interpretuje LLM. Vysoká latence snižuje šanci na interakci, prohlubuje odchodovost a v extrémech způsobuje, že AI systémy upřednostňují rychlejší zdroje.

Druhy latence v digitálním řetězci

  • Síťová latence – DNS lookup, TCP/QUIC handshake, TLS, RTT a propustnost trasy (peering, hustota CDN).
  • Back-end latence – fronta žádostí, CPU/I/O čekání, databázové dotazy, cache missy, mikroservisy, fronty zpráv.
  • Edge/render latence – CDN/edge funkce, prerendering/SSR/ISR, transformace (komprese, obrazové formáty).
  • Klientská latence – parsování HTML/CSS/JS, hidratační čas, JS blokování hlavního vlákna, dekódování obrázků, layout/paint.
  • LLM/AI latence – vyhledání kontextu (RAG), latence vektorového indexu, inference modelu, tokenizace a streamování odpovědi.

Metabolismus latence: metriky, na kterých záleží

  • TTFB (Time to First Byte): součet síťové a serverové latence do prvního bajtu. Silně koreluje s vnímanou rychlostí.
  • LCP (Largest Contentful Paint): nepřímé vyjádření latence síť + render; často omezená velikostí a dostupností hlavních zdrojů.
  • INP (Interaction to Next Paint): odezva na interakci; citlivá na JS blokování a hlavní vlákno.
  • RTT (Round-Trip Time): fyzikální limit trasy; optimalizovatelný umístěním obsahu blíže k uživateli (CDN/edge).
  • Jitter: variabilita latence; důležitá pro streaming a interaktivitu.
  • Tail latence p95/p99: extrémy, které ničily UX a SLO; důležitější než průměr.

Vztah latence k E-E-A-T, SEO a AIO/AEO

  • SEO: pomalé TTFB a vysoká latence zdrojů snižují šance na dobré Core Web Vitals a mohou omezit crawling a efektivní renderování.
  • AIO/AEO: Answer engine preferují zdroje, které dodávají text, strukturovaná data a multimédia rychle a stabilně; rychlost je implicitní signál kvality.
  • LLM optimalizace webů: nižší latence zvyšuje pravděpodobnost úspěšného stažení a parsování strukturovaných dat (JSON-LD), čímž se zlepšuje mapování entit.

Fronta a vytížení: proč p99 bolí nejvíce

Při vytížení serveru blízko 100 % se podle principů teorie čekacích řad (Littleův zákon, M/M/1) dramaticky zvyšují čekací časy. I malé špičky způsobí skok p95/p99 latence. Proto je kritické dimenzování (capacity planning), back-pressure, circuit-breakery a bulkhead izolace služeb.

Měření latence: RUM vs. syntetika

  • RUM (Real User Monitoring): reálná data z prohlížečů (Navigation/Resource/Long Tasks API). Ukazuje regionální a zařízení-specifické rozdíly.
  • Syntetické testy: konzistentní laboratorní měření (opakovatelná, profilování, testování změn).
  • Tracing (např. OpenTelemetry): koreluje latenci napříč mikroservisy, databázemi a frontami; klíč k p95 korelacím.

Zdrojové závislosti a kritická cesta

Každý zdroj na kritické cestě (HTML → CSS → fonty/JS → hero obrázek) přidává latenci. Cílem je minimalizovat počet RTT (HTTP/2/3), zmenšit objem bajtů a oddálit nekritické úlohy (defer/async). Kritická cesta by měla být explicitně navržena: preload pro nejdůležitější zdroje, server-push je nahrazen precizním preloadingem a edge hinty.

Optimalizační playbook pro síť a edge

  • CDN/Edge: nasazení co nejblíže uživateli; inteligentní routing, coalescing, HTTP/3 (QUIC), TLS 1.3, 0-RTT obnova.
  • DNS a spojení: snížit CNAME řetězce, využívat dohody o peeringu; <link rel="preconnect"> pro origin a kritické domény.
  • Kompresion a formáty: texty přes Brotli; obrázky AVIF/WEBP; adaptivní velikosti; serverové Accept-Encoding a Vary správně nastavené.
  • Cache strategie: Cache-Control s max-age, s-maxage, stale-while-revalidate; validátory ETag a Last-Modified.
  • HTML přenos: early flush (HTML streaming), chunked transfer; minimalizovat blokující meta-refresh a JS.

Optimalizační playbook pro back-end

  • Hot paths: identifikovat top endpointy podle RPS a latence; vyhradit jim rozpočty CPU/IO.
  • Databáze: indexy podle profilů dotazů, eliminace N+1, connection pooling, read-repliky, CQRS tam, kde to dává smysl.
  • Cache vrstvy: výsledkové cache (kvazi-idempotentní odpovědi), memoizace, TTL podle stálosti; negative caching a dogpile prevence.
  • Asynchronní zpracování: odložení neinteraktivních procesů do front (e-maily, webhooks, náročné transformace).
  • SSR/ISR: u obsahových stránek generovat nebo inkrementálně prerenderovat na edge; vyhnout se cold-start penalizacím.

Optimalizační playbook pro front-end a interaktivitu

  • Kritické CSS: inline pouze minimum, zbytek odložit; vyhnout se velkým globálním knihovnám.
  • JavaScript: code-splitting, lazy-hydration, defer/async, odstranit nevyužité moduly; používat islands architekturu.
  • Obrázky a fonty: fetchpriority="high" pro LCP obrázek; font-display: swap; subsetting fontů.
  • Interakční latence: minimalizovat dlouhé úlohy (>50 ms); plánovat práci přes requestIdleCallback; vyhnout se synchronním XHR.

Latence a LLM/AI: specifika pro AIO a generativní rozhraní

  • RAG pipeline: před-cacheovat embeddingy, držet vektory v RAM (HNSW/IVF-PQ), omezovat počet kandidátů, late fusion až po re-rankingu.
  • Inference: model s menším kontextem a speculative decoding; streamování tokenů na klienta pro vnímaný čas do první odpovědi.
  • Prompt cache: šablony a časté otázky uchovávat v edge cache; ESI/edge compute pro rychlé „AI snippets“.
  • Bezpečné timeouts: při degradaci raději vrátit konzervativní odpovědi z cache než čekat na p99 inference.

Rozpočty a SLO: jak nastavovat cíle

Definujte SLI (Service Level Indicators) a SLO (Service Level Objectives) pro p95/p99. Příklad cílů pro veřejný web:

Metrika Cíl p95 Cíl p99 Poznámka
TTFB (EU) < 200 ms < 350 ms CDN + TLS 1.3 + cache
LCP < 2,5 s < 4,0 s optimalizovat hero zdroje
INP < 200 ms < 300 ms Long Tasks < 50 ms
API (kritické) < 150 ms < 300 ms v regionální blízkosti

Diagnostika: kde hledat ztracené milisekundy

  • Waterfall (síť/zdroje): identifikace blokujících kroků, prázdných RTT a chybějících preload.
  • Flamegraphy: CPU „horká místa“ na serveru a klientovi.
  • Trace mapy: požadavek přes služby; hledání „nepomalejšího článku řetězce“.
  • Percentily: porovnávat p50 vs. p95/p99; p50 skrývá problémy.
  • Regionální segmentace: Edge PoP vs. origin; mobil vs. desktop; rozdíly mezi prohlížeči.

Latence a obsah: jak ji reflektovat v architektuře webu

  • IA a routování: méně skoků k cíli, méně přesměrování; kanonické URL bez řetězení 302/301.
  • Strukturovaná data: JSON-LD podávat spolu s HTML (ne přes opožděný JS), aby je AI/roboti viděli bez čekací penalizace.
  • Prerendering/SSR/ISR: obsah, který AI často cituje, připravovat předem; minimalizovat runtime generování.

Antivzory, které zvyšují latenci

  • Velké JS frameworky pro statické stránky bez code-splittingu.
  • Řetězení proxy vrstev a vícenásobné TLS terminace bez důvodu.
  • Chybějící cache hlavičky a ETagy; cache-busting na HTML.
  • Požadavky na třetí strany, které blokují vykreslení (tag management bez consent-mode a prioritizace).
  • Hydratace celého DOM namísto ostrovů interaktivity.

Kontrolní seznam ke snížení latence

  1. CDN aktivní, HTTP/3 a TLS 1.3 zapnuté; preconnect na kritické domény.
  2. HTML streamované; kritické CSS minimalizované; LCP zdroj s fetchpriority="high".
  3. Obrázky v AVIF/WEBP, správné rozměry a sizes/srcset.
  4. JS dělený, odložený; žádné long tasks nad 50 ms; interakce asynchronní.
  5. DB dotazy profilované; cache hit-rate > 90 % pro často čtená data.
  6. Trasy API regionální; limitované fan-out volání mezi službami.
  7. Monitorování p95/p99; alerting na regresi > 10 %.

Měření dopadu na byznys a AIO

  • UX a konverze: zkrácení TTFB a LCP často zvyšuje míru dokončení cíle; sledujte A/B testy s RUM.
  • AIO/AEO viditelnost: rychlejší doručení strukturovaných dat zlepšuje šanci na využití v AI odpovědích.
  • Crawl budget: nižší latence znamená více načtených stránek během okna crawl rozpočtu.

Strategické směřování: latence jako produktová vlastnost

Latence není pouze technický parametr, ale také produktová vlastnost. Pro AI-první produkty, obsahové weby a e-commerce je rychlá odezva konkurenční výhodou. Investice do edge architektury, cache politik, profilování a odlehčení JS se promítnou do organického dosahu, v AIO/AEO i v příjmech.

Shrnutí

Latence je nejdražší jednotkou na webu: milisekundy formují vnímání rychlosti, úspěšnost indexace i výběr odpovědí AI. Klíčem je návrh kritické cesty, důsledná cache strategie, edge distribuované doručování a disciplinovaná práce s JS a daty. Optimalizujte p95/p99, nikoli průměr; měřte za reálných podmínek; a z latence udělejte KPI s jasným SLO.