Proč jemně ladit crawl: rozdíl mezi procházením a indexací
Technické SEO rozlišuje dvě fáze zpracování webu: crawl (procházení URL roboty) a indexaci (zařazení obsahu do výsledků vyhledávání). robots.txt určuje, co robot smí navštívit, zatímco meta direktivy (např. <meta name="robots"> nebo hlavička X-Robots-Tag) určují, co vyhledávač smí indexovat a jak s obsahem nakládat. Jemné ladění procházení má přímý vliv na výkon serveru, crawl budget (rozpočet procházení) a čistotu indexu.
Architektura rozhodování robotů: kde se uplatňují pravidla
- DNS a síť: latence a chyby 5xx ovlivňují rychlost procházení.
- robots.txt: první požadavek na doméně – definuje přístup na úrovni cesty.
- HTTP stavové kódy: 200/301/302/404/410/451/5xx určují další chování.
- Meta direktivy: vyhodnocují se až po načtení dokumentu či hlavičky.
- Signály odkazů: objevování nových URL i bez indexace (nofollow je dnes pouze „hint“).
robots.txt: principy a priority
Soubor /robots.txt platí pro host (včetně subdomény) a zpravidla se hodnotí podle User-agent bloků. Vyhledávače berou v potaz nejkonkrétnější pravidlo, přičemž poslední konfliktní pravidla mohou být pro různé roboty vyhodnocena odlišně.
- Disallow: cesta či vzor, kterou robot nesmí procházet.
- Allow: výjimka vůči
Disallowpro konkrétnější cestu. - Wildcard:
*(libovolný řetězec) a$(konec URL) – podporované hlavními vyhledávači. - Sitemap: odkaz(y) na XML sitemapy – doporučené pro rychlejší objevování obsahu.
robots.txt: vzorové konfigurace
# Základ: povolit vše kromě interního vyhledávání a filtrů User-agent: * Disallow: /search/ Disallow: /filter/ Allow: /filter/help
Sitemap: https://www.example.com/sitemap.xml
Sitemap: https://cdn.example.com/media-sitemap.xml
# Jemné ladění pro e-shop s fasetami User-agent: * # Blokování parametrů generujících permutace bez hodnoty Disallow: /*?sort= Disallow: /*?view= Disallow: /*?color= # Zachovat přístup k stránkování kategorií (pokud má hodnotu pro index) Allow: /category/*?page= # Chránit vykreslování – neblokovat kritické zdroje Allow: /assets/css/ Allow: /assets/js/
# Media host – pouze obrázky a videa User-agent: * Disallow: / Allow: /*.jpg$ Allow: /*.jpeg$ Allow: /*.png$ Allow: /*.webp$ Allow: /*.mp4$
Čemu se vyhnout v robots.txt
- Nesnažte se „noindexovat“ přes robots.txt. Direktiva
noindexvrobots.txtnení podporována. Pokud URL zablokujete vrobots.txt, vyhledávač neuvidí meta tagy ani hlavičky a nemůže uložitnoindex. - Neblokujte zdroje potřebné k vykreslení (CSS, JavaScript, fonty pro veřejné stránky). Blokování snižuje porozumění layoutu a může zhoršit hodnocení.
- Nezakazujte sekce s 404/410. Nechte roboty vidět stavové kódy, díky čemuž URL rychleji vyřadí z indexu.
- Nezaměňujte hostitele a subdomény.
robots.txtje per host –cdn.example.comvyžaduje vlastní soubor. - Dávejte pozor na BOM a kódování. Soubor má být čistý UTF-8 bez BOM, s konci řádků
n.
Meta robots (HTML) a X-Robots-Tag (HTTP): jemné ovládání indexace
Na úrovni dokumentu (HTML) či souboru (PDF, obrázky) lze řídit indexaci a prezentaci výsledků:
index/noindex: povolit nebo zakázat zařazení do indexu.follow/nofollow: jak zacházet s odkazy. Dnes jenofollowpouze „hint“, nikoli striktní příkaz.- Úryvky a náhledy:
nosnippet,max-snippet,max-image-preview(none/standard/large),max-video-preview. - Překlad a cache:
notranslate,noarchive. - Dostupné do:
unavailable_afters datem podle RFC 850. - Obrázky:
noimageindexzabraňuje indexaci obrázků ze stránky.
Příklady meta robots v HTML
<!-- Zakázat indexaci, povolit sledování odkazů --> <meta name="robots" content="noindex,follow">
X-Robots-Tag pro ne-HTML soubory
HTTP hlavička X-Robots-Tag umožňuje aplikovat direktivy na PDF, obrázky, video nebo na celý host (pomocí konfigurace serveru). Výhoda: není nutné upravovat obsah souboru.
# Apache (.htaccess) <FilesMatch ".(pdf|docx)$"> Header set X-Robots-Tag "noindex, noarchive, nosnippet" </FilesMatch>
# Nginx (server/location) location ~* .(pdf|docx)$ { add_header X-Robots-Tag "noindex, noarchive, nosnippet"; }
Důležité: Pokud je URL zablokována v robots.txt, robot si její hlavičku nevyžádá, a proto se X-Robots-Tag neuplatní. Na „odindexování“ nechte URL crawlovatelnou a použijte noindex (meta tag nebo hlavička) nebo vraťte 404 či 410.
Relace, parametry a fasetová navigace: strategie
- URL s parametry (třídění, zobrazení, barva, velikost) zpravidla Disallow v
robots.txt, ale klíčové varianty (např.?page=) ponechejte přístupné, pokud mají hodnotu pro uživatele. - Rel=canonical z parametrických stránek na primární kategorii. Neblokujte a zároveň nepoužívejte canonical – pokud je stránka blokována, robot canonical neuvidí.
- Interní prolinkování: minimalizujte odkazy na zakázané parametry, abyste neplýtvali crawl budgetem.
Stavové kódy vs. noindex vs. Disallow: rozhodovací matice
- Chcete URL trvale odstranit z indexu? Vraťte
410 Gone(nebo404) – rychlé vyřazení. Neblokujte vrobots.txt. - Chcete URL viditelnou pro uživatele, ale mimo index?
200 OK+noindex(meta tag neboX-Robots-Tag). - Dočasný přesun / údržba?
302nebo503s Retry-After; neponechávejte dlouhodobě. - Trvalý přesun?
301(beznoindexna cílové URL); sledujte přesměrovací řetězce.
Jemné ladění rychlosti procházení a výkonu
- Serverové limity: sledujte chyby 5xx během špiček procházení. Pokud se objeví, optimalizujte caching, kompresi, databázové dotazy a CDN.
- Crawl-delay: některé roboty jej respektují, Google jej ignoruje. Řiďte rychlost spíše výkonem, škálováním a HTTP optimalizacemi.
- Crawl budget: čistá informační architektura, menší počet nevýznamných URL, rychlé odpovědi, správné stavové kódy a relevantní sitemapy.
Rendering a dynamika: kdy meta nemusí „stihnout“
Pokud meta robots vkládáte po načtení pomocí JavaScriptu, ne všichni roboti to uvidí včas. Doporučení: vkládejte <meta name="robots"> přímo v HTML na serveru nebo používejte X-Robots-Tag v HTTP odpovědi.
Typické scénáře a řešení
- Staging / UAT prostředí: nepoužívejte pouze
Disallow: /. Nejbezpečnější je HTTP autentizace (Basic) nebo IP whitelist. Pokud musíte, přidejte inoindex+X-Robots-Taga zabraňte odkazování z produkce. - Interní vyhledávání: Disallow
/searcha odkazy označterel="nofollow"(hint). Ideálně interní vyhledávání nezpřístupňujte k indexaci. - Duplicitní verze (http/https, s/bez www): řešte přesměrováním
301acanonical, ne přesrobots.txt. - PDF katalogy bez indexace: ponechte crawl, přidejte
X-Robots-Tag: noindexa linkujte pouze tam, kde to dává smysl. - Obrázky citlivých sekcí: použijte
noimageindexv metadatech stránky a případněX-Robots-Tagpro obrazové adresáře.
Specifika direktiv a jemné rozdíly
noindex,followje platné: URL se neindexuje, odkazy mohou být sledovány (jako hint).noindex,nofollow: často zbytečně omezuje objevování. Používejte pouze pokud chcete minimalizovat šíření odkazových signálů.nosnippetpotlačuje úryvek; může snižovat CTR – preferujte spíšemax-snippet.max-image-previewpomáhá řídit velikost náhledů v Discover/Obrázcích; „large“ podporuje bohatší náhledy.unavailable_after: po datu robot obsah neindexuje nebo snižuje viditelnost; neplést s 410.
Bezpečnost a citlivý obsah vs. robots.txt
robots.txt není bezpečnostní mechanismus. URL v něm jsou veřejné a mohou se stát „mapou pokladů“. Citlivé oblasti chraňte autentizací, autorizací a kontrolou přístupu na úrovni sítě.
Monitoring a diagnostika: jak ověřit efekt
- Serverové logy: identifikujte user-agenty, frekvence, chyby 5xx/4xx, procházené cesty; sledujte změny po nasazení.
- Nástroje vyhledávačů: kontrola Crawl stats, Page indexing, test robots.txt, odstranění URL, reporty pro obrázky/video.
- Automatické testy: CI kontrola přítomnosti klíčových direktiv a syntaktických chyb.
- Měření výkonu: po úpravách porovnejte CPU/IO během peaků procházení a dobu odezvy.
Checklist pro nasazení změn
- Má každý host/subdoména správný vlastní
robots.txta URL není přesměrována? - Neblokují se CSS/JS/fonty potřebné pro vykreslování veřejných stránek?
- Parametry bez hodnoty pro vyhledávání jsou
Disallow, ale důležité varianty zůstávají přístupné? - Na URL určených mimo index je
noindex(meta nebo hlavička) a neDisallow? - Stavové kódy odpovídají realitě (410 pro trvale odstraněné, 301 pro trvalý přesun)?
- Sitemapy obsahují pouze kanonické, indexovatelné URL s kódem 200 a správným canonicalem?
- Ověřeno v nástrojích vyhledávačů a v logách po nasazení?
Anti-patterny, které plýtvají crawl budgetem
- Nekonečné kombinace filtrů (barva × velikost × třídění × zobrazení). Řešení: whitelisting výživných kombinací +
Disallowpro zbytek. - „Pseudopaginace“ bez obsahu (
?page=999). Řešení: omezit počet stránek a přebytek vracet404nebo přesměrovat



























