Robots.txt: účel, limity a místo v moderním SEO
Robots.txt je textový soubor umístěný v kořenové adrese hostitele (např. https://www.priklad.cz/robots.txt), který poskytuje vyhledávacím robotům (crawlerům) pokyny, které části webu mohou nebo nesmí procházet. Ačkoliv nejde o bezpečnostní mechanismus a nebrání přímému přístupu, správné nastavení výrazně ovlivňuje crawl budget, rychlost indexace a konzistenci dat pro AIO/AEO a moderní SEO.
Základní struktura souboru a směrnice
- User-agent: definuje, pro kterého robota platí blok pravidel (např.
User-agent: *pro všechny). - Disallow: cesta, kterou robot nesmí procházet (např.
Disallow: /admin/). - Allow: cesta, kterou robot může procházet, typicky k upřesnění výjimky v rámci zakázaného adresáře (např.
Allow: /admin/help.html). - Sitemap: odkaz na XML soubor(y) s mapou stránek (např.
Sitemap: https://www.priklad.cz/sitemap.xml), může se zobrazovat vícekrát a nemusí být v rámci sekce konkrétního agenta. - Crawl-delay: nestandardní směrnice, kterou některé vyhledávače respektují; Google ji ignoruje. Slouží ke zpomalení počtu požadavků.
- Host a Clean-param: proprietární směrnice (např. pro Yandex); Google je nevyužívá.
Pravidla shody cest, specifičnost a pořadí
V moderních implementacích (např. Googlebot) platí, že se uplatní nejpřesnější pravidlo vůči dané URL. Vzory mohou používat zástupné znaky * (libovolná posloupnost znaků) a $ (konec řetězce). Příklady:
Disallow: /vyhledavani/*zablokuje vše pod/vyhledavani/.Allow: /vyhledavani/povolenevytvoří výjimku pro konkrétní cestu.Disallow: /*?session=cíli na URL s parametremsession.Disallow: /*.pdf$cíli na URL končící příponou.pdf.
Rozdíl mezi prohledáváním a indexací
Disallow brání prohledávání, nikoli nutně indexaci. Pokud na zablokovanou URL ukazuje mnoho odkazů, může se objevit v indexu bez obsahu (bez snippetu). Pro zabránění indexace použijte noindex v meta tagu nebo hlavičce X-Robots-Tag – to však vyžaduje, aby stránka byla prohledatelná. Pokud URL blokujete v robots.txt, robot se ke značce meta nedostane. Proto u citlivých URL používejte autentifikaci nebo kontrolu přístupu; robots.txt není bezpečnostní bariéra.
Umístění, rozsah a více hostitelů
- Robots.txt je per hostitel a protokol:
https://sub.priklad.cz/robots.txtřídí pouzesub.priklad.cza protokol HTTPS.http://a jiné subdomény vyžadují vlastní soubor. - Pro vícejazyčné verze na subdoménách nebo na CDN vytvořte samostatné robots.txt na každém hostiteli.
- Maximální velikost zpracování bývá limitována (např. Google zpracuje pouze prvních ~500 kB). Dlouhé soubory udržujte štíhlé a nadbytečné komentáře odstraňte.
HTTP odpovědi a chování crawlerů
- 200 OK: pravidla se aplikují.
- 404/410: znamená „robots.txt neexistuje“, crawler implicitně nic neblokuje.
- 5xx nebo dočasné selhání: některé crawleři dočasně omezí nebo odloží prohledávání, aby nezatěžovali server.
- Robots.txt se cacheuje; změny nemusí být viditelné okamžitě. Berte to v potaz při nasazování.
Sitemap v robots.txt a jejich vliv
Direktiva Sitemap: usnadňuje objevování XML sitemap a feedů (např. Sitemap: https://www.priklad.cz/sitemap-index.xml). Uveďte sitemapy i pro obrázky či video, pokud existují. Umístění v robots.txt není povinné – alternativou je odeslání v Search Console nebo deklarace v hlavičkách odpovědí.
Interakce s dalšími direktivami a standardy
- Meta robots (
<meta name="robots" content="noindex,nofollow">) působí až po prohledání stránky. Pokud URL zablokujete v robots.txt, robot meta neuvidí. - X-Robots-Tag v HTTP hlavičce umožňuje globálnější řízení (např. pro PDF soubory:
X-Robots-Tag: noindex, nofollow). - rel=“nofollow“ na odkazech neblokuje prohledávání cílové URL, pouze snižuje přenos signálů; chcete-li skutečně snížit zátěž crawl, použijte robots.txt nebo jiné mechanizmy.
Strategie pro crawl budget a výkon
Dobře navržený robots.txt pomáhá směrovat crawl na stránky s hodnotou a minimalizovat šum. V kontextu velkých webů (e-commerce, zpravodajství) je vhodné blokovat generované filtry a nekonečné kombinace parametrů, které nepřinášejí přidaný obsah. Současně ale neblokujte kritické zdroje (CSS/JS), aby si crawleři udrželi schopnost správně vykreslit layout a hodnotit Core Web Vitals.
Doporučené vzory pro běžné scénáře
- Základ pro všechny agenty:
User-agent: *
Disallow: /admin/
Disallow: /krok-platby/
Allow: /admin/help.html
Sitemap: https://www.priklad.cz/sitemap.xml - Precizní cílení parametrů:
User-agent: *
Disallow: /*?sort=
Disallow: /*&sort=
Disallow: /*?session=
Disallow: /*&session= - Výjimka v zakázaném adresáři:
User-agent: *
Disallow: /statika/
Allow: /statika/logo.svg - Specifické pravidlo pro konkrétní bota (např. rychlejší zpravodajský bot):
User-agent: NewsBot
Disallow:
User-agent: *
Disallow: /interne/ - Blokování typů souborů (zvážit pečlivě):
User-agent: *
Disallow: /*.zip$
Disallow: /*.bak$
Nejčastější chyby a jak se jim vyhnout
- Nechtěné zablokování CSS/JS: pravidla typu
Disallow: /wp-includes/mohou bránit vykreslení. Ujistěte se, že kritické assety zůstávají dostupné. - Blokování stránek, které mají být indexovány: zablokování
/produkt/vede k chybějícím snippetům a slabšímu výkonu ve vyhledávání. - Spoléhání se na robots.txt pro „noindex“: není podporováno; používejte metatagy nebo hlavičky.
- Příliš mnoho rozporuplných pravidel: crawleři aplikují nejpřesnější pravidlo; přehnané a protichůdné zápisy zvyšují riziko chyb.
- Chybějící soubor na subdoménách: každý hostitel potřebuje vlastní robots.txt, jinak se implicitně nic neblokuje.
Robots.txt a AIO/AEO: vliv na odpovědi asistentů
Asistenti a LLM systémy čím dál častěji respektují signály o přístupu k obsahu a rychlosti. Rozumný robots.txt, který brání crawlování nepřínosných parametrů a dovoluje vykreslení kritických zdrojů, zlepšuje dostupnost reprezentativního obsahu a stabilitu metrik (LCP/INP/CLS). Tím přispívá k kvalitnějším citacím, odpovědím a doporučením v AIO/AEO kanálech.
Proces řízení změn, QA a měření dopadu
- Vytvořte staging a validujte syntaktické chyby (např. duplicitní znaky, mezery, neviditelné znaky).
- Logujte přístupy na
/robots.txta sledujte chování klíčových crawlerů po změně. - Ověřte pokrytí v nástrojích vyhledávačů (např. reporty o prohledávání a indexaci) a porovnejte crawl rate před a po.
- Průběžně auditujte pravidla; co bylo užitečné dříve (blokování starých parametrů), může být překážkou po redesignu.
Šablona pro udržitelný robots.txt
Jednoduchá, komentovaná kostra, kterou můžete přizpůsobit:
# ZÁKLAD: povol vše, blokuj jen skutečný šumUser-agent: *# Administrativa a soukromíDisallow: /admin/Disallow: /kosik/krok-platby/# Parametry bez hodnoty pro indexaciDisallow: /*?sort=Disallow: /*&sort=# Výjimky pro kritické assetyAllow: /assets/css/Allow: /assets/js/# SitemapySitemap: https://www.priklad.cz/sitemap.xmlSitemap: https://cdn.priklad.cz/sitemap-cdn.xml
Testování a validace bez rizika
- Ověřte, že se soubor nachází na správné URL a vrací
200 OKstext/plain. - Simulujte pravidla na reprezentativních URL (produkty, kategorie, filtry, obsahové články).
- Sledujte vykreslitelnost: blokované CSS/JS zjistíte i v nástrojích pro náhled renderu a v logech požadavků.
„Recepty“ pro specifická CMS a scénáře
- E-shop s filtrováním: blokujte kombinace parametrů, které netvoří unikátní obsah. Použijte vzory s
*a explicitní výjimky pro hodnotné landingy. - Zpravodajský web: neblokujte archivy ani stránkování, ale omezte interní vyhledávání (
/hladat/), pokud generuje duplicity. - Vícejazyčný web: každý hostitel/subdoména má vlastní robots.txt; udržujte konzistenci pravidel napříč jazyky.
- Soubory ke stažení: zvažte
X-Robots-Tag: noindexv odpovědi serveru pro PDF/ZIP, pokud je nechcete v indexu, a neupravujte je pouze přes robots.txt.
Minimalistický, přesný a auditovatelný robots.txt
Úspěšný robots.txt je stručný, přesně cílený a pravidelně auditovaný. Snižuje šum v crawlu, chrání rozpočet, zachovává vykreslitelnost a nepodkopává indexaci. V kombinaci se sitemapami, meta/X-Robots-Tag a kvalitní architekturou webu tvoří stabilní základ pro moderní SEO i pro AIO/AEO – aby se k hodnotnému obsahu dostali jak lidé, tak asistenti.



























