SEO · Technika

Sitemap, robots.txt a canonical: k čemu slouží a jak neuškodit SEO

Publikováno 1. 4. 2026 · ~10 minut čtení
sitemap.xml sděluje Googlu, které stránky má indexovat, robots.txt určuje, kam roboti nesmí vstupovat, a canonical tag vysvětluje, která verze stránky má být považovaná za hlavní mezi podobnými nebo duplicitními URL. Všechny tři soubory fungují společně a typickou chybou je rozpor mezi nimi: stránka je povolená v sitemapě, ale zablokovaná v robots.txt, nebo canonical ukazuje na stránku, která je sama zablokovaná z indexace. Tomuto tématu se vyplatí porozumět jednou a pak ho kontrolovat při každé větší změně webu.

Proč Google potřebuje sitemap.xml

Sitemap.xml je soubor se seznamem stránek webu, který Googlu jasně sděluje, co má indexovat. Bez něj robot dokáže stránky najít i sám, procházením po odkazech webu, ale sitemap tento proces urychluje a zpřehledňuje, zvlášť u velkých webů nebo stránek, ke kterým je složité se dostat přes běžnou navigaci.

Do sitemapy by se měly zahrnovat pouze stránky, které skutečně chcete mít ve vyhledávání — funkční, dostupné bez chyb, nezablokované z indexace. Zahrnutí servisních, duplicitních nebo zablokovaných stránek nepomáhá, ale vytváří zmatek pro robota a zbytečný šum v reportech Search Console.

Jak by měl vypadat robots.txt

Robots.txt je jednoduchý textový soubor v kořeni webu, který určuje, kterým robotům je povoleno nebo zakázáno procházet jaké části webu. Základní struktura obvykle vypadá takto: uvádí se, ke kterému robotovi pravidlo patří (User-agent) a jaké cesty jsou zakázané (Disallow) nebo výslovně povolené (Allow).

Samostatnou a čím dál důležitější otázkou je, co dělat s crawlery AI systémů, jako je GPTBot (OpenAI) nebo PerplexityBot. Pokud máte zájem na tom, aby obsah webu mohl být citovaný v odpovědích ChatGPT, Perplexity nebo Google AI Overviews, tyto crawlery by neměly být v robots.txt blokované ve výchozím nastavení — u části CMS a hostingů je taková blokace nastavená „ve výchozím nastavení" a stojí za to ji explicitně zkontrolovat a odstranit, pokud je pro vás citovatelnost důležitá.

Více o tom, jak optimalizovat web pro citování v AI systémech — v článku „Jak optimalizovat web pro ChatGPT, Perplexity a AI Overviews (GEO)?".

Canonical: kdy je jedna stránka „hlavní" mezi duplicitami

Canonical tag (link rel="canonical" v sekci head) říká Googlu, kterou verzi stránky považovat za hlavní, pokud existuje více podobných nebo identických URL — například stejná karta produktu dostupná s různými parametry filtru v adrese.

Bez explicitního canonical tagu si Google hlavní verzi vybírá sám, a ne vždy tak, jak by si přál majitel webu — to může rozmělňovat ranking signály mezi několika verzemi stejné stránky místo jejich soustředění na jednu URL.

Je důležité odlišovat canonical od 301 přesměrování: canonical říká „tato stránka je podobná jiné, ale obě technicky existují a jsou dostupné", zatímco 301 přesměrování fyzicky přesměruje uživatele i robota z jedné adresy na druhou, a stará stránka fakticky přestává být samostatně dostupná.

Chcete zkontrolovat, zda ve vaší technické konfiguraci nejsou rozpory?

Provedeme technický SEO audit a zkontrolujeme soulad sitemap, robots.txt a canonical — dřív, než vás tyto drobné rozpory začnou stát pozice.

Typické chyby

SouborK čemu sloužíČastá chybaJak zkontrolovat
sitemap.xmlSeznam stránek k indexaciV sitemapě jsou zahrnuté zablokované nebo nefunkční stránkySearch Console → Soubory Sitemap → stav zpracování
robots.txtOmezení přístupu robotů k částem webuNáhodně zablokovaný celý web (Disallow: /) po výměně CMS nebo hostinguRuční kontrola souboru na adrese site.cz/robots.txt
canonicalUrčení hlavní verze mezi duplicitamiCanonical ukazuje na stránku, která je sama zablokovaná z indexaceZobrazení zdrojového kódu stránky + Search Console → Pokrytí
Provázanost všech tříKonzistentní indexace bez rozporůSitemap povoluje stránku, robots.txt ji blokujeKřížová kontrola: porovnat sitemap, robots.txt a canonical ručně u klíčových stránek

Mini-checklist před publikací

Checklist: 10 typických SEO chyb před auditem

Stáhněte si bezplatný PDF s body pro samostatnou kontrolu — zaškrtněte, co jste už zkontrolovali, a přijďte na audit s hotovým seznamem otázek.

PDF se otevře ihned po odeslání. Žádný spam — odhlásit se můžete kdykoli.

Časté otázky

Je sitemap.xml povinná pro malý web?

Formálně ne — Google dokáže najít stránky i přes běžnou navigaci po odkazech webu, ale sitemap tento proces urychluje a zpřehledňuje i u malých webů, a její absence nepřináší žádnou výhodu, proto se vyplatí ji vytvořit v každém případě.

Dá se v robots.txt zablokovat sekce /admin/ nebo osobní účet?

Ano, servisní části jako administrační panel nebo osobní účet uživatele je rozumné blokovat z indexace — je to standardní a bezpečná praxe, na rozdíl od náhodné blokace veřejných stránek webu.

Jaký je rozdíl mezi canonical a 301 přesměrováním?

Canonical se používá, když obě verze stránky mají technicky zůstat dostupné, ale jedna z nich je považovaná za hlavní pro indexaci. 301 přesměrování se používá, když stará adresa má zcela a definitivně ustoupit nové, fyzicky přesměrovávající na ni uživatele i roboty.

Jak spolu souvisí llms.txt a robots.txt?

Jde o dva odlišné soubory s různými úkoly: robots.txt řídí přístup crawlerů k částem webu, zatímco llms.txt je doplňkový, zatím ne univerzálně podporovaný soubor se stručným popisem webu speciálně pro jazykové modely. Existence llms.txt nenahrazuje správné nastavení robots.txt.

Jak často je potřeba sitemap aktualizovat?

V ideálním případě se sitemap aktualizuje automaticky při přidání, odstranění nebo změně URL stránek — většina moderních CMS to dělá bez ručního zásahu. Pokud je aktualizace ruční, stojí za to sitemap znovu projít při každé znatelné změně struktury webu, ne podle pevného kalendářního harmonogramu.

Potřebujete technický audit sitemap, robots.txt a canonical?

Zanechte nezávaznou poptávku — zkontrolujeme soulad všech tří souborů dřív, než rozpory začnou ovlivňovat pozice.