Sitemap, robots.txt a canonical: k čemu slouží a jak neuškodit SEO
Proč Google potřebuje sitemap.xml
Sitemap.xml je soubor se seznamem stránek webu, který Googlu jasně sděluje, co má indexovat. Bez něj robot dokáže stránky najít i sám, procházením po odkazech webu, ale sitemap tento proces urychluje a zpřehledňuje, zvlášť u velkých webů nebo stránek, ke kterým je složité se dostat přes běžnou navigaci.
Do sitemapy by se měly zahrnovat pouze stránky, které skutečně chcete mít ve vyhledávání — funkční, dostupné bez chyb, nezablokované z indexace. Zahrnutí servisních, duplicitních nebo zablokovaných stránek nepomáhá, ale vytváří zmatek pro robota a zbytečný šum v reportech Search Console.
Jak by měl vypadat robots.txt
Robots.txt je jednoduchý textový soubor v kořeni webu, který určuje, kterým robotům je povoleno nebo zakázáno procházet jaké části webu. Základní struktura obvykle vypadá takto: uvádí se, ke kterému robotovi pravidlo patří (User-agent) a jaké cesty jsou zakázané (Disallow) nebo výslovně povolené (Allow).
Samostatnou a čím dál důležitější otázkou je, co dělat s crawlery AI systémů, jako je GPTBot (OpenAI) nebo PerplexityBot. Pokud máte zájem na tom, aby obsah webu mohl být citovaný v odpovědích ChatGPT, Perplexity nebo Google AI Overviews, tyto crawlery by neměly být v robots.txt blokované ve výchozím nastavení — u části CMS a hostingů je taková blokace nastavená „ve výchozím nastavení" a stojí za to ji explicitně zkontrolovat a odstranit, pokud je pro vás citovatelnost důležitá.
Více o tom, jak optimalizovat web pro citování v AI systémech — v článku „Jak optimalizovat web pro ChatGPT, Perplexity a AI Overviews (GEO)?".
Canonical: kdy je jedna stránka „hlavní" mezi duplicitami
Canonical tag (link rel="canonical" v sekci head) říká Googlu, kterou verzi stránky považovat za hlavní, pokud existuje více podobných nebo identických URL — například stejná karta produktu dostupná s různými parametry filtru v adrese.
Bez explicitního canonical tagu si Google hlavní verzi vybírá sám, a ne vždy tak, jak by si přál majitel webu — to může rozmělňovat ranking signály mezi několika verzemi stejné stránky místo jejich soustředění na jednu URL.
Je důležité odlišovat canonical od 301 přesměrování: canonical říká „tato stránka je podobná jiné, ale obě technicky existují a jsou dostupné", zatímco 301 přesměrování fyzicky přesměruje uživatele i robota z jedné adresy na druhou, a stará stránka fakticky přestává být samostatně dostupná.
Chcete zkontrolovat, zda ve vaší technické konfiguraci nejsou rozpory?
Provedeme technický SEO audit a zkontrolujeme soulad sitemap, robots.txt a canonical — dřív, než vás tyto drobné rozpory začnou stát pozice.
Typické chyby
| Soubor | K čemu slouží | Častá chyba | Jak zkontrolovat |
|---|---|---|---|
| sitemap.xml | Seznam stránek k indexaci | V sitemapě jsou zahrnuté zablokované nebo nefunkční stránky | Search Console → Soubory Sitemap → stav zpracování |
| robots.txt | Omezení přístupu robotů k částem webu | Náhodně zablokovaný celý web (Disallow: /) po výměně CMS nebo hostingu | Ruční kontrola souboru na adrese site.cz/robots.txt |
| canonical | Určení hlavní verze mezi duplicitami | Canonical ukazuje na stránku, která je sama zablokovaná z indexace | Zobrazení zdrojového kódu stránky + Search Console → Pokrytí |
| Provázanost všech tří | Konzistentní indexace bez rozporů | Sitemap povoluje stránku, robots.txt ji blokuje | Křížová kontrola: porovnat sitemap, robots.txt a canonical ručně u klíčových stránek |
Mini-checklist před publikací
- Sitemap.xml existuje, je dostupná na přímém odkazu a obsahuje pouze funkční, indexovatelné stránky.
- Robots.txt neblokuje důležité části webu — ověřeno ručně, ne „ponecháno tak, jak je ve výchozím nastavení".
- Každá klíčová stránka má svůj vlastní, správný canonical tag, který odkazuje sám na sebe (pokud nejde o duplicitu).
- Nejsou žádné rozpory mezi třemi soubory: co je povolené v sitemapě, není zablokované v robots.txt.
- Pokud je důležitá citovatelnost v AI systémech — crawlery jako GPTBot a PerplexityBot nejsou explicitně zablokované.
Checklist: 10 typických SEO chyb před auditem
Stáhněte si bezplatný PDF s body pro samostatnou kontrolu — zaškrtněte, co jste už zkontrolovali, a přijďte na audit s hotovým seznamem otázek.
Hotovo! Checklist se otevřel v nové záložce. Kopii pošleme na váš email. Pokud se soubor neotevřel — otevřete PDF znovu.
Časté otázky
Je sitemap.xml povinná pro malý web?
Formálně ne — Google dokáže najít stránky i přes běžnou navigaci po odkazech webu, ale sitemap tento proces urychluje a zpřehledňuje i u malých webů, a její absence nepřináší žádnou výhodu, proto se vyplatí ji vytvořit v každém případě.
Dá se v robots.txt zablokovat sekce /admin/ nebo osobní účet?
Ano, servisní části jako administrační panel nebo osobní účet uživatele je rozumné blokovat z indexace — je to standardní a bezpečná praxe, na rozdíl od náhodné blokace veřejných stránek webu.
Jaký je rozdíl mezi canonical a 301 přesměrováním?
Canonical se používá, když obě verze stránky mají technicky zůstat dostupné, ale jedna z nich je považovaná za hlavní pro indexaci. 301 přesměrování se používá, když stará adresa má zcela a definitivně ustoupit nové, fyzicky přesměrovávající na ni uživatele i roboty.
Jak spolu souvisí llms.txt a robots.txt?
Jde o dva odlišné soubory s různými úkoly: robots.txt řídí přístup crawlerů k částem webu, zatímco llms.txt je doplňkový, zatím ne univerzálně podporovaný soubor se stručným popisem webu speciálně pro jazykové modely. Existence llms.txt nenahrazuje správné nastavení robots.txt.
Jak často je potřeba sitemap aktualizovat?
V ideálním případě se sitemap aktualizuje automaticky při přidání, odstranění nebo změně URL stránek — většina moderních CMS to dělá bez ručního zásahu. Pokud je aktualizace ruční, stojí za to sitemap znovu projít při každé znatelné změně struktury webu, ne podle pevného kalendářního harmonogramu.
Potřebujete technický audit sitemap, robots.txt a canonical?
Zanechte nezávaznou poptávku — zkontrolujeme soulad všech tří souborů dřív, než rozpory začnou ovlivňovat pozice.