Sitemap, robots.txt и canonical: зачем нужны и как не навредить SEO
sitemap.xml сообщает Google, какие страницы стоит проиндексировать, robots.txt указывает, куда роботам заходить нельзя, а canonical-тег объясняет, какая версия страницы должна считаться основной среди похожих или дублирующихся URL. Все три файла работают в связке, и типичная ошибка — противоречие между ними: страница разрешена в sitemap, но заблокирована в robots.txt, или canonical указывает на страницу, которая сама закрыта от индексации. Разобраться в этом стоит один раз и проверять при каждом крупном изменении сайта.
Зачем Google нужен sitemap.xml
Sitemap.xml — это файл-список страниц сайта, который явно сообщает Google, что нужно проиндексировать. Без него робот всё равно может найти страницы, переходя по ссылкам сайта, но sitemap ускоряет и упорядочивает этот процесс, особенно для крупных сайтов или страниц, до которых сложно дойти через обычную навигацию.
В sitemap стоит включать только страницы, которые вы действительно хотите видеть в поиске — рабочие, доступные без ошибок, не закрытые от индексации. Включение служебных, дублирующихся или заблокированных страниц не помогает, а создаёт путаницу для робота и лишний шум в отчётах Search Console.
Как должен выглядеть robots.txt
Robots.txt — простой текстовый файл в корне сайта, который указывает, каким роботам и какие разделы сайта разрешено или запрещено обходить. Базовая структура обычно выглядит так: указывается, к какому роботу относится правило (User-agent), и какие пути запрещены (Disallow) или явно разрешены (Allow).
Отдельный и всё более важный вопрос — что делать с краулерами ИИ-систем, такими как GPTBot (OpenAI) или PerplexityBot. Если вы заинтересованы в том, чтобы контент сайта мог цитироваться в ответах ChatGPT, Perplexity или Google AI Overviews, эти краулеры не должны блокироваться в robots.txt по умолчанию — на части CMS и хостингов такая блокировка стоит «из коробки», и её стоит явно проверить и снять, если цитируемость для вас важна.
Подробнее о том, как оптимизировать сайт под цитирование в ИИ-системах — в статье «Как оптимизировать сайт под ChatGPT, Perplexity и AI Overviews (GEO)?».
Canonical: когда одна страница «главная» среди дублей
Canonical-тег (link rel="canonical" в секции head) указывает Google, какую именно версию страницы считать основной, если существует несколько похожих или идентичных URL — например, одна и та же карточка товара, доступная с разными параметрами фильтра в адресе.
Без явного canonical-тега Google выбирает основную версию самостоятельно, и не всегда так, как хотел бы владелец сайта — это может размывать сигналы ранжирования между несколькими версиями одной и той же страницы вместо их концентрации на одном URL.
Важно отличать canonical от 301-редиректа: canonical говорит «эта страница похожа на другую, но обе технически существуют и доступны», а 301-редирект физически перенаправляет пользователя и робота с одного адреса на другой, и старая страница фактически перестаёт быть самостоятельно доступной.
Хотите проверить, нет ли противоречий в вашей технической настройке?
Проведём технический SEO-аудит и проверим sitemap, robots.txt и canonical на согласованность — прежде чем эти мелкие противоречия начнут стоить вам позиций.
Типичные ошибки
| Файл | Зачем | Частая ошибка | Как проверить |
|---|---|---|---|
| sitemap.xml | Список страниц для индексации | В sitemap включены заблокированные или неработающие страницы | Search Console → Файлы Sitemap → статус обработки |
| robots.txt | Ограничение доступа роботов к разделам сайта | Случайно закрыт весь сайт (Disallow: /) после смены CMS или хостинга | Ручной просмотр файла по адресу site.cz/robots.txt |
| canonical | Указание основной версии среди дублей | Canonical указывает на страницу, которая сама закрыта от индексации | Просмотр исходного кода страницы + Search Console → Покрытие |
| Связка всех трёх | Согласованная индексация без противоречий | Sitemap разрешает страницу, robots.txt её блокирует | Кросс-проверка: сверить sitemap, robots.txt и canonical вручную по ключевым страницам |
Мини-чек-лист перед публикацией
- Sitemap.xml существует, доступен по прямой ссылке и содержит только рабочие, индексируемые страницы.
- Robots.txt не блокирует важные разделы сайта — проверено вручную, а не «по умолчанию оставлено как есть».
- Каждая ключевая страница имеет собственный, корректный canonical-тег, указывающий сама на себя (если это не дубль).
- Нет противоречий между тремя файлами: то, что разрешено в sitemap, не заблокировано в robots.txt.
- Если важна цитируемость в ИИ-системах — краулеры вроде GPTBot и PerplexityBot явно не заблокированы.
Чек-лист: 10 типичных SEO-ошибок до аудита
Скачайте бесплатный PDF с пунктами для самостоятельной проверки — отметьте, что уже проверили, и приходите к аудиту с готовым списком вопросов.
Готово! Чек-лист открыт в новой вкладке. Копию пришлём на ваш email. Если файл не открылся — откройте PDF ещё раз.
Частые вопросы
Обязателен ли sitemap.xml для небольшого сайта?
Формально нет — Google способен найти страницы и через обычную навигацию по ссылкам сайта, но sitemap ускоряет и упорядочивает этот процесс даже для небольших сайтов, и его отсутствие не даёт никакого преимущества, поэтому создавать его стоит в любом случае.
Можно ли закрыть в robots.txt раздел /admin/ или личный кабинет?
Да, служебные разделы вроде административной панели или личного кабинета пользователя разумно закрывать от индексации — это стандартная и безопасная практика, в отличие от случайной блокировки публичных страниц сайта.
В чём разница между canonical и 301-редиректом?
Canonical используется, когда обе версии страницы должны технически оставаться доступными, но одна из них считается основной для индексации. 301-редирект применяется, когда старый адрес должен полностью и окончательно уступить место новому, физически перенаправляя на него пользователей и роботов.
Как соотносятся llms.txt и robots.txt?
Это разные файлы с разными задачами: robots.txt управляет доступом краулеров к разделам сайта, а llms.txt — это дополнительный, пока не универсально поддерживаемый файл с кратким описанием сайта специально для языковых моделей. Наличие llms.txt не заменяет корректную настройку robots.txt.
Как часто нужно обновлять sitemap?
В идеале sitemap должен обновляться автоматически при добавлении, удалении или изменении URL страниц — большинство современных CMS делает это без ручного вмешательства. Если обновление ручное, стоит пересматривать sitemap при каждом заметном изменении структуры сайта, а не по фиксированному календарному графику.
Нужна проверка sitemap, robots.txt и canonical?
Оставьте заявку — найдём конфликты индексации и дадим план исправлений с приоритетами.