robots.txt и sitemap.xml решают разные задачи, но ошибки в них часто проявляются вместе. Первый файл управляет обходом, второй помогает находить URL. Ни один из них не должен противоречить фактической архитектуре сайта.

Что делает robots.txt

Robots.txt содержит директивы для поисковых роботов. Через Disallow обычно закрывают технические области, параметры или служебные пути, которые не нужно обходить. Однако запрет обхода не является универсальной командой удаления URL из индекса.

Когда нужен meta robots noindex

Если страница должна быть доступна роботу, но не должна попадать в индекс, применяют подходящий meta robots или X-Robots-Tag. Важно не закрыть такую страницу в robots.txt раньше, чем робот сможет увидеть noindex.

Что включать в sitemap.xml

Карта сайта должна содержать канонические URL, которые вы действительно хотите индексировать. Не добавляйте 404, редиректы, noindex, страницы авторизации и технические фильтры. Для большого проекта sitemap удобно разделять на несколько файлов через индекс карты сайта.

Lastmod

Дата последнего изменения полезна, если обновляется честно. Автоматическая установка сегодняшней даты на все страницы каждый день снижает ценность сигнала.

Типовые конфликты

  • URL в sitemap закрыт Disallow;
  • страница в sitemap имеет noindex;
  • canonical ведёт на другой URL;
  • в sitemap попали редиректы;
  • карта сайта возвращает HTML вместо XML;
  • robots.txt недоступен или отвечает 5xx.

Хороший технический аудит показывает эти сигналы рядом — так конфликт заметен сразу.