robots.txt и sitemap.xml решают разные задачи, но ошибки в них часто проявляются вместе. Первый файл управляет обходом, второй помогает находить URL. Ни один из них не должен противоречить фактической архитектуре сайта.
Что делает robots.txt
Robots.txt содержит директивы для поисковых роботов. Через Disallow обычно закрывают технические области, параметры или служебные пути, которые не нужно обходить. Однако запрет обхода не является универсальной командой удаления URL из индекса.
Когда нужен meta robots noindex
Если страница должна быть доступна роботу, но не должна попадать в индекс, применяют подходящий meta robots или X-Robots-Tag. Важно не закрыть такую страницу в robots.txt раньше, чем робот сможет увидеть noindex.
Что включать в sitemap.xml
Карта сайта должна содержать канонические URL, которые вы действительно хотите индексировать. Не добавляйте 404, редиректы, noindex, страницы авторизации и технические фильтры. Для большого проекта sitemap удобно разделять на несколько файлов через индекс карты сайта.
Lastmod
Дата последнего изменения полезна, если обновляется честно. Автоматическая установка сегодняшней даты на все страницы каждый день снижает ценность сигнала.
Типовые конфликты
- URL в sitemap закрыт Disallow;
- страница в sitemap имеет noindex;
- canonical ведёт на другой URL;
- в sitemap попали редиректы;
- карта сайта возвращает HTML вместо XML;
- robots.txt недоступен или отвечает 5xx.
Хороший технический аудит показывает эти сигналы рядом — так конфликт заметен сразу.
