BrandEvo

SEO

Robots.txt и sitemap.xml: зачем нужны и как настроить

Два служебных файла управляют тем, как поисковый робот видит ваш сайт: robots.txt задаёт правила обхода, а sitemap.xml подсказывает, какие страницы важны. Разбираем, за что отвечает каждый, как они устроены и какие ошибки в них чаще всего мешают продвижению.

ROBOTS.TXTSITEMAP.XMLDISALLOWКАРТА САЙТАОБХОД РОБОТАИНДЕКСАЦИЯСЛУЖЕБНЫЕ ФАЙЛЫ САЙТАROBOTS.TXTSITEMAP.XMLDISALLOWКАРТА САЙТАОБХОД РОБОТАИНДЕКСАЦИЯСЛУЖЕБНЫЕ ФАЙЛЫ САЙТА

robots.txt и sitemap.xml

Robots.txt и sitemap.xml — два маленьких файла, которые часто остаются без внимания, а потом оказываются причиной, по которой сайт плохо индексируется. Один говорит роботу, куда можно ходить, а куда нет; второй показывает, какие страницы вообще существуют и достойны внимания. Разберём оба по порядку — что это, как работает и где чаще всего ошибаются.

01Зачем сайту служебные файлы

Когда поисковый робот заходит на сайт, ему нужно понять две вещи: какие страницы можно обходить, а какие трогать не стоит, и где вообще лежит то, что стоит проиндексировать. Именно для этого существуют два файла.

robots.txt — текстовый файл с правилами обхода. Он лежит в корне сайта и первым делом считывается роботом. В нём указывают, какие разделы закрыть от обхода (служебные, технические, дубли), а какие оставить открытыми.

sitemap.xml — карта сайта в формате XML. Это список адресов страниц, которые вы хотите видеть в поиске. Карта помогает роботу узнать обо всех важных страницах, даже если на часть из них ведёт мало внутренних ссылок.

Оба файла — часть технического фундамента сайта наряду со скоростью, кодами ответа и борьбой с дублями. Шире эта тема разобрана в материале о технической оптимизации сайта.

02Как устроен robots.txt

Файл состоит из простых директив. Базовый набор, который встречается почти всегда:

  • User-agent — для какого робота правила (звёздочка означает «для всех»).
  • Disallow — какие разделы или страницы закрыть от обхода.
  • Allow — какие адреса открыть как исключение внутри закрытого раздела.
  • Sitemap — ссылка на карту сайта, чтобы робот сразу её нашёл.

Учебный пример простого файла (схематично):

User-agent: *
Disallow: /admin/
Disallow: /cart/
Allow: /
Sitemap: https://site.ru/sitemap.xml

Здесь всем роботам запрещён обход административного раздела и корзины, остальное открыто, а в конце указан адрес карты сайта. Что обычно закрывают через Disallow: административные панели, корзину и оформление заказа, страницы поиска по сайту, технические страницы, фильтры и сортировки, генерирующие дубли. Что закрывать не стоит — рабочие коммерческие и контентные страницы, ради которых сайт и существует.

03Важный нюанс: запрет обхода — это не запрет индексации

Частое заблуждение: «закрыл страницу в robots.txt — значит, её не будет в поиске». На деле robots.txt управляет обходом, а не индексацией. Робот не станет скачивать содержимое закрытой страницы, но сам адрес всё равно может попасть в выдачу, если на него ведут ссылки, — просто без описания.

Поэтому инструменты выбирают по задаче:

  • Нужно сэкономить обход служебных разделов — закрывают в robots.txt.
  • Нужно гарантированно убрать страницу из поиска — используют метатег noindex на самой странице (и при этом не закрывают её в robots.txt, иначе робот не увидит запрет).

Эта разница тесно связана с тем, как страницы вообще попадают в поиск. Подробно процесс разобран в материале об индексации сайта в Яндексе.

04Как устроен sitemap.xml

Карта сайта — это список URL, обёрнутый в XML-разметку. Для каждой страницы можно указать адрес и дополнительные подсказки: дату последнего изменения, как часто страница обновляется, относительный приоритет. Главное в карте — сам перечень актуальных адресов.

Несколько правил хорошей карты:

  • Только нужные страницы — в карту попадают адреса, которые вы хотите видеть в поиске, и отдают код 200. Закрытые от индексации и редиректы там не нужны.
  • Актуальность — карта должна обновляться при появлении и удалении страниц. На большинстве движков и конструкторов она генерируется автоматически.
  • Ссылка из robots.txt — адрес карты указывают в robots.txt, чтобы робот сразу её обнаружил.
  • Передача в вебмастер — карту добавляют в панель вебмастера, чтобы отслеживать, как поиск её обрабатывает.

Для крупных сайтов карту разбивают на несколько файлов и собирают в индексный sitemap. Но малому бизнесу с сайтом на десятки–сотни страниц достаточно одной автоматически формируемой карты.

05Типовые ошибки и как проверить

Большинство проблем с этими файлами сводится к нескольким повторяющимся ошибкам:

  • Закрыт весь сайт — строка Disallow: /, оставшаяся с этапа разработки. Самая опасная ошибка: сайт полностью выпадает из поиска.
  • Закрыты нужные разделы — по неосторожности под запрет попадают рабочие страницы или папки со стилями и скриптами, без которых поиск хуже понимает вёрстку.
  • Карта не соответствует сайту — в sitemap остались удалённые страницы, редиректы или закрытые от индексации адреса.
  • Карта не обновляется — новые страницы в неё не попадают, и робот узнаёт о них с задержкой.
  • Нет ссылки на карту — sitemap есть, но нигде не указан, и поиск может его не найти.

Минимальная проверка: откройте site.ru/robots.txt и site.ru/sitemap.xml в браузере. Если первый не закрывает сайт целиком, а второй отдаёт актуальный список рабочих страниц — базовый порядок уже наведён.

Удобнее всего контролировать оба файла через панель вебмастера: она показывает ошибки в robots.txt и проблемы обработки карты. Как её настроить — в статье про Яндекс.Вебмастер. А чтобы сайт изначально отдавал корректные служебные файлы, их закладывают ещё на этапе создания сайта.

// Как это работает в BrandEvo

Служебные файлы — под контролем с самого начала

В рамках технического аудита мы проверяем robots.txt и sitemap.xml: не закрыто ли лишнее, открыты ли нужные разделы, актуальна ли карта и передана ли она в вебмастер. Эти файлы мы держим в порядке постоянно, а не настраиваем один раз и забываем. Подробнее — на странице SEO-продвижения.

Официальная документация по теме — Справка Яндекс.Вебмастера.

Сомневаетесь, что файлы настроены правильно?

Оставьте заявку — проверим robots.txt и sitemap, найдём ошибки, мешающие обходу, и предложим план под нишу и бюджет.


Частые вопросы

Подходит ли подписка BrandEvo моему бизнесу?

Подписка работает для малого и среднего бизнеса в России. Тариф «Старт» — 200 000 ₽/год для услуг и небольших проектов, «E-commerce» — 400 000 ₽/год для интернет-магазинов. Подробное сравнение — на странице тарифов.

Что входит в подписку маркетинга?

Полный цикл: SEO, контекстная реклама, контент-маркетинг, email-рассылки, дизайн, веб-аналитика и разработка под задачу. Не отдельные услуги, а одна команда под результат.

Можно ли начать, если у меня ещё нет сайта?

Да. Если сайта нет — в первый месяц делаем посадочную страницу или лендинг. Если есть — проводим аудит и улучшаем. Создание и поддержка сайта входят в подписку.

Смотреть тарифы →
Карта блога — все статьи