Когда сайт запускается, мало кто вспоминает о двух скромных файлах в корне. Дизайн утверждён, тексты загружены, реклама готова, а вопрос «как поисковики узнают о страницах и что им можно трогать» остаётся без ответа. Иногда его решает сама система управления, иногда никто. Результат бывает печальным в обе стороны: либо в поиск попадает служебный мусор (корзины, фильтры, тестовые страницы), либо, что ещё хуже, закрытым оказывается целый сайт.

Классическая история из практики: во время разработки сайт закрывают от индексации, чтобы черновики не попали в выдачу. Затем он запускается, а запрет остаётся. Через месяц владелец удивляется, почему нет трафика. Такие случаи происходят чаще, чем хотелось бы, поэтому проверка этих настроек входит в обязательный чек-лист запуска сайта.

В статье разберём, что такое robots.txt и sitemap.xml, зачем они нужны, как их правильно настроить и как не навредить.

Как поисковики обходят сайт

Чтобы страница появилась в выдаче, робот должен её найти, прочитать, понять и добавить в базу. Этот путь делится на этапы.

  1. Обнаружение. Робот узнаёт о странице по ссылкам с других страниц, из карты сайта или из других источников.
  2. Обход. Робот запрашивает страницу и получает её содержимое. Здесь вступают в силу правила robots.txt.
  3. Индексация. Поисковик решает, стоит ли добавлять страницу в базу и как её интерпретировать.
  4. Ранжирование. Страница получает позицию по запросам.

Robots.txt влияет на второй этап: он говорит роботу, куда заходить не стоит. Sitemap.xml помогает на первом: подсказывает, какие страницы существуют и важны. Но ни один из файлов не гарантирует индексацию. Это именно рекомендации и подсказки, а не приказы.

Важное различие: запрет обхода и запрет индексации — не одно и то же. Если страница закрыта в robots.txt, но на неё много ссылок, поисковик может добавить её в выдачу без описания, просто по адресу. Чтобы страница точно не попала в поиск, нужен другой механизм: мета-тег с запретом индексации или специальный заголовок ответа сервера. Причём для его работы страница должна быть открыта для обхода, иначе робот не увидит инструкцию.

Файл robots.txt: основы

Это обычный текстовый файл, который лежит в корне сайта и доступен по адресу вида «ваш-домен/robots.txt». Робот проверяет его раньше любых других страниц. Файл состоит из групп правил, каждая из которых относится к определённому роботу.

Главные директивы

  • User-agent. Указывает, к какому роботу относятся следующие правила. Звёздочка означает всех роботов.
  • Disallow. Запрещает обход указанных путей. Пустое значение означает «разрешено всё».
  • Allow. Разрешает обход пути внутри запрещённого раздела. Нужна для исключений.
  • Sitemap. Сообщает адрес карты сайта.
  • Clean-param. Директива некоторых поисковиков для служебных параметров адреса, чтобы они не создавали дубли.

Пример логики простого файла

Для типичного корпоративного сайта в файле обычно содержится: общее правило для всех роботов, запрет служебных разделов (админка, внутренний поиск, корзина, личный кабинет, страницы с параметрами сортировки), исключения для нужных ресурсов и строка с адресом карты сайта. Всё это записывается короткими строками без лишних украшений.

Правила чувствительны к регистру и к точности записи путей. Лишний символ может разрешить то, что вы хотели закрыть, или закрыть то, что нужно открыть. Поэтому после каждой правки обязательна проверка.

Что закрывать от роботов, а что нет

Что обычно стоит закрывать

  • Административная часть. Панель управления, служебные скрипты.
  • Корзина, оформление заказа, личный кабинет. Эти страницы бесполезны в поиске и различаются для каждого пользователя.
  • Результаты внутреннего поиска. Их количество практически бесконечно, и они плодят низкокачественные страницы.
  • Страницы с параметрами сортировки и служебными метками. Они создают дубли основных страниц.
  • Тестовые и черновые разделы. Лучше защитить их паролем, а не полагаться только на запрет.
  • Версии для печати и технические дубли.

Что закрывать нельзя

  • Файлы стилей и скриптов. Роботы отображают страницу почти как браузер. Если закрыть ресурсы, они увидят искажённую страницу и могут занизить оценку.
  • Изображения, которые должны находиться в поиске.
  • Основные посадочные страницы. Кажется очевидным, но ошибки случаются.
  • Страницы, которые должны получать трафик, но имеют параметры. Проверьте, не попадают ли они под шаблонное правило.

Отдельная тема — фильтры в интернет-магазине. Часть фильтрованных страниц стоит открыть, потому что по ним есть спрос («красные диваны», «диваны угловые»), а часть закрыть, потому что они бесполезны. Решение принимают на основе семантики: подробности в статье про фильтры и поиск в интернет-магазине и про семантическое ядро.

Совет студии. Перед запуском сравните файл на рабочем сайте с файлом тестовой версии. Самая дорогая ошибка в SEO — унаследовать запрет «Disallow: /» из тестового окружения.

Sitemap.xml: карта для роботов

Карта сайта — это файл с перечнем адресов страниц, которые вы хотите видеть в поиске. Она не заменяет перелинковку, но помогает роботу быстрее найти новые страницы, особенно на крупных проектах и сайтах с глубокой структурой.

Что включать в карту

  • Только страницы, которые должны попасть в поиск.
  • Только адреса с кодом ответа «успешно» без перенаправлений.
  • Канонические адреса, без параметров и дублей.
  • Страницы, которые не закрыты метатегом запрета индексации.

Чего в карте быть не должно

  • Страниц с ошибками и перенаправлениями.
  • Закрытых от индексации страниц.
  • Служебных и дублирующих адресов.
  • Адресов с чужого домена или другого протокола.

Дополнительные данные в карте

Для каждой страницы можно указать дату последнего изменения. Если она правдива и обновляется только при реальных изменениях содержимого, робот лучше планирует обход. Поля приоритета и частоты изменений сейчас почти не учитываются поисковиками, поэтому тратить на них время не нужно. Для изображений, видео и новостей существуют специальные расширения формата.

Ограничения и несколько карт

Одна карта имеет ограничения по размеру и количеству адресов. Для больших проектов создают несколько карт и объединяющий индексный файл. Разумно делить их по типам: отдельно страницы услуг, статьи, товары, категории. Так проще находить проблемы: в панели вебмастера видно, какая часть адресов проиндексирована в каждом разделе.

Как связаны robots.txt, sitemap и другие механизмы

Часто путают, какой инструмент использовать. Таблица поможет разобраться.

ЗадачаПодходящий инструментКомментарий
Не тратить время робота на служебные разделыRobots.txtЭкономит бюджет обхода
Гарантированно убрать страницу из поискаМета-тег запрета индексации или заголовокСтраница должна быть доступна для чтения
Показать, какие страницы важныSitemap.xmlПодсказка, а не гарантия
Указать главный адрес среди дублейКанонический адресСклеивает сигналы дублей
Перенести страницу навсегдаПостоянное перенаправлениеПередаёт историю на новый адрес
Защитить закрытые данныеАвторизация или парольRobots.txt не защищает, а лишь просит

Обратите внимание на последнюю строку. Файл robots.txt общедоступен, и перечисление в нём «секретных» разделов только подсказывает, где их искать. Всё, что действительно должно быть защищено, закрывается авторизацией.

Бюджет обхода: когда это важно

У каждого сайта есть ограниченное внимание робота: он готов обходить определённое число страниц за определённое время. Для небольшого сайта на десятки страниц это не проблема. Для интернет-магазина с десятками тысяч товаров и миллионами комбинаций фильтров — критичный фактор. Если робот тратит время на бесполезные адреса, новые товары и обновления замечаются с задержкой.

Как экономить бюджет:

  • Закрывайте бесконечные комбинации параметров и результаты внутреннего поиска.
  • Убирайте цепочки перенаправлений и страницы с ошибками.
  • Следите за скоростью ответа сервера: медленный сервер снижает число страниц, которые робот готов запросить. Подробнее в материале про скорость загрузки сайта.
  • Выстраивайте логичную перелинковку, чтобы важные страницы были рядом с главной. Как это делать, мы рассказали в статье про внутреннюю перелинковку.
  • Держите карту сайта чистой и актуальной.

Пошаговая настройка

  1. Проанализируйте структуру. Выпишите типы страниц и решите, какие должны быть в поиске, а какие нет.
  2. Найдите служебные адреса. Административные разделы, корзину, поиск, параметры.
  3. Составьте правила robots.txt. Минимально необходимые, без избыточных запретов.
  4. Добавьте адрес карты сайта в файл.
  5. Сформируйте карту автоматически средствами CMS, чтобы она обновлялась сама. О выборе системы — в статье как выбрать CMS для корпоративного сайта.
  6. Проверьте файлы в инструментах вебмастеров обеих поисковых систем.
  7. Отправьте карту через панели вебмастеров.
  8. Проверьте в отчётах индексирования, какие страницы приняты, какие исключены и по какой причине.
  9. Повторяйте проверку после крупных изменений структуры и релизов.

Хорошо, когда эти вопросы продуманы ещё на этапе разработки. Они входят в набор задач, который мы разбирали в статье про SEO при разработке, и учитываются нами в этапах работы над проектом.

Особенности для разных типов сайтов

Корпоративный сайт

Структура небольшая и понятная. Достаточно закрыть админку и служебные страницы, подключить автоматическую карту и указать её в файле. Следите за тем, чтобы страницы благодарностей после отправки формы не попадали в индекс: они бесполезны и могут искажать аналитику.

Интернет-магазин

Здесь больше сложностей: фильтры, сортировки, пагинация, карточки с вариантами. Нужно продумать, какие комбинации фильтров ценны для поиска, остальные закрыть, использовать канонические адреса и разбить карту на разделы. Мы учитываем это при разработке интернет-магазинов.

Лендинг

Одна страница, и карта почти не нужна. Но robots.txt всё равно должен существовать и не блокировать ресурсы. Если лендинг предназначен только для рекламы, возможно, его стоит закрыть от индексации, чтобы он не конкурировал с основным сайтом. Подробнее о выборе формата — в статье лендинг или многостраничный сайт.

Сайт на нескольких языках или регионах

Для каждой версии нужна своя логика: отдельные карты, корректные указания о языковых версиях. Следите, чтобы правила не закрывали сразу весь раздел одной версии.

Типичные ошибки

  • Запрет всего сайта. Строка с запретом корня, оставшаяся после разработки.
  • Закрытые стили и скрипты. Робот видит страницу «голой».
  • Использование robots.txt как защиты. Закрытые таким образом данные остаются доступными по прямой ссылке.
  • Закрытие страницы, которую нужно убрать из индекса. Робот не видит мета-тег, и страница остаётся в выдаче.
  • Грязная карта сайта. Ошибки, перенаправления, закрытые страницы и дубли.
  • Устаревшая карта. Создана однажды вручную и больше не обновляется.
  • Неправильный адрес файла. Файл лежит не в корне или недоступен по основному домену и протоколу.
  • Разные правила для разных версий домена. С префиксом и без, по защищённому и обычному протоколу.
  • Слишком много правил. Сложный файл, в котором уже никто не помнит смысл каждой строки.
  • Отсутствие проверки после релиза. Обновление платформы перезаписывает файл настройками по умолчанию.

Многие из этих проблем всплывают при техническом аудите сайта, и именно с проверки индексации обычно начинается такая работа. Если выявлены проблемы, их исправление можно включить в поддержку сайта.

Как проверять результат

  • В панелях вебмастеров. Инструмент проверки файла показывает, разрешён ли обход конкретного адреса для выбранного робота.
  • Отчёты индексирования. Видно число страниц в индексе, исключённых и с ошибками, а также причины исключения.
  • Проверка кода ответа. Файл должен отдаваться со статусом «успешно», а не с ошибкой или перенаправлением.
  • Просмотр логов сервера. Они показывают, какие страницы действительно запрашивают роботы и как часто.
  • Выборочная проверка. Задайте поисковику запрос по точному адресу или фрагменту текста важной страницы и убедитесь, что она найдена.
Совет студии. Внесите проверку robots.txt и карты сайта в регламент каждого релиза. Занимает несколько минут, а страхует от потери трафика целого сайта.

Чек-лист

  1. Файл robots.txt лежит в корне и доступен по основному адресу сайта.
  2. Нет запрета на обход всего сайта и важных разделов.
  3. Закрыты админка, корзина, личный кабинет, внутренний поиск, параметры сортировки.
  4. Стили, скрипты и нужные изображения доступны роботам.
  5. В файле указан адрес карты сайта.
  6. Карта формируется автоматически и содержит только актуальные канонические адреса.
  7. В карте нет страниц с ошибками, перенаправлениями и запретом индексации.
  8. Карты отправлены в панели вебмастеров.
  9. Для страниц, которые нужно убрать из выдачи, использован мета-тег, а не запрет обхода.
  10. После релизов настройки проверяются повторно.

Итог

Robots.txt и sitemap.xml — небольшие по размеру, но важные по последствиям файлы. Первый рассказывает роботам, куда лучше не ходить, второй показывает, что на сайте действительно ценно. Вместе с понятной структурой, перелинковкой и быстрой работой сервера они создают основу, на которой строятся все остальные SEO-усилия. Ошибки здесь стоят дорого, а исправляются быстро, поэтому настраивать и проверять их стоит с особой аккуратностью.

Если вы не уверены, что с индексацией вашего сайта всё в порядке, или готовите запуск нового проекта, напишите нам. Мы проверим файлы и отчёты, найдём слабые места и предложим решения в рамках SEO-оптимизации.