Когда сайт запускается, мало кто вспоминает о двух скромных файлах в корне. Дизайн утверждён, тексты загружены, реклама готова, а вопрос «как поисковики узнают о страницах и что им можно трогать» остаётся без ответа. Иногда его решает сама система управления, иногда никто. Результат бывает печальным в обе стороны: либо в поиск попадает служебный мусор (корзины, фильтры, тестовые страницы), либо, что ещё хуже, закрытым оказывается целый сайт.
Классическая история из практики: во время разработки сайт закрывают от индексации, чтобы черновики не попали в выдачу. Затем он запускается, а запрет остаётся. Через месяц владелец удивляется, почему нет трафика. Такие случаи происходят чаще, чем хотелось бы, поэтому проверка этих настроек входит в обязательный чек-лист запуска сайта.
В статье разберём, что такое robots.txt и sitemap.xml, зачем они нужны, как их правильно настроить и как не навредить.
Как поисковики обходят сайт
Чтобы страница появилась в выдаче, робот должен её найти, прочитать, понять и добавить в базу. Этот путь делится на этапы.
- Обнаружение. Робот узнаёт о странице по ссылкам с других страниц, из карты сайта или из других источников.
- Обход. Робот запрашивает страницу и получает её содержимое. Здесь вступают в силу правила robots.txt.
- Индексация. Поисковик решает, стоит ли добавлять страницу в базу и как её интерпретировать.
- Ранжирование. Страница получает позицию по запросам.
Robots.txt влияет на второй этап: он говорит роботу, куда заходить не стоит. Sitemap.xml помогает на первом: подсказывает, какие страницы существуют и важны. Но ни один из файлов не гарантирует индексацию. Это именно рекомендации и подсказки, а не приказы.
Важное различие: запрет обхода и запрет индексации — не одно и то же. Если страница закрыта в robots.txt, но на неё много ссылок, поисковик может добавить её в выдачу без описания, просто по адресу. Чтобы страница точно не попала в поиск, нужен другой механизм: мета-тег с запретом индексации или специальный заголовок ответа сервера. Причём для его работы страница должна быть открыта для обхода, иначе робот не увидит инструкцию.
Файл robots.txt: основы
Это обычный текстовый файл, который лежит в корне сайта и доступен по адресу вида «ваш-домен/robots.txt». Робот проверяет его раньше любых других страниц. Файл состоит из групп правил, каждая из которых относится к определённому роботу.
Главные директивы
- User-agent. Указывает, к какому роботу относятся следующие правила. Звёздочка означает всех роботов.
- Disallow. Запрещает обход указанных путей. Пустое значение означает «разрешено всё».
- Allow. Разрешает обход пути внутри запрещённого раздела. Нужна для исключений.
- Sitemap. Сообщает адрес карты сайта.
- Clean-param. Директива некоторых поисковиков для служебных параметров адреса, чтобы они не создавали дубли.
Пример логики простого файла
Для типичного корпоративного сайта в файле обычно содержится: общее правило для всех роботов, запрет служебных разделов (админка, внутренний поиск, корзина, личный кабинет, страницы с параметрами сортировки), исключения для нужных ресурсов и строка с адресом карты сайта. Всё это записывается короткими строками без лишних украшений.
Правила чувствительны к регистру и к точности записи путей. Лишний символ может разрешить то, что вы хотели закрыть, или закрыть то, что нужно открыть. Поэтому после каждой правки обязательна проверка.
Что закрывать от роботов, а что нет
Что обычно стоит закрывать
- Административная часть. Панель управления, служебные скрипты.
- Корзина, оформление заказа, личный кабинет. Эти страницы бесполезны в поиске и различаются для каждого пользователя.
- Результаты внутреннего поиска. Их количество практически бесконечно, и они плодят низкокачественные страницы.
- Страницы с параметрами сортировки и служебными метками. Они создают дубли основных страниц.
- Тестовые и черновые разделы. Лучше защитить их паролем, а не полагаться только на запрет.
- Версии для печати и технические дубли.
Что закрывать нельзя
- Файлы стилей и скриптов. Роботы отображают страницу почти как браузер. Если закрыть ресурсы, они увидят искажённую страницу и могут занизить оценку.
- Изображения, которые должны находиться в поиске.
- Основные посадочные страницы. Кажется очевидным, но ошибки случаются.
- Страницы, которые должны получать трафик, но имеют параметры. Проверьте, не попадают ли они под шаблонное правило.
Отдельная тема — фильтры в интернет-магазине. Часть фильтрованных страниц стоит открыть, потому что по ним есть спрос («красные диваны», «диваны угловые»), а часть закрыть, потому что они бесполезны. Решение принимают на основе семантики: подробности в статье про фильтры и поиск в интернет-магазине и про семантическое ядро.
Sitemap.xml: карта для роботов
Карта сайта — это файл с перечнем адресов страниц, которые вы хотите видеть в поиске. Она не заменяет перелинковку, но помогает роботу быстрее найти новые страницы, особенно на крупных проектах и сайтах с глубокой структурой.
Что включать в карту
- Только страницы, которые должны попасть в поиск.
- Только адреса с кодом ответа «успешно» без перенаправлений.
- Канонические адреса, без параметров и дублей.
- Страницы, которые не закрыты метатегом запрета индексации.
Чего в карте быть не должно
- Страниц с ошибками и перенаправлениями.
- Закрытых от индексации страниц.
- Служебных и дублирующих адресов.
- Адресов с чужого домена или другого протокола.
Дополнительные данные в карте
Для каждой страницы можно указать дату последнего изменения. Если она правдива и обновляется только при реальных изменениях содержимого, робот лучше планирует обход. Поля приоритета и частоты изменений сейчас почти не учитываются поисковиками, поэтому тратить на них время не нужно. Для изображений, видео и новостей существуют специальные расширения формата.
Ограничения и несколько карт
Одна карта имеет ограничения по размеру и количеству адресов. Для больших проектов создают несколько карт и объединяющий индексный файл. Разумно делить их по типам: отдельно страницы услуг, статьи, товары, категории. Так проще находить проблемы: в панели вебмастера видно, какая часть адресов проиндексирована в каждом разделе.
Как связаны robots.txt, sitemap и другие механизмы
Часто путают, какой инструмент использовать. Таблица поможет разобраться.
| Задача | Подходящий инструмент | Комментарий |
|---|---|---|
| Не тратить время робота на служебные разделы | Robots.txt | Экономит бюджет обхода |
| Гарантированно убрать страницу из поиска | Мета-тег запрета индексации или заголовок | Страница должна быть доступна для чтения |
| Показать, какие страницы важны | Sitemap.xml | Подсказка, а не гарантия |
| Указать главный адрес среди дублей | Канонический адрес | Склеивает сигналы дублей |
| Перенести страницу навсегда | Постоянное перенаправление | Передаёт историю на новый адрес |
| Защитить закрытые данные | Авторизация или пароль | Robots.txt не защищает, а лишь просит |
Обратите внимание на последнюю строку. Файл robots.txt общедоступен, и перечисление в нём «секретных» разделов только подсказывает, где их искать. Всё, что действительно должно быть защищено, закрывается авторизацией.
Бюджет обхода: когда это важно
У каждого сайта есть ограниченное внимание робота: он готов обходить определённое число страниц за определённое время. Для небольшого сайта на десятки страниц это не проблема. Для интернет-магазина с десятками тысяч товаров и миллионами комбинаций фильтров — критичный фактор. Если робот тратит время на бесполезные адреса, новые товары и обновления замечаются с задержкой.
Как экономить бюджет:
- Закрывайте бесконечные комбинации параметров и результаты внутреннего поиска.
- Убирайте цепочки перенаправлений и страницы с ошибками.
- Следите за скоростью ответа сервера: медленный сервер снижает число страниц, которые робот готов запросить. Подробнее в материале про скорость загрузки сайта.
- Выстраивайте логичную перелинковку, чтобы важные страницы были рядом с главной. Как это делать, мы рассказали в статье про внутреннюю перелинковку.
- Держите карту сайта чистой и актуальной.
Пошаговая настройка
- Проанализируйте структуру. Выпишите типы страниц и решите, какие должны быть в поиске, а какие нет.
- Найдите служебные адреса. Административные разделы, корзину, поиск, параметры.
- Составьте правила robots.txt. Минимально необходимые, без избыточных запретов.
- Добавьте адрес карты сайта в файл.
- Сформируйте карту автоматически средствами CMS, чтобы она обновлялась сама. О выборе системы — в статье как выбрать CMS для корпоративного сайта.
- Проверьте файлы в инструментах вебмастеров обеих поисковых систем.
- Отправьте карту через панели вебмастеров.
- Проверьте в отчётах индексирования, какие страницы приняты, какие исключены и по какой причине.
- Повторяйте проверку после крупных изменений структуры и релизов.
Хорошо, когда эти вопросы продуманы ещё на этапе разработки. Они входят в набор задач, который мы разбирали в статье про SEO при разработке, и учитываются нами в этапах работы над проектом.
Особенности для разных типов сайтов
Корпоративный сайт
Структура небольшая и понятная. Достаточно закрыть админку и служебные страницы, подключить автоматическую карту и указать её в файле. Следите за тем, чтобы страницы благодарностей после отправки формы не попадали в индекс: они бесполезны и могут искажать аналитику.
Интернет-магазин
Здесь больше сложностей: фильтры, сортировки, пагинация, карточки с вариантами. Нужно продумать, какие комбинации фильтров ценны для поиска, остальные закрыть, использовать канонические адреса и разбить карту на разделы. Мы учитываем это при разработке интернет-магазинов.
Лендинг
Одна страница, и карта почти не нужна. Но robots.txt всё равно должен существовать и не блокировать ресурсы. Если лендинг предназначен только для рекламы, возможно, его стоит закрыть от индексации, чтобы он не конкурировал с основным сайтом. Подробнее о выборе формата — в статье лендинг или многостраничный сайт.
Сайт на нескольких языках или регионах
Для каждой версии нужна своя логика: отдельные карты, корректные указания о языковых версиях. Следите, чтобы правила не закрывали сразу весь раздел одной версии.
Типичные ошибки
- Запрет всего сайта. Строка с запретом корня, оставшаяся после разработки.
- Закрытые стили и скрипты. Робот видит страницу «голой».
- Использование robots.txt как защиты. Закрытые таким образом данные остаются доступными по прямой ссылке.
- Закрытие страницы, которую нужно убрать из индекса. Робот не видит мета-тег, и страница остаётся в выдаче.
- Грязная карта сайта. Ошибки, перенаправления, закрытые страницы и дубли.
- Устаревшая карта. Создана однажды вручную и больше не обновляется.
- Неправильный адрес файла. Файл лежит не в корне или недоступен по основному домену и протоколу.
- Разные правила для разных версий домена. С префиксом и без, по защищённому и обычному протоколу.
- Слишком много правил. Сложный файл, в котором уже никто не помнит смысл каждой строки.
- Отсутствие проверки после релиза. Обновление платформы перезаписывает файл настройками по умолчанию.
Многие из этих проблем всплывают при техническом аудите сайта, и именно с проверки индексации обычно начинается такая работа. Если выявлены проблемы, их исправление можно включить в поддержку сайта.
Как проверять результат
- В панелях вебмастеров. Инструмент проверки файла показывает, разрешён ли обход конкретного адреса для выбранного робота.
- Отчёты индексирования. Видно число страниц в индексе, исключённых и с ошибками, а также причины исключения.
- Проверка кода ответа. Файл должен отдаваться со статусом «успешно», а не с ошибкой или перенаправлением.
- Просмотр логов сервера. Они показывают, какие страницы действительно запрашивают роботы и как часто.
- Выборочная проверка. Задайте поисковику запрос по точному адресу или фрагменту текста важной страницы и убедитесь, что она найдена.
Чек-лист
- Файл robots.txt лежит в корне и доступен по основному адресу сайта.
- Нет запрета на обход всего сайта и важных разделов.
- Закрыты админка, корзина, личный кабинет, внутренний поиск, параметры сортировки.
- Стили, скрипты и нужные изображения доступны роботам.
- В файле указан адрес карты сайта.
- Карта формируется автоматически и содержит только актуальные канонические адреса.
- В карте нет страниц с ошибками, перенаправлениями и запретом индексации.
- Карты отправлены в панели вебмастеров.
- Для страниц, которые нужно убрать из выдачи, использован мета-тег, а не запрет обхода.
- После релизов настройки проверяются повторно.
Итог
Robots.txt и sitemap.xml — небольшие по размеру, но важные по последствиям файлы. Первый рассказывает роботам, куда лучше не ходить, второй показывает, что на сайте действительно ценно. Вместе с понятной структурой, перелинковкой и быстрой работой сервера они создают основу, на которой строятся все остальные SEO-усилия. Ошибки здесь стоят дорого, а исправляются быстро, поэтому настраивать и проверять их стоит с особой аккуратностью.
Если вы не уверены, что с индексацией вашего сайта всё в порядке, или готовите запуск нового проекта, напишите нам. Мы проверим файлы и отчёты, найдём слабые места и предложим решения в рамках SEO-оптимизации.