Генераторы

Генератор robots.txt

Готовый robots.txt под ваш движок с директивами и Sitemap.

  

Как составить правильный robots.txt

Файл лежит в корне сайта и читается роботом раньше любой страницы. В нём вы указываете, какие разделы обходить не нужно: корзину, личный кабинет, внутренний поиск, страницы сортировки и фильтров. На сайте из 300 страниц разница почти незаметна. А вот на каталоге в 20 000 товаров с пятью фильтрами робот легко уходит в сотни тысяч комбинаций адресов и до реальных карточек добирается неделями, потому что суточный лимит обхода конечен.

Есть оговорка, о которую спотыкаются постоянно. Директива Disallow запрещает обход, но не индексацию: если на закрытую страницу ведут внешние ссылки, Google способен показать её в выдаче без описания. Чтобы адрес гарантированно выпал из индекса, нужен <meta name="robots" content="noindex"> или заголовок X-Robots-Tag: noindex. Такая страница обязана оставаться открытой для обхода, иначе робот просто не прочитает запрет.

Что вводить в генераторе

Начните с шаблона CMS. Он подставит типовые служебные пути: у WordPress это /wp-admin/, /wp-includes/, /xmlrpc.php и внутренний поиск /*?s=, у Битрикса набор другой — /bitrix/, /personal/, /auth/, /search/. Дальше добавьте свои правила, по одному в строке.

Куда положить файл

Сохраните результат как robots.txt в кодировке UTF-8 без BOM и загрузите в корень сайта. Проверка занимает секунд десять: откройте https://ваш-домен.ru/robots.txt в браузере и убедитесь, что отдаётся обычный текст со статусом 200. Поддомены поисковики считают отдельными сайтами, поэтому у shop.example.ru должен быть собственный файл. Google читает первые 500 КБ, остальное отбрасывает без предупреждения.

Яндекс и Google трактуют директивы по-разному

Директиву Host Яндекс отменил в марте 2018 года, главное зеркало теперь определяется 301-редиректом и атрибутом canonical. Crawl-delay Яндекс перестал учитывать тогда же, Google не поддерживал её никогда. Скорость обхода регулируют в Вебмастере и Search Console. Живой остаётся Clean-param: она работает только у Яндекса и удобнее запрета через Disallow, потому что склеивает статистику адреса с параметром и без него.

Частые ошибки

Проверка после установки

В Яндекс.Вебмастере работает «Анализ robots.txt», в Google Search Console доступен отчёт со списком заблокированных адресов. Прогоните через них 5–10 значимых URL: главную, карточку товара, статью, страницу категории. Один неверно запрещённый адрес означает, что правило слишком широкое. Файл перечитывайте после каждой смены движка или структуры каталога.

Частые вопросы

Зачем нужен robots.txt?

Это текстовый файл в корне сайта, который подсказывает поисковым роботам, какие разделы обходить, а какие — нет, и где лежит карта сайта. Он управляет обходом, но не гарантирует запрет индексации — для этого нужен meta robots или заголовок X-Robots-Tag.

Нужно ли закрывать служебные разделы?

Да, обычно закрывают корзину, личный кабинет, результаты поиска по сайту, страницы сортировки и фильтров, дубли с параметрами. Но не закрывайте CSS и JS — иначе робот увидит страницу «сломанной».

Обязательна ли директива Sitemap?

Не обязательна, но желательна: она помогает поисковикам быстрее найти карту сайта. Указывайте полный абсолютный адрес с https.

Чем Disallow отличается от noindex?

Disallow запрещает роботу заходить на страницу, noindex запрещает показывать её в результатах поиска. Если адрес закрыт в robots.txt, робот не прочитает meta noindex и страница может остаться в индексе без описания. Для гарантированного удаления оставьте её открытой для обхода и поставьте meta robots noindex.

Нужен ли robots.txt небольшому сайту?

Даже на сайте из 30 страниц файл полезен: он указывает адрес карты сайта и закрывает служебные разделы движка. Без файла сервер отдаёт 404, ошибкой это не считается, но директива Sitemap теряется.