Генератор robots.txt
Готовый robots.txt под ваш движок с директивами и Sitemap.
Как составить правильный robots.txt
Файл лежит в корне сайта и читается роботом раньше любой страницы. В нём вы указываете, какие разделы обходить не нужно: корзину, личный кабинет, внутренний поиск, страницы сортировки и фильтров. На сайте из 300 страниц разница почти незаметна. А вот на каталоге в 20 000 товаров с пятью фильтрами робот легко уходит в сотни тысяч комбинаций адресов и до реальных карточек добирается неделями, потому что суточный лимит обхода конечен.
Есть оговорка, о которую спотыкаются постоянно. Директива Disallow запрещает обход, но не индексацию: если на закрытую страницу ведут внешние ссылки, Google способен показать её в выдаче без описания. Чтобы адрес гарантированно выпал из индекса, нужен <meta name="robots" content="noindex"> или заголовок X-Robots-Tag: noindex. Такая страница обязана оставаться открытой для обхода, иначе робот просто не прочитает запрет.
Что вводить в генераторе
Начните с шаблона CMS. Он подставит типовые служебные пути: у WordPress это /wp-admin/, /wp-includes/, /xmlrpc.php и внутренний поиск /*?s=, у Битрикса набор другой — /bitrix/, /personal/, /auth/, /search/. Дальше добавьте свои правила, по одному в строке.
- Основной домен: только имя хоста без протокола, вида
example.ru. Генератор соберёт строкуSitemap: https://example.ru/sitemap.xmlсам. - Disallow: пути от корня, всегда начиная со слеша. Правило
/cartзакроет и/cart/, и/cart-items/: сравнение идёт по началу строки, а не по целому сегменту. - Allow: исключение внутри запрещённой ветки. Классический пример для WordPress: закрыт весь
/wp-admin/, но открыт/wp-admin/admin-ajax.php, через который работают фильтры и формы. - Маски: символ
*заменяет любую последовательность,$фиксирует конец адреса. СтрокаDisallow: /*?sort=уберёт все сортировки, аDisallow: /*.pdf$отсечёт только PDF-файлы.
Куда положить файл
Сохраните результат как robots.txt в кодировке UTF-8 без BOM и загрузите в корень сайта. Проверка занимает секунд десять: откройте https://ваш-домен.ru/robots.txt в браузере и убедитесь, что отдаётся обычный текст со статусом 200. Поддомены поисковики считают отдельными сайтами, поэтому у shop.example.ru должен быть собственный файл. Google читает первые 500 КБ, остальное отбрасывает без предупреждения.
Яндекс и Google трактуют директивы по-разному
Директиву Host Яндекс отменил в марте 2018 года, главное зеркало теперь определяется 301-редиректом и атрибутом canonical. Crawl-delay Яндекс перестал учитывать тогда же, Google не поддерживал её никогда. Скорость обхода регулируют в Вебмастере и Search Console. Живой остаётся Clean-param: она работает только у Яндекса и удобнее запрета через Disallow, потому что склеивает статистику адреса с параметром и без него.
Частые ошибки
- Забыли снять
Disallow: /после переноса с тестового сервера. Сайт исчезает из выдачи за 2–3 недели, а возвращается месяцами. - Закрыли
/wp-content/или папку со скриптами. Робот видит страницу без стилей, оценка мобильной версии падает, вместе с ней проседают позиции. - Написали
Disallow: example.ru/cart. Домен в пути не указывают, правило не сработает. - Поставили относительный путь в директиве Sitemap. Нужен абсолютный адрес с протоколом.
- Закрыли раздел, который давно в индексе, и ждут выпадения страниц. Robots.txt тут бессилен: адреса останутся, пока робот не увидит noindex, 404 или 410.
Проверка после установки
В Яндекс.Вебмастере работает «Анализ robots.txt», в Google Search Console доступен отчёт со списком заблокированных адресов. Прогоните через них 5–10 значимых URL: главную, карточку товара, статью, страницу категории. Один неверно запрещённый адрес означает, что правило слишком широкое. Файл перечитывайте после каждой смены движка или структуры каталога.
Частые вопросы
Зачем нужен robots.txt?
Это текстовый файл в корне сайта, который подсказывает поисковым роботам, какие разделы обходить, а какие — нет, и где лежит карта сайта. Он управляет обходом, но не гарантирует запрет индексации — для этого нужен meta robots или заголовок X-Robots-Tag.
Нужно ли закрывать служебные разделы?
Да, обычно закрывают корзину, личный кабинет, результаты поиска по сайту, страницы сортировки и фильтров, дубли с параметрами. Но не закрывайте CSS и JS — иначе робот увидит страницу «сломанной».
Обязательна ли директива Sitemap?
Не обязательна, но желательна: она помогает поисковикам быстрее найти карту сайта. Указывайте полный абсолютный адрес с https.
Чем Disallow отличается от noindex?
Disallow запрещает роботу заходить на страницу, noindex запрещает показывать её в результатах поиска. Если адрес закрыт в robots.txt, робот не прочитает meta noindex и страница может остаться в индексе без описания. Для гарантированного удаления оставьте её открытой для обхода и поставьте meta robots noindex.
Нужен ли robots.txt небольшому сайту?
Даже на сайте из 30 страниц файл полезен: он указывает адрес карты сайта и закрывает служебные разделы движка. Без файла сервер отдаёт 404, ошибкой это не считается, но директива Sitemap теряется.