Что такое robots.txt и как его правильно настроить
robots.txt (файл с правилами для поисковых роботов) — robots.txt это текстовый файл в корне сайта, в котором прописано, какие разделы поисковым и другим роботам можно обходить, а какие нет.
Файл лежит по адресу site.ru/robots.txt, и робот читает его перед обходом. Правила группируются по User-agent (имени робота), дальше идут директивы Disallow (запретить) и Allow (разрешить), а в конце указывают адрес карты сайта.
Условный пример для небольшого сайта:
- User-agent: * и под ним Disallow: /admin/, Disallow: /cart/, Disallow: /*?utm_ (закрыть служебные разделы и адреса с метками);
- отдельный блок для GPTBot, OAI-SearchBot и PerplexityBot с Allow: /, если вы хотите, чтобы нейросети читали сайт;
- строка Sitemap: https://site.ru/sitemap.xml.
Что обычно закрывают: админку, корзину и личный кабинет, результаты поиска по сайту, страницы сортировки и фильтров, которые плодят дубли, адреса с UTM-метками. Для Яндекса есть директива Clean-param, она склеивает адреса с лишними параметрами.
Важная тонкость. robots.txt запрещает обход, но не всегда убирает страницу из индекса. Если на закрытую страницу много ссылок, Google может показать её в выдаче без описания. Чтобы гарантированно убрать страницу, нужен мета-тег noindex, а обход при этом должен быть открыт.
Частые ошибки. После переноса с тестового сервера остаётся Disallow: / и сайт целиком выпадает из поиска. Закрыты папки со стилями и скриптами, и робот видит страницу сломанной. На CDN или в защите от ботов по умолчанию заблокированы ИИ-краулеры, а владелец сайта об этом не знает. Для GEO-продвижения это первое, что мы проверяем.
Проверить файл можно в Яндекс Вебмастере, раздел «Анализ robots.txt»: туда вставляется адрес страницы, и сервис показывает, разрешён ли он.
