ГлавнаяИнструментыSEOГенератор robots.txt
Генератор и проверка robots.txt с AI-ботами
Соберите robots.txt из шаблона, закройте служебные разделы, решите, каким AI-краулерам открывать сайт, и проверьте любой адрес: разрешён ли он Googlebot, YandexBot или GPTBot, какая группа и какое правило сработали.
—
Crawl-delay и Host не нужны. Google Crawl-delay не поддерживает, Яндекс перестал учитывать его в 2018 году; тогда же Яндекс отказался от Host в пользу 301-редиректа. Поэтому генератор их не добавляет.
—
Правила применённой группы
| Строка | Правило | Длина | Совпадение |
|---|
Этот адрес для разных роботов
| Робот | Группа | Доступ |
|---|
Проверка файла
Расчёт идёт в вашем браузере — введённые данные никуда не отправляются.
Как пользоваться
- Выберите шаблон«SaaS» закрывает личный кабинет и API, «Интернет-магазин» — корзину, фильтры и сортировку. Добавьте свои пути и отдельные группы для Яндекса или Google.
- Решите вопрос с AI-ботамиБоты разделены по назначению: обучение моделей, поиск с цитированием, запросы пользователя. Можно закрыть обучение и оставить поиск.
- Проверьте адресаКнопка «Проверить этот файл» переносит результат во вкладку «Проверка URL». Там видно, какая группа и какое правило решают судьбу адреса для каждого робота.
- Опубликуйте файлСкопируйте текст и положите его в корень домена: https://site.ru/robots.txt. У каждого поддомена и протокола свой файл.
Синтаксис robots.txt: группы, правила и приоритеты
robots.txt — текстовый файл в корне сайта, который говорит поисковым роботам, какие адреса можно сканировать. С 2022 года правила его чтения закреплены стандартом RFC 9309; Google и Яндекс описывают в справке одни и те же базовые принципы и несколько собственных расширений.
Файл состоит из групп. Группа начинается с одной или нескольких строк User-agent и продолжается правилами Disallow (запретить) и Allow (разрешить). Строки Sitemap к группам не относятся и могут стоять где угодно.
Как робот выбирает группу
Робот ищет группу со своим токеном — без учёта регистра — и подчиняется только ей. Если такой группы нет, берёт группу *; если нет и её, считает, что разрешено всё. Группы с одинаковым токеном объединяются. Отсюда частая ошибка: создать отдельную группу User-agent: Yandex и забыть повторить в ней запреты из *.
У поисковых систем есть задокументированные «запасные» группы: Googlebot-Image и Googlebot-News используют правила Googlebot, если своих нет, а все роботы Яндекса — группу Yandex.
Как выбирается правило
Значение правила сравнивается с началом пути вместе с параметрами. * означает любую последовательность символов, $ в конце — конец адреса. Если подходят несколько правил, побеждает самое длинное; при равной длине — Allow. Порядок строк значения не имеет.
Это таблица приоритетов из документации Google; инструмент проверяет её в автотестах. Пустой Disallow: ничего не запрещает. Пути сравниваются в нормализованном виде: кириллица и другие не-ASCII-символы кодируются в UTF-8 с процентами, поэтому /каталог/ и /%D0%BA%D0%B0… — одно и то же. Регистр в путях важен: /Admin/ и /admin/ — разные правила.
robots.txt для Яндекса и Google: в чём разница
Основа у двух поисковиков общая: группы, Allow и Disallow, подстановочные знаки * и $, выбор самого длинного правила. Различаются расширения.
- Clean-param понимает только Яндекс. Директива сообщает, что параметры вроде
utm_sourceилиrefне меняют содержимое страницы, и робот не обходит дубли. Синтаксис:Clean-param: utm_source&utm_medium /catalog/— параметры через&, затем необязательный префикс пути. Google директиву игнорирует; для него дубли склеивают черезrel="canonical". - Host больше не нужен. В 2018 году Яндекс отказался от этой директивы: главное зеркало определяется по 301-редиректу. Google Host никогда не поддерживал.
- Crawl-delay не работает ни там, ни там. Google его не поддерживает, Яндекс перестал учитывать в 2018 году и предлагает настраивать скорость обхода в Яндекс Вебмастере.
- Запасные группы. Все роботы Яндекса читают группу
Yandex, если для конкретного робота (например, YandexImages) нет своей. У Google запасная группа Googlebot для Googlebot-Image, -Video и -News. - Размер. Google обрабатывает первые 500 КиБ файла, всё дальше игнорирует.
- Кириллица. Яндекс в справке просит не писать кириллицу в robots.txt: домены — в Punycode, пути — в URL-кодировке.
Проверить, как файл видит конкретный поисковик, можно в Яндекс Вебмастере («Анализ robots.txt») и в отчёте о robots.txt в Google Search Console. Наш инструмент удобен до публикации: он работает с любым текстом, а не только с файлом на сайте.
Как закрыть сайт от AI-ботов и нужно ли это
AI-компании обходят веб с разными целями, и у крупных игроков для каждой цели свой токен. Решать стоит по назначению, а не «закрыть всех разом».
| Токен | Чей | Зачем ходит |
|---|---|---|
| GPTBot | OpenAI | обучение моделей |
| OAI-SearchBot | OpenAI | поиск в ChatGPT |
| ChatGPT-User | OpenAI | запрос пользователя |
| ClaudeBot | Anthropic | обучение моделей |
| Claude-SearchBot | Anthropic | поисковые ответы |
| Claude-User | Anthropic | запрос пользователя |
| PerplexityBot | Perplexity | поиск и ссылки в ответах |
| Perplexity-User | Perplexity | запрос пользователя |
| Google-Extended | токен: обучение и grounding Gemini | |
| Applebot-Extended | Apple | токен: обучение моделей Apple |
| CCBot | Common Crawl | открытый архив веба |
| meta-externalagent | Meta | обучение и продукты |
| Amazonbot | Amazon | сервисы Amazon и AI |
| Bytespider | ByteDance | сбор данных |
Три группы и три разных решения
- Обучение моделей (GPTBot, ClaudeBot, CCBot и др.). Запрет не даёт использовать новые страницы в будущих обучающих наборах. Трафика эти боты не приводят, поэтому их закрывают чаще всего — особенно платный и авторский контент.
- Поиск и ответы со ссылками (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Эти боты приводят посетителей: сайт цитируется в ответе со ссылкой. Закрыв их, вы уходите из нового канала. Для SaaS и медиа их обычно оставляют открытыми.
- Запросы пользователя (ChatGPT-User, Claude-User, Perplexity-User). Страницу открывают, потому что человек прямо попросил. Это ближе к браузеру, чем к краулеру; некоторые компании прямо пишут, что такие запросы могут не следовать robots.txt.
Google-Extended и Applebot-Extended — не краулеры. Страницы по-прежнему сканирует обычный Googlebot или Applebot, а токен лишь запрещает использовать их для обучения моделей. На позиции в Google Поиске запрет Google-Extended не влияет. Закрыть Googlebot, чтобы уйти из AI-ответов Google, значит уйти и из поиска.
И главное: robots.txt — договорённость, а не защита. Добросовестные компании её соблюдают, но проверить это извне нельзя, а некоторые боты правила игнорируют. Если контент действительно нельзя отдавать, нужны авторизация, ограничения на сервере или в CDN.
Типичные ошибки в robots.txt
- Закрыть CSS и JavaScript. Правила вроде
Disallow: /*.js$илиDisallow: /assets/мешают поисковику отрисовать страницу, и она может выглядеть для него пустой или неудобной на телефоне. - Прятать страницы через robots.txt вместо noindex. Запрет сканирования не убирает адрес из индекса: Google может показать его без описания, если на страницу ведут ссылки. Чтобы страница пропала из поиска, её нужно открыть для сканирования и добавить
<meta name="robots" content="noindex">или заголовокX-Robots-Tag. ДирективаNoindexв самом robots.txt не работает с 2019 года. - Считать robots.txt защитой. Файл публичный. Строка
Disallow: /secret-admin-panel/сообщает путь всем, кто его откроет. Служебные разделы закрывают паролем, а в robots.txt достаточно общего/admin/— или ничего. - Отдельная группа без общих правил. Создали
User-agent: Yandexради Clean-param — и Яндекс перестал видеть запреты из*. - Правило до User-agent. Строки
Disallowв начале файла, до первой группы, игнорируются. - Относительный Sitemap. Нужен полный адрес:
Sitemap: https://site.ru/sitemap.xml. - Забытый
Disallow: /после разработки. Тестовый стенд закрыли целиком, файл уехал в продакшен — сайт выпадает из поиска. Проверяйте robots.txt после каждого релиза. - Один файл на все поддомены. robots.txt действует только для своего хоста и протокола: у
app.site.ruиsite.ru— разные файлы.
Для SaaS типичная схема: маркетинговый сайт открыт, кабинет /app/ закрыт от сканирования и защищён авторизацией, страницы регистрации и входа открыты. Если продукт живёт на отдельном поддомене, у него свой robots.txt.
Источники
- RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
- Google Search Central. How Google interprets the robots.txt specification — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
- Google Search Central. Overview of Google crawlers and fetchers (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
- Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
- Яндекс Вебмастер. Справка: «Использование файла robots.txt», «Директива Clean-param» — yandex.ru/support/webmaster.
- OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
- Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
- Perplexity. Perplexity Crawlers — docs.perplexity.ai.
- Apple. About Applebot — support.apple.com/119829.
- Common Crawl. CCBot — commoncrawl.org/ccbot.
Частые вопросы
Как создать robots.txt онлайн?
Выберите шаблон в генераторе (открытый сайт, служебные разделы, SaaS или интернет-магазин), поправьте пути, укажите Sitemap и при необходимости закройте AI-ботов. Скопируйте результат и сохраните как robots.txt в корне сайта, чтобы файл открывался по адресу https://ваш-домен/robots.txt.
Как проверить, закрыта ли страница в robots.txt?
Откройте вкладку «Проверка URL», вставьте содержимое файла, адрес страницы и выберите робота. Инструмент покажет, разрешён ли адрес, какая группа применилась и какое правило решило исход, а также результат для Googlebot, YandexBot и AI-ботов.
Как закрыть сайт от AI-ботов?
Добавьте группы с их токенами и правилом Disallow: /, например User-agent: GPTBot и User-agent: ClaudeBot. Разделяйте ботов по назначению: боты обучения трафика не дают, а поисковые боты вроде OAI-SearchBot и PerplexityBot приводят посетителей по ссылкам из ответов. Помните, что robots.txt соблюдается добровольно.
Закроет ли Google-Extended сайт от Google?
Нет. Google-Extended — управляющий токен, а не краулер: он запрещает использовать страницы для обучения и grounding моделей Gemini, но не влияет на сканирование Googlebot и на Google Поиск.
Нужны ли в robots.txt директивы Host и Crawl-delay?
Нет. Google их не поддерживает, а Яндекс в 2018 году отказался от Host в пользу 301-редиректа на главное зеркало и перестал учитывать Crawl-delay; скорость обхода настраивается в Яндекс Вебмастере.
Что такое Clean-param и нужен ли он для Google?
Clean-param — директива Яндекса: она сообщает, что указанные GET-параметры (например, utm-метки) не меняют содержимое страницы, и робот не обходит дубли. Google её игнорирует; для него дубли склеивают атрибутом rel="canonical".
Уберёт ли Disallow страницу из поиска?
Не гарантированно. Disallow запрещает сканирование, но Google может проиндексировать адрес без содержимого, если на него ведут ссылки. Чтобы убрать страницу из выдачи, оставьте её доступной для сканирования и добавьте мета-тег robots со значением noindex.
Какое правило главнее: Allow или Disallow?
То, у которого длиннее шаблон пути, независимо от порядка строк. Если длина одинаковая, побеждает Allow. Так работают Google, Яндекс и стандарт RFC 9309.
Ещё в разделе «SEO»
- Проверка сниппета
Как заголовок и описание будут выглядеть в поиске и не обрежутся ли они?
- Генератор Open Graph
Какие теги Open Graph нужны странице и как будет выглядеть превью ссылки?
- Проверка читаемости текста
Насколько текст сложен для чтения и какие предложения слишком длинные?
- Счётчик символов и знаков
Сколько в тексте символов, слов и абзацев — и помещается ли он в title, тему письма или пуш?
- Транслитерация и генератор ЧПУ
Как превратить заголовок на кириллице в чистый адрес страницы?
- Генератор hreflang
Какими тегами hreflang связать языковые версии страницы?
- Генератор UTM-меток
Как собрать единообразные UTM-ссылки для каждой кампании и канала?
- UTM-метки для Яндекс Метрики
Как эта ссылка ляжет в отчёт «Метки UTM» и что в ней ломает склейку источников?
- QR-коды с UTM-метками
Какое место на выставке или какая листовка привели посетителей — и как пометить каждый QR-код?