Clew

ГлавнаяИнструментыSEOГенератор robots.txt

Генератор и проверка robots.txt с AI-ботами

Соберите robots.txt из шаблона, закройте служебные разделы, решите, каким AI-краулерам открывать сайт, и проверьте любой адрес: разрешён ли он Googlebot, YandexBot или GPTBot, какая группа и какое правило сработали.

● Бесплатно, без регистрацииОбновлено:

Шаблон
Шаблон заменяет группы и Clean-param; дальше правьте вручную.

Робот выбирает одну группу — свою или, если её нет, *. Поэтому в группу Yandex или Googlebot нужно повторить общие запреты.

AI-боты: закрыть доступ

Обучение моделей

Поиск и ответы со ссылками

Запросы по команде пользователя

robots.txt — просьба, а не замок. Добросовестные компании правила соблюдают, но часть ботов их игнорирует. Надёжно ограничить доступ можно только на сервере: авторизацией или блокировкой по IP и user-agent.

По строке на правило: параметры через &, затем через пробел необязательный путь. Яндекс перестанет считать адреса с этими параметрами разными страницами. Google директиву игнорирует.
Полные адреса карт сайта, по одному в строке.

—

 

    Crawl-delay и Host не нужны. Google Crawl-delay не поддерживает, Яндекс перестал учитывать его в 2018 году; тогда же Яндекс отказался от Host в пользу 301-редиректа. Поэтому генератор их не добавляет.

    Расчёт идёт в вашем браузере — введённые данные никуда не отправляются.

    Как пользоваться

    1. Выберите шаблон«SaaS» закрывает личный кабинет и API, «Интернет-магазин» — корзину, фильтры и сортировку. Добавьте свои пути и отдельные группы для Яндекса или Google.
    2. Решите вопрос с AI-ботамиБоты разделены по назначению: обучение моделей, поиск с цитированием, запросы пользователя. Можно закрыть обучение и оставить поиск.
    3. Проверьте адресаКнопка «Проверить этот файл» переносит результат во вкладку «Проверка URL». Там видно, какая группа и какое правило решают судьбу адреса для каждого робота.
    4. Опубликуйте файлСкопируйте текст и положите его в корень домена: https://site.ru/robots.txt. У каждого поддомена и протокола свой файл.

    Синтаксис robots.txt: группы, правила и приоритеты

    robots.txt — текстовый файл в корне сайта, который говорит поисковым роботам, какие адреса можно сканировать. С 2022 года правила его чтения закреплены стандартом RFC 9309; Google и Яндекс описывают в справке одни и те же базовые принципы и несколько собственных расширений.

    Файл состоит из групп. Группа начинается с одной или нескольких строк User-agent и продолжается правилами Disallow (запретить) и Allow (разрешить). Строки Sitemap к группам не относятся и могут стоять где угодно.

    User-agent: * # группа для всех роботов Disallow: /app/ # запретить всё, что начинается с /app/ Allow: /app/signup # кроме страницы регистрации User-agent: GPTBot # две строки User-agent — User-agent: CCBot # одна общая группа Disallow: / Sitemap: https://site.ru/sitemap.xml

    Как робот выбирает группу

    Робот ищет группу со своим токеном — без учёта регистра — и подчиняется только ей. Если такой группы нет, берёт группу *; если нет и её, считает, что разрешено всё. Группы с одинаковым токеном объединяются. Отсюда частая ошибка: создать отдельную группу User-agent: Yandex и забыть повторить в ней запреты из *.

    У поисковых систем есть задокументированные «запасные» группы: Googlebot-Image и Googlebot-News используют правила Googlebot, если своих нет, а все роботы Яндекса — группу Yandex.

    Как выбирается правило

    Значение правила сравнивается с началом пути вместе с параметрами. * означает любую последовательность символов, $ в конце — конец адреса. Если подходят несколько правил, побеждает самое длинное; при равной длине — Allow. Порядок строк значения не имеет.

    Allow: /p + Disallow: / → /page разрешено (2 символа длиннее 1) Allow: /folder + Disallow: /folder → /folder/page разрешено (длина равна, Allow главнее) Allow: /page + Disallow: /*.htm → /page.htm запрещено (6 символов длиннее 5) Allow: /$ + Disallow: / → / разрешено; /page.htm — запрещено

    Это таблица приоритетов из документации Google; инструмент проверяет её в автотестах. Пустой Disallow: ничего не запрещает. Пути сравниваются в нормализованном виде: кириллица и другие не-ASCII-символы кодируются в UTF-8 с процентами, поэтому /каталог/ и /%D0%BA%D0%B0… — одно и то же. Регистр в путях важен: /Admin/ и /admin/ — разные правила.

    robots.txt для Яндекса и Google: в чём разница

    Основа у двух поисковиков общая: группы, Allow и Disallow, подстановочные знаки * и $, выбор самого длинного правила. Различаются расширения.

    • Clean-param понимает только Яндекс. Директива сообщает, что параметры вроде utm_source или ref не меняют содержимое страницы, и робот не обходит дубли. Синтаксис: Clean-param: utm_source&utm_medium /catalog/ — параметры через &, затем необязательный префикс пути. Google директиву игнорирует; для него дубли склеивают через rel="canonical".
    • Host больше не нужен. В 2018 году Яндекс отказался от этой директивы: главное зеркало определяется по 301-редиректу. Google Host никогда не поддерживал.
    • Crawl-delay не работает ни там, ни там. Google его не поддерживает, Яндекс перестал учитывать в 2018 году и предлагает настраивать скорость обхода в Яндекс Вебмастере.
    • Запасные группы. Все роботы Яндекса читают группу Yandex, если для конкретного робота (например, YandexImages) нет своей. У Google запасная группа Googlebot для Googlebot-Image, -Video и -News.
    • Размер. Google обрабатывает первые 500 КиБ файла, всё дальше игнорирует.
    • Кириллица. Яндекс в справке просит не писать кириллицу в robots.txt: домены — в Punycode, пути — в URL-кодировке.

    Проверить, как файл видит конкретный поисковик, можно в Яндекс Вебмастере («Анализ robots.txt») и в отчёте о robots.txt в Google Search Console. Наш инструмент удобен до публикации: он работает с любым текстом, а не только с файлом на сайте.

    Как закрыть сайт от AI-ботов и нужно ли это

    AI-компании обходят веб с разными целями, и у крупных игроков для каждой цели свой токен. Решать стоит по назначению, а не «закрыть всех разом».

    AI-краулеры по назначению
    ТокенЧейЗачем ходит
    GPTBotOpenAIобучение моделей
    OAI-SearchBotOpenAIпоиск в ChatGPT
    ChatGPT-UserOpenAIзапрос пользователя
    ClaudeBotAnthropicобучение моделей
    Claude-SearchBotAnthropicпоисковые ответы
    Claude-UserAnthropicзапрос пользователя
    PerplexityBotPerplexityпоиск и ссылки в ответах
    Perplexity-UserPerplexityзапрос пользователя
    Google-ExtendedGoogleтокен: обучение и grounding Gemini
    Applebot-ExtendedAppleтокен: обучение моделей Apple
    CCBotCommon Crawlоткрытый архив веба
    meta-externalagentMetaобучение и продукты
    AmazonbotAmazonсервисы Amazon и AI
    BytespiderByteDanceсбор данных

    Три группы и три разных решения

    • Обучение моделей (GPTBot, ClaudeBot, CCBot и др.). Запрет не даёт использовать новые страницы в будущих обучающих наборах. Трафика эти боты не приводят, поэтому их закрывают чаще всего — особенно платный и авторский контент.
    • Поиск и ответы со ссылками (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Эти боты приводят посетителей: сайт цитируется в ответе со ссылкой. Закрыв их, вы уходите из нового канала. Для SaaS и медиа их обычно оставляют открытыми.
    • Запросы пользователя (ChatGPT-User, Claude-User, Perplexity-User). Страницу открывают, потому что человек прямо попросил. Это ближе к браузеру, чем к краулеру; некоторые компании прямо пишут, что такие запросы могут не следовать robots.txt.

    Google-Extended и Applebot-Extended — не краулеры. Страницы по-прежнему сканирует обычный Googlebot или Applebot, а токен лишь запрещает использовать их для обучения моделей. На позиции в Google Поиске запрет Google-Extended не влияет. Закрыть Googlebot, чтобы уйти из AI-ответов Google, значит уйти и из поиска.

    И главное: robots.txt — договорённость, а не защита. Добросовестные компании её соблюдают, но проверить это извне нельзя, а некоторые боты правила игнорируют. Если контент действительно нельзя отдавать, нужны авторизация, ограничения на сервере или в CDN.

    Типичные ошибки в robots.txt

    • Закрыть CSS и JavaScript. Правила вроде Disallow: /*.js$ или Disallow: /assets/ мешают поисковику отрисовать страницу, и она может выглядеть для него пустой или неудобной на телефоне.
    • Прятать страницы через robots.txt вместо noindex. Запрет сканирования не убирает адрес из индекса: Google может показать его без описания, если на страницу ведут ссылки. Чтобы страница пропала из поиска, её нужно открыть для сканирования и добавить <meta name="robots" content="noindex"> или заголовок X-Robots-Tag. Директива Noindex в самом robots.txt не работает с 2019 года.
    • Считать robots.txt защитой. Файл публичный. Строка Disallow: /secret-admin-panel/ сообщает путь всем, кто его откроет. Служебные разделы закрывают паролем, а в robots.txt достаточно общего /admin/ — или ничего.
    • Отдельная группа без общих правил. Создали User-agent: Yandex ради Clean-param — и Яндекс перестал видеть запреты из *.
    • Правило до User-agent. Строки Disallow в начале файла, до первой группы, игнорируются.
    • Относительный Sitemap. Нужен полный адрес: Sitemap: https://site.ru/sitemap.xml.
    • Забытый Disallow: / после разработки. Тестовый стенд закрыли целиком, файл уехал в продакшен — сайт выпадает из поиска. Проверяйте robots.txt после каждого релиза.
    • Один файл на все поддомены. robots.txt действует только для своего хоста и протокола: у app.site.ru и site.ru — разные файлы.

    Для SaaS типичная схема: маркетинговый сайт открыт, кабинет /app/ закрыт от сканирования и защищён авторизацией, страницы регистрации и входа открыты. Если продукт живёт на отдельном поддомене, у него свой robots.txt.

    Источники

    1. RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
    2. Google Search Central. How Google interprets the robots.txt specification — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
    3. Google Search Central. Overview of Google crawlers and fetchers (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
    4. Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
    5. Яндекс Вебмастер. Справка: «Использование файла robots.txt», «Директива Clean-param» — yandex.ru/support/webmaster.
    6. OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
    7. Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
    8. Perplexity. Perplexity Crawlers — docs.perplexity.ai.
    9. Apple. About Applebot — support.apple.com/119829.
    10. Common Crawl. CCBot — commoncrawl.org/ccbot.

    Частые вопросы

    Как создать robots.txt онлайн?

    Выберите шаблон в генераторе (открытый сайт, служебные разделы, SaaS или интернет-магазин), поправьте пути, укажите Sitemap и при необходимости закройте AI-ботов. Скопируйте результат и сохраните как robots.txt в корне сайта, чтобы файл открывался по адресу https://ваш-домен/robots.txt.

    Как проверить, закрыта ли страница в robots.txt?

    Откройте вкладку «Проверка URL», вставьте содержимое файла, адрес страницы и выберите робота. Инструмент покажет, разрешён ли адрес, какая группа применилась и какое правило решило исход, а также результат для Googlebot, YandexBot и AI-ботов.

    Как закрыть сайт от AI-ботов?

    Добавьте группы с их токенами и правилом Disallow: /, например User-agent: GPTBot и User-agent: ClaudeBot. Разделяйте ботов по назначению: боты обучения трафика не дают, а поисковые боты вроде OAI-SearchBot и PerplexityBot приводят посетителей по ссылкам из ответов. Помните, что robots.txt соблюдается добровольно.

    Закроет ли Google-Extended сайт от Google?

    Нет. Google-Extended — управляющий токен, а не краулер: он запрещает использовать страницы для обучения и grounding моделей Gemini, но не влияет на сканирование Googlebot и на Google Поиск.

    Нужны ли в robots.txt директивы Host и Crawl-delay?

    Нет. Google их не поддерживает, а Яндекс в 2018 году отказался от Host в пользу 301-редиректа на главное зеркало и перестал учитывать Crawl-delay; скорость обхода настраивается в Яндекс Вебмастере.

    Что такое Clean-param и нужен ли он для Google?

    Clean-param — директива Яндекса: она сообщает, что указанные GET-параметры (например, utm-метки) не меняют содержимое страницы, и робот не обходит дубли. Google её игнорирует; для него дубли склеивают атрибутом rel="canonical".

    Уберёт ли Disallow страницу из поиска?

    Не гарантированно. Disallow запрещает сканирование, но Google может проиндексировать адрес без содержимого, если на него ведут ссылки. Чтобы убрать страницу из выдачи, оставьте её доступной для сканирования и добавьте мета-тег robots со значением noindex.

    Какое правило главнее: Allow или Disallow?

    То, у которого длиннее шаблон пути, независимо от порядка строк. Если длина одинаковая, побеждает Allow. Так работают Google, Яндекс и стандарт RFC 9309.

    Ещё в разделе «SEO»

    Открыть подборку →

    Подсказки, туры и чеклисты, эффект которых видно в цифрах.

    Попробовать Clew бесплатноКак это работаетFree — бесплатно навсегда · Pro и Business — 14 дней без карты

    Туры, попапы и онбординг в эпоху ИИ

    7 паттернов с числом шагов, правилами текста и метриками, что меняет ИИ, чек-лист перед публикацией. PDF, 2 страницы. Что внутри гайда →