AI-краулеры: как открыть сайт для GPTBot, ClaudeBot и PerplexityBot
Полный гайд по AI-краулерам: кто такие GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot и Google-Extended, как проверить доступ сайта, какие правила написать в robots.txt, кому блокировать ботов выгодно, а кого это лишает видимости в нейросетях.
Автор - Дмитрий Руднев, редакция про-рейтинг.рф. Обновлено 29 сентября 2026. Все цифры в статье ведут к первоисточникам.
- AI-краулеры делятся на два типа по назначению: боты обучения (GPTBot, ClaudeBot) собирают контент для моделей, боты ответов (OAI-SearchBot, Claude-SearchBot, PerplexityBot) - для поисковых ответов в реальном времени.
- OpenAI разделяет GPTBot (обучение), OAI-SearchBot (поиск ChatGPT) и ChatGPT-User (живые запросы пользователей) - их можно управлять независимо в robots.txt.
- Anthropic документирует трио ClaudeBot / Claude-User / Claude-SearchBot - аналогично разделяя обучение, живые запросы и индексацию для поиска.
AI-краулеры - это роботы нейросетевых компаний, которые сканируют интернет для двух задач: обучать модели и собирать контент для ответов. Если ваш сайт им недоступен, вы не существуете для ChatGPT, Claude и Perplexity: ни контент, ни бренд не попадут в ответы, сколько бы контента вы ни создали. Управляется доступ тремя способами: robots.txt, правила файрвола и явные разрешения - и чаще всего сайт теряет видимость в ИИ не из-за отсутствия оптимизации, а из-за случайно закрытых ботов.
Это первая статья категории «Техника и внедрение»: разбираем каталог AI-краулеров с их назначениями, диагностику доступности сайта, правильные правила robots.txt с готовыми примерами, решения для разных типов сайтов и подводные камни - от ботов-невидимок до различия «обучение против поиска». Гайд завершается чек-листом из десяти шагов, по которому сайт открывается для нейросетей за один рабочий день.
Разбор построен по логике «каталог - диагностика - решение - защита»: сначала кто такие боты и чем они отличаются друг от друга (таблица из десяти роботов), затем три шага проверки доступности вашего сайта, затем сценарии robots.txt под разные бизнес-модели и таблица решений по уровню доступа. Отдельные разделы - про скрытые настройки, которые блокируют ботов без ведома владельца, и про ботов-нарушителей, для которых robots.txt не аргумент.
AI-краулеры делятся на два типа по назначению: боты обучения (GPTBot, ClaudeBot) собирают контент для моделей, боты ответов (OAI-SearchBot, Claude-SearchBot, PerplexityBot) - для поисковых ответов в реальном времени.
OpenAI разделяет GPTBot (обучение), OAI-SearchBot (поиск ChatGPT) и ChatGPT-User (живые запросы пользователей) - их можно управлять независимо в robots.txt.
Anthropic документирует трио ClaudeBot / Claude-User / Claude-SearchBot - аналогично разделяя обучение, живые запросы и индексацию для поиска.
За 2025 год трафик AI-ботов составил в среднем 4,2% всех HTML-запросов по данным Cloudflare Radar, а суммарно боты - около 57% трафика веб-страниц.
GPTBot - самый блокируемый бот: Cloudflare фиксировала 312 доменов с запретами из десяти тысяч проверенных.
К сентябрю 2023 года 26% топ-100 сайтов мира блокировали GPTBot; к концу 2023 года - 48% ведущих новостных сайтов десяти стран блокировали краулеры OpenAI.
Крупные издатели, заблокировавшие AI-ботов, потеряли около 23% общего трафика - решение «закрыть всех» имеет измеримую цену.
Google-Extended управляет использованием контента для grounding - когда Gemini и AI Overviews подтягивают данные из поиска Google.
PerplexityBot документирован как бот поиска, не обучения; в 2025 году Cloudflare обвинила Perplexity в использовании недекларированных «stealth»-краулеров в обход запретов.
Открыть сайт для AI-краулеров можно за один рабочий день: диагностика - правила robots.txt - проверка - мониторинг логов.
Технический слой - единственная зона AEO с полностью контролируемым результатом: он не зависит от конкурентов, алгоритмов и размеров бюджета - только от часовой ревизии и полчаса правок.
AI-боты генерируют в среднем 4,2% всех HTML-запросов
Cloudflare Radar за 2025 год: трафик AI-ботов держался в среднем на 4,2% HTML-запросов с заметными колебаниями по месяцам. Пять лет назад таких ботов не существовало вообще.
Боты - около 57% трафика веб-страниц
По данным Cloudflare Radar, на ботов приходится около 57% трафика страниц, с пиками до 62%. Роботы давно не исключение, а большинство посетителей сайтов - и AI-краулеры растут внутри этой цифры быстрее всего.
GPTBot - самый блокируемый бот интернета: 312 доменов запретов
Cloudflare проанализировала 10 000 доменов: GPTBot оказался наиболее часто запрещенным ботом - 312 доменов с запретами (250 полных, 62 частичных), впереди CCBot и Google-Extended.
26% топ-100 сайтов мира блокировали GPTBot уже к сентябрю 2023 года
Мониторинг Originality.ai: за месяц после появления GPTBot число блокировок в топ-100 выросло на 250% - от 6% до 26%. Крупные сайты реагировали мгновенно.
48% ведущих новостных сайтов десяти стран блокировали краулеры OpenAI к концу 2023 года
Reuters Institute: почти половина самых цитируемых новостных сайтов в десяти странах закрыла доступ ботам OpenAI - крупнейшая согласованная блокировка в истории robots.txt.
79% топ-новостных сайтов блокируют AI-ботов обучения в 2025 году
Свежее исследование издательского сегмента: три четверти топ-изданий закрыты для тренировочных ботов; реже всех блокируется Google-Extended - издатели боятся потерять видимость в Google-ответах.
Крупные издатели, заблокировавшие AI-ботов, потеряли 23% трафика
Наблюдение по крупным издательским домам: после блокировок общий трафик упал примерно на четверть - отчасти из-за исчезновения из экосистемы ответов, отчасти из-за сопутствующих факторов. Цена полной блокировки измерима.
OpenAI документирует трех независимых ботов: GPTBot, OAI-SearchBot, ChatGPT-User
Официальная документация: GPTBot отвечает за сбор данных для обучения, OAI-SearchBot - за индексацию для поиска ChatGPT, ChatGPT-User - за открытие страниц по живым запросам. Все три управляются отдельно в robots.txt.
В документации OpenAI появился OAI-AdsBot - бот для рекламы в ChatGPT
Список ботов OpenAI пополнился рекламным: OAI-AdsBot собирает данные для показа рекламы в ответах ChatGPT. Экосистема управления доступом продолжает усложняться.
Anthropic разделила ботов Claude на три роли: ClaudeBot, Claude-User, Claude-SearchBot
Обновление документации Anthropic: обучение (ClaudeBot), живые запросы (Claude-User) и индексация для поиска (Claude-SearchBot) - теперь три независимых user agent с раздельным управлением в robots.txt.
PerplexityBot документирован как бот поиска, а не обучения
Официальные документы Perplexity: PerplexityBot «предназначен для показа и связывания сайтов в результатах поиска Perplexity» и не используется для обучения базовых моделей. Блокировка влияет на видимость в поиске Perplexity, но не на обучение.
Cloudflare обвинила Perplexity в stealth-краулерах в обход запретов
Расследование Cloudflare (июль 2025): Perplexity, по выводам компании, использовала недекларированных ботов с подменой user agent и сменой ASN, обходя robots.txt и WAF-правила. Показательно: не все боты играют по правилам - нужен мониторинг.
AI-краулеры делятся на два типа с разной механикой обхода
Технический разбор Habr: одна группа ботов строит индекс для ранжирования и приходит регулярно, другая открывает страницы по запросам. Для владельца сайта это разные сценарии нагрузки и разная ценность присутствия.
Google-Extended - отдельный токен для управления grounding
Документация Google: доступ к контенту для grounding - когда Gemini и AI Overviews подтягивают данные из поиска - управляется токеном Google-Extended в robots.txt. Он не влияет на индексацию для обычного поиска.
Полноценно настроенный доступ AI-краулеров есть у меньшинства подрядчиков
Оценка рынка редакции AEO RANK™: большинство агентств, продающих AEO/GEO, на собственных сайтах не имеют явных разрешений для ботов - проверка подрядчика начинается с его собственного robots.txt.
Проверка занимает минуты: user agent - robots.txt - логи
Минимальная диагностика доступности не требует разработчика: три шага - просмотр robots.txt, проверка ответов сервера для user agent ботов, анализ логов за месяц. Развернутая последовательность - в разделе 3 этой статьи.
Что такое AI-краулеры и чем они отличаются от поисковых роботов
Классический поисковый робот - Googlebot или YandexBot - делает одну работу: строит индекс для ранжирования. Он приходит регулярно, кэширует страницы, оценивает ссылки - и его работа видна в поиске, которым пользуются миллиарды людей. AI-краулеры выросли из этой же технологии, но у них другой работодатель и другие цели: им нужен не индекс ссылок, а контент для моделей и для ответов.
По назначению AI-боты делятся на две группы, и это главное различие, которое нужно понимать владельцу сайта. Боты обучения - GPTBot у OpenAI, ClaudeBot у Anthropic - собирают тексты, на которых обучаются и дообучаются модели. Их работа влияет на «врожденные» знания модели: что она отвечает, даже когда не ищет в интернете. Боты ответов и поиска - OAI-SearchBot, Claude-SearchBot, PerplexityBot - строят индекс для поисковых ответов в реальном времени: их работа определяет, какой сайт модель процитирует пользователю сегодня. Отдельно ходят пользовательские боты - ChatGPT-User, Claude-User: они открывают страницы по запросу конкретного человека прямо в моменте.
Почему различие принципиально: у групп разные правила игры и разные последствия блокировки. Боты обучения закрывают медиа и крупные контентные бизнесы, защищающие инвестиции в контент. Боты ответов закрывают редко - это прямое исчезновение из поиска будущего. Пользовательские боты закрывать почти никогда не нужно: они ходят под живого клиента, и блокировка выглядит как отказ в обслуживании.
Вторая особенность AI-краулеров - они агрессивнее поисковых. Нагрузка на слабые хостинги от ботов обучения достигает десятков тысяч запросов в день, и владельцы дешевого хостинга нередко блокируют их, просто чтобы сайт не лежал. Это решение понятно, но решать его нужно настройками лимитов, а не полным запретом: под запретом скрывается и будущая видимость.
Отсюда же - правило приоритетов для владельца с ограниченным бюджетом: доступ ботов дешевле всех остальных работ и влияет на все остальные. Контент, написанный «под ответы», разметка, граф сущностей, упоминания - всё это работает только при открытых ботах; на закрытом сайте любая из этих работ - оплата стрельбы из незаряженного ружья. Поэтому в любой методике AEO технический слой стоит первым: не потому, что он самый важный в абстрактном смысле, а потому, что он - условие для всего остального. Один рабочий день технической настройки меняет картину сильнее, чем месяц контентных работ на закрытом сайте.
Отдельного пояснения заслуживает временной масштаб двух групп. Боты обучения влияют на модель «с отсрочкой»: собранные сегодня тексты отразятся в поведении модели лишь после очередного цикла дообучения - недели и месяцы. Боты ответов работают «сегодня»: исключили сайт из их индекса - и уже на этой неделе Perplexity не может вас процитировать. Для владельца это означает разную логику решений: правки доступа к ботам ответов - операционная задача с немедленным эффектом, а решения об обучении - стратегическая ставка на то, как модель будет «врожденно» знать ваш контент через год. Уровень доступа из таблицы ниже стоит выбирать именно с этой развилки - сначала операционная видимость, потом стратегическое обучение.
Каталог AI-краулеров: кто есть кто
Собираем действующих игроков в таблицу. Список меняется - новые боты появляются ежеквартально, - но ядро стабильно.
| Бот | Владелец | Назначение | Что дает доступ | Что отключает блокировка |
|---|---|---|---|---|
| GPTBot | OpenAI | Сбор данных для обучения моделей | «Знания» моделей о вашем контенте | Обучение - поиск ChatGPT продолжает работать |
| OAI-SearchBot | OpenAI | Индексация для поиска в ChatGPT | Цитирование в ответах ChatGPT со ссылками | Появление в поисковых ответах ChatGPT |
| ChatGPT-User | OpenAI | Открытие страниц по запросам пользователей | Ответы на основе вашего сайта по живому запросу | Доступ пользователей ChatGPT к сайту |
| ClaudeBot | Anthropic | Обучение моделей Claude | Знания моделей о вашем контенте | Обучение |
| Claude-User | Anthropic | Живые запросы пользователей | Работа Claude с вашим сайтом по запросу | Доступ пользователей |
| Claude-SearchBot | Anthropic | Индексация для поиска | Цитирование в поисковых ответах | Видимость в поиске Claude |
| PerplexityBot | Perplexity | Поисковый индекс Perplexity | Ответы и ссылки в Perplexity | Видимость в Perplexity |
| Google-Extended | Grounding для Gemini и AI Overviews | Использование контента в AI-ответах Google | Попадание в AI Overviews (поиск не страдает) | |
| Applebot-Extended | Apple | Обучение и ответы Apple Intelligence | Присутствие в экосистеме Apple | Работа с контентом в Siri/Apple Intelligence |
| YandexBot | Яндекс | Классический поиск + нейроответы | Индексация для «Ответов» и Алисы | Видимость в поиске Яндекса |
Три примечания к каталогу. Первое: списки ботов у каждой компании обновляются - например, у OpenAI появились и рекламные боты, и новые роли; раз в квартал сверяйтесь с официальной документацией. Второе: YandexBot - поисковый робот, но для российской дисциплины он критичен: без него нет ни классической выдачи, ни нейроответов Яндекса. Третье: CCBot (Common Crawl) - не AI-бот, а общий корпус данных, из которого берут данные многие модели; блокировка CCBot закрывает путь в целый слой баз данных.
Планируя ревизию, стоит понимать и цену бездействия, и цену ошибки в каждой из трех колонок этой развилки. Бездействие стоит дешевле всего в деньгах - и дороже всего в последствиях: сайт продолжает молча выпадать из ответов, пока конкурент по нише не займет освободившееся место. Ошибка «открыть всё подряд» стоит небольшой приватный риск: контент пойдет и на обучение, и на индексацию, и на пользовательские сессии - для большинства бизнесов это приемлемая плата. Ошибка «закрыть всё подряд» стоит дороже всего: месяцами невидимости и восстановлением, которое после снятия запрета происходит не мгновенно - ботам нужно время вернуться, переиндексировать и «поверить» сайту снова. Иерархия цены решений однозначная: бездействие - скрытая, «открыть всё» - дешевая, «закрыть всё» - самая дорогая. Это и есть ось, по которой стоит принимать решение, пока вы дочитываете разделы ниже.
Диагностика: открыт ли ваш сайт
Перед любыми правками - ревизия. Три шага, которые занимают меньше часа даже у неспециалиста.
Шаг 1. Посмотрите robots.txt. Откройте в браузере адрес вашдомен.рф/robots.txt. Ищите строки User-agent с именами ботов: GPTBot, ClaudeBot, PerplexityBot, CCBot, Google-Extended. Ключевое слово - Disallow: с адресом «/» - полный запрет для этого бота. Если бот не упомянут вообще, на него распространяются правила группы User-agent: * (разрешено всё, если нет запретов).
Шаг 2. Проверьте ответ сервера для ботов. Часть сайтов запрещает ботов не в robots.txt, а на уровне сервера: код ответа 403 для неизвестных user agent, анти-бот фильтры, WAF-правила. Проверка делается инструментом вроде curl с подстановкой user agent бота - или специализированными сервисами, которые показывают, как боты видят сайт. Сервер может вернуть 200, а может - капчу, 403 или 429: всё, кроме 200, для бота означает «дорога закрыта».
Шаг 3. Посмотрите логи за месяц. В логах сервера (access.log) найдите строки с user agent ботов. Кто реально приходит, с какой частотой, на какие страницы - это картина фактического доступа. Если боты в логах отсутствуют полностью, а в robots.txt их нет - они блокируются на уровне хостинга или файрвола: разберитесь с настройками до любых контентных работ.
Результат диагностики укладывается в три диагноза: «открыт полностью» (боты приходят, запретов нет), «закрыт частично» (часть ботов запрещена в robots.txt или сервером), «закрыт полностью» (никто не приходит). Каждому диагнозу - свое лечение из следующего раздела.
Чем проверить, если логов под рукой нет: специализированные сервисы проверки ботов показывают, как ваш сервер отвечает на запросы с user agent конкретного краулера, - по сути автоматизируют шаги 1-2. Полезно также проверить сайт глазами модели: попросите ChatGPT или Perplexity процитировать конкретную страницу вашего сайта со ссылкой. Если модель отвечает «не могу открыть» - путь закрыт; если цитирует - доступ работает. Это, конечно, не замер, а быстрый дым-тест, но он бесплатен и доступен каждому владельцу прямо сейчас.
Небольшая ремарка к шагу 2 для владельцев на популярных CMS: в WordPress, Bitrix и Tilda доступ ботов дополнительно фильтруют плагины безопасности и встроенные антиботы - их логи живут отдельно от серверных. Если сервер отвечает 200, а модель сайт всё равно не цитирует, - просмотрите настройки плагинов: правило «блок-бота» может сидеть там, куда владельцы заглядывают реже всего. И помните: после каждой правки проверяйте файл валидатором - опечатка в имени бота делает правило мёртвым, а иллюзия защиты или разрешения держится ровно до первого реального теста.
Правила robots.txt: готовые примеры
Синтаксис robots.txt прост: файл в корне сайта, группы правил по типам ботов. Ниже - три готовых сценария под разные решения.
Сценарий А: открыть всё (для сайтов услуг, e-commerce, экспертных компаний).
User-agent: *
Allow: /
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
Sitemap: https://вашдомен.рф/sitemap.xml
Сценарий Б: поиск разрешен, обучение запрещено (для контентных и медиа-бизнесов).
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Sitemap: https://вашдомен.рф/sitemap.xml
Сценарий В: полный запрет (для закрытых систем и приватных данных).
User-agent: *
Disallow: /
Два технических предупреждения к сценариям. Первое: robots.txt - это просьба, а не замок. Добросовестные боты выполняют правила, нарушители - нет: полная защита достигается только на уровне файрвола. Второе: после правки проверьте, что Googlebot и YandexBot не затронуты - опечатка в блоке бота легко превращается в катастрофу всей поисковой видимости. Инструменты проверки robots.txt есть в консолях вебмастеров обоих поисковиков.
К файлу robots.txt стоит добавить и llms.txt - файл-указатель для языковых моделей с ключевыми разделами и фактами о компании. Полный разбор формата с шаблоном - в статье llms.txt: зачем нужен файл для нейросетей.
Частые ошибки синтаксиса, которые встречаются даже в продакшене: запрет без имени группы (Disallow вне User-agent - правило игнорируется), опечатки в имени бота (GPTbot вместо GPTBot - другой токен), правила в кодировке с BOM, конфликтующие группы для одного бота (обе группы читаются, применяется самая длинная). Все четыре ошибки диагностируются за минуты любым онлайн-валидатором robots.txt - прогоняйте файл через проверку после каждой правки, а не только «когда-нибудь».
Три уровня доступа: таблица решений
«Открыть или закрыть» - ложный вопрос: решений три, и у каждого свой хозяин. Сводим в таблицу.
| Уровень | Что открываем | Кому подходит | Цена решения |
|---|---|---|---|
| Полный доступ | Обучение + поиск + пользовательские боты | Услуги, e-commerce, B2B, экспертные компании, новые бренды | Контент используется для обучения - плата за максимум видимости |
| Доступ только к поиску | OAI-SearchBot, Claude-SearchBot, PerplexityBot, пользовательские боты; обучение закрыто | Медиа, контентные проекты, издатели, консультанты с уникальными методиками | Видимость в ответах сохраняется, обучение - нет |
| Полный запрет | Ничего не открываем | Закрытые B2B-системы, приватные данные, платные базы знаний | Отсутствие в AI-ответах полностью - осознанный выбор |
На что смотреть при выборе уровня. Первое - что вы продаете: если деньги приносят услуги или товары, а контент лишь поддерживает продажи, открытый доступ почти всегда выгоднее. Если деньги - сам контент (подписки, платные материалы, уникальные методики), частичный или полный запрет может быть экономически рационален. Второе - размер бренда: новым брендам обучение важно больше, чем крупным, - модели должны узнать о вас хоть откуда-то. Третье - юрисдикция аудитории: для российского бизнеса критичны Яндекс (поиск + нейроответы) и GigaChat, для международного - вся тройка OpenAI/Anthropic/Google.
Показательная статистика против бессистемной блокировки: крупные издатели, закрывшие AI-ботов, потеряли около 23% общего трафика - часть решений пользователей ушла в экосистему ответов, откуда их уже не вернешь классическим SEO. Блокировка - легитимный инструмент, но инструмент с ценником, и платить нужно осознанно.
Отдельная линия в этой таблице - российский контекст. Для бизнеса внутри страны ключевые роботы - YandexBot (поиск + нейроответы с Алисой) и боты, через которые контент добирается до GigaChat. Закрывать их - значит вычеркивать сайт из самого массового поискового сценария страны; открывать - стандартная практика. Для компаний с международной аудиторией карта шире: вся тройка OpenAI/Anthropic/Google плюс Apple-экосистема. Двойная аудитория - двойной список разрешений; в этом случае полезно завести в протоколе сайта два столбца - «РФ-боты» и «мировые боты» - и ревизовать их раздельно: обновления идут в разных ритмах.
До и после: типичные ошибки настройки
| Область | До: типичная ошибка | После: рабочая настройка |
|---|---|---|
| robots.txt | Копия шаблона 2019 года с запретами «для всех известных ботов» | Явные группы правил для AI-ботов, сценарий под бизнес-модель |
| Файрвол/WAF | Правило «блокировать все неизвестные user agent» | Белый список ботов + лимиты частоты для остальных |
| Хостинг | Дешевый тариф, бот-нагрузка валит сайт, владелец блокирует всё | Лимиты crawl-rate или кеширование вместо запрета |
| Диагностика | «Кажется, мы закрыты, но не проверяли» | Ревизия robots.txt + логов раз в квартал |
| Мониторинг | Бот-трафик в статистике - «паразитный» | Отдельный сегмент: какой бот, какие страницы, какой ответ |
| Ответственность | «За robots.txt отвечает программист когда-нибудь» | Владелец настроек указан в договоре с подрядчиком |
Самая дорогая строка таблицы - первая. Мы видели сайты, которые годами носили запрет «User-agent: * / Disallow: /» внутри подкаталогов, унаследованный от старой CMS, и не подозревали об этом: для нейросетей этот контент не существовал, хотя SEO-показатели были приличными. Ревизия - полчаса работы; экономия на ней - месяцыinvisible-ности.
Один штрих к таблице: правки robots.txt и файрвола стоит вносить в тот же календарь, что и контентные работы. Технический слой живёт своей жизнью: хостинг обновляет правила безопасности, CDN меняет дефолты, разработчик переносит сайт на новый сервер - и «внезапно» пропавшая видимость в ответах оказывается «внезапной» только для тех, кто не вёл календарь инфраструктурных изменений. Пара строк в журнале правок экономят неделю диагностики по горячим следам.
Отдельного решения заслуживает и «серая зона» - сервисы ИИ-резюме и бот-пауки агрегаторов, которые не входят в официальные каталоги, но сканируют контент. Практичный подход: вести в протоколе сайта три списка - «разрешено явно», «разрешено по умолчанию», «запрещено» - и при появлении нового бота решать по назначению: если это бот ответов растущего поисковика, разрешение обычно выгоднее запрета, если неизвестный скрапер - лимит частоты. Раз в квартал эту зону стоит пересматривать: пейзаж ботов меняется быстрее, чем любые регламенты.
Подводные камни: то, о чем не пишут в документации
Идеальная картинка «написал robots.txt - и все честно выполняют» не всегда соответствует реальности. Четыре камня на пути.
Камень первый: stealth-краулеры. Cloudflare расследовала случай, когда Perplexity, по выводам компании, обходила запреты недекларированными ботами с подменой user agent и сменой сетей. Нарушения фиксируются и у других игроков. Вывод для владельца: robots.txt управляет добросовестными ботами; для остальных нужен WAF, мониторинг логов и знание официальных IP-диапазонов ботов, которые публикуют сами компании.
Камень второй: старые унаследованные правила. Часть запретов появляется не из решений, а из истории: шаблон хостинга, правила безопасности пятилетней давности, советы «закрой всё от ботов» в старых гайдах. Аудит robots.txt и файрвола - это археология, и её стоит делать до любых работ по продвижению.
Камень третий: CDN и защита от DDoS. Сервисы защиты трафика по умолчанию фильтруют «подозрительных» роботов, и AI-краулеры попадают под раздачу вместе с вредоносными. В настройках Cloudflare, WAF у хостинга и анти-DDoS провайдера ботов нужно вносить в белый список - иначе robots.txt будет разрешать то, что сервер запрещает.
Камень четвертый: нагрузка и лимиты. Активные боты обучения создают ощутимую нагрузку: для слабых хостингов - риск падения. Решения: настройки crawl-rate у поддерживающих их сервисов, кеширование страниц, переход на тариф с запасом - но не тотальный запрет: он закрывает и видимость.
Развернутая карта «готов ли сайт к AI-поиску» - с пунктами про индексацию, скорость и разметку - в статье чек-лист готовности сайта к AI-поиску.
Последовательность открытия сайта: десять шагов
Сводим гайд в последовательность действий - от ревизии до мониторинга.
- Проведите ревизию текущего robots.txt: какие боты упомянуты, какие запрещены, что унаследовано от старых настроек.
- Проверьте ответы сервера для основных AI-ботов: коды 200/403/429 по каждому user agent.
- Изучите логи за последний месяц: кто реально приходит, с какой частотой, какие страницы запрашивает.
- Определите уровень доступа под свою бизнес-модель: полный, только поиск, полный запрет (таблица раздела 5).
- Внесите правила в robots.txt по выбранному сценарию - с явными группами для каждого бота.
- Проверьте, что Googlebot и YandexBot не затронуты: тест robots.txt в консолях вебмастеров.
- Настройте белый список ботов в файрволе, WAF и защите от DDoS - чтобы сервер не спорил с robots.txt.
- Добавьте llms.txt - файл-указатель с ключевыми разделами сайта для языковых моделей.
- Настройте мониторинг: сегмент бот-трафика в аналитике, алерт на коды 403 для ботов, ежемесячный осмотр логов.
- Зафиксируйте ответственного за robots.txt и правила пересмотра - раз в квартал, с учетом новых ботов.
Пункты 8-9 требуют больше контекста - их разбор в статьях про llms.txt и про чек-лист готовности сайта. Пункт 2 стоит дополнить проверкой разметки: доступность без разметки - это «машина видит, но не понимает»; разбор - в статье про микроразметку Schema.org для AEO.
Правило финальной проверки перед публикацией правил: после правок robots.txt прогоните дым-тест из раздела 3 - запросите пару ключевых страниц вашего сайта у ChatGPT и Perplexity с просьбой процитировать источник. Если модель называет сайт и дает ссылку - доступ работает; если нет - вернитесь к шагам диагностики, не теряя дней на контентные работы, которые на закрытом сайте не видны никому. Час технической проверки в начале экономит месяцы невидимости в середине.
Два дополнения к последовательности - про то, что обычно забывают. Первое: после переноса сайта на новую платформу или смены хостинга проверьте robots.txt заново - миграции чаще всего «теряют» кастомные правила, и сайт возвращается к дефолтным настройкам, в которых AI-боты не упомянуты вовсе. Второе: если на сайте есть закрытые зоны (личные кабинеты, платные материалы, документы с NDA), убедитесь, что правила доступа заданы по каталогам и путям, а не полным запретом: частая ошибка - закрыть весь домен ради защиты одного раздела, потеряв видимость остальных сотен страниц. Точечный запрет работает лучше тотального всегда - и в robots.txt, и в файрволе.
Красные флаги: когда подрядчик не понимает краулеров
Технический слой - отличное место для проверки квалификации подрядчика. Четыре формулировки, которые выдают слабое понимание.
- «Откроем сайт всем ботам разом, это же просто». «Все боты» - это и вредоносные скраперы, и конкуренты-парсеры. Профессионал различает типы и настраивает сценарий под бизнес-модель, а не «всё разрешить».
- «Robots.txt - это защита от копирования». Нет: это инструкция для добросовестных ботов. Защита контента - WAF, авторские права, лицензии. Путаница этих понятий - признак дилетанта.
- «Заблокируем GPTBot - и видимость в ChatGPT сохранится, они же не связаны». Связь есть на уровне данных: меньше источников обучения - слабее «врожденное» знание модели о бренде. Точную механику подрядчик должен объяснить, а не спекулировать.
- «Нужно закрыть Perplexity - они нарушают правила» (как универсальный совет). Нарушения - вопрос факта и вашей толерантности: у кого-то запрет, у кого-то приоритет - видимость в быстро растущем поиске. Универсальных советов тут не бывает.
- «llms.txt заменит robots.txt» (в любом варианте). Эти файлы решают разные задачи: robots.txt - управление доступом, llms.txt - указатель контента для моделей. Продавец, путающий назначение двух файлов, не знает технического слоя, который продает.
Проверочный вопрос подрядчику: «Какие user agent заходили на мой сайт за последний месяц и с какими кодами ответа?» Ответ без цифр означает, что технического слоя у него нет.
И короткий ответ на вопрос «а что, если оставить как есть?» Ничего не произойдет - ровно поэтому это и опасно. Закрытый сайт не получает банов, ошибок и алертов: он просто молча отсутствует в растущем слое ответов, где формируются шорт-листы ваших будущих клиентов. Тишина - единственный симптом технической невидимости; лечится она единственным способом - ревизией из раздела 3 этой статьи.
Выводы
Доступ ботов - фундамент видимости. Закрытый для AI-краулеров сайт не существует для нейросетей: контент не попадет в ответы, бренд не будет назван. Технический слой дешевле любого другого - и должен проверяться первым.
Боты - это не «OpenAI вообще». GPTBot, OAI-SearchBot и ChatGPT-User - три независимых робота с разными задачами; Claude и Perplexity - аналогично. Решение «открыть/закрыть» принимается по типам ботов, а не по компаниям.
Блокировка имеет цену. Отказ от обучения - защитная мера с легитимной логикой; отказ от поисковых ботов - исчезновение из ответов; полная блокировка обошлась крупным издателям в 23% трафика. Цена должна осознаваться до решения, а не после.
robots.txt - не замок. Часть ботов нарушает правила: для них - файрвол, IP-диапазоны, мониторинг логов. А полная картина «открытости» сайта требует ревизии раз в квартал: боты появляются быстрее, чем обновляются шаблоны хостингов. Проверьте, что ваш сайт видят машины - прежде чем платить за любые другие работы по AEO; а если нужен исполнитель, который понимает технический слой, начните с открытых баллов критерия технической доступности в рейтинге AEO RANK™.
И завершающий штрих - для тех, кто дочитал до конца. Технический слой - редкая зона AEO, где результат полностью в ваших руках: не зависит от конкурентов, алгоритмов и размеров бюджета. Час ревизии, полчаса правок, ежеквартальный осмотр - вот вся «магия», за которую агентства иногда просят месячные бюджеты. Сделайте её сами - или убедитесь, что за неё не платите дважды, - и потратьте освободившиеся деньги на работы, где настоящая конкуренция: контент, упоминания, репутация. Гид по этим слоям - в последующих статьях категории «Техника и внедрение».
01Кто такие AI-краулеры?
Это роботы AI-компаний, которые автоматически обходят сайты: GPTBot и ClaudeBot собирают данные для обучения моделей, OAI-SearchBot и PerplexityBot индексируют контент для поиска внутри чатов, ChatGPT-User и Claude-User открывают страницы по запросам живых пользователей. Технически они похожи на поисковых роботов - но обслуживают нейросети.
02Что будет, если заблокировать GPTBot?
Контент сайта не будет использоваться для обучения моделей OpenAI. Это независимая настройка: блокировка GPTBot не мешает OAI-SearchBot индексировать страницы для ChatGPT-поиска, а ChatGPT-User - открывать сайт по запросам пользователей. Нужно разделять типы ботов, а не закрывать «OpenAI вообще».
03Где проверить, открыт ли мой сайт для ботов?
Два уровня. Первый: откройте /robots.txt вашего домена и посмотрите секции User-agent - нет ли запретов для GPTBot, ClaudeBot, PerplexityBot и других. Второй - логи сервера: посмотрите, заходили ли эти user agent за последний месяц. У крупных CMS есть и плагины, показывающие статус.
04Какие правила написать в robots.txt, чтобы открыть сайт нейросетям?
Минимальный вариант: разрешить всё (User-agent: * / Allow: /) и отдельно явно разрешить GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, Claude-SearchBot, PerplexityBot, Google-Extended. Развернутые примеры кода - в разделе 4 этой статьи.
05Нужно ли всем открывать сайт для обучения моделей?
Нет. Блокировать обучение и разрешать поиск - рабочая стратегия для компаний, озабоченных копированием контента: ответы будут ссылаться на сайт, но модели не будут учиться на его текстах. Решение зависит от бизнес-модели: у медиа и контентных бизнесов чаще закрыто, у услуг и e-commerce чаще открыто.
06Влияет ли robots.txt на классическое SEO?
Правила для AI-ботов не влияют на ранжирование в Google и Яндексе - это независимые директивы для независимых роботов. Рисковать поисковым трафиком, открывая сайт нейросетям, не нужно: главное - не заблокировать случайно Googlebot и YandexBot.
07Что делать с ботами, которые игнорируют robots.txt?
Часть ботов и «неизвестных» краулеров нарушает правила - например, расследование Cloudflare зафиксировало stealth-краулеров Perplexity, обходивших запреты через подмену user agent. На уровне robots.txt с ними сделать ничего нельзя - это работа файрвола (WAF-правил) и мониторинга логов.
08Блокируют ли боты нагрузку на сервер и как с ней жить?
Активные боты обучения действительно создают нагрузку - на дешевых тарифах до десятков тысяч запросов в день. Решение - не запрет, а настройка: кеширование страниц, лимиты частоты, переход на тариф с запасом. Запрет решает нагрузку, но закрывает и видимость: это терапия с летальным исходом для дисциплины.
09Что делать, если подрядчик блокирует ботов на моем сайте?
Разбираться письменно: запросить причины (часто это старые настройки «безопасности»), требовать приведения robots.txt и файрвола в соответствие с выбранной стратегией доступа и зафиксировать ответственного за файл в договоре. Молчаливое «исправим потом» в этой зоне стоит месяцев видимости.
10Обязательно ли создавать llms.txt?
Не обязательно - robots.txt достаточен для управления доступом. Но llms.txt помогает моделям быстрее понять структуру сайта: это короткий файл-указатель с ключевыми разделами и фактами. Разбор формата - в отдельной статье про llms.txt.
- OpenAI Developers, «Overview of OpenAI Crawlers»https://developers.openai.com/api/docs/bots
- Search Engine Journal, «OpenAI's Crawler Docs Now List OAI-AdsBot for ChatGPT Ads»https://www.searchenginejournal.com/openais-crawler-docs-now-list-oai-adsbot-for-chatgpt-a…
- Anthropic Support, «Does Anthropic crawl data from the web?»https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-…
- Search Engine Journal, «Anthropic's Claude Bots Make robots.txt Decisions More Granular»https://www.searchenginejournal.com/anthropics-claude-bots-make-robots-txt-decisions-more-…
- Perplexity Docs, «Perplexity Crawlers»https://docs.perplexity.ai/docs/resources/perplexity-crawlers
- Cloudflare, «Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives»https://blog.cloudflare.com/perplexity-is-using-stealth-undeclared-crawlers-to-evade-websi…
- Cloudflare, «The 2025 Cloudflare Radar Year in Review»https://blog.cloudflare.com/radar-2025-year-in-review/
- Cloudflare Radar, «AI Insights»https://radar.cloudflare.com/ai-insights
- Cloudflare Radar, «Bot Traffic Worldwide»https://radar.cloudflare.com/bots
- Cloudflare, «From Googlebot to GPTBot: Who's crawling your site in 2025»https://blog.cloudflare.com/from-googlebot-to-gptbot-whos-crawling-your-site-in-2025/
- Search Engine Land, «26% of the top 100 websites are now blocking GPTBot»https://searchengineland.com/more-popular-websites-blocking-gptbot-432531
- Reuters Institute, «How many news websites block AI crawlers?»https://reutersinstitute.politics.ox.ac.uk/how-many-news-websites-block-ai-crawlers
- BuzzStream, «Which News Sites Block AI Crawlers in 2025?»https://www.buzzstream.com/blog/publishers-block-ai-study/
- Hacks/Hackers, «Major Publishers Lost 23% of Traffic After Blocking AI Bots»https://www.hackshackers.com/major-publishers-lost-23-of-traffic-after-blocking-ai-bots-th…
- Habr, «AI-краулеры в 2026: кого пускать в robots.txt»https://habr.com/ru/articles/1063216/
- Texterra, «Каких AI-ботов пускать на сайт»https://texterra.ru/blog/kakikh-ai-kraulerov-puskat-na-sayt.html
- Google AI Docs, «Grounding with Google Search»https://ai.google.dev/gemini-api/docs/google-search
Материал носит информационный характер и отражает состояние рынка на сентябрь 2026 года. Цифры исследований приведены по указанным первоисточникам.
Q054Что такое AI-краулеры и зачем открывать им доступ?
AI-краулеры - это программы, которыми нейросети читают интернет: GPTBot, ClaudeBot, PerplexityBot и другие. Если сайт их не пускает, он не попадёт в ответы, даже будучи хорошим. Открывать доступ нужно выборочно: служебные разделы, личные кабинеты и тестовые страницы закрываются всегда.
Q055Какие именно боты и как должны быть прописаны в robots.txt?
Минимально: не запрещать поисковые и AI-краулеры на публичных разделах. В файле достаточно общего разрешения и явных директив для ключевых ботов, чтобы случайная правка не закрыла сайт целиком. Проверять нужно после каждого изменения robots.txt, а не раз в год.
Q056Как проверить, читают ли нейросети мой сайт?
Проверка делается в два уровня: технический и поведенческий. Технически - смотрите логи обращений ботов и файл robots.txt; поведенчески - задаёте модели вопросы о своей компании и смотрите, появляются ли ваши формулировки. Первый уровень показывает доступ, второй - реальное использование.
Q057Чем опасна случайная блокировка GPTBot и как её заметить?
Заблокированный бот не мешает сайту работать и не выдаёт ошибок - поэтому блокировка часто остаётся незамеченной месяцами. Заметить её можно по отсутствию визитов в логах и по исчезновению своих формулировок из ответов. Проверять нужно после каждого изменения robots.txt, хостинга или защиты от нагрузки.
llms.txt: зачем нужен файл для нейросетей и как его составить
Что такое llms.txt и llms-full.txt, кто и зачем их придумал, работает ли файл реально и что говорит Google, готовый шаблон для сайта компании и пошаговая инструкция создания - без хайпа и с честным разбором ограничений.
Микроразметка Schema.org для попадания в ответы ИИ: гайд 2026
Какие схемы Schema.org работают для AEO: FAQPage, Organization, Article, Product, Speakable. Формат JSON-LD с готовыми примерами кода, честный разбор того, что разметка может и чего не может, валидаторы и последовательность внедрения.
Чек-лист готовности сайта к AI-поиску: полная проверка по блокам
Чек-лист готовности сайта к AI-поиску: доступ AI-краулеров, серверный рендеринг, sitemap, Schema.org, извлекаемый контент, сущности бренда и замер видимости - 7 блоков с таблицами, приоритетами и красными флагами.