У каждого сайта есть небольшой файл под названием robots.txt. Тридцать лет он был служебной мелочью: вот папки, которые я предпочел бы, чтобы вы не сканировали. Ради удовольствия его никто не читал.
Но незаметно он стал чем-то другим.
Мы открыли robots.txt 49 известных сайтов и проверили, каких AI-crawler каждый из них разворачивает. То, что вернулось, оказалось не техническим паттерном. Это была карта того, кто подписал лицензионную сделку.
Семь крупных издателей блокируют crawler Anthropic и пропускают crawler OpenAI прямо внутрь. У каждого из них есть публично известная контентная сделка с OpenAI.
Этот файл больше не служебная мелочь. Это контракт, опубликованный в корне домена, где его может прочитать любой.
Результаты вкратце
Издатели блокируют AI-компании, с которыми они спорят, и перестают блокировать тех, кто им платит. Кто есть кто, можно увидеть, не читая ни одного пресс-релиза.
При этом большинство списков блокировки скопированы из 2023 года и останавливают не тех crawler.
Кто вообще что-либо блокирует
Сначала простая часть. Из 49 проверенных сайтов 21 блокирует хотя бы один AI-crawler, и то, по какую сторону этой линии вы окажетесь, почти полностью зависит от того, что продает ваш бизнес.
Если ваша выручка приходит от людей, читающих ваши страницы, AI, который отвечает без отправки читателя к вам, является конкурентом. Если ваша выручка приходит от людей, использующих ваш продукт, AI, который читает вашу документацию, является продавцом.
Один и тот же файл, противоположный стимул.
Список, который никто не блокирует последовательно
Теперь посмотрим, что именно блокирует 21 блокирующий сайт, и аккуратная история разваливается.
Common Crawl тихо архивирует веб с 2011 года, задолго до того, как кто-либо начал беспокоиться о чат-ботах. Теперь это самый часто блокируемый crawler в этом списке.
Тем временем OAI-SearchBot — crawler, который питает поисковые результаты ChatGPT, — заблокирован только третью сайтов, которые вообще потрудились что-то заблокировать.
Часть этого объясняется простой устарелостью. Многие такие списки были написаны во время паники вокруг скрейпинга в 2023 году, скопированы из блог-поста и больше никогда не пересматривались. Но устарелость не объясняет следующую часть.
Семь издателей, один заметный пробел
Семь сайтов в нашей выборке блокируют ClaudeBot от Anthropic и не блокируют GPTBot от OpenAI.
The Guardian. Wired. The Verge. The Washington Post. The Atlantic. Business Insider. Investopedia.
Вот как выглядит файл Wired. Прочитайте список crawler, которых разворачивают, а затем обратите внимание, кого в нем нет.
Anthropic заблокирован сразу тремя способами. Google, Apple, Amazon, Meta, Perplexity, Cohere, Mistral и ByteDance всех разворачивают. Crawler OpenAI вообще не появляются в файле.
Затем мы сверили все семь названий с публичными сообщениями о лицензионных соглашениях в сфере AI.
У всех семи есть публично известная контентная сделка с OpenAI. The Guardian, Condé Nast — владелец Wired, Vox Media, владелец The Verge, The Washington Post, The Atlantic, Axel Springer, владелец Business Insider, и Dotdash Meredith, владелец Investopedia.
Семь из семи. Это не совпадение, от которого можно просто отмахнуться.
Другая группа судится
Посмотрите на сайты, которые вместо этого блокируют все, и паттерн подтверждается с противоположной стороны.
The New York Times блокирует все 17 crawler, которые мы тестировали, включая OpenAI. То же делает CNN. BBC блокирует 15. Это организации, которые судятся с AI-компаниями или публично отказываются лицензировать контент, и их файлы говорят ровно это.
Так что robots.txt издателя теперь складывается в две формы. Блокируете всех — значит, боретесь или выжидаете. Блокируете всех, кроме одной компании, — значит, эта компания вам платит.
Reuters — третья форма, и ее стоит упомянуть: он называет длинный список ботов в разрешающей группе и вообще не упоминает GPTBot, ClaudeBot, CCBot или Google-Extended. Решение не принимать решения — тоже позиция.
Что это значит для вашего сайта
Скорее всего, вы не ведете переговоры с OpenAI. Урок все равно применим и состоит из трех частей.
1. Перестаньте копировать чужие списки блокировки. Этот список был написан под чужие контракты и чужую бизнес-модель. Скопировать файл Wired значит скопировать переговорную позицию Condé Nast, которая вряд ли является вашей.
2. Решите, что именно вы защищаете. Если люди платят за чтение ваших текстов, AI, отвечающий вместо вас, стоит вам денег. Если люди платят за использование вашего продукта, AI, читающий вашу документацию, занимается вашим маркетингом. Этим двум ситуациям не нужен один и тот же robots.txt.
3. Если блокируете, блокируйте правильные имена. Обучающие crawler и ответные crawler — разные вещи с разными агентами. Блокировка GPTBot останавливает обучение, но оставляет OAI-SearchBot свободным цитировать вас в ChatGPT, чего большинство людей на самом деле и хочет. Блокировка CCBot в основном раздражает исследовательский архив.
И проверьте, что сейчас говорит ваш файл, потому что большинство людей никогда не читали свой.
Что мы не смогли измерить
Мы измеряли корреляцию, а не причину. Семь из семи — заметный паттерн, но мы не можем заглянуть ни в чей контракт. Возможно, лицензионное соглашение вообще не упоминает доступ crawler, а эти две вещи просто идут рядом. Мы считаем это маловероятным, но доказать не можем.
Блокировка — это просьба, а не стена. У robots.txt нет никакого принудительного исполнения. Добросовестный crawler ему подчиняется. У нас нет способа узнать, кто подчиняется.
49 сайтов — это выборка. Мы выбрали узнаваемые названия в шести категориях, и другие 49 сайтов сдвинули бы проценты.
Сделки постоянно меняются. Это фотография, сделанная 22 августа 2026 года. И файлы, и соглашения за ними успеют измениться к тому времени, когда вы это прочитаете, и именно поэтому метод важнее чисел.
Наш Website Audit загружает ваш сайт так, как это делает поисковая система, и сообщает, что нашел, включая наличие robots.txt и то, что он разрешает. Это самый быстрый способ проверить, что файл в корне вашего сайта говорит именно то, что вы думаете.
- Проверки сканируемости, robots.txt и sitemap в одном отчете
- Около 140 технических проверок, сначала худшие проблемы
- 3 проверки в день, без регистрации, без карты
Часто задаваемые вопросы
Что именно вы проверяли?
Мы загрузили robots.txt с 49 известных доменов 22 августа 2026 года и корректно его разобрали — группируя последовательные строки User-agent с правилами, которые следуют за ними, — затем записали, у каких из 18 AI-crawler была собственная группа с правилом Disallow: / для всего сайта. Считать одно упоминание имени бота недостаточно, потому что многие сайты называют ботов в разрешающих группах.
Сколько сайтов блокируют AI-crawler?
21 из 49, или 42%. По категориям: издатели 10 из 12, справочные сайты 5 из 8, ритейлеры 3 из 8, SaaS 3 из 8, инструменты для разработчиков 0 из 8 и SEO-инструменты 0 из 5. Среди сайтов, которые что-либо блокируют, средний список блокировки называл около 11 crawler.
Какие семь сайтов блокируют Anthropic, но не OpenAI?
The Guardian, Wired, The Verge, The Washington Post, The Atlantic, Business Insider и Investopedia. У каждого из них, либо у его материнской компании, есть публично известное соглашение о лицензировании контента с OpenAI: Condé Nast владеет Wired, Vox Media владеет The Verge, Axel Springer владеет Business Insider, а Dotdash Meredith владеет Investopedia.
Доказывает ли это, что сделки вызвали изменение?
Нет. Мы измерили корреляцию на семи сайтах и сверили ее с публичными сообщениями об этих соглашениях. Мы не можем прочитать ничей контракт, поэтому не можем сказать, прописан ли доступ crawler в сделке или просто следует из отношений. Семь из семи достаточно сильно, чтобы об этом сообщить, но недостаточно, чтобы назвать доказательством.
Какой crawler блокируют чаще всего?
CCBot, которым управляет Common Crawl, у 90% блокирующих сайтов. Common Crawl — некоммерческая организация, архивирующая веб с 2011 года, задолго до появления нынешней AI-индустрии. Далее идут ClaudeBot и Bytespider от ByteDance с 80%. GPTBot от OpenAI заблокирован у 52%, ChatGPT-User у 38%, а OAI-SearchBot у 33%.
В чем разница между GPTBot и OAI-SearchBot?
В общих чертах GPTBot собирает контент для обучения, тогда как OAI-SearchBot поддерживает поисковую функцию ChatGPT, которая цитирует источники и дает на них ссылки. Блокировать первый и разрешать второй — последовательная позиция для большинства издателей: без обучения, но все еще быть процитированными и получить ссылку. Блокировка обоих убирает вас и из ответов тоже.
Стоит ли мне блокировать AI-crawler на своем сайте?
Это полностью зависит от того, как вы зарабатываете деньги. Если люди платят за чтение вашего контента, ассистент, отвечающий вместо вас, является конкурентом, и блокировка оправданна. Если люди платят за использование вашего продукта, ассистент, читающий вашу документацию, помогает вам продавать, и именно поэтому ни одна компания из категорий инструментов для разработчиков или SEO в нашей выборке вообще ничего не блокировала.
Могу ли я сам запустить такую проверку?
Да, и это бесплатно. Добавьте /robots.txt к любому домену и прочитайте файл. Ищите имена AI-crawler, проверяйте, есть ли у каждого собственная группа с Disallow: /, и отмечайте, кого не хватает. Сделать это для десяти крупнейших сайтов в вашей отрасли занимает около двадцати минут и многое говорит об их коммерческой позиции.
Прочитайте файл, прежде чем копировать его
Каждый кейс в этой серии рассматривал что-то, что компания построила. Этот — о том, что компании случайно опубликовали.
Никто не собирался раскрывать свою переговорную позицию в простом текстовом файле в корне домена. Но у контрактов есть технические последствия, технические последствия записываются в robots.txt, а robots.txt по замыслу публичен.
Так что в следующий раз, когда вы увидите рекомендованный список блокировки AI, который ходит по кругу, помните, на что смотрите. Это не лучшая практика. Это осадок чьих-то чужих переговоров, и интереснее всего как раз те части, которые они оставили снаружи.
Начните со своего файла — запустите бесплатный аудит и посмотрите, что сейчас сообщаете crawler. Большинство людей удивляются.
Проверено 22 августа 2026 года на 49 доменах, с разбором robots.txt по группам user-agent, а не по совпадению ключевых слов, и с учетом только правил Disallow: / для всего сайта. Полные показатели по категориям и отдельным crawler приведены в FAQ выше.
Лицензионные соглашения проверялись по публичным сообщениям, а не по контрактам, и мы не делаем заявлений об их условиях. И robots-файлы, и коммерческие договоренности часто меняются; повторите проверку, прежде чем на нее опираться.