Блог UNmiss

Почему все 9 из 9 медиа блокируют ИИ-краулеров

Мы разобрали 65 файлов robots.txt по 18 ИИ-краулерам. Блокируют все медиа и ни одна софтверная компания. 6 уроков о решении, которое все наследуют.

Мы разобрали 65 файлов robots.txt по 18 ИИ-краулерам, и все медиа в выборке их блокируют, а из софтверных компаний не блокирует ни одна.

Никакой середины в данных нет вообще. Если ваш продукт, это читатели, вы блокируете. Если ваш продукт, это софт, вы не блокируете.

Когда-то robots.txt был просто хозяйственным файлом: вот папки, в которые лучше не заглядывать. Теперь это место, где компании публично объявляют, можно ли использовать их работу, чтобы обучать машину и отвечать за них. Мы полностью переснимали это исследование с нуля 6 сентября 2026 года. Вот 6 уроков.

Посмотрите, кто блокирует на вашем рынке

Мы запросили robots.txt у 67 доменов, получили 65 и разобрали каждый по группам user-agent относительно 18 названных ИИ-краулеров.

Примерно четверть блокирует хотя бы одного. И распределены они совсем не ровно:

Что они продаютБлокируют
Медиавсе до одного
Ритейлбольше половины
SaaSоколо пятой части
Инструменты для разработчиковникто
SEO-инструментыникто
ИИ-лабораторииникто

Блокируют все проверенные нами медиа, и большинство блокирует почти весь список. The New York Times и wikiHow останавливают 17 краулеров из 18 протестированных.

Это те же медиа, у которых, по нашему параллельному исследованию той же недели, нет файла llms.txt. Они не колеблются насчёт ИИ. Они уже решили, и решили в обратную сторону.

Так что прежде чем трогать свой файл, сходите и прочитайте файлы 5 компаний, с которыми вы конкурируете. Это 10 минут, и о выводах вашего рынка это расскажет больше, чем любое исследование, включая это.

Файл robots.txt сайта nytimes.com со списком user-agent ИИ-краулеров, за каждым из которых идёт правило Disallow со слэшем на весь сайт.
На что смотреть: у каждой группы user-agent своё правило Disallow на весь сайт. The New York Times блокирует 17 краулеров из 18 протестированных.

Спросите себя, строится ли ваша модель на том, чтобы вас находили

Теперь другая сторона, и она абсолютна.

Инструменты для разработчиков, SEO-инструменты и ИИ-лаборатории: ни одной блокировки на весь сайт ни по одному ИИ-краулеру.

GitHub, GitLab, Stripe, Vercel, Cloudflare, Docker, Supabase, Sentry, Twilio. Ahrefs, Semrush, Moz, SE Ranking, Surfer, Screaming Frog, Sitebulb и мы. Anthropic, OpenAI, Perplexity, Mistral, Cohere, Hugging Face.

Логика здесь несложная. Страница документации, которую модель прочитала и порекомендовала разработчику, делает свою работу. Новостная статья, которую модель прочитала и ответила вместо вас, свою работу не делает.

То есть ответ вытекает из вашей бизнес-модели, а не из best practice. Разберитесь, чем из этих двух являются ваши страницы, прежде чем копировать чей-то файл.

Если ваши страницы существуют, чтобы их нашли и по ним что-то сделали, блокировка краулера убирает вас из ответа и ничего не защищает. Если ваши страницы сами и есть продукт, расчёт полностью переворачивается, и никакой общий совет не примет это решение за вас.

Никогда не блокируйте краулер, который возвращает ссылки

Среди блокирующих краулеры Anthropic останавливают чуть чаще, чем краулеры OpenAI, а в самом низу списка сидит OAI-SearchBot, самый редко блокируемый краулер в исследовании.

Именно он питает поисковые результаты со ссылками обратно на вас. Это краулер, который с наибольшей вероятностью пришлёт вам посетителя, и именно его останавливает меньше всего сайтов.

Вот это различие и стоит держать в голове, когда правите свой файл. Краулер, который обучает модель, и краулер, который возвращает цитату со ссылкой, это разные решения, даже если оба приходят от одной компании и попадают в один и тот же скопированный список.

Важное исправление, потому что раньше мы здесь ошиблись. В ранней версии этой статьи мы писали, что каждое медиа, блокирующее Anthropic, одновременно пропускает OpenAI, и связывали это с лицензионными сделками. При перезапуске на 65 доменах эта картина оказалась гораздо слабее: ровно так делают только 2 сайта. Перекос реальный и устойчивый. А вот красивая история нет.

Работайте с нами
Решайте, что блокировать, опираясь на данные

Блокировка ИИ-краулера, это решение о трафике, который большинство компаний никогда не измеряли. Сначала получите цифры. Мы покажем, что вам сегодня присылают ассистенты, а потом поможем настроить файл осознанно.

  • Измеряем ИИ-трафик, который вы уже получаете
  • Пишем те правила robots, которые вы и хотели иметь
  • Постоянное SEO и GEO, если нужно
  • Первая консультация бесплатная
Записаться на бесплатную консультацию → Посмотреть наши услуги SEO и GEO →

Перечитайте файл, который никто не перечитывает

Во главе списка блокировок стоит не GPTBot. Это CCBot, его блокирует больше сайтов, чем любой краулер, принадлежащий ИИ-компании.

CCBot, это Common Crawl, некоммерческая организация, которая архивирует веб с 2008 года, задолго до того, как кто-то начал переживать за обучающие данные. Ниже идут meta-externalagent, Bytespider, Applebot-Extended и PerplexityBot.

Такие файлы накапливаются. Кто-то добавил CCBot много лет назад по причине, которую сейчас никто не помнит, кто-то другой вставил список из статьи в блоге, и файл разросся. Очень немногие читаются как решение, принятое один раз, осознанно и про нынешний набор краулеров.

Ваш, скорее всего, такой же. Откройте его и посмотрите дату последнего настоящего изменения: если вы не найдёте человека, который помнит, как его вносил, вы исполняете чужое мнение из эпохи, которая уже закончилась.

Тот же дрейф вылезает в любом техническом файле, который никто не перечитывает. Ровно это мы нашли, проверяя карты сайта на той же неделе, и ровно это проверяет наш Website Audit, когда смотрит, согласуются ли ваши правила robots с вашими индексируемыми страницами.

Это бесплатно и закрывает сторону ИИ. Ещё до любых блокировок стоит понять, что вам присылает обычный поиск, и это хорошо показывают и Semrush, и SE Ranking.

Файл robots.txt сайта theguardian.com с группами user-agent для ИИ-краулеров рядом с большими разрешающими группами, где есть только правила на уровне путей.
На что смотреть: на группы. Краулер, названный в разрешающей группе вроде этих, не заблокирован, сколько бы раз он там ни встречался.

Разбирайте группы, а не грепайте имена

Вот методологическая ловушка, и она даёт прямо противоположный ответ.

robots.txt устроен в виде групп. Идущие подряд строки User-agent: делят между собой правила, которые идут после них, а новая группа начинается на следующей строке User-agent: после правила. Краулер заблокирован только тогда, когда в группе, где он назван, есть Disallow: / на весь сайт.

По нашим 65 файлам 91 упоминание краулеров сидит в группах, которые их не блокируют: обычно это большая разрешающая группа, где все правила только на уровне путей, а десятки ботов перечислены, чтобы дать им тот же обычный доступ, что и всем остальным.

Сделайте grep по имени бота, и вы засчитаете каждое такое упоминание как блокировку. Это не погрешность округления; на некоторых сайтах вывод переворачивается целиком.

Поэтому если вы проверяете это в масштабе, разбирайте группы, а не ищите строки. Наш скрипт для исследования так и делает, он лежит в репозитории, если хотите прогнать его по своему списку.

Та же ловушка касается и вашего собственного файла. Бот, который вы считаете заблокированным, может быть назван в группе, которая даёт ему всё, и узнаете вы об этом, только прочитав группу, в которой он сидит, а не строку, где он встретился.

Прочитайте файл, прежде чем его копировать

Инструкция, и это главный практический вывод.

Почти каждый ходящий по рукам список блокировок в robots.txt скопирован с другого сайта. Поэтому CCBot стоит выше GPTBot, поэтому 91 упоминание не является блокировкой и поэтому во множестве файлов названы краулеры, которых больше не существует.

Откройте свой. По каждому ИИ-краулеру в нём ответьте на один вопрос: был бы вам полезен посетитель, пришедший из этой системы? Для медиа по подписке ответ часто отрицательный. Для всего, что продаётся за счёт того, что его находят, ответ почти всегда положительный, а OAI-SearchBot, тот самый, который возвращает ссылки, останавливать хочется в последнюю очередь.

А затем, прежде чем что-либо менять, проверьте, что вы уже получаете от этих систем. Наш AI Visibility Checker задаёт 6 покупательских вопросов основным ассистентам и отдельно считает упоминания и цитаты со ссылками, а это и показывает, есть ли вообще трафик, который надо защищать.

Бесплатно, без регистрации
Узнайте, что говорят о вас ИИ-ассистенты

Блокировка краулера, это решение о трафике, который вы, возможно, не измеряли. Проверьте, что ассистенты говорят сейчас и присылает ли вам кто-нибудь из них людей, прежде чем править файл.

  • 6 покупательских вопросов, заданных без вашего бренда в тексте
  • Упоминания и цитаты считаются отдельно
  • 3 проверки в день, без регистрации и без карты
Проверить видимость в ИИ бесплатно

Что мы измерить не смогли

А вот чего это исследование не показывает. Пара инструментов, названных на этом сайте, наши партнёры: если вы купите по этим ссылкам, мы получим комиссию, а вы не заплатите ни цента больше.

robots.txt, это просьба, а не запрет. Он фиксирует, о чём сайт просит. Он не говорит, послушался ли хоть один краулер, и проверить соблюдение снаружи мы никак не можем. Заблокированный краулер в этих данных, это заявленное намерение.

Мы тестировали 18 названных краулеров и засчитывали блокировку только при Disallow: / на весь сайт внутри группы, где этот агент назван. Правила на уровне путей, crawl-delay и агенты с масками не учитывались, поэтому сайт, который закрывает ИИ-краулеру большую часть сайта, но не весь, проходит здесь как не блокирующий.

2 из 67 доменов вообще не отдали файл, это npmjs.com и rust-lang.org, поэтому знаменатель везде 65.

Выборка, это 67 доменов, которые мы выбрали по 6 категориям, с перевесом в сторону компаний, знакомых SEO-аудитории, и случайной выборкой веба она не является. Другой список даст другую долю. Метод лежит в scripts/survey-ai-crawler-files.mjs в нашем репозитории, а сырой вывод в evidence/surveys/.

Частные лицензионные соглашения нам не видны, и эта версия статьи ничего о них не утверждает. Ранняя версия утверждала, опираясь на гораздо меньшую выборку, и это утверждение мы убрали, а не переформулировали.

Частые вопросы

Сколько сайтов блокируют ИИ-краулеров?

17 из 65, которые мы смогли прочитать, то есть 26%, замер 6 сентября 2026 года по 18 названным ИИ-краулерам. Блокируют все 9 медиа, 4 ритейлера из 7, 4 SaaS-компании из 18 и ни один из 31 домена инструментов для разработчиков, SEO-инструментов и ИИ-лабораторий.

Какого ИИ-краулера блокируют чаще всего?

CCBot, его блокируют 14 из 17 блокирующих сайтов. Он принадлежит Common Crawl, некоммерческой организации, которая архивирует веб с 2008 года, задолго до нынешних переживаний об обучающих данных. GPTBot блокируют 9 сайтов, а OAI-SearchBot 6.

Блокируют ли медиа ИИ-краулеров?

Все 9 в нашей выборке, в среднем по 14.1 краулера из 18 у каждого. The New York Times и wikiHow блокируют 17, CNN 17, The Verge и BBC 15, Investopedia 14, Wired 12, Healthline 11 и the Guardian 9.

Anthropic блокируют чаще, чем OpenAI?

Немного чаще. 13 из 17 блокирующих сайтов останавливают хотя бы один краулер Anthropic против 10 для OpenAI, а OAI-SearchBot блокируют реже всех в исследовании, всего 6 сайтов. И только 2 сайта блокируют все краулеры Anthropic, пропуская при этом все краулеры OpenAI.

Стоит ли блокировать ИИ-краулеров на своём сайте?

Это следует из вашей бизнес-модели. Если люди платят за чтение ваших страниц, блокировка защищает то, что вы продаёте. Если ваши страницы существуют, чтобы их нашли и по ним что-то сделали, блокировка убирает вас из ответа, а OAI-SearchBot, краулер, который с наибольшей вероятностью пришлёт посетителя по ссылке, останавливать хочется в последнюю очередь.

robots.txt действительно останавливает краулер?

Это просьба, а не запрет. Файл фиксирует, о чём просит сайт; ничто в нём ничего не обеспечивает принудительно, и проверить соблюдение снаружи мы никак не можем. Любая цифра «блокирует» здесь, это заявленное намерение.

Почему grep по имени бота в robots.txt даёт неверный ответ?

Потому что назвать краулер, не значит его заблокировать. В наших 65 файлах 91 упоминание краулеров сидит в разрешающих группах, где все правила только на уровне путей. Краулер считается заблокированным, только когда в группе, где он назван, есть Disallow: / на весь сайт.

Блокируют ли SEO-инструменты ИИ-краулеров?

Ни один из 8 проверенных, включая нас. И ни один из 16 сайтов инструментов для разработчиков и 7 ИИ-лабораторий. Софтверные компании хотят, чтобы их документацию читали.

Одна цифра, которую стоит запомнить

31 к 0.

Столько софтверных компаний в этом исследовании блокирует ИИ-краулера: ни одна, против 9 медиа из 9.

Никакой общепринятой best practice в этих данных не прячется, потому что 2 группы отвечают на разные вопросы. Медиа спрашивает, можно ли машине заменить собой его продукт. Софтверная компания спрашивает, можно ли машине рекомендовать её продукт.

Ответить за вас не может никто, и ни один список блокировок, скопированный из статьи в блоге, за вас на это не ответил. Самый блокируемый краулер в этом исследовании принадлежит некоммерческому архиву, который старше всей этой дискуссии, и это хорошо показывает, насколько содержимое таких файлов было решено, а насколько просто унаследовано.

Откройте свой robots.txt. Это 5 минут, а сейчас он делает от вашего имени заявление, которого вы, возможно, никогда не делали.

Замер 6 сентября 2026 года. Мы запросили robots.txt у 67 доменов, разобрали 65 из них по группам user-agent и засчитывали краулер как заблокированный, только если в группе, где он назван, был Disallow: / на весь сайт. Тестировались 18 краулеров: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, anthropic-ai, Claude-User, Google-Extended, CCBot, PerplexityBot, Bytespider, Applebot-Extended, meta-externalagent, Amazonbot, cohere-ai, Diffbot, omgili, ImagesiftBot и Timpibot. Метод лежит в scripts/survey-ai-crawler-files.mjs в нашем репозитории, а сырые результаты в evidence/surveys/, так что любую цифру отсюда можно перепроверить.

Блог