Блог UNmiss

Robots.txt тепер показує, хто підписав угоду з AI

Ми прочитали 49 файлів robots.txt. Сім видавців блокують Anthropic і дозволяють OpenAI, і всі семеро мають ліцензійну угоду з OpenAI. Найчастіше блокують crawler неприбуткової організації.

Кожен сайт має маленький файл під назвою robots.txt. Тридцять років це була частина технічного порядку: ось папки, які я волів би, щоб ви не сканували. Ніхто не читав його заради розваги.

Він тихо став чимось іншим.

Ми відкрили robots.txt 49 відомих сайтів і перевірили, яких AI-crawler кожен із них відвертає. Те, що повернулося, не було технічним патерном. Це була карта того, хто підписав ліцензійну угоду.

Сім великих видавців блокують crawler Anthropic і дають crawler OpenAI пройти прямо всередину. Кожен із них має публічно повідомлену контентну угоду з OpenAI.

Цей файл більше не є технічним прибиранням. Це контракт, опублікований у корені домену, де його може прочитати будь-хто.

Результати стисло

7 із 7
сайтів, що блокують Anthropic, але не OpenAI, мають угоду з OpenAI
52%
тих, хто щось блокує, фактично блокують GPTBot від OpenAI
90%
блокують Common Crawl, неприбутковий дослідницький crawler
Коротко

Видавці блокують AI-компанії, з якими вони воюють, і припиняють блокувати тих, хто їм платить. Ви можете побачити, хто є хто, не читаючи жодного пресрелізу.

Водночас більшість списків блокування скопійовані з 2023 року й зупиняють не тих crawler.

Хто взагалі щось блокує

Спершу проста частина. Із 49 сайтів, які ми перевірили, 21 блокує принаймні один AI-crawler, і те, по який бік цієї межі ви опиняєтесь, майже повністю залежить від того, що продає ваш бізнес.

Якщо ваш дохід приходить від людей, які читають ваші сторінки, AI, що відповідає без переходу читача до вас, є конкурентом. Якщо ваш дохід приходить від людей, які користуються вашим продуктом, AI, що читає вашу документацію, є продавцем.

Той самий файл, протилежний стимул.

Список, який ніхто не блокує послідовно

Тепер подивіться, що насправді блокують 21 сайт, які щось блокують, і охайна історія розсипається.

Common Crawl тихо архівує веб із 2011 року, задовго до того, як хтось почав хвилюватися про чатботів. Тепер це найчастіше блокований crawler у цьому списку.

Водночас OAI-SearchBot — crawler, що живить результати пошуку ChatGPT, — заблокований лише третиною сайтів, які взагалі взяли на себе клопіт щось блокувати.

Частково це проста застарілість. Багато цих списків написали під час паніки через scraping у 2023 році, скопіювали з допису в блозі й більше ніколи не переглядали. Але застарілість не пояснює наступну частину.

Сім видавців, одна помітна прогалина

Сім сайтів у нашій вибірці блокують ClaudeBot від Anthropic і не блокують GPTBot від OpenAI.

The Guardian. Wired. The Verge. The Washington Post. The Atlantic. Business Insider. Investopedia.

Ось який вигляд має файл Wired. Прочитайте список crawler, яких відвертають, а потім зверніть увагу, кого в ньому немає.

Фрагмент файла robots.txt сайту wired.com зі списком заблокованих user agent, зокрема Google-Extended, Applebot-Extended, Amazonbot, meta-externalagent, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, cohere-ai, CCBot, Bytespider, Diffbot, DuckAssistBot, MistralAI-User і Timpibot.
На що звернути увагу: Google, Apple, Amazon, Meta, Anthropic, Perplexity, Cohere, Mistral і ByteDance усі названі. OpenAI ніде у файлі не згадується.

Anthropic заблокований тричі. Google, Apple, Amazon, Meta, Perplexity, Cohere, Mistral і ByteDance усіх відвертають. Crawler OpenAI у файлі взагалі не з’являються.

Потім ми перевірили всі сім назв за публічними повідомленнями про ліцензійні угоди щодо AI.

Усі сім мають публічно повідомлену контентну угоду з OpenAI. The Guardian, Condé Nast, якій належить Wired, Vox Media, якій належить The Verge, The Washington Post, The Atlantic, Axel Springer, якій належить Business Insider, і Dotdash Meredith, якій належить Investopedia.

Сім із семи. Це не збіг, від якого можна просто відмахнутися.

Інша група судиться

Подивіться на сайти, які натомість блокують усе, і патерн тримається з протилежного боку.

The New York Times блокує всі 17 crawler, які ми тестували, включно з OpenAI. CNN робить те саме. BBC блокує 15. Це організації, які судяться з AI-компаніями або публічно відмовляються від ліцензування, і їхні файли говорять саме це.

Отже, robots.txt видавця тепер складається у дві форми. Блокуєте всіх — ви воюєте або тримаєте паузу. Блокуєте всіх, крім однієї компанії, — ця компанія вам платить.

Reuters — третя форма, і її варто згадати: він називає довгий список ботів у дозвільній групі й взагалі не згадує GPTBot, ClaudeBot, CCBot або Google-Extended. Вирішити не вирішувати — це теж позиція.

Що це означає для вашого сайту

Ви, ймовірно, не ведете переговори з OpenAI. Урок усе одно застосовний і складається з трьох частин.

1. Припиніть копіювати чужі списки блокування. Цей список написали для чужих контрактів і чужої бізнес-моделі. Копіювати файл Wired означає копіювати переговорну позицію Condé Nast, яка навряд чи є вашою.

2. Вирішіть, що саме ви насправді захищаєте. Якщо люди платять, щоб читати ваші слова, AI, який відповідає замість вас, коштує вам грошей. Якщо люди платять, щоб користуватися вашим продуктом, AI, який читає вашу документацію, робить ваш маркетинг. Ці дві ситуації не мають спільного файла robots.txt.

3. Якщо блокуєте, блокуйте правильні назви. Training crawler і answer crawler — різні речі з різними агентами. Блокування GPTBot зупиняє тренування, але залишає OAI-SearchBot вільним цитувати вас у ChatGPT, чого більшість людей насправді хоче. Блокування CCBot переважно дратує дослідницький архів.

І перевірте, що зараз говорить ваш файл, бо більшість людей ніколи не читали свій.

Звіт UNmiss Website Audit для wired.com із показником здоров’я сайту 83 зі 100, нулем критичних проблем, трьома попередженнями, вісьмома нотатками й 110 пройденими перевірками, з групами для on-page SEO, технічного SEO, швидкості та мобільної версії.
На що звернути увагу: перевірка crawler читає ваш robots.txt так, як це зробила б пошукова система, тож ви бачите, що насправді говорите ботам, а не те, що мали на увазі.

Що ми не могли виміряти

Ми виміряли кореляцію, а не причину. Сім із семи — разючий патерн, але ми не можемо бачити внутрішню частину чийогось контракту. Можливо, ліцензійна угода ніколи не згадує доступ crawler, а ці дві речі просто йдуть разом. Ми вважаємо це малоймовірним; довести не можемо.

Блокування — це прохання, а не стіна. robots.txt не має жодного механізму примусу. Добре вихований crawler його дотримується. Ми не можемо знати, хто дотримується.

49 сайтів — це вибірка. Ми вибрали впізнавані назви з шести категорій, і інші 49 змінили б відсотки.

Угоди постійно змінюються. Це фотографія, зроблена 22 серпня 2026 року. І файли, і угоди за ними вже зміняться до моменту, коли ви це читатимете, саме тому метод важливіший за числа.

Безкоштовно, без акаунта
Подивіться, що ваш robots.txt говорить crawler

Наш Website Audit отримує ваш сайт так, як це робить пошукова система, і повідомляє, що знайшов, зокрема чи присутній ваш robots.txt і що він дозволяє. Це найшвидший спосіб перевірити, що файл у корені говорить саме те, що ви думаєте.

  • Перевірки crawlability, robots.txt і sitemap в одному звіті
  • Близько 140 технічних перевірок, найгірші проблеми першими
  • 3 перевірки на день, без реєстрації, без картки
Запустити безкоштовний аудит сайту

Поширені запитання

Що саме ви перевіряли?

Ми отримали robots.txt із 49 відомих доменів 22 серпня 2026 року й правильно його розпарсили: групували послідовні рядки User-agent із правилами, що йдуть після них, а потім записали, які з 18 AI-crawler мали власну групу з правилом Disallow: / для всього сайту. Рахувати саму згадку назви бота недостатньо, бо багато сайтів називають ботів у дозвільних групах.

Скільки сайтів блокують AI-crawler?

21 із 49, або 42%. За категоріями: видавці 10 із 12, довідкові сайти 5 із 8, ритейлери 3 із 8, SaaS 3 із 8, інструменти для розробників 0 із 8 і SEO-інструменти 0 із 5. Серед сайтів, які щось блокують, середній список блокування називав приблизно 11 crawler.

Які сім сайтів блокують Anthropic, але не OpenAI?

The Guardian, Wired, The Verge, The Washington Post, The Atlantic, Business Insider і Investopedia. Кожен із них або його материнська компанія має публічно повідомлену ліцензійну угоду на контент з OpenAI: Condé Nast володіє Wired, Vox Media володіє The Verge, Axel Springer володіє Business Insider, а Dotdash Meredith володіє Investopedia.

Це доводить, що угоди спричинили зміну?

Ні. Ми виміряли кореляцію на семи сайтах і звірили її з публічними повідомленнями про ці угоди. Ми не можемо читати чиїсь контракти, тож не можемо сказати, чи доступ crawler прописаний в угоді, чи просто випливає з відносин. Сім із семи достатньо сильно, щоб про це повідомити, і недостатньо сильно, щоб назвати доказом.

Який crawler блокують найчастіше?

CCBot, яким керує Common Crawl, у 90% сайтів, що блокують. Common Crawl — неприбуткова організація, яка архівує веб із 2011 року, задовго до нинішньої AI-індустрії. Далі йдуть ClaudeBot і Bytespider від ByteDance із 80%. GPTBot від OpenAI заблокований у 52%, ChatGPT-User у 38%, а OAI-SearchBot у 33%.

Яка різниця між GPTBot і OAI-SearchBot?

Загалом GPTBot збирає контент для тренування, тоді як OAI-SearchBot підтримує функцію пошуку ChatGPT, яка цитує джерела й посилається на них. Блокувати першого й дозволяти другого — послідовна позиція для більшості видавців: жодного тренування, але вас усе ще цитують і дають посилання. Блокування обох також прибирає вас із відповідей.

Чи варто мені блокувати AI-crawler на власному сайті?

Це повністю залежить від того, як ви заробляєте гроші. Якщо люди платять, щоб читати ваш контент, асистент, який відповідає замість вас, є конкурентом, і блокування можна захистити. Якщо люди платять, щоб користуватися вашим продуктом, асистент, який читає вашу документацію, допомагає вам продавати, саме тому жодна компанія з інструментів для розробників або SEO у нашій вибірці не блокувала нічого.

Чи можу я сам запустити цю перевірку?

Так, і це безкоштовно. Додайте /robots.txt до будь-якого домену й прочитайте його. Шукайте назви AI-crawler, перевіряйте, чи кожен має власну групу з Disallow: /, і занотовуйте, кого бракує. Зробити це для десяти найбільших сайтів у вашій галузі займає близько двадцяти хвилин і багато говорить про їхню комерційну позицію.

Прочитайте файл, перш ніж копіювати його

Кожен кейс у цій серії дивився на щось, що компанія побудувала. Цей — про щось, що компанії випадково опублікували.

Ніхто не ставив собі за мету розкрити свою переговорну позицію у plain text файлі в корені домену. Але контракти мають технічні наслідки, технічні наслідки записують у robots.txt, а robots.txt за задумом є публічним.

Тож наступного разу, коли побачите рекомендований список блокування AI, який ходить колом, пам’ятайте, на що ви дивитесь. Це не best practice. Це залишок чиїхось переговорів, і частини, які вони пропустили, є найцікавішими.

Почніть із власного файла — запустіть безкоштовний аудит і подивіться, що зараз говорите crawler. Більшість людей дивуються.

Перевірено 22 серпня 2026 року на 49 доменах, із парсингом robots.txt за групами user-agent, а не за збігом ключових слів, і з підрахунком лише правил Disallow: / для всього сайту. Повні цифри за категоріями й окремими crawler наведені у FAQ вище.

Ліцензійні угоди перевірялися за публічними повідомленнями, а не за контрактами, і ми не робимо жодних тверджень про їхні умови. І robots-файли, і комерційні домовленості часто змінюються; запустіть перевірку повторно, перш ніж покладатися на неї.

Блог