Todo site tem um pequeno arquivo chamado robots.txt. Durante trinta anos, ele foi uma peça de manutenção: aqui estão as pastas que eu preferiria que você não rastreasse. Ninguém o lia por diversão.
Ele se tornou discretamente outra coisa.
Abrimos o robots.txt de 49 sites conhecidos e verificamos quais crawlers de IA cada um afasta. O que voltou não foi um padrão técnico. Foi um mapa de quem assinou um acordo de licenciamento.
Sete grandes publishers bloqueiam o crawler da Anthropic e deixam o da OpenAI passar direto. Todos eles têm um acordo de conteúdo com a OpenAI divulgado publicamente.
Esse arquivo já não é mais manutenção. É um contrato, publicado na raiz do domínio, onde qualquer pessoa pode lê-lo.
Resultados em resumo
Publishers bloqueiam empresas de IA com as quais estão brigando e param de bloquear aquelas que os pagam. Você consegue ver qual é qual sem ler um único comunicado à imprensa.
Enquanto isso, a maioria das listas de bloqueio foi copiada de 2023 e para os crawlers errados.
Quem bloqueia qualquer coisa
Primeiro, a parte fácil. Dos 49 sites que verificamos, 21 bloqueiam pelo menos um crawler de IA — e de que lado dessa linha você fica depende quase inteiramente do que o seu negócio vende.
Se sua receita vem de pessoas lendo suas páginas, uma IA que responde sem enviar o leitor é uma concorrente. Se sua receita vem de pessoas usando seu produto, uma IA que lê sua documentação é uma vendedora.
Mesmo arquivo, incentivo oposto.
A lista que ninguém bloqueia de forma consistente
Agora veja o que os 21 bloqueadores realmente bloqueiam, e a história organizada se desfaz.
O Common Crawl vem arquivando a web discretamente desde 2011, muito antes de alguém se preocupar com chatbots. Agora é o crawler mais bloqueado nesta lista.
Enquanto isso, OAI-SearchBot — o crawler que alimenta os resultados de busca do ChatGPT — é bloqueado por apenas um terço dos sites que se deram ao trabalho de bloquear alguma coisa.
Parte disso é simples desatualização. Muitas dessas listas foram escritas durante o pânico de raspagem de 2023, coladas de um post de blog e nunca revisitadas. Mas desatualização não explica a próxima parte.
Sete publishers, uma lacuna gritante
Sete sites da nossa amostra bloqueiam o ClaudeBot da Anthropic e não bloqueiam o GPTBot da OpenAI.
The Guardian. Wired. The Verge. The Washington Post. The Atlantic. Business Insider. Investopedia.
Veja como é o arquivo da Wired. Leia a lista de crawlers que estão sendo afastados e então note quem está ausente dela.
A Anthropic é bloqueada três vezes. Google, Apple, Amazon, Meta, Perplexity, Cohere, Mistral e ByteDance são todos afastados. Os crawlers da OpenAI não aparecem no arquivo de forma alguma.
Então verificamos todos os sete nomes contra reportagens públicas sobre acordos de licenciamento de IA.
Todos os sete têm um acordo de conteúdo com a OpenAI divulgado publicamente. The Guardian, Condé Nast — dona da Wired — Vox Media, dona do The Verge, The Washington Post, The Atlantic, Axel Springer, dona da Business Insider, e Dotdash Meredith, dona da Investopedia.
Sete de sete. Isso não é uma coincidência que você possa simplesmente descartar.
O outro grupo está processando
Veja os sites que bloqueiam tudo, em vez disso, e o padrão se mantém pelo sentido oposto.
The New York Times bloqueia todos os 17 crawlers que testamos, incluindo os da OpenAI. A CNN também. A BBC bloqueia 15. Essas são as organizações em litígio com empresas de IA ou que se recusam publicamente a licenciar, e seus arquivos dizem exatamente isso.
Então o robots.txt de um publisher agora se organiza em dois formatos. Bloqueie todo mundo, e você está brigando ou resistindo. Bloqueie todo mundo exceto uma empresa, e essa empresa está pagando você.
A Reuters é o terceiro formato e merece menção: ela nomeia uma longa lista de bots em um grupo permissivo e nunca menciona GPTBot, ClaudeBot, CCBot ou Google-Extended. Decidir não decidir também é uma posição.
O que isso significa para o seu site
Você provavelmente não está negociando com a OpenAI. A lição ainda se aplica, em três partes.
1. Pare de copiar listas de bloqueio de outras pessoas. Essa lista foi escrita para os contratos de outra pessoa e para o modelo de negócio de outra pessoa. Copiar o arquivo da Wired significa copiar a posição de negociação da Condé Nast, que provavelmente não é a sua.
2. Decida o que você está realmente protegendo. Se as pessoas pagam para ler suas palavras, uma IA respondendo no seu lugar custa dinheiro a você. Se as pessoas pagam para usar seu produto, uma IA lendo sua documentação está fazendo seu marketing. Essas duas situações não compartilham um arquivo robots.txt.
3. Se você bloquear, bloqueie os nomes certos. Crawlers de treinamento e crawlers de resposta são coisas diferentes, com agentes diferentes. Bloquear GPTBot interrompe o treinamento, mas deixa o OAI-SearchBot livre para citar você no ChatGPT — que é o que a maioria das pessoas realmente quer. Bloquear CCBot principalmente incomoda um arquivo de pesquisa.
E verifique o que seu arquivo diz atualmente, porque a maioria das pessoas nunca leu o próprio.
O que não conseguimos medir
Medimos correlação, não causa. Sete de sete é um padrão marcante, mas não podemos ver dentro do contrato de ninguém. É possível que um acordo de licenciamento nunca mencione acesso de crawler e que as duas coisas simplesmente andem juntas. Achamos isso improvável; não conseguimos provar.
Bloquear é um pedido, não uma parede. robots.txt não tem nenhum tipo de aplicação obrigatória. Um crawler bem-comportado obedece. Não temos como saber quem obedece.
49 sites é uma amostra. Escolhemos nomes reconhecíveis em seis categorias, e outros 49 mudariam as porcentagens.
Acordos mudam constantemente. Esta é uma fotografia tirada em 22 de agosto de 2026. Tanto os arquivos quanto os acordos por trás deles terão mudado quando você a ler, e é exatamente por isso que o método importa mais do que os números.
Nosso Website Audit busca seu site da forma como um mecanismo de busca faz e relata o que encontrou, incluindo se seu robots.txt está presente e o que ele permite. É a maneira mais rápida de verificar se o arquivo na sua raiz diz o que você acha que diz.
- Verificações de rastreabilidade, robots.txt e sitemap em um único relatório
- Cerca de 140 verificações técnicas, piores problemas primeiro
- 3 verificações por dia, sem cadastro, sem cartão
Perguntas frequentes
O que exatamente vocês verificaram?
Buscamos o robots.txt de 49 domínios conhecidos em 22 de agosto de 2026 e o analisamos corretamente — agrupando linhas consecutivas de User-agent com as regras que as seguem — depois registramos quais dos 18 crawlers de IA tinham seu próprio grupo contendo um Disallow: / para o site inteiro. Contar uma menção ao nome de um bot não basta, porque muitos sites nomeiam bots em grupos permissivos.
Quantos sites bloqueiam crawlers de IA?
21 de 49, ou 42%. Por categoria: publishers 10 de 12, sites de referência 5 de 8, varejistas 3 de 8, SaaS 3 de 8, ferramentas para desenvolvedores 0 de 8 e ferramentas de SEO 0 de 5. Entre os sites que bloqueiam alguma coisa, a lista média de bloqueio nomeava cerca de 11 crawlers.
Quais sete sites bloqueiam a Anthropic, mas não a OpenAI?
The Guardian, Wired, The Verge, The Washington Post, The Atlantic, Business Insider e Investopedia. Cada um deles, ou sua empresa-mãe, tem um acordo de licenciamento de conteúdo com a OpenAI divulgado publicamente: a Condé Nast é dona da Wired, a Vox Media é dona do The Verge, a Axel Springer é dona da Business Insider e a Dotdash Meredith é dona da Investopedia.
Isso prova que os acordos causaram a mudança?
Não. Medimos uma correlação em sete sites e a verificamos contra reportagens públicas sobre esses acordos. Não podemos ler o contrato de ninguém, então não podemos dizer se o acesso de crawler está escrito no acordo ou se simplesmente decorre da relação. Sete de sete é forte o suficiente para reportar e não forte o suficiente para chamar de prova.
Qual crawler é bloqueado com mais frequência?
CCBot, operado pelo Common Crawl, em 90% dos sites bloqueadores. O Common Crawl é uma organização sem fins lucrativos que arquiva a web desde 2011, muito antes da indústria atual de IA. ClaudeBot e Bytespider, da ByteDance, vêm em seguida, com 80%. O GPTBot da OpenAI é bloqueado por 52%, o ChatGPT-User por 38% e o OAI-SearchBot por 33%.
Qual é a diferença entre GPTBot e OAI-SearchBot?
Em linhas gerais, o GPTBot coleta conteúdo para treinamento, enquanto o OAI-SearchBot dá suporte ao recurso de busca do ChatGPT, que cita e aponta links para fontes. Bloquear o primeiro e permitir o segundo é uma posição coerente para a maioria dos publishers: sem treinamento, mas ainda ser citado e receber links. Bloquear ambos também remove você das respostas.
Devo bloquear crawlers de IA no meu próprio site?
Depende inteiramente de como você ganha dinheiro. Se as pessoas pagam para ler seu conteúdo, um assistente que responde no seu lugar é um concorrente e bloquear é defensável. Se as pessoas pagam para usar seu produto, um assistente lendo sua documentação está ajudando você a vender — e é por isso que nenhuma empresa de ferramentas para desenvolvedores ou de SEO na nossa amostra bloqueou qualquer coisa.
Posso executar essa verificação por conta própria?
Sim, e é grátis. Adicione /robots.txt a qualquer domínio e leia. Procure os nomes dos crawlers de IA, verifique se cada um tem seu próprio grupo com Disallow: / e observe quem está ausente. Fazer isso para os dez maiores sites do seu setor leva cerca de vinte minutos e diz muito sobre a posição comercial deles.
Leia o arquivo antes de copiá-lo
Todo estudo de caso desta série analisou algo que uma empresa construiu. Este é sobre algo que empresas publicaram sem querer.
Ninguém se propôs a revelar sua posição de negociação em um arquivo de texto simples na raiz do próprio domínio. Mas contratos têm consequências técnicas, consequências técnicas são escritas em robots.txt, e robots.txt é público por definição.
Então, da próxima vez que você vir uma lista recomendada de bloqueio de IA circulando, lembre-se do que está olhando. Não é melhor prática. É o resíduo da negociação de outra pessoa, e as partes que ela deixou de fora são a parte interessante.
Comece pelo seu próprio arquivo — execute uma auditoria gratuita e veja o que você está dizendo aos crawlers atualmente. A maioria das pessoas se surpreende.
Verificado em 22 de agosto de 2026 em 49 domínios, analisando robots.txt por grupo de user-agent, em vez de por correspondência de palavra-chave, e contando apenas regras Disallow: / para o site inteiro. Os números completos por categoria e por crawler estão nas perguntas frequentes acima.
Os acordos de licenciamento foram verificados contra reportagens públicas, não contra contratos, e nenhuma alegação é feita sobre seus termos. Tanto arquivos robots quanto arranjos comerciais mudam com frequência; execute novamente a verificação antes de confiar nela.