Blog de UNmiss

Robots.txt ahora muestra quien firmo un acuerdo de IA

Leimos 49 archivos robots.txt. Siete editores bloquean a Anthropic y permiten a OpenAI, y los siete tienen un acuerdo de licencia con OpenAI. El rastreador mas bloqueado es una organizacion sin fines de lucro.

Cada sitio web tiene un pequeno archivo llamado robots.txt. Durante treinta anos fue una pieza de mantenimiento: estas son las carpetas que preferiria que no rastrearas. Nadie lo leia por diversion.

En silencio, se ha convertido en otra cosa.

Abrimos el robots.txt de 49 sitios web conocidos y comprobamos que rastreadores de IA rechaza cada uno. Lo que aparecio no fue un patron tecnico. Fue un mapa de quienes han firmado un acuerdo de licencia.

Siete grandes editores bloquean el rastreador de Anthropic y dejan que el de OpenAI pase directamente. Cada uno de ellos tiene un acuerdo de contenido con OpenAI reportado publicamente.

Ese archivo ya no es mantenimiento. Es un contrato, publicado en la raiz del dominio, donde cualquiera puede leerlo.

Resultados de un vistazo

7 de 7
sitios que bloquean a Anthropic pero no a OpenAI tienen un acuerdo con OpenAI
52%
de quienes bloquean realmente bloquean GPTBot de OpenAI
90%
bloquean Common Crawl, un rastreador de investigacion sin fines de lucro
La version corta

Los editores bloquean a las empresas de IA con las que estan peleando y dejan de bloquear a las que les pagan. Puedes ver cual es cual sin leer un solo comunicado de prensa.

Mientras tanto, la mayoria de las listas de bloqueo estan copiadas de 2023 y detienen a los rastreadores equivocados.

Quienes bloquean algo

Primero, la parte facil. De los 49 sitios que comprobamos, 21 bloquean al menos un rastreador de IA, y de que lado de esa linea caes depende casi por completo de lo que vende tu negocio.

Si tus ingresos vienen de personas que leen tus paginas, una IA que responde sin enviar al lector es una competidora. Si tus ingresos vienen de personas que usan tu producto, una IA que lee tu documentacion es una vendedora.

Mismo archivo, incentivo opuesto.

La lista que nadie bloquea de forma consistente

Ahora mira que bloquean realmente los 21 sitios que bloquean, y la historia ordenada se desmorona.

Common Crawl lleva archivando silenciosamente la web desde 2011, mucho antes de que alguien se preocupara por los chatbots. Ahora es el rastreador mas bloqueado de esta lista.

Mientras tanto, OAI-SearchBot, el rastreador que alimenta los resultados de busqueda de ChatGPT, esta bloqueado solo por un tercio de los sitios que se tomaron la molestia de bloquear algo.

Parte de eso es simple obsolescencia. Muchas de estas listas se escribieron durante el panico por el scraping de 2023, se pegaron desde una publicacion de blog y nunca se revisaron. Pero la obsolescencia no explica la siguiente parte.

Siete editores, un hueco llamativo

Siete sitios de nuestra muestra bloquean ClaudeBot de Anthropic y no bloquean GPTBot de OpenAI.

The Guardian. Wired. The Verge. The Washington Post. The Atlantic. Business Insider. Investopedia.

Asi se ve el archivo de Wired. Lee la lista de rastreadores rechazados y luego fijate en quien falta.

Un extracto del archivo robots.txt de wired.com que enumera agentes de usuario bloqueados, incluidos Google-Extended, Applebot-Extended, Amazonbot, meta-externalagent, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, cohere-ai, CCBot, Bytespider, Diffbot, DuckAssistBot, MistralAI-User y Timpibot.
Que observar: Google, Apple, Amazon, Meta, Anthropic, Perplexity, Cohere, Mistral y ByteDance aparecen todos nombrados. OpenAI no se menciona en ninguna parte del archivo.

Anthropic esta bloqueado por triplicado. Google, Apple, Amazon, Meta, Perplexity, Cohere, Mistral y ByteDance son rechazados todos. Los rastreadores de OpenAI no aparecen en el archivo en absoluto.

Luego comprobamos los siete nombres con reportes publicos sobre acuerdos de licencia de IA.

Los siete tienen un acuerdo de contenido con OpenAI reportado publicamente. The Guardian, Conde Nast, que posee Wired, Vox Media, que posee The Verge, The Washington Post, The Atlantic, Axel Springer, que posee Business Insider, y Dotdash Meredith, que posee Investopedia.

Siete de siete. Eso no es una coincidencia que puedas apartar con la mano.

El otro grupo esta demandando

Mira los sitios que en cambio bloquean todo, y el patron se sostiene desde la direccion opuesta.

The New York Times bloquea los 17 rastreadores que probamos, incluidos los de OpenAI. CNN tambien. La BBC bloquea 15. Estas son las organizaciones en litigio con empresas de IA o que se niegan publicamente a conceder licencias, y sus archivos dicen exactamente eso.

Asi que el robots.txt de un editor ahora se ordena en dos formas. Bloquea a todos y estas peleando o resistiendo. Bloquea a todos excepto a una empresa, y esa empresa te esta pagando.

Reuters es la tercera forma y merece mencion: nombra una larga lista de bots en un grupo permisivo y nunca menciona GPTBot, ClaudeBot, CCBot ni Google-Extended. Decidir no decidir tambien es una postura.

Que significa esto para tu sitio

Probablemente no estes negociando con OpenAI. La leccion aun aplica, en tres partes.

1. Deja de copiar las listas de bloqueo de otras personas. Esa lista fue escrita para los contratos de otra persona y el modelo de negocio de otra persona. Copiar el archivo de Wired significa copiar la posicion negociadora de Conde Nast, que probablemente no sea la tuya.

2. Decide que estas protegiendo realmente. Si la gente paga para leer tus palabras, una IA que responde en tu lugar te cuesta dinero. Si la gente paga para usar tu producto, una IA que lee tu documentacion esta haciendo tu marketing. Esas dos situaciones no comparten un archivo robots.txt.

3. Si bloqueas, bloquea los nombres correctos. Los rastreadores de entrenamiento y los rastreadores de respuestas son cosas distintas con agentes distintos. Bloquear GPTBot detiene el entrenamiento pero deja a OAI-SearchBot libre para citarte en ChatGPT, que es lo que la mayoria de la gente realmente quiere. Bloquear CCBot sobre todo molesta a un archivo de investigacion.

Y comprueba que dice tu archivo actualmente, porque la mayoria de la gente nunca ha leido el suyo.

Informe de Website Audit de UNmiss para wired.com que muestra una puntuacion de salud del sitio de 83 sobre 100, cero problemas criticos, tres advertencias, ocho avisos y 110 comprobaciones aprobadas, con grupos para SEO on-page, SEO tecnico, velocidad y movil.
Que observar: la comprobacion de rastreadores lee tu robots.txt como lo haria un motor de busqueda, para que puedas ver que les estas diciendo realmente a los bots en vez de lo que querias decirles.

Lo que no pudimos medir

Medimos correlacion, no causa. Siete de siete es un patron llamativo, pero no podemos ver dentro del contrato de nadie. Es posible que un acuerdo de licencia nunca mencione el acceso de rastreadores y que las dos cosas simplemente viajen juntas. Creemos que eso es improbable; no podemos demostrarlo.

Bloquear es una solicitud, no un muro. robots.txt no tiene ningun mecanismo de aplicacion. Un rastreador bien comportado lo obedece. No tenemos forma de saber quien obedece.

49 sitios es una muestra. Elegimos nombres reconocibles en seis categorias, y otros 49 moverian los porcentajes.

Los acuerdos cambian constantemente. Esta es una fotografia tomada el 22 de agosto de 2026. Tanto los archivos como los acuerdos que hay detras se habran movido para cuando lo leas, que es exactamente por eso que el metodo importa mas que los numeros.

Gratis, sin cuenta
Mira que les dice tu robots.txt a los rastreadores

Nuestro Website Audit obtiene tu sitio como lo hace un motor de busqueda e informa lo que encontro, incluido si tu robots.txt esta presente y que permite. Es la forma mas rapida de comprobar que el archivo en tu raiz dice lo que crees que dice.

  • Comprobaciones de rastreabilidad, robots.txt y sitemap en un solo informe
  • Alrededor de 140 comprobaciones tecnicas, primero los peores problemas
  • 3 comprobaciones al dia, sin registro, sin tarjeta
Ejecutar una auditoria gratuita del sitio

Preguntas frecuentes

Que comprobaron exactamente?

Obtuvimos robots.txt de 49 dominios conocidos el 22 de agosto de 2026 y lo analizamos correctamente, agrupando lineas consecutivas de User-agent con las reglas que les siguen, y luego registramos cuales de 18 rastreadores de IA tenian su propio grupo que contenia un Disallow: / para todo el sitio. Contar una mencion del nombre de un bot no basta, porque muchos sitios nombran bots en grupos permisivos.

Cuantos sitios bloquean rastreadores de IA?

21 de 49, o 42%. Por categoria: editores 10 de 12, sitios de referencia 5 de 8, minoristas 3 de 8, SaaS 3 de 8, herramientas para desarrolladores 0 de 8 y herramientas SEO 0 de 5. Entre los sitios que bloquean algo, la lista de bloqueo promedio nombraba unos 11 rastreadores.

Que siete sitios bloquean a Anthropic pero no a OpenAI?

The Guardian, Wired, The Verge, The Washington Post, The Atlantic, Business Insider e Investopedia. Cada uno, o su empresa matriz, tiene un acuerdo de licencia de contenido con OpenAI reportado publicamente: Conde Nast posee Wired, Vox Media posee The Verge, Axel Springer posee Business Insider y Dotdash Meredith posee Investopedia.

Eso demuestra que los acuerdos causaron el cambio?

No. Medimos una correlacion en siete sitios y la comprobamos con reportes publicos sobre esos acuerdos. No podemos leer el contrato de nadie, asi que no podemos decir si el acceso de rastreadores esta escrito en el acuerdo o simplemente se desprende de la relacion. Siete de siete es lo bastante fuerte para reportarlo y no lo bastante fuerte para llamarlo prueba.

Que rastreador se bloquea con mas frecuencia?

CCBot, operado por Common Crawl, en el 90% de los sitios que bloquean. Common Crawl es una organizacion sin fines de lucro que ha archivado la web desde 2011, mucho antes de la industria actual de IA. ClaudeBot y Bytespider de ByteDance le siguen con 80%. GPTBot de OpenAI esta bloqueado por el 52%, ChatGPT-User por el 38% y OAI-SearchBot por el 33%.

Cual es la diferencia entre GPTBot y OAI-SearchBot?

En terminos generales, GPTBot recopila contenido para entrenamiento, mientras que OAI-SearchBot da soporte a la funcion de busqueda de ChatGPT, que cita y enlaza a las fuentes. Bloquear el primero y permitir el segundo es una postura coherente para la mayoria de los editores: no al entrenamiento, pero aun ser citado y enlazado. Bloquear ambos tambien te elimina de las respuestas.

Deberia bloquear rastreadores de IA en mi propio sitio?

Depende por completo de como ganas dinero. Si la gente paga para leer tu contenido, un asistente que responde en tu lugar es un competidor y bloquear es defendible. Si la gente paga para usar tu producto, un asistente que lee tu documentacion te esta ayudando a vender, que es por eso que ni una sola empresa de herramientas para desarrolladores o SEO de nuestra muestra bloqueo nada.

Puedo ejecutar esta comprobacion yo mismo?

Si, y es gratis. Anade /robots.txt a cualquier dominio y leelo. Busca los nombres de rastreadores de IA, comprueba si cada uno tiene su propio grupo con Disallow: / y anota quien falta. Hacer esto con los diez sitios mas grandes de tu sector toma unos veinte minutos y te dice mucho sobre su posicion comercial.

Lee el archivo antes de copiarlo

Cada caso de estudio de esta serie ha mirado algo que construyo una empresa. Este trata sobre algo que las empresas publicaron por accidente.

Nadie se propuso revelar su posicion negociadora en un archivo de texto plano en la raiz de su dominio. Pero los contratos tienen consecuencias tecnicas, las consecuencias tecnicas se escriben en robots.txt, y robots.txt es publico por diseno.

Asi que la proxima vez que veas circular una lista de bloqueo de IA recomendada, recuerda lo que estas mirando. No es una buena practica. Es el residuo de la negociacion de otra persona, y las partes que dejaron fuera son lo interesante.

Empieza con tu propio archivo: ejecuta una auditoria gratuita y mira que les estas diciendo actualmente a los rastreadores. La mayoria se sorprende.

Comprobado el 22 de agosto de 2026 en 49 dominios, analizando robots.txt por grupo de user-agent en lugar de por coincidencia de palabras clave, y contando solo reglas Disallow: / para todo el sitio. Las cifras completas por categoria y por rastreador estan en las preguntas frecuentes anteriores.

Los acuerdos de licencia se comprobaron con reportes publicos, no con contratos, y no se hace ninguna afirmacion sobre sus terminos. Tanto los archivos robots como los acuerdos comerciales cambian con frecuencia; vuelve a ejecutar la comprobacion antes de depender de ella.

Blog