Plantilla de robots.txt y directivas de rastreo
Robots.txt es el primer archivo que solicitan la mayoría de los rastreadores, y una línea incorrecta puede ocultar todo tu sitio de la búsqueda. Estos patrones listos para copiar cubren las situaciones que más afectan a los propietarios de sitios, con notas en lenguaje sencillo sobre lo que hace cada directiva. Cambie los marcadores de posición entre corchetes por sus propias rutas y dominio, luego valídelos antes de realizar el envío.
- Formato
- Word .docx editable
- Longitud
- 6 variantes - ~6 pages
- Precio
- 100 % gratis
- Configuración
- Copiar o descargar
Obtén el documento Word editable con un clic.
★★★★★4.9·Gratis · Sin registro · Descarga instantánea
Plantilla de robots.txt y directivas de rastreo
Úselo cuando: tenga un sitio de producción saludable y quiera que los motores de búsqueda rastreen todo libremente y encuentren rápidamente su mapa del sitio.
Directivas
- User-agent: *
- Disallow: (deje el valor en blanco para permitir todo)
- Sitemap: [https://example.com/sitemap.xml]
Un Disallow vacío significa que no hay nada bloqueado. No necesita una línea Allow para esto; permitir por defecto es el comportamiento estándar.
Higiene opcional
- Disallow: [/wp-admin/] (bloquee una ruta de administración real si tiene una)
- Allow: [/wp-admin/admin-ajax.php]
Nota: robots.txt controla el rastreo, no la indexación. Una URL bloqueada aún puede aparecer en los resultados si otras páginas enlazan con ella. Para mantener una página fuera del índice, permita el rastreo y agregue una metaetiqueta noindex, o protéjala detrás de un inicio de sesión. Coloque el archivo en la raíz del dominio: [https://example.com/robots.txt].
6 variantes listas para usar
Copiar todoSitio de producción estándar
Cuándo usarla: Un sitio activo normal que desea un rastreo completo más un puntero de mapa del sitio.
Úselo cuando: tenga un sitio de producción saludable y quiera que los motores de búsqueda rastreen todo libremente y encuentren rápidamente su mapa del sitio.
Directivas
- User-agent: *
- Disallow: (deje el valor en blanco para permitir todo)
- Sitemap: [https://example.com/sitemap.xml]
Un Disallow vacío significa que no hay nada bloqueado. No necesita una línea Allow para esto; permitir por defecto es el comportamiento estándar.
Higiene opcional
- Disallow: [/wp-admin/] (bloquee una ruta de administración real si tiene una)
- Allow: [/wp-admin/admin-ajax.php]
Nota: robots.txt controla el rastreo, no la indexación. Una URL bloqueada aún puede aparecer en los resultados si otras páginas enlazan con ella. Para mantener una página fuera del índice, permita el rastreo y agregue una metaetiqueta noindex, o protéjala detrás de un inicio de sesión. Coloque el archivo en la raíz del dominio: [https://example.com/robots.txt].
Sitio de prueba, desarrollo o prelanzamiento
Cuándo usarla: Un entorno no público que debe mantener completamente fuera de la búsqueda.
Úselo cuando: el sitio sea un servidor de staging, una copia de desarrollo o una versión previa al lanzamiento que nadie debería encontrar en la búsqueda.
Directivas
- User-agent: *
- Disallow: /
Un único Disallow: / indica a los rastreadores compatibles que omitan todas las URL del host. Esto es intencional aquí y peligroso en cualquier otro caso.
Advertencia crítica: nunca permita que esta línea llegue a producción. El desastre de desindexación más común es un Disallow: / copiado del staging al sitio activo durante el despliegue.
Protección más sólida
- Robots.txt es una solicitud, no un bloqueo. Los rastreadores maliciosos lo ignoran.
- Agregue autenticación HTTP (un nombre de usuario y una contraseña) para que el entorno sea verdaderamente privado.
- Si agrega un noindex para todo el sitio como respaldo, no bloquee también la página con Disallow: /: una página bloqueada nunca revela su etiqueta noindex.
Nota: si ya se rastreó una URL de staging, no confíe en Disallow: / para eliminarla. Bloquear la URL también impide que Google vea una etiqueta noindex. Permita el rastreo temporalmente con noindex o utilice las herramientas de eliminación de Search Console.
Control de rastreo de comercio electrónico
Cuándo usarla: Una tienda que necesita alejar el presupuesto de rastreo de las URL de bajo valor.
Úselo cuando: una tienda genere infinitas URL de facetas, parámetros y cuentas que desperdician el presupuesto de rastreo y diluyen las señales.
Bloqueos típicos
- User-agent: *
- Disallow: [/cart]
- Disallow: [/checkout]
- Disallow: [/account/]
- Disallow: [/search] (resultados de búsqueda interna del sitio)
- Disallow: [/*?*sort=] (un parámetro de ordenación en cualquier lugar de la cadena de consulta)
- Disallow: [/*?*filter=] (filtros por facetas)
- Disallow: [/*.pdf$] (bloquea cualquier URL que termine en .pdf: $ ancla el final)
Use * para hacer coincidir cualquier secuencia y $ para anclar el final de una URL. Las rutas distinguen entre mayúsculas y minúsculas, por lo que [/Search] y [/search] son reglas diferentes.
Precaución: solo bloquee los parámetros que creen duplicados reales o páginas de poco valor. Bloquear un parámetro que cambia el contenido principal del producto (o sus URL canónicas) puede ocultar páginas que desea posicionar. Prefiera etiquetas canónicas para el contenido duplicado y reserve robots.txt para desperdicios de rastreo que nunca quiera que se recuperen.
Permitir motores de búsqueda, bloquear scrapers
Cuándo usarla: Da la bienvenida a los principales robots de búsqueda y rechaza a los rastreadores agresivos o no deseados.
Úselo cuando: quiera que Google, Bing y otros motores importantes rastreen libremente, pero desee desalentar a scrapers conocidos y bots que consumen mucho ancho de banda.
Permita los motores que quiera
- User-agent: Googlebot
- Disallow: (en blanco)
- User-agent: Bingbot
- Disallow: (en blanco)
Desaliente a un rastreador específico
- User-agent: [BadBot]
- Disallow: /
Cada bloque de User-agent se evalúa de forma independiente y un bot sigue el grupo más específico que lo nombra. Mantenga un grupo final User-agent: * para que los bots sin nombre sigan recibiendo instrucciones claras.
Para frenar los rastreadores de IA que cumplen las reglas, nómbrelos también: por ejemplo, User-agent: GPTBot con Disallow: /. Esto solo detiene a los rastreadores que eligen respetar robots.txt.
Comprobación de realidad: robots.txt es voluntario. Los motores bien comportados lo obedecen; los scrapers maliciosos y muchos rastreadores de IA lo ignoran e incluso pueden usarlo para encontrar las rutas que usted nombró. Para una aplicación efectiva, bloquee por user-agent o IP en el servidor o firewall, o utilice limitación de velocidad. Trate robots.txt como una guía, no como seguridad.
Declaración de mapa de sitio y múltiples mapas de sitio
Cuándo usarla: Apunte los rastreadores a uno o varios mapas de sitio, incluido un índice de mapa de sitio.
Úselo cuando: quiera que todos los rastreadores descubran sus mapas del sitio, especialmente en un sitio grande dividido en varios archivos.
Un solo mapa del sitio
- Sitemap: [https://example.com/sitemap.xml]
Varios mapas del sitio
- Sitemap: [https://example.com/sitemap-posts.xml]
- Sitemap: [https://example.com/sitemap-products.xml]
- Sitemap: [https://example.com/sitemap-images.xml]
O un índice de mapas del sitio
- Sitemap: [https://example.com/sitemap_index.xml]
Reglas que debe seguir:
- Enumere cada mapa del sitio en su propia línea. No hay límite en el número de líneas Sitemap, pero cada archivo de mapa del sitio individual está limitado a 50.000 URL y 50 MB sin comprimir: divida los sitios más grandes en varios archivos o en un índice de mapas del sitio.
- Utilice siempre una URL absoluta completa con el protocolo correcto (https) y el host.
- La directiva Sitemap es independiente de los grupos User-agent, así que colóquela en cualquier lugar del archivo.
- Se sigue recomendando enviar mapas del sitio en Search Console y Bing Webmaster Tools como respaldo.
Lista de verificación de control de calidad previa a la publicación
Cuándo usarla: Detecte los errores que silenciosamente desindexan un sitio antes de enviar el archivo.
Úselo cuando: esté a punto de publicar o reemplazar un archivo robots.txt y quiera evitar los errores clásicos y costosos.
Compruebe cada elemento
- Confirme que el archivo está en la raíz: [https://example.com/robots.txt]. Se ignora un archivo en una subcarpeta.
- Asegúrese de que no haya ningún Disallow: / extraviado que haya quedado del staging.
- Verifique las mayúsculas y minúsculas en cada ruta; robots.txt distingue entre mayúsculas y minúsculas.
- Compruebe que las carpetas CSS, JS y de imágenes no estén bloqueadas para que Google pueda renderizar las páginas.
- Confirme que cada línea Sitemap utilice una URL https completa que devuelva un 200.
- Esté atento a reglas Disallow: que sean más amplias de lo previsto (una barra diagonal final importa).
- Recuerde que robots.txt no desindexa; combine bloqueos con noindex o herramientas de eliminación cuando sea necesario.
- Vuelva a realizar la prueba después de cualquier actualización de CMS o plugin, que puede sobrescribir el archivo.
Prueba final: abra [https://example.com/robots.txt] en un navegador para confirmar que carga; luego valídelo con un probador de robots.txt antes y después de publicarlo.
Cómo usar esta plantilla
- Cree un archivo de texto sin formato llamado exactamente robots.txt y colóquelo en la raíz de su dominio para que se resuelva en https://yourdomain.com/robots.txt; los archivos en subcarpetas se ignoran.
- Decida su configuración predeterminada: deje Disallow en blanco para permitir el rastreo completo y agregue líneas Disallow solo para las rutas que realmente quiera mantener fuera del rastreo.
- Agrupe las reglas bajo una línea User-agent; use User-agent: * para todos los bots, o nombre un bot específico como Googlebot para darle su propio grupo.
- Escriba las rutas Disallow exactamente como aparecen en sus URL; recuerde que las rutas distinguen entre mayúsculas y minúsculas, y que una barra diagonal final cambia lo que se hace coincidir.
- Utilice comodines con cuidado: * coincide con cualquier secuencia de caracteres y $ fija el final de una URL, lo cual es útil para bloquear parámetros o tipos de archivo.
- Agregue una línea de mapa de sitio por mapa de sitio usando URL https absolutas completas, o apunte a un único archivo de índice de mapa de sitio para sitios grandes.
- Valide el archivo en un probador de robots.txt y obtenga algunas URL importantes para confirmar que todavía están permitidas antes de publicar.
- Después del lanzamiento, supervise la cobertura de Search Console y el informe de robots.txt para detectar errores de rastreo, y vuelva a revisar el archivo después de cualquier actualización de CMS, tema o plugin.
Consejos profesionales
- Nunca envíe Disallow: / en un sitio activo; esa única línea pide a los rastreadores que omitan cada URL y es la causa más común de desindexación accidental.
- Robots.txt controla el rastreo, no la indexación. Para eliminar una página de los resultados, permita el rastreo y agregue una etiqueta noindex, o protéjala mediante autenticación, en lugar de depender de Disallow.
- No bloquee directorios de CSS, JavaScript o imágenes; Google los necesita para renderizar y comprender sus páginas, y bloquearlos puede perjudicar el posicionamiento.
- Trate el archivo robots.txt como público y consultivo: cualquiera puede leerlo, los robots con buen comportamiento lo obedecen y los rastreadores maliciosos lo ignoran, así que utilice controles del lado del servidor para una protección real.
Preguntas frecuentes
¿Disallow elimina una página de Google?
No. Disallow impide que los rastreadores compatibles obtengan la página, pero una URL no permitida aún se puede indexar si otras páginas enlazan con ella. Para mantener una página fuera del índice, permita el rastreo y agregue una directiva noindex, o protéjala mediante autenticación.
¿Dónde tiene que residir el archivo robots.txt?
En la raíz de cada host, por lo que se resuelve en https://yourdomain.com/robots.txt. Se ignora un archivo robots.txt colocado en una subcarpeta. Cada subdominio y protocolo se trata por separado, por lo que las versiones https, http y www pueden necesitar cada una su propio archivo.
¿El archivo robots.txt distingue entre mayúsculas y minúsculas?
Los valores de la ruta lo son. Disallow: /Folder/ y Disallow: /folder/ coinciden con diferentes URL, así que copie las rutas exactamente como aparecen en su sitio. Los nombres de directivas como User-agent y Disallow no distinguen entre mayúsculas y minúsculas, pero lo que importa es que coincidan con las mayúsculas y minúsculas de su URL real.
¿Cuál es la diferencia entre Disallow y noindex?
Disallow controla el rastreo: solicita a los bots que no recuperen una URL. Noindex controla la indexación: pide a los motores de búsqueda que no muestren una página en los resultados. Si bloquea una página con Disallow, Google no puede ver su etiqueta noindex, por lo que para desindexar una página debe permitir el rastreo y usar noindex.
¿Cómo puedo bloquear un bot pero permitir los demás?
Dé a ese bot su propio grupo, por ejemplo User-agent: BadBot seguido de Disallow: /, y mantenga un grupo User-agent: * separado para todos los demás. Cada bot sigue el grupo más específico que lo nombra, por lo que el bot objetivo queda bloqueado mientras los demás siguen permitidos.
¿El archivo robots.txt detendrá los raspadores y los rastreadores de IA?
Solo los que eligen obedecerlo. Robots.txt es voluntario, por lo que los motores de búsqueda de confianza lo siguen, mientras que muchos scrapers y bots lo ignoran por completo. Para una aplicación efectiva, bloquee por user-agent o IP a nivel de servidor o firewall, o agregue limitación de velocidad y autenticación.