UNmissUNmiss Empezar gratis

Plantilla de análisis de crawl budget y logs

Los motores de búsqueda tienen recursos limitados para rastrear un sitio determinado, y el rastreo desperdiciado significa que sus páginas importantes se descubren y actualizan más lentamente. Esta plantilla lo guiará a través de la extracción de registros del servidor, el análisis del comportamiento real del robot de Google, la búsqueda de desperdicios de rastreo y la mejora de la eficiencia. Úselo para hacer que cada rastreo cuente en sitios grandes o con muchos duplicados.

Formato
Word .docx editable
Longitud
6 variantes - ~6 pages
Precio
100 % gratis
Configuración
Copiar o descargar

Obtén el documento Word editable con un clic.

4.9·Gratis · Sin registro · Descarga instantánea

Funciona conSemrushSe Ranking
USEO técnico

Plantilla de análisis de crawl budget y logs

¿Es importante para usted el presupuesto de rastreo?

El presupuesto de rastreo es la cantidad de URL que un motor de búsqueda está dispuesto a rastrear y puede rastrear en su sitio durante un período determinado. Para la mayoría de los sitios pequeños y medianos, este no es un problema que valga la pena resolver. Por lo general, Google puede rastrear unos cuantos miles de URL sin esfuerzo.

Debe preocuparse por el presupuesto de rastreo principalmente si gestiona un sitio grande (cientos de miles de URL o más), un sitio que genera muchas URL duplicadas o de bajo valor, o uno donde las páginas nuevas y actualizadas tardan mucho en indexarse.

Señales de alerta que justifican este trabajo

  • Navegación por facetas o filtros que crean combinaciones interminables de URL
  • Páginas importantes no indexadas semanas después de su publicación
  • Search Console muestra muchas URL "Descubiertas – actualmente sin indexar"
  • Registros del servidor llenos de visitas de bots a parámetros, ordenación o paginación

[Site URL]: anote aquí el recuento total aproximado de URL: [Total URLs]. Si es pequeño y las páginas se indexan rápidamente, omita el resto y concéntrese en otra cosa.

Descargar plantilla gratis

6 variantes listas para usar

Copiar todo

¿Necesita esto?

Cuándo usarla: Decida si el presupuesto de rastreo es realmente un problema que vale la pena dedicarle tiempo antes de profundizar en los registros.

¿Es importante para usted el presupuesto de rastreo?

El presupuesto de rastreo es la cantidad de URL que un motor de búsqueda está dispuesto a rastrear y puede rastrear en su sitio durante un período determinado. Para la mayoría de los sitios pequeños y medianos, este no es un problema que valga la pena resolver. Por lo general, Google puede rastrear unos cuantos miles de URL sin esfuerzo.

Debe preocuparse por el presupuesto de rastreo principalmente si gestiona un sitio grande (cientos de miles de URL o más), un sitio que genera muchas URL duplicadas o de bajo valor, o uno donde las páginas nuevas y actualizadas tardan mucho en indexarse.

Señales de alerta que justifican este trabajo

  • Navegación por facetas o filtros que crean combinaciones interminables de URL
  • Páginas importantes no indexadas semanas después de su publicación
  • Search Console muestra muchas URL "Descubiertas – actualmente sin indexar"
  • Registros del servidor llenos de visitas de bots a parámetros, ordenación o paginación

[Site URL]: anote aquí el recuento total aproximado de URL: [Total URLs]. Si es pequeño y las páginas se indexan rápidamente, omita el resto y concéntrese en otra cosa.

Obtener y preparar archivos de registro

Cuándo usarla: Recopile registros de acceso al servidor sin procesar y límpielos para convertirlos en algo que realmente pueda analizar.

Dónde encontrar sus registros

Los registros de acceso al servidor son el registro más confiable de cómo los bots y los usuarios realmente visitan su sitio. Solicite a su proveedor de hosting, equipo de DevOps o CDN registros de acceso sin procesar que cubran al menos algunas semanas, idealmente un mes completo, para capturar los ciclos de rastreo normales.

Las fuentes comunes incluyen su servidor web (Apache, Nginx), su CDN (como Cloudflare o Fastly) y cualquier balanceador de carga que tengan delante. Extraiga de [Log Source] para el período [Date Range].

Prepare los datos

  1. Combine registros de todos los servidores para no perder solicitudes atendidas por diferentes máquinas.
  2. Confirme que cada línea incluya marca de tiempo, URL solicitada, código de estado, agente de usuario y dirección IP.
  3. Verifique Googlebot realizando una búsqueda DNS inversa en la IP y luego una búsqueda directa. No confíe únicamente en la cadena del agente de usuario, ya que es fácil de falsificar.
  4. Filtre los bots de motores de búsqueda verificados antes de sacar conclusiones sobre el comportamiento de rastreo.

Almacene el conjunto de datos limpio en un lugar repetible para que pueda volver a ejecutar el mismo análisis el próximo trimestre.

Analice los patrones de rastreo

Cuándo usarla: Comprenda qué rastrea realmente Googlebot, con qué frecuencia y qué códigos de estado encuentra.

Qué mirar primero

Con las solicitudes verificadas de Googlebot aisladas, cree una imagen del comportamiento de rastreo real en lugar de adivinar. Céntrese en el volumen, la frecuencia y los códigos de respuesta: estos revelan hacia dónde se dirige el esfuerzo de rastreo.

Preguntas clave para responder

  • ¿Qué URL se rastrean más? Compare las URL más rastreadas con sus páginas más importantes. Las discrepancias son una señal.
  • ¿Con qué frecuencia se rastrean las páginas clave? Las páginas de dinero deben visitarse con regularidad; las URL importantes que rara vez se rastrean se vuelven obsoletas.
  • ¿Qué códigos de estado ve Googlebot? Un sitio saludable tiene mayormente respuestas 200. Esté atento a los picos de 404, redireccionamientos 301/302 y errores de servidor 5xx.
  • ¿Qué secciones dominan? Agrupe las visitas por directorio para ver si una sección de bajo valor está consumiendo actividad de rastreo.

Registre sus hallazgos para [Top Crawled Section] y anote cualquier sección que esté sobrerastreada en relación con su valor: [Over-crawled Path].

El rastreo intenso de redirecciones o errores es un esfuerzo desperdiciado que se debe limpiar en pasos posteriores.

Encuentre el desperdicio de rastreo

Cuándo usarla: Identifique las URL de bajo valor, duplicadas y rotas que agotan los recursos de rastreo.

Dónde se pierde el presupuesto de rastreo

El desperdicio de rastreo ocurre cuando los bots dedican tiempo a URL que no deberían rastrearse en absoluto. En sitios grandes, esto puede marcar la diferencia entre que las páginas importantes se actualicen diaria o mensualmente.

Fuentes comunes de desperdicio

  • URL facetadas y con parámetros: filtros, ordenación y parámetros de seguimiento que multiplican una sola página en miles de variantes.
  • Contenido duplicado: la misma página accesible a través de múltiples URL, barras diagonales finales o rutas con mayúsculas/minúsculas.
  • Soft 404: resultados vacíos, listados caducados o páginas delgadas que devuelven 200 pero no ofrecen ningún valor.
  • Cadenas de redireccionamiento: URL que pasan por varios saltos antes de resolverse.
  • Espacios infinitos: calendarios, resultados de búsqueda e ID de sesión que generan URL casi infinitas.

A partir de su análisis de registros, enumere aquí los peores infractores: [Waste Pattern 1], [Waste Pattern 2]. Calcule la proporción de visitas de Googlebot a estas URL de bajo valor: ese número es su oportunidad. Priorice las correcciones según la cantidad de actividad de rastreo que consume cada patrón.

Mejore la eficiencia del rastreo

Cuándo usarla: Tome medidas concretas para que los motores de búsqueda inviertan su esfuerzo de rastreo en las páginas que importan.

Dirija a los rastreadores a lo que importa

Una vez que sepa dónde está el desperdicio, el objetivo es consolidar las señales y dirigir a los bots hacia URL canónicas y valiosas.

  1. Fortalezca los enlaces internos a páginas importantes para que sean fáciles de descubrir y señalen su prioridad.
  2. Mantenga limpios los mapas de sitio XML: incluya solo URL canónicas e indexables y elimine redireccionamientos, errores y páginas con noindex.
  3. Utilice robots.txt cuidadosamente para bloquear el rastreo de rutas claramente de bajo valor, como la búsqueda interna y los espacios de parámetros infinitos. Recuerde que bloquear el rastreo no es lo mismo que eliminar una URL del índice.
  4. Maneje los parámetros con etiquetas canónicas que apunten a la versión limpia y evite enlazar internamente a URL parametrizadas.
  5. Corrija las cadenas de redireccionamiento apuntando el primer salto directamente al destino final con un único 301.
  6. Resuelva los soft 404 devolviendo un 404 o 410 real, o mejorando la página para que merezca su rastreo.

Registre sus tres acciones principales: [Action 1], [Action 2], [Action 3]. Implemente los cambios gradualmente para que pueda medir su efecto.

Supervise con estadísticas de rastreo

Cuándo usarla: Realice un seguimiento del comportamiento de rastreo a lo largo del tiempo mediante Search Console y verificaciones de registros continuas.

Cierre el ciclo

La eficiencia del rastreo no es un proyecto de una sola vez. Después de realizar cambios, controle si los motores de búsqueda responden como espera.

Qué observar

  • Estadísticas de rastreo de Search Console: revise el total de solicitudes de rastreo, el tiempo de respuesta promedio y el desglose por código de respuesta, tipo de archivo y propósito (descubrimiento frente a actualización).
  • Estado del host: esté atento a problemas de disponibilidad, ya que un servidor lento o con errores hace que Google rastree menos.
  • Tendencias de códigos de estado: confirme que los errores 404, redireccionamientos y errores 5xx tienen una tendencia a la baja después de sus correcciones.
  • Informes de indexación: verifique si las páginas previamente atascadas pasan al estado indexado.

Cree una rutina

Vuelva a extraer los registros del servidor con una cadencia regular (mensual o trimestral) y compárelos con su línea base. Registre la fecha de revisión aquí: [Next Review Date] y el propietario responsable: [Owner].

Si el desperdicio vuelve a aparecer, lo detectará temprano en lugar de después de que las páginas importantes caigan del índice.

Cómo usar esta plantilla

  1. Decida si vale la pena invertir su tiempo en el presupuesto de rastreo: es importante principalmente para sitios grandes (cientos de miles de URL) o sitios con muchas URL duplicadas y de bajo valor.
  2. Solicite registros de acceso al servidor sin procesar desde su host, CDN y balanceadores de carga que abarquen al menos varias semanas, idealmente un mes completo.
  3. Limpie y combine los registros, luego verifique el robot de Google mediante DNS inverso y directo para analizar el comportamiento real del bot en lugar de agentes de usuario falsificados.
  4. Mapee los patrones de rastreo: identifique las URL y secciones más rastreadas, la frecuencia de rastreo de las páginas clave y los códigos de estado que recibe Googlebot.
  5. Busque desperdicios de rastreo, como parámetros facetados, URL duplicadas, 404 suaves, cadenas de redireccionamiento y espacios de URL infinitos.
  6. Mejore la eficiencia con enlaces internos más sólidos, mapas de sitio XML limpios, reglas robots.txt bien pensadas, etiquetas canónicas y redirecciones 301 de un solo salto.
  7. Abra las estadísticas de rastreo de Search Console para confirmar que las solicitudes de rastreo, los tiempos de respuesta y las tendencias de los códigos de estado se mueven en la dirección correcta.
  8. Establezca un cronograma recurrente para volver a extraer registros y revisar las estadísticas de rastreo para que el desperdicio no regrese lentamente.

Consejos profesionales

  • El presupuesto de rastreo es una preocupación real, principalmente para sitios grandes o con muchos duplicados; si su sitio es pequeño y las páginas se indexan rápidamente, concentre su esfuerzo en otra parte.
  • Siempre verifique el robot de Google con DNS inverso y luego directo antes de confiar en cualquier solicitud, porque la cadena del agente de usuario es trivial de falsificar.
  • Bloquear una URL en robots.txt detiene el rastreo pero no la elimina del índice; use noindex o códigos de estado adecuados cuando necesite eliminar una página.
  • Corrija las cadenas de redireccionamiento apuntando la URL original directamente al destino final con un 301 para que los bots no desperdicien saltos.

Preguntas frecuentes

¿Qué es el presupuesto de rastreo?

El presupuesto de rastreo es la cantidad de URL que un motor de búsqueda está dispuesto y es capaz de rastrear su sitio durante un período de tiempo. Depende de la carga que puede manejar su servidor y de la demanda que tienen los motores de búsqueda de su contenido.

¿Los sitios pequeños deben preocuparse por el presupuesto de rastreo?

Normalmente no. Si su sitio tiene unos cuantos miles de URL y las páginas nuevas se indexan rápidamente, el presupuesto de rastreo rara vez es un cuello de botella. Se vuelve importante en sitios grandes o sitios que generan muchas URL duplicadas o de bajo valor.

¿Por qué utilizar archivos de registro del servidor en lugar de solo herramientas de rastreo?

Los registros del servidor muestran lo que los motores de búsqueda realmente solicitaron, incluida la frecuencia, los códigos de estado y exactamente a qué URL acceden. Las herramientas de rastreo simulan un rastreo, pero los registros son la verdad sobre el comportamiento real de un bot en su sitio.

¿Cómo verifico que una solicitud sea realmente Googlebot?

Realice una búsqueda DNS inversa en la IP solicitante para confirmar que se resuelve en un dominio de Google y luego ejecute una búsqueda DNS directa en ese nombre para confirmar que se asigna nuevamente a la misma IP. Nunca confíe únicamente en la cadena del agente de usuario, ya que puede ser falsificada.

¿Cuáles son las fuentes más comunes de desperdicio de rastreo?

Parámetros de URL y navegación facetados, URL duplicadas, 404 suaves, cadenas de redireccionamiento y espacios infinitos como calendarios o resultados de búsqueda internos. Estos pueden consumir una gran parte de la actividad de rastreo en sitios grandes.

¿Dónde puedo ver las estadísticas de rastreo en Search Console?

Search Console incluye un informe de estadísticas de rastreo que muestra el total de solicitudes de rastreo, el tiempo de respuesta promedio y desgloses por código de respuesta, tipo de archivo, tipo de robot de Google y propósito. Úselo junto con su análisis de registros para realizar un seguimiento de las tendencias a lo largo del tiempo.