Modelo de análise de crawl budget e arquivos de log
Modelo gratuito de análise de crawl budget e arquivos de log para ver como o Googlebot rastreia seu site e corrigir o desperdício de rastreamento rapidamente.
Os mecanismos de busca têm recursos limitados para rastrear qualquer site, e o rastreamento desperdiçado significa que suas páginas importantes são descobertas e atualizadas mais lentamente. Este modelo orienta você a extrair os logs do servidor, analisar o comportamento real do Googlebot, encontrar desperdício de rastreamento e melhorar a eficiência. Use-o para fazer cada rastreamento valer a pena em sites grandes ou com muitos conteúdos duplicados.
6 variações prontas para usar
Você realmente precisa disto
Decida se o crawl budget é de fato um problema que vale seu tempo antes de mergulhar nos logs.
O crawl budget importa para você?
O crawl budget é o número de URLs que um mecanismo de busca está disposto e é capaz de rastrear no seu site em um determinado período. Para a maioria dos sites pequenos e médios, isto não é um problema que valha a pena resolver. O Google normalmente rastreia alguns milhares de URLs sem dificuldade.
Você deve se preocupar com o crawl budget principalmente se administra um site grande (centenas de milhares de URLs ou mais), um site que gera muitas URLs de baixo valor ou duplicadas, ou um em que páginas novas e atualizadas demoram muito para ser indexadas.
Sinais de alerta que justificam este trabalho
- Navegação facetada ou filtros criando combinações infinitas de URLs
- Páginas importantes não indexadas semanas após a publicação
- Search Console exibindo muitas URLs com "Detectada – atualmente não indexada"
- Logs do servidor cheios de acessos de bots a parâmetros, ordenação ou paginação
[URL do site]: anote aqui o total aproximado de URLs: [Total de URLs]. Se for pequeno e as páginas indexam rápido, pule o restante e foque em outra coisa.
Obtenha e prepare os arquivos de log
Reúna os logs brutos de acesso do servidor e limpe-os até algo que você consiga de fato analisar.
Onde encontrar seus logs
Os logs de acesso do servidor são o registro mais confiável de como bots e usuários realmente acessam seu site. Peça ao seu provedor de hospedagem, à equipe de devops ou ao seu CDN os logs de acesso brutos cobrindo ao menos algumas semanas, idealmente um mês inteiro, para capturar os ciclos normais de rastreamento.
Fontes comuns incluem seu servidor web (Apache, Nginx), seu CDN (como Cloudflare ou Fastly) e qualquer balanceador de carga à frente deles. Extraia os dados de [Fonte do log] para o período [Intervalo de datas].
Prepare os dados
- Combine os logs de todos os servidores para não perder solicitações atendidas por máquinas diferentes.
- Confirme que cada linha inclui carimbo de data/hora, URL solicitada, código de status, user agent e endereço IP.
- Verifique o Googlebot fazendo uma consulta DNS reversa no IP e depois uma consulta direta. Não confie apenas na string do user agent, pois é facilmente falsificada.
- Filtre para bots de mecanismos de busca verificados antes de tirar conclusões sobre o comportamento de rastreamento.
Armazene o conjunto de dados limpo em um local reutilizável para poder repetir a mesma análise no próximo trimestre.
Analise os padrões de rastreamento
Entenda o que o Googlebot realmente rastreia, com que frequência e quais códigos de status encontra.
O que olhar primeiro
Com as solicitações verificadas do Googlebot isoladas, monte um retrato do comportamento real de rastreamento em vez de adivinhar. Foque em volume, frequência e códigos de resposta: eles revelam para onde vai o esforço de rastreamento.
Perguntas-chave a responder
- Quais URLs são mais rastreadas? Compare as URLs mais rastreadas com suas páginas mais importantes. Discrepâncias são um sinal.
- Com que frequência as páginas-chave são rastreadas? Páginas que geram receita devem ser visitadas com regularidade; URLs importantes raramente rastreadas ficam desatualizadas.
- Quais códigos de status o Googlebot vê? Um site saudável é majoritariamente 200. Fique atento a picos de 404, redirecionamentos 301/302 e erros de servidor 5xx.
- Quais seções dominam? Agrupe os acessos por diretório para ver se alguma seção de baixo valor está consumindo a atividade de rastreamento.
Registre suas conclusões para [Seção mais rastreada] e anote qualquer seção rastreada em excesso em relação ao seu valor: [Caminho rastreado em excesso].
O rastreamento intenso de redirecionamentos ou erros é esforço desperdiçado que deve ser limpo nas etapas seguintes.
Encontre o desperdício de rastreamento
Identifique as URLs de baixo valor, duplicadas e quebradas que drenam recursos de rastreamento.
Onde o crawl budget vaza
O desperdício de rastreamento acontece quando bots gastam tempo em URLs que não deveriam ser rastreadas de forma alguma. Em sites grandes, isso pode ser a diferença entre páginas importantes serem atualizadas diariamente ou mensalmente.
Fontes comuns de desperdício
- URLs facetadas e de parâmetros: filtros, ordenação e parâmetros de rastreamento que multiplicam uma única página em milhares de variantes.
- Conteúdo duplicado: a mesma página acessível por várias URLs, barras finais ou caminhos em maiúsculas/minúsculas.
- Soft 404: resultados vazios, anúncios expirados ou páginas rasas que retornam 200 mas não oferecem valor.
- Cadeias de redirecionamento: URLs que saltam por vários trechos antes de resolver.
- Espaços infinitos: calendários, resultados de busca e IDs de sessão que geram URLs quase infinitas.
A partir da sua análise de logs, liste aqui os piores infratores: [Padrão de desperdício 1], [Padrão de desperdício 2]. Estime a fração de acessos do Googlebot que vai para essas URLs de baixo valor: esse número é sua oportunidade. Priorize as correções pelo quanto de atividade de rastreamento cada padrão consome.
Melhore a eficiência de rastreamento
Tome ações concretas para que os mecanismos de busca gastem seu esforço de rastreamento em páginas que importam.
Direcione os rastreadores ao que importa
Uma vez que você sabe onde está o desperdício, o objetivo é consolidar sinais e conduzir os bots para URLs valiosas e canônicas.
- Fortaleça os links internos para páginas importantes, de modo que sejam fáceis de descobrir e sinalizem sua prioridade.
- Mantenha os sitemaps XML limpos: inclua apenas URLs canônicas e indexáveis e remova redirecionamentos, erros e páginas noindex.
- Use o robots.txt com critério para bloquear o rastreamento de caminhos claramente de baixo valor, como busca interna e espaços infinitos de parâmetros. Lembre-se de que bloquear o rastreamento não é o mesmo que remover do índice.
- Trate os parâmetros com tags canônicas apontando para a versão limpa e evite vincular internamente a URLs parametrizadas.
- Corrija as cadeias de redirecionamento apontando o primeiro trecho diretamente para o destino final com um único 301.
- Resolva os soft 404 retornando um 404 ou 410 real, ou melhorando a página para que mereça seu rastreamento.
Registre suas três principais ações: [Ação 1], [Ação 2], [Ação 3]. Implemente as mudanças gradualmente para poder medir o efeito.
Monitore com as estatísticas de rastreamento
Acompanhe o comportamento de rastreamento ao longo do tempo usando o Search Console e verificações contínuas de log.
Feche o ciclo
A eficiência de rastreamento não é um projeto único. Depois de fazer mudanças, monitore se os mecanismos de busca respondem como você espera.
O que observar
- Estatísticas de rastreamento do Search Console: revise o total de solicitações de rastreamento, o tempo médio de resposta e a distribuição por código de resposta, tipo de arquivo e finalidade (descoberta vs. atualização).
- Status do host: fique atento a problemas de disponibilidade, pois um servidor lento ou com erros faz o Google rastrear menos.
- Tendências dos códigos de status: confirme que 404, redirecionamentos e erros 5xx estão em queda após suas correções.
- Relatórios de indexação: verifique se páginas antes travadas passam para o estado indexado.
Crie uma rotina
Reextraia os logs do servidor em uma cadência regular (mensal ou trimestral) e compare com sua linha de base. Registre aqui a data da revisão: [Data da próxima revisão] e o responsável: [Responsável].
Se o desperdício voltar a se acumular, você vai percebê-lo cedo, em vez de apenas depois que páginas importantes caem do índice.
Como usar este modelo
- Decida se o crawl budget vale seu tempo: ele importa principalmente para sites grandes (centenas de milhares de URLs) ou sites com muitas URLs duplicadas e de baixo valor.
- Solicite os logs de acesso brutos do servidor ao seu host, CDN e balanceadores de carga cobrindo ao menos várias semanas, idealmente um mês inteiro.
- Limpe e combine os logs e depois verifique o Googlebot via DNS reverso e direto para analisar o comportamento real dos bots em vez de user agents falsificados.
- Mapeie os padrões de rastreamento: identifique as URLs e seções mais rastreadas, a frequência de rastreamento das páginas-chave e os códigos de status que o Googlebot recebe.
- Cace o desperdício de rastreamento, como parâmetros facetados, URLs duplicadas, soft 404, cadeias de redirecionamento e espaços infinitos de URL.
- Melhore a eficiência com links internos mais fortes, sitemaps XML limpos, regras criteriosas de robots.txt, tags canônicas e 301 de um único salto.
- Abra as estatísticas de rastreamento do Search Console para confirmar que as solicitações de rastreamento, os tempos de resposta e as tendências dos códigos de status seguem na direção certa.
- Estabeleça um cronograma recorrente para reextrair os logs e revisar as estatísticas de rastreamento, de modo que o desperdício não retorne aos poucos.
Dicas profissionais
- O crawl budget é uma preocupação real principalmente para sites grandes ou com muitos duplicados; se o seu site é pequeno e as páginas indexam rápido, direcione seu esforço para outro lugar.
- Sempre verifique o Googlebot com DNS reverso e depois direto antes de confiar em qualquer solicitação, pois a string do user agent é trivial de falsificar.
- Bloquear uma URL no robots.txt interrompe o rastreamento, mas não a remove do índice; use noindex ou códigos de status apropriados quando precisar tirar uma página do ar.
- Corrija as cadeias de redirecionamento apontando a URL original direto para o destino final com um único 301, para que os bots não desperdicem saltos.
Perguntas frequentes
O que é crawl budget?
Crawl budget é o número de URLs que um mecanismo de busca está disposto e é capaz de rastrear no seu site ao longo de um período. Ele é moldado por quanta carga seu servidor consegue suportar e por quanta demanda os mecanismos de busca têm pelo seu conteúdo.
Sites pequenos precisam se preocupar com crawl budget?
Normalmente não. Se seu site tem alguns milhares de URLs e as páginas novas são indexadas rapidamente, o crawl budget raramente é um gargalo. Ele se torna importante em sites grandes ou sites que geram muitas URLs de baixo valor ou duplicadas.
Por que usar arquivos de log do servidor em vez de apenas ferramentas de rastreamento?
Os logs do servidor mostram o que os mecanismos de busca realmente solicitaram, incluindo frequência, códigos de status e exatamente quais URLs eles acessaram. As ferramentas de rastreamento simulam um rastreamento, mas os logs são a verdade concreta do comportamento real dos bots no seu site.
Como verifico se uma solicitação é realmente do Googlebot?
Faça uma consulta DNS reversa no IP solicitante para confirmar que ele resolve para um domínio do Google e, em seguida, execute uma consulta DNS direta nesse nome para confirmar que ele aponta de volta para o mesmo IP. Nunca confie apenas na string do user agent, pois ela pode ser falsificada.
Quais são as fontes mais comuns de desperdício de rastreamento?
Navegação facetada e parâmetros de URL, URLs duplicadas, soft 404, cadeias de redirecionamento e espaços infinitos como calendários ou resultados de busca interna. Eles podem consumir uma grande fração da atividade de rastreamento em sites grandes.
Onde vejo as estatísticas de rastreamento no Search Console?
O Search Console inclui um relatório de Estatísticas de rastreamento que mostra o total de solicitações de rastreamento, o tempo médio de resposta e as distribuições por código de resposta, tipo de arquivo, tipo de Googlebot e finalidade. Use-o junto com sua análise de logs para acompanhar tendências ao longo do tempo.