Modelo de robots.txt e diretivas de rastreamento

Padrões de robots.txt prontos para copiar para as configurações de site mais comuns, além das regras que impedem que você bloqueie o Google por acidente.

O robots.txt é o primeiro arquivo que a maioria dos rastreadores solicita, e uma única linha errada pode esconder todo o seu site da busca. Estes padrões prontos para copiar abrangem as situações que os donos de sites mais enfrentam, com notas em linguagem simples sobre o que cada diretiva faz. Substitua os marcadores entre colchetes pelos seus próprios caminhos e domínio e valide o arquivo antes de publicá-lo.

6 variações prontas para usar

Site de produção padrão

Um site no ar comum que quer rastreamento total mais um ponteiro para o sitemap.

Use quando: você opera um site de produção saudável e quer que os buscadores rastreiem tudo livremente enquanto encontram seu sitemap rapidamente.

Diretivas

  • User-agent: *
  • Disallow: (deixe o valor em branco para permitir tudo)
  • Sitemap: [https://example.com/sitemap.xml]

Um Disallow vazio significa que nada está bloqueado. Você não precisa de uma linha Allow para isso; permitir por padrão é o comportamento normal.

Higiene opcional

  • Disallow: [/wp-admin/] (bloqueie um caminho de administração real, se você tiver um)
  • Allow: [/wp-admin/admin-ajax.php]

Observação: o robots.txt controla o rastreamento, não a indexação. Uma URL bloqueada ainda pode aparecer nos resultados se outras páginas apontarem para ela. Para manter uma página fora do índice, permita o rastreamento e adicione uma meta tag noindex, ou proteja-a atrás de um login. Coloque o arquivo na raiz do domínio: [https://example.com/robots.txt].

Site de staging, dev ou pré-lançamento

Um ambiente não público que você precisa manter totalmente fora da busca.

Use quando: o site é um servidor de staging, uma cópia de desenvolvimento ou uma build de pré-lançamento que ninguém deveria encontrar na busca.

Diretivas

  • User-agent: *
  • Disallow: /

Um único Disallow: / diz aos rastreadores em conformidade para ignorar todas as URLs do host. Aqui isso é intencional e, em qualquer outro lugar, perigoso.

Aviso crítico: nunca deixe esta linha chegar à produção. O desastre de desindexação mais comum é um Disallow: / copiado do staging para o site no ar durante o deploy.

Proteção mais forte

  • O robots.txt é um pedido, não uma tranca. Rastreadores mal-intencionados o ignoram.
  • Adicione autenticação HTTP (usuário e senha) para que o ambiente seja de fato privado.
  • Se você adicionar um noindex em todo o site como backup, não bloqueie também a página com Disallow: /: uma página bloqueada nunca revela sua tag noindex.

Observação: se uma URL de staging já foi rastreada, não confie no Disallow: / para removê-la. Bloquear a URL também impede o Google de ver uma tag noindex. Permita o rastreamento temporariamente com noindex, ou use as ferramentas de remoção no Search Console.

Controle de rastreamento para e-commerce

Uma loja que precisa desviar o orçamento de rastreamento de URLs de baixo valor.

Use quando: uma loja gera infinitas URLs de facetas, parâmetros e conta que desperdiçam o orçamento de rastreamento e diluem os sinais.

Bloqueios típicos

  • User-agent: *
  • Disallow: [/cart]
  • Disallow: [/checkout]
  • Disallow: [/account/]
  • Disallow: [/search] (resultados da busca interna do site)
  • Disallow: [/*?*sort=] (um parâmetro de ordenação em qualquer lugar da query string)
  • Disallow: [/*?*filter=] (filtros de facetas)
  • Disallow: [/*.pdf$] (bloquear qualquer URL que termine em .pdf: $ ancora o fim)

Use * para corresponder a qualquer sequência e $ para ancorar o fim de uma URL. Os caminhos diferenciam maiúsculas de minúsculas, então [/Search] e [/search] são regras diferentes.

Cuidado: bloqueie apenas parâmetros que criem duplicatas verdadeiras ou páginas rasas. Bloquear um parâmetro que altera o conteúdo principal do produto (ou suas URLs canônicas) pode esconder páginas que você quer que ranqueiem. Prefira tags canônicas para conteúdo duplicado e reserve o robots.txt para o desperdício de rastreamento que você nunca quer que seja buscado.

Permitir buscadores, bloquear scrapers

Receber os grandes bots de busca enquanto afasta rastreadores agressivos ou indesejados.

Use quando: você quer que Google, Bing e outros grandes buscadores rastreiem livremente, mas quer desencorajar scrapers conhecidos e bots que consomem muita banda.

Permita os buscadores que você quer

  • User-agent: Googlebot
  • Disallow: (em branco)
  • User-agent: Bingbot
  • Disallow: (em branco)

Desencoraje um rastreador específico

  • User-agent: [BadBot]
  • Disallow: /

Cada bloco User-agent é avaliado de forma independente, e um bot segue o grupo mais específico que o nomeia. Mantenha um grupo User-agent: * final para que bots não nomeados também recebam instruções claras.

Para conter rastreadores de IA em conformidade, nomeie-os também: por exemplo, User-agent: GPTBot com Disallow: /. Isso só detém rastreadores que optam por respeitar o robots.txt.

Verificação da realidade: o robots.txt é voluntário. Buscadores de bom comportamento o obedecem; scrapers maliciosos e muitos rastreadores de IA o ignoram e podem até usá-lo para encontrar caminhos que você nomeou. Para imposição real, bloqueie por user-agent ou IP no servidor ou firewall, ou use limitação de taxa. Trate o robots.txt como orientação, não como segurança.

Declaração de sitemap e de múltiplos sitemaps

Apontar os rastreadores para um ou vários sitemaps, incluindo um índice de sitemap.

Use quando: você quer que todo rastreador descubra seus sitemaps, especialmente em um site grande dividido em vários arquivos.

Sitemap único

  • Sitemap: [https://example.com/sitemap.xml]

Múltiplos sitemaps

  • Sitemap: [https://example.com/sitemap-posts.xml]
  • Sitemap: [https://example.com/sitemap-products.xml]
  • Sitemap: [https://example.com/sitemap-images.xml]

Ou um índice de sitemap

  • Sitemap: [https://example.com/sitemap_index.xml]

Regras a seguir:

  • Liste cada sitemap em sua própria linha. Não há limite para o número de linhas Sitemap, mas cada arquivo de sitemap individual é limitado a 50.000 URLs e 50 MB descompactado: divida sites maiores em vários arquivos ou em um índice de sitemap.
  • Sempre use uma URL absoluta completa com o protocolo (https) e host corretos.
  • A diretiva Sitemap é independente dos grupos User-agent, então coloque-a em qualquer lugar do arquivo.
  • Enviar os sitemaps no Search Console e no Bing Webmaster Tools ainda é recomendado como backup.

Checklist de QA antes de publicar

Pegue os erros que desindexam um site em silêncio antes de você publicar o arquivo.

Use quando: você está prestes a publicar ou substituir um arquivo robots.txt e quer evitar os erros clássicos e caros.

Verifique cada item

  1. Confirme que o arquivo está na raiz: [https://example.com/robots.txt]. Um arquivo em uma subpasta é ignorado.
  2. Certifique-se de que não sobrou nenhum Disallow: / perdido do staging.
  3. Verifique as maiúsculas e minúsculas em cada caminho; o robots.txt diferencia maiúsculas de minúsculas.
  4. Confira que as pastas de CSS, JS e imagens não estão bloqueadas, para que o Google possa renderizar as páginas.
  5. Confirme que cada linha Sitemap usa uma URL https completa que retorna um 200.
  6. Fique atento a regras Disallow: mais amplas do que o pretendido (uma barra final faz diferença).
  7. Lembre-se de que o robots.txt não desindexa; combine os bloqueios com noindex ou ferramentas de remoção quando necessário.
  8. Teste novamente após qualquer atualização de CMS ou plugin, que pode sobrescrever o arquivo.

Teste final: acesse [https://example.com/robots.txt] em um navegador para confirmar que carrega, depois valide-o com um testador de robots.txt antes e depois de ir ao ar.

Como usar este modelo

  1. Crie um arquivo de texto simples com o nome exato robots.txt e coloque-o na raiz do domínio para que ele resolva em https://yourdomain.com/robots.txt; arquivos em subpastas são ignorados.
  2. Defina o seu padrão: deixe o Disallow em branco para permitir rastreamento total e adicione linhas Disallow apenas para os caminhos que você realmente quer manter fora do rastreamento.
  3. Agrupe as regras sob uma linha User-agent; use User-agent: * para todos os bots ou nomeie um bot específico como o Googlebot para dar a ele seu próprio grupo.
  4. Escreva os caminhos Disallow exatamente como aparecem nas suas URLs, lembrando que os caminhos diferenciam maiúsculas de minúsculas e uma barra final muda o que é correspondido.
  5. Use curingas com cuidado: * corresponde a qualquer sequência de caracteres e $ ancora o fim de uma URL, o que é útil para bloquear parâmetros ou tipos de arquivo.
  6. Adicione uma linha Sitemap por sitemap usando URLs https absolutas completas, ou aponte para um único arquivo de índice de sitemap para sites grandes.
  7. Valide o arquivo em um testador de robots.txt e acesse algumas URLs importantes para confirmar que ainda estão permitidas antes de publicar.
  8. Após o lançamento, monitore a cobertura no Search Console e o relatório de robots.txt em busca de erros de rastreamento, e reveja o arquivo após qualquer atualização de CMS, tema ou plugin.

Dicas profissionais

  • Nunca publique Disallow: / em um site no ar; essa única linha pede aos rastreadores que ignorem todas as URLs e é a causa mais comum de desindexação acidental.
  • O robots.txt controla o rastreamento, não a indexação. Para remover uma página dos resultados, permita o rastreamento e adicione uma tag noindex, ou proteja-a atrás de autenticação, em vez de confiar no Disallow.
  • Não bloqueie diretórios de CSS, JavaScript ou imagens; o Google precisa deles para renderizar e entender suas páginas, e bloqueá-los pode prejudicar as posições.
  • Trate o robots.txt como público e consultivo: qualquer um pode lê-lo, bots de bom comportamento o obedecem e rastreadores maliciosos o ignoram, então use controles no servidor para proteção real.

Perguntas frequentes

O Disallow remove uma página do Google?

Não. O Disallow impede que rastreadores em conformidade busquem a página, mas uma URL bloqueada ainda pode ser indexada se outras páginas apontarem para ela. Para manter uma página fora do índice, permita o rastreamento e adicione uma diretiva noindex, ou proteja-a atrás de autenticação.

Onde o arquivo robots.txt precisa ficar?

Na raiz de cada host, para que resolva em https://yourdomain.com/robots.txt. Um robots.txt colocado em uma subpasta é ignorado. Cada subdomínio e protocolo é tratado separadamente, então as versões https, http e www podem precisar cada uma do seu próprio arquivo.

O robots.txt diferencia maiúsculas de minúsculas?

Os valores dos caminhos, sim. Disallow: /Folder/ e Disallow: /folder/ correspondem a URLs diferentes, então copie os caminhos exatamente como aparecem no seu site. Nomes de diretivas como User-agent e Disallow não diferenciam maiúsculas de minúsculas, mas o que importa é corresponder às maiúsculas e minúsculas reais das suas URLs.

Qual é a diferença entre Disallow e noindex?

O Disallow controla o rastreamento: ele pede aos bots que não busquem uma URL. O noindex controla a indexação: ele pede aos buscadores que não mostrem uma página nos resultados. Se você usar Disallow em uma página, o Google não consegue ver a tag noindex dela, então, para desindexar uma página, você precisa permitir o rastreamento e usar noindex.

Como bloqueio um bot mas permito os outros?

Dê a esse bot seu próprio grupo, por exemplo User-agent: BadBot seguido de Disallow: /, e mantenha um grupo User-agent: * separado para todos os demais. Cada bot segue o grupo mais específico que o nomeia, então o bot visado é bloqueado enquanto os outros continuam permitidos.

O robots.txt vai deter scrapers e rastreadores de IA?

Apenas os que optam por obedecê-lo. O robots.txt é voluntário, então buscadores respeitáveis o seguem enquanto muitos scrapers e bots o ignoram por completo. Para imposição real, bloqueie por user-agent ou IP no nível do servidor ou firewall, ou adicione limitação de taxa e autenticação.