Modelo de robots.txt e diretivas de rastreamento
Padrões de robots.txt prontos para copiar para as configurações de site mais comuns, além das regras que impedem que você bloqueie o Google por acidente.
O robots.txt é o primeiro arquivo que a maioria dos rastreadores solicita, e uma única linha errada pode esconder todo o seu site da busca. Estes padrões prontos para copiar abrangem as situações que os donos de sites mais enfrentam, com notas em linguagem simples sobre o que cada diretiva faz. Substitua os marcadores entre colchetes pelos seus próprios caminhos e domínio e valide o arquivo antes de publicá-lo.
6 variações prontas para usar
Site de produção padrão
Um site no ar comum que quer rastreamento total mais um ponteiro para o sitemap.
Use quando: você opera um site de produção saudável e quer que os buscadores rastreiem tudo livremente enquanto encontram seu sitemap rapidamente.
Diretivas
- User-agent: *
- Disallow: (deixe o valor em branco para permitir tudo)
- Sitemap: [https://example.com/sitemap.xml]
Um Disallow vazio significa que nada está bloqueado. Você não precisa de uma linha Allow para isso; permitir por padrão é o comportamento normal.
Higiene opcional
- Disallow: [/wp-admin/] (bloqueie um caminho de administração real, se você tiver um)
- Allow: [/wp-admin/admin-ajax.php]
Observação: o robots.txt controla o rastreamento, não a indexação. Uma URL bloqueada ainda pode aparecer nos resultados se outras páginas apontarem para ela. Para manter uma página fora do índice, permita o rastreamento e adicione uma meta tag noindex, ou proteja-a atrás de um login. Coloque o arquivo na raiz do domínio: [https://example.com/robots.txt].
Site de staging, dev ou pré-lançamento
Um ambiente não público que você precisa manter totalmente fora da busca.
Use quando: o site é um servidor de staging, uma cópia de desenvolvimento ou uma build de pré-lançamento que ninguém deveria encontrar na busca.
Diretivas
- User-agent: *
- Disallow: /
Um único Disallow: / diz aos rastreadores em conformidade para ignorar todas as URLs do host. Aqui isso é intencional e, em qualquer outro lugar, perigoso.
Aviso crítico: nunca deixe esta linha chegar à produção. O desastre de desindexação mais comum é um Disallow: / copiado do staging para o site no ar durante o deploy.
Proteção mais forte
- O robots.txt é um pedido, não uma tranca. Rastreadores mal-intencionados o ignoram.
- Adicione autenticação HTTP (usuário e senha) para que o ambiente seja de fato privado.
- Se você adicionar um noindex em todo o site como backup, não bloqueie também a página com Disallow: /: uma página bloqueada nunca revela sua tag noindex.
Observação: se uma URL de staging já foi rastreada, não confie no Disallow: / para removê-la. Bloquear a URL também impede o Google de ver uma tag noindex. Permita o rastreamento temporariamente com noindex, ou use as ferramentas de remoção no Search Console.
Controle de rastreamento para e-commerce
Uma loja que precisa desviar o orçamento de rastreamento de URLs de baixo valor.
Use quando: uma loja gera infinitas URLs de facetas, parâmetros e conta que desperdiçam o orçamento de rastreamento e diluem os sinais.
Bloqueios típicos
- User-agent: *
- Disallow: [/cart]
- Disallow: [/checkout]
- Disallow: [/account/]
- Disallow: [/search] (resultados da busca interna do site)
- Disallow: [/*?*sort=] (um parâmetro de ordenação em qualquer lugar da query string)
- Disallow: [/*?*filter=] (filtros de facetas)
- Disallow: [/*.pdf$] (bloquear qualquer URL que termine em .pdf: $ ancora o fim)
Use * para corresponder a qualquer sequência e $ para ancorar o fim de uma URL. Os caminhos diferenciam maiúsculas de minúsculas, então [/Search] e [/search] são regras diferentes.
Cuidado: bloqueie apenas parâmetros que criem duplicatas verdadeiras ou páginas rasas. Bloquear um parâmetro que altera o conteúdo principal do produto (ou suas URLs canônicas) pode esconder páginas que você quer que ranqueiem. Prefira tags canônicas para conteúdo duplicado e reserve o robots.txt para o desperdício de rastreamento que você nunca quer que seja buscado.
Permitir buscadores, bloquear scrapers
Receber os grandes bots de busca enquanto afasta rastreadores agressivos ou indesejados.
Use quando: você quer que Google, Bing e outros grandes buscadores rastreiem livremente, mas quer desencorajar scrapers conhecidos e bots que consomem muita banda.
Permita os buscadores que você quer
- User-agent: Googlebot
- Disallow: (em branco)
- User-agent: Bingbot
- Disallow: (em branco)
Desencoraje um rastreador específico
- User-agent: [BadBot]
- Disallow: /
Cada bloco User-agent é avaliado de forma independente, e um bot segue o grupo mais específico que o nomeia. Mantenha um grupo User-agent: * final para que bots não nomeados também recebam instruções claras.
Para conter rastreadores de IA em conformidade, nomeie-os também: por exemplo, User-agent: GPTBot com Disallow: /. Isso só detém rastreadores que optam por respeitar o robots.txt.
Verificação da realidade: o robots.txt é voluntário. Buscadores de bom comportamento o obedecem; scrapers maliciosos e muitos rastreadores de IA o ignoram e podem até usá-lo para encontrar caminhos que você nomeou. Para imposição real, bloqueie por user-agent ou IP no servidor ou firewall, ou use limitação de taxa. Trate o robots.txt como orientação, não como segurança.
Declaração de sitemap e de múltiplos sitemaps
Apontar os rastreadores para um ou vários sitemaps, incluindo um índice de sitemap.
Use quando: você quer que todo rastreador descubra seus sitemaps, especialmente em um site grande dividido em vários arquivos.
Sitemap único
- Sitemap: [https://example.com/sitemap.xml]
Múltiplos sitemaps
- Sitemap: [https://example.com/sitemap-posts.xml]
- Sitemap: [https://example.com/sitemap-products.xml]
- Sitemap: [https://example.com/sitemap-images.xml]
Ou um índice de sitemap
- Sitemap: [https://example.com/sitemap_index.xml]
Regras a seguir:
- Liste cada sitemap em sua própria linha. Não há limite para o número de linhas Sitemap, mas cada arquivo de sitemap individual é limitado a 50.000 URLs e 50 MB descompactado: divida sites maiores em vários arquivos ou em um índice de sitemap.
- Sempre use uma URL absoluta completa com o protocolo (https) e host corretos.
- A diretiva Sitemap é independente dos grupos User-agent, então coloque-a em qualquer lugar do arquivo.
- Enviar os sitemaps no Search Console e no Bing Webmaster Tools ainda é recomendado como backup.
Checklist de QA antes de publicar
Pegue os erros que desindexam um site em silêncio antes de você publicar o arquivo.
Use quando: você está prestes a publicar ou substituir um arquivo robots.txt e quer evitar os erros clássicos e caros.
Verifique cada item
- Confirme que o arquivo está na raiz: [https://example.com/robots.txt]. Um arquivo em uma subpasta é ignorado.
- Certifique-se de que não sobrou nenhum Disallow: / perdido do staging.
- Verifique as maiúsculas e minúsculas em cada caminho; o robots.txt diferencia maiúsculas de minúsculas.
- Confira que as pastas de CSS, JS e imagens não estão bloqueadas, para que o Google possa renderizar as páginas.
- Confirme que cada linha Sitemap usa uma URL https completa que retorna um 200.
- Fique atento a regras Disallow: mais amplas do que o pretendido (uma barra final faz diferença).
- Lembre-se de que o robots.txt não desindexa; combine os bloqueios com noindex ou ferramentas de remoção quando necessário.
- Teste novamente após qualquer atualização de CMS ou plugin, que pode sobrescrever o arquivo.
Teste final: acesse [https://example.com/robots.txt] em um navegador para confirmar que carrega, depois valide-o com um testador de robots.txt antes e depois de ir ao ar.
Como usar este modelo
- Crie um arquivo de texto simples com o nome exato robots.txt e coloque-o na raiz do domínio para que ele resolva em https://yourdomain.com/robots.txt; arquivos em subpastas são ignorados.
- Defina o seu padrão: deixe o Disallow em branco para permitir rastreamento total e adicione linhas Disallow apenas para os caminhos que você realmente quer manter fora do rastreamento.
- Agrupe as regras sob uma linha User-agent; use User-agent: * para todos os bots ou nomeie um bot específico como o Googlebot para dar a ele seu próprio grupo.
- Escreva os caminhos Disallow exatamente como aparecem nas suas URLs, lembrando que os caminhos diferenciam maiúsculas de minúsculas e uma barra final muda o que é correspondido.
- Use curingas com cuidado: * corresponde a qualquer sequência de caracteres e $ ancora o fim de uma URL, o que é útil para bloquear parâmetros ou tipos de arquivo.
- Adicione uma linha Sitemap por sitemap usando URLs https absolutas completas, ou aponte para um único arquivo de índice de sitemap para sites grandes.
- Valide o arquivo em um testador de robots.txt e acesse algumas URLs importantes para confirmar que ainda estão permitidas antes de publicar.
- Após o lançamento, monitore a cobertura no Search Console e o relatório de robots.txt em busca de erros de rastreamento, e reveja o arquivo após qualquer atualização de CMS, tema ou plugin.
Dicas profissionais
- Nunca publique Disallow: / em um site no ar; essa única linha pede aos rastreadores que ignorem todas as URLs e é a causa mais comum de desindexação acidental.
- O robots.txt controla o rastreamento, não a indexação. Para remover uma página dos resultados, permita o rastreamento e adicione uma tag noindex, ou proteja-a atrás de autenticação, em vez de confiar no Disallow.
- Não bloqueie diretórios de CSS, JavaScript ou imagens; o Google precisa deles para renderizar e entender suas páginas, e bloqueá-los pode prejudicar as posições.
- Trate o robots.txt como público e consultivo: qualquer um pode lê-lo, bots de bom comportamento o obedecem e rastreadores maliciosos o ignoram, então use controles no servidor para proteção real.
Perguntas frequentes
O Disallow remove uma página do Google?
Não. O Disallow impede que rastreadores em conformidade busquem a página, mas uma URL bloqueada ainda pode ser indexada se outras páginas apontarem para ela. Para manter uma página fora do índice, permita o rastreamento e adicione uma diretiva noindex, ou proteja-a atrás de autenticação.
Onde o arquivo robots.txt precisa ficar?
Na raiz de cada host, para que resolva em https://yourdomain.com/robots.txt. Um robots.txt colocado em uma subpasta é ignorado. Cada subdomínio e protocolo é tratado separadamente, então as versões https, http e www podem precisar cada uma do seu próprio arquivo.
O robots.txt diferencia maiúsculas de minúsculas?
Os valores dos caminhos, sim. Disallow: /Folder/ e Disallow: /folder/ correspondem a URLs diferentes, então copie os caminhos exatamente como aparecem no seu site. Nomes de diretivas como User-agent e Disallow não diferenciam maiúsculas de minúsculas, mas o que importa é corresponder às maiúsculas e minúsculas reais das suas URLs.
Qual é a diferença entre Disallow e noindex?
O Disallow controla o rastreamento: ele pede aos bots que não busquem uma URL. O noindex controla a indexação: ele pede aos buscadores que não mostrem uma página nos resultados. Se você usar Disallow em uma página, o Google não consegue ver a tag noindex dela, então, para desindexar uma página, você precisa permitir o rastreamento e usar noindex.
Como bloqueio um bot mas permito os outros?
Dê a esse bot seu próprio grupo, por exemplo User-agent: BadBot seguido de Disallow: /, e mantenha um grupo User-agent: * separado para todos os demais. Cada bot segue o grupo mais específico que o nomeia, então o bot visado é bloqueado enquanto os outros continuam permitidos.
O robots.txt vai deter scrapers e rastreadores de IA?
Apenas os que optam por obedecê-lo. O robots.txt é voluntário, então buscadores respeitáveis o seguem enquanto muitos scrapers e bots o ignoram por completo. Para imposição real, bloqueie por user-agent ou IP no nível do servidor ou firewall, ou adicione limitação de taxa e autenticação.