Googlebot. No ecossistema Microsoft, o Bingbot precisa conseguir rastrear as páginas públicas. Para o ChatGPT Search, a OpenAI orienta permitir OAI-SearchBot. Para o Claude, os principais agentes ligados à busca e ao acesso solicitado pelo usuário são Claude-SearchBot e Claude-User. Bots associados a treinamento podem ser tratados separadamente.
O arquivo robots.txt existe há décadas, mas a expansão dos mecanismos de busca baseados em inteligência artificial transformou uma configuração antes tratada como detalhe técnico em uma decisão estratégica.
Hoje, um mesmo site pode receber acessos de robôs com finalidades diferentes: indexar páginas para mecanismos de busca, encontrar fontes para respostas generativas, recuperar uma página solicitada por um usuário ou coletar conteúdo que poderá contribuir para o treinamento de futuros modelos.
O problema é que essas funções são frequentemente misturadas. Algumas empresas bloqueiam todos os “bots de IA” acreditando que estão apenas impedindo treinamento e, sem perceber, reduzem a capacidade de suas páginas serem encontradas e citadas. Outras liberam tudo sem entender o que cada agente faz.
Para uma estratégia de SEO, GEO e visibilidade nas respostas de IA, a pergunta correta não é simplesmente “devo liberar ou bloquear a inteligência artificial?”. A pergunta é: qual robô quero permitir, para qual finalidade e em quais partes do site?
Googlebot, Bingbot, OAI-SearchBot e Claude-SearchBot precisam de acesso ao conteúdo público que você deseja tornar encontrável.
GPTBot, ClaudeBot e Google-Extended possuem finalidades diferentes da indexação tradicional e podem exigir uma política própria.
Conteúdo privado deve ser protegido por autenticação ou outro controle de acesso. Robots.txt é um sinal para crawlers compatíveis.
O que é robots.txt e o que ele realmente controla?
O robots.txt é um arquivo de texto publicado na raiz de um domínio, normalmente acessível em um endereço como:
https://seudominio.com.br/robots.txtEle informa aos crawlers compatíveis quais caminhos podem ou não ser rastreados. Uma regra simples pode impedir que um bot visite uma seção inteira:
User-agent: ExampleBot
Disallow: /area-restrita/O ponto mais importante é entender que robots.txt controla principalmente rastreamento, não privacidade.
O Google alerta que uma URL bloqueada no robots.txt ainda pode ser descoberta por links externos e, em algumas situações, aparecer nos resultados sem que seu conteúdo tenha sido rastreado.
As quatro diretivas mais importantes
| Diretiva | Função | Exemplo |
|---|---|---|
| User-agent | Define a qual crawler o grupo de regras se aplica. | User-agent: Googlebot |
| Disallow | Indica um caminho que o crawler não deve acessar. | Disallow: /wp-admin/ |
| Allow | Libera um caminho específico dentro de uma área mais ampla bloqueada. | Allow: /wp-admin/admin-ajax.php |
| Sitemap | Informa a localização completa do sitemap XML. | Sitemap: https://exemplo.com/sitemap_index.xml |
O Google documenta suporte a User-agent, Allow, Disallow e Sitemap. A diretiva Crawl-delay, por exemplo, não é suportada pelo Google, embora outros crawlers possam interpretá-la.
Busca, resposta generativa e treinamento não são a mesma coisa
Esta é a distinção mais importante do artigo. Um crawler associado a uma empresa de IA não significa necessariamente que ele esteja coletando conteúdo para treinamento. Plataformas diferentes passaram a documentar agentes separados justamente para permitir maior controle ao proprietário do site.
| Finalidade | O que acontece | Exemplos |
|---|---|---|
| Busca e indexação | O crawler descobre e processa páginas para um índice ou experiência de pesquisa. | Googlebot, Bingbot, OAI-SearchBot, Claude-SearchBot |
| Acesso solicitado pelo usuário | O sistema recupera uma página durante uma ação iniciada por uma pessoa. | Claude-User e outros agentes/fetchers específicos |
| Treinamento ou desenvolvimento | Conteúdo pode ser coletado para contribuir com futuros modelos. | GPTBot, ClaudeBot e usos controlados por Google-Extended |
| Grounding | O modelo recebe informação recuperada de fontes externas para responder com maior atualidade e factualidade. | Google-Extended controla determinados usos de grounding no ecossistema Gemini |
Google-Extended controla tanto determinados usos de treinamento quanto grounding no ecossistema Gemini, embora não controle a inclusão no Google Search.Googlebot e Google-Extended: não confunda os dois
Para aparecer na Pesquisa Google, inclusive como link de apoio em AI Overviews e AI Mode, a página precisa estar indexada e elegível para aparecer nos resultados com um snippet.
O controle de rastreamento para essas experiências é o Googlebot. O Google afirma que não existem requisitos técnicos extras exclusivos para AI Overviews ou AI Mode.
Googlebot
É o crawler principal do Google Search. As preferências destinadas ao Googlebot afetam a Pesquisa e seus recursos, incluindo as experiências de IA integradas à busca.
Google-Extended
É um token de controle no robots.txt. Ele não possui um user-agent HTTP próprio e não afeta a inclusão nem o ranking do site no Google Search.
Então para que serve Google-Extended?
Segundo a documentação atual do Google, Google-Extended permite ao proprietário controlar se conteúdo rastreado pelo Google pode ser utilizado:
- no treinamento de futuras gerações de modelos Gemini;
- em determinados usos de grounding nas Gemini Apps;
- em Grounding with Google Search no Vertex AI.
A documentação esclarece que bloquear Google-Extended não retira uma página do Google Search e não é um sinal de ranking.
User-agent: Google-Extended
Disallow: /Bingbot, Microsoft Copilot e as respostas de IA do Bing
No ecossistema Microsoft, o Bingbot é o principal crawler do Bing. Se a empresa deseja manter páginas no índice e participar das experiências de busca alimentadas pelo Bing, conteúdos públicos importantes precisam estar rastreáveis.
O Bing Webmaster Tools possui um painel de AI Performance para medir citações em respostas de inteligência artificial, incluindo Microsoft Copilot, resumos gerados no Bing e integrações selecionadas.
A Microsoft afirma que respeita preferências de proprietários de conteúdo expressas por robots.txt e outros mecanismos suportados. O Bing Webmaster Tools também oferece um teste de robots.txt para verificar se o Bingbot consegue acessar URLs importantes.
User-agent: Bingbot
Disallow: /conteudo-nao-publico/Na maioria dos sites empresariais, porém, não há motivo para criar um grupo especial para Bingbot. Um bloco genérico bem configurado para todos os crawlers costuma ser mais simples e reduzir o risco de regras conflitantes.
ChatGPT: OAI-SearchBot e GPTBot possuem finalidades diferentes
A OpenAI separa explicitamente o rastreamento usado para busca daquele associado ao possível treinamento de modelos.
OAI-SearchBot
A OpenAI orienta proprietários de sites a não bloquear este agente quando desejam que o conteúdo possa ser descoberto, exibido, citado e vinculado em resultados de busca do ChatGPT.
GPTBot
É o agente que os editores podem bloquear em páginas que desejam excluir de potencial uso em treinamento futuro, conforme as orientações da OpenAI.
Isso permite uma política relativamente simples: permitir que a empresa seja encontrada no ChatGPT Search, mas bloquear GPTBot se a organização não quiser disponibilizar o conteúdo para potencial treinamento.
# OAI-SearchBot continua sujeito às regras públicas do grupo *
# Não crie um bloqueio específico para ele.
User-agent: GPTBot
Disallow: /User-agent: * já permite o conteúdo público, não é necessário criar Allow: / para OAI-SearchBot. Evitar grupos redundantes diminui o risco de liberar acidentalmente caminhos que deveriam continuar bloqueados.A OpenAI também informa que, em determinadas situações, uma URL bloqueada para rastreamento pode ser obtida de outra fonte e ter somente o link e o título apresentados. Quando a intenção é impedir que a página apareça, controles de indexação como noindex são mais apropriados — desde que o crawler consiga acessar a página para ler a diretiva.
Claude: Claude-SearchBot, Claude-User e ClaudeBot
A Anthropic documenta três agentes principais com funções distintas.
Claude-SearchBot
Navega pela web para melhorar a relevância e a precisão dos resultados de busca. Bloqueá-lo pode reduzir a visibilidade do site nas experiências de pesquisa do Claude.
Claude-User
Pode acessar páginas quando um usuário pede ao Claude que recupere conteúdo da web. Bloqueá-lo limita esse acesso iniciado pelo usuário.
ClaudeBot
Coleta conteúdo público que pode contribuir para o desenvolvimento e treinamento dos modelos da Anthropic.
Controle de frequência
A Anthropic informa que seus bots suportam a extensão não padronizada Crawl-delay quando for necessário reduzir a frequência das solicitações.
# Claude-SearchBot e Claude-User permanecem sujeitos ao grupo *
# e continuam podendo acessar o conteúdo público permitido.
User-agent: ClaudeBot
Disallow: /Modelo de robots.txt para WordPress com foco em SEO, GEO e IA
Não existe um robots.txt universal para todos os sites. Um e-commerce, um portal, um site institucional e uma área de membros têm necessidades diferentes.
Ainda assim, o exemplo abaixo mostra uma estrutura conservadora para um site WordPress empresarial que deseja:
- manter páginas públicas acessíveis para Google, Bing, ChatGPT e Claude;
- evitar rastreamento de áreas administrativas e transacionais sem valor de busca;
- informar o sitemap;
- bloquear GPTBot e ClaudeBot para treinamento;
- manter Google-Extended liberado para não reduzir os usos de grounding controlados por esse token.
# ============================================================
# robots.txt — exemplo para WordPress
# SEO + GEO + mecanismos de busca e IA
# Ajuste os caminhos ao seu site antes de publicar
# ============================================================
User-agent: *
# Área administrativa
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
# Endpoints sem valor de indexação
Disallow: /wp-login.php
Disallow: /xmlrpc.php
# Busca interna e parâmetros comuns
Disallow: /search/
Disallow: /*?s=
Disallow: /*?replytocom=
# WooCommerce — use somente se essas URLs existirem
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /order-received/
Disallow: /*?add-to-cart=
# ------------------------------------------------------------
# Política de treinamento
# Busca do ChatGPT permanece disponível via OAI-SearchBot
# ------------------------------------------------------------
User-agent: GPTBot
Disallow: /
# Busca do Claude permanece disponível via Claude-SearchBot
# e acesso solicitado pelo usuário via Claude-User
User-agent: ClaudeBot
Disallow: /
# ------------------------------------------------------------
# Sitemap
# ------------------------------------------------------------
Sitemap: https://www.seudominio.com.br/sitemap_index.xmlE o Google-Extended?
No modelo acima, ele não é bloqueado. Isso maximiza a abertura do conteúdo público para os usos de Gemini e grounding controlados por esse token.
Se a política da organização for impedir esses usos, adicione:
User-agent: Google-Extended
Disallow: /E se eu quiser permitir também treinamento pela OpenAI e Anthropic?
Nesse caso, simplesmente não inclua os grupos de bloqueio para GPTBot e ClaudeBot. Se o grupo User-agent: * permite as páginas públicas, esses agentes poderão seguir as regras gerais.
Allow: / apenas para “provar” que cada IA está liberada. Se o bot respeita robots.txt e não existe bloqueio específico, ele normalmente seguirá o grupo aplicável. Quanto mais regras redundantes, maior o risco de conflito ou manutenção incompleta.Robots.txt, noindex e X-Robots-Tag: qual usar?
Um dos erros mais comuns é tratar Disallow e noindex como se fossem a mesma coisa.
| Objetivo | Controle mais adequado | Observação |
|---|---|---|
| Reduzir ou impedir rastreamento de uma área | Disallow no robots.txt | A URL ainda pode ser descoberta por outros caminhos. |
| Impedir uma página HTML de aparecer no índice | <meta name="robots" content="noindex"> | O crawler precisa conseguir acessar a página para ler a diretiva. |
| Impedir um PDF ou arquivo não HTML de ser indexado | X-Robots-Tag: noindex | A diretiva é enviada no cabeçalho HTTP. |
| Proteger conteúdo privado | Login, autenticação ou restrição de servidor | Não dependa de robots.txt para segurança. |
Evite bloquear o crawler antes que ele leia o noindex
Se você coloca uma página em Disallow e também adiciona noindex dentro dela, o crawler pode não conseguir acessar a página para ler o noindex.
noindex até que os mecanismos processem a instrução. Para conteúdo realmente privado, proteja o acesso.Seu robots.txt pode estar correto e o bot continuar bloqueado
Em sites modernos, o robots.txt é apenas uma das camadas que controlam o acesso. Um crawler permitido no arquivo pode receber 403 Forbidden, 429 Too Many Requests ou um desafio de segurança antes mesmo de chegar ao conteúdo.
Os bloqueios podem ocorrer em:
- Cloudflare ou outra CDN;
- Web Application Firewall (WAF);
- plugins de segurança do WordPress;
- regras do servidor ou hospedagem;
- sistemas anti-bot;
- bloqueios geográficos;
- rate limits excessivos;
- CAPTCHAs aplicados indiscriminadamente.
O Google recomenda explicitamente verificar se o rastreamento é permitido também pela CDN e pela infraestrutura de hospedagem. O mesmo raciocínio é importante para crawlers de IA.
Robots.txt, sitemap e IndexNow fazem trabalhos diferentes
Essas três tecnologias são complementares:
| Recurso | Pergunta que ele responde | Principal função |
|---|---|---|
| robots.txt | “Este crawler pode acessar este caminho?” | Controlar rastreamento. |
| Sitemap XML | “Quais URLs relevantes existem neste site?” | Fornecer um inventário estruturado de URLs. |
| IndexNow | “Qual URL acabou de ser criada, alterada ou removida?” | Notificar rapidamente mecanismos participantes sobre mudanças. |
A documentação atual do IndexNow recomenda combinar IndexNow + sitemaps: o primeiro envia sinais rápidos de mudança; o segundo oferece cobertura ampla da estrutura do site.
Microsoft Bing, Naver, Seznam.cz, Yandex e Yep aparecem atualmente entre os mecanismos com suporte ao protocolo. O Bing também relaciona o uso do IndexNow à manutenção de conteúdo atualizado em experiências de busca e respostas de IA.
Para WordPress, muitos plugins de SEO e provedores já oferecem integração automática. Portanto, antes de implementar a API manualmente, verifique se a funcionalidade já existe no seu plugin, CDN ou hospedagem.
Como auditar seu robots.txt para SEO, GEO e LLMs
Abra o arquivo diretamente
Acesse /robots.txt no navegador e verifique se o servidor realmente entrega o arquivo esperado. Plugins, CDN e cache podem servir uma versão diferente da configurada.
Liste as áreas que devem ser públicas
Home, serviços, produtos, artigos, páginas de localização e conteúdos institucionais que fazem parte da estratégia de aquisição devem estar acessíveis aos crawlers desejados.
Liste as áreas que não precisam de rastreamento
Áreas administrativas, carrinho, checkout, resultados de busca interna e determinadas URLs parametrizadas costumam consumir rastreamento sem acrescentar valor de descoberta.
Separe busca de treinamento
Decida explicitamente se a organização aceita ou bloqueia GPTBot, ClaudeBot e Google-Extended. Documente o motivo para que a configuração não seja alterada sem contexto.
Teste Google e Bing
Use Search Console e Bing Webmaster Tools para verificar URLs importantes, rastreamento e indexação. O Bing oferece um Robots.txt Tester específico.
Verifique os logs e o firewall
Confirme se OAI-SearchBot, Claude-SearchBot e outros agentes desejados não estão recebendo bloqueios da infraestrutura. Não confie apenas no conteúdo do robots.txt.
Confirme o sitemap
Inclua a URL absoluta do sitemap e verifique seu processamento nas ferramentas dos mecanismos de busca.
Ative IndexNow quando fizer sentido
Especialmente em sites com atualizações frequentes, produtos, preços, notícias ou conteúdos que mudam regularmente.
Revise periodicamente
Crawlers, políticas e funcionalidades mudam. Uma configuração de 2024 ou 2025 não deve ser tratada como permanente em 2026.
10 erros de robots.txt que podem prejudicar SEO, GEO e respostas de IA
Evite estes problemas
- Bloquear
Googlebote esperar aparecer no AI Overview ou AI Mode. - Bloquear
Bingbote esperar boa presença no ecossistema de busca do Bing. - Bloquear
OAI-SearchBotquando a intenção é ser descoberto e citado pelo ChatGPT Search. - Bloquear
Claude-SearchBoteClaude-Usersem avaliar o impacto na descoberta pelo Claude. - Confundir
GPTBoteClaudeBotcom os bots de busca das respectivas plataformas. - Bloquear
Google-Extendedacreditando que isso remove o site de AI Overviews. - Usar robots.txt como mecanismo de segurança para conteúdo privado.
- Combinar
Disallowcomnoindexde modo que o crawler não consiga ler a diretiva de indexação. - Copiar um robots.txt genérico sem adaptar caminhos, e-commerce, subdomínios e plugins.
- Ignorar CDN, WAF e plugins de segurança que podem bloquear crawlers mesmo quando o robots.txt está correto.
Há ainda um erro menos óbvio: criar um arquivo tão complexo que ninguém sabe por que cada regra existe. Em SEO técnico, simplicidade e documentação ajudam a evitar problemas.
Qual configuração faz mais sentido para uma empresa brasileira?
Para a maioria das empresas cujo objetivo é gerar negócios por meio de busca orgânica e respostas de IA, a política mais coerente é manter o conteúdo público acessível aos mecanismos de descoberta.
Isso significa, em termos gerais:
- permitir Googlebot para Pesquisa, AI Overviews e AI Mode;
- permitir Bingbot para o ecossistema de busca da Microsoft;
- não bloquear OAI-SearchBot quando a empresa quer presença no ChatGPT Search;
- não bloquear Claude-SearchBot e Claude-User quando deseja descoberta e acesso pelo Claude;
- decidir separadamente a política de GPTBot e ClaudeBot;
- avaliar Google-Extended sabendo que o mesmo controle envolve treinamento e determinados usos de grounding no Gemini;
- manter sitemap, indexação e conteúdo atualizados;
- combinar IndexNow com sitemap nos mecanismos compatíveis.
Depois da configuração técnica, o próximo passo é conteúdo. Um crawler conseguir acessar uma página não significa que ela será indexada, classificada, citada ou recomendada.
É por isso que este artigo faz parte da mesma estratégia apresentada em GEO sem mitos: o que realmente ajuda uma empresa a aparecer nas respostas do Google e das IAs.
E, depois de liberar e otimizar a descoberta, é importante medir o resultado. Veja também: como saber se o site aparece nas respostas de IA do Google e do Bing.
Fontes oficiais consultadas
Crawlers e políticas de uso podem mudar. Este artigo foi preparado com base na documentação disponível em agosto de 2026 e deve ser revisado periodicamente.
- Google Search Central — introdução ao robots.txt
- Google for Developers — Googlebot e Google-Extended
- Google Search Central — recursos de IA e seu site
- Bing Webmaster Tools — crawlers utilizados pelo Bing
- Bing Webmaster Blog — AI Performance
- OpenAI — Publishers and Developers FAQ
- Anthropic — ClaudeBot, Claude-User e Claude-SearchBot
- IndexNow — documentação oficial
Perguntas frequentes sobre robots.txt e inteligência artificial
Qual bot preciso liberar para aparecer no Google AI Overview e AI Mode?
O Googlebot. O Google informa que AI Overviews e AI Mode fazem parte da Pesquisa e não exigem um crawler exclusivo. A página precisa estar indexada e elegível para aparecer no Google Search com um snippet.
Google-Extended controla a presença no AI Overview?
Não. Segundo o Google, Google-Extended não afeta a inclusão ou o ranking no Google Search. Ele controla determinados usos de conteúdo no treinamento de futuras gerações de Gemini e em grounding nas Gemini Apps e no Vertex AI.
Qual bot preciso liberar para aparecer no ChatGPT Search?
A OpenAI orienta não bloquear o OAI-SearchBot quando você deseja que o conteúdo público possa ser descoberto, exibido, citado e vinculado nos resultados de busca do ChatGPT.
Posso bloquear o treinamento da OpenAI e continuar aparecendo no ChatGPT Search?
Sim. A OpenAI utiliza controles separados. É possível permitir OAI-SearchBot para busca e bloquear GPTBot nas páginas que você deseja excluir de potencial treinamento.
Qual é a diferença entre ClaudeBot e Claude-SearchBot?
Claude-SearchBot navega pela web para melhorar a busca do Claude. ClaudeBot coleta conteúdo que pode contribuir para o treinamento e desenvolvimento dos modelos da Anthropic.
O que é Claude-User?
Claude-User é utilizado quando o Claude acessa conteúdo da web a pedido de um usuário. Bloquear esse agente pode impedir que o sistema recupere páginas do seu site durante solicitações iniciadas por pessoas.
Robots.txt impede uma página de ser indexada?
Não de forma confiável. Robots.txt controla principalmente rastreamento. Uma URL bloqueada ainda pode ser descoberta por outros links. Quando a intenção é impedir indexação, use noindex ou outro mecanismo apropriado e permita que o crawler leia essa diretiva.
Posso usar robots.txt para proteger páginas privadas?
Não. Robots.txt é público e depende de o crawler respeitar as regras. Conteúdo privado deve ser protegido por login, autenticação, regras de servidor ou outra barreira real de acesso.
Preciso escrever Allow: / para cada bot de inteligência artificial?
Normalmente não. Se o grupo aplicável já permite o conteúdo público e não existe um bloqueio específico para aquele crawler, criar vários grupos redundantes aumenta a complexidade e pode causar conflitos de manutenção.
O Crawl-delay funciona no Google?
Não. O Google não oferece suporte à diretiva Crawl-delay no robots.txt. Outros crawlers, como os da Anthropic e do Bing, documentam formas de controlar a frequência de rastreamento.
IndexNow substitui o sitemap?
Não. A recomendação atual do IndexNow é utilizar os dois. IndexNow avisa rapidamente sobre URLs adicionadas, alteradas ou removidas, enquanto o sitemap fornece um inventário mais completo das URLs importantes do site.
Como saber se um firewall está bloqueando bots de IA?
Analise logs do servidor e da CDN, procure respostas 403 ou 429 e revise regras de WAF, anti-bot, bloqueio geográfico e rate limiting. Um robots.txt permissivo não garante que a infraestrutura permita a requisição.



