Robots.txt para inteligência artificial: como liberar Google, Bing, ChatGPT e Claude corretamente

Ilustração tecnológica de um site protegido e conectado a diferentes crawlers, com sinais de acesso permitido e bloqueado para mecanismos de busca e inteligência artificial.
Resposta direta: se sua empresa quer aparecer no Google, Bing, ChatGPT e Claude, não bloqueie os rastreadores responsáveis pela busca e descoberta do conteúdo. Para o Google Search — inclusive AI Overviews e AI Mode — o controle principal é o Googlebot. No ecossistema Microsoft, o Bingbot precisa conseguir rastrear as páginas públicas. Para o ChatGPT Search, a OpenAI orienta permitir OAI-SearchBot. Para o Claude, os principais agentes ligados à busca e ao acesso solicitado pelo usuário são Claude-SearchBot e Claude-User. Bots associados a treinamento podem ser tratados separadamente.

O arquivo robots.txt existe há décadas, mas a expansão dos mecanismos de busca baseados em inteligência artificial transformou uma configuração antes tratada como detalhe técnico em uma decisão estratégica.

Hoje, um mesmo site pode receber acessos de robôs com finalidades diferentes: indexar páginas para mecanismos de busca, encontrar fontes para respostas generativas, recuperar uma página solicitada por um usuário ou coletar conteúdo que poderá contribuir para o treinamento de futuros modelos.

O problema é que essas funções são frequentemente misturadas. Algumas empresas bloqueiam todos os “bots de IA” acreditando que estão apenas impedindo treinamento e, sem perceber, reduzem a capacidade de suas páginas serem encontradas e citadas. Outras liberam tudo sem entender o que cada agente faz.

Para uma estratégia de SEO, GEO e visibilidade nas respostas de IA, a pergunta correta não é simplesmente “devo liberar ou bloquear a inteligência artificial?”. A pergunta é: qual robô quero permitir, para qual finalidade e em quais partes do site?

Busca e descoberta

Googlebot, Bingbot, OAI-SearchBot e Claude-SearchBot precisam de acesso ao conteúdo público que você deseja tornar encontrável.

Treinamento é outra decisão

GPTBot, ClaudeBot e Google-Extended possuem finalidades diferentes da indexação tradicional e podem exigir uma política própria.

Robots.txt não é segurança

Conteúdo privado deve ser protegido por autenticação ou outro controle de acesso. Robots.txt é um sinal para crawlers compatíveis.

O que é robots.txt e o que ele realmente controla?

O robots.txt é um arquivo de texto publicado na raiz de um domínio, normalmente acessível em um endereço como:

Endereço padrão
https://seudominio.com.br/robots.txt

Ele informa aos crawlers compatíveis quais caminhos podem ou não ser rastreados. Uma regra simples pode impedir que um bot visite uma seção inteira:

Exemplo básico
User-agent: ExampleBot
Disallow: /area-restrita/

O ponto mais importante é entender que robots.txt controla principalmente rastreamento, não privacidade.

O Google alerta que uma URL bloqueada no robots.txt ainda pode ser descoberta por links externos e, em algumas situações, aparecer nos resultados sem que seu conteúdo tenha sido rastreado.

Não use robots.txt para proteger informações confidenciais. Área de clientes, dados pessoais, documentos privados, ambientes administrativos e materiais internos devem utilizar login, autenticação, restrições de servidor ou outro mecanismo real de controle de acesso.

As quatro diretivas mais importantes

DiretivaFunçãoExemplo
User-agentDefine a qual crawler o grupo de regras se aplica.User-agent: Googlebot
DisallowIndica um caminho que o crawler não deve acessar.Disallow: /wp-admin/
AllowLibera um caminho específico dentro de uma área mais ampla bloqueada.Allow: /wp-admin/admin-ajax.php
SitemapInforma a localização completa do sitemap XML.Sitemap: https://exemplo.com/sitemap_index.xml

O Google documenta suporte a User-agent, Allow, Disallow e Sitemap. A diretiva Crawl-delay, por exemplo, não é suportada pelo Google, embora outros crawlers possam interpretá-la.

Busca, resposta generativa e treinamento não são a mesma coisa

Esta é a distinção mais importante do artigo. Um crawler associado a uma empresa de IA não significa necessariamente que ele esteja coletando conteúdo para treinamento. Plataformas diferentes passaram a documentar agentes separados justamente para permitir maior controle ao proprietário do site.

FinalidadeO que aconteceExemplos
Busca e indexaçãoO crawler descobre e processa páginas para um índice ou experiência de pesquisa.Googlebot, Bingbot, OAI-SearchBot, Claude-SearchBot
Acesso solicitado pelo usuárioO sistema recupera uma página durante uma ação iniciada por uma pessoa.Claude-User e outros agentes/fetchers específicos
Treinamento ou desenvolvimentoConteúdo pode ser coletado para contribuir com futuros modelos.GPTBot, ClaudeBot e usos controlados por Google-Extended
GroundingO modelo recebe informação recuperada de fontes externas para responder com maior atualidade e factualidade.Google-Extended controla determinados usos de grounding no ecossistema Gemini
Para SEO e GEO: bloquear treinamento não precisa significar bloquear busca. OpenAI e Anthropic fornecem controles separados. No Google, existe uma particularidade: Google-Extended controla tanto determinados usos de treinamento quanto grounding no ecossistema Gemini, embora não controle a inclusão no Google Search.

Googlebot e Google-Extended: não confunda os dois

Para aparecer na Pesquisa Google, inclusive como link de apoio em AI Overviews e AI Mode, a página precisa estar indexada e elegível para aparecer nos resultados com um snippet.

O controle de rastreamento para essas experiências é o Googlebot. O Google afirma que não existem requisitos técnicos extras exclusivos para AI Overviews ou AI Mode.

Pesquisa Google

Googlebot

É o crawler principal do Google Search. As preferências destinadas ao Googlebot afetam a Pesquisa e seus recursos, incluindo as experiências de IA integradas à busca.

Controle separado

Google-Extended

É um token de controle no robots.txt. Ele não possui um user-agent HTTP próprio e não afeta a inclusão nem o ranking do site no Google Search.

Então para que serve Google-Extended?

Segundo a documentação atual do Google, Google-Extended permite ao proprietário controlar se conteúdo rastreado pelo Google pode ser utilizado:

  • no treinamento de futuras gerações de modelos Gemini;
  • em determinados usos de grounding nas Gemini Apps;
  • em Grounding with Google Search no Vertex AI.

A documentação esclarece que bloquear Google-Extended não retira uma página do Google Search e não é um sinal de ranking.

Mas existe um trade-off: se a empresa deseja impedir os usos controlados por Google-Extended, o bloqueio também pode restringir os usos de grounding descritos pelo Google no ecossistema Gemini. Portanto, essa configuração deve ser tratada como decisão de política de conteúdo, e não como ajuste de SEO.
Bloquear Google-Extended sem bloquear Google Search
User-agent: Google-Extended
Disallow: /
Efeito: não bloqueia Googlebot nem remove páginas da Pesquisa Google, mas restringe os usos que o Google associa ao token Google-Extended.

Bingbot, Microsoft Copilot e as respostas de IA do Bing

No ecossistema Microsoft, o Bingbot é o principal crawler do Bing. Se a empresa deseja manter páginas no índice e participar das experiências de busca alimentadas pelo Bing, conteúdos públicos importantes precisam estar rastreáveis.

O Bing Webmaster Tools possui um painel de AI Performance para medir citações em respostas de inteligência artificial, incluindo Microsoft Copilot, resumos gerados no Bing e integrações selecionadas.

A Microsoft afirma que respeita preferências de proprietários de conteúdo expressas por robots.txt e outros mecanismos suportados. O Bing Webmaster Tools também oferece um teste de robots.txt para verificar se o Bingbot consegue acessar URLs importantes.

Exemplo: bloquear uma seção apenas para o Bingbot
User-agent: Bingbot
Disallow: /conteudo-nao-publico/

Na maioria dos sites empresariais, porém, não há motivo para criar um grupo especial para Bingbot. Um bloco genérico bem configurado para todos os crawlers costuma ser mais simples e reduzir o risco de regras conflitantes.

ChatGPT: OAI-SearchBot e GPTBot possuem finalidades diferentes

A OpenAI separa explicitamente o rastreamento usado para busca daquele associado ao possível treinamento de modelos.

Busca e citações

OAI-SearchBot

A OpenAI orienta proprietários de sites a não bloquear este agente quando desejam que o conteúdo possa ser descoberto, exibido, citado e vinculado em resultados de busca do ChatGPT.

Treinamento

GPTBot

É o agente que os editores podem bloquear em páginas que desejam excluir de potencial uso em treinamento futuro, conforme as orientações da OpenAI.

Isso permite uma política relativamente simples: permitir que a empresa seja encontrada no ChatGPT Search, mas bloquear GPTBot se a organização não quiser disponibilizar o conteúdo para potencial treinamento.

Permitir busca no ChatGPT e bloquear GPTBot
# OAI-SearchBot continua sujeito às regras públicas do grupo *
# Não crie um bloqueio específico para ele.

User-agent: GPTBot
Disallow: /
Importante: se o grupo geral User-agent: * já permite o conteúdo público, não é necessário criar Allow: / para OAI-SearchBot. Evitar grupos redundantes diminui o risco de liberar acidentalmente caminhos que deveriam continuar bloqueados.

A OpenAI também informa que, em determinadas situações, uma URL bloqueada para rastreamento pode ser obtida de outra fonte e ter somente o link e o título apresentados. Quando a intenção é impedir que a página apareça, controles de indexação como noindex são mais apropriados — desde que o crawler consiga acessar a página para ler a diretiva.

Claude: Claude-SearchBot, Claude-User e ClaudeBot

A Anthropic documenta três agentes principais com funções distintas.

Busca

Claude-SearchBot

Navega pela web para melhorar a relevância e a precisão dos resultados de busca. Bloqueá-lo pode reduzir a visibilidade do site nas experiências de pesquisa do Claude.

Solicitação do usuário

Claude-User

Pode acessar páginas quando um usuário pede ao Claude que recupere conteúdo da web. Bloqueá-lo limita esse acesso iniciado pelo usuário.

Treinamento

ClaudeBot

Coleta conteúdo público que pode contribuir para o desenvolvimento e treinamento dos modelos da Anthropic.

Crawl-delay

Controle de frequência

A Anthropic informa que seus bots suportam a extensão não padronizada Crawl-delay quando for necessário reduzir a frequência das solicitações.

Permitir pesquisa do Claude e bloquear ClaudeBot
# Claude-SearchBot e Claude-User permanecem sujeitos ao grupo *
# e continuam podendo acessar o conteúdo público permitido.

User-agent: ClaudeBot
Disallow: /
Não bloqueie por IP como primeira opção. A Anthropic recomenda expressar a preferência por robots.txt e observa que bloquear IPs pode impedir o próprio bot de ler a política do site. Para identificar tráfego legítimo, utilize a documentação oficial de endereços e agentes publicada pela plataforma.

Modelo de robots.txt para WordPress com foco em SEO, GEO e IA

Não existe um robots.txt universal para todos os sites. Um e-commerce, um portal, um site institucional e uma área de membros têm necessidades diferentes.

Ainda assim, o exemplo abaixo mostra uma estrutura conservadora para um site WordPress empresarial que deseja:

  • manter páginas públicas acessíveis para Google, Bing, ChatGPT e Claude;
  • evitar rastreamento de áreas administrativas e transacionais sem valor de busca;
  • informar o sitemap;
  • bloquear GPTBot e ClaudeBot para treinamento;
  • manter Google-Extended liberado para não reduzir os usos de grounding controlados por esse token.
Modelo recomendado — busca e IA liberadas, treinamento seletivo
# ============================================================
# robots.txt — exemplo para WordPress
# SEO + GEO + mecanismos de busca e IA
# Ajuste os caminhos ao seu site antes de publicar
# ============================================================

User-agent: *

# Área administrativa
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

# Endpoints sem valor de indexação
Disallow: /wp-login.php
Disallow: /xmlrpc.php

# Busca interna e parâmetros comuns
Disallow: /search/
Disallow: /*?s=
Disallow: /*?replytocom=

# WooCommerce — use somente se essas URLs existirem
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /order-received/
Disallow: /*?add-to-cart=

# ------------------------------------------------------------
# Política de treinamento
# Busca do ChatGPT permanece disponível via OAI-SearchBot
# ------------------------------------------------------------
User-agent: GPTBot
Disallow: /

# Busca do Claude permanece disponível via Claude-SearchBot
# e acesso solicitado pelo usuário via Claude-User
User-agent: ClaudeBot
Disallow: /

# ------------------------------------------------------------
# Sitemap
# ------------------------------------------------------------
Sitemap: https://www.seudominio.com.br/sitemap_index.xml
Antes de copiar: substitua o domínio, remova regras de sistemas que você não utiliza e verifique se algum conteúdo legítimo está dentro dos caminhos bloqueados. Não copie um robots.txt de outro site sem revisar sua arquitetura.

E o Google-Extended?

No modelo acima, ele não é bloqueado. Isso maximiza a abertura do conteúdo público para os usos de Gemini e grounding controlados por esse token.

Se a política da organização for impedir esses usos, adicione:

Opcional — bloquear Google-Extended
User-agent: Google-Extended
Disallow: /
Essa regra não bloqueia Google Search, AI Overviews ou AI Mode, mas também restringe os usos de grounding que o Google associa ao Google-Extended nas Gemini Apps e no Vertex AI. Avalie o objetivo antes de aplicar.

E se eu quiser permitir também treinamento pela OpenAI e Anthropic?

Nesse caso, simplesmente não inclua os grupos de bloqueio para GPTBot e ClaudeBot. Se o grupo User-agent: * permite as páginas públicas, esses agentes poderão seguir as regras gerais.

Regra de simplicidade: não crie dezenas de grupos Allow: / apenas para “provar” que cada IA está liberada. Se o bot respeita robots.txt e não existe bloqueio específico, ele normalmente seguirá o grupo aplicável. Quanto mais regras redundantes, maior o risco de conflito ou manutenção incompleta.

Robots.txt, noindex e X-Robots-Tag: qual usar?

Um dos erros mais comuns é tratar Disallow e noindex como se fossem a mesma coisa.

ObjetivoControle mais adequadoObservação
Reduzir ou impedir rastreamento de uma áreaDisallow no robots.txtA URL ainda pode ser descoberta por outros caminhos.
Impedir uma página HTML de aparecer no índice<meta name="robots" content="noindex">O crawler precisa conseguir acessar a página para ler a diretiva.
Impedir um PDF ou arquivo não HTML de ser indexadoX-Robots-Tag: noindexA diretiva é enviada no cabeçalho HTTP.
Proteger conteúdo privadoLogin, autenticação ou restrição de servidorNão dependa de robots.txt para segurança.

Evite bloquear o crawler antes que ele leia o noindex

Se você coloca uma página em Disallow e também adiciona noindex dentro dela, o crawler pode não conseguir acessar a página para ler o noindex.

Exemplo clássico: uma página já indexada deve ser removida dos resultados. Em vez de bloqueá-la primeiro no robots.txt, permita o rastreamento e use noindex até que os mecanismos processem a instrução. Para conteúdo realmente privado, proteja o acesso.

Seu robots.txt pode estar correto e o bot continuar bloqueado

Em sites modernos, o robots.txt é apenas uma das camadas que controlam o acesso. Um crawler permitido no arquivo pode receber 403 Forbidden, 429 Too Many Requests ou um desafio de segurança antes mesmo de chegar ao conteúdo.

Os bloqueios podem ocorrer em:

  • Cloudflare ou outra CDN;
  • Web Application Firewall (WAF);
  • plugins de segurança do WordPress;
  • regras do servidor ou hospedagem;
  • sistemas anti-bot;
  • bloqueios geográficos;
  • rate limits excessivos;
  • CAPTCHAs aplicados indiscriminadamente.

O Google recomenda explicitamente verificar se o rastreamento é permitido também pela CDN e pela infraestrutura de hospedagem. O mesmo raciocínio é importante para crawlers de IA.

Diagnóstico correto: “não existe Disallow no robots.txt” não significa “o bot consegue acessar o site”. Analise logs do servidor, códigos HTTP, ferramentas de inspeção e regras da camada de segurança.

Robots.txt, sitemap e IndexNow fazem trabalhos diferentes

Essas três tecnologias são complementares:

RecursoPergunta que ele respondePrincipal função
robots.txt“Este crawler pode acessar este caminho?”Controlar rastreamento.
Sitemap XML“Quais URLs relevantes existem neste site?”Fornecer um inventário estruturado de URLs.
IndexNow“Qual URL acabou de ser criada, alterada ou removida?”Notificar rapidamente mecanismos participantes sobre mudanças.

A documentação atual do IndexNow recomenda combinar IndexNow + sitemaps: o primeiro envia sinais rápidos de mudança; o segundo oferece cobertura ampla da estrutura do site.

Microsoft Bing, Naver, Seznam.cz, Yandex e Yep aparecem atualmente entre os mecanismos com suporte ao protocolo. O Bing também relaciona o uso do IndexNow à manutenção de conteúdo atualizado em experiências de busca e respostas de IA.

Para WordPress, muitos plugins de SEO e provedores já oferecem integração automática. Portanto, antes de implementar a API manualmente, verifique se a funcionalidade já existe no seu plugin, CDN ou hospedagem.

IndexNow não é um pedido de ranking. Ele informa que algo mudou e pode acelerar a descoberta. O mecanismo ainda decide quando rastrear, indexar e utilizar a URL.

Como auditar seu robots.txt para SEO, GEO e LLMs

Abra o arquivo diretamente

Acesse /robots.txt no navegador e verifique se o servidor realmente entrega o arquivo esperado. Plugins, CDN e cache podem servir uma versão diferente da configurada.

Liste as áreas que devem ser públicas

Home, serviços, produtos, artigos, páginas de localização e conteúdos institucionais que fazem parte da estratégia de aquisição devem estar acessíveis aos crawlers desejados.

Liste as áreas que não precisam de rastreamento

Áreas administrativas, carrinho, checkout, resultados de busca interna e determinadas URLs parametrizadas costumam consumir rastreamento sem acrescentar valor de descoberta.

Separe busca de treinamento

Decida explicitamente se a organização aceita ou bloqueia GPTBot, ClaudeBot e Google-Extended. Documente o motivo para que a configuração não seja alterada sem contexto.

Teste Google e Bing

Use Search Console e Bing Webmaster Tools para verificar URLs importantes, rastreamento e indexação. O Bing oferece um Robots.txt Tester específico.

Verifique os logs e o firewall

Confirme se OAI-SearchBot, Claude-SearchBot e outros agentes desejados não estão recebendo bloqueios da infraestrutura. Não confie apenas no conteúdo do robots.txt.

Confirme o sitemap

Inclua a URL absoluta do sitemap e verifique seu processamento nas ferramentas dos mecanismos de busca.

Ative IndexNow quando fizer sentido

Especialmente em sites com atualizações frequentes, produtos, preços, notícias ou conteúdos que mudam regularmente.

Revise periodicamente

Crawlers, políticas e funcionalidades mudam. Uma configuração de 2024 ou 2025 não deve ser tratada como permanente em 2026.

10 erros de robots.txt que podem prejudicar SEO, GEO e respostas de IA

Evite estes problemas

  • Bloquear Googlebot e esperar aparecer no AI Overview ou AI Mode.
  • Bloquear Bingbot e esperar boa presença no ecossistema de busca do Bing.
  • Bloquear OAI-SearchBot quando a intenção é ser descoberto e citado pelo ChatGPT Search.
  • Bloquear Claude-SearchBot e Claude-User sem avaliar o impacto na descoberta pelo Claude.
  • Confundir GPTBot e ClaudeBot com os bots de busca das respectivas plataformas.
  • Bloquear Google-Extended acreditando que isso remove o site de AI Overviews.
  • Usar robots.txt como mecanismo de segurança para conteúdo privado.
  • Combinar Disallow com noindex de modo que o crawler não consiga ler a diretiva de indexação.
  • Copiar um robots.txt genérico sem adaptar caminhos, e-commerce, subdomínios e plugins.
  • Ignorar CDN, WAF e plugins de segurança que podem bloquear crawlers mesmo quando o robots.txt está correto.

Há ainda um erro menos óbvio: criar um arquivo tão complexo que ninguém sabe por que cada regra existe. Em SEO técnico, simplicidade e documentação ajudam a evitar problemas.

Qual configuração faz mais sentido para uma empresa brasileira?

Para a maioria das empresas cujo objetivo é gerar negócios por meio de busca orgânica e respostas de IA, a política mais coerente é manter o conteúdo público acessível aos mecanismos de descoberta.

Isso significa, em termos gerais:

  • permitir Googlebot para Pesquisa, AI Overviews e AI Mode;
  • permitir Bingbot para o ecossistema de busca da Microsoft;
  • não bloquear OAI-SearchBot quando a empresa quer presença no ChatGPT Search;
  • não bloquear Claude-SearchBot e Claude-User quando deseja descoberta e acesso pelo Claude;
  • decidir separadamente a política de GPTBot e ClaudeBot;
  • avaliar Google-Extended sabendo que o mesmo controle envolve treinamento e determinados usos de grounding no Gemini;
  • manter sitemap, indexação e conteúdo atualizados;
  • combinar IndexNow com sitemap nos mecanismos compatíveis.

Depois da configuração técnica, o próximo passo é conteúdo. Um crawler conseguir acessar uma página não significa que ela será indexada, classificada, citada ou recomendada.

É por isso que este artigo faz parte da mesma estratégia apresentada em GEO sem mitos: o que realmente ajuda uma empresa a aparecer nas respostas do Google e das IAs.

E, depois de liberar e otimizar a descoberta, é importante medir o resultado. Veja também: como saber se o site aparece nas respostas de IA do Google e do Bing.

Fontes oficiais consultadas

Crawlers e políticas de uso podem mudar. Este artigo foi preparado com base na documentação disponível em agosto de 2026 e deve ser revisado periodicamente.

Perguntas frequentes sobre robots.txt e inteligência artificial

Qual bot preciso liberar para aparecer no Google AI Overview e AI Mode?

O Googlebot. O Google informa que AI Overviews e AI Mode fazem parte da Pesquisa e não exigem um crawler exclusivo. A página precisa estar indexada e elegível para aparecer no Google Search com um snippet.

Google-Extended controla a presença no AI Overview?

Não. Segundo o Google, Google-Extended não afeta a inclusão ou o ranking no Google Search. Ele controla determinados usos de conteúdo no treinamento de futuras gerações de Gemini e em grounding nas Gemini Apps e no Vertex AI.

Qual bot preciso liberar para aparecer no ChatGPT Search?

A OpenAI orienta não bloquear o OAI-SearchBot quando você deseja que o conteúdo público possa ser descoberto, exibido, citado e vinculado nos resultados de busca do ChatGPT.

Posso bloquear o treinamento da OpenAI e continuar aparecendo no ChatGPT Search?

Sim. A OpenAI utiliza controles separados. É possível permitir OAI-SearchBot para busca e bloquear GPTBot nas páginas que você deseja excluir de potencial treinamento.

Qual é a diferença entre ClaudeBot e Claude-SearchBot?

Claude-SearchBot navega pela web para melhorar a busca do Claude. ClaudeBot coleta conteúdo que pode contribuir para o treinamento e desenvolvimento dos modelos da Anthropic.

O que é Claude-User?

Claude-User é utilizado quando o Claude acessa conteúdo da web a pedido de um usuário. Bloquear esse agente pode impedir que o sistema recupere páginas do seu site durante solicitações iniciadas por pessoas.

Robots.txt impede uma página de ser indexada?

Não de forma confiável. Robots.txt controla principalmente rastreamento. Uma URL bloqueada ainda pode ser descoberta por outros links. Quando a intenção é impedir indexação, use noindex ou outro mecanismo apropriado e permita que o crawler leia essa diretiva.

Posso usar robots.txt para proteger páginas privadas?

Não. Robots.txt é público e depende de o crawler respeitar as regras. Conteúdo privado deve ser protegido por login, autenticação, regras de servidor ou outra barreira real de acesso.

Preciso escrever Allow: / para cada bot de inteligência artificial?

Normalmente não. Se o grupo aplicável já permite o conteúdo público e não existe um bloqueio específico para aquele crawler, criar vários grupos redundantes aumenta a complexidade e pode causar conflitos de manutenção.

O Crawl-delay funciona no Google?

Não. O Google não oferece suporte à diretiva Crawl-delay no robots.txt. Outros crawlers, como os da Anthropic e do Bing, documentam formas de controlar a frequência de rastreamento.

IndexNow substitui o sitemap?

Não. A recomendação atual do IndexNow é utilizar os dois. IndexNow avisa rapidamente sobre URLs adicionadas, alteradas ou removidas, enquanto o sitemap fornece um inventário mais completo das URLs importantes do site.

Como saber se um firewall está bloqueando bots de IA?

Analise logs do servidor e da CDN, procure respostas 403 ou 429 e revise regras de WAF, anti-bot, bloqueio geográfico e rate limiting. Um robots.txt permissivo não garante que a infraestrutura permita a requisição.

Deixe um comentário