Sim, o robots.txt pode mudar sem que ninguém da empresa tenha aberto o arquivo. Em boa parte dos sites ele não é um arquivo escrito à mão: é gerado por um plugin de SEO, pela plataforma do site, pelo tema ou por uma CDN, e qualquer atualização dessas peças pode acrescentar regras que bloqueiam o GPTBot, o ClaudeBot ou o PerplexityBot. O sinal costuma ser silencioso: o site continua abrindo normalmente para você, e só os assistentes param de enxergá-lo. Para descobrir, compare o arquivo de hoje com uma cópia de quando estava certo e confira quem, na sua estrutura, tem permissão para escrevê-lo.
Este guia lista os responsáveis mais comuns por essas mudanças, mostra como identificar cada um e termina com uma rotina simples para não ser pego de surpresa de novo.
Por que um arquivo tão simples muda sem aviso?
Porque o robots.txt que o robô lê nem sempre é o que está gravado no servidor. Quando alguém acessa seusite.com.br/robots.txt, a resposta pode vir de quatro lugares diferentes:
- Um arquivo físico na raiz do site, escrito por alguém.
- Um arquivo virtual montado na hora pelo sistema do site, como o WordPress faz quando não existe arquivo físico.
- Um plugin que intercepta o pedido e devolve o próprio conteúdo, às vezes somando regras ao arquivo virtual.
- Uma CDN ou firewall na frente do site, que pode responder no lugar do servidor ou acrescentar linhas ao que o servidor mandou.
Cada uma dessas camadas pode ser atualizada por alguém diferente: você, o desenvolvedor, o fornecedor do plugin, a plataforma ou a empresa da CDN. Nenhuma delas avisa as outras. É por isso que a pergunta certa não é "quem mexeu no arquivo?", e sim "quem, hoje, responde por esse endereço?".
Quais plugins costumam reescrever o robots.txt?
No WordPress, os suspeitos principais são três tipos de plugin:
- Plugins de SEO. Os mais populares têm um editor de robots.txt no painel. Uma atualização pode trazer uma opção nova, como "bloquear robôs de IA" ou "bloquear robôs de treino", e há casos em que ela vem ligada ou é oferecida num assistente de configuração que alguém aceitou sem ler.
- Plugins de segurança. Alguns acrescentam regras ao robots.txt ou bloqueiam user-agents inteiros no firewall do próprio plugin. O efeito para o robô é o mesmo: não entra.
- Plugins de cache e desempenho. Eles não costumam escrever regras, mas podem guardar uma versão antiga do arquivo e continuar servindo-a depois que você o corrigiu.
Há também o conflito entre camadas. Se existir um arquivo robots.txt físico na raiz, o WordPress deixa de gerar o virtual, e as configurações do plugin de SEO passam a não valer. Quem edita no painel vê uma coisa; o robô lê outra. O guia WordPress e robôs de IA mostra onde fica cada uma dessas opções.
A CDN pode alterar o robots.txt do meu site?
Pode. CDNs e serviços de proteção como a Cloudflare passaram a oferecer recursos específicos para robôs de IA. Há opções que bloqueiam esses robôs no firewall, antes de o robots.txt ser lido, e há opções de robots.txt gerenciado, em que o serviço acrescenta ao seu arquivo regras de Disallow para robôs de IA conhecidos. Em ambos os casos, o arquivo no seu servidor pode estar perfeito e o robô, mesmo assim, ser barrado.
O detalhe que confunde: quando a CDN acrescenta linhas ao robots.txt, você só vê a versão final acessando o endereço público do site. Abrir o arquivo pelo gerenciador de arquivos da hospedagem mostra a versão sem as linhas da CDN. O guia Cloudflare e firewall bloqueando robôs de IA explica onde ficam essas opções no painel e como liberar só os robôs que você quer.
E as plataformas prontas, como Wix e Shopify?
Nas plataformas fechadas, o robots.txt é da plataforma. Ela escreve a versão padrão e pode mudá-la quando quiser, para todos os clientes ao mesmo tempo. Na maioria dos casos isso é bom, porque as plataformas grandes acompanham as mudanças dos robôs. Mas também significa que uma decisão da plataforma sobre robôs de IA chega ao seu site sem você ter feito nada.
Algumas plataformas deixam personalizar o arquivo, cada uma de um jeito. Se você personalizou, a responsabilidade de acompanhar passa a ser sua: uma regra antiga, escrita quando o robô tinha outro nome, pode continuar bloqueando o robô novo. O artigo sobre Wix, Shopify e Nuvemshop resume o que cada uma permite.
Que outros descuidos mudam o robots.txt?
Três situações aparecem com frequência, e nenhuma delas tem a ver com IA:
- O robots.txt do ambiente de testes vai para o ar. É comum o site de homologação ter
Disallow: /para não aparecer no Google. Se o arquivo vai junto na publicação, o site inteiro fica bloqueado para todos os robôs, de busca e de IA. - Troca de tema, de agência ou de plataforma. Uma migração reescreve a raiz do site. O arquivo antigo, com as exceções que alguém tinha acertado, some sem cerimônia.
- Uma regra genérica demais. Alguém incomodado com robôs que sobrecarregam o servidor escreve um bloqueio para
User-agent: *sem perceber que, para os robôs que não têm um grupo próprio, esse é o grupo que vale.
Há ainda o caso em que o arquivo não mudou, mas deixou de responder. Pela RFC 9309, a norma do robots.txt, um arquivo ausente (erro 404) libera o acesso, mas um arquivo que falha por erro do servidor (5xx) deve ser tratado pelos robôs como bloqueio total. Um servidor instável, ou uma regra de firewall que devolve erro só para robôs, produz exatamente isso. Por isso o diagnóstico do Mecita nunca dá o robots.txt como aprovado quando não consegue lê-lo: marca como alerta e dá só metade dos pontos.
Como descobrir o que mudou e quem mudou?
Siga esta ordem, do mais rápido ao mais trabalhoso:
- Abra o arquivo público. Acesse
https://seusite.com.br/robots.txtnuma aba anônima. É isso que os robôs leem, com todas as camadas aplicadas. - Compare com a última versão boa. Se você não tem uma cópia, o histórico do repositório do site, um backup da hospedagem ou o arquivo de páginas do Internet Archive costumam ter.
- Procure grupos novos. Linhas como
User-agent: GPTBotseguidas deDisallow: /são o sinal clássico. Veja na página de cada robô, como a do GPTBot, qual assistente ele alimenta. - Teste como robô. O comando abaixo pede o arquivo se apresentando como o GPTBot e mostra o código de resposta. Um 403 ou 503 aqui, com 200 no navegador, aponta para o firewall ou a CDN.
- Desligue as camadas uma de cada vez. Com o arquivo em mãos, confira as opções de robôs no plugin de SEO, no plugin de segurança e no painel da CDN. A linha que aparece só na versão pública veio de alguma delas.
curl -s -o /dev/null -w "%{http_code}\n" \
-A "Mozilla/5.0 (compatible; GPTBot/1.1; +https://openai.com/gptbot)" \
https://seusite.com.br/robots.txt
Esse teste mostra se o seu servidor recusa o nome do robô. Ele não imita o endereço de origem, que alguns firewalls também conferem, então um 200 aqui não prova que o robô verdadeiro entra. Um erro, porém, prova que ele não entra.
Como deixar o robots.txt à prova de surpresas?
Não existe arquivo imune, mas dá para reduzir muito o risco:
- Escolha uma única fonte. Decida quem escreve o robots.txt, seja o arquivo físico, o plugin ou a plataforma, e desligue as outras opções de edição. Duas fontes são duas chances de conflito.
- Seja explícito com os robôs que importam. Um grupo próprio para cada robô que você quer liberar protege contra uma regra genérica escrita depois. O exemplo abaixo libera os principais e mantém o bloqueio da área administrativa.
- Guarde a versão boa. Um arquivo de texto com a data, numa pasta compartilhada, já resolve. Se o site tem repositório, o robots.txt deve estar nele.
- Inclua o arquivo na conferência de toda atualização. Atualizou plugin, tema ou plataforma, mexeu na CDN: abra o robots.txt público e compare.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: PerplexityBot
User-agent: Googlebot
User-agent: Bingbot
Allow: /
Disallow: /wp-admin/
User-agent: *
Disallow: /wp-admin/
Sitemap: https://seusite.com.br/sitemap.xml
Linhas User-agent seguidas formam um único grupo, e cada robô obedece só ao grupo mais específico que o menciona. As regras dentro do grupo nomeado valem inteiras para esses robôs, independentemente do que estiver em User-agent: *. O guia robots.txt para robôs de IA explica essas regras de leitura com mais exemplos.
Quanto custa na nota um robots.txt que mudou sozinho?
O acesso dos robôs vale 20 dos 100 pontos no diagnóstico do Mecita, e o peso de cada robô dentro desses 20 depende de quanto ele importa. Mas o custo real é maior: se o bloqueio atinge um robô crítico, como o GPTBot, o OAI-SearchBot, o ClaudeBot, o PerplexityBot ou o Googlebot, a nota inteira fica limitada a 39, por melhor que o resto do site esteja. Um site invisível para o ChatGPT não pode sair com nota boa por estar certo em outras coisas.
É por isso que um robots.txt alterado por um plugin costuma ser a queda de nota mais brusca que um site sofre. Todo o resto continua igual, e a nota despenca de uma semana para a outra. A página da checagem de robots.txt mostra exatamente como essa conta é feita.
Como saber a tempo, e não meses depois?
A conferência manual funciona, desde que alguém se lembre de fazê-la. Uma rotina mensal, somada à conferência depois de cada atualização, já pega a maior parte dos casos. Anote na agenda e use o próprio diagnóstico grátis como ferramenta: ele mostra na hora quais robôs estão bloqueados e se o arquivo respondeu.
Se o diagnóstico encontrar um bloqueio e você não souber de onde ele vem, o Plano de Correção, por R$ 29,90 em pagamento único, traz as instruções prontas para você ou para quem cuida do site: o que mudar, em que ordem, e o texto do robots.txt pronto para colar. Por 30 dias você pode rodar o diagnóstico de novo e receber o plano atualizado.
Para quem prefere não depender da memória, o Mecita Monitor vai avisar quando o site regredir, como no caso de um robots.txt que mudou sozinho. Ele ainda não está disponível; por enquanto, há uma lista de espera.
Confira agora quem o seu robots.txt está bloqueando
O diagnóstico grátis lê o arquivo que os robôs de IA leem e mostra, robô por robô, quem entra e quem fica de fora.
✓ Sem cadastro✓ Sem cartão✓ 15 robôs de IA verificados
Perguntas frequentes
Como o robots.txt pode mudar se ninguém mexeu nele?
Porque muitas vezes ele não é um arquivo escrito por alguém. Plugins de SEO, a própria plataforma do site e algumas CDNs geram ou editam o robots.txt automaticamente. Uma atualização, uma opção nova ligada por padrão ou a troca de tema basta para mudar o que os robôs de IA leem.
Se o robots.txt der erro, os robôs de IA entram mesmo assim?
Depende do erro. Pela norma que define o robots.txt, a RFC 9309, um arquivo que não existe (404) libera tudo, mas um arquivo que não responde por erro do servidor (5xx) deve ser tratado como bloqueio total. Um robots.txt instável pode esconder o site por dias.
Com que frequência devo conferir o robots.txt?
Depois de toda atualização de plugin, tema, plataforma ou configuração de CDN, e pelo menos uma vez por mês mesmo sem mudança conhecida. Guardar uma cópia do arquivo bom torna a conferência uma comparação de dois minutos.
Bloquear só o robô de treino é um problema?
Não necessariamente. Bloquear o GPTBot e liberar o OAI-SearchBot e o ChatGPT-User é uma escolha legítima. O problema é quando a escolha é feita por um plugin ou por uma CDN sem que você saiba, e às vezes ela leva junto os robôs de busca.