O Googlebot é o robô de rastreamento da busca do Google. Ele existe desde muito antes dos assistentes de IA, mas hoje também é a porta de entrada para as AI Overviews, os resumos gerados por IA que aparecem no topo de muitas buscas, e para o AI Mode. Se o Googlebot não lê o seu site, você fica de fora de tudo isso ao mesmo tempo.
Quem opera o Googlebot e o que ele faz
O Googlebot pertence ao Google. Ele percorre a web, lê as páginas e alimenta o índice da Busca Google. A documentação oficial explica que existem duas versões principais, a de celular (Googlebot Smartphone) e a de computador (Googlebot Desktop), e que as duas obedecem ao mesmo token no robots.txt: Googlebot.
Os recursos de IA da busca, como as AI Overviews e o AI Mode, usam esse mesmo índice. Não existe um robô separado para eles. Por isso o controle de acesso é o do Googlebot.
Bloquear o Googlebot tira você das respostas?
Sim, e de forma ampla. Um site bloqueado para o Googlebot sai da busca comum, das AI Overviews e do AI Mode. Para a maioria dos negócios, é o bloqueio mais caro que existe.
Uma confusão comum é achar que o Google-Extended controla as AI Overviews. Não controla. O Google afirma que o Google-Extended não afeta a inclusão do site na busca nem é usado como fator de classificação. Ele trata de usos ligados ao Gemini.
Por que o Googlebot é essencial no Mecita
O Mecita trata o Googlebot como essencial: se ele estiver bloqueado, a nota fica limitada. O motivo dispensa muita explicação. Nenhum diagnóstico de visibilidade em IA faz sentido para um site que não pode ser lido pelo Google, que além da busca comum também mostra respostas geradas por IA.
Esse tipo de bloqueio costuma ser acidente: um Disallow: / que ficou do tempo em que o site estava em construção, ou uma configuração "desencorajar mecanismos de busca" esquecida ligada no WordPress.
Como liberar o Googlebot no robots.txt
Na maioria dos sites não é preciso nenhuma linha específica: sem regra contra ele, o Googlebot entra. Se você quer deixar explícito:
User-agent: Googlebot
Allow: /
Se o seu robots.txt tem um grupo User-agent: * com bloqueios de áreas privadas e você cria um grupo próprio para o Googlebot, repita esses bloqueios no grupo dele. Um robô com grupo próprio ignora o grupo geral.
Como bloquear o Googlebot no robots.txt
Para tirar uma área do rastreamento, como uma pasta de testes:
User-agent: Googlebot
Disallow: /homologacao/
Bloquear o site inteiro (Disallow: /) quase nunca é o que um negócio quer. Lembre também que o robots.txt controla o rastreamento, não a indexação: para tirar uma página do índice do Google, a documentação indica usar noindex e deixar o Googlebot ler a página para enxergar essa instrução.
Como conferir as visitas do Googlebot nos registros do servidor
O jeito mais fácil é o Google Search Console, que é gratuito: o relatório de estatísticas de rastreamento mostra quantas páginas o Googlebot pediu e quais respostas recebeu. Pelo servidor:
grep -i "googlebot" /var/log/nginx/access.log
Muita gente se passa por Googlebot. Para confirmar, faça a busca reversa do IP:
host 66.249.66.1
O nome deve terminar em googlebot.com, google.com ou googleusercontent.com, e a busca direta desse nome deve voltar ao mesmo IP.
Erros comuns
- Opção "desencorajar mecanismos de busca" ligada. No WordPress, ela fica em Configurações, Leitura. Esquecida depois do lançamento, ela pede aos buscadores que não indexem o site.
- Bloquear o CSS e o JavaScript. O Google monta a página para entender o layout. Bloquear essas pastas pode prejudicar a leitura.
- Confundir Google-Extended com Googlebot. Bloquear o Googlebot achando que está saindo "só do Gemini" tira o site do Google inteiro.
- Firewall barrando por volume. O Googlebot pode fazer muitas visitas seguidas em sites grandes. Uma proteção de volume mal ajustada devolve
429e reduz o rastreamento.
Perguntas frequentes
As AI Overviews usam o Googlebot ou o Google-Extended?
O Googlebot. As AI Overviews e o AI Mode fazem parte da busca do Google e usam o índice montado pelo Googlebot. O Google-Extended controla outros usos, ligados ao Gemini, e o Google afirma que ele não afeta a inclusão do site na busca.
Dá para sair das AI Overviews sem sair do Google?
Não de forma separada pelo robots.txt. O Google oferece controles de trecho, como a meta tag nosnippet e o atributo data-nosnippet, que limitam o que pode ser mostrado. Mas esses controles também afetam os trechos da busca comum.
Como sei se uma visita é do Googlebot de verdade?
O Google recomenda fazer a busca reversa de DNS do IP, que deve terminar em googlebot.com, google.com ou googleusercontent.com, e depois a busca direta do nome, que deve voltar ao mesmo IP. O Google também publica as faixas de IP em formato JSON.