- Definição
- Crawler: Crawler, ou robô de rastreamento, é um programa que visita páginas da internet automaticamente, lê o conteúdo e segue os links para descobrir outras páginas. É assim que buscadores e assistentes de IA ficam sabendo que o seu site existe.
Como funciona
Um crawler funciona como um visitante incansável. Ele chega a uma página, baixa o conteúdo, anota os links que encontrou e vai visitando um por um. Antes de entrar num site, um crawler educado consulta o robots.txt para saber o que pode ler, e costuma usar o sitemap.xml como lista de páginas.
Cada crawler se apresenta com um nome, o user-agent. É por esse nome que você sabe quem visitou e é com ele que você escreve regras no robots.txt.
Os três tipos de robô de IA
Nem todo robô de IA faz a mesma coisa. Vale separar três papéis:
- Robôs de treino. Coletam páginas que podem entrar no material de treinamento de modelos de linguagem. Exemplos: GPTBot, da OpenAI, e ClaudeBot, da Anthropic.
- Robôs de índice de busca. Montam o índice que o assistente consulta quando precisa pesquisar. Exemplos: OAI-SearchBot, do ChatGPT, e PerplexityBot.
- Robôs sob demanda. Buscam uma página específica no momento em que um usuário pede algo ao assistente. Exemplos: ChatGPT-User e Perplexity-User.
Além deles, os crawlers dos buscadores tradicionais também alimentam a IA: o Googlebot abastece a busca do Google, inclusive os AI Overviews, e o Bingbot abastece o Bing e o Copilot. A lista completa, com o papel de cada um, está na página de robôs de IA.
Crawler não é navegador
A diferença mais importante entre um crawler e uma pessoa é o que cada um enxerga. O seu cliente abre o site num navegador que executa JavaScript, carrega imagens, fecha o aviso de cookies. Muitos crawlers de IA fazem bem menos: baixam o HTML e leem o texto que já veio pronto. Se o conteúdo só aparece depois que o JavaScript roda, o crawler pode ver uma página praticamente vazia. Esse é o assunto de JavaScript e renderização.
Por que importa para o seu negócio
Tudo o que um assistente sabe sobre a sua empresa passou, em algum momento, por um crawler. Se o crawler não entra, não lê ou lê uma página vazia, o assistente fica sem fonte. Aí ele ou deixa você de fora da resposta, ou preenche o espaço com informação velha de outros sites.
Um exemplo
Uma loja de móveis planejados tem o catálogo inteiro montado por JavaScript. Para o cliente, o site é ótimo. Para um crawler que só lê HTML, a página de produtos tem apenas o menu e o rodapé. Quando alguém pede ao assistente “lojas de móveis planejados com cozinha sob medida”, a loja não tem nenhum texto que diga que faz cozinha sob medida.
Como o Mecita olha para isso
O diagnóstico faz exatamente o que um crawler de IA faz: pede a página sem executar JavaScript, lê o robots.txt e confere quem pode entrar. As checagens mostram o resultado de cada etapa.
Perguntas frequentes
Crawler gasta a banda do meu site?
Um pouco, como qualquer visita. Os robôs das grandes empresas costumam controlar o ritmo para não sobrecarregar o servidor. Se algum robô estiver exagerando, dá para limitar no servidor sem bloquear os robôs que trazem clientes.
Como sei se um crawler de IA já visitou o meu site?
Os registros de acesso do servidor mostram o user-agent de cada visita. Procure nomes como GPTBot, ClaudeBot ou PerplexityBot. Muitos serviços de hospedagem mostram esses registros no painel.
Faltou algum termo? Veja o glossário completo.