Pular para o conteúdo
mecita
Glossário

O que é crawler (robô de rastreamento)

2 min de leituraAtualizado em
Definição
Crawler: Crawler, ou robô de rastreamento, é um programa que visita páginas da internet automaticamente, lê o conteúdo e segue os links para descobrir outras páginas. É assim que buscadores e assistentes de IA ficam sabendo que o seu site existe.

Como funciona

Um crawler funciona como um visitante incansável. Ele chega a uma página, baixa o conteúdo, anota os links que encontrou e vai visitando um por um. Antes de entrar num site, um crawler educado consulta o robots.txt para saber o que pode ler, e costuma usar o sitemap.xml como lista de páginas.

Cada crawler se apresenta com um nome, o user-agent. É por esse nome que você sabe quem visitou e é com ele que você escreve regras no robots.txt.

Os três tipos de robô de IA

Nem todo robô de IA faz a mesma coisa. Vale separar três papéis:

  1. Robôs de treino. Coletam páginas que podem entrar no material de treinamento de modelos de linguagem. Exemplos: GPTBot, da OpenAI, e ClaudeBot, da Anthropic.
  2. Robôs de índice de busca. Montam o índice que o assistente consulta quando precisa pesquisar. Exemplos: OAI-SearchBot, do ChatGPT, e PerplexityBot.
  3. Robôs sob demanda. Buscam uma página específica no momento em que um usuário pede algo ao assistente. Exemplos: ChatGPT-User e Perplexity-User.

Além deles, os crawlers dos buscadores tradicionais também alimentam a IA: o Googlebot abastece a busca do Google, inclusive os AI Overviews, e o Bingbot abastece o Bing e o Copilot. A lista completa, com o papel de cada um, está na página de robôs de IA.

Crawler não é navegador

A diferença mais importante entre um crawler e uma pessoa é o que cada um enxerga. O seu cliente abre o site num navegador que executa JavaScript, carrega imagens, fecha o aviso de cookies. Muitos crawlers de IA fazem bem menos: baixam o HTML e leem o texto que já veio pronto. Se o conteúdo só aparece depois que o JavaScript roda, o crawler pode ver uma página praticamente vazia. Esse é o assunto de JavaScript e renderização.

Por que importa para o seu negócio

Tudo o que um assistente sabe sobre a sua empresa passou, em algum momento, por um crawler. Se o crawler não entra, não lê ou lê uma página vazia, o assistente fica sem fonte. Aí ele ou deixa você de fora da resposta, ou preenche o espaço com informação velha de outros sites.

Um exemplo

Uma loja de móveis planejados tem o catálogo inteiro montado por JavaScript. Para o cliente, o site é ótimo. Para um crawler que só lê HTML, a página de produtos tem apenas o menu e o rodapé. Quando alguém pede ao assistente “lojas de móveis planejados com cozinha sob medida”, a loja não tem nenhum texto que diga que faz cozinha sob medida.

Como o Mecita olha para isso

O diagnóstico faz exatamente o que um crawler de IA faz: pede a página sem executar JavaScript, lê o robots.txt e confere quem pode entrar. As checagens mostram o resultado de cada etapa.

Perguntas frequentes

Crawler gasta a banda do meu site?

Um pouco, como qualquer visita. Os robôs das grandes empresas costumam controlar o ritmo para não sobrecarregar o servidor. Se algum robô estiver exagerando, dá para limitar no servidor sem bloquear os robôs que trazem clientes.

Como sei se um crawler de IA já visitou o meu site?

Os registros de acesso do servidor mostram o user-agent de cada visita. Procure nomes como GPTBot, ClaudeBot ou PerplexityBot. Muitos serviços de hospedagem mostram esses registros no painel.

Faltou algum termo? Veja o glossário completo.

Termos relacionados

  • User-agent

    User-agent é a identificação que um navegador ou robô envia ao visitar um site, dizendo quem ele é. No robots.txt, é o nome usado para escrever regras para um robô específico, como GPTBot ou PerplexityBot.

  • robots.txt

    robots.txt é um arquivo de texto no endereço /robots.txt do site que diz aos robôs de busca e de IA quais páginas eles podem ou não visitar. É o primeiro lugar que um robô educado consulta antes de entrar.

  • JavaScript e renderização

    Renderização por JavaScript, ou no cliente, é quando a página chega quase vazia e o conteúdo só é montado depois, no navegador. Robôs que não executam JavaScript, como muitos robôs de IA, leem essa página praticamente em branco.

Veja como o seu site se sai nisso

O diagnóstico gratuito lê o seu site do jeito que um robô de IA lê e mostra o que corrigir primeiro.

✓ Sem cadastro✓ Sem cartão✓ 15 robôs de IA verificados