Pular para o conteúdo
mecita
Common Crawl · Common Crawl (arquivo público da web)

CCBot: o robô do Common Crawl, o arquivo aberto da web

O CCBot monta o Common Crawl, arquivo público da web usado por pesquisadores e empresas de IA. Veja o que muda ao bloquear e como liberar ou bloquear.

User-agent: CCBotComplementarAtualizado em

O CCBot é o robô do Common Crawl, uma organização sem fins lucrativos que rastreia a web há muitos anos e publica tudo como um grande arquivo público e gratuito. Ele não alimenta um assistente específico. Em vez disso, o arquivo que ele produz é usado por muita gente, incluindo pesquisadores e empresas que treinam modelos de linguagem.

Quem opera o CCBot e o que ele faz

O CCBot pertence ao Common Crawl. A cada rastreamento, o CCBot visita bilhões de páginas, e o resultado é publicado em arquivos que qualquer pessoa pode baixar. Esse material é usado em pesquisas acadêmicas, em ferramentas de análise da web e, de forma bem documentada, como uma das fontes de texto no treino de vários modelos de linguagem conhecidos.

O Common Crawl informa que o CCBot respeita o robots.txt e a instrução Crawl-delay. A página oficial do robô também explica como identificar as visitas legítimas.

Bloquear o CCBot tira você das respostas?

Não diretamente. Nenhum assistente usa o CCBot para buscar informação na hora da pergunta. O efeito é indireto e de longo prazo: o arquivo do Common Crawl é uma das fontes que alimentam o treino de modelos, e um site que fica fora dele tem menos chance de fazer parte do conhecimento geral desses modelos.

Para uma empresa pequena, a conta é esta: estar no Common Crawl aumenta a chance de o nome, os serviços e a região da empresa aparecerem no que os modelos aprendem, inclusive em modelos que você nem sabe que existem.

Por que o CCBot é complementar no Mecita

No Mecita, o CCBot é complementar: bloqueado, tira alguns pontos da checagem de acesso, mas não limita a nota. O motivo é que o bloqueio não tira o site de nenhuma resposta imediata. O efeito aparece aos poucos, no treino de modelos futuros, e depende de quem usa o arquivo e como.

Ainda assim, o CCBot costuma estar entre os primeiros nomes de qualquer lista de "bloqueie os robôs de IA". Vale saber que ele está lá e decidir de propósito.

Como liberar o CCBot no robots.txt

User-agent: CCBot
Allow: /

Se o seu servidor é pequeno e você quer espaçar as visitas em vez de bloquear, o Common Crawl aceita:

User-agent: CCBot
Allow: /
Crawl-delay: 10

O número é o intervalo em segundos entre uma página e outra. Se o seu arquivo tem bloqueios no grupo User-agent: *, repita-os aqui: o CCBot com grupo próprio ignora o grupo geral.

Como bloquear o CCBot no robots.txt

User-agent: CCBot
Disallow: /

Lembre que o bloqueio vale daqui para frente. O que já foi publicado em arquivos anteriores continua lá, e cópias desses arquivos já estão espalhadas por muitos lugares.

Como conferir as visitas do CCBot nos registros do servidor

grep -i "ccbot" /var/log/nginx/access.log

Em hospedagens com cPanel, baixe o registro em "Acessos brutos" e procure por "CCBot". O CCBot trabalha em rodadas: você pode ver muitas visitas num período e nenhuma por semanas. Confira o código de resposta de cada linha: 200 é página lida, 403 e 429 são visitas barradas.

Para confirmar que a visita é mesmo do Common Crawl, siga as orientações de verificação da página oficial do CCBot, já que qualquer programa pode usar esse nome.

Erros comuns

  • Bloquear achando que é um assistente. O CCBot não responde a ninguém. Bloqueá-lo não tira o site de nenhuma busca, mas também não protege o que já foi arquivado.
  • Copiar listas de bloqueio. As listas "anti-IA" que circulam por aí costumam incluir o CCBot. Decida com a informação completa, não por imitação.
  • Achar que o bloqueio é retroativo. Arquivos anteriores continuam públicos.
  • Firewall barrando rodadas de rastreamento. Como o CCBot visita muitas páginas em sequência, proteções de volume podem barrá-lo. Prefira o Crawl-delay.

Perguntas frequentes

O que é o Common Crawl?

É uma organização sem fins lucrativos que rastreia a web e publica o resultado como um arquivo aberto e gratuito. Pesquisadores, universidades e empresas usam esse arquivo, e ele é uma das fontes de texto mais conhecidas no treino de modelos de linguagem.

Bloquear o CCBot apaga meu site do Common Crawl?

Não. O bloqueio vale para os próximos rastreamentos. As cópias que já foram publicadas em arquivos anteriores continuam disponíveis, porque o Common Crawl é um arquivo histórico.

O CCBot respeita o robots.txt?

Sim. O Common Crawl informa que o CCBot segue as regras do robots.txt, incluindo a instrução Crawl-delay, e também a meta tag nofollow.

Outros robôs de IA

Descubra se o CCBot consegue entrar no seu site

O diagnóstico gratuito lê o seu robots.txt, confere cada robô de IA e mostra o que corrigir primeiro.

✓ Sem cadastro✓ Sem cartão✓ 15 robôs de IA verificados