O CCBot é o robô do Common Crawl, uma organização sem fins lucrativos que rastreia a web há muitos anos e publica tudo como um grande arquivo público e gratuito. Ele não alimenta um assistente específico. Em vez disso, o arquivo que ele produz é usado por muita gente, incluindo pesquisadores e empresas que treinam modelos de linguagem.
Quem opera o CCBot e o que ele faz
O CCBot pertence ao Common Crawl. A cada rastreamento, o CCBot visita bilhões de páginas, e o resultado é publicado em arquivos que qualquer pessoa pode baixar. Esse material é usado em pesquisas acadêmicas, em ferramentas de análise da web e, de forma bem documentada, como uma das fontes de texto no treino de vários modelos de linguagem conhecidos.
O Common Crawl informa que o CCBot respeita o robots.txt e a instrução Crawl-delay. A página oficial do robô também explica como identificar as visitas legítimas.
Bloquear o CCBot tira você das respostas?
Não diretamente. Nenhum assistente usa o CCBot para buscar informação na hora da pergunta. O efeito é indireto e de longo prazo: o arquivo do Common Crawl é uma das fontes que alimentam o treino de modelos, e um site que fica fora dele tem menos chance de fazer parte do conhecimento geral desses modelos.
Para uma empresa pequena, a conta é esta: estar no Common Crawl aumenta a chance de o nome, os serviços e a região da empresa aparecerem no que os modelos aprendem, inclusive em modelos que você nem sabe que existem.
Por que o CCBot é complementar no Mecita
No Mecita, o CCBot é complementar: bloqueado, tira alguns pontos da checagem de acesso, mas não limita a nota. O motivo é que o bloqueio não tira o site de nenhuma resposta imediata. O efeito aparece aos poucos, no treino de modelos futuros, e depende de quem usa o arquivo e como.
Ainda assim, o CCBot costuma estar entre os primeiros nomes de qualquer lista de "bloqueie os robôs de IA". Vale saber que ele está lá e decidir de propósito.
Como liberar o CCBot no robots.txt
User-agent: CCBot
Allow: /
Se o seu servidor é pequeno e você quer espaçar as visitas em vez de bloquear, o Common Crawl aceita:
User-agent: CCBot
Allow: /
Crawl-delay: 10
O número é o intervalo em segundos entre uma página e outra. Se o seu arquivo tem bloqueios no grupo User-agent: *, repita-os aqui: o CCBot com grupo próprio ignora o grupo geral.
Como bloquear o CCBot no robots.txt
User-agent: CCBot
Disallow: /
Lembre que o bloqueio vale daqui para frente. O que já foi publicado em arquivos anteriores continua lá, e cópias desses arquivos já estão espalhadas por muitos lugares.
Como conferir as visitas do CCBot nos registros do servidor
grep -i "ccbot" /var/log/nginx/access.log
Em hospedagens com cPanel, baixe o registro em "Acessos brutos" e procure por "CCBot". O CCBot trabalha em rodadas: você pode ver muitas visitas num período e nenhuma por semanas. Confira o código de resposta de cada linha: 200 é página lida, 403 e 429 são visitas barradas.
Para confirmar que a visita é mesmo do Common Crawl, siga as orientações de verificação da página oficial do CCBot, já que qualquer programa pode usar esse nome.
Erros comuns
- Bloquear achando que é um assistente. O CCBot não responde a ninguém. Bloqueá-lo não tira o site de nenhuma busca, mas também não protege o que já foi arquivado.
- Copiar listas de bloqueio. As listas "anti-IA" que circulam por aí costumam incluir o CCBot. Decida com a informação completa, não por imitação.
- Achar que o bloqueio é retroativo. Arquivos anteriores continuam públicos.
- Firewall barrando rodadas de rastreamento. Como o CCBot visita muitas páginas em sequência, proteções de volume podem barrá-lo. Prefira o
Crawl-delay.
Perguntas frequentes
O que é o Common Crawl?
É uma organização sem fins lucrativos que rastreia a web e publica o resultado como um arquivo aberto e gratuito. Pesquisadores, universidades e empresas usam esse arquivo, e ele é uma das fontes de texto mais conhecidas no treino de modelos de linguagem.
Bloquear o CCBot apaga meu site do Common Crawl?
Não. O bloqueio vale para os próximos rastreamentos. As cópias que já foram publicadas em arquivos anteriores continuam disponíveis, porque o Common Crawl é um arquivo histórico.
O CCBot respeita o robots.txt?
Sim. O Common Crawl informa que o CCBot segue as regras do robots.txt, incluindo a instrução Crawl-delay, e também a meta tag nofollow.