Pular para o conteúdo
mecita

Como um assistente de IA lê o seu site, passo a passo

Do robots.txt à citação: o caminho que ChatGPT, Perplexity e Gemini percorrem para ler o seu site, e onde cada passo costuma quebrar.
Técnico

8 min de leitura

Por Equipe Mecita

Quando alguém pergunta pro ChatGPT "qual a melhor padaria na Vila Mariana?", a resposta parece surgir do nada. Não surge. Antes de o assistente escrever a primeira palavra, uma sequência de etapas bem mecânicas já aconteceu: um robô pediu licença pra entrar no site, baixou a página, separou o texto do resto, tentou entender de quem era aquele negócio e escolheu os trechos que valiam a pena repetir.

Cada uma dessas etapas pode falhar sem aviso nenhum. O site continua no ar, os clientes continuam entrando pelo navegador, e o dono nem desconfia que, pra IA, a empresa simplesmente não existe. Este artigo percorre o caminho inteiro, passo a passo, e mostra onde ele costuma quebrar.

Dois jeitos de a IA chegar ao seu site

Existem dois momentos em que um assistente de IA pode ler a sua página, e vale separar os dois porque eles usam robôs diferentes.

O primeiro é antes da pergunta. Empresas como OpenAI, Anthropic e Perplexity mantêm robôs que percorrem a web o tempo todo e guardam o que encontram num índice próprio. O GPTBot e o OAI-SearchBot fazem isso pra OpenAI, o ClaudeBot pra Anthropic, o PerplexityBot pro Perplexity. Do lado do Google e da Microsoft, os robôs de busca tradicionais, Googlebot e Bingbot, também alimentam as respostas geradas por IA dessas empresas.

O segundo é durante a pergunta. Quando o usuário pede algo que o índice não cobre, o assistente pode abrir uma página na hora, como um navegador faria. Pra isso existem agentes como o ChatGPT-User, o Perplexity-User e o Claude-User.

Na prática, os dois caminhos passam pelas mesmas etapas. O que muda é quem bate na porta. A lista completa, com o que cada um alimenta, está na nossa página de robôs de IA.

Passo 1: pedir licença no robots.txt

Antes de ler qualquer página, um robô bem-comportado abre o arquivo robots.txt na raiz do domínio, por exemplo padariaexemplo.com.br/robots.txt. É ali que o site diz quem pode entrar e onde.

O arquivo é dividido em grupos. Cada grupo começa com uma ou mais linhas User-agent e traz regras Allow e Disallow:

User-agent: GPTBot
Disallow: /

User-agent: *
Allow: /

Nesse exemplo, todo mundo pode entrar, menos o GPTBot. O robô procura o grupo com o nome dele; se não encontra, usa o grupo *. Quando duas regras se aplicam ao mesmo endereço, vence a mais específica, ou seja, a de caminho mais longo.

É aqui que acontece o bloqueio mais comum e mais silencioso. Muita gente copiou um robots.txt pronto, ou instalou um plugin de "proteção contra IA", sem saber que estava fechando a porta pros assistentes que os clientes usam pra procurar empresas.

Um detalhe que confunde: nem todo nome que aparece num robots.txt é um robô que visita o site. O Google-Extended, por exemplo, é um sinal que controla se o conteúdo lido pelo Google pode ser usado pelo Gemini; quem busca a página continua sendo o Googlebot. Cada empresa documenta como os próprios robôs tratam essas regras, e a documentação muda, então vale consultar a fonte de cada um.

Passo 2: baixar o HTML

Com a licença em mãos, o robô faz um pedido simples ao servidor e recebe de volta o HTML da página. Três coisas podem dar errado aqui.

A primeira é o código de resposta. Um 200 significa "aqui está a página". Um 404, um 500 ou uma cadeia longa de redirecionamentos fazem o robô desistir ou guardar a versão errada.

A segunda é o tempo. Robôs têm pressa e não esperam indefinidamente. Uma página que demora muito pra começar a responder pode ser abandonada no meio.

A terceira, e a mais traiçoeira, é o JavaScript. Muitos sites modernos entregam um HTML quase vazio e montam o conteúdo no navegador, com JavaScript. Pra quem visita, a página aparece completa. Pra um robô que não executa JavaScript, e muitos robôs de IA não executam, a página é só um esqueleto: um cabeçalho, uma div vazia e um monte de scripts.

Dá pra ver isso sozinho. No navegador, clique com o botão direito e escolha "Exibir código-fonte da página". Se o texto que você escreveu, o endereço e os serviços não estão ali, é bem provável que a IA também não esteja vendo.

Passo 3: separar o conteúdo do resto

O HTML de uma página tem muito mais do que o texto: menu, rodapé, banner de cookies, scripts de anúncio, ícones. Antes de guardar alguma coisa, o sistema tenta isolar o conteúdo principal e jogar fora o resto.

Essa limpeza funciona melhor quando a página ajuda:

  • Títulos de verdade. Um h1 com o assunto da página e h2 pras seções dizem onde começa e termina cada parte.
  • Texto como texto. Cardápio em foto, preço dentro de imagem e horário num banner não viram palavras pra um robô. No máximo, o texto alternativo da imagem.
  • Parágrafos com começo, meio e fim. Frases soltas espalhadas por blocos de design perdem o sentido quando o layout some.

Uma boa forma de pensar: se você copiasse todo o texto da página e colasse num bloco de notas, ele ainda faria sentido? É mais ou menos isso que sobra pra IA.

Passo 4: entender quem você é

Com o texto limpo, o assistente precisa responder a uma pergunta que parece óbvia: de quem é esta página? Uma padaria, uma clínica, um escritório de advocacia? Onde fica? Abre quando?

Ele junta as pistas que encontra:

  • o title e a meta description, que também aparecem na busca;
  • o h1 e os primeiros parágrafos;
  • endereço, telefone e horário escritos no texto;
  • os dados estruturados, um bloco invisível em formato JSON-LD que descreve a empresa num vocabulário padrão, o schema.org.

Os dados estruturados são a forma mais direta de tirar a dúvida. Em vez de o sistema adivinhar que "Rua Domingos de Morais, 1000" é um endereço, a página declara: isto é uma Bakery, este é o endereço, estes são os horários. Quando o texto visível e os dados estruturados dizem a mesma coisa, a chance de a IA errar diminui.

O contrário também vale. Um título genérico como "Home", nenhum endereço no texto e dados desencontrados entre páginas deixam o assistente sem certeza, e um assistente sem certeza costuma preferir citar outra fonte.

Passo 5: escolher os trechos que valem uma citação

Os assistentes raramente usam uma página inteira. Eles recortam trechos, às vezes um único parágrafo, que respondem bem a uma pergunta específica. É o que chamamos de citabilidade.

Um trecho fácil de citar costuma ter estas características:

  1. Responde sozinho. Faz sentido mesmo lido fora da página, sem depender de "como dissemos acima".
  2. É específico. Nomes, bairros, preços, prazos e números concretos em vez de adjetivos como "o melhor atendimento da região".
  3. Vem logo depois de uma pergunta ou título claro. "Vocês entregam no Paraíso?" seguido de uma resposta direta é praticamente um convite.
  4. Tem tamanho de parágrafo. Nem uma frase solta, nem um bloco de vinte linhas.

É por isso que páginas de perguntas frequentes bem escritas funcionam tão bem: cada resposta já é um trecho pronto.

Passo 6: montar a resposta e, às vezes, citar a fonte

Por fim, o assistente junta o que encontrou no seu site com o que encontrou em outros lugares, como avaliações, guias, reportagens e diretórios, e escreve a resposta.

Se ele mostra ou não o link da fonte depende do produto e do tipo de pergunta. Buscadores com IA, como o Perplexity e a busca do ChatGPT, costumam listar as páginas consultadas. Em outras situações, a resposta vem do que o modelo aprendeu antes, sem link nenhum.

Não existe botão que garanta a citação. O que existe é tirar os obstáculos do caminho: se o robô não entra, não lê o texto ou não entende quem você é, a sua empresa fica fora da resposta antes mesmo de competir.

Onde cada passo costuma quebrar

PassoO que costuma dar erradoComo conferir
1. Licençarobots.txt bloqueando robôs de IA; firewall com 403Abrir /robots.txt e procurar os nomes dos robôs
2. DownloadPágina lenta, erro 5xx, conteúdo montado só no navegador"Exibir código-fonte" e procurar o seu texto
3. LimpezaTexto em imagens, sem h1, parágrafos soltosCopiar a página num bloco de notas
4. IdentidadeTítulo "Home", sem endereço, sem dados estruturadosLer o título da aba e o código-fonte
5. TrechosSó adjetivos, nenhuma resposta diretaProcurar respostas a perguntas que os clientes fazem
6. RespostaNada a fazer diretamente, depende dos passos anterioresPerguntar ao assistente sobre o seu negócio

O diagnóstico do Mecita verifica exatamente essas etapas, de forma automática: se os robôs de IA têm acesso, se o texto existe sem JavaScript, se a página diz quem você é, se há dados estruturados e se o conteúdo tem trechos citáveis. Cada verificação está explicada em as checagens, e o cálculo da nota em como funciona.

Como testar o seu site agora

Se você quer fazer um teste rápido sem ferramenta nenhuma, siga esta ordem:

  1. Abra seusite.com.br/robots.txt e procure GPTBot, ClaudeBot, PerplexityBot e Disallow: /. Uma linha Disallow: / debaixo do nome de um desses robôs é um bloqueio total.
  2. Abra a página inicial, exiba o código-fonte e procure uma frase que você sabe que está no site. Se ela não aparece, o texto depende de JavaScript.
  3. Olhe o título da aba do navegador. Ele diz o nome da empresa e o que ela faz?
  4. Pergunte a um assistente de IA sobre o seu negócio pelo nome e veja se a resposta usa informações do seu site.

Ou deixe que a gente faça isso por você, com todos os robôs de uma vez:

Veja em que passo o seu site trava

Digite o endereço e veja em segundos o que impede ChatGPT, Perplexity e Gemini de citar a sua empresa.

✓ Sem cadastro✓ Sem cartão✓ 15 robôs de IA verificados

Perguntas frequentes

Se o meu site aparece no Google, a IA também consegue ler?

Não necessariamente. O Google executa JavaScript e tem um robô próprio; muitos robôs de IA leem só o HTML que o servidor entrega e respeitam regras separadas no robots.txt. Um site pode estar bem no Google e continuar invisível pro ChatGPT ou pro Perplexity.

Bloquear o GPTBot impede o ChatGPT de falar da minha empresa?

Impede o robô de treino da OpenAI de ler o seu site. O ChatGPT ainda pode citar o que outros sites dizem sobre você, mas perde a sua própria versão dos fatos: horário, endereço, serviços e preços escritos por você.

Preciso de um programador para corrigir esses problemas?

Depende do passo. Liberar os robôs no robots.txt e revisar título e descrição costumam ser ajustes no painel da plataforma. Mudar a forma como a página é renderizada ou adicionar dados estruturados pode pedir ajuda técnica.

Leia também

Descubra se a IA consegue ler o seu site

Digite o endereço e veja em segundos o que impede ChatGPT, Perplexity e Gemini de citar a sua empresa.

✓ Sem cadastro✓ Sem cartão✓ 15 robôs de IA verificados