Quando alguém pergunta pro ChatGPT "qual a melhor padaria na Vila Mariana?", a resposta parece surgir do nada. Não surge. Antes de o assistente escrever a primeira palavra, uma sequência de etapas bem mecânicas já aconteceu: um robô pediu licença pra entrar no site, baixou a página, separou o texto do resto, tentou entender de quem era aquele negócio e escolheu os trechos que valiam a pena repetir.
Cada uma dessas etapas pode falhar sem aviso nenhum. O site continua no ar, os clientes continuam entrando pelo navegador, e o dono nem desconfia que, pra IA, a empresa simplesmente não existe. Este artigo percorre o caminho inteiro, passo a passo, e mostra onde ele costuma quebrar.
Dois jeitos de a IA chegar ao seu site
Existem dois momentos em que um assistente de IA pode ler a sua página, e vale separar os dois porque eles usam robôs diferentes.
O primeiro é antes da pergunta. Empresas como OpenAI, Anthropic e Perplexity mantêm robôs que percorrem a web o tempo todo e guardam o que encontram num índice próprio. O GPTBot e o OAI-SearchBot fazem isso pra OpenAI, o ClaudeBot pra Anthropic, o PerplexityBot pro Perplexity. Do lado do Google e da Microsoft, os robôs de busca tradicionais, Googlebot e Bingbot, também alimentam as respostas geradas por IA dessas empresas.
O segundo é durante a pergunta. Quando o usuário pede algo que o índice não cobre, o assistente pode abrir uma página na hora, como um navegador faria. Pra isso existem agentes como o ChatGPT-User, o Perplexity-User e o Claude-User.
Na prática, os dois caminhos passam pelas mesmas etapas. O que muda é quem bate na porta. A lista completa, com o que cada um alimenta, está na nossa página de robôs de IA.
Passo 1: pedir licença no robots.txt
Antes de ler qualquer página, um robô bem-comportado abre o arquivo robots.txt na raiz do domínio, por exemplo padariaexemplo.com.br/robots.txt. É ali que o site diz quem pode entrar e onde.
O arquivo é dividido em grupos. Cada grupo começa com uma ou mais linhas User-agent e traz regras Allow e Disallow:
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
Nesse exemplo, todo mundo pode entrar, menos o GPTBot. O robô procura o grupo com o nome dele; se não encontra, usa o grupo *. Quando duas regras se aplicam ao mesmo endereço, vence a mais específica, ou seja, a de caminho mais longo.
É aqui que acontece o bloqueio mais comum e mais silencioso. Muita gente copiou um robots.txt pronto, ou instalou um plugin de "proteção contra IA", sem saber que estava fechando a porta pros assistentes que os clientes usam pra procurar empresas.
Um detalhe que confunde: nem todo nome que aparece num robots.txt é um robô que visita o site. O Google-Extended, por exemplo, é um sinal que controla se o conteúdo lido pelo Google pode ser usado pelo Gemini; quem busca a página continua sendo o Googlebot. Cada empresa documenta como os próprios robôs tratam essas regras, e a documentação muda, então vale consultar a fonte de cada um.
Passo 2: baixar o HTML
Com a licença em mãos, o robô faz um pedido simples ao servidor e recebe de volta o HTML da página. Três coisas podem dar errado aqui.
A primeira é o código de resposta. Um 200 significa "aqui está a página". Um 404, um 500 ou uma cadeia longa de redirecionamentos fazem o robô desistir ou guardar a versão errada.
A segunda é o tempo. Robôs têm pressa e não esperam indefinidamente. Uma página que demora muito pra começar a responder pode ser abandonada no meio.
A terceira, e a mais traiçoeira, é o JavaScript. Muitos sites modernos entregam um HTML quase vazio e montam o conteúdo no navegador, com JavaScript. Pra quem visita, a página aparece completa. Pra um robô que não executa JavaScript, e muitos robôs de IA não executam, a página é só um esqueleto: um cabeçalho, uma div vazia e um monte de scripts.
Dá pra ver isso sozinho. No navegador, clique com o botão direito e escolha "Exibir código-fonte da página". Se o texto que você escreveu, o endereço e os serviços não estão ali, é bem provável que a IA também não esteja vendo.
Passo 3: separar o conteúdo do resto
O HTML de uma página tem muito mais do que o texto: menu, rodapé, banner de cookies, scripts de anúncio, ícones. Antes de guardar alguma coisa, o sistema tenta isolar o conteúdo principal e jogar fora o resto.
Essa limpeza funciona melhor quando a página ajuda:
- Títulos de verdade. Um
h1com o assunto da página eh2pras seções dizem onde começa e termina cada parte. - Texto como texto. Cardápio em foto, preço dentro de imagem e horário num banner não viram palavras pra um robô. No máximo, o texto alternativo da imagem.
- Parágrafos com começo, meio e fim. Frases soltas espalhadas por blocos de design perdem o sentido quando o layout some.
Uma boa forma de pensar: se você copiasse todo o texto da página e colasse num bloco de notas, ele ainda faria sentido? É mais ou menos isso que sobra pra IA.
Passo 4: entender quem você é
Com o texto limpo, o assistente precisa responder a uma pergunta que parece óbvia: de quem é esta página? Uma padaria, uma clínica, um escritório de advocacia? Onde fica? Abre quando?
Ele junta as pistas que encontra:
- o
titlee a meta description, que também aparecem na busca; - o
h1e os primeiros parágrafos; - endereço, telefone e horário escritos no texto;
- os dados estruturados, um bloco invisível em formato JSON-LD que descreve a empresa num vocabulário padrão, o schema.org.
Os dados estruturados são a forma mais direta de tirar a dúvida. Em vez de o sistema adivinhar que "Rua Domingos de Morais, 1000" é um endereço, a página declara: isto é uma Bakery, este é o endereço, estes são os horários. Quando o texto visível e os dados estruturados dizem a mesma coisa, a chance de a IA errar diminui.
O contrário também vale. Um título genérico como "Home", nenhum endereço no texto e dados desencontrados entre páginas deixam o assistente sem certeza, e um assistente sem certeza costuma preferir citar outra fonte.
Passo 5: escolher os trechos que valem uma citação
Os assistentes raramente usam uma página inteira. Eles recortam trechos, às vezes um único parágrafo, que respondem bem a uma pergunta específica. É o que chamamos de citabilidade.
Um trecho fácil de citar costuma ter estas características:
- Responde sozinho. Faz sentido mesmo lido fora da página, sem depender de "como dissemos acima".
- É específico. Nomes, bairros, preços, prazos e números concretos em vez de adjetivos como "o melhor atendimento da região".
- Vem logo depois de uma pergunta ou título claro. "Vocês entregam no Paraíso?" seguido de uma resposta direta é praticamente um convite.
- Tem tamanho de parágrafo. Nem uma frase solta, nem um bloco de vinte linhas.
É por isso que páginas de perguntas frequentes bem escritas funcionam tão bem: cada resposta já é um trecho pronto.
Passo 6: montar a resposta e, às vezes, citar a fonte
Por fim, o assistente junta o que encontrou no seu site com o que encontrou em outros lugares, como avaliações, guias, reportagens e diretórios, e escreve a resposta.
Se ele mostra ou não o link da fonte depende do produto e do tipo de pergunta. Buscadores com IA, como o Perplexity e a busca do ChatGPT, costumam listar as páginas consultadas. Em outras situações, a resposta vem do que o modelo aprendeu antes, sem link nenhum.
Não existe botão que garanta a citação. O que existe é tirar os obstáculos do caminho: se o robô não entra, não lê o texto ou não entende quem você é, a sua empresa fica fora da resposta antes mesmo de competir.
Onde cada passo costuma quebrar
| Passo | O que costuma dar errado | Como conferir |
|---|---|---|
| 1. Licença | robots.txt bloqueando robôs de IA; firewall com 403 | Abrir /robots.txt e procurar os nomes dos robôs |
| 2. Download | Página lenta, erro 5xx, conteúdo montado só no navegador | "Exibir código-fonte" e procurar o seu texto |
| 3. Limpeza | Texto em imagens, sem h1, parágrafos soltos | Copiar a página num bloco de notas |
| 4. Identidade | Título "Home", sem endereço, sem dados estruturados | Ler o título da aba e o código-fonte |
| 5. Trechos | Só adjetivos, nenhuma resposta direta | Procurar respostas a perguntas que os clientes fazem |
| 6. Resposta | Nada a fazer diretamente, depende dos passos anteriores | Perguntar ao assistente sobre o seu negócio |
O diagnóstico do Mecita verifica exatamente essas etapas, de forma automática: se os robôs de IA têm acesso, se o texto existe sem JavaScript, se a página diz quem você é, se há dados estruturados e se o conteúdo tem trechos citáveis. Cada verificação está explicada em as checagens, e o cálculo da nota em como funciona.
Como testar o seu site agora
Se você quer fazer um teste rápido sem ferramenta nenhuma, siga esta ordem:
- Abra
seusite.com.br/robots.txte procureGPTBot,ClaudeBot,PerplexityBoteDisallow: /. Uma linhaDisallow: /debaixo do nome de um desses robôs é um bloqueio total. - Abra a página inicial, exiba o código-fonte e procure uma frase que você sabe que está no site. Se ela não aparece, o texto depende de JavaScript.
- Olhe o título da aba do navegador. Ele diz o nome da empresa e o que ela faz?
- Pergunte a um assistente de IA sobre o seu negócio pelo nome e veja se a resposta usa informações do seu site.
Ou deixe que a gente faça isso por você, com todos os robôs de uma vez:
Veja em que passo o seu site trava
Digite o endereço e veja em segundos o que impede ChatGPT, Perplexity e Gemini de citar a sua empresa.
✓ Sem cadastro✓ Sem cartão✓ 15 robôs de IA verificados
Perguntas frequentes
Se o meu site aparece no Google, a IA também consegue ler?
Não necessariamente. O Google executa JavaScript e tem um robô próprio; muitos robôs de IA leem só o HTML que o servidor entrega e respeitam regras separadas no robots.txt. Um site pode estar bem no Google e continuar invisível pro ChatGPT ou pro Perplexity.
Bloquear o GPTBot impede o ChatGPT de falar da minha empresa?
Impede o robô de treino da OpenAI de ler o seu site. O ChatGPT ainda pode citar o que outros sites dizem sobre você, mas perde a sua própria versão dos fatos: horário, endereço, serviços e preços escritos por você.
Preciso de um programador para corrigir esses problemas?
Depende do passo. Liberar os robôs no robots.txt e revisar título e descrição costumam ser ajustes no painel da plataforma. Mudar a forma como a página é renderizada ou adicionar dados estruturados pode pedir ajuda técnica.