Toda auditoria de presença em IA que faço começa pelo mesmo lugar: abrir o site com o cabeçalho de um agente de IA e ver o que aconteceu. Metade dos casos, alguma coisa deu errado antes de qualquer conversa sobre estratégia começar. Este é o checklist que uso, na ordem em que testo.
1. Anti-bot da CDN bloqueando o agente
Cloudflare, Akamai, AWS WAF, Vercel Edge. Todos entregam, por padrão, um bloqueio genérico contra "bots suspeitos". Muitos operam mirando o User-Agent, e alguns já classificam GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot como suspeitos. Se o crawler tenta abrir o site e recebe um 403, um desafio de JavaScript ou um bloqueio de país, sua marca não existe para ele. Ponto.
Como testar: curl -A "GPTBot/1.0" -I https://seusite.com. Se voltar 200, ok. Se voltar 403 ou 429 ou um HTML de "verificando você é humano", o site precisa liberar esse UA no WAF antes de qualquer outra coisa.
2. JavaScript rendering sem fallback
Sites em React, Vue e Next sem SSR ou pré-render entregam uma casca HTML vazia com scripts dentro. O modelo que abrir vai ler "carregando..." e virar as costas. Google e Bing renderizam JavaScript, com atraso e custo. Nenhum dos crawlers de IA renderiza JavaScript por padrão em 2026.
Como testar: curl https://seusite.com/pagina | grep "conteudo-principal". Se o texto real não aparece no HTML retornado, você tem problema.
3. robots.txt com bloqueio antigo
Muitos sites herdaram um robots.txt escrito em 2019, quando a discussão era outra. Bloqueiam User-agent: * em rotas grandes, ou têm regras contraditórias. Alguns bloqueiam explicitamente GPTBot por uma decisão comercial legítima de 2023 e ninguém revisou desde então. Se você quer citação em IA, precisa deixar o crawler entrar.
O que revisar: as regras específicas para GPTBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended. Se qualquer uma diz Disallow: /, você fechou a porta.
4. Meta robots ou X-Robots-Tag em conflito
Um site em WordPress mal configurado consegue devolver, ao mesmo tempo, meta name="robots" content="noindex" em algumas páginas e index, follow em outras. Um site atrás de um proxy pode devolver um X-Robots-Tag: noindex em cabeçalho sem ninguém saber. O crawler obedece o mais restritivo.
Como testar: curl -I https://seusite.com/pagina e verificar o cabeçalho X-Robots-Tag. E abrir a página e olhar o <head>. Se tiver contradição, o modelo vai obedecer a versão que bloqueia.
5. Canonical apontando para o lugar errado
Site com trailing slash inconsistente, com HTTPS/HTTP misturado, com versão AMP ainda apontando para o desktop. O modelo faz o mesmo que o Google: obedece o canonical. Se o canonical de uma boa página aponta para uma página fraca (ou pior, para 404), a página fraca é que passa a ser lida como fonte, e ela não tem conteúdo para citar.
6. Schema.org ausente ou quebrado
Dados estruturados não são obrigatórios para uma citação acontecer, mas quando eles estão presentes e corretos, aumentam a confiança do modelo de que a informação da página é o que ela diz ser. Site sem Organization, sem Article, sem Person em texto assinado, está deixando dinheiro em cima da mesa. E schema quebrado é pior que schema ausente: o modelo cruza os dados com fontes externas, encontra contradição, e omite a marca por conservadorismo.
Como testar: colar a URL no validator.schema.org e no Rich Results Test do Google. Se houver erro, corrige antes de escrever qualquer artigo novo.
7. Grafo de entidade inconsistente entre fontes
Este é o mais sutil dos oito, e o mais caro. O site diz que a empresa foi fundada em 2009. O LinkedIn corporativo diz 2011. Um press release antigo diz 2010. O Google Meu Negócio diz 2009. Perante essa contradição, o modelo tende a omitir a informação, e às vezes omite a marca inteira quando o dado seria central para a resposta.
O que revisar: nome oficial, ano de fundação, cidade sede, nome do fundador, categoria da empresa, e-mail comercial. Precisam bater em todas as fontes públicas relevantes. Não é vaidade. É credencial.
8. Velocidade e cabeçalho errado no primeiro byte
Site que demora oito segundos para servir o primeiro byte perde crawler. Os crawlers de IA têm orçamento apertado, e desistem antes do Googlebot. Um Time to First Byte acima de dois segundos é problema. Um Time to First Byte de oito segundos com Cache-Control: no-store é problema grave.
1. Anti-bot libera. 2. HTML renderiza sem JS. 3. robots.txt permite. 4. Meta robots sem conflito. 5. Canonical consistente. 6. Schema válido. 7. Grafo bate entre fontes. 8. Primeiro byte rápido.
Depois desse checklist
Só depois de fechar essas oito travas faz sentido conversar sobre pilar, satélite, autor, tema. Sem isso, o cliente vai pagar dez mil por mês em conteúdo que a máquina não consegue ler. Uso a Vynco para rodar esse checklist em bloco, com um relatório que mostra o que o agente da IA viu contra o que o navegador viu. Fazer manual dá, mas em cliente novo com trinta domínios (frota, franquia, rede), a mão não escala.