A pergunta que ouço mais em call de agência é: "Alex, como eu sei se estou aparecendo nas IAs?". Quem responde "abre o ChatGPT e testa" está fazendo o mesmo que abrir o Google, ver a marca em primeiro, e concluir que ela ranqueia bem para todo mundo. Não funciona assim, e há uma década a gente já sabe que não funciona assim. Modelo generativo tem variação por horário, por cidade, por sessão, por versão. Print é anedota.
Medição, por outro lado, é um número que muda de forma previsível quando você mexe em coisas certas. Vou mostrar o método que uso, direto do que roda dentro da Vynco na operação real.
O que exatamente estamos medindo
A métrica principal é taxa de citação por conjunto de perguntas relevantes. Em português claro: dado um conjunto de perguntas que um cliente real faria, em qual porcentagem dessas perguntas a sua marca é citada por um modelo específico. Todo o resto é derivado disso.
Métricas secundárias:
- Share of voice — quando sua marca aparece, quantas outras marcas aparecem junto, e em qual posição você fica.
- Substitutos — quem aparece quando você não aparece. Este é o dado mais estratégico de todos.
- Sensibilidade geográfica — quanto muda a resposta entre São Paulo, Recife e Curitiba.
- Sensibilidade temporal — a resposta é estável ao longo da semana ou está volátil.
Como montar o conjunto de perguntas
Este é o passo que quase todo mundo pula, e é o que separa dado bom de dado ruim. Uma lista de "palavras-chave do SEO" não serve. Precisa ser como a pessoa pergunta, com verbo, com hesitação, com contexto. Uso três fontes:
- SAC e comercial — as perguntas que o time recebe por WhatsApp e telefone. É o material mais fiel de linguagem real.
- Search Console — as buscas que já trazem a marca no orgânico, ajustadas para linguagem conversacional.
- Perguntas frias — perguntas que não mencionam sua marca, mas que qualquer cliente potencial faria. Ex: "qual a melhor plataforma para medir citação em IA?".
Um conjunto útil tem entre 40 e 120 perguntas. Menos que 40, o intervalo de confiança fica largo demais. Mais que 120, o custo de execução em vários modelos vira problema sem devolver muito insight adicional.
Metade das perguntas menciona a marca, metade não. As que mencionam medem se você é reconhecido. As que não mencionam medem se você é lembrado.
Quantas vezes rodar cada pergunta
Modelo generativo é probabilístico. A mesma pergunta pode devolver resposta diferente na segunda execução. Sem replicação, você está medindo ruído.
Regra que uso:
- Mínimo: 3 execuções por pergunta, por modelo, por praça.
- Ideal: 5 execuções, distribuídas em dias diferentes da semana.
- Contínuo: para monitoramento, uma execução por semana por pergunta, indefinidamente.
Com 60 perguntas, 4 modelos, 3 praças e 3 execuções, você tem 2.160 chamadas por rodada. Parece muito, mas é o que produz uma taxa com intervalo de confiança que dá para bater na mesa.
Quais modelos incluir
Cobrir todos é ilusão. Cobrir os que importam é obrigação. Meu padrão em 2026:
- ChatGPT (GPT-5 ou modelo em produção) — o maior em uso geral no Brasil.
- Google AI Overview / AI Mode — vai canibalizar boa parte do tráfego orgânico até o fim do ano.
- Perplexity — pequeno em volume, gigante em contexto profissional.
- Gemini — presente em toda a suíte Google que a pessoa já usa no trabalho.
Copilot e Claude entram se o cliente é B2B corporativo. Meta AI entra se o cliente é DTC brasileiro. O resto, no ponto de maturidade atual, é ruído.
O que fazer com o resultado
Uma taxa de citação sem interpretação é só um número. O que ela precisa devolver são decisões:
- Se a taxa é baixa e os substitutos são consistentes — o problema é de entidade. O modelo tem outras marcas como padrão do setor e você não é reconhecível. Trabalho: reconstruir a presença externa (Wikipedia, LinkedIn, portais setoriais) e o schema.org de
Organization. - Se a taxa é baixa e os substitutos variam muito — o problema é de categoria. A IA não sabe onde encaixar a sua marca. Trabalho: reescrever a definição da marca em uma frase, replicar essa frase em todas as fontes.
- Se a taxa é média e há grande variação por praça — o problema é de local. Você existe para o modelo em algumas cidades e não em outras. Trabalho: presença geográfica com
LocalBusiness, imprensa regional, links locais. - Se a taxa é média e há grande variação por modelo — o problema é de fonte. Alguns modelos leem fontes que citam sua marca, outros não. Trabalho: mapear quais domínios cada modelo prefere e mirar aqueles.
Um relatório de presença em IA que não termina em três decisões concretas para as próximas quatro semanas não é relatório. É teatro de dashboard.
O que evitar
- Rodar em modo anônimo achando que resolve — resolve algumas variáveis, cria outras. O importante é rodar sempre no mesmo padrão de sessão.
- Perguntar direto "quem é a melhor marca de X" — quase toda IA moderna evita responder essa forma. Reformule para "quais opções existem", "o que considerar ao escolher".
- Comparar taxa de citação entre modelos como se fossem a mesma coisa — cada um tem viés próprio de fonte. Compare série temporal dentro do mesmo modelo, não taxa cruzada.
Como começamos com um cliente novo
Semana 1: define 60 perguntas com o comercial e o marketing do cliente. Semana 2: linha de base rodando 3× em 4 modelos e 3 praças. Semana 3: relatório com taxa, substitutos, hipótese de causa raiz e três decisões. A partir da semana 4: monitoramento contínuo semanal, com revisão trimestral do conjunto de perguntas.
Este é o processo que roda na Vynco hoje. Se o seu time quer construir isso na mão, o método está aí. Se quer usar a plataforma pronta, começa por vynco.ai/ferramentas. Se quer que a WB.P execute como serviço em contrato integrado, me chama.