Como medir a presença de uma marca no ChatGPT, Gemini e Perplexity
Antes de tentar "aparecer mais" em respostas de IA generativa, é preciso saber onde você está hoje. Sem uma linha de base numérica, qualquer mudança no conteúdo é adivinhação. Este documento descreve um método de medição — reproduzível, comparável entre rodadas e independente de qualquer tática de otimização.
O que conta como "presença" em uma resposta de LLM
Presença não é um binário simples. Uma marca pode aparecer de várias formas dentro de uma resposta gerada, e cada forma tem peso diferente para o leitor final. Considere presente quando ocorre um destes eventos:
- Menção nominal: o nome da marca aparece no corpo da resposta em texto corrido.
- Citação como fonte: a marca aparece como referência bibliográfica ou link (comum no Perplexity, ocasional no ChatGPT com busca e no Gemini).
- Recomendação direta: o motor sugere a marca como resposta ao pedido do usuário ("uma boa opção é X").
- Inclusão em lista comparativa: a marca aparece dentro de uma enumeração de opções, mesmo sem destaque individual.
- Aparição em link de referência: URL da marca surge nos rodapés de fontes ou nos cartões laterais de citações.
Fixar essa definição por escrito antes de começar a coletar dados é o que garante que dois analistas contando a mesma resposta cheguem ao mesmo número.
Métricas mensuráveis
A partir da definição acima, você deriva métricas que podem ser agregadas ao longo do tempo:
- Taxa de menção por prompt: em quantas execuções do mesmo prompt a marca apareceu, dividido pelo total de execuções.
- Share of Voice em IA: participação da marca no conjunto de marcas mencionadas dentro de uma categoria — quantas vezes você aparece frente ao total de aparições de todos os concorrentes rastreados.
- Posição na resposta: em qual ordem a marca é citada quando há lista (1º, 2º, 3º etc.).
- Sentimento associado: contexto positivo, neutro ou crítico em torno da menção.
- Cobertura de fontes citadas: quantas das URLs listadas como fontes pelo motor pertencem ao domínio da marca.
- Frequência de recomendação direta: subconjunto da taxa de menção em que o motor explicitamente sugere a marca como escolha.
Registre cada métrica separadamente. Uma marca pode ter taxa de menção alta e posição média baixa — ou aparecer sempre em listas comparativas mas nunca como recomendação direta. Agrupar tudo em um número único apaga o diagnóstico.
Prompts de teste padronizados
O ponto de partida é um conjunto fixo de prompts que representem a categoria da marca. Divida em quatro tipos, para cobrir intenções distintas:
- Informacional: "O que é [categoria/serviço]?"; "Como funciona [tema associado à marca]?".
- Comparativo: "Quais são as melhores opções de [categoria] no Brasil?"; "Compare [marca A] e [marca B]".
- Transacional: "Onde contratar [serviço]?"; "Quanto custa [produto/serviço] em [região]?".
- Recomendação direta: "Recomende uma [categoria] para [perfil de cliente]"; "Qual [categoria] você indicaria para [caso de uso]?".
Alguns pontos que preservam a comparabilidade:
- Use o mesmo texto literal em todos os motores. Alterar uma vírgula muda a resposta.
- Não personalize com a marca dentro do prompt (isso enviesa o resultado — você quer saber se a marca emerge, não confirmar que o motor sabe repetir o nome).
- Fixe o idioma e, quando o motor permitir, a região (pt-BR, Brasil).
- Mantenha o conjunto congelado entre rodadas. Se precisar adicionar prompts novos, marque como nova coorte e não some com a série histórica.
Um conjunto inicial de 15 a 25 prompts costuma ser suficiente para uma categoria bem delimitada. Menos que isso cobre pouca variação de intenção; muito mais aumenta o custo operacional sem ganho proporcional de sinal.
Diferenças de coleta entre os três motores
Cada motor exige um procedimento próprio de captura, porque expõe informação diferente:
ChatGPT
- A resposta varia conforme o modelo escolhido (por exemplo, GPT-4o, o1 e variantes com raciocínio). Registre modelo e data.
- O modo com busca ativa (quando o motor consulta a web) produz respostas diferentes do modo puramente generativo. Trate como coletas separadas.
- Fontes nem sempre aparecem — quando aparecem, capture-as junto da resposta.
- Comece cada teste em conversa nova, sem "Custom Instructions" ativas e com "Memória" desligada.
Gemini
- Integra Google Search em várias respostas, o que aproxima o comportamento de um snippet enriquecido.
- Registre a variante do modelo em uso no momento do teste.
- Verifique se há botão de fontes ("Verificar respostas"/"double-check") e capture-as separadamente da resposta corrida.
- Igualmente, sessão nova a cada prompt.
Perplexity
- Expõe fontes de forma estruturada por padrão, com numeração ao lado das afirmações.
- Registre o modo/modelo escolhido (por exemplo, modo padrão versus "Pro" com modelo específico), pois altera profundidade e seleção de fontes.
- A lista de fontes é dado primário, tão importante quanto o texto da resposta.
Em todos os três: sessão limpa (sem histórico, sem memória, sem instruções personalizadas ativas) é condição obrigatória para que a rodada de amanhã seja comparável com a de hoje.
Registro dos resultados
Uma planilha simples cobre a operação. Cada linha é uma execução:
| Campo | Conteúdo | |---|---| | Data | Data e hora da execução | | Motor | ChatGPT / Gemini / Perplexity | | Modelo/versão | Identificador do modelo usado | | Modo | Busca ligada/desligada, Pro/Padrão etc. | | Região/Idioma | pt-BR, Brasil | | Prompt | Texto literal enviado | | Resposta bruta | Texto completo da resposta, copiado | | Fontes citadas | Lista de URLs listadas pelo motor | | Marca citada | Sim / Não | | Forma de presença | Menção / Fonte / Recomendação / Lista / Link | | Posição | Ordem numérica quando em lista | | Sentimento | Positivo / Neutro / Crítico | | Concorrentes citados | Marcas rivais mencionadas | | Execução nº | Índice da repetição (1, 2, 3…) |
Guardar a resposta bruta na íntegra é o que permite reauditoria: se amanhã você mudar a definição de sentimento, dá para reclassificar sem repetir a coleta.
Amostragem contra a estocasticidade
LLMs são estocásticos — o mesmo prompt no mesmo motor pode gerar respostas diferentes em execuções distintas. Uma única execução por prompt é insuficiente para inferir presença.
- Repita N execuções de cada prompt em cada motor por rodada. Um valor prático como ponto de partida é 3 a 5 execuções por combinação prompt × motor.
- Trate cada execução como observação independente na planilha.
- Calcule as métricas por prompt como médias (ou proporções) sobre as N execuções.
- Registre o desvio entre execuções — muita variabilidade em um prompt específico é um dado em si.
Se o orçamento operacional permitir, aumente N para prompts de maior interesse comercial.
Cadência e série temporal
A medição só vira instrumento de diagnóstico quando gera série histórica. Defina uma cadência fixa — semanal para categorias voláteis ou muito competitivas, mensal para a maioria dos casos — e mantenha o mesmo protocolo:
- Mesmo conjunto de prompts.
- Mesmos motores.
- Mesma quantidade de execuções por combinação.
- Mesma janela de execução (por exemplo, sempre nas segundas pela manhã).
- Mesmo idioma e região.
A cada rodada, some as linhas novas à planilha (não sobrescreva) e agregue por semana/mês.
Comparação entre rodadas
Com duas ou mais rodadas em mãos, compare:
- Tendência da taxa de menção por prompt e agregada.
- Evolução do Share of Voice frente aos concorrentes rastreados.
- Deslocamento de posição média na resposta.
- Mudanças na composição de fontes citadas pelo motor (troca de domínios de referência é um sinal relevante).
- Alterações de sentimento ao longo do tempo.
Ao interpretar variações, considere que atualizações do modelo pelo próprio fornecedor podem causar saltos independentemente de qualquer ação da marca. Por isso o campo "Modelo/versão" é essencial: uma mudança de versão explica muito mais oscilação do que costuma parecer.
Validando que as rodadas são comparáveis
Antes de tirar conclusões de qualquer diferença entre uma rodada e outra, verifique se as condições foram, de fato, equivalentes:
- Prompt literal idêntico — copie e cole; não redigite.
- Modelo/versão registrado em cada execução; se o motor atualizou entre rodadas, marque isso na série.
- Região e idioma iguais.
- Sessão limpa confirmada (histórico e memória desligados; sem instruções personalizadas).
- Múltiplas execuções dentro de cada rodada, para diluir estocasticidade.
- Mesmo operador ou critério documentado para classificar "marca citada", posição e sentimento — divergências entre analistas viram ruído se não houver rubrica escrita.
Quando alguma dessas condições muda, anote a mudança na série. Isso preserva a honestidade do dado: um pico não deve ser lido como ganho de presença se, na verdade, o modelo mudou de versão.
Medição não é otimização
Este documento cobre como capturar o estado atual da presença da marca nos três motores. Não trata de como aumentar essa presença.
- Medir = definir métricas, executar prompts padronizados, registrar resultados, gerar série temporal, comparar.
- Otimizar = alterar conteúdo, estrutura de páginas, cobertura de temas, autoridade e fontes citáveis para elevar as métricas medidas.
As duas atividades usam vocabulário próximo (GEO, AEO, LLMO aparecem em ambas), mas confundi-las leva a decisões ruins: sem baseline de medição, qualquer esforço de otimização vira anedota; sem separar os papéis, você acaba ajustando a régua enquanto tenta ler o resultado. Estabelecida a rotina de medição descrita aqui, o próximo passo — que é assunto de outros documentos — é decidir o que fazer com os números.