Cinco campanhas GEO que nos ensinaram: crescimento não linear, memória que desvanece e valor defensivo

Retrospectiva de cinco campanhas GEO de clientes pelo fluxo de trabalho da Auspia: como a visibilidade chega em degraus, por que decai sem alimentação e o que fazer em mercados lotados.

A versão curta

Neste trimestre rodamos cinco campanhas de GEO pelo fluxo de trabalho da Auspia: uma marcenaria de móveis sob medida, uma marca de luxo internacional, uma agência de TikTok focada nos EUA, uma rede regional de beleza e uma bicicletaria de bairro. Os resultados dos clientes variaram, mas o padrão nos números não variou. Três descobertas valem guardar:

  1. Visibilidade chega como degrau, não como rampa. Toda campanha que funcionou passou pela mesma sequência: suma, depois vacilou, depois rompeu. Semanas de nada, depois um salto que segurou.
  2. Tem meia-vida. Nas duas campanhas em que a alimentação do corpus foi interrompida, a participação nas menções foi corroendo devagar. Menção de IA é um ativo que se mantém, não um muro que se constrói uma vez.
  3. Em mercados lotados ou com reputação abalada, GEO é defesa antes de ser crescimento. Para a rede de beleza, a vitória foi medida em alegações falsas diluídas e contexto negativo achatado, não em cliques novos.

Se você fizer uma coisa depois de ler isto, faça um placar semanal. As campanhas que realmente progrediram sobreviveram a uma medição mais rígida. As que só pareciam progredir, não sobreviveram.

Por que estamos publicando uma retrospectiva do lado do cliente

Antigamente a busca entregava às pessoas uma lista de links e deixava que clicassem. A IA generativa entrega uma afirmação. Sob dados aumentados por recuperação (RAG), a resposta é o anúncio, e uma marca ganha essa menção do mesmo jeito que ganha uma citação: sendo a fonte mais amigável a consenso no corpus para aquela pergunta.

Esse deslocamento é toda a razão de existência do GEO. O artigo Generative Engine Optimization de Princeton (Aggarwal et al., KDD 2024) defendeu que os modelos seguem suas preferências de recuperação, então a tarefa passa a ser falar a língua do sistema de recuperação. Um trabalho publicado na Nature em 2024 confirmou o mecanismo por trás disso: os modelos rejeitam estatisticamente material de origem com alta entropia e contraditório para reduzir o risco de alucinação, e preferem fontes de baixa entropia, estruturadas e verificáveis.

Ainda assim, a maioria dos projetos de GEO encerra no dia em que os entregáveis saem. O aprendizado do executor volta para a cabeça dele, o cliente recebe um relatório, e ninguém fora daquela sala consegue dizer se uma tendência era real. Esta retrospectiva é o oposto desse fluxo: cinco projetos de cliente, um placar compartilhado, e as conclusões com as quais realmente nos sentimos confortáveis em defender.

O placar que usamos

Cada campanha foi medida do mesmo jeito, com as mesmas quatro métricas do modelo de visibilidade GEO:

Métrica

O que ela conta

O que um movimento significa

Taxa de inclusão

Com que frequência a marca aparece nas respostas do seu conjunto de perguntas

A diferença entre invisível e considerado

Participação no top-3

Com que frequência a marca aparece nas três primeiras menções

A diferença entre considerado e recomendado

Posição média condicionada

Onde a marca cai quando aparece

Qualidade de posicionamento dentro de uma menção

Coeficiente de variação

O quanto a volatilidade das respostas muda entre sessões

Se o resultado é reproduzível ou um caso único

Acima disso, cada campanha rastreou sinais operacionais: contagem de menções, proporção de links-fonte apontando para os domínios da marca, e qual assistente carregou a menção.

A disciplina de coleta importa mais do que as métricas. Montamos uma matriz de consultas por cliente a partir de perguntas reais de compradores, depois rodamos o mesmo conjunto de prompts semanalmente, deslogados, guardando os snapshots. No papel isso parece lição de casa. Na prática, é a única razão de os achados abaixo não serem impressões. (O AI Search Visibility Checker da Auspia automatiza esse rastreamento e reavaliação do conjunto de prompts, que é o principal motivo de conseguirmos rodar isso.)

As superfícies que acompanhamos foram os cinco assistentes que os compradores nesses mercados usam para pesquisa de categoria: ChatGPT, Gemini, Perplexity, Copilot e Claude.

O ciclo de mensuração e evidências do GEO em cinco etapas: conjunto de perguntas base, captura e nota semanal, construção do corpus de evidências, distribuição por superfície, verificação multi-dispositivo e atualização semanal que volta à captura.

As cinco campanhas

Cliente

O que estava quebrado

Movimento central

O que mudou

Marcenaria de móveis sob medida (Portland)

Perguntas de compradores sem resposta em um assistente

Conteúdo guiado por consulta + fatos de marca em fases

A marca aparece em respostas em que estava ausente

Marca de luxo internacional

Presença intermitente, um assistente especialmente silencioso

Adaptação de narrativa por assistente + verificação multi-dispositivo

Menções positivas consistentes em configurações e angulações

Agência de TikTok focada nos EUA

Pesquisa de categoria mostrou um completo branco da marca

Sequenciamento por intenção de conversão, plataforma por plataforma

Menções no top-3 em todos os cinco assistentes

Rede regional de beleza (20+ estúdios)

Listagens desatualizadas, alegações falsas espalhadas, enquadramento negativo

Conjunto de 30+ palavras-chave da marca, contraprazo em fases

Contexto mudou de arriscado para estabelecido e verificado

O que estourou o platô: o marceneiro que não ganhou nada por semanas

A oficina tinha reputação local forte e presença zero de IA. Compradores perguntavam "qual o melhor marceneiro sob medida perto de mim" e outras especificidades assim, e o assistente respondia sem mencioná-la, enquanto recomendava concorrentes.

Minamos as perguntas que os compradores realmente digitam, montamos páginas em formato de FAQ e fatos de marca estruturados ao redor delas, e fizemos o que muita equipe pula: alimentar o conteúdo em fases, em vez de tudo de uma vez. Nada aconteceu por semanas. Aí a taxa de inclusão deu um degrau, e as menções se estabilizaram. A lição não era sobre qualidade de conteúdo. Era sobre a forma da curva: quieto, quieto, quieto, salto.

A auditoria de consistência: a marca de luxo que parecia boa em um aparelho

A marca aparecia em algumas respostas e sumia em outras, e um assistente ficava praticamente mudo. Esse tipo de presença parcial é mais difícil de diagnosticar do que a ausência, porque o relatório parece ok.

A correção teve duas metades. O conteúdo foi moldado para a maneira como cada assistente narra produtos de luxo, em vez de enviado como bloco único. E a entrega foi tornada verificável: cada checagem rodou de três configurações diferentes de aparelho e rede, com cruzamento, para que um bom resultado não pudesse ser artefato de uma sessão. Consistência deixou de ser uma esperança e virou um portão.

A varredura multiplataforma: a agência que desapareceu da própria categoria

Agência americana verificada pelo TikTok, forte demanda de categoria, e as respostas dos assistentes simplesmente não mencionavam a agência. Em vez de lançar em todo lugar ao mesmo tempo, sequenciamos: as perguntas de maior intenção de conversão primeiro, uma plataforma por vez, avançando quando a superfície anterior se mantinha.

No fim, as palavras-chave de categoria colocaram a agência entre as três primeiras menções em todos os cinco assistentes. O sequenciamento foi a parte que parecia ineficiente e a que pagou. Rodar cinco superfícies no primeiro dia torna todo resultado ilegível.

A reparação de reputação: a rede de beleza enfrentando um contexto ruim

As listagens da rede estavam velhas, alegações falsas flutuavam em torno do nome, e os assistentes a descreviam com linguagem cautelosa. Em um mercado assim, o problema não é a cobertura. O problema é o tom da resposta.

Trabalhamos um conjunto de 30+ palavras-chave em torno da marca e depois reforçamos fatos verificados em fases: estado atual, credenciais, detalhes corretivos. O contexto nas respostas foi se movendo para "estabelecida, verificada".

A invisível de 30 anos: a bicicletaria que exportou a própria menção

A loja atendia um bairro há três décadas e não tinha presença em lugar nenhum do digital. Nossa movimentação em campanhas locais é deliberadamente pequena: captar o que os compradores próximos comentam e por os fatos práticos direto na camada de resposta — endereço, horários, telefone e o que a loja realmente faz.

O telefone começou a aparecer em respostas locais dentro da janela da campanha. O dono imprimiu a saída da IA e montou a página atrás do balcão, ao lado das provas visíveis ao cliente. Quando a camada de resposta e a loja entram em acordo, a descoberta local deixa de ser um problema de busca.

Quatro padrões que os números repetiram

1. O efeito de limiar. Cinco campanhas, uma forma. A exposição não cresce linearmente; ela dá degraus. Abaixo de certa densidade de fatos de marca limpos e entrelaçados, a única escolha segura do modelo é um concorrente. Atravesse a linha de densidade e as recomendações começam a aparecer. Essa é a curva S que o trabalho acadêmico de GEO prevê, e apareceu em todo projeto que deu certo.

2. A meia-vida. As campanhas de luxo e de cross-border tiveram um período em que a alimentação do corpus pausou. Em cerca de dois meses, a taxa de inclusão e a participação no top-3 começaram a descer. A memória da plataforma tem inércia, mas decai sem entrada nova. GEO não é um estado a que se chega.

3. Desnorteamento e posicionamento defensivo. Em mercados de alta concentração ou com contexto negativo já existente, o valor do GEO é defensivo. Você não está ganhando participação que não tinha; você está trazendo o tom da resposta de volta a afirmações verificáveis e circulando uma linha de base segura. É um resultado legítimo, mas precisa ser medido como o que é.

4. Heterogeneidade de plataforma. Os cinco assistentes se comportaram de forma diferente. Nessas campanhas, Gemini e Copilot seguraram as menções por mais tempo depois que os insumos pararam. ChatGPT atualizou mais rápido quando o corpus mudou. Você não consegue rodar um ritmo só para todas as superfícies; precisa de um por superfície.

A visibilidade de GEO sobe numa curva S através das fases de sumiço, oscilação e rompimento, e decai quando a alimentação do corpus parou.

O ciclo operacional que realmente se sustentou

Tire as cinco histórias de indústria e sobram quatro princípios operacionais:

  • Corrente de evidências vence persuasão. O conteúdo que realmente moveu números foram resultados de testes, certificações, especificações declaradas, fatos datados e limites concretos. A frase "somos os melhores" foi o único conteúdo que nunca apareceu em um snapshot.
  • O corpus é um ativo. Cada um desses clientes poderia ter comprado posts novos de blog. O que precisavam de verdade era um banco reutilizável de fatos estruturados, limpos em termos de entidade e citáveis.
  • Faseado por intenção, não por volume. As campanhas se dividiram em ondas de perguntas por intenção de compra e cada onda ganhou tempo para se estabelecer antes de a próxima lançar.
  • Verificação é o portão de entrega. A regra do cliente de luxo virou a nossa: uma alegação de visibilidade só é verdadeira quando reproduz entre sessões, dispositivos e redes.

É por isso que tudo o que rodamos começa com uma auditoria, não com um plano de conteúdo. O GEO Score Checker e o AI Search Visibility Checker da Auspia existem para tornar a linha de base mensurável, e a ausência dessa linha de base é exatamente onde a maioria dos programas internos de GEO trava em silêncio.

Onde a evidência amolece

Não vamos fingir que a revisão é mais rigorosa do que é.

  • As janelas de observação foram curtas. Várias campanhas rodaram por semanas, não por trimestres. As regras de consolidação de cauda longa ainda estão não verificadas.
  • A atribuição é correlacional. Não conseguimos nas contas separar a contribuição de GEO do tráfego pago ou RP concorrentes. Ninguém consegue, honestamente, de fora.
  • A cobertura é estreita. Bens de consumo, moda, cross-border, beleza, serviços locais. Sem compradores B2B com listas de conformidade, sem produtos financeiros ou de saúde.
  • Confundidos e ruído. A amostragem de snapshots ainda agrupa. Alguns clientes só mostraram sinais de exposição, nunca curvas quantitativas completas, e a entrada deles na matriz é um resumo direcional, não uma medida.

O que faríamos diferente na próxima vez

Se reiniciássemos todas essas campanhas amanhã, as mudanças são pequenas e específicas. Trate GEO como infraestrutura, com uma checagem automática semanal ou mensal por assistente, em vez de uma data de fim de projeto. Construa primeiro a base de conhecimento corporativa, o banco de fatos em forma de schema, e deixe os posts e a distribuição fluírem dela. Mantenha a corrente de evidências como padrão da casa. E configure o ritmo por assistente, não por campanha.

Um caminho compacto para ter seus próprios números em oito semanas

  • Semana 0: escolha 15–20 perguntas que compradores realmente fazem sobre você. Rode deslogado uma vez por assistente. Guarde a saída.
  • Semanas 1–3: construa a corrente de evidências: especificações, certificações, dados de teste, datas, limites. Publique como conteúdo em formato de resposta, seccionado.
  • Semanalmente: rode de novo o mesmo conjunto de prompts, registre as quatro métricas e compare com os snapshots.
  • Duas vezes por rodada de verificação: repita de rede e aparelho diferentes. Se o resultado não reproduzir, não é resultado.
  • Semana 8: revise a curva. Progresso claro ou oscilação documentada é sucesso. Números em branco com um pipeline bem construído também são um achado, e dizem que o assistente que você alimenta não tem rota até você.

FAQ

Quanto tempo até as respostas de IA começarem a se mover? Semanas, não dias. Nessas campanhas, a janela prática foi de seis a dez semanas de alimentação constante antes do primeiro degrau. O diagnóstico útil é se você está na fase de oscilação — o pipeline funciona mas a densidade ainda não está lá — ou na fase de sumiço, em que a recuperação não tem rota até você.

GEO é um projeto único? Não. O padrão de meia-vida foi consistente. Se você se importa com as respostas, mantenha o pipeline quente. Mercados de ritmo menor seguram com uma checagem mensal leve; mercados em que compradores pesquisam toda semana precisam de semanal.

GEO corrige respostas de IA falsas ou negativas? Desloca o equilíbrio, o que não é o mesmo que apagar. A contracaída de fatos verificados moveu as respostas da rede de beleza da linguagem de cautela para "estabelecida". Se uma alegação falsa vem de um registro-fonte que está errado, corrija o registro-fonte primeiro. E nunca leia "mexeu" como "permanente".

Com qual assistente devemos começar? Onde seus compradores realmente pesquisam. Nessas campanhas nunca foi a mesma superfície. Comece lá, verifique, depois amplie. Lançar os cinco no primeiro dia torna impossível saber o que funcionou.

Não é só SEO com outro nome? Trabalho diferente. SEO compete em uma lista ranqueada de links que as pessoas clicam; GEO compete dentro de uma afirmação gerada que as pessoas leem. Compartilham a base: fatos limpos, estruturados e consistência. Mas a medição, o ritmo e os modos de falha são diferentes, e rodar os dois ciclos separadamente é como essas campanhas foram realmente conduzidas.

Autor: Ethan Marlowe, líder de medição de GEO em mais de 500 prompts na Auspia. Ethan escreve sobre rastreamento de prompts, relatórios de citação e os painéis de visibilidade que mantêm o GEO honesto.

Explore este tópico

Continue na mesma linha de crescimento