¿El orden de las palabras decide qué marca recomiendan los AI Overviews? Probamos 102 consultas

Puntos clave

Circula entre equipos de buscadores la afirmación de que poner una marca primero en una consulta comparativa hace que los AI Overviews la recomienden hasta en un 80% de los casos. Lo probamos con 102 consultas y 16 pares de marcas. El orden no cambió nada. Esto sí lo hizo.

Este mes circula entre equipos de buscadores una afirmación con un número muy seguro pegado: si pones la marca A primero en una consulta comparativa, el AI Overview de Google recomienda la marca A alrededor del 80% de las veces. Invierte el orden y la recomendación se invierte con él. Que la marca grande sea mucho más grande no la salva.

Es una historia satisfactoria, porque explica algo que cualquiera que siga respuestas de IA ha visto con sus propios ojos: las respuestas comparativas no se parecen a la lista de resultados, y nadie fuera de Google puede inspeccionar cómo se armaron. Así que hicimos lo aburrido y lo probamos. El 11 de septiembre de 2026 lanzamos 102 consultas comparativas contra AI Overviews de Google en vivo, cubriendo 16 pares de marcas, ambos órdenes de palabras, dos a tres repeticiones cada uno, y guardamos cada respuesta y cada fuente citada.

El resultado: el orden cambió la recomendación en cero de 16 pares. La marca escrita primero en la consulta fue nombrada primero en el 49% de las ejecuciones, que es exactamente lo que parece un lanzamiento de moneda. Lo que sí cambió la respuesta, de forma fiable, fue cómo formulas la consulta y qué superficie de Google responde.

La afirmación, tal como se difundió

La versión que circula este mes es más o menos así:

  • "Marca A vs Marca B" devuelve AI Overviews que abren con y recomiendan la Marca A cerca del 80% de las veces.
  • "Marca B vs Marca A" devuelve la imagen espejo.
  • Esto se sostiene incluso cuando la Marca A es mucho más grande y antigua que la Marca B.
  • El mecanismo propuesto: los AI Overviews despliegan tu consulta en subbúsquedas, y la primera marca nombrada en la consulta ancla esas subbúsquedas.

Ese último punto es lo que hace creíble la afirmación, y también la parte mejor documentada.

El mecanismo es real, y por eso la afirmación viaja

La guía de Google para funciones de IA generativa, publicada en mayo de 2026, confirma el fan-out de consultas: AI Overviews y AI Mode pueden expandir una consulta en varias subconsultas relacionadas, ejecutarlas contra el índice en paralelo y sintetizar una respuesta a partir de los resultados combinados. Cuáles fueron esas subconsultas no se reporta en ningún sitio, Search Console incluido. Así que cuando ves un AI Overview, estás mirando la salida de un proceso que no puedes observar.

Los efectos de orden en los modelos de lenguaje también son reales, y hay trabajo revisado por pares detrás. Un estudio publicado en PNAS Nexus en agosto de 2026 probó nueve modelos con comparaciones de currículums y selección de colores y encontró efectos de posición que no eran simples desempates: en algunos casos, reordenar las opciones invertía cuál prefería el modelo, y el modelo acababa eligiendo la peor opción. Un trabajo de Columbia Business School encontró un patrón relacionado en la dirección opuesta: ChatGPT elegía la primera opción de una lista alrededor del 63% de las veces en 5.447 prompts, un resultado que reapareció en el 64,29% de 64.800 ensayos de una configuración más simple.

Lee esos dos hallazgos juntos y la afirmación viral parece el siguiente paso natural: el fan-out existe, los LLM tienen manías de orden, luego el orden debe decidir las recomendaciones de marca.

La brecha está en el último paso. Esos experimentos piden a un modelo juzgar una lista de opciones y elegir una. Una consulta comparativa en AI Overviews no es esa tarea. Es una petición de síntesis respondida por un sistema de recuperación que ancla la respuesta en páginas de terceros. Eso es justo lo que hacía que la afirmación mereciera probarse en lugar de repetirse.

Qué ejecutamos

Consultas

102 contra Google AI Overviews, más 18 contra AI Mode

Pares de marcas

16 (10 de software, 6 de consumo)

Órdenes

Ambos, con 2–3 repeticiones por orden

Formulación

"X vs Y" en todos los pares; también "which is better, X or Y" en 3 pares

Superficie

Google Search, Estados Unidos, inglés, escritorio

Fecha

11 de septiembre de 2026 (un solo día)

Captura

Respuestas de la API de SERP, una consulta por petición, guardando cada elemento de texto del AI Overview y la lista completa de referencias

Coste

Unos 0,43 dólares en créditos de API

Dos decisiones de diseño importan. Primera, ejecutamos cada consulta dos o tres veces, porque una sola respuesta invertida no prueba nada en un sistema con algo de aleatoriedad. Segunda, registramos cómo se construyó la respuesta, no solo qué decía: qué marca se nombra primero, con qué frecuencia se menciona cada una, cómo son las páginas citadas y cuántas citas apuntan al dominio propio de cada marca.

Los 16 pares se eligieron para abarcar dos situaciones: comparativas de software donde ambas marcas son entidades que la gente investiga (Notion vs Asana, Slack vs Microsoft Teams, Semrush vs Ahrefs, Figma vs Sketch) y comparativas de consumo donde la marca mayor es obvia (Nike vs Adidas, Coca-Cola vs Pepsi, iPhone vs Samsung Galaxy, Netflix vs Disney+, Toyota vs Honda, iRobot Roomba vs Roborock).

Resultado 1: la respuesta no siguió el orden

De las 100 ejecuciones que produjeron una primera mención limpia y medible, la marca escrita primero en la consulta fue nombrada primero 49 veces: 49%.

Par

Primera nombrada en "A vs B"

Primera nombrada en "B vs A"

¿El orden lo cambió?

Notion vs Asana

Asana

Asana

No

Slack vs Microsoft Teams

Microsoft Teams

Microsoft Teams

No

Wix vs Squarespace

Wix

Wix

No

Canva vs Adobe Express

Canva

Canva

No

Mailchimp vs Klaviyo

Klaviyo

Klaviyo

No

Airtable vs Monday.com

Monday.com

Monday.com

No

Shopify vs WooCommerce

Shopify

Shopify

No

Semrush vs Ahrefs

Semrush

Semrush

No

Figma vs Sketch

Figma

Figma

No

Zoom vs Google Meet

Google Meet

Google Meet

No

Nike vs Adidas

Nike

Nike

No

Coca-Cola vs Pepsi

Coca-Cola

Coca-Cola

No

iPhone vs Samsung Galaxy

Samsung Galaxy

Samsung Galaxy

No

Netflix vs Disney+

Netflix

Netflix

No

Toyota vs Honda

Toyota

Toyota

No

iRobot Roomba vs Roborock

Roborock

Roborock

No

No se invirtió ni una mayoría. Cuando una respuesta tenía preferencia, la mantuvo en ambos órdenes: los AI Overviews abrieron con Asana tanto para "Notion vs Asana" como para "Asana vs Notion", con Monday.com en ambas comparativas de Airtable, con Google Meet en ambas de Zoom. Nike lideró en los dos órdenes frente a Adidas. Samsung Galaxy lideró en los dos órdenes frente a iPhone.

Las ejecuciones repetidas coincidieron entre sí 93 veces de 100. Seis de las siete excepciones vinieron de un solo par bajo una formulación distinta, que resulta ser la historia real. La séptima fue una ejecución de Slack vs Microsoft Teams que abrió con Slack en lugar de Teams; las dos siguientes volvieron a Teams.

Hay algo que esta medición no puede resolver: encabezar una respuesta no es lo mismo que ser recomendado. Así que también contamos el lenguaje de recomendación. En las 60 ejecuciones de pares de software, las frases que usaban palabras de victoria (wins, better choice, recommend, stronger, go-to) se repartieron 40 a 39 entre la marca escrita primero y la escrita segunda. Un empate técnico.

Diagrama que muestra que en los 16 pares de marcas el orden de palabras no cambió qué marca se nombra primero

Resultado 2: las dos respuestas solían ser la misma respuesta

Si el orden anclara las subbúsquedas, las dos versiones de una consulta deberían recuperar páginas distintas, y las respuestas deberían divergir. En su mayoría no divergieron.

En 8 de los 10 pares de software, el AI Overview de "A vs B" y el de "B vs A" fueron idénticos palabra por palabra. Compara las primeras líneas de Semrush vs Ahrefs en ambos órdenes:

Semrush es una plataforma de marketing todo en uno, mientras que Ahrefs es una herramienta especializada en SEO y análisis de enlaces. (cita original en inglés)

Misma frase, mismo orden de los hechos, mismo cierre de "elige Semrush si… / elige Ahrefs si…", sin importar con qué marca empezara la consulta. Solo dos pares mostraron deriva real de texto: Slack vs Microsoft Teams y Shopify vs WooCommerce, y en el caso de Shopify la deriva se limitó a un párrafo de apertura redactado de otra forma, no a una conclusión distinta.

La evidencia de apoyo apunta en la misma dirección. En las 806 entradas de referencia de las ejecuciones de software, las citas a los dominios propios de las dos marcas salieron 36 a 36. Los títulos de página de referencia que nombran ambas marcas pusieron primero a la marca escrita antes en la consulta 392 veces y a la escrita después 396 veces: 49,7%, otro lanzamiento de moneda. El total de menciones de marca se repartió 337 a 336, o 50,1% frente a 49,9%.

Un sistema cuya recuperación estuviera siendo dirigida por la marca que aparece primero en la consulta no produciría un reparto de citas de 36 a 36 ni prosa idéntica byte a byte.

Qué movió de verdad la respuesta

Dos cosas, y ambas son más útiles que el orden.

La formulación. En tres pares ejecutamos la consulta "vs" y la consulta "which is better, X or Y" en ambos órdenes. Los AI Overviews se comportaron como si fueran preguntas distintas, y lo hicieron de forma idéntica en los dos órdenes.

Para Shopify y WooCommerce, "Shopify vs WooCommerce" abrió con una descripción de producto: Shopify es un creador de tiendas alojadas todo en uno, y la respuesta recorrió las diferencias. "Which is better, Shopify or WooCommerce" abrió con una negativa a ordenarlos: ninguno es objetivamente mejor, depende de tus necesidades. Las mismas cuatro ejecuciones, el mismo par, el mismo día, primeras impresiones opuestas, impulsadas enteramente por la formulación y no por la posición.

Para Semrush y Ahrefs, las respuestas de "which is better" contenían frases de veredicto explícitas, y todas ellas acreditaban a Ahrefs: cinco de cinco ejecuciones, tanto si la consulta decía "Semrush or Ahrefs" como "Ahrefs or Semrush". El orden era irrelevante frente al hecho de que el corpus comparativo subyacente trata a Ahrefs como la herramienta de enlaces más fuerte.

La superficie. Ejecutamos 18 de las mismas consultas a través de Google AI Mode, la superficie conversacional. Su comportamiento difiere del de los AI Overviews de una forma que parece sensibilidad al orden y no lo es. Para Semrush vs Ahrefs, AI Mode abrió con "Both Semrush and Ahrefs are…" o "Both Ahrefs and Semrush are…" según el orden de la consulta, reflejándolo. Y fíjate en la variante en la que aterrizó: "Both X and Y", una construcción sin ninguna implicación de ranking. El nombre que encabeza la frase es un eco estilístico del prompt.

Bajo ese eco, la sustancia de AI Mode fue mucho menos estable que la de los AI Overviews: la similitud de texto entre ejecuciones dentro del mismo orden fue de solo 0,30 a 0,36, y de 0,38 entre órdenes, donde los AI Overviews produjeron texto idéntico en la mayoría de los pares. En dos de los tres pares, las respuestas de AI Mode fueron idénticas byte a byte entre órdenes, y en el caso de Shopify se fijó en WooCommerce en su apertura las dos veces, mientras los AI Overviews se fijaron en Shopify las dos veces. Cada superficie tiene sus hábitos de redacción asentados, y no son los mismos.

Comparación que muestra que la misma pareja de marcas produce aperturas opuestas en el AI Overview según la formulación de la consulta

La historia del orden no es pura ficción

Una medición sí se movió con el orden de las palabras, y es la que más gente está mirando de verdad: la lista de resultados clásica.

En 5 de los 10 pares de software, los tres primeros resultados orgánicos tradicionales difirieron entre "A vs B" y "B vs A", incluido el par en el que el AI Overview era idéntico en ambos órdenes. Reddit quedó cerca de lo más alto en la mayoría de las comparativas de software, y qué hilo concreto aparecía cambiaba con la formulación. Así que sí hay sensibilidad real al orden en Google Search para consultas comparativas. Está en la capa que hay debajo de la respuesta de IA, no en la recomendación en sí. Esa distinción es toda la razón por la que valía la pena ejecutar esta prueba, y no es el hallazgo que esperábamos escribir.

Esto importa para el reporting. Si tu rastreador de posiciones muestra tu posición oscilando entre consultas comparativas de marca y no de marca, estás viendo un efecto real. Simplemente no es el efecto que describe la afirmación viral, y optimizar para él no moverá lo que el AI Overview dice de ti.

La palanca que sí señalan los datos

La señal más clara de nuestras ejecuciones no tenía que ver con la construcción de la consulta. Tenía que ver con el corpus comparativo del que se construía cada respuesta.

En Airtable vs Monday.com, las fuentes citadas incluían 18 páginas propiedad de Monday.com y cero páginas propiedad de Airtable, en ambos órdenes. En Mailchimp vs Klaviyo, seis citas de Mailchimp, cero de Klaviyo. Shopify vs WooCommerce produjo tres citas de WooCommerce y ninguna de Shopify. Mientras tanto, en bastantes pares no apareció el dominio propio de ninguna de las dos marcas: la respuesta se armaba con comparativas de terceros, sitios de reseñas e hilos de foros.

Ese patrón es coherente con cómo funciona de verdad la recuperación. Al modelo no le importa qué nombre escribiste primero; le importa qué páginas existen y cómo describen cada marca. Donde una marca posee su contenido comparativo, esas páginas entran. Donde no, faltan de las respuestas de todo el que pregunta.

Cómo ejecutar tu propia prueba de inversión de orden

Quince minutos y sin necesidad de acceso a ninguna API:

  1. Elige cinco consultas comparativas en las que tu marca sea uno de los dos nombres y tengas un competidor real.
  2. Ejecuta cada una en ambos órdenes, y cada orden dos veces. Cuatro respuestas por par, diez pares de respuestas en total.
  3. Guarda las respuestas antes de leerlas. Haz captura o copia el texto completo y las fuentes citadas.
  4. Compara dos cosas por separado: qué marca se nombra primero y qué dice la respuesta sobre cada marca. Donde encontramos la señal interesante, el orden era estable y la sustancia no.
  5. Mira la lista de citas, no solo la prosa. Si el dominio propio del competidor aparece una y otra vez y el tuyo no, has encontrado el cuello de botella real.

El AI Overview Citation Checker te muestra qué páginas cita un AI Overview para una consulta, que es la forma más rápida de ver si tu dominio está siquiera en la lista.

Hazlo al menos dos veces, en días distintos, antes de concluir nada. Nuestra propia coincidencia entre ejecuciones fue del 93%, no del 100%, y una única ejecución invertida es exactamente el tipo de ruido que se convierte en una entrada de blog segura de sí misma.

Qué hacer con esto

No reestructures tus páginas comparativas en torno al orden de las palabras. No hay evidencia de que cambie lo que recomiendan los AI Overviews, y si Google alguna vez le diera peso, el arreglo sería editar una palabra, lo que no te dice nada sobre tu posición real.

Sí trata la formulación como una variable real. "X vs Y" y "which is better, X or Y" son consultas distintas que producen respuestas distintas. Si tus compradores formulan las comparaciones como preguntas, necesitas contenido que responda a la pregunta, no solo una tabla de especificaciones.

Sí comprueba si las páginas propias de tu marca aparecen en las citas de las comparativas que te importan. El reparto de 18 a 0 que vimos es el número más accionable de este conjunto de datos, y va de publicar, no de redactar prompts.

Sí conserva una métrica de primera mención si ya la tienes, y trátala como una descripción de lo que dice la respuesta, no como una palanca que puedas accionar. En nuestros datos fue un lanzamiento de moneda que siguió al corpus, no a la consulta.

Límites

Esto es un día de datos de una sola ubicación e idioma, en escritorio, capturados a través de una API de SERP en lugar de una sesión de navegador, en 16 pares de marcas. Los resultados de búsqueda varían según personalización, momento y dispositivo, y un solo día no puede descartar un cambio futuro.

Medimos qué marca se nombra primero, con qué frecuencia se menciona y qué fuentes se citan. Ninguna de esas cosas mide directamente lo persuasiva que resulta la respuesta para un lector, y una respuesta que nombre tu marca primero puede aun así dejar la impresión de que gana la otra.

La muestra de AI Mode fue de 18 consultas en tres pares, suficiente para ver que la superficie se comporta distinto e insuficiente para cuantificarlo. Lee esa sección como una dirección, no como una tasa.

Por último, las afirmaciones sobre el mecanismo de la historia original siguen siendo inverificables desde fuera. Google confirma que el fan-out ocurre y no expone las subconsultas, así que nadie puede mostrar qué subconsultas produjo tu consulta. Nuestra prueba puede mostrar que invertir el orden no cambió la salida. No puede mostrar por qué.

Preguntas frecuentes

¿El orden de las palabras en una consulta de Google afecta a los AI Overviews? En nuestra prueba, no. En 102 consultas de AI Overviews que cubren 16 pares de marcas en ambos órdenes, la marca escrita primero fue nombrada primero el 49% de las veces, y ningún par cambió de dirección al invertir la consulta. Ocho de diez pares de software devolvieron respuestas idénticas palabra por palabra en ambos órdenes.

¿Por qué la gente informa de que el orden afecta a las recomendaciones de IA? Porque los efectos de orden están documentados en modelos de lenguaje a los que se pide elegir de una lista, donde la primera opción gana alrededor del 63% de las veces en la investigación publicada, y porque el fan-out de consultas de Google hace invisible el proceso de recuperación. Ambos hechos son reales. Ninguno de los dos significa que una consulta comparativa en AI Overviews vaya a cambiar de marca cuando reordenas los nombres.

¿Qué cambia de verdad un AI Overview en una consulta comparativa? La formulación y la superficie. "Shopify vs WooCommerce" produjo una respuesta de producto en ambos órdenes, mientras que "which is better, Shopify or WooCommerce" produjo una respuesta de "ninguno es objetivamente mejor" en ambos órdenes. Las mismas consultas en AI Mode volvieron con otro encuadre distinto, y con mucha más variación entre ejecuciones.

¿Vale la pena optimizar para la primera mención en los AI Overviews? Vígílala, no optimices para ella. La primera mención siguió al corpus de fuentes en nuestros datos, no a nada que controláramos desde la consulta. La variable controlable es si tus propias páginas comparativas están en la lista de citas: un par que probamos atrajo 18 citas de propiedad del competidor y cero de la otra marca.

Lecturas relacionadas

Autor: Ethan Marlowe, responsable de medición GEO en Auspia con más de 500 prompts. Escribe sobre medición de visibilidad en IA, diseño de conjuntos de prompts y cómo hacer pruebas que aguanten una segunda mirada.

Explora este tema

Sigue la misma línea de crecimiento