Entscheidet die Wortstellung, welche Marke AI Overviews empfiehlt? Wir haben 102 Abfragen getestet

Die wichtigsten Punkte

In Suchteams kursiert die Behauptung, wer eine Marke in einer Vergleichsabfrage vorne platziert, werde von AI Overviews in bis zu 80% der Fälle empfohlen. Wir haben das mit 102 Abfragen und 16 Markenpaaren getestet. Die Reihenfolge änderte nichts. Etwas anderes schon.

Diesen Monat wandert eine Behauptung durch Suchteams, an der eine sehr selbstsichere Zahl klebt: Setzt man Marke A in einer Vergleichsabfrage nach vorne, empfiehlt Googles AI Overview Marke A in rund 80% der Fälle. Dreht man die Reihenfolge um, dreht sich die Empfehlung mit. Dass die größere Marke deutlich größer ist, rettet sie nicht.

Es ist eine befriedigende Geschichte, weil sie etwas erklärt, das jeder, der KI-Antworten verfolgt, mit eigenen Augen gesehen hat: Vergleichsantworten sehen nicht aus wie die Ergebnisliste, und niemand außerhalb von Google kann nachvollziehen, wie sie zusammengesetzt wurden. Also haben wir das Langweilige getan und es getestet. Am 11. September 2026 haben wir 102 Vergleichsabfragen gegen live laufende Google AI Overviews geschickt, über 16 Markenpaare, beide Wortstellungen, zwei bis drei Wiederholungen pro Abfrage, und jede Antwort und jede zitierte Quelle gespeichert.

Das Ergebnis: Die Reihenfolge änderte die Empfehlung in null von 16 Paaren. Die zuerst genannte Marke wurde in 49% der Durchläufe zuerst erwähnt, was genau so aussieht wie ein Münzwurf. Was die Antwort zuverlässig veränderte, war die Formulierung der Abfrage und die Google-Oberfläche, die antwortet.

Die Behauptung, wie sie sich verbreitet hat

Die diesen Monat kursierende Version geht ungefähr so:

  • „Marke A vs Marke B“ liefert AI Overviews, die in etwa 80% der Fälle mit Marke A beginnen und Marke A empfehlen.
  • „Marke B vs Marke A“ liefert das Spiegelbild.
  • Das gilt auch dann, wenn Marke A deutlich größer und älter ist als Marke B.
  • Der vorgeschlagene Mechanismus: AI Overviews fächert die Abfrage in Untersuchen auf, und die zuerst genannte Marke verankert diese Untersuchen.

Genau dieser letzte Punkt macht die Behauptung glaubwürdig, und er ist zugleich der am besten belegte Teil.

Der Mechanismus ist real, deshalb reist die Behauptung

Googles Leitfaden für generative KI-Funktionen, veröffentlicht im Mai 2026, bestätigt das Query-Fan-out: AI Overviews und AI Mode können eine Abfrage in mehrere verwandte Unterabfragen expandieren, sie parallel gegen den Index ausführen und aus den kombinierten Ergebnissen eine Antwort synthetisieren. Welche Unterabfragen das waren, wird nirgends berichtet, Search Console eingeschlossen. Wenn Sie also ein AI Overview sehen, sehen Sie die Ausgabe eines Prozesses, den Sie nicht beobachten können.

Reihenfolgeeffekte in Sprachmodellen sind ebenfalls real, und dahinter steht begutachtete Forschung. Eine im August 2026 in PNAS Nexus veröffentlichte Studie testete neun Modelle mit Lebenslauf-Vergleichen und Farbauswahl und fand Positionseffekte, die keine bloßen Stichentscheide waren: In manchen Fällen kehrte das Umsortieren der Optionen die Präferenz des Modells um, und das Modell wählte dann die schlechtere Option. Eine Arbeit der Columbia Business School fand ein verwandtes Muster in der Gegenrichtung: ChatGPT wählte in 5.447 Prompts rund 63% der Fälle die erste Option einer Liste, ein Ergebnis, das sich in 64.800 Durchläufen eines einfacheren Aufbaus mit 64,29% wiederholte.

Liest man diese beiden Befunde zusammen, wirkt die viral gegangene Behauptung wie der natürliche nächste Schritt: Fan-out existiert, LLMs haben Reihenfolge-Macken, also muss die Reihenfolge die Markenempfehlung bestimmen.

Die Lücke steckt im letzten Schritt. Diese Experimente verlangen von einem Modell, eine Liste von Optionen zu bewerten und eine auszuwählen. Eine Vergleichsabfrage in AI Overviews ist nicht diese Aufgabe. Sie ist eine Syntheseanfrage, die von einem Retrieval-System beantwortet wird, das die Antwort in Seiten Dritter verankert. Genau das machte die Behauptung testenswert statt wiederholenswert.

Was wir gefahren haben

Abfragen

102 gegen Google AI Overviews, dazu 18 gegen AI Mode

Markenpaare

16 (10 Software, 6 Konsumgüter)

Wortstellungen

Beide, mit 2–3 Wiederholungen je Reihenfolge

Formulierung

„X vs Y“ für alle Paare; zusätzlich „which is better, X or Y“ für 3 Paare

Oberfläche

Google Search, USA, Englisch, Desktop

Datum

11. September 2026 (ein Tag)

Erfassung

SERP-API-Antworten, eine Abfrage pro Request, mit jedem AI-Overview-Textelement und der vollständigen Referenzliste

Kosten

Rund 0,43 US-Dollar an API-Guthaben

Zwei Design-Entscheidungen sind wichtig. Erstens haben wir jede Abfrage zwei- oder dreimal gefahren, weil eine einzelne gekippte Antwort nichts über ein System mit irgendeiner Zufälligkeit beweist. Zweitens haben wir festgehalten, wie die Antwort gebaut wurde, nicht nur was sie sagte: welche Marke zuerst genannt wird, wie oft jede erwähnt wird, wie die zitierten Seiten aussehen und wie viele Zitate auf die eigene Domain der jeweiligen Marke zeigen.

Die 16 Paare wurden so gewählt, dass sie zwei Situationen abdecken: Software-Vergleiche, in denen beide Marken Entitäten sind, die Menschen recherchieren (Notion vs Asana, Slack vs Microsoft Teams, Semrush vs Ahrefs, Figma vs Sketch), und Konsumgüter-Vergleiche, in denen die größere Marke offensichtlich ist (Nike vs Adidas, Coca-Cola vs Pepsi, iPhone vs Samsung Galaxy, Netflix vs Disney+, Toyota vs Honda, iRobot Roomba vs Roborock).

Ergebnis 1: Die Antwort folgte der Reihenfolge nicht

Über 100 Durchläufe, die eine saubere, messbare erste Erwähnung ergaben, wurde die zuerst genannte Marke 49 Mal zuerst erwähnt: 49%.

Paar

Zuerst genannt bei „A vs B“

Zuerst genannt bei „B vs A“

Änderte die Reihenfolge das?

Notion vs Asana

Asana

Asana

Nein

Slack vs Microsoft Teams

Microsoft Teams

Microsoft Teams

Nein

Wix vs Squarespace

Wix

Wix

Nein

Canva vs Adobe Express

Canva

Canva

Nein

Mailchimp vs Klaviyo

Klaviyo

Klaviyo

Nein

Airtable vs Monday.com

Monday.com

Monday.com

Nein

Shopify vs WooCommerce

Shopify

Shopify

Nein

Semrush vs Ahrefs

Semrush

Semrush

Nein

Figma vs Sketch

Figma

Figma

Nein

Zoom vs Google Meet

Google Meet

Google Meet

Nein

Nike vs Adidas

Nike

Nike

Nein

Coca-Cola vs Pepsi

Coca-Cola

Coca-Cola

Nein

iPhone vs Samsung Galaxy

Samsung Galaxy

Samsung Galaxy

Nein

Netflix vs Disney+

Netflix

Netflix

Nein

Toyota vs Honda

Toyota

Toyota

Nein

iRobot Roomba vs Roborock

Roborock

Roborock

Nein

Keine einzige Mehrheit kippte. Wo eine Antwort eine Präferenz hatte, behielt sie sie in beiden Reihenfolgen: AI Overviews eröffneten mit Asana sowohl bei „Notion vs Asana“ als auch bei „Asana vs Notion“, mit Monday.com in beiden Airtable-Vergleichen, mit Google Meet in beiden Zoom-Vergleichen. Nike führte in beiden Reihenfolgen gegen Adidas. Samsung Galaxy führte in beiden Reihenfolgen gegen iPhone.

Wiederholte Durchläufe stimmten 93 von 100 Mal überein. Sechs der sieben Ausnahmen kamen von einem einzigen Paar unter einer anderen Formulierung, und genau das ist die eigentliche Geschichte. Die siebte war ein Slack-vs-Microsoft-Teams-Durchlauf, der mit Slack statt Teams eröffnete; die beiden folgenden liefen wieder auf Teams.

Eine Sache kann diese Messung nicht klären: Eine Antwort anzuführen ist nicht dasselbe, wie empfohlen zu werden. Also haben wir auch die Empfehlungssprache gezählt. Über alle 60 Software-Durchläufe verteilten sich Sätze mit Gewinner-Wörtern (wins, better choice, recommend, stronger, go-to) 40 zu 39 zwischen der zuerst und der zuletzt genannten Marke. Ein totes Rennen.

Grafik, die zeigt, dass in allen 16 Markenpaaren die Wortstellung nicht änderte welche Marke zuerst genannt wird

Ergebnis 2: Die beiden Antworten waren meist dieselbe Antwort

Wenn die Reihenfolge die Untersuchen verankern würde, müssten die beiden Versionen einer Abfrage unterschiedliche Seiten abrufen, und die Antworten müssten auseinanderlaufen. Meistens liefen sie nicht auseinander.

Bei 8 der 10 Software-Paare waren das AI Overview für „A vs B“ und das für „B vs A“ wortwörtlich identisch. Vergleichen Sie die ersten Zeilen von Semrush vs Ahrefs in beiden Reihenfolgen:

Semrush ist eine All-in-One-Marketingplattform, während Ahrefs ein spezialisiertes SEO- und Backlink-Analyse-Tool ist. (Originalzitat auf Englisch)

Derselbe Satz, dieselbe Reihenfolge der Fakten, dieselbe Schlussformel „Wählen Sie Semrush, wenn… / wählen Sie Ahrefs, wenn…“, egal mit welcher Marke die Abfrage begann. Nur zwei Paare zeigten echte Textabweichung: Slack vs Microsoft Teams und Shopify vs WooCommerce, und bei Shopify beschränkte sich die Abweichung auf einen anders formulierten Eröffnungsabsatz statt auf eine andere Schlussfolgerung.

Die Belege zeigen in dieselbe Richtung. Über 806 Referenzeinträge in den Software-Durchläufen ergaben Zitate auf die eigenen Domains der beiden Marken ein Verhältnis von 36 zu 36. Referenzseitentitel, die beide Marken nennen, setzten die zuerst genannte Marke 392 Mal nach vorne und die zweitgenannte 396 Mal: 49,7%, wieder ein Münzwurf. Die gesamten Markennennungen verteilten sich 337 zu 336, also 50,1% zu 49,9%.

Ein System, dessen Retrieval von der zuerst in der Abfrage erscheinenden Marke gesteuert würde, würde weder ein Zitatverhältnis von 36 zu 36 noch byte-identische Prosa erzeugen.

Was die Antwort tatsächlich bewegte

Zwei Dinge, und beide sind nützlicher als die Reihenfolge.

Die Formulierung. Bei drei Paaren haben wir die „vs“-Abfrage und die Abfrage „which is better, X or Y“ in beiden Reihenfolgen gefahren. Die AI Overviews verhielten sich, als wären das verschiedene Fragen, und taten das in beiden Reihenfolgen identisch.

Bei Shopify und WooCommerce eröffnete „Shopify vs WooCommerce“ mit einer Produktbeschreibung: Shopify ist ein All-in-One-Baukasten für gehostete Shops, und die Antwort arbeitete die Unterschiede ab. „Which is better, Shopify or WooCommerce“ eröffnete mit einer Weigerung zu ranken: Keines ist objektiv besser, es hängt von den eigenen Anforderungen ab. Dieselben vier Durchläufe, dasselbe Paar, derselbe Tag, gegensätzliche erste Eindrücke, angetrieben allein von der Formulierung und nicht von der Position.

Bei Semrush und Ahrefs enthielten die „which is better“-Antworten ausdrückliche Urteilssätze, und jeder einzelne davon sprach Ahrefs den Vorzug zu: fünf von fünf Durchläufen, ob die Abfrage „Semrush or Ahrefs“ oder „Ahrefs or Semrush“ lautete. Die Reihenfolge war irrelevant gegenüber der Tatsache, dass der zugrunde liegende Vergleichskorpus Ahrefs als das stärkere Backlink-Tool behandelt.

Die Oberfläche. Wir haben 18 derselben Abfragen über Google AI Mode gefahren, die konversationelle Oberfläche. Ihr Verhalten unterscheidet sich von AI Overviews auf eine Weise, die wie Reihenfolgeempfindlichkeit aussieht, aber keine ist. Bei Semrush vs Ahrefs eröffnete AI Mode je nach Abfragereihenfolge mit „Both Semrush and Ahrefs are…“ oder „Both Ahrefs and Semrush are…“ und spiegelte sie damit. Und beachten Sie, auf welcher Variante sie landete: „Both X and Y“, eine Konstruktion ganz ohne Ranking-Implikation. Der Name, der den Satz anführt, ist ein stilistisches Echo des Prompts.

Unter diesem Echo war die Substanz von AI Mode deutlich instabiler als die von AI Overviews: Die Textähnlichkeit zwischen Durchläufen innerhalb derselben Reihenfolge lag bei nur 0,30 bis 0,36 und bei 0,38 über die Reihenfolgen hinweg, während AI Overviews bei den meisten Paaren identischen Text produzierten. Bei zwei der drei Paare waren die AI-Mode-Antworten über die Reihenfolgen hinweg byte-identisch, und im Shopify-Fall fixierte sie sich beide Male auf WooCommerce in der Eröffnung, während AI Overviews sich beide Male auf Shopify fixierte. Jede Oberfläche hat eingeschliffene Formulierungsgewohnheiten, und es sind nicht dieselben.

Vergleich, der zeigt, dass dasselbe Markenpaar bei anderer Formulierung gegensätzliche AI-Overview-Einstiege erzeugt

Die Reihenfolge-Story ist keine reine Fiktion

Eine Messung bewegte sich tatsächlich mit der Wortstellung, und es ist die, die die meisten Leute tatsächlich beobachten: die klassische Ergebnisliste.

Bei 5 der 10 Software-Paare unterschieden sich die ersten drei traditionellen organischen Ergebnisse zwischen „A vs B“ und „B vs A“, einschließlich des Paares, bei dem das AI Overview in beiden Reihenfolgen identisch war. Reddit rankte in den meisten Software-Vergleichen weit oben, und welcher konkrete Thread erschien, verschob sich mit der Formulierung. Es gibt also echte Reihenfolgeempfindlichkeit in der Google-Suche bei Vergleichsabfragen. Sie sitzt in der Schicht unterhalb der KI-Antwort, nicht in der Empfehlung selbst. Diese Unterscheidung ist der ganze Grund, warum dieser Test es wert war, gefahren zu werden, und es ist nicht der Befund, den wir erwartet hatten zu schreiben.

Das ist für das Reporting wichtig. Wenn Ihr Rank-Tracker zeigt, dass Ihre Position zwischen gebrandeten und nicht gebrandeten Vergleichsabfragen schwankt, sehen Sie einen echten Effekt. Es ist nur nicht der Effekt, den die viral gegangene Behauptung beschreibt, und darauf zu optimieren wird nicht bewegen, was das AI Overview über Sie sagt.

Der Hebel, auf den die Daten tatsächlich zeigen

Das klarste Signal in unseren Durchläufen hatte nichts mit dem Aufbau der Abfrage zu tun. Es hatte mit dem Vergleichskorpus zu tun, aus dem jede Antwort gebaut wurde.

Bei Airtable vs Monday.com enthielten die zitierten Quellen 18 Seiten im Besitz von Monday.com und null Seiten im Besitz von Airtable, in beiden Reihenfolgen. Bei Mailchimp vs Klaviyo sechs Zitate von Mailchimp, null von Klaviyo. Shopify vs WooCommerce ergab drei Zitate von WooCommerce und keine von Shopify. Bei vielen Paaren tauchte zugleich die eigene Domain keiner der beiden Marken auf: Die Antwort war aus Drittvergleichen, Testseiten und Foren-Threads zusammengesetzt.

Dieses Muster passt dazu, wie Retrieval tatsächlich funktioniert. Dem Modell ist egal, welchen Namen Sie zuerst getippt haben; es ist relevant, welche Seiten existieren und wie sie die jeweilige Marke beschreiben. Wo eine Marke ihre Vergleichsinhalte selbst besitzt, werden diese Seiten mit hineingezogen. Wo nicht, fehlen sie in den Antworten aller, die fragen.

So fahren Sie Ihren eigenen Reihenfolge-Test

Fünfzehn Minuten, kein API-Zugang nötig:

  1. Wählen Sie fünf Vergleichsabfragen, in denen Ihre Marke einer der beiden Namen ist und Sie einen echten Wettbewerber haben.
  2. Fahren Sie jede in beiden Reihenfolgen, und jede Reihenfolge zweimal. Vier Antworten pro Paar, insgesamt zehn Antwortpaare.
  3. Speichern Sie die Antworten, bevor Sie sie lesen. Screenshot oder kopieren Sie den Volltext und die zitierten Quellen.
  4. Vergleichen Sie zwei Dinge getrennt: welche Marke zuerst genannt wird und was die Antwort über jede Marke sagt. Wo wir das interessante Signal fanden, war die Reihenfolge stabil und die Substanz nicht.
  5. Schauen Sie die Zitatliste an, nicht nur die Prosa. Wenn die eigene Domain des Wettbewerbers immer wieder auftaucht und Ihre nicht, haben Sie den eigentlichen Engpass gefunden.

Der AI Overview Citation Checker zeigt Ihnen, welche Seiten ein AI Overview für eine Abfrage zitiert, was der schnellste Weg ist zu sehen, ob Ihre Domain überhaupt im Pool ist.

Machen Sie das mindestens zweimal, an verschiedenen Tagen, bevor Sie irgendetwas schlussfolgern. Unsere eigene Übereinstimmung zwischen Durchläufen lag bei 93%, nicht bei 100%, und ein einzelner gekippter Durchlauf ist genau die Art Rauschen, aus der ein selbstsicherer Blogbeitrag wird.

Was Sie damit tun sollten

Bauen Sie Ihre Vergleichsseiten nicht um die Wortstellung herum um. Es gibt keine Belege, dass sie ändert, was AI Overviews empfehlen, und sollte Google sie je gewichten, wäre die Korrektur eine Änderung an einem Wort, die Ihnen nichts über Ihre tatsächliche Position sagt.

Behandeln Sie die Formulierung dagegen als echte Variable. „X vs Y“ und „which is better, X or Y“ sind verschiedene Abfragen, die verschiedene Antworten produzieren. Wenn Ihre Käufer Vergleiche als Frage formulieren, brauchen Sie Inhalte, die die Frage beantworten, nicht nur eine Spezifikationstabelle.

Prüfen Sie, ob die eigenen Seiten Ihrer Marke in den Zitaten der Vergleiche auftauchen, die Ihnen wichtig sind. Das Verhältnis von 18 zu 0, das wir gesehen haben, ist die umsetzbarste Zahl in diesem Datensatz, und es geht ums Veröffentlichen, nicht um Prompt-Formulierungen.

Behalten Sie eine Erstnennungs-Kennzahl, wenn Sie schon eine haben, und behandeln Sie sie als Beschreibung dessen, was die Antwort sagt, nicht als Hebel, den Sie ziehen können. In unseren Daten war sie ein Münzwurf, der dem Korpus folgte, nicht der Abfrage.

Grenzen

Das ist ein Tag Daten von einem Standort und in einer Sprache, auf dem Desktop, erfasst über eine SERP-API statt über eine Browser-Sitzung, über 16 Markenpaare. Suchergebnisse variieren nach Personalisierung, Zeit und Gerät, und ein einzelner Tag kann eine künftige Änderung nicht ausschließen.

Wir haben gemessen, welche Marke zuerst genannt wird, wie oft sie erwähnt wird und welche Quellen zitiert werden. Nichts davon misst direkt, wie überzeugend die Antwort für einen Leser ist, und eine Antwort, die Ihre Marke zuerst nennt, kann trotzdem den Eindruck hinterlassen, dass die andere gewinnt.

Die AI-Mode-Stichprobe umfasste 18 Abfragen über drei Paare, genug, um zu sehen, dass die Oberfläche sich anders verhält, und nicht genug, um sie zu quantifizieren. Lesen Sie diesen Abschnitt als Richtung, nicht als Rate.

Schließlich bleiben die Mechanismus-Behauptungen der ursprünglichen Geschichte von außen unüberprüfbar. Google bestätigt, dass Fan-out stattfindet, und legt die Unterabfragen nicht offen, also kann niemand zeigen, welche Unterabfragen Ihre Abfrage erzeugt hat. Unser Test kann zeigen, dass das Umdrehen der Reihenfolge die Ausgabe nicht verändert hat. Er kann nicht zeigen, warum.

FAQ

Beeinflusst die Wortstellung in einer Google-Abfrage die AI Overviews? In unserem Test nicht. Über 102 AI-Overview-Abfragen mit 16 Markenpaaren in beiden Wortstellungen wurde die zuerst genannte Marke in 49% der Fälle zuerst erwähnt, und bei keinem Paar wechselte die Antwort die Richtung, als wir die Abfrage umdrehten. Acht von zehn Software-Paaren lieferten in beiden Reihenfolgen wortwörtlich identische Antworten.

Warum berichten Leute, dass die Reihenfolge KI-Empfehlungen beeinflusst? Weil Reihenfolgeeffekte bei Sprachmodellen dokumentiert sind, die aus einer Liste auswählen sollen, wo die erste Option in der veröffentlichten Forschung in etwa 63% der Fälle gewinnt, und weil Googles Query-Fan-out den Retrieval-Prozess unsichtbar macht. Beide Fakten sind real. Keines von beiden bedeutet, dass eine Vergleichsabfrage in AI Overviews die Marken wechselt, wenn Sie die Namen umsortieren.

Was ändert bei einer Vergleichsabfrage tatsächlich ein AI Overview? Formulierung und Oberfläche. „Shopify vs WooCommerce“ produzierte in beiden Reihenfolgen eine produktgeleitete Antwort, während „which is better, Shopify or WooCommerce“ in beiden Reihenfolgen eine Antwort im Sinne von „keines ist objektiv besser“ produzierte. Dieselben Abfragen kamen in AI Mode erneut mit anderem Framing zurück, und mit deutlich mehr Variation zwischen den Durchläufen.

Lohnt es sich, auf die Erstnennung in AI Overviews zu optimieren? Beobachten ja, optimieren nein. Die Erstnennung folgte in unseren Daten dem Quellenkorpus und nicht etwas, das wir von der Abfrage aus steuerten. Die steuerbare Variable ist, ob Ihre eigenen Vergleichsseiten überhaupt im Zitatpool sind: Ein getestetes Paar zog 18 Zitate aus Wettbewerbersbesitz und null von der anderen Marke.

Weiterlesen

Autor: Ethan Marlowe, GEO-Measurement-Lead bei Auspia über mehr als 500 Prompts hinweg. Er schreibt über KI-Sichtbarkeitsmessung, die Gestaltung von Prompt-Sets und darüber, wie man Tests baut, die einen zweiten Blick überstehen.

Dieses Thema erkunden

Folgen Sie derselben Wachstumslinie