Apakah urutan kata menentukan merek mana yang direkomendasikan AI Overviews? Kami menguji 102 kueri

Poin utama

Di kalangan tim pencarian beredar klaim bahwa merek yang ditulis lebih dulu dalam kueri perbandingan akan direkomendasikan AI Overviews hingga 80% kasus. Kami mengujinya dengan 102 kueri dan 16 pasangan merek. Urutan kata tidak mengubah apa pun. Yang mengubahnya adalah hal lain.

Bulan ini beredar satu klaim di kalangan tim pencarian, lengkap dengan angka yang sangat percaya diri: kalau Anda menaruh merek A di depan dalam sebuah kueri perbandingan, AI Overviews Google akan merekomendasikan merek A sekitar 80% kasus. Balik urutannya, rekomendasinya ikut terbalik. Seberapa jauh lebih besar merek yang satu lagi tidak berpengaruh.

Itu cerita yang menyenangkan, karena menjelaskan hal yang setiap orang yang mengamati jawaban AI memang lihat sendiri: jawaban perbandingan tidak terlihat seperti daftar hasil pencarian, dan tidak ada siapa pun di luar Google yang bisa memverifikasi bagaimana jawaban itu disusun. Jadi kami melakukan pekerjaan yang membosankan: mengujinya. Pada 11 September 2026 kami menjalankan 102 kueri perbandingan di AI Overviews Google yang sebenarnya, mencakup 16 pasangan merek dalam kedua urutan, mengulang tiap pasangan dua sampai tiga kali, dan mencatat setiap jawaban beserta setiap sumber yang dikutip.

Hasilnya: nol dari 16 pasangan mengganti rekomendasinya karena urutan kata. Merek yang ditulis lebih dulu dalam kueri muncul sebagai nama pertama pada 49% percobaan, persis seperti melempar koin. Yang mengubah jawaban secara konsisten adalah cara Anda menyusun kueri dan permukaan Google mana yang menjawab.

Klaimnya, seperti yang beredar

Versi yang beredar bulan ini kurang lebih berbunyi begini:

  • Brand A vs Brand B mengembalikan AI Overview yang dibuka dengan dan merekomendasikan merek A sekitar 80% kasus.
  • Brand B vs Brand A memberi gambaran yang berkebalikan.
  • Itu tetap berlaku meski merek A jauh lebih besar dan lebih tua daripada merek B.
  • Mekanisme yang diajukan adalah AI Overviews memecah kueri Anda menjadi kueri-kueri kecil, dan merek yang muncul lebih dulu dalam kueri menjadi jangkar bagi kueri-kueri kecil itu.

Poin terakhir itulah yang membuat klaim ini meyakinkan, dan itu juga bagian yang punya bukti paling kuat.

Mekanismenya nyata, dan itulah sebabnya klaim ini melaju jauh

Panduan Google soal fitur AI generatif yang terbit Mei 2026 mengonfirmasi perluasan kueri: AI Overviews dan AI Mode membuka satu kueri menjadi beberapa kueri turunan yang berkaitan, menjalankannya bersamaan di indeks, lalu menyusunnya menjadi satu jawaban dari hasil yang terkumpul. Kueri turunan itu apa, tidak dilaporkan di mana pun, termasuk di Search Console. Jadi saat Anda melihat sebuah AI Overview, Anda sedang melihat hasil dari proses yang tidak bisa Anda amati.

Efek urutan pada model bahasa juga nyata, dan ada riset yang sudah melalui tinjauan sejawat di belakangnya. Sebuah studi yang terbit di PNAS Nexus pada Agustus 2026 menguji sembilan model dengan tugas membandingkan riwayat hidup dan memilih warna, dan menemukan efek posisi tidak sekadar memecah seri: pada sebagian kasus, membalik urutan pilihan ikut mengubah pilihan yang disukai model, lalu model memilih opsi yang lebih lemah. Penelitian dari Columbia Business School menemukan pola serupa di arah sebaliknya: ChatGPT memilih opsi pertama dalam daftar sekitar 63% kasus dari 5.447 prompt, dan efek itu berulang pada 64,29% dalam 64.800 percobaan dengan rancangan yang lebih sederhana.

Baca kedua hasil itu bersama-sama, klaim yang beredar tampak seperti langkah lanjutan yang wajar: perluasan kueri memang terjadi, model bahasa memang punya kebiasaan aneh soal urutan, jadi urutanlah yang menentukan merek mana yang disebut AI.

Celahnya ada di langkah terakhir. Eksperimen tadi meminta model melihat daftar opsi lalu memilih satu. Kueri perbandingan di AI Overviews bukan tugas seperti itu. Kueri itu permintaan sintesis yang dijawab sistem perolehan yang mengambil bahan dari halaman pihak ketiga. Justru karena itu klaim ini perlu diuji, bukan sekadar diulang.

Apa yang kami jalankan

Kueri

102 di Google AI Overviews, ditambah 18 di AI Mode

Pasangan merek

16 (10 perangkat lunak, 6 barang konsumen)

Urutan

Keduanya, tiap urutan diulang 2–3 kali

Gaya penulisan

X vs Y untuk semua pasangan, ditambah which is better, X or Y untuk tiga pasangan

Permukaan

Google Search, Amerika Serikat, bahasa Inggris, desktop

Tanggal

11 September 2026 (dalam satu hari)

Pencatatan

Jawaban lewat SERP API, satu permintaan per kueri; seluruh teks AI Overview dan semua item sumber disimpan

Biaya

Sekitar $0,43 kredit API

Dua keputusan rancangan penting. Pertama, kami menjalankan tiap kueri dua sampai tiga kali, karena satu percobaan yang terbalik di sistem yang punya sedikit keacakan tidak membuktikan apa pun. Kedua, kami mencatat bagaimana jawaban itu dibangun, bukan hanya apa yang dikatakannya: merek mana yang disebut lebih dulu, berapa kali tiap merek disebut, halaman mana yang dikutip, dan berapa banyak kutipan yang menunjuk ke domain masing-masing merek.

16 pasangan merek dipilih untuk mencakup dua situasi: perbandingan perangkat lunak yang kedua mereknya memang hal yang orang cari (Notion vs Asana, Slack vs Microsoft Teams, Semrush vs Ahrefs, Figma vs Sketch), dan perbandingan barang konsumen yang merek lebih besarnya jelas lebih besar (Nike vs Adidas, Coca-Cola vs Pepsi, iPhone vs Samsung Galaxy, Netflix vs Disney+, Toyota vs Honda, iRobot Roomba vs Roborock).

Hasil 1: jawaban tidak mengikuti urutan

Dari 100 percobaan yang nama pertamanya bisa dikenali dengan jelas, merek yang ditulis lebih dulu dalam kueri muncul sebagai nama pertama 49 kali. 49 persen.

Pasangan

Nama pertama di A vs B

Nama pertama di B vs A

Urutan mengubahnya?

Notion vs Asana

Asana

Asana

Tidak

Slack vs Microsoft Teams

Microsoft Teams

Microsoft Teams

Tidak

Wix vs Squarespace

Wix

Wix

Tidak

Canva vs Adobe Express

Canva

Canva

Tidak

Mailchimp vs Klaviyo

Klaviyo

Klaviyo

Tidak

Airtable vs Monday.com

Monday.com

Monday.com

Tidak

Shopify vs WooCommerce

Shopify

Shopify

Tidak

Semrush vs Ahrefs

Semrush

Semrush

Tidak

Figma vs Sketch

Figma

Figma

Tidak

Zoom vs Google Meet

Google Meet

Google Meet

Tidak

Nike vs Adidas

Nike

Nike

Tidak

Coca-Cola vs Pepsi

Coca-Cola

Coca-Cola

Tidak

iPhone vs Samsung Galaxy

Samsung Galaxy

Samsung Galaxy

Tidak

Netflix vs Disney+

Netflix

Netflix

Tidak

Toyota vs Honda

Toyota

Toyota

Tidak

iRobot Roomba vs Roborock

Roborock

Roborock

Tidak

Tidak ada satu pasangan pun yang mayoritasnya terbalik. Di mana jawaban punya kecenderungan, kecenderungan itu bertahan di kedua urutan: AI Overviews membuka dengan Asana untuk Notion vs Asana maupun Asana vs Notion, dengan Monday.com di kedua perbandingan Airtable, dan dengan Google Meet di kedua perbandingan Zoom. Nike memimpin di kedua urutan melawan Adidas. Samsung Galaxy memimpin di kedua urutan melawan iPhone.

Percobaan ulang sepakat satu sama lain 93 kali dari 100. Enam dari tujuh pengecualian datang dari satu pasangan dengan gaya penulisan berbeda, dan itulah yang justru menjadi cerita sebenarnya. Pengecualian ketujuh adalah satu percobaan Slack vs Microsoft Teams yang dibuka dengan Slack dan bukan Teams; dua percobaan berikutnya kembali ke Teams.

Ada satu hal yang tidak bisa diselesaikan pengukuran ini: membuka sebuah jawaban tidak sama dengan direkomendasikan. Jadi kami juga menghitung bahasa yang bersifat rekomendasi. Dari seluruh 60 percobaan pasangan perangkat lunak, kalimat yang memakai kata bertipe kemenangan (wins, better choice, recommend, stronger, go-to) terbagi 40 banding 39 antara merek yang di depan dan merek yang di belakang dalam kueri. Seri persis.

Infografis yang membandingkan dua urutan kueri yang sama: kali pertama satu merek di depan, kali kedua urutannya dibalik, dan jawabannya persis sama

Hasil 2: dua jawaban itu biasanya jawaban yang sama

Kalau urutan menjadi jangkar bagi kueri turunan, dua versi kueri yang sama seharusnya menarik halaman yang berbeda, dan jawabannya seharusnya menyimpang. Sebagian besar tidak.

Pada 8 dari 10 pasangan perangkat lunak, AI Overview untuk A vs B dan untuk B vs A identik kata per kata. Bandingkan dua baris pertama Semrush vs Ahrefs di kedua urutan:

Semrush adalah platform pemasaran serba bisa, sementara Ahrefs adalah alat khusus untuk SEO dan analisis tautan balik. (kutipan aslinya dalam bahasa Inggris)

Kalimat yang sama. Urutan faktanya sama. Pembagian penutup "pilih Semrush jika… / pilih Ahrefs jika…" juga sama, apa pun merek yang membuka kuerinya. Hanya dua pasangan yang teksnya benar-benar menyimpang: Slack vs Microsoft Teams dan Shopify vs WooCommerce, dan pada Shopify penyimpangan itu hanya sebatas paragraf pembuka yang ditulis berbeda, bukan kesimpulan yang berbeda.

Bukti pendukungnya menunjuk ke arah yang sama. Dari 806 entri rujukan di percobaan pasangan perangkat lunak, kutipan ke domain milik kedua merek itu sendiri keluar 36 banding 36. Judul halaman sumber yang menyebut kedua merek menaruh merek yang di depan di posisi pertama 392 kali dan merek yang di belakang 396 kali: 49,7%, lemparan koin lagi. Total penyebutan merek terbagi 337 banding 336, yaitu 50,1% banding 49,9%.

Sistem yang perolehannya dikemudikan oleh merek yang muncul lebih dulu dalam kueri tidak akan menghasilkan pembagian kutipan 36 banding 36 dan tidak akan menghasilkan teks yang sama persis byte demi byte.

Apa yang sungguh menggerakkan jawaban

Ada dua hal, dan keduanya lebih berguna daripada urutan kata.

Gaya penulisan. Pada tiga pasangan, kami menjalankan kueri gaya vs dan kueri which is better, X or Y, di kedua urutan. AI Overviews memperlakukan kedua cara bertanya itu sebagai dua pertanyaan berbeda, dan memperlakukan keduanya dengan cara yang persis sama di kedua urutan.

Untuk Shopify dan WooCommerce, Shopify vs WooCommerce dibuka dengan definisi produk: Shopify adalah pembuat toko terkelola yang serba lengkap, lalu jawabannya menelusuri perbedaannya. Which is better, Shopify or WooCommerce dibuka dengan penolakan untuk memberi peringkat: tidak ada yang lebih baik secara mutlak, semua tergantung kebutuhan Anda. Empat percobaan, pasangan yang sama, hari yang sama. Kesan pertamanya bertolak belakang, dan itu digerakkan murni oleh gaya penulisan, bukan posisi.

Untuk Semrush dan Ahrefs, jawaban which is better memuat putusan yang tegas, dan setiap kalimatnya memihak Ahrefs: lima dari lima percobaan. Tidak ada bedanya kuerinya ditulis Semrush or Ahrefs atau Ahrefs or Semrush. Urutan kata tidak berarti apa-apa ketika data perbandingan di bawahnya sendiri menganggap Ahrefs alat tautan balik yang lebih kuat.

Permukaan. Kami menjalankan 18 kueri yang sama di Google AI Mode, permukaan yang bersifat percakapan. Perilakunya berbeda dari AI Overviews dengan cara yang terlihat peka terhadap urutan kata padahal bukan. Untuk Semrush vs Ahrefs, AI Mode dibuka dengan Both Semrush and Ahrefs are… atau Both Ahrefs and Semrush are… mengikuti urutan kueri. Ia memantulkan kueri itu kembali, dan perhatikan pola yang menjadi tempatnya mendarat: Both X and Y, struktur yang tidak memuat peringkat apa pun. Nama yang membuka kalimat itu cuma gema retoris dari prompt.

Di bawah gema itu, substansi AI Mode jauh lebih tidak stabil daripada AI Overviews: kemiripan teks antarpercobaan di urutan yang sama hanya 0,30–0,36, dan 0,38 antara dua urutan, sementara AI Overviews memberi teks yang sama kata per kata di sebagian besar pasangan. Pada dua dari tiga pasangan, jawaban AI Mode sama persis byte demi byte di kedua urutan, dan pada Shopify ia menaruh WooCommerce di depan di kalimat pembuka kedua kali, sedangkan AI Overviews menaruh Shopify di depan kedua kali. Tiap permukaan sudah punya kebiasaan menulis yang tetap, dan kebiasaan itu tidak sama satu sama lain.

Infografis yang menyandingkan dua permukaan pencarian: AI Overviews memberi teks yang stabil dan bisa diulang, sedangkan AI Mode menanggapi gaya penulisan kueri dan lebih bervariasi

Kisah urutan kata bukan cerita yang mengada-ada

Ada satu pengukuran yang benar-benar bergerak mengikuti urutan kata, dan itulah yang paling banyak orang pantau: daftar hasil pencarian konvensional.

Pada 5 dari 10 pasangan perangkat lunak, tiga hasil organik teratas berbeda antara A vs B dan B vs A, termasuk pada pasangan yang AI Overview-nya sama di kedua urutan. Reddit berada di sekitar posisi teratas pada sebagian besar perbandingan perangkat lunak, dan utas yang muncul berubah mengikuti gaya penulisan. Jadi di Google Search memang ada kepekaan urutan kata yang nyata untuk kueri perbandingan. Letaknya di lapisan bawah jawaban AI, bukan di dalam rekomendasinya. Perbedaan itulah yang membuat pengujian ini layak dilakukan, dan itu temuan yang tidak kami duga harus kami tulis.

Ini penting untuk pelaporan. Kalau alat pemantau peringkat Anda menunjukkan peringkat berayun antara kueri perbandingan yang menyebut merek dan yang tidak, Anda sedang melihat efek yang nyata. Hanya saja itu bukan efek yang dibicarakan klaim tersebut, dan mengoptimalkan untuknya tidak akan mengubah apa yang AI Overview katakan tentang Anda.

Tuas yang sebenarnya ditunjuk data

Sinyal paling jelas dalam percobaan kami sama sekali tidak berkaitan dengan cara kueri dirangkai. Ia berkaitan dengan kumpulan bahan perbandingan yang menjadi dasar tiap jawaban.

Pada Airtable vs Monday.com, sumber yang dikutip mencakup 18 halaman milik Monday.com dan nol milik Airtable, di kedua urutan. Pada Mailchimp vs Klaviyo ada enam kutipan milik Mailchimp dan nol milik Klaviyo. Shopify vs WooCommerce memberi tiga kutipan milik WooCommerce dan tidak satu pun milik Shopify. Pada saat yang sama, banyak pasangan tidak memunculkan domain merek mana pun: jawaban itu disusun dari artikel perbandingan pihak ketiga, situs ulasan, dan utas forum.

Pola ini cocok dengan cara perolehan sebenarnya bekerja. Model tidak peduli nama mana yang Anda ketik lebih dulu. Ia peduli halaman mana yang ada dan apa yang halaman itu katakan tentang tiap merek. Di tempat merek memiliki konten perbandingannya sendiri, halaman itu ikut ditarik masuk. Di tempat ia tidak punya, halaman itu tidak ada dalam jawaban siapa pun yang bertanya.

Cara menjalankan uji balik urutan sendiri

Lima belas menit, dan tidak perlu akses API:

  1. Pilih lima kueri perbandingan yang merek Anda salah satu dari dua namanya dan pesaingnya benar-benar pesaing.
  2. Jalankan tiap kueri di kedua urutan, dan jalankan tiap urutan dua kali. Empat jawaban per pasangan, total sepuluh set.
  3. Simpan jawabannya sebelum Anda membacanya. Ambil tangkapan layar atau salin seluruh teks dan daftar sumbernya.
  4. Bandingkan dua hal secara terpisah: merek mana yang disebut lebih dulu, dan apa yang jawaban katakan tentang tiap merek. Di situlah kami menemukan sinyal menarik — urutannya stabil, isinya tidak.
  5. Lihat daftar kutipannya, bukan cuma teksnya. Kalau domain pesaing muncul berulang kali sementara domain Anda tidak, Anda sudah menemukan hambatan yang sebenarnya.

AI Overview Citation Checker menunjukkan halaman mana yang dikutip AI Overview untuk sebuah kueri, dan itu cara tercepat melihat apakah domain Anda masuk ke tumpukan kutipan itu.

Lakukan setidaknya dua kali, di hari yang berbeda, sebelum menarik kesimpulan apa pun. Percobaan ulang kami sendiri sepakat 93%, bukan 100%, dan satu percobaan yang terbalik justru jenis derau yang gampang berubah menjadi tulisan blog yang terlalu percaya diri.

Lalu apa yang perlu dilakukan

Jangan rombak halaman perbandingan Anda berdasarkan urutan kata. Tidak ada bukti itu mengubah apa yang direkomendasikan AI Overviews, dan kalaupun suatu hari Google benar-benar memberi bobot padanya, perbaikannya cuma mengganti satu kata, yang tidak mengatakan apa-apa tentang posisi Anda yang sebenarnya.

Perlakukan gaya penulisan sebagai variabel yang nyata. X vs Y dan which is better, X or Y adalah dua kueri berbeda yang memberi dua bentuk jawaban berbeda. Kalau pembeli Anda menuliskan perbandingan sebagai pertanyaan, Anda perlu konten yang menjawab pertanyaan itu, bukan sekadar tabel spesifikasi.

Periksa apakah halaman merek Anda sendiri muncul di kutipan perbandingan yang Anda pedulikan. Pembagian 18 banding 0 yang kami lihat adalah angka paling bisa ditindaklanjuti di seluruh kumpulan data ini, dan itu soal menerbitkan konten, bukan soal menulis prompt.

Kalau Anda sudah punya pengukuran nama-pertama, simpan saja, tapi bacalah sebagai keterangan tentang apa yang jawaban katakan, bukan sebagai tuas yang bisa Anda tarik. Dalam data kami, itu lemparan koin yang mengikuti kumpulan bahan, bukan kueri.

Batasan

Ini data satu hari dari satu lokasi dan satu bahasa, di desktop, dikumpulkan lewat SERP API dan bukan sesi peramban, mencakup 16 pasangan merek. Hasil pencarian berubah mengikuti personalisasi, waktu, dan perangkat, dan satu hari tidak menyingkirkan kemungkinan hal ini berubah di masa depan.

Kami mengukur merek mana yang disebut lebih dulu, seberapa sering disebut, dan sumber mana yang dikutip. Tidak satu pun dari itu mengukur secara langsung seberapa besar jawaban itu meyakinkan pembaca, dan jawaban yang menyebut nama Anda lebih dulu tetap bisa meninggalkan kesan bahwa pihak lain yang menang.

Sampel AI Mode adalah 18 kueri pada tiga pasangan. Cukup untuk melihat permukaannya berperilaku beda, tidak cukup untuk mengukurnya secara angka. Bacalah bagian itu sebagai arah, bukan laju.

Terakhir, mekanisme dalam cerita asalnya tidak bisa diverifikasi dari luar. Google mengonfirmasi perluasan kueri terjadi dan tidak mengungkapkan kueri turunannya, jadi tidak ada yang bisa menunjukkan kueri Anda menghasilkan kueri turunan yang mana. Uji kami menunjukkan membalik urutan tidak mengubah hasilnya. Ia tidak menunjukkan sebabnya.

Pertanyaan yang sering diajukan

Apakah urutan kata dalam kueri Google berpengaruh pada AI Overviews Dalam uji kami, tidak. Sepanjang 102 kueri AI Overview yang mencakup 16 pasangan merek di kedua urutan, merek yang ditulis lebih dulu muncul sebagai nama pertama pada 49% kasus, dan tidak ada pasangan yang arahnya berbalik ketika kuerinya kami balik. Delapan dari sepuluh pasangan perangkat lunak memberi jawaban yang sama kata per kata di kedua urutan.

Lalu kenapa orang bilang urutan memengaruhi rekomendasi AI Karena efek urutan memang tercatat pada model bahasa ketika diminta memilih dari daftar, dengan opsi pertama menang sekitar 63% kasus dalam riset yang sudah terbit, dan karena perluasan kueri Google membuat proses perolehan tidak bisa diamati. Kedua fakta itu benar. Tidak satu pun berarti kueri perbandingan di AI Overviews akan berganti merek saat Anda menyusun ulang namanya.

Apa yang sungguh mengubah AI Overview untuk kueri perbandingan Gaya penulisan dan permukaan. Shopify vs WooCommerce memberi jawaban yang dibuka dengan produk di kedua urutan, sedangkan which is better, Shopify or WooCommerce memberi jawaban "tidak ada yang lebih baik secara mutlak" di kedua urutan. Kueri yang sama di AI Mode kembali dengan pola yang lain lagi dan jauh lebih bervariasi antarpercobaan.

Apakah perlu mengoptimalkan posisi nama pertama di AI Overviews Pantau saja, tapi jangan dioptimalkan. Dalam data kami, posisi nama pertama mengikuti kumpulan bahan, bukan hal yang kami kendalikan dari sisi kueri. Variabel yang bisa Anda kendalikan adalah apakah halaman perbandingan Anda ada di tumpukan kutipan: satu pasangan yang kami uji menarik 18 kutipan milik pesaing dan nol dari merek yang satu lagi.

Bacaan terkait

Penulis: Ethan Marlowe, Head of GEO Measurement di Auspia, menangani lebih dari 500 prompt. Menulis tentang pengukuran visibilitas di AI, perancangan set prompt, dan cara membangun uji yang bertahan pada pemeriksaan kedua.

Jelajahi topik ini

Lanjutkan alur pertumbuhan yang sama