Pemeriksa keterlihatan AI: apabila kiraan petikan dan jawapan tidak sepadan

Perkara utama

Dua puluh gesaan yang sama, tiga permukaan AI, satu hari. Gemini memetik median 47 sumber setiap jawapan, Perplexity dua puluh, manakala ChatGPT tidak memetik apa-apa pada 12 daripada 20 gesaan dan hanya menyebut nama pembekal. Inilah dua isyarat yang wajib diasingkan oleh pemeriksa keterlihatan.

Dua pemeriksa keterlihatan AI boleh membaca jawapan yang sama pada hari yang sama dan memberi keputusan yang bertentangan. Satu mengembalikan kiraan petikan, satu lagi tidak mengembalikan apa-apa, kerana jawapan itu menyebut nama jenama anda dan mengesyorkannya tanpa pernah memautkannya.

Pada September 2026 kami menjalankan dua puluh gesaan merentas tiga permukaan AI dan merekodkan, pada setiap jawapan, dua isyarat: jenama yang disebut jawapan di dalam teks, dan domain yang dikemukakan jawapan sebagai sumber. Kedua-duanya bukan dua sudut bagi satu ukuran. Kedua-duanya berpisah di tempat yang boleh dijangka, dan tempat itulah bahagian paling berguna dalam laporan.

Versi pendeknya: Perplexity memetik sumber pada setiap gesaan, Gemini mengembalikan median 47 sumber setiap jawapan, manakala ChatGPT tidak mengembalikan sebarang petikan pada 12 daripada 20 gesaan, namun tetap menyebut nama pembekal pada 13 daripadanya. Kelainan antara jalan pada satu permukaan ialah persoalan lain, dan kami mengukurnya sebelum ini dalam kelainan jalan penjejak keterlihatan AI.

Apa yang kami jalankan

Perkara

Tetapan

Gesaan

Dua puluh soalan yang akan ditanya pembeli tentang alat keterlihatan AI

Permukaan

ChatGPT (gpt-5-2025-08-07), Gemini (gemini-2.5-flash), Perplexity (sonar)

Carian web

Diaktifkan pada ketiga-tiga permukaan

Wilayah dan bahasa

Amerika Syarikat, bahasa Inggeris

Tarikh

12 September 2026

Jawapan dikumpulkan

60

Kos keseluruhan jalan

1,444 dolar, iaitu 0,024 dolar setiap jawapan

Jalan ulangan

Kami jalankan semula lima gesaan yang sama untuk melihat sama ada tingkah lakunya stabil

Kos setiap jawapan berjulat dari 0,006 dolar di Perplexity hingga 0,037 dolar di Gemini. Permukaan termurah menghasilkan senarai sumber paling konsisten, dan yang termahal bukanlah permukaan yang mengembalikan sumber paling banyak.

Dua isyarat, diukur secara berasingan

Kami menangkap setiap jawapan dua kali: sekali sebagai teks, sekali sebagai senarai sumber yang dilampirkan permukaan pada teks itu.

Permukaan

Anotasi sumber

Setiap jawapan

Jawapan tanpa petikan

Domain berbeza setiap jawapan

ChatGPT (gpt-5)

90

0 hingga 18, median 0

12 daripada 20

0 hingga 10

Gemini 2.5 Flash

989

14 hingga 122, median 47

0 daripada 20

3 hingga 23

Perplexity

399

19 hingga 20

0 daripada 20

16 hingga 20

Ketiga-tiga senarai ini bukan jenis objek yang sama, dan di sinilah pemeriksa mula-mula tersilap.

Carta bar yang menunjukkan median bilangan sumber yang dilampirkan pada satu jawapan: pada dua puluh gesaan masing-masing, ChatGPT berada pada 0, Gemini pada 47 dan Perplexity pada 20

Gemini melampirkan sumber pada hampir setiap dakwaan. Halaman yang sama boleh menduduki banyak slot dalam satu jawapan, dan itulah sebabnya angkanya setinggi itu: sepanjang 20 jawapan Gemini, semrush.com menduduki 44 slot, maxaeo.ai dua puluh enam, google.com dua puluh dua, adobe.com dua puluh satu dan medium.com dua puluh. Bilangan anotasi yang tinggi pada permukaan ini bercakap tentang betapa halusnya model memecahkan bahan, bukan tentang betapa dikenali jenama anda.

Perplexity pula mendedahkan panel yang mempunyai had atas. Ia mengembalikan tepat dua puluh sumber pada 19 daripada 20 gesaan dan sembilan belas pada gesaan kedua puluh. Itu menetapkan penyebut: bahagian anda dalam jawapan Perplexity sentiasa bahagian daripada dua puluh, jadi merebut satu slot bermakna seseorang kehilangan satu slot di tempat lain.

ChatGPT hanya mengembalikan senarai sumber apabila ia mencari. Ia melepaskan kueri carian pada 8 daripada 20 gesaan dan tidak memetik apa-apa pada dua belas yang selebihnya. Pada dua belas itu ia tetap menjawab soalan itu dan tetap menyebut nama alat. Satu contoh tanpa suntingan: apabila ditanya tentang alat terbaik untuk memantau sebutan jenama dalam hasil carian AI, ia menyenaraikan Brand24, Mention, BuzzSumo, Talkwalker dan Google Alerts, tanpa satu pun sumber dilampirkan pada mana-mana daripadanya. Senarai semak yang kami gunakan untuk mengaudit jawapan ChatGPT bagi pola kegagalan ini ada dalam senarai semak keterlihatan dalam ChatGPT.

Disebut tanpa dipetik

Seterusnya kami mengira, bagi 27 jenama dan penerbit, berapa daripada 60 jawapan menyebut jenama itu di dalam teks dan berapa yang memetik domainnya sebagai sumber. Kedua-dua lajur berbeza dalam kedua-dua arah sekali gus.

Jenama

Jawapan yang menyebutnya

Jawapan yang memetik domainnya

Semrush

18

15

Reddit

16

14

Otterly

14

6

Ahrefs

13

16

Profound

11

6

Peec AI

11

2

Frase

5

9

HubSpot

5

8

ZipTie

5

0

Siftly

4

5

Keyword.com

4

5

Nightwatch

3

4

LLM Pulse

2

6

Cognizo

1

6

MaxAEO

1

7

Searchable

1

5

AirOps

0

5

Menra

0

4

Ada dua pola dalam jadual ini. Peec AI, Otterly, Profound dan ZipTie disyorkan dalam jawapan jauh lebih kerap daripada halaman mereka dipautkan. MaxAEO, Cognizo, LLM Pulse, Searchable, AirOps dan Menra sebaliknya: halaman mereka ditarik masuk sebagai sumber sedangkan jawapan tidak pernah menyebut nama syarikat itu. Pemeriksa yang hanya melihat pautan akan menilai kumpulan kedua sebagai kelihatan dan kumpulan pertama sebagai tidak kelihatan. Pemeriksa yang hanya melihat sebutan melakukan sebaliknya.

Carta bar berkumpulan yang membandingkan kekerapan lima jenama disebut dalam jawapan AI dengan kekerapan domain mereka dipetik sebagai sumber, merentas 60 jawapan

Sepanjang 60 jawapan itu, ketiga-tiga permukaan bersama-sama memetik 432 domain berbeza. ChatGPT menyumbang 47 daripadanya, iaitu 11 peratus, Gemini 184 (43 peratus) dan Perplexity 285 (66 peratus). Apa juga permukaan yang anda periksa, anda sedang melihat sampel daripada alam sumber yang jauh lebih besar. Ini tidak termasuk permukaan Google sendiri, yang di sana kehadirannya diukur dengan cara lain dan kami jelaskan dalam penjejak AI Overview.

Apa yang wajib direkodkan oleh pemeriksa

Pemeriksa keterlihatan yang mengembalikan satu nombor sedang membuang tiga daripada empat medannya. Inilah empat yang wajar dikekalkan.

Medan

Bentuk rakaman

Mengapa ia mengubah keputusan

Sama ada permukaan itu mencari

ya atau tidak

Jawapan yang tidak mencari tidak boleh menghasilkan petikan, jadi sifarnya bukan isyarat keterlihatan

Sama ada jenama disebut di dalam teks jawapan

bilangan jawapan

Satu-satunya isyarat yang terus hidup pada jawapan tanpa asas

Sama ada domain ada dalam senarai sumber

bilangan jawapan

Isyarat yang dilaporkan oleh kebanyakan alat secara bersendirian

Penyebut

bilangan jawapan, dan bilangan slot sumber setiap jawapan

Panel dengan dua puluh slot tetap dan senarai berisi 47 anotasi tidak boleh dibandingkan sebagai peratus

Kesan praktikalnya ialah sifar palsu. Dalam data kami, 13 daripada 20 jawapan ChatGPT menyebut sekurang-kurangnya satu pembekal, manakala hanya 8 daripada 20 memetik apa-apa, jadi kira-kira satu perempat jawapan pada permukaan ini akan melaporkan sifar petikan bagi jenama yang jawapan itu sendiri sebut dan syorkan.

Cara melakukannya tanpa menipu diri sendiri

Pola kegagalan apabila anda menyerahkan kerja ini kepada ejen bukanlah nombor yang salah, tetapi nombor yang yakin diri yang dikira daripada medan yang tidak pernah dikumpulkan.

  • Tangkap muatan mentah sebelum mengira apa-apa. Simpan teks jawapan, senarai sumber, pengecam model, dan nilai benar-salah tentang sama ada kueri carian dilepaskan. Metrik terbitan dibina dalam kod pada peringkat kedua, bukan diletakkan di dalam gesaan pengumpulan.
  • Buat ejen itu memetik, bukan meringkaskan. Rubrik "laporkan berapa kali jenama muncul" menghasilkan prosa. Rubrik "kembalikan teks jawapan dan senarai sumber sebagaimana adanya" menghasilkan data yang boleh anda semak semula.
  • Jalankan semula gesaan yang sama sebelum mempercayai sesuatu perubahan. Kami mengulang lima gesaan dan keputusan mencari itu sepadan pada 5 daripada 5, jadi lonjakan mendadak dalam bilangan petikan lebih berkemungkinan versi model atau suntingan gesaan daripada bunyi bising.
  • Simpan pengecam model pada setiap baris. Dua puluh gesaan yang sama pada titik akhir yang sama melalui gpt-4o hanya mengembalikan anotasi sumber pada 2 daripada 20, berbanding 8 daripada 20 dengan gpt-5.
  • Sediakan belanjawan. Jalan penuh 60 jawapan menelan 1,444 dolar, jadi pada kadar ini versi mingguan bagi pemeriksaan yang sama berada sekitar 6 dolar sebulan.

Batasan

  • Satu hari, satu wilayah, bahasa Inggeris, tiga permukaan. Jawapan berbeza antara wilayah.
  • Satu versi model bagi setiap permukaan. Malah dalam jalan kami sendiri, tingkah lakunya berganjak antara versi model.
  • Pengesanan jenama ialah padanan rentetan berdasarkan nama, jadi jenama yang disyorkan hanya melalui nama produknya mungkin terlepas pandang.
  • Carian web diaktifkan melalui API. Aplikasi pengguna mungkin mencari lebih banyak daripada jalan ini, atau lebih sedikit.
  • Kos hanya meliputi penjanaan jawapan dan tidak termasuk masa penyimpanan atau semakan.

Soalan lazim

Mengapa ChatGPT melaporkan sifar petikan pada 12 daripada 20 gesaan?

Kerana ia menjawab gesaan itu tanpa mencari. Model yang tidak pernah mengambil halaman tidak boleh memetiknya. Jadi sifar itu menggambarkan jalannya, bukan jenama anda. Sebelum membaca angka petikan daripada mana-mana permukaan sembang, periksa dahulu sama ada permukaan itu benar-benar menggunakan web.

Adakah sebutan masih bernilai jika tiada pautan sama sekali?

Pada jawapan tanpa asas, itulah keseluruhan isyaratnya, dan itulah juga isyarat yang datang sebelum pautan. Dalam data kami, sebutan dan pautan diperoleh daripada sumber yang berbeza: sebutan mengikut kandungan perbandingan dan ulasan, manakala petikan mengikut halaman yang distrukturkan supaya dipetik.

Patutkah saya gabungkan sebutan dan petikan menjadi satu skor keterlihatan?

Tidak. Seperti yang ditunjukkan jadual jenama, kedua-duanya berbeza secara sistematik dalam kedua-dua arah, dan skor gabungan menyembunyikan yang mana satu berganjak. Laporkan keduanya sebagai dua garis dan biarkan pembaca melihat jurang itu.

Permukaan mana yang patut saya periksa dahulu?

Jika anda mahu panel yang stabil, murah dan lebarnya tetap, pilih Perplexity, kerana panjang senarainya tidak berubah. Jika anda mahu keluasan, pilih Gemini, yang mencapai 184 daripada 432 domain yang kami lihat. ChatGPT hanya dengan pemeriksaan kewajaran disertakan, jika tidak satu perlima jawapannya akan terbaca sebagai jenama yang tidak kelihatan.

Pandangan Auspia: laporkan sebutan dan petikan sebagai dua garis berasingan, dan rekod sama ada permukaan itu mencari sebelum merekod apa-apa yang lain. Satu skor keterlihatan menyembunyikan tepat jurang yang memberitahu anda apa yang perlu dibaiki seterusnya, dan pembaikan termurah dalam data kami bukanlah menambah kandungan, tetapi memeriksa permukaan yang benar-benar memandang ke web.

Penulis: Adrian Cole

Terokai topik ini

Teruskan aliran pertumbuhan yang sama