Verificatore di visibilità IA: quando il numero di citazioni e la risposta non concordano

Punti chiave

Gli stessi 20 prompt, tre superfici IA, un giorno. Gemini ha citato una mediana di 47 fonti per risposta, Perplexity 20, e ChatGPT non ha citato nulla su 12 dei 20 prompt limitandosi a nominare fornitori. Ecco i due segnali che un verificatore di visibilità deve tenere separati.

Due verificatori di visibilità nell'IA possono leggere le stesse risposte lo stesso giorno e arrivare a verdetti opposti. Uno restituisce un conteggio di citazioni, l'altro non restituisce nulla, perché la risposta ha nominato il tuo brand e l'ha consigliato senza mai collegarlo.

A settembre 2026 abbiamo eseguito venti prompt su tre superfici IA e abbiamo registrato, su ogni risposta, due segnali: il brand che la risposta ha nominato nel testo e il dominio che la risposta ha presentato come fonte. Non sono due angolazioni di una stessa misura. Divergono in punti prevedibili, e quei punti sono la parte più utile del rapporto.

La versione breve: Perplexity ha citato fonti su ogni prompt, Gemini ha restituito una mediana di 47 fonti per risposta e ChatGPT non ha restituito alcuna citazione su 12 dei 20 prompt, pur nominando fornitori su 13 di essi. La variabilità tra esecuzioni su una singola superficie è un'altra questione, e l'abbiamo misurata prima in variabilità di esecuzione del tracker di visibilità nell'IA.

Cosa abbiamo eseguito

Voce

Impostazione

Prompt

Venti domande che un acquirente porrebbe sugli strumenti di visibilità nell'IA

Superfici

ChatGPT (gpt-5-2025-08-07), Gemini (gemini-2.5-flash), Perplexity (sonar)

Ricerca web

Attiva su tutte e tre le superfici

Regione e lingua

Stati Uniti, inglese

Data

12 settembre 2026

Risposte raccolte

60

Costo dell'esecuzione completa

1,444 dollari, cioè 0,024 dollari per risposta

Ripetizione

Abbiamo rieseguito gli stessi cinque prompt per vedere se il comportamento è stabile

Il costo per risposta è andato da 0,006 dollari su Perplexity a 0,037 dollari su Gemini. La superficie meno cara ha prodotto la lista di fonti più coerente, e quella più cara non è stata quella che ha restituito più fonti.

I due segnali, misurati separatamente

Abbiamo catturato ogni risposta due volte: una come testo e una come la lista di fonti che la superficie ha allegato a quel testo.

Superficie

Annotazioni di fonte

Per risposta

Risposte senza citazioni

Domini distinti per risposta

ChatGPT (gpt-5)

90

da 0 a 18, mediana 0

12 su 20

da 0 a 10

Gemini 2.5 Flash

989

da 14 a 122, mediana 47

0 su 20

da 3 a 23

Perplexity

399

da 19 a 20

0 su 20

da 16 a 20

Queste tre liste non sono lo stesso tipo di oggetto, ed è qui che il verificatore sbaglia per primo.

Grafico a barre che mostra la mediana del numero di fonti allegate a una singola risposta: sui rispettivi venti prompt, ChatGPT sta a 0, Gemini a 47 e Perplexity a 20

Gemini allega una fonte a quasi ogni affermazione. La stessa pagina può occupare molti slot dentro una sola risposta, ed è per questo che i numeri sono così alti: su 20 risposte di Gemini, semrush.com ha occupato 44 slot, maxaeo.ai ventisei, google.com ventidue, adobe.com ventuno e medium.com venti. L'elevato numero di annotazioni su questa superficie dice quanto finemente il modello scomponga il materiale, non quanto sia conosciuto il tuo brand.

Perplexity, invece, espone un pannello con un tetto. Ha restituito esattamente venti fonti in 19 dei 20 prompt e diciannove nel ventesimo. Questo fissa il denominatore: la tua quota in una risposta di Perplexity è sempre una quota su venti, quindi conquistare uno slot significa che qualcuno ha perso uno slot altrove.

ChatGPT restituisce una lista di fonti solo quando ha cercato. Ha emesso una query di ricerca in 8 dei 20 prompt e non ha citato nulla negli altri dodici. In quei dodici ha comunque risposto alla domanda e ha comunque nominato strumenti. Un esempio non editato: alla domanda sui migliori strumenti per monitorare le menzioni di brand nei risultati di ricerca IA, ha elencato Brand24, Mention, BuzzSumo, Talkwalker e Google Alerts, senza alcuna fonte allegata a nessuno di essi. La checklist che usiamo per verificare le risposte di ChatGPT rispetto a questa modalità di guasto è in checklist di visibilità su ChatGPT.

Nominato senza essere citato

Poi abbiamo contato, per 27 brand e testate, in quante delle 60 risposte il brand è stato nominato nel testo e in quante è stato citato il suo dominio come fonte. Le due colonne divergono in entrambe le direzioni insieme.

Brand

Risposte che l'hanno nominato

Risposte che hanno citato il suo dominio

Semrush

18

15

Reddit

16

14

Otterly

14

6

Ahrefs

13

16

Profound

11

6

Peec AI

11

2

Frase

5

9

HubSpot

5

8

ZipTie

5

0

Siftly

4

5

Keyword.com

4

5

Nightwatch

3

4

LLM Pulse

2

6

Cognizo

1

6

MaxAEO

1

7

Searchable

1

5

AirOps

0

5

Menra

0

4

In questa tabella ci sono due schemi. Peec AI, Otterly, Profound e ZipTie vengono consigliati nelle risposte molto più spesso di quanto vengano collegati i loro siti. MaxAEO, Cognizo, LLM Pulse, Searchable, AirOps e Menra sono l'opposto: le loro pagine vengono trascinate dentro come fonti mentre la risposta non nomina mai l'azienda. Un verificatore che guarda solo i link giudica il secondo gruppo visibile e il primo invisibile. Un verificatore che guarda solo le menzioni fa il contrario.

Grafico a barre raggruppate che confronta la frequenza con cui cinque brand sono stati nominati nelle risposte IA e la frequenza con cui i loro domini sono stati citati come fonte, su 60 risposte

Su tutte le 60 risposte, le tre superfici insieme hanno citato 432 domini distinti. ChatGPT ne copre 47, cioè 11 per cento, Gemini 184 (43 per cento) e Perplexity 285 (66 per cento). Qualunque superficie tu verifichi, stai guardando un campione di un universo di fonti molto più grande. Questo non include la superficie di Google stessa, dove la presenza si misura in un altro modo e lo spieghiamo nel tracker di AI Overview.

Cosa deve registrare un verificatore

Un verificatore di visibilità che restituisce un solo numero sta buttando via tre dei suoi quattro campi. Questi sono i quattro che vale la pena tenere.

Campo

Forma di registrazione

Perché cambia il verdetto

Se la superficie ha cercato

sì o no

Una risposta che non ha cercato non può produrre citazioni, quindi il suo zero non è un segnale di visibilità

Se il brand è stato nominato nel testo della risposta

numero di risposte

L'unico segnale che sopravvive su una risposta senza fondamento

Se il dominio è nella lista delle fonti

numero di risposte

Il segnale che la maggior parte degli strumenti riporta da solo

Il denominatore

numero di risposte e numero di slot fonte per risposta

Un pannello con venti slot fissi e una lista con 47 annotazioni non si confrontano come percentuali

La conseguenza pratica è lo zero falso. Nei nostri dati, 13 delle 20 risposte di ChatGPT hanno nominato almeno un fornitore, mentre solo 8 su 20 hanno citato qualcosa, quindi circa un quarto delle risposte di questa superficie riporterà zero citazioni per un brand che quella stessa risposta ha nominato e consigliato.

Come farlo senza ingannare te stesso

La modalità di guasto quando affidi questo lavoro a un agente non è un numero sbagliato, ma un numero sicuro di sé calcolato da un campo che non è mai stato raccolto.

  • Cattura il payload grezzo prima di calcolare qualsiasi cosa. Conserva il testo della risposta, la lista delle fonti, l'identificatore del modello e un valore booleano che dica se è stata emessa una query di ricerca. Le metriche derivate si costruiscono nel codice in una seconda fase, non si mettono dentro il prompt di raccolta.
  • Fai citare l'agente invece di fargli riassumere. Un criterio del tipo «riporta quante volte è comparso il brand» produce prosa. Un criterio del tipo «restituisci letteralmente il testo della risposta e la lista delle fonti» produce dati che puoi ricontrollare.
  • Riesegui lo stesso prompt prima di credere a un cambiamento. Abbiamo ripetuto cinque prompt e la decisione di cercare coincideva in 5 casi su 5, quindi un balzo improvviso nel numero di citazioni è più probabilmente una versione del modello o una modifica del prompt che rumore.
  • Tieni l'identificatore del modello su ogni riga. Gli stessi venti prompt sullo stesso endpoint via gpt-4o hanno restituito annotazioni di fonte solo in 2 casi su 20, contro 8 su 20 con gpt-5.
  • Prevedi un budget. L'esecuzione completa di 60 risposte è costata 1,444 dollari, quindi a questi prezzi una versione settimanale della stessa verifica sta intorno ai 6 dollari al mese.

Limiti

  • Un giorno, una regione, l'inglese, tre superfici. Le risposte cambiano da regione a regione.
  • Una versione di modello per superficie. Anche nelle nostre esecuzioni il comportamento si è spostato tra versioni di modello.
  • Il rilevamento dei brand è una corrispondenza di stringhe sul nome, quindi un brand consigliato solo con il nome del prodotto può sfuggire.
  • La ricerca web è stata attivata via API. Le app per consumatori possono cercare più di queste esecuzioni, o meno.
  • Il costo copre solo la generazione delle risposte e non include il tempo di archiviazione o revisione.

Domande frequenti

Perché ChatGPT ha riportato zero citazioni in 12 dei 20 prompt?

Perché ha risposto a quei prompt senza cercare. Un modello che non recupera mai una pagina non può citarla. Quello zero descrive quindi l'esecuzione, non il tuo brand. Prima di leggere un numero di citazioni da qualsiasi superficie di chat, verifica prima se quella superficie ha usato il web.

Su una risposta senza fondamento è tutto il segnale, ed è anche il segnale che arriva prima del link. Nei nostri dati menzione e link si ottengono da fonti diverse: la menzione segue i contenuti comparativi e di recensione, la citazione segue le pagine strutturate per essere citate.

Dovrei fondere menzioni e citazioni in un unico punteggio di visibilità?

No. Come mostra la tabella dei brand, divergono sistematicamente in entrambe le direzioni, e un punteggio fuso nasconde quale dei due si è mosso. Riportali come due linee e lascia che il lettore veda lo scarto.

Quale superficie dovrei verificare per prima?

Se vuoi un pannello stabile, economico e a larghezza fissa, scegli Perplexity, perché la lunghezza della sua lista non cambia. Se vuoi ampiezza, scegli Gemini, che ha raggiunto 184 dei 432 domini che abbiamo visto. ChatGPT solo con un controllo di plausibilità accanto, altrimenti un quinto delle sue risposte si leggerà come brand invisibile.

Vista Auspia: riporta menzioni e citazioni come due linee separate e registra se la superficie ha cercato prima di registrare qualunque altra cosa. Un punteggio unico di visibilità nasconde esattamente lo scarto che ti dice cosa sistemare dopo, e la correzione più economica nei nostri dati non è stata aggiungere contenuti, ma verificare una superficie che ha davvero guardato il web.

Scritto da: Adrian Cole

Esplora questo argomento

Continua sullo stesso percorso di crescita