Tracker widoczności w AI: sześć identycznych promptów zwróciło 18 różnych źródeł

Najważniejsze wnioski

Wysłaliśmy ten sam prompt sześć razy: 18 cytowanych adresów URL i żadne źródło zacytowane we wszystkich sześciu uruchomieniach. Zmierzyliśmy zmienność między uruchomieniami i omawiamy cztery pola, które tracker widoczności musi przechowywać.

Tracker widoczności w AI brzmi prosto. Zadajesz asystentowi kilka pytań kategorii, notujesz, czy Twoja marka się pojawiła, i rysujesz to w czasie.

Problem leży wyżej w łańcuchu, przed zapisem. To, co mierzysz, nie stoi w miejscu. Wyślij ten sam prompt do tego samego modelu dwa razy, a dostaniesz dwie odpowiedzi, które pokrywają się tylko częściowo. Zapiszesz jedną z nich i zapisałeś jedną próbkę z rozkładu, a potem przedstawiłeś ją jako fakt.

Chcieliśmy wiedzieć, jak duże jest to rozproszenie w rzeczywistości, więc przeprowadziliśmy eksperyment, zamiast go zakładać. Krótka wersja: sześć identycznych żądań dało osiemnaście cytowanych źródeł i żadne źródło nie zostało zacytowane we wszystkich sześciu.

Ten artykuł dotyczy tego, co uruchomiliśmy, co wróciło, oraz czterech pól, które tracker widoczności w AI musi przechowywać, żeby liczba była warta spojrzenia również w przyszłym miesiącu.

Co uruchomiliśmy

Dwa eksperymenty, oba na promptach, których zespół SaaS naprawdę użyłby w badaniu kategorii.

Eksperyment 1: jeden prompt, jeden model, sześć uruchomień. Model gpt-4o, wyszukiwanie w sieci włączone, Stany Zjednoczone, angielski. Prompt: „Jakie są najlepsze narzędzia do śledzenia pozycji dla małego zespołu SaaS w 2026 roku? Podaj krótką listę ze źródłami." Sześć osobnych wywołań na żywo, wykonanych po kolei w tym samym oknie sesji.

Eksperyment 2: dwa modele, ten sam prompt, po trzy uruchomienia. Ten sam prompt trafił do Claude Sonnet 5 i do Gemini 3.8 Flash, po trzy razy do każdego, bez wyszukiwania w sieci. Bez wyszukiwania mierzymy, jakie produkty model wymienia z własnej wiedzy, a to osobny sygnał od tego, jakie źródła cytuje.

Wysłaliśmy też drugi prompt tą samą ścieżką wyszukiwania cztery razy, żeby sprawdzić, czy zachowanie cytowania jest spójne między typami pytań: „Jak śledzić AI Overviews dla swojej strony? Podaj konkretne metody ze źródłami."

Sześć uruchomień to nie duża próbka i traktujemy ją tak, jak na to zasługuje. Wystarczy, żeby pokazać kierunek i przybliżony rząd wielkości zmienności, i o to chodzi.

Wynik 1: osiemnaście źródeł, zero wspólnych dla wszystkich sześciu uruchomień

Sześć uruchomień z wyszukiwaniem zacytowało łącznie 18 różnych adresów URL. Oto, jak często pojawiała się każda domena.

Liczba cytowań (z 6 uruchomień)

Domeny

5

cloro.dev

3

scalegrowth.digital, techradar.com

2

thesharpdigital.com, piperocket.digital, digiinte.com, tajo.io, gtm.help, softwaresift.com

1

impressivemagazine.com, theguidex.com, gtmonly.com, honeyb.ai, seo.com, blog.contentforce.ai, crowdreply.io, seomonster.ai, rankpy.com

Żadna domena nie została zacytowana we wszystkich sześciu uruchomieniach. Żaden adres URL nie został zacytowany we wszystkich sześciu uruchomieniach.

Liczba, która ma tu znaczenie, to pokrycie między uruchomieniami. Porównując każdą parę uruchomień, średnie pokrycie Jaccarda na cytowanych adresach URL wyniosło 0,167. W dwóch z piętnastu par pokrycie było dokładnie zerowe, to znaczy, że te dwie odpowiedzi nie podzieliły ani jednego źródła.

Wykres słupkowy pokazujący, w ilu z sześciu uruchomień tego samego promptu zacytowano każdą domenę źródłową, z maksimum pięć na sześć i żadną domeną, która osiągnęła sześć na sześć

Źródło zacytowane w pięciu z sześciu uruchomień to pułap, który zaobserwowaliśmy. Nic nie było cytowane za każdym razem.

W tej tabeli zakopane jest drugie odkrycie. Domeny, po które model sięgnął, w większości nie są znanymi w tej kategorii serwisami porównawczymi. Dziewięć z osiemnastu domen pojawiło się dokładnie raz, a część z nich to małe serwisy, których treść czyta się jak coś złożonego pod to zapytanie, a nie jak owoc pracy dziennikarskiej. Dla marki to broń obosieczna. Oznacza, że miejsce w cytowaniu łatwiej zdobyć niż pozycję w tradycyjnym rankingu „najlepszych narzędzi". Oznacza też, że miejsce zajmuje ten, kto wyprodukował stronę pasującą do formy zapytania w tamtym uruchomieniu, i że w następnym uruchomieniu zostanie ono zapełnione od nowa.

Wynik 2: sama odpowiedź zmienia rozmiar

Cytowania się ruszały, a długość odpowiedzi ruszała się razem z nimi.

Uruchomienie

Tokeny wyjściowe

Długość odpowiedzi

Koszt uruchomienia

1

505

2 153 znaki

$0,0735

2

860

3 728 znaków

$0,0770

3

1 108

4 746 znaków

$0,0797

4

832

3 555 znaków

$0,0765

5

870

3 547 znaków

$0,0772

6

813

3 544 znaki

$0,0768

Długość wyjścia wahała się od 505 do 1 108 tokenów, rozstęp 603 tokeny, około 73 procent średniej. Najdłuższa odpowiedź była ponad dwukrotnie dłuższa od najkrótszej. Pięć z sześciu uruchomień wpadło w dość wąskie pasmo między 813 a 1 108 tokenów; jedno uruchomienie zatrzymało się wcześnie na 505 i zacytowało pięć źródeł zamiast dziewięciu do czternastu.

Dla pomiaru ma to konkretne znaczenie. Jeśli Twój tracker wychwytuje „czy marka pojawia się w odpowiedzi i na której pozycji", to krótkie uruchomienie ma mniej miejsc, w których można się pojawić. Zespół, który próbkuje raz w tygodniu i przypadkiem trafił na krótkie uruchomienie, zapisze gorszy wynik niż zespół, który trafił na długie uruchomienie, choć na stronie nic się nie zmieniło.

Wynik 3: niektóre prompty nie dostają żadnych cytowań

Drugi prompt, o śledzeniu AI Overviews, przeszedł tą samą ścieżką wyszukiwania cztery razy i wrócił z zerem cytowań za każdym razem.

Uruchomienie

Tokeny wyjściowe

Długość odpowiedzi

Cytowania

1

479

2 135 znaków

0

2

522

2 240 znaków

0

3

534

2 312 znaków

0

4

497

2 228 znaków

0

Odpowiedzi były stabilne pod względem długości, zmieniały się tylko o 8 procent przez cztery uruchomienia. Ale model odpowiadał z własnej wiedzy i nie wymienił żadnego źródła, więc w kolumnie cytowań nie było czego zapisać.

Z tego wynika konkretny i mylący odczyt trackera. Panel wskaźnika cytowań pokaże dla tego pytania zero i wygląda to jak porażka widoczności. Nie jest. To forma pytania, która nie wyzwala poszukiwania źródeł. Prawidłowy odczyt to „cytowanie nie dotyczy", a tracker, który nie umie odróżnić tego od „sprawdzono cytowanie i byłaś nieobecna", wyśle Cię w pogoń za problemem, którego nie ma.

Wynik 4: zmiana modelu to inny pomiar, nie powtórzenie

Z wyłączonym wyszukiwaniem zmierzyliśmy, jakie produkty wymienia każdy model. To izoluje własny zbiór rekomendacji modelu od wszystkiego, co zwrócił indeks wyszukiwania w tej minucie.

Claude Sonnet 5 wymieniał od czterech do pięciu produktów na uruchomienie. Przez trzy uruchomienia wymienił sześć różnych produktów: AccuRanker, Ahrefs, SEMrush, SE Ranking, Serpstat i SerpWatcher. Trzy z nich pojawiły się we wszystkich trzech uruchomieniach: AccuRanker, Ahrefs i SEMrush. Średnie pokrycie parami 0,587.

Gemini 3.8 Flash wymieniał od dwóch do pięciu produktów na uruchomienie. Przez trzy uruchomienia wymienił siedem różnych produktów: AccuRanker, Ahrefs, Looker Studio, Nightwatch, SE Ranking, SEMrush i Wincher. Tylko jeden z nich, SE Ranking, pojawił się we wszystkich trzech uruchomieniach. Średnie pokrycie parami 0,306.

Między dwoma modelami cztery produkty zostały wymienione przez oba, a pięć tylko przez jeden.

Tabela porównująca po trzy uruchomienia dla każdego modelu, pokazująca wymienione produkty, powtarzające się rekomendacje i pokrycie parami między uruchomieniami

To samo pytanie daje częściowo inny zbiór rekomendacji na każdym modelu i w każdym uruchomieniu.

Praktyczny wniosek: jeśli śledzisz „widoczność w AI" jako jedną liczbę, uśredniasz co najmniej dwa niezależne źródła zmienności, czyli uruchomienie i model. Marka, która pojawia się stabilnie u jednego asystenta, a u innego nie, to prawdziwe i dające się wykorzystać odkrycie. Marka, której pomiar z jednej próbki przesunął się o dwie pozycje, to szum.

Co powinien rejestrować tracker widoczności w AI

Cztery pola zamieniają zrzut ekranu w pomiar.

Liczba uruchomień, nie wynik uruchomienia. Przechowuj każde uruchomienie i raportuj zakres. „Zacytowany w 4 z 6 uruchomień" to fakt. „Zacytowany, pozycja 3" to przypadek. Sześć uruchomień to rozsądne minimum dla małego programu; dwanaście jest lepsze, jeśli prompt ma znaczenie komercyjne.

Pole cytowania osobno od pola wzmianki. „Model nas polecił" i „model podlinkował do nas" to dwa różne wyniki z różnymi sposobami naprawy. Nasze sześć uruchomień dało 18 cytowań z 18 różnych adresów URL; tracker rejestrujący tylko wzmianki o marce nie wychwyciłby z tej huśtawki niczego.

Stan kanału odpowiedzi. Rejestruj, czy uruchomienie w ogóle korzystało z wyszukiwania, i rejestruj długość odpowiedzi. Uruchomienie z zerem cytowań i uruchomienie z zerem wzmianek wyglądają na panelu identycznie i znaczą coś przeciwnego.

Treść promptu słowo w słowo, z numerem wersji. Sformułowanie promptu decyduje o tym, które źródła zostaną podciągnięte. Jeśli prompt zmienia się między miesiącami, linia trendu się urywa. Wersjonuj prompt tak, jak wersjonujesz skrypt śledzący.

Budowanie pętli uruchomień

Ręczna weryfikacja nie przetrwa jednego spotkania z kalendarzem. Pętla to skrypt, który uruchamia prompt N razy, zapisuje każdą surową odpowiedź wraz z jej cytowaniami i porównuje bieżące okno z poprzednim.

To dobrze pasuje do agenta, bo praca jest powtarzalna, ograniczona regułami i wymaga pisemnego rejestru. W Claude Code albo Codex użyteczna instrukcja brzmi: zostawiaj surowe uruchomienia na dysku i nigdy ich nie nadpisuj, a potem raportuj tabelę podsumowującą zamiast jednej liczby. Jeśli już pobierasz dane Search Console i Bing przez serwery MCP, ta sama sesja może trzymać dziennik cytowań obok danych o wyświetleniach, i tam właśnie obie liczby zaczynają być przydatne razem. Nasze notatki o tym, co te serwery ujawniają, są w co naprawdę robią cztery serwery SEO MCP, a strona obecności tego samego problemu jest w naszym zrzucie AI Overview na czterdzieści zapytań.

Jedna zasada projektowa jest ważniejsza od pozostałych: wyjście trackera powinno być rozkładem. Raportuj „zacytowany w 4 z 6", a nie „zacytowany". Raportuj listę źródeł, a nie źródło numer jeden. Każdy panel, który ściska sześć uruchomień w jedną liczbę, wyrzucił jedyną informację, jaką kupiły dodatkowe uruchomienia.

Jeśli celem jest porównanie z konkurencją, a nie monitoring, lepszym narzędziem jest pętla śledzenia pozycji w czasie, a kompromisy między źródłami danych są w jak zbudować tracker pozycji z dwóch źródeł.

Granice próbki sześciu uruchomień

Trzy uczciwe zastrzeżenia.

Próbka jest mała. Sześć uruchomień Zakreśla rozproszenie tylko z grubsza. Ustala, że pokrycie między uruchomieniami jest częściowe i że pary o zerowym pokryciu się zdarzają; nie daje przedziału ufności dla Twojej kategorii.

Wyniki są związane z czasem. Te uruchomienia wykonano 12 września 2026 roku na modelach działających na żywo. Zmieniają się i modele, i wyniki wyszukiwania pod nimi.

Cytowane domeny to próbka z jednego komercyjnego promptu. Inna forma pytania, na przykład pytanie porównawcze albo pytanie „jak zrobić", da inny wzorzec cytowań. Użytecznym ruchem jest uruchomienie tego samego projektu na dziesięciu Twoich najważniejszych komercyjnie promptach i zapisanie, jak zachowuje się Twoja kategoria.

Najczęstsze pytania

Ile uruchomień potrzebuję, zanim liczba widoczności w AI zacznie coś znaczyć? Sześć to praktyczne minimum dla jednego promptu, a liczbę należy raportować jako zliczenie z liczby uruchomień, nie jako pozycję. Jeśli prompt steruje decyzjami o przychodzie, dwanaście uruchomień da ciaśniejszy odczyt za kilka dolarów.

Czy to znaczy, że śledzenie widoczności w AI nie jest warte zachodu? To znaczy, że śledzenie z jednej próbki nie jest warte zachodu. Odkryciem jest sama zmienność. Tracker, który raportuje „zacytowany w 4 z 6 uruchomień, źródła zmieniły się o 12 domen od zeszłego miesiąca", opisuje realny system, w którym ściga się konkurent.

Dlaczego jeden prompt wrócił z zerem cytowań? Model odpowiedział z własnej wiedzy, zamiast szukać źródeł. To właściwość pytania, nie porażka Twojej strony. Śledź to jako nie dotyczy, a nie jako zero.

Czy śledzić ChatGPT, Claude i Gemini osobno? Tak. W naszym porównaniu na trzech uruchomieniach oba modele pokryły się tylko w czterech z dziewięciu wymienionych produktów. Uśrednianie ukrywa decyzję na poziomie programu o tym, którego asystenta optymalizować najpierw.

Czy da się zmniejszyć zmienność, obniżając temperaturę modelu? Częściowo, i warto to sprawdzić na własnych promptach. Ale na zbiór cytowań wpływa też indeks wyszukiwania, a tego nie kontrolujesz. Liczba uruchomień to pewniejsza dźwignia.

Spojrzenie Auspia: jeśli w tym kwartale budujesz śledzenie widoczności w AI, zbuduj najpierw dziennik uruchomień, a potem panel. Panel to wybór sposobu prezentacji. Dziennik uruchomień to pomiar. Zacznij od dziesięciu promptów, po sześć uruchomień każdy, przechowywanych słowo w słowo, a w tydzień dowiesz się więcej, niż powiedziałby Ci cały rok weryfikacji z jednej próbki.

Autor: Ethan Marlowe, kierowanie pomiarem GEO na ponad 500 promptach w Auspia. Pisze o śledzeniu promptów, raportach cytowań i panelach widoczności, które wytrzymują spotkanie z realnym cyklem pomiarowym.

Poznaj ten temat

Kontynuuj tę samą ścieżkę wzrostu