Monitoring marki w AI: ile promptów naprawdę potrzebuje twoja lista

Najważniejsze wnioski

Przepuściliśmy te same 20 promptów przez trzy powierzchnie AI i śledziliśmy, skąd pochodzą źródła. Pięć promptów znalazło 31 procent wszechświata źródeł, dziesięć znalazło 54 procent, a dwudziesty wciąż dodał 14 nowych domen. Plateau nie nadeszło.

Każdy plan monitoringu marki w AI zaczyna się od listy promptów, a niemal każda taka lista powstaje z tego, w co zespół już wierzy. Dwadzieścia promptów brzmi rzetelnie. Pięćdziesiąt brzmi wyczerpująco. Nikt nie sprawdza, czy lista wciąż cokolwiek odkrywa.

We wrześniu 2026 roku przepuściliśmy dwadzieścia promptów przez trzy powierzchnie AI i śledziliśmy jedno: skąd pochodzą źródła. Nie wzmianki o naszej marce, ale cały zbiór domen, które przyciągnęły odpowiedzi. Jeśli lista promptów jest kompletna, dodawanie kolejnych powinno przestać znajdować nowe źródła. Tak się nie stało.

Co mierzyliśmy

Pozycja

Ustawienie

Prompty

20 pytań kupujących o narzędzia widoczności w AI

Powierzchnie

ChatGPT (gpt-5), Gemini 2.5 Flash, Perplexity (sonar), z włączonym wyszukiwaniem w sieci

Zebrane odpowiedzi

60

Znalezione różne źródła

432 domeny

Koszt jednego pełnego przebiegu

1 444 dolary

Powtarzalne pokrycie

5 promptów uruchomionych dwa razy tego samego dnia

Każdą z 60 odpowiedzi potraktowaliśmy jako jedną obserwację wszechświata źródeł i liczyliśmy różne domeny, a nie sloty cytowań. Gemini zwrócił 989 adnotacji źródeł w swoich 20 odpowiedziach, ale wiele z nich wskazywało tę samą stronę, więc uczciwą jednostką jest tu liczba domen. Dane na poziomie adnotacji są w analizie sprawdzacza widoczności w AI.

Wynik 1: lista nigdy się nie zamyka

Właśnie ta część decyduje o tym, jak zbudować program monitoringu. Po każdym promptcie dodawaliśmy jego nowe domeny do wszystkiego, co znaleziono wcześniej.

Uruchomione prompty

Znalezione różne źródła

Udział w sumie z 20 promptów

1

34

8 procent

3

91

21 procent

5

134

31 procent

10

235

54 procent

15

336

78 procent

20

432

100 procent

Ostatni prompt dodał 14 domen, których nie pokazał żaden wcześniejszy. Najmniejszy przyrost krańcowy w całych 20 promptach wyniósł 14, największy 34. W tym zakresie nie ma punktu, w którym kolejny prompt przestaje się zwracać, co oznacza, że lista promptów nie jest próbką, którą się uzupełnia, lecz próbką, którą się dalej losuje.

Wersja praktyczna: lista pięciu promptów napisana z pamięci pokrywa około jednej trzeciej tego, co pokrywa dwadzieścia. Na tym polega różnica między programem monitoringu, który zauważa zmianę kategorii, a programem, który co miesiąc raportuje te same pięć odpowiedzi.

Wykres słupkowy nowych źródeł dodanych przez każdy z 20 promptów, zaczyna się od 34 i kończy na 14, bez wypłaszczenia

Wynik 2: każda powierzchnia widzi inną trzecią część tej samej przestrzeni

432 domeny nie rozłożyły się równomiernie. Każda powierzchnia dotarła do innego wycinka tego samego zestawu pytań.

Powierzchnia

Różne źródła

Udział w 432

Mediana źródeł na odpowiedź

ChatGPT

47

11 procent

0

Gemini 2.5 Flash

184

43 procent

12

Perplexity

285

66 procent

19

Gemini i Perplexity razem znalazły 400 z 432 domen, czyli ChatGPT dodał 32 domeny, których nie pokazała żadna inna powierzchnia. W tych 12 promptach, w których ChatGPT nie szukał, ta powierzchnia nie wniosła zupełnie nic, i dlatego jej mediana wynosi zero.

Wniosek dla monitoringu jest niewygodny. Jeśli twoje narzędzie śledzi jedną powierzchnię, nie uruchamiasz pomniejszonej wersji programu z trzema powierzchniami. Raportujesz o innej populacji źródeł, a odpowiedź na pytanie „czy w tym miesiącu cytują nas częściej” może brzmieć po prostu „nic nie zmieniliśmy, zmieniła się powierzchnia”. Ten sam efekt zmierzyliśmy na poziomie odpowiedzi w rozrzucie przebiegów trackera widoczności w AI.

Wynik 3: dwie powierzchnie rzadko zgadzają się co do tego samego promptu

Porównaliśmy listy źródeł, które Gemini i Perplexity wygenerowały dla tego samego promptu, tego samego dnia, w tym samym języku.

  • Obie listy dzieliły średnio 2,5 domeny z około dwudziestu w każdej.
  • Średnie pokrycie Jaccarda wyniosło 0,089.
  • I tylko w 3 z 8 promptów, w których ChatGPT również zwrócił źródła, wszystkie trzy powierzchnie podzieliły choć jedną domenę, a największe potrójne pokrycie wyniosło 2 domeny.
  • Pełna zgodność wszystkich trzech powierzchni na jednym promptcie nie zdarzyła się ani razu.

Dwie odpowiedzi na to samo pytanie, zbudowane z niemal rozłącznych zbiorów stron. To najmocniejszy argument przeciw raportowaniu z jednej powierzchni, jaki znaleźliśmy, a zarazem dobra wiadomość: nowa strona ma znacznie więcej szans na podchwycenie, niż sugeruje pojedyncza lista źródeł.

Wynik 4: większość źródeł pojawia się raz

432 domeny rozkładają się skrajnie nierówno.

  • 324 z 432 domen, czyli 75 procent, pojawiły się dokładnie w jednej z 60 odpowiedzi.
  • Tylko 17 domen pojawiło się w 5 odpowiedziach lub więcej.
  • Powtarzający się rdzeń jest mały i przewidywalny: ahrefs.com w 16 odpowiedziach, semrush.com w 15, reddit.com w 14, potem frase.io z 9 i klaster po 6, obejmujący otterly.ai, tryprofound.com, llmpulse.ai, cognizo.ai i searchenginejournal.com.

To dzieli pracę monitoringową na pół i obie połowy chcą innego rytmu. Powtarzający się rdzeń to warstwa sprawdzana często, bo zmiana tam oznacza realną zmianę we wspólnym źródle. Ogon jednorazowych wystąpień to warstwa próbkowana, bo 75 procent wszechświata jest szumem, dopóki się nie powtórzy.

Wykres słupkowy pokazujący, że z 432 różnych źródeł 324 pojawiają się raz, 91 pojawia się od dwóch do czterech razy, a 17 pojawia się pięć razy lub więcej w 60 odpowiedziach

Co monitorować zamiast kompletnej listy

Warstwa

Co wchodzi

Rytm

Miesięczny koszt danych

Warstwa 1: powtarzający się rdzeń

17 powtarzających się domen plus twoja domena i trzech najbliższych konkurentów

Co tydzień na jednej powierzchni

0,48 dolara na Perplexity, 3,23 dolara na Gemini

Warstwa 2: panel promptów

Od 15 do 20 promptów obejmujących kategorię, porównanie, cenę i sformułowanie problemu

Co miesiąc na wszystkich trzech powierzchniach

1,44 dolara za przebieg

Warstwa 3: odkrywanie promptów

5 nowych promptów miesięcznie, pisanych z rozmów sprzedażowych i zgłoszeń do wsparcia

Przegląd kwartalny, potem awans albo odrzucenie

Wliczone w przebieg miesięczny

Z tego przebiegu wyszły trzy zasady.

  1. Zapisuj klasę promptu, nie tylko sam prompt. Nasza najszersza odpowiedź przyszła z promptu o tym, jak w ogóle zostać cytowanym, a nie z porównania narzędzi, a najwęższa właśnie z porównania. Klasy zachowują się różnie, a raportuje się klasę.
  2. Zachowaj powierzchnię w każdym zapisie. Liczba cytowań bez nazwy powierzchni nie jest porównywalna, bo długości list różnią się trzykrotnie.
  3. Rotuj prompty odkrywające. Dwadzieścia promptów znalazło 432 domeny, a krzywa mówi, że inne dwadzieścia znajdzie inne kilkaset. Awans i wycofanie to jedyny mechanizm, który utrzymuje panel w uczciwości.

Koszt nie jest tu ograniczeniem. Pełny przebieg dwudziestu promptów po trzech powierzchniach kosztował 1 444 dolary, więc miesięczny program to około 17 dolarów rocznie na dane, nie licząc czasu przeglądu. Ograniczeniem jest to, że czas przeglądu jest tą droższą połową, dlatego struktura warstw ważniejsza jest niż długość listy. Własna powierzchnia Google w ogóle nie wchodzi do tego panelu i wymaga innego przyrządu, co wyjaśnia nasz tracker AI Overview.

Ograniczenia

  • Jeden dzień, jedno miejsce, angielski, trzy powierzchnie, po jednej wersji modelu na każdą.
  • Liczenie domen usuwa powtórzenia wewnątrz odpowiedzi, więc strona cytowana pięć razy liczy się raz.
  • Klasy promptów przypisaliśmy sami, a nie według jakiejkolwiek zewnętrznej taksonomii.
  • Liczby kosztowe obejmują wyłącznie generowanie odpowiedzi.
  • Wkład ChatGPT jest zaniżony przez 12 promptów, w których nie szukał, a to właściwość tej powierzchni, nie zestawu promptów.

Częste pytania

Ile promptów potrzebuję do monitoringu marki w AI?

W naszych danych nie ma punktu ukończenia. Dwadzieścia promptów znalazło 432 źródła, a dwudziesty wciąż dodał 14 nowych. Wybierz rozmiar panelu, który możesz przeglądać co miesiąc, a wysiłek przeznacz na jakość promptów i rotację, nie na długość listy.

Monitorować jedną powierzchnię AI czy kilka?

Kilka, i raportować je osobno. Dwie najcięższe powierzchnie dzieliły średnio 2,5 źródła na prompt, a pełna potrójna zgodność nie zdarzyła się ani razu. Program z jedną powierzchnią mierzy tę powierzchnię, nie twoją kategorię.

Czy domena, która pojawiła się raz, jest warta śledzenia?

Tylko jako obserwacja. 324 z 432 domen pojawiły się raz, więc pojedyncze wystąpienie bliższe jest szumowi niż sygnałowi. Awansuj domenę do warstwy powtarzających się, gdy pojawi się w drugiej odpowiedzi, najlepiej na drugiej powierzchni.

Jak często uruchamiać panel?

Co miesiąc dla pełnego panelu, co tydzień dla powtarzającego się rdzenia. Lista powtarzających się jest dość krótka, by tygodniowy przebieg na jednej taniej powierzchni kosztował poniżej pięćdziesięciu centów miesięcznie, a nowe źródła wchodzą właśnie w przebiegu miesięcznym.

Spojrzenie Auspia: przestańcie ustalać rozmiar listy promptów po tym, jak rzetelnie się ją odczuwa, i zacznijcie mierzyć, kiedy przestaje cokolwiek znajdować. W naszych danych ten punkt nigdy nie nadszedł, co znaczy, że właściwą jednostką planowania są klasy promptów i rotacja, a nie jedna dłuższa lista. Podzielcie powtarzające się źródła na warstwy, próbkujcie ogon i trzymajcie nazwę powierzchni przy każdym raportowanym numerze.

Autor: Elena Shaw

Poznaj ten temat

Kontynuuj tę samą ścieżkę wzrostu