Przez 30 dni trzymaliśmy Ahrefs Brand Radar i Semrush AI Toolkit podpięte do tej samej domeny, w tym samym oknie czasowym, z tą samą listą fraz. Założenie było proste: jeśli oba mierzą widoczność tej samej strony w odpowiedziach modeli językowych, powinny pokazywać mniej więcej to samo. Nie pokazały. Różnice sięgały kilkudziesięciu procent, a w niektórych tygodniach narzędzia nie zgadzały się nawet co do kierunku trendu.
Poniżej: warunki testu, miejsca w których liczby się pokrywają, miejsca w których się rozjeżdżają, i co z tego wynika przy wyborze narzędzia do stałego raportowania.
Warunki testu i badana domena
Testowaliśmy na średniej wielkości domenie B2B z branży usługowej: około 280 artykułów, ruch organiczny w okolicach 14 tysięcy sesji miesięcznie, marka rozpoznawalna w niszy, ale bez obecności w mediach ogólnopolskich. To celowy wybór. Na dużej marce konsumenckiej oba narzędzia zbierają tyle sygnałów, że różnice metodologiczne toną w wolumenie. Na małej domenie widać je gołym okiem.
Parametry testu:
- okres: 30 pełnych dni, bez zmian w treści poza normalnym harmonogramem (6 nowych wpisów)
- lista monitorowanych fraz: 40 zapytań, identyczna w obu narzędziach, w tym 12 brandowych i 28 generycznych
- rynek: Polska, język polski, dodatkowo kontrolna próbka 8 fraz w języku angielskim
- brak jakichkolwiek działań link buildingowych i PR w trakcie okna pomiarowego
Metodologię zbierania danych opisaliśmy szerzej w case AIO z 30 dni testów pod ChatGPT, gdzie mierzyliśmy to samo zjawisko ręcznie. Ten test jest jego kontynuacją: sprawdzamy, na ile komercyjne platformy odtwarzają obraz składany wcześniej z własnych odpytań.
Zakres danych w obu narzędziach
Pierwsza rzecz, która tłumaczy część rozbieżności: narzędzia nie patrzą na te same silniki i nie odpytują ich z tą samą częstotliwością.
| Wymiar | Ahrefs Brand Radar | Semrush AI Toolkit |
|---|---|---|
| Pokrywane silniki | ChatGPT, Perplexity, Google AI Overviews, Gemini | ChatGPT, Perplexity, Google AI Overviews, Gemini, Copilot |
| Częstotliwość odpytań | dzienna dla fraz priorytetowych, tygodniowa dla reszty | dzienna dla całej listy w wyższych planach |
| Jednostka raportowania | wzmianka marki i osobno cytowanie z linkiem | wzmianka, cytowanie i udział głosu w jednym wskaźniku |
| Historia wstecz | dostępna od momentu dodania domeny | częściowo odtwarzana z własnego archiwum |
| Dane o konkurencji | do 5 domen w standardowym widoku | do 10 domen, z podziałem na silniki |
Sama różnica w liczbie silników generuje rozjazd: Semrush dokłada Copilota, odpowiedzialnego w naszej próbce za około 9 procent wykrytych cytowań. Gdyby to była jedyna przyczyna, wystarczyłoby odjąć ten udział i liczby by się zgodziły. Nie zgodziły się.
Co dokładnie liczy się jako cytowanie
Ahrefs rozdziela dwa zdarzenia: wymienienie nazwy marki w treści odpowiedzi oraz podanie linku do domeny w sekcji źródeł. Semrush domyślnie łączy je w jeden wskaźnik widoczności. To samo w sobie wystarczy, żeby dwa dashboardy pokazały różne liczby za ten sam miesiąc.
Cytowania: gdzie liczby się zgadzają
Zgodność była najwyższa tam, gdzie sygnał był najmocniejszy. Dla 12 fraz brandowych oba narzędzia raportowały obecność domeny w 11 przypadkach. Jedyna rozbieżność: zapytanie, przy którym model odpowiadał opisowo, bez źródeł, co Ahrefs zaliczył jako wzmiankę, a Semrush nie.
Dobrze zgadzały się też przypadki skrajne w drugą stronę. Spośród 28 fraz generycznych obie platformy zgodnie wskazały 9 jako całkowicie poza zasięgiem przez cały miesiąc. To użyteczna zgodność: te tematy można bez wahania odpisać z planu optymalizacji albo potraktować jako lukę do zapełnienia nową treścią.
Trzeci obszar zgody: kierunek trendu w skali całego miesiąca. Oba narzędzia pokazały wzrost ogólnej widoczności, odpowiednio o 22 i 31 procent. Wartości inne, ale wniosek biznesowy ten sam.
Gdzie dane się rozjeżdżają i dlaczego
Problemy zaczynają się w środku rozkładu, czyli tam, gdzie podejmuje się decyzje. Dla 19 fraz generycznych, przy których domena pojawiała się niesystematycznie, różnice w raportowanej liczbie cytowań wynosiły od 18 do 64 procent. W trzech tygodniach z czterech narzędzia pokazały przeciwny kierunek tygodniowej zmiany tej samej frazy.
Rozjazdy udało się przypisać do czterech przyczyn:
- Moment odpytania. Modele nie odpowiadają deterministycznie. Dwa zapytania o tej samej treści, zadane w odstępie kilku godzin, potrafią zwrócić inny zestaw źródeł. Narzędzie odpytujące rano i narzędzie odpytujące wieczorem mierzą de facto dwie różne próbki.
- Normalizacja wariantów frazy. Semrush agreguje bliskie warianty zapytania pod jedną pozycją, Ahrefs trzyma je osobno. Przy frazach z odmianą fleksyjną, czyli w polskim przy większości, daje to systematycznie wyższe liczby po stronie Semrusha.
- Traktowanie odpowiedzi bez źródeł. Opisane wyżej: wzmianka bez linku to dla jednego narzędzia sukces, dla drugiego zdarzenie nieliczone.
- Lokalizacja odpytania. W kontrolnej próbce angielskiej rozbieżności spadły do 11 procent. To sugeruje, że część różnicy bierze się z tego, jak każda platforma obsługuje rynek polski: z jakiego regionu wychodzi zapytanie i czy wymusza język odpowiedzi.
Ostatni punkt jest wart podkreślenia, bo bywa pomijany. Jeśli porównujesz wyniki narzędzia z własnymi obserwacjami, a pytasz model z polskiego IP po polsku, to nie masz gwarancji, że narzędzie robi to samo. Ta sama ostrożność obowiązuje przy ocenie pokrycia tematycznego: punkt odniesienia musi być jeden, co rozwijamy w tekście o tym, jak liczyć topical authority i uzupełniać luki.
Czy któreś z narzędzi jest bliżej prawdy
Sprawdziliśmy to ręcznie na próbce 15 fraz: cztery silniki, trzy odpytania dziennie przez pięć dni, czyli 900 zapytań. Żadne z narzędzi nie było systematycznie bliżej naszego pomiaru. Ahrefs częściej zaniżał (średnio o 14 procent), Semrush zawyżał (o 19 procent), a nasza ręczna próbka sama miała znaczną wariancję między dniami.
Wniosek praktyczny: traktowanie którejkolwiek z tych liczb jako wartości bezwzględnej jest błędem. Obie działają jako wskaźnik kierunku i punkt odniesienia do samych siebie w czasie, pod warunkiem że nie zmieniasz narzędzia w trakcie.
Wygoda pracy i raportowanie dla klienta
Tu różnice są wyraźniejsze niż w danych i łatwiejsze do oceny.
Brand Radar jest szybszy w codziennym użyciu: widok płaski, filtry działają od razu, droga od ogólnego wykresu do konkretnej odpowiedzi modelu to dwa kliknięcia. W ekosystemie Ahrefsa dane o widoczności w AI siedzą obok linków i pozycji, więc nie przełączasz kontekstu.
AI Toolkit jest bogatszy, ale cięższy: więcej przekrojów, podział na silniki w każdym widoku, porównanie do dziesięciu konkurentów. Kosztem jest to, że dotarcie do konkretnej odpowiedzi modelu wymaga więcej ekranów. Przy raporcie miesięcznym to zaleta, przy codziennej diagnostyce przeszkoda.
Eksport: oba oddają CSV, oba mają API w wyższych planach. Semrush ma gotowy konektor do Looker Studio, Ahrefs wymaga własnej warstwy pośredniej. Przy zautomatyzowanym raportowaniu klienckim ta jedna różnica potrafi przeważyć wybór.
Koszt kontra realna wartość
Żadne z narzędzi nie jest dodatkiem gratis do abonamentu: moduł AI jest wyceniany osobno albo wymaga wyższego planu, a cenniki zmieniają się na tyle często, że podawanie kwot nie ma sensu. Policz inaczej: ile fraz realnie monitorujesz i ile decyzji podejmujesz na tych danych w miesiącu.
Przy 40 frazach i jednym raporcie miesięcznie koszt na decyzję jest wysoki w obu. Przy 300 frazach i cotygodniowej optymalizacji zaczyna się bronić, ale wtedy wygrywa narzędzie z lepszym API, bo ręczne przeklikiwanie przestaje być wykonalne.
Jest też opcja trzecia, o której łatwo zapomnieć: własny skrypt odpytujący modele przez API i zapisujący odpowiedzi. Daje pełną kontrolę nad lokalizacją, częstotliwością i definicją cytowania, czyli nad wszystkimi czterema źródłami rozjazdu opisanymi wyżej. Kosztuje czas na utrzymanie, ale przy dużej liczbie fraz bywa tańszy niż abonament. Szerszy przegląd dostępnych opcji, razem z narzędziami spoza wielkiej dwójki, zebraliśmy w porównaniu narzędzi do widoczności AI.
Które wybrać przy jakim budżecie
Nasze rekomendacje po tym teście, uporządkowane według sytuacji:
- Masz już Ahrefsa i monitorujesz do 100 fraz. Zostań przy Brand Radarze. Dołożenie Semrusha nie uzasadnia drugiego abonamentu, a dane i tak nie będą porównywalne.
- Prowadzisz raportowanie dla kilku klientów naraz. AI Toolkit, głównie za konektor do Looker Studio i podział na silniki. Oszczędność czasu przy raportach zwraca różnicę w cenie.
- Interesuje cię wyłącznie Google AI Overviews. Żadne z nich w pierwszej kolejności: da się to monitorować taniej, a tutaj dopłacasz za silniki, których nie używasz.
- Masz zespół techniczny i ponad 300 fraz. Rozważ własny zbieracz danych na API modeli, z jednym z narzędzi jako kontrolą, nie jedynym źródłem prawdy.
Niezależnie od wyboru obowiązuje jedna zasada: trzymaj się jednego narzędzia przez cały okres porównawczy. Zmiana platformy w środku kwartału unieważnia szereg czasowy, bo zmieniasz nie tylko dostawcę, ale i definicję mierzonego zjawiska. O warunkach, na jakich treść w ogóle trafia do generowanej odpowiedzi, pisze Google w dokumentacji funkcji AI w wyszukiwarce.
Czego ten test nie rozstrzyga
Uczciwie: jedna domena, 30 dni i 40 fraz to za mało, żeby ogłosić zwycięzcę. Nasz test pokazuje, że dwa narzędzia mierzące to samo zjawisko dają istotnie różne liczby, i wskazuje cztery konkretne przyczyny tej różnicy. Nie rozstrzyga, które ma rację, bo przy zjawisku o tak dużej naturalnej wariancji samo pojęcie wartości prawdziwej jest problematyczne. Powtórzymy pomiar na większej próbce domen w kolejnym kwartale; do tego czasu rozsądne podejście to jedno narzędzie, stała lista fraz, czytanie trendu zamiast wartości bezwzględnych i okresowa kontrola ręczna na kilkunastu najważniejszych zapytaniach.
FAQ
Czy warto płacić za oba narzędzia naraz?
W większości przypadków nie. Dane z obu nie są porównywalne wprost, więc nie uzyskasz obrazu dokładniejszego, tylko dwa różne obrazy, które trzeba będzie pogodzić. Dwa abonamenty mają sens wyłącznie wtedy, gdy obsługujesz klientów, którzy sami narzucają konkretne narzędzie w raporcie.
Dlaczego liczby cytowań różnią się nawet o kilkadziesiąt procent?
Składają się na to cztery rzeczy: inna pora odpytania modeli, inna agregacja wariantów tej samej frazy, inna definicja tego, co liczy się jako cytowanie, oraz inna lokalizacja, z której wychodzi zapytanie. Przy frazach o słabym, niesystematycznym sygnale te czynniki kumulują się i dają bardzo rozbieżne wyniki.
Które narzędzie lepiej radzi sobie z językiem polskim?
W naszym teście rozbieżności były znacznie mniejsze na próbce angielskiej (11 procent wobec 18 do 64 procent na polskiej). Żadne z narzędzi nie wypadło wyraźnie lepiej na polskim; oba mają z nim więcej problemu niż z angielskim, głównie przez fleksję i agregację wariantów zapytań.
Czy można zweryfikować dane z narzędzia ręcznie?
Tak i warto to robić okresowo. Wybierz kilkanaście najważniejszych fraz, zadaj je modelom po kilka razy dziennie przez kilka dni i zanotuj, czy twoja domena pojawia się w źródłach. Pojedyncze odpytanie niczego nie dowodzi, bo odpowiedzi modeli nie są powtarzalne.
Co zrobić, jeśli oba narzędzia pokazują zero cytowań?
To zgodny sygnał, warto go traktować poważnie: dla tego tematu twojej domeny nie ma w zestawie źródeł modeli. Zwykle chodzi o brak pokrycia tematycznego, nie o sformułowanie istniejących wpisów, więc rozważ nową, pogłębioną treść zamiast optymalizacji starej.










