Raporty widoczności w modelach językowych opisują skutek, a logi serwera pokazują przyczynę. Jeżeli GPTBot ani ClaudeBot nie pobierają Twoich podstron, żadna optymalizacja treści nie zadziała, bo model po prostu nie ma czego przetworzyć. Analiza logów jest najtańszym i najbardziej wiarygodnym testem tego, czy Twój serwis w ogóle istnieje w obiegu danych, z którego korzystają asystenci AI. To także pierwszy krok, zanim sięgniesz po płatne narzędzia opisane w przeglądzie stacku narzędzi do AIO.
Które boty AI odwiedzają polskie serwisy
W praktyce polskich witryn regularnie pojawia się kilka rodzin crawlerów powiązanych z modelami językowymi. Każda z nich ma inny cel, więc inaczej interpretuje się jej obecność w logach.
| User agent | Właściciel | Do czego służy |
|---|---|---|
| GPTBot | OpenAI | Pobieranie treści do trenowania modeli |
| OAI-SearchBot | OpenAI | Budowa indeksu wyszukiwania w ChatGPT |
| ChatGPT-User | OpenAI | Pobranie strony na żądanie użytkownika w czasie rozmowy |
| ClaudeBot | Anthropic | Crawl treści na potrzeby modeli Claude |
| Claude-User | Anthropic | Odczyt strony wywołany zapytaniem użytkownika |
| PerplexityBot | Perplexity | Indeksowanie źródeł cytowanych w odpowiedziach |
| Google-Extended | Kontrola użycia treści przez Gemini i AI Overviews | |
| Bytespider | ByteDance | Agresywny crawl treningowy, często bez wartości biznesowej |
Rozróżnienie między botem treningowym a botem uruchamianym na żądanie użytkownika ma znaczenie strategiczne. GPTBot i ClaudeBot zbierają materiał do modelu, więc ich wizyty przekładają się na wiedzę modelu z opóźnieniem liczonym w miesiącach. ChatGPT-User oraz Claude-User pojawiają się w momencie, gdy ktoś realnie pyta o Twoją stronę lub gdy asystent pobiera ją jako źródło. Ten drugi typ ruchu jest zdecydowanie cenniejszym sygnałem handlowym.
Skąd wziąć logi na typowym hostingu
Na współdzielonym hostingu logi dostępu leżą zwykle w katalogu logs obok public_html, a panel administracyjny udostępnia je jako archiwa .gz z podziałem na doby. W cPanel znajdziesz je w sekcji Raw Access, w DirectAdmin w zakładce Site Summary. Na VPS z Nginx domyślną ścieżką jest /var/log/nginx/access.log, a w Apache /var/log/apache2/access.log.
Dwie pułapki potrafią zepsuć całą analizę, zanim się zacznie. Pierwsza to retencja: wielu dostawców kasuje logi po siedmiu dniach, co przy botach AI odwiedzających serwis raz na kilka tygodni oznacza pustą próbkę. Warto ustawić własny eksport do osobnego katalogu i trzymać co najmniej kwartał danych. Druga pułapka to Cloudflare lub inny proxy przed serwerem: jeżeli origin loguje wyłącznie adresy proxy, weryfikacja tożsamości bota po IP przestaje działać. W takim wypadku analizę robisz na logach dostawcy CDN, nie na logach origin.
Filtrowanie po user agent krok po kroku
Do pierwszego przeglądu wystarczy terminal. Poniższe polecenie wypisze liczbę żądań każdego z interesujących nas crawlerów w pojedynczym pliku logu:
grep -Ei "GPTBot|ChatGPT-User|OAI-SearchBot|ClaudeBot|Claude-User|PerplexityBot|Google-Extended" access.log
| grep -oiE "(GPTBot|ChatGPT-User|OAI-SearchBot|ClaudeBot|Claude-User|PerplexityBot|Google-Extended)"
| sort | uniq -c | sort -rn
Kolejny krok to sprawdzenie, które adresy URL bot faktycznie pobrał, bo tu najczęściej wychodzą problemy strukturalne:
grep -i "GPTBot" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -30
Trzecia kolumna analizy to kody odpowiedzi. Zestawienie awk '{print $9}' ograniczone do wierszy z botem AI pokazuje, ile żądań kończy się kodem 200, ile przekierowaniem 301, a ile błędem 403 lub 429. Wysoki udział odpowiedzi 403 zwykle oznacza, że blokuje je WAF albo wtyczka bezpieczeństwa, o czym administrator często nie ma pojęcia. Jeżeli wolisz pracować na interfejsie graficznym, ten sam zbiór danych zaimportujesz do arkusza według procedury opisanej w tekście o monitoringu widoczności AI w Google Sheets.
Weryfikacja, czy bot jest prawdziwy
User agent to zwykły nagłówek tekstowy, który każdy może podszyć. Skrapery komercyjne notorycznie podają się za GPTBota, licząc na to, że przepuścisz je przez firewall. Weryfikacja jest jednak prosta, bo dostawcy publikują listy swoich adresów IP. OpenAI udostępnia pliki JSON z zakresami dla każdego ze swoich crawlerów, Anthropic robi to samo dla ClaudeBota, a metodę odwrotnego DNS opisuje dokumentacja Google Search Central.
Praktyczna procedura ma trzy kroki. Wyciągnij adresy IP z wierszy zawierających dany user agent. Porównaj je z opublikowaną listą zakresów CIDR. Dla adresów spoza listy wykonaj odwrotne zapytanie DNS i sprawdź, czy nazwa hosta należy do domeny dostawcy, a następnie potwierdź ją zapytaniem w przód. Adresy, które nie przejdą tego testu, traktuj jako podszywające się i blokuj bez wahania. W typowym audycie okazuje się, że od kilkunastu do kilkudziesięciu procent ruchu opisanego jako GPTBot pochodzi z serwerów niemających nic wspólnego z OpenAI.
Co oznacza niska częstotliwość odwiedzin
Załóżmy, że w logach z ostatnich trzydziestu dni GPTBot pojawił się dwanaście razy, a ClaudeBot trzy. To mało, ale sama liczba nic nie mówi bez kontekstu. Sprawdź najpierw pokrycie: ile unikalnych adresów URL zostało pobranych względem liczby wszystkich opublikowanych podstron. Serwis z czterystoma artykułami i piętnastoma odwiedzonymi adresami ma problem z odkrywalnością, a nie z częstotliwością.
Najczęstsze przyczyny anemicznego crawlu układają się w krótką listę. Dyrektywy w pliku robots.txt blokujące konkretne boty, często odziedziczone po poprzednim wykonawcy. Reguły firewalla lub Cloudflare Bot Fight Mode odrzucające ruch automatyczny hurtowo. Brak linkowania wewnętrznego do nowych treści, przez co bot nie ma jak do nich dotrzeć. Wolne odpowiedzi serwera powyżej dwóch sekund, które crawler traktuje jako sygnał do zmniejszenia tempa. Warstwę techniczną tych problemów wyłapiesz szybciej, jeżeli równolegle przepuścisz serwis przez crawler zgodnie z konfiguracją Screaming Froga pod audyt AI.
Powiązanie logów z cytowaniami
Logi mają sens dopiero wtedy, gdy zestawisz je z widocznością w odpowiedziach modeli. Zbuduj prosty arkusz z czterema kolumnami: adres URL, data ostatniego pobrania przez bota AI, liczba pobrań w ostatnim kwartale, obecność w cytowaniach dla monitorowanego zestawu promptów. Po dwóch, trzech miesiącach zależność zwykle staje się czytelna.
Powtarzalny wzorzec wygląda tak: adresy pobierane wielokrotnie i regularnie pojawiają się w cytowaniach nieproporcjonalnie częściej niż te odwiedzone raz. Drugi wzorzec dotyczy opóźnienia. Między pierwszym pobraniem przez bota treningowego a pojawieniem się treści w odpowiedziach mija zwykle od kilku tygodni do kilku miesięcy, więc ocenianie efektów po dwóch tygodniach jest przedwczesne. Trzeci wzorzec jest najbardziej praktyczny: wizyty agentów działających na żądanie użytkownika, czyli ChatGPT-User i Claude-User, korelują z realnym zainteresowaniem, bo ktoś w tym momencie pytał asystenta o temat, który obsługuje Twoja strona. Te adresy URL warto rozbudowywać w pierwszej kolejności.
Kiedy blokować, a kiedy przepuszczać boty
Decyzja nie jest zerojedynkowa i zależy od modelu biznesowego. Wydawca żyjący z odsłon reklamowych ma inny rachunek niż firma usługowa, dla której wzmianka w odpowiedzi asystenta jest darmową rekomendacją.
- Przepuszczaj boty wyszukiwarkowe i agentów na żądanie użytkownika, czyli OAI-SearchBot, ChatGPT-User, Claude-User, PerplexityBot. To one budują cytowania i przyprowadzają ruch.
- Rozważ przepuszczenie GPTBota i ClaudeBota, jeżeli zależy Ci na obecności marki w wiedzy modelu. Rezygnujesz z kontroli nad treścią, zyskujesz rozpoznawalność.
- Blokuj crawlery bez wartości zwrotnej, w praktyce Bytespider i anonimowe skrapery, które generują obciążenie i nie cytują źródeł.
- Zawsze blokuj ruch podszywający się pod znane boty, wykryty podczas weryfikacji adresów IP.
Blokadę realizujesz przez robots.txt dla botów respektujących standard oraz przez regułę na poziomie serwera lub CDN dla reszty. Zanim wprowadzisz zmiany, przeczytaj analizę zmian w obsłudze robots.txt przez agenty OpenAI, bo reguły dla poszczególnych user agentów zmieniały się kilkukrotnie i stare wpisy potrafią blokować więcej, niż zakładał ich autor.
Cykl kontrolny wystarczy ustawić raz na miesiąc. Eksport logów, filtrowanie po user agentach, weryfikacja adresów IP, zestawienie pobranych adresów URL z mapą serwisu i aktualizacja arkusza cytowań. Kwadrans pracy daje twardą odpowiedź na pytanie, czy problemem jest treść, czy dostęp.
FAQ
Czy GPTBot w logach oznacza, że ChatGPT będzie cytował moją stronę?
Nie bezpośrednio. GPTBot pobiera treści na potrzeby trenowania modeli, a za cytowania w odpowiedziach odpowiada głównie OAI-SearchBot i indeks wyszukiwania. Obecność GPTBota jest warunkiem koniecznym dla obecności marki w wiedzy modelu, ale nie gwarantuje linku w odpowiedzi.
Jak często boty AI powinny odwiedzać serwis?
Nie istnieje jedna norma, bo tempo zależy od wielkości i świeżości serwisu. Praktyczny punkt odniesienia dla średniego bloga branżowego to kilkanaście do kilkudziesięciu żądań miesięcznie przy pokryciu przekraczającym połowę opublikowanych adresów URL. Ważniejszy od liczby jest trend i zasięg, nie wartość bezwzględna.
Czy zablokowanie GPTBota zaszkodzi pozycjom w Google?
Nie. GPTBot należy do OpenAI i nie ma żadnego wpływu na indeks Google ani na rankingi w klasycznych wynikach. Osobną dyrektywą jest Google-Extended, która steruje wykorzystaniem treści przez Gemini i AI Overviews, ale również ona nie wpływa na standardowe indeksowanie przez Googlebota.
Co zrobić, gdy w logach nie ma żadnego bota AI?
Sprawdź w kolejności: plik robots.txt pod kątem dyrektyw Disallow dla konkretnych user agentów, reguły firewalla i ustawienia CDN blokujące ruch automatyczny, kody odpowiedzi 403 w logach oraz to, czy serwis w ogóle jest linkowany z zewnątrz. Brak linków zewnętrznych oznacza, że crawler nie ma jak trafić na Twoją domenę.
Czy wtyczki WordPress do statystyk zastąpią analizę logów?
Nie zastąpią, bo większość z nich rejestruje ruch przez JavaScript, a boty AI go nie wykonują. Wtyczki działające po stronie serwera, na przykład moduły logujące w warstwie PHP, pokażą część danych, ale surowy log dostępu pozostaje jedynym pełnym źródłem informacji o żądaniach automatycznych.










