Przez piętnaście lat branża uczyła się jednego odruchu: zanim napiszesz tekst, sprawdź wolumen frazy. Dziś ten odruch przestaje wystarczać, bo coraz większa część decyzji zakupowych zaczyna się nie od dwóch słów wpisanych w Google, lecz od pełnego zdania zadanego modelowi językowemu. Pytanie „jaka agencja SEO dla sklepu z meblami w Polsce, budżet 8 tysięcy miesięcznie” nie ma wolumenu w żadnym narzędziu. A jednak właśnie takie zapytania decydują o tym, czy model wymieni twoją markę, czy trzy inne.
Badanie zapytań pod AI to osobna dyscyplina, nie wariant klasycznego keyword research. Poniżej opisuję metodę, którą stosujemy do budowania listy promptów dla klienta: skąd brać realne sformułowania, jak je kategoryzować, jak priorytetyzować i jak utrzymać listę przy życiu. Jeśli interesuje cię sama mechanika projektowania pytań testowych, osobno rozłożyliśmy to w tekście o promptach testowych.
Czym prompt różni się od słowa kluczowego
Różnic jest pięć i każda z nich zmienia sposób pracy.
Długość i składnia. Mediana zapytania w Google to dwa, trzy wyrazy. Zapytanie do modelu to zwykle całe zdanie, często z kontekstem, ograniczeniem budżetowym albo opisem sytuacji. Użytkownik nie optymalizuje zapytania pod wyszukiwarkę, bo nie musi: rozmawia.
Brak wolumenu. Prompty są w praktyce unikalne. Dwie osoby pytające o to samo sformułują to inaczej, więc licznik wyszukiwań traci sens jako jednostka planowania. Zamiast wolumenu operujemy kategorią zapytania i oceną wartości biznesowej.
Jedna odpowiedź zamiast dziesięciu wyników. W SERP-ie pozycja czwarta nadal daje kliknięcia. W odpowiedzi modelu albo jesteś w zestawie wymienionych źródeł, albo nie istniejesz. Rozkład jest ostrzejszy, co widać w naszym pomiarze rozbioru cytowań w odpowiedziach AI.
Niestabilność. Ten sam prompt zadany trzy razy w odstępie godziny daje trzy różne odpowiedzi, czasem z różnym zestawem marek. To nie błąd pomiaru, to właściwość modelu. Dlatego pojedynczy test nic nie mówi, a lista promptów musi być na tyle duża, by uśrednianie miało sens.
Kontekst sesji. Odpowiedź zależy od tego, o co użytkownik pytał wcześniej. Prompt rzadko jest samotny, zwykle stanowi trzeci lub czwarty krok rozmowy. W badaniu warto więc notować nie tylko pytanie, ale też typowy kontekst, w którym się pojawia.
Pięć kategorii zapytań, które warto pokryć
Lista promptów bez podziału na kategorie szybko staje się workiem bez dna. Pracujemy na pięciu koszykach i każdy z nich ma inną wartość oraz inną trudność.
| Kategoria | Przykład | Wartość biznesowa | Trudność wejścia |
|---|---|---|---|
| Rekomendacyjne | „polecisz agencję SEO dla B2B w Polsce?” | bardzo wysoka | wysoka |
| Porównawcze | „czym różni się Ahrefs od Semrusha dla małego sklepu?” | wysoka | średnia |
| Definicyjne | „co to jest AI Overviews i jak wpływa na ruch?” | średnia | niska |
| Proceduralne | „jak krok po kroku zmierzyć ruch z ChatGPT w GA4?” | wysoka | średnia |
| Weryfikacyjne | „czy marka X jest wiarygodna, co o niej wiadomo?” | wysoka | niska przy dobrej encji |
Rozkład nakładów powinien być nierówny. Zapytania rekomendacyjne są najcenniejsze, ale wejście do nich wymaga obecności w cudzych zestawieniach i w opiniach, nie tylko dobrego artykułu u siebie. Zapytania definicyjne i proceduralne wygrywa się własnym contentem najszybciej, więc stanowią naturalny punkt startu. Weryfikacyjne zależą głównie od spójności encji: nazwa, opis, dane strukturalne, zgodność informacji w serwisach trzecich.
Praktyczna proporcja na pierwszy kwartał pracy: 40 procent promptów proceduralnych, 25 procent definicyjnych, 20 procent porównawczych, 10 procent rekomendacyjnych, 5 procent weryfikacyjnych. Po pierwszym pomiarze proporcje przesuwa się w stronę kategorii, w których marka zaczyna się pojawiać, bo tam przyrost jest najtańszy.
Skąd brać realne sformułowania użytkowników
Najczęstszy błąd polega na wymyślaniu promptów przy biurku. Wychodzą z tego pytania, które brzmią jak brief marketingowy, a nie jak zdanie wpisane w okno czatu. Źródła, które naprawdę działają, są bardziej prozaiczne.
Transkrypcje rozmów sprzedażowych. To najgęstsze źródło, jakie istnieje. Pierwsze dwie minuty rozmowy handlowej to zwykle dokładnie te pytania, które klient wcześniej zadał modelowi. Przejrzenie trzydziestu nagrań daje zwykle pięćdziesiąt do siedemdziesięciu użytecznych sformułowań.
Zgłoszenia do supportu i czat na stronie. Tu znajdziesz język ludzi, którzy już kupili, czyli pytania proceduralne i problemowe. Idealne pod kategorię „jak zrobić”.
Wątki na Reddicie i w grupach branżowych. Modele uczą się na tych treściach i, co ważniejsze, często je cytują w trybie z przeszukiwaniem sieci. Tytuł wątku bywa gotowym promptem.
Autouzupełnianie w samych modelach. ChatGPT i Perplexity podpowiadają pytania pogłębiające pod odpowiedzią. Zadaj szerokie pytanie w swojej kategorii i zbierz wszystkie sugestie, a potem powtórz operację dla każdej z nich. Dwa poziomy w głąb dają zwykle kilkadziesiąt wariantów.
Sekcja „Inne pytania” w Google. Stare źródło, ale nadal trafne, bo to pytania w pełnym zdaniu. Wymaga lekkiego przeredagowania, bo PAA bywa nienaturalnie zwięzłe.
Rozmowy z własnym zespołem. Handlowcy i konsultanci pamiętają pytania, które słyszą co tydzień. Pół godziny burzy mózgów z dwiema osobami z pierwszej linii bije każde narzędzie.
Celuj w 120 do 200 surowych sformułowań na starcie. Po deduplikacji zostanie z tego realnie 40 do 60 promptów, które mają sens w monitoringu, i to jest właściwy rozmiar listy roboczej. Jak taka lista wygląda w gotowej formie, pokazujemy przy okazji opisu automatycznego monitoringu promptów.
Jak przełożyć frazy z Search Console na prompty
Search Console pozostaje najlepszym darmowym źródłem języka twoich odbiorców, tylko trzeba go czytać inaczej niż zwykle. Interesują nas nie frazy o najwyższej liczbie wyświetleń, lecz te najdłuższe, bo one najbliżej stoją mowie potocznej.
Procedura jest krótka. Eksportuj zapytania z ostatnich 90 dni (API Search Console zwraca więcej wierszy niż interfejs, a limit w panelu ucina listę już na tysiącu pozycji). Odfiltruj wszystko krótsze niż cztery wyrazy. Zostanie ogon, w którym ludzie piszą pełnymi zdaniami: „jak sprawdzić czy strona jest w AI Overviews”, „ile kosztuje audyt widoczności w chatgpt”. Te frazy są już promptami, wymagają tylko dopełnienia kontekstem.
Dopełnianie wygląda tak, że do każdej frazy dodajesz jeden z trzech modyfikatorów, które faktycznie pojawiają się w rozmowach z modelami: ograniczenie („dla sklepu do 500 produktów”), porównanie („i co jest lepsze od tego”) albo prośbę o rekomendację („kogo polecisz do tego w Polsce”). Z jednej frazy z Search Console robią się w ten sposób trzy prompty w trzech różnych kategoriach.
Jedna uwaga metodyczna: nie przenoś do listy fraz, które w Search Console mają zero kliknięć przy wysokiej liczbie wyświetleń i pozycji poza trzydziestką. To zwykle dopasowania szerokie, a nie realne intencje. Dokumentacja Google wyjaśnia, jak traktować takie przypadki w materiałach Search Central o Search Console.
Priorytetyzacja: wartość biznesowa kontra szansa
Czterdzieści promptów to wciąż za dużo, by pracować nad wszystkimi równocześnie. Potrzebny jest prosty wskaźnik, który da się policzyć w arkuszu bez zgadywania.
Używamy trzech ocen w skali 1 do 5 i jednego iloczynu.
- Wartość (W): jak blisko tego promptu leży decyzja zakupowa. Pytanie „co to jest GEO” dostaje 1, pytanie „kogo wziąć do audytu widoczności AI dla e-commerce” dostaje 5.
- Szansa (S): czy mamy czym wygrać. Istniejąca, dobra treść na temat plus wzmianki w serwisach trzecich to 5. Zero materiału i zero wzmianek to 1.
- Obecność (O): w ilu z pięciu testowych przebiegów marka już się pojawia, przeliczone na skalę. Pięć na pięć to 5.
Priorytet liczymy jako W × S × (6 minus O). Ostatni składnik odwraca obecność, bo prompt, w którym jesteśmy już wymieniani zawsze, nie wymaga pracy. Najwyżej wychodzą zapytania cenne, w których mamy realne zaplecze, ale jeszcze nas tam nie ma. To właściwa kolejka robocza i zwykle liczy osiem do dwunastu pozycji na kwartał.
Warto policzyć też udział marki w całej liście, czyli procent promptów, w których pojawiamy się przynajmniej raz na pięć przebiegów. To jedyna liczba, którą ma sens raportować zarządowi, bo pojedyncze prompty są zbyt zmienne. Metodykę liczenia tego udziału opisaliśmy osobno przy okazji wyboru narzędzi: zobacz porównanie narzędzi do widoczności AI, bo większość platform liczy ten wskaźnik po swojemu i wyniki nie są przenośne między nimi.
Jak zbudować arkusz roboczy
Narzędzie nie musi być skomplikowane. Arkusz z jedenastoma kolumnami obsługuje cały proces i daje się wersjonować.
- ID: stały identyfikator, żeby dane historyczne się nie rozjechały przy sortowaniu.
- Prompt: dokładne sformułowanie, bez skracania.
- Kategoria: jedna z pięciu opisanych wyżej.
- Źródło: skąd pochodzi (rozmowa sprzedażowa, Search Console, Reddit, autouzupełnianie).
- Model: na czym testujemy, bo wyniki między modelami są nieporównywalne.
- W, S, O: trzy oceny.
- Priorytet: formuła, nie wpisywana ręcznie.
- Data pomiaru oraz liczba trafień na 5 przebiegów.
- Konkurenci wymienieni: kto zajmuje miejsce, które chcemy. Najcenniejsza kolumna w całym arkuszu, bo pokazuje, czyje treści model uznaje za źródło.
Pomiar robimy w stałym rytmie, w tym samym dniu tygodnia, pięć przebiegów na prompt, w nowej sesji bez historii. Bez tych trzech warunków porównania między miesiącami nie znaczą nic. Przy liście czterdziestu promptów i pięciu przebiegach to dwieście zapytań miesięcznie, czyli zadanie na jedno popołudnie albo na prosty skrypt.
Kolumnę z konkurentami przeglądaj co miesiąc osobno. Jeśli ta sama domena pojawia się w ośmiu promptach z twojej kolejki, nie masz problemu z treścią, tylko z obecnością w tym konkretnym źródle. To zmienia plan działania z „napisz artykuł” na „znajdź się w tym zestawieniu”, a to zupełnie inna praca.
Aktualizacja listy co kwartał
Lista promptów starzeje się szybciej niż lista słów kluczowych, bo zmienia się nie tylko rynek, ale też sposób, w jaki ludzie rozmawiają z modelami. Kwartał to rozsądny cykl przeglądu.
Przy każdym przeglądzie robimy cztery rzeczy. Usuwamy prompty, w których obecność wynosi 5 na 5 trzy pomiary z rzędu, bo są wygrane i tylko zaśmiecają raport (wracają do listy po pół roku jako kontrola). Dodajemy nowe sformułowania ze świeżych transkrypcji sprzedażowych, co zwykle daje pięć do dziesięciu pozycji. Przeliczamy ocenę szansy dla całej listy, bo publikacje z ostatnich trzech miesięcy zmieniły zaplecze. I weryfikujemy kategorie, bo część zapytań definicyjnych z czasem przesuwa się w stronę porównawczych, kiedy temat dojrzewa na rynku.
Dokumentuj każdą wersję listy z datą. Przy pierwszej poważnej zmianie widoczności ta historia jest jedynym sposobem, by odpowiedzieć na pytanie, czy poprawa wynika z twojej pracy, czy z tego, że lista zapytań po cichu stała się łatwiejsza.
FAQ
Ile promptów wystarczy na start?
Czterdzieści do sześćdziesięciu po deduplikacji. Mniej niż trzydzieści daje wyniki zbyt zmienne, by cokolwiek z nich wnioskować, a powyżej osiemdziesięciu koszt comiesięcznego pomiaru przestaje się opłacać przy braku automatyzacji.
Czy prompty trzeba testować osobno w każdym modelu?
Tak, jeśli raportujesz wyniki. Zestawy wymienianych marek różnią się między ChatGPT, Perplexity i Google AI Mode na tyle, że uśrednianie ich w jedną liczbę zaciera obraz. Przy ograniczonym budżecie wybierz jeden model, w którym twoi klienci faktycznie siedzą, i mierz tylko jego, konsekwentnie.
Czy wolumen wyszukiwań ma jeszcze jakąkolwiek wartość w tym procesie?
Ma, ale pośrednią. Wysoki wolumen frazy nadrzędnej mówi, że temat jest szeroki, więc warto go pokryć treścią. Nie mówi nic o tym, ile razy ktoś zada o niego pytanie modelowi. Traktuj wolumen jako wskaźnik rozmiaru tematu, nie jako prognozę ruchu.
Jak często zmienia się odpowiedź na ten sam prompt?
W naszych pomiarach zestaw wymienianych marek zmienia się częściowo przy około połowie powtórzeń w ciągu jednego dnia. Dlatego stosujemy pięć przebiegów i liczymy trafienia, a nie binarne „jest albo nie ma”.
Czy da się ten proces zautomatyzować?
Częściowo. Same przebiegi i zapis odpowiedzi automatyzuje się prosto przez API modeli. Tego, czego nie da się zautomatyzować, to zbieranie sformułowań z rozmów sprzedażowych i ocena wartości biznesowej, a to właśnie dwa kroki, które decydują o jakości całej listy.
Co zrobić, gdy w cennym prompcie model wymienia tylko konkurentów?
Sprawdź, skąd bierze te nazwy. Jeśli wskazuje konkretne zestawienie albo artykuł branżowy, celem jest obecność w tym źródle, nie publikacja kolejnego tekstu u siebie. Jeśli nie podaje źródła, pracuj nad spójnością encji marki i jej opisem w serwisach trzecich.









