Jak sprawdzić, czy ChatGPT i inne roboty AI mają dostęp do Twojej strony WordPress — poradnik krok po kroku

TL;DR robots.txt to tylko deklaracja — realną blokadę widać w kodach HTTP (403/429) i logach. „Brak dostępu" to nie to samo co „brak cytowań" — crawl, rekomendacja i wizyta to trzy osobne zdarzenia. Najszybszy test: curl -A "<user-agent>" -I dla każdego bota osobno; 200 = dostęp, 403/429 = blokada upstream. Blokada zwykle siedzi w WAF/CDN, wtyczce bezpieczeństwa lub hostingu managed — nie w samym WordPressie. Weryfikuj tożsamość bota (IP z JSON-a operatora lub reverse DNS), bo user-agent bywa fałszowany. Rozdzielaj klasy botów: training vs search/agent — blokada training nie odcina Cię od cytowań. Efekt mierz osobno: logi (dostęp) plus monitoring odpowiedzi modeli (widoczność).

Twój sklep nie pojawia się w odpowiedziach ChatGPT, choć w Google działa bez zarzutu. Pierwsza myśl: „pewnie roboty AI nie mają dostępu do strony". To sensowne podejrzenie, ale łatwo pójść w złą stronę.

Wielu właścicieli stron WordPress zatrzymuje się na robots.txt. Sprawdza plik, widzi „Allow" i uznaje sprawę za zamkniętą. Tymczasem prawdziwa blokada często siedzi zupełnie gdzie indziej: w CDN, wtyczce bezpieczeństwa albo na poziomie hostingu. robots.txt to tylko deklaracja. Realną blokadę widać dopiero w kodach odpowiedzi HTTP i w logach serwera.

Ten poradnik jest dla właścicieli i operatorów stron WordPress oraz WooCommerce, którzy znają panel WP, ale nie administrują serwerem na co dzień. Po lekturze samodzielnie przeprowadzisz audyt dostępu botów AI: od robots.txt, przez test curl, logi i weryfikację IP, aż po WAF/CDN i wtyczki.

Jedna rzecz na start, żeby uniknąć rozczarowania: dostęp to nie to samo co cytowanie. Bot może wchodzić na stronę i dostawać kod 200, a mimo to marka nie pojawi się w odpowiedziach modelu. To dwa różne problemy i dwa różne zestawy poprawek.

Jak sprawdzić, czy roboty AI mają dostęp do strony WordPress — plan w 6 krokach

Cała procedura to sześć kroków. Każdy ma jeden konkretny cel.

  1. Ustal, które boty AI Cię interesują. Cel: rozdzielić klasy botów, żeby nie zablokować sobie widoczności.
  2. Sprawdź robots.txt. Cel: wykluczyć najprostszą przyczynę blokady.
  3. Zrób test dostępu z curl. Cel: najszybciej wykryć realną blokadę.
  4. Sprawdź logi i zweryfikuj tożsamość bota. Cel: ustalić, czy boty faktycznie wchodzą i czy nie są podszywane.
  5. Sprawdź blokady poza WordPressem. Cel: znaleźć najczęstszą przyczynę kodów 403/429.
  6. Sprawdź indeksację i surowy HTML. Cel: domknąć lukę między „bot wchodzi" a „treść jest czytelna".

Co przygotować: dostęp do panelu WordPress, dostęp do logów lub panelu hostingu, panel CDN (jeśli go używasz) oraz terminal albo narzędzie do wysyłania zapytań curl. Całość zajmie od kilkunastu minut do godziny, jeśli logi są łatwo dostępne. Dostęp do serwera nie jest konieczny, ale bez logów część kroków pomoże Ci wykonać osoba techniczna.

Krok 1 — Ustal, które boty AI w ogóle Cię interesują

Nie wszystkie boty AI robią to samo. Jeśli potraktujesz je jako jedną grupę, możesz odciąć się od cytowań, próbując ograniczyć trening.

Bot User-agent Klasa Po co go sprawdzać
GPTBot GPTBot training Pobiera treści do treningu. Blokada nie odcina od cytowań.
ClaudeBot ClaudeBot training Jak wyżej, dla modeli Anthropic.
CCBot CCBot training Zbiera dane dla Common Crawl.
Bytespider Bytespider training Crawler powiązany z ekosystemem ByteDance.
OAI-SearchBot OAI-SearchBot search Indeksuje strony dla ChatGPT Search. Blokada usuwa Cię z wyników.
PerplexityBot PerplexityBot search Zasila odpowiedzi Perplexity.
Bingbot Bingbot search Zasila indeks Bing, z którego korzysta ChatGPT.
ChatGPT-User ChatGPT-User agent Działa na żądanie użytkownika, wchodzi na stronę w trakcie rozmowy.
Claude-User Claude-User agent Analogicznie dla Claude.
Perplexity-User Perplexity-User agent Analogicznie dla Perplexity.

Dwie rzeczy warte zapamiętania. Po pierwsze, Google-Extended to nie crawler, tylko token w robots.txt, który kontroluje użycie treści przez Google do celów AI. Nie blokuje Googlebota i nie wpływa na klasyczne wyniki wyszukiwania. Po drugie, nie mieszaj ChatGPT-User z OAI-SearchBot. Pierwszy działa na życzenie użytkownika, drugi odpowiada za indeksowanie. Blokada jednego nie jest blokadą drugiego.

Jak sprawdzić, że zrobiłeś to dobrze: masz listę botów, które chcesz dopuścić, i wiesz, które z nich odpowiadają za cytowania. Typowy błąd: blokowanie wszystkiego, co ma „AI" w nazwie.

Krok 2 — Sprawdź robots.txt (i nie pomyl go z llms.txt)

Wejdź na twojadomena.pl/robots.txt. Zobaczysz listę reguł pogrupowanych po user-agenach. Szukaj wpisów Disallow przy botach z kroku 1.

Jeśli używasz Yoast SEO albo Rank Math, plik edytujesz w panelu wtyczki. Uwaga na konflikt: jeśli w katalogu głównym leży fizyczny plik robots.txt, wtyczka może go nie nadpisywać. Wtedy zmiany w panelu nic nie dadzą.

Gotowy fragment, który dopuszcza kluczowe boty:

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Google-Extended
Allow: /

Trzy pliki, trzy różne zadania. robots.txt mówi botom, gdzie mogą wchodzić. sitemap.xml listuje adresy do zaindeksowania. llms.txt to kuratorska mapa najważniejszych zasobów dla AI — więcej o tym, jak działa mapa llms.txt, przeczytasz w osobnym materiale. Żaden nie zastępuje pozostałych.

Zmiana w robots.txt nie działa natychmiast. OpenAI podaje, że aktualizacja reguł może zająć około 24 godzin.

Jak sprawdzić, że zrobiłeś to dobrze: odświeżasz twojadomena.pl/robots.txt i widzisz swoje reguły. Typowy błąd: usuwanie istniejących wpisów bez analizy, co potrafi odciąć inne boty.

Krok 3 — Zrób test dostępu z curl (dla każdego bota osobno)

To najszybsza diagnoza. Wysyłasz zapytanie z konkretnym user-agentem i patrzysz na kod odpowiedzi.

curl -A "OAI-SearchBot" -I https://twojadomena.pl/
curl -A "GPTBot" -I https://twojadomena.pl/
curl -A "ChatGPT-User" -I https://twojadomena.pl/
curl -A "PerplexityBot" -I https://twojadomena.pl/
Kod Znaczenie Co robić
200 Dostęp działa Przejdź do kroku 4, sprawdź logi.
403 Blokada upstream Szukaj w WAF/CDN, wtyczkach, hostingu (krok 5).
429 Rate limiting Sprawdź limity w CDN i na hostingu.
5xx Problem serwera Sprawdź logi błędów i obciążenie.

Powtórz test nie tylko dla strony głównej, ale też dla strony produktu i kategorii. W e-commerce to właśnie te adresy najczęściej generują blokady.

Jeśli jeden bot dostaje 403, a inny 200, blokada jest selektywna i prawie na pewno siedzi w warstwie przed WordPressem. Test z Twojego komputera jest miarodajny dla kodu odpowiedzi, ale nie pokaże, czy bot faktycznie wchodzi. To sprawdzisz w logach.

Jak sprawdzić, że zrobiłeś to dobrze: masz tabelę botów z kodami odpowiedzi. Typowy błąd: testowanie tylko strony głównej.

Krok 4 — Sprawdź logi serwera i zweryfikuj tożsamość bota

Logi znajdziesz w panelu hostingu, w narzędziach CDN albo w plikach access log. Filtruj po user-agenach:

grep -i "GPTBot\|OAI-SearchBot\|ChatGPT-User\|PerplexityBot" access.log
Metoda weryfikacji Co daje Ograniczenia
IP z JSON-a operatora Pewność, że to prawdziwy bot OpenAI publikuje listy, Anthropic i Perplexity nie
Reverse DNS Potwierdza właściciela IP Działa dobrze dla Google (crawl-***.googlebot.com)
Sam user-agent Szybki filtr wstępny Łatwy do sfałszowania

OpenAI publikuje zakresy IP w plikach JSON dla każdego bota osobno. Google weryfikujesz przez reverse DNS. Dla części botów Anthropic i Perplexity publicznych zakresów IP po prostu nie ma, więc zostaje analiza wzorców ruchu.

Fałszywe boty to realny problem. W jednym z analizowanych zbiorów logów GPTBot miał najwyższy odsetek fałszerstw. Jeśli IP nie ma na oficjalnej liście, traktuj żądanie jako niezweryfikowane.

Jak sprawdzić, że zrobiłeś to dobrze: widzisz w logach wpisy z prawdziwych IP operatorów. Typowy błąd: wiara w sam user-agent.

Krok 5 — Sprawdź blokady poza WordPressem (WAF, CDN, wtyczki, hosting)

Tu najczęściej siedzi przyczyna kodów 403 i 429. Cloudflare domyślnie blokuje część crawlerów AI, a wtyczki bezpieczeństwa potrafią robić to samo.

Drzewko decyzyjne, gdy curl zwraca 403:

  • Masz Cloudflare? Sprawdź sekcję zarządzania botami i reguły WAF.
  • Masz Wordfence lub Sucuri? Sprawdź allowlistę IP i reguły blokujące podszywaczy.
  • Hosting managed (np. WP Engine, Kinsta)? Zapytaj support o politykę wobec crawlerów AI.
  • Nic z powyższych? Sprawdź .htaccess i reguły na poziomie serwera.

Kolejność diagnozy idzie od góry stosu w dół: CDN, potem wtyczki, potem hosting, na końcu WordPress. Allowlist IP pomaga, ale nie jest pełnym rozwiązaniem, jeśli operator nie publikuje zakresów.

Jak sprawdzić, że zrobiłeś to dobrze: po odblokowaniu curl znów zwraca 200. Typowy błąd: pomijanie CDN i szukanie przyczyny wyłącznie w WordPressie.

Krok 6 — Sprawdź indeksację i surowy HTML

Bot wchodzi, ale treść może być dla niego niewidoczna. ChatGPT korzysta z indeksu Bing, Gemini z indeksu Google. Sprawdź więc Google Search Console i Bing Webmaster Tools.

Checklista:

  • Czy kluczowe strony są zaindeksowane w Bing i Google?
  • Czy w surowym HTML (Ctrl+U) widać opisy, ceny i nazwy produktów?
  • Czy dane nie są renderowane wyłącznie przez JavaScript?
  • Czy nie ma błędnego canonical ani noindex?

Jeśli kluczowe treści pojawiają się tylko po wykonaniu JS, bot może ich nie zobaczyć. Brak indeksacji w Bing oznacza, że ChatGPT nie ma skąd wziąć Twojej strony.

Jak sprawdzić, że zrobiłeś to dobrze: widzisz treść w surowym HTML i zielony status indeksacji. Typowy błąd: zakładanie, że skoro strona działa w przeglądarce, bot widzi to samo.

Jak odróżnić brak dostępu od braku cytowań

To najważniejsza interpretacja w całym audycie. Trzy zdarzenia są osobne i wymagają osobnego pomiaru.

Zdarzenie Gdzie to widać Co poprawić
Crawl (bot wchodzi) Logi serwera, kody HTTP Blokady w WAF/CDN, robots.txt
Rekomendacja (model Cię wymienia) Monitoring odpowiedzi modeli Treść, struktura, autorytet, dane
Wizyta (klient przychodzi) Analityka, źródła ruchu Ścieżka konwersji, landing page

Bot może wchodzić codziennie, a model i tak Cię nie wymieni. Powód rzadko leży w dostępie. Częściej to brak konkretnych, weryfikowalnych danych, słaba struktura treści albo niski autorytet. Efektu nie zobaczysz z dnia na dzień. Realistyczny horyzont to 30–90 dni.

Najczęstsze błędy i jak je naprawić

Błąd Objaw Naprawa
Blokowanie wszystkich botów z „AI" w nazwie Brak cytowań mimo dobrej treści Zostaw OAI-SearchBot, PerplexityBot, Bingbot
Blokowanie Googlebota Spadek w klasycznym wyszukiwaniu Usuń regułę blokującą Googlebota
Mylenie llms.txt z robots.txt Zmiany nie przynoszą efektu Ustaw reguły w robots.txt
Zmiany w robots.txt na ślepo Znikają inne boty Analizuj plik przed edycją
Wiara w user-agent bez weryfikacji IP Fałszywe boty w logach Porównaj IP z listą operatora
Pomijanie WAF/CDN 403 mimo poprawnego robots.txt Sprawdź reguły w CDN
Testowanie tylko strony głównej Produkty nadal zablokowane Testuj też kategorie i produkty
Wniosek „brak wizyt = brak dostępu" Szukanie problemu nie tam Rozdziel crawl, rekomendację i wizytę

Co dalej

Gdy wszystko działa, nie kończ na jednorazowym audycie. Dostęp to warunek wstępny, nie cel. Kolejny krok to systematyczny monitoring widoczności w modelach.

  • Blokada w CDN? Skontaktuj się z hostingiem lub dostawcą CDN i poproś o zmianę reguł.
  • Brak indeksacji? Napraw SEO techniczne i prześlij strony do Bing Webmaster Tools.
  • Chcesz powtarzalności? Semly.ai prowadzi stały monitoring widoczności w ChatGPT, Gemini, Claude i Grok z raportami co 24 godziny. Agent Leon sprawdza robots.txt i llms.txt, a integracja z WordPress i WooCommerce pozwala wdrażać poprawki bezpośrednio z platformy.

Zacznij od darmowego audytu widoczności w Semly.ai. Zobaczysz, gdzie jesteś teraz i co warto poprawić w pierwszej kolejności.

FAQ

Czy boty AI respektują robots.txt? W większości tak, ale nie wszystkie i nie zawsze. ChatGPT-User działa na żądanie użytkownika i reguły robots.txt mogą nie mieć zastosowania. Dlatego robots.txt to punkt wyjścia, a nie pełna odpowiedź.

Jak rozpoznać crawler AI w logach? Filtruj logi po user-agenach, a potem zweryfikuj IP. Dla OpenAI porównaj adresy z oficjalnymi plikami JSON, dla Google sprawdź reverse DNS. Sam user-agent nie wystarczy.

Czy blokada botów AI odcina mnie od cytowań? To zależy od klasy bota. Blokada botów treningowych nie odcina Cię od cytowań. Blokada botów search i agent, takich jak OAI-SearchBot czy PerplexityBot, realnie usuwa Cię z odpowiedzi.

Czy llms.txt gwarantuje cytowania? Nie. To propozycja standardu, a nie zatwierdzona specyfikacja. Żaden główny dostawca modeli nie potwierdził oficjalnie, że czyta te pliki. Traktuj llms.txt jako uzupełnienie, nie zamiennik robots.txt — sprawdź, jak działa mapa llms.txt.

Jak szybko widać efekt po odblokowaniu? Zmiany w robots.txt u OpenAI działają około 24 godzin. Efekt w odpowiedziach modeli to zwykle kwestia tygodni, a nie dni. Realistyczny horyzont to 30–90 dni.

Źródła

Sprawdź, czy Cię widzi

Wpisz adres Twojej strony, żeby otrzymać bezpłatny raport widoczności w AI