Plik robots.txt pozwala przekazać zgodnym robotom, które części publicznej witryny mogą pobierać. Nie jest zaporą sieciową, nie usuwa adresu automatycznie z indeksu i nie chroni danych poufnych. W kontekście AI dochodzi jeszcze jeden problem: ta sama firma może używać osobnego robota do wyszukiwania, pobierania strony na prośbę użytkownika i trenowania modeli.

Jeśli firma chce być cytowana w odpowiedziach AI, a jednocześnie ograniczyć wykorzystanie treści do treningu, powinna zastosować reguły per user-agent. Poniżej znajduje się mapa najważniejszych nazw potwierdzonych w oficjalnej dokumentacji oraz procedura bezpiecznego wdrożenia.

Krótka odpowiedźDopuść roboty wykorzystywane do wyszukiwania, jeśli zależy Ci na cytowaniach. Reguły dla treningu ustaw osobno, sprawdź dokumentację dostawcy i nie blokuj zasobów potrzebnych do renderowania.

Co robots.txt może, a czego nie potrafi?

Robots.txt działa na poziomie pobierania adresów przez roboty, które respektują standard. Reguła Disallow nie jest równoznaczna z noindex. Adres może nadal zostać poznany z linków i pojawić się bez treści. Jeśli strona ma zniknąć z wyników, trzeba umożliwić robotowi odczyt dyrektywy noindex albo zwrócić właściwy status HTTP. Dane prywatne należy chronić uwierzytelnieniem, a nie wpisem w publicznym pliku.

Plik musi znajdować się dokładnie w katalogu głównym hosta, na przykład https://example.com/robots.txt. Reguły subdomeny nie przenoszą się automatycznie na domenę główną. Składnia jest prosta, lecz błędna gwiazdka, ukośnik lub grupowanie może zablokować cały serwis. Dlatego każdą zmianę trzeba sprawdzić na kilku prawdziwych adresach.

Mapa botów AI: wyszukiwanie, pobranie i trening

Dostawca i botDeklarowane zastosowanieDecyzja przy celu: cytowania
OpenAI OAI-SearchBotWyszukiwanie i linki w odpowiedziachZwykle Allow
OpenAI GPTBotUlepszanie modeliOsobna decyzja organizacji
Anthropic Claude-SearchBotWyszukiwanieZwykle Allow
Anthropic Claude-UserPobranie zlecone przez użytkownikaZwykle Allow
Anthropic ClaudeBotTrening modeli generatywnychOsobna decyzja organizacji
PerplexityBotIndeks wyszukiwania PerplexityZwykle Allow
Google-ExtendedKontrola użycia przez Gemini i Vertex AINie wpływa na zwykły Google Search

Nazwy i zakres mogą się zmieniać, dlatego źródłem prawdy powinna być aktualna dokumentacja operatora. Nie dodawaj niepotwierdzonych nazw tylko dlatego, że znajdują się w losowym generatorze. Szczególnie ważne jest rozróżnienie Googlebot od Google-Extended: blokada drugiego tokenu nie jest blokadą indeksowania w klasycznych wynikach Google.

Przykładowa polityka dla firmy, która chce cytowań

Najbardziej zachowawczy wariant pozwala botom wyszukiwania pobierać publiczne treści, a decyzję o botach treningowych opisuje oddzielnie. W pakiecie tej strony zastosowano jawne grupy dla robotów wyszukiwania i ogólną zgodę dla pozostałych publicznych zasobów. Nie daje to gwarancji cytowania, ale usuwa oczywistą barierę.

  1. Spisz cel: widoczność w odpowiedziach, trening, oba zastosowania albo żadne.
  2. Zidentyfikuj oficjalne user-agenty i sprawdź ich aktualną dokumentację.
  3. Pozostaw dostęp do CSS, JavaScript i obrazów potrzebnych do zrozumienia strony.
  4. Zablokuj wyłącznie techniczne katalogi, wyniki wewnętrznego wyszukiwania lub API, jeśli nie mają wartości publicznej.
  5. Wdróż plik najpierw na środowisku testowym i ręcznie sprawdź kilka ścieżek.
  6. Po publikacji monitoruj logi serwera i błędy indeksowania.
Ważne

Nie umieszczaj w robots.txt ścieżek, których istnienia nie chcesz ujawniać. Plik jest publiczny i każdy może go odczytać.

Najczęstsze błędy w regułach dla AI

Najgroźniejsza pomyłka to Disallow: / w grupie ogólnej, dodane podczas prac nad wersją testową i pozostawione po publikacji. Druga to blokowanie katalogu assets, przez co robot widzi niekompletną stronę. Trzecia to założenie, że Allow dla jednego bota nadpisze nieprawidłową konfigurację proxy, zapory lub CDN. Robot nadal musi otrzymać kod 200 i treść bez wyzwania wymagającego interakcji.

Problemem bywa także konflikt celów. Marketing oczekuje cytowań, a dział prawny blokuje wszystkie nazwy zawierające AI bez rozróżnienia funkcji. Warto udokumentować decyzję, datę i właściciela polityki. Dzięki temu kolejna aktualizacja nie jest przypadkową edycją pliku.

Jak przetestować robots.txt i dostępność strony?

Najpierw otwórz plik w przeglądarce i sprawdź status HTTP oraz treść. Następnie przejdź przez reguły od najbardziej szczegółowej grupy user-agent do pasującej ścieżki. Sam test składni nie wystarcza. Trzeba jeszcze pobrać stronę z odpowiednim nagłówkiem user-agent, skontrolować przekierowania, canonical i obecność treści w odpowiedzi HTML.

Logi serwera są najlepszym dowodem, czy określony bot rzeczywiście odwiedza witrynę, lecz nazwę user-agenta można podszyć. Jeśli decyzja bezpieczeństwa ma duże znaczenie, porównaj adres IP z procedurą weryfikacji operatora, o ile ją udostępnia. Dla zwykłego monitoringu SEO wystarczy rejestrować datę, adres, status i rozmiar odpowiedzi.

Jak opisać politykę crawlerów w organizacji?

Krótki dokument powinien wskazywać, które boty wyszukiwania są dozwolone, jakie boty treningowe są blokowane lub dopuszczone, kto zatwierdził wybór i kiedy nastąpi kolejny przegląd. Dołącz uzasadnienie biznesowe oraz procedurę awaryjną na wypadek gwałtownego obciążenia serwera. Takie podejście jest bardziej odporne niż jednorazowa lista skopiowana do pliku.

Przegląd wykonuj co kwartał i po informacji o zmianie dokumentacji dostawcy. Sprawdź również regulamin, politykę prywatności oraz licencje materiałów publikowanych w serwisie. Robots.txt jest tylko jednym elementem zarządzania treścią i nie rozstrzyga wszystkich kwestii prawnych.

Checklista przed publikacją pliku

  • Plik jest dostępny pod głównym adresem hosta i zwraca kod 200.
  • Domena produkcyjna nie ma globalnego Disallow: /.
  • OAI-SearchBot, Claude-SearchBot i PerplexityBot są zgodne z przyjętym celem.
  • Reguły dla treningu zostały ustalone niezależnie od wyszukiwania.
  • Sitemap wskazuje kanoniczną wersję HTTPS.
  • CSS, JavaScript, obrazy i strony artykułów nie są omyłkowo blokowane.
  • Zmiana ma datę, właściciela i zaplanowany termin przeglądu.

Najczęstsze pytania

Czy robots.txt gwarantuje, że AI nie użyje treści?

Nie jest techniczną blokadą dostępu dla wszystkich podmiotów. Działa dla robotów, które respektują reguły. Wrażliwe dane muszą być zabezpieczone uwierzytelnieniem.

Czy mogę dopuścić OAI-SearchBot i zablokować GPTBot?

Tak. OpenAI dokumentuje te user-agenty jako odrębne zastosowania, więc można przygotować dla nich osobne grupy.

Czy Google-Extended blokuje stronę w Google?

Według Google token Google-Extended nie wpływa na obecność ani ranking w klasycznej wyszukiwarce. Dotyczy wykorzystania treści przez określone produkty generatywne.

Czy PerplexityBot służy do treningu modeli?

Perplexity opisuje go jako robota tworzącego indeks wyszukiwania, a nie robota do budowania baz treningowych.

Źródła i dokumentacja

Dokumentację źródłową sprawdzono 20 lipca 2026 r. Linki prowadzą do materiałów pierwotnych lub oficjalnych instrukcji.

Historia aktualizacji

- publikacja poradnika, weryfikacja źródeł, FAQ i linkowania wewnętrznego.

Materiały robocze i metodologia

Zobacz checklisty, zasady redakcyjne i pliki do pobrania używane przy audytach.

Otwórz centrum zasobów
Kanoniczny adres artykułuhttps://pawlinaltd.pl/blog/robots-txt-dla-crawlerow-ai/