Crawlery AI i robots.txt – jak kontrolować dostęp do treści?

FUNKYMEDIA · CRAWLERY AI · ROBOTS.TXT

Nie każdy robot związany z AI robi to samo. Jeden może zbierać informacje dla wyszukiwania, drugi pozyskiwać publiczne treści do rozwoju modeli, a trzeci otworzyć konkretną stronę dlatego, że użytkownik poprosił asystenta o wykonanie zadania.

Dlatego kontrola dostępu nie powinna zaczynać się od pytania „blokować AI czy nie?”. Najpierw trzeba ustalić operatora, zastosowanie crawlera, rzeczywistą odpowiedź serwera i biznesowy skutek blokady. Dopiero później można świadomie zaprojektować robots.txt, WAF, limity, cache oraz ochronę treści prywatnych.

W TYM ARTYKULE

01Rodzaje crawlerów
02Co kontroluje robots.txt
03Logi, CDN i WAF
04Polityka dostępu
05Audyt crawlerów AI

SZYBKA ODPOWIEDŹ

robots.txt pozwala przekazać respektującym go crawlerom reguły pobierania adresów, ale nie jest systemem bezpieczeństwa, nie gwarantuje braku indeksacji i nie przesądza o tym, czy marka zostanie cytowana lub rekomendowana przez AI. W praktyce warto oddzielać roboty wyszukiwania od crawlerów treningowych i działań inicjowanych przez użytkownika. Treści publiczne można udostępniać selektywnie, a materiały poufne chronić prawdziwą kontrolą dostępu: logowaniem, uprawnieniami, tokenami lub ograniczeniami sieciowymi.

Najpierw ustal, po co crawler pobiera stronę

Określenie „crawler AI” jest zbyt szerokie, aby na jego podstawie podejmować decyzję o blokowaniu.

WYSZUKIWANIE

Crawler wyszukiwania

Pobiera lub aktualizuje treści wykorzystywane do odnajdywania dokumentów i przygotowywania odpowiedzi.

ROZWÓJ MODELI

Crawler treningowy

Może pozyskiwać publiczne materiały przeznaczone do określonych zastosowań związanych z rozwojem modeli.

DZIAŁANIE UŻYTKOWNIKA

Robot użytkownika

Pobiera stronę w związku z konkretnym poleceniem człowieka, np. otwarciem URL-a, analizą lub wykonaniem zadania.

Te trzy zastosowania mogą mieć osobne tokeny, polityki i konsekwencje biznesowe.

Nie pytaj tylko „czy to bot AI?”

Lepszy zestaw pytań wygląda tak:

?Kto obsługuje crawler?
?Jaki jest cel pobierania?
?Jaki token User-Agent deklaruje?
?Czy respektuje robots.txt?
?Czy można zweryfikować jego tożsamość?
?Jakie będą skutki jego zablokowania?
?Czy żądanie zostało zainicjowane przez użytkownika?

Crawlowanie nie oznacza obecności w odpowiedzi AI

W logu można zobaczyć wizytę robota i jednocześnie nie zobaczyć żadnego efektu w wyszukiwaniu ani odpowiedziach AI.

01POBRANIE

crawler żąda URL-a

02ODCZYT

system interpretuje zasób

03INDEKS

informacja może zostać zapisana

04RETRIEVAL

dokument może zostać odnaleziony

05WYKORZYSTANIE

informacja może wejść do odpowiedzi

06CYTOWANIE

źródło może zostać pokazane

KAŻDY ETAP JEST OSOBNY

Wizyta crawlera potwierdza przede wszystkim próbę pobrania. Nie jest dowodem indeksacji, wykorzystania treści, wzmianki, cytowania ani rekomendacji.

Kod 200 również nie oznacza, że crawler otrzymał właściwą treść

Serwer może zwrócić 200, ale dokumentem faktycznie dostarczonym robotowi może być:

!strona challenge
!komunikat Access denied
!pusty szablon
!wersja bez treści JavaScript
!nieaktualna wersja z cache

Dlatego przy audycie trzeba badać nie tylko status HTTP, ale także treść, typ MIME i rozmiar odpowiedzi.

Retrieval, grounding i cytowanie to kolejne osobne warstwy

ProcesCo oznacza?
Crawlpróba pobrania zasobu
Indeksacjazapis informacji do późniejszego odnajdywania
Retrievalodnalezienie dokumentu dla konkretnej potrzeby
Groundingoparcie odpowiedzi na odnalezionych danych
Cytowaniepokazanie źródła użytkownikowi
Rekomendacjawskazanie marki jako możliwego wyboru

Zablokowanie własnej domeny nie usuwa marki z całego ekosystemu

Informacje o firmie mogą nadal istnieć w:

publikacjach branżowych
recenzjach
rankingach
katalogach
forach i dyskusjach
wcześniej pozyskanych danych

W efekcie marka może nadal być opisywana, lecz oficjalne źródło będzie mniej dostępne do sprawdzenia aktualnych faktów.

Przykładowe grupy botów należy rozdzielać według funkcji

ZastosowaniePrzykładowe tokeny
WyszukiwanieGooglebot, bingbot, OAI-SearchBot, Claude-SearchBot, PerplexityBot
Rozwój modeliGPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot
Działanie użytkownikaChatGPT-User, Claude-User, Perplexity-User
POLITYKI SIĘ ZMIENIAJĄ

Nazwy tokenów, zakres zastosowań i zasady operatorów mogą się zmieniać. Konfigurację trzeba okresowo porównywać z aktualną dokumentacją dostawców.

Google-Extended nie jest osobnym botem widocznym w logach

To szczególny przypadek, który łatwo błędnie interpretować.

GOOGLE-EXTENDED

Token kontroli wykorzystania ≠ osobny User-Agent wykonujący każde pobranie.

Dlatego brak ciągu „Google-Extended” w logach nie dowodzi, że konfiguracja jest ignorowana.

robots.txt steruje pobieraniem, nie poufnością

Plik powinien znajdować się w katalogu głównym konkretnego hosta.

ZAKRES

Host + protokół + port → własny robots.txt.

Reguły domeny głównej nie muszą automatycznie kontrolować:

subdomeny bloga
subdomeny sklepu
innego protokołu
innego portu

Podstawowe dyrektywy mają bardzo konkretne znaczenie

DyrektywaFunkcja
User-agentokreśla robota lub grupę robotów
Disallowwskazuje ścieżki niedozwolone do pobierania
Allowmoże tworzyć bardziej szczegółowy wyjątek
Sitemapwskazuje lokalizację mapy witryny

Najważniejsza konfiguracja biznesowa to często dostęp selektywny

Firma może chcieć pozostawić publiczne materiały dostępne dla wyszukiwania, a podjąć inną decyzję wobec crawlerów związanych z rozwojem modeli.

MODEL SELEKTYWNY

Publiczna wiedza → dostęp dla wyszukiwania
Treści wrażliwe → autoryzacja
Crawl treningowy → osobna decyzja biznesowa.

Ten model jest znacznie bardziej precyzyjny niż `User-agent: *` stosowany bez analizy konsekwencji.

Przykład: wyszukiwanie dozwolone, crawl treningowy zablokowany

PRZYKŁADOWA POLITYKA

User-agent: OAI-SearchBot
Disallow:

User-agent: GPTBot
Disallow: /

User-agent: Claude-SearchBot
Disallow:

User-agent: ClaudeBot
Disallow: /

Taka polityka ilustruje zasadę rozdzielenia zastosowań. Przed wdrożeniem trzeba zweryfikować aktualne tokeny i dokumentację konkretnych operatorów.

Nie publikuj poufnych ścieżek jako „zabezpieczenia” w robots.txt

ROBOTS.TXT ≠ KONTROLA DOSTĘPU

Plik robots.txt jest publiczny. Nie służy do ukrywania paneli klientów, danych osobowych, raportów płatnych ani dokumentów wewnętrznych.

Jeżeli zasób ma być naprawdę niedostępny, użyj mechanizmu egzekwowanego przez serwer.

Treści prywatne wymagają uwierzytelnienia

logowanie
kontrola uprawnień
token dostępu
uwierzytelnienie HTTP
ograniczenia sieciowe

Jeżeli osoba znająca URL nie powinna zobaczyć zasobu, robots.txt nie jest właściwym mechanizmem ochrony.

Disallow nie jest tym samym co noindex

MechanizmGłówny cel
Disallowograniczenie pobierania przez respektującego robota
noindexprośba o niewłączanie dokumentu do obsługiwanego indeksu
Uwierzytelnienietechniczne uniemożliwienie dostępu bez uprawnień

Jeżeli crawler ma odczytać noindex, musi najpierw móc pobrać dokument.

CZĘSTY BŁĄD

Jednoczesne zablokowanie adresu w robots.txt i oczekiwanie, że robot odczyta znajdujące się na tej stronie noindex.

robots.txt jest polityką, a WAF jest egzekwowaniem ruchu

Te warstwy nie powinny być ze sobą mylone.

robots.txtWAF / firewall
publikuje zasady dla crawleratechnicznie przepuszcza lub odrzuca żądanie
wymaga respektowaniadziała na poziomie infrastruktury
identyfikuje grupę przez tokenmoże używać IP, reputacji, kraju i innych sygnałów

Zezwolenie w robots.txt nie gwarantuje dostępu

Crawler może być dozwolony, a mimo to otrzymywać:

403blokadę WAF
429rate limiting
302przekierowanie do challenge
200stronę CAPTCHA zamiast treści

Dlatego konfigurację trzeba testować end-to-end, a nie wyłącznie przez odczyt pliku robots.txt.

CDN może ukryć rzeczywistą aktywność crawlerów przed originem

Jeżeli odpowiedź zostanie obsłużona z cache, żądanie może nie dotrzeć do serwera źródłowego.

PEŁNY OBRAZ

Logi CDN + logi WAF + logi reverse proxy + logi originu.

Analiza wyłącznie logów hostingu może więc mocno zaniżać liczbę pobrań.

Cache pomaga, ale może również podawać nieaktualną treść

!zbyt długi TTL
!cache starego robots.txt
!cache odpowiedzi 403 lub 404
!różne wersje według języka lub urządzenia
!inna zawartość dla bota i użytkownika

User-Agent nie potwierdza tożsamości crawlera

Dowolny klient HTTP może zadeklarować:

PODSZYWAJĄCY SIĘ BOT

User-Agent: Googlebot

Nie oznacza to, że żądanie rzeczywiście pochodzi od Google.

Do decyzji bezpieczeństwa potrzebujesz dodatkowej weryfikacji

oficjalnych zakresów IP
weryfikacji DNS, gdy operator ją dokumentuje
mechanizmów podpisu, jeżeli są dostępne
list zweryfikowanych botów CDN
analizy zachowania ruchu

ZASADA

Nazwa User-Agent jest przydatna do klasyfikacji logów. Sama nie powinna być jedyną podstawą reguły bezpieczeństwa.

Jakie informacje powinny trafiać do logów?

czas żądania
adres IP
host i URL
metoda HTTP
status odpowiedzi
liczba bajtów
czas odpowiedzi
User-Agent
wynik cache
reguła WAF lub klasyfikacja bota

Co mierzyć dla każdego crawlera?

REQ

liczba żądań

URL

unikalne adresy

2XX

udane odpowiedzi

429

ograniczenia ruchu

BW

transfer

CACHE

udział cache

Ważne jest również, które katalogi są pobierane, jak często bot wraca do tych samych URL-i oraz czy interesuje go HTML, PDF, obrazy czy inne zasoby.

Nie mierz widoczności liczbą requestów bota

CRAWL ≠ AI VISIBILITY

Duża liczba wizyt crawlera treningowego nie oznacza wysokiej widoczności marki w odpowiedziach AI.

Osobno trzeba mierzyć:

wzmianki o marce
cytowania domeny
rekomendacje
poprawność informacji
ruch referencyjny z systemów AI

Jakie są biznesowe skutki blokowania?

DecyzjaMożliwa konsekwencja
Blokada crawlera wyszukiwaniamniejsza możliwość pobrania aktualnej wersji własnej strony
Blokada crawlera treningowegoograniczenie przyszłego pobierania dla danego zastosowania
Blokada wszystkich botówryzyko utraty klasycznej i AI-owej widoczności
Ograniczenie zbędnych URL-iniższe obciążenie infrastruktury
Autoryzacja materiałów płatnychrzeczywista ochrona treści

Największe ryzyko dla marki: AI zna ją z innych źródeł, ale nie może sprawdzić oficjalnej strony

To szczególnie ważne w AI Search.

SCENARIUSZ

Oficjalna domena zablokowana → źródła zewnętrzne dostępne → AI nadal opisuje markę → aktualne dane firmy trudniejsze do weryfikacji.

Z tego powodu całkowite blokowanie wszystkich robotów nie zawsze jest zgodne z celem budowania widoczności i kontroli nad publicznym obrazem firmy.

Polityka dla marki budującej widoczność w AI powinna być selektywna

01PUBLICZNE

określ treści do odkrywania

02SEARCH

zdecyduj o crawlerach wyszukiwania

03TRAINING

podejmij osobną decyzję

04PRYWATNE

zabezpiecz autoryzacją

05WAF

usuń niezamierzone blokady

06LOGI

sprawdzaj rzeczywisty ruch

Nie pozwalaj crawlerom marnować zasobów na bezwartościową przestrzeń URL

W wielu serwisach problemem nie jest sam crawler, lecz ogromna liczba adresów generowanych przez:

×sortowanie
×filtry
×wyszukiwarkę wewnętrzną
×parametry sesyjne
×duplikaty techniczne

Kontrola crawlowania może więc służyć również ochronie zasobów infrastruktury i koncentracji pobrań na wartościowych dokumentach.

llms.txt nie zastępuje robots.txt

To dwa różne zagadnienia.

ROZDZIEL

robots.txt dotyczy polityki pobierania przez obsługujące go roboty. llms.txt nie jest uniwersalnym standardem kontroli dostępu do crawlerów AI.

Szczegółowo granice tego rozwiązania opisuje analiza llms.txt w AI Search.

Najczęstsze błędy wdrożeniowe

BŁĄD 01

Blokada wszystkiego

User-agent: * i Disallow: / mogą odciąć znacznie więcej niż crawler treningowy.

BŁĄD 02

Disallow + noindex

Robot nie może pobrać dokumentu i przez to może nie zobaczyć dyrektywy noindex.

BŁĄD 03

Zły host

Reguła domeny głównej niekoniecznie steruje subdomeną sklepu lub dokumentacji.

BŁĄD 04

WAF blokuje robots.txt

Crawler nie może nawet odczytać opublikowanej polityki.

BŁĄD 05

Wiara w User-Agent

Nazwa bota jest traktowana jak dowód jego tożsamości.

BŁĄD 06

Tylko logi originu

Ruch obsłużony przez CDN całkowicie znika z analizy.

Mity dotyczące crawlerów AI

MitRzeczywistość
Wizyta GPTBot oznacza cytowanie w ChatGPTcrawl i cytowanie to różne procesy
Blokada GPTBot blokuje ChatGPT Searchwyszukiwanie może mieć osobny crawler
Google-Extended steruje Google Searchnie należy utożsamiać go z Googlebotem
Disallow usuwa URL z indeksuogranicza przede wszystkim pobieranie
robots.txt chroni pliki prywatnedo tego potrzebna jest kontrola dostępu
User-Agent potwierdza botamożna go sfałszować
Brak bota w logach oznacza brak wiedzy o marcesystem może korzystać z innych źródeł i wcześniejszych danych

Jak przeprowadzić audyt crawlerów AI?

01CEL

ustal co ma być publiczne

02HOSTY

zinwentaryzuj domeny i subdomeny

03ROBOTS

sprawdź wszystkie pliki

04LOGI

zidentyfikuj rzeczywisty ruch

05BOTY

zweryfikuj ich tożsamość

06ODPOWIEDŹ

sprawdź co faktycznie otrzymują

07POLITYKA

wdroż reguły selektywne

08WAF

usuń konflikty infrastruktury

09POMIAR

monitoruj efekty

Audyt zaczyna się od klasyfikacji treści, nie od botów

Typ zasobuDomyślna intencja
publiczny artykuł eksperckiodnajdywalność i wykorzystanie
strona ofertowaaktualna widoczność marki
publiczny raportźródło referencyjne
panel klientabrak publicznego dostępu
płatny raportdostęp zgodny z modelem biznesowym
dane osoboweochrona techniczna

Po zmianie robots.txt nie oceniaj efektu natychmiast

Plik może być cache’owany, a crawlery wracają według własnych harmonogramów.

POTRZEBA CZASU

Zmiana polityki → ponowne pobranie robots.txt → kolejny crawl → aktualizacja systemu → dopiero później obserwacja efektu.

Nie należy zatem wyciągać wniosków na podstawie pojedynczego testu kilka minut po wdrożeniu.

Jak mierzyć skutki zmiany polityki dostępu?

TECHNIKA

Crawl

Żądania, statusy HTTP, URL-e, transfer, WAF i cache.

WIDOCZNOŚĆ

AI Search

Wzmianki, cytowania, rekomendacje i poprawność informacji.

BIZNES

Efekt

Ruch referencyjny, leady, konwersje oraz koszt infrastruktury.

Model końcowy: polityka dostępu powinna odpowiadać celowi zasobu

MODEL FUNKYMEDIA

Zasób → cel biznesowy → typ crawlera → reguła robots.txt → egzekwowanie infrastrukturalne → logi → efekt w AI Search.

Nie ma jednego poprawnego pliku robots.txt dla każdej firmy.

Sklep internetowy, serwis usługowy, wydawca płatnych raportów i baza dokumentacji mogą mieć zupełnie inne potrzeby.

Dobra polityka nie odpowiada więc na pytanie „czy pozwalam AI?”. Odpowiada na pytanie: który system może pobrać który zasób, w jakim celu i jakie konsekwencje biznesowe akceptujemy.

Dla marki budującej widoczność w AI Search najczęściej racjonalny jest model selektywny: pozostawić aktualne, publiczne i wiarygodne materiały dostępne dla mechanizmów wyszukiwania, osobno zdecydować o crawlerach treningowych, ograniczyć bezwartościową przestrzeń URL, a treści prywatne zabezpieczać rzeczywistym uwierzytelnieniem.

ROZWIŃ TEMAT

Od kontroli pobierania do strony gotowej na działanie agentów

robots.txt odpowiada na część problemu technicznego dostępu. Kolejnym poziomem jest serwis, który po pobraniu można nie tylko odczytać, lecz także bezpiecznie obsłużyć: przez nawigację, formularze, dane transakcyjne i potwierdzanie działań.