Co to za bot? Lista crawlerow, botow AI i user-agentow

Co to za bot? Lista crawlerów, botów AI i user-agentów

Zaglądasz do logów i widzisz nieznaną nazwę? Ta strona odpowiada na jedno pytanie: co to za bot i co z nim zrobić. Sprawdź operatora, funkcję bota, zasady robots.txt i liczbę żądań, które odnotowałam u siebie. Kolumna „logi podrez.pl” pokaże, ile żądań z nazwą danego bota w polu user-agent odnotowałam na swojej stronie między lutym a sierpniem 2026, ale czytaj te liczby jako podpowiedź, czego się spodziewać, nie jako średnią dla rynku.

Lista botów i user-agentów [wyszukiwarka]

W tabeli znajdziesz crawlery AI, klasyczne wyszukiwarki, narzędzia SEO, podglądy linków z komunikatorów, monitoring i zwykłe biblioteki HTTP. Zawęź kategorię albo wpisz nazwę – tabela filtruje się na bieżąco, a przy jednym trafieniu dostaniesz gotową odpowiedź, a tam, gdzie bot ma użyteczny token – również wpis do robots.txt.

1. Zawęź kategorię

Co oznaczają kategorie botów?Jedenaście klas botów, po jednym zdaniu na każdą.

AI: trening
zbiera treść, żeby modele się na niej uczyły
AI: indeksy i odpowiedzi
buduje indeks, z którego system generatywny cytuje
Na żądanie użytkownika
pobiera stronę, bo ktoś właśnie o coś zapytał
Tokeny bez bota
nie wysyłają żądań, służą tylko do wpisania w robots.txt
Wyszukiwarki
klasyczne wyszukiwarki i ich boty pomocnicze
Podglądy linków
robią miniaturkę linku w komunikatorze albo social mediach
SEO i marketing
narzędzia SEO, audyty i weryfikacja stron reklamowych
Monitoring i bezpieczeństwo
dostępność serwisu, wzmianki o marce, skanowanie nadużyć
Badania i archiwa
korpusy naukowe i archiwizacja stron
Narzędzia i biblioteki
ruch uruchamiany przez przeglądarkę, wtyczkę, aplikację albo własny skrypt
Nieznane lub podejrzane
operator, funkcja albo autentyczność user-agenta nie zostały potwierdzone

Tabelę można przewijać w bok →

Bot i operatorFunkcjaToken w robots.txtRespektujeŻądania
podrez.pl, 02.02–05.08.2026
GPTBotOpenAITrening modeliGPTBotTak9 367
AmazonbotAmazonUlepszanie produktów Amazona, może służyć do treningu modeliAmazonbotTak5 617
ClaudeBotAnthropicTrening modeliClaudeBotTak4 398
meta-externalagentMetaZbieranie treści, m.in. pod treningMeta-ExternalAgentDeklarowane1 027
BytespiderByteDanceZbieranie treści pod modele ByteDanceBytespiderBrak jednoznacznej dokumentacji619
CCBotCommon CrawlOtwarty korpus stron, wykorzystywany m.in. do treninguCCBotTak483
cohere-ai
CohereBot
Cohere
Zbieranie treścicohere-ai
CohereBot
Brak jednoznacznej dokumentacji36
MistralAI-TrainingMistral AITrening modeliMistralAI-TrainingTak0
LinkupBotLinkup (linkup.so)Deklarowany indeks dla API wyszukiwania używanego przez aplikacje AILinkupBotBrak jednoznacznej dokumentacji4 935
OAI-SearchBotOpenAIIndeks wyszukiwania ChatGPTOAI-SearchBotTak4 527
ShapBotParallelIndeks wyszukiwania Parallel, zasila jego API dla agentów AIShapBotTak2 990
PerplexityBotPerplexityIndeks wyszukiwaniaPerplexityBotTak2 353
YouBotYou.comIndeks wyszukiwaniaYouBotTak108
Google-CloudVertexBotGoogleCrawl zamawiany przez właściciela strony pod Vertex AIGoogle-CloudVertexBotTak35
Claude-SearchBotAnthropicIndeks wyszukiwaniaClaude-SearchBotTak28
DuckAssistBotDuckDuckGoOdpowiedzi generatywne w DuckDuckGoDuckAssistBotTak14
meta-webindexerMetaIndeks wyników wyszukiwania Meta AIMeta-WebIndexerBrak jednoznacznej dokumentacji13
DiffbotDiffbotWyszukiwarka i Knowledge Graph Diffbota, nie służy do treninguDiffbotTak, z możliwością wyjątków umownych3
MistralAI-IndexMistral AIIndeks wyszukiwania dla VibeMistralAI-IndexTak0
ChatGPT-UserOpenAIPobranie na żądanie użytkownikaOpenAI nie dokumentuje jako tokenu sterującegoMoże nie obowiązywać6 005
Google-GeminiNotebook
dawniej Google-NotebookLM
Google
Pobranie źródeł dodanych przez użytkownikabrak, blokada tylko na serwerzeZwykle nie3 310**
FeedFetcher-GoogleGooglePobieranie kanałów RSS i Atom na żądanie użytkownikabrak, fetcher użytkownikaZwykle nie1 322
Claude-UserAnthropicPobranie na żądanie użytkownikaClaude-UserTak572
Google-Read-AloudGoogleOdczytywanie strony na głos na żądanie użytkownikabrak, fetcher użytkownikaZwykle nie276
Diffbot-UserDiffbotPobranie na żądanie użytkownika narzędziaDiffbot-UserTak158
MistralAI-UserMistral AIPobranie na żądanie użytkownika Vibe, z linkiem do źródłaMistralAI-UserTak148
Perplexity-UserPerplexityPobranie na żądanie użytkownikaPerplexity-UserZwykle nie89
Google-AgentGoogleAgenci Google wykonujący zadania na żądanie użytkownikabrak, blokada tylko na serwerzeZwykle nie0
Amzn-UserAmazonPobranie na żądanie użytkownika, np. pytanie do AlexyAmzn-UserMoże nie obowiązywać0
meta-externalfetcherMetaPobranie na żądanie użytkownikaMeta-ExternalFetcherBywa pomijane0
Google-PinpointGooglePobranie źródeł dodanych przez użytkownika narzędzia Pinpointbrak, fetcher użytkownikaZwykle nie0
Google-CWSGoogleFetcher powiązany z Chrome Web Storebrak, fetcher użytkownikaZwykle nie0
Shap-UserParallelPobranie strony na żądanie użytkownika Parallelbrak – Parallel opisuje go jako sygnał widoczności, nie mechanizm sterowaniaNie dotyczy0
Google-ExtendedGoogleZgoda na trening Gemini i grounding. Każde wystąpienie tej nazwy w logach to podszycieGoogle-ExtendedToken sterujący, bez user-agenta31
wyłącznie podszycia
Applebot-ExtendedAppleZgoda na trening Apple Intelligence. Każde wystąpienie tej nazwy w logach to podszycieApplebot-ExtendedToken sterujący, bez user-agenta5
wyłącznie podszycia
GooglebotGoogleWyszukiwarka, zasila też AI Overviews i AI ModeGooglebotTak12 538
bingbotMicrosoftWyszukiwarka Bing, zasila też CopilotabingbotTak6 843
ApplebotAppleSiri, Spotlight i Safari; zasila też odpowiedzi generatywne AppleApplebotTak3 627
BaiduspiderBaiduChińska wyszukiwarka; wariant -render renderuje JavaScriptBaiduspiderTak2 546
PetalBotHuaweiWyszukiwarka Petal SearchPetalBotTak2 524
YandexBotYandexWyszukiwarka YandexYandexBotTak1 725
Googlebot-ImageGoogleIndeksowanie grafikGooglebot-Image
Googlebot
Tak1 434
SeznamBotSeznamCzeska wyszukiwarkaSeznamBotTak1 146
GoogleOtherGoogleCrawler ogólnego przeznaczeniaGoogleOtherTak681
DuckDuckBotDuckDuckGoKlasyczne wyniki wyszukiwaniaDuckDuckBotTak666
YandexRenderResourcesBot
YandexImages
YandexFavicons
YaDirectFetcher
Yandex
Renderowanie JS, grafiki, favikony i strony docelowe reklam Yandex Directwłasne tokeny
np. YandexImages
Tak483
ExabotExalead? – do weryfikacjiHistorycznie wyszukiwarka Exalead. Sprawdź pełny user-agent i podany w nim adresExabotBrak jednoznacznej dokumentacji98
BingPreview / bingbotMicrosoftZrzuty stron na potrzeby podglądów w Bingu. User-agent obserwowany w logach; aktualna dokumentacja pokazuje ten ruch jako bingbotabrak odrębnego tokenu; obowiązują reguły dla bingbotaZgodnie z regułami bingbota88
QwantbotQwantFrancuska wyszukiwarka nastawiona na prywatnośćQwantbotTak48
Yahoo! SlurpYahooWyszukiwarka YahooSlurpTak9
Y!J-DLCYahoo Japan? – do weryfikacjiAgent wiązany z Yahoo Japan, bez aktualnego potwierdzenia operatorabrakBrak jednoznacznej dokumentacji38
Bravebot***Brave? – niepotwierdzoneUser-agent przypisywany indeksowi Brave Search; operator go nie dokumentujeBravebotBrak jednoznacznej dokumentacji42
Storebot-GoogleGoogleGoogle ShoppingStorebot-GoogleTak12
SogouSogouChińska wyszukiwarkaSogouTak8
Amzn-SearchBotAmazonWyszukiwanie w produktach Amazona, m.in. AlexaAmzn-SearchBotTak5
Googlebot-VideoGoogleIndeksowanie wideoGooglebot-Video
Googlebot
Tak2
MojeekBotMojeekNiezależna wyszukiwarka z własnym indeksemMojeekBotTak2
BingVideoPreviewMicrosoftPodglądy materiałów wideo w BinguBingVideoPreviewTak0
YepBotAhrefs / YepWyszukiwarka Yep, obecnie tylko do żądań IndexNow. Indeks buduje AhrefsBotYepBotTak, respektuje też Crawl-delay0
PinterestbotPinterestIndeksuje treści i produkty pod Piny, aktualizuje ceny i martwe linkiPinterestbotTak; honoruje Crawl-delay do wartości 1, większe traktuje jak 10
GoogleOther-Image
GoogleOther-Video
Google
Odmiany GoogleOther dla publicznych obrazów i filmówGoogleOther-Image
GoogleOther-Video
GoogleOther
Tak0
GoogleProducerGoogleKanały skonfigurowane przez wydawcę w Google Publisher Centerbrak, fetcher użytkownikaZwykle nie0
facebookexternalhitMetaPodgląd linków udostępnianych w serwisach MetafacebookexternalhitBywa pomijane4 479
Slackbot-LinkExpanding
Slack-ImgProxy
Slackbot
Slack
Podglądy linków, pobieranie obrazów i pozostałe żądania SlackabrakNie – Slack deklaruje, że nie przetwarza robots.txt407
SkypeUriPreviewMicrosoftPodgląd linków w SkypebrakBrak jednoznacznej dokumentacji327
TwitterbotX (dawniej Twitter)Podgląd linków w kartach XTwitterbotBrak jednoznacznej dokumentacji273
LinkedInBotLinkedInPodgląd linków udostępnianych na LinkedInieLinkedInBotBrak jednoznacznej dokumentacji270
WhatsAppMetaPodgląd linków wysyłanych w WhatsAppiebrakBrak jednoznacznej dokumentacji166
DiscordbotDiscordPodgląd linków na DiscordzieDiscordbotBrak jednoznacznej dokumentacji6
MicrosoftPreviewMicrosoftPodglądy stron w produktach MicrosoftuMicrosoftPreviewTak0
Google MessagesGooglePodgląd linków wysyłanych w Wiadomościach Googlebrak, fetcher użytkownikaZwykle nie0
AhrefsSiteAuditAhrefsAudyt techniczny zamówiony przez właściciela stronyAhrefsSiteAuditTak domyślnie; właściciel strony może to wyłączyć w ustawieniach audytu127 925
Screaming Frog SEO Spiderużytkownik programuRęczny crawl, zwykle Twój własny albo agencjiScreaming Frog SEO SpiderZależy od ustawień7 787
BarkrowlerBabbarIndeks linkówBarkrowlerTak5 975
AhrefsBotAhrefsIndeks linków i treści dla Ahrefs oraz wyszukiwarki YepAhrefsBotTak5 347
SemrushBotSemrushIndeks linków i danych o widocznościSemrushBotTak4 639
serpstatbotSerpstatIndeks linków zwrotnychserpstatbotTak2 741
MJ12botMajesticIndeks linkówMJ12botTak1 543
DataForSeoBotDataForSEOIndeks danych SEO sprzedawanych przez APIDataForSeoBotTak1 219
SERankingBacklinksBotSE RankingIndeks linków zwrotnychSERankingBacklinksBotTak752
SiteAuditBotSemrushAudyt techniczny na zlecenieSiteAuditBotTak666
SEBot-WASE RankingCrawler audytów technicznych SE RankingSEBot-WATak domyślnie; właściciel strony może to zmienić528
AdsBot-GoogleGoogleOcena jakości stron docelowych reklamAdsBot-GoogleTak, ale ignoruje User-agent: *228
Mediapartners-GoogleGoogleDopasowanie reklam AdSense do treści stronyMediapartners-GoogleTak, ale ignoruje User-agent: *81
AdsBot-Google-MobileGoogleOcena jakości mobilnych stron docelowych reklamAdsBot-Google-MobileTak, ale ignoruje User-agent: *39
AdIdxBotMicrosoftKontrola jakości stron docelowych reklam Microsoft AdvertisingadidxbotTak0
DotBotMozCrawler budujący indeks linków Moz Link ExplorerDotBotBrak aktualnej jednoznacznej dokumentacji operatora0
rogerbotMozAudyt stron dodanych do kampanii Moz Pro przez właścicielirogerbotBrak aktualnej jednoznacznej dokumentacji operatora0
OAI-AdsBotOpenAIWeryfikacja stron docelowych reklam w ChatGPTOAI-AdsBotTak*0
UptimeRobotUptimeRobotMonitoring dostępności strony, zwykle uruchomiony przez właścicielaUptimeRobotNie dotyczy51 781
AwarioBotAwarioMonitoring wzmianek o markachAwarioBotTak1 601
NetcraftSurveyAgent
CheckMarkNetwork
StormIntelCrawler
OI-Crawler
badania bezpieczeństwa i inwentaryzacja domen
Skanowanie publicznej powierzchni serwisów, statystyki domenwłasne tokenyBrak jednoznacznej dokumentacji64
Buck (Hypefactors)
RecordedFuture
monitoring mediów
Śledzenie wzmianek o markach i tematachwłasne tokenyBrak jednoznacznej dokumentacji36
Google-SafetyGoogleWykrywanie malware i nadużyć pod publicznie udostępnianymi linkamibrakNie – Google deklaruje ignorowanie robots.txt0
archive.org_botInternet ArchiveArchiwizacja stron w Wayback Machinearchive.org_botBrak jednoznacznej aktualnej dokumentacji operatora381
ClueWeb-CrawlerCarnegie Mellon UniversityBudowa publicznego korpusu ClueWeb do badań nad wyszukiwaniemClueWeb-CrawlerTak82
Aranea Web-Crawled CorporaSłowacka Akademia NaukBudowa publicznych korpusów językowychbrakBrak jednoznacznej dokumentacji79
curl
Wget
python-requests
Scrapy
Go-http-client
axios i pokrewne
dowolny skrypt
Nie boty, tylko biblioteki do pobierania stron. Za każdą stoi człowiek albo cudzy programbrakNie dotyczy – zależy od skryptu, biblioteka niczego nie egzekwuje22 176
Google-InspectionToolGoogleNarzędzia testowe Search ConsoleGoogle-InspectionTool
Googlebot
Tak4 874
Chrome Privacy Preserving Prefetch ProxyGooglePrefetch stron dla użytkowników Chrome. Wygląda jak bot, stoi za nim przeglądarkabrakNie dotyczy1 234
Inoreader
Feedly
czytniki RSS
Pobranie kanału RSS w imieniu subskrybentawłasne tokenyZwykle tak321
WP Rocket Pre-fetchWP RocketWtyczka cache prefetchująca linki z Twojej strony. Też Twój własny ruchbrakNie dotyczy43
biblioteka datasets (Hugging Face)dowolny użytkownikBiblioteka Pythona do budowania zbiorów danych. Ktoś pobierał treść do własnego zestawubrakNie dotyczy – zależy od skryptu14
APIs-GoogleGoogleDostarczanie powiadomień z interfejsów API Google, np. PubSubHubbubAPIs-GoogleTak, ale ignoruje User-agent: *0
Google-Site-VerificationGoogleSprawdzenie potwierdzenia własności strony w Search Consolebrak, fetcher użytkownikaZwykle nie0
2ip bot2ip.ioUsługa sprawdzania adresów IP i stron2ip botBrak jednoznacznej dokumentacji37 237
br-crawler
crawler_eb_germany
Hermes-SVF-static-crawler
VelenPublicWebCrawler i inne
nieustalony
Brak dokumentacji i możliwości ustalenia operatora. Oceniaj po zachowaniubrakNieznane3 900
BingSapphireMicrosoft? – do weryfikacjiBrak na oficjalnej liście crawlerów Microsoftu. Sprawdź adres IPbrakBrak jednoznacznej dokumentacji76
EmailCrawlernieznanyZbieranie adresów e-mail. Jedyna pozycja, przy której blokada nie wymaga namysłuEmailCrawlerNieznane; jeśli chcesz mieć pewność, blokuj na serwerze21

Pilne, jeśli blokujesz NotebookLM. 16 lipca 2026 Google zmienił nazwę user-agenta z Google-NotebookLM na Google-GeminiNotebook. Stara nazwa jest wspierana tylko przez okres przejściowy wskazywany na sierpień 2026. Reguła w .htaccess albo w WAF-ie napisana na starą nazwę wkrótce przestanie cokolwiek łapać. U mnie ten bot wykonał 3310 żądań, więc nie jest to problem teoretyczny.

Jak powstała ta tabela

Funkcje i tokeny sprawdziłam w dokumentacji operatorów wszędzie tam, gdzie taka dokumentacja istnieje. Pozycje bez oficjalnego źródła opisuję na podstawie pełnego user-agenta, adresu podanego w jego ciągu i zachowania w logach – brak potwierdzenia jest wyraźnie oznaczony. Dane o częstotliwości pochodzą z ponad 1,8 mln żądań w logach podrez.pl za okres od 2 lutego do 5 sierpnia 2026.

Część pozycji grupuje kilka pokrewnych user-agentów jednego operatora, więc nazw jest więcej niż wierszy.

Opracowanie: Ewelina Podrez-Siama, SEO od 2009 roku. Ostatnia weryfikacja: 6 sierpnia 2026.

Źródła: dokumentacja operatorów botówDwadzieścia dwa dokumenty, w których sprawdzałam tokeny, funkcje i zasady. Sprawdź sama, jeśli coś budzi wątpliwość.

OpenAI
Overview of OpenAI Crawlers – GPTBot, OAI-SearchBot, ChatGPT-User, OAI-AdsBot
Advertiser Guidance for Allowing OpenAI Web Crawlers – token OAI-AdsBot i respektowanie reguł

Anthropic
Does Anthropic crawl data from the web… – ClaudeBot, Claude-User, Claude-SearchBot

Perplexity
Perplexity Crawlers – PerplexityBot, Perplexity-User, listy adresów IP

Google
Google's common crawlers – Googlebot, GoogleOther, Google-Extended, Google-CloudVertexBot
Google special-case crawlers – AdsBot, Mediapartners, APIs-Google, Google-Safety
Google user-triggered fetchers – Gemini Notebook, Google-Agent, GoogleProducer
Verify requests from Google – trzy klasy botów, trzy pliki JSON, odwrotny DNS
Changelog dokumentacji crawlerów – daty zmian, m.in. 16.07.2026 i 20.03.2026
AI Features and Your Website – dyrektywy podglądu wobec AI Overviews i AI Mode

Apple
About Applebot – Applebot, Applebot-Extended, dziedziczenie reguł po Googlebocie

Amazon
About Amazonbot – Amazonbot, Amzn-SearchBot, Amzn-User, trzy listy adresów IP

Mistral AI
Mistral crawlers – MistralAI-Training, MistralAI-Index, MistralAI-User

Microsoft
Overview of Bing crawlers – bingbot, adidxbot, BingPreview, MicrosoftPreview, BingVideoPreview

Pozostali operatorzy
Common Crawl – CCBot
Parallel – ShapBot i Shap-User
Slack Robots – trzy agenty i deklaracja o nierespektowaniu reguł
Yep – YepBot
Pinterest – Pinterestbot
Diffbot – Does Diffbot respect robots.txt?
Brave Search Crawler

Kontekst
Cloudflare – Your site, your rules: new AI traffic options – kategorie Search, Agent i Training oraz zmiana domyślnych ustawień od 15.09.2026

Wszystkie odnośniki sprawdzone 6 sierpnia 2026. Pozycje w tabeli oznaczone jako „brak jednoznacznej dokumentacji" nie mają odpowiednika na tej liście – opisuję je wyłącznie na podstawie user-agenta i zachowania w logach.

 

* OAI-AdsBot. Dokumentacja OpenAI dla deweloperów wymienia jako tokeny sterujące wyłącznie GPTBot i OAI-SearchBot, ale artykuł pomocy dla reklamodawców podaje wprost przykład User-agent: OAI-AdsBot i deklaruje respektowanie reguł. Opieram się na tym drugim, bo jest nowszy i bardziej szczegółowy.

** Gemini Notebook. Wszystkie 3310 żądań przyszło pod starą nazwą Google-NotebookLM. Nowa nie pojawiła się w moich logach ani razu.

*** Bravebot. Jedyna pozycja, przy której dokumentacja przeczy obserwacji. Strona pomocy Brave Search mówi, że jej crawler nie przedstawia się odrębnym user-agentem, a mimo to żądania podpisane Bravebot i odsyłające do search.brave.com notują niezależne rejestry i moje logi. Możliwe, że dokumentacja jest nieaktualna, ale bez potwierdzenia operatora nie wykluczam podszycia.

Kolumna „respektuje robots.txt". Opiera się na dokumentacji operatora, nie na moich testach. „Deklarowane" znaczy, że operator tak twierdzi, ale krążą raporty o odstępstwach. „Brak jednoznacznej dokumentacji" znaczy dokładnie to, co mówi – nie znalazłam wiarygodnego źródła i nie zgaduję.

Dlaczego robots.txt nie blokuje wszystkich botów AI?

Wpis w robots.txt nie działa tak samo na każdego bota. Crawlery chodzące po sieci z własnej inicjatywy zwykle się do niego stosują. Przy fetcherach uruchamianych przez użytkownika zaczynają się schody, bo tu każdy operator ma własną politykę.

  • Crawlery automatyczne

    Chodzą po sieci z inicjatywy operatora: GPTBot, ClaudeBot, PerplexityBot, Googlebot. Respektują robots.txt i to dla nich ten plik powstał.

  • Fetchery na żądanie użytkownika

    Pobierają stronę, bo konkretne działanie użytkownika tego wymagało. Tu operatorzy się różnią. Anthropic i Mistral dają osobne tokeny (Claude-User, MistralAI-User) i deklarują, że je respektują. Google, OpenAI, Perplexity i Amazon zaznaczają, że reguły mogą nie mieć zastosowania, bo żądanie inicjuje użytkownik.

  • Tokeny sterujące bez bota

    Google-Extended i Applebot-Extended nie wysyłają żadnych żądań. Wpisujesz je do robots.txt, ale w logach ich nie zobaczysz. Google-Extended obejmuje trening modeli Gemini oraz grounding, czyli podawanie treści modelowi w momencie odpowiedzi. Applebot-Extended dotyczy treningu modeli Apple.

Praktyczny wniosek: zanim zablokujesz fetcher uruchamiany przez użytkownika, sprawdź politykę konkretnego operatora. Disallow dla Claude-User albo MistralAI-User faktycznie zamyka drzwi, bo Anthropic i Mistral deklarują respektowanie tych tokenów. Przy Google, OpenAI, Perplexity i Amazonie ten sam wpis jest prośbą, więc jeśli potrzebujesz pewności, dołóż regułę na poziomie serwera albo WAF-a. Jak to sprawdzić u siebie, opisałam w tekście o analizie logów serwera.

Podejrzane user-agenty: nazwy niemożliwe i wymagające weryfikacji

W moich logach trafiło się pięć nazw, których nie da się pogodzić z dokumentacją ich rzekomych operatorów. Warto je znać, bo wyglądają wiarygodnie i łatwo przepuścić je przez filtr.

Dwie z tych nazw nie mogą pochodzić od operatora, bo jego własna dokumentacja mówi, że te tokeny w ogóle nie crawlują. Trzy kolejne nie występują w aktualnej dokumentacji swoich rzekomych operatorów – to nie dowodzi podszycia, ale każe sprawdzić adres IP, zanim uznasz je za prawdziwe.

Nazwa w loguStatusDlaczegoCzego szukała u mnie
Google-ExtendedNiemożliwaToken sterujący w robots.txt, Google nie wysyła nim żądań/.aws/credentials
Applebot-ExtendedNiemożliwaApple pisze wprost, że ten token nie crawluje stron/privatekey.key
BingIndexCrawlerDo weryfikacjiNazwa nie występuje w aktualnej dokumentacji crawlerów Microsoftu; Bing crawluje jako bingbotzwykłe podstrony
anthropic-aiDo weryfikacjiNazwa spoza aktualnej dokumentacji Anthropic/secrets.yml
Claude-WebDo weryfikacjiNazwa spoza aktualnej dokumentacji Anthropic/_profiler/open, /info.php

Adresy pochodzą z logów podrez.pl, luty–sierpień 2026. Liczba wystąpień: Google-Extended 31, anthropic-ai 28, Claude-Web 20, BingIndexCrawler 10, Applebot-Extended 5.

Wzorzec jest czytelny: podejrzane żądania sięgają po tokeny, które nie są user-agentami, oraz po nazwy nieobecne w aktualnej dokumentacji operatorów. Warto przy tym rozróżniać intencje. Żądania podpisane jako Google-Extended czy anthropic-ai szukały u mnie plików z hasłami i konfiguracyjnych, więc to skaner. Sama niezgodność nazwy z dokumentacją nie musi jednak oznaczać złych zamiarów – dlatego rozstrzyga adres IP, a nie sama nazwa. Problem nie dotyczy zresztą wyłącznie mojej strony – Common Crawl wprost ostrzega w swojej dokumentacji, że zna przypadki crawlerów fałszywie podających się za CCBota, i zaleca weryfikację user-agenta.

Jak sprawdzić, czy bot jest prawdziwy: weryfikacja po adresie IP

User-agenta podrabia się w dziesięć sekund, więc sama nazwa nie dowodzi niczego. Pewność daje dopiero zestawienie nazwy z adresem IP i oficjalnymi zakresami operatora, a tam gdzie to możliwe – z odwrotnym i ponownym sprawdzeniem DNS. Google testuje też kryptograficzne uwierzytelnianie botów, czyli Web Bot Auth.

OperatorŹródło adresów
OpenAIopenai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json, openai.com/adsbot.json
Anthropicclaude.com/crawling/bots.json
Perplexityperplexity.com/perplexitybot.json, perplexity.com/perplexity-user.json
Google – crawlery zwykłecommon-crawlers.json; odwrotny DNS kończy się na googlebot.com
Google – crawlery specjalnespecial-crawlers.json; odwrotny DNS kończy się na google.com
Google – fetchery i agenty użytkownikaosobne pliki JSON; odwrotny DNS kończy się na google.com lub gae.googleusercontent.com
Mistralmistral.ai/mistralai-user-ips.json, mistral.ai/mistralai-index-ips.json; dla MistralAI-Training lista nie jest publikowana
Amazontrzy osobne listy: /ip-addresses/, /searchbot-ip-addresses/, /live-ip-addresses/
Paralleldocs.parallel.ai/resources/shapbot.json
Microsoftnarzędzie Verify Bingbot w Bing Webmaster Tools; odwrotny DNS kończy się na search.msn.com
Common Crawlindex.commoncrawl.org/ccbot.json; odwrotny DNS kończy się na crawl.commoncrawl.org

Jak zablokować boty AI w robots.txt? Gotowe przykłady.

Zanim cokolwiek zablokujesz: w większości przypadków tego nie rekomenduję. Blokada odcina Cię od odpowiedzi generatywnych, a więc od kanału, w którym Twoja marka może zostać wymieniona i zacytowana. Dla większości firm, ekspertów i sklepów to strata, nie zysk.

Wyjątki są realne i dotyczą przede wszystkim wydawców, portali i mediów, czyli tych, którzy żyją ze sprzedaży treści albo z ruchu na własnej stronie. Tam blokada bywa uzasadnioną decyzją biznesową – ale nadal decyzją, a nie ustawieniem domyślnym.

Poniższe konfiguracje traktuj więc jako punkt wyjścia do świadomego wyboru, nie jako zalecenie.

Pierwszy wariant ogranicza najważniejsze crawlery wykorzystywane do treningu modeli. Drugi blokuje osobno identyfikowane boty i fetchery systemów AI, zostawiając dostęp Googlebotowi, bingbotowi i Applebotowi. Oba są punktem wyjścia, nie uniwersalną konfiguracją dla każdej witryny.

Wariant 1 · Bez treningu

chronię treść

Wpuszczam wszystko, co może mnie cytować, i odcinam zbieranie treści pod uczenie modeli.

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Bytespider
User-agent: Meta-ExternalAgent
User-agent: MistralAI-Training
User-agent: cohere-ai
User-agent: CohereBot
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /

User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: DuckAssistBot
User-agent: MistralAI-Index
User-agent: MistralAI-User
User-agent: Amzn-SearchBot
User-agent: ShapBot
Allow: /
Cena: przy crawlerach wielofunkcyjnych, takich jak Amazonbot czy CCBot, blokada wyłącza też zastosowania inne niż trening.

Wariant 2 · Osobne boty AI

Google i Apple zostają

Blokuję osobne crawlery treningowe, indeksy AI i fetchery użytkowników, ale zostawiam otwarte klasyczne wyszukiwarki. To nie usuwa strony z AI Overviews, AI Mode ani z generatywnych odpowiedzi Apple.

# wyszukiwarki zostają
User-agent: Googlebot
User-agent: bingbot
User-agent: Applebot
Allow: /

# trening modeli
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Bytespider
User-agent: Meta-ExternalAgent
User-agent: MistralAI-Training
User-agent: cohere-ai
User-agent: CohereBot
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /

# indeksy odpowiedzi generatywnych
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: MistralAI-Index
User-agent: Meta-WebIndexer
User-agent: DuckAssistBot
User-agent: Amzn-SearchBot
User-agent: LinkupBot
User-agent: ShapBot
User-agent: YouBot
User-agent: Diffbot
Disallow: /

# pobrania na żądanie użytkownika
User-agent: ChatGPT-User
User-agent: Claude-User
User-agent: Perplexity-User
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amzn-User
Disallow: /
Efekt: ograniczasz dostęp systemom, które mają własne boty – ChatGPT, Claude, Perplexity, Mistral. To nie jest pełne wyjście z odpowiedzi generatywnych: AI Overviews i AI Mode zasila Googlebot, Copilota zasila bingbot, a Applebot bywa źródłem kontekstu dla odpowiedzi Apple.

Drugi wariant ma dziurę i lepiej o niej wiedzieć od razu. Ostatnia grupa to fetchery uruchamiane przez użytkownika, a część z nich może zignorować robots.txt. Gemini Notebook i Google-Agent nie mają nawet własnego tokenu. Jeśli blokada ma być szczelna, trzeba ją dołożyć na poziomie serwera. Przykład dla Apache i pliku .htaccess:

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} (Google-GeminiNotebook|Google-NotebookLM|Google-Agent|GoogleProducer|ChatGPT-User|Perplexity-User|Amzn-User|Meta-ExternalFetcher|Shap-User) [NC]
RewriteRule ^ - [F,L]

Jedno zastrzeżenie, o którym łatwo zapomnieć: robots.txt nie służy do ochrony danych. Plik jest publiczny, dyrektywy nie są kontrolą dostępu, a zablokowany adres i tak może trafić do indeksu na podstawie linków z zewnątrz. Sekcje faktycznie prywatne zabezpiecza się logowaniem po stronie serwera.

Uwaga na grupy i na wildcard. Jeśli dla bota istnieje bardziej konkretna pasująca grupa, ma ona pierwszeństwo przed User-agent: *. Wildcard obowiązuje dopiero wtedy, gdy nic konkretniejszego nie pasuje. Fetchery uruchamiane przez użytkownika to osobny przypadek: część respektuje dedykowane tokeny, część może je pomijać i wymaga reguły na poziomie serwera lub WAF-a.

Jak ograniczyć AI Overviews? O nosnippet, data-nosnippet i max-snippet

robots.txt informuje zgodne boty, czy powinny pobierać stronę. Dyrektywy meta sterują natomiast indeksowaniem i tym, jakie fragmenty mogą trafić do wyników oraz do funkcji AI. To dwie różne warstwy i przy AI Overviews druga bywa jedyną, jaka Ci zostaje.

Rzecz kluczowa

Nie istnieje osobny opt-out z AI Overviews i AI Mode, który zostawiałby nienaruszoną zwykłą obecność w Google. Zasila je ten sam Googlebot i ten sam indeks, a Google-Extended dotyczy wyłącznie treningu Gemini i groundingu, więc jego blokada nic tu nie zmienia.

Możesz natomiast ograniczyć, ile treści trafia do tych funkcji. Google wymienia cztery dyrektywy: nosnippet, data-nosnippet, max-snippet i noindex. Każda z nich działa jednocześnie na zwykłe wyniki i na funkcje AI – nie da się rozdzielić jednego od drugiego.

DyrektywaCo robiCzym płacisz
nosnippetBlokuje wyświetlanie fragmentu strony we wszystkich formach wyników, łącznie z AI Overviews i AI ModeZnika też zwykły opis pod tytułem w wynikach i szansa na direct answer
data-nosnippetTo samo, ale tylko dla oznaczonego fragmentu HTMLReszta strony działa normalnie – najbardziej precyzyjne narzędzie z tego zestawu
max-snippet:NOgranicza długość fragmentu do N znaków i tym samym ilość treści podawanej modelowiPrzy niskiej wartości efekt zbliżony do nosnippet
noindexUsuwa stronę ze wszystkich form wyników Google, także z AI Overviews i AI ModeStrona znika również ze zwykłych wyników wyszukiwania
noarchiveU Amazona oznacza „nie używaj tej strony do trenowania modeli"Działa tylko u operatorów, którzy tę dyrektywę honorują

Apple honoruje nosnippet jako rezygnację z wykorzystania treści w odpowiedziach generatywnych opartych na bieżących informacjach. Amazon deklaruje respektowanie noarchive, noindex i none, ale nie obsługuje crawl-delay.

Najbardziej precyzyjne narzędzie to data-nosnippet. Wyłącza z podglądów i z bezpośredniego użycia przez funkcje AI tylko oznaczony fragment strony. Stosuj je świadomie: te same akapity, które najłatwiej zastąpiłyby wizytę u Ciebie – definicje, listy kroków, tabele – są zwykle tymi, dzięki którym w ogóle jesteś cytowana.

Co boty AI pobierają z Twojej strony: treść czy pliki?

Sama liczba wizyt niewiele mówi. Ciekawsze, ile z nich trafia w podstronę z treścią, a ile w pliki CSS, obrazki i końcówki API.

BotUdane żądaniaUdział wejść w treść
Perplexity-User5791,2%
CCBot40582,5%
ChatGPT-User587073,9%
PerplexityBot212761,1%
Claude-User38960,2%
OAI-SearchBot315733,7%
GPTBot528332,0%
ClaudeBot224428,6%
Google-GeminiNotebook294520,0%
Applebot319215,0%
Amazonbot333714,6%

Logi podrez.pl, 02.02–05.08.2026. Perplexity-User, ChatGPT-User i Claude-User trafiają głównie prosto w treść, ale sama klasa bota nie przesądza zachowania: CCBot ma wysoki udział wejść w treść, a Gemini Notebook niski.

Często zadawane pytania

Jak sprawdzić, jaki bot odwiedził moją stronę?

Nazwa bota znajduje się w polu user-agent w logu dostępowym serwera, zwykle w pliku access.log lub domena.pl.log w katalogu logs. Skopiuj nazwę i wyszukaj ją w tabeli powyżej. Jeśli chcesz mieć pewność, że bot jest prawdziwy, porównaj adres IP z zakresami publikowanymi przez operatora.

Czy zablokowanie GPTBota usuwa mnie z wyników ChatGPT?

Nie. GPTBot odpowiada za zbieranie treści pod trening modeli, a za obecność w wynikach wyszukiwania ChatGPT odpowiada OAI-SearchBot. To dwa niezależne tokeny i można je ustawić różnie: zablokować trening, zostawić wyszukiwanie. Analogiczny trójpodział stosują Anthropic i Mistral. Amazon również rozdziela ruch na trzy agenty, ale jego Amazonbot jest crawlerem wielofunkcyjnym, który do treningu tylko może być wykorzystywany. Perplexity rozdziela natomiast tylko indeks wyszukiwania od pobrań na żądanie użytkownika i nie ma udokumentowanego crawlera treningowego.

Dlaczego nie widzę Google-Extended w logach?

Bo Google-Extended nie jest botem. To token sterujący w robots.txt, którym decydujesz o wykorzystaniu treści do trenowania modeli Gemini i do groundingu. Samo pobieranie stron wykonują zwykłe roboty Google. Jeśli mimo to widzisz tę nazwę w logu, patrzysz na podszywacza.

Jak wypisać się z AI Overviews?

Przez robots.txt się nie da. AI Overviews i AI Mode korzystają ze zwykłego indeksu Google, budowanego przez Googlebota, a token Google-Extended dotyczy wyłącznie trenowania modeli Gemini i groundingu. Jedyne dostępne narzędzie to dyrektywy podglądu: nosnippet, data-nosnippet, max-snippet i noindex. Każda z nich ogranicza też zwykły wynik wyszukiwania, więc wyjście z AI Overviews oznacza częściowe wyjście z Google.

Czy blokada w robots.txt zatrzyma każdego bota AI?

Nie. Fetchery uruchamiane przez użytkownika, takie jak Gemini Notebook czy ChatGPT-User, mogą pomijać robots.txt, ponieważ żądanie inicjuje człowiek, a nie automat. Żeby je zatrzymać, potrzebujesz reguły na poziomie serwera, w konfiguracji WAF-a albo w pliku .htaccess.

Co się zmieniło z NotebookLM?

16 lipca 2026 Google zaktualizował dokumentację i zmienił nazwę user-agenta z Google-NotebookLM na Google-GeminiNotebook, po tym jak sam produkt został przemianowany na Gemini Notebook. Stara nazwa jest wspierana tylko przez okres przejściowy wskazywany na sierpień 2026, więc reguły napisane na starą nazwę trzeba zaktualizować.

Sama nazwa w logu to dopiero początek. Znacznie ciekawsze bywa to, co ten bot dostał w odpowiedzi – i czy w ogóle dostał. Jak to sprawdzić i co znalazłam u siebie, opisałam w tekście o analizie logów serwera.

Nie wiesz, które boty wpuszcza Twoja strona?

Analizę logów pod kątem botów AI, crawlerów wyszukiwarek, narzędzi SEO i podejrzanego ruchu robię w ramach audytu. Jeśli wolisz zacząć od rozmowy, umów krótkie spotkanie.

Ostatnia weryfikacja: 6 sierpnia 2026 Tokeny i funkcje botów sprawdzone w dokumentacji operatorów: OpenAI, Anthropic, Perplexity, Google, Apple, Amazon, Common Crawl, Mistral, Diffbot, Parallel, Slack, Yep, Pinterest. Pozycje oznaczone jako „brak jednoznacznej dokumentacji" nie mają potwierdzenia u operatora i opisuję je wyłącznie na podstawie obserwacji. Brave i Linkup: funkcje ocenione na podstawie dokumentacji produktu, user-agentów i moich logów, bez aktualnej dokumentacji samego crawlera. Dane obserwacyjne pochodzą z logów dostępowych podrez.pl za okres 02.02–05.08.2026, ponad 1,8 mln żądań.

Historia tej strony 06.08.2026 – pierwsza wersja.

Kalendarium zmian u operatorów 16.07.2026 – Google zmienił nazwę user-agenta NotebookLM na Google-GeminiNotebook; stara nazwa wspierana przez okres przejściowy.
01.07.2026 – Cloudflare wprowadził podział botów na kategorie Search, Agent i Training.
07.04.2026 – Anthropic rozbił dokumentację na trzy boty, dodając Claude-SearchBot i Claude-User.
20.03.2026 – Google udokumentował user-agenta Google-Agent.

Poznajmy się

Avatar of Ewelina Podrez-Siama

Ewelina Podrez-Siama

Strateg SEO od 2009 roku, założycielka agencji Fox Strategy. Projektuje strategie widoczności dla marek enterprise, e-commerce i projektów contentowych – łącząc SEO, dane i wiedzę o tym, jak modele językowe interpretują marki. Pracowała m.in. dla Allegro, mBanku, PayU i Yves Rocher.

Autorka czterech książek o SEO, w tym najnowszej „Marka osobista w czasach AI i generatywnego wyszukiwania" (Onepress 2026), oraz trzech bestsellerowych książek kucharskich jako Ms. Fox.

Gościnna wykładowczyni przedmiotu „Skuteczne SEO" na Uniwersytecie WSB Merito, prelegentka na I❤️Marketing, semKRK i Festiwalu SEO, Head Judge w kategorii SEO podczas semKRK Awards 2025. Publikuje w Forbesie, Dzienniku Gazecie Prawnej i Firmove by ING.

Poznaj Ewelinę · w mediach