Zaglądasz do logów i widzisz nieznaną nazwę? Ta strona odpowiada na jedno pytanie: co to za bot i co z nim zrobić. Sprawdź operatora, funkcję bota, zasady robots.txt i liczbę żądań, które odnotowałam u siebie. Kolumna „logi podrez.pl” pokaże, ile żądań z nazwą danego bota w polu user-agent odnotowałam na swojej stronie między lutym a sierpniem 2026, ale czytaj te liczby jako podpowiedź, czego się spodziewać, nie jako średnią dla rynku.
Lista botów i user-agentów [wyszukiwarka]
W tabeli znajdziesz crawlery AI, klasyczne wyszukiwarki, narzędzia SEO, podglądy linków z komunikatorów, monitoring i zwykłe biblioteki HTTP. Zawęź kategorię albo wpisz nazwę – tabela filtruje się na bieżąco, a przy jednym trafieniu dostaniesz gotową odpowiedź, a tam, gdzie bot ma użyteczny token – również wpis do robots.txt.
Co oznaczają kategorie botów?Jedenaście klas botów, po jednym zdaniu na każdą.
- AI: trening
- zbiera treść, żeby modele się na niej uczyły
- AI: indeksy i odpowiedzi
- buduje indeks, z którego system generatywny cytuje
- Na żądanie użytkownika
- pobiera stronę, bo ktoś właśnie o coś zapytał
- Tokeny bez bota
- nie wysyłają żądań, służą tylko do wpisania w robots.txt
- Wyszukiwarki
- klasyczne wyszukiwarki i ich boty pomocnicze
- Podglądy linków
- robią miniaturkę linku w komunikatorze albo social mediach
- SEO i marketing
- narzędzia SEO, audyty i weryfikacja stron reklamowych
- Monitoring i bezpieczeństwo
- dostępność serwisu, wzmianki o marce, skanowanie nadużyć
- Badania i archiwa
- korpusy naukowe i archiwizacja stron
- Narzędzia i biblioteki
- ruch uruchamiany przez przeglądarkę, wtyczkę, aplikację albo własny skrypt
- Nieznane lub podejrzane
- operator, funkcja albo autentyczność user-agenta nie zostały potwierdzone
Tabelę można przewijać w bok →
| Bot i operator | Funkcja | Token w robots.txt | Respektuje | Żądania podrez.pl, 02.02–05.08.2026 |
|---|---|---|---|---|
| GPTBotOpenAI | Trening modeli | GPTBot | Tak | 9 367 |
| AmazonbotAmazon | Ulepszanie produktów Amazona, może służyć do treningu modeli | Amazonbot | Tak | 5 617 |
| ClaudeBotAnthropic | Trening modeli | ClaudeBot | Tak | 4 398 |
| meta-externalagentMeta | Zbieranie treści, m.in. pod trening | Meta-ExternalAgent | Deklarowane | 1 027 |
| BytespiderByteDance | Zbieranie treści pod modele ByteDance | Bytespider | Brak jednoznacznej dokumentacji | 619 |
| CCBotCommon Crawl | Otwarty korpus stron, wykorzystywany m.in. do treningu | CCBot | Tak | 483 |
| cohere-ai CohereBotCohere | Zbieranie treści | cohere-ai CohereBot | Brak jednoznacznej dokumentacji | 36 |
| MistralAI-TrainingMistral AI | Trening modeli | MistralAI-Training | Tak | 0 |
| LinkupBotLinkup (linkup.so) | Deklarowany indeks dla API wyszukiwania używanego przez aplikacje AI | LinkupBot | Brak jednoznacznej dokumentacji | 4 935 |
| OAI-SearchBotOpenAI | Indeks wyszukiwania ChatGPT | OAI-SearchBot | Tak | 4 527 |
| ShapBotParallel | Indeks wyszukiwania Parallel, zasila jego API dla agentów AI | ShapBot | Tak | 2 990 |
| PerplexityBotPerplexity | Indeks wyszukiwania | PerplexityBot | Tak | 2 353 |
| YouBotYou.com | Indeks wyszukiwania | YouBot | Tak | 108 |
| Google-CloudVertexBotGoogle | Crawl zamawiany przez właściciela strony pod Vertex AI | Google-CloudVertexBot | Tak | 35 |
| Claude-SearchBotAnthropic | Indeks wyszukiwania | Claude-SearchBot | Tak | 28 |
| DuckAssistBotDuckDuckGo | Odpowiedzi generatywne w DuckDuckGo | DuckAssistBot | Tak | 14 |
| meta-webindexerMeta | Indeks wyników wyszukiwania Meta AI | Meta-WebIndexer | Brak jednoznacznej dokumentacji | 13 |
| DiffbotDiffbot | Wyszukiwarka i Knowledge Graph Diffbota, nie służy do treningu | Diffbot | Tak, z możliwością wyjątków umownych | 3 |
| MistralAI-IndexMistral AI | Indeks wyszukiwania dla Vibe | MistralAI-Index | Tak | 0 |
| ChatGPT-UserOpenAI | Pobranie na żądanie użytkownika | OpenAI nie dokumentuje jako tokenu sterującego | Może nie obowiązywać | 6 005 |
| Google-GeminiNotebook dawniej Google-NotebookLMGoogle | Pobranie źródeł dodanych przez użytkownika | brak, blokada tylko na serwerze | Zwykle nie | 3 310** |
| FeedFetcher-GoogleGoogle | Pobieranie kanałów RSS i Atom na żądanie użytkownika | brak, fetcher użytkownika | Zwykle nie | 1 322 |
| Claude-UserAnthropic | Pobranie na żądanie użytkownika | Claude-User | Tak | 572 |
| Google-Read-AloudGoogle | Odczytywanie strony na głos na żądanie użytkownika | brak, fetcher użytkownika | Zwykle nie | 276 |
| Diffbot-UserDiffbot | Pobranie na żądanie użytkownika narzędzia | Diffbot-User | Tak | 158 |
| MistralAI-UserMistral AI | Pobranie na żądanie użytkownika Vibe, z linkiem do źródła | MistralAI-User | Tak | 148 |
| Perplexity-UserPerplexity | Pobranie na żądanie użytkownika | Perplexity-User | Zwykle nie | 89 |
| Google-AgentGoogle | Agenci Google wykonujący zadania na żądanie użytkownika | brak, blokada tylko na serwerze | Zwykle nie | 0 |
| Amzn-UserAmazon | Pobranie na żądanie użytkownika, np. pytanie do Alexy | Amzn-User | Może nie obowiązywać | 0 |
| meta-externalfetcherMeta | Pobranie na żądanie użytkownika | Meta-ExternalFetcher | Bywa pomijane | 0 |
| Google-PinpointGoogle | Pobranie źródeł dodanych przez użytkownika narzędzia Pinpoint | brak, fetcher użytkownika | Zwykle nie | 0 |
| Google-CWSGoogle | Fetcher powiązany z Chrome Web Store | brak, fetcher użytkownika | Zwykle nie | 0 |
| Shap-UserParallel | Pobranie strony na żądanie użytkownika Parallel | brak – Parallel opisuje go jako sygnał widoczności, nie mechanizm sterowania | Nie dotyczy | 0 |
| Google-ExtendedGoogle | Zgoda na trening Gemini i grounding. Każde wystąpienie tej nazwy w logach to podszycie | Google-Extended | Token sterujący, bez user-agenta | 31 wyłącznie podszycia |
| Applebot-ExtendedApple | Zgoda na trening Apple Intelligence. Każde wystąpienie tej nazwy w logach to podszycie | Applebot-Extended | Token sterujący, bez user-agenta | 5 wyłącznie podszycia |
| GooglebotGoogle | Wyszukiwarka, zasila też AI Overviews i AI Mode | Googlebot | Tak | 12 538 |
| bingbotMicrosoft | Wyszukiwarka Bing, zasila też Copilota | bingbot | Tak | 6 843 |
| ApplebotApple | Siri, Spotlight i Safari; zasila też odpowiedzi generatywne Apple | Applebot | Tak | 3 627 |
| BaiduspiderBaidu | Chińska wyszukiwarka; wariant -render renderuje JavaScript | Baiduspider | Tak | 2 546 |
| PetalBotHuawei | Wyszukiwarka Petal Search | PetalBot | Tak | 2 524 |
| YandexBotYandex | Wyszukiwarka Yandex | YandexBot | Tak | 1 725 |
| Googlebot-ImageGoogle | Indeksowanie grafik | Googlebot-Image Googlebot | Tak | 1 434 |
| SeznamBotSeznam | Czeska wyszukiwarka | SeznamBot | Tak | 1 146 |
| GoogleOtherGoogle | Crawler ogólnego przeznaczenia | GoogleOther | Tak | 681 |
| DuckDuckBotDuckDuckGo | Klasyczne wyniki wyszukiwania | DuckDuckBot | Tak | 666 |
| YandexRenderResourcesBot YandexImages YandexFavicons YaDirectFetcherYandex | Renderowanie JS, grafiki, favikony i strony docelowe reklam Yandex Direct | własne tokeny np. YandexImages | Tak | 483 |
| ExabotExalead? – do weryfikacji | Historycznie wyszukiwarka Exalead. Sprawdź pełny user-agent i podany w nim adres | Exabot | Brak jednoznacznej dokumentacji | 98 |
| BingPreview / bingbotMicrosoft | Zrzuty stron na potrzeby podglądów w Bingu. User-agent obserwowany w logach; aktualna dokumentacja pokazuje ten ruch jako bingbota | brak odrębnego tokenu; obowiązują reguły dla bingbota | Zgodnie z regułami bingbota | 88 |
| QwantbotQwant | Francuska wyszukiwarka nastawiona na prywatność | Qwantbot | Tak | 48 |
| Yahoo! SlurpYahoo | Wyszukiwarka Yahoo | Slurp | Tak | 9 |
| Y!J-DLCYahoo Japan? – do weryfikacji | Agent wiązany z Yahoo Japan, bez aktualnego potwierdzenia operatora | brak | Brak jednoznacznej dokumentacji | 38 |
| Bravebot***Brave? – niepotwierdzone | User-agent przypisywany indeksowi Brave Search; operator go nie dokumentuje | Bravebot | Brak jednoznacznej dokumentacji | 42 |
| Storebot-GoogleGoogle | Google Shopping | Storebot-Google | Tak | 12 |
| SogouSogou | Chińska wyszukiwarka | Sogou | Tak | 8 |
| Amzn-SearchBotAmazon | Wyszukiwanie w produktach Amazona, m.in. Alexa | Amzn-SearchBot | Tak | 5 |
| Googlebot-VideoGoogle | Indeksowanie wideo | Googlebot-Video Googlebot | Tak | 2 |
| MojeekBotMojeek | Niezależna wyszukiwarka z własnym indeksem | MojeekBot | Tak | 2 |
| BingVideoPreviewMicrosoft | Podglądy materiałów wideo w Bingu | BingVideoPreview | Tak | 0 |
| YepBotAhrefs / Yep | Wyszukiwarka Yep, obecnie tylko do żądań IndexNow. Indeks buduje AhrefsBot | YepBot | Tak, respektuje też Crawl-delay | 0 |
| PinterestbotPinterest | Indeksuje treści i produkty pod Piny, aktualizuje ceny i martwe linki | Pinterestbot | Tak; honoruje Crawl-delay do wartości 1, większe traktuje jak 1 | 0 |
| GoogleOther-Image GoogleOther-VideoGoogle | Odmiany GoogleOther dla publicznych obrazów i filmów | GoogleOther-Image GoogleOther-Video GoogleOther | Tak | 0 |
| GoogleProducerGoogle | Kanały skonfigurowane przez wydawcę w Google Publisher Center | brak, fetcher użytkownika | Zwykle nie | 0 |
| facebookexternalhitMeta | Podgląd linków udostępnianych w serwisach Meta | facebookexternalhit | Bywa pomijane | 4 479 |
| Slackbot-LinkExpanding Slack-ImgProxy SlackbotSlack | Podglądy linków, pobieranie obrazów i pozostałe żądania Slacka | brak | Nie – Slack deklaruje, że nie przetwarza robots.txt | 407 |
| SkypeUriPreviewMicrosoft | Podgląd linków w Skype | brak | Brak jednoznacznej dokumentacji | 327 |
| TwitterbotX (dawniej Twitter) | Podgląd linków w kartach X | Twitterbot | Brak jednoznacznej dokumentacji | 273 |
| LinkedInBotLinkedIn | Podgląd linków udostępnianych na LinkedInie | LinkedInBot | Brak jednoznacznej dokumentacji | 270 |
| WhatsAppMeta | Podgląd linków wysyłanych w WhatsAppie | brak | Brak jednoznacznej dokumentacji | 166 |
| DiscordbotDiscord | Podgląd linków na Discordzie | Discordbot | Brak jednoznacznej dokumentacji | 6 |
| MicrosoftPreviewMicrosoft | Podglądy stron w produktach Microsoftu | MicrosoftPreview | Tak | 0 |
| Google MessagesGoogle | Podgląd linków wysyłanych w Wiadomościach Google | brak, fetcher użytkownika | Zwykle nie | 0 |
| AhrefsSiteAuditAhrefs | Audyt techniczny zamówiony przez właściciela strony | AhrefsSiteAudit | Tak domyślnie; właściciel strony może to wyłączyć w ustawieniach audytu | 127 925 |
| Screaming Frog SEO Spiderużytkownik programu | Ręczny crawl, zwykle Twój własny albo agencji | Screaming Frog SEO Spider | Zależy od ustawień | 7 787 |
| BarkrowlerBabbar | Indeks linków | Barkrowler | Tak | 5 975 |
| AhrefsBotAhrefs | Indeks linków i treści dla Ahrefs oraz wyszukiwarki Yep | AhrefsBot | Tak | 5 347 |
| SemrushBotSemrush | Indeks linków i danych o widoczności | SemrushBot | Tak | 4 639 |
| serpstatbotSerpstat | Indeks linków zwrotnych | serpstatbot | Tak | 2 741 |
| MJ12botMajestic | Indeks linków | MJ12bot | Tak | 1 543 |
| DataForSeoBotDataForSEO | Indeks danych SEO sprzedawanych przez API | DataForSeoBot | Tak | 1 219 |
| SERankingBacklinksBotSE Ranking | Indeks linków zwrotnych | SERankingBacklinksBot | Tak | 752 |
| SiteAuditBotSemrush | Audyt techniczny na zlecenie | SiteAuditBot | Tak | 666 |
| SEBot-WASE Ranking | Crawler audytów technicznych SE Ranking | SEBot-WA | Tak domyślnie; właściciel strony może to zmienić | 528 |
| AdsBot-GoogleGoogle | Ocena jakości stron docelowych reklam | AdsBot-Google | Tak, ale ignoruje User-agent: * | 228 |
| Mediapartners-GoogleGoogle | Dopasowanie reklam AdSense do treści strony | Mediapartners-Google | Tak, ale ignoruje User-agent: * | 81 |
| AdsBot-Google-MobileGoogle | Ocena jakości mobilnych stron docelowych reklam | AdsBot-Google-Mobile | Tak, ale ignoruje User-agent: * | 39 |
| AdIdxBotMicrosoft | Kontrola jakości stron docelowych reklam Microsoft Advertising | adidxbot | Tak | 0 |
| DotBotMoz | Crawler budujący indeks linków Moz Link Explorer | DotBot | Brak aktualnej jednoznacznej dokumentacji operatora | 0 |
| rogerbotMoz | Audyt stron dodanych do kampanii Moz Pro przez właścicieli | rogerbot | Brak aktualnej jednoznacznej dokumentacji operatora | 0 |
| OAI-AdsBotOpenAI | Weryfikacja stron docelowych reklam w ChatGPT | OAI-AdsBot | Tak* | 0 |
| UptimeRobotUptimeRobot | Monitoring dostępności strony, zwykle uruchomiony przez właściciela | UptimeRobot | Nie dotyczy | 51 781 |
| AwarioBotAwario | Monitoring wzmianek o markach | AwarioBot | Tak | 1 601 |
| NetcraftSurveyAgent CheckMarkNetwork StormIntelCrawler OI-Crawlerbadania bezpieczeństwa i inwentaryzacja domen | Skanowanie publicznej powierzchni serwisów, statystyki domen | własne tokeny | Brak jednoznacznej dokumentacji | 64 |
| Buck (Hypefactors) RecordedFuturemonitoring mediów | Śledzenie wzmianek o markach i tematach | własne tokeny | Brak jednoznacznej dokumentacji | 36 |
| Google-SafetyGoogle | Wykrywanie malware i nadużyć pod publicznie udostępnianymi linkami | brak | Nie – Google deklaruje ignorowanie robots.txt | 0 |
| archive.org_botInternet Archive | Archiwizacja stron w Wayback Machine | archive.org_bot | Brak jednoznacznej aktualnej dokumentacji operatora | 381 |
| ClueWeb-CrawlerCarnegie Mellon University | Budowa publicznego korpusu ClueWeb do badań nad wyszukiwaniem | ClueWeb-Crawler | Tak | 82 |
| Aranea Web-Crawled CorporaSłowacka Akademia Nauk | Budowa publicznych korpusów językowych | brak | Brak jednoznacznej dokumentacji | 79 |
| curl Wget python-requests Scrapy Go-http-client axios i pokrewnedowolny skrypt | Nie boty, tylko biblioteki do pobierania stron. Za każdą stoi człowiek albo cudzy program | brak | Nie dotyczy – zależy od skryptu, biblioteka niczego nie egzekwuje | 22 176 |
| Google-InspectionToolGoogle | Narzędzia testowe Search Console | Google-InspectionTool Googlebot | Tak | 4 874 |
| RankMath Link CheckerRank Math | Wtyczka SEO sprawdzająca linki. Jeśli masz Rank Math, to Twój własny ruch | brak | Nie dotyczy | 1 408 |
| Chrome Privacy Preserving Prefetch ProxyGoogle | Prefetch stron dla użytkowników Chrome. Wygląda jak bot, stoi za nim przeglądarka | brak | Nie dotyczy | 1 234 |
| Inoreader Feedlyczytniki RSS | Pobranie kanału RSS w imieniu subskrybenta | własne tokeny | Zwykle tak | 321 |
| WP Rocket Pre-fetchWP Rocket | Wtyczka cache prefetchująca linki z Twojej strony. Też Twój własny ruch | brak | Nie dotyczy | 43 |
| biblioteka datasets (Hugging Face)dowolny użytkownik | Biblioteka Pythona do budowania zbiorów danych. Ktoś pobierał treść do własnego zestawu | brak | Nie dotyczy – zależy od skryptu | 14 |
| APIs-GoogleGoogle | Dostarczanie powiadomień z interfejsów API Google, np. PubSubHubbub | APIs-Google | Tak, ale ignoruje User-agent: * | 0 |
| Google-Site-VerificationGoogle | Sprawdzenie potwierdzenia własności strony w Search Console | brak, fetcher użytkownika | Zwykle nie | 0 |
| 2ip bot2ip.io | Usługa sprawdzania adresów IP i stron | 2ip bot | Brak jednoznacznej dokumentacji | 37 237 |
| br-crawler crawler_eb_germany Hermes-SVF-static-crawler VelenPublicWebCrawler i innenieustalony | Brak dokumentacji i możliwości ustalenia operatora. Oceniaj po zachowaniu | brak | Nieznane | 3 900 |
| BingSapphireMicrosoft? – do weryfikacji | Brak na oficjalnej liście crawlerów Microsoftu. Sprawdź adres IP | brak | Brak jednoznacznej dokumentacji | 76 |
| EmailCrawlernieznany | Zbieranie adresów e-mail. Jedyna pozycja, przy której blokada nie wymaga namysłu | EmailCrawler | Nieznane; jeśli chcesz mieć pewność, blokuj na serwerze | 21 |
Pilne, jeśli blokujesz NotebookLM. 16 lipca 2026 Google zmienił nazwę user-agenta z Google-NotebookLM na Google-GeminiNotebook. Stara nazwa jest wspierana tylko przez okres przejściowy wskazywany na sierpień 2026. Reguła w .htaccess albo w WAF-ie napisana na starą nazwę wkrótce przestanie cokolwiek łapać. U mnie ten bot wykonał 3310 żądań, więc nie jest to problem teoretyczny.
Jak powstała ta tabela
Funkcje i tokeny sprawdziłam w dokumentacji operatorów wszędzie tam, gdzie taka dokumentacja istnieje. Pozycje bez oficjalnego źródła opisuję na podstawie pełnego user-agenta, adresu podanego w jego ciągu i zachowania w logach – brak potwierdzenia jest wyraźnie oznaczony. Dane o częstotliwości pochodzą z ponad 1,8 mln żądań w logach podrez.pl za okres od 2 lutego do 5 sierpnia 2026.
Część pozycji grupuje kilka pokrewnych user-agentów jednego operatora, więc nazw jest więcej niż wierszy.
Opracowanie: Ewelina Podrez-Siama, SEO od 2009 roku. Ostatnia weryfikacja: 6 sierpnia 2026.
Źródła: dokumentacja operatorów botówDwadzieścia dwa dokumenty, w których sprawdzałam tokeny, funkcje i zasady. Sprawdź sama, jeśli coś budzi wątpliwość.
OpenAI
Overview of OpenAI Crawlers – GPTBot, OAI-SearchBot, ChatGPT-User, OAI-AdsBot
Advertiser Guidance for Allowing OpenAI Web Crawlers – token OAI-AdsBot i respektowanie reguł
Anthropic
Does Anthropic crawl data from the web… – ClaudeBot, Claude-User, Claude-SearchBot
Perplexity
Perplexity Crawlers – PerplexityBot, Perplexity-User, listy adresów IP
Google
Google's common crawlers – Googlebot, GoogleOther, Google-Extended, Google-CloudVertexBot
Google special-case crawlers – AdsBot, Mediapartners, APIs-Google, Google-Safety
Google user-triggered fetchers – Gemini Notebook, Google-Agent, GoogleProducer
Verify requests from Google – trzy klasy botów, trzy pliki JSON, odwrotny DNS
Changelog dokumentacji crawlerów – daty zmian, m.in. 16.07.2026 i 20.03.2026
AI Features and Your Website – dyrektywy podglądu wobec AI Overviews i AI Mode
Apple
About Applebot – Applebot, Applebot-Extended, dziedziczenie reguł po Googlebocie
Amazon
About Amazonbot – Amazonbot, Amzn-SearchBot, Amzn-User, trzy listy adresów IP
Mistral AI
Mistral crawlers – MistralAI-Training, MistralAI-Index, MistralAI-User
Microsoft
Overview of Bing crawlers – bingbot, adidxbot, BingPreview, MicrosoftPreview, BingVideoPreview
Pozostali operatorzy
Common Crawl – CCBot
Parallel – ShapBot i Shap-User
Slack Robots – trzy agenty i deklaracja o nierespektowaniu reguł
Yep – YepBot
Pinterest – Pinterestbot
Diffbot – Does Diffbot respect robots.txt?
Brave Search Crawler
Kontekst
Cloudflare – Your site, your rules: new AI traffic options – kategorie Search, Agent i Training oraz zmiana domyślnych ustawień od 15.09.2026
Wszystkie odnośniki sprawdzone 6 sierpnia 2026. Pozycje w tabeli oznaczone jako „brak jednoznacznej dokumentacji" nie mają odpowiednika na tej liście – opisuję je wyłącznie na podstawie user-agenta i zachowania w logach.
* OAI-AdsBot. Dokumentacja OpenAI dla deweloperów wymienia jako tokeny sterujące wyłącznie GPTBot i OAI-SearchBot, ale artykuł pomocy dla reklamodawców podaje wprost przykład User-agent: OAI-AdsBot i deklaruje respektowanie reguł. Opieram się na tym drugim, bo jest nowszy i bardziej szczegółowy.
** Gemini Notebook. Wszystkie 3310 żądań przyszło pod starą nazwą Google-NotebookLM. Nowa nie pojawiła się w moich logach ani razu.
*** Bravebot. Jedyna pozycja, przy której dokumentacja przeczy obserwacji. Strona pomocy Brave Search mówi, że jej crawler nie przedstawia się odrębnym user-agentem, a mimo to żądania podpisane Bravebot i odsyłające do search.brave.com notują niezależne rejestry i moje logi. Możliwe, że dokumentacja jest nieaktualna, ale bez potwierdzenia operatora nie wykluczam podszycia.
Kolumna „respektuje robots.txt". Opiera się na dokumentacji operatora, nie na moich testach. „Deklarowane" znaczy, że operator tak twierdzi, ale krążą raporty o odstępstwach. „Brak jednoznacznej dokumentacji" znaczy dokładnie to, co mówi – nie znalazłam wiarygodnego źródła i nie zgaduję.
Dlaczego robots.txt nie blokuje wszystkich botów AI?
Wpis w robots.txt nie działa tak samo na każdego bota. Crawlery chodzące po sieci z własnej inicjatywy zwykle się do niego stosują. Przy fetcherach uruchamianych przez użytkownika zaczynają się schody, bo tu każdy operator ma własną politykę.
Crawlery automatyczne
Chodzą po sieci z inicjatywy operatora: GPTBot, ClaudeBot, PerplexityBot, Googlebot. Respektują
robots.txti to dla nich ten plik powstał.Fetchery na żądanie użytkownika
Pobierają stronę, bo konkretne działanie użytkownika tego wymagało. Tu operatorzy się różnią. Anthropic i Mistral dają osobne tokeny (
Claude-User,MistralAI-User) i deklarują, że je respektują. Google, OpenAI, Perplexity i Amazon zaznaczają, że reguły mogą nie mieć zastosowania, bo żądanie inicjuje użytkownik.Tokeny sterujące bez bota
Google-ExtendediApplebot-Extendednie wysyłają żadnych żądań. Wpisujesz je dorobots.txt, ale w logach ich nie zobaczysz. Google-Extended obejmuje trening modeli Gemini oraz grounding, czyli podawanie treści modelowi w momencie odpowiedzi. Applebot-Extended dotyczy treningu modeli Apple.
Praktyczny wniosek: zanim zablokujesz fetcher uruchamiany przez użytkownika, sprawdź politykę konkretnego operatora. Disallow dla Claude-User albo MistralAI-User faktycznie zamyka drzwi, bo Anthropic i Mistral deklarują respektowanie tych tokenów. Przy Google, OpenAI, Perplexity i Amazonie ten sam wpis jest prośbą, więc jeśli potrzebujesz pewności, dołóż regułę na poziomie serwera albo WAF-a. Jak to sprawdzić u siebie, opisałam w tekście o analizie logów serwera.
Podejrzane user-agenty: nazwy niemożliwe i wymagające weryfikacji
W moich logach trafiło się pięć nazw, których nie da się pogodzić z dokumentacją ich rzekomych operatorów. Warto je znać, bo wyglądają wiarygodnie i łatwo przepuścić je przez filtr.
Dwie z tych nazw nie mogą pochodzić od operatora, bo jego własna dokumentacja mówi, że te tokeny w ogóle nie crawlują. Trzy kolejne nie występują w aktualnej dokumentacji swoich rzekomych operatorów – to nie dowodzi podszycia, ale każe sprawdzić adres IP, zanim uznasz je za prawdziwe.
| Nazwa w logu | Status | Dlaczego | Czego szukała u mnie |
|---|---|---|---|
Google-Extended | Niemożliwa | Token sterujący w robots.txt, Google nie wysyła nim żądań | /.aws/credentials |
Applebot-Extended | Niemożliwa | Apple pisze wprost, że ten token nie crawluje stron | /privatekey.key |
BingIndexCrawler | Do weryfikacji | Nazwa nie występuje w aktualnej dokumentacji crawlerów Microsoftu; Bing crawluje jako bingbot | zwykłe podstrony |
anthropic-ai | Do weryfikacji | Nazwa spoza aktualnej dokumentacji Anthropic | /secrets.yml |
Claude-Web | Do weryfikacji | Nazwa spoza aktualnej dokumentacji Anthropic | /_profiler/open, /info.php |
Adresy pochodzą z logów podrez.pl, luty–sierpień 2026. Liczba wystąpień: Google-Extended 31, anthropic-ai 28, Claude-Web 20, BingIndexCrawler 10, Applebot-Extended 5.
Wzorzec jest czytelny: podejrzane żądania sięgają po tokeny, które nie są user-agentami, oraz po nazwy nieobecne w aktualnej dokumentacji operatorów. Warto przy tym rozróżniać intencje. Żądania podpisane jako Google-Extended czy anthropic-ai szukały u mnie plików z hasłami i konfiguracyjnych, więc to skaner. Sama niezgodność nazwy z dokumentacją nie musi jednak oznaczać złych zamiarów – dlatego rozstrzyga adres IP, a nie sama nazwa. Problem nie dotyczy zresztą wyłącznie mojej strony – Common Crawl wprost ostrzega w swojej dokumentacji, że zna przypadki crawlerów fałszywie podających się za CCBota, i zaleca weryfikację user-agenta.
Jak sprawdzić, czy bot jest prawdziwy: weryfikacja po adresie IP
User-agenta podrabia się w dziesięć sekund, więc sama nazwa nie dowodzi niczego. Pewność daje dopiero zestawienie nazwy z adresem IP i oficjalnymi zakresami operatora, a tam gdzie to możliwe – z odwrotnym i ponownym sprawdzeniem DNS. Google testuje też kryptograficzne uwierzytelnianie botów, czyli Web Bot Auth.
| Operator | Źródło adresów |
|---|---|
| OpenAI | openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json, openai.com/adsbot.json |
| Anthropic | claude.com/crawling/bots.json |
| Perplexity | perplexity.com/perplexitybot.json, perplexity.com/perplexity-user.json |
| Google – crawlery zwykłe | common-crawlers.json; odwrotny DNS kończy się na googlebot.com |
| Google – crawlery specjalne | special-crawlers.json; odwrotny DNS kończy się na google.com |
| Google – fetchery i agenty użytkownika | osobne pliki JSON; odwrotny DNS kończy się na google.com lub gae.googleusercontent.com |
| Mistral | mistral.ai/mistralai-user-ips.json, mistral.ai/mistralai-index-ips.json; dla MistralAI-Training lista nie jest publikowana |
| Amazon | trzy osobne listy: /ip-addresses/, /searchbot-ip-addresses/, /live-ip-addresses/ |
| Parallel | docs.parallel.ai/resources/shapbot.json |
| Microsoft | narzędzie Verify Bingbot w Bing Webmaster Tools; odwrotny DNS kończy się na search.msn.com |
| Common Crawl | index.commoncrawl.org/ccbot.json; odwrotny DNS kończy się na crawl.commoncrawl.org |
Jak zablokować boty AI w robots.txt? Gotowe przykłady.
Zanim cokolwiek zablokujesz: w większości przypadków tego nie rekomenduję. Blokada odcina Cię od odpowiedzi generatywnych, a więc od kanału, w którym Twoja marka może zostać wymieniona i zacytowana. Dla większości firm, ekspertów i sklepów to strata, nie zysk.
Wyjątki są realne i dotyczą przede wszystkim wydawców, portali i mediów, czyli tych, którzy żyją ze sprzedaży treści albo z ruchu na własnej stronie. Tam blokada bywa uzasadnioną decyzją biznesową – ale nadal decyzją, a nie ustawieniem domyślnym.
Poniższe konfiguracje traktuj więc jako punkt wyjścia do świadomego wyboru, nie jako zalecenie.
Pierwszy wariant ogranicza najważniejsze crawlery wykorzystywane do treningu modeli. Drugi blokuje osobno identyfikowane boty i fetchery systemów AI, zostawiając dostęp Googlebotowi, bingbotowi i Applebotowi. Oba są punktem wyjścia, nie uniwersalną konfiguracją dla każdej witryny.
Wariant 1 · Bez treningu
chronię treśćWpuszczam wszystko, co może mnie cytować, i odcinam zbieranie treści pod uczenie modeli.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Bytespider
User-agent: Meta-ExternalAgent
User-agent: MistralAI-Training
User-agent: cohere-ai
User-agent: CohereBot
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: DuckAssistBot
User-agent: MistralAI-Index
User-agent: MistralAI-User
User-agent: Amzn-SearchBot
User-agent: ShapBot
Allow: /
Wariant 2 · Osobne boty AI
Google i Apple zostająBlokuję osobne crawlery treningowe, indeksy AI i fetchery użytkowników, ale zostawiam otwarte klasyczne wyszukiwarki. To nie usuwa strony z AI Overviews, AI Mode ani z generatywnych odpowiedzi Apple.
# wyszukiwarki zostają
User-agent: Googlebot
User-agent: bingbot
User-agent: Applebot
Allow: /
# trening modeli
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Bytespider
User-agent: Meta-ExternalAgent
User-agent: MistralAI-Training
User-agent: cohere-ai
User-agent: CohereBot
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /
# indeksy odpowiedzi generatywnych
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: MistralAI-Index
User-agent: Meta-WebIndexer
User-agent: DuckAssistBot
User-agent: Amzn-SearchBot
User-agent: LinkupBot
User-agent: ShapBot
User-agent: YouBot
User-agent: Diffbot
Disallow: /
# pobrania na żądanie użytkownika
User-agent: ChatGPT-User
User-agent: Claude-User
User-agent: Perplexity-User
User-agent: MistralAI-User
User-agent: Meta-ExternalFetcher
User-agent: Amzn-User
Disallow: /
Drugi wariant ma dziurę i lepiej o niej wiedzieć od razu. Ostatnia grupa to fetchery uruchamiane przez użytkownika, a część z nich może zignorować robots.txt. Gemini Notebook i Google-Agent nie mają nawet własnego tokenu. Jeśli blokada ma być szczelna, trzeba ją dołożyć na poziomie serwera. Przykład dla Apache i pliku .htaccess:
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} (Google-GeminiNotebook|Google-NotebookLM|Google-Agent|GoogleProducer|ChatGPT-User|Perplexity-User|Amzn-User|Meta-ExternalFetcher|Shap-User) [NC]
RewriteRule ^ - [F,L]
Jedno zastrzeżenie, o którym łatwo zapomnieć: robots.txt nie służy do ochrony danych. Plik jest publiczny, dyrektywy nie są kontrolą dostępu, a zablokowany adres i tak może trafić do indeksu na podstawie linków z zewnątrz. Sekcje faktycznie prywatne zabezpiecza się logowaniem po stronie serwera.
Uwaga na grupy i na wildcard. Jeśli dla bota istnieje bardziej konkretna pasująca grupa, ma ona pierwszeństwo przed User-agent: *. Wildcard obowiązuje dopiero wtedy, gdy nic konkretniejszego nie pasuje. Fetchery uruchamiane przez użytkownika to osobny przypadek: część respektuje dedykowane tokeny, część może je pomijać i wymaga reguły na poziomie serwera lub WAF-a.
Jak ograniczyć AI Overviews? O nosnippet, data-nosnippet i max-snippet
robots.txt informuje zgodne boty, czy powinny pobierać stronę. Dyrektywy meta sterują natomiast indeksowaniem i tym, jakie fragmenty mogą trafić do wyników oraz do funkcji AI. To dwie różne warstwy i przy AI Overviews druga bywa jedyną, jaka Ci zostaje.
Rzecz kluczowa
Nie istnieje osobny opt-out z AI Overviews i AI Mode, który zostawiałby nienaruszoną zwykłą obecność w Google. Zasila je ten sam Googlebot i ten sam indeks, a Google-Extended dotyczy wyłącznie treningu Gemini i groundingu, więc jego blokada nic tu nie zmienia.
Możesz natomiast ograniczyć, ile treści trafia do tych funkcji. Google wymienia cztery dyrektywy: nosnippet, data-nosnippet, max-snippet i noindex. Każda z nich działa jednocześnie na zwykłe wyniki i na funkcje AI – nie da się rozdzielić jednego od drugiego.
| Dyrektywa | Co robi | Czym płacisz |
|---|---|---|
nosnippet | Blokuje wyświetlanie fragmentu strony we wszystkich formach wyników, łącznie z AI Overviews i AI Mode | Znika też zwykły opis pod tytułem w wynikach i szansa na direct answer |
data-nosnippet | To samo, ale tylko dla oznaczonego fragmentu HTML | Reszta strony działa normalnie – najbardziej precyzyjne narzędzie z tego zestawu |
max-snippet:N | Ogranicza długość fragmentu do N znaków i tym samym ilość treści podawanej modelowi | Przy niskiej wartości efekt zbliżony do nosnippet |
noindex | Usuwa stronę ze wszystkich form wyników Google, także z AI Overviews i AI Mode | Strona znika również ze zwykłych wyników wyszukiwania |
noarchive | U Amazona oznacza „nie używaj tej strony do trenowania modeli" | Działa tylko u operatorów, którzy tę dyrektywę honorują |
Apple honoruje nosnippet jako rezygnację z wykorzystania treści w odpowiedziach generatywnych opartych na bieżących informacjach. Amazon deklaruje respektowanie noarchive, noindex i none, ale nie obsługuje crawl-delay.
Najbardziej precyzyjne narzędzie to data-nosnippet. Wyłącza z podglądów i z bezpośredniego użycia przez funkcje AI tylko oznaczony fragment strony. Stosuj je świadomie: te same akapity, które najłatwiej zastąpiłyby wizytę u Ciebie – definicje, listy kroków, tabele – są zwykle tymi, dzięki którym w ogóle jesteś cytowana.
Co boty AI pobierają z Twojej strony: treść czy pliki?
Sama liczba wizyt niewiele mówi. Ciekawsze, ile z nich trafia w podstronę z treścią, a ile w pliki CSS, obrazki i końcówki API.
| Bot | Udane żądania | Udział wejść w treść |
|---|---|---|
| Perplexity-User | 57 | 91,2% |
| CCBot | 405 | 82,5% |
| ChatGPT-User | 5870 | 73,9% |
| PerplexityBot | 2127 | 61,1% |
| Claude-User | 389 | 60,2% |
| OAI-SearchBot | 3157 | 33,7% |
| GPTBot | 5283 | 32,0% |
| ClaudeBot | 2244 | 28,6% |
| Google-GeminiNotebook | 2945 | 20,0% |
| Applebot | 3192 | 15,0% |
| Amazonbot | 3337 | 14,6% |
Logi podrez.pl, 02.02–05.08.2026. Perplexity-User, ChatGPT-User i Claude-User trafiają głównie prosto w treść, ale sama klasa bota nie przesądza zachowania: CCBot ma wysoki udział wejść w treść, a Gemini Notebook niski.
Często zadawane pytania
Jak sprawdzić, jaki bot odwiedził moją stronę?
Nazwa bota znajduje się w polu user-agent w logu dostępowym serwera, zwykle w pliku access.log lub domena.pl.log w katalogu logs. Skopiuj nazwę i wyszukaj ją w tabeli powyżej. Jeśli chcesz mieć pewność, że bot jest prawdziwy, porównaj adres IP z zakresami publikowanymi przez operatora.
Czy zablokowanie GPTBota usuwa mnie z wyników ChatGPT?
Nie. GPTBot odpowiada za zbieranie treści pod trening modeli, a za obecność w wynikach wyszukiwania ChatGPT odpowiada OAI-SearchBot. To dwa niezależne tokeny i można je ustawić różnie: zablokować trening, zostawić wyszukiwanie. Analogiczny trójpodział stosują Anthropic i Mistral. Amazon również rozdziela ruch na trzy agenty, ale jego Amazonbot jest crawlerem wielofunkcyjnym, który do treningu tylko może być wykorzystywany. Perplexity rozdziela natomiast tylko indeks wyszukiwania od pobrań na żądanie użytkownika i nie ma udokumentowanego crawlera treningowego.
Dlaczego nie widzę Google-Extended w logach?
Bo Google-Extended nie jest botem. To token sterujący w robots.txt, którym decydujesz o wykorzystaniu treści do trenowania modeli Gemini i do groundingu. Samo pobieranie stron wykonują zwykłe roboty Google. Jeśli mimo to widzisz tę nazwę w logu, patrzysz na podszywacza.
Jak wypisać się z AI Overviews?
Przez robots.txt się nie da. AI Overviews i AI Mode korzystają ze zwykłego indeksu Google, budowanego przez Googlebota, a token Google-Extended dotyczy wyłącznie trenowania modeli Gemini i groundingu. Jedyne dostępne narzędzie to dyrektywy podglądu: nosnippet, data-nosnippet, max-snippet i noindex. Każda z nich ogranicza też zwykły wynik wyszukiwania, więc wyjście z AI Overviews oznacza częściowe wyjście z Google.
Czy blokada w robots.txt zatrzyma każdego bota AI?
Nie. Fetchery uruchamiane przez użytkownika, takie jak Gemini Notebook czy ChatGPT-User, mogą pomijać robots.txt, ponieważ żądanie inicjuje człowiek, a nie automat. Żeby je zatrzymać, potrzebujesz reguły na poziomie serwera, w konfiguracji WAF-a albo w pliku .htaccess.
Co się zmieniło z NotebookLM?
16 lipca 2026 Google zaktualizował dokumentację i zmienił nazwę user-agenta z Google-NotebookLM na Google-GeminiNotebook, po tym jak sam produkt został przemianowany na Gemini Notebook. Stara nazwa jest wspierana tylko przez okres przejściowy wskazywany na sierpień 2026, więc reguły napisane na starą nazwę trzeba zaktualizować.
Sama nazwa w logu to dopiero początek. Znacznie ciekawsze bywa to, co ten bot dostał w odpowiedzi – i czy w ogóle dostał. Jak to sprawdzić i co znalazłam u siebie, opisałam w tekście o analizie logów serwera.
Nie wiesz, które boty wpuszcza Twoja strona?
Analizę logów pod kątem botów AI, crawlerów wyszukiwarek, narzędzi SEO i podejrzanego ruchu robię w ramach audytu. Jeśli wolisz zacząć od rozmowy, umów krótkie spotkanie.
Historia tej strony 06.08.2026 – pierwsza wersja.
Kalendarium zmian u operatorów 16.07.2026 – Google zmienił nazwę user-agenta NotebookLM na
Google-GeminiNotebook; stara nazwa wspierana przez okres przejściowy.01.07.2026 – Cloudflare wprowadził podział botów na kategorie Search, Agent i Training.
07.04.2026 – Anthropic rozbił dokumentację na trzy boty, dodając
Claude-SearchBot i Claude-User.20.03.2026 – Google udokumentował user-agenta
Google-Agent.
