Twoja strona istnieje dopiero wtedy, gdy zobaczy ją robot. Nie klient, nie Ty, nie grafik, który ją projektował. Robot.
Ten mało romantyczny fakt stoi za każdym pytaniem w rodzaju "dlaczego mojej strony nie ma w Google". W dziewięciu przypadkach na dziesięć odpowiedź brzmi tak samo: crawler tam nie dotarł albo dotarł i nie zrozumiał, co widzi.
Czym jest crawler
Crawler to program komputerowy, który samodzielnie porusza się po internecie, pobiera strony i przekazuje je dalej do przetworzenia. Nie klika, nie czyta, nie ocenia. Pobiera kod i idzie dalej.
Definicja bez owijania
Czym jest crawler w jednym zdaniu: to automat, który odwiedza adresy URL, zapisuje ich zawartość i zbiera kolejne linki, żeby mieć dokąd pójść za chwilę. Wszystko, co robi, sprowadza się do tej pętli powtarzanej miliardy razy dziennie.
Pająk, pełzacz, bot indeksujący

Ta sama rzecz ma zaskakująco dużo nazw i wszystkie oznaczają to samo:
- Crawler - od angielskiego to crawl, czyli pełzać.
- Spider, pająk - bo porusza się po "sieci" po nitkach linków.
- Robot indeksujący - nazwa najczęstsza w polskich tekstach o SEO.
- Bot wyszukiwarki - gdy chcemy podkreślić, do kogo należy.
- Web crawler - wersja pełna, używana w dokumentacji technicznej.
W tekście używam ich zamiennie. Podobnie robią wszystkie roboty wyszukiwarek internetowych, których dokumentację czytałem.

Sprawdź, co widzi Google
Porozmawiajmy o Twojej stronieUwaga: crawler to też coś zupełnie innego
Jeśli trafiłeś tu, szukając terenowego modelu zdalnie sterowanego albo potwora z Tibii, to niestety nie ten adres. Słowo crawler funkcjonuje w modelarstwie RC jako nazwa auta do jazdy po kamieniach, a w kilku grach jako nazwa przeciwnika. Reszta tego tekstu dotyczy wyłącznie robotów internetowych.
Jak działa crawler krok po kroku

Mechanizm jest prosty do bólu. Jego skala robi wrażenie, nie sama zasada.
1. Kolejka adresów
Robot startuje z listy adresów URL, które już zna: z poprzednich wizyt, z mapy witryny, z linków prowadzących z innych stron. Ta lista nazywa się kolejką crawlowania i nigdy się nie kończy.
2. Pobranie strony
Crawler wysyła do serwera zapytanie i dostaje z powrotem kod HTML. Nie widzi wtedy jeszcze grafiki, kolorów ani układu. Widzi tekst i znaczniki.
3. Analiza zawartości
Teraz robot zaczyna analizować to, co pobrał: nagłówki, znaczniki meta, treść, strukturę strony, wewnętrzne odnośniki. Przy okazji wyciąga z kodu wszystkie nowe adresy i dokłada je do kolejki.

Zobacz stronę oczami robota
Porozmawiajmy o Twojej stronie4. Indeksowanie
Na końcu strona trafia do indeksu, czyli ogromnej bazy, z której wyszukiwarka układa potem wyniki. Indeksacja to osobny etap i nie następuje automatycznie. Crawler może odwiedzić podstronę i jej nie zaindeksować, bo uzna ją za duplikat, treść ubogą albo zablokowaną znacznikiem.
To rozróżnienie jest kluczowe: crawlowanie to odwiedziny, indeksowanie stron to decyzja o zapisaniu. Skanować nie znaczy zapamiętać.
5. Klasyfikacja
Zaindeksowana strona nie leży w bazie luzem. Wyszukiwarka musi ją jeszcze klasyfikować: przypisać tematykę, ocenić język, rozpoznać typ treści i dopiero na tej podstawie zdecydować, przy jakich zapytaniach warto ją pokazać w wynikach wyszukiwania.
Rodzaje crawlerów

Nie wszystkie boty chcą tego samego. Poniżej cztery grupy, które spotkasz w logach serwera.
| Typ crawlera | Po co przychodzi | Czy chcesz go wpuścić |
|---|---|---|
| Boty wyszukiwarek Googlebot, Bingbot |
Indeksowanie do wyników wyszukiwania | Tak, bezwarunkowo |
| Crawlery SEO Screaming Frog, Sitebulb |
Audyt techniczny Twojej własnej witryny | Tak, uruchamiasz je sam |
| Crawlery AI GPTBot, ClaudeBot, PerplexityBot |
Zbieranie treści dla modeli i odpowiedzi AI | To decyzja biznesowa, patrz niżej |
| Boty złośliwe skanery podatności, spam |
Szukanie luk, kopiowanie treści, spam w formularzach | Nie, blokuj na poziomie serwera |
Czwarta grupa jest liczniejsza, niż większość właścicieli stron podejrzewa. Według analiz ruchu z ostatnich lat boty odpowiadają już za mniej więcej połowę ruchu w sieci.
Crawlery AI to nowa kategoria
Jeszcze trzy lata temu ta rubryka w tabeli nie istniała. Dziś GPTBot, ClaudeBot i PerplexityBot potrafią generować na średniej stronie więcej zapytań niż Googlebot, bo zbierają treść zarówno do trenowania modeli, jak i do odpowiadania na bieżące pytania użytkowników.

Audyt techniczny Twojej strony
Porozmawiajmy o Twojej stronieGooglebot, czyli ten najważniejszy

Googlebot to zbiorcza nazwa robotów Google. W praktyce nie jest jednym programem, tylko rodziną botów o różnych zadaniach.
| Robot | Zadanie |
|---|---|
| Googlebot Smartphone | Główny robot indeksujący, ocenia wersję mobilną strony |
| Googlebot Desktop | Wersja komputerowa, dziś pomocnicza |
| Googlebot Image / Video | Grafika i materiały wideo do wyszukiwarki obrazów |
| AdsBot | Sprawdza jakość stron docelowych w kampaniach Google Ads |
| Google-InspectionTool | Obsługuje testy uruchamiane ręcznie w Search Console |
Liczy się wersja mobilna
Google indeksuje dziś strony przede wszystkim tak, jak widzi je telefon. Jeśli wersja mobilna Twojej witryny ma mniej treści niż komputerowa, to ta uboższa wersja jest tą ocenianą.
Deep crawl i fresh crawl
Robot indeksujący wraca na strony w dwóch trybach. Fresh crawl to szybkie, częste zaglądanie na adresy, które zmieniają się regularnie: stronę główną, kategorie, blog. Deep crawl to rzadsza, głęboka wizyta obejmująca całą witrynę, łącznie z podstronami, o których sam zdążyłeś zapomnieć.
Crawler a scraper: nie to samo

Te dwa pojęcia mylą się nagminnie, także w tekstach branżowych. Różnica jest jednak konkretna.
| Kryterium | Crawler | Scraper |
|---|---|---|
| Cel | Odnaleźć i skatalogować strony | Wyciągnąć konkretne dane |
| Zakres | Idzie za każdym linkiem, jaki znajdzie | Zna z góry adresy i pola, które go interesują |
| Efekt | Indeks adresów URL | Tabela z cenami, nazwiskami, opisami |
| robots.txt | Duże crawlery respektują | Bardzo różnie, często ignoruje |
W praktyce jedno bywa etapem drugiego: żeby coś zescrapować, trzeba to najpierw znaleźć. Prawnych granic tej drugiej czynności dotyczy osobny tekst o web scrapingu i jego legalności.

Zwiększ widoczność w Google
Porozmawiajmy o Twojej stronieDlaczego crawler decyduje o Twoim SEO
Bo jest pierwszym i jedynym wąskim gardłem. Zanim jakikolwiek algorytm oceni jakość treści witryny, ktoś musi ją w ogóle pobrać.
Bez wizyty nie ma pozycji
Kolejność jest zawsze taka sama i nie da się jej przeskoczyć:
- Crawler musi dotrzeć do adresu.
- Musi zrozumieć zawartość strony.
- Google musi zdecydować, że warto ją zaindeksować.
- Dopiero potem podstrona bierze udział w rankingu.
Wypadnięcie na pierwszym kroku unieważnia wszystko, co zrobiłeś dalej. Możesz mieć najlepszy tekst w branży. Bez wizyty robota nie istnieje.
Crawler a pozycjonowanie
Dostępność dla robotów to fundament, na którym stoi pozycjonowanie. Linki, treści i optymalizacja techniczna działają dopiero powyżej tego poziomu. Dlatego każdy sensowny proces pozycjonowania strony zaczyna się od sprawdzenia, czy w ogóle jest co pozycjonować, a nie od doboru słów kluczowych.
Najczęstsza rozmowa w naszej agencji wygląda tak: klient pokazuje świetną stronę i pyta, dlaczego nie ma z niej ruchu. Otwieramy Search Console i okazuje się, że połowa podstron nigdy nie została odwiedzona przez robota. Nie było kary, nie było konkurencji, nie było złych treści. Był link, którego nikt nie postawił, i plik robots.txt, którego nikt nie przeczytał po wdrożeniu.
Crawl budget, czyli limit cierpliwości
Crawl budget to liczba podstron, które robot zamierza odwiedzić na Twojej witrynie w danym okresie. Zależy od dwóch rzeczy: ile serwer wytrzyma i na ile Google uznaje serwis za wart częstych odwiedzin.
Przy stronie firmowej na trzydzieści podstron to zagadnienie czysto teoretyczne. Przy sklepie z filtrami generującymi dziesiątki tysięcy adresów URL potrafi zdecydować o tym, czy nowe produkty pojawią się w wynikach w dwa dni, czy w dwa miesiące.
Objawy, że coś jest nie tak

- Nowe podstrony pojawiają się w wyszukiwarce po tygodniach albo wcale.
- Raport indeksowania w Search Console pokazuje setki adresów "wykryto, obecnie niezindeksowane".
- Google Analytics notuje ruch, ale wyłącznie na stronie głównej.
- Test adresu URL zwraca pustą stronę zamiast Twojej treści.
Każdy z tych objawów da się zdiagnozować w godzinę. Pełny audyt SEO obejmuje to jako jeden z pierwszych punktów, o czym piszemy w osobnym tekście o audycie SEO krok po kroku.

Sprawdzimy Twoją indeksację
Porozmawiajmy o Twojej stronieJak sterować crawlerami
Masz nad nimi mniej władzy, niż sądzisz, i więcej, niż wykorzystujesz.
Plik robots.txt
To zwykły plik tekstowy w katalogu głównym domeny. Mówi robotom, gdzie mogą wchodzić, a gdzie nie. Jedna uwaga, którą trzeba powtarzać do znudzenia: robots.txt to prośba, nie zamek w drzwiach. Googlebot ją uszanuje. Bot zbierający adresy e-mail nie.
Znacznik meta robots
Robots.txt blokuje wejście. Znacznik meta w kodzie strony działa inaczej: robot wchodzi, czyta i dowiaduje się, że ma tej podstrony nie indeksować. Do wyrzucenia adresu z wyników wyszukiwania służy właśnie ten drugi mechanizm, nie pierwszy.
Mapa witryny
Sitemap.xml to lista adresów, które uważasz za warte odwiedzin. Nie gwarantuje niczego, ale skraca robotowi drogę. Szczególnie przy dużych serwisach i świeżo wdrożonych podstronach.
Klasyczny błąd wdrożeniowy
Strona powstaje na serwerze testowym, zablokowana w robots.txt przed całym światem. Potem idzie na produkcję. Blokada zostaje. Widziałem to wiele razy i za każdym razem kosztowało to kilka tygodni niewidoczności, zanim ktokolwiek się zorientował.

Odblokujemy Twoją stronę
Porozmawiajmy o Twojej stronieNarzędzia, które same są crawlerami
Najlepszy sposób, żeby zrozumieć robota, to puścić własnego na swoją witrynę.
| Narzędzie | Do czego | Koszt |
|---|---|---|
| Screaming Frog | Pełny audyt techniczny, standard branżowy | Bezpłatnie do 500 adresów, potem ok. 199 GBP rocznie |
| Sitebulb | To samo, ale z czytelniejszymi raportami | Płatne, dostępny okres próbny |
| Google Search Console | Dane wprost od Google o Twojej witrynie | Bezpłatnie |
| Własny skrypt | Nietypowe potrzeby, monitorowanie konkurencji | Czas programisty, zwykle Python |
Zacznij od Search Console
Jest darmowa i pokazuje dane, których nie ma nigdzie indziej: kiedy robot był ostatnio, co pobrał, czego nie zaindeksował i dlaczego. Więcej o samym narzędziu w tekście o Google Search Console.
Co sprawdzać w raporcie z crawla
- Adresy zwracające kod 404 i 500.
- Łańcuchy przekierowań dłuższe niż jedno.
- Podstrony bez żadnych linków prowadzących do nich (sieroty).
- Zduplikowane tytuły i opisy meta.
- Głębokość kliknięć powyżej trzech od strony głównej.
Jak ułatwić crawlerowi pracę

Większość optymalizacji stron pod kątem robotów to zwykła higiena, nie magia. Każda strona internetowa zyskuje na tych samych kilku rzeczach.
Płaska struktura witryny
Im mniej kliknięć od strony głównej do najgłębszej podstrony, tym lepiej. Trzy poziomy w zupełności wystarczą, żeby crawler mógł przeszukiwać serwis bez gubienia się w gałęziach. Przejrzystą strukturę witryny robot mapuje przy jednej wizycie, zagmatwaną rozkłada na kilka.
Linkowanie wewnętrzne
Robot porusza się po linkach. To jego jedyny środek transportu. Podstrona, do której nie prowadzi żaden odnośnik, jest dla niego niewidzialna, choćby figurowała w menu wygenerowanym skryptem.
Szybkość ładowania
Wolny serwer to mniej pobranych stron w tym samym czasie. Zależność jest wprost proporcjonalna i dotyczy każdej witryny. Sposoby opisaliśmy w tekście o przyspieszaniu strony internetowej.

Porozmawiajmy o widoczności
Porozmawiajmy o Twojej stronieJavaScript z umiarem
Treść budowana w przeglądarce przez JavaScript wymaga od robota dodatkowej pracy, a ta bywa odkładana na później. Jeśli tekst ma pracować na pozycje, powinien być w kodzie od razu.
Bez duplikatów
Ten sam produkt pod pięcioma adresami URL to pięciokrotnie zmarnowany budżet crawlowania. Znacznik canonical mówi robotowi, którą wersję traktować jako właściwą.
Blokować crawlery AI czy nie
To pytanie zadaje dziś prawie każdy klient i nie ma na nie jednej dobrej odpowiedzi.
Argumenty za blokowaniem
Twoje treści posłużą do trenowania modelu, na którym nic nie zarobisz. Boty zjadają transfer. Przy dużych serwisach potrafi to być zauważalna część rachunku za serwer.
Argumenty przeciw
Jeśli zablokujesz GPTBota, to gdy ktoś zapyta ChatGPT o firmę z Twojej branży, Twojej nazwy tam nie będzie. Modele mogą polecać tylko to, co przeczytały. Coraz większa część ruchu zaczyna się właśnie od takiego pytania, a nie od wpisania frazy w wyszukiwarkę.
Nasza rekomendacja
Rozdziel to. Treści marketingowe, blog i opisy usług zostaw otwarte, bo mają Cię promować. Zamknij panele klienta, wyniki wyszukiwania wewnętrznego i wszystko, co nie ma trafiać do żadnego indeksu. Temat rozwijamy w tekście o widoczności w odpowiedziach AI.
Najczęstsze pytania o crawlery
Co to znaczy crawler?
To program, który automatycznie odwiedza strony internetowe, pobiera ich zawartość i podąża za znalezionymi linkami. Po polsku mówi się o nim robot indeksujący albo pająk.
Co to znaczy crawling?
Crawling, czyli crawlowanie, to sam proces odwiedzania i pobierania stron przez robota. Nie mylić z indeksowaniem, które jest kolejnym etapem i wcale nie musi nastąpić.
Jak działa crawler?
Pobiera adres z kolejki, ściąga kod strony, wyciąga z niego treść oraz nowe linki i dokłada je do kolejki. Potem powtarza to od początku, bez końca.
Jak powiedzieć "crawl" po polsku?
Dosłownie: pełzać, czołgać się. Stąd polskie określenie pełzacz, choć w branży i tak wszyscy mówią crawlowanie.
Czym crawler różni się od scrapera?
Crawler szuka i kataloguje strony, scraper wyciąga z nich konkretne dane. Pierwszy buduje mapę, drugi wypełnia tabelkę.
Czy mogę zablokować crawlery na swojej stronie?
Częściowo. Plik robots.txt zablokuje te, które go respektują, a to głównie duzi gracze. Roboty złośliwe trzeba odcinać na poziomie serwera lub firewalla.
Jak często robot odwiedza stronę?
Od kilku razy dziennie do kilku razy w roku. Decyduje aktualizowanie treści, liczba linków prowadzących z zewnątrz i wydajność serwera.
Jakie narzędzie do crawlowania wybrać na start?
Screaming Frog w wersji bezpłatnej. Limit 500 adresów wystarcza, żeby przeskanować typową stronę firmową i zobaczyć te same błędy, które widzi Google.
Kto sprawdzi, czy roboty widzą moją stronę?
Potrzebna jest osoba, która porówna to, co widzisz Ty, z tym, co pobiera robot. Napisz do nas - robimy takie audyty i naprawiamy to, co blokuje indeksację.



