Sitemap, robots.txt i indeksacja: jak Google widzi stronę
Mapa strony XML, plik robots.txt i tag noindex decydują o tym, co Google znajdzie, przeskanuje i pokaże w wynikach. Wyjaśniamy, czym różnią się te narzędzia, jak je poprawnie ustawić i jak w Search Console sprawdzić, dlaczego strona nie jest zaindeksowana.
Mapa strony XML (sitemap) to plik z listą adresów URL, które chcesz pokazać wyszukiwarkom, wraz z informacją o ich ostatniej aktualizacji. Razem z plikiem robots.txt i tagami meta robots tworzy zestaw sygnałów, dzięki którym Google wie, co ma przeskanować i zaindeksować. Te trzy narzędzia są często mylone, a błąd w jednym z nich potrafi wyłączyć z wyników całą sekcję strony. Poniżej wyjaśniamy, jak działają, jak je sprawdzić i jak rozwiązać najczęstsze problemy z indeksacją.
Najważniejsze w skrócie
- Mapa strony XML pomaga wyszukiwarce odkryć adresy, ale nie gwarantuje, że zostaną zaindeksowane.
- Plik robots.txt steruje skanowaniem (crawlingiem), a nie indeksowaniem, więc nie służy do ukrywania stron w wynikach.
- Aby strona nie pojawiała się w Google, użyj tagu noindex i nie blokuj jej jednocześnie w robots.txt.
- W mapie strony powinny znaleźć się tylko adresy kanoniczne, zwracające kod 200 i przeznaczone do indeksacji.
- Raport indeksowania stron w Google Search Console pokazuje, które adresy są w indeksie i dlaczego inne nie są.
Jak Google odkrywa, skanuje i indeksuje stronę
Proces ma trzy etapy. Odkrywanie: Google dowiaduje się o istnieniu adresu z linków na innych stronach, linków wewnętrznych lub z mapy strony. Skanowanie: robot Googlebot pobiera stronę i renderuje jej treść. Indeksowanie: Google analizuje zawartość i decyduje, czy zapisać stronę w indeksie, z którego pochodzą wyniki wyszukiwania. Na każdym etapie coś może pójść nie tak, a sitemap, robots.txt i noindex działają na różnych etapach.
Mapa strony XML: czym jest i co powinna zawierać
Sitemap to plik XML, zwykle pod adresem /sitemap.xml, zawierający listę adresów URL. Każdy wpis ma adres (loc) i opcjonalnie datę ostatniej zmiany (lastmod). Pola priority i changefreq Google według własnej dokumentacji ignoruje, więc nie warto poświęcać im uwagi. Datę lastmod Google uwzględnia, o ile jest wiarygodna, czyli zmienia się tylko przy faktycznej zmianie treści.
Prosty przykład wpisu:
<url>
<loc>https://example.com/uslugi/audyt-seo/</loc>
<lastmod>2026-08-20</lastmod>
</url>Co powinno trafić do sitemap
- Adresy kanoniczne, które zwracają kod 200.
- Strony, które chcesz widzieć w wynikach: oferta, wpisy, strony kolekcji, wersje językowe.
Czego w sitemap być nie powinno
- Adresów z przekierowaniem, błędem 404 lub tagiem noindex.
- Duplikatów z parametrami, np. sortowania czy filtrowania.
- Stron technicznych, takich jak koszyk, podziękowanie po formularzu czy wyniki wyszukiwania wewnętrznego.
Jedna mapa strony XML może zawierać do 50 000 adresów i ważyć do 50 MB bez kompresji. Większe serwisy dzielą ją na kilka plików i łączą je w indeks sitemap.
Mapa strony XML na stronie wielojęzycznej
Jeśli strona ma kilka wersji językowych, każda z nich powinna mieć własny adres URL, na przykład /en/services/ obok /uslugi/, i każda powinna trafić do mapy strony. Google traktuje wersje językowe jako osobne strony, więc brak angielskich adresów w sitemap spowalnia ich odkrywanie. Powiązania między wersjami językowymi opisuje się atrybutami hreflang, które można umieścić w kodzie strony lub bezpośrednio w mapie strony XML. Najważniejsze, by oznaczenia były wzajemne: jeśli polska strona wskazuje angielską, angielska musi wskazywać polską. Unikaj też jednego adresu, który w zależności od przeglądarki pokazuje różne języki, bo robot zobaczy tylko jedną wersję.
Plik robots.txt: co blokuje, a czego nie
Robots.txt to plik tekstowy w katalogu głównym domeny (/robots.txt), w którym mówisz robotom, których ścieżek nie powinny skanować. Przykład:
User-agent: *
Disallow: /koszyk/
Sitemap: https://example.com/sitemap.xmlKluczowa i często mylona zasada: robots.txt blokuje skanowanie, a nie indeksowanie. Jeśli do zablokowanej strony prowadzą linki, Google może ją zaindeksować bez znajomości treści i pokazać sam adres. Dyrektywa Sitemap: w robots.txt to prosty sposób, by wskazać robotom lokalizację mapy strony.
Meta robots i noindex: jak wykluczyć stronę z wyników
Jeśli strona ma nie pojawiać się w Google, dodaj do niej tag <meta name="robots" content="noindex">. Aby Google go zobaczył, musi mieć możliwość zeskanowania strony, więc nie blokuj jej jednocześnie w robots.txt. To jeden z najczęstszych błędów: strona zablokowana w robots.txt i oznaczona noindex może nadal wisieć w wynikach, bo robot nigdy nie odczytał tagu.
| Narzędzie | Na co wpływa | Kiedy używać |
|---|---|---|
| Mapa strony XML | odkrywanie adresów | zawsze, dla stron przeznaczonych do indeksu |
| robots.txt | skanowanie | by oszczędzać zasoby robota na stronach technicznych |
| meta robots noindex | indeksowanie | by wykluczyć konkretną stronę z wyników |
| link kanoniczny | wybór wersji do indeksu | gdy ta sama treść jest pod kilkoma adresami |
Jak zgłosić sitemap w Google Search Console
- Zweryfikuj domenę w Google Search Console.
- Otwórz sekcję „Mapy witryn” i wpisz adres mapy strony, np.
sitemap.xml. - Sprawdź, czy status to „Sukces” i ile adresów wykryto.
- Po kilku dniach przejrzyj raport indeksowania stron i porównaj liczbę zaindeksowanych adresów z liczbą adresów w sitemap.
Do sprawdzenia pojedynczego adresu służy narzędzie „Sprawdzanie adresu URL”, które pokazuje, czy strona jest w indeksie, kiedy była skanowana i jaki adres Google uznał za kanoniczny. Po większych zmianach, na przykład po przebudowie menu lub dodaniu nowej sekcji, możesz poprosić tam o ponowne zindeksowanie najważniejszych adresów. Nie ma sensu robić tego dla każdej podstrony: przy dobrze działającej mapie strony i poprawnym linkowaniu wewnętrznym Google i tak znajdzie zmiany.
Najczęstsze problemy z indeksacją i ich przyczyny
- Strona wykryta, ale niezaindeksowana: Google zna adres, ale jeszcze go nie przeskanował. Często chodzi o słabe linkowanie wewnętrzne lub niską wartość treści.
- Strona przeskanowana, ale niezaindeksowana: Google ocenił treść jako mało wartościową lub zduplikowaną. Pomaga rozbudowa i ujednolicenie treści.
- Duplikat, Google wybrał inną stronę kanoniczną: kilka adresów ma podobną treść. Ustaw link kanoniczny i ogranicz duplikaty.
- Zablokowano przez robots.txt: sprawdź, czy blokada jest zamierzona.
- Wykluczono tagiem noindex: częsty efekt pozostawienia ustawień ze środowiska testowego po publikacji.
Checklista indeksacji po uruchomieniu strony
- Mapa strony XML jest dostępna i zawiera tylko adresy kanoniczne z kodem 200.
- Robots.txt nie blokuje ważnych sekcji ani plików CSS i JS.
- Na produkcji nie ma tagów noindex pozostawionych z wersji testowej.
- Sitemap zgłoszona w Search Console, bez błędów.
- Każda wersja językowa ma własne adresy i jest ujęta w mapie strony.
- Ważne podstrony są podlinkowane z menu lub treści.
Jak to wygląda w LessCMS
- Mapa strony XML i robots.txt są generowane automatycznie, bez ręcznej edycji plików.
- Nowe wpisy w kolekcjach automatycznie dostają adres URL i wpis w sitemap, podobnie jak każda wersja językowa strony.
- Strony są renderowane po stronie serwera, więc robot dostaje pełną treść HTML od razu.
- Meta title i description ustawiasz per strona, wpis i język. Więcej przeczytasz w opisie funkcji SEO i wielojęzyczności.
Najczęstsze pytania
Czy mapa strony XML jest konieczna?
Nie jest obowiązkowa, ale bardzo pomaga, zwłaszcza przy nowych stronach, dużej liczbie podstron i słabym linkowaniu wewnętrznym. Małe, dobrze podlinkowane strony też mogą być zaindeksowane bez niej, jednak sitemap przyspiesza odkrywanie nowych adresów.
Jak sprawdzić, czy strona ma mapę strony XML?
Wpisz w przeglądarce adres domeny z końcówką /sitemap.xml albo sprawdź dyrektywę Sitemap: w pliku robots.txt. Status mapy zobaczysz też w Google Search Console.
Czy robots.txt ukrywa stronę przed Google?
Nie. Robots.txt blokuje skanowanie, ale zablokowany adres może trafić do indeksu, jeśli prowadzą do niego linki. Do wykluczenia strony z wyników użyj tagu noindex.
Dlaczego Google nie indeksuje mojej strony mimo sitemap?
Sitemap tylko informuje o adresach, a decyzję o indeksacji Google podejmuje na podstawie jakości i unikalności treści. Sprawdź raport indeksowania w Search Console, aby poznać konkretny powód.
Jak często Google odczytuje mapę strony?
Nie ma stałego harmonogramu, Google robi to według własnego uznania. Wiarygodna data lastmod i regularne aktualizacje treści pomagają szybciej wychwycić zmiany.
Chcesz, żeby mapa strony XML i robots.txt aktualizowały się same? Sprawdź plany LessCMS i załóż konto bez karty.