LessTools
LESSCMSWizualny edytor stron z headless API LESSCOMMERCESklep, PIM i zamówienia w jednym LESSSEOWidoczność w Google, mierzona co dzień — wkrótce
Jedno konto i jedna faktura dla wszystkich. Poznaj LessTools →
← Blog
SEO

Sitemap, robots.txt i indeksacja: jak Google widzi stronę

Mapa strony XML, plik robots.txt i tag noindex decydują o tym, co Google znajdzie, przeskanuje i pokaże w wynikach. Wyjaśniamy, czym różnią się te narzędzia, jak je poprawnie ustawić i jak w Search Console sprawdzić, dlaczego strona nie jest zaindeksowana.

Mapa strony XML (sitemap) to plik z listą adresów URL, które chcesz pokazać wyszukiwarkom, wraz z informacją o ich ostatniej aktualizacji. Razem z plikiem robots.txt i tagami meta robots tworzy zestaw sygnałów, dzięki którym Google wie, co ma przeskanować i zaindeksować. Te trzy narzędzia są często mylone, a błąd w jednym z nich potrafi wyłączyć z wyników całą sekcję strony. Poniżej wyjaśniamy, jak działają, jak je sprawdzić i jak rozwiązać najczęstsze problemy z indeksacją.

Najważniejsze w skrócie

  • Mapa strony XML pomaga wyszukiwarce odkryć adresy, ale nie gwarantuje, że zostaną zaindeksowane.
  • Plik robots.txt steruje skanowaniem (crawlingiem), a nie indeksowaniem, więc nie służy do ukrywania stron w wynikach.
  • Aby strona nie pojawiała się w Google, użyj tagu noindex i nie blokuj jej jednocześnie w robots.txt.
  • W mapie strony powinny znaleźć się tylko adresy kanoniczne, zwracające kod 200 i przeznaczone do indeksacji.
  • Raport indeksowania stron w Google Search Console pokazuje, które adresy są w indeksie i dlaczego inne nie są.

Jak Google odkrywa, skanuje i indeksuje stronę

Proces ma trzy etapy. Odkrywanie: Google dowiaduje się o istnieniu adresu z linków na innych stronach, linków wewnętrznych lub z mapy strony. Skanowanie: robot Googlebot pobiera stronę i renderuje jej treść. Indeksowanie: Google analizuje zawartość i decyduje, czy zapisać stronę w indeksie, z którego pochodzą wyniki wyszukiwania. Na każdym etapie coś może pójść nie tak, a sitemap, robots.txt i noindex działają na różnych etapach.

Mapa strony XML: czym jest i co powinna zawierać

Sitemap to plik XML, zwykle pod adresem /sitemap.xml, zawierający listę adresów URL. Każdy wpis ma adres (loc) i opcjonalnie datę ostatniej zmiany (lastmod). Pola priority i changefreq Google według własnej dokumentacji ignoruje, więc nie warto poświęcać im uwagi. Datę lastmod Google uwzględnia, o ile jest wiarygodna, czyli zmienia się tylko przy faktycznej zmianie treści.

Prosty przykład wpisu:

<url>
  <loc>https://example.com/uslugi/audyt-seo/</loc>
  <lastmod>2026-08-20</lastmod>
</url>

Co powinno trafić do sitemap

  • Adresy kanoniczne, które zwracają kod 200.
  • Strony, które chcesz widzieć w wynikach: oferta, wpisy, strony kolekcji, wersje językowe.

Czego w sitemap być nie powinno

  • Adresów z przekierowaniem, błędem 404 lub tagiem noindex.
  • Duplikatów z parametrami, np. sortowania czy filtrowania.
  • Stron technicznych, takich jak koszyk, podziękowanie po formularzu czy wyniki wyszukiwania wewnętrznego.

Jedna mapa strony XML może zawierać do 50 000 adresów i ważyć do 50 MB bez kompresji. Większe serwisy dzielą ją na kilka plików i łączą je w indeks sitemap.

Mapa strony XML na stronie wielojęzycznej

Jeśli strona ma kilka wersji językowych, każda z nich powinna mieć własny adres URL, na przykład /en/services/ obok /uslugi/, i każda powinna trafić do mapy strony. Google traktuje wersje językowe jako osobne strony, więc brak angielskich adresów w sitemap spowalnia ich odkrywanie. Powiązania między wersjami językowymi opisuje się atrybutami hreflang, które można umieścić w kodzie strony lub bezpośrednio w mapie strony XML. Najważniejsze, by oznaczenia były wzajemne: jeśli polska strona wskazuje angielską, angielska musi wskazywać polską. Unikaj też jednego adresu, który w zależności od przeglądarki pokazuje różne języki, bo robot zobaczy tylko jedną wersję.

Plik robots.txt: co blokuje, a czego nie

Robots.txt to plik tekstowy w katalogu głównym domeny (/robots.txt), w którym mówisz robotom, których ścieżek nie powinny skanować. Przykład:

User-agent: *
Disallow: /koszyk/
Sitemap: https://example.com/sitemap.xml

Kluczowa i często mylona zasada: robots.txt blokuje skanowanie, a nie indeksowanie. Jeśli do zablokowanej strony prowadzą linki, Google może ją zaindeksować bez znajomości treści i pokazać sam adres. Dyrektywa Sitemap: w robots.txt to prosty sposób, by wskazać robotom lokalizację mapy strony.

Meta robots i noindex: jak wykluczyć stronę z wyników

Jeśli strona ma nie pojawiać się w Google, dodaj do niej tag <meta name="robots" content="noindex">. Aby Google go zobaczył, musi mieć możliwość zeskanowania strony, więc nie blokuj jej jednocześnie w robots.txt. To jeden z najczęstszych błędów: strona zablokowana w robots.txt i oznaczona noindex może nadal wisieć w wynikach, bo robot nigdy nie odczytał tagu.

NarzędzieNa co wpływaKiedy używać
Mapa strony XMLodkrywanie adresówzawsze, dla stron przeznaczonych do indeksu
robots.txtskanowanieby oszczędzać zasoby robota na stronach technicznych
meta robots noindexindeksowanieby wykluczyć konkretną stronę z wyników
link kanonicznywybór wersji do indeksugdy ta sama treść jest pod kilkoma adresami

Jak zgłosić sitemap w Google Search Console

  1. Zweryfikuj domenę w Google Search Console.
  2. Otwórz sekcję „Mapy witryn” i wpisz adres mapy strony, np. sitemap.xml.
  3. Sprawdź, czy status to „Sukces” i ile adresów wykryto.
  4. Po kilku dniach przejrzyj raport indeksowania stron i porównaj liczbę zaindeksowanych adresów z liczbą adresów w sitemap.

Do sprawdzenia pojedynczego adresu służy narzędzie „Sprawdzanie adresu URL”, które pokazuje, czy strona jest w indeksie, kiedy była skanowana i jaki adres Google uznał za kanoniczny. Po większych zmianach, na przykład po przebudowie menu lub dodaniu nowej sekcji, możesz poprosić tam o ponowne zindeksowanie najważniejszych adresów. Nie ma sensu robić tego dla każdej podstrony: przy dobrze działającej mapie strony i poprawnym linkowaniu wewnętrznym Google i tak znajdzie zmiany.

Najczęstsze problemy z indeksacją i ich przyczyny

  • Strona wykryta, ale niezaindeksowana: Google zna adres, ale jeszcze go nie przeskanował. Często chodzi o słabe linkowanie wewnętrzne lub niską wartość treści.
  • Strona przeskanowana, ale niezaindeksowana: Google ocenił treść jako mało wartościową lub zduplikowaną. Pomaga rozbudowa i ujednolicenie treści.
  • Duplikat, Google wybrał inną stronę kanoniczną: kilka adresów ma podobną treść. Ustaw link kanoniczny i ogranicz duplikaty.
  • Zablokowano przez robots.txt: sprawdź, czy blokada jest zamierzona.
  • Wykluczono tagiem noindex: częsty efekt pozostawienia ustawień ze środowiska testowego po publikacji.

Checklista indeksacji po uruchomieniu strony

  1. Mapa strony XML jest dostępna i zawiera tylko adresy kanoniczne z kodem 200.
  2. Robots.txt nie blokuje ważnych sekcji ani plików CSS i JS.
  3. Na produkcji nie ma tagów noindex pozostawionych z wersji testowej.
  4. Sitemap zgłoszona w Search Console, bez błędów.
  5. Każda wersja językowa ma własne adresy i jest ujęta w mapie strony.
  6. Ważne podstrony są podlinkowane z menu lub treści.

Jak to wygląda w LessCMS

  • Mapa strony XML i robots.txt są generowane automatycznie, bez ręcznej edycji plików.
  • Nowe wpisy w kolekcjach automatycznie dostają adres URL i wpis w sitemap, podobnie jak każda wersja językowa strony.
  • Strony są renderowane po stronie serwera, więc robot dostaje pełną treść HTML od razu.
  • Meta title i description ustawiasz per strona, wpis i język. Więcej przeczytasz w opisie funkcji SEO i wielojęzyczności.

Najczęstsze pytania

Czy mapa strony XML jest konieczna?

Nie jest obowiązkowa, ale bardzo pomaga, zwłaszcza przy nowych stronach, dużej liczbie podstron i słabym linkowaniu wewnętrznym. Małe, dobrze podlinkowane strony też mogą być zaindeksowane bez niej, jednak sitemap przyspiesza odkrywanie nowych adresów.

Jak sprawdzić, czy strona ma mapę strony XML?

Wpisz w przeglądarce adres domeny z końcówką /sitemap.xml albo sprawdź dyrektywę Sitemap: w pliku robots.txt. Status mapy zobaczysz też w Google Search Console.

Czy robots.txt ukrywa stronę przed Google?

Nie. Robots.txt blokuje skanowanie, ale zablokowany adres może trafić do indeksu, jeśli prowadzą do niego linki. Do wykluczenia strony z wyników użyj tagu noindex.

Dlaczego Google nie indeksuje mojej strony mimo sitemap?

Sitemap tylko informuje o adresach, a decyzję o indeksacji Google podejmuje na podstawie jakości i unikalności treści. Sprawdź raport indeksowania w Search Console, aby poznać konkretny powód.

Jak często Google odczytuje mapę strony?

Nie ma stałego harmonogramu, Google robi to według własnego uznania. Wiarygodna data lastmod i regularne aktualizacje treści pomagają szybciej wychwycić zmiany.

Chcesz, żeby mapa strony XML i robots.txt aktualizowały się same? Sprawdź plany LessCMS i załóż konto bez karty.

sitemaprobots.txtindeksacjasearch console

Zbuduj taką stronę u siebie

Wizualny edytor, treść przez API i SEO w standardzie — w każdym planie.