webh.pl

robots.txt, sitemap.xml i llms.txt

Do czego służą robots.txt, sitemap.xml i llms.txt, jak je przygotować i gdzie umieścić, aby wyszukiwarki i narzędzia AI dobrze czytały stronę.

  • czytania
  • Zaktualizowano:
SEO Strony i aplikacje
Hosting

Trzy pliki w głównym katalogu domeny wpływają na to, jak roboty widzą Twoją stronę: robots.txt mówi im, gdzie mogą zaglądać, sitemap.xml podaje wyszukiwarkom listę podstron, a llms.txt porządkuje treść dla narzędzi AI. Każdy jest prosty do przygotowania, a poprawnie ustawione pomagają w indeksowaniu i widoczności witryny. Ten poradnik tłumaczy, do czego służą i jak je skonfigurować.

robots.txt: Co roboty mogą odwiedzać

robots.txt to plik tekstowy z instrukcjami dla robotów wyszukiwarek: Wskazuje, których ścieżek mają nie odwiedzać. Leży zawsze w głównym katalogu domeny i jest dostępny pod adresem twojadomena.pl/robots.txt.

Prosty przykład wygląda tak:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://twojadomena.pl/sitemap.xml

Kolejno: Reguły dotyczą wszystkich robotów (User-agent: *), zakazują zaglądania do panelu, dopuszczają jeden potrzebny plik i wskazują adres mapy witryny.

Uwaga

robots.txt nie służy do ukrywania danych. To publiczny plik i tylko prośba, której roboty wyszukiwarek przestrzegają, ale nie blokuje on dostępu do plików. Treści, które mają być niewidoczne, chroń hasłem (zabezpieczanie katalogu hasłem) lub zakazem indeksowania, a nie wpisem w robots.txt.

Najczęstszy błąd to pozostawiony wpis Disallow: /, który blokuje całą stronę. Trafia tam zwykle z wersji testowej i potrafi wypaść stronę z wyników wyszukiwania, o czym piszemy przy migracji bez utraty pozycji.

Wskazówka

W WordPress robots.txt bywa generowany wirtualnie, a wtyczki SEO pozwalają go edytować z panelu. Sklepy i systemy CMS często mają własne ustawienia tego pliku, więc sprawdź, czy nie zarządza nim już Twoja aplikacja, zanim utworzysz plik ręcznie.

Content Signal: Jak sterować użyciem treści przez AI

Klasyczny robots.txt mówi tylko, czy robot może odwiedzić daną ścieżkę, ale nie rozróżnia, w jakim celu treść zostanie użyta. Odpowiedzią na rozwój robotów AI jest mechanizm content signals: Dodatkowa dyrektywa Content-Signal w robots.txt, którą deklarujesz preferencje co do wykorzystania Twojej treści.

Rozróżnia ona trzy zastosowania, każde ustawiane na yes lub no:

  • Search to budowanie indeksu wyszukiwarki i pokazywanie linków oraz fragmentów,
  • Ai-input to użycie treści jako materiału do odpowiedzi generowanych przez AI (np. w asystentach),
  • Ai-train to wykorzystanie treści do trenowania modeli AI.

Przykładowy wpis, który dopuszcza wyszukiwarki, ale nie zgadza się na trenowanie modeli:

User-Agent: *
Content-Signal: search=yes, ai-train=no
Allow: /

Informacja

Content signals to deklaracja preferencji, a nie techniczne zabezpieczenie, podobnie jak reszta robots.txt. Stosują się do niej narzędzia, które ją respektują, więc traktuj ją jako jasno wyrażone stanowisko co do wykorzystania treści, a nie twardą blokadę. To wciąż młody mechanizm, ale jego dodanie jest tanie i czytelnie komunikuje Twoje preferencje.

sitemap.xml: Mapa strony dla wyszukiwarek

sitemap.xml to lista adresów Twojej strony w formacie XML. Ułatwia wyszukiwarkom odnalezienie i zaindeksowanie wszystkich podstron, zwłaszcza gdy witryna jest duża lub ma podstrony słabo połączone linkami.

Mapy zwykle nie piszesz ręcznie:

  • W WordPress generują ją wtyczki SEO, automatycznie aktualizując po dodaniu treści,
  • Sklepy i systemy CMS często mają wbudowane generowanie mapy,
  • Dla stron statycznych użyjesz generatora mapy witryny.

Gdy mapa jest gotowa, zrób dwie rzeczy: Wskaż ją w robots.txt (linia Sitemap:) i prześlij jej adres w Google Search Console, żeby przyspieszyć indeksowanie.

llms.txt: Treść uporządkowana dla narzędzi AI

llms.txt to nowszy, proponowany standard pliku, który pomaga modelom i asystentom AI zrozumieć zawartość Twojej strony. Podobnie jak robots.txt, umieszczasz go w głównym katalogu, pod adresem twojadomena.pl/llms.txt, ale zapisujesz w formacie Markdown i podajesz w nim uporządkowany przewodnik po najważniejszych treściach oraz odnośniki do nich.

Prosty przykład:

# Nazwa firmy

> Krótki opis, czym zajmuje się strona.

## Dokumentacja
- [Cennik](https://twojadomena.pl/cennik): aktualne ceny usług
- [Pomoc](https://twojadomena.pl/pomoc): baza wiedzy i poradniki

## Kontakt
- [Kontakt](https://twojadomena.pl/kontakt): formularz i dane firmy

Plik tworzysz raz, jako zwykły dokument tekstowy, i wgrywasz do głównego katalogu strony.

Informacja

llms.txt to świeży standard i nie wszystkie narzędzia AI go uwzględniają. Jest opcjonalny, ale jego przygotowanie jest tanie, a może poprawić sposób, w jaki asystenci AI odczytują i przywołują Twoją stronę. Nie zastępuje robots.txt ani sitemap.xml.

Gdzie umieścić te pliki

Wszystkie trzy pliki muszą leżeć w głównym katalogu strony (tym, do którego prowadzi domena), żeby były dostępne wprost pod adresem domeny, na przykład twojadomena.pl/robots.txt. Pliki wgrasz przez FTP lub menedżer plików w panelu, jak opisujemy w poradniku o SSH i FTP. Jeśli plik generuje aplikacja (np. wtyczka SEO), edytuj go w niej, a nie wgrywaj drugiej kopii ręcznie.

Jak sprawdzić, czy działają

Najprościej otworzyć każdy plik w przeglądarce, wpisując jego adres:

  • twojadomena.pl/robots.txt
  • twojadomena.pl/sitemap.xml
  • twojadomena.pl/llms.txt

Jeśli plik się wyświetla, jest dostępny dla robotów. Poprawność robots.txt i mapy witryny dodatkowo sprawdzisz i zgłosisz w Google Search Console.

Najczęstsze pytania

Czy potrzebuję wszystkich trzech plików?

robots.txt i sitemap.xml warto mieć na każdej stronie, bo pomagają wyszukiwarkom. llms.txt jest opcjonalny i dotyczy narzędzi AI, więc dodaj go, jeśli zależy Ci, żeby asystenci AI lepiej rozumieli Twoją treść.

Czy robots.txt ukryje moje dane przed światem?

Nie. To publiczny plik i jedynie prośba do robotów, a nie zabezpieczenie. Treści, które mają być niedostępne, chroń hasłem lub zakazem indeksowania, a nie wpisem w robots.txt.

Strona zniknęła z Google po przebudowie, co sprawdzić?

W pierwszej kolejności robots.txt pod kątem wpisu Disallow: / oraz ustawienia indeksowania w aplikacji. Zostawiony z wersji testowej zakaz indeksowania to najczęstsza przyczyna zniknięcia strony z wyników, co opisujemy przy migracji bez utraty pozycji.

Jak często aktualizować sitemap.xml?

Jeśli mapę generuje wtyczka lub system CMS, aktualizuje się sama po dodaniu treści. Mapę tworzoną ręcznie odśwież po większych zmianach w strukturze strony.