robots.txt, sitemap.xml i llms.txt: trzy pliki, trzy różne zadania
Jedna osoba mówi, że trzeba dodać llms.txt. Druga, że wystarczy dobrze ustawiony robots.txt. Trzecia, że przecież masz mapę strony, więc temat jest załatwiony. Wszystkie trzy pliki leżą w tym samym miejscu, mają podobnie wyglądające nazwy i wszystkie trzy adresowane są do automatów — więc naturalnie wydaje się, że robią to samo, tylko inaczej.
Nie robią. Odpowiadają na trzy zupełnie różne pytania i żaden nie zastępuje żadnego innego.
W skrócie: robots.txt mówi, gdzie automaty mają wstęp — jest jedynym z tej trójki, który czegokolwiek zabrania. Mapa strony to kompletny spis adresów, które chcesz mieć w wyszukiwarce. llms.txt jest skróconym wprowadzeniem dla asystentów AI: jedną stroną tekstu, na której sam mówisz, o czym jest Twój sklep i gdzie szukać rzeczy istotnych. Pierwszy odpowiada na pytanie „gdzie wolno wejść”, drugi „co tu jest”, trzeci „o czym to jest”.
W tym tekście: co dokładnie robi każdy z nich, czego nie robi mimo powszechnego przekonania, w jakiej kolejności się nimi zajmować i dlaczego przy pierwszym z nich jedna decyzja potrafi kosztować widoczność w asystentach.
robots.txt: gdzie automaty mają wstęp
Najstarszy z trójki, obecny w sieci od trzydziestu lat, i jedyny, który cokolwiek ogranicza — zawiera reguły mówiące, które automaty mogą wchodzić na które części witryny. W sklepie służy przede wszystkim do odcięcia rzeczy, które w wynikach wyszukiwania nie mają czego szukać: wyników wyszukiwarki wewnętrznej, koszyka, panelu klienta i wariantów adresów powstających przy filtrowaniu. Każda platforma generuje taki plik automatycznie i zwykle robi to sensownie; kłopot polega na tym, że prawie nikt nigdy do niego nie zagląda, a przy okazji kolejnych wdrożeń dopisują do niego kolejne osoby.
Dwie rzeczy, których ten plik nie robi, choć powszechnie się mu je przypisuje. Po pierwsze, nie ukrywa treści — reguła w nim zapisana jest prośbą skierowaną do automatu, a nie zabezpieczeniem, więc to, co ma być naprawdę niedostępne, musi stać za logowaniem. Po drugie, nie usuwa stron z wyników wyszukiwania: zablokowany adres potrafi się w nich utrzymać, jeśli prowadzą do niego odnośniki z innych witryn, tyle że bez opisu, bo robot nie mógł go przeczytać. Gdyby zaś tego pliku w ogóle nie było, automaty wchodziłyby wszędzie, łącznie z adresami generującymi tysiące wariantów tej samej strony — dlatego w praktyce ma go każdy sklep, świadomie albo nie.
Konfiguracja wygląda inaczej na każdej platformie i ma swoje pułapki, więc rozpisaliśmy ją w osobnych tekstach: jak działa plik robots.txt w PrestaShop i jak działa plik robots.txt w WooCommerce.
sitemap.xml: kompletny spis adresów
Mapa strony to lista wszystkich adresów, które chcesz mieć w wyszukiwarce. W sklepie generuje się automatycznie i aktualizuje sama przy każdej zmianie w katalogu, więc zwykle nikt się nią nie zajmuje — i słusznie, o ile działa. Gdyby jej zabrakło, wyszukiwarka i tak znalazłaby Twoje strony, tylko wolniej i mniej kompletnie.
Są natomiast dwie rzeczy, które mapa z definicji robi inaczej niż plik dla asystentów, i to one przesądzają, że jedno nie zastępuje drugiego. Mapa zawiera adresy, a nie treść ani jej streszczenie — mówi „te strony istnieją”, ale milczy o tym, co na nich jest i która z nich jest ważniejsza. Obejmuje przy tym zbiór zbyt duży, żeby przeczytać go w całości: sklep z pięcioma tysiącami produktów ma w mapie pięć tysięcy adresów, co dla wyszukiwarki odwiedzającej strony po kolei przez tygodnie jest formatem właściwym, a dla asystenta, który ma ułożyć odpowiedź w kilka sekund — bezużytecznym.
llms.txt: skrócone wprowadzenie dla asystentów
Jedna strona tekstu: nazwa sklepu, krótkie streszczenie, a pod nim pogrupowane odnośniki do tego, co w tym sklepie rozstrzyga, każdy z jednozdaniowym opisem. Zamiast pięciu tysięcy adresów kilkanaście, za to z informacją, po co tam iść. Kluczowa różnica wobec dwóch poprzednich plików polega na tym, że ten nie jest ani zakazem, ani inwentarzem — jest streszczeniem, które napisałeś sam. Nic w nim nie powstaje automatycznie z bazy sklepu i właśnie w tym leży jego wartość, bo struktura sklepu mówi, jakie są kategorie, a nie która z nich Cię utrzymuje. Sama propozycja formatu stawia tę granicę wprost: informacje z llms.txt są używane na żądanie, wtedy gdy agent ich potrzebuje, podczas gdy reguły dostępu obowiązują przy każdym wejściu.
Czego ten plik nie robi: nie wpływa na pozycje w wynikach wyszukiwania Google i sam Google to potwierdza, pisząc, że utrzymywanie takich plików na potrzeby innych usług jest w porządku, ale jego wyszukiwarce ani nie zaszkodzi, ani nie pomoże. Kto sprzedaje go jako sposób na wyższe pozycje, sprzedaje coś innego, niż jest napisane na opakowaniu. Co się natomiast dzieje, gdy go nie ma: asystent, który trafi na Twój sklep, wyrabia sobie zdanie na podstawie kilku przypadkowych podstron — czasem będzie to kategoria, która Cię utrzymuje, a czasem wpis blogowy sprzed czterech lat o promocji, która dawno się skończyła.
Jak taki plik napisać, tłumaczy tekst jak napisać plik llms.txt krok po kroku, a gotowe przykłady dla różnych typów sklepu zebraliśmy w tekście gotowe przykłady pliku llms.txt dla różnych sklepów.
Wszystko w jednej tabeli
| robots.txt | sitemap.xml | llms.txt | |
|---|---|---|---|
| odpowiada na pytanie | gdzie wolno wejść | co tu jest | o czym to jest |
| kto to pisze | wdrożeniowiec, raz | generuje się samo | człowiek, który zna sklep |
| jak długi | kilkanaście linii | tyle, ile adresów | jedna strona |
| dla kogo przede wszystkim | wszystkie automaty | wyszukiwarki | asystenci AI |
| czy coś blokuje | tak, w formie prośby | nie | nie |
| co się stanie bez niego | automaty wchodzą wszędzie | wyszukiwarka znajdzie wolniej | asystent zgaduje z przypadkowych stron |
Najczęstsze nieporozumienia
„Mam mapę strony, więc plik dla asystentów jest zbędny.” Mapa wymienia adresy i nie zawiera ani streszczeń, ani informacji o tym, co jest ważniejsze. Do tego jest za duża, żeby przeczytać ją w całości. To są dwa różne narzędzia do dwóch różnych zadań.
„Zablokowałem boty AI w robots.txt, więc jestem bezpieczny.” Blokada jest prośbą, a nie zabezpieczeniem. Część automatów wprost deklaruje w swojej dokumentacji, że przy pobieraniu strony na życzenie konkretnego użytkownika reguł nie stosuje. Treść, która ma być naprawdę niedostępna, musi być za logowaniem.
„Plik dla asystentów zastąpi mi robots.txt.” Nie zastąpi, bo niczego nie ogranicza. To jest zaproszenie z planem zwiedzania, a nie tabliczka z napisem, gdzie nie wolno wchodzić.
„Dodanie llms.txt poprawi moje pozycje w Google.” Nie poprawi i Google mówi to wprost. Wartość tego pliku leży gdzie indziej.
Boty: jedna decyzja, która potrafi kosztować widoczność
To jest część, dla której warto znać cały ten temat, a nie tylko nazwy plików, bo tutaj jedna linijka potrafi kosztować obecność w odpowiedziach asystentów. Automaty dostawców AI nie są jednym bytem: u tego samego dostawcy jeden zbiera treści do trenowania modeli, a zupełnie inny odpowiada za to, czy Twoja strona może w ogóle pojawić się w wynikach wyszukiwania wewnątrz jego asystenta — i o tym drugim dokumentacja mówi wprost, że witryny, które się z niego wypisały, nie będą pokazywane w odpowiedziach. Konsekwencja jest niemiła: właściciel sklepu, który usłyszał, że „AI kradnie treści”, i zablokował wszystko, co wyglądało na sztuczną inteligencję, przy okazji wypisał się z bycia widocznym, a zwykle nie ma o tym pojęcia, bo nic nie stało się od razu i nic go o tym nie powiadomiło.
Do tego dwie rzeczy warte znajomości, zanim ktokolwiek zacznie edytować ten plik u Ciebie. Blokowanie po adresie sieciowym jest przez dostawców odradzane, ponieważ uniemożliwia automatowi przeczytanie reguł, czyli odbiera mu możliwość zastosowania się do nich — blokada wygląda wtedy na mocniejszą, a w praktyce zamyka drogę, którą reguły w ogóle działają. Nie każdy automat te reguły zresztą stosuje: przy pobraniu wykonanym na życzenie konkretnego użytkownika część dostawców wprost deklaruje, że ich nie sprawdza.
Pełną listę automatów z podziałem na funkcje i trzy gotowe warianty konfiguracji zebraliśmy w tekście które boty AI odwiedzają sklep i co z nimi zrobić. Tutaj wystarczy zasada: nie dopisuj blokad automatów AI, zanim nie sprawdzisz, który z nich za co odpowiada.
W jakiej kolejności się tym zająć
Najpierw plik z regułami dostępu, ponieważ rozstrzyga, co w ogóle zostanie obejrzane, a błąd w nim kosztuje najwięcej — sprawdź przede wszystkim, czy nie blokujesz automatu odpowiadającego za obecność w asystencie, skoro chcesz tam być. Potem mapa strony, przy której zwykle wystarczy sprawdzić, czy się generuje i czy nie wypisuje adresów nieistniejących albo zablokowanych w pliku z regułami; ta sprzeczność zdarza się częściej, niż powinna, i jest bardzo łatwa do przeoczenia, bo oba pliki ogląda się osobno. Na końcu plik dla asystentów, bo ma sens dopiero wtedy, gdy dwa poprzednie mu nie przeszkadzają — streszczenie sklepu opublikowane pod adresem, do którego nikt nie ma wstępu, jest listem do nikogo.
Jeśli nie chcesz sprawdzać tego samodzielnie, prześlij nam adres sklepu — w darmowym raporcie GEO sprawdzamy między innymi wszystkie trzy pliki i to, czy nie przeszkadzają sobie nawzajem.
Zanim uznasz temat za zamknięty
- Otwórz adres sklepu z dopiskiem
/robots.txt. Plik istnieje? Jeśli widzisz błąd, trzeba go wygenerować. - Poszukaj w nim nazw automatów AI —
GPTBot,ClaudeBot,PerplexityBoti podobnych. Jeśli przy którejś widniejeDisallow, sprawdź, czy to była świadoma decyzja. - Sprawdź, czy nie blokujesz plików odpowiadających za wygląd strony — arkuszy stylów i skryptów. To jest najkosztowniejszy błąd w tym pliku.
- Otwórz adres z dopiskiem
/sitemap.xml. Mapa się generuje i zawiera aktualne adresy? - Sprawdź, czy mapa nie wypisuje adresów zablokowanych w pliku z regułami. Te dwa pliki powinny mówić to samo.
- Otwórz adres z dopiskiem
/llms.txt. Jeśli widzisz treść, której nie kojarzysz, postawiła ją wtyczka i warto ją przeczytać. - Jeśli czegokolwiek z tego nie rozumiesz, pokaż to osobie opiekującej się sklepem. Te pliki są pisane dla automatów, nie dla ludzi, i nie ma w tym nic dziwnego.
Najczęstsze pytania
Czym różni się llms.txt od robots.txt?
Odpowiadają na różne pytania. robots.txt mówi, gdzie automaty mają wstęp, i jest jedynym z tych plików, który cokolwiek ogranicza. llms.txt nie ogranicza niczego — jest streszczeniem witryny, z którego asystent korzysta wtedy, gdy potrzebuje informacji.
Jakie pliki powinien mieć sklep internetowy, żeby był widoczny dla AI?
Trzy: plik z regułami dostępu, mapę strony i plik llms.txt. Dwa pierwsze ma dziś praktycznie każdy sklep, bo generuje je platforma — warto je jednak przejrzeć, bo powstały bez niczyjej decyzji. Trzeci trzeba napisać samodzielnie i to on jest skierowany wprost do asystentów AI.
Czy llms.txt zastąpi mapę strony?
Nie. Mapa jest kompletnym spisem adresów dla wyszukiwarki, a plik dla asystentów krótkim wprowadzeniem z kilkunastoma najważniejszymi pozycjami. Jedno nie wyklucza drugiego.
Czy wpis o llms.txt powinien znaleźć się w robots.txt?
Nie ma takiego wymogu. Plik leży pod znanym adresem i tam się go szuka. Nowsza wersja propozycji formatu opisuje natomiast sposoby ogłaszania go przez znacznik w nagłówku strony i nagłówek odpowiedzi serwera — to drobiazg wdrożeniowy.
Zablokowałem boty AI. Jak to odkręcić?
Sprawdź najpierw, które dokładnie zablokowałeś i po co. Blokada automatu zbierającego dane treningowe to inna decyzja niż blokada automatu odpowiadającego za obecność w wynikach asystenta, choć żadna z nich nie jest bez konsekwencji — a w wielu sklepach zrobiono obie naraz, chcąc zrobić tę pierwszą. Warto przy tym wiedzieć, że blokada automatów treningowych też ma swoją cenę: model przestaje wiedzieć cokolwiek o Twojej marce, gdy odpowiada bez szukania w sieci, a przy niektórych wpisach — jak token sterujący Google — oznacza wprost rezygnację z cytowań w asystencie tego dostawcy. Rozkładamy to na części w osobnym tekście: które boty AI odwiedzają sklep i co z nimi zrobić.
Czy te pliki wpływają na pozycje w Google?
Plik z regułami dostępu owszem, bo rozstrzyga, co w ogóle zostanie odwiedzone. Mapa strony pomaga w kompletności indeksowania. Plik dla asystentów nie wpływa i Google mówi to wprost.
Kto powinien się tym zająć?
Sprawdzenie możesz wykonać sam w kwadrans. Zmiany w pliku z regułami dostępu lepiej zlecić osobie utrzymującej sklep, bo jedna źle postawiona linia potrafi odciąć od wyszukiwarki cały katalog.
Pytania zamiast nazw
Najprościej zapamiętać to tak: gdzie wolno wejść, co tu jest i o czym to jest. Każdy z tych plików odpowiada na jedno z tych pytań i żaden nie odpowiada na dwa.
Otwórz swój sklep z dopiskiem /robots.txt i sprawdź jedną rzecz: czy widnieje tam nazwa automatu odpowiadającego za obecność w asystencie razem z regułą zakazu. Jeśli tak, ktoś kiedyś podjął za Ciebie decyzję biznesową, nazywając ją techniczną — i to jest pierwsza rzecz do naprawienia, zanim zajmiesz się czymkolwiek innym.
A jeśli wolisz, żeby ktoś przeszedł te trzy pliki z Tobą, zamów darmowy raport GEO. Sprawdzamy w nim, czy asystenci mają dostęp do Twojego sklepu i co z niego wyczytują. Jeśli wolisz od razu zobaczyć, ile kosztuje wdrożenie i co obejmuje, mamy zakres i ceny pakietów GEO.

Ponad 9 lat na rynku, setki wdrożonych realizacji
Nasi klienci rozpoczynają z nami współpracę, ponieważ potrzebują cyfrowej transformacji. Zostają z nami, ponieważ znajdują w WebCrafters solidnego partnera biznesowego, wspierającego ich kompleksowo od strony technologicznej.
Nie jesteśmy tylko software housem. Jesteśmy Twoim zewnętrznym działem IT, który zadba o Twój biznes tak samo, jak zespół programistów, designerów i project managerów, który pracowałby bezpośrednio w Twojej firmie.
Zbuduj z nami swój nowy produkt!
Umów się na bezpłatną konsultację z ekspertem i porozmawiajmy
o Twoich oczekiwaniach.
