heheh no wlasnie mialem taki blad, ale już działa
[ Dodano: 06 Wrz 2005 17:30 ]A o co chodzi z tym, czy ja u siebie w pliku bot.txt też musze wstawiać to co tam jest napisane?
Kod:
Plik robots.txt
Plik robots.txt powinien znajdować się w głównym katalogu witryny, tzn. w przypadku witryny o nazwie www.witryna.pl powinien mieć adres www.witryna.pl/robots.txt.
W pliku robots.txt można zabronić wchodzenia do witryny wszystkim robotom lub tylko niektórym (w szczególności np. tylko Szukaczowi). Można zabronić im wchodzenia w ogóle lub tylko do niektórych katalogów, jakie się w niej znajdują.
Dokładny opis (po angielsku) pliku robots.txt znajduje się pod adresem: http://www.robotstxt.org/wc/norobots.html
Poniżej podajemy kilka najprostszych przykładów.
Plik o poniższej treści POZWALA wszystkim robotom wchodzić do witryny i czytać wszystkie pliki, jakie w niej są:
User-agent: *
Disallow:
Plik o poniższej treści ZABRANIA wszystkim robotom wchodzić do witryny i czytać cokolwiek:
User-agent: *
Disallow: /
Plik o poniższej treści ZABRANIA robotowi o nazwie Szukacz wchodzić i czytać cokolwiek:
User-agent: szukacz
Disallow: /
Plik o poniższej treści ZABRANIA robotowi o nazwie Szukacz wchodzić do katalogu /tmp, /logs, /koszyk oraz czytać plik /foo.html, a wszystkim pozostałym robotom ZABRANIA tylko wchodzić do katalogów /tmp oraz /logs:
User-agent: szukacz
Disallow: /tmp/
Disallow: /logs/
Disallow: /koszyk/
Disallow: /foo.html
User-agent: *
Disallow: /tmp/
Disallow: /logs/
UWAGA! Kolejność, w jakiej wymienione są nazwy robotów, nie ma znaczenia. Równie dobrze można zdefiniować ten plik w poniższy sposób:
User-agent: *
Disallow: /tmp/
Disallow: /logs/
User-agent: szukacz
Disallow: /tmp/
Disallow: /logs/
Disallow: /koszyk/
Disallow: /foo.html
Plik o poniższej treści pozwala Szukaczowi wchodzić wszędzie, a ZABRANIA wszystkim pozostałym robotom wchodzić do katalogów /tmp oraz /logs:
User-agent: szukacz
Disallow:
User-agent: *
Disallow: /tmp/
Disallow: /logs/
W ten sposób można dość dokładnie określić, co robotom wolno czytać, a czego nie.
Jeśli w witrynie nie ma w ogóle pliku robots.txt, roboty stwierdzają, że wolno im wchodzić do witryny i czytać wszystkie pliki.
Uwaga: Jeśli serwer www na pytanie naszego robota o plik robots.txt odpowiada, że nie ma on prawa dostępu do tego pliku (kod 403 oznaczający "Access forbiden"), nasz robot NIE WCHODZI do tej witryny i niczego z niej nie indeksuje.
Serwis Komputerowy OC-TEAM