Robots.txt
Die robots.txt ist eine öffentlich einsehbare Textdatei im Stammverzeichnis einer Website, die seriösen Crawlern mitteilt, welche Bereiche sie besuchen dürfen und welche vom Crawling ausgeschlossen sind.
In der Praxis
Eine robots.txt verhindert Crawling, aber nicht zwingend Indexierung – bereits verlinkte, gesperrte Seiten können trotzdem ohne Inhaltsvorschau in den Suchergebnissen auftauchen. Für den zuverlässigen Ausschluss einzelner Seiten aus dem Index ist stattdessen ein Meta-Robots-Tag mit „noindex“ das richtige Werkzeug.