Freitag, 7. März 2025
Die robots.txt ist ein bewährtes Werkzeug für Website-Betreiber, das seit über 30 Jahren im Einsatz ist und von Crawler-Betreibern (wie Tools für Website-Inhaber, Diensten und Suchmaschinen) umfassend unterstützt wird. In dieser Ausgabe der Robots-Refresher-Serie werfen wir einen genaueren Blick auf die robots.txt als flexible Methode, um Bots mitzuteilen, was sie auf Ihrer Website tun (oder lassen) sollen.
Erste Schritte mit der robots.txt
Die Funktionsweise dieser Dateien ist simpel: Sie erstellen eine Textdatei namens “robots.txt” und laden diese auf Ihre Website hoch – falls Sie ein Content-Management-System (CMS) verwenden, ist es meist sogar noch einfacher. Sie können Ihre robots.txt-Datei leer lassen (oder gar keine verwenden), wenn Ihre gesamte Website gecrawlt werden darf, oder Sie fügen Regeln hinzu, um das Crawling zu steuern. Um beispielsweise allen Bots (auch bekannt als Crawler, Robots, Spiders) mitzuteilen, dass sie Ihre “Warenkorb”-Seite meiden sollen, könnten Sie dies in Ihre robots.txt-Datei schreiben:
Spezifischere Möglichkeiten mit der robots.txt
Die robots.txt ist das Schweizer Taschenmesser, um festzulegen, was verschiedene Bots auf Ihrer Website tun oder lassen sollen: Sie kann aus nur wenigen Zeilen bestehen oder komplex mit detaillierten Regeln für ganz spezifische URL-Muster sein. Sie können eine robots.txt-Datei zur Lösung technischer Probleme (wie unnötige paginierte Seiten) oder aus redaktionellen oder persönlichen Gründen (etwa wenn bestimmte Inhalte nicht gecrawlt werden sollen) nutzen. Sie könnten zum Beispiel:
Mehrere Bots (aber nicht alle) über dieselbe Regel informieren Diese Gruppe weist sowohl | |
Einen Bot anweisen, Pfade mit einem bestimmten Textbaustein zu meiden Sie könnten zum Beispiel | |
Einem Bot erlauben, Ihren Blog zu crawlen, aber nicht die Entwürfe | |
Einen Crawler von einem Teil Ihrer Website ausschließen, während andere Crawler Zugriff erhalten Diese robots.txt-Datei untersagt dem genannten | |
Einen Kommentar für Ihr zukünftiges Ich hinterlassen Sie können eine Zeile mit |
Für noch mehr Informationen können Sie unsere Liste nützlicher robots.txt-Regeln einsehen.
Änderungen an Ihrer robots.txt-Datei (praktisch umgesetzt)
Das Robots Exclusion Protocol (REP) funktioniert, indem Regeln (“allow” oder “disallow“) zusammengestellt und die Bots spezifiziert werden, für die diese Regeln gelten. Sie müssen nicht programmieren lernen oder mit komplizierten Tools hantieren; Sie können diese Regeln einfach in eine Textdatei schreiben und auf Ihre Website hochladen.
Für die meisten Websites ist es sogar noch einfacher! Wenn Sie ein CMS verwenden, ist meist bereits eine Funktion integriert, die Ihnen bei der Bearbeitung Ihrer robots.txt-Datei hilft. Einige CMS ermöglichen es beispielsweise, die robots.txt-Datei über Kontrollkästchen oder ein einfaches Formular anzupassen, und viele bieten Plugins, die Sie beim Erstellen und Schreiben von Regeln für Ihre robots.txt-Datei unterstützen. Um zu prüfen, was in Ihrem CMS möglich ist, suchen Sie einfach nach dem Namen Ihres CMS + “robots.txt-Datei bearbeiten”.
Sobald alles eingerichtet ist, können Sie testen, ob Ihre Datei wie gewünscht funktioniert. Es gibt viele von der Web-Community entwickelte Test-Tools, die dabei helfen, wie das robots.txt-Test-Tool von TametheBot und dieser robots.txt-Parser, die auf der Open-Source-Parser-Bibliothek für robots.txt basieren.
Wenn Sie Fragen zur robots.txt haben, finden Sie uns auf LinkedIn oder können sich mit gleichgesinnten Experten in unseren Community-Foren austauschen.
Entdecken Sie den Rest der Robots-Refresher-Serie:
So setzen wir das um
We archive Search Central announcements because client questions often trace back to a change that was announced years ago. Reading the original is faster than reconstructing it from second-hand summaries.
Verwandte Leistungen