Crawling infrastructure

So erstellen und übermitteln Sie eine robots.txt-Datei

Sie können mit einer robots.txt-Datei
steuern, auf welche Dateien Crawler zugreifen dürfen
auf Ihrer Website.

Eine robots.txt-Datei befindet sich im Stammverzeichnis Ihrer Website. Für die Website www.example.com liegt die robots.txt-Datei also unter www.example.com/robots.txt. robots.txt ist eine einfache Textdatei, die dem
Robots Exclusion Standard folgt.
Eine robots.txt-Datei besteht aus einer oder mehreren Regeln. Jede Regel blockiert oder erlaubt den Zugriff für alle oder einen bestimmten Crawler auf einen festgelegten Dateipfad auf der Domain oder Subdomain, auf der die robots.txt-Datei gehostet wird. Sofern Sie in Ihrer robots.txt-Datei nichts anderes angeben, ist das Crawlen aller Dateien implizit erlaubt.

Hier ist eine einfache robots.txt-Datei mit zwei Regeln:

Das bedeutet diese robots.txt-Datei:

  1. Dem User-Agent namens Googlebot ist es nicht gestattet, URLs zu crawlen, die mit
    https://example.com/nogooglebot/ beginnen.
  2. Alle anderen User-Agents dürfen die gesamte Website crawlen. Dies hätte auch weggelassen werden können, das Ergebnis wäre dasselbe; das Standardverhalten ist, dass User-Agents die gesamte Website crawlen dürfen.
  3. Die Sitemap-Datei der Website befindet sich unter
    https://www.example.com/sitemap.xml.

Weitere Beispiele finden Sie im Abschnitt Syntax.

Grundlegende Richtlinien für die Erstellung einer robots.txt-Datei

Die Erstellung einer robots.txt-Datei und deren allgemeine Zugänglichkeit und Nützlichkeit umfasst vier Schritte:

  1. Erstellen Sie eine Datei namens robots.txt.
  2. Fügen Sie Regeln zur robots.txt-Datei hinzu.
  3. Laden Sie die robots.txt-Datei in das Stammverzeichnis Ihrer Website hoch.
  4. Testen Sie die robots.txt-Datei.

Erstellen einer robots.txt-Datei

Sie können fast jeden Texteditor verwenden, um eine robots.txt-Datei zu erstellen. Zum Beispiel können Notepad, TextEdit, vi und emacs gültige robots.txt-Dateien erstellen. Verwenden Sie keine Textverarbeitungsprogramme; diese speichern Dateien oft in einem proprietären Format und können unerwartete Zeichen wie typografische Anführungszeichen hinzufügen, was zu Problemen für Crawler führen kann. Achten Sie darauf, die Datei mit UTF-8-Kodierung zu speichern, falls Sie im Dialogfeld zum Speichern dazu aufgefordert werden.

Regeln für Format und Speicherort:

  • Die Datei muss den Namen robots.txt tragen.
  • Ihre Website darf nur eine robots.txt-Datei haben.
  • Die robots.txt-Datei muss sich im Stammverzeichnis des Website-Hosts befinden, für den sie gilt. Um beispielsweise das Crawlen aller URLs unter https://www.example.com/ zu steuern, muss die robots.txt-Datei unter https://www.example.com/robots.txt liegen. Sie kann nicht in einem Unterverzeichnis platziert werden (z. B. unter https://example.com/pages/robots.txt). Wenn Sie sich nicht sicher sind, wie Sie auf Ihr Website-Stammverzeichnis zugreifen können, oder Berechtigungen dafür benötigen, wenden Sie sich an Ihren Webhosting-Anbieter. Wenn Sie nicht auf Ihr Stammverzeichnis zugreifen können, verwenden Sie eine alternative Blockierungsmethode wie meta-Tags.
  • Eine robots.txt-Datei kann auf einer Subdomain (z. B. https://site.example.com/robots.txt) oder auf nicht standardmäßigen Ports (z. B. https://example.com:8181/robots.txt) veröffentlicht werden.
  • Eine robots.txt-Datei gilt nur für Pfade innerhalb des Protokolls, des Hosts und des Ports, unter denen sie veröffentlicht ist. Das bedeutet, Regeln in https://example.com/robots.txt gelten nur für Dateien unter https://example.com/, nicht für Subdomains wie https://m.example.com/ oder alternative Protokolle wie http://example.com/.
  • Eine robots.txt-Datei muss eine UTF-8-kodierte Textdatei sein (was ASCII einschließt). Google ignoriert möglicherweise Zeichen, die nicht zum UTF-8-Bereich gehören, wodurch robots.txt-Regeln möglicherweise ungültig werden.

So schreiben Sie robots.txt-Regeln

Regeln sind Anweisungen für Crawler, welche Teile Ihrer Website sie crawlen dürfen. Befolgen Sie diese Richtlinien, wenn Sie Regeln zu Ihrer robots.txt-Datei hinzufügen:

  • Eine robots.txt-Datei besteht aus einer oder mehreren Gruppen (Regelsätzen).
  • Jede Gruppe besteht aus mehreren Regeln (auch Direktiven genannt), eine Regel pro Zeile. Jede Gruppe beginnt mit einer User-agent-Zeile, die das Ziel der Gruppe angibt.
  • Eine Gruppe liefert folgende Informationen:
    • Für wen die Gruppe gilt (der User-Agent).
    • Auf welche Verzeichnisse oder Dateien dieser Agent zugreifen kann.
    • Auf welche Verzeichnisse oder Dateien dieser Agent nicht zugreifen kann.
  • Crawler verarbeiten Gruppen von oben nach unten. Ein User-Agent kann nur mit einem Regelsatz übereinstimmen, und zwar mit der ersten, spezifischsten Gruppe, die auf den jeweiligen User-Agent zutrifft. Wenn es mehrere Gruppen für denselben User-Agent gibt, werden diese vor der Verarbeitung zu einer einzigen Gruppe zusammengefasst.
  • Die Standardannahme ist, dass ein User-Agent jede Seite oder jedes Verzeichnis crawlen kann, das nicht durch eine disallow-Regel blockiert ist.
  • Regeln unterscheiden zwischen Groß- und Kleinschreibung. Zum Beispiel gilt disallow: /file.asp für https://www.example.com/file.asp, aber nicht für https://www.example.com/FILE.asp.
  • Das Zeichen # markiert den Beginn eines Kommentars. Kommentare werden bei der Verarbeitung ignoriert.

Googles Crawler unterstützen die folgenden Regeln in robots.txt-Dateien:

  • user-agent: [Erforderlich, eine oder mehrere pro Gruppe] Die Regel gibt den Namen des automatischen Clients an, der als Suchmaschinen-Crawler bekannt ist und auf den die Regel angewendet wird. Dies ist die erste Zeile jeder Regelgruppe. Die Namen der Google User-Agents sind in der Google-Liste der User-Agents aufgeführt. Die Verwendung eines Sternchens (*) entspricht allen Crawlern außer den verschiedenen AdsBot-Crawlern, die explizit benannt werden müssen. Zum Beispiel:
  • disallow: [Mindestens ein oder mehrere disallow– oder allow-Einträge pro Regel] Ein Verzeichnis oder eine Seite, relativ zur Stamm-Domain, die der User-Agent nicht crawlen soll. Wenn sich die Regel auf eine Seite bezieht, muss es der vollständige Seitenname sein, wie er im Browser angezeigt wird. Sie muss mit einem /-Zeichen beginnen, und wenn sie sich auf ein Verzeichnis bezieht, muss sie mit dem /-Zeichen enden.
  • allow: [Mindestens ein oder mehrere disallow– oder allow-Einträge pro Regel] Ein Verzeichnis oder eine Seite, relativ zur Stamm-Domain, die vom gerade genannten User-Agent gecrawlt werden darf. Dies wird verwendet, um eine disallow-Regel aufzuheben und das Crawlen eines Unterverzeichnisses oder einer Seite in einem blockierten Verzeichnis zu erlauben. Geben Sie für eine einzelne Seite den vollständigen Seitennamen an, wie er im Browser angezeigt wird. Sie muss mit einem /-Zeichen beginnen, und wenn sie sich auf ein Verzeichnis bezieht, muss sie mit dem /-Zeichen enden.
  • sitemap: [Optional, null oder mehr pro Datei] Der Speicherort einer Sitemap für diese Website. Die Sitemap-URL muss eine vollständig qualifizierte URL sein; Google geht nicht von http/https/www./non-www-Alternativen aus und prüft diese auch nicht. Sitemaps sind eine gute Möglichkeit, um anzugeben, welche Inhalte Google crawlen sollte, im Gegensatz zu den Inhalten, die es crawlen kann oder nicht kann.
    Erfahren Sie mehr über Sitemaps.
    Beispiel:

Alle Regeln, außer sitemap, unterstützen den *-Platzhalter für ein Pfadpräfix, -suffix oder eine ganze Zeichenfolge.

Zeilen, die keiner dieser Regeln entsprechen, werden ignoriert.

Lesen Sie unsere Seite über die Interpretation der robots.txt-Spezifikation durch Google für eine vollständige Beschreibung jeder Regel.

Hochladen der robots.txt-Datei

Sobald Sie Ihre robots.txt-Datei auf Ihrem Computer gespeichert haben, können Sie sie für Suchmaschinen-Crawler verfügbar machen. Es gibt kein einzelnes Tool, das Ihnen dabei helfen kann, da das Hochladen der robots.txt-Datei auf Ihre Website von Ihrer Website- und Serverarchitektur abhängt. Setzen Sie sich mit Ihrem Hosting-Unternehmen in Verbindung oder durchsuchen Sie dessen Dokumentation; suchen Sie beispielsweise nach „Dateien hochladen [Name des Anbieters]“.

Nachdem Sie die robots.txt-Datei hochgeladen haben, testen Sie, ob sie öffentlich zugänglich ist und ob Google sie parsen kann.

Testen des robots.txt-Markups

Um zu testen, ob Ihre neu hochgeladene robots.txt-Datei öffentlich zugänglich ist, öffnen Sie ein privates Browserfenster (oder ein Äquivalent) in Ihrem Browser und navigieren Sie zum Speicherort der robots.txt-Datei. Zum Beispiel https://example.com/robots.txt. Wenn Sie den Inhalt Ihrer robots.txt-Datei sehen, können Sie das Markup testen.

Google bietet zwei Optionen zur Behebung von Problemen mit dem robots.txt-Markup:

  1. Der robots.txt-Bericht in der Search Console. Sie können diesen Bericht nur für robots.txt-Dateien verwenden, die bereits auf Ihrer Website zugänglich sind.
  2. Wenn Sie Entwickler sind, sehen Sie sich Googles Open-Source-robots.txt-Bibliothek an, die auch in der Google Suche verwendet wird. Sie können dieses Tool verwenden, um robots.txt-Dateien lokal auf Ihrem Computer zu testen.

Einreichen der robots.txt-Datei bei Google

Sobald Sie Ihre robots.txt-Datei hochgeladen und getestet haben, finden Googles Crawler diese automatisch und beginnen mit der Verwendung. Sie müssen nichts weiter tun. Wenn Sie Ihre robots.txt-Datei aktualisiert haben und die zwischengespeicherte Kopie von Google so schnell wie möglich aktualisieren müssen, erfahren Sie hier, wie Sie eine aktualisierte robots.txt-Datei einreichen.

Alien Road

So setzen wir das um

Most robots.txt files we inherit contain rules nobody can explain. We rewrite them from scratch against this guidance and document each line, so the next team knows what it is safe to change.

Verwandte Leistungen

Teilen

© Copyright 2026 Alien Road. All rights reserved.