Vorlage für robots.txt und Crawling-Direktiven
Kopierfertige robots.txt-Muster für die häufigsten Website-Konfigurationen, plus die Regeln, die verhindern, dass Sie Google versehentlich aussperren.
Die robots.txt ist die erste Datei, die die meisten Crawler abrufen, und eine falsche Zeile kann Ihre gesamte Website aus der Suche verbergen. Diese kopierfertigen Muster decken die Situationen ab, auf die Website-Betreiber am häufigsten stoßen, mit verständlichen Hinweisen dazu, was jede Direktive bewirkt. Ersetzen Sie die Platzhalter in eckigen Klammern durch Ihre eigenen Pfade und Ihre Domain und prüfen Sie die Datei, bevor Sie sie veröffentlichen.
6 einsatzbereite Varianten
Standard-Produktivseite
Eine normale Live-Website, die vollständiges Crawling und einen Verweis auf die Sitemap wünscht.
Verwenden, wenn: Sie eine gesunde Produktivseite betreiben und möchten, dass Suchmaschinen alles frei crawlen und Ihre Sitemap schnell finden.
Direktiven
- User-agent: *
- Disallow: (Wert leer lassen, um alles zuzulassen)
- Sitemap: [https://example.com/sitemap.xml]
Ein leeres Disallow bedeutet, dass nichts blockiert ist. Sie benötigen dafür keine Allow-Zeile; Zulassen als Standard ist das übliche Verhalten.
Optionale Hygiene
- Disallow: [/wp-admin/] (einen echten Admin-Pfad blockieren, falls vorhanden)
- Allow: [/wp-admin/admin-ajax.php]
Hinweis: Die robots.txt steuert das Crawling, nicht die Indexierung. Eine blockierte URL kann trotzdem in den Ergebnissen erscheinen, wenn andere Seiten darauf verlinken. Um eine Seite aus dem Index zu halten, erlauben Sie das Crawling und fügen ein noindex-Meta-Tag hinzu oder schützen sie hinter einem Login. Legen Sie die Datei im Domain-Root ab: [https://example.com/robots.txt].
Staging-, Dev- oder Pre-Launch-Seite
Eine nicht öffentliche Umgebung, die vollständig aus der Suche gehalten werden muss.
Verwenden, wenn: die Website ein Staging-Server, eine Entwicklungskopie oder ein Pre-Launch-Build ist, den niemand in der Suche finden soll.
Direktiven
- User-agent: *
- Disallow: /
Ein einzelnes Disallow: / weist regelkonforme Crawler an, jede URL auf dem Host zu überspringen. Hier ist das beabsichtigt und überall sonst gefährlich.
Kritische Warnung: Lassen Sie diese Zeile niemals in die Produktion gelangen. Die häufigste Deindexierungs-Katastrophe ist ein Disallow: /, das beim Deployment vom Staging auf die Live-Seite kopiert wird.
Stärkerer Schutz
- Die robots.txt ist eine Bitte, kein Schloss. Skrupellose Crawler ignorieren sie.
- Fügen Sie eine HTTP-Authentifizierung (Benutzername und Passwort) hinzu, damit die Umgebung wirklich privat ist.
- Wenn Sie ein seitenweites noindex als Absicherung hinzufügen, blockieren Sie die Seite nicht zugleich mit Disallow: /: Eine blockierte Seite gibt ihr noindex-Tag niemals preis.
Hinweis: Wenn eine Staging-URL bereits gecrawlt wurde, verlassen Sie sich nicht auf Disallow: /, um sie zu entfernen. Das Blockieren der URL hindert Google auch daran, ein noindex-Tag zu sehen. Erlauben Sie das Crawling vorübergehend mit noindex oder nutzen Sie die Entfernungs-Tools in der Search Console.
Crawl-Steuerung für E-Commerce
Ein Shop, der das Crawl-Budget von URLs mit geringem Wert weglenken muss.
Verwenden, wenn: ein Shop endlose Facetten-, Parameter- und Konto-URLs erzeugt, die Crawl-Budget verschwenden und Signale verwässern.
Typische Blockierungen
- User-agent: *
- Disallow: [/cart]
- Disallow: [/checkout]
- Disallow: [/account/]
- Disallow: [/search] (interne Suchergebnisse der Website)
- Disallow: [/*?*sort=] (ein Sortierparameter irgendwo im Query-String)
- Disallow: [/*?*filter=] (Facettenfilter)
- Disallow: [/*.pdf$] (jede URL blockieren, die auf .pdf endet: $ verankert das Ende)
Verwenden Sie *, um eine beliebige Zeichenfolge zu treffen, und $, um das Ende einer URL zu verankern. Pfade sind case-sensitiv, daher sind [/Search] und [/search] unterschiedliche Regeln.
Vorsicht: Blockieren Sie nur Parameter, die echte Duplikate oder inhaltsarme Seiten erzeugen. Das Blockieren eines Parameters, der den Hauptinhalt des Produkts (oder Ihre kanonischen URLs) verändert, kann Seiten verbergen, die Sie ranken lassen möchten. Bevorzugen Sie für doppelten Inhalt Canonical-Tags und reservieren Sie die robots.txt für Crawl-Verschwendung, die Sie niemals abrufen lassen wollen.
Suchmaschinen zulassen, Scraper blockieren
Große Such-Bots willkommen heißen und zugleich aggressive oder unerwünschte Crawler abweisen.
Verwenden, wenn: Sie möchten, dass Google, Bing und andere große Suchmaschinen frei crawlen, aber bekannte Scraper und bandbreitenhungrige Bots abhalten wollen.
Die gewünschten Suchmaschinen zulassen
- User-agent: Googlebot
- Disallow: (leer)
- User-agent: Bingbot
- Disallow: (leer)
Einen bestimmten Crawler abhalten
- User-agent: [BadBot]
- Disallow: /
Jeder User-agent-Block wird unabhängig abgeglichen, und ein Bot befolgt die spezifischste Gruppe, die ihn benennt. Behalten Sie am Ende eine User-agent: *-Gruppe, damit auch unbenannte Bots klare Anweisungen erhalten.
Um regelkonforme AI-Crawler einzudämmen, benennen Sie sie ebenfalls: zum Beispiel User-agent: GPTBot mit Disallow: /. Das stoppt nur Crawler, die sich entscheiden, die robots.txt zu respektieren.
Realitätscheck: Die robots.txt ist freiwillig. Gut erzogene Suchmaschinen befolgen sie; bösartige Scraper und viele AI-Crawler ignorieren sie und können sie sogar nutzen, um von Ihnen benannte Pfade zu finden. Für echte Durchsetzung blockieren Sie per User-Agent oder IP auf Server- oder Firewall-Ebene oder setzen Sie Rate-Limiting ein. Betrachten Sie die robots.txt als Orientierung, nicht als Sicherheit.
Deklaration von Sitemap und mehreren Sitemaps
Crawler auf eine oder mehrere Sitemaps verweisen, einschließlich eines Sitemap-Index.
Verwenden, wenn: Sie möchten, dass jeder Crawler Ihre Sitemaps findet, besonders bei einer großen Website, die auf mehrere Dateien aufgeteilt ist.
Einzelne Sitemap
- Sitemap: [https://example.com/sitemap.xml]
Mehrere Sitemaps
- Sitemap: [https://example.com/sitemap-posts.xml]
- Sitemap: [https://example.com/sitemap-products.xml]
- Sitemap: [https://example.com/sitemap-images.xml]
Oder ein Sitemap-Index
- Sitemap: [https://example.com/sitemap_index.xml]
Zu befolgende Regeln:
- Listen Sie jede Sitemap in einer eigenen Zeile auf. Es gibt keine Obergrenze für die Anzahl der Sitemap-Zeilen, aber jede einzelne Sitemap-Datei ist auf 50.000 URLs und 50 MB unkomprimiert begrenzt: Teilen Sie größere Websites auf mehrere Dateien oder einen Sitemap-Index auf.
- Verwenden Sie stets eine vollständige absolute URL mit dem korrekten Protokoll (https) und Host.
- Die Sitemap-Direktive ist unabhängig von User-agent-Gruppen, platzieren Sie sie also an beliebiger Stelle in der Datei.
- Das Einreichen der Sitemaps in der Search Console und den Bing Webmaster Tools wird weiterhin als Absicherung empfohlen.
QA-Checkliste vor der Veröffentlichung
Fangen Sie die Fehler ab, die eine Website still deindexieren, bevor Sie die Datei ausliefern.
Verwenden, wenn: Sie im Begriff sind, eine robots.txt-Datei zu veröffentlichen oder zu ersetzen, und die klassischen, kostspieligen Fehler vermeiden wollen.
Jeden Punkt prüfen
- Bestätigen Sie, dass die Datei im Root liegt: [https://example.com/robots.txt]. Eine Datei in einem Unterordner wird ignoriert.
- Stellen Sie sicher, dass kein verirrtes Disallow: / aus dem Staging übrig geblieben ist.
- Überprüfen Sie die Groß-/Kleinschreibung jedes Pfads; die robots.txt ist case-sensitiv.
- Prüfen Sie, dass CSS-, JS- und Bildordner nicht blockiert sind, damit Google Seiten rendern kann.
- Bestätigen Sie, dass jede Sitemap-Zeile eine vollständige https-URL verwendet, die einen 200 zurückgibt.
- Achten Sie auf Disallow:-Regeln, die breiter sind als beabsichtigt (ein abschließender Schrägstrich macht einen Unterschied).
- Denken Sie daran, dass die robots.txt nicht deindexiert; kombinieren Sie Blockierungen bei Bedarf mit noindex oder Entfernungs-Tools.
- Testen Sie nach jedem CMS- oder Plugin-Update erneut, das die Datei überschreiben kann.
Abschlusstest: Rufen Sie [https://example.com/robots.txt] im Browser ab, um zu bestätigen, dass sie lädt, und validieren Sie sie dann mit einem robots.txt-Tester vor und nach dem Livegang.
So verwendest du diese Vorlage
- Erstellen Sie eine reine Textdatei mit dem exakten Namen robots.txt und legen Sie sie im Domain-Root ab, damit sie unter https://yourdomain.com/robots.txt aufgelöst wird; Dateien in Unterordnern werden ignoriert.
- Legen Sie Ihre Standardeinstellung fest: Lassen Sie Disallow leer, um vollständiges Crawling zu erlauben, und fügen Sie Disallow-Zeilen nur für Pfade hinzu, die Sie wirklich vom Crawling ausschließen möchten.
- Gruppieren Sie Regeln unter einer User-agent-Zeile; verwenden Sie User-agent: * für alle Bots oder benennen Sie einen bestimmten Bot wie Googlebot, um ihm eine eigene Gruppe zu geben.
- Schreiben Sie Disallow-Pfade genau so, wie sie in Ihren URLs erscheinen, und denken Sie daran, dass Pfade case-sensitiv sind und ein abschließender Schrägstrich verändert, was abgeglichen wird.
- Verwenden Sie Platzhalter mit Bedacht: * trifft eine beliebige Zeichenfolge und $ verankert das Ende einer URL, was zum Blockieren von Parametern oder Dateitypen nützlich ist.
- Fügen Sie eine Sitemap-Zeile pro Sitemap mit vollständigen absoluten https-URLs hinzu oder verweisen Sie bei großen Websites auf eine einzelne Sitemap-Index-Datei.
- Validieren Sie die Datei in einem robots.txt-Tester und rufen Sie einige wichtige URLs ab, um zu bestätigen, dass sie weiterhin erlaubt sind, bevor Sie veröffentlichen.
- Überwachen Sie nach dem Start die Abdeckung in der Search Console und den robots.txt-Bericht auf Crawl-Fehler und prüfen Sie die Datei nach jedem CMS-, Theme- oder Plugin-Update erneut.
Profi-Tipps
- Liefern Sie niemals Disallow: / auf einer Live-Seite aus; diese einzelne Zeile bittet Crawler, jede URL zu überspringen, und ist die häufigste Ursache versehentlicher Deindexierung.
- Die robots.txt steuert das Crawling, nicht die Indexierung. Um eine Seite aus den Ergebnissen zu entfernen, erlauben Sie das Crawling und fügen ein noindex-Tag hinzu oder schützen sie hinter einer Authentifizierung, statt sich auf Disallow zu verlassen.
- Blockieren Sie keine CSS-, JavaScript- oder Bildverzeichnisse; Google benötigt sie, um Ihre Seiten zu rendern und zu verstehen, und ihr Blockieren kann den Rankings schaden.
- Behandeln Sie die robots.txt als öffentlich und beratend: Jeder kann sie lesen, gut erzogene Bots befolgen sie und bösartige Crawler ignorieren sie, nutzen Sie also serverseitige Kontrollen für echten Schutz.
Haeufige Fragen
Entfernt Disallow eine Seite aus Google?
Nein. Disallow hindert regelkonforme Crawler daran, die Seite abzurufen, aber eine per Disallow gesperrte URL kann trotzdem indexiert werden, wenn andere Seiten darauf verlinken. Um eine Seite aus dem Index zu halten, erlauben Sie das Crawling und fügen eine noindex-Direktive hinzu oder schützen sie hinter einer Authentifizierung.
Wo muss die robots.txt-Datei liegen?
Im Root jedes Hosts, damit sie unter https://yourdomain.com/robots.txt aufgelöst wird. Eine robots.txt in einem Unterordner wird ignoriert. Jede Subdomain und jedes Protokoll wird separat behandelt, daher benötigen die https-, http- und www-Versionen jeweils möglicherweise eine eigene Datei.
Ist die robots.txt case-sensitiv?
Die Pfadwerte sind es. Disallow: /Folder/ und Disallow: /folder/ treffen unterschiedliche URLs, kopieren Sie Pfade also genau so, wie sie auf Ihrer Website erscheinen. Direktivennamen wie User-agent und Disallow sind nicht case-sensitiv, aber entscheidend ist, die tatsächliche Groß-/Kleinschreibung Ihrer URLs zu treffen.
Was ist der Unterschied zwischen Disallow und noindex?
Disallow steuert das Crawling: Es bittet Bots, eine URL nicht abzurufen. Noindex steuert die Indexierung: Es bittet Suchmaschinen, eine Seite nicht in den Ergebnissen anzuzeigen. Wenn Sie eine Seite per Disallow sperren, kann Google ihr noindex-Tag nicht sehen, also müssen Sie zum Deindexieren einer Seite das Crawling erlauben und noindex verwenden.
Wie blockiere ich einen Bot, erlaube aber die anderen?
Geben Sie diesem Bot eine eigene Gruppe, zum Beispiel User-agent: BadBot gefolgt von Disallow: /, und behalten Sie eine separate User-agent: *-Gruppe für alle anderen. Jeder Bot befolgt die spezifischste Gruppe, die ihn benennt, sodass der gezielte Bot blockiert wird, während die anderen erlaubt bleiben.
Stoppt die robots.txt Scraper und AI-Crawler?
Nur die, die sich entscheiden, sie zu befolgen. Die robots.txt ist freiwillig, daher befolgen sie seriöse Suchmaschinen, während viele Scraper und Bots sie völlig ignorieren. Für echte Durchsetzung blockieren Sie per User-Agent oder IP auf Server- oder Firewall-Ebene oder fügen Rate-Limiting und Authentifizierung hinzu.