Robots.txt-Generator

Bauen Sie eine robots.txt aus Regelgruppen und Vorlagen, legen Sie fest, welche KI-Crawler Ihre Website lesen dürfen, und testen Sie beliebige Adressen gegen die Regeln, bevor Sie die Datei hochladen.

  • Generator + Tester
  • Schalter für KI-Crawler
  • Prüft die Regeln
  • Läuft in Ihrem Browser

Vorlagen

Eine Vorlage ersetzt die Regelgruppen unten und behält Ihre Sitemaps. Danach können Sie alles bearbeiten – Rückgängig stellt den vorherigen Stand wieder her.

Regeln für Crawler

Ein Crawler befolgt nur die Gruppe, die ihn am genauesten benennt, sonst die Gruppe *. Innerhalb einer Gruppe gewinnt der längste passende Pfad; sind eine Allow- und eine Disallow-Regel gleich lang, gewinnt Allow. * steht für beliebige Zeichen, $ markiert das Ende der Adresse.

KI-Crawler

Trainingscrawler kopieren Inhalte in die Trainingsdaten von Modellen; Such- und nutzerausgelöste Abrufe lesen eine Seite live und verlinken meist auf sie. Jeder Schalter fügt eine Gruppe hinzu oder entfernt sie. Das Sperren von Google-Extended ändert Ihr Ranking in der Google Suche nicht. Seriöse KI-Unternehmen halten sich an diese Regeln, aber robots.txt kann niemanden zwingen.

Sitemaps und Dateikopf

Sitemap-Adressen

Verwenden Sie die vollständige Adresse einschließlich https://. Sitemap-Zeilen gelten für alle Crawler, egal wo sie in der Datei stehen.

Optional. Jede Zeile wird zu einem Kommentar, der mit # beginnt.

Vorhandene robots.txt importieren

    robots.txt

    Speichern Sie die Datei als robots.txt und laden Sie sie in das Stammverzeichnis der Website hoch, sodass sie unter https://your-domain.com/robots.txt erreichbar ist. Jede Subdomain braucht eine eigene Datei. Eine gesperrte Seite kann trotzdem ohne Beschreibung in den Suchergebnissen erscheinen – verwenden Sie noindex auf der Seite selbst, um sie herauszuhalten.

    Prüfungen

      Adressen gegen diese Regeln testen

      Vollständige Adressen und Pfade wie /shop/?sort=price funktionieren beide. Verglichen werden nur der Pfad und der Query-String.

      Geben Sie einen Crawler-Namen ein oder fügen Sie einen vollständigen User-Agent-Header ein.

      Geben Sie eine oder mehrere Adressen ein, um zu sehen, ob der gewählte Crawler sie abrufen darf.

      So funktioniert es

      So erstellen Sie eine robots.txt

      Die Datei wird nach jeder Änderung neu aufgebaut.

      1. 1

        Mit einer Vorlage oder der eigenen Datei beginnen

        Wählen Sie eine Vorlage wie WordPress, WooCommerce oder „Alles erlauben“ oder fügen Sie eine vorhandene robots.txt ein, um sie in den Editor zu laden.

      2. 2

        Gruppen bearbeiten

        Ergänzen Sie User-Agents, Allow- und Disallow-Pfade und Ihre Sitemap-Adressen. Zwei Schalter fügen die Gruppen für KI-Crawler hinzu oder entfernen sie.

      3. 3

        Testen, dann herunterladen

        Geben Sie einige Adressen ein, um zu sehen, ob ein Crawler sie abrufen darf, lesen Sie die Prüfhinweise und speichern Sie die Datei als robots.txt für das Hauptverzeichnis Ihrer Website.

      Warum ToolCMB

      Ein robots.txt-Editor, der sich selbst erklärt

      Der Abgleich folgt RFC 9309 und dem von Google dokumentierten Verhalten.

      Gruppen und Regeln

      Jede Gruppe nennt einen oder mehrere User-Agents und listet ihre Allow- und Disallow-Pfade auf. Gruppen und Regeln lassen sich umsortieren, kommentieren und entfernen.

      Vorlagen

      Alles erlauben, alles sperren, WordPress, WooCommerce, ein Shopify-ähnlicher Shop, Joomla, Drupal, eine Staging-Website und eine Sperrliste für KI-Trainingsbots. „Rückgängig“ stellt den vorherigen Stand wieder her.

      Schalter für KI-Crawler

      Ein Schalter für Trainings-Crawler wie GPTBot, ClaudeBot, Google-Extended und CCBot, ein weiterer für KI-Suche und vom Nutzer ausgelöste Abrufe wie OAI-SearchBot und PerplexityBot.

      Integrierter Tester

      Fügen Sie Adressen oder Pfade ein und wählen Sie einen Crawler. Für jede Adresse sehen Sie „Erlaubt“ oder „Gesperrt“, die verwendete Gruppe und die Zeile der entscheidenden Regel. Das Ergebnis lässt sich als CSV exportieren.

      Import mit Reparatur

      Fügen Sie eine vorhandene Datei ein oder öffnen Sie sie. Falsch geschriebene Direktiven werden erkannt; ungültige Zeilen, verwaiste Regeln und nicht unterstützte <code>noindex</code>-Zeilen werden gemeldet.

      Prüfung beim Tippen

      Warnt, wenn die gesamte Website oder Googlebot gesperrt ist, wenn eine Regel CSS oder JavaScript verbergen könnte, wenn ein Pfad fehlerhaft ist und wenn die Datei 500 KiB überschreitet.

      Privat

      Alles läuft in Ihrem Browser. Was Sie eingeben, einfügen oder öffnen, wird nicht an einen Server gesendet.

      Kostenlos, ohne Anmeldung

      Kein Konto, keine Limits, kein Wasserzeichen – auf Smartphone, Tablet und Computer.

      Was die robots.txt leistet – und was nicht

      Eine robots.txt ist eine einfache Textdatei im Hauptverzeichnis eines Hosts, zum Beispiel https://example.com/robots.txt. Sie teilt Crawlern mit, welche Pfade sie anfordern dürfen. Das Format ist als Robots Exclusion Protocol in RFC 9309 standardisiert: Gruppen beginnen mit einer oder mehreren User-agent-Zeilen, gefolgt von Allow- und Disallow-Regeln. Jedes Protokoll, jede Subdomain und jeder Port braucht eine eigene Datei, und Sitemap-Zeilen gelten für jeden Crawler, egal wo sie stehen.

      Ein Crawler befolgt nur eine Gruppe: diejenige, die ihn am genauesten benennt, andernfalls die Gruppe *. Innerhalb dieser Gruppe entscheidet die Regel mit dem längsten passenden Pfad; sind eine Allow- und eine Disallow-Regel gleich lang, gewinnt Allow. * steht für eine beliebige Zeichenfolge und $ markiert das Ende der Adresse – Disallow: /*.pdf$ sperrt also jede PDF-Datei. Bei Pfaden wird zwischen Groß- und Kleinschreibung unterschieden. Crawl-delay gehört nicht zum Standard: Bing beachtet es, Google ignoriert es.

      Der häufigste Fehler ist, eine Seite per robots.txt aus den Suchergebnissen heraushalten zu wollen. Die Datei verhindert nur das Crawlen: Eine gesperrte Adresse kann trotzdem indexiert werden – ohne Beschreibung –, wenn andere Seiten auf sie verlinken. Um eine Seite herauszuhalten, lassen Sie sie crawlbar und setzen Sie ein Robots-Meta-Tag mit noindex oder einen X-Robots-Tag-Header. Weitere häufige Fehler sind ein vergessenes Disallow: / von einer Staging-Website, gesperrtes CSS oder JavaScript, das Google zum Rendern der Seiten braucht, und Geheimnisse in einer Datei, die jeder lesen kann.

      Gängige robots.txt-Regeln

      RegelWirkungHinweis
      <code>Disallow:</code> (leer)Erlaubt allesDasselbe Ergebnis wie ohne Datei
      <code>Disallow: /</code>Sperrt die gesamte WebsiteNur für Websites, die nicht in der Suche erscheinen sollen
      <code>Disallow: /cart/</code>Sperrt einen Ordner und alles darunterOhne den letzten Schrägstrich trifft die Regel auch /cart-help
      <code>Disallow: /*?sort=</code>Sperrt Adressen, die diesen Parameter enthalten<code>*</code> steht für beliebige Zeichen
      <code>Allow: /wp-admin/admin-ajax.php</code>Gibt eine Datei in einem gesperrten Ordner wieder freiDie längere Regel gewinnt
      <code>Sitemap: https://example.com/sitemap.xml</code>Verweist Crawler auf Ihre SitemapMuss eine vollständige Adresse sein

      Tipps

      • Tragen Sie Ihre Sitemap in die Datei ein – erstellen Sie eine mit dem Sitemap-Generator.
      • Prüfen Sie nach dem Hochladen mit dem HTTP-Status-Checker, ob /robots.txt mit Status 200 antwortet. Ein Serverfehler bei dieser Datei kann das Crawlen der gesamten Website stoppen.
      • Um eine Seite aus den Suchergebnissen herauszuhalten, schreiben Sie mit dem Meta-Tag-Generator ein Robots-Meta-Tag, statt die Seite hier zu sperren.
      • Die robots.txt ist eine Bitte, keine Zugriffskontrolle. Schützen Sie private Ordner mit einem Passwort oder einer IP-Regel aus dem .htaccess-Generator.
      FAQ

      Häufig gestellte Fragen

      Keine Antwort gefunden? Schreiben Sie uns – wir antworten schnell.

      Wohin gehört die robots.txt?

      In das Hauptverzeichnis der Website, sodass sie unter https://your-domain.com/robots.txt erreichbar ist. Eine Datei in einem Unterordner wird ignoriert. Jede Subdomain – und http und https getrennt – verwendet eine eigene Datei.

      Entfernt Disallow eine Seite aus Google?

      Nein. Disallow verhindert das Crawlen, nicht die Indexierung. Verlinken andere Seiten auf die Adresse, kann sie weiterhin ohne Beschreibung in den Ergebnissen erscheinen. Verwenden Sie ein Robots-Meta-Tag mit noindex oder einen X-Robots-Tag-Header – und sperren Sie die Seite nicht, sonst sieht der Crawler diese Anweisung nie.

      Wie sperre ich KI-Bots wie GPTBot oder ClaudeBot aus?

      Fügen Sie eine Gruppe hinzu, die den Crawler benennt und Disallow: / enthält. Die beiden KI-Schalter dieses Generators schreiben solche Gruppen für die bekannten Trainings-Crawler und für die Abrufe der KI-Suche. Seriöse Betreiber halten sich an diese Regeln, erzwingen lässt sich das mit der robots.txt aber nicht.

      Beeinflusst das Sperren von Google-Extended mein Google-Ranking?

      Nein. Google-Extended ist ein Steuer-Token für die Nutzung Ihrer Inhalte in Googles KI-Modellen. Es beeinflusst weder das Crawlen durch Googlebot noch Ihre Position in der Google Suche.

      Brauche ich überhaupt eine robots.txt?

      Nicht unbedingt. Ohne Datei gehen Crawler davon aus, dass alles abgerufen werden darf. Eine Datei ist nützlich, um Crawler von Suchergebnisseiten, Warenkörben und Admin-Bereichen fernzuhalten, einzelne Crawler gezielt anzusprechen und Ihre Sitemap bekannt zu machen.

      Werden meine Daten an einen Server gesendet?

      Nein. Das Tool läuft vollständig in Ihrem Browser. Ihre Eingaben werden nicht hochgeladen, protokolliert oder auf unseren Servern gespeichert.

      Weitere kostenlose SEO- und Website-Tools

      Tags und Dateien erzeugen, Statuscodes, Weiterleitungen, DNS und Zertifikate prüfen – kostenlos und ohne Konto.

      Alle Tools ansehen