Konrad Griesser Digitalmarketing – Webdesign für Augsburg

So erreichen Sie uns

Kostenlosen SEO-Check anfordern
SEO, GEO & AEO

KI-Crawler in der robots.txt: erlauben, sperren, steuern

GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended: Welche KI-Crawler was tun und wie Sie sie in der robots.txt gezielt steuern.

KI-Crawler in der robots.txt: erlauben, sperren, steuern

KI-Crawler lassen sich in der robots.txt einzeln erlauben oder sperren, und die wichtigste Unterscheidung ist die zwischen Training und Suche. Crawler wie GPTBot sammeln Material für das Training von Sprachmodellen. Crawler wie OAI-SearchBot oder PerplexityBot bauen den Index auf, aus dem KI-Antworten ihre Quellen beziehen. Wer in ChatGPT, Perplexity und ähnlichen Diensten als Quelle genannt werden möchte, darf die Such-Crawler nicht aussperren. Ob Sie zusätzlich das Training zulassen, ist eine Abwägung, die jedes Unternehmen selbst treffen muss.

Drei Arten von KI-Zugriffen

Hinter dem Sammelbegriff stecken drei unterschiedliche Dinge:

  • Trainings-Crawler rufen Seiten ab, damit deren Texte in künftige Modelle einfließen. Beispiele: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl, dessen Datenbestände viele Anbieter nutzen).
  • Such-Crawler erstellen einen Index für die Live-Recherche und die Quellenangaben. Beispiele: OAI-SearchBot, PerplexityBot, Claude-SearchBot.
  • Nutzerausgelöste Abrufe entstehen, wenn ein Mensch im Chat eine Adresse nennt oder das System während eines Gesprächs gezielt eine Seite öffnet. Beispiele: ChatGPT-User, Claude-User, Perplexity-User. Manche Anbieter behandeln diese Abrufe wie den Besuch eines Menschen und wenden die robots.txt darauf nur eingeschränkt an.

Die Bezeichnungen ändern sich gelegentlich. Maßgeblich ist die aktuelle Dokumentation des jeweiligen Anbieters.

Sonderfall Google und Microsoft

Google-Extended ist kein eigener Crawler, sondern ein Steuerungsbegriff in der robots.txt. Er legt fest, ob Inhalte, die der normale Googlebot ohnehin abruft, für das Training und die Wissensanreicherung von Gemini verwendet werden dürfen. Auf die Google-Suche hat er laut Google keinen Einfluss — weder auf Rankings noch auf die AI Overviews oder den KI-Modus. Diese laufen über den Googlebot. Wer dort nicht erscheinen will, muss mit Snippet-Anweisungen wie nosnippet arbeiten und verliert damit auch die normale Vorschau.

Ähnlich ist es bei Microsoft: Copilot stützt sich auf den Bing-Index, den der bingbot aufbaut. Wer den bingbot sperrt, verschwindet aus Bing und aus Copilot.

So sehen die Einträge aus

Die Syntax ist dieselbe wie für jeden anderen Crawler. Jeder Block beginnt mit dem Namen und enthält darunter die Regeln:

  • Trainings-Crawler sperren: User-agent: GPTBot und in der nächsten Zeile Disallow: /. Für weitere Crawler wiederholen Sie den Block mit ClaudeBot, CCBot oder Google-Extended.
  • Such-Crawler ausdrücklich erlauben: User-agent: OAI-SearchBot und darunter Allow: /. Nötig ist das nur, wenn eine allgemeine Regel sonst sperren würde.
  • Nur Teilbereiche sperren: Disallow: /kundenbereich/ oder Disallow: /downloads/ innerhalb des jeweiligen Blocks.

Ein häufiger Fehler: Sobald ein Crawler einen eigenen Block hat, gelten für ihn nur noch die Regeln dieses Blocks und nicht mehr die allgemeinen unter User-agent: *. Wer für GPTBot einen Block anlegt und darin nur einen Ordner nennt, hat damit alle anderen Sperren für diesen Crawler aufgehoben.

Erlauben oder sperren: eine Entscheidungshilfe

Für die meisten Unternehmen, mit denen wir arbeiten, ist die Antwort eindeutig:

  1. Dienstleister, Handwerk, Industrie, Tourismus: alles erlauben. Sie wollen gefunden, genannt und empfohlen werden. Auch das Training arbeitet für Sie, denn es entscheidet mit, was künftige Modelle über Sie wissen.
  2. Verlage, Fachportale, Anbieter bezahlter Inhalte: hier ist die Abwägung echt. Wer vom Verkauf seiner Texte lebt, hat gute Gründe, Trainings-Crawler zu sperren und Such-Crawler zuzulassen — so bleibt die Chance auf Quellenlinks erhalten.
  3. Onlineshops: Produkt- und Ratgeberseiten offen lassen. Filterseiten, interne Suche und Warenkorb sperren Sie ohnehin für alle Crawler.
  4. Vertrauliche Bereiche: gehören nicht in die robots.txt, sondern hinter eine Anmeldung.

Eine Sperre wirkt zudem nur in die Zukunft. Was bereits in Trainingsdaten eingeflossen ist, holt kein Eintrag zurück.

Grenzen der robots.txt — und eine Prüfung, die sich lohnt

Die robots.txt ist eine Bitte, keine technische Schranke. Die großen Anbieter erklären, sich daran zu halten, bei unbekannten Bots ist das nicht sicher. Wer Zugriffe wirklich unterbinden will, braucht Regeln auf dem Server oder in der Firewall.

Wichtiger ist in der Praxis der umgekehrte Fall: die unbeabsichtigte Sperre. Wir finden regelmäßig Websites, deren Betreiber in KI-Antworten genannt werden möchten, während ein Sicherheits-Plugin, der Hoster oder ein vorgeschalteter Schutzdienst sämtliche KI-Bots pauschal blockiert — teils als Voreinstellung. So prüfen Sie das:

  • Die eigene robots.txt im Browser öffnen und nach den genannten Crawlern sowie nach pauschalen Sperren suchen.
  • In den Einstellungen von Hoster, CDN und Sicherheits-Plugins nach Optionen zu Bots und KI-Crawlern sehen.
  • Die Serverprotokolle darauf durchsehen, ob die Crawler ankommen und welchen Statuscode sie erhalten.

Diese Prüfung gehört zu unserem SEO-Audit und ist Teil dessen, was wir unter technischem SEO verstehen. Wie das mit Inhalten und Reputation zusammenspielt, lesen Sie unter Generative Engine Optimization.

Kurz beantwortet

Schadet es meinem Google-Ranking, wenn ich GPTBot sperre?

Nein. Die Crawler der KI-Anbieter haben mit der Google-Suche nichts zu tun, und auch Google-Extended beeinflusst die Suche laut Google nicht. Sie verzichten lediglich darauf, dass Ihre Inhalte in das Training des jeweiligen Modells einfließen.

Halten sich alle KI-Crawler an die robots.txt?

Die großen Anbieter sichern das zu, technisch erzwingen lässt es sich über die Datei nicht. Für verbindliche Sperren brauchen Sie serverseitige Regeln, und wirklich Vertrauliches gehört hinter eine Anmeldung.

Kann ich das Training sperren und trotzdem in ChatGPT als Quelle erscheinen?

Ja, nach der Dokumentation von OpenAI sind das getrennte Crawler. Sie sperren GPTBot und lassen OAI-SearchBot zu. Bei anderen Anbietern ist die Trennung ähnlich, aber nicht überall gleich sauber — ein Blick in die jeweilige Dokumentation lohnt sich.

Konrad Griesser

Konrad Griesser

SEO-, GEO- & AEO-Berater aus Augsburg — im Web zuhause seit 1999. Mehr über SEO Genie

Weiterlesen

Ähnliche Beiträge

Lieber umsetzen lassen?

SEO, GEO und AEO aus einer Hand — für Unternehmen in ganz Bayern.

Website kostenlos prüfen