Wer in seinen Server-Logs nachsieht, findet dort Dutzende Bots. Diese Seite ordnet die wichtigsten ein: was sie tun, wie sie heißen und was passiert, wenn man sie aussperrt.
Stand der Angaben: . Kennungen ändern sich, im Zweifel gilt die Dokumentation des Anbieters.
Drei Arten von KI-Bots
Der häufigste Irrtum beim Thema KI-Crawler: Die großen Anbieter betreiben nicht einen Bot, sondern mehrere, für klar getrennte Zwecke. Wer einen davon aussperrt, hat die anderen nicht ausgesperrt. OpenAI und Anthropic verwenden beide dieselbe Dreiteilung, Perplexity eine zweistufige Variante davon.
Trainings-Crawler
Sammeln öffentliche Inhalte, die in das Training künftiger Modelle einfließen können. Wer sie aussperrt, nimmt seine Inhalte aus dem Modelltraining heraus. Dazu gehören GPTBot, ClaudeBot und die Kennung Google-Extended.
Such-Crawler
Indexieren Seiten, damit ein Assistent sie in seinen Antworten als Quelle nennen kann. Dazu gehören OAI-SearchBot, Claude-SearchBot und PerplexityBot.
Nutzergesteuerte Abrufe
Holen eine einzelne Seite, weil gerade jemand eine Frage gestellt hat, für die sie gebraucht wird. Dazu gehören ChatGPT-User, Claude-User und Perplexity-User.
Warum der Unterschied zählt
Einen Trainings-Crawler auszusperren heißt: Die eigenen Inhalte sollen nicht ins Modelltraining einfließen. Einen Such-Crawler auszusperren bedeutet etwas ganz anderes: Die Seite verschwindet aus KI-Antworten. Das ist das heutige Gegenstück dazu, sich aus dem Suchindex zu nehmen. Zwei völlig verschiedene Entscheidungen, die regelmäßig in einem Aufwasch getroffen werden, meist versehentlich.
Ein zweiter Punkt, der selten erwähnt wird: Die Anbieter handhaben die nutzergesteuerten Abrufe unterschiedlich. Anthropic gibt an, dass alle drei Kennungen die robots.txt beachten, einschließlich Claude-User. OpenAI und Perplexity ziehen die Grenze anders und weisen darauf hin, dass die Regeln bei ChatGPT-User unter Umständen und bei Perplexity-User in der Regel nicht greifen, weil hinter dem Abruf eine unmittelbare Nutzerhandlung steht.
Die Kennungen
Die Bots, die tatsächlich regelmäßig in Logs auftauchen. Es gibt deutlich mehr, aber eine vollständige Liste veraltet schneller, als sie sich pflegen lässt. Für den Rest siehe die Quellen unten.
| Kennung | Betreiber | Zweck |
|---|---|---|
| GPT | OpenAI | Training |
| OAI- | OpenAI | Suche |
| ChatGPT- | OpenAI | Nutzerabruf |
| Claude | Anthropic | Training |
| Claude- | Anthropic | Suche |
| Claude- | Anthropic | Nutzerabruf |
| Google- | Steuerkennung, siehe unten | |
| Perplexity | Perplexity | Suche |
| Perplexity- | Perplexity | Nutzerabruf |
| Applebot- | Apple | Steuerkennung für KI-Training |
| Meta- | Meta | Training |
| Amazon | Amazon | Suche und Assistenz |
| Byte | ByteDance | Training |
| CCBot | Common Crawl | offenes Archiv, dient vielen als Trainingsquelle |
| Duck | DuckDuckGo | Assistenzantworten |
Zwei Sonderfälle
Google-Extended und Applebot-Extended sind keine Bots, die Sie in den Logs sehen werden. Es sind reine Steuerkennungen: Sie existieren nur als Eintrag in der robots.txt, mit dem sich die Verwendung der Inhalte für KI-Zwecke untersagen lässt, ohne dass die normale Suchindexierung darunter leidet. Ein Eintrag gegen Google-Extended ändert die Position in der Google-Suche nicht.
Veraltete Kennungen
In vielen robots.txt-Dateien stehen noch anthropic-ai und Claude-Web. Beide stammen aus der Zeit vor ClaudeBot und laufen ins Leere. Sie schaden nicht, ersetzen aber die aktuellen Einträge nicht.
robots.txt
Die Datei liegt im Wurzelverzeichnis unter /robots.txt. Jeder Block braucht mindestens eine Regel; eine Kennung ohne Allow oder Disallow bewirkt nichts. Zwischen zwei Blöcken gehört eine Leerzeile, sonst werden sie zusammengefasst.
Training aussperren, Sichtbarkeit behalten
Die Einstellung, die die meisten eigentlich meinen: nicht ins Modelltraining, aber weiterhin in KI-Antworten auffindbar.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Was die Datei nicht kann
Disallowverhindert das Abrufen, nicht zwingend das Auftauchen in einem Index. Wenn eine Seite anderswo verlinkt ist, kann sie ohne Inhaltsangabe trotzdem gelistet werden. Wer sicher aus dem Index will, braucht<meta name="robots" content="noindex">und muss die Seite dafür crawlen lassen.- Die Datei ist öffentlich. Wer dort geheime Pfade einträgt, veröffentlicht genau die Liste, die er verstecken wollte.
- Sie ist eine Bitte, keine Sperre. Wer wirklich sperren will, braucht eine Regel in der Firewall oder beim CDN.
Crawl-Delaywar nie Teil des Standards. Google ignoriert die Angabe, und von den KI-Anbietern äußert sich kaum einer dazu. Verlassen sollte man sich nicht darauf.
Bots ohne KI
Der größte Teil des Bot-Verkehrs hat mit KI nichts zu tun und ist meist erwünscht. Ein pauschales Disallow: / für alle Bots nimmt Sie aus den Suchmaschinen, verhindert Linkvorschauen in Messengern und schaltet Ihre Erreichbarkeitsprüfung ab.
| Kennung | Betreiber | Zweck |
|---|---|---|
| Google | Suchindexierung | |
| Bingbot | Microsoft | Suchindexierung |
| Duck | DuckDuckGo | Suchindexierung |
| Apple | Apple | Suche in Siri und Spotlight |
| facebook | Meta | Linkvorschau |
| Slackbot- | Slack | Linkvorschau |
| Ahrefs | Ahrefs | SEO-Analyse |
| Semrush | Semrush | SEO-Analyse |
| archive.org | Internet Archive | Archivierung |
SEO-Bots erzeugen bei kleinen Seiten spürbar Last, ohne dem Betreiber selbst zu nützen. Sie auszusperren ist vertretbar. Suchmaschinen- und Vorschau-Bots sollten in aller Regel durchgelassen werden.
Ist der Bot echt?
Der User-Agent ist ein frei wählbares Textfeld. Jeder kann sich als GPTBot ausgeben, und das passiert regelmäßig, weil sich damit Sperren umgehen lassen, die auf den Namen abzielen. Wer wissen will, ob ein Zugriff echt war, muss die Herkunft prüfen und nicht den Namen.
Die verlässliche Methode ist die IP-Adresse. Die großen Anbieter veröffentlichen die Adressbereiche ihrer Crawler als Liste zum Abgleich. Bei Googlebot funktioniert zusätzlich die umgekehrte Namensauflösung: Rückwärtsauflösung der IP, dann Vorwärtsauflösung des erhaltenen Namens, und beides muss zusammenpassen.
# Rückwärts, dann vorwärts auflösen
host 66.249.66.1
host crawl-66-249-66-1.googlebot.com
Wo der Betreiber keine IP-Liste veröffentlicht, lässt sich ein Zugriff nicht überprüfen. Das gilt für viele kleinere Crawler und ist ein guter Grund, ihnen mit Zurückhaltung zu begegnen.
Quellen
Verbindlich ist immer die Dokumentation des Betreibers. Diese Seite fasst zusammen, ersetzt sie aber nicht.
- OpenAI, externes Angebot, öffnet in einem neuen Tab – Dokumentation zu GPTBot, OAI-SearchBot und ChatGPT-User
- Anthropic, externes Angebot, öffnet in einem neuen Tab – Dokumentation zu ClaudeBot, Claude-SearchBot und Claude-User
- Google, externes Angebot, öffnet in einem neuen Tab – Übersicht aller Google-Crawler und Steuerkennungen
- ai.robots.txt, externes Angebot, öffnet in einem neuen Tab – gemeinschaftlich gepflegte Liste, deutlich umfangreicher als die obige
- robotstxt.org, externes Angebot, öffnet in einem neuen Tab – Einführung in das Protokoll selbst
Die andere Blickrichtung
Nicht jeder Bot arbeitet im Auftrag seines Besitzers: Wie aus gekaperten Rechnern ein Botnetz wird und warum Kommunen und Kliniken dabei besonders oft getroffen werden, steht auf Infrastrukturapokalypse, externes Angebot, öffnet in einem neuen Tab.
Hier geht es um Bots, die öffentliche Seiten abrufen. Worum es geht, wenn Daten über einzelne Personen gesammelt werden, und was man dagegen tun kann, steht auf Stasistan, externes Angebot, öffnet in einem neuen Tab.