Zum Inhalt springen

IT-Wurm

Welche Bots durch Ihre Logs laufen, wozu sie da sind und wie Sie sie steuern.

Wer in seinen Server-Logs nachsieht, findet dort Dutzende Bots. Diese Seite ordnet die wichtigsten ein: was sie tun, wie sie heißen und was passiert, wenn man sie aussperrt.

Stand der Angaben: . Kennungen ändern sich, im Zweifel gilt die Dokumentation des Anbieters.

Drei Arten von KI-Bots

Der häufigste Irrtum beim Thema KI-Crawler: Die großen Anbieter betreiben nicht einen Bot, sondern mehrere, für klar getrennte Zwecke. Wer einen davon aussperrt, hat die anderen nicht ausgesperrt. OpenAI und Anthropic verwenden beide dieselbe Dreiteilung, Perplexity eine zweistufige Variante davon.

Trainings-Crawler

Sammeln öffentliche Inhalte, die in das Training künftiger Modelle einfließen können. Wer sie aussperrt, nimmt seine Inhalte aus dem Modelltraining heraus. Dazu gehören GPTBot, ClaudeBot und die Kennung Google-Extended.

Such-Crawler

Indexieren Seiten, damit ein Assistent sie in seinen Antworten als Quelle nennen kann. Dazu gehören OAI-SearchBot, Claude-SearchBot und PerplexityBot.

Nutzergesteuerte Abrufe

Holen eine einzelne Seite, weil gerade jemand eine Frage gestellt hat, für die sie gebraucht wird. Dazu gehören ChatGPT-User, Claude-User und Perplexity-User.

Warum der Unterschied zählt

Einen Trainings-Crawler auszusperren heißt: Die eigenen Inhalte sollen nicht ins Modelltraining einfließen. Einen Such-Crawler auszusperren bedeutet etwas ganz anderes: Die Seite verschwindet aus KI-Antworten. Das ist das heutige Gegenstück dazu, sich aus dem Suchindex zu nehmen. Zwei völlig verschiedene Entscheidungen, die regelmäßig in einem Aufwasch getroffen werden, meist versehentlich.

Ein zweiter Punkt, der selten erwähnt wird: Die Anbieter handhaben die nutzergesteuerten Abrufe unterschiedlich. Anthropic gibt an, dass alle drei Kennungen die robots.txt beachten, einschließlich Claude-User. OpenAI und Perplexity ziehen die Grenze anders und weisen darauf hin, dass die Regeln bei ChatGPT-User unter Umständen und bei Perplexity-User in der Regel nicht greifen, weil hinter dem Abruf eine unmittelbare Nutzerhandlung steht.

Die Kennungen

Die Bots, die tatsächlich regelmäßig in Logs auftauchen. Es gibt deutlich mehr, aber eine vollständige Liste veraltet schneller, als sie sich pflegen lässt. Für den Rest siehe die Quellen unten.

Verbreitete KI-Crawler nach Betreiber
Kennung Betreiber Zweck
GPTBotOpenAITraining
OAI-SearchBotOpenAISuche
ChatGPT-UserOpenAINutzerabruf
ClaudeBotAnthropicTraining
Claude-SearchBotAnthropicSuche
Claude-UserAnthropicNutzerabruf
Google-ExtendedGoogleSteuerkennung, siehe unten
PerplexityBotPerplexitySuche
Perplexity-UserPerplexityNutzerabruf
Applebot-ExtendedAppleSteuerkennung für KI-Training
Meta-ExternalAgentMetaTraining
AmazonbotAmazonSuche und Assistenz
BytespiderByteDanceTraining
CCBotCommon Crawloffenes Archiv, dient vielen als Trainingsquelle
DuckAssistBotDuckDuckGoAssistenzantworten

Zwei Sonderfälle

Google-Extended und Applebot-Extended sind keine Bots, die Sie in den Logs sehen werden. Es sind reine Steuerkennungen: Sie existieren nur als Eintrag in der robots.txt, mit dem sich die Verwendung der Inhalte für KI-Zwecke untersagen lässt, ohne dass die normale Suchindexierung darunter leidet. Ein Eintrag gegen Google-Extended ändert die Position in der Google-Suche nicht.

Veraltete Kennungen

In vielen robots.txt-Dateien stehen noch anthropic-ai und Claude-Web. Beide stammen aus der Zeit vor ClaudeBot und laufen ins Leere. Sie schaden nicht, ersetzen aber die aktuellen Einträge nicht.

robots.txt

Die Datei liegt im Wurzelverzeichnis unter /robots.txt. Jeder Block braucht mindestens eine Regel; eine Kennung ohne Allow oder Disallow bewirkt nichts. Zwischen zwei Blöcken gehört eine Leerzeile, sonst werden sie zusammengefasst.

Training aussperren, Sichtbarkeit behalten

Die Einstellung, die die meisten eigentlich meinen: nicht ins Modelltraining, aber weiterhin in KI-Antworten auffindbar.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Was die Datei nicht kann

  • Disallow verhindert das Abrufen, nicht zwingend das Auftauchen in einem Index. Wenn eine Seite anderswo verlinkt ist, kann sie ohne Inhaltsangabe trotzdem gelistet werden. Wer sicher aus dem Index will, braucht <meta name="robots" content="noindex"> und muss die Seite dafür crawlen lassen.
  • Die Datei ist öffentlich. Wer dort geheime Pfade einträgt, veröffentlicht genau die Liste, die er verstecken wollte.
  • Sie ist eine Bitte, keine Sperre. Wer wirklich sperren will, braucht eine Regel in der Firewall oder beim CDN.
  • Crawl-Delay war nie Teil des Standards. Google ignoriert die Angabe, und von den KI-Anbietern äußert sich kaum einer dazu. Verlassen sollte man sich nicht darauf.

Bots ohne KI

Der größte Teil des Bot-Verkehrs hat mit KI nichts zu tun und ist meist erwünscht. Ein pauschales Disallow: / für alle Bots nimmt Sie aus den Suchmaschinen, verhindert Linkvorschauen in Messengern und schaltet Ihre Erreichbarkeitsprüfung ab.

Häufige Bots ohne KI-Bezug
Kennung Betreiber Zweck
GooglebotGoogleSuchindexierung
BingbotMicrosoftSuchindexierung
DuckDuckBotDuckDuckGoSuchindexierung
ApplebotAppleSuche in Siri und Spotlight
facebookexternalhitMetaLinkvorschau
Slackbot-LinkExpandingSlackLinkvorschau
AhrefsBotAhrefsSEO-Analyse
SemrushBotSemrushSEO-Analyse
archive.org_botInternet ArchiveArchivierung

SEO-Bots erzeugen bei kleinen Seiten spürbar Last, ohne dem Betreiber selbst zu nützen. Sie auszusperren ist vertretbar. Suchmaschinen- und Vorschau-Bots sollten in aller Regel durchgelassen werden.

Ist der Bot echt?

Der User-Agent ist ein frei wählbares Textfeld. Jeder kann sich als GPTBot ausgeben, und das passiert regelmäßig, weil sich damit Sperren umgehen lassen, die auf den Namen abzielen. Wer wissen will, ob ein Zugriff echt war, muss die Herkunft prüfen und nicht den Namen.

Die verlässliche Methode ist die IP-Adresse. Die großen Anbieter veröffentlichen die Adressbereiche ihrer Crawler als Liste zum Abgleich. Bei Googlebot funktioniert zusätzlich die umgekehrte Namensauflösung: Rückwärtsauflösung der IP, dann Vorwärtsauflösung des erhaltenen Namens, und beides muss zusammenpassen.

# Rückwärts, dann vorwärts auflösen
host 66.249.66.1
host crawl-66-249-66-1.googlebot.com

Wo der Betreiber keine IP-Liste veröffentlicht, lässt sich ein Zugriff nicht überprüfen. Das gilt für viele kleinere Crawler und ist ein guter Grund, ihnen mit Zurückhaltung zu begegnen.

Quellen

Verbindlich ist immer die Dokumentation des Betreibers. Diese Seite fasst zusammen, ersetzt sie aber nicht.

Die andere Blickrichtung

Nicht jeder Bot arbeitet im Auftrag seines Besitzers: Wie aus gekaperten Rechnern ein Botnetz wird und warum Kommunen und Kliniken dabei besonders oft getroffen werden, steht auf Infrastrukturapokalypse, externes Angebot, öffnet in einem neuen Tab.

Hier geht es um Bots, die öffentliche Seiten abrufen. Worum es geht, wenn Daten über einzelne Personen gesammelt werden, und was man dagegen tun kann, steht auf Stasistan, externes Angebot, öffnet in einem neuen Tab.