Zum Inhalt springen
KI-Crawler von ChatGPT, Claude und Perplexity auf der eigenen Website prüfen

Wie Sie prüfen, ob ChatGPT, Claude und Perplexity Ihre Website erreichen können

Damit Ihre Inhalte in ChatGPT, Claude oder Perplexity zitiert werden, muss der jeweilige KI-Crawler Ihre Website überhaupt erst technisch erreichen können. Die Prüfung dafür läuft über drei Schritte: die offiziellen Bot-Namen kennen, deren Zugriffe im Server-Log verifizieren und den Live-Abruf testen.

Welche KI-Crawler gibt es überhaupt?

Jeder größere KI-Anbieter betreibt mehrere, unterschiedlich arbeitende Bots. Wer das nicht auseinanderhält, blockt schnell den falschen. OpenAI (ChatGPT) - GPTBot: sammelt Trainingsdaten für zukünftige Modelle - OAI-SearchBot: baut den Suchindex für die ChatGPT-Suche auf - ChatGPT-User: ruft Seiten live ab, wenn ein Nutzer eine konkrete Frage stellt, und ist damit der Bot, der für Zitate in Antworten sorgt
Anthropic (Claude) - ClaudeBot: sammelt Trainingsdaten - Claude-SearchBot: indexiert Inhalte für die Claude-Websuche - Claude-User: ruft Seiten während laufender Konversationen live ab
Perplexity - PerplexityBot: crawlt für den Suchindex - Perplexity-User: ruft Seiten auf Basis konkreter Nutzeranfragen live ab Für die Zitierfähigkeit in Antworten sind jeweils die "User"-Bots (ChatGPT-User, Claude-User, Perplexity-User) entscheidend, nicht die Trainings-Crawler. Ein Block von GPTBot in der robots.txt hat also erstmal nichts damit zu tun, ob Sie in einer ChatGPT-Antwort zitiert werden können.

So verifizieren Sie echten Bot-Traffic

User-Agent-Strings lassen sich beliebig fälschen. Ein Eintrag wie "ChatGPT-User" im Log ist deshalb allein kein Beweis. Verlässlich wird die Prüfung erst über die offiziellen IP-Bereiche der Anbieter: - OpenAI: openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json - Anthropic: claude.com/crawling/bots.json - Perplexity: perplexity.com/perplexitybot.json, perplexity.com/perplexity-user.json Ein einfacher Grep-Befehl im Access-Log zeigt, welche Anfragen sich als KI-Bot ausgeben:
grep -E 'GPTBot | OAI-SearchBot | ChatGPT-User | ClaudeBot | Claude-User | PerplexityBot' access.log
Die gefundenen IPs gleichen Sie anschließend gegen die offiziellen Listen ab. Liegt eine IP außerhalb des veröffentlichten Bereichs, handelt es sich nicht um den echten Bot, sondern um einen Fake-Absender. Ein Sonderfall bei Anthropic: Ein Teil der offiziellen ClaudeBot-IP-Bereiche liegt in Google-Cloud- und Azure-Adressraum. Eine ASN-Abfrage, die "Google Cloud" statt "Anthropic" zurückgibt, bedeutet hier nicht automatisch Fälschung, sondern hängt an der zugrunde liegenden Cloud-Infrastruktur.

Blockiert Ihre robots.txt versehentlich Bots?

Ein häufiger Fehler: Eine robots.txt blockt GPTBot pauschal, um Training zu verhindern, und schließt dabei versehentlich OAI-SearchBot mit ein, wenn beide Regeln gemeinsam in einer zu breiten Anweisung landen.
Das Ergebnis: Die Seite verschwindet nicht nur aus dem Training, sondern auch aus der ChatGPT-Suche. Definieren Sie deshalb für jeden Bot eine eigene, klar benannte Regel:
User-agent: GPTBot Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: /
Wichtig zu wissen: Für ChatGPT-User gilt die robots.txt laut OpenAI-Dokumentation nicht zwingend, da der Abruf durch eine konkrete Nutzeranfrage ausgelöst wird. Über robots.txt lässt sich dieser Bot also weder zuverlässig einladen noch zuverlässig aussperren, entscheidend ist hier allein die technische Erreichbarkeit des Servers.

Der Live-Test: Selbst nachstellen, was ein Nutzer sieht

Der schnellste Praxistest kostet nichts: Geben Sie ChatGPT (mit aktivierter Websuche), Claude oder Perplexity den Auftrag, eine konkrete URL Ihrer Website zu öffnen und die Überschrift wörtlich zu zitieren. Beobachten Sie parallel Ihr Access-Log. 1. Kommt in der Antwort ein korrektes Zitat an und taucht im Log ein erfolgreicher Abruf der jeweiligen echten IP auf, ist die Seite technisch sauber erreichbar.
2. Bleibt die Antwort vage oder verweigert das System den Abruf, lohnt sich der Blick ins Log: Oft liefert der Server einen Fehlerstatus (403, 404, 429), den ein normales Uptime-Monitoring gar nicht bemerkt, weil dieses mit einem gewöhnlichen Browser-Client testet und andere Antworten erhält als ein KI-Bot.

Wenn der Zugriff technisch klappt, die Seite trotzdem nicht zitiert wird

Kommt der Bot nachweislich durch, taucht Ihre Seite aber trotzdem in keiner Antwort auf, liegt kein Zugriffsproblem mehr vor, sondern ein Relevanz- oder Indexierungsthema. Das ist ein eigenständiges Feld der GEO-Optimierung (Content-Struktur, Aktualität, Autorität) und keine technische Frage mehr.

Häufig gestellte Fragen

1. Reicht es, im User-Agent nach "ChatGPT" oder "Claude" zu suchen?
2. Blockiert ein Block von GPTBot auch die ChatGPT-Suche?
3. Gilt robots.txt auch für nutzerausgelöste Live-Abrufe?
4. Warum zeigt mein Uptime-Monitoring keine Probleme, obwohl KI-Bots scheitern?
5. Veröffentlicht auch Perplexity verlässliche IP-Listen?
Unternehmen
Rechtsdokumente
Kontakt
Dimitrios Nikolaidis
SEO / GEO Berater