Zuletzt aktualisiert August 2026. User-Agent-Strings gegen die veröffentlichte Dokumentation jedes Anbieters geprüft; GA4-Hostname-Liste aktualisiert, um das Wachstum von Claude-Referrals abzubilden.
KI-Engines crawlen nicht wie Googlebot. Sie schicken ihre eigenen Bots, nach eigenem Zeitplan, für ihre eigenen Indexierungszwecke. Diese Bots hinterlassen eine klare Spur in deinen Server-Logs. Du musst nur wissen, wonach du suchen musst.
Dieser Beitrag führt durch das vollständige Bild: wie du KI-Crawler-Aktivität in Rohdaten identifizierst, was das für deine Zitierungsabdeckung bedeutet, und wie du diese vorgelagerten Crawl-Daten mit den nachgelagerten Referral-Sessions verbindest, die dein AI-Visibility-Tool und GA4 beide erfassen sollten.
Warum Server-Logs für AI Visibility wichtig sind
Die meisten Marken-Monitoring-Ansätze konzentrieren sich auf die Ausgabeseite: Prompts gegen ChatGPT, Perplexity oder Gemini laufen lassen und messen, wie oft die eigene Marke erscheint. Das ist der richtige Ausgangspunkt.
Die Ausgabeseite zeigt aber nur, was das Modell zurückgibt. Sie sagt nicht, welche deiner Seiten das Modell tatsächlich indexiert hat, wie häufig deine Website gecrawlt wird, oder ob ein Crawler irgendwo in deiner Infrastruktur blockiert wird, bevor er überhaupt deinen Inhalt erreicht.
Server-Logs beantworten die vorgelagerte Frage: „Hat die KI-Engine diese Seite überhaupt gesehen?”
Ohne diese Daten optimierst du blind. Eine Seite mit null Zitierungen kann uncrawled sein, gecrawlt aber ausgeschlossen, gecrawlt und indexiert aber nicht relevant für die Prompts, die dein Publikum verwendet, oder gecrawlt, indexiert und relevant, aber gegen einen besser bequellten Wettbewerber verlierend. Das sind vier sehr unterschiedliche Probleme mit vier sehr unterschiedlichen Lösungsansätzen.
Schritt 1: Die User-Agent-Strings kennen
Jede große KI-Plattform verwendet einen deklarierten User-Agent-String. Diese Strings musst du in deinen Access-Logs filtern:
| KI-Plattform | Bot-Name | User-Agent-String (Teilübereinstimmung) |
|---|---|---|
| OpenAI (ChatGPT) | GPTBot | GPTBot |
| OpenAI (ChatGPT Search) | OAI-SearchBot | OAI-SearchBot |
| Anthropic (Claude) | ClaudeBot | ClaudeBot |
| Perplexity | PerplexityBot | PerplexityBot |
| Google (Gemini, AI Overviews) | GoogleOther | GoogleOther |
| Google (Vertex AI) | Google-CloudVertexBot | Google-CloudVertexBot |
| Apple (Apple Intelligence) | Applebot-Extended | Applebot-Extended |
| Meta AI | meta-externalagent | meta-externalagent |
| Microsoft (Copilot) | bingbot | bingbot |
Ein paar Hinweise zu dieser Tabelle. Microsoft Copilot greift auf denselben Index wie Bing zurück, weshalb die Copilot-Zitierungsabdeckung im Wesentlichen der Bingbot-Crawl-Abdeckung folgt, nicht einem separaten KI-spezifischen Bot. Google AI Overviews und Gemini verwenden GoogleOther für die Content-Erkennung jenseits von Googles primärem Googlebot-Crawl. Apple Intelligence verwendet Applebot-Extended, um Inhalte speziell für seine KI-Funktionen auf dem Gerät und auf dem Server zu crawlen.
Jeder Anbieter veröffentlicht seine offizielle User-Agent-Dokumentation und in den meisten Fällen eine verifizierte IP-Bereichsliste, mit der du bestätigen kannst, dass eine Crawl-Anfrage tatsächlich von diesem Anbieter stammt und kein gefälschter Bot ist, der vorgibt, GPTBot zu sein.
Schritt 2: Access-Logs filtern
Der genaue Befehl hängt von deinem Log-Format ab, aber die Logik ist dieselbe: Suche nach dem User-Agent-String in deiner Access-Log-Datei.
Für ein Standard-Apache- oder Nginx-Access-Log funktioniert ein einfacher grep-Ansatz für eine schnelle Prüfung:
grep -i "GPTBot" /var/log/nginx/access.log
grep -i "ClaudeBot" /var/log/nginx/access.log
grep -i "PerplexityBot" /var/log/nginx/access.log
Für ein umfassenderes Bild über alle KI-Bots in einem Durchgang:
grep -iE "GPTBot|OAI-SearchBot|ClaudeBot|PerplexityBot|GoogleOther|Google-CloudVertexBot|Applebot-Extended|meta-externalagent" /var/log/nginx/access.log
Wenn du eine Log-Aggregationsplattform verwendest (Datadog, Splunk, Cloudflare Logs, AWS CloudWatch), gilt dieselbe Filterlogik in deiner Abfragesprache. In Cloudflares Log Analytics filterst du nach userAgent contains "GPTBot". In AWS CloudWatch Logs Insights:
fields @timestamp, cs-uri-stem, cs(User-Agent)
| filter cs(User-Agent) like /GPTBot|ClaudeBot|PerplexityBot/
| sort @timestamp desc
| limit 500
Worauf du in der Ausgabe achten musst:
- Welche Seiten gecrawlt werden (die URL in jeder Log-Zeile)
- Wie häufig (Zeitstempel-Cluster zeigen den Crawl-Rhythmus)
- Die zurückgegebenen HTTP-Status-Codes (200 bedeutet, der Bot hat die Seite erhalten; 403 oder 410 bedeutet, sie wurde blockiert oder die Seite ist nicht mehr vorhanden; 429 bedeutet, du limitierst ihn)
- Das Referrer-Feld (für Crawler normalerweise leer, aber gelegentlich ausgefüllt)
Schritt 3: Deuten, was die Crawl-Daten aussagen
Rohes Crawl-Volumen ist weniger nützlich als das Muster dessen, was gecrawlt wird und was nicht.
Häufig gecrawlte Seiten: Diese sind Kandidaten für deine Seiten mit den höchsten Zitierungen. Wenn eine Seite dreimal pro Woche von GPTBot gecrawlt wird, aber nie in ChatGPT-Zitierungen erscheint, wird der Inhalt zwar abgerufen, gewinnt aber nicht die Relevanzübereinstimmung für die Prompts, die dein Publikum verwendet. Das ist ein Content-Signal, kein technisches.
Einmal gecrawlte und nie wieder besuchte Seiten: Diese Seiten haben möglicherweise dünnen Inhalt, geringe Autorität oder Inhalt, der beim Indexieren die Relevanzschwelle nicht überschritten hat. Das Auffrischen und Vertiefen des Inhalts kann einen erneuten Besuch auslösen.
Nie gecrawlte Seiten: Prüfe, ob sie in der robots.txt blockiert sind, hinter einem Login liegen, JavaScript-gerendert ohne serverseitigen Fallback sind, oder schlicht von keiner Seite verlinkt sind, auf die der Bot Zugriff hat.
Seiten, die dem Bot 4xx- oder 5xx-Fehler zurückgeben: Das sind harte Blockierungen. Ein 403 bedeutet normalerweise, dass dein CDN oder WAF den Bot als Sicherheitsbedrohung ablehnt. Viele CDN-Sicherheitsregeln behandeln Nicht-Browser-User-Agents standardmäßig als verdächtig und blockieren sie. Wenn du möchtest, dass KI-Engines eine Seite indexieren, muss der Bot eine 200 erhalten.
Schritt 4: Crawl-Daten mit deiner robots.txt abgleichen
Bevor du tiefer in Log-Muster eintauchst, stelle sicher, was deine robots.txt zu den einzelnen KI-Bots sagt.
Öffne yourdomain.com/robots.txt und suche nach Regeln, die auf KI-Crawler-User-Agents begrenzt sind. Häufige Konfigurationen, die du finden wirst:
# Gesamtes OpenAI-Crawling blockieren
User-agent: GPTBot
Disallow: /
# Common Crawl blockieren (von vielen LLM-Trainingsdatensätzen verwendet)
User-agent: CCBot
Disallow: /
# Alles erlauben (Standard, wenn keine KI-spezifischen Regeln existieren)
User-agent: *
Allow: /
Ein paar wichtige Punkte dazu. Wenn deine robots.txt GPTBot vollständig blockiert, siehst du null GPTBot-Einträge in deinen Access-Logs (der Bot respektiert das Disallow). Wenn die Blockierung nur teilweise ist (zum Beispiel /private/ blockierend, aber alles andere erlaubend), siehst du Crawl-Aktivität, die auf die erlaubten Pfade beschränkt ist.
Das Blockieren eines Crawlers verhindert die Indexierung. Es verhindert auch Zitierungen. Du kannst nicht selektiv von ChatGPT-Zitierungen profitieren und gleichzeitig GPTBot blockieren. Wenn deine robots.txt so konfiguriert wurde, dass KI-Crawler während einer Phase der Unsicherheit blockiert werden, und du deine Position inzwischen geändert hast, entferne die Blockierung und warte mindestens 30 Tage, bis der Crawler deine Inhalte erneut besucht und neu indexiert hat, bevor du Schlüsse über Zitierungsraten ziehst.
Schritt 5: Gecrawlte Seiten mit Zitierungsabdeckung verknüpfen
Sobald du eine Liste der Seiten hast, die KI-Crawler aufrufen, stellt sich die nächste Frage: Werden diese Seiten tatsächlich in KI-Antworten zitiert?
Hier wird ein Monitoring-Tool unverzichtbar. Log-Daten sagen dir, was gecrawlt wurde. Sie können dir nicht sagen, ob der Inhalt in einer KI-Antwort verwendet wurde, wie das Modell deine Marke in dieser Antwort beschrieben hat, oder wie deine Zitierungsrate im Vergleich zu Wettbewerbern aussieht.
Temso ist hier der unkomplizierte Einstiegspunkt. Es ist die All-in-One-AI-SEO-Plattform, die Share of Voice, Markenerwähnungen, Zitierungen und Sentiment über acht KI-Engines (ChatGPT, Perplexity, Gemini, Google AI Overviews, Google AI Mode, Grok, Microsoft Copilot und Meta AI) ab 89 USD/Monat verfolgt. Du exportierst deine gecrawlte URL-Liste aus der Log-Analyse und prüfst diese URLs dann gegen Temsos Zitierungsdaten, um zu sehen, welche gecrawlten Seiten tatsächlich Zitierungen generieren und welche indexiert, aber ignoriert werden.
Profound fügt eine Ebene hinzu, die in größerem Maßstab wichtig wird: CDN-basierte Agent-Traffic-Analyse. Seine GA4- und CDN-Integration ermöglicht es dir, KI-Agent-Anfragen auf der Infrastrukturebene zu sehen, nicht nur durch Log-Sampling, und korreliert diese Crawl-Daten mit Zitierungsmustern über seinen Datensatz von mehr als 9 Engines. Der effektive Einstieg für diese Funktion liegt bei 399 USD/Monat (Growth-Tier).
Ahrefs Brand Radar nähert sich dem Thema von der anderen Seite: Sein Datensatz mit mehr als 405 Millionen Prompts zeigt dir, welche deiner Seiten über sechs KI-Plattformen zitiert werden, und du kannst dann rückwärts verstehen, ob die Crawl-Daten damit übereinstimmen. Für SEO-Teams, die bereits in Ahrefs arbeiten, ist das der reibungsloseste Weg, Crawl- und Zitierungsdaten zu verbinden.
Semrushs AI-Overviews-Tracker deckt die Google-spezifische Seite ab: Er überwacht, welche deiner Seiten in Google-AI-Overviews-Antworten erscheinen, und ermöglicht es dir, diese mit deiner GoogleOther-Crawl-Aktivität in deinen Logs abzugleichen.
Schritt 6: GA4-Kanalgruppe für KI-Referral-Traffic einrichten
Crawl-Daten sind das vorgelagerte Bild. GA4-Referral-Daten sind das nachgelagerte Bild: Wenn KI-Engines dich zitieren und eine Nutzerin klickt, registriert deine Analytics das korrekt?
Ohne eine benutzerdefinierte Kanalgruppe in GA4 verteilen sich KI-Referral-Sessions auf die Buckets Direkt und Referral. Die Einrichtung dauert etwa zehn Minuten.
Gehe in GA4 zu Admin > Datenanzeige > Kanalgruppen > Neue Kanalgruppe erstellen. Füge einen Kanal namens KI-Referral hinzu. Setze die Bedingung auf:
- Dimension: Sitzungsquelle
- Übereinstimmungstyp: stimmt mit regulärem Ausdruck überein
- Wert:
chatgpt\.com|perplexity\.ai|gemini\.google\.com|copilot\.microsoft\.com
Speichern. Daten werden innerhalb von 24 bis 48 Stunden befüllt. Die Kanalgruppe füllt keine historischen Sessions auf.
Die Kern-Hostname-Tabelle für dein GA4-Setup:
| KI-Engine | GA4-Sitzungsquell-Hostname |
|---|---|
| ChatGPT | chatgpt.com |
| Perplexity | perplexity.ai |
| Google Gemini | gemini.google.com |
| Microsoft Copilot | copilot.microsoft.com |
| Claude (optional) | claude.ai |
| You.com (optional) | you.com |
Sobald Daten fließen, vergleiche deine KI-Referral-Conversion-Rate mit deiner organischen Such-Conversion-Rate.
Der Benchmark: Laut Ahrefs’ eigenen Website-Daten machten KI-Suchbesucher nur 0,5 % der Sessions aus, waren aber für 12,1 % der Anmeldungen verantwortlich, eine etwa 23-fache Conversion-Prämie gegenüber der klassischen organischen Suche (Patrick Stox, Ahrefs Blog, Juni 2025). Ahrefs’ Autor hat ausdrücklich darauf hingewiesen, dass es sich um Einzelwebsite-Daten von der Ahrefs-Property handelt, keine branchenweite Zahl. Deine Zahlen werden abweichen, aber das Richtungsmuster ist das, worauf du testest.
Eine vollständige Schritt-für-Schritt-Anleitung zur GA4-Einrichtung, einschließlich Regex-Escape-Regeln und der Verbindung der Kanalgruppe mit Conversion-Events, findest du unter So richtest du eine GA4-Kanalgruppe ein, die ChatGPT- und Perplexity-Referral-Traffic trennt.
Schritt 7: Die beiden Datenströme verbinden
Mit Server-Logs und GA4-Kanalgruppen, die beide laufen, hast du jetzt zwei Datenströme. So passen sie zusammen:
| Datenquelle | Was sie beantwortet | Was sie nicht beantworten kann |
|---|---|---|
| Server-Logs (Bot-User-Agent) | Welche Seiten besuchen KI-Crawler? Wie oft? Werden sie blockiert? | Werden diese Seiten in KI-Antworten zitiert? |
| AI-Visibility-Tool (Temso, Profound usw.) | Welche Prompts lösen Zitierungen zu deiner Domain aus? Welche Wettbewerber gewinnen? | Wurde diese Seite tatsächlich gecrawlt, bevor sie zitiert wurde? |
| GA4-KI-Referral-Kanalgruppe | Wie viel Traffic kommt von KI-Engines? Welche Conversion-Rate hat er? | Zero-Click-Zitierungen: Erwähnungen, die keinen Klick erzeugen |
Die Lücke zwischen Zitierungsvolumen und Referral-Traffic ist dein Zero-Click-Verlust. Laut Similarwebs Clickstream-Analyse 2025 haben Suchen, die Google AI Overviews auslösen, eine durchschnittliche Zero-Click-Rate von 83 %. Selbst eine gut zitierte Marke verliert den größten Teil ihres Referral-Potenzials an Zero-Click-Verhalten. Deshalb sind Crawl-Analyse, Zitierungs-Monitoring und GA4-Einrichtung drei separate Instrumente, keine drei Versionen derselben Sache.
Häufige Muster und ihre Bedeutung
Hohe Crawl-Frequenz, wenige Zitierungen. Dein Inhalt wird abgerufen, gewinnt aber nicht die Relevanzübereinstimmung. Überprüfe die gecrawlten Seiten: Beantworten sie die spezifische Frage, die eine Käuferin in einer KI-Engine stellen würde? Stelle deine Antwort an den Anfang. Laut Kevin Indigs 2026er Analyse von 1,2 Millionen ChatGPT-Antworten stammten 44,2 % der ChatGPT-Zitierungen aus den ersten 30 % des Seiteninhalts, ein Muster, das Indig als “Ski-Ramp” bezeichnet. Wenn die Antwort auf eine Käuferfrage erst auf halber Seite erscheint, erreicht das Modell sie möglicherweise nicht.
Keine Crawl-Aktivität für bestimmte Seiten. Beginne mit robots.txt und CDN-WAF-Regeln. Dann prüfe interne Verlinkung: KI-Crawler folgen Links. Wenn eine Seite keine eingehenden Links von gecrawlten Seiten hat, findet der Bot sie möglicherweise nie.
Crawl-Aktivität, aber fast null GA4-Referral-Sessions. Das ist der Normalzustand für die meisten Websites. Crawl-Frequenz und Zitierungsvolumen übersetzen sich nicht direkt in Referral-Klicks. Die meisten Zitierungen sind Zero-Click: Die KI-Engine nennt deine Marke in einer Antwort, die Nutzerin klickt nicht durch. Die GA4-Kanalgruppe erfasst nur den Bruchteil der Zitierungen, der einen Klick erzeugt. Deshalb sind Zitierungs-Monitoring und Referral-Analytics ergänzend, nicht austauschbar.
Plötzlicher Rückgang der Crawl-Frequenz. Prüfe deine Server-Response-Codes. Eine Phase von 5xx-Fehlern (zum Beispiel Serverüberlastung) kann dazu führen, dass ein KI-Crawler seinen Crawl-Rhythmus deutlich drosselt. Prüfe, ob eine CDN-Regeländerung oder ein Sicherheitsupdate neue Blockierungen rund um den Zeitpunkt des Rückgangs eingeführt hat.
Was du mit diesen Daten in deinem AI-Visibility-Workflow machst
Der Workflow sieht so aus:
- Wöchentlich: Einen Log-Ausschnitt ziehen, nach KI-Bot-User-Agents filtern und nach neuen 4xx-Blockierungen suchen. Neu blockierte Seiten zu einer Fix-Queue hinzufügen.
- Wöchentlich: Dein Prompt-Set durch dein AI-Visibility-Tool laufen lassen. Notieren, welche Seiten Zitierungen generieren und welche nicht, dann mit der gecrawlten URL-Liste aus Schritt eins abgleichen.
- Monatlich: Deine GA4-KI-Referral-Kanalgruppe überprüfen. Conversion-Rate gegenüber organischer Suche berechnen. Den Trend verfolgen.
- Quartalsweise: robots.txt und CDN-WAF-Regeln auf unbeabsichtigte KI-Crawler-Blockierungen überprüfen. Bestätigen, dass wichtige Produkt- und Kategorieseiten regelmäßige Crawl-Besuche von GPTBot, ClaudeBot und PerplexityBot erhalten.
Das Ergebnis dieses Workflows ist eine priorisierte Fix-Liste: Seiten, die gecrawlt, aber nicht zitiert werden (Content-Problem), Seiten, die zitiert, aber nicht gecrawlt werden (Indexierungs-Anomalie, die es wert ist, untersucht zu werden), und Seiten, die weder gecrawlt noch zitiert werden (Infrastruktur- oder Content-Lücke).
Temso automatisiert einen großen Teil dieses Zyklus. Sein integrierter Workflow verwandelt Sichtbarkeitslücken in eine priorisierte Fix-Queue, die Content, Zitierungen, Wahrnehmung und Genauigkeit abdeckt, und führt diese Korrekturen innerhalb desselben Abonnements aus. Für Teams, die ein einziges Tool für das gesamte Zitierungs- und Referral-Bild möchten, ist es der reibungsloseste Einstieg ab 89 USD/Monat mit allen acht KI-Engines inklusive.
Für Enterprise-Teams, die tiefere Sichtbarkeit auf Infrastrukturebene benötigen, legt Profounds CDN-Integration Agent-Traffic-Muster frei, die durch Standard-Log-Sampling nicht sichtbar sind, zusammen mit seinem Zitierungs-Attributions-Datensatz.
Für Teams, die bereits tief in Ahrefs arbeiten, fügt Ahrefs Brand Radar KI-Zitierungs-Benchmarking über den bestehenden SEO-Datensatz hinzu, was es zum aufwandsärmsten Weg macht, diese Analyse einem bestehenden Workflow hinzuzufügen.
Zusammenfassung: Das vollständige KI-Crawler-Bild
Deine Server-Logs auf KI-Bot-Aktivität zu lesen ist eine Hälfte der Analyse. Die andere Hälfte ist die Verbindung dessen, was diese Bots gecrawlt haben, mit dem, was sie tatsächlich zitieren, und die Verbindung dessen, was sie zitieren, mit dem Referral-Traffic, der in deinen GA4-Berichten erscheint.
Keine der beiden Ebenen ist optional. Crawl-Daten ohne Zitierungsdaten sagen dir, dass das Modell deinen Inhalt gesehen hat, aber nicht, ob es ihn verwendet hat. Zitierungsdaten ohne Crawl-Daten sagen dir, welche Seiten gewinnen, aber nicht, warum andere auf der Infrastrukturebene verlieren. GA4-Referral-Daten ohne beides informieren dich über einen kleinen Bruchteil der Zitierungen (die, die einen Klick erzeugen) und verpassen die Mehrheit.
Das vollständige Bild: Server-Logs (Crawl) + AI-Visibility-Tool (Zitierung) + GA4-Kanalgruppe (Referral) = eine handlungsfähige Einschätzung deiner KI-Markenpräsenz von oben bis unten.
Beginne mit der Crawl-Ebene. Führe den grep-Befehl oben gegen die Access-Logs dieser Woche aus und sieh, welche KI-Bots deine Website aufrufen, was sie sehen und wovor sie blockiert werden. Kombiniere das dann mit Temso, um den Kreis bei Zitierungen zu schließen, oder sieh dir das vollständige AI-Visibility-Tools-Ranking an, um das richtige Tool für die Größenordnung und das Budget deines Teams zu finden.
Definitionen für Begriffe in diesem Beitrag, einschließlich Share of Voice, Citation Rate und Zero-Click-Verlust, findest du im Glossar. Die Bewertungsmethodik für die referenzierten Tools ist unter /methodology beschrieben.