In diesem Blog stehen 76 Beiträge, bevor Sie diesen hier lesen. Sie handeln von Rankings, von Zitaten in KI-Antworten, von Messkonzepten und Sichtbarkeitswerten. Das Serverlog kommt darin genau einmal vor, in einem Nebensatz. Das ist bemerkenswert, denn es ist die einzige Quelle zum Thema, die niemandem gehört außer dem Betreiber der Website selbst.

Jede andere Zahl über KI-Verkehr stammt von jemand anderem und misst jemand anderen. Fastly misst seine eigene Kundschaft, Cloudflare seine, Adobe den US-Einzelhandel. Für den deutschen Mittelstand existiert keine repräsentative Erhebung darüber, wie oft KI-Systeme dort vorbeischauen. Es existiert aber auf jedem Webserver eine Textdatei, in der steht, wer die eigene Website in den vergangenen Tagen gelesen hat. Diese Datei ist unspektakulär, sie ist nicht hübsch aufbereitet, und sie ist die einzige Zahl über das eigene Haus.

Wie Sie steuern, wer lesen darf, haben wir im Beitrag zu Cloudflares neuer Standardregel ab 15. September 2026 beschrieben. Dieser Beitrag handelt vom Gegenstück: nachsehen, wer tatsächlich da war.

1. Wer da klopft: die Kennungen im Log

Jede Zeile im Zugriffslog endet mit dem User-Agent, den der Aufrufer mitgeschickt hat. Darin steht bei den seriösen Anbietern eine feste Kennung, ein sogenanntes Token. Diese Token sind öffentlich dokumentiert, sie ändern sich selten, und sie sagen etwas darüber aus, wozu der Zugriff dient. Die folgende Übersicht führt die Betreiber auf, die 2026 eine eigene Dokumentation dazu veröffentlicht haben.

KI-Kennungen im Zugriffslog: Betreiber, Token, Zweck und Prüfmöglichkeit
Betreiber Token im Log Zweck Prüfung
OpenAIGPTBotTrainingopenai.com/gptbot.json
OpenAIOAI-SearchBotIndex für die Sucheopenai.com/searchbot.json
OpenAIChatGPT-UserAbruf im Moment der Frageopenai.com/chatgpt-user.json
OpenAIOAI-AdsBotWerbung, neu hinzugekommenopenai.com/adsbot.json
AnthropicClaudeBotTrainingclaude.com/crawling/bots.json
AnthropicClaude-UserAbrufdieselbe Liste
AnthropicClaude-SearchBotIndex für die Suchedieselbe Liste
PerplexityPerplexityBotIndex, laut Doku ausdrücklich nicht Trainingperplexity.com/perplexitybot.json
PerplexityPerplexity-UserAbrufperplexity.com/perplexity-user.json
GoogleGooglebotIndexReverse-DNS auf googlebot.com
GoogleGoogle-Extendedreines robots.txt-Token, kein eigener User-Agenttaucht im Log nie auf
MicrosoftbingbotIndexkeine IP-Liste, Reverse-DNS auf search.msn.com
Metameta-externalagentTraining und IndexBetreiber-Doku
Metameta-externalfetcherAbrufBetreiber-Doku
MetafacebookexternalhitLinkvorschauBetreiber-Doku
AmazonAmazonbotIndexBetreiber-Doku
AppleApplebotIndex; Applebot-Extended ist wie bei Google ein reines robots.txt-TokenBetreiber-Doku
Common CrawlCCBotöffentlicher Datensatz, breit als Trainingsgrundlage genutztBetreiber-Doku
MistralMistralAI-Training, MistralAI-Index, MistralAI-UserTraining, Index, AbrufBetreiber-Doku

Quelle: Betreiber-Dokumentationen, abgerufen im August 2026. Für OpenAI: developers.openai.com/api/docs/bots. Die Anthropic-Liste unter claude.com/crawling/bots.json enthielt am 18.08.2026 26 IPv4-Präfixe.

Drei Punkte an dieser Tabelle sind wichtiger als der Rest.

  • Die Anthropic-Liste unterscheidet die drei Bots nicht. Es gibt nur eine gemeinsame Datei mit IP-Präfixen, und sie enthält keine Bot-Namen. Sie können damit prüfen, dass ein Zugriff von Anthropic kam – nicht, ob es ClaudeBot, Claude-User oder Claude-SearchBot war. Diese Unterscheidung bleibt Ihnen nur über den User-Agent, und der ist nicht verifizierbar.
  • OAI-AdsBot ist neu. Er ist in vielen kursierenden Blocklisten noch nicht enthalten. Wer eine robots.txt aus dem Jahr 2025 einsetzt, hat ihn schlicht nicht auf dem Zettel – weder zum Sperren noch zum Zählen.
  • Filterregeln gehören auf das Token, nie auf den vollständigen User-Agent. Der Vollstring enthält Versionsnummern, und die wandern. Wer auf GPTBot/1.2 filtert, zählt ab der nächsten Version nichts mehr. Wer auf GPTBot filtert, zählt weiter.

Eine Kuriosität am Rande, die bei der ersten Prüfung irritiert: Verifizierte Bing-Zugriffe lösen per Reverse-DNS zu Namen wie msnbot-157-55-33-18.search.msn.com auf, obwohl der User-Agent bingbot sagt. Der alte Name steckt noch in der Infrastruktur. Das ist kein Fehler und kein Fälschungsindiz.

Nicht belegt, deshalb nicht als Tatsache behauptet: Für Bytespider von ByteDance, für DeepSeek und für xAI ließ sich zum Zeitpunkt der Recherche keine offizielle Betreiber-Dokumentation finden – weder eine Beschreibung der Kennungen noch eine IP-Liste. Zugriffe unter diesen Namen können echt sein, sie können aber auch von beliebigen Dritten stammen. Behandeln Sie sie im Log als das, was sie sind: unbestätigt.

2. Trainings-Crawler und Abruf-Bots: der Unterschied, auf den es ankommt

Wenn Sie aus diesem Beitrag eine einzige Unterscheidung mitnehmen, dann diese. Die Kennungen im Log zerfallen in zwei Gruppen, die inhaltlich fast nichts miteinander zu tun haben.

Trainings-Crawler wie GPTBot, ClaudeBot oder CCBot arbeiten planmäßig und im Voraus. Sie holen Inhalte, weil sie Inhalte holen sollen. Es gibt keinen Adressaten, keine Frage und keinen Zeitdruck. Ein Zugriff von GPTBot um drei Uhr nachts bedeutet: Ihre Seite wurde eingesammelt. Mehr nicht.

Abruf-Bots wie ChatGPT-User, Claude-User, Perplexity-User oder meta-externalfetcher arbeiten reaktiv. Hinter jedem einzelnen dieser Zugriffe steht in genau diesem Moment ein Mensch mit einer Frage, der gleich eine Antwort bekommt – häufig mit einem Quellenlink. Das ist funktional näher an einem Besucher als an einem Crawler.

Ein Trainings-Crawler holt sich Ihren Text. Ein Abruf-Bot beantwortet gerade jemandem eine Frage damit. Das ist nicht dieselbe Sorte Ereignis.

Aus dieser Trennung folgt eine praktische Konsequenz, die in Blockdiskussionen regelmäßig untergeht: Perplexity und Meta dokumentieren selbst, dass ihre Abruf-Bots die robots.txt in der Regel nicht befolgen, weil der Nutzer den Abruf ausdrücklich verlangt hat. Die Begründung ist nachvollziehbar – es handelt sich um eine vom Menschen ausgelöste Einzelanfrage, nicht um systematisches Einsammeln.

Wer pauschal alle KI-Bots sperrt, sperrt beide Sorten. Er verhindert das Einsammeln, das ihm vielleicht egal wäre, und verliert gleichzeitig genau den Verkehr, den er eigentlich wollte: den Moment, in dem ein Interessent eine Frage stellt und Ihre Seite als Antwort in Betracht kommt. Das gilt umso mehr, seit agentische KI-Browser wie Atlas und Comet im Auftrag von Nutzern unterwegs sind.

3. Ins Log schauen: die Kommandos zum Zählen

Sie brauchen dafür keine Administratorkenntnisse, nur die Logdatei und ein Terminal. Bei Shared Hosting laden Sie die Datei aus dem Kundenportal herunter, bei einem eigenen Server liegt sie meist unter /var/log/apache2/access.log oder /var/log/nginx/access.log. Ältere Tage sind in der Regel als .gz daneben abgelegt; dafür ersetzen Sie in allen folgenden Befehlen grep durch zgrep und awk durch eine vorgeschaltete Entpackung.

Eine Zeile im gebräuchlichen Combined-Format sieht so aus – IP-Adresse, Zeitstempel, angefragter Pfad, Statuscode, Referrer, User-Agent:

203.0.113.7 - - [28/Aug/2026:04:11:52 +0200] "GET /leistungen/ HTTP/1.1"
200 18422 "-" "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko);
compatible; ChatGPT-User/1.0; +https://openai.com/bot"

Eine Logzeile im Combined-Format. Der User-Agent steht am Ende, das Token darin ist ChatGPT-User.

Erstens: eine Übersicht aller Kennungen. Der folgende Befehl zählt jedes Token einzeln durch und gibt eine sortierte Liste aus. Er ist der sinnvolle erste Schritt, weil er Ihnen zeigt, welche Systeme bei Ihnen überhaupt vorkommen.

# Zugriffe je Kennung, absteigend sortiert
for t in GPTBot OAI-SearchBot ChatGPT-User OAI-AdsBot \
         ClaudeBot Claude-User Claude-SearchBot \
         PerplexityBot Perplexity-User Googlebot bingbot \
         meta-externalagent meta-externalfetcher facebookexternalhit \
         Amazonbot Applebot CCBot MistralAI; do
  printf '%7s  %s\n' "$(grep -c -- "$t" access.log)" "$t"
done | sort -rn

Ein Durchlauf je Token. Wichtig: gefiltert wird auf das Token, nicht auf den Vollstring mit Versionsnummer.

Zweitens: der Verlauf über die Tage. Interessanter als eine Gesamtzahl ist die Entwicklung. Der folgende Befehl zieht das Datum aus dem vierten Feld und zählt die Tage einzeln.

# Zugriffe je Tag für eine Kennung
awk '/ChatGPT-User/ {print substr($4, 2, 11)}' access.log | sort | uniq -c

Ergebnis: eine Zeile je Tag, etwa 17 28/Aug/2026.

Drittens: welche Seiten geholt werden. Das ist der praktisch wertvollste Auszug, weil er zeigt, welche Ihrer Inhalte in KI-Antworten gebraucht werden.

# Die 20 meistgeholten Seiten einer Kennung
awk '/ChatGPT-User/ {print $7}' access.log | sort | uniq -c | sort -rn | head -20

Feld 7 ist der angefragte Pfad. Für die Abruf-Bots ist diese Liste die aussagekräftigste Auswertung überhaupt.

Viertens: die IP-Adressen einer Kennung, als Vorbereitung für die Verifikation im nächsten Abschnitt.

# Alle verschiedenen IP-Adressen, die sich als GPTBot ausgeben
awk '/GPTBot/ {print $1}' access.log | sort -u

Diese Liste gleichen Sie anschließend gegen die veröffentlichte IP-Liste des Betreibers ab.

Zwei Fallstricke. Erstens zählt grep auch Treffer im Referrer, nicht nur im User-Agent; bei sauberen Logs ist das selten, bei manipulierten Referrern kann es die Zahl verfälschen. Zweitens ist Googlebot auch in Googlebot-Image und Googlebot-News enthalten – die Summe ist also eine Summe über alle Google-Crawler. Wer das trennen will, filtert genauer.

4. Namensschild statt Ausweis: Zugriffe verifizieren – und wo die Methode endet

Der User-Agent ist ein frei beschreibbares Textfeld. Jeder kann hineinschreiben, was er möchte. Er ist ein Namensschild, kein Ausweis. Eine Zeile mit GPTBot darin belegt genau eines: dass jemand GPTBot hineingeschrieben hat.

Es gibt zwei belastbare Verfahren, das zu prüfen.

4.1 Abgleich mit den veröffentlichten IP-Listen

Die meisten Betreiber veröffentlichen maschinenlesbare Listen der IP-Bereiche, aus denen ihre Crawler kommen. Sie holen die Liste, prüfen, ob die IP aus dem Log darin enthalten ist, fertig. OpenAI führt je Bot eine eigene Datei; Anthropic eine gemeinsame für alle drei Kennungen. Für Bing gibt es keine IP-Liste, dort bleibt nur das zweite Verfahren.

4.2 Reverse-DNS mit Vorwärts-Gegenprobe

Das Verfahren hat zwei Schritte, und der zweite ist der entscheidende. Sie lösen die IP-Adresse zu einem Hostnamen auf, und anschließend den Hostnamen wieder zurück zur IP-Adresse. Nur wenn beide Richtungen zusammenpassen, ist der Zugriff belegt.

# Schritt 1: IP zu Name
host 66.249.66.1
# 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com

# Schritt 2: Name zurück zur IP - die Gegenprobe
host crawl-66-249-66-1.googlebot.com
# crawl-66-249-66-1.googlebot.com has address 66.249.66.1

Nur wenn Schritt 2 wieder die Ausgangs-IP liefert, ist der Zugriff bestätigt.

Warum der zweite Schritt zählt: Den Reverse-Eintrag seiner eigenen IP-Adresse kann jeder frei setzen. Wer über eigene Adressen verfügt, kann sie irgendwas.googlebot.com nennen. Was er nicht kann, ist den Vorwärtseintrag in der Zone googlebot.com setzen – die gehört Google. Erst der Rückweg schließt die Lücke. Wer nur Schritt eins macht, prüft nichts.

Sperren Sie nicht per IP. Anthropic rät davon ausdrücklich ab, und die Begründung ist einleuchtend: Ein IP-Block hindert den Crawler auch daran, Ihre robots.txt abzurufen. Die eigentliche Anweisung, die Sie ihm geben wollten, kommt dann nie an. Die IP-Liste ist ein Prüfwerkzeug, kein Sperrwerkzeug.

4.3 Die Grenze der Methode

Hier endet, was ein Logfile leisten kann. Cloudflare wies am 4. August 2025 nach, dass Perplexity bei Blockade auf nicht deklarierte Crawler auswich: ein generischer Chrome-User-Agent, rotierende IP-Adressen, wechselnde ASNs. Cloudflare schätzte das Volumen dieser undeklarierten Zugriffe auf drei bis sechs Millionen Anfragen täglich, gegenüber 20 bis 25 Millionen des offen deklarierten Crawlers.

Die Konsequenz für Ihre Auswertung ist unangenehm, aber klar: Wer sich nicht zu erkennen geben will, steht in Ihrem Log als „Besucher mit Chrome“. Jede Zahl, die Sie aus dem Log ziehen, ist deshalb eine Untergrenze, nie eine Vollerhebung. Sie zählt die Höflichen. Das ist immer noch mehr, als eine fremde Benchmark über Ihre Website weiß – aber es ist keine vollständige Antwort auf die Frage, wer da war.

5. Was Ihr Hoster überhaupt aufbewahrt

Bevor Sie mit der Auswertung beginnen, lohnt ein Blick darauf, wie viel Vergangenheit Ihnen Ihr Anbieter überhaupt zur Verfügung stellt. Die Antwort fällt bei den großen deutschen Hostern durchgehend knapp aus.

Aufbewahrung des Zugriffslogs bei deutschen Hostern
Anbieter Aufbewahrung Besonderheit
All-Inklmax. 7 Tagekürzester Zeitraum im Vergleich
HostEurope14 TageAbruf über das KIS-Kundenportal; ob die IP vollständig gespeichert wird, ist nicht dokumentiert
STRATO6 Wochenausdrücklicher Hinweis: „Ältere Daten stellen wir nicht zur Verfügung“; IP-Speicherung nicht dokumentiert
IONOSmax. 8 Wochenanonymisiert die Besucher-IP-Adressen im Logfile

Quelle: Angaben der Anbieter, Stand August 2026. Bei eigenen Servern bestimmen Sie die Aufbewahrung selbst über die Logrotation.

Zwei Punkte daraus sind für die Praxis entscheidend.

IONOS anonymisiert die Besucher-IP-Adressen im Logfile. Damit ist die Verifikation aus Abschnitt 4 dort nicht durchführbar. Sie sehen, dass etwas mit der Kennung GPTBot zugegriffen hat – Sie können aber nicht prüfen, ob es GPTBot war. Für die Datenschutzlage ist das ein Vorteil, für die Beweisführung ein Ausschlusskriterium. Wer bei IONOS hostet und die Prüfung braucht, muss sie an anderer Stelle vornehmen, etwa auf einer vorgelagerten Ebene.

Bei sieben Tagen bis sechs Wochen ist eine Jahresauswertung aus Shared-Hosting-Logs nicht möglich. Wer eine Zeitreihe aufbauen will – und genau die wäre interessant, weil sie zeigt, ob die Abrufe zunehmen –, muss die Logs regelmäßig selbst herunterladen und aufbewahren. Ein monatlicher Termin im Kalender genügt dafür. Wer damit heute anfängt, hat in zwölf Monaten eine Zahl, die sonst niemand hat.

Bei HostEurope und STRATO ist nicht dokumentiert, ob die IP-Adresse vollständig gespeichert wird. Wir schreiben das so hin, statt zu raten: Klären lässt es sich in dreißig Sekunden mit einem Blick in die erste Spalte der eigenen Logdatei.

6. Fremde Benchmarks: was die Zahlen zeigen und was nicht

Es gibt Erhebungen zum KI-Verkehr, und sie sind interessant. Sie messen nur nicht Sie. Drei davon werden 2026 am häufigsten zitiert; hier stehen sie mit dem, worauf sie sich beziehen.

97 %
Anteil von OpenAI an den Abruf-Bots. Fastly Threat Insights Report, Januar 2026
+393 %
Verkehr aus generativer KI auf US-Einzelhandelsseiten im Jahresvergleich. Adobe Digital Insights, April 2026
50.000:1
Crawl-zu-Besuch-Verhältnis bei Anthropic. Cloudflare, August 2025

6.1 Fastly: OpenAI dominiert die Abrufe

Der Fastly Threat Insights Report vom Januar 2026 wertet rund 6,5 Billionen Anfragen pro Monat über 130.000 Anwendungen aus. Bei den Abruf-Bots ist OpenAI mit 97 Prozent praktisch allein; DuckAssistBot kommt auf 2 Prozent. Die Abruf-Bots machen dabei etwa 1 Prozent des gesamten Bot-Verkehrs aus. Bei den Crawlern verteilt es sich anders: Google Other 36 Prozent, Meta 28 Prozent, PetalBot 18 Prozent.

Der Bezug dieser Zahlen ist Fastlys globale Kundschaft, und die besteht überproportional aus großen Websites. Das ist nicht der deutsche Mittelstand. Was Sie aus dem Bericht mitnehmen können, ist die Rangfolge – nicht die Größenordnung für Ihre eigene Seite.

6.2 Fastly, Juni 2026: das Verhältnis verschiebt sich

In einer Auswertung vom 9. Juni 2026 für den Zeitraum Januar bis Mai 2026 berichtet Fastly, der KI-Verkehr sei um 30 Prozent gewachsen, rund 6,5-mal schneller als menschlicher Verkehr. Für Mai 2026 nennt der Bericht eine Aufteilung von 85 Prozent Crawlern zu 15 Prozent Abrufen.

Achtung beim Vergleich: Das 1 Prozent aus dem Januar-Bericht und die 15 Prozent aus dem Mai-Bericht haben verschiedene Nenner. Das eine bezieht sich auf den gesamten Bot-Verkehr, das andere auf den KI-Verkehr. Die beiden Zahlen lassen sich nicht zu einer Wachstumsgeschichte verrechnen, auch wenn das häufig getan wird.

6.3 Adobe: eine Wachstumsrate von sehr kleiner Basis

Adobe Digital Insights berichtet im April 2026 auf Basis von Daten bis März 2026 und über einer Billion Besuchen auf US-Einzelhandelsseiten einen Zuwachs des Verkehrs aus generativer KI von 393 Prozent im Jahresvergleich. Diese Zahl wird viel zitiert und selten eingeordnet.

Sie ist eine Wachstumsrate von sehr kleiner Basis, und sie gilt für den US-Einzelhandel bei Adobe-Kunden. Für einen deutschen Mittelständler ist daraus keine Erwartung ableitbar. Die belastbarere Aussage desselben Berichts betrifft nicht die Menge, sondern die Qualität: KI-verwiesene Besucher haben eine 32 Prozent niedrigere Absprungrate und sehen 13 Prozent mehr Seiten. Das ist die Zahl, die man sich merken sollte – sie beschreibt, was diese Besucher tun, und nicht, wie viele es anderswo waren.

6.4 Cloudflare: das Missverhältnis zwischen Holen und Bringen

Cloudflare veröffentlichte im August 2025 Crawl-zu-Besuch-Verhältnisse über alle Branchen: Anthropic 50.000:1, OpenAI 887:1, Perplexity 118:1. Auf 50.000 Abrufe durch Anthropic kam also ein Besucher zurück. Die Zahlen sind als Stand 2025 zu kennzeichnen; eine methodisch dokumentierte Fassung für 2026 liegt nicht vor.

Genau dieses Missverhältnis ist der Grund, warum die Diskussion über klicklose Suche überhaupt geführt wird. Und es ist der Grund, warum die eigene Log-Auswertung nüchtern bleiben sollte: Ein hoher Crawler-Wert ist kein Erfolg.

7. Die drei Fehlschlüsse

Wer zum ersten Mal ins Log schaut, zieht mit hoher Wahrscheinlichkeit einen dieser drei Schlüsse. Alle drei sind falsch.

7.1 „GPTBot war 4.000-mal da, also empfiehlt ChatGPT uns.“

Falsch, weil GPTBot der Trainings-Crawler ist. Er sagt aus, dass Ihre Inhalte eingesammelt wurden, und nichts darüber, ob Sie in Antworten vorkommen. Wer Sichtbarkeit in Antworten messen will, zählt ChatGPT-User, Claude-User und Perplexity-User – die Kennungen, hinter denen eine konkrete Frage steht. Hohe Crawler-Zahlen sind Aufmerksamkeit der Maschine, nicht Nachfrage des Marktes.

7.2 „Im User-Agent steht GPTBot, also war es OpenAI.“

Falsch, und zwar in beide Richtungen. Nach oben: Common Crawl warnt selbst vor Crawlern, die sich als CCBot ausgeben – die Kennung ist bekannt, und sie steht jedem zur Verfügung, der sie hineinschreiben möchte. Nach unten: Perplexity gab sich im von Cloudflare dokumentierten Fall umgekehrt als Chrome aus. Ein Name im Log kann zu viel behaupten und zu wenig verraten. Deshalb der Abgleich aus Abschnitt 4.

7.3 „Google-Extended taucht nicht im Log auf, also trainiert Google nicht mit uns.“

Falsch, weil Google-Extended dort gar nicht auftauchen kann. Es ist ein reines robots.txt-Token ohne eigenen User-Agent und sendet selbst keine Anfrage. Bei Applebot-Extended ist es genauso.

Der allgemeine Fall dahinter ist wichtiger als das Beispiel: Aus der Abwesenheit im Log folgt nichts. Sie kann bedeuten, dass niemand da war. Sie kann bedeuten, dass der Zugriff kein eigenes Namensschild trägt. Sie kann bedeuten, dass er ein fremdes getragen hat. Und sie kann schlicht bedeuten, dass die Sieben-Tage-Frist Ihres Hosters den fraglichen Zeitraum längst überschrieben hat. Ein leeres Ergebnis ist kein Befund.

8. Die IP im Log: der Datenschutz-Rahmen

Die erste Spalte im Logfile ist eine IP-Adresse, und damit ist das Thema Datenschutz eröffnet. Der Europäische Gerichtshof hat am 19. Oktober 2016 in der Sache C-582/14 (Breyer) entschieden, dass eine dynamische IP-Adresse für den Websitebetreiber ein personenbezogenes Datum sein kann. Rechtsgrundlage für das Führen von Serverlogs ist regelmäßig Artikel 6 Absatz 1 Buchstabe f DSGVO, das berechtigte Interesse.

Eine gesetzliche Aufbewahrungsfrist für Serverlogs gibt es nicht. Maßgeblich ist der Grundsatz der Speicherbegrenzung aus Artikel 5 Absatz 1 Buchstabe e: so kurz wie möglich, so lang wie nötig. In der Praxis gelten sieben Tage als etabliert, das Bayerische Landesamt für Datenschutzaufsicht wird mit dreißig Tagen zitiert. Beides ist Praxis und Behördenmeinung, nicht Gesetz.

Für den hier beschriebenen Anwendungsfall ist die Lage entspannt. Wer aggregierte Kennzahlen herauszieht – Zugriffe je Bot, je Tag, je Seite –, erhält ein Ergebnis ohne Personenbezug. Die IP-Adresse wird nur im Moment der Verifikation gebraucht und muss danach nicht in der Auswertung stehen. Wer die Logs länger aufbewahren will, um eine Zeitreihe zu bauen, kann die aggregierte Tabelle behalten und die Rohdaten löschen.

Hinweis: Dieser Abschnitt ist Recherche und keine Rechtsberatung. Für die konkrete Ausgestaltung Ihrer Aufbewahrungsfristen und Ihres Verarbeitungsverzeichnisses sprechen Sie mit Ihrer Datenschutzberatung.

9. Fazit: die ehrlichste Zahl, die Sie über KI haben

Die Log-Auswertung ist keine große Sache. Eine Datei herunterladen, vier Befehle ausführen, eine Tabelle daraus machen: eine knappe Stunde beim ersten Mal, danach zehn Minuten im Monat. Was sie liefert, ist trotzdem etwas, das keine Benchmark ersetzt – eine Aussage über Ihre Website statt über den Durchschnitt fremder Websites.

Drei Dinge bleiben nach dem ersten Durchgang übrig. Sie wissen, welche Systeme Sie überhaupt lesen. Sie wissen, welche Ihrer Seiten die Abruf-Bots holen – das ist die Liste, an der sich Ihre Inhaltsarbeit ausrichten sollte. Und Sie haben einen Ausgangswert, gegen den Sie in drei Monaten vergleichen können.

Unsere Empfehlung: Zählen Sie zuerst die Abruf-Bots, nicht die Trainings-Crawler. ChatGPT-User, Claude-User und Perplexity-User sind die einzigen Kennungen im Log, hinter denen ein Mensch mit einer Frage steht. Alles andere ist Infrastruktur. Und laden Sie Ihr Log ab heute einmal im Monat herunter – bei sieben Tagen Aufbewahrung ist das der einzige Weg zu einer Zeitreihe.

Die zweite Hälfte des Themas ist die Steuerung: welche Crawler Sie zulassen und welche nicht. Wie Sie KI-Verkehr zusätzlich in der Webanalyse abbilden, zeigen wir im Beitrag zur AI-Assistant-Channel-Gruppe in GA4. Und warum die llms.txt kaum abgerufen wird, lässt sich – passend zum Thema dieses Beitrags – ebenfalls im eigenen Log nachsehen.

10. FAQ: die wichtigsten Fragen zum Serverlog

Wo finde ich das Zugriffslog meiner Website?

Bei Shared Hosting im Kundenportal des Anbieters: HostEurope stellt die Logdateien über das KIS-Kundenportal bereit, STRATO, IONOS und All-Inkl über ihre jeweiligen Kundenmenüs. Bei einem eigenen Server liegen sie meist unter /var/log/apache2/access.log oder /var/log/nginx/access.log, ältere Tage als .gz-Archiv daneben. Wer nur ein Analysewerkzeug im Browser nutzt, sieht dort ausschließlich Menschen mit aktivem JavaScript – Crawler tauchen allein im Serverlog auf.

Welche Kennung zeigt, dass ChatGPT meine Seite gerade für eine Nutzerfrage abruft?

ChatGPT-User. Diese Kennung steht für einen Abruf im Moment der Frage: Ein Mensch hat gerade etwas gefragt, das System holt Ihre Seite und beantwortet die Frage damit, häufig mit Quellenlink. Die Entsprechungen bei den anderen Anbietern sind Claude-User bei Anthropic, Perplexity-User bei Perplexity und meta-externalfetcher bei Meta. GPTBot und ClaudeBot sind dagegen Trainings-Crawler und sagen über Ihre Sichtbarkeit in Antworten nichts aus.

Wie prüfe ich, ob ein Zugriff wirklich von GPTBot kam?

Auf zwei Wegen. Erstens über die veröffentlichten IP-Listen: OpenAI führt je Bot eine eigene Liste unter openai.com/gptbot.json, /searchbot.json, /chatgpt-user.json und /adsbot.json; Anthropic eine gemeinsame unter claude.com/crawling/bots.json. Zweitens über Reverse-DNS mit Vorwärts-Gegenprobe: Sie lösen die IP-Adresse zu einem Namen auf und den Namen wieder zurück zur IP-Adresse. Nur wenn beide Richtungen zusammenpassen, ist der Zugriff belegt – den Reverse-Eintrag seiner eigenen IP-Adresse kann jeder frei setzen.

Warum taucht Google-Extended nicht in meinem Log auf?

Weil es dort nicht auftauchen kann. Google-Extended ist ein reines robots.txt-Token ohne eigenen User-Agent: Es steuert, ob Ihre Inhalte für Gemini und Vertex AI verwendet werden dürfen, sendet aber selbst keine Anfrage. Bei Apple verhält sich Applebot-Extended genauso. Aus der Abwesenheit im Log folgt in beiden Fällen nichts.

Wie lange bewahren deutsche Hoster das Zugriffslog auf?

Kurz. All-Inkl nennt maximal sieben Tage, HostEurope 14 Tage, STRATO sechs Wochen mit dem ausdrücklichen Hinweis, dass ältere Daten nicht zur Verfügung gestellt werden, IONOS maximal acht Wochen. Eine Jahresauswertung aus einem Shared-Hosting-Log ist damit nicht möglich. Wer eine Zeitreihe braucht, muss die Logs regelmäßig selbst herunterladen und aufbewahren.

Kann ich die Verifikation bei jedem Hoster durchführen?

Nein. IONOS anonymisiert die Besucher-IP-Adressen im Logfile. Dort sehen Sie zwar, dass etwas mit der Kennung GPTBot zugegriffen hat, können aber nicht mehr prüfen, ob es GPTBot war – dafür bräuchten Sie die vollständige IP-Adresse. Bei HostEurope und STRATO ist nicht dokumentiert, ob die IP-Adresse vollständig gespeichert wird; das klärt nur ein Blick in die eigene Logdatei.

Darf ich die IP-Adressen im Log überhaupt auswerten?

Der Europäische Gerichtshof hat am 19. Oktober 2016 in der Sache C-582/14 (Breyer) entschieden, dass eine dynamische IP-Adresse für den Websitebetreiber ein personenbezogenes Datum sein kann. Rechtsgrundlage für Serverlogs ist regelmäßig Artikel 6 Absatz 1 Buchstabe f DSGVO. Eine gesetzliche Frist gibt es nicht; maßgeblich ist der Grundsatz der Speicherbegrenzung nach Artikel 5 Absatz 1 Buchstabe e. Für diesen Anwendungsfall ist die Lage entspannt: Wer aggregierte Kennzahlen herauszieht, also Zugriffe je Bot je Tag je Seite, erhält ein Ergebnis ohne Personenbezug. Die IP-Adresse wird nur im Moment der Verifikation gebraucht. Dieser Beitrag ist Recherche und keine Rechtsberatung.

Warum ist die Log-Auswertung nur eine Untergrenze?

Weil sie nur zählen kann, was sich zu erkennen gibt. Cloudflare wies am 4. August 2025 nach, dass Perplexity bei Blockade auf nicht deklarierte Crawler auswich: generischer Chrome-User-Agent, rotierende IP-Adressen, wechselnde ASNs, geschätzt drei bis sechs Millionen Anfragen täglich gegenüber 20 bis 25 Millionen des deklarierten Crawlers. Wer sein Namensschild abnimmt, steht im Log als Besucher mit Chrome. Jede Log-Statistik ist deshalb eine Untergrenze, nie eine Vollerhebung.

Stand und Quellen: Kennungen und IP-Listen nach den Dokumentationen der Betreiber, abgerufen im August 2026 (OpenAI: developers.openai.com/api/docs/bots; Anthropic: claude.com/crawling/bots.json, Stand 18.08.2026 mit 26 IPv4-Präfixen; Perplexity: perplexity.com). Zahlen: Fastly Threat Insights Report, Januar 2026, und Fastly-Auswertung vom 09.06.2026; Adobe Digital Insights, April 2026, Daten bis März 2026; Cloudflare, August 2025. Der Fall des undeklarierten Crawlings wurde von Cloudflare am 04.08.2025 veröffentlicht. Hoster-Angaben nach Auskunft der Anbieter, Stand August 2026. Zu ByteDance, DeepSeek und xAI ließ sich keine offizielle Betreiber-Dokumentation finden; entsprechende Kennungen sind hier als unbestätigt gekennzeichnet. Alle Angaben mit Stand 30. August 2026.

Stephan Michalik
Über den Autor
Stephan Michalik
Gründer Grünberg.Digital. · CEO Flio Germany GmbH

Maximale Performance durch die Symbiose aus Erfahrung und Innovation: Als Gründer von Grünberg.Digital. und CEO der Flio Germany GmbH – einem führenden Business Inkubator und Enabler – konzipiert Stephan Michalik ganzheitliche Onlinemarketing-Strategien. Ob treffsicheres SEA, umsatzstarkes E-Mail-Marketing oder verkaufsstarke Landingpages: Er kombiniert diese Core-Disziplinen nahtlos mit modernster KI. Das Ergebnis sind hocheffiziente, KI-gestützte Marketing-Ökosysteme für maximalen digitalen Vorsprung.

LinkedIn