>
Plenty is claimed about AI crawlers and very little is shown. Anyone running a site can see in their own logs which systems actually arrive, what they take and how often — and almost nobody publishes it. Here is one day of it, with the query that produced it.
AI systems made more requests than search engines did — 299 against 282. The search engines pulled more data (4.0 MB against 2.1 MB), because Googlebot fetches images and stylesheets that a language model has no use for.
This domain was registered on 1 August 2026. It is two days old, ranks for nothing, and has no inbound links worth counting — and seven distinct AI systems have already read it.
| System | Requests | Data | Share |
|---|---|---|---|
| ClaudeBot (Anthropic) | 135 | 795 kB | 45 % |
| GPTBot (OpenAI) | 96 | 798 kB | 32 % |
| PerplexityBot | 22 | 213 kB | 7 % |
| CCBot (Common Crawl) | 16 | 69 kB | 5 % |
| ChatGPT-User (OpenAI, on behalf of a human) | 15 | 152 kB | 5 % |
| OAI-SearchBot (OpenAI) | 9 | 43 kB | 3 % |
| Amazonbot | 6 | 45 kB | 2 % |
| Crawler | Requests | Data | Share |
|---|---|---|---|
| Googlebot | 134 | 2658 kB | 48 % |
| YandexBot | 130 | 1306 kB | 46 % |
| Bingbot | 10 | 78 kB | 4 % |
| Applebot | 8 | 53 kB | 3 % |
YandexBot at 130 requests is within reach of Googlebot, which is not the ratio most sites see. Bingbot at 10 is the surprise in the other direction.
Separated out rather than counted: requests carrying an AI user agent that went straight for files nobody links to.
| User agent claimed | Requests | Paths sought |
|---|---|---|
| Bingbot | 5 | /.env.prod |
| PerplexityBot | 5 | /terraform.tfvars |
| OAI-SearchBot (OpenAI) | 5 | /.git/HEAD |
| ChatGPT-User (OpenAI, on behalf of a human) | 5 | /keys.json |
A user agent is not an identity. It is a string the client chooses. Whether these came from the named operators or from someone borrowing their name cannot be determined from this side, and this page does not claim to know. What can be said: they were not reading, all of them got 404, and nothing they sought exists here.
The most-requested paths across all of them are the machine-readable ones — /sitemap.xml, /llms.txt, /mcp — before the articles. That is the whole argument for maintaining those files: they are not decoration, they are what gets read first.
These numbers cannot be checked from outside. They come from our own provider's analytics, retrieved with a token only the operator holds. Nobody can recompute them. What is published instead is the method: the query runs in
tools/crawler-bericht.py, in plain text, and anyone with a Cloudflare zone can run the same one against their own.
So this is a self-report with a disclosed method, not a measurement someone could repeat. Everywhere else on this site that distinction is the point, and it would be dishonest to blur it here because the numbers happen to be flattering.
Two further limits. One day is one day — a crawler that visits weekly is invisible in it. And requests are counted at the edge, so a system reading a cached copy through an intermediary never appears at all.
Über KI-Crawler wird viel behauptet und wenig gezeigt. Wer eine Seite betreibt, kann im eigenen Protokoll sehen, welche Systeme tatsächlich kommen, was sie holen und wie oft — und fast niemand veröffentlicht es. Hier ist ein Tag davon, mitsamt der Abfrage, die ihn erzeugt hat.
Die KI-Systeme haben mehr Anfragen gestellt als die Suchmaschinen — 299 gegen 282. Die Suchmaschinen haben mehr Daten gezogen (4,0 MB gegen 2,1 MB), weil Googlebot Bilder und Stilvorlagen holt, mit denen ein Sprachmodell nichts anfangen kann.
Diese Domain wurde am 1. August 2026 registriert. Sie ist zwei Tage alt, rankt für nichts und hat keine nennenswerten eingehenden Links — und sieben verschiedene KI-Systeme haben sie bereits gelesen.
| System | Anfragen | Daten | Anteil |
|---|---|---|---|
| ClaudeBot (Anthropic) | 135 | 795 kB | 45 % |
| GPTBot (OpenAI) | 96 | 798 kB | 32 % |
| PerplexityBot | 22 | 213 kB | 7 % |
| CCBot (Common Crawl) | 16 | 69 kB | 5 % |
| ChatGPT-User (OpenAI, im Auftrag eines Menschen) | 15 | 152 kB | 5 % |
| OAI-SearchBot (OpenAI) | 9 | 43 kB | 3 % |
| Amazonbot | 6 | 45 kB | 2 % |
| Crawler | Anfragen | Daten | Anteil |
|---|---|---|---|
| Googlebot | 134 | 2658 kB | 48 % |
| YandexBot | 130 | 1306 kB | 46 % |
| Bingbot | 10 | 78 kB | 4 % |
| Applebot | 8 | 53 kB | 3 % |
YandexBot liegt mit 130 Anfragen in Reichweite von Googlebot, und das ist nicht das Verhältnis, das die meisten Seiten sehen. Bingbot mit 10 ist die Überraschung in die andere Richtung.
Herausgerechnet statt mitgezählt: Anfragen mit einem KI-User-Agent, die direkt auf Dateien zielten, die niemand verlinkt.
| Behaupteter User-Agent | Anfragen | Gesuchte Pfade |
|---|---|---|
| Bingbot | 5 | /.env.prod |
| PerplexityBot | 5 | /terraform.tfvars |
| OAI-SearchBot (OpenAI) | 5 | /.git/HEAD |
| ChatGPT-User (OpenAI, im Auftrag eines Menschen) | 5 | /keys.json |
Ein User-Agent ist keine Identität. Er ist eine Zeichenkette, die der Client wählt. Ob diese Anfragen von den genannten Betreibern kamen oder von jemandem, der sich ihren Namen leiht, lässt sich von dieser Seite aus nicht feststellen, und diese Seite behauptet nicht, es zu wissen. Sagen lässt sich: Sie haben nicht gelesen, alle bekamen 404, und nichts von dem, was sie suchten, gibt es hier.
Die meistgefragten Pfade über alle hinweg sind die maschinenlesbaren — /sitemap.xml, /llms.txt, /mcp — vor den Artikeln. Das ist das ganze Argument dafür, diese Dateien zu pflegen: Sie sind keine Zierde, sie sind das, was zuerst gelesen wird.
Diese Zahlen sind von außen nicht überprüfbar. Sie stammen aus der Auswertung unseres eigenen Anbieters, abgerufen mit einem Token, das nur der Betreiber hat. Niemand kann sie nachrechnen. Veröffentlicht wird stattdessen die Methode: Die Abfrage steht in
tools/crawler-bericht.py, im Klartext, und wer eine Cloudflare-Zone hat, kann dieselbe gegen die eigene laufen lassen.
Das hier ist also eine Selbstauskunft mit offengelegter Methode, keine Messung, die jemand wiederholen könnte. Überall sonst auf dieser Seite ist genau dieser Unterschied der Punkt, und es wäre unredlich, ihn hier zu verwischen, weil die Zahlen zufällig schmeichelhaft sind.
Zwei weitere Grenzen. Ein Tag ist ein Tag — ein Crawler, der wöchentlich vorbeikommt, ist darin unsichtbar. Und gezählt wird am Rand des Netzes, ein System also, das über einen Zwischenspeicher eine Kopie liest, taucht überhaupt nicht auf.
Sobre los rastreadores de IA se afirma mucho y se muestra muy poco. Quien gestiona un sitio puede ver en sus propios registros qué sistemas llegan de verdad, qué se llevan y con qué frecuencia — y casi nadie lo publica. Aquí hay un día de ello, junto con la consulta que lo produjo.
Los sistemas de IA hicieron más peticiones que los motores de búsqueda — 299 frente a 282. Los motores de búsqueda se llevaron más datos (4,0 MB frente a 2,1 MB), porque Googlebot recupera imágenes y hojas de estilo que a un modelo de lenguaje no le sirven de nada.
Este dominio se registró el 1 de agosto de 2026. Tiene dos días, no posiciona para nada y no tiene enlaces entrantes dignos de contarse — y siete sistemas de IA distintos ya lo han leído.
| Sistema | Peticiones | Datos | Cuota |
|---|---|---|---|
| ClaudeBot (Anthropic) | 135 | 795 kB | 45 % |
| GPTBot (OpenAI) | 96 | 798 kB | 32 % |
| PerplexityBot | 22 | 213 kB | 7 % |
| CCBot (Common Crawl) | 16 | 69 kB | 5 % |
| ChatGPT-User (OpenAI, por encargo de una persona) | 15 | 152 kB | 5 % |
| OAI-SearchBot (OpenAI) | 9 | 43 kB | 3 % |
| Amazonbot | 6 | 45 kB | 2 % |
| Rastreador | Peticiones | Datos | Cuota |
|---|---|---|---|
| Googlebot | 134 | 2658 kB | 48 % |
| YandexBot | 130 | 1306 kB | 46 % |
| Bingbot | 10 | 78 kB | 4 % |
| Applebot | 8 | 53 kB | 3 % |
YandexBot, con 130 peticiones, está al alcance de Googlebot, y esa no es la proporción que ve la mayoría de los sitios. Bingbot, con 10, es la sorpresa en la dirección contraria.
Separadas en lugar de contadas: peticiones que llevaban un agente de usuario de IA y fueron directas a archivos que nadie enlaza.
| Agente de usuario declarado | Peticiones | Rutas buscadas |
|---|---|---|
| Bingbot | 5 | /.env.prod |
| PerplexityBot | 5 | /terraform.tfvars |
| OAI-SearchBot (OpenAI) | 5 | /.git/HEAD |
| ChatGPT-User (OpenAI, por encargo de una persona) | 5 | /keys.json |
Un agente de usuario no es una identidad. Es una cadena que elige el cliente. Si estas vinieron de los operadores nombrados o de alguien que toma prestado su nombre no puede determinarse desde este lado, y esta página no pretende saberlo. Lo que sí puede decirse: no estaban leyendo, todas recibieron 404 y nada de lo que buscaban existe aquí.
Las rutas más solicitadas por todos ellos son las legibles por máquina — /sitemap.xml, /llms.txt, /mcp — antes que los artículos. Ese es todo el argumento para mantener esos archivos: no son adorno, son lo que se lee primero.
Estas cifras no pueden comprobarse desde fuera. Proceden de la analítica de nuestro propio proveedor, obtenidas con un token que solo tiene el operador. Nadie puede recalcularlas. Lo que se publica en su lugar es el método: la consulta está en
tools/crawler-bericht.py, en texto plano, y cualquiera que tenga una zona de Cloudflare puede ejecutar la misma contra la suya.
Así que esto es un autoinforme con el método revelado, no una medición que alguien pudiera repetir. En todo el resto de este sitio esa distinción es justamente el asunto, y sería deshonesto difuminarla aquí porque las cifras resulten halagadoras.
Dos límites más. Un día es un día — un rastreador que pasa semanalmente es invisible en él. Y las peticiones se cuentan en el borde, así que un sistema que lee una copia en caché a través de un intermediario no aparece en absoluto.
On affirme beaucoup de choses sur les robots d’IA et on en montre très peu. Qui exploite un site peut voir dans ses propres journaux quels systèmes arrivent réellement, ce qu’ils prennent et à quelle fréquence — et presque personne ne le publie. En voici une journée, avec la requête qui l’a produite.
Les systèmes d’IA ont fait plus de requêtes que les moteurs de recherche — 299 contre 282. Les moteurs de recherche ont tiré plus de données (4,0 MB contre 2,1 MB), parce que Googlebot récupère des images et des feuilles de style dont un modèle de langue n’a aucun usage.
Ce domaine a été enregistré le 1er août 2026. Il a deux jours, ne se classe sur rien et n’a aucun lien entrant digne d’être compté — et sept systèmes d’IA distincts l’ont déjà lu.
| Système | Requêtes | Données | Part |
|---|---|---|---|
| ClaudeBot (Anthropic) | 135 | 795 kB | 45 % |
| GPTBot (OpenAI) | 96 | 798 kB | 32 % |
| PerplexityBot | 22 | 213 kB | 7 % |
| CCBot (Common Crawl) | 16 | 69 kB | 5 % |
| ChatGPT-User (OpenAI, pour le compte d’un humain) | 15 | 152 kB | 5 % |
| OAI-SearchBot (OpenAI) | 9 | 43 kB | 3 % |
| Amazonbot | 6 | 45 kB | 2 % |
| Robot | Requêtes | Données | Part |
|---|---|---|---|
| Googlebot | 134 | 2658 kB | 48 % |
| YandexBot | 130 | 1306 kB | 46 % |
| Bingbot | 10 | 78 kB | 4 % |
| Applebot | 8 | 53 kB | 3 % |
YandexBot, avec 130 requêtes, est à portée de Googlebot, et ce n’est pas le rapport que voient la plupart des sites. Bingbot, avec 10, est la surprise dans l’autre sens.
Mises à part plutôt que comptées : des requêtes portant un agent utilisateur d’IA et allant droit vers des fichiers que personne ne lie.
| Agent utilisateur déclaré | Requêtes | Chemins recherchés |
|---|---|---|
| Bingbot | 5 | /.env.prod |
| PerplexityBot | 5 | /terraform.tfvars |
| OAI-SearchBot (OpenAI) | 5 | /.git/HEAD |
| ChatGPT-User (OpenAI, pour le compte d’un humain) | 5 | /keys.json |
Un agent utilisateur n’est pas une identité. C’est une chaîne que le client choisit. Savoir si celles-ci venaient des opérateurs nommés ou de quelqu’un qui emprunte leur nom ne peut pas être déterminé depuis ce côté-ci, et cette page ne prétend pas le savoir. Ce qu’on peut dire : elles ne lisaient pas, toutes ont reçu 404, et rien de ce qu’elles cherchaient n’existe ici.
Les chemins les plus demandés, tous confondus, sont ceux lisibles par machine — /sitemap.xml, /llms.txt, /mcp — avant les articles. C’est tout l’argument pour entretenir ces fichiers : ce ne sont pas des ornements, ce sont eux qu’on lit en premier.
Ces chiffres ne sont pas vérifiables de l’extérieur. Ils viennent de l’analytique de notre propre fournisseur, récupérée avec un jeton que seul l’exploitant détient. Personne ne peut les recalculer. Ce qui est publié à la place, c’est la méthode : la requête se trouve dans
tools/crawler-bericht.py, en clair, et quiconque dispose d’une zone Cloudflare peut lancer la même contre la sienne.
Ceci est donc une auto-déclaration à méthode divulguée, pas une mesure que quelqu’un pourrait répéter. Partout ailleurs sur ce site cette distinction est le sujet même, et il serait malhonnête de la brouiller ici parce que les chiffres se trouvent être flatteurs.
Deux limites de plus. Un jour est un jour — un robot qui passe chaque semaine y est invisible. Et les requêtes sont comptées en bordure de réseau : un système qui lit une copie en cache via un intermédiaire n’apparaît pas du tout.
Sui crawler di IA si afferma molto e si mostra pochissimo. Chi gestisce un sito può vedere nei propri registri quali sistemi arrivano davvero, che cosa prendono e con quale frequenza — e quasi nessuno lo pubblica. Eccone una giornata, con la query che l’ha prodotta.
I sistemi di IA hanno fatto più richieste dei motori di ricerca — 299 contro 282. I motori di ricerca hanno tirato più dati (4,0 MB contro 2,1 MB), perché Googlebot preleva immagini e fogli di stile che a un modello linguistico non servono.
Questo dominio è stato registrato il 1° agosto 2026. Ha due giorni, non si posiziona per nulla e non ha link in entrata degni di essere contati — e sette sistemi di IA distinti lo hanno già letto.
| Sistema | Richieste | Dati | Quota |
|---|---|---|---|
| ClaudeBot (Anthropic) | 135 | 795 kB | 45 % |
| GPTBot (OpenAI) | 96 | 798 kB | 32 % |
| PerplexityBot | 22 | 213 kB | 7 % |
| CCBot (Common Crawl) | 16 | 69 kB | 5 % |
| ChatGPT-User (OpenAI, per conto di una persona) | 15 | 152 kB | 5 % |
| OAI-SearchBot (OpenAI) | 9 | 43 kB | 3 % |
| Amazonbot | 6 | 45 kB | 2 % |
| Crawler | Richieste | Dati | Quota |
|---|---|---|---|
| Googlebot | 134 | 2658 kB | 48 % |
| YandexBot | 130 | 1306 kB | 46 % |
| Bingbot | 10 | 78 kB | 4 % |
| Applebot | 8 | 53 kB | 3 % |
YandexBot, con 130 richieste, è a portata di Googlebot, e non è il rapporto che vede la maggior parte dei siti. Bingbot, con 10, è la sorpresa nella direzione opposta.
Messe da parte anziché contate: richieste che portavano uno user agent di IA e puntavano dritto a file che nessuno collega.
| User agent dichiarato | Richieste | Percorsi cercati |
|---|---|---|
| Bingbot | 5 | /.env.prod |
| PerplexityBot | 5 | /terraform.tfvars |
| OAI-SearchBot (OpenAI) | 5 | /.git/HEAD |
| ChatGPT-User (OpenAI, per conto di una persona) | 5 | /keys.json |
Uno user agent non è un’identità. È una stringa che sceglie il client. Se queste siano venute dagli operatori nominati o da qualcuno che ne prende in prestito il nome non è determinabile da questo lato, e questa pagina non pretende di saperlo. Quello che si può dire: non stavano leggendo, tutte hanno ricevuto 404 e nulla di ciò che cercavano esiste qui.
I percorsi più richiesti nel complesso sono quelli leggibili dalla macchina — /sitemap.xml, /llms.txt, /mcp — prima degli articoli. È tutto qui l’argomento per mantenere quei file: non sono decorazione, sono ciò che viene letto per primo.
Questi numeri non sono verificabili dall’esterno. Vengono dall’analitica del nostro stesso fornitore, recuperata con un token che ha solo il gestore. Nessuno può ricalcolarli. Ciò che si pubblica al loro posto è il metodo: la query sta in
tools/crawler-bericht.py, in chiaro, e chiunque abbia una zona Cloudflare può eseguire la stessa sulla propria.
Questa è quindi un’autodichiarazione con metodo dichiarato, non una misura che qualcuno potrebbe ripetere. In ogni altro punto di questo sito quella distinzione è il punto, e sarebbe disonesto sfumarla qui perché i numeri risultano lusinghieri.
Altri due limiti. Un giorno è un giorno — un crawler che passa ogni settimana lì è invisibile. E le richieste si contano al bordo della rete, quindi un sistema che legge una copia in cache tramite un intermediario non compare affatto.
AI クローラーについては多くが語られ、ほとんど示されていない。サイトを運用していれば、どのシステムが実際に来て、何を持ち去り、どれくらいの頻度で来るのかを、自分の記録で見ることができる。それを公開する者はほとんどいない。ここにその一日分を、生成に使ったクエリとともに置く。
AI システムのほうが検索エンジンより多くリクエストした。299 対 282 である。データ量では検索エンジンのほうが多く(4.0 MB 対 2.1 MB)、Googlebot が画像やスタイルシートまで取得するからで、それらは言語モデルには用がない。
このドメインは 2026 年 8 月 1 日に登録された。二日目であり、何の検索順位もなく、数えるに値する被リンクもない。それでも七つの異なる AI システムがすでに読んでいる。
| システム | リクエスト | データ量 | 割合 |
|---|---|---|---|
| ClaudeBot (Anthropic) | 135 | 795 kB | 45 % |
| GPTBot (OpenAI) | 96 | 798 kB | 32 % |
| PerplexityBot | 22 | 213 kB | 7 % |
| CCBot (Common Crawl) | 16 | 69 kB | 5 % |
| ChatGPT-User (OpenAI、人間の依頼による) | 15 | 152 kB | 5 % |
| OAI-SearchBot (OpenAI) | 9 | 43 kB | 3 % |
| Amazonbot | 6 | 45 kB | 2 % |
| クローラー | リクエスト | データ量 | 割合 |
|---|---|---|---|
| Googlebot | 134 | 2658 kB | 48 % |
| YandexBot | 130 | 1306 kB | 46 % |
| Bingbot | 10 | 78 kB | 4 % |
| Applebot | 8 | 53 kB | 3 % |
YandexBot は 130 リクエストで Googlebot に手が届く位置にあり、これはたいていのサイトが見る比率ではない。Bingbot の 10 は、逆方向の驚きである。
数えずに切り分けたもの——AI のユーザーエージェントを名乗りながら、誰もリンクしていないファイルへ一直線に向かったリクエストである。
| 名乗ったユーザーエージェント | リクエスト | 求めたパス |
|---|---|---|
| Bingbot | 5 | /.env.prod |
| PerplexityBot | 5 | /terraform.tfvars |
| OAI-SearchBot (OpenAI) | 5 | /.git/HEAD |
| ChatGPT-User (OpenAI、人間の依頼による) | 5 | /keys.json |
ユーザーエージェントは身元ではない。クライアントが選ぶ文字列にすぎない。これらが名指しされた運営者から来たのか、その名を借りた誰かから来たのかは、こちら側からは判定できず、本ページはそれを知っているとは主張しない。言えるのは、それらは読んでいなかった、すべて 404 を受け取った、求めていたものはここに何一つ存在しない、ということである。
すべてを通じて最も多く求められたパスは、機械可読なもの——/sitemap.xml、/llms.txt、/mcp——であり、記事より先である。これらのファイルを整備する理由はそれに尽きる。飾りではなく、最初に読まれるものだ。
これらの数字は外部から検証できない。自分たちの事業者の解析から得たもので、運営者しか持たないトークンで取得した。誰も再計算できない。代わりに公開するのは方法である。クエリは
tools/crawler-bericht.pyに平文で置いてあり、Cloudflare のゾーンを持つ者は誰でも、同じものを自分のゾーンに対して実行できる。
したがってこれは方法を開示した自己申告であって、誰かが再現できる測定ではない。本サイトの他のどこでもこの区別こそが要点であり、数字がたまたま好都合だからといってここでぼかすのは不誠実だろう。
さらに二つの限界がある。一日は一日でしかない——週に一度来るクローラーはそこには映らない。そしてリクエストは配信の縁で数えるので、仲介を経てキャッシュされた複製を読む系統はまったく現れない。
Sobre rastreadores de IA afirma-se muito e mostra-se muito pouco. Quem mantém um site pode ver nos próprios registros quais sistemas de fato chegam, o que levam e com que frequência — e quase ninguém publica isso. Aqui está um dia disso, com a consulta que o produziu.
Os sistemas de IA fizeram mais requisições do que os buscadores — 299 contra 282. Os buscadores puxaram mais dados (4,0 MB contra 2,1 MB), porque o Googlebot busca imagens e folhas de estilo que não servem para um modelo de linguagem.
Este domínio foi registrado em 1º de agosto de 2026. Tem dois dias, não posiciona para nada e não tem links de entrada dignos de contagem — e sete sistemas de IA distintos já o leram.
| Sistema | Requisições | Dados | Participação |
|---|---|---|---|
| ClaudeBot (Anthropic) | 135 | 795 kB | 45 % |
| GPTBot (OpenAI) | 96 | 798 kB | 32 % |
| PerplexityBot | 22 | 213 kB | 7 % |
| CCBot (Common Crawl) | 16 | 69 kB | 5 % |
| ChatGPT-User (OpenAI, a pedido de uma pessoa) | 15 | 152 kB | 5 % |
| OAI-SearchBot (OpenAI) | 9 | 43 kB | 3 % |
| Amazonbot | 6 | 45 kB | 2 % |
| Rastreador | Requisições | Dados | Participação |
|---|---|---|---|
| Googlebot | 134 | 2658 kB | 48 % |
| YandexBot | 130 | 1306 kB | 46 % |
| Bingbot | 10 | 78 kB | 4 % |
| Applebot | 8 | 53 kB | 3 % |
O YandexBot, com 130 requisições, está ao alcance do Googlebot, e essa não é a proporção que a maioria dos sites vê. O Bingbot, com 10, é a surpresa na direção oposta.
Separadas em vez de contadas: requisições que traziam um agente de usuário de IA e foram direto a arquivos que ninguém liga.
| Agente de usuário declarado | Requisições | Caminhos procurados |
|---|---|---|
| Bingbot | 5 | /.env.prod |
| PerplexityBot | 5 | /terraform.tfvars |
| OAI-SearchBot (OpenAI) | 5 | /.git/HEAD |
| ChatGPT-User (OpenAI, a pedido de uma pessoa) | 5 | /keys.json |
Um agente de usuário não é uma identidade. É uma cadeia de caracteres que o cliente escolhe. Se estas vieram dos operadores nomeados ou de alguém que toma emprestado o nome deles não se pode determinar deste lado, e esta página não afirma saber. O que se pode dizer: não estavam lendo, todas receberam 404 e nada do que procuravam existe aqui.
Os caminhos mais requisitados no conjunto são os legíveis por máquina — /sitemap.xml, /llms.txt, /mcp — antes dos artigos. É esse todo o argumento para manter esses arquivos: não são enfeite, são o que se lê primeiro.
Estes números não podem ser verificados de fora. Vêm da analítica do nosso próprio provedor, obtida com um token que só o operador tem. Ninguém pode recalculá-los. O que se publica em vez disso é o método: a consulta está em
tools/crawler-bericht.py, em texto claro, e quem tiver uma zona Cloudflare pode rodar a mesma contra a sua.
Portanto isto é um autorrelato com método divulgado, não uma medição que alguém pudesse repetir. Em todo o resto deste site essa distinção é justamente a questão, e seria desonesto borrá-la aqui porque os números por acaso são lisonjeiros.
Mais dois limites. Um dia é um dia — um rastreador que passa semanalmente é invisível nele. E as requisições são contadas na borda, de modo que um sistema que lê uma cópia em cache por meio de um intermediário não aparece de jeito nenhum.
Об ИИ-краулерах утверждают много, а показывают крайне мало. Тот, кто держит сайт, может увидеть в собственных журналах, какие системы приходят на самом деле, что забирают и как часто, — и почти никто этого не публикует. Вот один день, вместе с запросом, который его получил.
ИИ-системы сделали больше запросов, чем поисковые машины — 299 против 282. Поисковые машины вытянули больше данных (4,0 MB против 2,1 MB), потому что Googlebot забирает изображения и таблицы стилей, которые языковой модели ни к чему.
Этот домен зарегистрирован 1 августа 2026 года. Ему два дня, он ни по чему не ранжируется и не имеет входящих ссылок, достойных подсчёта, — и семь разных ИИ-систем уже его прочитали.
| Система | Запросы | Данные | Доля |
|---|---|---|---|
| ClaudeBot (Anthropic) | 135 | 795 kB | 45 % |
| GPTBot (OpenAI) | 96 | 798 kB | 32 % |
| PerplexityBot | 22 | 213 kB | 7 % |
| CCBot (Common Crawl) | 16 | 69 kB | 5 % |
| ChatGPT-User (OpenAI, по поручению человека) | 15 | 152 kB | 5 % |
| OAI-SearchBot (OpenAI) | 9 | 43 kB | 3 % |
| Amazonbot | 6 | 45 kB | 2 % |
| Краулер | Запросы | Данные | Доля |
|---|---|---|---|
| Googlebot | 134 | 2658 kB | 48 % |
| YandexBot | 130 | 1306 kB | 46 % |
| Bingbot | 10 | 78 kB | 4 % |
| Applebot | 8 | 53 kB | 3 % |
YandexBot со 130 запросами находится в пределах досягаемости Googlebot, и это не то соотношение, которое видит большинство сайтов. Bingbot с 10 — неожиданность в другую сторону.
Выделено отдельно, а не засчитано: запросы с ИИ-агентом пользователя, шедшие прямо к файлам, на которые никто не ссылается.
| Заявленный агент пользователя | Запросы | Искомые пути |
|---|---|---|
| Bingbot | 5 | /.env.prod |
| PerplexityBot | 5 | /terraform.tfvars |
| OAI-SearchBot (OpenAI) | 5 | /.git/HEAD |
| ChatGPT-User (OpenAI, по поручению человека) | 5 | /keys.json |
Агент пользователя — не удостоверение личности. Это строка, которую выбирает клиент. Пришли ли эти запросы от названных операторов или от того, кто позаимствовал их имя, с этой стороны определить нельзя, и эта страница не утверждает, что знает. Сказать можно вот что: они не читали, все получили 404, и ничего из того, что они искали, здесь нет.
Самые запрашиваемые пути по всем вместе — машиночитаемые: /sitemap.xml, /llms.txt, /mcp — раньше статей. В этом и весь довод за то, чтобы эти файлы вести: они не украшение, они то, что читают первым.
Эти числа нельзя проверить снаружи. Они получены из аналитики нашего собственного провайдера, извлечены токеном, который есть только у оператора. Пересчитать их никто не может. Вместо этого публикуется метод: запрос лежит в
tools/crawler-bericht.py, открытым текстом, и всякий, у кого есть зона Cloudflare, может выполнить такой же для своей.
Итак, это самоотчёт с раскрытым методом, а не измерение, которое кто-то мог бы повторить. Везде на этом сайте именно это различие и составляет суть, и было бы нечестно размывать его здесь только потому, что числа случайно лестны.
Ещё два ограничения. День есть день — краулер, приходящий раз в неделю, в нём невидим. И запросы считаются на границе сети, поэтому система, читающая кэшированную копию через посредника, не появляется вовсе.
关于 AI 爬虫,说的多,拿出来看的极少。任何运营站点的人都能在自己的日志里看到哪些系统真的来过、取走了什么、来得多频繁——却几乎没有人把它公开。这里是其中一天,连同产生它的那条查询。
AI 系统发出的请求比搜索引擎更多——299 对 282。搜索引擎拉走的数据更多(4.0 MB 对 2.1 MB),因为 Googlebot 会取图片和样式表,而语言模型用不上这些。
这个域名注册于 2026 年 8 月 1 日。它只有两天大,没有任何排名,也没有值得计入的外部链接——而已经有七个不同的 AI 系统读过它。
| 系统 | 请求数 | 数据量 | 占比 |
|---|---|---|---|
| ClaudeBot (Anthropic) | 135 | 795 kB | 45 % |
| GPTBot (OpenAI) | 96 | 798 kB | 32 % |
| PerplexityBot | 22 | 213 kB | 7 % |
| CCBot (Common Crawl) | 16 | 69 kB | 5 % |
| ChatGPT-User (OpenAI,代表人类发起) | 15 | 152 kB | 5 % |
| OAI-SearchBot (OpenAI) | 9 | 43 kB | 3 % |
| Amazonbot | 6 | 45 kB | 2 % |
| 爬虫 | 请求数 | 数据量 | 占比 |
|---|---|---|---|
| Googlebot | 134 | 2658 kB | 48 % |
| YandexBot | 130 | 1306 kB | 46 % |
| Bingbot | 10 | 78 kB | 4 % |
| Applebot | 8 | 53 kB | 3 % |
YandexBot 以 130 次请求已在 Googlebot 的射程之内,这不是大多数站点看到的比例。Bingbot 的 10 次,则是反方向上的意外。
单列出来而不计入:带着 AI 用户代理、却径直奔向无人链接的文件的请求。
| 声称的用户代理 | 请求数 | 所求路径 |
|---|---|---|
| Bingbot | 5 | /.env.prod |
| PerplexityBot | 5 | /terraform.tfvars |
| OAI-SearchBot (OpenAI) | 5 | /.git/HEAD |
| ChatGPT-User (OpenAI,代表人类发起) | 5 | /keys.json |
用户代理不是身份。它只是客户端自己选定的一个字符串。这些请求究竟来自被点名的运营方,还是来自借用其名号的人,从这一侧无法判定,本页也不声称知道。可以说的是:它们不是在读,全部收到 404,它们所寻找的东西这里一样都没有。
在所有请求中被要得最多的路径是机器可读的那几个——/sitemap.xml、/llms.txt、/mcp——排在文章之前。维护这些文件的全部理由就在这里:它们不是装饰,它们是最先被读到的东西。
这些数字无法从外部核验。它们出自我们自己服务商的分析数据,用只有运营者持有的令牌取得。没有人能重算。作为替代,公开的是方法:这条查询就在
tools/crawler-bericht.py里,以明文写出;任何拥有 Cloudflare 区域的人,都可以对自己的区域运行同一条。
所以这是一份公开了方法的自述,而不是一次别人能够重复的测量。在本站其他任何地方,这个区分正是要点所在;仅仅因为数字碰巧好看就在这里把它抹糊,那是不诚实的。
还有两条界限。一天就只是一天——每周才来一次的爬虫在其中是看不见的。而且请求是在网络边缘计数的,因此经由中间层读取缓存副本的系统根本不会出现。