<стр>Финансовый директор Cloudflare говорит, что число машин будет превосходить число людей в соотношении 1000 к 1. Моим самым большим ИИ-сканером был сканер учетных данных с названием некоммерческой организации.стр>
Самый крупный ИИ-сканер на моем сайте за последний день не был ИИ-сканером. Под именем Common Crawl оно появлялось примерно 1500 раз; он ничего не отправлял обратно, и ему были нужны мои SSH-ключи.
<п>Я пошел искать из-за номера.п>
Финансовый директор Cloudflare сообщил аналитикам, что машинный трафик может в 1000 раз превысить человеческий трафик
<п>Финансовый директор Cloudflare Томас Зайферт сообщил аналитикам во время отчета о прибылях и убытках компании за второй квартал, что «если нынешние тенденции сохранятся, мы думаем, что через пять лет объем трафика, не связанного с людьми, будет в 1000 раз превышать объем трафика людей». Затем строка, которая будет охватывать заголовки: «Люди станут ошибкой округления в Интернете не потому, что человеческий трафик снижается, а именно потому, как быстро мы наблюдаем рост нечеловеческого трафика».
<п>Прежде чем кто-нибудь потянется за вилами, стоит сказать две вещи. Во-первых, Зайферт без подсказки добавил свое собственное предостережение: «с большой оговоркой, что я называл это неправильным на каждом этапе пути». Cloudflare ранее ожидал, что машинный трафик превысит человеческий трафик в 2027 году, и это произошло в мае 2026 года. Его ошибки привели к оценке меньше, что является самым сильным аргументом в пользу серьезного отношения к прогнозу.
Во-вторых, основные измерения реальны. В собственном сообщении Cloudflare, опубликованном на той же неделе, говорится, что менее половины всех запросов HTML-страниц теперь исходят от человека. У меня с этим нет никаких аргументов. Посетители машины реальны, и они составляют всю тему этого сайта.
Спор идет о том, какое значение имеет число.
Как выглядит один день трафика краулеров на моем сайте
<п>Я получил представление ИИ-сканера Cloudflare для nohacks.co за 24 часа, закончившиеся вечером 7 августа. Около 3000 запросов, из которых примерно треть оказались неудачными, что более чем на 1000% больше, чем за предыдущий период.
Сканер: CCBot 1,510. Пользователь ChatGPT 375. ClaudeBot 296. Googlebot 245. PetalBot 107. Тринадцать других пользователей делят 353 между собой.

Image 1 кредит
CCBot — это сканер Common Crawl, давнего некоммерческого веб-архива, чей корпус обучил значительную часть моделей, о которых сейчас все спорят. На бумаге это мой самый крупный посетитель, ничем не примечательный.
Затем я экспортировал пути.
Он запросил мои SSH-ключи, а не мои статьи
Вот наиболее запрашиваемые пути в трафике ИИ-сканера с указанием количества запросов в том же виде, в котором они были экспортированы:
<ул>
мл> <п>Так продолжается по сотне путей: /id_rsa, /id_ecdsa, /private-key, /ssl/localhost.key, /key.json, /serviceAccountKey.json, /.aws/config, /actuator/configprops, /api/v1/env, /Dockerfile, /values.yaml и /@fs/proc/self/environ, что является попыткой известного ошибка обхода пути на сервере разработки.
По этим сотням путей: 1028 запросов, передано 6,7 МБ и ноль рефералов. Количество запросов к чему-либо, что я фактически написал, обращается в ноль. Ближе всего к моему контенту был /blog/wp-login.php, проверка входа в WordPress, нацеленная на веб-сайт, на котором никогда не использовался WordPress, и два запроса на /blog/null.
<п>Эта последняя деталь имеет большее значение, чем кажется. Что бы это ни было, оно не читает мои страницы, прежде чем что-то спросить. Он работает по списку, везде один и тот же список, а мой сайт представляет собой циклическую строку.
Это сканер учетных данных. Common Crawl переходит по ссылкам и загружает страницы, и у него нет причин запрашивать у веб-сайта подкаста ключ учетной записи службы Firebase.
<п>Мне не удалось проверить исходные адреса, чтобы доказать выдачу себя за другое лицо, поскольку данные IP для каждого запроса — это не то, что я могу получить в рамках своего плана. Common Crawl публикует тест: подлинный трафик CCBot поступает из документированных блоков адресов и обратно разрешается в имена хостов, заканчивающиеся на Crawl.commoncrawl.org. Кто-нибудь, у кого есть эти журналы, сможет решить это за минуту. Что я могу сказать, так это то, что пришло, что оно запросило и как оно было помечено: AI-панель Cloudflare приписывает это Common Crawl как оператору и учитывает каждый запрос в итоговых результатах моего ИИ-сканера.
<п>Это приводит к той части, которая меня больше всего тревожит. Я поискал эти запросы в своих событиях безопасности и вообще ничего не нашел, поскольку в журнал безопасности записываются только запросы, которые нарушают правило. Я не блокирую этот трафик, поэтому он проходит, обслуживается и не оставляет следов. Он появляется ровно в одном месте на всей моей информационной панели: в представлении сканера AI, расположенном в списке рядом с ChatGPT-User и Googlebot, под названием некоммерческого исследовательского архива. Сканер учетных данных полностью читаем как трафик агента и совершенно невидим как событие безопасности.
2 из этих путей новые, и именно о них я продолжаю думать
В этом списке скрыты /.mcp.json, запрошенный 30 раз, и /.continue/config.json, запрошенный 24.
<п>Эти два представляют собой конфигурацию инструментов агента: определение сервера MCP и файл настроек помощника по кодированию. Оба обычно содержат ключи API и токены доступа, потому что именно это вы вкладываете в них, чтобы позволить агенту получить доступ к вашим услугам.
Кто-то добавил учетные данные агента в стандартный список слов для секретного сканирования. Та же самая автоматическая проверка, которая почти всегда запрашивала у каждого веб-сайта в Интернете файл /.env, теперь также запрашивает файл, в котором перечислены, какие инструменты могут вызывать ваши агенты и с помощью чего они аутентифицируются. Никто об этом не объявил, и это почти произошло. Если вы запустите что-нибудь агентное, список слов появится до того, как большинство людей закончат писать свой первый сервер MCP.
Cloudflare опубликовала само исправление на той же неделе
<стр>Самый сильный противовес формулировке звонка о прибылях – это собственная инженерная статья Cloudflare, написанная на той же неделе.стр>
В их сообщении в агентском Интернете говорится, что большой объем трафика от ботов с хорошим поведением повторно загружает страницы, которые не изменились, и что это приводит к миллиардам запросов. По их словам, «огромное количество машинных усилий, не придающих вообще никакого результата».
Усилия машины и потребность в ней — разные величины. Мои собственные журналы представляют собой более четкую версию той же мысли, чем я ожидал найти: самый крупный источник трафика моей машины был не просто бесполезен, он был враждебным и все еще имел значение.
Мета-сканирование вашего веб-сайта и никогда ничего не отправляет обратно — это определение бесполезного трафика, если вы являетесь владельцем веб-сайта. Я писал об этом расколе 1 августа. Сканер с именем исследовательского сканера, который ищет ваши облачные учетные данные, находится в категории ниже, и оба они отображаются в одной полосе на одной диаграмме.
Поэтому, когда график поднимается вверх, перед владельцем сайта возникает вопрос: каков на самом деле трафик.
<х2>Помогите создать проблему, продать проблему, продать решениеч2>
То, что Cloudflare здесь позиционирует, понятно, и об этом следует упомянуть. Помогите создать проблему, продать проблему, продать решения. Только в первую неделю августа: прогноз трафика ботов на звонке о доходах, сообщение в блоге, подсчитывающее, какая часть сети больше не является человеческой, сканер готовности агентов, сообщающий вам, что вы не готовы, продукт AI-визуализации для оценки вас, мост, позволяющий предоставить агентам инструменты вашего веб-сайта, и настройка по умолчанию, которая начинает блокировать некоторых из этих агентов в сентябре, если вы не решите иначе.
<п>Каждый из этих продуктов является разумным ответом на что-то реальное. Именно поэтому эту закономерность стоит заметить, а не игнорировать. Компания, измеряющая проблему, формулирующая ее и продающая исправления, — это одна компания, и теперь она владеет и счетчиком, и клапаном.
Я хочу быть осторожным, потому что я поддержал многое из того, что сделал Cloudflare. Плата за сканирование была правильной идеей. День независимости контента был правильной идеей. Предоставление владельцам веб-сайтов реального выбора в отношении того, какие машины будут задействованы, важнее, чем суд, решающий это за них, и именно это я утверждал, когда Девятый округ рассматривал этот вопрос 4 августа.
Все это может быть правдой одновременно. Cloudflare может одновременно делать и хорошие вещи, и некоторые хорошие вещи, и некоторые вещи, которые выглядят схематично. Большинство компаний могут. Ошибка состоит в том, чтобы решить, хорошие они или плохие парни, а затем прочитать все, что они делают.стр>
Иди и посмотри свои логи
Отнеситесь серьезно к цифрам трафика и отнеситесь к кадрам с той солью, которую они заслуживают. Машины — это большинство запросов. Это измерено, и это правда.
Затем откройте свою собственную аналитику сканера и прочитайте пути, а не итоговые значения. Мой рассказал мне три вещи, которых я не знал этим утром: что мой самый крупный ИИ-сканер был сканером, что он сжигал мегабайты моей пропускной способности ни на что, и что список слов, с которым он работает, теперь включает файлы конфигурации, в которых, по его мнению, живут мои инструменты агента.
Ни одна из этих деталей не присутствует ни в чьих проекциях. Объем есть. Полторы тысячи из них прибыли на один небольшой веб-сайт за один день, каждый из них учитывался в соотношении тысяча к одному, описанному Зейфертом аналитикам, и ни один из них не хотел ничего, что я написал.стр>
Этот пост был первоначально опубликован на сайте No Hacks.
