Robots.txt зависит от соответствия ботов, а блоки WAF, CDN и уровня сервера обеспечивают его соблюдение. Разбивка того, какой слой навсегда останавливает роботов ИИ.
Решение заблокировать поисковые роботы с искусственным интеллектом — это бизнес-решение, которое в настоящее время обсуждают многие специалисты по поиску. Но как только вы примете решение, как лучше всего заблокировать этих ботов?
Существует два основных подхода к блокировке сканеров: через robots.txt и в стеке сервера.
Каждый AI-бот имеет свое собственное идентифицирующее имя, например OpenAI GPTBot и OAI-SearchBot. Чтобы заблокировать их, вам просто нужно добавить правило запрета, указав имя сканера. Например, чтобы запретить GPTBot сканировать какую-либо часть вашего веб-сайта, вы должны добавить:
Пользовательский агент: GPTBot
Запретить: /
<п>Если есть только определенные части вашего веб-сайта, которые вы хотите запретить сканировать ИИ-ботам, вы можете вызвать их таким же образом. Например, чтобы запретить GPTBot сканировать страницы вашего продукта, вы должны включить папку, в которой находятся эти страницы, например:
Пользовательский агент: GPTBot
Запретить: /products/
Блокировка на уровне сервера
Есть несколько способов заблокировать ботов на уровне сервера: через сам сервер, CDN или WAF.
<п>В этом случае сервер прочитает входящий запрос, например IP-адрес бота, заголовок и т. д., и применит определенные правила, которые вы настроили для этого агента (запретить, разрешить, перенаправить). Например, вы можете указать, что GPTBot будет получать сообщение “deny” команда. Это предотвратит доступ бота к контенту вашего сайта.
<п>Для сети доставки контента (CDN) концепция та же, но она происходит на более раннем этапе посещения бота. CDN перехватывает запрос контента от бота до того, как он попадет на сервер. Это существенно экономит пропускную способность сервера, поскольку бот фактически никогда с ним не взаимодействует. Некоторые CDN предлагают эту технологию изначально, и вам не нужно ничего делать для ее настройки. Например, Cloudflare предлагает предустановленную блокировку в зависимости от того, является ли бот поисковым сканером, агентом или используется для обучения, а также позволяет более тонкую настройку каждого бота.
<п>В брандмауэре веб-приложений (WAF) боты проверяются более тщательно, чем CDN. WAF действует как уровень безопасности, который может анализировать поведение запросов, а не только заголовки, используемые ботами. Это означает, что он способен обнаруживать ботов, которые подделывают другие пользовательские агенты. В большинстве технологических стеков это наиболее компетентный способ выявления более сложных сканеров с искусственным интеллектом, которые стремятся ускользнуть от радаров попыток блокировки. WAF, который использует ваша компания, может быть частью вашей CDN, например Cloudflare WAF, или автономного приложения, такого как AWS WAF.
Robots.txt: плюсы и минусы
Файл robots.txt, возможно, является наиболее доступным для специалистов по поиску способом управления ботами. Обычно оптимизаторы имеют доступ к изменению файла robots.txt для своих доменов или могут легко запросить быстрое обновление у команды разработчиков.
Однако у этого метода есть и другие преимущества.
Плюсы
<п>Механизм запрета robots.txt официально поддерживается крупнейшими и авторитетными компаниями в области искусственного интеллекта. Например, GPTBot и OAI-SearchBot от OpenAI, ClaudeBot от Anthropic, Claude-User и Claude-SearchBot, Google-Extended от Google и PerplexityBot от Perplexity.
Этот метод позволяет выборочно выбирать, какие страницы запрещать посещение ботам, а также точно настраивать блокировку для каждого сканера.
Минусы
<п>Однако у этого метода есть некоторые минусы. Наибольший риск заключается в том, что соблюдение файла robots.txt является полностью добровольным и не контролируется централизованно. То есть, хотя создатели ИИ-ботов могут заявлять, что их боты уважают файл robots.txt, это всего лишь набор запросов, а не реальный блок. Думайте об этом как о знаке «Посторонним вход воспрещен» перед открытыми воротами. На самом деле ботов ничто не останавливает, только их кодирование соответствует правилам robots.txt.
.
Файл robots.txt можно очень легко настроить для запрета доступа ботов к определенным страницам, если в CMS веб-сайта есть элементы управления robots.txt. Это означает, что заинтересованные стороны, не обладающие техническими знаниями, могут случайно заблокировать больше ботов, чем ожидалось, из-за ошибочного правила запрета. Это может иметь катастрофические последствия, если файл robots.txt будет обновлен, чтобы запретить всех ботов, например, путем реализации:
Пользовательский агент: *
Запретить: /
Файл robots.txt не обновляется автоматически при выпуске новых пользовательских агентов. Это означает, что кому-то придется вручную добавлять новые запреты каждый раз, когда вы захотите запретить новому боту с искусственным интеллектом доступ к вашему сайту.
Стек серверов: плюсы и минусы
Блокировка ботов на уровне сервера, CDN или WAF имеет разные плюсы в зависимости от реализации.
Плюсы
Реализации CDN и WAF будут останавливать запросы ботов до того, как они попадут на сервер. Это сэкономит пропускную способность сервера, снизит нагрузку на сервер и сэкономит связанные с этим расходы.
Самый большой плюс реализации серверного стека, независимо от того, какой вы выберете, заключается в том, что они представляют собой определенный блок. Если файл robots.txt представляет собой вежливое сообщение «посторонним вход воспрещен». знак, блоки сервера, CDN и WAF представляют собой висячий замок на воротах. Эти методы реализации не требуют соблюдения сканером требований; они обнаруживают ботов и блокируют им доступ к контенту, независимо от того, соответствует ли бот требованиям или нет.
<п>Еще одним преимуществом этого метода является то, что программное обеспечение, расположенное на этих уровнях, часто предоставляет отчеты о заблокированных ботах. “Навесной замок” записывает попытки разблокировки. Это может быть полезно при анализе того, какие боты пытаются получить доступ к вашему сайту. Для сайтов, которые получают много нежелательного внимания ботов с искусственным интеллектом, это можно использовать в обсуждениях, иногда законных, с владельцами этих ботов.
Минусы
Недостатками методов реализации серверного стека являются, прежде всего, накладные расходы на обслуживание. Большинство серверов веб-сайтов достаточно заблокированы, поэтому доступ к файлам сервера, WAF или CDN будет разрешен только тем, кто действительно знает, что с ними делает. Это означает, что изменения в блоках, скорее всего, должны будут пройти через разработчика, а не реализовываться непосредственно оптимизатором. Потребность в посреднике требует времени, ресурсов и затрат, особенно если сервером управляет третья сторона, например агентство по развитию.
<п>Для каждого уровня безопасности возможен спуфинг ботов. Хотя WAF является самой сильной линией защиты, все же возможно, что высокоразвитые боты смогут обойти его проверки. Это означает, что не существует полностью надежного метода блокировки мошеннических ботов ИИ через стек серверов. Однако для большинства они по-прежнему очень эффективны.
Так что же нам использовать?
На этот вопрос нет однозначного ответа. Это зависит от настройки вашего веб-сайта, затрат и структуры управления.
В идеальном мире вы должны блокировать ботов на каждом уровне стека серверов. Сервер — хороший способ заблокировать известные пользовательские агенты и обнаружить простые закономерности в поведении ботов. Блоки CDN в значительной степени эффективны и не позволяют ботам использовать пропускную способность сервера. WAF является наиболее эффективным средством обнаружения поддельных ботов и предотвращения доступа к сайту продвинутых парсеров с искусственным интеллектом. Однако у вас может быть непросто настроить WAF, если он вообще есть на вашем сайте.
The robots.txt — это самый простой способ заявить о желании определенных ботов не получать доступ к вашему сайту, и он эффективен для ответственных ботов. Однако его можно просто игнорировать, и поэтому он является сдерживающим фактором, а не методом предотвращения.
Подводя итог, если у вас есть острая необходимость заблокировать определенных ИИ-сканеров, я бы рекомендовал подняться как можно выше по стеку серверов; блокировка через WAF, если есть возможность, через CDN, если нет, и через сервер в крайнем случае.
Если вам нужно заблокировать только одного или двух наиболее авторитетных сканеров ИИ, вы, вероятно, можете просто положиться на файл robots.txt в качестве сдерживающего фактора. Тем не менее, я бы также посоветовал просмотреть журналы вашего сервера, чтобы увидеть, не проходит ли какой-либо из этих ботов мимо вашего запрета в файле robots.txt.
