<стр>Джон Мюллер из Google рассказывает, что произошло, когда он тестировал файлы Markdown, предназначенные для облегчения использования контента роботами с искусственным интеллектом.
Кто-то на Reddit спросил, удалось ли кому-нибудь предоставить файлы уценки LLM. Джон Мюллер из Google поделился своим личным опытом тестирования файлов уценки для использования в LLM.
Файлы уценки для LLM
Файлы Markdown — это машиночитаемый и человекочитаемый контент, содержащий разметку, которая сигнализирует, является ли что-то заголовком и так далее. По сути, это просто контент, из которого удалена вся интерактивность, поэтому нет JavaScript или CSS.
<п>Идея состоит в том, что предоставление этих файлов LLM позволит им потреблять контент без необходимости иметь дело с посторонним HTML, JavaScript и всем остальным, что предназначено специально для человеческого взаимодействия.
Мотивацией предоставления файлов уценки в LLM является получение преимущества в ранжировании в поисковых системах ИИ.
Кто-нибудь успешно работал с файлами Markdown?
Человек на Reddit начал обсуждение с такого вопроса:
<блоковая цитата><п>“Я уже кэширую свои веб-страницы в формате HTML, поэтому преобразование их в уценку и повторное кэширование, а затем проверка заголовков на предмет того, запрашивает ли бот уценку, не составляет большого труда. Я прочитал все, что смог найти в Интернете, и, похоже, все пришли к выводу, что это не поможет получить больше упоминаний об ИИ, но и вреда не принесет.стр>
Мне интересно, стоит ли это делать, просто чтобы не дать ИИ-ботам забить мой сайт. Мне пришлось заблокировать несколько в Cloudflare, потому что они сходили с ума, но если они запрашивают файлы с уценкой меньшего размера, то, возможно, стоит разрешить их снова (я могу сократить размер файлов примерно до трети).
Полагаю, мой вопрос заключается в следующем: видел ли кто-нибудь, чтобы один из основных ИИ-ботов запрашивал скидку?”
Джон Мюллер из Google поделился своим опытом: единственные боты, которые поражают его файлы уценки, исходят из инструментов SEO.
Мюллер поделился:
“На моих тестовых сайтах единственными сканерами, которые утверждают, что принимают уценку, являются инструменты SEO. Мммв.п>
(Кроме того, раздражает то, что настройки сервера, которые я использую, не регистрируют заголовок принятия, поэтому вам приходится вручную настраивать запись в журнал, даже если вы просто хотите посмотреть, примет ли кто-нибудь его. Если вам интересно узнать о ваших сайтах, я рекомендую выяснить, как это регистрировать, и проверить метрики. сначала.)”
Файлы Markdown похожи на метатеги ключевых слов
<п>Проблема с файлами Markdown для LLM заключается в том, что все компании, занимающиеся генеративным поиском и LLM, полностью освоили сканирование и индексацию HTML-файлов. Кроме того, в их интересах загружать то, что видят пользователи, а не специальный контент, созданный специально для студентов-магистров.
Причина в том, что владельцам сайтов и SEO-специалистам нельзя доверять контент, предназначенный только для LLM. Именно по этой причине метатеги ключевых слов не работают. Все наполняли его вариантами ключевых слов, орфографическими ошибками и фразами, которых не было в их контенте.стр> <п>У LLM и агентов искусственного интеллекта нет смысла использовать файлы уценки, потому что они не заслуживают доверия, а поскольку загрузка и индексирование HTML-контента тривиальны, это проблема, которая решается уже более тридцати лет.
Уценка для ИИ-агентов
Cloudflare считает, что файлы уценки пользуются огромной популярностью среди LLM. Они предлагают услуги, которые могут предоставлять файлы уценки агентам ИИ, которые по сути запрашивают это.
Недавно они написали:
“Markdown быстро стал лингва-франка для агентов и систем искусственного интеллекта в целом. Явная структура формата делает его идеальным для обработки ИИ, что в конечном итоге приводит к лучшим результатам и минимизации потерь токенов.
<п>Сеть Cloudflare поддерживает преобразование контента в режиме реального времени в источнике для включенных зон с использованием согласования контента ↗ заголовки. Когда системы искусственного интеллекта запрашивают страницы с любого веб-сайта, который использует Cloudflare и включен Markdown для агентов, они могут указать предпочтение текста/уценки в запросе, и наша сеть автоматически и эффективно преобразует HTML в Markdown, если это возможно, на лету.”
Честно говоря, это не реальность. Если бы это было так, обсуждение Reddit было бы заполнено историями успеха файлов уценки.
Инструкции для ИИ-агентов
<п>OpenAI и Anthropic более реалистично относятся к файлам уценки, потому что это “lingua franca” для навыков, указаний и инструкций агента ИИ.
На странице поддержки OpenAI поясняется:
“Пользовательские инструкции с помощью AGENTS.md
Дайте Кодексу дополнительные инструкции и контекст для вашего проектастр>Codex читает файлы AGENTS.md перед выполнением какой-либо работы. Сочетая глобальное руководство с переопределениями для конкретного проекта, вы можете начинать каждую задачу с одинаковыми ожиданиями, независимо от того, какой репозиторий вы открываете.”
<ч2>Выносч2> <ул>
мл>
