- Сайты, не имеющие соглашения с OpenAI, обслуживались так же, как и его партнеры.
- Это открытие подтверждает поправку Сугантана Моханадасана, опубликованную в июле.
- Что индекс хранит о странице, так это ее заголовок и короткий фрагмент.
мкл>
Новые данные не обнаруживают различий в том, как собственный поисковый индекс OpenAI обслуживает лицензированные и нелицензированные сайты, и показывают, откуда берутся фрагменты ChatGPT.
Resoneo утверждает, что сотни изданий, не имеющих контракта на контент OpenAI, обслуживались собственным поисковым индексом OpenAI точно так же, как и его лицензированные партнеры. В данных бесплатного аккаунта этот индекс обрабатывал большинство результатов поиска ChatGPT.
Французская консалтинговая компания по SEO прочитала 1249 ответов ChatGPT, полученных в июле. Resoneo продает консультации по SEO и раздает расширение Chrome, которое собирает данные.
Это открытие подтверждает поправку, опубликованную Сугантаном Моханадасаном в июле, после того как он первоначально считал индекс закрытым для небольших сайтов.
Что измерил Resoneo
<п>Серверный поток ChatGPT помечал каждый веб-результат именем конвейера, который его получил, и одним из четырех значений было ‘labrador,’ Собственный индекс OpenAI. Сравнивая страницы из этого конвейера, Resoneo обнаружила, что лицензионное соглашение не изменило способ обслуживания страницы. Это был один и тот же формат, одинаковая длина и одинаковая свежесть как для партнеров, так и для непартнеров.
Resoneo описывает лабрадора как индекс, пополняемый новостями прессы и открытыми научными архивами. Они отмечают, что OpenAI может получить к нему доступ напрямую, без необходимости платить третьей стороне, что и отличает его от других.
<п>В данных бесплатного аккаунта Resoneo почти каждый раз в этом индексе появлялись вопросы с готовыми ответами, местные предприятия и продукты. Результаты новостей были довольно равномерно разделены между индексом и тем, что было получено из Google. Для платных аккаунтов в режиме размышления парсинг Google предоставил около 75% из 16 407 результатов поиска, зафиксированных Resoneo, в то время как собственный индекс составил около 24%.
<стр>Результаты поиска в образце платного режима мышления Resoneoстр>
16,407 результатов поиска. Значения округлены.
020406080%
Очистил Google · около 75%сильный>
Внутренний индекс OpenAI · около 24%сильный>
<п>Источник: Резонео. Классификация конвейеров основана на обратном проектировании сетевого трафика ChatGPT.

Как изменилось предыдущее чтение
Моханадасан назвал этот индекс в качестве белого списка известных издателей в июне после изучения сетевого трафика ChatGPT. Он упомянул, что оно «похоже на лицензированное животное». включая такие домены, как Reuters, The Guardian, WSJ и Wikipedia.
14 июля он взял свои слова обратно. Читатель из Италии, воспользовавшись бесплатной учетной записью, прислал ему снимки, показывающие, что каждое цитирование издателя проходит через один и тот же конвейер, включая небольшие итальянские сайты. Моханадасан повторно провел свои тесты, признав в сводной таблице, что он «перегнул палку». с заявлением о уровне и упомянул, что лицензионные соглашения являются подлинными, но оценка уровня была основана на рассмотрении точки зрения только одной учетной записи как репрезентативной для всей ситуации.
<п>Они провели различные тесты, каждый из которых имел разный размер. Набор данных Resoneo включает как бесплатные, так и платные учетные записи, несколько стран и сеансы с выходом из системы, при этом одни и те же запросы воспроизводятся для разных типов учетных записей. Подсчеты Моханадасана взяты из одного аккаунта, и он называет их направленными, хотя его поправка также опирается на данные двух других читателей. счета. Resoneo считает работу Моханадасана основой своих усилий.
<п>Примерно 21 июля, по данным Resoneo, OpenAI перестала помечать каждый результат поиска именем системы, которая его получила, т.е. тегом, который считывали оба расследования.
Что модель видит на вашей странице
Resoneo просмотрел 534 страницы, процитированные ChatGPT, и сравнил каждую из них с фрагментами, хранящимися в индексе OpenAI. Из 463 страниц с заголовком H1 он был включен в 387 фрагментов, или 83,6%. Фрагмент обрезается сразу после 200 символов, обычно в начале содержимого страницы, а не в метаописании, которое конвейер Google-скрапинга все еще захватывает примерно один раз из трех.
<п>Средняя длина H1 составляла 51 символ, что означает примерно 150 символов содержимого страницы. Кикер раздела появляется перед H1 на 29% страниц и занимает 18 символов. Дата публикации отображается на 11% страниц, используя 25 символов, а альтернативный текст первого изображения появляется на 9% страниц и может содержать 50 символов.
В образце каждая седьмая страница не имела разметки H1. Resoneo отмечает, что в таких случаях фрагмент начинается с любого подзаголовка, предусмотренного шаблоном.
Почему это важно
Сайты без соглашения с контентом OpenAI по-прежнему появляются в индексе, который управляет большинством результатов ChatGPT для бесплатных аккаунтов. Результаты Resoneo подтверждают это, как и собственные обновления Моханадасана. После повторного тестирования он рекомендовал проверить несколько учетных записей, чтобы получить более четкую картину, поскольку одна учетная запись показывает только то, как ChatGPT взаимодействовал с этой одной учетной записью.
В индексе хранится заголовок и около 200 символов со страницы. Все, что шаблон печатает над первым абзацем, частично использует это. Resoneo не проверял, повышает ли его изменение вероятность цитирования страницы.
<ч2>Взгляд в будущееч2>
Издатели подписывают контракты на контент с OpenAI по нескольким причинам. Появление в ChatGPT ответов бесплатным пользователям выглядит слабым решением, поскольку сайты без сделок уже были в индексе, который обрабатывает большинство этих ответов.
Поможет ли сделка более частому цитированию страницы – это другой вопрос, и ни одно расследование не изучало этот вопрос. Resoneo сосредоточился на том, как страницы хранятся и обслуживаются. На момент публикации страница сканера OpenAI не содержит подробного описания внутреннего индекса и не указывает, что включают в себя соглашения с издателями. Resoneo отмечает, что партнерские статьи попадают в OpenAI через ленту, а не через сканирование, поэтому сделка может изменить способ попадания туда контента.
