Авторегрессионный рейтинг Google DeepMind — это система искусственного интеллекта, которая может ранжировать документы без ограничений существующих систем.
Google недавно опубликовал исследовательскую работу об обучении LLM замене существующих серверных архитектур ранжирования для поиска. Исследователи предлагают использовать авторегрессионное ранжирование в качестве замены нынешних двухэтапных систем ранжирования.
Двойные энкодеры и перекрестные энкодеры
В очень общем и простом английском смысле традиционные системы поискового ранжирования обычно имеют двухэтапную архитектуру с двойным кодировщиком и перекрестным кодировщиком.
<ул> <ли>Двойной кодировщик (DE) преобразует запросы и документы в векторы и использует их для быстрого поиска вероятных документов. Двойные кодеры относительно недороги и быстры в вычислительном отношении. Эти документы-кандидаты впоследствии передаются в перекрестный кодировщик (CE).
мл>
Двойные кодировщики эффективны и быстры, но их точность ранжирования документов ограничена. Вот почему системы ранжирования используют более мощные перекрестные кодировщики. Но перекрестные кодировщики слишком затратны в вычислительном отношении для крупномасштабного поиска, поэтому их используют на втором этапе для ранжирования документов-кандидатов.
Исследователи предлагают заменить двухэтапную серверную часть поиска новой системой, называемой авторегрессионным ранжированием (ARR). Исследовательская работа называется Авторегрессионное ранжирование: преодоление разрыва между двойными и перекрестными кодировщиками. Это исследователи из Google DeepMind, Массачусетского университета в Амхерсте и Техасского университета в Остине.
Это довольно радикальное изменение – заменить стандартную двухэтапную систему ранжирования единой LLM, которая создает ранжированный список документов. Если что-то подобное будет использовано, последствия для SEO/AEO будут огромными.
Тренировка модели ранжирования: SToICaL
<п>Первым шагом создания модели ранжирования является ее обучение. Исследователи разработали метод под названием SToICaL (Simple Token-Item Calibrated Loss), чтобы научить LLM ранжировать документы.
В ходе тренинга LLM учит, какие документы должны иметь более высокий и более низкий рейтинг двумя способами:
<ул>
мл> <п>В результате получается LLM, который узнает, какие документы релевантны, и способен подавлять ранжирование нерелевантных.
Исследователи объясняют:
“Затем мы предлагаем SToICaL (Simple Token-Item Calibrated Loss), обобщенную потерю обучения с учетом ранга для точной настройки LLM. Используя повторное взвешивание на уровне элементов и маргинализацию дерева префиксов, мы распределяем массу вероятности по действительным токенам docID на основе их истинной релевантности.”
<ч2>Результаты испытанийч2>
Исследователи протестировали свою новую систему, чтобы оценить, действительно ли она повышает эффективность ранжирования по сравнению с обычным прогнозированием следующего токена, используя два набора данных: WordNet и ESCI Shopping Queries. Они также сравнили его со стандартными двойными и перекрестными энкодерами в отдельном тесте с использованием WordNet.
Результаты тестирования показали, что авторегрессионное ранжирование (ARR) работает хорошо, но не по всем показателям.
<п>Они поделились:п> <ул>
<ли>В сравнении с WordNet ARR работал аналогично Cross Encoder (более затратному в вычислительном отношении) и значительно лучше, чем Dual Encoder.
мл>
Одна из областей, требующих дальнейшего исследования, заключается в том, что в тесте поиска покупок одна версия метода стала хуже ранжировать в первую очередь наиболее релевантный результат, хотя она и улучшила общий рейтинг результатов.
<ч2>Выводыч2>
Исследователи приходят к выводу, что двойные кодировщики (DE) становятся ограниченными по мере роста количества ранжируемых документов, поскольку для представления всех возможных ранжирований размер вектора должен соответственно увеличиваться. Они показывают, что ARR не имеет такого ограничения и теоретически может ранжировать произвольное количество документов.
Они объясняют:
“Мы предоставляем теоретическое обоснование превосходной выразительной способности ARR по сравнению с DE. Строгий анализ геометрии встраивания, необходимой для ранжирования, показывает, что для DE, чтобы достичь любого порядка 𝑘 документах, его размерность внедрения должна расти линейно с 𝑘.
Напротив, мы доказываем, что модели ARR с постоянным скрытым измерением теоретически достаточно для ранжирования произвольного количества документов. Это дает формальное объяснение преимуществ ARR.”
<п>Однако это теоретический результат, означающий, что он не обязательно устанавливает, что ARR будет работать таким образом в реальных поисковых системах. Тем не менее, исследователи также говорят, что их эксперименты показали, что этот подход улучшил показатели ранжирования и стал лучше удерживать нерелевантные документы ниже релевантных.
Они пишут (PDF):
“В этой статье мы создали теоретическую основу для авторегрессионного ранжирования, доказав, что, хотя DE требуют, чтобы размеры внедрения росли с размером корпуса, модели ARR, генерирующие многотокенные docID, могут решать полные задачи ранжирования с постоянным скрытым измерением, при условии мягкого условия в отношении ранга матрицы внедрения для токенов docID.
Мы предложили обобщенную потерю обучения с учетом ранга для (точечного) авторегрессионного ранжирования, которое основано на повторном взвешивании на уровне элементов и маргинализации дерева префиксов для распределения вероятностной массы по действительным токенам docID на основе их истинной релевантности. Эксперименты в WordNet и ESCI показывают, что этот подход успешно подавляет создание недействительных идентификаторов документов и улучшает ключевые показатели ранжирования.”
<ч2>Выносч2> <ул>
мл>
