Когда ИИ не имеет никакого отношения к вашей компании, он описывает кого-то другого

Когда ИИ не имеет никакого отношения к вашей компании, он описывает кого-то другого

Подмена происходит с полной уверенностью, она происходит в месте, которым вы не владеете, и никакой аудит контента, который вы проводите, никогда ее не обнаружит.

<п>Когда модель ИИ ничего не имеет о вашей компании, она никому ничего не рассказывает. Он не отступает, не подстраховывается и не отмечает место, где его доказательства иссякли. Он ищет ближайшую хорошо задокументированную вещь, которой обычно является конкурент, средний показатель по категории или ваша версия трехлетней давности, и обеспечивает эту замену в том же регистре, который использует уверенно, хотя на самом деле знает.

Это уже обсуждалось. Что не обсуждалось, так это часть, которая должна беспокоить любого, кто занимается этой работой: вы не можете найти это, проверив свой собственный контент. Каждый когда-либо созданный аудит контента проверяет то, что существует: страницы, структуру, охват, точность, свежесть. Этот провал живет в том, чего не существует, в месте, которым вы не владеете, и он становится видимым только в тот момент, когда кто-то задает вопрос, который вы никогда не увидите.

<п>Таким образом, аудит возвращается чистым. Страницы в порядке. Схема подтверждает. Покрытие выглядит разумным на фоне конкурентного набора. И модель по-прежнему рассказывает людям о вашей компании что-то такое, чего не поддерживает ни одна ваша страница и ни одна ваша страница не может помешать.

When AI Has Nothing On Your Company, It Describes Someone Else

Изображение предоставлено: Дуэйн Форрестер

Почему модель заполняет пробел, а не оставляет его

<п>Механизм хорошо документирован, и я достаточно часто опирался на Маллена и его коллег в этом информационном бюллетене, чтобы постоянные читатели могли просмотреть эту часть: модели боролись именно с менее популярными фактическими знаниями, и их увеличение в основном улучшает запоминание популярных фактов, мало что делая для хвоста. Масштаб не придет на помощь производителю среднего бизнеса или региональной сервисной фирме. Тонкая часть распределения остается тонкой.

<п>Что происходит в этой тонкой части — интересный вопрос. Лонгпре и его коллеги в своей работе EMNLP 2021 по конфликтам знаний измерили, насколько сильно модели полагаются на заученную информацию, а не на чтение того, что на самом деле перед ними, и сформулировали вопрос практикующего так, имеет ли модель тенденцию галлюцинировать, а не читать. Поведение не является воздержанием. Это уверенное производство, независимо от того, какие гири удерживаются.

<п>Отделите это от галлюцинации, как обычно используется этот термин, потому что индустрия сравняла эти два понятия, и сглаживание будет стоить вам диагноза. Родовая галлюцинация случайна. Он производит фальшивые ссылки на дела, сфабрикованную статистику, правдоподобно звучащую статью, которой не существует, и делает это достаточно непредсказуемо, что лучшие модели заметно уменьшают ее. То, что я описываю, не случайно. Оно носит систематический, направленный и предсказуемый характер, судя по форме доказательств. При наличии разреженного объекта и плотного соседа модель будет надежно смещаться к соседу, и каждый раз будет делать это в одном и том же направлении, поскольку градиент, указывающий в этом направлении, является свойством обучающего распределения, а не сбоем в выборке. Вот почему обычные заверения о том, что новые модели меньше галлюцинируют, здесь не применимы. Модели становятся все лучше и лучше не изобретают ничего. Они не становятся лучше в знании компаний, о которых никто не писал.

Работанный пример, опубликованный в июне

Сейчас распространяется статья поставщиков о галлюцинациях ИИ о деталях продукта, предназначенная для брендовых команд и предупреждающая их о том, что модели придумывают претензии к своим продуктам. Это грамотное письмо по реальной проблеме.

<п>Свою аргументацию он начинает с прямой цитаты, приписываемой Перси Лянгу, правильно названному директором Стэнфордского центра исследований фундаментальных моделей, о том, как модели общаются в коммерческом контексте. Я не могу найти эту квоту где-либо еще. Ни в газете, ни в разговоре, ни в интервью, ни на какой-либо другой странице в сети. В той же статье приводятся цитаты двух известных деятелей СМИ, найти которые мне тоже не удалось. Он приписывает диапазон частоты галлюцинаций Стэнфордскому индексу HAI AI, указывая на входную дверь отчета, а не на какую-либо страницу внутри него. Затем он делает то же самое еще примерно дюжину раз. Отчет Nielsen о потребительском доверии. Отчет о рисках Gartner. Отчет оперативной группы IAB. Оценочное исследование MIT Sloan. Каждое название звучит точно так же, как настоящий отчет. Каждая ссылка указывает на домашнюю страницу организации, а не на документ.

<стр>Прочитайте это еще раз, учитывая, о чем эта статья. Эта статья предупреждает бренды о том, что системы искусственного интеллекта выдумывают уверенные заявления о них, а также выдумывают уверенные заявления об исследователях и учреждениях, чтобы обосновать свою точку зрения. Механизм не остался в машине. Оно вышло с другой стороны, было опубликовано, проиндексировано и теперь находится в корпусе, на котором будет учиться следующее поколение моделей.

<п>Справедливое возражение состоит в том, что большая часть этих исследований проводится за платным доступом, и писатель без подписки Gartner или Forrester действительно не может провести глубокие ссылки на них. Это охватывает часть списка. Он не охватывает Стэнфордский индекс, который можно загрузить бесплатно. Он не охватывает Антологию ACL, которая является бесплатной, открытой и полностью индексируемой, и в которой, по-видимому, не существует документа по таксономии, в котором галлюцинации брендов были разделены на четыре названных типа. И это не покрывает квоту, потому что человек либо сказал что-то публично, либо нет, и никакая подписка этого не меняет. Существует также соглашение о цитировании закрытой работы: укажите отчет, автора и дату, чтобы читатель, имеющий доступ, мог его найти, а читатель без доступа мог подтвердить его подлинность. Вместо этого на этой странице находится заголовок, который идеально соответствует заявлению, и ничего под ним.

<п>На самом деле меня не интересуют производители, и я намеренно не называю их имена, потому что образец имеет значение, а компания – нет. Важно то, что это именно та ошибка, которая действует на уровень выше. Тому, кто собрал эту статью, нужна была авторитетная поддержка утверждений о частоте галлюцинаций на уровне бренда, а авторитетной поддержки этих конкретных утверждений не существует в том объеме, который требуется для аргументации. Таким образом, пробел был заполнен вещами, имеющими форму доказательств. Реальные названия учреждений, правдоподобные названия отчетов, правильно идентифицированный директор Стэнфорда, рабочие связи, ведущие к реальным организациям. Каждый поверхностный сигнал строгости, ничего существенного.

<стр>И представьте себе директора по маркетингу, который читает это, верит цифрам и повторяет их на доске. Замена перешла от модели к статье, к человеку, к решению, при этом никто в цепочке не сделал ничего явно неправильного.

<сильный>4 формы, 1 поведение

<п>Замена не отображается одинаково дважды, и это одна из причин, почему она остается невидимой. Он принимает четыре узнаваемые формы, и каждую из них обычно ошибочно принимают за что-то другое.

Первый – это тихая аналогия, где модель достигает ближайшего хорошо задокументированного соседа и описывает его как вас. Ваша модель ценообразования становится моделью ценообразования вашего крупнейшего конкурента. Ваш график реализации становится графиком реализации категории. Ничто в ответе не указывает на то, что произошла замена, поскольку со стороны модели никакой замены не произошло. Это дало наиболее вероятное описание такой компании, как ваша.

Второй устаревший вид, представленный в виде валюты. Модель содержит версию вашей компании, которая была точной на какой-то момент, и излагает ее в настоящем времени. Снятые с производства продукты, ушедшие руководители, старое заявление о позиционировании, рынок, с которого вы ушли. В параметрической памяти нет метки времени и к ней не прикреплено предупреждение об истечении срока действия.

Третий — это слабые доказательства, используемые с уверенностью, как и веские доказательства. Одна рецензия на торговлю и сорок независимых источников дают ответы, которые читаются одинаково. Модель не раскрывает, на каком объеме материала она основана, поэтому утверждение, основанное на одном сообщении в блоге, звучит как консенсус.

<п>Четвертое — категориальные знания, применимые к конкретной компании. Модель знает очень много о вашей отрасли и очень мало о вас, поэтому она отвечает на отраслевой вопрос и прикрепляет к нему ваше имя. Это труднее всего обнаружить, потому что ответ в отношении категории обычно верен, а это означает, что он выдерживает случайную проверку точности.

Почему каждый из них проходит аудит контента

Вот та часть, которая важна с оперативной точки зрения. Аудит контента проверяет ваши страницы на соответствие стандартам. Ни одна из этих четырех ошибок не имеет ничего общего с вашими страницами. Доказательства, которые могли бы предотвратить каждое из них, в основном были написаны другими людьми в течение многих лет, а не вами. Никакая проверка вашего собственного материала не выявит этого недостатка, потому что недостаток не в вашем материале.<п>Естественная реакция — публиковать больше. Напишите страницы, закройте пробелы, извлеките информацию, позвольте поиску исправить ошибки, которые были допущены весами. Этот инстинкт понятен, и он слабее, чем кажется. Скиаволино и его коллеги в работе EMNLP 2021 над вопросами, ориентированными на сущности, обнаружили, что плотные методы извлечения плохо справляются с разреженными методами в вопросах, богатых сущностями, и надежно обобщают только на общие сущности. Тот же градиент популярности, который уменьшает ваше присутствие в весах, снова появляется в том, что извлекается. Возврат — это второе применение предвзятости, а не ее исправление, что означает, что спасательный люк, который в настоящее время продают большинство тактических советов, проходит через ту же узкую дверь, что и все остальное.

Итак, аудит чистый, контент в порядке, большее количество контента – это в лучшем случае частичный ответ, а сбой все равно происходит, один раз для каждого запроса, конфиденциально, в объеме, который никто не считает.

Единственное место, где это становится видимым

Вы находите замену, наблюдая за выходами, а не проверяя входы. Вот и вся смена, и это неудобно, потому что диагностическая поверхность — это то, чем вы не владеете и не можете полностью опробовать.

<п>То, что вы ищете, является конкретным и не является точным в обычном смысле слова. Это любое утверждение модели о вашей компании, которое не подтверждается ни одним из ваших источников. Не ошибочные утверждения, хотя они учитываются. Претензии, происхождение которых невозможно проследить, в отношении чего-либо, опубликованного вами или о вас. Способность, которой у вас нет, подробно описанная. Временная шкала, которую вы никогда не цитировали. Сравнение конкурентов, проведенное на условиях, которые вы никогда не устанавливали. В каждом из этих случаев модели требовались доказательства о вас, но у нее их не было, и она все равно что-то производила.

<п>То, как вы берете пробу, имеет большее значение, чем ее объем. Попросить модель описать вашу компанию по имени — это наименее информативный тест, потому что ваше имя в подсказке само по себе является сигналом для поиска, который втягивает любой существующий тонкий материал прямо в контекст. Замены появляются в вопросах, где ваше имя отсутствует и должно быть указано моделью. Вопросы категории с уточнением. Вопросы сравнения, называющие только вашего конкурента. Вопросы о возможностях, а не о компании. Это условия, при которых модель решает, принадлежите ли вы вообще к ответу, и что сказать о вас, когда она решит. Это решение — то, у кого сосед берет деньги взаймы.

<стр>Проведите это по реальному набору вопросов, которые ваши покупатели действительно задают, неоднократно, потому что замены меняются. Затем рассматривайте результаты как карту того, где отсутствует стороннее описание, а не как список страниц, которые нужно исправить, потому что это то, что есть. Я скажу прямо, что я руковожу компанией, занимающейся измерениями, поэтому я заинтересован во всем этом и вижу вещи с уникальной точки зрения. Это не меняет основной идеи, которая заключается в том, что дисциплина, построенная исключительно на аудите того, чем вы владеете, структурно слепа к сбоям, которые происходят полностью за пределами того, чем вы владеете.

<стр>Неудобная версия: самый чистый аудит контента, который вы когда-либо проводили, ничего об этом не скажет, и никогда не говорил. <стр>Если вы заметили модель, говорящую о вашей компании что-то, что не связано ни с чем, что вы не смогли найти, я хотел бы услышать об этом. Оставьте комментарий, указав, что там написано и как вы это заметили, или свяжитесь напрямую. Здесь примеры более полезны, чем теория, и хорошей общедоступной коллекции их пока нет.

<стр>Я продолжаю рассказывать о том, как эти системы создают и сохраняют картину компании в The Machine Layer, доступно здесь.

Этот пост был первоначально опубликован на сайте Duane Forrester Decodes.

Back To Top