График целостности: недостающий уровень в аудите видимости ИИ

График целостности: недостающий уровень в аудите видимости ИИ

Большинство проверок схемы оценивают страницы изолированно. Реальный разрыв — это целостность отношений, и это то, что системы ИИ должны синтезировать, рекомендовать и действовать.

Недавнее объявление от Common Crawl представило аудит видимости ИИ, призванный помочь организациям определить, могут ли системы ИИ обнаруживать их контент и получать к нему доступ. Посылка проста и ее трудно оспорить. Прежде чем система ИИ сможет извлекать, обобщать, цитировать, рекомендовать или действовать на основе информации, она сначала должна уметь ее найти.

<п>В течение многих лет наглядность была основой поиска. Если Google не сможет просканировать страницу, он не сможет ее ранжировать. Если система ИИ не может получить доступ к информации, она не сможет включить эту информацию в ответы, рекомендации или решения. <с>Однако, прочитав объявление, я поймал себя на том, что думаю совершенно о другой проблеме.

Common Crawl — это не поисковая система и не платформа искусственного интеллекта. Это одно из крупнейших открытых хранилищ данных веб-сканирования, ставшее важным источником данных обучения и исследований для более широкой экосистемы искусственного интеллекта. Независимо от того, использует ли конкретная модель ИИ напрямую Common Crawl, проект стал полезным прокси для более широкого вопроса: Могут ли машины обнаруживать и получать доступ к информации, которую организации публикуют в Интернете?

<стр>Именно поэтому мое внимание привлек аудит видимости ИИ. <стр>Что происходит после обнаружения контента?

Этот вопрос оказался в центре внимания при рассмотрении реализаций схемы на нескольких банковских веб-сайтах. На первый взгляд, скорее всего, выглядел зрелым. Сайты содержали разметку организации, сущности BankOrCreditUnion, информацию о филиалах, схему продукта, схему обслуживания и многие компоненты, которые можно было бы ожидать увидеть в крупных финансовых учреждениях.

<п>Однако когда я перестал смотреть на отдельные страницы и начал смотреть на отношения между сущностями, возникла совсем другая картина. Я обнаружил, что у большинства банков есть фундаментальная схема, но очень немногие построили граф знаний.

Разница между описанием страницы и описанием бизнеса

Одной из повторяющихся тем в индустрии SEO является важность полноты схемы. Проверяем наличие необходимых свойств. Мы проверяем разметку с помощью инструментов Google. Ищем недостающие поля и возможности расширить охват.

<п>Проблема в том, что большинство этих упражнений оценивают страницы изолированно.  Страница-ветвь рассматривается как таковая. Страница продукта рассматривается как страница продукта. Страница службы рассматривается как таковая. Часто упускается из виду, связаны ли эти объекты значимой связью.

В примерах банковского дела, которые я рассмотрел, часто можно было обнаружить, что местоположение филиала, текущий счет, ипотечное предложение и корпоративная организация отмечены отдельно. Чего часто не хватало, так это соединительной ткани, которая объясняла, как эти сущности связаны друг с другом.

<ул> <ли>Какому юридическому лицу принадлежал бренд, ориентированный на потребителя?

  • Какие продукты и какие услуги предлагались?
  • Какие услуги в каких филиалах были доступны?
  • Какие предложения были доступны только на определенных рынках или юрисдикциях?
  • Какие продукты принадлежали к более широкому семейству финансовых решений?
  • Разметка описывала отдельные части, но редко описывала сам бизнес.

    Это различие может показаться тонким, но оно становится все более важным по мере того, как поисковые системы и системы искусственного интеллекта выходят за пределы понимания уровня страницы в сторону понимания на уровне сущности.

    Проблема с валидатором

    <п>Частично проблема может быть связана с тем, как мы оцениваем структурированные данные. Большинство инструментов проверки выполняют проверку одной страницы. Они определяют, содержит ли страница ожидаемые свойства для данного типа схемы и соответствуют ли эти свойства принятым стандартам.

    Этот подход работает достаточно хорошо, когда целью является получение расширенного результата или проверка отдельного объекта. Это становится менее эффективным, когда целью является построение связанного графа знаний.

    <п>Одним из наиболее разочаровывающих аспектов реализации сложной архитектуры схем является то, что сами механизмы, предназначенные для создания отношений сущностей, часто кажутся неполными, если просматривать их с помощью инструментов проверки на уровне страницы.

    Противоречие становится особенно очевидным, когда организации пытаются внедрить графовую архитектуру, как рекомендует Google. Страница филиала может ссылаться на свою родительскую организацию через отношение @id, которое указывает на определение основного объекта организации на домашней странице. Адрес организации, юридическая информация, социальные профили и другие основные атрибуты хранятся в графе, но не обязательно на тестируемой странице.

    Как ни странно, некоторые из тех же реализаций, которые Google рекомендует для выравнивания объектов, могут генерировать предупреждения в инструментах тестирования на уровне страницы, поскольку информация намеренно ссылается в другом месте, а не дублируется. По сути, организациям рекомендуется строить графики, при этом оценивая каждую страницу как остров.

    Это различие, возможно, не имело большого значения в эпоху расширенных фрагментов, когда основной целью было определение того, содержит ли одна страница достаточно информации, чтобы претендовать на функцию поиска. Это становится все более важным, поскольку поисковые системы, системы знаний и платформы искусственного интеллекта стремятся понять, как сущности связаны друг с другом во всей организации.

    Эволюция Google показывает истинное направление

    <п>Сегодня многие из наиболее значительных инвестиций Google сосредоточены на отношениях и контексте. График продуктов, фиды Merchant Center, данные о совместимости, взаимосвязи вариантов, сверка сущностей и атрибуты диалога — все указывает в одном направлении. В совокупности эти инициативы предполагают, что понимание отношений между сущностями становится все более важным, особенно когда эти отношения трудно выводить последовательно только на основе содержания.

    <п>Действия Google показывают, что вывод о взаимосвязях остается сложной задачей даже для одной из самых сложных в мире систем поиска информации. В противном случае было бы мало причин продолжать расширять механизмы, с помощью которых организации могут явно предоставлять контекстную информацию о продуктах, услугах, брендах и аудиториях.

    Общие меры сканирования. Отношения определяют понимание

    Это возвращает нас к Common Crawl.

    Аудит видимости ИИ решает важную задачу. Организации должны четко понимать, могут ли системы искусственного интеллекта получить доступ к их контенту. Контент, который невозможно обнаружить, не может влиять на результаты поиска, ответы, генерируемые искусственным интеллектом, или системы рекомендаций.

    Новая проблема ИИ — это то, что происходит после того, как машины получают доступ к контенту. Сканер может успешно обнаружить каждую страницу веб-сайта, но при этом изо всех сил пытается понять, как соединяются основные объекты. Исторически поисковые системы пытались сделать вывод об этих взаимосвязях на основе контента, ссылок, поведения пользователей и множества других сигналов. Во многих случаях им это удавалось на удивление хорошо. Однако недавние инвестиции Google показывают, что выводы имеют пределы.

    <п>Рассмотрим недавнее появление диалоговых атрибутов в Merchant Center. Вместо того, чтобы полагаться исключительно на системы искусственного интеллекта, чтобы определить, какие продукты решают аналогичные проблемы, какие продукты являются альтернативами или какие атрибуты имеют значение в конкретных ситуациях, Google все чаще просит продавцов предоставлять этот контекст напрямую.

    Google явно обладает ресурсами, данными и возможностями искусственного интеллекта, чтобы делать обоснованные предположения о взаимоотношениях продуктов. Тем не менее, компания продолжает запрашивать информацию непосредственно у организаций, которые производят, продают и поддерживают эту продукцию.

    Причина проста. Выводы могут быть действенными, но знания из первых рук зачастую более точны.

    Производитель знает, какие продукты совместимы. Розничный торговец знает, какие товары обычно покупаются вместе. Банк знает, какие услуги в каких филиалах доступны. Глобальная компания знает, какие варианты продукции применимы на конкретных рынках.

    Хотя системы искусственного интеллекта могут попытаться реконструировать эти отношения по содержанию, организации уже обладают ответами. Таким образом, вопрос не в том, может ли ИИ делать выводы об отношениях. Более важный вопрос заключается в том, смогут ли организации, владеющие этими отношениями, предоставить машинам надежный способ их понимания.

    <п>Это различие становится все более важным по мере того, как системы ИИ выходят за рамки извлечения информации и начинают синтезировать, рекомендовать и действовать на ее основе. Информация может уже существовать где-то на веб-сайте, но контекстуальные связи, придающие ей смысл, часто оставляют машинам для самостоятельного обнаружения.

    Готовы ли мы к агентской машине хайпа?

    <п>За последний год отрасль стала все больше внимания уделять таким концепциям, как MCP, WebMCP, навыки агентов, карты агентов, каталоги API, протоколы A2A и файлы llms.txt. Большая часть обсуждений предполагает, что сеть быстро развивается в сторону экосистемы, ориентированной на агентов.

    <стр>Недавнее исследование агентской готовности, проведенное Бастианом Гриммом, предлагает полезную проверку реальности. Проведя сравнительный анализ широко известных веб-сайтов в США, Великобритании и Германии, он обнаружил, что внедрение этих агентно-ориентированных стандартов остается крайне ограниченным. Подавляющее большинство сайтов не представило ни одного из механизмов обнаружения агентов, продвигаемых в настоящее время в отрасли.

    Это открытие не означает, что сеть, готовая к работе с агентами, не важна, но предполагает, что мы, возможно, забегаем вперед. Что еще более важно, даже если завтра каждый крупный веб-сайт развернет llms.txt, манифесты WebMCP и каталоги API, та же самая основная проблема останется.

    <стр>Какую информацию раскрывают эти системы?

    Машиночитаемый дверной проем ценен только в том случае, если он ведет к точной, связанной и контекстуально полной информации. Если основные взаимоотношения между продуктами, брендами, местоположениями, услугами и рынками плохо смоделированы, агентский доступ просто облегчает получение неполной информации.

    Уровень доступа – не самая сложная часть. Уровень отношений:

    .

    За пределами графов сущностей: знакомство с графом целостности

    <п>Большинство дискуссий о структурированных данных сосредоточено на построении Entity Graph, чтобы помочь машинам понять компанию, продукт, местоположение и то, как они связаны друг с другом. Эти возможности важны. Однако перед системами искусственного интеллекта стоит более сложная задача. Они должны определить, какие факты применимы в каком контексте. Я считаю, что именно здесь организациям следует задуматься о том, что я называю графиком целостности.

    График целостности выходит за рамки идентификации объекта и сохраняет контекстную истину.

    <п>Это помогает установить, какое юридическое лицо владеет брендом, какие продукты относятся к семейству продуктов, какие услуги доступны на конкретных рынках, какие филиалы предлагают определенные услуги, какие правила применяются в конкретных юрисдикциях и какая информация применима глобально, а не локально.

    Просто идентифицировать сущности уже недостаточно. Организации должны сохранять целостность своих отношений.

    <ч2>Какие организации следует проводить аудит дальше <п>Растущее число проверок готовности ИИ подчеркивает, насколько быстро развивается разговор. Аудит видимости AI Common Crawl фокусируется на обнаруживаемости и доступности. Тест Бастиана Гримма для технологий, готовых к работе с агентами, оценивает, предоставляют ли веб-сайты машиночитаемые интерфейсы, которые агенты могут обнаруживать и с которыми могут взаимодействовать. Диксон Джонс и команда Waikay подходят к проблеме с еще одной точки зрения: аудита видимости бренда AI, оценивая, могут ли системы искусственного интеллекта распознавать бренды, понимать сущности и точно связывать организацию с темами, продуктами и концепциями, которыми она стремится владеть.

    В совокупности эти новые системы аудита показывают, что отрасль оценивает несколько различных уровней машинного понимания.

    Common Crawl фокусируется на видимости и доступности, задавая вопрос, могут ли машины обнаружить контент и получить к нему доступ.

    Схемы готовности агентов проверяют, могут ли агенты обнаруживать возможности и взаимодействовать с системами.

    Оценки видимости объектов оценивают, могут ли системы ИИ правильно идентифицировать бренды, организации и связанные с ними концепции.

    <п>Целостность отношений фокусируется совершенно на другом вопросе: понимают ли машины, как работает сама организация.

    Каждый слой основывается на предыдущем. Контент должен быть доступен для обнаружения, прежде чем к нему можно будет получить доступ. Он должен быть доступен, прежде чем его можно будет связать с сущностью. Он должен быть связан с объектом, прежде чем машины смогут точно понять отношения, которые придают информации смысл.

    Почему это важно для глобальных организаций

    <с>Важность целостности отношений становится еще более очевидной, если смотреть через призму международного сообщества.

    Транснациональная компания может иметь контент, доступный на двадцати рынках. Common Crawl может успешно обнаружить все это. Системы искусственного интеллекта могут его получить. Поисковые системы могут его индексировать. Проблема видимости решена.

    <п>В течение многих лет международное SEO было сосредоточено на том, чтобы помочь поисковым системам показать правильную страницу правильному пользователю. Системы искусственного интеллекта ставят перед собой другую задачу. Теперь мы должны помочь машинам понять правильные факты для правильной аудитории, рынка и контекста.

    Мы должны обеспечить ясность в отношении того, какая информация о продукте применяется в Германии, какие правила применяются в Японии и какие услуги доступны в Канаде. Часто не менее сложная задача состоит в том, какие местные торговые марки соответствуют одному и тому же глобальному продукту, и какие факты верны для всего мира, а какие специфичны для рынка? Это не проблемы сканирования и поиска, а проблемы целостности данных.

    <п>Во многих отношениях следующее поколение международного SEO может напоминать hreflang на уровне знаний, а не на уровне URL. Задача больше не состоит в том, чтобы просто направить пользователей на нужную страницу. Задача состоит в том, чтобы машины поняли правильную версию истины.

    Следующее конкурентное преимущество

    <стр>Банковский анализ, ставший источником вдохновения для написания этой статьи, хорошо иллюстрирует проблему. Большинство учреждений не испытывало недостатка в схемах. Их веб-сайты содержали тысячи строк структурированных данных и множество типов схем. Чего им не хватало, так это последовательного представления того, как работает сам бизнес. Этот акцент имеет смысл, поскольку возможность обнаружения остается предпосылкой для участия. Однако одной лишь открытости будет недостаточно.

    Организации, которые преуспеют на следующем этапе поиска, возможно, не те, у которых больше всего разметки схемы, больше всего страниц или больше всего готовых к искусственному интеллекту конечных точек. Это могут быть организации, которые предоставляют наиболее четкое, наиболее полное и наиболее достоверное представление о том, как их предприятия, продукты, услуги, местоположения, бренды и рынки связаны друг с другом. Следующая задача — определить, понимают ли машины, как на самом деле работает бизнес.

    Этот сдвиг может в конечном итоге оказаться более важным, чем любое отдельное свойство схемы, конечная точка API или тактика оптимизации ИИ. Поскольку поисковые системы и системы искусственного интеллекта становятся все более способными извлекать информацию, конкурентное преимущество будет переходить к организациям, которые могут предоставлять контекст, сохранять отношения и поддерживать целостность своих знаний. <стр>Понимание сущности – это только начало. Понимание того, как эта сущность связана со всем, что ее окружает, — вот в чем настоящая ценность.

    Back To Top