Cloudflare помогает положить конец дилемме «поиск или обучение ИИ»

Cloudflare, ведущая компания в области облачных сетевых решений, объявила о новой маркировке Accountable для краулинга, связанного с ИИ, и запустила настройку Disallow AI Training, позволяющую любому сайту отказаться от использования его контента для обучения ИИ, при этом сохранив видимость в результатах поиска. Ранее компания заявляла, что владельцы сайтов должны иметь реальный контроль над тем, как ИИ использует их материалы, и сформулировала требования, которым должны соответствовать операторы краулеров, чтобы сохранить доступ к контенту.

Теперь Apple, Google и Microsoft получили статус Accountable, продемонстрировав соответствие этим критериям или предоставив конкретные сроки для их выполнения. Другие краулеры смешанного типа, которые объединяют сбор контента для поиска и для обучения ИИ, будут блокироваться, если владельцы сайтов включат опцию Block Training.

На протяжении почти трех десятилетий правило было простым: краулер сканирует сайт, а взамен сайт получает трафик. Появление ИИ изменило условия: краулеры смешанного использования, собирающие контент и для поискового индекса, и для обучения ИИ, сейчас составляют крупнейшую категорию верифицированного краулингового трафика в сети Cloudflare — более трети. Большинство владельцев сайтов по‑прежнему хотят, чтобы их находили: менее одного процента блокируют поисковые краулеры, тогда как около семнадцати процентов ограничивают обучение ИИ.

До сегодняшнего дня отказ от обучения часто означал потерю индексирования теми краулерами, у которых не было соответствующих инструментов учёта предпочтений. Генеральный директор и сооснователь Cloudflare отметил, что задача компании — сохранить открытую природу интернета, ценность поиска, и одновременно дать людям и бизнесу значимый контроль над использованием их труда, а также выразил готовность к дальнейшему сотрудничеству с такими компаниями, как Apple, Google и Microsoft, для создания здоровой экосистемы.

Краулеры смешанного использования стали самой сложной проблемой в вопросе обучения ИИ. Следующим шагом, по словам Cloudflare, становятся AI‑суммаризации: все операторы, которых Cloudflare пометит как Accountable, должны предоставить владельцам сайтов возможность отказаться от создания AI‑суммарий их контента. На текущем этапе это двоичный выбор, задаваемый для каждого оператора отдельно. В ближайшем будущем Cloudflare намерена дать владельцам сайтов централизованный контроль за тем, какая доля их контента может быть задействована.

Cloudflare заменяет переключатель «Block AI Bots» тремя раздельными контролями: для поиска, для обучения ИИ и для ИИ‑агентов. Новые сайты в Cloudflare теперь будут видеть предлагаемые рекомендованные настройки с учётом их бизнес‑модели: для сайтов с рекламой — краулинг для поиска включён, обучение ИИ запрещено, а ИИ‑агенты блокируются на страницах с рекламой; для прочих сайтов — поиск, обучение ИИ и ИИ‑агенты разрешены, что соответствует поведению большинства сайтов без рекламной поддержки.

Также функция «Managed Robots.txt» заменяется на «Bot Preference Sync», которая позволяет владельцам сайтов задать предпочтения краулинга один раз и автоматически применить их ко всем поддерживаемым краулерам; клиенты в любой момент могут изменить эти настройки.

Cloudflare установила чёткие критерии для прозрачного и подотчётного краулинга ИИ, включая требования для краулеров смешанного типа. Операторы должны либо выполнить, либо пообещать выполнить в оговорённые сроки четыре пункта: предоставить владельцам сайтов понятный способ отказаться от обучения ИИ через robots.txt или сопоставимый стандарт; позволить владельцам сайтов отказаться от AI‑создаваемых поисковых суммарий; дать владельцам сайтов доступ к просмотру использования их контента на уровне URL для целей поиска и обучения; публично подтвердить, что отказ от обучения не повлияет на ранжирование сайта в традиционном поиске.

Apple, Google и Microsoft продемонстрировали соответствие этим требованиям. В частности, Google предложил контроль Google‑Extended, позволяющий сайтам отказаться от обучения без отказа от участия в Поиске, и анонсировал новые инструменты для помощи владельцам сайтов в навигации по вопросам ИИ в поиске.

Некоторые ведущие AI‑компании используют отдельные краулеры для поиска и для обучения; это даёт Cloudflare возможность блокировать их краулеры обучения, не затрагивая поисковые, и позволяет также отнести такие краулеры к категории Accountable. Полный перечень операторов, соответствующих критериям, публикуется Cloudflare в их аналитическом разделе.

Кроме того, Cloudflare активно участвует в разработке открытых стандартов на уровне Internet Engineering Task Force, в том числе в работе над спецификацией «ai‑prefs», которая позволит любому сайту выражать свои предпочтения по доступу ИИ в стандартизованной и переносимой форме. Текущие управления Cloudflare разработаны так, чтобы работать в связке с этими развивающимися стандартами. Компания предоставляет дополнительные материалы о подходе к вопросам ИИ и контролю над контентом в своих блогах, где объясняет идею сохранения возможности обнаружения сайта при отказе от обучения ИИ и обсуждает развитие бизнес‑моделей для «агентного» интернета.