Cloudflare представила Precursor

Cloudflare представила Precursor — новую технологию поведенческого обнаружения ботов, ориентированную на выявление автоматизированной активности в рамках всей веб-сессии, а не на остановку посетителей в отдельных контрольных точках с помощью CAPTCHA. Это решение появляется на фоне стремительного роста агентных ИИ, который делает традиционное противопоставление „человек — бот“ всё менее релевантным. Cloudflare отмечает, что теперь автоматизированные системы генерируют примерно 57% всех веб-запросов, и боты уже превысили людей как основной источник интернет‑трафика. При этом появились новые сложности для владельцев сайтов: одни боты вредоносны, другие — полезны, а всё чаще автоматизированные агенты действуют напрямую от имени реального человека.

Precursor, ставший общедоступным в июле, призван улучшить первую часть этой задачи — обнаружение автоматизации — и сделать это без постоянного предъявления пользователю испытаний на «человечность». Вместо того чтобы заставлять посетителей неоднократно доказывать, что они люди, Precursor непрерывно оценивает поведение на протяжении сессии и пытается выделить характерные для автоматизации паттерны. Этот подход совпадает с другим шагом Cloudflare: компания готовит изменения в том, как новые сайты в её сети будут обрабатывать разные типы ИИ‑трафика. Для новых доменов по умолчанию планируется блокировать ботов, классифицированных как Training или Agent, на страницах с рекламой, тогда как боты, помеченные как Search, останутся разрешёнными. Это признание того, что важнее не просто факт автоматизации, а цель и роль бота.

Традиционный подход знаком всем: „угадать картинки“, распознать искажённые буквы или поставить галочку „я не робот“. CAPTCHA изначально строились на предположении, что существуют задачи, простые для людей и трудные для программ. Однако эта грань стирается: технологии компьютерного зрения отлично распознают объекты, а операторы ботов применяют автоматизацию браузера, резидентные прокси, сервисы живого решения CAPTCHA и сложную эмуляцию, чтобы трафик выглядел легитимно. Кроме того, CAPTCHA создают трение для реальных клиентов, особенно для пользователей с технологиями доступности, и мешают потокам покупок, регистрации и входа.

Cloudflare уже управляет Turnstile — альтернативой CAPTCHA, используемой в огромном масштабе: почти три миллиарда срабатываний в сутки для оценок риска при входах, регистрациях и оплатах. Precursor идёт дальше, анализируя всю сессию вместо одной отдельной операции. Как работает Precursor? Технология действует через скрипт на стороне клиента, доставляемый через сеть Cloudflare. После включения он регулярно собирает сигналы из браузера и отправляет результаты в Cloudflare, где они используются для обновления состояния безопасности сессии. Идея схожа с другими поведенческими системами: бот может подделать движение мыши, сымитировать набор и делать паузы, но проводить такие убедительные действия на протяжении длительной сессии значительно сложнее.

Precursor анализирует поведенческие сигналы по всей сессии без необходимости предъявлять пользователю повторные вызовы. Важный нюанс — баланс между анализом поведения и неприемлемым уровнем наблюдения. Поведенческое обнаружение может легко превратиться в слежку, если его реализовать неосторожно. Задача безопасности — находить шаблоны автоматизации, не превращая каждый визит в детальную запись действий пользователя. Непрерывная оценка закрывает и другую слепую зону традиционной веб‑безопасности: защита часто сосредоточена только на очевидных точках риска — создании аккаунта, входе, оплате. Злоумышленники это знают и могут демонстрировать „хорошее“ поведение в контрольной точке, скрывая злоупотребления в других частях сессии.

Например, бот‑скальпер может изучать складские остатки и подготовить покупки, а на этапе оформления вести себя как обычный покупатель; операции по перебору учётных данных могут распределять активность, чтобы не сработали пороги, а скрейперы имитируют обычную навигацию при массовом сборе данных. Подход Precursor на уровне сессии призван делать такие паттерны видимыми даже когда отдельные HTTP‑запросы выглядят безвредно. Cloudflare анализирует более триллиона запросов в день и обслуживает более 20% интернета, что даёт системам детекции большой объём данных для распознавания меняющихся шаблонов автоматизации.

Как и у любого поставщика средств защиты, реальная проверка эффективности Precursor — находить тонкий баланс между поимкой сложных автоматизаций и минимизацией ложных срабатываний в отношении легитимных пользователей. Тем не менее переход от точечных вызовов к непрерывной поведенческой оценке отражает направление развития технологий обнаружения ботов. Появление ИИ усложняет задачу ещё сильнее, потому что некоторые боты должны быть разрешены. Поисковые краулеры, мониторинговые сервисы и автоматические взаимодействия между сервисами обычно желательны.

Появились агентные ИИ, которые действуют от имени пользователей: ассистент может найти дешёвый билет, забронировать столик, получить страховочную оценку или купить товар. С точки зрения сайта это бот, а с точки зрения клиента — агент, действующий с его полномочиями. Полный запрет всей автоматизации так же бессмыслен, как и её полное разрешение. Cloudflare разделяет ИИ‑поведение на три категории: Search, Agent и Training. Search‑краулер индексирует информацию, Agent действует в реальном времени от имени человека, а Training‑краулер собирает контент для обучения моделей. Эти категории помогают владельцам сайтов применять разные политики в зависимости от целей автоматизированной системы.

Например: когда асистент посещает магазин, это может представлять потенциального покупателя и быть допустимым; когда же внешняя компания массово скачивает описания товаров для коммерческой модели, это может противоречить интересам ритейлера; скрейпер, регулярно собирающий цены для конкурента, — ещё одна история. Значит, интернету нужно не только обнаружение ботов, но и их идентификация и политика в отношении них: кто управляет агентом, зачем он здесь и стоит ли ему позволять действия.

Cloudflare уже начинает применять разные правила. По умолчанию для новых доменов Training и Agent‑трафик блокируются на страницах с рекламой, поскольку реклама предполагает, что экономическая модель сайта зависит от внимания человека, увидевшего объявление; Training‑краулер потребляет этот контент, не обеспечивая человеческого просмотра, а агент может получить информацию или завершить взаимодействие, не показав пользователю рекламу, на которой сайт зарабатывает. В то же время Search обычно перенаправляет людей обратно на исходные сайты и потому остаётся разрешённым.

Владельцы сайтов не обязаны следовать этим настройкам: Cloudflare позволяет независимо разрешать или блокировать Search, Agent и Training по всему домену или на отдельных страницах с рекламой. Компания продолжает совершенствовать эти инструменты: была анонсирована синхронизация предпочтений ботов с robots.txt для сохранения видимости в поиске при согласованном краулинге. Параллельно Cloudflare работает над механизмами идентификации ботов. В проекте Web Bot Auth предлагается аутентификация на основе криптографически подписанных HTTP‑запросов. Вместо того чтобы бот называл себя SomeHelpfulAgent через user‑agent, что может подделать любой злоумышленник, подписанный запрос может криптографически подтвердить, кто его отправил.

Это открывает путь к более тонким политикам: сайт сможет различать признанный поисковый движок, авторизованного агента, мониторинговый сервис и неизвестный автоматизированный браузер, маскирующийся под кого‑то другого. User‑agent‑строки не были задуманы как надёжный механизм идентификации, и агентный веб будет все больше нуждаться в чём‑то вроде проверяемых учётных данных для программ. Ещё сложнее ситуация с гибридными посетителями: сессия может переключаться между человеком и агентом. Клиент может вручную просмотреть товары, затем поручить агенту сравнить оставшиеся варианты, после чего снова вручную подтвердить покупку.

Новая модель безопасности должна определять, кто в данный момент контролирует взаимодействие, на чьём основании и с какой целью — это существенно сложнее, чем простая идентификация автоматизированного браузера, и объясняет, почему простые антибот‑механизмы вряд ли останутся без изменений по мере распространения агентных систем. Проще всего было бы собирать громадные объёмы информации о каждом пользователе, чтобы точнее распознавать поведение, но это создаёт опасную тенденцию к расширенному слежению.

Cloudflare сотрудничает с разработчиками браузеров и технологическими компаниями над приватностью‑ориентированными подходами, которые позволят легитимному трафику устанавливать доверие без превращения в ещё один механизм межсайтового трекинга. Общее стремление — обнаруживать злоупотребления, раскрывая как можно меньше персонально идентифицирующей информации. Это станет всё важнее по мере усиления приватных настроек браузеров, которые убирают часть сигналов, исторически используемых системами безопасности. Борьба с автоматизацией не должна служить предлогом для восстановления инвазивного отслеживания под другим именем.

Ещё один мотив различать посетителей — экономика сайтов: не весь трафик одинаково ценен. Поисковые краулеры потребляют трафик, но приводят людей на сайты; ИИ‑системы могут поглотить контент и ответить пользователю, не отправляя посетителя на исходный ресурс. Cloudflare развивает более тонкие средства контроля над AI‑search, training и agent трафиком. Предлагаемые по умолчанию настройки для страниц с рекламой прямо связывают политику ботов с моделью дохода сайта: если страница монетизируется показом рекламы, автоматическое потребление контента без показа рекламы пользователю ущемляет экономику владельца.

Таким образом, Precursor решает одну часть большей задачи. Это прежде всего технология обнаружения и валидации поведения, а не полноценная система идентификации и политик для агентного интернета. В сочетании с работой Cloudflare по классификации ИИ‑ботов, управлению краулингом и проверяемым идентификаторам автоматизации, Precursor помогает ответить на вопрос: проявляет ли сессия автоматизированное поведение? Механизмы идентификации ответят, какая система за ней стоит; классификация опишет её назначение; владелец сайта решит, приемлемо ли такое поведение.

Такое сочетание гораздо лучше подходит для интернета, где действуют агентные ИИ, чем старый подход с CAPTCHA, применяемой к любому подозрительному запросу. CAPTCHA могли существовать долго отчасти из‑за недостатка лучшей универсальной альтернативы, но их базовое допущение всё чаще спорно: машины умеют распознавать изображения, эмулировать браузеры, двигать курсоры и печатать, а легитимному программному обеспечению всё чаще нужно разрешение на действия от имени людей. Главная цель больше не в доказательстве „плоти и крови“ за каждым HTTP‑запросом, а в установлении, легитимна ли активность, идентифицируема и авторизована.

Precursor — одна из частей попытки Cloudflare непрерывно и незаметно делать такое суждение, не прерывая пользователей головоломками. Одновременно более тонкое разделение трафика на Search, Agent и Training позволяет допускать полезную автоматизацию и даёт владельцам сайтов инструменты против автоматизации, противоречащей их безопасности или бизнес‑модели. Ирония в том, что интернет может лучше справляться с роботами, перестав постоянно требовать от всех подтверждения своей человечности. Precursor доступен для включения через панель управления Cloudflare. Для новых доменов по умолчанию предполагается различение Search, Agent и Training трафика, с блокировкой Agent и Training на страницах с рекламой и разрешением Search.