Мнение гостя

По данным Fiddler AI, от 70% до 95% AI‑агентов терпят неудачу в продакшене, а примерно 88% корпоративных агентов, работающих в контролируемом демо, не выдерживают реальных рабочих процессов. Одна из главных причин — неправильный выбор партнёра по разработке. Рынок AI‑агентов стремительно растёт, и в категорию ворвались тысячи компаний. Как отмечает Cubitrek, большая часть того, что продаётся как «разработка AI‑агентов», — это переработанные чат‑боты или базовая интеграция языковых моделей. Ставки слишком высоки, чтобы ограничиваться мягким запросом предложений. По данным S&P Global, средние невозвратные затраты на заброшенную крупную корпоративную инициативу по AI достигают миллионов долларов. Это руководство рассматривает пять вопросов, которые отделяют реальные компетенции от красивых презентаций: опыт вывода в продакшен, выбор фреймворка и модели, безопасность и защитные механизмы, права на интеллектуальную собственность и постзапусковые операции.

Что такое компания по разработке AI‑агентов?

Компания по разработке AI‑агентов — это инжиниринговая сервисная фирма, которая проектирует, создаёт и выводит в эксплуатацию автономных или полуавтономных программных агентов, выполняющих многозадачные шаги с минимальным участием человека. В отличие от чат‑ботов или копилотов, агенты планируют действия, вызывают инструменты, исполняют рабочие процессы и принимают решения самостоятельно. Рынок поставщиков делится на три типа взаимодействия; справочник покупателя Cognipeer рекомендует ясно определить, какой тип вам нужен, прежде чем начинать оценку:

  • Платформенные провайдеры предоставляют программную платформу, на которой ваша команда строит и эксплуатирует агентов (например, Cognigy).
  • Системные интеграторы и консалтинговые фирмы проектируют и строят систему с использованием существующих платформ или кастомной разработки, а затем передают вам систему для эксплуатации.
  • Услуги кастомной разработки AI‑агентов создают агентов с нуля, обычно на открытых фреймворках вроде LangGraph, CrewAI или LlamaIndex.

Если выбрать не ту категорию, вы потеряете недели: платформенный провайдер не будет писать для вас кастомную оркестрационную логику, а кастомная студия не предоставит управляемое рантайм‑окружение с пользовательским интерфейсом.

Почему выбор вендора по AI‑агентам важен как никогда

Число поставщиков выросло от нескольких пионеров до тысяч, и большинство покупателей не имеют надёжного способа отделить суть от маркетинга. Только небольшая доля предприятий, изучающих агентов, фактически развёрнута в продакшене, и прогнозы аналитиков указывают на высокий уровень отмен проектов из‑за затрат и неочевидной ценности. Данные показывают рост числа брошенных инициатив и значительное увеличение перерасходов: исследования демонстрируют средние перерасходы против пилотных прогнозов в сотни процентов, а многие организации уже столкнулись с тем, что агенты превысили свои полномочия или стали причиной инцидентов безопасности. С другой стороны, исследования MIT показывают, что успех при работе с внешними вендорами и партнёрами выше, чем при первой попытке внутренней сборки, но это преимущество сохраняется только если вендор действительно имеет опыт эксплуатации в продакшене. Правильные вопросы на этапе RFP помогут избежать превращения неправильного поставщика в дорогостоящую неудачу.

1. Какие AI‑агенты вы построили и вывели в продакшен?

Это самый предсказуемый вопрос. Нужно знать, что именно вендор запускает в продакшене сейчас, в каком масштабе и можно ли связаться с этими клиентами. Фирма, которая не в состоянии назвать ни одной живой развёртки, продаёт пилот, а не реальную способность. Разрыв между демо и продакшеном — ключевая проблема: переменные, важные в продакшене (распределение запросов, частота крайних случаев, надёжность интеграций и поведение под нагрузкой), как правило, намеренно исключаются из демо. Запросите: названные продакшн‑развёртки с измеримыми показателями (тип агента, объёмы, частота эскалаций к человеку, длительность эксплуатации); контактные лица‑референсы, готовые обсуждать крайние случаи и режимы отказов; реальные панели мониторинга из продакшена, а не скриншоты слайдов; кейс‑стади с честными диапазонами автоматизации вместо плоского «80–90% автоматизации». Красные флаги: только демо без живых развёрток; все кейсы недавние (что говорит о том, что агент не эксплуатировался достаточно долго для выявления отказов); отказ предоставлять ссылки за пределами тщательно отобранного списка; расплывчатые утверждения о «клиентах из списка Fortune 500» без указания агента, сценария или даты развёртки.

2. Какие фреймворки и базовые модели вы используете и почему именно для моего сценария?

Нет единого «лучшего» фреймворка. Правильный выбор зависит от формы рабочего процесса, компетенций команды, потребностей наблюдаемости и того, как вы хотите восстанавливать работу при ошибках. Сильный вендор рекомендует фреймворк, подходящий для конкретного кейса; если у него в арсенале только один вариант, он будет продвигать его независимо от пригодности. Выбор влияет на стоимость и производительность: бенчмарки показывают существенные различия в скорости и расходе токенов между фреймворками. Практические рекомендации по применению: LangGraph хорош для сложных, состояниесберегающих, долгозапущенных рабочих процессов с чекпоинтингом и согласованием с человеком; CrewAI — для многоролевого сотрудничества агентов и быстрой прототипной работы; Microsoft Agent Framework подходит командам на Azure и .NET; LlamaIndex — для приложений, ориентированных на данные и тяжёлую индексацию/поиск. Ожидайте вендора, который аргументирует выбор модели (OpenAI, Anthropic, Google, варианты Llama) и объясняет компромисс между стоимостью и возможностями. Поддержка открытых протоколов для интероперабельности между инструментами становится важным требованием. Красные флаги: вендор знает только один фреймворк и рекомендует его для всего; отсутствие конкретики о компромиссе между LangGraph и CrewAI и пр.; единственная рекомендация по одной базовой модели без обсуждения альтернатив; проприетарный фреймворк, из‑за которого ваша оркестрационная логика нельзя экспортировать.

3. Как вы обеспечиваете безопасность, соответствие требованиям и защитные механизмы для автономных агентов?

Автономные агенты ломают традиционные модели комплаенса: каждое действие должно иметь прослеживаемый источник, но агенты получают доступ к данным, выполняют рабочие процессы и принимают решения без человека, одобряющего каждый шаг. Последствия уже измеримы: финансовые потери, связанные с нарушениями AI‑комплаенса, существенны, а прогнозы аналитиков указывают на рост юридических исков, связанных с недостаточными защитными механизмами. Многие компании не имеют зрелых рамок управления для автономных агентов. Ожидаемые сертификаты и соответствия включают SOC 2 Type II для корпоративных договорных обязательств, HIPAA с предоставлением BAA для здравоохранения, покрытие GDPR/CCPA/DPA с документированными правилами резидентности данных и поддержкой уведомления о нарушении в регламентные сроки, соответствие требованиям регионального законодательства об AI и использование NIST AI RMF или эквивалентных рамок. Технические меры, которые должен описать вендор: уникальная идентичность для каждого агента для трассировки, а не общий OAuth‑токен; защитные слои на уровне ввода/вывода (обнаружение PII, валидация, выравнивание); защита от инъекций в промпты и от отравления RAG; принцип минимально необходимых прав, DLP‑политики и подробные журналы аудита с политикой хранения; человеческая эскалация для неоднозначных случаев. Красные флаги: только SOC 2 без ответа по HIPAA/GDPR/EU AI Act, если это релевантно; расплывчатое «у нас есть защитные механизмы» без деталей по уровням контроля; отсутствие уникальной идентичности на уровне агента и отсутствие политики хранения логов.

4. Кто владеет кодом, промптами, наборами для оценки и данными обучения по окончании контракта?

Заключительный риск, о котором часто забывают — привязка к вендору. Когда платформа оборачивает логику агента в собственный рантайм, предприятие фактически не владеет агентом, а лишь конфигурацией, работающей только в облаке одного поставщика. Юридические вопросы по распределению ответственности за AI, права на продукты, созданные AI, блокировка клиента и управление автономными агентами действуют иначе, чем в традиционных интеграционных контрактах. Следует избегать закрытых схем: вы должны владеть кодом агента, оркестрационной логикой, промптами и определениями инструментов при развертывании; контракт должен чётко прописывать права на данные, права на экспорт, поддержку при миграции и условия расторжения; помощь при переходе должна быть зафиксирована в соглашении. Предпочтительны открытые фреймворки с переносимой логикой оркестрации, модель‑провайдер‑независимость и соблюдение открытых стандартов для интероперабельности. Красные флаги: вендор сохраняет права на промпты, датасеты оценки или дообученные модели; проприетарный фреймворк, который нельзя запустить вне их облака; требования к многолетним контрактам ещё до любой валидации продакшена; сбор платы за исходящие данные или поддержку перехода, делающий смену невозможной.

5. Как вы оцениваете, мониторите и поддерживаете агентов в продакшене после запуска?

Проблемы проявляются именно после запуска: подключение агентов к корпоративным системам требует решения множества интеграционных, безопасностных и управленческих задач, которые часто не всплывают в ходе разработки. Общая стоимость владения обычно недооценивается, потому что в сметы не включают расходы на токены, циклы дообучения и расширение инфраструктуры. Поддержка обычно составляет значительную долю от первоначальной стоимости ежегодно. Метрики одного запуска скрывают хрупкость: агенты на базе одной и той же модели демонстрируют существенное падение качества в многократных попытках. Набор наблюдаемости, который вендор должен назвать, включает: платформы для инженерии агентов и мониторинга продакшена, фреймворк‑агностичные инструменты для оценки траекторий и мульти‑шаговых сценариев; трассировку и мониторинг на основе OpenTelemetry; решения для LLM‑как‑судьи, кодовые или мульти‑ходовые оценщики, запускающиеся против реальных продакшен‑трейсов; автоматическое добавление неудачных трейсов в регрессионные наборы; метрики pass@k вместо единичных метрик успеха; регулярный человеческий обзор с участием доменных экспертов для калибровки оценщиков; циклы тонкой настройки промптов и мониторинг затрат на токены, поскольку выбор модели определяет расходы сильнее, чем выбор фреймворка; документированная процедура реагирования на инциденты вроде промпт‑инъекций, неправомерного использования инструментов и неконтролируемого роста затрат. Красные флаги: отсутствие LLM‑как‑судьи или человеческого цикла оценки; отсутствие месячного бюджета на поддержку или расчёта TCO; отсутствие плана передачи, потому что вендор рассчитывает управлять вашим агентом бесконечно.

Как сравнивать ответы разных поставщиков услуг по разработке AI‑агентов

Пять перечисленных вопросов должны дать вам сопоставимые ответы по каждому кандидату. Постройте взвешенную рубрику оценки: требования, разделённые на обязательные и желательные, единый опросник для вендоров, рубрика с весами в зависимости от бизнес‑приоритетов и шаблон для проверки референсов. Ограничьте шортлист тремя‑пятью фирмами и сопоставляйте критерии с вашими реальными приоритетами. Давите на производственные переменные, а не на демо: распределение запросов, крайние случаи, надёжность интеграций и поведение под нагрузкой. Убедитесь, что TCO включает токены, инфраструктуру, переобучение и комплаенс. Скрытые затраты могут составлять значительную долю первых расходов. Лучший вендор — тот, чьи ответы выдерживают проверку и зафиксированы документально.

Часто задаваемые вопросы (кратко)

  • Что такое услуги по разработке AI‑агентов? Это инжиниринговые услуги по проектированию, созданию и развертыванию автономных или полуавтономных программных сущностей, выполняющих многосерийные задачи с минимальным участием человека. Такие агенты интерпретируют сложные инструкции, принимают контекстные решения и выполняют рабочие процессы.
  • Как оценивать компании по разработке AI‑агентов? Спрашивайте о реальных продакшен‑развёртках, обосновывайте выбор фреймворков и моделей, требуйте подтверждений по безопасности и сертификациям (SOC 2, HIPAA и пр.), оговаривайте права на IP и план постзапускового мониторинга. Ответы должны быть конкретными и документированными.
  • Каков средний процент неудач проектов с AI‑агентами? По данным различных исследований, агенты терпят неудачу в продакшене в широком диапазоне — от примерно 70% до 95%, а значительная доля агентов, успешных в демо, не выдерживает перехода в реальные рабочие процессы.
  • Сколько стоят услуги по разработке AI‑агентов? Оценки стоимости варьируются: прототипы — в низком диапазоне, MVP и простые агенты — дороже, сложные агентные системы могут требовать существенных инвестиций, а ежегодная поддержка обычно добавляет значительную часть первоначальной стоимости (порядка 20–30% от стоимости разработки).
  • Какие сертификаты и соответствия должны быть у компании по разработке AI‑агентов? Для корпоративных контрактов ожидаются SOC 2 Type II; для здравоохранения — HIPAA с BAA; для работы с европейскими данными — GDPR и DPA; также полезны соответствие региональным требованиям к AI и использование рамок вроде NIST AI RMF или стандартов ISO для управления безопасностью и конфиденциальностью.