Согласно опросу 157 предприятий, компании всё активнее наделяют ИИ-агентов самостоятельностью, но при этом всё меньше доверяют оценкам, которые должны эту самостоятельность контролировать. Половина уже сталкивались с тем, что агент, успешно прошедший внутренние тесты, подводил клиентов в реальной эксплуатации. Лишь один из двадцати респондентов полностью доверяет автоматическим проверкам, а главной их слабостью называют неспособность предсказывать реальное поведение. При этом две трети либо уже допускают, либо целенаправленно готовят к внедрению полностью автоматическое развёртывание изменений без участия человека, ориентируясь лишь на результаты автоматических оценок. Так возникает «разрыв оценки» — дистанция между автономией, которую предоставляют агентам, и доверием к тестам, призванным предотвращать сбои.
Данная волна исследования VentureBeat Pulse изучает, как технические лидеры измеряют производительность агентов: какие платформы для оценки надёжности они используют, как выбирают и насколько им доверяют, что ломается в реальной работе и насколько далеко они готовы отпустить агентов без контроля человека.
Ключевой вывод — разрыв оценки: организации дают агентам всё больше свободы, а инструменты контроля не поспевают. За последний год половина компаний (50%) развернули агента или LLM-функцию, которые прошли внутренние проверки, но затем вызвали сбой, заметный клиентам, причём четверть сталкивались с этим неоднократно. Доверие к тестам минимально: лишь 5% полностью им доверяют, а чаще всего упоминаемое ограничение (29%) — плохое соответствие между результатами тестов и реальным миром. Предприятия на практике убеждаются: успешная оценка ещё не означает работающего агента.
Опасность разрыва усугубляется тенденцией: две трети организаций (66%) уже разрешают полностью автоматическое развёртывание для низкорисковых агентов (34%) или активно строят пайплайны, чтобы внедрить его в течение года (33%). При этом набор инструментов для оценки, который должен был бы заслужить это доверие, разрознен и незрел: чаще всего используются встроенные средства самих провайдеров моделей, и столько же компаний вообще не имеют специализированных инструментов (по 17% в каждой группе). Лишь около четверти предприятий проводят проверки качества в реальном времени на рабочем трафике. Автономия наступает быстрее, чем гарантии.
Методология
Это исследование, проведённое VentureBeat в рамках серии Pulse Research и сфокусированное на трекинге «Agentic Reliability & Evals», изучало, как технические руководители оценивают производительность и надёжность ИИ-агентов. Выборка включает организации со штатом от 100 сотрудников (n=157); данные собраны в ходе одного опроса в июне 2026 года. Поскольку это единовременный срез, а не накопленная выборка за несколько месяцев, отчёт носит описательный характер и не выявляет помесячную динамику. Там, где допускался множественный выбор, сумма долей может превышать 100%.
По ролям выборка представлена старшими специалистами, влияющими на закупки: 38% — лица, принимающие окончательные решения о покупке ИИ-решений, ещё 34% — рекомендатели или влияющие лица. Среди названных должностей лидируют менеджеры по продуктам и программам (15%), консультанты и советники (10%), директора по инжинирингу/ИТ (8%), а также CIO/CTO/CISO (8%); большая группа (37%) отнесена к категории «Другое».
По размеру организаций преобладают компании среднего рынка: 100–499 сотрудников (37%) и 500–2 499 (27%), далее — 2 500–9 999 (20%), 10 000–49 999 (10%) и свыше 50 000 (6%). Крупнейшая отрасль — технологии и ПО (23%), затем розничная торговля и потребительские товары (15%), здравоохранение и науки о жизни (12%), производство (10%).
При 157 респондентах выборка достаточно велика для выявления тенденций, но не является вероятностной — она сформирована на основе самовыборки. Поэтому результаты стоит воспринимать как направленный сигнал, а не точное измерение. Кроме того, заметен уклон в сторону среднего рынка, то есть это скорее взгляд организаций, активно выстраивающих практики оценки агентов, а не крупнейших игроков.
Примечание: этот опрос был переработан для июньской волны на основе предыдущего исследования «LLM observability and evaluations»; поскольку вопросы и выборка изменились, сравнения с данными за апрель–май не проводятся.
Результат 1: Пройденная оценка не гарантирует работающего агента
У половины компаний агенты, прошедшие тесты, всё равно подводили клиентов
| Доля | Ситуация |
|---|---|
| 26% | да, один раз |
| 24% | да, более одного раза — постоянный разрыв между оценкой и реальностью |
| 36% | нет таких производственных сбоев |
| 8% | предварительные оценки не проводятся; ещё 6% не отслеживают это или затрудняются ответить |
Это ключевая цифра отчёта: половина организаций (50%) разворачивали ИИ-функционал, который успешно прошёл внутренние оценки, но затем подвёл клиента — выдал неверный результат, нарушил бизнес-процесс или спровоцировал инцидент, причём четверть пережила это не единожды. Лишь 36% сообщили об отсутствии таких сбоев; остальные либо вовсе не проводят предварительные тесты (8%), либо не отслеживают первопричины настолько, чтобы понять картину (6%). Поломка точна и дорого обходится: оценка говорила, что агент готов, а он не был готов. Именно этот опыт определяет всё дальнейшее — как компании доверяют тестам, что мониторят и какую автономию предоставляют.
Результат 2: Почти никто полностью не доверяет автоматическим оценкам
Главная претензия: тесты не совпадают с реальными результатами
| Доля | Ограничение |
|---|---|
| 29% | плохое соответствие реальным результатам |
| 21% | предвзятость или нестабильность оценок |
| 18% | недостаток объяснимости |
| 17% | утечка данных или конфиденциальность |
| 11% | незрелость инструментов; лишь 5% полностью доверяют автоматическим проверкам |
Доверие к автоматическим оценкам невелико и конкретно. Лишь 5% организаций заявляют, что полностью доверяют автоматической проверке в её нынешнем виде — остальные 95% указывают на сдерживающие факторы. Чаще всего (29%) называют ту самую проблему, которая напрямую объясняет Результат 1: оценки плохо соответствуют реальным результатам, пропуская агентов, которые затем дают сбои. Далее следуют систематические ошибки и нестабильность вердиктов (21%), а также недостаток объяснимости (18%) — компании не всегда могут понять, почему тест вынес именно такое заключение. 17% обеспокоены утечкой данных или нарушением приватности в самом процессе оценки. Тесты, призванные сертифицировать агентов, пока не заслужили доверия — именно это делает тренд автономии из следующего раздела особенно примечательным.
Результат 3: Потолок автономии всё равно поднимается
Две трети уже допускают или строят системы полностью автоматического развёртывания
| Доля | Позиция |
|---|---|
| 34% | уже разрешено для отдельных низкорисковых агентов или изменений |
| 33% | пока нет, но активно готовят пайплайны для внедрения в течение 12 месяцев |
| 22% | нет и не планируют в обозримом будущем |
| 8% | не применимо (не используют автономных агентов); 3% не знают |
Вот главный парадокс отчёта. Хотя почти никто полностью не доверяет автоматическим оценкам (Результат 2), две трети (66%) уже допускают либо активно проектируют пайплайны для полностью автоматического развёртывания без участия человека: 34% уже разрешили это для агентов и изменений с низким риском, а 33% намерены внедрить в течение 12 месяцев. Лишь 22% исключают такую возможность в обозримом будущем. Направление однозначно: компании идут к тому, чтобы доверить пропуск в production одним лишь оценкам, убирая человека-контролёра, — и это в момент, когда сами признают, что оценки ненадёжны. Потолок автономии поднимается быстрее, чем уровень уверенности под ним; именно этот механизм масштабирует ложную самоуверенность, породившую сбои из Результата 1.
Примечательно, что ставка на автономию — не удел лишь небольших компаний. Если разделить выборку по размеру, более крупные предприятия даже чуть дальше продвинулись к отказу от ручной проверки (70% против 64%) и немного чаще сталкивались с отказом агента после успешных тестов (54% против 48%). Предположение, что крупные регулируемые организации дольше всех сохраняют человека в цикле, в этой выборке не подтверждается. Конечно, это лишь ориентировочные цифры, так как опрос не охватывал огромную выборку — 57 респондентов из компаний с 2500+ сотрудников и 100 из более мелких.
Результат 4: Инструменты оценки разрознены и завязаны на провайдеров
Лидируют встроенные тесты провайдеров — но столько же компаний обходятся без всего
| Доля | Основной инструмент |
|---|---|
| 17% | встроенные тесты и трассировка OpenAI Developer Platform |
| 17% | нет специализированного инструмента для оценки надёжности агентов |
| 13% | встроенные тесты Anthropic Claude Console |
| 12% | Confident AI (DeepEval); 11% — собственные разработки |
| 8% | Braintrust; специализированные платформы (LangSmith, Weave, Promptfoo, Langfuse, Arize) набирают единицы процентов |
Инструментарий оценки находится на ранней стадии и далёк от консолидации. Лидируют встроенные решения провайдеров: собственные тесты и трассировка OpenAI (17%) и Anthropic Claude Console (13%) в сумме превосходят любую независимую платформу, но самыми распространёнными оказались также «никакие» — 17% компаний вообще не используют специализированных средств для оценки агентов, что тревожно для тех, кто поставляет агентов клиентам. Специализированные вендоры: DeepEval (12%), Braintrust (8%), а также LangSmith, Weave, Promptfoo, Langfuse, Arize — разбросаны в диапазоне от единиц до низких двузначных чисел; ещё 11% разработали собственные решения. Ни одна независимая платформа не стала отраслевым стандартом, поэтому большинство предприятий оценивает агентов с помощью инструментов провайдера, самописных скриптов или вовсе без них.
Результат 5: Production-мониторинг редко следит за качеством ответов
Лишь четверть запускают проверки качества в реальном времени
| Доля | Тип мониторинга |
|---|---|
| 25% | трассировка транзакций — инфраструктурные спаны, токены, сырой ввод-вывод для отладки |
| 25% | отслеживание шлюзовой инфраструктуры — задержки, ошибки, стоимость на уровне API, но не качество |
| 23% | встроенные проверки качества — автоматические судьи/ограничения на реальном трафике с оповещениями |
| 10% | выборочная ручная проверка качества; 17% не знают или говорят, что это не их зона |
Если сгруппировать по тому, что именно отслеживается, картина резкая: 51% организаций следят лишь за работоспособностью агента, и только 23% — за корректностью его ответов. С учётом выборочных проверяющих и тех, кто не в курсе, примерно три четверти компаний вообще не проводят автоматическую оценку правильности ответов в реальном времени — им видно, что система «жива» и сколько это стоит, а качество контента они принимают на веру. Это слепое пятно — эксплуатационный аналог преддеплойного разрыва из Результата 1: те же организации, которые убирают человека из процесса развёртывания, в большинстве своём не способны оперативно заметить, когда выкаченный агент начинает ошибаться.
Результат 6: Покупают исходя из цены, измеряют по стабильности
Стоимость и интеграция — главные факторы выбора; цель — воспроизводимость результатов
| Доля | Критерий |
|---|---|
| 28% | основной фактор выбора — стоимость тестов |
| 27% | простота интеграции; 24% — точность оценки |
| 36% | главная метрика успеха — стабильность (повторяемость) оценок |
| 19% | успех измеряют скоростью экспериментов; 18% — снижением числа сбоев |
Компании покупают инструменты оценки, ориентируясь на экономику, а доверяют им за повторяемость. Стоимость тестов (28%) — главный фактор выбора, ненамного опережая простоту интеграции (27%) и точность оценки (24%); полнота наблюдаемости (13%) и дорожная карта вендора (4%) волнуют значительно меньше. Что касается критериев успеха, то 36% называют стабильность оценок — способность выдавать одинаковый вердикт на одинаковое поведение, — что намного опережает скорость экспериментов (19%), сокращение числа сбоев (18%), видимость в production (13%) и соответствие нормам (11%). Акцент на стабильности показателен: прежде чем довериться вердикту, нужно, чтобы он был воспроизводимым — а именно этого свойства (вернее, его отсутствия) не хватает, согласно главным претензиям в Результате 2. Удовлетворённость текущими инструментами средняя — 3,8 по пятибалльной шкале по общей удовлетворённости, простоте внедрения и соотношению цены и качества.
Результат 7: Следующие инвестиции — в людей и наблюдаемость
Деньги идут на контроль, а не только на автоматизацию
| Доля | Направление роста инвестиций |
|---|---|
| 30% | инструменты наблюдаемости в production |
| 26% | рабочие процессы с участием человека-проверяющего |
| 20% | оценка безопасности и политик |
| 16% | автоматизированные пайплайны оценки |
| 8% | бюджет не увеличивается |
Второе по величине запланированное увеличение инвестиций — после средств наблюдаемости в production — приходится на рабочие процессы с участием человека (26%). В контексте Результата 1 это самое тихое противоречие отчёта: пока две трети компаний проектируют системы, исключающие человека из принятия решений о развёртывании, большая доля планирует нарастить расходы на людей-проверяющих (26%), чем на автоматизированные пайплайны оценки (16%), которые должны их заменить. Тренд на отказ от человека и бюджет на ручную проверку растут в одних и тех же организациях одновременно. Лишь 8% сообщают, что их бюджет не увеличивается. В целом предприятия страхуются: строят автономию, но одновременно инвестируют в более пристальный надзор и держат людей наготове для тех решений, которые автоматическим тестам пока нельзя доверить.
Результат 8: Грядёт перетряска инструментов
Почти две трети планируют внедрить или сменить платформу в течение года
| Доля | Планы |
|---|---|
| 36% | не планируют изменений |
| 31% | планируют внедрение или смену в ближайшие 0–3 месяца |
| 24% | в течение 3–6 месяцев |
| 10% | в течение 6–12 месяцев |
Рынок инструментов оценки широко открыт. Хотя 36% не планируют изменений, явное большинство (64%) намерено внедрить новую, дополнительную или заменяющую платформу в течение двенадцати месяцев, а 31% — уже в ближайшем квартале. Набор рассматриваемых решений указывает на области, где текущее покрытие минимально: лидирует DeepEval от Confident AI (20%) — интерес к нему выше, чем к встроенным тестам OpenAI (13%) и Braintrust (9%). Специалисты по open-source привлекают больше внимания, чем можно предположить по их нынешней доле. Учитывая, что многие сегодня полагаются на инструменты провайдеров или обходятся вовсе без них (Результат 4), это не столько отток, сколько первая настоящая волна внедрения — момент, когда слой оценки начинает консолидироваться. Какие платформы заслужат доверие на рынке, где автоматическим тестам почти никто не верит, — открытый вопрос, за которым серия продолжит следить.
Итог: разрыв в оценке, который автономия только увеличит
Организации с численностью от 100 сотрудников предоставляют ИИ-агентам больше самостоятельности, чем позволяет уровень доверия к их оценкам. Половина уже выпускали агентов, прошедших тесты, но подводивших клиентов. Почти никто не доверяет автоматическим проверкам полностью — главным образом из-за расхождения с реальностью. И большинство отслеживает в production лишь доступность и затраты, но не корректность ответов. Тем не менее две трети либо уже разрешают, либо активно готовят полностью автоматическое развёртывание.
Рынок инструментов пока незрел и фрагментирован: самые распространённые средства — встроенные тесты провайдеров, и столько же компаний вообще без специализированного инструментария; явное большинство планирует внедрить или сменить платформу в ближайший год. Обнадёживает, что следующие инвестиции направляются в наблюдаемость и — что показательно — в человеческий контроль: предприятия чувствуют разрыв, даже когда пытаются его преодолеть инженерно.
При 157 респондентах за одну волну это лишь вектор, указывающий в сторону среднего рынка, но направление очевидно: автономия предоставляется на основе оценок, которым те, кто её предоставляет, пока не верят. Разрыв оценки — не проблема покрытия, которую можно закрыть дополнительными тестами; это проблема соответствия оценок реальности и доверия к ним. Открытый вопрос для следующих волн: догонит ли уверенность автономию — или ложная самоуверенность перерастёт из клиентских инцидентов в автоматически развёртываемые изменения.
На основе опроса 157 квалифицированных респондентов из организаций со штатом 100+, проведённого в июне 2026 года. Данные отражают тенденцию, но не являются точным статистическим измерением — выборка самовыборная, со смещением в сторону среднего рынка. Среди респондентов — менеджеры по продуктам, консультанты, директора по инжинирингу и ИТ, CIO/CTO/CISO и специалисты других функций, представляющие отрасли: технологии/ПО, розничную торговлю, здравоохранение, производство и другие.