Идеальный диалог с AI может скрывать серьёзные проблемы продукта, предупреждают лидеры индустрии
Руководители LangChain, Conviva и CoreWeave утверждают, что большинство команд неправильно оценивают своих AI-агентов, и решение проблемы заключается не в совершенствовании алгоритмов оценки, а в сравнении групп пользователей во времени.

Ключевые моменты
- Харрисон Чейз, генеральный директор LangChain, заявил на конференции VB Transform 2026, что многие команды страдают от «паралича оценки» и никогда не выпускают продукт, потому что преследуют идеальный набор тестов перед запуском.
- Хуэй Чжан, технический директор Conviva, продемонстрировал, как один диалог с AI может получить хороший результат в изоляции, одновременно скрывая проблему, видимую только при сравнении тысяч пользователей с базовым уровнем.
- LangChain дообучила собственную небольшую AI-модель для выявления ошибок, замечаемых пользователями, в 10–100 раз дешевле, чем использование Claude Sonnet от Anthropic, ведущей коммерческой AI-модели.
- Все три руководителя согласились, что проверка человеком по-прежнему остаётся необходимой в регулируемых сферах, таких как право, финансы и здравоохранение, даже по мере расширения автоматизированной проверки.
Представьте себе клиента, попросившего AI-ассистента в интернет-магазине рекомендовать беговые кроссовки перед полумарафоном. Ассистент задаёт несколько вопросов, клиент покупает кроссовки, и диалог заканчивается. Если оценить это взаимодействие отдельно, оно выглядит хорошо.
Теперь посмотрите на полную картину. Среди тысяч подобных диалогов этот ассистент задавал уточняющие вопросы в три раза чаще, чем обычно для этой категории товара. Клиенты завершали покупки вне чата в пять раз чаще, чем обычно. Что-то явно не работает. Но вы бы этого никогда не заметили, анализируя диалоги по одному.
Это была центральная идея выступления на VB Transform 2026, впервые сообщил VentureBeat, где лидеры трёх AI-компаний инфраструктуры описали, как корпоративные команды неправильно оценивают агентов.
Измеряют ли команды правильные показатели?
Большинство команд — нет. Хуэй Чжан, технический директор Conviva, компании, специализирующейся на аналитике потоковых данных, называет лучший подход «контрастивным анализом»: сравнением группы пользователей с историческим базовым уровнем, а не оценкой отдельных логов чатов. Отдельные оценки выглядят хорошо. Закономерности на уровне популяции раскрывают настоящую ошибку.
Харрисон Чейз, генеральный директор LangChain, компании, создавшей популярный фреймворк для разработки AI-агентов (программного обеспечения, способного самостоятельно выполнять многошаговые задачи), указал на вторую ловушку. Команды разрабатывают исчерпывающие наборы тестов перед запуском, а затем никогда не выпускают продукт.
«Мы иногда видим команды, которые страдают от своего рода паралича оценки», — сказал Чейз. «Лучшие команды запускают продукт и затем его совершенствуют».
Его подход: рассматривайте критерии оценки как живую спецификацию продукта, которая обновляется по мере выявления реальных проблем, а не как контрольный список, который нужно завершить один раз.
Эммануэль Турле, директор по инженерии в CoreWeave, поставщике GPU-облаков (GPU — это специализированные чипы, выполняющие требующиеся AI вычисления), столкнулся с этой же стеной со стороны инженерии. Он преследовал 100-процентное покрытие тестами и всё равно выпустил ошибки. Его решение: сначала установите постоянный широкий мониторинг, позвольте реальным сбоям подсказать вам, какие тесты писать дальше.
Как только появляется категория проблемы, перед вами встаёт вопрос стоимости. Правило Турле: начните с самой способной AI-модели, чтобы доказать, что проблема решаема, затем переходите на более дешёвые, меньшие модели для рутинных проверок. LangChain сделала ровно это. Она дообучила модель Qwen (семейство моделей с открытым исходным кодом от Alibaba), чтобы выявлять моменты, когда пользователи чувствуют, что агент допустил ошибку. Результат соответствовал точности Claude Sonnet при намного меньшей стоимости. Чейз отметил, что некоторые защитные механизмы вообще не требуют модели: простое сопоставление с образцом, называемое regex, справляется со множеством проверок практически без затрат.
Вопрос о роли человека пронизывает всё это. Турле основывался на своём предыдущем опыте работы в компании, разрабатывающей беспилотные автомобили: даже после сжатия цикла тестирования до двух недель человек всё равно должен был одобрить модель перед её установкой в автомобиль. Та же логика применяется к AI-агентам, обрабатывающим медицинские советы, финансовые решения или юридические документы.
Чейз пошёл дальше, утверждая, что проверка человеком — это не просто сетка безопасности. Так система учится. Без обратной связи от человека агент не имеет ничего, над чем нужно совершенствоваться.



