Ідеальна розмова з ШІ все ще може означати зламаний продукт, попереджають лідери індустрії
Керівники LangChain, Conviva та CoreWeave стверджують, що більшість команд неправильно вимірюють своїх ШІ-агентів, і рішення менше стосується розумніших систем оцінювання, а більше — порівняння груп користувачів протягом часу.

Ключові моменти
- Харісон Чейс, генеральний директор LangChain, сказав на VB Transform 2026, що багато команд страждають від «паралічу оцінювання» і ніколи не випускають продукт, оскільки переслідують ідеальний набір тестів перед запуском.
- Хуі Чжан, CTO Conviva, продемонстрував, як одна розмова зі ШІ може отримати хорошу оцінку окремо, але приховувати проблему в цілій категорії, видиму лише при порівнянні тисяч користувачів із базовим показником.
- LangChain тонко налагодив свою власну невелику модель ШІ, щоб виявляти помилки, сприйняті користувачами, у 10–100 разів дешевше, ніж використання Claude Sonnet від Anthropic, провідної комерційної моделі ШІ.
- Усі три керівники погодилися, що людська санкція залишається необхідною в регульованих галузях, таких як право, фінанси та охорона здоров'я, навіть у міру масштабування автоматизованої перевірки.
Уявіть собі клієнта, який просить у ШІ-асистента по покупкам кросівки для бігу перед напівмарафоном. Асистент задає кілька запитань, клієнт купує пару, і розмова закінчується. Оцініть цю взаємодію окремо: вона виглядає добре.
Тепер подивіться на повну картину. Серед тисяч подібних розмов цей асистент задавав уточнювальні запитання в три рази частіше, ніж зазвичай для цієї категорії взуття. Клієнти завершували покупки поза чатом у п'ять разів частіше, ніж звичайно. Очевидно, щось не так. Але ви ніколи не побачите цього, перевіряючи одну розмову за раз.
Це був центральний аргумент, висунутий на VB Transform 2026, про який уперше повідомив VentureBeat, де лідери трьох компаній ШІ-інфраструктури описали, як корпоративні команди неправильно оцінюють агентів.
Команди вимірюють правильні речі?
Більшість команд — ні. Хуй Чжан, CTO Conviva, компанії, що займається аналітикою потокового передавання, називає кращий підхід «контрастивним аналізом»: порівнянням групи користувачів із історичним базовим показником замість оцінювання окремих журналів чату. Окремі оцінки виглядають добре. Закономірності популяції виявляють справжню проблему.
Харісон Чейс, генеральний директор LangChain, компанії, яка стоїть за популярною платформою для створення ШІ-агентів (програмне забезпечення, яке може самостійно виконувати багатокрокові завдання), виділив другу пастку. Команди розробляють вичерпні набори тестів перед запуском, а потім ніколи не випускають продукт.
«Нам іноді зустрічаються команди, які страждають від майже паралічу оцінювання», — сказав Чейс. «Найкращі команди запускають і потім ітерують».
Його формулювання: вважайте критерії оцінювання живою специфікацією продукту, яка оновлюється в міру виявлення реальних проблем, а не контрольним списком, який ви закінчуєте один раз.
Еммануель Турле, директор інженерії в CoreWeave, провайдері GPU-хмари (GPU означає спеціалізовані чіпи, які виконують важкі обчислення, необхідні для ШІ), натрапив на ту саму проблему з інженерного боку. Він переслідував 100% покриття тестами і все ще випускав помилки. Його рішення: спочатку налаштуйте широке постійне моніторування, дайте реальним збоям навчити вас, які тести писати далі.
Після того як категорія проблеми виникає, у вас також виникає питання вартості. Правило Турле — почати з найпроможнішої моделі ШІ, щоб довести, що щось дозволяє розв'язати, а потім перейти до дешевших, менших моделей для звичайних перевірок. LangChain зробив саме те. Він тонко налагодив модель Qwen (сімейство моделей з відкритим кодом від Alibaba), щоб виявляти моменти, коли користувачі відчували, що агент зробив помилку. Результат відповідав точності Claude Sonnet за часточку ціни. Чейс зазначив, що деякі гарантії навіть не потребують моделі: простий код пошуку за шаблонами, називаний regex, обробляє багато перевірок практично без витрат.
Питання людини пронизує все це. Турле спирався на свою попередню роботу в компанії, яка розробляє автомобілі без водія: навіть після скорочення циклу тестування до двох тижнів людина все ще повинна була затвердити модель перед її введенням у транспортний засіб. Та сама логіка стосується ШІ-агентів, які обробляють медичні поради, фінансові рішення або юридичні документи.
Чейс пішов далі, стверджуючи, що людська перевірка — це не просто сітка безпеки. Це те, як система вчиться. Без людського зворотного зв'язку в циклі агент не має чого вдосконалювати.



