#AI testing
10 stories taggedAI testing.

Apple Researchers Built a Tool That Writes Its Own AI Tests
A new system called Agent Seer can automatically generate realistic test scenarios for AI agents by reading the descriptions of the tools those agents use, no human writing required.

AI Models Broke Out of Their Test Cages and Hacked Real Companies. Now Employees Are Demanding Answers.
More than a thousand AI researchers have asked the US government to slow things down after two OpenAI models escaped their testing environment and autonomously attacked outside services. Days later, Anthropic said the same thing happened to some of its models.

ИИ компании Meta взломал компанию во время теста безопасности. Это уже третья крупная лаборатория, сообщившая об этом.
Ошибка партнера Meta по тестированию дала модели ИИ неожиданный доступ в интернет. То, что произошло дальше, становится тревожной тенденцией в отрасли.

Claude AI от Anthropic проник в реальные компьютерные сети во время тестирования, оставшись незамеченным
Три модели Claude прошли мимо ошибки конфигурации безопасности и получили доступ к живым системам, к которым они никогда не должны были иметь доступа. Компания узнала об этом только после проверки 141 000 тестовых запусков, последовавших за похожим инцидентом в OpenAI.

Идеальный диалог с AI может скрывать серьёзные проблемы продукта, предупреждают лидеры индустрии
Руководители LangChain, Conviva и CoreWeave утверждают, что большинство команд неправильно оценивают своих AI-агентов, и решение проблемы заключается не в совершенствовании алгоритмов оценки, а в сравнении групп пользователей во времени.

Ошибка при тестировании OpenAI выявила уязвимости в кибербезопасности ИИ
Неправильно настроенная тестовая среда позволила модели OpenAI взломать Hugging Face, подчеркивая важность безопасных тестовых конфигураций.

Собственный ИИ OpenAI вырвался из тестовой «клетки» и взломал Hugging Face
Две модели OpenAI сбежали из изолированной тестовой среды, попали в интернет и взломали серверы конкурирующей компании по ИИ. OpenAI называет это беспрецедентным, одновременно используя инцидент для продажи средств безопасности.

Модели ИИ от OpenAI взломали Hugging Face случайно
Предварительная модель ИИ с немного ослабленными механизмами безопасности для тестирования стала искать ярлыки в бенчмарке и в результате взломала крупную платформу ИИ. Вот что на самом деле произошло.

Исследователи Apple создали виртуального пользователя для тестирования ИИ-ассистентов до запуска для реальных людей
Новая исследовательская платформа имитирует реальное взаимодействие с приложением, позволяя проактивным ИИ-ассистентам пройти тестирование и оценку без риска для настоящих пользователей.

ИИ-агентам доверяют больше решений, чем компании могут на самом деле проверить
Новое исследование показывает, что половина предприятий уже развернула ИИ-агент, который прошел внутренние тесты, а затем сломал что-то для реального клиента. Только 5% полностью доверяют тестированию, которое должно выявлять такие сбои.