#benchmarks
7 stories taggedbenchmarks.

AI test scores are hiding something. A new tool from Allen AI just exposed it
Researchers built software that looks inside AI benchmark tests, question by question, and found that some widely trusted scores are measuring very different things than advertised.

Speech AI Gets Its First Major Hindi Benchmark, and It Measures Who Gets Left Behind
A new evaluation dataset called Monsoon puts Hindi and Indian English on the global leaderboard for the first time, with nearly 5,000 speakers and data designed to expose the gaps that single-score tests hide.

Исследователи Apple создали инструмент, который пишет свои собственные тесты для ИИ
Новая система под названием Agent Seer автоматически генерирует реалистичные сценарии тестирования для ИИ-агентов, читая описания инструментов, которые эти агенты используют, без участия человека.

Google DeepMind помещает свой ИИ в криптографически защищённый контейнер для тестирования
Первая в истории двойная слепая оценка призвана предотвратить секретное изучение моделями ИИ экзаменационных вопросов перед днём тестирования.

Пять миллионов человек оценивают дизайны на основе искусственного интеллекта, чтобы машины учились, что выглядит хорошо
Стартап Intelligence собрал 7,9 миллиона долларов для запуска платформы, где обычные пользователи голосуют за изображения и веб-сайты, созданные ИИ, а собранные данные уже стоят 60 миллионов долларов в год для компаний, которые разрабатывают модели ИИ.

Исследователи создали тест, чтобы проверить, может ли ИИ действительно суммировать видео длиной 16 минут
Новый бенчмарк LVSum показывает, как плохо современные инструменты ИИ отслеживают время события в длительных записях.

ИИ самостоятельно научился писать код лучше, без учителя
Удивительно простой трюк позволил передовой модели ИИ повысить свой балл на стандартном тесте программирования почти на 13 пунктов, просто изучая собственные ответы.