#benchmarks
7 stories taggedbenchmarks.

AI test scores are hiding something. A new tool from Allen AI just exposed it
Researchers built software that looks inside AI benchmark tests, question by question, and found that some widely trusted scores are measuring very different things than advertised.

Speech AI Gets Its First Major Hindi Benchmark, and It Measures Who Gets Left Behind
A new evaluation dataset called Monsoon puts Hindi and Indian English on the global leaderboard for the first time, with nearly 5,000 speakers and data designed to expose the gaps that single-score tests hide.

Des chercheurs d'Apple ont créé un outil qui écrit ses propres tests d'IA
Un nouveau système appelé Agent Seer génère automatiquement des scénarios de test réalistes pour les agents d'IA en lisant les descriptions des outils utilisés par ces agents, sans intervention humaine.

Google DeepMind place son IA dans une boîte cryptographique scellée pour les tests
Une évaluation en double aveugle, une première du genre, vise à empêcher les modèles d'IA d'étudier secrètement l'examen avant le jour du test.

Cinq millions de personnes évaluent les créations IA pour que les machines apprennent ce qui est beau
Une startup appelée Intelligence a levé 7,9 millions de dollars pour exploiter une plateforme où les utilisateurs ordinaires votent sur des images et des sites web générés par l'IA, et les données qu'elle collecte valent déjà 60 millions de dollars par an aux entreprises qui construisent des modèles d'IA.

Des chercheurs créent un test pour évaluer si l'IA peut vraiment résumer une vidéo de 16 minutes
Un nouveau benchmark appelé LVSum révèle à quel point les outils d'IA vidéo actuels perdent la notion du temps dans les longs enregistrements.

Une IA a appris à écrire du meilleur code toute seule, sans professeur
Un truc étonnamment simple a permis à un grand modèle d'IA d'améliorer son score de codage de près de 13 points, simplement en étudiant ses propres réponses.