#benchmarks
6 stories taggedbenchmarks.

Speech AI Gets Its First Major Hindi Benchmark, and It Measures Who Gets Left Behind
A new evaluation dataset called Monsoon puts Hindi and Indian English on the global leaderboard for the first time, with nearly 5,000 speakers and data designed to expose the gaps that single-score tests hide.

Apple-Forscher entwickeln ein Tool, das seine eigenen KI-Tests schreibt
Ein neues System namens Agent Seer kann automatisch realistische Testszenarien für KI-Agenten generieren, indem es die Beschreibungen der von diesen Agenten verwendeten Tools liest – ohne menschliches Zutun.

Google DeepMind sperrt sein KI-Modell in eine kryptographische versiegelte Box zum Testen
Eine beispiellose doppelblinde Evaluierung soll verhindern, dass KI-Modelle die Prüfungsfragen heimlich vor dem Test studieren.

Fünf Millionen Menschen bewerten KI-Designs, damit Maschinen lernen, was gut aussieht
Ein Startup namens Intelligence hat 7,9 Millionen Dollar gesammelt, um eine Plattform zu betreiben, auf der gewöhnliche Nutzer über KI-generierte Bilder und Websites abstimmen. Die gesammelten Daten sind bereits 60 Millionen Dollar pro Jahr für die Unternehmen wert, die KI-Modelle entwickeln.

Forscher entwickeln Test, um zu prüfen, ob KI ein 16-Minuten-Video wirklich zusammenfassen kann
Ein neues Benchmark namens LVSum zeigt, wie schlecht heutige KI-Videotools den Überblick über den zeitlichen Ablauf in langen Aufzeichnungen verlieren.

Eine KI brachte sich selbst bei, besseren Code zu schreiben – ganz ohne Lehrer
Ein überraschend einfacher Trick half einem führenden KI-Modell, seine Codierungsbewertung um knapp 13 Punkte zu verbessern, indem es einfach seine eigenen Antworten studierte.