#AI evaluation
5 stories taggedAI evaluation.

Apple Researchers Built a Better Way to Judge AI Video Captions
A new method from Apple ML Research scores video captions on what they actually get right, not just whether they use the same words as a human writer.

AI test scores are hiding something. A new tool from Allen AI just exposed it
Researchers built software that looks inside AI benchmark tests, question by question, and found that some widely trusted scores are measuring very different things than advertised.

AI tools sound most confident exactly when they are most wrong, new testing shows
A developer built a testing framework to measure whether an AI explainer tool actually got the right answer, not just whether it sounded convincing. What he found should worry any business relying on AI to guide real decisions.

Fünf Millionen Menschen bewerten KI-Designs, damit Maschinen lernen, was gut aussieht
Ein Startup namens Intelligence hat 7,9 Millionen Dollar gesammelt, um eine Plattform zu betreiben, auf der gewöhnliche Nutzer über KI-generierte Bilder und Websites abstimmen. Die gesammelten Daten sind bereits 60 Millionen Dollar pro Jahr für die Unternehmen wert, die KI-Modelle entwickeln.

Warum AI-Bilderkennungssysteme übersehen, was direkt vor ihnen liegt
Apple ML Research hat ein neues Tool entwickelt, das verborgene Muster hinter KI-Fehlern bei der Objekterkennung aufdeckt – seine Erkenntnisse sind für jeden wichtig, der sich auf KI zum Erfassen von Objekten in der realen Welt verlässt.