#AI benchmarks
21 stories taggedAI benchmarks.

AI aces trivia but fumbles riddles: the puzzle tests that expose what machines still can't do
From mental rotation to river-crossing logic, a new set of benchmarks shows where AI trips over problems any sharp human can crack, and where it beats us cold.

Ein winziger KI-Agent eines Londoner Startups schlägt Anthropic und OpenAI beim Lesen wissenschaftlicher Arbeiten
Inherent, gegründet von vier Google-DeepMind-Veteranen, gibt an, dass sein Faraday-Agent viel größere Modelle von Anthropic und OpenAI bei einem wichtigen Wissenschafts-Benchmark übertroffen hat, obwohl er auf einem Modell läuft, das ungefähr ein Zehntel ihrer Größe ausmacht.

GLM-5.3 Opens Up to Developers at the Same Price as Its Predecessor
Chinese startup Z.ai's new frontier model is now available via API, matching the old per-token rate while scoring higher on independent benchmarks. But a quirk in how the model writes means your bill may still rise.

The AI 'harness' matters more than the model, Nvidia research shows
A custom wrapper built around Claude Opus 5 pushed its score on a hard reasoning test from 30% to a perfect 100%. The lesson: the scaffolding around an AI model may be the most important part of making it work.

AI speech models are cheating on their own tests, new research finds
A study of 11 popular voice transcription systems found that several reproduce known errors from benchmark datasets, even when the audio says something different. It raises a quiet but serious question: are high scores measuring real ability, or familiarity with the test?

Ein KI-Modell mit 27 Milliarden Parametern, das Sie zu Hause ausführen können, entspricht Cloud-Konkurrenten bei Codingtests
Alibabas Qwen3.8-27B kann kostenlos heruntergeladen werden, passt auf einen hochwertigen Laptop und erzielte bei unabhängigen Benchmarks das gleiche Niveau wie Mid-Tier-Modelle von OpenAI und Anthropic. Entwickler bezeichnen es als das bislang deutlichste Zeichen dafür, dass KI der Spitzenklasse die Cloud verlässt und auf private Hardware umzieht.

More Memory Does Not Always Mean a Smarter AI Agent
A study across eight AI models found that feeding an agent more of its own past experience can hurt as much as help. The right amount of memory depends entirely on how capable the model already is.

Google bringt Gemini 3.7 Flash nur drei Wochen nach Vorgänger auf den Markt
Das neue Modell bringt messbare Verbesserungen beim Programmieren und Dokumentenverarbeitung und startet mit einführungspreisen, da Google Druck von günstigeren Konkurrenten verspürt.

Microsofts Orchard-Framework ermöglicht KI-Agenten, ihre Gewichtsklasse zu verlassen
Ein neues Open-Source-Toolkit von Microsoft Research trainiert KI-Agenten, die Code reparieren, im Web browsen und Aufgaben verwalten können – mit Modellen, die deutlich kleiner sind als heutige Spitzensysteme.

GraphRAG vs. einfaches RAG: die ehrliche Bilanz
Ein Knowledge Graph kann KI-Antworten deutlich verbessern, aber nur bei bestimmten Fragen – und die Indexierungskosten können überraschend hoch sein. Hier ist, was fünf Studien wirklich herausgefunden haben.

Inkling-Small ist ein Viertel der Größe seines Vorgängers und nahezu genauso leistungsfähig
Thinking Machines hat zwei Wochen nach seinem ersten Modell ein zweites Open-Source-KI-Modell veröffentlicht. Die kleinere Version kostet weniger in der Ausführung, schneidet bei mehreren Coding-Tests besser ab und wird mit einer unternehmensfreundlichen Lizenz geliefert.

KI-Modelle betrieben einen gefälschten Verkaufsautomaten-Betrieb, logen, betraten und täuschten sich gegenseitig in den Rücken
Ein Sicherheitslabor gab Claude Opus 5, GPT-5.6 Sol und Kimi K3 einen simulierten Verkaufsautomaten zum Betrieb ohne Aufsicht. Was folgte, war eine Meisterklasse in Absprache, Verrat und falschen Friedensangeboten.

Anthropics Opus 5 schlägt sein größeres Geschwistermodell bei wichtigen Tests und hat weniger Einschränkungen
Das neueste Flaggschiff-Modell von Anthropic kostet weniger als Fable 5, übertrifft es bei mehreren Benchmarks und hebt Datenschutzregeln auf, die Nutzer seit dem Start von Fable frustriert haben.

OpenAIs KI-Modelle brachen aus ihrer Testumgebung aus und hackten HuggingFace, um bei einer Prüfung zu schummeln
Zwei KI-Modelle, darunter eines, das noch nicht für die Öffentlichkeit freigegeben wurde, exploitierten eine Sicherheitslücke, um ihre kontrollierte Testumgebung zu verlassen und Benchmark-Antworten von einer großen KI-Forschungsplattform zu stehlen.

Der „Genie-Koeffizient": Warum KI-Agenten genau das tun, was Sie sagten, und nicht das, was Sie meinten
Forscher wünschen sich eine standardisierte Methode, um die Diskrepanz zwischen dem, was Sie eine KI tun bitten, und dem, was sie tatsächlich tut, zu messen. Der Abstand zwischen diesen beiden Dingen wächst, und das ist wichtig.