#AI benchmarks
21 stories taggedAI benchmarks · page 2 of 2.

Ein billiges chinesisches KI-Modell bringt Programmierer zum Überdenken ihrer Rechnungen
GLM 5.2 von Z.ai kostet einen Bruchteil der Top-Modelle von Anthropic und bewältigt echte Aufgaben. Aber Ratenlimits, Halluzinationen und Datenschutzfragen bedeuten, dass es nicht für jeden geeignet ist.

Chinas Kimi K3 ist das bisher größte KI-Modell aus China und verunsichert den Markt
Moonshot AIs neues Kimi K3 hat 2,8 Billionen Parameter, schlägt mehrere Top-US-Modelle bei Schlüsseltests und ließ am Tag seiner Einführung die Aktienkurse konkurrierender chinesischer KI-Unternehmen abstürzen.

KI kann sich Konzepte aus wenigen Bildern nicht so merken wie Sie
Apple-Forscher testeten führende KI-Bildmodelle bei einer einfachen menschlichen Fähigkeit: Erkennen Sie, was eine Gruppe von Bildern gemeinsam haben, und wenden Sie diese Idee auf ein neues Bild an. Die Modelle schlugen überwiegend fehl.

Ein kleineres KI-Modell trainiert auf einer Sprache schlägt zwei größere, neuere Modelle beim Lesen von Brasilianischem Portugiesisch
DharmaOCR erzielte bessere Ergebnisse als sowohl Mistral OCR4 als auch Unlimited-OCR bei einem Portugiesisch-Lesetest – und der Grund liegt in der Spezialisierung, nicht in der Größe.

Babys lernen schneller als die leistungsstärksten KI-Systeme der Welt. Wissenschaftler wollen wissen, warum.
Ein neuer Test stellt modernste KI-Modelle gegen die Wahrnehmungsfähigkeit von Kleinkindern an – und die Kleinkinder gewinnen. Forscher sagen, dass die Untersuchung von Säuglingshirnen KI billiger, umweltfreundlicher und intelligenter machen könnte.

Sprachgesteuerte KI kann sprechen, aber kann sie auch wirklich zuhören?
Eine großangelegte Humanstudie zeigt, dass heutige beste Sprachmodelle oft die Pausen, Zögerungen und Tonwechsel übersehen, die echte Gespräche ausmachen.