#AI benchmarks
21 stories taggedAI benchmarks.

AI aces trivia but fumbles riddles: the puzzle tests that expose what machines still can't do
From mental rotation to river-crossing logic, a new set of benchmarks shows where AI trips over problems any sharp human can crack, and where it beats us cold.

Un diminuto agente de IA de una startup de Londres superó a Anthropic y OpenAI en lectura de artículos científicos
Inherent, fundada por cuatro veteranos de Google DeepMind, afirma que su agente Faraday superó a modelos mucho más grandes de Anthropic y OpenAI en un punto de referencia clave de ciencia, a pesar de ejecutarse en un modelo aproximadamente una décima parte de su tamaño.

GLM-5.3 Opens Up to Developers at the Same Price as Its Predecessor
Chinese startup Z.ai's new frontier model is now available via API, matching the old per-token rate while scoring higher on independent benchmarks. But a quirk in how the model writes means your bill may still rise.

The AI 'harness' matters more than the model, Nvidia research shows
A custom wrapper built around Claude Opus 5 pushed its score on a hard reasoning test from 30% to a perfect 100%. The lesson: the scaffolding around an AI model may be the most important part of making it work.

AI speech models are cheating on their own tests, new research finds
A study of 11 popular voice transcription systems found that several reproduce known errors from benchmark datasets, even when the audio says something different. It raises a quiet but serious question: are high scores measuring real ability, or familiarity with the test?

Un modelo de IA de 27 mil millones de parámetros que puedes ejecutar en casa igualó a rivales exclusivos de la nube en pruebas de codificación
El Qwen3.8-27B de Alibaba es gratuito para descargar, cabe en una laptop de alta gama, y obtuvo puntuaciones equivalentes a modelos de nivel medio de OpenAI y Anthropic en benchmarks independientes. Los desarrolladores lo llaman la señal más clara hasta ahora de que la IA de frontera se está trasladando de la nube al hardware personal.

More Memory Does Not Always Mean a Smarter AI Agent
A study across eight AI models found that feeding an agent more of its own past experience can hurt as much as help. The right amount of memory depends entirely on how capable the model already is.

Google lanza Gemini 3.7 Flash solo tres semanas después de su predecesor
El nuevo modelo trae mejoras medibles en codificación y lectura de documentos, y llega con una tarifa introductoria reducida mientras Google enfrenta presión de competidores más económicos.

El marco Orchard de Microsoft permite que pequeños agentes de IA rindan muy por encima de su peso
Un nuevo kit de herramientas de código abierto de Microsoft Research entrena agentes de IA que pueden corregir código, navegar por la web y gestionar tareas, utilizando modelos mucho más pequeños que los gigantes actuales de frontera.

GraphRAG vs. RAG convencional: el marcador honesto
Un gráfico de conocimiento puede mejorar enormemente las respuestas de la IA, pero solo para ciertas preguntas, y la factura de indexación puede sorprenderte. Aquí está lo que cinco estudios realmente encontraron.

Inkling-Small es una cuarta parte del tamaño de su predecesor y casi tan capaz
Thinking Machines ha lanzado un segundo modelo de IA de código abierto apenas dos semanas después del primero. La versión más pequeña cuesta menos de ejecutar, obtiene puntuaciones más altas en varias pruebas de codificación y viene con una licencia compatible con los negocios.

Modelos de IA dirigieron un negocio falso de máquinas expendedoras, mintieron, engañaron y se traicionaron mutuamente
Un laboratorio de seguridad entregó a Claude Opus 5, GPT-5.6 Sol y Kimi K3 una máquina expendedora simulada para gestionar sin supervisión. Lo que siguió fue una lección magistral en colusión, traición y falsas ramas de olivo.

El Opus 5 de Anthropic supera a su modelo más potente en pruebas clave y viene con menos restricciones
El nuevo modelo insignia de Anthropic cuesta menos que Fable 5, lo supera en varios puntos de referencia y elimina las reglas de privacidad que han frustrado a los usuarios desde el lanzamiento de Fable.

Los modelos de IA de OpenAI escaparon de su caja de pruebas e irrumpieron en HuggingFace para copiar en un examen
Dos modelos de IA, incluido uno aún no lanzado al público, explotaron una falla de seguridad para escapar de su entorno de prueba controlado y robar respuestas de pruebas de una importante plataforma de investigación de IA.

El 'Coeficiente del Genio': Por Qué los Agentes de IA Hacen Exactamente lo Que Dijiste y Nada Parecido a lo Que Quisiste Decir
Los investigadores buscan una forma estándar de medir la brecha entre lo que le pides a una IA que haga y lo que realmente hace. La distancia entre esas dos cosas está creciendo, y es importante.