El atajo de Apple: Cómo un truco de 'borrador y verificación' hace que los modelos de razonamiento sean el doble de rápidos
Apple ML Research ha desarrollado una forma más inteligente de acelerar el pensamiento de la IA, que verifica el significado en lugar de contar palabras exactas. Podría reducir el costo de ejecutar IA poderosa a la mitad.

Puntos clave
- Apple ML Research publicó una técnica llamada Arbitrage que acelera los modelos de razonamiento de IA hasta 2x sin sacrificar la calidad de las respuestas.
- El método mejora un truco de velocidad existente llamado Especulación Decodificadora al juzgar si un borrador es lo suficientemente bueno, no solo correcto palabra por palabra.
- El razonamiento largo de Cadena de Pensamiento, el monólogo interno paso a paso que ayuda a la IA a resolver problemas difíciles, es particularmente costoso de ejecutar, lo que hace que las mejoras de velocidad aquí sean inusualmente valiosas.
- La técnica se dirige a modelos de lenguaje grande, la tecnología detrás de chatbots como ChatGPT y Claude, en la etapa de inferencia, que es el momento en que la IA genera una respuesta para un usuario.
Cada vez que haces una pregunta difícil a un poderoso chatbot de IA, sucede algo costoso detrás de escenas. El modelo analiza el problema paso a paso, un proceso que los investigadores llaman razonamiento de Cadena de Pensamiento, antes de darte una respuesta. Todo ese pensamiento consume energía de computación rápidamente.
Apple ML Research ha publicado un artículo describiendo una técnica llamada Arbitrage que podría hacer que ese proceso sea significativamente más barato.
¿Cuál es el problema que resuelve?
La industria de la IA ya tiene un truco de velocidad llamado Especulación Decodificadora. La idea es simple: usa un modelo pequeño, rápido pero menos preciso para escribir un borrador aproximado de la respuesta, palabra por palabra. Luego deja que el modelo grande y preciso verifique ese borrador todo de una vez. Verificar en masa es más rápido que generar desde cero.
¿El inconveniente? El modelo grande desecha palabras en el momento en que no coinciden exactamente con su propia predicción, incluso cuando el significado es perfectamente correcto. Si el borrador dice "por lo tanto" y el modelo grande hubiera escrito "entonces", eso cuenta como un fracaso. El borrador se rechaza y el trabajo comienza de nuevo. Ese es un esfuerzo desperdiciado.
Arbitrage lo soluciona haciendo una pregunta más inteligente. En lugar de "¿es esta palabra idéntica?" pregunta "¿esta respuesta lleva a un resultado correcto?"
¿Cómo funciona realmente?
El sistema entrena un pequeño modelo de puntuación, llamado modelo de ventaja, para juzgar si un paso de borrador es lo suficientemente bueno para mantenerlo, incluso si la redacción difiere. El nombre Arbitrage proviene de la idea de detectar valor que otros pierden: encontrar tokens de borrador, los fragmentos de palabras individuales que produce una IA, que son correctos en esencia aunque no sean una coincidencia perfecta.
Debido a que se descartan menos borradores, el modelo pequeño rápido contribuye con mucho más trabajo útil. El modelo grande dedica menos tiempo a regenerar pasos desde cero.
En las pruebas, el enfoque alcanzó velocidades hasta dos veces más rápidas que ejecutar el modelo grande solo, manteniendo la calidad de la respuesta al mismo nivel.
¿Por qué esto importa a los usuarios ordinarios?
Una inferencia más rápida, es decir, una generación de respuestas más rápida, se traduce directamente en tiempos de espera más cortos y costos de operación más bajos para las empresas que construyen productos de IA. Los costos más bajos pueden significar suscripciones más baratas, respuestas más rápidas o características de IA que llegan a dispositivos con menos potencia de computación.
El razonamiento de Cadena de Pensamiento es lo que permite a la IA moderna manejar problemas matemáticos, análisis legal, codificación y planificación compleja. Hacer que sea más barato ejecutar significa que esas capacidades pueden llegar a más personas.
Arbitrage no cambiará lo que ves en pantalla hoy. Pero la infraestructura que mejora está debajo de casi todos los productos serios de IA que ya utilizas.
Preguntas frecuentes
¿Hace esto que las respuestas de IA sean menos confiables?
No. El modelo de ventaja se entrena para aceptar pasos de borrador solo cuando conducen a resultados correctos. La calidad de la respuesta en las pruebas de Apple se mantuvo estable mientras la velocidad aumentaba.
¿Aparecerá esto en los propios productos de Apple?
Apple ML Research publicó esto como investigación académica. Aún no hay un anuncio de producto, pero técnicas como esta rutinariamente pasan de artículos de investigación a productos enviados dentro de uno a dos años.



