El atajo de Apple para la IA: cómo un truco de 'borrador y verificación' hace que los modelos de razonamiento sean el doble de rápidos
Apple ML Research ha desarrollado una forma más inteligente de acelerar el pensamiento de la IA, que verifica el significado en lugar de contar palabras exactas. Podría reducir a la mitad el costo de ejecutar IA potente.

Puntos clave
- Apple ML Research publicó una técnica llamada Arbitrage que acelera los modelos de razonamiento de IA hasta 2 veces sin sacrificar la calidad de las respuestas.
- El método mejora un truco de velocidad existente llamado Especulación Decodificada juzgando si un borrador de respuesta es lo suficientemente bueno, no solo palabra por palabra correcto.
- El razonamiento Chain-of-Thought largo, el monólogo interno paso a paso que ayuda a la IA a resolver problemas difíciles, es particularmente costoso de ejecutar, lo que hace que las ganancias de velocidad aquí sean inusualmente valiosas.
- La técnica se dirige a modelos de lenguaje grandes, la tecnología detrás de chatbots como ChatGPT y Claude, en la etapa de inferencia, que es cuando la IA genera realmente una respuesta para un usuario.
Cada vez que le haces una pregunta difícil a un potente chatbot de IA, algo costoso sucede detrás de escenas. El modelo piensa el problema paso a paso, un proceso que los investigadores llaman razonamiento Chain-of-Thought, antes de darte una respuesta. Todo ese pensamiento consume poder de computación rápidamente.
Apple ML Research ha publicado un artículo que describe una técnica llamada Arbitrage que podría hacer ese proceso considerablemente más barato. Es el tercer artículo de Apple ML Research que hemos cubierto desde principios de agosto, siguiendo trabajos sobre alucinación de IA y un nuevo enfoque para la generación de texto.
¿Cuál es el problema que resuelve?
La industria de la IA ya tiene un truco de velocidad llamado Especulación Decodificada. Un modelo pequeño, rápido pero menos preciso escribe un borrador aproximado de la respuesta, token por token, donde un token es aproximadamente un fragmento de palabra. Luego, el modelo grande y preciso verifica ese borrador de una vez. Verificar en bloque es más rápido que generar desde cero.
Hay un inconveniente. El modelo grande descarta tokens en el momento en que no coinciden exactamente con su propia predicción, incluso cuando el significado es perfectamente correcto. Si el borrador dice "por lo tanto" y el modelo grande hubiera escrito "entonces", eso cuenta como un fracaso. El borrador se rechaza y el trabajo comienza de nuevo, desperdiciando esfuerzo.
Arbitrage lo arregla haciendo una pregunta más inteligente. En lugar de "¿es esta palabra idéntica?" pregunta "¿conduce esta respuesta a un resultado correcto?"
¿Cómo funciona realmente?
El sistema entrena un pequeño modelo de puntuación, llamado modelo de ventaja, para juzgar si un paso de borrador es lo suficientemente bueno para mantener, aunque la redacción difiera. El nombre Arbitrage proviene de la idea de detectar valor que otros pierden: encontrar tokens de borrador que sean correctos en sustancia incluso sin una coincidencia de palabras perfecta.
Debido a que se descartan menos borradores, el pequeño modelo rápido contribuye mucho más trabajo útil. El modelo grande dedica menos tiempo a regenerar pasos desde cero. En las pruebas, el enfoque alcanzó velocidades hasta dos veces más rápidas que ejecutar el modelo grande solo, mientras mantiene la calidad de respuesta estable.
¿Por qué es esto importante para los usuarios ordinarios?
La inferencia más rápida, es decir, la generación de respuestas más rápida, se traduce directamente en tiempos de espera más cortos y costos de operación más bajos para las empresas que crean productos de IA. Los costos más bajos pueden significar suscripciones más baratas o características de IA llegando a dispositivos con menos poder de computación.
El razonamiento Chain-of-Thought es lo que permite a la IA moderna manejar problemas matemáticos, codificación y planificación compleja. Hacerlo más barato de ejecutar significa que esas capacidades pueden llegar a más personas.
Arbitrage no cambiará lo que ves en la pantalla hoy. Pero la infraestructura que mejora se encuentra debajo de casi todos los productos de IA serios que ya usas.
Preguntas frecuentes
¿Esto hace que las respuestas de IA sean menos confiables?
No. El modelo de ventaja se entrena para aceptar pasos de borrador solo cuando conducen a resultados correctos. La calidad de respuesta en las pruebas de Apple se mantuvo estable mientras aumentaba la velocidad.
¿Aparecerá esto en los propios productos de Apple?
Apple ML Research publicó esto como investigación académica. Aún no hay anuncio de producto, pero técnicas como esta rutinariamente se trasladaron de documentos de investigación a productos disponibles dentro de uno a dos años.



