Por qué los modelos de IA aún inventan detalles en imágenes, y qué están haciendo los investigadores de Apple al respecto
Un nuevo estudio de Apple ML Research analiza por qué los modelos de IA multimodales alucina, es decir, describen imágenes con detalles que suenan seguros pero que simplemente no existen, y cómo una técnica de entrenamiento llamada alineación de preferencias podría solucionarlo.

Puntos clave
- Los modelos de lenguaje grande multimodales, sistemas de IA que procesan imágenes y texto, frecuentemente "alucina" generando descripciones que contradicen lo que realmente hay en una imagen.
- La alineación de preferencias, un método de entrenamiento que enseña a un modelo a preferir respuestas precisas sobre las que suenan plausibles, está bien establecida para IA de solo texto pero ha sido poco estudiada en modelos que comprenden imágenes.
- Apple ML Research publicó un estudio examinando cómo las técnicas de alineación afectan modelos de lenguaje e imagen, cubriendo qué funciona y qué no.
- Estos modelos potencian características como subtítulos de imágenes y herramientas de accesibilidad que millones de personas utilizan todos los días.
Pídele a una IA que describa una foto y generalmente acertará en la mayoría de las cosas. Pero a veces añade con confianza objetos o texto que simplemente no están en la imagen. Los investigadores llaman a esto alucinación, y es un problema conocido y persistente con una clase de sistemas de IA llamados modelos de lenguaje grande multimodales, o MLLMs, que son modelos de IA entrenados para entender imágenes y lenguaje escrito simultáneamente.
Para un chatbot de solo texto, la alucinación significa afirmar un hecho incorrecto. Los modelos de imagen pueden hacer eso también, pero también pueden contradecir la evidencia visual frente a ellos: describir un auto rojo como azul, inventar un letrero en la pared de una tienda, o afirmar que una persona sonríe cuando no lo está. El modelo no está mintiendo. Solo carece de un ancla confiable a la imagen.
¿Por qué sigue sucediendo?
Los modelos de IA de solo texto se han beneficiado enormemente de un paso de entrenamiento llamado alineación de preferencias. Después del entrenamiento inicial, los investigadores muestran al modelo pares de respuestas y le enseñan a preferir la más precisa y útil. A lo largo de miles de ejemplos, el modelo aprende a autocorregirse.
Ese paso de corrección ha sido estudiado mucho menos en modelos que manejan imágenes. Un modelo entrenado principalmente en texto desarrolla intuiciones sólidas sobre cómo deben sonar las oraciones. Cuando añades imágenes, esas intuiciones no se transfieren automáticamente a verificar hechos visuales.
¿Qué encontró el estudio de Apple?
Apple ML Research se propuso mapear el problema sistemáticamente. El equipo probó cómo diferentes estrategias de alineación de preferencias cambian el comportamiento de modelos de lenguaje e imagen, identificando qué enfoques reducen alucinaciones y cuáles quedan cortos.
El hallazgo más importante es que la alineación para MLLMs debe manejar una segunda dimensión de precisión: no solo "¿es esta oración factualmente correcta?" sino "¿coincide esta oración con lo que hay en la imagen?" Esas son preguntas diferentes, y los métodos de entrenamiento construidos solo para texto no manejan automáticamente la verificación visual. Nuestro informe anterior sobre el trabajo de Apple para ayudar a la IA a recuperarse a mitad de tarea del 24 de julio de 2026 mostró un patrón similar: las soluciones diseñadas para una modalidad rara vez se transfieren de manera clara a otra.
El estudio se posiciona como un recurso para la comunidad investigadora más amplia, mapeando problemas abiertos y señalando las direcciones más prometedoras.
¿Qué significa esto para los usuarios ordinarios?
Si utilizas una aplicación que lee descripciones de imágenes o responde preguntas sobre imágenes que cargas, estás confiando en esta tecnología. Las alucinaciones en esos contextos son más que una curiosidad. Una descripción incorrecta en una herramienta de accesibilidad puede realmente engañar a un usuario con discapacidad visual.
El entrenamiento de alineación mejorado es uno de los caminos más claros hacia modelos que se mantienen honestos sobre lo que realmente ven. El progreso ocurre dentro del proceso de entrenamiento, mucho antes de que un producto llegue a tu teléfono. Los usuarios no necesitan hacer nada diferente.
Preguntas frecuentes
¿Es la alucinación el mismo problema en modelos de imagen que en chatbots de texto?
No exactamente. Los chatbots de texto alucina al afirmar hechos incorrectos. Los modelos de imagen pueden hacer eso también, pero también pueden contradecir la evidencia visual justo frente a ellos, describiendo cosas que no existen o perdiendo cosas que claramente están.
¿Este estudio cambia algún producto que pueda usar ahora mismo?
No. Esta es investigación fundamental, no un anuncio de producto. Su valor está en darles a otros investigadores un mapa más claro del problema para que futuros modelos, en muchas empresas, se construyan con entrenamiento de alineación más sólido desde el principio.



