Por qué los modelos de IA aún inventan detalles en imágenes, y qué están haciendo al respecto los investigadores de Apple

Un nuevo estudio de Apple ML Research investiga por qué los modelos de IA multimodales alucina, es decir, describen imágenes con detalles que suenan confiados pero que simplemente no están allí, y cómo una técnica de entrenamiento llamada alineación de preferencias podría solucionarlo.

AI2Day Newsdesk4 min read
Full-frame edge-to-edge overhead photoreal view of a dark security operations center desk at night, multiple monitors glowing with abstract telemetry graphs and
Share

Puntos clave

  • Los modelos de lenguaje grandes multimodales, sistemas de IA que procesan tanto imágenes como texto, frecuentemente "alucina" generando descripciones que contradicen lo que realmente hay en una imagen.
  • La alineación de preferencias, un método de entrenamiento que enseña a un modelo a preferir respuestas precisas sobre las que suenan plausibles, está bien establecida para la IA solo de texto pero es mucho menos estudiada para modelos de comprensión de imágenes.
  • Apple ML Research publicó un estudio exhaustivo que examina cómo las técnicas de alineación afectan a los modelos de imagen-lenguaje, cubriendo qué funciona, qué no, y por qué.
  • Los hallazgos importan más allá de los laboratorios de investigación: estos modelos potencian funciones como subtítulos de imágenes, búsqueda visual y herramientas de accesibilidad que millones de personas usan todos los días.

Pídele a una IA que describa una foto y generalmente acertará la mayoría de las cosas. Pero a veces añade con confianza objetos, personas o texto que simplemente no están en la imagen. Los investigadores llaman a esto alucinación, y es un problema conocido y persistente con una clase de sistemas de IA llamados modelos de lenguaje grandes multimodales, o MLLMs, que son modelos de IA entrenados para entender tanto imágenes como lenguaje escrito al mismo tiempo.

Para un chatbot solo de texto, la alucinación significa afirmar un hecho incorrecto. Para un modelo de imagen, puede significar algo más desconcertante: describir un auto rojo como azul, inventar un letrero en la pared de una tienda, o afirmar que una persona está sonriendo cuando no lo está. El modelo no está mintiendo, simplemente no tiene un ancla confiable a la imagen que tiene delante.

¿Por qué sigue sucediendo esto?

Los modelos de IA solo de texto se han beneficiado enormemente de un paso de entrenamiento llamado alineación de preferencias. En resumen: después del entrenamiento inicial, los investigadores muestran al modelo pares de respuestas y le enseñan a preferir la más precisa y útil. Con miles de ejemplos, el modelo aprende a autocorregirse.

El problema es que este paso de corrección ha sido estudiado mucho menos para modelos que manejan imágenes. Un modelo entrenado principalmente en texto desarrolla instintos fuertes sobre cómo deberían sonar las oraciones. Cuando añades imágenes, esos instintos no se transfieren automáticamente a la verificación de hechos visuales.

¿Qué encontró el estudio de Apple?

La investigación, publicada por Apple ML Research y presentada inicialmente en una revisión de preimpresión más amplia, se propuso mapear el problema de manera sistemática. El equipo examinó cómo diferentes estrategias de alineación de preferencias cambian el comportamiento de los modelos de imagen-lenguaje, probando qué enfoques reducen la alucinación y cuáles se quedan cortos.

Una perspectiva clave que el estudio destaca es que la alineación para MLLMs debe considerar una segunda dimensión de precisión: no solo "¿es esta oración factualment correcta?" sino "¿esta oración coincide con lo que hay en la imagen?" Estas son preguntas diferentes, y los métodos de entrenamiento construidos solo para texto no manejan automáticamente la verificación visual.

El estudio se posiciona como un recurso para la comunidad investigadora más amplia, mapeando lo que se entiende, lo que permanece abierto y dónde se encuentran las direcciones más prometedoras.

¿Qué significa esto para los usuarios ordinarios?

Si usas una aplicación que lee descripciones de imágenes, etiqueta fotos automáticamente o responde preguntas sobre imágenes que subes, estás confiando en esta tecnología. Las alucinaciones en esos contextos son más que una curiosidad: una descripción incorrecta en una herramienta de accesibilidad puede desorientar genuinamente a un usuario con discapacidad visual.

El entrenamiento de alineación mejorado es uno de los caminos más claros hacia modelos que sean honestos sobre lo que realmente ven. El progreso aquí no requiere que los usuarios hagan nada diferente. Sucede dentro del proceso de entrenamiento, mucho antes de que un producto llegue a tu teléfono.

Preguntas frecuentes

¿Es la alucinación el mismo problema en modelos de imagen que en chatbots de texto?

No exactamente. Los chatbots de texto alucina al afirmar hechos incorrectos. Los modelos de imagen pueden hacer eso también, pero también pueden contradecir la evidencia visual justo frente a ellos, describiendo cosas que no están allí o perdiendo cosas que claramente están.

¿Cambia este estudio algún producto que pueda usar ahora mismo?

No. Esta es investigación fundamental, no un anuncio de producto. Su valor está en dar a otros investigadores un mapa más claro del problema para que los modelos futuros, en muchas empresas, se construyan con un entrenamiento de alineación más fuerte desde el principio.

© 2026 AI2Day