Investigadores de Apple Descubren un Defecto Oculto que Puede Corromper Silenciosamente las Imágenes Generadas por IA

Un pequeño número de puntos de datos rogue, llamados tokens outlier, pueden desestabilizar los sistemas que crean imágenes de IA. Una nueva investigación explica qué son y cómo solucionarlos.

AI2Day Newsdesk3 min read
A sleek, modern corporate security operations room photographed from a low angle looking toward a large curved desk with multiple dark monitors displaying abstr
Share

Puntos clave

  • Apple ML Research identificó un fallo específico, llamado tokens outlier, dentro de sistemas de generación de imágenes de IA construidos en un diseño conocido como Diffusion Transformers.
  • Estos tokens outlier aparecen tanto en la parte del sistema que lee imágenes como en la que crea nuevas.
  • El problema es más grave en las capas intermedias del modelo de IA, las etapas de procesamiento entre la entrada y la salida final.
  • Sin control, los tokens outlier pueden dirigir la atención del modelo hacia lugares equivocados, reduciendo la calidad y precisión de las imágenes generadas.

Imagina un aula donde un estudiante muy ruidoso interrumpe constantemente cada lección. Aunque ese estudiante nunca diga nada útil, el resto de la clase sigue mirando. Algo muy similar ocurre dentro de los sistemas de IA que generan imágenes a partir de indicaciones de texto.

Los investigadores de Apple ML Research han identificado el problema en detalle. Los causantes se llaman tokens outlier. Un token, en este contexto, es un pequeño fragmento de información que procesa la IA, aproximadamente como una palabra en una oración, pero para imágenes. Un token outlier es uno que lleva un valor numérico inusualmente grande, lo que lo hace parecer mucho más importante de lo que realmente es.

¿Qué exactamente sale mal?

Los tokens outlier roban atención. La IA dedica poder de procesamiento a ellos aunque lleven muy poca información real sobre la imagen que se está construyendo.

La investigación se centra en una clase de modelo llamada Diffusion Transformers, o DiTs. Estos son los motores que impulsan muchos de los mejores generadores de imágenes de IA de hoy. Funcionan en dos etapas principales. Primero, un codificador (piénsalo como las gafas de lectura del modelo) convierte una imagen real en una descripción matemática compacta. Luego un decodificador (el motor creativo) construye gradualmente una nueva imagen a partir del ruido, guiado por esa descripción.

El equipo de Apple descubrió que los tokens outlier causan problemas en ambas etapas. Los codificadores preentrenados pueden entregar representaciones distorsionadas al decodificador antes de que comience su trabajo. Y el decodificador en sí puede desarrollar sus propios tokens outlier mientras procesa, especialmente en lo profundo de sus capas intermedias.

¿Afecta esto a las imágenes que las personas realmente usan?

Potencialmente sí, aunque el documento describe un hallazgo de investigación más que un defecto de producto lanzado.

Cuando la atención del modelo se dirige hacia tokens sin sentido, la imagen final puede desviarse de lo que pidió el usuario. Se pierden detalles. La coherencia sufre. Cuanto más complejo sea el indicador, más oportunidades tienen los tokens outlier de causar problemas.

La buena noticia: los investigadores también estudiaron formas de suprimir estos outliers. Su trabajo señala posibles soluciones prácticas que podrían incorporarse a futuros modelos.

Para cualquiera que use herramientas de imágenes de IA hoy, esta investigación no requiere ninguna acción. Se sitúa a nivel fundamental, el tipo de hallazgo que los ingenieros utilizan para construir sistemas mejores en la próxima generación de herramientas.

¿Qué sucede a continuación?

La investigación está en una etapa temprana y exploratoria. No se han anunciado cambios de producto ni actualizaciones de modelos públicos.

Lo que hace que este trabajo sea significativo es que trae un problema conocido de una clase más antigua de modelos de IA (Vision Transformers usados en reconocimiento de imágenes) al mundo más nuevo de la generación de imágenes. Los investigadores habían identificado tokens outlier en modelos de reconocimiento antes, pero su papel en sistemas generativos había sido poco estudiado hasta ahora.

Estudiar la enfermedad cuidadosamente es el primer paso necesario antes de curarla.

Preguntas frecuentes

¿Afectará esto a las herramientas de imágenes de IA que ya uso?

No directa o inmediatamente. Esta es investigación fundamental, no una actualización de producto. Los hallazgos probablemente informarán cómo se diseñan y entrenan los futuros modelos de generación de imágenes.

¿Qué es un Diffusion Transformer en términos simples?

Es el tipo de arquitectura de IA, o estructura interna, utilizada por muchas herramientas modernas de generación de imágenes. Funciona comenzando con ruido aleatorio y dándole forma gradualmente hasta convertirlo en una imagen coherente, guiado por tu indicación de texto.

© 2026 AI2Day