Des chercheurs d'Apple découvrent un défaut caché qui peut corrompre silencieusement les images générées par l'IA

Un petit nombre de points de données rogue, appelés tokens aberrants, peuvent dérégler les systèmes qui créent des images IA. De nouvelles recherches expliquent ce qu'ils sont et comment les corriger.

AI2Day Newsdesk3 min read
A sleek, modern corporate security operations room photographed from a low angle looking toward a large curved desk with multiple dark monitors displaying abstr
Share

Points clés

  • Apple ML Research a identifié un défaut spécifique, appelé tokens aberrants, au sein des systèmes de génération d'images IA construits selon une conception connue sous le nom de Diffusion Transformers.
  • Ces tokens aberrants apparaissent à la fois dans la partie du système qui lit les images et dans celle qui en crée de nouvelles.
  • Le problème est le plus grave dans les couches intermédiaires du modèle IA, les étapes de traitement entre l'entrée et la sortie finale.
  • S'ils ne sont pas maîtrisés, les tokens aberrants peuvent détourner l'attention du modèle vers les mauvais endroits, réduisant la qualité et la précision des images générées.

Imaginez une salle de classe où un élève très bruyant interrompt constamment tous les cours. Même si cet élève ne dit jamais rien d'utile, le reste de la classe se tourne quand même pour le regarder. Quelque chose de très similaire se produit à l'intérieur des systèmes IA qui génèrent des images à partir d'invites textuelles.

Des chercheurs chez Apple ML Research ont identifié le problème en détail. Les fauteurs de trouble s'appellent tokens aberrants. Un token, dans ce contexte, est un petit morceau d'information que l'IA traite, à peu près comme un mot dans une phrase, mais pour les images. Un token aberrant est un token qui porte une valeur numérique inhabituellement grande, le rendant beaucoup plus important qu'il ne l'est réellement.

Qu'est-ce qui se passe exactement ?

Les tokens aberrants volent l'attention. L'IA consacre sa puissance de traitement à ces tokens même s'ils contiennent très peu d'informations réelles sur l'image en cours de construction.

La recherche porte sur une catégorie de modèle appelée Diffusion Transformers, ou DiTs. Ce sont les moteurs alimentant de nombreux meilleurs générateurs d'images IA actuels. Ils fonctionnent en deux étapes principales. D'abord, un encodeur (comme les lunettes de lecture du modèle) convertit une image réelle en une description mathématique compacte. Ensuite, un débruiteur (le moteur créatif) construit progressivement une nouvelle image à partir du bruit, guidé par cette description.

L'équipe d'Apple a découvert que les tokens aberrants causent des problèmes à ces deux étapes. Les encodeurs préentraînés peuvent transmettre des représentations déformées au débruiteur avant même qu'il ne commence son travail. Et le débruiteur lui-même peut développer ses propres tokens aberrants en traitant, particulièrement profondément dans ses couches intermédiaires.

Cela affecte-t-il les images que les gens utilisent réellement ?

Potentiellement oui, bien que l'article décrive une découverte de recherche plutôt qu'un défaut de produit livré.

Quand l'attention du modèle est détournée vers des tokens sans sens, l'image finale peut s'écarter de ce que l'utilisateur a demandé. Les détails sont supprimés. La cohérence en souffre. Plus l'invite est complexe, plus les tokens aberrants ont l'occasion de causer des problèmes.

La bonne nouvelle : les chercheurs ont également étudié des façons de supprimer ces aberrations. Leur travail pointe vers des corrections pratiques qui pourraient être intégrées dans les futurs modèles.

Pour quiconque utilise les outils de génération d'images IA aujourd'hui, cette recherche ne nécessite aucune action. Elle se situe au niveau fondamental, le type de découverte que les ingénieurs utilisent pour construire de meilleurs systèmes dans la prochaine génération d'outils.

Que se passe-t-il ensuite ?

La recherche est à un stade précoce et exploratoire. Aucun changement de produit ou mise à jour de modèle public n'a été annoncé.

Ce qui rend ce travail significatif est qu'il porte un problème connu d'une classe plus ancienne de modèles IA (Vision Transformers utilisés en reconnaissance d'images) dans le monde plus récent de la génération d'images. Les chercheurs avaient déjà repéré des tokens aberrants dans les modèles de reconnaissance, mais leur rôle dans les systèmes génératifs était largement non étudié jusqu'à présent.

Étudier la maladie soigneusement est la première étape nécessaire avant de la guérir.

Questions courantes

Cela affectera-t-il les outils de génération d'images IA que j'utilise déjà ?

Pas directement ou immédiatement. Il s'agit d'une recherche fondamentale, pas d'une mise à jour de produit. Les découvertes informeront probablement la façon dont les futurs modèles de génération d'images sont conçus et entraînés.

Qu'est-ce qu'un Diffusion Transformer en termes simples ?

C'est le type d'architecture IA, ou structure interne, utilisé par de nombreux outils modernes de génération d'images. Il fonctionne en commençant par du bruit aléatoire et en le façonnant progressivement en une image cohérente, guidé par votre invite textuelle.

© 2026 AI2Day