Votre carte de données IA a une couche cachée. Les chercheurs veulent l'utiliser.
Une étude d'Apple ML Research montre qu'une structure qu'les outils d'IA construisent discrètement lors de l'organisation des données peut révéler bien plus que les jolis graphiques que les chercheurs examinent habituellement.

Points clés
- Apple ML Research a publié une étude montrant qu'une structure interne cachée à l'intérieur d'un outil populaire de visualisation de données recèle une valeur analytique inexploitée.
- La structure, appelée graphe k-plus-proches-voisins, capture les relations entre les points de données avant que la distorsion ne s'installe lors de la création de graphiques.
- Trois algorithmes de graphes standard appliqués à cette structure peuvent identifier des exemples représentatifs, trouver des clusters denses et détecter les valeurs aberrantes.
- Les résultats s'appliquent largement à tout domaine utilisant cet outil, de la génomique à l'analyse commerciale.
Lorsque les data scientists cherchent à donner un sens à un ensemble de données massif, ils se tournent souvent vers un outil appelé UMAP (prononcé « you-map »), abréviation de Uniform Manifold Approximation and Projection. Pensez à UMAP comme à une machine qui prend des milliers de points de données flottant dans un espace multidimensionnel difficile à visualiser et les compresse dans un nuage de points 2D que vos yeux peuvent réellement suivre.
Ce graphique est véritablement utile. Mais une nouvelle recherche soutient que nous avons jeté la partie la plus précieuse.
Quelle est la structure cachée que tout le monde ignore ?
Avant que UMAP ne dessine son graphique, il construit discrètement une carte indiquant quels points de données sont les plus proches les uns des autres. Cette carte est un graphe k-plus-proches-voisins, un réseau de connexions montrant que le point A est étroitement lié aux points B, C et D, le point B à d'autres, et ainsi de suite, dans tout l'ensemble de données.
Le graphique 2D que les gens utilisent réellement est une version compressée et déformée de ce réseau. Les distances sont comprimées et étirées. Certaines relations disparaissent entièrement.
Le réseau d'origine, toujours présent dans la mémoire de l'outil, préserve fidèlement ces relations. Apple ML Research dit que presque personne ne le consulte.
Qu'en pouvez-vous vraiment faire ?
Les chercheurs ont testé trois algorithmes de graphes bien connus, des outils empruntés à la science des réseaux, la même discipline utilisée pour étudier les réseaux sociaux et les systèmes routiers, sur cette structure cachée.
| Algorithme | Ce qu'il fait | Résultat pratique |
|---|---|---|
| PageRank | Évalue chaque point selon le nombre de voisins importants qu'il possède | Met en évidence les exemples les plus représentatifs dans les données |
| Décomposition k-core | Élimine couche après couche les points faiblement connectés | Expose les groupes les plus denses et les plus fortement regroupés |
| Détection des valeurs aberrantes | Trouve les points ayant inhabituellement peu de connexions ou des connexions faibles | Signale les cas rares ou anormaux |
PageRank, pour ceux qui se souviennent des débuts de Google, était la formule originale utilisée par Google pour classer les pages web. Appliquée ici, elle trouve les points de données qui représentent le mieux un cluster, utile si vous devez choisir un exemple parmi mille à montrer à un collègue ou pour entraîner un autre modèle.
La décomposition k-core, quant à elle, ne se contente pas de trouver des clusters. Elle montre leur structure interne, quelles parties constituent le noyau serré et lesquelles forment la frange lâche.
Pourquoi un non-data-scientist devrait-il s'en préoccuper ?
Ces techniques se trouvent à l'intérieur des outils utilisés pour explorer les dossiers médicaux, le comportement des clients, les transactions financières et la recherche scientifique. Une meilleure détection des clusters signifie des catégories plus nettes. Un meilleur repérage des valeurs aberrantes signifie que les cas inhabituels, une présentation rare de maladie, une transaction suspecte, sont signalés plutôt que d'être enterrés.
Le hic à mentionner : c'est un article de recherche, pas une mise à jour produit. Les analystes et chercheurs de votre entreprise devraient mettre en œuvre ces idées. Cette étape demande du temps et des compétences.
Un mot de prudence équitable également. L'article montre ce qui est possible sur des ensembles de données de démonstration. Les résultats réels dépendent fortement de la qualité des données et de la précision avec laquelle l'outil est réglé.
La conclusion honnête : si vous travaillez avec quelqu'un qui utilise UMAP pour explorer des données, demandez-lui s'il examine également le graphe kNN. La réponse est presque certainement non, et cela pourrait valoir le coup de changer.



