Ihre KI-Datenkarte hat eine verborgene Schicht. Forscher wollen sie nutzen.

Eine Studie von Apple ML Research zeigt, dass eine Struktur, die KI-Tools beim Organisieren von Daten stillschweigend aufbauen, weit mehr enthüllen kann als die üblichen Diagramme, die Forscher normalerweise betrachten.

AI2Day Newsdesk3 min read
Extreme close-up macro photograph of microscopic geometric and organic shapes self-assembling from glowing double-helix strands on a dark background, editorial
Share

Wichtigste Punkte

  • Apple ML Research veröffentlichte eine Studie, die zeigt, dass eine verborgene interne Struktur in einem beliebten Datenvisu alisierungstool ungenutzten analytischen Wert birgt.
  • Die Struktur, ein k-nearest-neighbor-Graph genannt, erfasst Beziehungen zwischen Datenpunkten, bevor Verzerrungen beim Erstellen von Diagrammen auftreten.
  • Drei Standard-Graphalgorithmen, die auf diese Struktur angewendet werden, können repräsentative Beispiele identifizieren, dichte Cluster finden und Ausreißer erkennen.
  • Die Erkenntnisse gelten für alle Bereiche, die dieses Tool verwenden, von der Genomik bis zur Business-Analytics.

Wenn Datenwissenschaftler versuchen, ein großes Dataset zu verstehen, greifen sie häufig zu einem Tool namens UMAP (ausgesprochen „you-map"), kurz für Uniform Manifold Approximation and Projection. Stellen Sie sich UMAP als eine Maschine vor, die Tausende von Datenpunkten aus einem schwer vorstellbaren multidimensionalen Raum nimmt und sie in ein zweidimensionales Streudiagramm quetscht, dem Ihre Augen tatsächlich folgen können.

Dieses Diagramm ist wirklich nützlich. Aber neue Forschung argumentiert, dass wir den wertvollsten Teil weggeworfen haben.

Was ist die verborgene Struktur, die alle ignorieren?

Bevor UMAP sein Diagramm zeichnet, erstellt es stillschweigend eine Karte, welche Datenpunkte welchen anderen am nächsten sind. Diese Karte ist ein k-nearest-neighbor-Graph, ein Netzwerk von Verbindungen, das zeigt, dass Punkt A eng mit den Punkten B, C und D verbunden ist, Punkt B mit anderen, und so weiter, über den gesamten Datensatz hinweg.

Das zweidimensionale Diagramm, das die Leute tatsächlich verwenden, ist eine komprimierte, verzerrte Version dieses Netzwerks. Distanzen werden gestaucht und gedehnt. Einige Beziehungen verschwinden ganz.

Das ursprüngliche Netzwerk, das noch im Speicher des Tools sitzt, bewahrt diese Beziehungen treu. Apple ML Research sagt, dass sich fast niemand damit beschäftigt.

Was können Sie damit tatsächlich tun?

Die Forscher testeten drei bekannte Graphalgorithmen, Werkzeuge aus der Netzwerkwissenschaft, derselben Disziplin, die zur Untersuchung von sozialen Netzwerken und Straßensystemen verwendet wird, auf dieser verborgenen Struktur.

Algorithmus Was er tut Praktisches Ergebnis
PageRank Bewertet jeden Punkt danach, wie viele wichtige Nachbarn er hat Bringt die repräsentativsten Beispiele in den Daten ans Licht
k-core decomposition Entfernt schwach verbundene Punkte Schicht für Schicht Legt die dichtesten, am dichtesten zusammenhängenden Gruppen frei
Ausreißererkennung Findet Punkte mit ungewöhnlich wenigen oder schwachen Verbindungen Kennzeichnet seltene oder anormale Fälle

PageRank, für diejenigen, die sich an das frühe Google erinnern, war die ursprüngliche Formel, die Google zur Rangfolge von Webseiten verwendete. Hier angewendet, findet es die Datenpunkte, die einen Cluster am besten repräsentieren, nützlich, wenn Sie ein Beispiel aus tausend auswählen müssen, um einem Kollegen zu zeigen oder ein anderes Modell zu trainieren.

K-core decomposition zeigt unterdessen nicht nur Cluster. Es zeigt ihre interne Struktur, welche Teile den engen Kern bilden und welche den lockeren Rand.

Warum sollte sich ein Nicht-Datenwissenschaftler dafür interessieren?

Diese Techniken befinden sich in Tools, die zur Erforschung von medizinischen Unterlagen, Kundenverhalten, Finanztransaktionen und wissenschaftlichen Forschung verwendet werden. Bessere Clustererkennung bedeutet saubere Kategorien. Bessere Ausreißererkennung bedeutet, dass ungewöhnliche Fälle, eine seltene Krankheitspräsentation, eine verdächtige Transaktion, gekennzeichnet werden, anstatt vergraben zu werden.

Der Haken, der erwähnenswert ist: Dies ist ein Forschungspapier, keine Produktaktualisierung. Die Analysten und Wissenschaftler in Ihrem Unternehmen würden diese Ideen implementieren müssen. Dieser Schritt erfordert Zeit und Geschick.

Ein fairer Hinweis auch: Das Papier zeigt, was auf Demonstrationsdatensätzen möglich ist. Ergebnisse in der Praxis hängen stark von der Datenqualität und davon ab, wie sorgfältig das Tool kalibriert wird.

Die ehrliche Erkenntnis: Wenn Sie mit jemandem arbeiten, der UMAP zum Erkunden von Daten nutzt, fragen Sie ihn, ob er auch den kNN-Graph betrachtet. Die Antwort ist mit Sicherheit nein, und das könnte sich lohnen zu ändern.

© 2026 AI2Day