Ваша карта даних AI має приховану шар. Дослідники хочуть її використовувати.

Дослідження Apple ML Research показує, що структура, яку інструменти AI тихо будують під час організації даних, може розкрити набагато більше, ніж красиві графіки, на які зазвичай дивляться дослідники.

AI2Day Newsdesk3 min read
Extreme close-up macro photograph of microscopic geometric and organic shapes self-assembling from glowing double-helix strands on a dark background, editorial
Share

Ключові моменти

  • Apple ML Research опублікувала дослідження, яке показує, що приховану внутрішню структуру всередині популярного інструменту візуалізації даних чекає невикористаний аналітичний потенціал.
  • Структура, названа графом k-найближчих сусідів, фіксує зв'язки між точками даних до того, як виникають спотворення під час створення графіків.
  • Три стандартні алгоритми графів, застосовані до цієї структури, можуть визначити репрезентативні приклади, знайти щільні кластери та виявити викиди.
  • Результати застосовуються широко до будь-якої галузі, яка використовує цей інструмент, від геноміки до бізнес-аналітики.

Коли дослідники даних хочуть розібратися в масивному наборі даних, вони часто звертаються до інструменту, який називається UMAP (вимовляється як «ю-мап»), скорочення від Uniform Manifold Approximation and Projection. Подумайте про UMAP як про машину, яка бере тисячі точок даних, що плавають у важко уявному багатовимірному просторі, і стискає їх до 2D діаграми розсіювання, якій можна насправді слідкувати очима.

Цей графік дійсно корисний. Але нове дослідження стверджує, що ми викидали найціннішу частину.

Яка прихована структура все ігнорують?

До того, як UMAP малює свій графік, він тихо будує карту того, які точки даних найбільше близькі до яких інших. Ця карта — це граф k-найближчих сусідів, мережа з'єднань, що показує, що точка A тісно пов'язана з точками B, C і D, точка B — з іншими, і так далі, по всьому набору даних.

2D граф, який люди насправді використовують, — це стиснена, спотворена версія тієї мережі. Відстані стискаються та розтягуються. Деякі зв'язки зникають повністю.

Оригінальна мережа, яка досі знаходиться в пам'яті інструменту, вірно зберігає ці зв'язки. Apple ML Research каже, що майже ніхто на неї не дивиться.

Що можна з цим насправді робити?

Дослідники протестували три добре відомих алгоритми графів, інструменти, запозичені з мережевої науки, тієї самої дисципліни, яку використовують для вивчення соціальних мереж та дорожних систем, на цій прихованій структурі.

Алгоритм Що він робить Практичний результат
PageRank Оцінює кожну точку за тим, скільки в неї важливих сусідів Виявляє найрепрезентативніші приклади у даних
Розкладання k-core Видаляє слабо пов'язані точки шар за шаром Розкриває найщільніші, найтісніше згруповані групи
Виявлення викидів Знаходить точки з незвично малим чи слабким з'єднанням Позначає рідкісні чи аномальні випадки

PageRank, для тих, хто пам'ятає ранній Google, був оригінальною формулою, яку Google використовував для ранжування веб-сторінок. Застосована тут, вона знаходить точки даних, які найкраще представляють кластер, корисно, якщо вам потрібно вибрати один приклад із тисячі, щоб показати колегі або навчити іншу модель.

Розкладання k-core, у свою чергу, не просто знаходить кластери. Це показує їхню внутрішню структуру, які частини — це щільне ядро, а які — вільна окраїна.

Чому це має значення людям, які не дослідники даних?

Ці методи знаходяться всередині інструментів, використовуваних для дослідження медичних записів, поведінки клієнтів, фінансових транзакцій та наукових досліджень. Краще виявлення кластерів означає чистіші категорії. Краще виявлення викидів означає, що незвичайні випадки, рідкісна презентація захворювання, підозріла транзакція, отримують позначку замість того, щоб бути похованими.

Але варто назвати одну заувагу: це науковий документ, а не оновлення продукту. Аналітики та вчені в вашій компанії мали б впровадити ці ідеї. Цей крок займає час і майстерність.

Справедливе застереження також варто дати. Документ показує, що можливо на демонстраційних наборах даних. Результати в реальному світі сильно залежать від якості даних та того, наскільки ретельно налаштований інструмент.

Чесна висновок: якщо ви працюєте з кимось, хто використовує UMAP для дослідження даних, запитайте їх, чи також дивляться вони на граф kNN. Відповідь майже напевно ні, і це може бути варто змінити.

© 2026 AI2Day