Ваша карта данных AI имеет скрытый слой. Исследователи хотят его использовать.

Исследование Apple ML Research показывает, что структура, которую инструменты ИИ тихо создают при организации данных, может раскрыть гораздо больше, чем красивые диаграммы, которые обычно изучают исследователи.

AI2Day Newsdesk3 min read
Extreme close-up macro photograph of microscopic geometric and organic shapes self-assembling from glowing double-helix strands on a dark background, editorial
Share

Ключевые моменты

  • Apple ML Research опубликовала исследование, показывающее, что скрытая внутренняя структура популярного инструмента визуализации данных содержит неиспользованный аналитический потенциал.
  • Эта структура, называемая графом k-ближайших соседей, фиксирует связи между точками данных до того, как появятся искажения при создании диаграммы.
  • Три стандартных алгоритма работы с графами, применённые к этой структуре, могут выявить репрезентативные примеры, найти плотные кластеры и обнаружить выбросы.
  • Полученные результаты широко применимы к любой области, использующей этот инструмент, от геномики до бизнес-аналитики.

Когда специалисты по данным хотят разобраться в огромном наборе данных, они часто обращаются к инструменту UMAP (произносится «ю-мап»), сокращение от Uniform Manifold Approximation and Projection. UMAP можно представить как машину, которая берёт тысячи точек данных, плавающих в сложном для восприятия многомерном пространстве, и сжимает их в двумерную диаграмму рассеяния, которую можно реально отследить взглядом.

Эта диаграмма действительно полезна. Но новое исследование утверждает, что мы выбрасываем самую ценную часть.

Какую скрытую структуру все игнорируют?

Прежде чем UMAP рисует диаграмму, он тихо создаёт карту того, какие точки данных находятся ближе всего друг к другу. Эта карта — граф k-ближайших соседей, сеть связей, показывающая, что точка A тесно связана с точками B, C и D, точка B с другими, и так далее, по всему набору данных.

Двумерная диаграмма, которую люди на самом деле используют, — это сжатая, искажённая версия этой сети. Расстояния сжимаются и растягиваются. Некоторые связи полностью исчезают.

Исходная сеть, всё ещё хранящаяся в памяти инструмента, верно сохраняет эти связи. Apple ML Research говорит, что почти никто на неё не смотрит.

Что вы можете с этим делать?

Исследователи протестировали три хорошо известных алгоритма работы с графами, инструменты, заимствованные из теории сетей, той же дисциплины, которая используется для изучения социальных сетей и дорожных систем, на этой скрытой структуре.

Алгоритм Что он делает Практический результат
PageRank Оценивает каждую точку по количеству важных соседей Выявляет наиболее репрезентативные примеры в данных
k-core decomposition Удаляет слабо связанные точки слой за слоем Обнажает самые плотные, наиболее плотно сгруппированные группы
Обнаружение выбросов Находит точки с необычно малым количеством или слабыми связями Помечает редкие или аномальные случаи

PageRank, для тех, кто помнит ранний Google, был исходной формулой, которую Google использовал для ранжирования веб-страниц. Применённый здесь, он находит точки данных, которые лучше всего представляют кластер, что полезно, если вам нужно выбрать один пример из тысячи, чтобы показать коллеге или обучить другую модель.

K-core decomposition, между тем, не просто находит кластеры. Он показывает их внутреннюю структуру — какие части являются жёсткой сердцевиной, а какие — рыхлой периферией.

Почему это должно волновать того, кто не специалист по данным?

Эти методы встроены в инструменты, используемые для исследования медицинских записей, поведения потребителей, финансовых операций и научных исследований. Лучшее обнаружение кластеров означает более чистые категории. Лучшее обнаружение выбросов означает, что необычные случаи — редкое проявление болезни, подозрительная транзакция — отмечаются, а не остаются незамеченными.

Оговорка, которую стоит упомянуть: это исследовательская работа, а не обновление продукта. Аналитики и учёные в вашей компании должны были бы реализовать эти идеи. Этот шаг требует времени и навыков.

Справедливое предостережение: статья показывает, что возможно на демонстрационных наборах данных. Результаты в реальном мире во многом зависят от качества данных и того, насколько тщательно настроен инструмент.

Честный вывод: если вы работаете с кем-то, кто использует UMAP для исследования данных, спросите, смотрят ли они также на граф kNN. Ответ почти наверняка отрицательный, и это может стоить того, чтобы измениться.

© 2026 AI2Day