Исследователи нашли способ читать «скрытые мысли» ИИ, и это вызывает серьёзные вопросы безопасности
Команда компьютерных учёных взломала секретные цепочки рассуждений, которые крупные модели ИИ тщательно скрывают. Внутри они обнаружили утёкшие пароли и вызвали неудобные вопросы к китайской компании, разработчице ИИ.

Ключевые пункты
- Исследователи Университета Тюбингена и их коллеги разработали метод извлечения скрытых этапов рассуждения из крупных моделей ИИ, включая модели от OpenAI, Anthropic и Google.
- Эта же техника выявила приватные данные, такие как пароли и ключи API, хранящиеся в процессе рассуждения модели, хотя все три компании впоследствии устранили эту конкретную уязвимость.
- Китайская модель Kimi K3, разработанная Moonshot AI, продемонстрировала паттерны рассуждений, поразительно похожие на скрытые результаты Claude Opus 4.8 и GPT 5.6 Sol, что вызывает вопросы о том, была ли она обучена путём копирования этих моделей.
- Исследователи осторожны в выводах и подчёркивают, что сходство носит предположительный, а не доказательный характер.
- Полное решение более глубокой проблемы потребовало бы существенных изменений в том, как эти компании организуют свои программные интерфейсы.
У каждой продвинутой модели ИИ есть что-то вроде внутреннего монолога. Прежде чем дать вам ответ, она пошагово разбирает задачу в том, что исследователи называют «цепочкой мышления» — письменно оформленный процесс рассуждения, который модель использует для решения сложных проблем. Компании держат этот процесс рассуждения в секрете. Это коммерчески чувствительная информация, и её открытое разглашение облегчило бы конкурентам её копирование.
Теперь группа компьютерных учёных нашла способ прочитать эти скрытые мысли.
Техника, о которой сообщает Wired AI, разработана исследователями Университета Тюбингена, Института Макса Планка, организации MATS Research, занимающейся безопасностью ИИ, и компании Snyk. Их ключевая идея элегантна своей простотой.
Как именно работает эта атака?
Компании, разрабатывающие ИИ, обычно предлагают свои модели в разных размерах. Большая модель мощная, но дорогая в использовании; меньшая версия той же модели обходится дешевле. Обе версии используют одну и ту же базовую структуру, что означает, что они способны декодировать зашифрованные данные, передаваемые между ними.
Когда вы используете крупную модель ИИ через API (интерфейс прикладного программирования, цифровое соединение, позволяющее программам взаимодействовать), модель отправляет зашифрованную копию своих рассуждений на ваш компьютер, чтобы распределить часть вычислительной работы. Исследователи обнаружили, что передача этих зашифрованных рассуждений меньшей, более дешёвой сестринской модели может её разблокировать.
Почему меньшая модель сотрудничает там, где большая отказывает? Меньшие модели получают менее интенсивное «обучение на соответствие», процесс, который учит ИИ следовать правилам и отклонять неудобные запросы. Удалите эту защиту — и модель намного охотнее раскроет свои работы.
«Идея передать сообщения более слабому варианту модели, у которого тот же ключ шифрования, но слабее выстроена безопасность — очень интересно», — сказал Флориан Тремер, специалист по компьютерной безопасности из ETH Zürich.
Что они внутри нашли?
Два вещи, и они сильно отличаются по серьёзности.
Во-первых: пароли и ключи API. Если вы когда-либо вставляли конфиденциальные учётные данные в запрос при использовании одного из этих сервисов ИИ, эта информация могла остаться в следах рассуждения модели. Исследователи её извлекли. OpenAI, Anthropic и Google были оповещены в прошлом месяце, и каждая компания обновила свои системы, чтобы заблокировать эту конкретную утечку. Если вы использовали какой-либо из этих сервисов до выпуска патча, стоит обновить все ключи API или пароли, которые вы могли включить в запросы.
Во-вторых: вопрос о копировании. Исследователи передали 90 вопросов нескольким моделям ИИ, а затем дали некоторым открытым моделям (свободно загружаемые модели ИИ, которые может запустить кто угодно) начальные слова из следов рассуждения, полученных из больших проприетарных моделей. Kimi K3, модель китайской компании Moonshot AI, генерировала рассуждения, поразительно похожие на скрытые результаты Claude Opus 4.8 и GPT 5.6 Sol. Две другие тестировавшиеся модели, включая китайскую DeepSeek и американскую Inkling, не показали такого же паттерна.
Исследователи аккуратны в своих выводах. В их статье говорится, что результаты «не могут причинно установить дистилляцию», то есть они не доказали, что копирование произошло. Дистилляция — это широко распространённая техника в разработке ИИ, когда новая, меньшая модель учится, изучая результаты большей. Это обычная практика. Спорный вопрос в том, использовали ли китайские компании её для копирования американских моделей без разрешения.
Должны ли рядовые пользователи беспокоиться прямо сейчас?
Уязвимость утечки пароля исправлена. Это наиболее срочная практическая проблема, и она решена.
Более широкая проблема того, что скрытое рассуждение всё ещё может быть частично извлечено даже после патча, остаётся. Полное исправление потребовало бы от этих компаний переделать, как работают их API с нуля. Александр Панфилов, исследователь Университета Тюбингена, возглавивший эту работу, говорит, что уязвимость глубже сохраняется.
Пока что применяется простое правило: не вставляйте пароли, личные данные или конфиденциальную бизнес-информацию в какой-либо чатбот ИИ или инструмент. Такой совет всегда был разумен. Это исследование делает его чуть более актуальным.
Частые вопросы
Мои данные в опасности, если я использую ChatGPT, Claude или Gemini?
Конкретный дефект, который мог раскрыть пароли и ключи API, исправлен всеми тремя компаниями. В дальнейшем избегайте включения конфиденциальной информации в запросы к ИИ как общей практики, поскольку сервисы ИИ обрабатывают ваши данные на внешних серверах.
Что такое дистилляция и это законно?
Дистилляция — это техника, при которой новая модель ИИ учится, изучая результаты существующей, по сути используя более умную модель как учителя. Это широко используется и законно в большинстве контекстов, хотя использование её для копирования проприетарной модели конкурента без разрешения может нарушить условия обслуживания или вызвать вопросы интеллектуальной собственности.



