Дослідники знайшли спосіб читати 'приховані думки' штучного інтелекту, і це ставить серйозні питання безпеки
Команда комп'ютерних науковців пробилася крізь секретне мислення провідних моделей ШІ. Всередину вони знайшли витічені паролі та деякі незручні питання щодо китайської компанії ШІ.

Ключові моменти
- Дослідники з Університету Тюбінгена та співавтори знайшли метод для видобування прихованих етапів мислення з основних моделей ШІ, включаючи ті, що створені OpenAI, Anthropic та Google.
- Та сама техніка виявила приватні дані, такі як паролі та ключі API, які зберігаються в процесі мислення моделі, хоча всі три компанії з того часу закрили цю конкретну уразливість.
- Китайська модель Kimi K3, створена Moonshot AI,產生 закономірності мислення, надзвичайно схожі на приховані дані Claude Opus 4.8 та GPT 5.6 Sol, що піднімає питання про те, чи була вона навчена копіюванням цих моделей.
- Дослідники застерігають, що схожість є побічною, а не остаточним доказом копіювання.
- Повне вирішення більш глибокої проблеми потребуватиме суттєвих змін у тому, як працюють програмні інтерфейси цих компаній.
Кожна передова модель ШІ має своєрідний внутрішній монолог. Перш ніж дати вам відповідь, вона проходить через проблему крок за кроком у тому, що дослідники називають «ланцюг думок», написаний процес мислення, який модель використовує для розв'язання складних проблем. Компанії тримають цей процес мислення в таємниці. Це комерційно чутливо, а відкрите ділення зробило б легким для конкурентів скопіювати його.
Тепер команда комп'ютерних науковців знайшла спосіб прочитати ці приховані думки в будь-якому випадку.
Техніка, про яку повідомила Wired AI, походить від дослідників Університету Тюбінгена, Інституту Макса Планка, інституту безпеки ШІ MATS Research та компанії безпеки Snyk. Їхня ключова ідея майже елегантна у своїй простоті.
Як саме працює атака?
Компанії ШІ зазвичай пропонують свої моделі різних розмірів. Велика модель потужна, але дорога для запуску; менша версія тієї ж моделі коштує менше. Обидві версії мають одну й ту ж базову структуру, що означає, що вони мають однакову здатність розшифровувати зашифровані дані, передані між ними.
Коли ви використовуєте велику модель ШІ через API (інтерфейс програмування додатків, цифровий зв'язок, який дозволяє програмному забезпеченню спілкуватися з іншим програмним забезпеченням), модель надсилає зашифровану копію свого мислення на ваш комп'ютер для розподілу частини роботи обробки. Дослідники виявили, що надання цього зашифрованого мислення меншій, дешевшій аналогічній моделі може його розблокувати.
Чому менша модель співпрацює там, де більша не стала б? Менші моделі отримують менше «навчання вирівнюванню», процесу, який навчає ШІ дотримуватися правил і відмовляти у незручних запитах. Видаліть цю запобіжну міру, і модель набагато більше готова показати свою роботу.
«Ідея заміни повідомлень на слабшу варіацію моделі, яка має той самий ключ розшифрування, але слабке вирівнювання, дуже крута», сказав Флоріан Тремер, спеціаліст з комп'ютерної безпеки в ETH Zürich.
Що вони там знайшли?
Два речі, і вони мають зовсім різну серйозність.
По-перше: паролі та ключи API. Якби ви коли-небудь вставили чутливі облікові дані у запит, використовуючи один із цих сервісів ШІ, ця інформація могла опинитися всередині трасування мислення моделі. Дослідники її видобули. OpenAI, Anthropic та Google були всі сповіщені минулого місяця, і кожна оновила свої системи, щоб заблокувати цю конкретну утечку. Якщо ви використовували будь-який із цих сервісів до засобу виправлення, варто ротувати будь-які ключі API або паролі, які ви могли включити у запити.
По-друге: питання про копіювання. Дослідники надали 90 питань кільком моделям ШІ, а потім надали деяким моделям з відкритою вагою (вільно завантажувані моделі ШІ, які може запустити будь-хто) перші слова трасувань мислення, захоплених з великих власницьких моделей. Kimi K3, модель китайської компанії Moonshot AI, генерувала мислення, яке виглядало надзвичайно схоже на приховані дані Claude Opus 4.8 та GPT 5.6 Sol. Дві інші тестовані моделі, включаючи китайський DeepSeek та американський Inkling, не показали того ж закономірності.
Дослідники обережні щодо значення цього. У їхній статті зазначається, що висновки «не можуть причинно встановити дистиляцію», тобто вони не довели, що копіювання сталося. Дистиляція — це широко використовувана техніка в розробці ШІ, де нова менша модель навчається, вивчаючи результати більшої. Це звичайна практика. Контроверсія в тому, чи використовували китайські компанії її для копіювання американських моделей без дозволу.
Чи повинні звичайні користувачі турбуватися прямо зараз?
Фіксація утечки паролю закрита. Це найбільш терміний практичний зв'язок, і він вирішений.
Ширша проблема, що приховане мислення може все ще бути частково видобуто навіть після засобу виправлення, залишається. Повне вирішення потребуватиме від цих компаній переробити, як їхні API працюють з самого нуля. Олександр Панфілов, дослідник Університету Тюбінгена, який очолював роботу, каже, що глибша уразливість зберігається.
На даний момент застосовується просте правило: не вставляйте паролі, особисті дані або чутливу ділову інформацію у будь-який чат-бот ШІ або інструмент. Цю пораду завжди розумно було слідувати. Це дослідження робить її трохи більш невідкладною.
Поширені питання
Мої дані в небезпеці, якщо я використовую ChatGPT, Claude або Gemini?
Конкретна вада, яка могла б виявити паролі та ключі API, була закрита всіма трьома компаніями. Надалі уникайте включення чутливої інформації в запити до ШІ як загальну звичку, оскільки сервіси ШІ обробляють ваші вводи на зовнішніх серверах.
Що таке дистиляція, і чи вона незаконна?
Дистиляція — це техніка, де нова модель ШІ навчається, вивчаючи результати існуючої, по суті використовуючи розумнішу модель як вчителя. Вона широко використовується та законна в більшості контекстів, хоча використання її для копіювання власницької моделі конкурента без дозволу може порушити умови обслуговування або поставити питання щодо інтелектуальної власності.



