Нова технологія голосу AI на пристрої Apple робить Siri більш людськім, не надсилаючи аудіо в хмару
Дослідницька робота команди машинного навчання Apple розкриває аудіомодуль, що стоїть за більш виразними новими голосами Siri. Вся обробка відбувається на вашому iPhone за допомогою мікросхеми, яка у вас уже є.

Ключові моменти
- Модель AFM 3 Core Advanced компанії Apple, найпотужніший її локальний ШІ, тепер забезпечує нову функцію Siri Expressive Voices.
- Усе аудіо генерується й обробляється прямо на пристрої, тому дані голосу не надсилаються на сервери Apple.
- Система працює на Apple Matrix Coprocessor, спеціалізованому обчислювальному модулі, вбудованому у власні мікросхеми Apple.
- Нова аудіоархітектура перетворює стиснені аудіотокени в повноцінне, природне звучання мовлення в реальному часі.
- Apple ML Research опублікувала базові дослідження, описавши, як були подолані жорсткі обмеження пам'яті на телефоні.
Коли Siri до вас звертається, вона тепер звучить помітно природніше. Це не випадковість. Apple тихо випустила складну нову систему генерації аудіо, а стаття, опублікована Apple ML Research, пояснює, як вона саме працює.
Функція називається Siri Expressive Voices. Вона використовує процес, який називається синтезом аудіо — програмне забезпечення, що генерує вимовлені слова з нуля, а не склеює заздалегідь записані уривки. Подумайте про це як про дуже складний механізм «текст-мовлення», але замість робочого звучання результат багатий і конфігурується в реальному часі.
Як це фактично працює?
Система перетворює текст на мовлення через два етапи. По-перше, велика мовна модель під назвою AFM 3 Core Advanced, тип ШІ, що розуміє й генерує мову, виробляє компактні пакети аудіоінформації, звані семантичними токенами. Це ще не звук. Це більше схоже на стиснену скорочену форму того, як повинно звучати аудіо.
Другий компонент, який називається детокенізатор, потім розпаковує ці токени в звукові хвилі, які ви чуєте. У статті докладно описано цей другий етап, оскільки це справді складна частина.
Складність у пам'яті. Телефони мають суворі обмеження щодо того, скільки пам'яті програмне забезпечення може використовувати в будь-який момент. Щоб втиснути високоякісне генерування аудіо в ці обмеження, інженери Apple побудували триступеневу конструкцію, яка перетворює прості токени в більш багатий аудіоформат під назвою RVQ, що означає остаточну векторну квантизацію. Подумайте про RVQ як про послідовність аудіоінструкцій, які поступово підвищують якість звуку, подібно до того, як завантажується розмито зображення JPEG, а потім стає чітким.
Все це працює на Apple Matrix Coprocessor, або AMX, виділеному обчислювальному модулі, вбудованому в мікросхеми Apple Silicon, такі як серія A та M. AMX обробляє інтенсивні обчислення без перенавантаження основного процесора чи батареї.
Чому важливо, що все залишається на пристрої?
Коротко кажучи, це приватність. Оскільки синтез аудіо відбувається повністю на пристрої, ваш голос і те, що Siri вам відповідає, ніколи не надсилаються на сервери Apple. Нічого не можна перехопити, зберегти чи витребувати в суді. Для користувачів, які хвилювалися, що голосові помічники слухають, ця архітектура є змістовним вибором дизайну, а не просто маркетинговою заявою.
Продуктивність — інша перевага. Локальна обробка означає, що вам не потрібно чекати на ходіння туди-назад на далекий сервер. Голосова відповідь починається майже миттєво.
| Компонент | Функція | Працює на |
|---|---|---|
| AFM 3 Core Advanced | Генерує семантичні аудіотокени з тексту | На пристрої |
| Детокенізатор | Перетворює токени на звукові хвилі | Мікросхема Apple AMX |
| Представлення RVQ | Підвищує чіткість та багатошаровість аудіо | На пристрої |
Що це означає для звичайних користувачів?
Якщо ваш пристрій підтримує цю функцію, Siri просто звучить краще. Вам не потрібно змінювати жодне налаштування чи давати згоду на щось. Поліпшення приходить через оновлення програмного забезпечення.
Ширший сигнал полягає в тому, що Apple впроваджує серйозну можливість ШІ в мікросхему, а не покладається на сервери хмари. Такий підхід одночасно забезпечує пріоритет приватності й швидкості, і цей аудіомодуль є одним із найяскравіших прикладів того, як це виглядає на практиці.



