LFM2.5-VL-3B від Liquid AI може працювати на вашому телефоні і при цьому читати екран
Нова модель комп'ютерного зору з 3 мільярдами параметрів займає лише 3 ГБ пам'яті, перевершує більші конкуренти за тестами розпізнавання текту на екрані та працює достатньо швидко на смартфоні, щоб бути дійсно корисною.

Ключові моменти
- Liquid AI випустила LFM2.5-VL-3B на Hugging Face, модель бачення-мови достатньо компактну для роботи на ноутбуці чи смартфоні без підключення до хмари.
- Модель набирає 78,7 балів у тесті ScreenSpot-v2 Desktop для читання цифрових екранів, що значно вище за 6,0 для її попередниці LFM2-VL-3B.
- На одному графічному процесорі Nvidia H100 модель обробляє близько одного мільярда вихідних токенів на день, приблизно в два рази швидше за порівняльні моделі з 4 мільярдами параметрів.
- Модель займає приблизно 3 ГБ пам'яті і досягає 20 токенів на секунду на смартфоні Samsung Galaxy S26 Ultra.
- LFM2.5-VL-3B додає функціональні виклики, можливість, яка дозволяє моделі запускати дії в додатках та інструментах, до своїх попередніх можливостей розуміння зображень.
Liquid AI випустила LFM2.5-VL-3B, модель комп'ютерного зору та мови (програмне забезпечення, яке розуміє як зображення, так і текст, як більш потужна версія інструментів опису зображень, вбудованих у деякі телефони), розроблену для запуску безпосередньо на звичайному обладнанні. Підключення до інтернету та центру обробки даних не потрібне.
Головне число — це розмір. З 3,1 мільярда параметрів (внутрішніх значень, які формують те, як модель мислить), вона займає приблизно 3 ГБ пам'яті. Це менше за багато мобільних ігор.
Що вона насправді може робити?
Модель читає документи, декодує текст у зображеннях, визначає місцезнаходження об'єктів на фото та розуміє, що показано на екрані комп'ютера чи телефона. У тесті ScreenSpot-v2, стандартному тесті для читання інтерфейсів на екрані, LFM2.5-VL-3B отримала 78,7 для робочого стола, 81,2 для мобільного та 82,2 для інтернету. Її попередниця LFM2-VL-3B отримала 6,0, 7,6 та 2,5 на тих же трьох тестах.
Модель також підтримує функціональні виклики: можливість запускати дії в іншому програмному забезпеченні, таких як натискання кнопки чи заповнення форми, на основі того, що вона бачить на екрані. За словами Liquid AI, продуктивність тут тепер на рівні з Google Gemma-4-E2B та Alibaba Qwen3.5-2B, двома конкуруючими малими моделями.
| Модель | Розмір | ScreenSpot-v2 Desktop | MathVista (mini) | Середній показник зору |
|---|---|---|---|---|
| LFM2.5-VL-3B | 3.1B | 78.7 | 68.5 | 69.4 |
| LFM2-VL-3B | 3.1B | 6.0 | 62.1 | 57.2 |
| InternVL 3.5 4B | 4.7B | 82.0 | 67.1 | 69.4 |
| Qwen3.5-4B | 4.7B | 76.3 | 63.6 | 70.1 |
| Gemma-4-E4B-it | 8B | 45.8 | 45.2 | 59.7 |
Наскільки швидко вона працює?
Достатньо швидко, щоб мати значення на реальних пристроях. На чіпі Apple M5 Max (який встановлюється у високопродуктивні MacBook Pro) вона обробляє 228 токенів на секунду, де токен — це приблизно три чверті слова. На процесорі AMD Ryzen AI Max+ 395 (чіп, який встановлюється на деякі ноутбуки Windows), вона досягає 116 токенів на секунду. На смартфоні Galaxy S26 Ultra вона досягає 20 токенів на секунду, що достатньо швидко для живої розмови.
На серверному графічному процесорі Nvidia H100 (спеціалізованому чіпі для інтенсивних обчислень штучного інтелекту в центрах обробки даних) вона досягає близько 11 000 токенів на секунду при високому навантаженні, майже в два рази швидше за конкурентів із 4 мільярдами параметрів.
Для кого це?
Для розробників, які створюють додатки, які потребують розуміння зображень чи екранів без надсилання даних на віддалений сервер. Подумайте про інструменти доступності, які описують, що знаходиться на екрані, програми для витрат, які читають чеки, або бізнес-програмне забезпечення, яке автоматично заповнює форми. Модель вже доступна на Hugging Face, платформі для спільного використання моделей штучного інтелекту, під обліковим записом Liquid AI.



