LFM2.5-VL-3B от Liquid AI может работать на вашем телефоне и всё ещё читать экран
Новая модель зрения с 3 миллиардами параметров занимает 3 ГБ памяти, превосходит более крупные аналоги в тестах распознавания текста на экране и работает достаточно быстро на смартфоне, чтобы быть действительно полезной.

Ключевые моменты
- Liquid AI выпустила LFM2.5-VL-3B на Hugging Face — модель зрения и языка, достаточно компактную для работы на ноутбуке или смартфоне без подключения к облаку.
- Модель набрала 78,7 балла в тесте ScreenSpot-v2 Desktop для чтения цифровых экранов, что выше 6,0 для её предшественницы LFM2-VL-3B.
- На одном графическом процессоре Nvidia H100 модель обрабатывает примерно один миллиард выходных токенов в день — примерно в два раза быстрее, чем сравнимые модели с 4 миллиардами параметров.
- Модель занимает около 3 ГБ памяти и достигает 20 токенов в секунду на смартфоне Samsung Galaxy S26 Ultra.
- LFM2.5-VL-3B добавляет функцию вызова функций, которая позволяет модели инициировать действия в приложениях и инструментах, к её предыдущим способностям понимания изображений.
Компания Liquid AI выпустила LFM2.5-VL-3B — модель зрения и языка (программное обеспечение, понимающее как изображения, так и текст, как более продвинутая версия встроенных в некоторые телефоны инструментов описания изображений), разработанную для работы непосредственно на обычном оборудовании. Подключение к интернету и центру обработки данных не требуется.
Главный показатель — размер. При 3,1 миллиарда параметров (внутренних значений, которые определяют, как работает модель), она занимает около 3 ГБ памяти. Это меньше, чем многие мобильные игры.
Что она на самом деле может делать?
Модель читает документы, декодирует текст в изображениях, определяет расположение объектов на фотографии и понимает, что находится на экране компьютера или телефона. В тесте ScreenSpot-v2, стандартном тесте для чтения интерфейсов, LFM2.5-VL-3B набрала 78,7 для настольных ПК, 81,2 для мобильных устройств и 82,2 для веб-интерфейсов. Её предшественница LFM2-VL-3B набрала 6,0, 7,6 и 2,5 в этих же трёх тестах.
Модель также поддерживает функцию вызова функций: способность инициировать действия в другом программном обеспечении, например нажать кнопку или заполнить форму, на основе того, что она видит на экране. По словам Liquid AI, производительность здесь теперь соответствует Google Gemma-4-E2B и Alibaba Qwen3.5-2B — двум конкурирующим небольшим моделям.
| Модель | Размер | ScreenSpot-v2 Desktop | MathVista (mini) | Средний показатель зрения |
|---|---|---|---|---|
| LFM2.5-VL-3B | 3.1B | 78.7 | 68.5 | 69.4 |
| LFM2-VL-3B | 3.1B | 6.0 | 62.1 | 57.2 |
| InternVL 3.5 4B | 4.7B | 82.0 | 67.1 | 69.4 |
| Qwen3.5-4B | 4.7B | 76.3 | 63.6 | 70.1 |
| Gemma-4-E4B-it | 8B | 45.8 | 45.2 | 59.7 |
Насколько быстро она работает?
Достаточно быстро, чтобы иметь значение на реальных устройствах. На чипе Apple M5 Max (такие есть в высокопроизводительных MacBook Pro) модель обрабатывает 228 токенов в секунду, где токен — это примерно три четверти слова. На AMD Ryzen AI Max+ 395 (чип, встречающийся в некоторых ноутбуках на Windows) она достигает 116 токенов в секунду. На смартфоне Galaxy S26 Ultra она выдаёт 20 токенов в секунду, чего достаточно для живого диалога.
На серверном графическом процессоре Nvidia H100 (специализированном чипе для тяжёлых вычислений искусственного интеллекта в центрах обработки данных) она достигает около 11 000 токенов в секунду при полной нагрузке — почти в два раза быстрее, чем конкурирующие модели с 4 миллиардами параметров.
Для кого это?
Для разработчиков, создающих приложения, которым нужно понимать изображения или экраны без отправки данных на удалённый сервер. Подумайте об инструментах доступности, которые описывают содержимое экрана, приложениях для учёта расходов, которые читают квитанции, или бизнес-программном обеспечении, которое автоматически заполняет формы. Модель уже доступна на Hugging Face — платформе для обмена моделями искусственного интеллекта — на счёте Liquid AI.



