Le LFM2.5-VL-3B de Liquid AI peut fonctionner sur votre téléphone et lire votre écran

Le nouveau modèle de vision de 3 milliards de paramètres tient dans 3 GB de mémoire, surpasse des rivaux plus grands sur les benchmarks de lecture d'écran, et s'exécute assez rapidement sur un smartphone pour être véritablement utile.

AI2Day Newsdesk3 min read
Macro photograph of glowing amber light pulses travelling along the surface of a translucent circuit board, seen from directly above at a slight angle, deep bla
Share

Points clés

  • Liquid AI a publié LFM2.5-VL-3B sur Hugging Face, un modèle vision-langage suffisamment petit pour fonctionner sur un ordinateur portable ou un smartphone sans connexion cloud.
  • Le modèle obtient 78,7 sur le benchmark ScreenSpot-v2 Desktop pour la lecture d'écrans numériques, contre 6,0 pour son prédécesseur LFM2-VL-3B.
  • Sur un seul GPU Nvidia H100, le modèle traite environ un milliard de jetons en sortie par jour, environ deux fois plus rapide que les modèles comparables de 4 milliards de paramètres.
  • Le modèle tient dans environ 3 GB de mémoire et atteint 20 jetons par seconde sur un smartphone Samsung Galaxy S26 Ultra.
  • LFM2.5-VL-3B ajoute l'appel de fonction, une fonction qui permet au modèle de déclencher des actions dans des applications et des outils, à ses capacités précédentes de compréhension d'images.

Liquid AI a publié LFM2.5-VL-3B, un modèle vision-langage (un logiciel qui comprend à la fois les images et le texte, comme une version plus capable des outils de description d'images intégrés à certains téléphones) conçu pour fonctionner directement sur du matériel courant. Aucune connexion Internet à un centre de données requise.

Le chiffre clé est la taille. Avec 3,1 milliards de paramètres (les valeurs internes qui façonnent le fonctionnement d'un modèle), il tient dans environ 3 GB de mémoire. C'est plus petit que de nombreux jeux mobiles.

Que peut-il vraiment faire ?

Le modèle lit des documents, décode le texte dans les images, identifie où les objets se trouvent dans une photo et comprend ce qui se trouve sur l'écran d'un ordinateur ou d'un téléphone. Sur le benchmark ScreenSpot-v2, un test standard pour la lecture des interfaces à l'écran, LFM2.5-VL-3B a obtenu 78,7 pour le bureau, 81,2 pour le mobile et 82,2 pour le web. Son prédécesseur, LFM2-VL-3B, a obtenu 6,0, 7,6 et 2,5 sur les trois mêmes tests.

Le modèle prend également en charge l'appel de fonction : la capacité à déclencher des actions dans d'autres logiciels, tels que cliquer sur un bouton ou remplir un formulaire, en fonction de ce qu'il voit à l'écran. Liquid AI déclare que les performances ici sont maintenant équivalentes à celles de Gemma-4-E2B de Google et de Qwen3.5-2B d'Alibaba, deux modèles petits concurrents.

Modèle Taille ScreenSpot-v2 Bureau MathVista (mini) Score vision moyen
LFM2.5-VL-3B 3,1B 78,7 68,5 69,4
LFM2-VL-3B 3,1B 6,0 62,1 57,2
InternVL 3.5 4B 4,7B 82,0 67,1 69,4
Qwen3.5-4B 4,7B 76,3 63,6 70,1
Gemma-4-E4B-it 8B 45,8 45,2 59,7

À quelle vitesse fonctionne-t-il ?

Assez rapidement pour être pertinent sur des appareils réels. Sur la puce M5 Max d'Apple (le type de puce que l'on trouve dans un MacBook Pro haut de gamme), il traite 228 jetons par seconde, où un jeton représente environ trois quarts d'un mot. Sur le Ryzen AI Max+ 395 d'AMD (une puce que l'on trouve dans certains ordinateurs portables Windows), il atteint 116 jetons par seconde. Sur un smartphone Galaxy S26 Ultra, il atteint 20 jetons par seconde, ce qui est assez rapide pour une conversation en direct.

Sur un GPU Nvidia H100 de qualité serveur (la puce spécialisée qui effectue les calculs intensifs d'IA dans les centres de données), il atteint environ 11 000 jetons par seconde à charge élevée, près de deux fois plus rapide que les rivaux de 4 milliards de paramètres.

Pour qui est-ce ?

Les développeurs qui créent des applications qui doivent comprendre des images ou des écrans sans envoyer de données à un serveur distant. Pensez aux outils d'accessibilité qui décrivent ce qui est à l'écran, aux applications de dépenses qui lisent les reçus, ou aux logiciels commerciaux qui remplissent automatiquement les formulaires. Le modèle est désormais disponible sur Hugging Face, la plateforme de partage des modèles d'IA, sous le compte de Liquid AI.

© 2026 AI2Day