LFM2.5-VL-3B di Liquid AI può funzionare sul tuo telefono e leggere il tuo schermo

Il nuovo modello di visione con 3 miliardi di parametri si adatta a 3 GB di memoria, supera competitor più grandi nei benchmark di lettura dello schermo e funziona abbastanza velocemente su uno smartphone per essere genuinamente utile.

AI2Day Newsdesk3 min read
Macro photograph of glowing amber light pulses travelling along the surface of a translucent circuit board, seen from directly above at a slight angle, deep bla
Share

Punti chiave

  • Liquid AI ha rilasciato LFM2.5-VL-3B su Hugging Face, un modello visione-linguaggio sufficientemente piccolo per funzionare su un laptop o smartphone senza connessione cloud.
  • Il modello ottiene 78,7 nel benchmark ScreenSpot-v2 Desktop per la lettura degli schermi digitali, rispetto al 6,0 del suo predecessore LFM2-VL-3B.
  • Su una singola GPU Nvidia H100, il modello elabora circa un miliardo di token in output al giorno, circa il doppio rispetto a modelli comparabili con 4 miliardi di parametri.
  • Il modello si adatta a circa 3 GB di memoria e raggiunge 20 token al secondo su uno smartphone Samsung Galaxy S26 Ultra.
  • LFM2.5-VL-3B aggiunge function calling, una funzione che permette al modello di attivare azioni in app e strumenti, alle sue precedenti capacità di comprensione delle immagini.

Liquid AI ha rilasciato LFM2.5-VL-3B, un modello visione-linguaggio (software che comprende sia immagini che testo, come una versione più sofisticata degli strumenti di descrizione delle immagini integrati in alcuni telefoni) progettato per funzionare direttamente su hardware quotidiano. Non è richiesta alcuna connessione internet a un data center.

Il dato principale è la dimensione. Con 3,1 miliardi di parametri (i valori interni che modellano il funzionamento di un modello), si adatta a circa 3 GB di memoria. Ciò è inferiore a molti giochi mobile.

Che cosa può effettivamente fare?

Il modello legge documenti, decodifica il testo nelle immagini, identifica dove si trovano gli oggetti in una foto e comprende ciò che è visualizzato su uno schermo di computer o telefono. Nel benchmark ScreenSpot-v2, un test standard per la lettura delle interfacce sullo schermo, LFM2.5-VL-3B ha ottenuto 78,7 per desktop, 81,2 per mobile e 82,2 per web. Il suo predecessore, LFM2-VL-3B, ha ottenuto 6,0, 7,6 e 2,5 negli stessi tre test.

Il modello supporta anche function calling: la capacità di attivare azioni in altri software, come fare clic su un pulsante o compilare un modulo, in base a ciò che vede sullo schermo. Liquid AI afferma che le prestazioni qui sono ora in linea con Gemma-4-E2B di Google e Qwen3.5-2B di Alibaba, due modelli piccoli competitor.

Modello Dimensione ScreenSpot-v2 Desktop MathVista (mini) Punteggio visione medio
LFM2.5-VL-3B 3,1B 78,7 68,5 69,4
LFM2-VL-3B 3,1B 6,0 62,1 57,2
InternVL 3.5 4B 4,7B 82,0 67,1 69,4
Qwen3.5-4B 4,7B 76,3 63,6 70,1
Gemma-4-E4B-it 8B 45,8 45,2 59,7

Quanto velocemente funziona?

Abbastanza velocemente da essere significativo su dispositivi reali. Sul chip M5 Max di Apple (quello presente in un MacBook Pro di fascia alta), elabora 228 token al secondo, dove un token è approssimativamente tre quarti di una parola. Su AMD Ryzen AI Max+ 395 (un chip presente in certi laptop Windows), raggiunge 116 token al secondo. Su uno smartphone Galaxy S26 Ultra, raggiunge 20 token al secondo, il che è abbastanza veloce per una conversazione dal vivo.

Su una GPU Nvidia H100 di livello server (il chip specializzato che esegue i calcoli pesanti per l'IA nei data center), raggiunge circa 11.000 token al secondo ad alta capacità, quasi il doppio rispetto a competitor con 4 miliardi di parametri.

Per chi è destinato?

Sviluppatori che creano app che hanno bisogno di comprendere immagini o schermi senza inviare dati a un server remoto. Pensa a strumenti di accessibilità che descrivono ciò che è sullo schermo, app di spese che leggono ricevute, o software aziendale che compila moduli automaticamente. Il modello è disponibile ora su Hugging Face, la piattaforma per la condivisione di modelli IA, nell'account di Liquid AI.

© 2026 AI2Day