O LFM2.5-VL-3B da Liquid AI Funciona no Seu Telemóvel e Consegue Ler o Seu Ecrã
O novo modelo de visão com 3 mil milhões de parâmetros cabe em 3 GB de memória, supera rivais maiores em testes de leitura de ecrã e executa com velocidade suficiente num smartphone para ser verdadeiramente útil.

Pontos principais
- A Liquid AI lançou o LFM2.5-VL-3B no Hugging Face, um modelo de visão-linguagem suficientemente pequeno para funcionar num laptop ou smartphone sem ligação à nuvem.
- O modelo obtém 78,7 no teste de desktop ScreenSpot-v2 para leitura de ecrãs digitais, em comparação com 6,0 do seu antecessor LFM2-VL-3B.
- Num único GPU Nvidia H100, o modelo processa aproximadamente mil milhões de tokens de saída por dia, cerca do dobro da velocidade de modelos comparáveis com 4 mil milhões de parâmetros.
- O modelo cabe em aproximadamente 3 GB de memória e atinge 20 tokens por segundo num smartphone Samsung Galaxy S26 Ultra.
- O LFM2.5-VL-3B adiciona chamadas de funções, uma funcionalidade que permite ao modelo ativar ações em aplicações e ferramentas, às suas anteriores capacidades de compreensão de imagens.
A Liquid AI lançou o LFM2.5-VL-3B, um modelo de visão-linguagem (software que compreende tanto imagens como texto, como uma versão mais capaz das ferramentas de descrição de imagens incorporadas nalguns telemóveis) concebido para funcionar diretamente em hardware do dia a dia. Sem necessidade de ligação à internet a um centro de dados.
O número mais relevante é o tamanho. Com 3,1 mil milhões de parâmetros (os valores internos que moldam o raciocínio de um modelo), cabe em aproximadamente 3 GB de memória. Isto é mais pequeno do que muitos jogos móveis.
O que pode realmente fazer?
O modelo lê documentos, descodifica texto em imagens, identifica onde os objetos se localizam numa foto e compreende o que está num ecrã de computador ou telemóvel. No teste ScreenSpot-v2, um teste padrão para leitura de interfaces no ecrã, o LFM2.5-VL-3B obteve 78,7 para desktop, 81,2 para móvel e 82,2 para web. O seu antecessor, LFM2-VL-3B, obteve 6,0, 7,6 e 2,5 nos mesmos três testes.
O modelo também suporta chamadas de funções: a capacidade de ativar ações noutro software, como clicar num botão ou preencher um formulário, com base no que vê no ecrã. A Liquid AI afirma que o desempenho aqui é agora equivalente ao Gemma-4-E2B do Google e ao Qwen3.5-2B da Alibaba, dois modelos pequenos concorrentes.
| Modelo | Tamanho | ScreenSpot-v2 Desktop | MathVista (mini) | Classificação de visão média |
|---|---|---|---|---|
| LFM2.5-VL-3B | 3,1B | 78,7 | 68,5 | 69,4 |
| LFM2-VL-3B | 3,1B | 6,0 | 62,1 | 57,2 |
| InternVL 3.5 4B | 4,7B | 82,0 | 67,1 | 69,4 |
| Qwen3.5-4B | 4,7B | 76,3 | 63,6 | 70,1 |
| Gemma-4-E4B-it | 8B | 45,8 | 45,2 | 59,7 |
Qual é a velocidade de execução?
Rápida o suficiente para fazer diferença em dispositivos reais. No chip M5 Max da Apple (o tipo encontrado num MacBook Pro de alta gama), processa 228 tokens por segundo, onde um token é aproximadamente três quartos de uma palavra. No Ryzen AI Max+ 395 da AMD (um chip encontrado em certos laptops Windows), atinge 116 tokens por segundo. Num smartphone Galaxy S26 Ultra, atinge 20 tokens por segundo, o que é rápido o suficiente para uma conversa em direto.
Num GPU Nvidia H100 de nível servidor (o chip especializado que faz o processamento pesado de números de IA em centros de dados), atinge cerca de 11 mil tokens por segundo em carga elevada, quase o dobro da velocidade de rivais com 4 mil milhões de parâmetros.
Para quem é isto?
Programadores que criam aplicações que precisam compreender imagens ou ecrãs sem enviar dados para um servidor remoto. Pense em ferramentas de acessibilidade que descrevem o que está no ecrã, aplicações de despesas que leem recibos ou software empresarial que preenche formulários automaticamente. O modelo está disponível agora no Hugging Face, a plataforma para partilha de modelos de IA, na conta da Liquid AI.



