O LFM2.5-VL-3B da Liquid AI Funciona no Seu Telemóvel e Consegue Ler o Seu Ecrã

O novo modelo de visão com 3 mil milhões de parâmetros cabe em 3 GB de memória, supera rivais maiores em testes de leitura de ecrã e executa com velocidade suficiente num smartphone para ser verdadeiramente útil.

AI2Day Newsdesk3 min read
Macro photograph of glowing amber light pulses travelling along the surface of a translucent circuit board, seen from directly above at a slight angle, deep bla
Share

Pontos principais

  • A Liquid AI lançou o LFM2.5-VL-3B no Hugging Face, um modelo de visão-linguagem suficientemente pequeno para funcionar num laptop ou smartphone sem ligação à nuvem.
  • O modelo obtém 78,7 no teste de desktop ScreenSpot-v2 para leitura de ecrãs digitais, em comparação com 6,0 do seu antecessor LFM2-VL-3B.
  • Num único GPU Nvidia H100, o modelo processa aproximadamente mil milhões de tokens de saída por dia, cerca do dobro da velocidade de modelos comparáveis com 4 mil milhões de parâmetros.
  • O modelo cabe em aproximadamente 3 GB de memória e atinge 20 tokens por segundo num smartphone Samsung Galaxy S26 Ultra.
  • O LFM2.5-VL-3B adiciona chamadas de funções, uma funcionalidade que permite ao modelo ativar ações em aplicações e ferramentas, às suas anteriores capacidades de compreensão de imagens.

A Liquid AI lançou o LFM2.5-VL-3B, um modelo de visão-linguagem (software que compreende tanto imagens como texto, como uma versão mais capaz das ferramentas de descrição de imagens incorporadas nalguns telemóveis) concebido para funcionar diretamente em hardware do dia a dia. Sem necessidade de ligação à internet a um centro de dados.

O número mais relevante é o tamanho. Com 3,1 mil milhões de parâmetros (os valores internos que moldam o raciocínio de um modelo), cabe em aproximadamente 3 GB de memória. Isto é mais pequeno do que muitos jogos móveis.

O que pode realmente fazer?

O modelo lê documentos, descodifica texto em imagens, identifica onde os objetos se localizam numa foto e compreende o que está num ecrã de computador ou telemóvel. No teste ScreenSpot-v2, um teste padrão para leitura de interfaces no ecrã, o LFM2.5-VL-3B obteve 78,7 para desktop, 81,2 para móvel e 82,2 para web. O seu antecessor, LFM2-VL-3B, obteve 6,0, 7,6 e 2,5 nos mesmos três testes.

O modelo também suporta chamadas de funções: a capacidade de ativar ações noutro software, como clicar num botão ou preencher um formulário, com base no que vê no ecrã. A Liquid AI afirma que o desempenho aqui é agora equivalente ao Gemma-4-E2B do Google e ao Qwen3.5-2B da Alibaba, dois modelos pequenos concorrentes.

Modelo Tamanho ScreenSpot-v2 Desktop MathVista (mini) Classificação de visão média
LFM2.5-VL-3B 3,1B 78,7 68,5 69,4
LFM2-VL-3B 3,1B 6,0 62,1 57,2
InternVL 3.5 4B 4,7B 82,0 67,1 69,4
Qwen3.5-4B 4,7B 76,3 63,6 70,1
Gemma-4-E4B-it 8B 45,8 45,2 59,7

Qual é a velocidade de execução?

Rápida o suficiente para fazer diferença em dispositivos reais. No chip M5 Max da Apple (o tipo encontrado num MacBook Pro de alta gama), processa 228 tokens por segundo, onde um token é aproximadamente três quartos de uma palavra. No Ryzen AI Max+ 395 da AMD (um chip encontrado em certos laptops Windows), atinge 116 tokens por segundo. Num smartphone Galaxy S26 Ultra, atinge 20 tokens por segundo, o que é rápido o suficiente para uma conversa em direto.

Num GPU Nvidia H100 de nível servidor (o chip especializado que faz o processamento pesado de números de IA em centros de dados), atinge cerca de 11 mil tokens por segundo em carga elevada, quase o dobro da velocidade de rivais com 4 mil milhões de parâmetros.

Para quem é isto?

Programadores que criam aplicações que precisam compreender imagens ou ecrãs sem enviar dados para um servidor remoto. Pense em ferramentas de acessibilidade que descrevem o que está no ecrã, aplicações de despesas que leem recibos ou software empresarial que preenche formulários automaticamente. O modelo está disponível agora no Hugging Face, a plataforma para partilha de modelos de IA, na conta da Liquid AI.

© 2026 AI2Day