El LFM2.5-VL-3B de Liquid AI puede ejecutarse en tu teléfono y aún leer tu pantalla

El nuevo modelo de visión de 3 mil millones de parámetros cabe en 3 GB de memoria, supera a rivales más grandes en pruebas de lectura de pantalla y se ejecuta lo suficientemente rápido en un smartphone para ser genuinamente útil.

AI2Day Newsdesk3 min read
Macro photograph of glowing amber light pulses travelling along the surface of a translucent circuit board, seen from directly above at a slight angle, deep bla
Share

Puntos clave

  • Liquid AI lanzó LFM2.5-VL-3B en Hugging Face, un modelo de visión-lenguaje lo suficientemente pequeño para ejecutarse en una laptop o smartphone sin conexión a la nube.
  • El modelo obtiene 78,7 puntos en el benchmark ScreenSpot-v2 Desktop para leer pantallas digitales, subiendo desde 6,0 de su predecesor LFM2-VL-3B.
  • En una única GPU Nvidia H100, el modelo procesa aproximadamente mil millones de tokens de salida por día, aproximadamente el doble de velocidad que modelos comparables de 4 mil millones de parámetros.
  • El modelo cabe en aproximadamente 3 GB de memoria y alcanza 20 tokens por segundo en un smartphone Samsung Galaxy S26 Ultra.
  • LFM2.5-VL-3B añade llamadas de función, una característica que permite al modelo desencadenar acciones en aplicaciones y herramientas, a sus capacidades previas de comprensión de imágenes.

Liquid AI ha lanzado LFM2.5-VL-3B, un modelo de visión-lenguaje (software que entiende tanto imágenes como texto, como una versión más capaz de las herramientas de descripción de imágenes integradas en algunos teléfonos) diseñado para ejecutarse directamente en hardware cotidiano. No se requiere conexión a internet con un centro de datos.

El número destacado es el tamaño. Con 3,1 mil millones de parámetros (los valores internos que dan forma a cómo piensa un modelo), cabe en aproximadamente 3 GB de memoria. Eso es más pequeño que muchos juegos móviles.

¿Qué puede hacer realmente?

El modelo lee documentos, decodifica texto en imágenes, identifica dónde se encuentran los objetos en una foto y comprende lo que hay en una pantalla de computadora o teléfono. En el benchmark ScreenSpot-v2, una prueba estándar para leer interfaces en pantalla, LFM2.5-VL-3B obtuvo 78,7 para escritorio, 81,2 para móvil y 82,2 para web. Su predecesor, LFM2-VL-3B, obtuvo 6,0, 7,6 y 2,5 en las mismas tres pruebas.

El modelo también admite llamadas de función: la capacidad de desencadenar acciones en otro software, como hacer clic en un botón o rellenar un formulario, según lo que vea en la pantalla. Liquid AI dice que el rendimiento aquí ahora es comparable con Gemma-4-E2B de Google y Qwen3.5-2B de Alibaba, dos modelos pequeños competidores.

Modelo Tamaño ScreenSpot-v2 Desktop MathVista (mini) Puntuación de visión promedio
LFM2.5-VL-3B 3,1B 78,7 68,5 69,4
LFM2-VL-3B 3,1B 6,0 62,1 57,2
InternVL 3.5 4B 4,7B 82,0 67,1 69,4
Qwen3.5-4B 4,7B 76,3 63,6 70,1
Gemma-4-E4B-it 8B 45,8 45,2 59,7

¿Qué tan rápido se ejecuta?

Lo suficientemente rápido para importar en dispositivos reales. En el chip M5 Max de Apple (el tipo que se encuentra en una MacBook Pro de gama alta), procesa 228 tokens por segundo, donde un token es aproximadamente tres cuartos de una palabra. En el Ryzen AI Max+ 395 de AMD (un chip que se encuentra en ciertas laptops con Windows), alcanza 116 tokens por segundo. En un smartphone Galaxy S26 Ultra, alcanza 20 tokens por segundo, lo que es suficientemente rápido para una conversación en vivo.

En una GPU Nvidia H100 de grado servidor (el chip especializado que realiza cálculos pesados de IA en centros de datos), alcanza alrededor de 11.000 tokens por segundo a carga alta, casi el doble de velocidad que rivales de 4 mil millones de parámetros.

¿Para quién es esto?

Desarrolladores que construyen aplicaciones que necesitan entender imágenes o pantallas sin enviar datos a un servidor remoto. Piensa en herramientas de accesibilidad que describen lo que hay en pantalla, aplicaciones de gastos que leen recibos, o software empresarial que rellena formularios automáticamente. El modelo está disponible ahora en Hugging Face, la plataforma para compartir modelos de IA, en la cuenta de Liquid AI.

© 2026 AI2Day