Liquid AIs LFM2.5-VL-3B läuft auf Ihrem Telefon und kann trotzdem Ihren Bildschirm lesen
Das neue Sprachmodell mit 3 Milliarden Parametern passt in 3 GB Speicher, schlägt größere Konkurrenten bei Bildschirmablese-Benchmarks und läuft schnell genug auf einem Smartphone, um wirklich nützlich zu sein.

Wichtigste Punkte
- Liquid AI veröffentlichte LFM2.5-VL-3B auf Hugging Face, ein Vision-Language-Modell, das klein genug ist, um auf einem Laptop oder Smartphone ohne Cloud-Verbindung zu laufen.
- Das Modell erreicht 78,7 auf der ScreenSpot-v2 Desktop-Benchmark zum Ablesen digitaler Bildschirme, gegenüber 6,0 für seinen Vorgänger LFM2-VL-3B.
- Auf einer einzelnen Nvidia H100 GPU verarbeitet das Modell etwa eine Milliarde Ausgabe-Token pro Tag, etwa doppelt so schnell wie vergleichbare Modelle mit 4 Milliarden Parametern.
- Das Modell passt in ungefähr 3 GB Speicher und erreicht 20 Token pro Sekunde auf einem Samsung Galaxy S26 Ultra Smartphone.
- LFM2.5-VL-3B fügt Function Calling hinzu, eine Funktion, die es dem Modell ermöglicht, Aktionen in Apps und Tools auszulösen, zu seinen bisherigen Bildverständnisfähigkeiten.
Liquid AI hat LFM2.5-VL-3B veröffentlicht, ein Vision-Language-Modell (Software, die sowohl Bilder als auch Text versteht, wie eine fortgeschrittenere Version der Bildbeschreibungstools, die in einigen Telefonen eingebaut sind), das direkt auf alltäglicher Hardware laufen soll. Keine Internetverbindung zu einem Rechenzentrum erforderlich.
Die Hauptkennzahl ist die Größe. Mit 3,1 Milliarden Parametern (den internen Werten, die bestimmen, wie ein Modell denkt), passt es in etwa 3 GB Speicher. Das ist kleiner als viele Mobilspiele.
Was kann es eigentlich tun?
Das Modell liest Dokumente, dekodiert Text in Bildern, identifiziert, wo Objekte in einem Foto sitzen, und versteht, was auf einem Computer- oder Telefonbildschirm angezeigt wird. In der ScreenSpot-v2-Benchmark, einem Standard-Test zum Ablesen von Bildschirmoberflächen, erzielte LFM2.5-VL-3B 78,7 für Desktop, 81,2 für Mobilgeräte und 82,2 für Web. Sein Vorgänger, LFM2-VL-3B, erreichte 6,0, 7,6 und 2,5 bei denselben drei Tests.
Das Modell unterstützt auch Function Calling: die Möglichkeit, Aktionen in anderer Software auszulösen, wie etwa auf einen Button zu klicken oder ein Formular auszufüllen, basierend auf dem, was es auf dem Bildschirm sieht. Liquid AI sagt, dass die Leistung hier jetzt mit Googles Gemma-4-E2B und Alibabas Qwen3.5-2B gleichberechtigt ist, zwei konkurrierenden kleinen Modellen.
| Modell | Größe | ScreenSpot-v2 Desktop | MathVista (mini) | Durchschnittliche Vision-Punktzahl |
|---|---|---|---|---|
| LFM2.5-VL-3B | 3.1B | 78.7 | 68.5 | 69.4 |
| LFM2-VL-3B | 3.1B | 6.0 | 62.1 | 57.2 |
| InternVL 3.5 4B | 4.7B | 82.0 | 67.1 | 69.4 |
| Qwen3.5-4B | 4.7B | 76.3 | 63.6 | 70.1 |
| Gemma-4-E4B-it | 8B | 45.8 | 45.2 | 59.7 |
Wie schnell läuft es?
Schnell genug, um auf echten Geräten einen Unterschied zu machen. Auf Apples M5 Max-Chip (wie er in einem hochwertigen MacBook Pro zu finden ist), verarbeitet es 228 Token pro Sekunde, wobei ein Token ungefähr drei Viertel eines Wortes ist. Auf AMDs Ryzen AI Max+ 395 (ein Chip in bestimmten Windows-Laptops) erreicht es 116 Token pro Sekunde. Auf einem Galaxy S26 Ultra Smartphone erreicht es 20 Token pro Sekunde, was schnell genug für ein Live-Gespräch ist.
Auf einer Server-Klasse Nvidia H100 GPU (dem spezialisierten Chip, der Heavy-AI-Berechnung in Rechenzentren durchführt), erreicht es etwa 11.000 Token pro Sekunde unter hoher Last, fast doppelt so schnell wie Konkurrenten mit 4 Milliarden Parametern.
Für wen ist das gedacht?
Entwickler, die Apps erstellen, die Bilder oder Bildschirme verstehen müssen, ohne Daten an einen entfernten Server zu senden. Denken Sie an Barrierefreiheitstools, die beschreiben, was auf dem Bildschirm angezeigt wird, Ausgaben-Apps, die Quittungen lesen, oder Business-Software, die Formulare automatisch ausfüllt. Das Modell ist jetzt auf Hugging Face, der Plattform zum Teilen von AI-Modellen, unter Liquid AIs Konto verfügbar.



