Liquid AI का LFM2.5-VL-3B आपके फोन पर चल सकता है और अभी भी आपकी स्क्रीन पढ़ सकता है

यह नया 3-बिलियन-पैरामीटर विज़न मॉडल 3 जीबी मेमोरी में फिट होता है, स्क्रीन-रीडिंग बेंचमार्क पर बड़े प्रतिद्वंद्वियों को हराता है, और स्मार्टफोन पर वास्तव में उपयोगी होने के लिए काफी तेजी से चलता है।

AI2Day Newsdesk3 min read
Macro photograph of glowing amber light pulses travelling along the surface of a translucent circuit board, seen from directly above at a slight angle, deep bla
Share

मुख्य बिंदु

  • Liquid AI ने Hugging Face पर LFM2.5-VL-3B जारी किया, एक विज़न-लैंग्वेज मॉडल जो लैपटॉप या स्मार्टफोन पर क्लाउड कनेक्शन के बिना चलने के लिए काफी छोटा है।
  • मॉडल डिजिटल स्क्रीन पढ़ने के लिए ScreenSpot-v2 डेस्कटॉप बेंचमार्क पर 78.7 स्कोर करता है, जो इसके पूर्ववर्ती LFM2-VL-3B के लिए 6.0 से ऊपर है।
  • एक ही Nvidia H100 GPU पर, मॉडल प्रति दिन लगभग एक बिलियन आउटपुट टोकन संसाधित करता है, जो तुलनीय 4-बिलियन-पैरामीटर मॉडल की तुलना में लगभग दोगुना तेज है।
  • मॉडल लगभग 3 जीबी मेमोरी में फिट होता है और Samsung Galaxy S26 Ultra स्मार्टफोन पर 20 टोकन प्रति सेकंड तक पहुंचता है।
  • LFM2.5-VL-3B फंक्शन कॉलिंग जोड़ता है, एक ऐसी विशेषता जो मॉडल को ऐप्स और टूल में कार्रवाई शुरू करने देती है, इसकी पिछली छवि-समझ क्षमताओं के लिए।

Liquid AI ने LFM2.5-VL-3B जारी किया है, एक विज़न-लैंग्वेज मॉडल (सॉफ्टवेयर जो छवियों और पाठ दोनों को समझता है, कुछ फोन में बनाए गए छवि-विवरण उपकरणों की तुलना में अधिक सक्षम संस्करण), रोजमर्रा के हार्डवेयर पर सीधे चलाने के लिए डिज़ाइन किया गया है। डेटा सेंटर में इंटरनेट कनेक्शन की कोई आवश्यकता नहीं।

मुख्य संख्या आकार है। 3.1 बिलियन पैरामीटर (आंतरिक मान जो मॉडल के बारे में सोचने के तरीके को आकार देते हैं) पर, यह लगभग 3 जीबी मेमोरी में फिट होता है। यह कई मोबाइल गेम से छोटा है।

यह वास्तव में क्या कर सकता है?

मॉडल दस्तावेजों को पढ़ता है, छवियों में पाठ को डिकोड करता है, फोटो में वस्तुओं की स्थिति की पहचान करता है, और कंप्यूटर या फोन स्क्रीन पर क्या है यह समझता है। ScreenSpot-v2 बेंचमार्क पर, ऑन-स्क्रीन इंटरफेस पढ़ने के लिए एक मानक परीक्षण, LFM2.5-VL-3B ने डेस्कटॉप के लिए 78.7, मोबाइल के लिए 81.2, और वेब के लिए 82.2 स्कोर किया। इसके पूर्ववर्ती, LFM2-VL-3B, ने एक ही तीन परीक्षणों पर 6.0, 7.6, और 2.5 स्कोर किए।

मॉडल फंक्शन कॉलिंग का भी समर्थन करता है: दूसरे सॉफ्टवेयर में कार्रवाई शुरू करने की क्षमता, जैसे किसी बटन को क्लिक करना या फॉर्म भरना, जो यह स्क्रीन पर देखता है। Liquid AI का कहना है कि यहां प्रदर्शन अब Google के Gemma-4-E2B और Alibaba के Qwen3.5-2B के समान है, दो प्रतिस्पर्धी छोटे मॉडल।

मॉडल आकार ScreenSpot-v2 डेस्कटॉप MathVista (mini) औसत विज़न स्कोर
LFM2.5-VL-3B 3.1B 78.7 68.5 69.4
LFM2-VL-3B 3.1B 6.0 62.1 57.2
InternVL 3.5 4B 4.7B 82.0 67.1 69.4
Qwen3.5-4B 4.7B 76.3 63.6 70.1
Gemma-4-E4B-it 8B 45.8 45.2 59.7

यह कितनी तेजी से चलता है?

असली उपकरणों पर मायने रखने के लिए काफी तेजी से। Apple के M5 Max चिप पर (हाई-एंड MacBook Pro में पाई जाने वाली तरह), यह 228 टोकन प्रति सेकंड संसाधित करता है, जहां एक टोकन शब्द का लगभग तीन-चौथाई है। AMD के Ryzen AI Max+ 395 पर (कुछ Windows लैपटॉप में पाया जाने वाला चिप), यह 116 टोकन प्रति सेकंड तक पहुंचता है। Galaxy S26 Ultra स्मार्टफोन पर, यह 20 टोकन प्रति सेकंड तक पहुंचता है, जो लाइव बातचीत के लिए काफी तेज है।

सर्वर-ग्रेड Nvidia H100 GPU पर (विशेषीकृत चिप जो डेटा सेंटर में भारी AI संख्या-क्रंचिंग करता है), यह उच्च लोड पर लगभग 11,000 टोकन प्रति सेकंड तक पहुंचता है, जो 4-बिलियन-पैरामीटर प्रतिद्वंद्वियों की तुलना में लगभग दोगुना तेज है।

यह किसके लिए है?

डेवलपर्स जो ऐसे ऐप्स बना रहे हैं जिन्हें दूरस्थ सर्वर को डेटा भेजे बिना छवियों या स्क्रीन को समझना होगा। पहुंच उपकरणों के बारे में सोचें जो यह वर्णन करते हैं कि स्क्रीन पर क्या है, व्यय ऐप्स जो रसीदें पढ़ते हैं, या व्यावसायिक सॉफ्टवेयर जो स्वचालित रूप से फॉर्म भरता है। मॉडल अब Hugging Face पर उपलब्ध है, AI मॉडल साझा करने के लिए प्लेटफॉर्म, Liquid AI के खाते के अंतर्गत।

© 2026 AI2Day