रोबोट को भौतिक दुनिया को सच में समझने के लिए घर्षण महसूस करना चाहिए

VμA नामक एक नई मॉडल क्लास रोबोट सोच के केंद्र में पकड़ की भौतिकी रखती है। यह हर उस रोबोट के लिए क्यों मायने रखता है जो चीजें उठाता है।

AI2Day Newsdesk· 4 min read
A modern urban street at dusk photographed from street level, showing a sleek electric vehicle with a sensor array on its roof waiting at a glowing crosswalk, s
Share

मुख्य बिंदु

  • Contactile, एक सामरिक संवेदक कंपनी, VμA (vision-mu-action) नामक एक नई AI मॉडल क्लास का प्रस्ताव करती है जो रोबोट को कैमरा दृष्टि के साथ वास्तविक समय घर्षण डेटा प्रदान करती है।
  • वर्तमान रोबोट AI मॉडल एक मुख्य भौतिक मात्रा को छोड़ देते हैं: स्थैतिक घर्षण का गुणांक (mu), जो यह निर्धारित करता है कि पकड़ी गई वस्तु फिसलती है या रहती है।
  • Contactile का PapillArray संवेदक घर्षण और स्लिप स्थिति को सेंसर में ही गणना करता है, बिना किसी प्रसंस्करण विलंब के, वास्तविक समय में।
  • रोबोट सिमुलेशन प्रशिक्षण और वास्तविक दुनिया के प्रदर्शन के बीच का अंतर मुख्य रूप से प्रशिक्षण वातावरण में घर्षण भौतिकी की अनुपस्थिति के कारण माना जाता है।

एक रोबोट भुजा एक डिब्बे में पहुंचती है, एक गीली बोतल पकड़ती है, और इसे गिरा देती है। कैमरे ने बोतल देखी। जोड़ों ने भार महसूस किया। लेकिन किसी ने भी रोबोट को नहीं बताया कि सतह कितनी फिसलन भरी थी। यह एक ही गायब तथ्य है कि रोबोट ग्रिपर्स अभी भी ऐसे कार्यों में विफल होते हैं जो एक मानव बालक बिना सोचे समझे करता है।

Contactile, एक ऑस्ट्रेलियाई संवेदक कंपनी, The Robot Report द्वारा पहली बार रिपोर्ट किए गए एक नए तकनीकी टुकड़े में तर्क देती है कि यह अंतराल किसी भी ने जो ठीक किया है उससे गहरा चलता है। समस्या उन AI मॉडल के अंदर बैठती है जो रोबोट दुनिया के बारे में सोचने के लिए उपयोग करते हैं।

एक विश्व मॉडल क्या है, और इसे घर्षण की आवश्यकता क्यों है?

एक विश्व मॉडल भौतिक वास्तविकता की रोबोट की आंतरिक तस्वीर है: एक सॉफ्टवेयर जो भविष्यवाणी करता है कि अगला क्या होगा ताकि रोबोट योजना बना सके। इसे रोबोट के रूप में सोचें कि यह खुद से पूछ रहा है, "अगर मैं थोड़ा कठोर निचोड़ूं, तो क्या यह अंडा टूट जाएगा?" एक अच्छा विश्व मॉडल का मतलब है कि रोबोट को हर कार्य को याद नहीं करना पड़ता। यह नए कार्यों के माध्यम से तर्क कर सकता है।

लेकिन एक विश्व मॉडल केवल उतना ही अच्छा है जितनी जानकारी यह शुरू करता है। आज के मॉडल मुख्य रूप से दो इनपुट पर शर्त रखते हैं: कैमरों से छवियां और रोबोट की अपनी मोटर्स से संयुक्त स्थितियां। खुली जगह के माध्यम से आगे बढ़ने के लिए, यह ठीक है। वस्तुओं को पकड़ने और संभालने के लिए, यह नहीं है।

गायब संख्या को स्थैतिक घर्षण का गुणांक कहा जाता है, जिसे mu के रूप में लिखा जाता है। यह भौतिक मान है जो यह तय करता है कि क्या कोई पकड़ी गई वस्तु पकड़ी हुई रहती है। यह सामग्री के आधार पर बदलता है, चाहे सतह गीली हो, पहनी हुई हो, या लेपित हो, और तापमान। एक कैमरा इसे नहीं देख सकता। मोटर करंट इसे सटीक रूप से गणना नहीं कर सकते। एक दबाव मानचित्र आपको बता सकता है कि कुछ पकड़ा जा रहा है, लेकिन यह नहीं कि पकड़ विफल होने वाली है या नहीं।

mu के बिना, एक रोबोट का विश्व मॉडल वास्तविकता की एक अधूरी तस्वीर से तर्क दे रहा है। यह प्रशिक्षण डेटा से पैटर्न सीख सकता है, लेकिन यह उन सबक को एक नई वस्तु या बदली हुई सतह पर विश्वसनीय रूप से स्थानांतरित नहीं कर सकता है, क्योंकि जो एक चर है जो पकड़ सफलता को नियंत्रित करता है वह सरल रूप से वहां नहीं है।

सेंसर जो कैमरों को नहीं माप सकते उसे मापता है

Contactile का PapillArray Tactile Compute Module एक अंगुली के आकार का संवेदक सरणी है जो रोबोट के ग्रिपर पर बैठता है। प्रत्येक छोटा संवेदन बिंदु, जिसे टैक्सल कहा जाता है, सभी तीन दिशाओं में बल को मापता है। सेंसर फिर mu को सीधे, वास्तविक समय में, सेंसर में ही गणना करता है बिना डेटा को पहले अलग कंप्यूटर को भेजे।

आउटपुट में प्रत्येक taxel पर पूर्ण 3D बल, संपर्क पैच भर में कुल बल और टॉर्क, वर्तमान घर्षण मान, चाहे प्रत्येक बिंदु फिसल रहा है या रहा है, और ड्रॉप को रोकने के लिए आवश्यक न्यूनतम पकड़ बल शामिल हैं। ये संपर्क भौतिकी में निहित हैं, सीखे गए अनुमान नहीं।

Contactile इस पूर्ण सिग्नल स्टैक का उपयोग करने वाले मॉडलों को VμA नाम देने का प्रस्ताव करता है: vision-mu-action। पहली पीढ़ी के मॉडल को अपने नाम मिले जब एक नया इनपुट महत्वपूर्ण होने के लिए पर्याप्त हो गया। Vision-language-action (VLA) मॉडल ने रोबोट शिक्षण में प्राकृतिक भाषा जोड़ी। Vision-force-action (VFA) मॉडल ने बल जोड़ा। VμA वास्तविक घर्षण भौतिकी जोड़ता है जो हर पूर्व दृष्टिकोण से अनुपस्थित रहे हैं।

प्रशिक्षण पक्ष पर, VμA डेटा सांख्यिकीय प्रॉक्सी के बजाय कारणात्मक भौतिक संकेतों के साथ डेटासेट को समृद्ध करता है। तैनाती पक्ष पर, एक PapillArray से लैस रोबोट जानता है कि यह अभी क्या पकड़ रहा है उसका घर्षण मान, और यदि शर्तें बदलती हैं तो तुरंत अपनी पकड़ को अनुकूल कर सकता है। कोई अनुमान नहीं। कोई डोमेन यादृच्छिकीकरण workarounds नहीं।

उन उद्योगों के लिए जहां रोबोट गीले उपज, लेपित पैकेजिंग, या चर सामग्री को संभालते हैं, पकड़ भौतिकी को सही प्राप्त करना एक अनुसंधान जिज्ञासा नहीं है। यह एक कार्यशील उत्पादन लाइन और एक जो निरंतर मानव सुधार की आवश्यकता है के बीच अंतर है।

© 2026 AI2Day