एआई ट्यूटर बहुत मददगार हैं। एक नए परीक्षण से पता चलता है कि वे पीछे हटना कब सीखें इससे जूझते हैं

एलन इंस्टीट्यूट फॉर एआई के शोधकर्ताओं ने असली कक्षा के ट्रांसक्रिप्ट का उपयोग करके एक बेंचमार्क बनाया है यह जानने के लिए कि क्या एआई ट्यूटर शिक्षण में सबसे कठिन निर्णय ले सकते हैं: कब किसी छात्र की मदद करनी है और कब उन्हें किसी समस्या से जूझने देना चाहिए।

AI2Day Newsdesk4 min read
Photoreal editorial shot of a modern laptop on a bright desk, screen glowing with an abstract video editing timeline and a soft blurred portrait thumbnail sugge
Share

मुख्य बिंदु

  • एलन इंस्टीट्यूट फॉर एआई ने TutorMoments जारी किया, जो 462 वास्तविक एक-से-एक गणित ट्यूटरिंग ट्रांसक्रिप्ट का उपयोग करके एआई ट्यूटर्स यह परीक्षण करने के लिए कि वे कब मदद करें और कब रुकें।
  • डेटासेट में 27 अनुभवी अमेरिकी गणित शिक्षकों द्वारा कक्षा 2 से 7 तक चिह्नित 1,500 से अधिक निर्णय बिंदु शामिल हैं।
  • सात बड़े भाषा मॉडल, ChatGPT और Claude जैसे चैटबॉट के पीछे की तकनीक, का परीक्षण किया गया; जब कोई विशिष्ट निर्देश नहीं दिए गए तो सभी ने छात्रों की अत्यधिक मदद करने का रुझान दिखाया।
  • एक मॉडल को अधिक विस्तृत प्रॉम्प्ट देने से उसके स्कोर में सुधार हुआ, लेकिन कोई भी मॉडल उसी क्षण में मानव ट्यूटर्स द्वारा दिखाए गए निर्णय से लगातार मेल नहीं खाया।
  • बेंचमार्क, डेटासेट और कोड सभी स्वतंत्र रूप से उपलब्ध हैं, जिन्हें आंशिक रूप से Hugging Face डेटा रिपोजिटरी के माध्यम से प्रकाशित किया गया है।

एक अच्छा गणित ट्यूटर, जब कोई छात्र फंस जाता है, आमतौर पर एक सवाल पूछता है न कि जवाब देता है। "आप इस समस्या के बारे में पहले से क्या जानते हैं?" यह ठहराव, छात्र को वापस करने का यह छोटा सा धक्का, जानबूझकर किया जाता है। यह इसी तरह से सीखना स्थायी होता है।

एआई चैटबॉट्स इसके विपरीत बनाए गए हैं। उनका पूरा उद्देश्य मददगार होना है, जो ट्यूटरिंग संदर्भ में अक्सर अवधारणा की व्याख्या करने, चरणों को रखने और छात्र को सीधे उत्तर तक ले जाने का अर्थ है। यह सार्थक सोच को छोटा करता है जिसे शोधकर्ता कहते हैं कि किसी चीज़ को वास्तव में समझने के लिए केंद्रीय है।

एलन इंस्टीट्यूट फॉर एआई की एक टीम जानना चाहती थी कि समस्या वास्तव में कितनी गंभीर है और क्या इसे ठीक किया जा सकता है।

TutorMoments वास्तव में कैसे काम करता है?

शोधकर्ताओं ने असली ट्यूटरिंग सत्रों के चारों ओर TutorMoments नामक एक बेंचमार्क बनाया, न कि काल्पनिक परिदृश्य। उन्होंने एक अमेरिकी ट्यूटरिंग कार्यक्रम से 462 ट्रांसक्रिप्ट एकत्र किए जो मुख्य रूप से कम आय वाले स्कूलों की सेवा करते हैं, सभी पहचान विवरण हटा दिए, और ट्रांसक्रिप्ट को 27 अनुभवी गणित शिक्षकों को सौंप दिया।

शिक्षकों ने प्रत्येक ट्रांसक्रिप्ट को पढ़ा और उन क्षणों को चिह्नित किया जहां एक ट्यूटर को असली विकल्प का सामना करना पड़ा: समस्या को आसान बनाएं, या छात्र को अधिक कठिन तरीके से तर्क देने के लिए धकेलें। वे चिह्नित क्षण परीक्षा बन गए।

प्रत्येक चिह्नित बिंदु पर, एक बड़ा भाषा मॉडल पांच आदान-प्रदान के लिए सत्र ले जाता है, एक दूसरा भाषा मॉडल छात्र की भूमिका निभाता है। एक स्कोरिंग सिस्टम तब जांचता है कि क्या एआई ट्यूटर ने उस क्षण के लिए सही कॉल किया था, जो शिक्षकों ने कहा कि छात्र को वास्तव में क्या जरूरत थी।

तीन चीजें जो मापी जा रही हैं वह हैं कि क्या मॉडल ने आवश्यकता होने पर उपयुक्त समर्थन दिया, जब छात्र तैयार था तो गहरी सोच के लिए धकेला, और उस क्षण की तुलना में अधिक मदद देने से बचा गया।

एआई ट्यूटर्स ने वास्तव में क्या किया?

परीक्षण किए गए हर मॉडल ने अत्यधिक मदद करने का रुझान दिखाया। "अच्छी तरह से ट्यूटर करें" का साधारण निर्देश दिए जाने पर, सभी सात मॉडल छात्रों को सोचने के लिए धकेलने के बजाय समझाने और मार्गदर्शन की ओर झुके।

जब शोधकर्ताओं ने प्रॉम्प्ट को फिर से लिखा तो व्यापार को स्पष्ट रूप से वर्तनी दी, सभी में स्कोर में सुधार हुआ। लेकिन कोई भी मॉडल उसी तरह विश्वसनीय रूप से सही कॉल नहीं बना सका जैसे एक अनुभवी शिक्षक करता है।

नीचे दिए गए परिणाम 0 और 1 के बीच स्कोर दिखाते हैं, जहां 1 का मतलब है कि मॉडल हर प्रासंगिक क्षण पर सही कॉल बनाता है।

प्रॉम्प्ट प्रकार उपयुक्त स्कैफोल्डिंग उपयुक्त कठोरता अत्यधिक स्कैफोल्डिंग से बचता है
मानव ट्यूटर (संदर्भ) 0.458 0.182 0.496
सादा प्रॉम्प्ट (एआई औसत) मानव से नीचे लगभग शून्य कम
मूल्यांकन-सचेत प्रॉम्प्ट (एआई सर्वश्रेष्ठ) मानव से ऊपर उच्चतर उच्चतर

एक महत्वपूर्ण सावधानी: मानव ट्यूटर के स्कोर कम दिखते हैं क्योंकि डेटासेट जानबूझकर छूटे हुए अवसरों के चारों ओर बनाया गया था, वे क्षण जहां शिक्षकों को लगा कि कुछ बेहतर किया जा सकता था। तो मानव नंबर आदर्श शिक्षण का चित्र नहीं हैं।

एआई ट्यूटरिंग टूल का उपयोग करने वाले छात्रों के लिए इसका क्या मतलब है?

यदि आपके बच्चे या छात्र एआई ट्यूटरिंग ऐप का उपयोग कर रहे हैं, तो ऐप संभवतः उनके लिए सोच का बहुत कुछ कर रहा है। यह पल में मददगार लगता है। समय के साथ, यह नहीं हो सकता है।

शोधकर्ता यह नहीं कह रहे हैं कि एआई ट्यूटर बेकार हैं। वे कह रहे हैं कि क्षेत्र को इस विशिष्ट कौशल को मापने और प्रशिक्षित करने के बेहतर तरीकों की आवश्यकता है। एक मॉडल जो कभी जवाब नहीं देता है वह स्वचालित रूप से एक अच्छा ट्यूटर नहीं है; जो मायने रखता है वह यह है कि क्या वह हर व्यक्तिगत क्षण में छात्र को सही तरीके से पढ़ता है।

पूर्ण डेटासेट, बेंचमार्क कोड और एक तकनीकी रिपोर्ट सार्वजनिक रूप से उपलब्ध हैं, जैसा कि Hugging Face पर डेटासेट भी है, ताकि अन्य शोधकर्ता और एआई ट्यूटरिंग टूल बनाने वाली कंपनियां अपने मॉडल को समान वास्तविक-विश्व निर्णय बिंदुओं के खिलाफ परीक्षण कर सकें।

यदि आप एआई ट्यूटरिंग टूल का उपयोग करते हैं तो क्या देखना चाहिए: ध्यान दें कि क्या यह आपसे सवाल पूछता है या बस उनका जवाब देता है। एक टूल जो हमेशा समझाता है वह ट्यूटरिंग नहीं है। यह गृहकार्य कर रहा है।

© 2026 AI2Day