वेरिफाइड लेवल पर स्कोर किए गए जवाबों का हिस्सा
48 होल्ड-आउट स्पीकिंग जवाब, हर बैंड में 16। हर GPT मॉडल को ट्रांसक्रिप्ट दिया गया और सीधे शब्दों में CELPIP स्केल पर स्कोर करने के लिए कहा गया; तीन रन का औसत। Engine 2.0 अपने सामान्य प्रोडक्शन कॉन्फिगरेशन में चला।
81%
Prepamigo Engine 2.0
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Prepamigo बनाम टॉप चैटबॉट प्लान
कनाडाई डॉलर में। Prepamigo की कीमतों में टैक्स शामिल है। Claude Max (US$100 से शुरू) और ChatGPT Pro (US$200) को टैक्स से पहले 1.38 की दर पर बदला गया है। सटीकता उन होल्ड-आउट जवाबों का हिस्सा है जिन्हें वेरिफाइड लेवल पर स्कोर किया गया, जब नामित मॉडल को सीधे शब्दों में जवाब स्कोर करने के लिए कहा गया; तीन रन का औसत।
ChatGPT शायद वह सबसे कॉमन टूल है जिसे CELPIP कैंडिडेट अपनी स्पीकिंग प्रैक्टिस को खुद स्कोर करने के लिए इस्तेमाल करते हैं। यह हर किसी के फोन में है, कुछ सेकंड में जवाब देता है, और खुशी-खुशी बता देगा कि आपका जवाब किस लेवल का था। यह लेख जिस सवाल का जवाब देता है वह यह है कि जो लेवल यह आपको बताता है, क्या वही लेवल आपको असल में मिलेगा। हमने टेस्ट ठीक वैसे ही चलाया जैसे एक स्टूडेंट करता: ट्रांसक्रिप्ट पेस्ट करना, स्कोर मांगना, और गिनती करना।
छोटा जवाब यह है: 48 स्पीकिंग जवाबों पर, जिन्हें किसी भी सिस्टम ने पहले नहीं देखा था और जिनमें से हर एक का स्कोर स्वतंत्र रूप से वेरिफाई किया गया था, Prepamigo Scoring Engine 2.0 81% बार सही लेवल पर पहुंचा। सीधे शब्दों में पूछने पर, GPT 5.6 sol, जो ChatGPT के पेड प्लान के पीछे का मॉडल है, 35% बार सही लेवल पर पहुंचा। GPT 5.5 ने 37% हासिल किया, GPT 5.6 luna ने 31%, और GPT-4o mini ने 45%, ऐसा आंकड़ा जो असल से बेहतर दिखता है, क्योंकि यह मॉडल लगभग हर चीज़ को कम स्कोर देता है और इसलिए कमज़ोर जवाबों पर संयोग से सही निकल जाता है।
फिर हमने वह किया जो ज़्यादातर तुलनाएं छोड़ देती हैं। हमने हर GPT मॉडल को अपनी खुद की ग्रेडिंग प्रक्रिया दी, हर टास्क के लिए असली कैलिब्रेशन उदाहरणों और उनके सामने एक ज़बरदस्ती तुलना के साथ, यह देखने के लिए कि यह अपने बेहतरीन रूप में कितना अच्छा हो सकता है। GPT 5.6 sol 71% तक पहुंच गया, GPT 5.5 69% तक, luna 63% तक और GPT-4o mini 50% तक। चारों फिर भी Engine 2.0 से पीछे रहे, और चारों को अब भी टॉप-लेवल जवाबों पर सबसे ज़्यादा दिक्कत हुई। इस लेख का बाकी हिस्सा दोनों टेस्ट, हर स्कोर लेवल पर नतीजे, एक जनरल-पर्पस असिस्टेंट स्केल के बीच की ओर क्यों खिंच जाता है, दोनों तरफ रोज़ का वर्कफ़्लो कैसा दिखता है, और अगर आप गंभीरता से प्रैक्टिस करना चाहते हैं तो हर विकल्प की कीमत क्या है — इन सबसे गुज़रता है।
सीधा टेस्ट: एक स्टूडेंट को असल में क्या मिलता है
इक्यासी प्रतिशत बनाम पैंतीस प्रतिशत। 48 जवाबों के टेस्ट में, यह GPT 5.6 sol के मुकाबले Engine 2.0 के लिए बाईस अतिरिक्त सही स्कोर हैं। दूसरे शब्दों में, Engine 2.0, GPT 5.6 sol से 71% कम स्कोरिंग गलतियां करता है, GPT 5.5 से 70% कम, GPT 5.6 luna से 73% कम और GPT-4o mini से 66% कम।
सीधे टेस्ट के तीन अलग-अलग रन में GPT 5.6 sol को 31%, 40% और 35% मिला, और GPT 5.5 को 35%, 42% और 33%। रन के बीच का यह फ़र्क़ खुद एक निष्कर्ष है: अगर आप ChatGPT से दो अलग-अलग दिन एक ही ट्रांसक्रिप्ट को ग्रेड करने के लिए कहें, तो अक्सर आपको दो अलग-अलग स्कोर मिलेंगे। Engine 2.0 ने अपने तीनों रन में हर बार 81.3% स्कोर किया।
फ़र्क़ कहां खुलता है: स्कोर लेवल के हिसाब से
एक ओवरऑल आंकड़ा यह छुपा देता है कि गलतियां कहां होती हैं। ऐसा ग्रेडर जो कमज़ोर जवाबों पर बहुत बढ़िया हो और मज़बूत जवाबों पर बेकार हो, एक शुरुआती स्टूडेंट के लिए ठीक है, लेकिन 10 का लक्ष्य रखने वाले किसी व्यक्ति के लिए नुकसानदेह है। तो यहां हैं सीधे टेस्ट के नतीजे, वेरिफाइड बैंड के हिसाब से बांटे गए।
लोअर-लेवल जवाब (वेरिफाइड स्कोर 4 या 5)
16 होल्ड-आउट जवाब, सीधा प्रॉम्प्ट, तीन रन का औसत। ज़्यादातर चूक 3 का स्कोर हैं।
88%
Prepamigo Engine 2.0
75%
GPT-4o mini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
कमज़ोर जवाबों पर, Engine 2.0 88% के साथ आगे है। GPT-4o mini 75% के साथ इसके बाद आता है, यही वह एकमात्र जगह है जहां इसकी कम स्कोर देने की आदत इसके फ़ायदे में काम करती है। तीन बड़े GPT मॉडल 52% से 54% के बीच हैं: लगभग आधी बार वे 4 या 5 वाले जवाब को 3 का स्कोर देते हैं, जो गलत बैंड है, हालांकि दिशा समझ में आती है। ChatGPT से ग्रेड करवाने वाले किसी शुरुआती स्टूडेंट को लगभग आधी बार बताया जाएगा कि वह असल से कमज़ोर है।
मिडिल-लेवल जवाब (वेरिफाइड स्कोर 7 या 8)
16 होल्ड-आउट जवाब, सीधा प्रॉम्प्ट, तीन रन का औसत। चूक लगभग हमेशा 5 या 6 होती है।
85%
Prepamigo Engine 2.0
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
मिडिल बैंड वह जगह है जहां सीधे प्रॉम्प्ट वाले GPT मॉडल पूरी तरह बिखर जाते हैं। Engine 2.0 85% पर है; GPT-4o mini 44% पर; GPT 5.5, GPT 5.6 sol और luna 27% से 29% के बीच। मिडिल-लेवल जवाबों में मज़बूती और कमज़ोरी का एक असली मिश्रण होता है जिसे तोलना पड़ता है, और तुलना के लिए कोई कैलिब्रेशन उदाहरण न होने पर, GPT मॉडल कमज़ोरियां देखते हैं और 5 या 6 दे देते हैं। GPT 5.6 sol से स्कोर मांगने वाला 7 या 8 का स्पीकर दस में से तीन बार से भी कम सही बैंड सुनेगा।
टॉप-लेवल जवाब (वेरिफाइड स्कोर 10 या उससे ऊपर)
16 होल्ड-आउट जवाब, सीधा प्रॉम्प्ट, तीन रन का औसत। लगभग हर चूक 7 या 8 है।
71%
Prepamigo Engine 2.0
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
टॉप पर, Engine 2.0 71% टॉप-लेवल जवाबों को पहचानता है। GPT 5.5 27% को पहचानता है, GPT 5.6 sol 25% को, GPT-4o mini 17% को, और GPT 5.6 luna 13% को। हर GPT मॉडल हर दस में से कम से कम सात उन जवाबों को 7 या 8 दे देता है जो 10 के लायक होते हैं।
ज़रा सोचिए कि इसका मतलब किसी मज़बूत कैंडिडेट के लिए क्या है। आप आठ जवाब रिकॉर्ड करते हैं, उन्हें ट्रांसक्राइब करते हैं, उन्हें ChatGPT में पेस्ट करते हैं और स्कोर मांगते हैं, और यह आपको बताता है कि उनमें से छह 7 और 8 हैं। आप यह मान लेते हैं कि आप एक ठोस मिडिल-बैंड स्पीकर हैं जिसे अभी और काम करना है। असल में आप शुरू से ही 10 पर थे। यह कोई काल्पनिक बात नहीं है। हमारे टेस्ट में हर GPT मॉडल ने ज़्यादातर टॉप-लेवल जवाबों पर ठीक यही किया।
अगर आप ChatGPT को हमारी पूरी प्रक्रिया दें तो क्या होगा?
सीधे टेस्ट के आंकड़ों को यह मानकर पढ़ना आसान है कि GPT एक कमज़ोर मॉडल फैमिली है। ऐसा नहीं है। समस्या इंटेलिजेंस की नहीं है। समस्या यह है कि जब किसी मॉडल से नंबर मांगा जाता है और उसके पास तुलना करने के लिए कुछ नहीं होता, तो वह अंदाज़ा लगाता है, और जब यह अंदाज़ा लगाता है तो कम और बीच की ओर झुककर लगाता है।
तो हमने दूसरा टेस्ट चलाया। हर GPT मॉडल को वही पैकेज मिला जो Engine 2.0 के ग्रेडर पाते हैं: ट्रांसक्रिप्ट, टास्क, उस एक्ज़ैक्ट टास्क के लिए हर लेवल पर दो असली कैलिब्रेशन उदाहरण, और नंबर बनाने के बजाय चार में से हर डाइमेंशन के लिए सबसे नज़दीकी उदाहरण बताने का निर्देश। हर मॉडल को उसकी अपनी आदतों के हिसाब से एक छोटा कैलिब्रेशन नोट भी मिला।
हमारी पूरी प्रक्रिया देने पर: वेरिफाइड लेवल पर स्कोर किए गए जवाबों का हिस्सा
वही 48 होल्ड-आउट जवाब। हर GPT मॉडल ने हर जवाब को एक बार ग्रेड किया, ठीक उन्हीं ट्रांसक्रिप्ट, निर्देशों और कैलिब्रेशन उदाहरणों के साथ जो Engine 2.0 के खुद के ग्रेडर इस्तेमाल करते हैं।
81%
Prepamigo Engine 2.0
71%
GPT 5.6 sol
69%
GPT 5.5
63%
GPT 5.6 luna
50%
GPT-4o mini
कैलिब्रेशन उदाहरण बहुत बड़ा फ़र्क़ डालते हैं। GPT 5.6 sol दोगुना हो जाता है, 35% से 71%। GPT 5.5 37% से 69% पर जाता है, luna 31% से 63% पर। GPT-4o mini मुश्किल से हिलता है, 45% से 50%, क्योंकि यह जो भी दिखाया जाए, हर चीज़ को कम स्कोर देता ही रहता है; पूरी प्रक्रिया के साथ भी इसने एक भी टॉप-लेवल जवाब नहीं पहचाना। इससे पता चलता है कि किसी खास मकसद के लिए बने ग्रेडर की असली कीमत कहां है: ज़्यादा समझदार मॉडल में नहीं, बल्कि यह सुनने में असली उदाहरणों में कि हर लेवल हर खास टास्क पर कैसा लगता है, और ऐसे सवाल में जो मॉडल को अंदाज़ा लगाने के बजाय तुलना करने पर मजबूर करता है।
फिर भी, हर GPT मॉडल पीछे ही रहता है। पूरी प्रक्रिया के साथ, GPT 5.6 sol ओवरऑल Engine 2.0 से दस पॉइंट पीछे है, मिडिल बैंड में दस पॉइंट पीछे (85% के मुकाबले 75%), और टॉप पर आठ पॉइंट पीछे (71% के मुकाबले 63%)। इसकी बची हुई आदत है पॉलिश को ज़्यादा इनाम देना: स्मूथ डिलीवरी वाला एक सक्षम 8 का जवाब 9 या 10 तक धकेल दिया जाता है। GPT 5.6 luna इसका उल्टा करता है, मिडिल जवाबों को नीचे 5 की तरफ खींचता है, और मिडिल बैंड में 44% पर खत्म होता है। एक ही मॉडल का एक ही पास लगाना अब भी एक खास तरह का झुकाव रखता है, और Engine 2.0 बचे हुए फ़र्क़ को अलग-अलग प्रोवाइडर के दो स्वतंत्र ग्रेडरों, हर एक से तीन वोट जिनमें बीच वाला रखा जाता है, और एक ऐसे रीकंसिलिएशन रूल से बंद करता है जो जब दोनों ग्रेडर काफ़ी असहमत हों तो ज़्यादा वाला स्कोर लेता है।
हमने वह सीधा शॉर्टकट भी आज़माया: सीधे प्रॉम्प्ट को रखते हुए ऐसे निर्देश जोड़ना जैसे “बीच की तरफ मत झुकिए” या “लेवल 9 के जवाब का बेदाग होना ज़रूरी नहीं है।” इनसे कोई नापने लायक बदलाव नहीं आया। जो काम करता है वह है सवाल को बदलना, और मॉडल को तुलना करने के लिए कुछ असली देना।
वर्कफ़्लो का फ़र्क़: रिकॉर्ड करें और आगे बढ़ें, या सब कुछ खुद करें
सटीकता के आंकड़े यह मान लेते हैं कि ग्रेडिंग असल में होती है। ChatGPT के साथ, आपकी रिकॉर्डिंग रोकने और स्कोर पढ़ने के बीच हैरान करने लायक मात्रा में काम होता है, और उस काम का कुछ हिस्सा खुद स्कोर को बदल देता है।
पहला, आपको एक ट्रांसक्रिप्ट चाहिए। ChatGPT का वॉइस मोड एक बातचीत है, ग्रेडर नहीं; किसी रिकॉर्ड किए गए जवाब को ग्रेड करने के लिए आपको टेक्स्ट चाहिए। यानी या तो आप जो बोले उसे टाइप करें, जिससे वह बदल जाता है, या रिकॉर्डिंग को किसी ट्रांसक्रिप्शन टूल से गुज़ारें। और ट्रांसक्रिप्ट शब्दशः होनी चाहिए। हर फिलर, हर रीस्टार्ट, हर सेल्फ-करेक्शन उसमें बना रहना चाहिए। जब हमने हिचकिचाहटों को हटाकर एक “साफ़ की गई” ट्रांसक्रिप्ट टेस्ट की, तो सटीकता पंद्रह पॉइंट गिर गई, क्योंकि वे हिचकिचाहटें ठीक वही सबूत हैं जिनकी ज़रूरत ग्रेडर को यह जज करने के लिए होती है कि कोई जवाब कैसा लगता है। ज़्यादातर कंज़्यूमर ट्रांसक्रिप्शन टूल, जिनमें ज़्यादातर फोनों में बना-बनाया टूल भी शामिल है, डिफ़ॉल्ट रूप से साफ कर देते हैं।
दूसरा, आपको टास्क चाहिए। अगर आप पूछें तो ChatGPT एक CELPIP-स्टाइल प्रॉम्प्ट बना सकता है, लेकिन यह फ़ॉर्मेट, टाइमिंग और असली टेस्ट में इस्तेमाल होने वाले सिनेरियो के बारे में सिर्फ़ अंदाज़ा लगा रहा होता है। आपको पता नहीं चलेगा कि उसने जो प्रॉम्प्ट लिखा वह उससे मिलता है या नहीं जिससे आपको असल में जूझना होगा।
तीसरा, अगर आप सीधे टेस्ट के आंकड़ों से बेहतर कुछ चाहते हैं, तो आपको कैलिब्रेशन उदाहरण चाहिए: उसी टास्क टाइप के लिए हर लेवल पर असली जवाब, वेरिफाइड लेवल के साथ। यही वह इनपुट है जिसने हमारे टेस्ट में GPT 5.6 sol की सटीकता को दोगुना किया, और यही वह चीज़ है जिसे कोई स्टूडेंट घर पर नहीं बना सकता।
चौथा, आपको अगले जवाब के लिए यह सब फिर से करना पड़ता है, और हर एक आपके मैसेज अलाउंस में गिना जाता है।
Prepamigo पर, आप बैंक से एक टास्क चुनते हैं, टाइमर चलता है, आप बोलते हैं, और रुकने के लगभग दस सेकंड बाद स्कोर और फ़ीडबैक स्क्रीन पर आ जाता है। ट्रांसक्रिप्शन डिज़ाइन के हिसाब से शब्दशः होता है, कैलिब्रेशन उदाहरण टास्क के साथ अपने आप जुड़े होते हैं, और यहां न कुछ पेस्ट करना है न कुछ प्रॉम्प्ट करना है। शाम का ग्यारहवां जवाब भी उतनी ही मेहनत लेता है जितनी पहला।
स्थिरता: एक जैसा जवाब, एक जैसा स्कोर
ऐसा स्कोर जिसे आप दोहरा न सकें, कोई माप नहीं है। अगर एक ही रिकॉर्डिंग को सोमवार को 8 और मंगलवार को 10 मिलता है, तो आपने अपनी स्पीकिंग के बारे में कुछ नहीं सीखा। तो हमने रीपीटेबिलिटी भी टेस्ट की।
Engine 2.0 को अलग-अलग दिनों पर 48 होल्ड-आउट जवाबों पर तीन अलग-अलग बार चलाया गया। यह हर बार 81.3% स्कोर करता रहा। अलग-अलग जवाबों को देखने पर, 87.5% को तीनों रन में एक जैसा स्कोर मिला, और सिर्फ 4.2% कभी दो या उससे ज़्यादा पॉइंट से हिले, और वे सभी दो बैंड के बीच की सीमा पर बैठे हुए जवाब थे।
GPT 5.6 sol पर सीधा टेस्ट इसके सबसे बेहतर और सबसे कमज़ोर रन के बीच नौ पॉइंट हिला। यह स्थिरता का फ़र्क़ वोटिंग से आता है। Engine 2.0 में हर ग्रेडर हर जवाब पर तीन बार वोट करता है और बीच वाला वोट रखा जाता है। जब हमने वही कॉन्फ़िगरेशन तीन के बजाय एक ही वोट के साथ टेस्ट किया, तो रन के बीच एक जैसे स्कोर 87.5% से 77% तक गिर गए, और दो या उससे ज़्यादा पॉइंट उछलने वाले जवाबों का हिस्सा दोगुने से भी ज़्यादा हो गया। एक ChatGPT बातचीत एक ही वोट होती है। हमने यह भी जांचा कि क्या API के ज़रिए एक फ़िक्स्ड रैंडम सीड सेट करने से GPT मॉडल ज़्यादा रीपीटेबल बनते हैं। ऐसा नहीं हुआ; GPT 5.6 luna पर, रीपीटेबिलिटी असल में गिर गई।
ऐसा फ़ीडबैक जिस पर आप अमल कर सकें
ChatGPT एक अच्छा एक्सप्लेनर है। अगर आप पूछें कि इसने कोई स्कोर क्यों दिया, तो यह साफ अंग्रेज़ी में विस्तार से बताएगा, और सुधार भी सुझाएगा। ऐसे कैंडिडेट के लिए जो किसी जवाब पर बात करना चाहता है, यह सच में उपयोगी है।
खतरा यह है कि धाराप्रवाह व्याख्या सटीक निदान के बराबर नहीं है। जिस मॉडल ने किसी 10 को 7 स्कोर किया है, वह पूरे यकीन से बताएगा कि यह 7 क्यों है। यह इशारा करने के लिए कुछ न कुछ ढूंढ ही लेगा। और क्योंकि स्कोर करने से पहले उसे किसी सबूत के लिए ज़िम्मेदार नहीं होना पड़ा, इसलिए व्याख्या बाद में लिखी जाती है, ताकि वह उस नंबर को सही ठहरा सके जो वह पहले ही चुन चुका है।
Engine 2.0 उलटे तरीके से काम करता है। हर ग्रेडर को कोई लेवल बताने से पहले हर डाइमेंशन के लिए सबूत की ओर इशारा करना पड़ता है, और फ़ीडबैक उस सबूत से लिखा जाता है। यह आपके अपने शब्दों को कोट करता है: फ़ीडबैक के एक सैंपल में 158 कोटेशनों के ऑडिट में, 157 ट्रांसक्रिप्ट में शब्दशः मौजूद पाए गए। जब एक स्वतंत्र जजिंग मॉडल ने Engine 2.0 के फ़ीडबैक की हमारे पिछले सिस्टम के फ़ीडबैक से, एक जैसे जवाबों पर, ब्लाइंड तरीके से तुलना की, तो इसने 24 में से 20 तुलनाओं में Engine 2.0 को बेहतर माना, चाहे एक examiner की तरह जज किया गया हो या एक स्टूडेंट की तरह।
हमने यह भी जांचा कि फ़ीडबैक की आलोचना सही जगह पड़ती है या नहीं, इसके लिए हमने मज़बूत जवाब लिए और जानबूझकर एक-एक करके किसी एक डाइमेंशन को खराब किया। चार में से तीन मामलों में, जो डाइमेंशन खराब किया गया था वही वह डाइमेंशन था जिसका स्कोर सबसे ज़्यादा गिरा। यह ऐसी जांच है जिसे कोई चैटबॉट आसानी से पास नहीं कर सकता, क्योंकि उसके पास जांचने के लिए कोई तय डाइमेंशन नहीं होते।
रोज़ प्रैक्टिस करने की कीमत क्या है
स्पीकिंग स्कोर आपके चौथे जवाब पर नहीं, चालीसवें जवाब पर सबसे ज़्यादा उपयोगी होता है। तभी यह आपको बताना शुरू करता है कि आपके बोलने के तरीके में किया गया बदलाव असल में काम कर रहा है या नहीं। तो व्यावहारिक सवाल यह है कि बड़ी मात्रा में इस्तेमाल करने पर हर टूल की कीमत क्या पड़ती है।
ChatGPT Plus की कीमत US$20 प्रति माह है, यानी लगभग CA$28, जो हर महीने बिल होती है, जैसा सितंबर 2026 में प्रकाशित हुआ। यह आपको GPT 5.6 फैमिली देता है, हर रोलिंग विंडो पर मैसेज कैप के साथ; कैलिब्रेशन उदाहरणों के साथ लंबी ट्रांसक्रिप्ट ठीक वही तरह का मैसेज हैं जो उस अलाउंस का बड़ा हिस्सा खा जाती हैं, और एक बार लिमिट टकराने पर आप इंतज़ार करते हैं या किसी छोटे मॉडल पर उतर आते हैं। ChatGPT Pro, US$200 प्रति माह पर, यानी टैक्स से पहले लगभग CA$276, लिमिट को काफ़ी बढ़ा देता है। फ्री टियर अपने ज़्यादातर ट्रैफिक को छोटे मॉडलों पर भेज देता है, और इस टेस्ट में उनमें से सबसे छोटे मॉडल ने लगभग किसी भी टॉप-लेवल जवाब को नहीं पहचाना। किसी भी प्लान में क्वेश्चन बैंक, टाइमर, शब्दशः ट्रांसक्रिप्शन, कैलिब्रेशन उदाहरण, या CELPIP से जुड़ी कोई भी खास चीज़ शामिल नहीं है।
Prepamigo की कीमत CA$24.98 प्रति माह है, या एनुअल प्लान पर CA$8.25 प्रति माह, जो साल भर के लिए CA$98.98 है, टैक्स शामिल, और आप कभी भी कैंसल कर सकते हैं। हर प्लान में Engine 2.0 की असीमित स्कोरिंग शामिल है, किसी भी डेली, सेशन या वीकली कैप के बिना, असीमित प्रयास, और पूरा क्वेश्चन बैंक: Speaking, Writing, Reading और Listening में 80 पूरे प्रैक्टिस सेट और 2,000 से ज़्यादा प्रैक्टिस टास्क, जो CELPIP General टेस्ट के टास्क टाइप, टाइमिंग और फ़ॉर्मेट का पालन करने के लिए लिखे गए हैं।
सीधे शब्दों में: ChatGPT Plus की कीमत से भी कम में, आपको ऐसा ग्रेडर मिलता है जो सीधी तुलना में दो गुने से भी ज़्यादा सटीक है, जो आपको कभी इंतज़ार नहीं करवाता, और जिसमें सवाल और कैलिब्रेशन उदाहरण पहले से ही मौजूद हैं।
जब ChatGPT ही बेहतर टूल है
यह इस बात की दलील नहीं है कि CELPIP की तैयारी करते समय ChatGPT कभी न खोलें। एक गंभीर कैंडिडेट दोनों का इस्तेमाल कर सकता है।
- किसी जवाब पर बात करना। अगर आप यह समझना चाहते हैं कि कोई वजह कमज़ोर क्यों थी, या तीन बेहतर वजहों पर विचार करना चाहते हैं, तो बातचीत सही तरीका है। Engine 2.0 आपको एक फ़ैसला और सबूत देता है; यह बातचीत नहीं करता।
- वोकैबुलरी और वाक्य-रचना। किसी बात को कहने के पांच और नैचुरल तरीके पूछना जल्दी और उपयोगी होता है।
- किसी ऐसी चीज़ से बोलना जो जवाब भी दे। ChatGPT का वॉइस मोड अंग्रेज़ी को ऊंची आवाज़ में बोलने में सहज होने का एक ठीक-ठाक तरीका है। यह ग्रेडर नहीं है, लेकिन साथ ज़रूर है।
- राइटिंग प्रैक्टिस। लिखे हुए जवाबों को ट्रांसक्रिप्शन की ज़रूरत नहीं होती, इसलिए वर्कफ़्लो का फ़र्क़ छोटा है। राइटिंग पर GPT की सटीकता इस टेस्ट का हिस्सा नहीं थी और हम इसके बारे में कोई दावा नहीं करते।
- टेस्ट से बाहर की कोई भी चीज़। ChatGPT एक जनरल असिस्टेंट है और Prepamigo नहीं है।
यहां मौजूद सबूतों के आधार पर, ChatGPT को वह चीज़ नहीं होना चाहिए जो आपको बताए कि आप तैयार हैं या नहीं। इसके लिए आपको ऐसा ग्रेडर चाहिए जो इसी काम के लिए बनाया गया हो, ऐसे जवाबों पर टेस्ट किया गया हो जो उसने पहले नहीं देखे, और लेवल-दर-लेवल मापा गया हो।
आपके फ़ीडबैक में क्या नया है
Engine 2.0 के साथ एक नया बनाया गया फ़ीडबैक लेयर आता है। यह सिर्फ़ स्कोर नहीं, बल्कि दोनों ग्रेडर के सबूत को पढ़ता है, और इसे तीन तरह के स्टूडेंट पर टेस्ट किया गया है: कोई जो पहली बार CELPIP का सामना कर रहा है, कोई जिसकी अंग्रेज़ी कमज़ोर है और जो कोई ट्रिक ढूंढ रहा है, और कोई जिसके पास दिन में सिर्फ़ आधा घंटा है और अगले हफ़्ते टेस्ट है। यहां बताया गया है कि क्या बदला है।
- आपके अपने शब्द, वापस कोट किए गए. फ़ीडबैक का हर पॉइंट आपकी ट्रांसक्रिप्ट के उस ठीक वाक्यांश का हवाला देता है जिस पर ग्रेडर ने प्रतिक्रिया दी। अगर कोई वाक्यांश कोटेशन मार्क्स में है, तो वह जैसा-का-वैसा कॉपी किया गया है; हमारे ऑडिट में 158 में से 157 कोट ऐसे ही थे। फ़ीडबैक कभी वह नहीं बनाता जो आपने कहा ही नहीं।
- पहले ठीक करने के लिए एक चीज़. हर जवाब को एक ही टॉप मूव मिलता है: वह एक बदलाव जो आपका स्कोर सबसे ज़्यादा बढ़ाएगा, पेज पर सबसे सीधे शब्दों में लिखा हुआ। इसके बाद दो और ठोस कदम आते हैं, फिर बोलना शुरू करने से पहले दिमाग में दोहराने के लिए तीन पॉइंट की एक चेकलिस्ट।
- टास्क के हिसाब से सलाह. सलाह देना, किसी सीन का वर्णन करना और किसी को मनाना, इन सबका स्कोर अलग-अलग बातों पर होता है। फ़ीडबैक को अब पता है कि आठ टास्क टाइप में से हर एक किस चीज़ का इनाम देता है, और वह उसी पर बात करता है, बजाय इसके कि हर टास्क पर एक जैसी सामान्य टिप्स दोहराई जाएं।
- किस डाइमेंशन का पहले अभ्यास करें. फ़ीडबैक आपको बताता है कि चार डाइमेंशन में से कौन-सा आपका सबसे कमज़ोर है और कौन-सा सबसे मज़बूत, ताकि आपको पता हो कि अगला पॉइंट कहां से मिलेगा, बिना उसे किसी नंबर के पीछे छिपाए।
- टास्क ने क्या मांगा और आपसे क्या छूट गया. टास्क फ़ुलफ़िलमेंट के लिए, फ़ीडबैक प्रॉम्प्ट के उन खास हिस्सों की सूची देता है जो आपने कवर नहीं किए, या साफ़ शब्दों में कहता है कि आपने सब कुछ कवर कर लिया।
- ऐसी चीज़ें जिनका आप असल में अभ्यास कर सकते हैं. हर सुझाव कुछ ऐसा है जो आप अपने अगले प्रयास से पहले ज़ोर से बोलकर देख सकते हैं। ज़्यादा साफ़ बोलने या अपना एक्सेंट कम करने की कोई सलाह नहीं: लिसनेबिलिटी एक्सेंट को नहीं मापती, और फ़ीडबैक उस पर कभी कोई टिप्पणी नहीं करता।
- टाइमर के लिए कोई दोष नहीं. अगर टास्क पूरा होने के बाद घड़ी की वजह से जवाब कट जाता है, तो उस कट-ऑफ़ के लिए अंक नहीं काटे जाते, और फ़ीडबैक इसके लिए आपको नहीं डांटता।
जब एक स्वतंत्र जजिंग मॉडल ने इस फ़ीडबैक की तुलना हमारे पुराने सिस्टम द्वारा उन्हीं जवाबों के लिए बनाए गए फ़ीडबैक से की, बिना यह जाने कि कौन-सा कौन-सा है, तो उसने 24 में से 20 तुलनाओं में नए फ़ीडबैक को प्राथमिकता दी — एक परीक्षक की तरह जज करते हुए भी और एक स्टूडेंट की तरह जज करते हुए भी।
अक्सर पूछे जाने वाले सवाल
क्या ChatGPT मेरी CELPIP स्पीकिंग को स्कोर कर सकता है? यह आपको एक नंबर दे देगा। वेरिफाइड स्कोर वाले 48 अनदेखे जवाबों पर सीधे पूछने पर, GPT 5.6 sol 35% बार सही था, GPT 5.5 37%, luna 31%, GPT-4o mini 45%, जबकि Engine 2.0 के लिए यह 81% था। टॉप-लेवल जवाबों पर GPT 5.6 sol 25% बार सही था।
क्या Prepamigo, ChatGPT से ज़्यादा सटीक है? एक सीधी रिक्वेस्ट के साथ 81% बनाम GPT 5.6 sol के लिए 35%। कैलिब्रेशन उदाहरणों के साथ हमारी पूरी प्रक्रिया देने पर, GPT 5.6 sol 71% तक पहुंचा, जो अब भी दस पॉइंट पीछे है।
हर एक की कीमत कितनी है? ChatGPT Pro US$200 प्रति माह है, यानी टैक्स से पहले लगभग CA$276; Plus US$20 का है, जिसमें मैसेज कैप लगती है। Prepamigo CA$24.98 प्रति माह है, टैक्स शामिल, या एनुअल प्लान पर CA$8.25 प्रति माह, जिसमें असीमित स्कोरिंग और 80 प्रैक्टिस सेट मिलते हैं।
अगर मैं ChatGPT इस्तेमाल करूं, तो कौन सा GPT मॉडल इस्तेमाल करना चाहिए? सीधे प्रॉम्प्ट के साथ, इनमें से कोई भी अच्छा प्रदर्शन नहीं करता। कैलिब्रेशन उदाहरणों के साथ, GPT 5.6 sol। अगर आप 10 के आस-पास हैं, तो GPT-4o mini कभी नहीं।
Claude के मुकाबले वही तुलना पढ़ने के लिए, पढ़ें Prepamigo बनाम Claude। आठ सिस्टम की पूरी लीडरबोर्ड के लिए, पढ़ें कौन सा AI CELPIP स्पीकिंग को सबसे सटीक स्कोर करता है। यह लेख अंग्रेज़ी में भी उपलब्ध है: इसे अंग्रेज़ी में पढ़ें। या ट्रांसक्रिप्शन को छोड़ें और एक जवाब रिकॉर्ड करें।
