वेरिफाइड लेवल पर स्कोर किए गए जवाबों का हिस्सा
48 होल्ड-आउट स्पीकिंग जवाब, तीन लेवल में से हर एक पर 16। Claude को ट्रांसक्रिप्ट दिया गया और सीधे शब्दों में CELPIP स्केल पर स्कोर करने के लिए कहा गया; तीन रन का औसत। Engine 2.0 अपने सामान्य प्रोडक्शन कॉन्फिगरेशन में चला।
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
45%
Claude Sonnet 5
Prepamigo बनाम टॉप चैटबॉट प्लान
कनाडाई डॉलर में। Prepamigo की कीमतों में टैक्स शामिल है। Claude Max (US$100 से शुरू) और ChatGPT Pro (US$200) को टैक्स से पहले 1.38 की दर पर बदला गया है। सटीकता उन होल्ड-आउट जवाबों का हिस्सा है जिन्हें वेरिफाइड लेवल पर स्कोर किया गया, जब नामित मॉडल को सीधे शब्दों में जवाब स्कोर करने के लिए कहा गया; तीन रन का औसत।
अगर आपने कभी कोई स्पीकिंग ट्रांसक्रिप्ट Claude में पेस्ट करके उससे CELPIP रेटर की तरह ग्रेड करने को कहा है, तो आप इसका आकर्षण पहले से जानते हैं। यह फौरन जवाब देता है, अपनी बात खुद समझाता है, और कभी थकता नहीं। सवाल यह है कि जो नंबर यह आपको देता है, क्या वही नंबर आपको असल में मिलता। हमने यह टेस्ट वैसे ही चलाया जैसे कोई स्टूडेंट चलाता: वही ट्रांसक्रिप्ट, स्कोर के लिए एक सीधी रिक्वेस्ट, और फिर हमने गिनती की।
छोटा जवाब यह है: 48 स्पीकिंग जवाबों पर, जिन्हें सिस्टम ने पहले कभी नहीं देखा था और जिनका स्कोर स्वतंत्र रूप से वेरिफाइड था, Prepamigo Scoring Engine 2.0, 81% बार सही लेवल पर पहुंचा। वही ट्रांसक्रिप्ट्स सीधे शब्दों में स्कोर करने के लिए कहने पर, Claude Opus 5, 62% बार सही लेवल पर पहुंचा और Claude Sonnet 5, 45% बार। यह अंतर वहां सबसे ज़्यादा खुलता है जहां हाई स्कोर की तलाश में हर किसी के लिए यह सबसे ज़्यादा मायने रखता है: टॉप-लेवल जवाबों पर, Engine 2.0 ने 71% पहचाने, Opus 5 ने 50%, और Sonnet 5 ने सिर्फ 29%।
फिर हमने वह किया जिसे ज़्यादातर तुलनाएं छोड़ देती हैं। हमने Claude को अपनी खुद की ग्रेडिंग प्रक्रिया दी, हर टास्क के लिए असली कैलिब्रेशन उदाहरणों के साथ और उनके मुकाबले एक अनिवार्य तुलना के साथ, यह देखने के लिए कि यह कितना अच्छा हो सकता है। Opus 5, 77% तक चढ़ गया और Sonnet 5, 69% तक। दोनों फिर भी Engine 2.0 से पीछे रहे, और दोनों को सबसे ज़्यादा मुश्किल टॉप-लेवल जवाबों पर ही हुई। इस लेख का बाकी हिस्सा दोनों टेस्ट्स से गुज़रता है, हर स्कोर लेवल पर नंबर कैसे दिखते हैं, एक जनरल-पर्पस असिस्टेंट स्केल के बीच की तरफ क्यों खिंचता है, दोनों तरफ रोज़ का वर्कफ़्लो कैसा दिखता है, और अगर आप गंभीरता से प्रैक्टिस करना चाहते हैं तो हर विकल्प की कीमत क्या पड़ती है।
सीधा टेस्ट: एक स्टूडेंट को असल में क्या मिलता है
इक्यासी प्रतिशत बनाम बासठ और पैंतालीस। 48 जवाबों के टेस्ट में, Engine 2.0 और Opus 5 के बीच का अंतर नौ अतिरिक्त सही स्कोर का है, और Engine 2.0 और Sonnet 5 के बीच का अंतर सत्रह का। दूसरे शब्दों में, Engine 2.0, Opus 5 से 51% कम और Sonnet 5 से 66% कम स्कोरिंग गलतियां करता है।
सीधे टेस्ट के तीन अलग-अलग रन में Opus 5 को 62%, 65% और 58% मिले, और Sonnet 5 को 44%, 46% और 46%। रन-दर-रन कई अंकों का यह फैलाव खुद एक खोज है: Claude से एक ही ट्रांसक्रिप्ट को दो अलग-अलग दिन ग्रेड करने को कहें और अक्सर आपको दो अलग-अलग स्कोर मिलेंगे। Engine 2.0 ने अपने तीनों रन में हर बार 81.3% स्कोर किया।
अंतर कहां खुलता है: स्कोर लेवल दर लेवल
ज़्यादातर ग्रेडर, इंसान हों या मशीन, स्केल के बीच की तरफ खिंच जाते हैं। एक मज़बूत जवाब 10 के बजाय 8 बन जाता है; एक कमज़ोर जवाब 5 के बजाय 6 बन जाता है। यह खिंचाव औसत में छिपा रहता है और जैसे ही आप नतीजों को लेवल के हिसाब से बांटते हैं, साफ़ दिख जाता है। सीधे प्रॉम्प्ट के साथ, Claude एक और आदत जोड़ देता है: यह नीचे की तरफ खिंचता है, इसलिए कमज़ोर जवाबों को भी अक्सर उनके लेवल से कम स्कोर मिलता है।
लोअर-लेवल जवाब (वेरिफाइड स्कोर 4 या 5)
16 होल्ड-आउट जवाब, सीधा प्रॉम्प्ट, तीन रन का औसत। यहां Sonnet 5 की ज़्यादातर चूकें स्कोर 3 की हैं।
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
44%
Claude Sonnet 5
कमज़ोर जवाबों पर, Engine 2.0, 88% के साथ आगे है, Opus 5, 77% के साथ पीछे, और Sonnet 5, 44% तक गिर जाता है। यह स्केल का आसान सिरा है, और Opus 5 इसे ठीक-ठाक संभाल लेता है। Sonnet 5 नहीं संभाल पाता: यह 4 या 5 वाले जवाब को ज़्यादातर बार 3 देता है, जो गलत लेवल है, भले ही दिशा समझ में आती हो। इस लेवल का जो स्टूडेंट ग्रेडिंग के लिए Sonnet 5 का इस्तेमाल करता है, उसे ज़्यादातर बार बताया जाएगा कि वह असल में जितना अच्छा है उससे कमज़ोर है।
मिडल-लेवल जवाब (वेरिफाइड स्कोर 7 या 8)
16 होल्ड-आउट जवाब, सीधा प्रॉम्प्ट, तीन रन का औसत। चूकें लगभग हमेशा 6 होती हैं।
85%
Prepamigo Engine 2.0
63%
Claude Sonnet 5
58%
Claude Opus 5
मिडल में, Engine 2.0, 85% पर है और दोनों Claude मॉडल 63% और 58% पर। मिडल-लेवल जवाबों में ताकत और कमज़ोरी का ऐसा मिश्रण होता है जिसे तराजू पर तोलना पड़ता है, सिर्फ देखकर पकड़ना नहीं, और तोलने के लिए कोई कैलिब्रेशन उदाहरण न होने पर, दोनों Claude मॉडल कमज़ोरियों पर ज़्यादा ध्यान देते हैं और 6 दे देते हैं। एक 7 या 8 वाला स्पीकर हर दस में से लगभग चार बार सुनेगा कि वह 6 है।
टॉप-लेवल जवाब (वेरिफाइड स्कोर 10 या उससे ऊपर)
16 होल्ड-आउट जवाब, सीधा प्रॉम्प्ट, तीन रन का औसत। लगभग हर चूक 7 या 8 है।
71%
Prepamigo Engine 2.0
50%
Claude Opus 5
29%
Claude Sonnet 5
टॉप पर, Engine 2.0, टॉप-लेवल जवाबों में से 71% को पहचानता है। Opus 5 उनमें से आधे को पहचानता है। Sonnet 5, 29% को पहचानता है, जिसका मतलब है कि जो हर दस में से सात जवाब 10 के लायक हैं, उन्हें यह 7 या 8 दे देता है।
सोचिए इसका असल मतलब क्या है। मान लीजिए आज आपकी स्पीकिंग असल में 10 के स्तर की है। आप आठ जवाब रिकॉर्ड करते हैं, उन्हें ट्रांसक्राइब करते हैं, Claude Sonnet 5 में पेस्ट करके स्कोर मांगते हैं, और यह आपको बताता है कि उनमें से छह जवाब 7 या 8 के हैं। आप नतीजा निकालते हैं कि आप तैयार नहीं हैं। आप तीन और हफ्ते प्रैक्टिस में लगा देते हैं। आप पूरे समय तैयार थे। यह कोई काल्पनिक गलती नहीं है; यह हमारे पूरे टेस्ट में सबसे आम गलती है, और इसकी सबसे ज़्यादा मार उन उम्मीदवारों पर पड़ती है जिन्होंने सबसे ज़्यादा मेहनत की है।
अगर आप Claude को अपनी पूरी प्रक्रिया दे दें तो?
सीधे टेस्ट के आंकड़ों को पढ़कर यह मान लेना आसान है कि Claude एक कमज़ोर मॉडल है। ऐसा नहीं है। Opus 5, हमने जिन जनरल-पर्पस ग्रेडर्स को टेस्ट किया है उनमें, कहीं ज़्यादा दूरी से सबसे मज़बूत है। समस्या समझ या इंटेलिजेंस की नहीं है। समस्या यह है कि जब किसी मॉडल से नंबर मांगा जाता है, बिना किसी तुलना के आधार के, तो यह अंदाज़ा लगाता है, और अंदाज़ा लगाते समय यह कम और बीच की तरफ अंदाज़ा लगाता है।
इसलिए हमने दूसरा टेस्ट चलाया। Claude को वही पैकेज मिला जो Engine 2.0 के ग्रेडर्स को मिलता है: ट्रांसक्रिप्ट, टास्क, उस सटीक टास्क के लिए हर लेवल पर दो असली कैलिब्रेशन उदाहरण, और एक नंबर बनाने के बजाय चार डाइमेंशन में से हर एक के लिए सबसे नज़दीकी उदाहरण बताने का निर्देश। हर मॉडल को उसकी अपनी आदतों के हिसाब से ढला एक छोटा कैलिब्रेशन नोट भी मिला।
हमारी पूरी प्रक्रिया देने पर: वेरिफाइड लेवल पर स्कोर किए गए जवाबों का हिस्सा
वही 48 होल्ड-आउट जवाब। हर Claude मॉडल ने हर जवाब को एक बार ग्रेड किया, ठीक वैसे ही ट्रांसक्रिप्ट, निर्देश और कैलिब्रेशन उदाहरणों के साथ जैसे Engine 2.0 के अपने ग्रेडर्स को मिलते हैं।
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
69%
Claude Sonnet 5
कैलिब्रेशन उदाहरण एक बड़ा फर्क डालते हैं। Opus 5, 62% से 77% तक चढ़ता है; Sonnet 5, 45% से 69% तक। दोनों की लोअर-लेवल सटीकता 88% तक पहुंचती है, ठीक Engine 2.0 जितनी ही। दोनों की मिडल-लेवल सटीकता 81% तक पहुंचती है। इस पर रुककर सोचना ज़रूरी है, क्योंकि यह बताता है कि किसी खास मकसद के लिए बने ग्रेडर की असल कीमत कहां है: किसी ज़्यादा स्मार्ट मॉडल में नहीं, बल्कि हर खास टास्क पर हर लेवल कैसा सुनाई देता है इसके असली उदाहरणों में, और एक ऐसे सवाल में जो मॉडल को अंदाज़ा लगाने के बजाय तुलना करने पर मजबूर करता है।
फिर भी, दोनों मॉडल स्केल के टॉप पर पीछे रह जाते हैं। पूरी प्रक्रिया के साथ, Opus 5, टॉप-लेवल जवाबों में से 63% पहचानता है और Sonnet 5, 38%, जबकि Engine 2.0 के लिए यह आंकड़ा 71% है। एक ही पास बनाने वाला एक मॉडल, ऐसे मज़बूत जवाब पर भी रुक जाता है जिसमें कोई छोटी चूक हो। Engine 2.0 बाकी बचा अंतर तीन और चीज़ों से पाटता है: अलग-अलग प्रोवाइडर के दो स्वतंत्र ग्रेडर, हर एक से तीन वोट जिनमें बीच वाला वोट रखा जाता है, और एक रिकंसिलिएशन रूल जो दो ग्रेडर के बीच बड़े मतभेद होने पर ज़्यादा स्कोर लेता है, क्योंकि विश्लेषण से पता चला कि मज़बूत जवाबों पर कम वाला फैसला लगभग हमेशा गलत होता है।
हमने एक ज़ाहिर शॉर्टकट भी आज़माया: सीधे प्रॉम्प्ट को रखते हुए ऐसे निर्देश जोड़े जैसे “बीच की तरफ मत खिंचो” या “लेवल 9 वाले जवाब का बेदाग होना ज़रूरी नहीं है।” इनसे कोई मापने लायक बदलाव नहीं आया। मॉडल निर्देश से सहमत हो जाता है और फिर वही करता है जो वह वैसे भी करने वाला था। जो असल में काम करता है वह है सवाल को बदलना, और उसे अंदाज़ा लगाने के बजाय तुलना करने के लिए कुछ असली देना।
वर्कफ़्लो का अंतर: रिकॉर्ड करके आगे बढ़ें, या सब कुछ खुद करें
सटीकता के आंकड़े यह मानकर चलते हैं कि ग्रेडिंग असल में हो पाती है। Claude के साथ, आपकी रिकॉर्डिंग पर स्टॉप दबाने और स्कोर पढ़ने के बीच हैरान करने वाली मात्रा में काम पड़ा होता है।
पहली बात, आपको एक ट्रांसक्रिप्ट चाहिए। Claude का चैट इंटरफ़ेस ऑडियो रिकॉर्डिंग को ग्रेड नहीं करता, इसलिए आपको टेक्स्ट बनाना पड़ता है। इसका मतलब है कि या तो आप जो बोले थे उसे टाइप करें, जिससे वह बदल जाता है, या रिकॉर्डिंग को किसी ट्रांसक्रिप्शन टूल से गुज़ारें। और यहां एक बात है जिसने समझने से पहले हमें बहुत सटीकता की कीमत चुकाई: ट्रांसक्रिप्ट शब्द-दर-शब्द होना ज़रूरी है। हर फिलर, हर रीस्टार्ट, हर सेल्फ-करेक्शन बना रहना चाहिए। जब हमने हिचकिचाहटें हटाकर एक “साफ़ की गई” ट्रांसक्रिप्ट टेस्ट की, तो सटीकता पंद्रह अंक गिर गई, क्योंकि वे हिचकिचाहटें ही वह सबूत हैं जो एक ग्रेडर को यह जज करने के लिए चाहिए कि कोई जवाब कैसा सुनाई देता है। ज़्यादातर कंज़्यूमर ट्रांसक्रिप्शन टूल डिफ़ॉल्ट रूप से इन्हें साफ़ कर देते हैं।
दूसरी बात, आपको टास्क चाहिए। Claude के पास सही टाइमिंग और फॉर्मेट वाले CELPIP-जैसे प्रॉम्प्ट्स का कोई बैंक नहीं है। आप या तो खुद अपना बना लें, जिसका मतलब है असली टेस्ट क्या पूछता है इसका अंदाज़ा लगाना, या कहीं और से एक ढूंढें और उसे ट्रांसक्रिप्ट के साथ पेस्ट करें।
तीसरी बात, अगर आप सीधे टेस्ट के आंकड़ों से बेहतर कुछ चाहते हैं, तो आपको कैलिब्रेशन उदाहरण चाहिए: उसी टास्क टाइप के लिए हर लेवल पर असली जवाब, वेरिफाइड लेवल के साथ। यही वह इनपुट है जिसने हमारे टेस्ट में Opus 5 को 62% से 77% तक पहुंचाया, और यही वह चीज़ है जिसे कोई स्टूडेंट घर पर नहीं बना सकता।
चौथी बात, अगले जवाब के लिए आपको यह सब फिर से करना पड़ता है। और उसके बाद वाले के लिए भी।
Prepamigo पर, आप बैंक से एक टास्क चुनते हैं, टाइमर चलता है, आप बोलते हैं, और रुकने के लगभग दस सेकंड बाद, स्कोर और फ़ीडबैक स्क्रीन पर आ जाते हैं। ट्रांसक्रिप्शन डिज़ाइन से ही शब्द-दर-शब्द है, कैलिब्रेशन उदाहरण टास्क से अपने आप जुड़े होते हैं, और न कुछ पेस्ट करना है न कुछ प्रॉम्प्ट करना है। शाम का ग्यारहवां जवाब भी आपको पहले जवाब जितनी ही मेहनत में मिल जाता है।
कंसिस्टेंसी: वही जवाब, वही स्कोर
जिस स्कोर को आप दोबारा नहीं पा सकते, वह कोई माप नहीं है। अगर वही रिकॉर्डिंग सोमवार को 8 और मंगलवार को 10 पाती है, तो आपने अपनी स्पीकिंग के बारे में कुछ नहीं सीखा, बल्कि ग्रेडर के मूड के बारे में कुछ सीखा। इसलिए हमने यह भी टेस्ट किया कि क्या हर सिस्टम दो बार वही जवाब देता है।
Engine 2.0 को 48 होल्ड-आउट जवाबों पर तीन अलग-अलग बार चलाया गया। इसने हर रन में 81.3% स्कोर किया। कुल आंकड़े के बजाय अलग-अलग जवाबों को देखें तो, 87.5% को तीनों रन में एक जैसा ही स्कोर मिला, और सिर्फ 4.2% कभी दो अंक या उससे ज़्यादा हिले। ये चंद जवाब वे हैं जो दो लेवल के बीच की सीमा पर ठीक बैठे होते हैं, जहां जज करने में एक छोटा-सा फर्क जायज़ तौर पर स्कोर को किसी एक तरफ झुका देता है।
Claude पर सीधा टेस्ट कुल आंकड़े के स्तर पर रन-दर-रन कई अंक हिला, और अलग-अलग जवाबों के स्तर पर और भी ज़्यादा। यह कंसिस्टेंसी वाला अंतर इसमें शामिल मॉडलों का कोई इत्तेफ़ाक नहीं है। यह वोटिंग से आता है। Engine 2.0 में हर ग्रेडर हर जवाब पर तीन बार वोट करता है और बीच वाला वोट रखा जाता है, जो एक ही पास से आने वाले कभी-कभार के आउटलायर को हटा देता है। जब हमने वही कॉन्फिगरेशन एक ही वोट के साथ टेस्ट किया, तीन के बजाय, तो रन-दर-रन सहमति 87.5% से 77.1% तक गिर गई। एक ही Claude बातचीत एक ही वोट होती है।
ऐसा फ़ीडबैक जिस पर आप अमल कर सकें
एक स्कोर आपको बताता है कि आप कहां हैं। फ़ीडबैक बताता है कि आगे क्या करना है, और यह वह क्षेत्र है जहां Claude सच में अच्छा है। यह साफ़-साफ़ लिखता है, धैर्यवान है, और अगर आप पूछें कि इसने कोई खास स्कोर क्यों दिया तो यह आपकी मर्ज़ी की लंबाई में समझाएगा। जो उम्मीदवार अपने जवाब पर बात करना चाहता है, उसके लिए यह कीमती है।
खतरा वही है जो स्कोर के साथ था: धाराप्रवाह समझाना, सटीक निदान के बराबर नहीं है। जो मॉडल किसी 10 को 7 बताता है, वह भरोसा दिलाने वाले ढंग से समझाएगा कि यह 7 क्यों है। यह इशारा करने के लिए कुछ न कुछ ढूंढ लेगा। और क्योंकि Claude को स्कोर देने से पहले किसी सबूत के लिए बंधना नहीं पड़ता, इसलिए स्पष्टीकरण घटना के बाद लिखा जाता है, ताकि उस नंबर को सही ठहराया जा सके जो यह पहले ही चुन चुका है।
Engine 2.0 उल्टे ढंग से काम करता है। क्योंकि हर ग्रेडर को जिस भी डाइमेंशन पर वह फैसला करता है उसके लिए सबूत की तरफ इशारा करना पड़ता है, इसलिए फ़ीडबैक लेयर को वह सबूत सीधे मिलता है: आपकी ट्रांसक्रिप्ट के वे सटीक शब्द जिन्होंने कंटेंट, वोकैबुलरी, आप कैसे सुनाई देते हैं, और आपने टास्क पूरा किया या नहीं, इस फैसले का समर्थन किया। फ़ीडबैक उस सबूत से लिखा जाता है और आपके अपने शब्दों को कोट करता है। फ़ीडबैक के एक सैंपल में 158 कोटेशन के हमारे ऑडिट में, 157 ट्रांसक्रिप्ट में शब्द-दर-शब्द मौजूद निकले। जब हमने एक स्वतंत्र जज करने वाले मॉडल से Engine 2.0 के फ़ीडबैक की तुलना हमारे पुराने सिस्टम के फ़ीडबैक से करने के लिए कहा, बिना यह बताए कि कौन कौन सा है, तो इसने 24 में से 20 तुलनाओं में Engine 2.0 को चुना, चाहे परीक्षक की तरह जज किया गया हो या स्टूडेंट की तरह।
हमने यह भी टेस्ट किया कि क्या फ़ीडबैक अपनी आलोचना को सही जगह पर टिकाता है। हमने मज़बूत जवाब लिए और जान-बूझकर हर एक के एक पहलू को बिगाड़ा: ग्रामर की गलतियां और फिलर डाले, सटीक शब्दों की जगह अस्पष्ट शब्द रखे, सहायक डिटेल हटाई, या टास्क में मांगी गई मुख्य क्रिया हटा दी। चार में से तीन मामलों में, जिस डाइमेंशन को हमने बिगाड़ा था, उसी का स्कोर सबसे ज़्यादा गिरा। यह वह जांच है जिसे कोई चैटबॉट आसानी से पास नहीं कर सकता, क्योंकि उसके पास जांचने के लिए कोई तय डाइमेंशन नहीं होते।
रोज़ प्रैक्टिस करने की कीमत क्या है
एक स्पीकिंग स्कोर आपके चालीसवें जवाब पर सबसे ज़्यादा काम का होता है, चौथे पर नहीं। तभी यह बताना शुरू करता है कि आपके बोलने के तरीके में आया बदलाव असल में काम कर रहा है या नहीं। तो असली सवाल यह नहीं है कि हर टूल की कीमत क्या है, बल्कि यह है कि इसे बड़ी मात्रा में इस्तेमाल करने की कीमत क्या पड़ती है।
Claude Pro की कीमत US$20 प्रति माह है, यानी लगभग CA$28, या एनुअल बिलिंग पर US$17 प्रति माह, जैसा सितंबर 2026 में claude.com पर बताया गया है। इसमें एक घूमती हुई पांच घंटे की उपयोग सीमा और एक साप्ताहिक लिमिट आती है; जब आप किसी एक को छू लेते हैं, तो आपको इंतज़ार करना पड़ता है। कैलिब्रेशन उदाहरणों के साथ लंबी ट्रांसक्रिप्ट ठीक वैसा ही मैसेज है जो इस भत्ते का बहुत हिस्सा इस्तेमाल कर लेता है। Max प्लान, जो US$100 प्रति माह से शुरू होते हैं, यानी टैक्स से पहले लगभग CA$138, इन सीमाओं को काफी बढ़ा देते हैं लेकिन हटाते नहीं। किसी भी प्लान में कोई प्रश्न बैंक, टाइमर, ट्रांसक्रिप्शन, कैलिब्रेशन उदाहरण, या CELPIP से जुड़ी कोई खास चीज़ शामिल नहीं है।
Prepamigo की कीमत CA$24.98 प्रति माह है, या एनुअल प्लान पर CA$8.25 प्रति माह, जो साल भर के लिए CA$98.98 होती है, टैक्स सहित, और आप किसी भी वक्त कैंसिल कर सकते हैं। हर प्लान में Engine 2.0 से असीमित स्कोरिंग शामिल है, बिना किसी डेली, सेशन या साप्ताहिक कैप के, असीमित अटेम्प्ट्स, और पूरा प्रश्न बैंक: 80 पूरे प्रैक्टिस सेट्स और Speaking, Writing, Reading तथा Listening में 2,000 से ज़्यादा प्रैक्टिस टास्क, जो CELPIP General टेस्ट के टास्क टाइप्स, टाइमिंग और फॉर्मेट के मुताबिक लिखे गए हैं।
सीधे शब्दों में: Claude Pro की कीमत से भी कम में, आपको एक ऐसा ग्रेडर मिलता है जो सबसे ज़्यादा मायने रखने वाले जवाबों पर कहीं ज़्यादा सटीक है, जो आपसे कभी इंतज़ार करने को नहीं कहता, और जिसमें सवाल और कैलिब्रेशन उदाहरण पहले से मौजूद हैं।
Claude कब बेहतर टूल है
यह ऐसा लेख नहीं है जो कहता हो कि CELPIP की तैयारी करते समय आपको Claude कभी नहीं खोलना चाहिए। कई ऐसी चीज़ें हैं जो यह किसी खास मकसद वाले स्कोरिंग इंजन से बेहतर करता है, और एक गंभीर उम्मीदवार शायद दोनों का इस्तेमाल करे।
- किसी जवाब पर बातचीत करना। अगर आप यह समझना चाहते हैं कि कोई खास वजह कमज़ोर क्यों थी, या तीन बेहतर वजहें सोचना चाहते हैं, तो बातचीत का तरीका ही सही है। Engine 2.0 आपको एक फैसला और सबूत देता है; यह चैट नहीं करता।
- वोकैबुलरी और भाषा में मदद। Claude से किसी बात को कहने के पांच और नैचुरल तरीके पूछना तेज़ और काम का है, और इसके सुझाव आमतौर पर अच्छे होते हैं।
- राइटिंग प्रैक्टिस। लिखे हुए जवाबों को ट्रांसक्रिप्शन की ज़रूरत नहीं होती, इसलिए वर्कफ़्लो का अंतर बहुत छोटा हो जाता है। राइटिंग पर Claude की सटीकता इस टेस्ट का हिस्सा नहीं थी, और हम यहां इसके बारे में कोई दावा नहीं कर रहे।
- टेस्ट के बाहर की कोई भी चीज़। इमिग्रेशन के कागज़ी सवाल, स्टडी शेड्यूल, किसी ग्रामर पॉइंट को समझाना: Claude एक जनरल असिस्टेंट है और Prepamigo नहीं है।
जो चीज़ Claude को, यहां के सबूत के मुताबिक, नहीं होना चाहिए, वह है यह बताना कि आप तैयार हैं या नहीं। उसके लिए आपको एक ऐसा ग्रेडर चाहिए जो इसी काम के लिए बनाया गया हो, जिसे उन जवाबों पर टेस्ट किया गया हो जो उसने पहले नहीं देखे, और जिसे लेवल दर लेवल मापा गया हो।
आपके फ़ीडबैक में क्या नया है
Engine 2.0 के साथ एक नया बनाया गया फ़ीडबैक लेयर आता है। यह सिर्फ़ स्कोर नहीं, बल्कि दोनों ग्रेडर के सबूत को पढ़ता है, और इसे तीन तरह के स्टूडेंट पर टेस्ट किया गया है: कोई जो पहली बार CELPIP का सामना कर रहा है, कोई जिसकी अंग्रेज़ी कमज़ोर है और जो कोई ट्रिक ढूंढ रहा है, और कोई जिसके पास दिन में सिर्फ़ आधा घंटा है और अगले हफ़्ते टेस्ट है। यहां बताया गया है कि क्या बदला है।
- आपके अपने शब्द, वापस कोट किए गए. फ़ीडबैक का हर पॉइंट आपकी ट्रांसक्रिप्ट के उस ठीक वाक्यांश का हवाला देता है जिस पर ग्रेडर ने प्रतिक्रिया दी। अगर कोई वाक्यांश कोटेशन मार्क्स में है, तो वह जैसा-का-वैसा कॉपी किया गया है; हमारे ऑडिट में 158 में से 157 कोट ऐसे ही थे। फ़ीडबैक कभी वह नहीं बनाता जो आपने कहा ही नहीं।
- पहले ठीक करने के लिए एक चीज़. हर जवाब को एक ही टॉप मूव मिलता है: वह एक बदलाव जो आपका स्कोर सबसे ज़्यादा बढ़ाएगा, पेज पर सबसे सीधे शब्दों में लिखा हुआ। इसके बाद दो और ठोस कदम आते हैं, फिर बोलना शुरू करने से पहले दिमाग में दोहराने के लिए तीन पॉइंट की एक चेकलिस्ट।
- टास्क के हिसाब से सलाह. सलाह देना, किसी सीन का वर्णन करना और किसी को मनाना, इन सबका स्कोर अलग-अलग बातों पर होता है। फ़ीडबैक को अब पता है कि आठ टास्क टाइप में से हर एक किस चीज़ का इनाम देता है, और वह उसी पर बात करता है, बजाय इसके कि हर टास्क पर एक जैसी सामान्य टिप्स दोहराई जाएं।
- किस डाइमेंशन का पहले अभ्यास करें. फ़ीडबैक आपको बताता है कि चार डाइमेंशन में से कौन-सा आपका सबसे कमज़ोर है और कौन-सा सबसे मज़बूत, ताकि आपको पता हो कि अगला पॉइंट कहां से मिलेगा, बिना उसे किसी नंबर के पीछे छिपाए।
- टास्क ने क्या मांगा और आपसे क्या छूट गया. टास्क फ़ुलफ़िलमेंट के लिए, फ़ीडबैक प्रॉम्प्ट के उन खास हिस्सों की सूची देता है जो आपने कवर नहीं किए, या साफ़ शब्दों में कहता है कि आपने सब कुछ कवर कर लिया।
- ऐसी चीज़ें जिनका आप असल में अभ्यास कर सकते हैं. हर सुझाव कुछ ऐसा है जो आप अपने अगले प्रयास से पहले ज़ोर से बोलकर देख सकते हैं। ज़्यादा साफ़ बोलने या अपना एक्सेंट कम करने की कोई सलाह नहीं: लिसनेबिलिटी एक्सेंट को नहीं मापती, और फ़ीडबैक उस पर कभी कोई टिप्पणी नहीं करता।
- टाइमर के लिए कोई दोष नहीं. अगर टास्क पूरा होने के बाद घड़ी की वजह से जवाब कट जाता है, तो उस कट-ऑफ़ के लिए अंक नहीं काटे जाते, और फ़ीडबैक इसके लिए आपको नहीं डांटता।
जब एक स्वतंत्र जजिंग मॉडल ने इस फ़ीडबैक की तुलना हमारे पुराने सिस्टम द्वारा उन्हीं जवाबों के लिए बनाए गए फ़ीडबैक से की, बिना यह जाने कि कौन-सा कौन-सा है, तो उसने 24 में से 20 तुलनाओं में नए फ़ीडबैक को प्राथमिकता दी — एक परीक्षक की तरह जज करते हुए भी और एक स्टूडेंट की तरह जज करते हुए भी।
अक्सर पूछे जाने वाले सवाल
क्या Claude मेरी CELPIP स्पीकिंग प्रैक्टिस स्कोर कर सकता है? यह आपको एक नंबर दे देगा। वेरिफाइड स्कोर वाले 48 अनदेखे जवाबों पर सीधे पूछने पर, Claude Opus 5, 62% बार वेरिफाइड लेवल पर पहुंचा और Claude Sonnet 5, 45% बार, जबकि Prepamigo Scoring Engine 2.0 के लिए यह आंकड़ा 81% था। टॉप-लेवल जवाबों पर Sonnet 5 सिर्फ 29% बार सही निकला।
क्या Prepamigo, Claude से ज़्यादा सटीक है? हां: एक सीधी रिक्वेस्ट पर 81% बनाम 62% और 45%। कैलिब्रेशन उदाहरणों के साथ हमारी पूरी प्रक्रिया देने पर, Opus 5, 77% और Sonnet 5, 69% तक पहुंचा, फिर भी पीछे, और स्केल के टॉप पर अब भी सबसे कमज़ोर।
हर एक की कीमत कितनी है? Claude Max की शुरुआत US$100 प्रति माह से होती है, यानी टैक्स से पहले लगभग CA$138, उपयोग सीमाओं के साथ; Claude Pro की कीमत US$20 है, ज़्यादा सख्त सीमाओं के साथ। Prepamigo की कीमत CA$24.98 प्रति माह है, टैक्स सहित, या एनुअल प्लान पर CA$8.25 प्रति माह, असीमित स्कोरिंग और 80 प्रैक्टिस सेट्स के साथ।
Claude मेरे मज़बूत जवाबों को बार-बार 7 या 8 क्यों देता है? जिस मॉडल से नंबर मांगा जाता है, बिना किसी तुलना के आधार के, वह कम और बीच की तरफ खिंचता है, और एक टॉप-लेवल जवाब भी कभी पूरी तरह बेदाग नहीं होता। सीधे पूछने पर, Sonnet 5 ने टॉप-लेवल जवाब को 9 या उससे ज़्यादा सिर्फ 29% बार दिया।
स्कोरिंग असल में कैसे काम करती है यह देखने के लिए, Scoring Engine 2.0 के भीतर की झलक पढ़ें। GPT और Gemini सहित पूरी लीडरबोर्ड देखने के लिए, कौन सा AI CELPIP स्पीकिंग सबसे सटीक स्कोर करता है पढ़ें। इसे अंग्रेज़ी में पढ़ने के लिए यहां क्लिक करें: इसे अंग्रेज़ी में पढ़ें। या पढ़ना छोड़कर एक जवाब रिकॉर्ड करें।
