स्कोरिंग

Speaking के लिए Prepamigo Scoring Engine 2.0 की शुरुआत

6 सितंबर, 2026

Prepamigo Scoring Engine 2.0 बनाम अग्रणी मॉडल, ग्रेडर के रूप में

उन स्पीकिंग जवाबों का हिस्सा जिनका स्कोर स्वतंत्र रूप से वेरिफाइड स्कोर से मैच हुआ। 48 जवाब जो सिस्टम ने पहले कभी नहीं देखे थे, निचले, मध्य और टॉप स्कोर में बराबर बांटे गए। हर मॉडल को ट्रांसक्रिप्ट दिया गया और सीधे शब्दों में CELPIP स्केल पर उसे स्कोर करने को कहा गया; तीन रन का औसत।

81%

Prepamigo Scoring Engine 2.0Prepamigo

62%

Claude Opus 5Anthropic

58%

GeminiGoogle

45%

Claude Sonnet 5Anthropic

45%

GPT-4o miniOpenAI

37%

GPT 5.5OpenAI

35%

GPT 5.6 solOpenAI

31%

GPT 5.6 lunaOpenAI

Prepamigo बनाम टॉप चैटबॉट प्लान

कनाडाई डॉलर में। Prepamigo की कीमतों में टैक्स शामिल है। Claude Max (US$100 से शुरू) और ChatGPT Pro (US$200) को टैक्स से पहले 1.38 की दर पर बदला गया है। सटीकता उन होल्ड-आउट जवाबों का हिस्सा है जिन्हें वेरिफाइड लेवल पर स्कोर किया गया, जब नामित मॉडल को सीधे शब्दों में जवाब स्कोर करने के लिए कहा गया; तीन रन का औसत।

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
मासिक कीमत
CA$24.98 (टैक्स सहित)
CA$138+ (टैक्स अलग)
CA$276 (टैक्स अलग)
स्कोरिंग
असीमित
सीमित
सीमित
तैयार प्रश्न बैंक
हां
नहीं
नहीं
प्रैक्टिस सेट
80
कोई नहीं
कोई नहीं
प्रैक्टिस टास्क
2,000+
कोई नहीं
कोई नहीं
CELPIP फ़ॉर्मेट
हां
नहीं
नहीं
सटीकता
81%
62%
35%
टॉप-लेवल जवाब
71%
50%
25%

हमारा अब तक का सबसे सटीक स्पीकिंग ग्रेडर। जो जवाब इसने पहले कभी नहीं देखे थे, उन पर Prepamigo Scoring Engine 2.0 ने 81% बार वेरिफाइड स्कोर से मैच किया, यह उस काम पर हमने जिन भी अग्रणी मॉडलों को टेस्ट किया, सबसे आगे रहा, और यह Engine 1.0 से, जिस ग्रेडर की जगह यह ले रहा है, साफ़ तौर पर एक बड़ा कदम आगे है।

आज हम Speaking के लिए Prepamigo Scoring Engine 2.0 रिलीज़ कर रहे हैं, वह सिस्टम जो Prepamigo पर हर बोले गए प्रैक्टिस जवाब को ग्रेड करता है। Engine 2.0 हमारे स्कोर करने के तरीके का पूरी तरह से नया डिज़ाइन है। एक ही ग्रेडिंग पास की जगह, यह दो स्वतंत्र ग्रेडर इस्तेमाल करता है जो हर जवाब की तुलना सीधे कैलिब्रेटेड उदाहरणों से करते हैं, कई बार वोट करते हैं, और स्कोर दिखाने से पहले अपने जवाबों को मिलाते हैं।

नतीजा एक ऐसा ग्रेडर है जो किसी भी अग्रणी मॉडल से, जिसे एक छात्र जिस तरह इस्तेमाल करता उसी तरह इस्तेमाल किया जाए, कहीं ज़्यादा सटीक है। स्वतंत्र रूप से वेरिफाइड स्कोर वाले असली बोले गए जवाबों के एक होल्ड-आउट सेट पर, Engine 2.0 ने 81% बार सही स्कोर दिया। सीधे शब्दों में वही ट्रांसक्रिप्ट स्कोर करने को कहा गया तो उनमें सबसे मज़बूत, Claude Opus 5, ने 62% हासिल किया। Gemini ने 58% हासिल किया। Claude Sonnet 5 और GPT-4o mini ने 45%, GPT 5.5 ने 37%, GPT 5.6 sol ने 35%, और GPT 5.6 luna ने 31% हासिल किया। जब हमने फिर हर मॉडल को Engine 2.0 की अपनी प्रक्रिया, हर टास्क के लिए असली कैलिब्रेशन उदाहरणों के साथ, दी, तो उनमें सबसे बेहतर 77% तक पहुंचा और फिर भी पीछे रहा।

सटीकता सबसे ज़्यादा वहां मायने रखती है जहां उसे हासिल करना सबसे मुश्किल हो। Engine 2.0 71% बार किसी टॉप-लेवल जवाब को पहचानता है। सीधे पूछने पर, किसी भी दूसरे मॉडल ने 56% से ज़्यादा नहीं पहचाना, और GPT मॉडलों ने 13% से 27% के बीच पहचाना। Engine 2.0 ऑटोमेटेड ग्रेडरों की सबसे आम कमी का भी सामना करता है: वे स्कोर जो जवाब चाहे जितना भी मज़बूत या कमज़ोर हो, फिर भी कम और स्केल के बीच की ओर खिसक जाते हैं। यही खिसकाव Engine 1.0 में हमें सबसे ज़्यादा नज़र आने वाली कमज़ोरी थी।

Engine 2.0 तेज़ है, ज़्यादा स्थिर है, और ऐसा फीडबैक देता है जो छात्र के अपने शब्दों को कोट करता है। यह आज हर Prepamigo यूज़र के लिए लाइव है। यह पेज बताता है कि यह क्या करता है, हमने इसे कैसे मापा, और इसकी सीमाएं अभी कहां हैं।

वेरिफाइड स्कोर के मुक़ाबले सटीकता

जो सवाल हमारे लिए अहम है वह आसान है। जब कोई छात्र जवाब रिकॉर्ड करता है, तो क्या स्क्रीन पर दिखने वाला स्कोर उस स्कोर से मैच करता है जो एक भरोसेमंद ग्रेडर देता? इसका जवाब देने के लिए हमने आठों स्पीकिंग टास्क टाइप में असली बोले गए जवाबों का एक टेस्ट सेट बनाया, हर एक का स्कोर स्वतंत्र रूप से वेरिफाइड था, और हमने सेट को निचले, मध्य और टॉप स्कोर में बराबर बांटा ताकि कोई एक लेवल नतीजे पर हावी न हो सके।

यह तुलना उन 48 जवाबों का इस्तेमाल करती है जिन्हें शुरू से ही अलग रखा गया था। टीम में किसी ने भी Engine 2.0 बनाते या ट्यून करते समय इनका इस्तेमाल नहीं किया। हर जवाब को शब्द-दर-शब्द ट्रांसक्राइब किया गया। फिर हर मॉडल को बताया गया कि वह एक अनुभवी CELPIP परीक्षक है, उसे टास्क प्रॉम्प्ट और ट्रांसक्रिप्ट दिया गया, और अलग-अलग दिनों में तीन बार जवाब को 0 से 12 तक स्कोर करने को कहा गया। हमने तीन रन का औसत निकाला और गिना कि स्कोर वेरिफाइड स्कोर के लेवल से कितनी बार मैच हुआ।

51%

Claude Opus 5 से कम गलतियां

प्रति 100 जवाबों में 19 गलत स्कोर, बनाम 38।

71%

GPT 5.6 sol से कम गलतियां

प्रति 100 में 19 गलत स्कोर, बनाम 65।

71%

टॉप-लेवल जवाबों में से पहचाने गए

दूसरे मॉडलों में सबसे बेहतर 56% पहचानता है; GPT 5.6 sol 25% पहचानता है।

इन आंकड़ों में तीन बातें उभर कर आती हैं। पहली, फ़र्क छोटा नहीं है। सबसे मज़बूत अग्रणी मॉडल के मुक़ाबले उन्नीस अंक और ChatGPT के पेड प्लान के पीछे वाले मॉडल के मुक़ाबले छियालीस अंक, 48 जवाबों के टेस्ट में, नौ और बाईस अतिरिक्त सही स्कोर के बीच का फ़र्क है। दूसरी, यह फ़र्क किसी आसान टेस्ट का नतीजा नहीं है। ये 48 जवाब Engine 2.0 का डिज़ाइन फ़ाइनल होने से पहले चुने गए थे और डेवलपमेंट के दौरान कभी नहीं छुए गए। तीसरी, यह तुलना वही है जो एक छात्र के लिए मायने रखती है: यह मापती है कि जब आप किसी चैटबॉट में ट्रांसक्रिप्ट पेस्ट करके पूछते हैं तो आपको क्या मिलता है, और लगभग हर कोई इन मॉडलों का इस्तेमाल इसी तरह करता है।

यहां “सही” का मतलब क्या है, इस पर एक बात। इस स्केल पर वेरिफाइड स्कोर एक अंक की जगह लेवल में आते हैं, इसलिए हम किसी स्कोर को सही मानते हैं जब वह वेरिफाइड लेवल के भीतर आता है। उदाहरण के लिए, टॉप लेवल पर वेरिफाइड किया गया जवाब सही स्कोर हुआ माना जाता है अगर इंजन उसे 9, 10 या 11 देता है। एक सख़्त पैमाने के तहत जो सिर्फ 10 और उससे ऊपर को मानता है, हर सिस्टम कुछ अंक खो देता है लेकिन रैंकिंग नहीं बदलती।

सिस्टमसीधी रिक्वेस्टहमारी पूरी प्रक्रिया दिए जाने पर
Prepamigo Scoring Engine 2.081.3%
Claude Opus 561.8%77.1%
Gemini58.3%70.8%
Claude Sonnet 545.1%68.8%
GPT-4o mini45.1%50.0%
GPT 5.536.8%68.8%
GPT 5.6 sol35.4%70.8%
GPT 5.6 luna30.6%62.5%

हर स्कोर लेवल पर परफ़ॉर्मेंस

औसत सटीकता का आंकड़ा बहुत कुछ छुपा सकता है। एक ऐसा ग्रेडर जो कमज़ोर जवाबों पर बेहतरीन है और मज़बूत जवाबों पर बेकार है, वह एक अच्छा नंबर दिखा सकता है जबकि उन छात्रों को नाकाम कर देता है जिन्हें एक सटीक जवाब की सबसे ज़्यादा ज़रूरत है। इसलिए हम टेस्ट सेट के तीन लेवलों में से हर एक के लिए सटीकता अलग-अलग बताते हैं: 4 या 5 के निचले स्कोर, 7 या 8 के मध्य स्कोर, और 10 व उससे ऊपर के टॉप स्कोर।

ज़्यादातर ग्रेडर, चाहे इंसान हों या मशीन, बीच की ओर खिसकते हैं। एक मज़बूत जवाब को 10 की जगह 8 मिलता है। एक कमज़ोर जवाब को 5 की जगह 6 मिलता है। तुलना करने के लिए कुछ न होने पर, अग्रणी मॉडल एक दूसरी आदत जोड़ देते हैं: वे नीचे की ओर खिसकते हैं, जिससे एक कमज़ोर जवाब को अक्सर 3 और एक मज़बूत जवाब को 7 स्कोर किया जाता है। Engine 2.0 को खासतौर पर इन दोनों खिंचावों का सामना करने के लिए बनाया गया है, और नतीजे इसे स्केल के सबसे ऊपरी हिस्से में सबसे साफ़ तौर पर दिखाते हैं।

निचले स्कोर · वेरिफाइड स्कोर 4 या 5

हर सिस्टम के लिए 16 होल्ड-आउट जवाब, सीधी रिक्वेस्ट, तीन रन का औसत।

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

मध्य स्कोर · वेरिफाइड स्कोर 7 या 8

हर सिस्टम के लिए 16 होल्ड-आउट जवाब, सीधी रिक्वेस्ट, तीन रन का औसत।

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

टॉप स्कोर · वेरिफाइड स्कोर 10 या उससे ऊपर

हर सिस्टम के लिए 16 होल्ड-आउट जवाब, सीधी रिक्वेस्ट, तीन रन का औसत। लगभग हर चूक 7 या 8 होती है।

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

जो छात्र पहले से मज़बूत हैं, उनके लिए यही फ़र्क मायने रखता है। सीधे पूछने पर, कोई भी दूसरा मॉडल टॉप-लेवल जवाबों में से 56% से ज़्यादा नहीं पहचानता; GPT 5.6 sol चार में से एक पहचानता है, और GPT 5.6 luna आठ में से एक। Engine 2.0 71% पहचानता है।

निचले लेवल पर, Engine 2.0 88% के साथ आगे है, Claude Opus 5 77% पर और GPT-4o mini 75% पर है। बाकी हर मॉडल लगभग आधे पर है, और Claude Sonnet 5 44% पर है। चूक लगभग हमेशा 3 होती है: मॉडल एक कमज़ोर जवाब देखता है और उसे लेवल के भीतर देने की जगह उससे नीचे स्कोर कर देता है। यहां GPT-4o mini का अच्छा दिखने वाला आंकड़ा असल में उसकी समस्या का पहला संकेत है, जो यह है कि यह लगभग हर चीज़ को कम स्कोर करता है; स्केल के टॉप पर यह छह में से एक जवाब पहचानता है।

मध्य लेवल पर, Engine 2.0 85% के साथ आगे है। Gemini और Claude Sonnet 5 63% पर हैं, Claude Opus 5 58% पर, और फिर एक बड़ी गिरावट: GPT-4o mini 44% पर और तीन बड़े GPT मॉडल 27% से 29% के बीच। मध्य-लेवल के जवाबों में मज़बूती और कमज़ोरी का मिश्रण होता है जिसे तौलना पड़ता है, सिर्फ़ पहचानना नहीं, और तौलने के लिए कुछ न होने पर, GPT मॉडल कमज़ोरियां देखकर 5 या 6 दे देते हैं।

टॉप लेवल पर, फ़र्क सबसे बड़ा है। Engine 2.0 टॉप-लेवल जवाबों में से 71% को सही तरीके से पहचानता है। Gemini 56% पहचानता है और Opus 5 ठीक आधे। बाकी सात में से पांच मॉडल उन जवाबों में से, जो 10 के हक़दार हैं, कम से कम सात में से हर दस को 7 या 8 दे देते हैं। यह बीच की ओर खिसकने की समस्या का सबसे साफ़ रूप है। एक टॉप-लेवल जवाब बेदाग़ नहीं होता; उसमें कभी-कभार चूक, एक दोबारा शुरुआत, जटिल वाक्यों के बीच एक सादा वाक्य होता है, और एक ग्रेडर जो उसे एक कल्पित परफ़ेक्ट जवाब से मापता है, हर एक के लिए अंक काट देता है। Engine 2.0 उन उदाहरणों से कैलिब्रेटेड है जो दिखाते हैं कि एक असली टॉप-लेवल जवाब कैसा दिखता है, चूक शामिल करते हुए, और इसे साफ़ तौर पर उन उदाहरणों से तुलना करने के लिए डिज़ाइन किया गया है, न कि परफ़ेक्शन से।

अगर उन्हें हमारी पूरी प्रक्रिया दे दी जाए तो?

सीधी रिक्वेस्ट के आंकड़े यह नहीं बताते कि ये मॉडल कितने स्मार्ट हैं। ये बताते हैं कि जब किसी मॉडल से बिना किसी तुलना के एक नंबर मांगा जाता है तो क्या होता है। इसलिए हमने एक दूसरा टेस्ट चलाया, जिसमें हर मॉडल को ठीक वही दिया गया जो Engine 2.0 के अपने ग्रेडर पाते हैं: ट्रांसक्रिप्ट, टास्क, उस खास टास्क के लिए हर लेवल पर दो असली कैलिब्रेशन उदाहरण, और एक नंबर बनाने की जगह चार आयामों में से हर एक के लिए सबसे नज़दीकी उदाहरण बताने का निर्देश। हर मॉडल को उसकी अपनी आदतों के हिसाब से ट्यून किया गया एक छोटा कैलिब्रेशन नोट भी मिला।

हमारी पूरी प्रक्रिया दिए जाने पर: वेरिफाइड लेवल पर स्कोर हुए जवाबों का हिस्सा

वही 48 होल्ड-आउट जवाब। हर सिस्टम के लिए वही ट्रांसक्रिप्ट, निर्देश और कैलिब्रेशन उदाहरण; हर मॉडल ने हर जवाब को एक बार ग्रेड किया।

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

हर मॉडल सुधरता है, कुछ नाटकीय रूप से। GPT 5.6 sol 35% से दोगुना होकर 71% हो जाता है। Opus 5 62% से बढ़कर 77% पर पहुंच जाता है। GPT-4o mini मुश्किल से हिलता है, 45% से 50%, क्योंकि यह जो भी दिखाया जाए उसकी परवाह किए बिना हर चीज़ को कम स्कोर करता है। और हर मॉडल फिर भी Engine 2.0 से पीछे रहता है। स्केल के टॉप पर फ़र्क बना रहता है: Opus 5, GPT 5.6 sol, Gemini और GPT 5.5 सभी टॉप-लेवल जवाबों के 63% पर रुक जाते हैं, Sonnet 5 38% पर, GPT-4o mini शून्य पर, जबकि Engine 2.0 71% पर है।

यह दूसरा टेस्ट बताता है कि Engine 2.0 की असली वैल्यू आख़िर कहां है। यह कोई ज़्यादा स्मार्ट मॉडल नहीं है; यह इसी लिस्ट के मॉडलों का इस्तेमाल करता है। यह हर खास टास्क पर हर लेवल कैसा सुनाई देता है इसके असली उदाहरण हैं, एक ऐसा सवाल जो मॉडल को अंदाज़ा लगाने की जगह तुलना करने पर मजबूर करता है, और फिर तीन और चीज़ें जो एक ही पास नहीं दे सकता: अलग-अलग प्रोवाइडर के दो स्वतंत्र ग्रेडर, हर एक से तीन वोट जिसमें बीच वाला वोट रखा जाता है, और एक मिलान नियम जो दोनों ग्रेडरों के बीच बड़ा मतभेद होने पर ज़्यादा वाला स्कोर लेता है, क्योंकि विश्लेषण से पता चला कि मज़बूत जवाबों पर कम वाला नतीजा लगभग हमेशा गलत होता था।

निरंतरता और स्थिरता

जिस ग्रेडर पर आप भरोसा कर सकें, उसे स्थिर होना ज़रूरी है। अगर एक ही रिकॉर्डिंग को आज 8 और कल 10 मिल सकता है, तो दोनों में से कोई भी नंबर ज़्यादा मायने नहीं रखता, और एक छात्र यह नहीं बता सकता कि उसकी प्रैक्टिस काम कर रही है या नहीं। इसलिए सटीकता के साथ-साथ, हम यह भी मापते हैं कि जब एक ही सवाल दो बार पूछा जाए तो Engine 2.0 वही जवाब देता है या नहीं।

हमने Engine 2.0 को 48 होल्ड-आउट जवाबों पर तीन अलग-अलग बार चलाया, अलग-अलग दिनों में, बीच में कुछ भी बदले बिना। इसने हर रन में 81.3% स्कोर किया। यह लगभग 81% नहीं है: हर बार 48 में से वही 39 सही जवाब, एक इधर-उधर। जब हम कुल आंकड़े की जगह अलग-अलग जवाबों को देखते हैं, तो 87.5% को तीनों रन में एक जैसा स्कोर मिला, और सिर्फ़ 4.2% ही रन के बीच दो या ज़्यादा अंक हिले। ये कुछ जवाब वे हैं जो दो लेवल के बीच की सीमा पर ठीक बैठते हैं, जहां फ़ैसले में एक छोटा-सा फ़र्क वाजिब तौर पर स्कोर को किसी एक तरफ़ झुका देता है।

अग्रणी मॉडलों पर सीधी रिक्वेस्ट वाला टेस्ट रन के बीच कहीं ज़्यादा हिला। GPT 5.6 sol ने अपने तीन रन में 31%, 40% और 35% स्कोर किया; Opus 5 ने 62%, 65% और 58% स्कोर किया। किसी चैटबॉट से दो अलग-अलग दिनों में वही ट्रांसक्रिप्ट ग्रेड करने को कहें तो अक्सर आपको दो अलग-अलग स्कोर मिलेंगे।

यह स्थिरता दो डिज़ाइन फ़ैसलों से आती है। Engine 2.0 में हर ग्रेडर हर जवाब पर तीन बार वोट करता है और बीच वाला वोट रखा जाता है, जो वह कभी-कभार का अलग-थलग नतीजा हटा देता है जो एक ही पास दे सकता था। और दोनों ग्रेडरों के नतीजों को किसी दूसरे मॉडल की जगह एक तय नियम से मिलाया जाता है, इसलिए नतीजों की वही जोड़ी हमेशा वही फ़ाइनल स्कोर देती है। दोनों फ़ैसलों को सीधे टेस्ट किया गया: तीन की जगह एक वोट के साथ, रन-दर-रन सहमति 87.5% से गिरकर 77.1% हो गई, और दो या ज़्यादा अंक उछलने वाले जवाबों का हिस्सा दोगुने से भी ज़्यादा हो गया।

Engine 2.0 किसी जवाब को कैसे ग्रेड करता है

Engine 2.0 एक अकेला मॉडल नहीं है। यह एक प्रक्रिया है, और यही प्रक्रिया फ़र्क पैदा करती है। यहां बताया गया है कि छात्र के स्टॉप दबाने और स्क्रीन पर स्कोर दिखने के बीच के उन लगभग दस सेकंड में क्या होता है।

  1. रिकॉर्डिंग को शब्द-दर-शब्द ट्रांसक्राइब किया जाता है। हर फिलर, हर दोबारा शुरुआत, हर आत्म-सुधार रखा जाता है। यह ज़रूरी साबित हुआ। जब हमने झिझक हटाकर एक “साफ़ की गई” ट्रांसक्रिप्ट टेस्ट की, तो सटीकता पंद्रह अंक गिर गई, क्योंकि झिझक उस सबूत का हिस्सा है जो एक ग्रेडर को यह जज करने के लिए चाहिए कि कोई जवाब कैसा सुनाई देता है।
  2. दो स्वतंत्र ग्रेडर ट्रांसक्रिप्ट पढ़ते हैं। ये अलग-अलग प्रोवाइडर के अलग-अलग अंतर्निहित मॉडलों पर बने हैं, इसलिए इनकी अंधी जगहें एक जैसी नहीं होतीं। हर ग्रेडर को टास्क प्रॉम्प्ट, ट्रांसक्रिप्ट, और उस ठीक टास्क के लिए कैलिब्रेशन उदाहरणों का एक छोटा सेट मिलता है: निचले, मध्य और टॉप लेवल पर असली जवाब, हर लेवल पर दो, ताकि हर लेवल एक अकेले बिंदु की जगह एक दायरे के रूप में दिखाई जाए।
  3. हर ग्रेडर स्कोर करने की जगह तुलना करता है। यह Engine 1.0 से सबसे बड़ा बदलाव है। नंबर मांगने की जगह, हर ग्रेडर से जवाब के चार आयामों में से हर एक के लिए पूछा जाता है कि यह किस कैलिब्रेशन उदाहरण से सबसे ज़्यादा मिलता है। यहां “बीच में कहीं” जैसा कोई विकल्प नहीं है। किसी एक सबसे नज़दीकी उदाहरण को चुनने की मजबूरी ही बीच की ओर खिसकने को रोकती है। इसके बाद चुने गए लेवल से स्कोर एक तय नियम से निकाला जाता है, मॉडल से नहीं।
  4. हर ग्रेडर तीन बार वोट करता है। हर आयाम पर बीच वाला वोट रखा जाता है। यह कभी-कभार के खराब दिन वाले जवाब को हटा देता है, बिना असली फ़ैसले को औसत में घोले।
  5. दोनों नतीजों को मिलाया जाता है। अगर ग्रेडर सहमत हैं या सिर्फ़ एक अंक से अलग हैं, तो फ़ाइनल स्कोर उनका औसत होता है। अगर वे दो या ज़्यादा अंक से अलग हैं, तो ज़्यादा वाला स्कोर लिया जाता है। यह नियम उदारता नहीं है; यह कैलिब्रेशन है। जब हमने हर उस मामले का विश्लेषण किया जहां दोनों ग्रेडर बहुत ज़्यादा असहमत थे, तो कम वाला नतीजा लगभग हमेशा गलत निकला, क्योंकि असहमति लगभग हमेशा एक टॉप-लेवल जवाब पर उठती थी जिसके बारे में एक ग्रेडर बहुत ज़्यादा सतर्क रहा था।
  6. सेफगार्ड्स लगाए जाते हैं। तय नियमों का एक छोटा सेट उन मामलों को संभालता है जिनके बारे में किसी ग्रेडर को अंदाज़ा नहीं लगाना चाहिए: एक खामोश जवाब, बस कुछ शब्दों वाला जवाब, किसी दूसरी भाषा में, या पूरी तरह टॉपिक से बाहर जवाब को ग्रेडरों के नतीजे की परवाह किए बिना एक न्यूनतम स्कोर मिलता है। टेस्टिंग में, खामोशी को 3, कुछ शब्दों वाले जवाब को 4, और टॉपिक से बाहर या अंग्रेज़ी न होने वाले जवाब को 5 मिला, और पूरे सेट में कोई नाकामी नहीं हुई।

फ़ाइनल डिज़ाइन की दो ख़ासियतों पर ज़ोर देना ज़रूरी है। Engine 2.0 सिर्फ़ ट्रांसक्रिप्ट से ग्रेड करता है, इसलिए इसे ट्रांसक्रिप्शन के बाद ऑडियो की ज़रूरत नहीं होती और यह किसी एक प्रोवाइडर के ऑडियो मॉडल पर निर्भर नहीं करता। और क्योंकि दोनों ग्रेडर अलग-अलग प्रोवाइडर से हैं, अगर एक उपलब्ध न हो तो दूसरा काम करता रहता है, और एक तीसरा मॉडल जगह भरता है ताकि स्कोर हमेशा बने।

आपके फ़ीडबैक में क्या नया है

Engine 2.0 के साथ एक नया बनाया गया फ़ीडबैक लेयर आता है। यह सिर्फ़ स्कोर नहीं, बल्कि दोनों ग्रेडर के सबूत को पढ़ता है, और इसे तीन तरह के स्टूडेंट पर टेस्ट किया गया है: कोई जो पहली बार CELPIP का सामना कर रहा है, कोई जिसकी अंग्रेज़ी कमज़ोर है और जो कोई ट्रिक ढूंढ रहा है, और कोई जिसके पास दिन में सिर्फ़ आधा घंटा है और अगले हफ़्ते टेस्ट है। यहां बताया गया है कि क्या बदला है।

  • आपके अपने शब्द, वापस कोट किए गए. फ़ीडबैक का हर पॉइंट आपकी ट्रांसक्रिप्ट के उस ठीक वाक्यांश का हवाला देता है जिस पर ग्रेडर ने प्रतिक्रिया दी। अगर कोई वाक्यांश कोटेशन मार्क्स में है, तो वह जैसा-का-वैसा कॉपी किया गया है; हमारे ऑडिट में 158 में से 157 कोट ऐसे ही थे। फ़ीडबैक कभी वह नहीं बनाता जो आपने कहा ही नहीं।
  • पहले ठीक करने के लिए एक चीज़. हर जवाब को एक ही टॉप मूव मिलता है: वह एक बदलाव जो आपका स्कोर सबसे ज़्यादा बढ़ाएगा, पेज पर सबसे सीधे शब्दों में लिखा हुआ। इसके बाद दो और ठोस कदम आते हैं, फिर बोलना शुरू करने से पहले दिमाग में दोहराने के लिए तीन पॉइंट की एक चेकलिस्ट।
  • टास्क के हिसाब से सलाह. सलाह देना, किसी सीन का वर्णन करना और किसी को मनाना, इन सबका स्कोर अलग-अलग बातों पर होता है। फ़ीडबैक को अब पता है कि आठ टास्क टाइप में से हर एक किस चीज़ का इनाम देता है, और वह उसी पर बात करता है, बजाय इसके कि हर टास्क पर एक जैसी सामान्य टिप्स दोहराई जाएं।
  • किस डाइमेंशन का पहले अभ्यास करें. फ़ीडबैक आपको बताता है कि चार डाइमेंशन में से कौन-सा आपका सबसे कमज़ोर है और कौन-सा सबसे मज़बूत, ताकि आपको पता हो कि अगला पॉइंट कहां से मिलेगा, बिना उसे किसी नंबर के पीछे छिपाए।
  • टास्क ने क्या मांगा और आपसे क्या छूट गया. टास्क फ़ुलफ़िलमेंट के लिए, फ़ीडबैक प्रॉम्प्ट के उन खास हिस्सों की सूची देता है जो आपने कवर नहीं किए, या साफ़ शब्दों में कहता है कि आपने सब कुछ कवर कर लिया।
  • ऐसी चीज़ें जिनका आप असल में अभ्यास कर सकते हैं. हर सुझाव कुछ ऐसा है जो आप अपने अगले प्रयास से पहले ज़ोर से बोलकर देख सकते हैं। ज़्यादा साफ़ बोलने या अपना एक्सेंट कम करने की कोई सलाह नहीं: लिसनेबिलिटी एक्सेंट को नहीं मापती, और फ़ीडबैक उस पर कभी कोई टिप्पणी नहीं करता।
  • टाइमर के लिए कोई दोष नहीं. अगर टास्क पूरा होने के बाद घड़ी की वजह से जवाब कट जाता है, तो उस कट-ऑफ़ के लिए अंक नहीं काटे जाते, और फ़ीडबैक इसके लिए आपको नहीं डांटता।

जब एक स्वतंत्र जजिंग मॉडल ने इस फ़ीडबैक की तुलना हमारे पुराने सिस्टम द्वारा उन्हीं जवाबों के लिए बनाए गए फ़ीडबैक से की, बिना यह जाने कि कौन-सा कौन-सा है, तो उसने 24 में से 20 तुलनाओं में नए फ़ीडबैक को प्राथमिकता दी — एक परीक्षक की तरह जज करते हुए भी और एक स्टूडेंट की तरह जज करते हुए भी।

CA$25 प्रति माह में असीमित प्रैक्टिस

सटीकता तभी काम की है जब आप इसे हर दिन इस्तेमाल करने का खर्च उठा सकें। एक भरोसेमंद स्पीकिंग स्कोर आपके चालीसवें प्रैक्टिस जवाब पर सबसे ज़्यादा कीमती होता है, चौथे पर नहीं, क्योंकि तभी स्कोर आपको बताना शुरू करता है कि आपके बोलने के तरीके में किया गया बदलाव असल में काम कर रहा है या नहीं। इसलिए हमने Engine 2.0 की कीमत ऐसी रखी है कि इसे बिना गिनती के इस्तेमाल किया जा सके।

हर Prepamigo प्लान में Engine 2.0 से असीमित स्कोरिंग, असीमित प्रयास, और पूरा प्रश्न बैंक शामिल है: 80 पूरे प्रैक्टिस सेट और Speaking, Writing, Reading और Listening में 2,000 से ज़्यादा प्रैक्टिस टास्क, जो CELPIP General टेस्ट के टास्क टाइप, समय और फ़ॉर्मेट के हिसाब से लिखे गए हैं। आप रिकॉर्ड दबाते हैं, आपको लगभग दस सेकंड में एक स्कोर और सबूत-आधारित फीडबैक मिलता है, और आप इसे जितनी बार चाहें दोहरा सकते हैं।

Prepamigo

CA$25/ माह

CA$24.98 महीने-दर-महीने · वार्षिक प्लान पर CA$8.25 प्रति माह (CA$98.98 प्रति वर्ष) · टैक्स शामिल · कभी भी रद्द करें

  • असीमित स्कोरिंग Scoring Engine 2.0 से, कोई डेली, सेशन या वीकली सीमा नहीं।
  • 80 प्रैक्टिस सेट और 2,000+ टास्क चारों सेक्शन में, असली टेस्ट फ़ॉर्मेट पर आधारित, ताकि आपको कभी अपने खुद के प्रॉम्प्ट न लिखने पड़ें।
  • रिकॉर्ड करें और आगे बढ़ें। ट्रांसक्रिप्शन, ग्रेडिंग और फीडबैक आपके लिए संभाले जाते हैं; न कुछ पेस्ट करना है, न कुछ प्रॉम्प्ट करना है।
  • आपके अपने शब्दों में फीडबैक, हर कोटेशन को आपने असल में जो कहा उस तक ट्रेस किया जा सकता है।

तुलना के लिए, Claude Max

US$100/ माह

टैक्स से पहले लगभग CA$138 · 20x टियर US$200 प्रति माह · Pro US$20 पर कहीं ज़्यादा सख़्त सीमाओं के साथ

  • Max भी सीमित है। एक चलती हुई पांच घंटे की इस्तेमाल विंडो और एक साप्ताहिक सीमा, Pro जितना देता है उससे पांच या बीस गुना; जब भी आप किसी एक की सीमा पर पहुंचते हैं, आपको इंतज़ार करना पड़ता है।
  • कोई प्रश्न बैंक नहीं। आप अपने खुद के टास्क लाते हैं, ख़ुद फ़ैसला करते हैं कि वे असली टेस्ट जैसे लगते हैं या नहीं, और ख़ुद ही ट्रैक रखते हैं कि आप पहले से क्या प्रैक्टिस कर चुके हैं।
  • सेटअप आप करते हैं। रिकॉर्डिंग, ट्रांसक्राइबिंग, ट्रांसक्रिप्ट पेस्ट करना और ग्रेडिंग निर्देश लिखना, यह सब हर बार आप पर है।
  • एक सीधी रिक्वेस्ट, कोई कैलिब्रेटेड ग्रेडर नहीं। सीधे शब्दों में पूछने पर, Claude Opus 5 ने 62% बार वेरिफाइड स्कोर से मैच किया और Claude Sonnet 5 ने 45%, जबकि Engine 2.0 ने 81% किया।

Claude प्लान की कीमतें और इस्तेमाल की शर्तें सितंबर 2026 में claude.com पर प्रकाशित के अनुसार हैं और बदल सकती हैं। CELPIP उसके मालिक का ट्रेडमार्क है; Prepamigo एक स्वतंत्र प्रैक्टिस प्लेटफ़ॉर्म है और टेस्ट बनाने वाली संस्था से जुड़ा, समर्थित या संबद्ध नहीं है। Prepamigo के प्रैक्टिस टास्क मूल सामग्री हैं जो सार्वजनिक टेस्ट फ़ॉर्मेट के हिसाब से लिखी गई हैं।

उपलब्धता

Speaking के लिए Prepamigo Scoring Engine 2.0 अभी सभी Prepamigo यूज़र्स के लिए हर स्पीकिंग टास्क टाइप पर लाइव है। कुछ भी ऑन करने की ज़रूरत नहीं है। हर नए स्पीकिंग जवाब को Engine 2.0 स्कोर करता है, और हर स्कोर के साथ छात्र के अपने शब्दों से लिया गया फीडबैक आता है।

एक सामान्य जवाब को लगभग दस सेकंड में स्कोर किया जाता है, जो Engine 1.0 से तेज़ है। Engine 2.0 को चलाने में हमें प्रति जवाब उस डिज़ाइन से भी कम खर्च आता है जिसकी जगह इसने ली, और यही वजह है कि हम Prepamigo की कीमत बदले बिना हर छात्र के लिए दो ग्रेडर और हर एक से तीन वोट चला सकते हैं।

जैसे-जैसे ऊपर बताया गया रीयल-वर्ल्ड वेरिफिकेशन पूरा होगा, हम इस पेज के आंकड़ों में अपडेट प्रकाशित करते रहेंगे। अगर आपके पास कोई ऐसी रिकॉर्डिंग है जिसे आपको लगता है Engine 2.0 ने गलत स्कोर किया, तो हम उसे देखना चाहते हैं: ऐसे मामले अगला सुधार ढूंढने का सबसे तेज़ तरीका हैं जो हम जानते हैं।

आमने-सामने की तुलना के लिए, Prepamigo बनाम Claude और Prepamigo बनाम ChatGPT पढ़ें। या एक जवाब रिकॉर्ड करें करें और देखें कि Engine 2.0 कैसे काम करता है। इसे इसे अंग्रेज़ी में पढ़ें भी पढ़ सकते हैं।

Speaking के लिए Prepamigo Scoring Engine 2.0 की शुरुआत | PrepAmigo