48 होल्ड-आउट जवाबों पर Engine 2.0
वेरिफाइड बैंड के भीतर स्कोर किए गए जवाबों का हिस्सा। अलग-अलग दिनों में हुए तीन अलग रन में हर बार कुल 81.3% रहा।
81%
सही बैंड
Prepamigo बनाम टॉप चैटबॉट प्लान
कनाडाई डॉलर में। Prepamigo की कीमतों में टैक्स शामिल है। Claude Max (US$100 से शुरू) और ChatGPT Pro (US$200) को टैक्स से पहले 1.38 की दर पर बदला गया है। सटीकता उन होल्ड-आउट जवाबों का हिस्सा है जिन्हें वेरिफाइड लेवल पर स्कोर किया गया, जब नामित मॉडल को सीधे शब्दों में जवाब स्कोर करने के लिए कहा गया; तीन रन का औसत।
यह किसी भी प्रैक्टिस टूल से पूछा जाने वाला सही सवाल है, और ज्यादातर टूल इसका जवाब नहीं देते। एक स्पीकिंग स्कोर तभी काम का है जब वह बताए कि एक असली रेटर क्या कहेगा, और यह जानने का इकलौता तरीका है इसे मापना। तो यह लेख वही माप है, साफ-साफ रखा गया, जिसमें वे हिस्से भी शामिल हैं जो हमें अच्छा दिखाते हैं और वे भी जो नहीं दिखाते।
एक पैराग्राफ में जवाब: 48 स्पीकिंग जवाबों पर, जिन्हें Prepamigo के Scoring Engine 2.0 ने पहले कभी नहीं देखा था और जिनमें से हर एक का स्कोर स्वतंत्र रूप से वेरिफाइड था, इंजन ने 81% बार वेरिफाइड लेवल पर और 92% बार उसके एक अंक के भीतर स्कोर दिया। तीन अलग-अलग रन में इसने हर बार यही 81% हासिल किया। यह कमजोर और मिडल-लेवल जवाबों पर सबसे ज्यादा सटीक है, क्रमशः 88% और 85% पर, और टॉप-लेवल जवाबों पर सबसे कम सटीक, 71% पर, जहां इसकी खास गलती किसी 10 को 8 देना है। सीधे शब्दों में उन्हीं ट्रांसक्रिप्ट को स्कोर करने के लिए कहने पर, हमारे टेस्ट किए गए सबसे बेहतर जनरल-पर्पस AI मॉडल ने 62% हासिल किया, और सबसे कमजोर ने 31%; हमारी पूरी ग्रेडिंग प्रक्रिया के साथ, सबसे बेहतर मॉडल ने 77% हासिल किया।
आगे बताया गया है कि हमने ये आंकड़े कैसे निकाले, हर स्कोर लेवल पर इनका क्या मतलब है, ये कितने स्थिर हैं, गलतियां कहां होती हैं, यह स्कोर उन विकल्पों से कैसे तुलना करता है जो आप शायद इसके बजाय इस्तेमाल कर रहे हों, और इस सब को ध्यान में रखते हुए अपना स्कोर कैसे पढ़ें। अगर आपको सिर्फ व्यावहारिक सलाह चाहिए, तो सीधे अपना स्कोर कैसे पढ़ें वाले सेक्शन पर जाएं। अगर आप तय करना चाहते हैं कि इस नंबर पर भरोसा करें भी या नहीं, तो पूरा लेख पढ़ें।
यहां “सटीक” का क्या मतलब है
किसी भी नंबर से पहले, परिभाषा। हम यह दावा नहीं कर रहे कि Prepamigo का स्कोर आपके टेस्ट के नतीजे की भविष्यवाणी करता है। कोई भी प्रैक्टिस टूल यह वादा नहीं कर सकता, और जो कोई करता है वह सिर्फ अंदाजा लगा रहा है। हम जो मापते हैं वह इससे कहीं ज्यादा सीमित और ज्यादा ईमानदार है: एक बोले गए जवाब को देखते हुए जिसका स्कोर स्वतंत्र रूप से वेरिफाइड किया गया है, इंजन कितनी बार उसी लेवल पर स्कोर देता है?
CELPIP स्पीकिंग का स्कोर 12 तक जाने वाले स्केल पर दिया जाता है, और हमारे रेफरेंस डेटा में वेरिफाइड स्कोर तीन बैंड में आते हैं: लोअर, यानी 4 या 5; मिडल, यानी 7 या 8; और टॉप, यानी 10 और उससे ऊपर। जब इंजन का स्कोर वेरिफाइड बैंड के भीतर आता है, तो हम उसे सही मानते हैं। टॉप पर वेरिफाइड किया गया जवाब सही स्कोर किया गया माना जाता है अगर इंजन उसे 9, 10 या 11 देता है। एक ज्यादा सख्त तरीके से, जो सिर्फ 10 और उससे ऊपर को स्वीकार करता है, इस पेज के हर आंकड़े में कुछ अंकों की गिरावट आती है और हर तुलना उसी क्रम में बनी रहती है।
मुख्य आंकड़े
व्यवहार में 81% का क्या मतलब है? अगर आप एक जैसे लेवल पर दस जवाब रिकॉर्ड करते हैं, तो इंजन उनमें से लगभग आठ को सही बैंड में रखेगा और लगभग एक और को उसके एक अंक के भीतर। यह 5 को 10 के बैंड में या 10 को 5 के बैंड में नहीं रखेगा; तीन रन में स्कोर किए गए 144 जवाबों में ऐसा एक बार भी नहीं हुआ। यह जो गलतियां करता है वे एक सावधान रेटर की गलतियां हैं, किसी बॉर्डरलाइन जवाब पर, और अगला सेक्शन दिखाता है कि ये गलतियां कहां सबसे ज्यादा होती हैं।
हर स्कोर लेवल पर सटीकता
वेरिफाइड बैंड के अनुसार सटीकता
हर बैंड में 16 होल्ड-आउट जवाब। हर बार उस बैंड के जवाबों का वह हिस्सा है जिन्हें उसी बैंड के भीतर स्कोर किया गया।
88%
लोअर (4–5)
85%
मिडल (7–8)
71%
टॉप (10+)
लोअर-लेवल जवाब: 88%। कमजोर जवाबों को पहचानना सबसे आसान है। वे आमतौर पर छोटे होते हैं, प्रॉम्प्ट के शब्दों को दोहराते हैं, और टास्क के कुछ हिस्से अधूरे छोड़ देते हैं। इंजन ज्यादातर बार इन संकेतों को पकड़ लेता है। जब यह चूकता है, तो ऊपर की तरफ चूकता है: हर मामले में, जवाब को 4 या 5 के बजाय 8 स्कोर किया गया। इसका कारण लगभग हमेशा एक ऐसा जवाब होता है जो धाराप्रवाह और आत्मविश्वास से भरा लगता है लेकिन कहता कुछ खास नहीं; डिलिवरी उसे वह लेवल दे देती है जो उसने कंटेंट पर नहीं कमाया। हम यह जानते हैं क्योंकि हम देख सकते हैं कि ग्रेडर ने किस डाइमेंशन को ऊंचा रखा, और यह हर बार लिसनेबिलिटी होती है।
मिडल-लेवल जवाब: 85%। एक मायने में इन्हें ग्रेड करना सबसे मुश्किल है, क्योंकि इनमें ताकत और कमजोरी का एक असली मिश्रण होता है जिसे पहचानने के बजाय तौलना पड़ता है। यहां इंजन की चूकें दोनों दिशाओं में जाती हैं। कुछ जवाब जिनमें साफ हिचकिचाहट थी लेकिन विचार ठोस थे, उन्हें 5 या 6 तक नीचे खींच दिया गया; कुछ चमकदार सुनाई देने वाले जवाबों को 10 तक ऊपर धकेल दिया गया। दो ग्रेडरों के बीच का रीकंसिलिएशन स्टेप इनमें से ज्यादातर को पकड़ लेता है, यही वजह है कि यह आंकड़ा इतना ऊंचा है।
टॉप-लेवल जवाब: 71%। यह सबसे कमजोर बैंड है और वह जिसकी हम सबसे ज्यादा बात करते हैं, क्योंकि यह गलती इतनी लगातार होती है। जब इंजन किसी टॉप-लेवल जवाब को चूकता है, तो वह उसे 8 देता है। 7 नहीं, 6 नहीं; मुट्ठी भर 9 को छोड़कर, जो सही माने जाते हैं, हर बार 8। इंजन एक मजबूत जवाब देखता है और एक पायदान पीछे रुक जाता है।
इसे संदर्भ में समझना जरूरी है। मजबूत जवाबों पर 8 की तरफ यह झुकाव कोई Prepamigo की खासियत नहीं है; यह हर उस ऑटोमेटेड ग्रेडर की खास कमजोरी है जिसे हमने टेस्ट किया है, चाहे वह ह्यूमन-कैलिब्रेटेड हो या न हो। हमारे पिछले इंजन में यह समस्या कहीं ज्यादा थी। सीधे शब्दों में उन्हीं जवाबों को स्कोर करने के लिए कहने पर, सबसे बेहतर जनरल-पर्पस मॉडल ने 56% टॉप-लेवल जवाबों को पहचाना; ChatGPT के पेड प्लान के पीछे वाले मॉडल ने 25% पहचाना; और हमारी पूरी प्रक्रिया देने पर भी, इनमें से कोई भी 63% से आगे नहीं गया। इकहत्तर प्रतिशत वह सबसे बेहतर आंकड़ा है जो हमने हासिल किया है, और यह अब भी वह नंबर है जिसे हम सबसे ज्यादा सुधारना चाहते हैं।
8 की समस्या, आपकी स्क्रीन की तरफ से
लेवल वाला नजरिया बताता है कि किसी जाने-पहचाने लेवल के जवाब पर इंजन कैसा करता है। आप इसे उलटी तरफ से देख रहे हैं: आपके पास एक स्कोर है और आप जानना चाहते हैं कि उस पर कितना भरोसा करें। तो यहां वही डेटा उलट कर दिखाया गया है। इंजन जो भी स्कोर देता है, उस पर, जवाब असल में उस लेवल पर कितनी बार था?
- अगर इंजन 4 या 5 कहता है: जवाब 93% बार लोअर लेवल पर था। बाकी बचे हुए भारी हिचकिचाहट वाले मिडल-लेवल जवाब थे। Engine 2.0 से मिला कम स्कोर लगभग हमेशा सही होता है।
- अगर इंजन 10 कहता है: जवाब 92% बार टॉप लेवल पर था। Engine 2.0 से मिला 10, सच में 10 होता है।
- अगर इंजन 8 कहता है: जवाब 67% बार मिडल लेवल पर था, 23% बार टॉप लेवल पर, और 10% बार लोअर लेवल पर। 8 ही वह इकलौता स्कोर है जिसे ध्यान से पढ़ना चाहिए।
सीधे शब्दों में कहें तो: Engine 2.0 से मिला 8 मतलब है “शायद मिडल, लेकिन शायद बेहतर भी।” 8 पाने वाले लगभग चार जवाबों में से एक असल में 10 होता है। अगर आपको किसी ऐसे जवाब पर 8 मिलता है जिसे आपने बेहतरीन माना था, तो यह मत मान लें कि आप तैयार नहीं हैं। वही टास्क फिर से रिकॉर्ड करें। तीन प्रयासों में एक जैसा 10 आना, 10 ही है; तीन प्रयासों में एक जैसा 8 आना, 8 ही है; और मिश्रण मिलना एक बॉर्डरलाइन जवाब की निशानी है, और फीडबैक बताएगा कि कौन सा डाइमेंशन उसे वहां रोक रहा है।
क्या एक जैसी रिकॉर्डिंग को एक जैसा स्कोर मिलता है?
स्थिरता के बिना सटीकता सिर्फ किस्मत है। अगर एक जैसी रिकॉर्डिंग को आज 8 और कल 10 मिल सकता है, तो 81% वाला आंकड़ा सिर्फ शोर का एक औसत होगा और आप स्कोर से किसी चीज को ट्रैक नहीं कर पाएंगे। तो हमने रिपीटेबिलिटी को सीधे टेस्ट किया।
48 होल्ड-आउट जवाबों को तीन अलग-अलग बार, अलग-अलग दिनों में, बीच में कुछ भी बदले बिना स्कोर किया गया। हर रन में कुल आंकड़ा 81.3% रहा। अलग-अलग जवाबों के स्तर पर, 87.5% को तीनों बार एक जैसा स्कोर मिला, और सिर्फ 4.2% ही कभी दो या उससे ज्यादा अंकों से बदले। ये कुछ जवाब ठीक दो बैंड की सीमा पर होते हैं, जहां जजमेंट में एक छोटा सा फर्क वाजिब तौर पर स्कोर को इस या उस तरफ झुका देता है।
यह स्थिरता एक खास डिजाइन फैसले से आती है। इंजन के दोनों ग्रेडरों में से हर एक हर जवाब पर तीन बार वोट करता है, और बीच वाला वोट रखा जाता है। जब हमने तीन के बजाय एक ही वोट के साथ यही सेटअप टेस्ट किया, तो रन में एक जैसे स्कोर 87.5% से गिरकर 77% हो गए, और दो या उससे ज्यादा अंक बदलने वाले जवाबों का हिस्सा दोगुने से भी ज्यादा बढ़ गया। वोटिंग ने सटीकता के आंकड़े को नहीं बदला। इसने यह बदल दिया कि सटीकता का आंकड़ा किसी मतलब का है या नहीं।
आपके लिए, स्थिरता का मतलब है कि आपके स्कोर में बदलाव आपकी स्पीकिंग में बदलाव है। अगर आप एक हफ्ते में एक जैसा टास्क टाइप तीन बार रिकॉर्ड करते हैं और स्कोर 8 से 10 हो जाता है, तो इसका मतलब यह नहीं कि ग्रेडर का दिन अच्छा था। यह आप हैं।
यह उन विकल्पों से कैसे तुलना करता है जो आप शायद इसके बजाय इस्तेमाल करते हों
सटीकता का आंकड़ा किसी तुलना के साथ ज्यादा मतलब रखता है। तो हमने उन्हीं 48 होल्ड-आउट जवाबों को उन जनरल-पर्पस AI मॉडलों से गुजारा जिन्हें लोग असल में अपनी प्रैक्टिस ग्रेड करने के लिए इस्तेमाल करते हैं, वैसे ही जैसे कोई इंसान करता: हमने हर मॉडल को वर्ड-फॉर-वर्ड ट्रांसक्रिप्ट और टास्क दिया, उसे बताया कि वह एक अनुभवी CELPIP परीक्षक है, और 0 से 12 के बीच स्कोर मांगा। हर मॉडल के तीन रन, औसत निकाला गया।
वेरिफाइड बैंड के भीतर स्कोर किए गए जवाबों का हिस्सा
वही 48 होल्ड-आउट जवाब। हर मॉडल से सीधे शब्दों में ट्रांसक्रिप्ट स्कोर करने के लिए कहा गया; तीन रन का औसत। Engine 2.0 अपने सामान्य प्रोडक्शन सेटअप में चला।
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Engine 2.0 हर मॉडल से उन्नीस से इक्यावन अंकों के बीच आगे है। सीधे शब्दों में पूछने पर, हर जनरल-पर्पस मॉडल सख्ती से ग्रेड करता है: कमजोर जवाब पर चूक आमतौर पर 3 होती है, मजबूत जवाब पर चूक 7 या 8। Claude Opus 5 और Gemini ही सिर्फ दो मॉडल हैं जो आधे से ऊपर हैं। तीन बड़े GPT मॉडल 31% से 37% के बीच हैं, और टॉप-लेवल जवाब को 13% से 27% बार पहचानते हैं।
फिर हमने हर मॉडल को अपनी पूरी प्रक्रिया दी: उस खास टास्क के लिए वही कैलिब्रेशन उदाहरण, वही फोर्स्ड कंपैरिजन, और उसकी अपनी आदतों के हिसाब से ट्यून किया गया एक छोटा कैलिब्रेशन नोट। यह वह सबसे बेहतर नतीजा है जो हर मॉडल हमारे हाथों में हासिल कर सका, और यह कुछ ऐसा नहीं है जो कोई स्टूडेंट उन उदाहरणों के बिना दोहरा सके। Opus 5 चढ़कर 77% तक पहुंचा, GPT 5.6 sol और Gemini 71% तक, GPT 5.5 और Sonnet 5 69% तक, luna 63% तक और GPT-4o mini 50% तक। इनमें से हर एक फिर भी Engine 2.0 से पीछे रहा, और किसी ने भी 63% से ज्यादा टॉप-लेवल जवाब नहीं पहचाने।
आपके फ़ीडबैक में क्या नया है
Engine 2.0 के साथ एक नया बनाया गया फ़ीडबैक लेयर आता है। यह सिर्फ़ स्कोर नहीं, बल्कि दोनों ग्रेडर के सबूत को पढ़ता है, और इसे तीन तरह के स्टूडेंट पर टेस्ट किया गया है: कोई जो पहली बार CELPIP का सामना कर रहा है, कोई जिसकी अंग्रेज़ी कमज़ोर है और जो कोई ट्रिक ढूंढ रहा है, और कोई जिसके पास दिन में सिर्फ़ आधा घंटा है और अगले हफ़्ते टेस्ट है। यहां बताया गया है कि क्या बदला है।
- आपके अपने शब्द, वापस कोट किए गए. फ़ीडबैक का हर पॉइंट आपकी ट्रांसक्रिप्ट के उस ठीक वाक्यांश का हवाला देता है जिस पर ग्रेडर ने प्रतिक्रिया दी। अगर कोई वाक्यांश कोटेशन मार्क्स में है, तो वह जैसा-का-वैसा कॉपी किया गया है; हमारे ऑडिट में 158 में से 157 कोट ऐसे ही थे। फ़ीडबैक कभी वह नहीं बनाता जो आपने कहा ही नहीं।
- पहले ठीक करने के लिए एक चीज़. हर जवाब को एक ही टॉप मूव मिलता है: वह एक बदलाव जो आपका स्कोर सबसे ज़्यादा बढ़ाएगा, पेज पर सबसे सीधे शब्दों में लिखा हुआ। इसके बाद दो और ठोस कदम आते हैं, फिर बोलना शुरू करने से पहले दिमाग में दोहराने के लिए तीन पॉइंट की एक चेकलिस्ट।
- टास्क के हिसाब से सलाह. सलाह देना, किसी सीन का वर्णन करना और किसी को मनाना, इन सबका स्कोर अलग-अलग बातों पर होता है। फ़ीडबैक को अब पता है कि आठ टास्क टाइप में से हर एक किस चीज़ का इनाम देता है, और वह उसी पर बात करता है, बजाय इसके कि हर टास्क पर एक जैसी सामान्य टिप्स दोहराई जाएं।
- किस डाइमेंशन का पहले अभ्यास करें. फ़ीडबैक आपको बताता है कि चार डाइमेंशन में से कौन-सा आपका सबसे कमज़ोर है और कौन-सा सबसे मज़बूत, ताकि आपको पता हो कि अगला पॉइंट कहां से मिलेगा, बिना उसे किसी नंबर के पीछे छिपाए।
- टास्क ने क्या मांगा और आपसे क्या छूट गया. टास्क फ़ुलफ़िलमेंट के लिए, फ़ीडबैक प्रॉम्प्ट के उन खास हिस्सों की सूची देता है जो आपने कवर नहीं किए, या साफ़ शब्दों में कहता है कि आपने सब कुछ कवर कर लिया।
- ऐसी चीज़ें जिनका आप असल में अभ्यास कर सकते हैं. हर सुझाव कुछ ऐसा है जो आप अपने अगले प्रयास से पहले ज़ोर से बोलकर देख सकते हैं। ज़्यादा साफ़ बोलने या अपना एक्सेंट कम करने की कोई सलाह नहीं: लिसनेबिलिटी एक्सेंट को नहीं मापती, और फ़ीडबैक उस पर कभी कोई टिप्पणी नहीं करता।
- टाइमर के लिए कोई दोष नहीं. अगर टास्क पूरा होने के बाद घड़ी की वजह से जवाब कट जाता है, तो उस कट-ऑफ़ के लिए अंक नहीं काटे जाते, और फ़ीडबैक इसके लिए आपको नहीं डांटता।
जब एक स्वतंत्र जजिंग मॉडल ने इस फ़ीडबैक की तुलना हमारे पुराने सिस्टम द्वारा उन्हीं जवाबों के लिए बनाए गए फ़ीडबैक से की, बिना यह जाने कि कौन-सा कौन-सा है, तो उसने 24 में से 20 तुलनाओं में नए फ़ीडबैक को प्राथमिकता दी — एक परीक्षक की तरह जज करते हुए भी और एक स्टूडेंट की तरह जज करते हुए भी।
अपना स्कोर कैसे पढ़ें
- 4 या 5 लगभग तय तौर पर सही होता है। इंजन 88% बार कमजोर जवाबों को पहचान लेता है, और जब यह 4 या 5 कहता है, तो यह 93% बार सही होता है। फीडबैक पढ़कर देखें कि कौन सा डाइमेंशन सबसे कम है और उस पर काम करें।
- 10 सच में 10 होता है। जब इंजन 10 कहता है, तो जवाब 92% बार टॉप लेवल पर था। आप उस टास्क टाइप पर तैयार हैं। उन टास्क टाइप की तरफ बढ़ें जिनसे आप बचते हैं।
- 8 एक सवाल है। दो-तिहाई बार इसका मतलब मिडल होता है। चार में से एक बार इसका मतलब टॉप होता है। वही टास्क फिर से रिकॉर्ड करें और अलग-अलग प्रयासों के पैटर्न को देखें।
- बदलावों पर लेवल से ज्यादा भरोसा करें। क्योंकि स्कोर स्थिर है, प्रयासों के बीच का बदलाव आपकी स्पीकिंग में बदलाव है। एक जैसा टास्क टाइप दोहराना यह जानने का सबसे तेज़ तरीका है कि कोई नई आदत काम कर रही है या नहीं।
- कोट्स पढ़ें। आपके फीडबैक में कोट किए गए शब्द वही हैं जिन पर ग्रेडरों ने प्रतिक्रिया दी। यही वे खास शब्द हैं जिन्हें बदलना है।
अक्सर पूछे जाने वाले सवाल
Prepamigo का स्पीकिंग स्कोर कितना सटीक है? वेरिफाइड स्कोर वाले 48 अनदेखे जवाबों पर: सही बैंड पर 81%, एक अंक के भीतर 92%, तीन रन में एक समान। बैंड के अनुसार: लोअर 88%, मिडल 85%, टॉप 71%।
क्या यह मेरे असली स्कोर के बराबर है? कोई भी प्रैक्टिस टूल यह वादा नहीं कर सकता। हम जो मापते हैं वह यह है कि इंजन कितनी बार एक ही जवाब पर वेरिफाइड स्कोर से सहमत होता है। अपने स्कोर को एक दिशा के साथ एक लेवल के रूप में पढ़ें, और प्रयासों के पैटर्न को देखें।
मुझे उस जवाब पर 8 क्यों मिला जिसे मैंने बेहतरीन माना था? यह इंजन की सबसे बड़ी बची हुई गलती है: चार में से एक 8 असल में 10 होता है। वही टास्क फिर से रिकॉर्ड करें। प्रयासों में एक जैसा 10 आना, 10 ही है।
क्या एक जैसी रिकॉर्डिंग को दोबारा एक जैसा स्कोर मिलेगा? तीन रन में 87.5% एक समान; सिर्फ 4.2% दो या उससे ज्यादा अंकों से बदले, सभी बैंड की सीमाओं पर।
इंजन स्टेप दर स्टेप कैसे काम करता है यह देखने के लिए, Scoring Engine 2.0 के भीतर पढ़ें। GPT, Claude और Gemini पर वही टेस्ट कैसा रहा, यह देखने के लिए, कौन सा AI CELPIP स्पीकिंग को सबसे सटीक तरीके से स्कोर करता है पढ़ें। इसे इसे अंग्रेज़ी में पढ़ें भी पढ़ा जा सकता है। या एक जवाब रिकॉर्ड करें और खुद अपने लिए आंकड़े देखें।
