वेरिफाइड लेवल पर स्कोर किए गए निबंधों का हिस्सा
36 आधिकारिक CELPIP राइटिंग जवाब, हर लेवल पर 12, दोनों राइटिंग टास्क। हर मॉडल को टास्क और निबंध दिया गया और सीधे शब्दों में CELPIP स्केल पर उसे स्कोर करने को कहा गया। Prepamigo का राइटिंग स्कोरर अपने सामान्य प्रोडक्शन कॉन्फ़िगरेशन में चला।
86%
Prepamigo Writing Scorer
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
Prepamigo बनाम टॉप चैटबॉट प्लान
कनाडाई डॉलर में। Prepamigo की कीमतों में टैक्स शामिल है। Claude Max (US$100 से शुरू) और ChatGPT Pro (US$200) को टैक्स से पहले 1.38 की दर पर बदला गया है। सटीकता 36 आधिकारिक निबंधों का वह हिस्सा है जिन्हें वेरिफाइड लेवल पर स्कोर किया गया, जब नामित मॉडल को सीधे शब्दों में निबंध स्कोर करने के लिए कहा गया; एक रन।
बहुत सारे CELPIP उम्मीदवार अपना लेखन किसी AI चैटबॉट से जांचते हैं। ईमेल पेस्ट करो, स्कोर मांगो, पैराग्राफ़ पढ़ो। राइटिंग के लिए यह आसान है: न रिकॉर्डिंग, न ट्रांसक्रिप्ट। जो बात आपको कोई नहीं बताता वह यह है कि वह नंबर कितनी बार सही होता है, या किस मॉडल पर भरोसा करें, या हर एक कौन-सी गलतियां करता है। हम जानना चाहते थे, इसलिए हमने छह चैटबॉट और अपने स्कोरर को वेरिफाइड स्कोर वाले वही 36 आधिकारिक निबंध दिए और गिनती की।
एक वाक्य में: GPT 5.6 sol, 78% के साथ CELPIP राइटिंग के लिए सबसे सटीक चैटबॉट है, Claude मॉडल 61% और 56% के साथ सबसे कम सटीक हैं क्योंकि वे मध्य-लेवल निबंधों को बढ़ा-चढ़ाकर आंकते हैं, और एक खास मकसद के लिए बना स्कोरर, Prepamigo का, उन्हीं निबंधों पर 86% तक पहुंचा और उसने हर मध्य-लेवल निबंध को सही किया। हमें साफ़ कह देना चाहिए कि Prepamigo हमारा प्रोडक्ट है। जहां किसी चैटबॉट ने किसी खास लेवल पर हमें हराया, हम वह कहते हैं; दो ने हराया।
लीडरबोर्ड
ऊपर के चार्ट में तीन स्तर साफ़ दिखते हैं। Prepamigo 86% पर अकेला खड़ा है। GPT 5.6 sol 78% पर और GPT 5.6 luna 69% पर दूसरा स्तर बनाते हैं: इस्तेमाल करने लायक, जानी-पहचानी आदतों के साथ। बाकी सब 60% पर या उसके आसपास हैं, जो तीन-बैंड वाले स्केल के लिए एक जानकार अंदाज़े से ज़्यादा बेहतर नहीं है।
यह पैटर्न स्पीकिंग से अलग है, जहां Claude मॉडलों ने अच्छा किया और GPT मॉडलों ने बुरा। राइटिंग में यह उल्टा है। GPT मॉडल थोड़े सख़्त हैं: वे एक सामान्य 7 को 6 तक खींच लेते हैं और एक चूक वाले मज़बूत निबंध को 9 पर रोक देते हैं। Claude मॉडल उदार हैं: वे एक सामान्य 7 को 9 या 10 तक चढ़ा देते हैं और पतले कमज़ोर निबंधों को 3 देते हैं। Gemini बीच में Claude जैसा बर्ताव करता है। GPT-4o mini 9 को छत मानता है।
हर लेवल पर नतीजे
कमज़ोर निबंध (वेरिफाइड 4 या 5)
हर सिस्टम के लिए 12 आधिकारिक निबंध।
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
Prepamigo Writing Scorer
67%
Claude Opus 5
58%
Gemini
50%
Claude Sonnet 5
कमज़ोर निबंध स्केल का आसान सिरा हैं, और तीनों GPT मॉडल 83% पर बराबर हैं, Prepamigo के 75% से आगे। Prepamigo की तीनों चूकें एक पायदान ऊपर गईं, 6 या 7 पर, छोटे लेकिन साफ़-सुथरे निबंधों पर। Claude मॉडल दूसरी दिशा में चूकते हैं: Sonnet 5 ने बारह कमज़ोर निबंधों में से चार को 3 दिया, एक लेवल नीचे, और Opus 5 ने उनमें से दो को 3 दिया। एक पतला निबंध जो फिर भी टास्क पूरा करता है, 4 है, 3 नहीं, और जिस मॉडल के पास 4 का कोई उदाहरण नहीं है, वह फ़र्क नहीं बता सकता।
मध्य निबंध (वेरिफाइड 7 या 8)
हर सिस्टम के लिए 12 आधिकारिक निबंध। वह लेवल जहां ज़्यादातर उम्मीदवार होते हैं।
100%
Prepamigo Writing Scorer
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
42%
Gemini
33%
Claude Sonnet 5
25%
Claude Opus 5
मध्य बैंड ही मैदान को बांटता है। Prepamigo ने सभी बारह सही किए। GPT 5.6 sol ने नौ सही किए, तीन को 6 तक खींचते हुए। GPT-4o mini ने आठ सही किए और चार को 9 तक चढ़ा दिया। Luna ने सात सही किए, ज़्यादातर नीचे खींचते हुए। Gemini ने पांच सही किए और छह को 9 या 10 तक चढ़ा दिया। Claude Sonnet 5 ने चार सही किए, 6 और 9 के बीच बंटे हुए। Claude Opus 5 ने तीन सही किए और बारह में से सात को 9 या 10 दिया।
अगर आप 7 या 8 वाले लेखक हैं, और ज़्यादातर उम्मीदवार हैं, तो यही वह चार्ट है जिसे याद रखना है। Claude Opus 5 से पूछें और आधे से ज़्यादा बार यह आपको बताएगा कि आपका काम हो गया। Gemini से पूछें और आधी बार यह वही कहेगा। GPT 5.6 sol से पूछें और चार में से एक बार यह आपको बताएगा कि आप फिसलकर 6 पर आ गए हैं।
मज़बूत निबंध (वेरिफाइड 10 या उससे ऊपर)
हर सिस्टम के लिए 12 आधिकारिक निबंध। लगभग हर चूक 9 है।
92%
Claude Opus 5
83%
Prepamigo Writing Scorer
83%
Gemini
83%
Claude Sonnet 5
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
टॉप पर, Claude Opus 5 इस टेस्ट का सबसे अच्छा ग्रेडर है, जिसने बारह में से ग्यारह मज़बूत निबंध पहचाने; उनमें से पांच को इसने 11 दिया। Prepamigo, Gemini और Sonnet 5 ने दस-दस पहचाने। GPT 5.6 sol ने नौ और luna ने आठ पहचाने, बाकी को 9 पर रोकते हुए। GPT-4o mini ने तीन पहचाने और नौ को 9 दिया: यह 10 देता ही नहीं। Claude की उदारता यहां सही है और बाकी हर जगह गलत; GPT मॉडलों की सख़्ती यहां गलत है और बाकी जगह लगभग सही।
मॉडल बीच के बारे में असहमत क्यों हैं
एक मध्य-लेवल CELPIP निबंध एक खास चीज़ है: यह टास्क को कवर करता है, यह व्यवस्थित है, इसमें समझ में रुकावट डालने वाली गलतियां कम हैं, और यह सामान्य है, जिसमें वजहें विकसित करने के बजाय बस कह दी गई हैं और वोकैबुलरी सटीक होने के बजाय सुरक्षित है। एक प्रशिक्षित रेटर ने ऐसे सैकड़ों देखे हैं और जानता है कि वे कहां बैठते हैं। एक जनरल-पर्पस मॉडल ने एक साफ़-सुथरा, व्यवस्थित, ज़्यादातर सही लिखा हुआ टुकड़ा देखा है और उसे छाप से फ़ैसला करना है। Claude की छाप यह है कि साफ़-सुथरा मतलब मज़बूत। GPT की छाप यह है कि सामान्य मतलब कमज़ोर। दोनों 7 के बारे में गलत हैं, उल्टी दिशाओं में।
Prepamigo का स्कोरर छाप से फ़ैसला नहीं करता। यह निबंध की तुलना उसी तरह के टास्क के हर लेवल पर असली ग्रेड किए गए जवाबों से करता है, सभी असली चूकों वाले असली निबंध, और चारों डाइमेंशन में से हर एक पर उसे उसके बगल में रखता है जिससे वह सबसे ज़्यादा मिलता है। एक साफ़-सुथरा लेकिन सामान्य निबंध मध्य सैंपल के बगल में आता है, क्योंकि वह यही है। तुलना के ऊपर एक रूल लेयर बैठता है, उन चीज़ों के लिए जिन्हें गिनने में मॉडल कमज़ोर है: क्या हर ज़रूरी पॉइंट कवर हुआ, क्या सर्वे जवाब एक पक्ष लेता है, क्या ईमेल में अभिवादन और समापन है, और वह कितना लंबा है। एक छूटा हुआ ज़रूरी पॉइंट टास्क फ़ुलफ़िलमेंट को 8 या उससे नीचे रोक देता है, अंग्रेज़ी चाहे जैसी हो, क्योंकि टेस्ट ऐसे ही काम करता है।
हमने राइटिंग स्कोरर को वह दो-ग्रेडर, वोट-और-रिकंसाइल डिज़ाइन देने की भी कोशिश की जो हमारा स्पीकिंग स्कोरर इस्तेमाल करता है। इसने राइटिंग को बदतर बनाया, क्योंकि आधिकारिक राइटिंग लेवल 0 से 12 के स्केल पर सिर्फ़ दो अंक की दूरी पर बैठते हैं और सैंपलों के बीच एक मजबूरन चुनाव ने मध्य निबंधों को 9 तक चढ़ा दिया। राइटिंग उसी डिज़ाइन को रखती है जो बीच को सही करता है।
रैंकिंग स्पीकिंग से उल्टी क्यों है
अगर आपने हमारी स्पीकिंग तुलना पढ़ी है, तो राइटिंग का लीडरबोर्ड उल्टा लगेगा। स्पीकिंग ट्रांसक्रिप्ट पर Claude Opus 5, 62% के साथ सबसे अच्छा चैटबॉट था और GPT 5.6 sol, 35% के साथ बड़े मॉडलों में सबसे खराब। राइटिंग में GPT 5.6 sol 78% पर है और Claude मॉडल सबसे नीचे।
वजह यह है कि हर मॉडल किस चीज़ के बारे में उदार है। एक CELPIP स्पीकिंग ट्रांसक्रिप्ट बोली हुई अंग्रेज़ी लिखी हुई है: टुकड़े, दोहराव, खुद के सुधार। GPT इसे टूटा हुआ पढ़ता है और सख़्ती से स्कोर करता है, जो ट्रांसक्रिप्ट पर गलत है; Claude इसके आर-पार विचारों तक पढ़ता है। एक CELPIP निबंध इसका उल्टा है: यह संपादित है, व्यवस्थित है, सतह पर साफ़-सुथरा है, और अक्सर नीचे से सामान्य। Claude सफ़ाई को ताकत पढ़ता है और बीच को बढ़ा-चढ़ाकर आंकता है; GPT सामान्य कंटेंट को कमज़ोरी पढ़ता है और लगभग सही है, या एक अंक कम।
व्यावहारिक सबक यह है कि CELPIP के लिए कोई एक सबसे अच्छा चैटबॉट नहीं है। जो मॉडल आपकी स्पीकिंग अच्छी तरह ग्रेड करता है, वही आपके लेखन की चापलूसी करेगा, और इसका उल्टा भी। एक खास मकसद के लिए बना स्कोरर हर टास्क के लिए सही तरह के ग्रेड किए गए सैंपलों से तुलना करके इस सवाल को दरकिनार कर देता है। Prepamigo का स्पीकिंग इंजन और राइटिंग इंजन अलग-अलग डिज़ाइन वाले अलग-अलग सिस्टम हैं, क्योंकि दोनों टास्क अलग-अलग तरीकों से नाकाम होते हैं।
वह पैराग्राफ़ जो नंबर के साथ आता है
हर चैटबॉट अपने स्कोर के साथ फ़ीडबैक का एक पैराग्राफ़ लौटाता है, और वह पैराग्राफ़ आमतौर पर उतना आत्मविश्वासी होता है जितना नंबर हकदार नहीं है। उस पर अमल करने से पहले तीन चीज़ें जांचें।
- क्या यह आपको कोट करता है? जो सुधार आपके ठीक शब्दों की तरफ़ इशारा नहीं करता, वह एक सामान्य नियम है, आपके निबंध पर फ़ीडबैक नहीं। ज़्यादातर चैटबॉट सलाह ऐसी होती है जो किसी भी निबंध पर लागू होती है: अपनी वाक्य-रचना में विविधता लाएं, ज़्यादा सटीक वोकैबुलरी इस्तेमाल करें, अपनी वजहें विकसित करें। सच, और अमल करने लायक नहीं।
- क्या यह छूटे हुए पॉइंट का नाम लेता है? अगर आपने टास्क पेस्ट किया है, तो एक अच्छा जवाब आपको बताता है कि कौन-सा ज़रूरी पॉइंट आपने कवर नहीं किया। अगर आपने पेस्ट नहीं किया, तो चैटबॉट जान ही नहीं सकता, और वह फिर भी कवरेज की तारीफ़ कर देगा।
- क्या आलोचना स्कोर से मेल खाती है? चैटबॉट का पैराग्राफ़ अक्सर तीन या चार समस्याएं गिनाता है और फिर 10 दे देता है, या निबंध की तारीफ़ करता है और 6 दे देता है। जब शब्द और नंबर असहमत हों, तो कोई भी भरोसेमंद नहीं है।
Prepamigo का फ़ीडबैक उल्टे ढंग से बनाया गया है: स्कोरर को हर डाइमेंशन का स्कोर देने से पहले उसका समर्थन करने वाले वाक्यांश कोट करने होते हैं, और जो कोट आपके निबंध में नहीं मिलता, उसे हटा दिया जाता है। छूटे हुए पॉइंट नाम के साथ सूचीबद्ध होते हैं, और एक छूटा हुआ पॉइंट टास्क-फ़ुलफ़िलमेंट स्कोर की सीमा तय करता है, इसलिए शब्द और नंबर असहमत नहीं हो सकते। नीचे का सेक्शन बताता है कि इसमें क्या है।
हर मॉडल पर नोट्स
- GPT 5.6 sol। राइटिंग के लिए सबसे अच्छा चैटबॉट, 78% पर, और अगर आप कोई इस्तेमाल करते हैं तो यही करें। थोड़ा सख़्त: तीन मध्य निबंध 6 तक खींचे, तीन मज़बूत निबंध 9 पर रोके। कमज़ोर निबंधों पर यह Prepamigo से बेहतर है, 83% बनाम 75%।
- GPT 5.6 luna। 69%। Sol जैसा ही आकार लेकिन बीच में ज़्यादा सख़्त, जहां इसने बारह में से सात सही किए। कमज़ोर निबंधों पर अच्छा।
- Gemini। 61%। दोनों सिरों पर ठीक, बीच में 42% पर कमज़ोर, जहां इसने बारह में से छह निबंधों को 9 या 10 तक चढ़ा दिया।
- Claude Opus 5। कुल मिलाकर 61% लेकिन मज़बूत निबंधों पर इस टेस्ट का सबसे अच्छा ग्रेडर, 92% पर। बीच में यह 25% के साथ सबसे खराब है, बारह में से सात को 9 या 10 देते हुए। अगर आपका लेखन पहले से मज़बूत है, तो Opus 5 इसकी पुष्टि करेगा; अगर यह औसत है, तो Opus 5 आपको बताएगा कि यह मज़बूत है।
- GPT-4o mini। 58%। 9 को स्केल का टॉप मानता है: बारह में से नौ मज़बूत निबंधों को 9 मिला। अगर आप 10 के आसपास कहीं भी हैं, तो राइटिंग ग्रेड करने के लिए इसे इस्तेमाल मत कीजिए।
- Claude Sonnet 5। 56%, सबसे कम सटीक। चार कमज़ोर निबंधों को 3 दिया और मध्य बैंड को 6 और 9 के बीच बांट दिया।
अगर आप फिर भी चैटबॉट इस्तेमाल करने वाले हैं
- GPT 5.6 sol इस्तेमाल करें। मज़बूत निबंध से नीचे किसी भी चीज़ के लिए Claude मॉडल नहीं, और कमज़ोर निबंध से ऊपर किसी भी चीज़ के लिए छोटा मॉडल नहीं।
- पूरा टास्क पेस्ट करें। ईमेल टास्क के ज़रूरी पॉइंट और सर्वे टास्क के विकल्प स्कोर बदल देते हैं। जो मॉडल पॉइंट नहीं जानता, वह आपको नहीं बता सकता कि एक छूट गया है।
- पहले पॉइंट जांचने को कहें। हर ज़रूरी पॉइंट पर हां या न मांगें, फिर स्कोर। यह रूल लेयर है, हाथ से किया हुआ।
- दो बार पूछें, नीचे वाला जवाब रखें। GPT 5.6 sol ने उन्हीं निबंधों के तीन रन में 78%, 83% और 81% स्कोर किया; एक अकेला जवाब कुछ अंकों की किस्मत साथ लाता है।
- 9 और 6 को शक से पढ़ें। GPT मॉडल से, 9 अक्सर एक रोका हुआ 10 है और 6 अक्सर एक नीचे खींचा हुआ 7। Claude मॉडल से, 9 अक्सर एक चढ़ाया हुआ 7 है।
जो एक इनपुट आप खुद नहीं दे सकते, वह है हर लेवल पर उसी टास्क का वेरिफाइड ग्रेड किया गया निबंध, जिससे एक खास मकसद के लिए बना स्कोरर तुलना करता है। यह, और ज़रूरी पॉइंट की जांच, 78% और 86% के बीच का फ़र्क है।
आपके राइटिंग फ़ीडबैक में क्या नया है
स्कोर तो आपको वापस मिलने वाली चीज़ का सिर्फ़ आधा हिस्सा है। राइटिंग फ़ीडबैक लेयर को स्कोरर के साथ-साथ नए सिरे से बनाया गया है, और इसमें हर चीज़ आपके अपने टेक्स्ट से जुड़ी है। यहां बताया गया है कि क्या बदला है।
- ऐसे सुधार जो आप अपने निबंध में खुद ढूंढ सकते हैं. ग्रामर, स्पेलिंग और वोकैबुलरी का हर सुधार आपके जवाब के ठीक वही शब्द कोट करता है, ताकि ऐप उन्हें वहीं हाइलाइट कर सके जहां आपने उन्हें लिखा था। जो कुछ भी चेकर आपके निबंध में शब्द-दर-शब्द नहीं ढूंढ पाता, वह आपके देखने से पहले ही हटा दिया जाता है।
- एक मॉडल आंसर, आपके अपने जवाब से बना हुआ. आपको अपने ही जवाब का एक फिर से लिखा हुआ वर्ज़न मिलता है जो आपके विचार बनाए रखता है, हर ज़रूरी पॉइंट को कवर करता है और टास्क के मांगे गए 150 से 200 शब्दों में उतरता है। अगर पहला रीराइट उस लंबाई से चूक जाता है, तो दिखाए जाने से पहले उसे एक बार फिर से लिखा जाता है।
- जो ज़रूरी पॉइंट आपसे छूटा, उसका नाम. ईमेल टास्क के लिए, फ़ीडबैक प्रॉम्प्ट के उन बुलेट पॉइंट की सूची देता है जिन्हें आपके जवाब ने कवर नहीं किया। एक छूटा हुआ पॉइंट टास्क-फ़ुलफ़िलमेंट स्कोर को भी 8 या उससे नीचे रोक देता है, ताकि नंबर और फ़ीडबैक कभी एक-दूसरे से असहमत न हों।
- हर डाइमेंशन के लिए एक रोकने वाली वजह. चार डाइमेंशन में से हर एक के लिए, फ़ीडबैक ठोस शब्दों में उस एक चीज़ का नाम लेता है जो उस स्कोर को नीचे रोक रही है, या साफ़ कहता है कि कोई चीज़ नहीं रोक रही और उसे कौन-सी चीज़ संभाल रही है। यह तय करना कि किसी डाइमेंशन में कोई समस्या नहीं है, एक असली जवाब है, कोई कमी नहीं।
- आलोचना सही जगह पर. कमज़ोर टोन टास्क-फ़ुलफ़िलमेंट की समस्या है, अस्पष्ट शब्द चुनना वोकैबुलरी की समस्या है, बिना रुके खिंचता वाक्य रीडेबिलिटी की समस्या है। हर पॉइंट उसी डाइमेंशन के नीचे दर्ज होता है जिससे वह जुड़ा है, बजाय इसके कि उसे कुल सारांश में मिला दिया जाए।
- वाक्य-स्तर के रीराइट. आपके निबंध के खास वाक्य एक बेहतर वर्ज़न और इस बारे में एक लाइन के साथ वापस आते हैं कि वह बेहतर क्यों है, ताकि आप बदलाव के बारे में पढ़ने के बजाय उसे देख सकें।
- आपका सबसे मज़बूत और सबसे कमज़ोर डाइमेंशन, आमने-सामने. फ़ीडबैक आपको बताता है कि चार डाइमेंशन में से कौन-सा आपके स्कोर को संभाल रहा है और कौन-सा उसे पीछे खींच रहा है, ताकि चार नंबरों को डिकोड किए बिना आपको पता हो कि अगली प्रैक्टिस किस पर करनी है।
फ़ीडबैक का हर कोटेशन दिखाए जाने से पहले आपके निबंध से मिलाया जाता है। अगर चेकर वे शब्द नहीं ढूंढ पाता, तो वह लाइन हटा दी जाती है। इसीलिए फ़ीडबैक कभी आपसे कुछ ऐसा ठीक करने को नहीं कहता जो आपने लिखा ही नहीं।
अक्सर पूछे जाने वाले सवाल
CELPIP राइटिंग स्कोर करने में कौन सा AI सबसे सटीक है? चैटबॉट में, GPT 5.6 sol 78% पर, फिर luna 69%, Gemini और Claude Opus 5 61%, GPT-4o mini 58%, Claude Sonnet 5 56%। Prepamigo का राइटिंग स्कोरर उन्हीं निबंधों पर 86% तक पहुंचा।
राइटिंग के लिए ChatGPT या Claude? ChatGPT, साफ़ तौर पर: 78% बनाम 61% और 56%। Claude मॉडल मध्य-लेवल निबंधों को 9 या 10 तक बढ़ा देते हैं। मज़बूत निबंधों पर Opus 5 सबमें सबसे बेहतर है।
वे मेरे औसत निबंध को 9 क्यों देते हैं? जिस मॉडल के पास तुलना के लिए कुछ नहीं है, उसे साफ़-सुथरा और व्यवस्थित मज़बूत लगता है। Prepamigo उसी टास्क के असली ग्रेड किए गए सैंपलों से तुलना करता है।
चैटबॉट से बेहतर स्कोर कैसे पाऊं? GPT 5.6 sol इस्तेमाल करें, पूरा टास्क पेस्ट करें, पहले हर ज़रूरी पॉइंट जांचने को कहें, दो बार पूछें, और 9 और 6 को शक से पढ़ें।
दोनों आमने-सामने की तुलनाओं के लिए, राइटिंग के लिए Prepamigo बनाम Claude और राइटिंग के लिए Prepamigo बनाम ChatGPT पढ़ें। स्कोरर कैसे काम करता है, इसके लिए Prepamigo के राइटिंग स्कोरर के भीतर की झलक पढ़ें। इसे अंग्रेज़ी में पढ़ने के लिए यहां क्लिक करें: इसे अंग्रेज़ी में पढ़ें। या एक जवाब लिखें और अंदाज़े लगाना छोड़ दें।
