سهم نوشتههایی که در سطح تأییدشده نمره گرفتند
36 پاسخ رسمی رایتینگ CELPIP، 12 پاسخ در هر یک از سه سطح، در هر دو تسک رایتینگ. به Claude تسک و نوشته داده شد و از آن خواسته شد با کلماتی ساده آن را در مقیاس CELPIP نمره بدهد. نمرهدهنده رایتینگ Prepamigo در پیکربندی عادی عملیاتی خودش اجرا شد.
86%
نمرهدهنده رایتینگ Prepamigo
61%
Claude Opus 5
56%
Claude Sonnet 5
مقایسه Prepamigo با پرطرفدارترین طرحهای چتبات
بر اساس دلار کانادا. قیمتهای Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شدهاند. دقت، سهم 36 نوشته رسمی است که وقتی از مدل نامبرده با کلماتی ساده درخواست امتیازدهی به نوشته میشود، در سطح تأییدشده امتیاز میگیرند؛ یک اجرا.
رایتینگ مهارتی است که در آن یک چتبات بهعنوان ارزیاب از همهجا قانعکنندهتر به نظر میرسد. ضبطی برای پیادهسازی نیست، لهجهای برای نگرانی نیست، فقط متنی وارد میشود و عددی بیرون میآید، همراه با یک پاراگراف توضیح مطمئن. پس ما آن عدد را آزمودیم. همان 36 پاسخ رسمی رایتینگ CELPIP را که نمرهدهنده خودمان با آنها سنجیده میشود، دوازده تا در هر سطح، به Claude دادیم و از آن خواستیم همانطور که یک داوطلب میپرسد، به آنها نمره بدهد.
پاسخ کوتاه: نمرهدهنده رایتینگ Prepamigo در 86% مواقع به سطح تأییدشده رسید. Claude Opus 5 در 61% مواقع و Claude Sonnet 5 در 56% مواقع به آن رسیدند. این فاصله بهطور یکنواخت پخش نشده است. در نوشتههای ضعیف و نوشتههای قوی Claude قابلقبول است، و در بالای مقیاس Opus 5 واقعاً از ما بهتر است. در نوشتههای سطح میانی، همان 7 و 8هایی که بیشتر داوطلبان واقعاً مینویسند، Opus 5 از هر چهار بار یک بار و Sonnet 5 از هر سه بار یک بار درست بود. Prepamigo در هر دوازده مورد درست بود.
باقی این مقاله آن نتایج را سطحبهسطح مرور میکند، توضیح میدهد چرا یک مدل عمومی وسط مقیاس را از دست میدهد، بررسی میکند بازخورد هر طرف چقدر ارزش دارد، و مقایسه میکند تمرین جدی رایتینگ با هرکدام چقدر هزینه دارد. ما در سراسر مقاله سعی کردهایم با Claude منصف باشیم، از جمله در همان یک جایی که ما را شکست داد.
آزمون ساده: چیزی که یک داوطلب واقعاً میگیرد
هشتاد و شش درصد در برابر شصتویک و پنجاهوشش. روی 36 نوشته، این یعنی نُه نمره درست بیشتر از Opus 5 و یازده نمره بیشتر از Sonnet 5. به بیان دیگر، Prepamigo روی همان نوشتهها 64% اشتباه نمرهدهی کمتر از Opus 5 و 69% کمتر از Sonnet 5 دارد.
اینکه به Claude چه داده شد مهم است، پس اینجا میآوریم. به هر مدل گفته شد که یک ممتحن باتجربه رایتینگ CELPIP است، تسک دقیقاً همانطور که داوطلب دیده بود به آن داده شد، شامل نکتههای الزامی تسک ایمیل و گزینههای تسک نظرسنجی، و نوشته به آن داده شد. از آن یک نمره از 0 تا 12 خواسته شد. کل دستور همین است. همان چیزی است که در یک پنجره چت تایپ میکنید، و آزمونی منصفانهتر از یک خط «این را نمره بده» است، چون مدل دستکم میداند تسک چه خواسته است.
نمرهدهنده Prepamigo همان تسک و همان نوشته را دریافت کرد. همچنین چیزی را داشت که همیشه در محیط عملیاتی دارد: نمونههای واقعیِ نمرهدادهشده برای همان تسک در هر سطح تا با آنها مقایسه کند، و یک لایه قواعد که چیزهایی را بررسی میکند که یک ارزیاب اول از همه بررسی میکند، مثل اینکه آیا همه نکتههای الزامی حاضرند، آیا پاسخ نظرسنجی واقعاً یک طرف را انتخاب میکند، آیا ایمیل سلام و خداحافظی دارد، و طول پاسخ چقدر است.
جایی که فاصله باز میشود: سطحبهسطح
یک رقم کلی پنهان میکند که خطاها کجا میافتند، و در رایتینگ خطاها در یک جا میافتند. اینجا همان نتایج به تفکیک سطح تأییدشده آمده است: نوشتههای ضعیف با نمره 4 یا 5، نوشتههای میانی با نمره 7 یا 8، و نوشتههای قوی با نمره 10 و بالاتر.
نوشتههای ضعیف (نمره تأییدشده 4 یا 5)
12 نوشته رسمی. خطاهای Claude در اینجا بیشتر نمره 3 است، یک سطح پایینتر.
75%
نمرهدهنده رایتینگ Prepamigo
67%
Claude Opus 5
50%
Claude Sonnet 5
در نوشتههای ضعیف، Prepamigo روی 75% است، Opus 5 روی 67%، Sonnet 5 روی 50%. هر سه خطای Prepamigo یک پله بالاتر رفتند، به 6 یا 7، در نوشتههایی که کوتاه اما مرتب بودند. خطاهای Claude در جهت مخالف میروند: Sonnet 5 به چهار تا از دوازده نوشته ضعیف نمره 3 داد، و Opus 5 به دو تای آنها نمره 3 داد. نمره 3 در این مقیاس پاسخی است که بهسختی با تسک درگیر میشود. این نوشتهها با آن درگیر میشوند؛ فقط کممایهاند. Claude، بدون هیچ نمونهای از اینکه یک 4 چه شکلی است، کممایه را مردود میخواند.
نوشتههای میانی (نمره تأییدشده 7 یا 8)
12 نوشته رسمی. این سطحی است که بیشتر داوطلبان در آن هستند، و سطحی است که Claude در آن شکست میخورد.
100%
نمرهدهنده رایتینگ Prepamigo
33%
Claude Sonnet 5
25%
Claude Opus 5
میانه، تمام ماجراست. Prepamigo هر دوازده نوشته سطح میانی را داخل باند 7 تا 8 نمره داد. Opus 5 سه تای آنها را درست گرفت؛ Sonnet 5 چهار تا. خطاهای Opus 5 تقریباً همه رو به بالا بودند: به شش تا از دوازده نوشته 9 داد و به یکی 10. Sonnet 5 به هر دو سو رفت، چهار نوشته را به 6 پایین کشید و چهار تا را به 9 یا 10 بالا برد.
به این فکر کنید که این برای داوطلبی که یکی از آن نوشتهها را نوشته چه معنایی دارد. 7 یا 8 رایجترین نمره واقعی در آزمون است، و همان نمرهای است که تعیین میکند به هدف مهاجرتیتان رسیدهاید یا نه. از Opus 5 بپرسید، و بیش از نیمی از مواقع به شما میگوید که 9 یا 10 هستید و آمادهاید تمرین را کنار بگذارید. نیستید. از Sonnet 5 بپرسید، و از هر سه بار یک بار به شما میگوید که به 6 سقوط کردهاید. نکردهاید. هیچکدام از این دو پاسخ به شما کمک نمیکند تصمیم بگیرید بعدش چه کنید.
نوشتههای قوی (نمره تأییدشده 10 یا بالاتر)
12 نوشته رسمی. تنها سطحی که Claude Opus 5 در آن Prepamigo را شکست میدهد.
92%
Claude Opus 5
83%
نمرهدهنده رایتینگ Prepamigo
83%
Claude Sonnet 5
در بالا، Opus 5 بهترین ارزیاب این آزمون است: یازده نوشته قوی از دوازده را شناسایی کرد. Prepamigo و Sonnet 5 هرکدام ده تا را شناسایی کردند. هر دو خطای Prepamigo نمره 9 بودند، یک پله پایینتر؛ خطاهای Sonnet 5 یک 9 و یک 7 بودند. این را گزارش میکنیم چون واقعیت دارد، و چون الگوی کلی را توضیح میدهد: Claude دستودلباز است. 9 و 10 و 11 را سخاوتمندانه میبخشد، که اتفاقاً در نوشتههای قوی درست از آب درمیآید و در همهچیز دیگر اشتباه.
چرا یک چتبات وسط مقیاس را از دست میدهد
یک نوشته سطح میانی CELPIP چیز مشخصی است. تسک را پوشش میدهد، منظم است، خطاهای کمی دارد که مانع فهم شوند، و در عین حال کلیگوست: دلیلها ادعا میشوند نه پرورده، واژگان محتاطانه است، جملهها همه یک شکل دارند. ارزیابی که صدها نمونه از اینها را دیده دقیقاً میداند کجا قرار میگیرد. یک مدل عمومی صدها نمونه از اینها را با برچسب 7 ندیده است. یک نوشته تمیز، منظم و عمدتاً درست دیده، و دستش بهسمت عدد بالا میرود.
کل تفاوت همین است. نمرهدهنده Prepamigo نوشته را در برابر یک تصور از نوشتن خوب نمیسنجد. آن را در برابر نوشتههای واقعیِ نمرهدادهشده برای همان تسک میسنجد: یکی در سطح ضعیف، یکی در میانه، یکی در بالا، همهشان پاسخهای واقعی با لغزشهای واقعی. یک نوشته تمیز اما کلیگو کنار نمونه میانی مینشیند چون بیش از همه به آن شبیه است. یک نوشته کممایه کنار نمونه ضعیف مینشیند نه پایینتر از آن، چون نمونه ضعیف هم کممایه است و با این حال یک 4 است.
روی این مقایسه، یک لایه قواعد قرار دارد که چیزهایی را که مدل در شمردنشان ضعیف است مدیریت میکند. آیا ایمیل هر سه نکته الزامی را پوشش داد، یا فقط دو تا را؟ آیا پاسخ نظرسنجی واقعاً یک گزینه را انتخاب کرد، یا بین آنها دودل ماند؟ آیا سلام و خداحافظی هست؟ آیا پاسخ 180 کلمه است یا 60؟ یک نکته الزامی جاافتاده، نمره انجام تسک را در 8 یا پایینتر نگه میدارد، هرقدر هم انگلیسی خوب باشد، چون آزمون اینطور کار میکند. Claude، وقتی ساده پرسیده شود، چنین کف یا سقفی ندارد؛ همهچیز را با برداشت تصمیم میگیرد.
آزمودیم که آیا گفتن سطحها به Claude این را درست میکند. بهتنهایی، نه. دادن یک روبریک به مدل همان انحراف را تولید میکند. چیزی که عدد را جابهجا میکند، دادن نمونههای واقعیِ نمرهدادهشده و یک لایه قواعد است، که به بیان دیگر یعنی: ساختن یک نمرهدهنده.
فاصله روند کار: چه چیزی را باید خودتان بیاورید
رایتینگ مهارتی است که در آن استفاده از Claude بهعنوان ارزیاب از همه آسانتر است، و ارزش دارد در این باره صادق باشیم. نوشته را میچسبانید، در چند ثانیه نمره میگیرید، و اگر بخواهید خودش را توضیح دهد، این کار را میکند، بهتفصیل. مرحله پیادهسازی نیست، صدایی نیست، تنظیماتی نیست. برای یک نظر دوم سریع، واقعاً راحت است.
چیزی که نمیگیرید، تسک است. Claude بانکی از دستورهای ایمیل و نظرسنجی به سبک CELPIP با نکتههای الزامی، گزینهها و تعداد کلمات درست ندارد، پس یا خودتان دستور مینویسید و امیدوارید شبیه آزمون باشد، یا روی هر چیزی که پیدا کنید تمرین میکنید. بررسی نکتههای الزامی نمیگیرید، چون Claude نمیداند آزمون واقعی کدام نکتهها را فهرست میکند. پاسخ نمونهای که از نوشته خودتان با طول درست بازنویسی شده باشد نمیگیرید. و عددی که در برابر نوشتههای واقعیِ نمرهدادهشده کالیبره شده باشد نمیگیرید، که به همین دلیل وسط مقیاس خراب میشود.
در Prepamigo، یک تسک از بانک باز میکنید، تایمر اجرا میشود، مینویسید، و حدود یک دقیقه بعد از ارسال، چهار نمره بُعدی، یک نمره کلی، فهرستی از هر چیزی که از قلم انداختهاید، اصلاحهایی که از متن خودتان نقل شدهاند، و یک پاسخ نمونه بازنویسیشده دارید. چهلمین نوشته ماه همان تلاشی را از شما میگیرد که نوشته اول.
همان نوشته، همان نمره
نمرهای که نتوانید تکرار کنید، یک اندازهگیری نیست. اگر همان نوشته امروز 8 بگیرد و فردا 10، چیزی درباره رایتینگ خودتان یاد نگرفتهاید. پس بعد از اجرای اصلی، هر 36 نوشته را دو بار دیگر در روزهای متفاوت نمره دادیم. نمرهدهنده رایتینگ Prepamigo در سه اجرا 86%، 89% و 86% گرفت، و هر بار همان دوازده نوشته سطح میانی داخل باند بودند.
اجراهای Claude هم جابهجا شدند، اما شکل خطاهایش نه: در هر اجرا، بیشتر نوشتههای سطح میانی از Opus 5 با نمره 9 برگشتند، و نوشتههای ضعیف همچنان از Sonnet 5 نمره 3 جمع میکردند. همین ثبات، یافته مفید است. مشکل این نیست که Claude پرنوسان است. مشکل این است که Claude هر بار با اطمینان و در همان جهت بدکالیبره است، که متوجه شدنش سختتر است.
بازخورد: توضیحی خوب برای عددی اشتباه
Claude متن بازخورد عالی مینویسد. روشن، صبور و مشخص است، و اگر از آن بخواهید توضیح دهد چرا یک نوشته 9 است، پاراگرافی قانعکننده تولید میکند. مشکل این است که آن پاراگراف برای توجیه عددی نوشته میشود که از قبل انتخاب کرده، و وقتی عدد اشتباه باشد، توضیح هم با آن اشتباه است. نوشتهای که واقعاً 7 است بهخاطر ویژگیهایی که ندارد ستایش میشود، و داوطلب با خیال راحت میرود.
بازخورد Prepamigo از سر دیگر کار میکند. هر اصلاح دقیقاً کلمات نوشته شما را نقل میکند، و هر چیزی که بررسیکننده نتواند در متن شما پیدا کند پیش از آنکه ببینید حذف میشود. نکته الزامی جاافتاده نام برده میشود. هر بُعد یک عامل محدودکننده میگیرد، یا یک جمله ساده که هیچ چیزی مانع آن نیست. و یک پاسخ نمونه میگیرید که از پاسخ خودتان با طولی که تسک میخواهد بازنویسی شده، تا فاصله را ببینید نه اینکه دربارهاش بخوانید. بخش زیر فهرست میکند در لایه بازخورد چه چیزی تغییر کرده.
چه چیزی در بازخورد رایتینگ شما تازه است
نمره فقط نیمی از چیزی است که دریافت میکنید. لایه بازخورد رایتینگ همراه با نمرهدهنده از نو ساخته شده، و همهچیز در آن به متن خود شما گره خورده است. اینها چیزهایی است که تغییر کرده.
- اصلاحهایی که میتوانید در نوشته خودتان پیدا کنید. هر اصلاح گرامری، املایی و واژگانی دقیقاً همان کلمات پاسخ شما را نقل میکند، تا اپ بتواند آنها را همانجا که نوشتهاید برجسته کند. هر چیزی که بررسیکننده نتواند کلمهبهکلمه در نوشته شما پیدا کند، پیش از آنکه ببینید حذف میشود.
- یک پاسخ نمونه، ساختهشده از پاسخ خودتان. نسخهای بازنویسیشده از پاسخ خودتان دریافت میکنید که ایدههای شما را حفظ میکند، همه نکتههای الزامی را پوشش میدهد و در بازه 150 تا 200 کلمهای که تسک میخواهد قرار میگیرد. اگر بازنویسی اول به این طول نرسد، پیش از نمایش یک بار دیگر انجام میشود.
- نکته الزامیای که از قلم انداختید، با نام. برای تسک ایمیل، بازخورد نکتههایی از صورت سؤال را که پاسخ شما پوشش نداده فهرست میکند. یک نکته جاافتاده همچنین نمره انجام تسک را در 8 یا پایینتر نگه میدارد، بنابراین عدد و بازخورد هرگز با هم ناسازگار نمیشوند.
- یک عامل محدودکننده برای هر بُعد. برای هر یک از چهار بُعد، بازخورد آن یک چیزی را که نمره را پایین نگه داشته، بهطور مشخص نام میبرد، یا بهصراحت میگوید هیچ چیزی مانع نیست و چه چیزی آن نمره را بالا نگه داشته است. اینکه تصمیم گرفته شود یک بُعد مشکلی ندارد، خودش یک پاسخ واقعی است، نه یک جای خالی.
- انتقاد در جای درست. لحن ضعیف مشکلِ انجام تسک است، انتخاب واژه مبهم مشکلِ واژگان است، جمله بیپایان مشکلِ خوانایی است. هر نکته زیر همان بُعدی ثبت میشود که به آن تعلق دارد، بهجای اینکه همه در خلاصه کلی روی هم ریخته شوند.
- بازنویسی در سطح جمله. جملههای مشخصی از نوشته شما با یک نسخه بهبودیافته و یک خط توضیح درباره اینکه چرا بهتر است برمیگردند، تا تغییر را ببینید نه اینکه فقط دربارهاش بخوانید.
- قویترین و ضعیفترین بُعد شما، کنار هم. بازخورد به شما میگوید کدام یک از چهار بُعد نمره شما را بالا نگه داشته و کدام آن را پایین میکشد، تا بدون رمزگشایی چهار عدد بدانید بعد از این چه چیزی را تمرین کنید.
هر نقلقول در بازخورد پیش از نمایش با نوشته شما مطابقت داده میشود. اگر بررسیکننده نتواند آن کلمات را پیدا کند، آن خط حذف میشود. به همین دلیل بازخورد هرگز از شما نمیخواهد چیزی را اصلاح کنید که ننوشتهاید.
هزینه تمرین روزانه
یک نمره رایتینگ بیشترین سود را در سیامین نوشته شما دارد، نه سومین. آنجاست که شروع میکند به شما بگوید آیا تغییری در نحوه نوشتنتان کار میکند یا نه. پس سؤال عملی این است که استفاده حجیم از هر گزینه چقدر هزینه دارد.
Claude Pro ماهانه US$20 است، حدود CA$28، یا US$17 در ماه با صورتحساب سالانه، همانطور که در سپتامبر 2026 در claude.com منتشر شده، با یک بازه استفاده پنجساعته چرخشی و یک سقف هفتگی. طرحهای Max، از US$100 در ماه، حدود CA$138 پیش از مالیات، آن محدودیتها را بالا میبرند اما حذفشان نمیکنند. هیچکدام از طرحها بانک تسک، تایمر، بررسی نکتههای الزامی، پاسخ نمونه، یا نمرهای کالیبرهشده در برابر نوشتههای واقعیِ نمرهدادهشده ندارند.
Prepamigo ماهانه CA$24.98 است، یا CA$8.25 در ماه در طرح سالانه، که CA$98.98 برای سال است، شامل مالیات، و میتوانید هر زمان لغو کنید. هر طرح شامل نمرهدهی نامحدود بدون سقف روزانه، جلسهای یا هفتگی، تلاشهای نامحدود، و بانک کامل سوال است: 80 مجموعه تمرینی کامل و بیش از 2,000 تمرین در Writing، Speaking، Reading و Listening، نوشتهشده برای پیروی از انواع تسک، زمانبندی و قالب آزمون CELPIP General.
وقتی Claude ابزار بهتری است
- صیقل دادن یک نوشته قوی. اگر همین حالا در 10 هستید و میخواهید بدانید 11 یا 12 چه میخواهد، Opus 5 نوشتن قوی را بهطور قابلاعتماد تشخیص میدهد و خوب توضیح میدهد. این همان یک سطحی است که ما را شکست داد.
- بازنویسی یک جمله به پنج شکل. خواستن جایگزین برای یک جمله ناشیانه سریع است و پیشنهادها خوباند.
- گفتگو دربارهاش. اگر میخواهید درباره اینکه چرا یک دلیل ضعیف است بحث کنید، گفتگو شکل درستی دارد. Prepamigo به شما حکم و شواهد میدهد؛ گفتگو نمیکند.
- هرچیز خارج از آزمون. Claude یک دستیار عمومی است و Prepamigo نیست.
چیزی که Claude، بر اساس این شواهد، نباید باشد، همان چیزی است که به نویسندهای در سطح 7 یا 8 بگوید کجا ایستاده است. این یعنی بیشتر داوطلبان، و دقیقاً همانجایی است که Claude از هر چهار بار سه بار اشتباه میکند.
سوالات متداول
آیا Claude میتواند رایتینگ CELPIP من را نمره بدهد؟ یک عدد به شما میدهد. روی 36 پاسخ رسمی با نمرههای تأییدشده، Claude Opus 5 در 61% مواقع و Claude Sonnet 5 در 56% مواقع درست بود، در برابر 86% برای Prepamigo. در نوشتههای سطح میانی: 25% و 33% در برابر 100%.
آیا Prepamigo برای رایتینگ از Claude دقیقتر است؟ در مجموع، بله، با 25 تا 30 واحد اختلاف. در نوشتههای قوی Opus 5 بهتر است، 92% در برابر 83%. در نوشتههای سطح میانی، جایی که بیشتر داوطلبان هستند، فاصله 100% در برابر 25% است.
چرا Claude به نوشته متوسط من 9 میدهد؟ بدون چیزی برای مقایسه، یک نوشته تمیز، منظم و کلیگو قوی خوانده میشود. Opus 5 به هفت تا از دوازده نوشته تأییدشده 7 تا 8 نمره 9 یا 10 داد. Prepamigo هر نوشته را با نمونههای واقعیِ نمرهدادهشده برای همان تسک مقایسه میکند.
هزینه هرکدام چقدر است؟ Claude Max از US$100 در ماه شروع میشود، حدود CA$138 پیش از مالیات؛ Pro با US$20 محدودیتهای سختتری دارد. Prepamigo ماهانه CA$24.98 با مالیات، یا CA$8.25 در ماه در طرح سالانه، با نمرهدهی نامحدود و 80 مجموعه تمرینی است.
برای همین مقایسه در برابر ChatGPT، بخوانید Prepamigo در برابر ChatGPT برای رایتینگ. برای دیدن اینکه نمرهدهنده رایتینگ چگونه کار میکند، بخوانید درون نمرهدهنده رایتینگ Prepamigo. یا نوشتن پاسخ کنید و نمره را ببینید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.
