سهم نوشتههایی که در سطح تأییدشده نمره گرفتند
36 پاسخ رسمی رایتینگ CELPIP، 12 پاسخ در هر یک از سه سطح، در هر دو تسک رایتینگ. به هر مدل GPT تسک و نوشته داده شد و از آن خواسته شد با کلماتی ساده آن را در مقیاس CELPIP نمره بدهد. نمرهدهنده رایتینگ Prepamigo در پیکربندی عادی عملیاتی خودش اجرا شد.
86%
نمرهدهنده رایتینگ Prepamigo
78%
GPT 5.6 sol
69%
GPT 5.6 luna
58%
GPT-4o mini
مقایسه Prepamigo با پرطرفدارترین طرحهای چتبات
بر اساس دلار کانادا. قیمتهای Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شدهاند. دقت، سهم 36 نوشته رسمی است که وقتی از مدل نامبرده با کلماتی ساده درخواست امتیازدهی به نوشته میشود، در سطح تأییدشده امتیاز میگیرند؛ یک اجرا.
ChatGPT احتمالاً رایجترین ابزاری است که داوطلبان CELPIP برای بررسی رایتینگ خود استفاده میکنند. ایمیل را میچسبانید، نمره میخواهید، یک عدد و یک پاراگراف میگیرید. سریع است، روی گوشیتان است، و برای رایتینگ هیچ مرحله پیادهسازیای سر راه نیست. پس ما آن عدد را آزمودیم. همان 36 پاسخ رسمی رایتینگ CELPIP را که نمرهدهنده خودمان با آنها سنجیده میشود، دوازده تا در هر سطح، به سه مدل GPT دادیم و از آنها خواستیم همانطور که یک داوطلب میپرسد، به نوشتهها نمره بدهند.
پاسخ کوتاه: نمرهدهنده رایتینگ Prepamigo در 86% مواقع به سطح تأییدشده رسید. GPT 5.6 sol، مدلی که پشت طرحهای پولی ChatGPT است، در 78% مواقع به آن رسید. GPT 5.6 luna به 69% و GPT-4o mini به 58% رسیدند. هشت واحد یک فاصله واقعی است، و از دو جا میآید: وسط مقیاس، جایی که Prepamigo هر دوازده نوشته را درست نمره داد و GPT 5.6 sol نُه تا را، و بالای مقیاس، جایی که GPT 5.6 sol یکچهارم نوشتههای قوی را در 9 نگه داشت.
باید همین اول بگوییم که GPT 5.6 sol بهترین ارزیاب عمومی رایتینگ است که آزمودهایم، بسیار جلوتر از هر مدل Claude روی همان نوشتهها. باقی این مقاله نتایج را سطحبهسطح مرور میکند، توضیح میدهد آن هشت واحد از کجا میآید، بازخورد هر طرف را بررسی میکند، و مقایسه میکند تمرین جدی رایتینگ با هرکدام چقدر هزینه دارد.
آزمون ساده: چیزی که یک داوطلب واقعاً میگیرد
هشتاد و شش درصد در برابر هفتادوهشت. روی 36 نوشته، این یعنی سه نمره درست بیشتر برای Prepamigo نسبت به GPT 5.6 sol، شش تا بیشتر از GPT 5.6 luna، و ده تا بیشتر از GPT-4o mini. به بیان دیگر، Prepamigo نسبت به GPT 5.6 sol 37% اشتباه نمرهدهی کمتر، نسبت به luna 55% کمتر و نسبت به GPT-4o mini 67% کمتر دارد.
اینکه به مدلهای GPT چه داده شد مهم است. به هرکدام گفته شد که یک ممتحن باتجربه رایتینگ CELPIP است، تسک دقیقاً همانطور که داوطلب دیده بود به آن داده شد، شامل نکتههای الزامی تسک ایمیل و گزینههای تسک نظرسنجی، و نوشته به آن داده شد. از آن یک نمره از 0 تا 12 خواسته شد. این همان چیزی است که در ChatGPT تایپ میکنید، و آزمونی منصفانهتر از یک «این را نمره بده» خالی است، چون مدل دستکم میداند تسک چه خواسته است.
نمرهدهنده Prepamigo همان تسک و همان نوشته را دریافت کرد، بهعلاوه چیزی که همیشه در محیط عملیاتی دارد: نمونههای واقعیِ نمرهدادهشده برای همان تسک در هر سطح تا با آنها مقایسه کند، و یک لایه قواعد که چیزهایی را بررسی میکند که یک ارزیاب اول از همه بررسی میکند، مثل اینکه آیا همه نکتههای الزامی پوشش داده شدهاند، آیا پاسخ نظرسنجی واقعاً یک طرف را انتخاب میکند، آیا ایمیل سلام و خداحافظی دارد، و آیا طول پاسخ اصلاً نزدیک به چیزی هست که تسک میخواهد.
آن هشت واحد از کجا میآید: سطحبهسطح
نوشتههای ضعیف (نمره تأییدشده 4 یا 5)
12 نوشته رسمی. تنها سطحی که مدلهای GPT در آن اندکی جلو میافتند.
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
نمرهدهنده رایتینگ Prepamigo
در نوشتههای ضعیف، هر سه مدل GPT روی 83% هستند و Prepamigo روی 75%. این تنها سطحی است که ChatGPT در آن جلوتر است، و ما آن را همینطور گزارش میکنیم. هر سه خطای Prepamigo یک پله بالاتر رفتند، به 6 یا 7، در نوشتههایی که کوتاه اما مرتب بودند. هر دو خطای GPT 5.6 sol نمره 6 بودند. نوشتههای ضعیف انتهای آسان مقیاس برای یک چتباتاند: نوشتنِ کوتاه، کلیگو و پرخطا به چشم هر کسی ضعیف میآید.
نوشتههای میانی (نمره تأییدشده 7 یا 8)
12 نوشته رسمی. سطحی که بیشتر داوطلبان در آن هستند.
100%
نمرهدهنده رایتینگ Prepamigo
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
در میانه، Prepamigo هر دوازده نوشته را داخل باند 7 تا 8 نمره داد. GPT 5.6 sol نُه تا را درست گرفت؛ هر سه خطایش نمره 6 بودند، یک پله پایینتر. GPT 5.6 luna هفت تا را درست گرفت، سه نوشته را به 6 و یکی را به 5 پایین کشید و یکی را به 9 بالا برد. GPT-4o mini هشت تا را درست گرفت و چهار تای دیگر را به 9 بالا برد.
7 یا 8 رایجترین نمره واقعی در آزمون است، و همان نمرهای است که تعیین میکند داوطلب به هدفش رسیده یا نه. GPT 5.6 sol از هر چهار داوطلبِ اینچنینی به یکی میگوید که به 6 سقوط کرده است. Luna به چهار نفر از هر ده نفر. هیچکدام به آن شکلی که نتایج باند میانی Claude فاجعه است، فاجعه نیستند، اما این تفاوتِ میان نمره تمرینیای است که میتوانید بر اساسش برنامه بریزید و نمرهای که باید به آن شک کنید.
نوشتههای قوی (نمره تأییدشده 10 یا بالاتر)
12 نوشته رسمی. خطاها در اینجا نمره 9 هستند: نوشته قوی بود و ارزیاب دست نگه داشت.
83%
نمرهدهنده رایتینگ Prepamigo
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
در بالا، Prepamigo ده تا از دوازده نوشته قوی را شناسایی کرد، GPT 5.6 sol نُه تا، luna هشت تا، و GPT-4o mini سه تا. هر خطا بهجز یکی نمره 9 بود. GPT-4o mini به نُه تا از دوازده نوشته قوی 9 داد: بهسادگی 10 نمیدهد. اگر رایتینگ شما قوی است و آن را با نسخه رایگان ChatGPT بررسی میکنید، که هنوز بخش زیادی از ترافیک را به مدلهای کوچک میفرستد، تقریباً هر بار به شما گفته میشود که 9 هستید.
چرا یک چتبات در میانه و در بالا میلغزد
یک نوشته سطح میانی CELPIP تسک را پوشش میدهد، منظم است، و در عین حال کلیگوست: دلیلها ادعا میشوند نه پرورده، واژگان محتاطانه، جملهها همه یک شکل. یک نوشته قوی بینقص نیست؛ یکی دو لغزش دارد، و یک جمله ساده میان جملههای پرورده. مدلی که هیچ نمونه نمرهدادهشدهای برای مقایسه ندارد، باید از روی برداشت تصمیم بگیرد. برداشت GPT 5.6 sol کمی سختگیرانه است: 7 کلیگو به چشمش 6 میآید، 10 قویبایکلغزش به چشمش 9. Luna باز هم سختگیرتر است. GPT-4o mini با 9 مثل سقف رفتار میکند.
نمرهدهنده Prepamigo نوشته را در برابر یک تصور از نوشتن خوب نمیسنجد. آن را با نوشتههای واقعیِ نمرهدادهشده برای همان تسک مقایسه میکند، یکی در هر سطح، همهشان پاسخهای واقعی با لغزشهای واقعی. یک نوشته کلیگو اما کامل کنار نمونه میانی مینشیند چون به آن شبیه است. یک نوشته قوی با یک جمله ناشیانه کنار نمونه قوی مینشیند، که آن هم یکی دارد. روی این مقایسه، یک لایه قواعد برای چیزهایی قرار دارد که مدل در شمردنشان ضعیف است: آیا همه نکتههای الزامی حاضرند، آیا پاسخ نظرسنجی یک طرف را انتخاب کرده، آیا ایمیل سلام و خداحافظی دارد، و طولش چقدر است. یک نکته الزامی جاافتاده، نمره انجام تسک را صرفنظر از انگلیسی در 8 یا پایینتر نگه میدارد، چون آزمون اینطور کار میکند.
فاصله روند کار: چه چیزی را باید خودتان بیاورید
برای رایتینگ، استفاده از ChatGPT بهعنوان ارزیاب آسان است، و ما وانمود نمیکنیم غیر از این است. نوشته را میچسبانید، عدد میگیرید، توضیح میخواهید. نه ضبطی، نه متن پیادهشدهای. برای یک نظر دوم سریع روی یک نوشته، راحت است و با GPT 5.6 sol، نسبتاً دقیق.
چیزی که نمیگیرید، تسک است. ChatGPT اگر بخواهید میتواند یک دستور به سبک CELPIP بسازد، اما درباره نکتههای الزامی، گزینههای نظرسنجی و تعداد کلماتی که آزمون واقعی استفاده میکند حدس میزند. بررسی نکتههای الزامی نمیگیرید، چون نمیداند آزمون واقعی کدام نکتهها را فهرست میکند. پاسخ نمونهای که از نوشته خودتان با طول درست بازنویسی شده باشد نمیگیرید. و هر نوشتهای که میچسبانید از سهمیه پیامهایتان کم میکند.
در Prepamigo، یک تسک از بانک باز میکنید، تایمر اجرا میشود، مینویسید، و حدود یک دقیقه بعد از ارسال، چهار نمره بُعدی، یک نمره کلی، فهرستی از هر چیزی که از قلم انداختهاید، اصلاحهایی که از متن خودتان نقل شدهاند، و یک پاسخ نمونه بازنویسیشده دارید. چهلمین نوشته ماه همان تلاشی را از شما میگیرد که نوشته اول.
همان نوشته، همان نمره
بعد از اجرای اصلی، هر 36 نوشته را دو بار دیگر در روزهای متفاوت نمره دادیم. نمرهدهنده رایتینگ Prepamigo در سه اجرا 86%، 89% و 86% گرفت، و هر بار همان دوازده نوشته سطح میانی داخل باند بودند. GPT 5.6 sol 78%، 83% و 81% گرفت: در اجرای دوم و سوم بهتر، و یادآوری اینکه یک پاسخ تکی چتبات چند واحد شانس در هر دو جهت با خود دارد. اگر واقعاً با ChatGPT نمره میگیرید، دو بار بپرسید و پاسخ پایینتر را نگه دارید.
بازخورد: توضیح در برابر شواهد
ChatGPT خوب توضیح میدهد. بپرسید چرا یک نوشته 6 است و به انگلیسی روشن، همراه با پیشنهاد، به شما میگوید. گیر کار این است که توضیح برای توجیه عددی نوشته میشود که از قبل انتخاب شده، پس وقتی عدد یک پله پایین باشد، توضیح هم عیبهایی متناسب با آن پیدا میکند. داوطلبی که واقعاً در 7 بود، یک صفحه درباره ضعفهایی میخواند که تعیینکننده نبودند.
بازخورد Prepamigo از متن به بالا کار میکند. هر اصلاح دقیقاً کلمات نوشته شما را نقل میکند، و هر چیزی که بررسیکننده نتواند در متن شما پیدا کند پیش از آنکه ببینید حذف میشود. نکته الزامی جاافتاده نام برده میشود. هر بُعد یک عامل محدودکننده میگیرد، یا یک جمله ساده که هیچ چیزی مانع آن نیست. و یک پاسخ نمونه میگیرید که از پاسخ خودتان با طولی که تسک میخواهد بازنویسی شده. بخش زیر فهرست میکند چه چیزی تغییر کرده.
چه چیزی در بازخورد رایتینگ شما تازه است
نمره فقط نیمی از چیزی است که دریافت میکنید. لایه بازخورد رایتینگ همراه با نمرهدهنده از نو ساخته شده، و همهچیز در آن به متن خود شما گره خورده است. اینها چیزهایی است که تغییر کرده.
- اصلاحهایی که میتوانید در نوشته خودتان پیدا کنید. هر اصلاح گرامری، املایی و واژگانی دقیقاً همان کلمات پاسخ شما را نقل میکند، تا اپ بتواند آنها را همانجا که نوشتهاید برجسته کند. هر چیزی که بررسیکننده نتواند کلمهبهکلمه در نوشته شما پیدا کند، پیش از آنکه ببینید حذف میشود.
- یک پاسخ نمونه، ساختهشده از پاسخ خودتان. نسخهای بازنویسیشده از پاسخ خودتان دریافت میکنید که ایدههای شما را حفظ میکند، همه نکتههای الزامی را پوشش میدهد و در بازه 150 تا 200 کلمهای که تسک میخواهد قرار میگیرد. اگر بازنویسی اول به این طول نرسد، پیش از نمایش یک بار دیگر انجام میشود.
- نکته الزامیای که از قلم انداختید، با نام. برای تسک ایمیل، بازخورد نکتههایی از صورت سؤال را که پاسخ شما پوشش نداده فهرست میکند. یک نکته جاافتاده همچنین نمره انجام تسک را در 8 یا پایینتر نگه میدارد، بنابراین عدد و بازخورد هرگز با هم ناسازگار نمیشوند.
- یک عامل محدودکننده برای هر بُعد. برای هر یک از چهار بُعد، بازخورد آن یک چیزی را که نمره را پایین نگه داشته، بهطور مشخص نام میبرد، یا بهصراحت میگوید هیچ چیزی مانع نیست و چه چیزی آن نمره را بالا نگه داشته است. اینکه تصمیم گرفته شود یک بُعد مشکلی ندارد، خودش یک پاسخ واقعی است، نه یک جای خالی.
- انتقاد در جای درست. لحن ضعیف مشکلِ انجام تسک است، انتخاب واژه مبهم مشکلِ واژگان است، جمله بیپایان مشکلِ خوانایی است. هر نکته زیر همان بُعدی ثبت میشود که به آن تعلق دارد، بهجای اینکه همه در خلاصه کلی روی هم ریخته شوند.
- بازنویسی در سطح جمله. جملههای مشخصی از نوشته شما با یک نسخه بهبودیافته و یک خط توضیح درباره اینکه چرا بهتر است برمیگردند، تا تغییر را ببینید نه اینکه فقط دربارهاش بخوانید.
- قویترین و ضعیفترین بُعد شما، کنار هم. بازخورد به شما میگوید کدام یک از چهار بُعد نمره شما را بالا نگه داشته و کدام آن را پایین میکشد، تا بدون رمزگشایی چهار عدد بدانید بعد از این چه چیزی را تمرین کنید.
هر نقلقول در بازخورد پیش از نمایش با نوشته شما مطابقت داده میشود. اگر بررسیکننده نتواند آن کلمات را پیدا کند، آن خط حذف میشود. به همین دلیل بازخورد هرگز از شما نمیخواهد چیزی را اصلاح کنید که ننوشتهاید.
هزینه تمرین روزانه
ChatGPT Plus ماهانه US$20 است، حدود CA$28، با صورتحساب ماهانه، همانطور که در سپتامبر 2026 منتشر شده، با سقف پیام در هر بازه چرخشی؛ ChatGPT Pro، با US$200 در ماه، حدود CA$276 پیش از مالیات، آن سقف را بالا میبرد. نسخه رایگان بخش زیادی از ترافیک خود را به مدلهای کوچکتر میفرستد، و در این آزمون کوچکترینِ آنها از دوازده نوشته قوی سه تا را شناسایی کرد. هیچکدام از طرحها بانک تسک، تایمر، بررسی نکتههای الزامی، پاسخ نمونه، یا نمرهای کالیبرهشده در برابر نوشتههای واقعیِ نمرهدادهشده ندارند.
Prepamigo ماهانه CA$24.98 است، یا CA$8.25 در ماه در طرح سالانه، که CA$98.98 برای سال است، شامل مالیات، و میتوانید هر زمان لغو کنید. هر طرح شامل نمرهدهی نامحدود بدون سقف روزانه، جلسهای یا هفتگی، تلاشهای نامحدود، و بانک کامل سوال است: 80 مجموعه تمرینی کامل و بیش از 2,000 تمرین در Writing، Speaking، Reading و Listening، نوشتهشده برای پیروی از انواع تسک، زمانبندی و قالب آزمون CELPIP General.
وقتی ChatGPT ابزار بهتری است
- یک نظر دوم سریع روی یک نوشته. GPT 5.6 sol ارزیاب قابلقبولی است و ده ثانیه وقت میگیرد. اگر تسک را از قبل دارید و فقط یک دیدگاه دیگر میخواهید، مناسب است.
- بازنویسی یک جمله به پنج شکل. خواستن جایگزین برای یک جمله ناشیانه سریع است و پیشنهادها خوباند.
- گفتگو دربارهاش. اگر میخواهید درباره اینکه چرا یک دلیل ضعیف است بحث کنید، گفتگو شکل درستی دارد. Prepamigo به شما حکم و شواهد میدهد؛ گفتگو نمیکند.
- هرچیز خارج از آزمون. ChatGPT یک دستیار عمومی است و Prepamigo نیست.
چیزی که نباید باشد، تنها چیزی است که به نویسندهای در سطح 7 یا 8 میگوید کجا ایستاده است، یا چیزی که به یک نویسنده قوی میگوید 9 است. این دو جایی هستند که بیش از همه در آنها اشتباه میکند.
سوالات متداول
آیا ChatGPT میتواند رایتینگ CELPIP من را نمره بدهد؟ بله، و بهتر از بیشتر چتباتها: GPT 5.6 sol روی 36 پاسخ رسمی در 78% مواقع درست بود، luna در 69%، GPT-4o mini در 58%، در برابر 86% برای Prepamigo.
آیا Prepamigo برای رایتینگ از ChatGPT دقیقتر است؟ با هشت واحد اختلاف در برابر بهترین مدل GPT. نوشتههای سطح میانی 100% در برابر 75%؛ نوشتههای قوی 83% در برابر 75%؛ نوشتههای ضعیف 75% در برابر 83%.
کدام مدل GPT را باید استفاده کنم؟ GPT 5.6 sol. نه GPT-4o mini، که به نُه تا از دوازده نوشته قوی نمره 9 داد.
هزینه هرکدام چقدر است؟ ChatGPT Pro ماهانه US$200 است، حدود CA$276 پیش از مالیات؛ Plus با US$20 محدودیت پیام دارد. Prepamigo ماهانه CA$24.98 با مالیات، یا CA$8.25 در ماه در طرح سالانه، با نمرهدهی نامحدود و 80 مجموعه تمرینی است.
برای همین مقایسه در برابر Claude، بخوانید Prepamigo در برابر Claude برای رایتینگ. برای دیدن اینکه نمرهدهنده رایتینگ چگونه کار میکند، بخوانید درون نمرهدهنده رایتینگ Prepamigo. یا نوشتن پاسخ کنید و نمره را ببینید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.
