محصول

Prepamigo در برابر ChatGPT برای رایتینگ CELPIP: دقت، محدودیت‌ها و هزینه

۸ سپتامبر ۲۰۲۶

سهم نوشته‌هایی که در سطح تأییدشده نمره گرفتند

36 پاسخ رسمی رایتینگ CELPIP، 12 پاسخ در هر یک از سه سطح، در هر دو تسک رایتینگ. به هر مدل GPT تسک و نوشته داده شد و از آن خواسته شد با کلماتی ساده آن را در مقیاس CELPIP نمره بدهد. نمره‌دهنده رایتینگ Prepamigo در پیکربندی عادی عملیاتی خودش اجرا شد.

86%

نمره‌دهنده رایتینگ Prepamigo

78%

GPT 5.6 sol

69%

GPT 5.6 luna

58%

GPT-4o mini

مقایسه Prepamigo با پرطرفدارترین طرح‌های چت‌بات

بر اساس دلار کانادا. قیمت‌های Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شده‌اند. دقت، سهم 36 نوشته رسمی است که وقتی از مدل نام‌برده با کلماتی ساده درخواست امتیازدهی به نوشته می‌شود، در سطح تأییدشده امتیاز می‌گیرند؛ یک اجرا.

Prepamigo
ChatGPT ProGPT 5.6 sol
قیمت ماهانه
CA$24.98 (با مالیات)
CA$276 (بدون مالیات)
امتیازدهی
نامحدود
محدود
بانک سوال آماده
بله
خیر
مجموعه‌های تمرینی
80
ندارد
تمرین‌ها
+2,000
ندارد
قالب CELPIP
بله
خیر
دقت
86%
78%
نوشته‌های سطح میانی
100%
75%

ChatGPT احتمالاً رایج‌ترین ابزاری است که داوطلبان CELPIP برای بررسی رایتینگ خود استفاده می‌کنند. ایمیل را می‌چسبانید، نمره می‌خواهید، یک عدد و یک پاراگراف می‌گیرید. سریع است، روی گوشی‌تان است، و برای رایتینگ هیچ مرحله پیاده‌سازی‌ای سر راه نیست. پس ما آن عدد را آزمودیم. همان 36 پاسخ رسمی رایتینگ CELPIP را که نمره‌دهنده خودمان با آن‌ها سنجیده می‌شود، دوازده تا در هر سطح، به سه مدل GPT دادیم و از آن‌ها خواستیم همان‌طور که یک داوطلب می‌پرسد، به نوشته‌ها نمره بدهند.

پاسخ کوتاه: نمره‌دهنده رایتینگ Prepamigo در 86% مواقع به سطح تأییدشده رسید. GPT 5.6 sol، مدلی که پشت طرح‌های پولی ChatGPT است، در 78% مواقع به آن رسید. GPT 5.6 luna به 69% و GPT-4o mini به 58% رسیدند. هشت واحد یک فاصله واقعی است، و از دو جا می‌آید: وسط مقیاس، جایی که Prepamigo هر دوازده نوشته را درست نمره داد و GPT 5.6 sol نُه تا را، و بالای مقیاس، جایی که GPT 5.6 sol یک‌چهارم نوشته‌های قوی را در 9 نگه داشت.

باید همین اول بگوییم که GPT 5.6 sol بهترین ارزیاب عمومی رایتینگ است که آزموده‌ایم، بسیار جلوتر از هر مدل Claude روی همان نوشته‌ها. باقی این مقاله نتایج را سطح‌به‌سطح مرور می‌کند، توضیح می‌دهد آن هشت واحد از کجا می‌آید، بازخورد هر طرف را بررسی می‌کند، و مقایسه می‌کند تمرین جدی رایتینگ با هرکدام چقدر هزینه دارد.

آزمون ساده: چیزی که یک داوطلب واقعاً می‌گیرد

هشتاد و شش درصد در برابر هفتادوهشت. روی 36 نوشته، این یعنی سه نمره درست بیشتر برای Prepamigo نسبت به GPT 5.6 sol، شش تا بیشتر از GPT 5.6 luna، و ده تا بیشتر از GPT-4o mini. به بیان دیگر، Prepamigo نسبت به GPT 5.6 sol 37% اشتباه نمره‌دهی کمتر، نسبت به luna 55% کمتر و نسبت به GPT-4o mini 67% کمتر دارد.

این‌که به مدل‌های GPT چه داده شد مهم است. به هرکدام گفته شد که یک ممتحن باتجربه رایتینگ CELPIP است، تسک دقیقاً همان‌طور که داوطلب دیده بود به آن داده شد، شامل نکته‌های الزامی تسک ایمیل و گزینه‌های تسک نظرسنجی، و نوشته به آن داده شد. از آن یک نمره از 0 تا 12 خواسته شد. این همان چیزی است که در ChatGPT تایپ می‌کنید، و آزمونی منصفانه‌تر از یک «این را نمره بده» خالی است، چون مدل دست‌کم می‌داند تسک چه خواسته است.

نمره‌دهنده Prepamigo همان تسک و همان نوشته را دریافت کرد، به‌علاوه چیزی که همیشه در محیط عملیاتی دارد: نمونه‌های واقعیِ نمره‌داده‌شده برای همان تسک در هر سطح تا با آن‌ها مقایسه کند، و یک لایه قواعد که چیزهایی را بررسی می‌کند که یک ارزیاب اول از همه بررسی می‌کند، مثل این‌که آیا همه نکته‌های الزامی پوشش داده شده‌اند، آیا پاسخ نظرسنجی واقعاً یک طرف را انتخاب می‌کند، آیا ایمیل سلام و خداحافظی دارد، و آیا طول پاسخ اصلاً نزدیک به چیزی هست که تسک می‌خواهد.

آن هشت واحد از کجا می‌آید: سطح‌به‌سطح

نوشته‌های ضعیف (نمره تأییدشده 4 یا 5)

12 نوشته رسمی. تنها سطحی که مدل‌های GPT در آن اندکی جلو می‌افتند.

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

نمره‌دهنده رایتینگ Prepamigo

در نوشته‌های ضعیف، هر سه مدل GPT روی 83% هستند و Prepamigo روی 75%. این تنها سطحی است که ChatGPT در آن جلوتر است، و ما آن را همین‌طور گزارش می‌کنیم. هر سه خطای Prepamigo یک پله بالاتر رفتند، به 6 یا 7، در نوشته‌هایی که کوتاه اما مرتب بودند. هر دو خطای GPT 5.6 sol نمره 6 بودند. نوشته‌های ضعیف انتهای آسان مقیاس برای یک چت‌بات‌اند: نوشتنِ کوتاه، کلی‌گو و پرخطا به چشم هر کسی ضعیف می‌آید.

نوشته‌های میانی (نمره تأییدشده 7 یا 8)

12 نوشته رسمی. سطحی که بیشتر داوطلبان در آن هستند.

100%

نمره‌دهنده رایتینگ Prepamigo

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

در میانه، Prepamigo هر دوازده نوشته را داخل باند 7 تا 8 نمره داد. GPT 5.6 sol نُه تا را درست گرفت؛ هر سه خطایش نمره 6 بودند، یک پله پایین‌تر. GPT 5.6 luna هفت تا را درست گرفت، سه نوشته را به 6 و یکی را به 5 پایین کشید و یکی را به 9 بالا برد. GPT-4o mini هشت تا را درست گرفت و چهار تای دیگر را به 9 بالا برد.

7 یا 8 رایج‌ترین نمره واقعی در آزمون است، و همان نمره‌ای است که تعیین می‌کند داوطلب به هدفش رسیده یا نه. GPT 5.6 sol از هر چهار داوطلبِ این‌چنینی به یکی می‌گوید که به 6 سقوط کرده است. Luna به چهار نفر از هر ده نفر. هیچ‌کدام به آن شکلی که نتایج باند میانی Claude فاجعه است، فاجعه نیستند، اما این تفاوتِ میان نمره تمرینی‌ای است که می‌توانید بر اساسش برنامه بریزید و نمره‌ای که باید به آن شک کنید.

نوشته‌های قوی (نمره تأییدشده 10 یا بالاتر)

12 نوشته رسمی. خطاها در این‌جا نمره 9 هستند: نوشته قوی بود و ارزیاب دست نگه داشت.

83%

نمره‌دهنده رایتینگ Prepamigo

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

در بالا، Prepamigo ده تا از دوازده نوشته قوی را شناسایی کرد، GPT 5.6 sol نُه تا، luna هشت تا، و GPT-4o mini سه تا. هر خطا به‌جز یکی نمره 9 بود. GPT-4o mini به نُه تا از دوازده نوشته قوی 9 داد: به‌سادگی 10 نمی‌دهد. اگر رایتینگ شما قوی است و آن را با نسخه رایگان ChatGPT بررسی می‌کنید، که هنوز بخش زیادی از ترافیک را به مدل‌های کوچک می‌فرستد، تقریباً هر بار به شما گفته می‌شود که 9 هستید.

یک 9 از ChatGPT برای نوشته‌ای که فکر می‌کردید عالی است، بیشتر احتمال دارد یک 10 نگه‌داشته‌شده باشد تا یک 9 واقعی. آن را یک بار با پاسخ نمونه در کنارش بازنویسی کنید و دوباره نمره بگیرید؛ یک 10 ثابت در دو تلاش، یک 10 است.

چرا یک چت‌بات در میانه و در بالا می‌لغزد

یک نوشته سطح میانی CELPIP تسک را پوشش می‌دهد، منظم است، و در عین حال کلی‌گوست: دلیل‌ها ادعا می‌شوند نه پرورده، واژگان محتاطانه، جمله‌ها همه یک شکل. یک نوشته قوی بی‌نقص نیست؛ یکی دو لغزش دارد، و یک جمله ساده میان جمله‌های پرورده. مدلی که هیچ نمونه نمره‌داده‌شده‌ای برای مقایسه ندارد، باید از روی برداشت تصمیم بگیرد. برداشت GPT 5.6 sol کمی سخت‌گیرانه است: 7 کلی‌گو به چشمش 6 می‌آید، 10 قوی‌با‌یک‌لغزش به چشمش 9. Luna باز هم سخت‌گیرتر است. GPT-4o mini با 9 مثل سقف رفتار می‌کند.

نمره‌دهنده Prepamigo نوشته را در برابر یک تصور از نوشتن خوب نمی‌سنجد. آن را با نوشته‌های واقعیِ نمره‌داده‌شده برای همان تسک مقایسه می‌کند، یکی در هر سطح، همه‌شان پاسخ‌های واقعی با لغزش‌های واقعی. یک نوشته کلی‌گو اما کامل کنار نمونه میانی می‌نشیند چون به آن شبیه است. یک نوشته قوی با یک جمله ناشیانه کنار نمونه قوی می‌نشیند، که آن هم یکی دارد. روی این مقایسه، یک لایه قواعد برای چیزهایی قرار دارد که مدل در شمردنشان ضعیف است: آیا همه نکته‌های الزامی حاضرند، آیا پاسخ نظرسنجی یک طرف را انتخاب کرده، آیا ایمیل سلام و خداحافظی دارد، و طولش چقدر است. یک نکته الزامی جاافتاده، نمره انجام تسک را صرف‌نظر از انگلیسی در 8 یا پایین‌تر نگه می‌دارد، چون آزمون این‌طور کار می‌کند.

فاصله روند کار: چه چیزی را باید خودتان بیاورید

برای رایتینگ، استفاده از ChatGPT به‌عنوان ارزیاب آسان است، و ما وانمود نمی‌کنیم غیر از این است. نوشته را می‌چسبانید، عدد می‌گیرید، توضیح می‌خواهید. نه ضبطی، نه متن پیاده‌شده‌ای. برای یک نظر دوم سریع روی یک نوشته، راحت است و با GPT 5.6 sol، نسبتاً دقیق.

چیزی که نمی‌گیرید، تسک است. ChatGPT اگر بخواهید می‌تواند یک دستور به سبک CELPIP بسازد، اما درباره نکته‌های الزامی، گزینه‌های نظرسنجی و تعداد کلماتی که آزمون واقعی استفاده می‌کند حدس می‌زند. بررسی نکته‌های الزامی نمی‌گیرید، چون نمی‌داند آزمون واقعی کدام نکته‌ها را فهرست می‌کند. پاسخ نمونه‌ای که از نوشته خودتان با طول درست بازنویسی شده باشد نمی‌گیرید. و هر نوشته‌ای که می‌چسبانید از سهمیه پیام‌هایتان کم می‌کند.

در Prepamigo، یک تسک از بانک باز می‌کنید، تایمر اجرا می‌شود، می‌نویسید، و حدود یک دقیقه بعد از ارسال، چهار نمره بُعدی، یک نمره کلی، فهرستی از هر چیزی که از قلم انداخته‌اید، اصلاح‌هایی که از متن خودتان نقل شده‌اند، و یک پاسخ نمونه بازنویسی‌شده دارید. چهلمین نوشته ماه همان تلاشی را از شما می‌گیرد که نوشته اول.

همان نوشته، همان نمره

بعد از اجرای اصلی، هر 36 نوشته را دو بار دیگر در روزهای متفاوت نمره دادیم. نمره‌دهنده رایتینگ Prepamigo در سه اجرا 86%، 89% و 86% گرفت، و هر بار همان دوازده نوشته سطح میانی داخل باند بودند. GPT 5.6 sol 78%، 83% و 81% گرفت: در اجرای دوم و سوم بهتر، و یادآوری این‌که یک پاسخ تکی چت‌بات چند واحد شانس در هر دو جهت با خود دارد. اگر واقعاً با ChatGPT نمره می‌گیرید، دو بار بپرسید و پاسخ پایین‌تر را نگه دارید.

بازخورد: توضیح در برابر شواهد

ChatGPT خوب توضیح می‌دهد. بپرسید چرا یک نوشته 6 است و به انگلیسی روشن، همراه با پیشنهاد، به شما می‌گوید. گیر کار این است که توضیح برای توجیه عددی نوشته می‌شود که از قبل انتخاب شده، پس وقتی عدد یک پله پایین باشد، توضیح هم عیب‌هایی متناسب با آن پیدا می‌کند. داوطلبی که واقعاً در 7 بود، یک صفحه درباره ضعف‌هایی می‌خواند که تعیین‌کننده نبودند.

بازخورد Prepamigo از متن به بالا کار می‌کند. هر اصلاح دقیقاً کلمات نوشته شما را نقل می‌کند، و هر چیزی که بررسی‌کننده نتواند در متن شما پیدا کند پیش از آنکه ببینید حذف می‌شود. نکته الزامی جاافتاده نام برده می‌شود. هر بُعد یک عامل محدودکننده می‌گیرد، یا یک جمله ساده که هیچ چیزی مانع آن نیست. و یک پاسخ نمونه می‌گیرید که از پاسخ خودتان با طولی که تسک می‌خواهد بازنویسی شده. بخش زیر فهرست می‌کند چه چیزی تغییر کرده.

چه چیزی در بازخورد رایتینگ شما تازه است

نمره فقط نیمی از چیزی است که دریافت می‌کنید. لایه بازخورد رایتینگ همراه با نمره‌دهنده از نو ساخته شده، و همه‌چیز در آن به متن خود شما گره خورده است. این‌ها چیزهایی است که تغییر کرده.

  • اصلاح‌هایی که می‌توانید در نوشته خودتان پیدا کنید. هر اصلاح گرامری، املایی و واژگانی دقیقاً همان کلمات پاسخ شما را نقل می‌کند، تا اپ بتواند آن‌ها را همان‌جا که نوشته‌اید برجسته کند. هر چیزی که بررسی‌کننده نتواند کلمه‌به‌کلمه در نوشته شما پیدا کند، پیش از آنکه ببینید حذف می‌شود.
  • یک پاسخ نمونه، ساخته‌شده از پاسخ خودتان. نسخه‌ای بازنویسی‌شده از پاسخ خودتان دریافت می‌کنید که ایده‌های شما را حفظ می‌کند، همه نکته‌های الزامی را پوشش می‌دهد و در بازه 150 تا 200 کلمه‌ای که تسک می‌خواهد قرار می‌گیرد. اگر بازنویسی اول به این طول نرسد، پیش از نمایش یک بار دیگر انجام می‌شود.
  • نکته الزامی‌ای که از قلم انداختید، با نام. برای تسک ایمیل، بازخورد نکته‌هایی از صورت سؤال را که پاسخ شما پوشش نداده فهرست می‌کند. یک نکته جاافتاده همچنین نمره انجام تسک را در 8 یا پایین‌تر نگه می‌دارد، بنابراین عدد و بازخورد هرگز با هم ناسازگار نمی‌شوند.
  • یک عامل محدودکننده برای هر بُعد. برای هر یک از چهار بُعد، بازخورد آن یک چیزی را که نمره را پایین نگه داشته، به‌طور مشخص نام می‌برد، یا به‌صراحت می‌گوید هیچ چیزی مانع نیست و چه چیزی آن نمره را بالا نگه داشته است. این‌که تصمیم گرفته شود یک بُعد مشکلی ندارد، خودش یک پاسخ واقعی است، نه یک جای خالی.
  • انتقاد در جای درست. لحن ضعیف مشکلِ انجام تسک است، انتخاب واژه مبهم مشکلِ واژگان است، جمله بی‌پایان مشکلِ خوانایی است. هر نکته زیر همان بُعدی ثبت می‌شود که به آن تعلق دارد، به‌جای اینکه همه در خلاصه کلی روی هم ریخته شوند.
  • بازنویسی در سطح جمله. جمله‌های مشخصی از نوشته شما با یک نسخه بهبودیافته و یک خط توضیح درباره اینکه چرا بهتر است برمی‌گردند، تا تغییر را ببینید نه اینکه فقط درباره‌اش بخوانید.
  • قوی‌ترین و ضعیف‌ترین بُعد شما، کنار هم. بازخورد به شما می‌گوید کدام یک از چهار بُعد نمره شما را بالا نگه داشته و کدام آن را پایین می‌کشد، تا بدون رمزگشایی چهار عدد بدانید بعد از این چه چیزی را تمرین کنید.

هر نقل‌قول در بازخورد پیش از نمایش با نوشته شما مطابقت داده می‌شود. اگر بررسی‌کننده نتواند آن کلمات را پیدا کند، آن خط حذف می‌شود. به همین دلیل بازخورد هرگز از شما نمی‌خواهد چیزی را اصلاح کنید که ننوشته‌اید.

هزینه تمرین روزانه

ChatGPT Plus ماهانه US$20 است، حدود CA$28، با صورت‌حساب ماهانه، همان‌طور که در سپتامبر 2026 منتشر شده، با سقف پیام در هر بازه چرخشی؛ ChatGPT Pro، با US$200 در ماه، حدود CA$276 پیش از مالیات، آن سقف را بالا می‌برد. نسخه رایگان بخش زیادی از ترافیک خود را به مدل‌های کوچک‌تر می‌فرستد، و در این آزمون کوچک‌ترینِ آن‌ها از دوازده نوشته قوی سه تا را شناسایی کرد. هیچ‌کدام از طرح‌ها بانک تسک، تایمر، بررسی نکته‌های الزامی، پاسخ نمونه، یا نمره‌ای کالیبره‌شده در برابر نوشته‌های واقعیِ نمره‌داده‌شده ندارند.

Prepamigo ماهانه CA$24.98 است، یا CA$8.25 در ماه در طرح سالانه، که CA$98.98 برای سال است، شامل مالیات، و می‌توانید هر زمان لغو کنید. هر طرح شامل نمره‌دهی نامحدود بدون سقف روزانه، جلسه‌ای یا هفتگی، تلاش‌های نامحدود، و بانک کامل سوال است: 80 مجموعه تمرینی کامل و بیش از 2,000 تمرین در Writing، Speaking، Reading و Listening، نوشته‌شده برای پیروی از انواع تسک، زمان‌بندی و قالب آزمون CELPIP General.

وقتی ChatGPT ابزار بهتری است

  • یک نظر دوم سریع روی یک نوشته. GPT 5.6 sol ارزیاب قابل‌قبولی است و ده ثانیه وقت می‌گیرد. اگر تسک را از قبل دارید و فقط یک دیدگاه دیگر می‌خواهید، مناسب است.
  • بازنویسی یک جمله به پنج شکل. خواستن جایگزین برای یک جمله ناشیانه سریع است و پیشنهادها خوب‌اند.
  • گفتگو درباره‌اش. اگر می‌خواهید درباره این‌که چرا یک دلیل ضعیف است بحث کنید، گفتگو شکل درستی دارد. Prepamigo به شما حکم و شواهد می‌دهد؛ گفتگو نمی‌کند.
  • هرچیز خارج از آزمون. ChatGPT یک دستیار عمومی است و Prepamigo نیست.

چیزی که نباید باشد، تنها چیزی است که به نویسنده‌ای در سطح 7 یا 8 می‌گوید کجا ایستاده است، یا چیزی که به یک نویسنده قوی می‌گوید 9 است. این دو جایی هستند که بیش از همه در آن‌ها اشتباه می‌کند.

سوالات متداول

آیا ChatGPT می‌تواند رایتینگ CELPIP من را نمره بدهد؟ بله، و بهتر از بیشتر چت‌بات‌ها: GPT 5.6 sol روی 36 پاسخ رسمی در 78% مواقع درست بود، luna در 69%، GPT-4o mini در 58%، در برابر 86% برای Prepamigo.

آیا Prepamigo برای رایتینگ از ChatGPT دقیق‌تر است؟ با هشت واحد اختلاف در برابر بهترین مدل GPT. نوشته‌های سطح میانی 100% در برابر 75%؛ نوشته‌های قوی 83% در برابر 75%؛ نوشته‌های ضعیف 75% در برابر 83%.

کدام مدل GPT را باید استفاده کنم؟ GPT 5.6 sol. نه GPT-4o mini، که به نُه تا از دوازده نوشته قوی نمره 9 داد.

هزینه هرکدام چقدر است؟ ChatGPT Pro ماهانه US$200 است، حدود CA$276 پیش از مالیات؛ Plus با US$20 محدودیت پیام دارد. Prepamigo ماهانه CA$24.98 با مالیات، یا CA$8.25 در ماه در طرح سالانه، با نمره‌دهی نامحدود و 80 مجموعه تمرینی است.

برای همین مقایسه در برابر Claude، بخوانید Prepamigo در برابر Claude برای رایتینگ. برای دیدن این‌که نمره‌دهنده رایتینگ چگونه کار می‌کند، بخوانید درون نمره‌دهنده رایتینگ Prepamigo. یا نوشتن پاسخ کنید و نمره را ببینید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.

Prepamigo در برابر ChatGPT برای رایتینگ CELPIP: دقت، محدودیت‌ها و هزینه | PrepAmigo