سهم انشاهایی که در سطح تأییدشده نمره گرفتند
36 پاسخ رایتینگ رسمی CELPIP، 12 در هر سطح، هر دو تسک رایتینگ. به هر مدل تسک و انشا داده شد و با کلماتی ساده از آن خواسته شد در مقیاس CELPIP نمره بدهد. نمرهدهنده رایتینگ Prepamigo در پیکربندی عادی عملیاتی خودش اجرا شد.
86%
Prepamigo Writing Scorer
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
مقایسه Prepamigo با پرطرفدارترین طرحهای چتبات
بر اساس دلار کانادا. قیمتهای Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شدهاند. دقت، سهم 36 نوشته رسمی است که وقتی از مدل نامبرده با کلماتی ساده درخواست امتیازدهی به نوشته میشود، در سطح تأییدشده امتیاز میگیرند؛ یک اجرا.
بسیاری از داوطلبان CELPIP رایتینگ خود را با یک چتبات هوش مصنوعی بررسی میکنند. ایمیل را وارد کن، نمره بخواه، پاراگراف را بخوان. برای رایتینگ آسان است: نه ضبطی، نه متن پیادهشدهای. چیزی که هیچکس به شما نمیگوید این است که آن عدد چند بار درست است، یا به کدام مدل اعتماد کنید، یا هرکدام چه اشتباههایی میکنند. میخواستیم بدانیم، پس به شش چتبات و نمرهدهنده خودمان همان 36 انشای رسمی با نمرههای تأییدشده را دادیم و شمردیم.
نسخه یکجملهای: GPT 5.6 sol با 78% دقیقترین چتبات برای رایتینگ CELPIP است، مدلهای Claude با 61% و 56% کمدقتترین هستند چون انشاهای سطح میانی را بالا میبرند، و یک نمرهدهنده اختصاصی، مال Prepamigo، روی همان انشاها به 86% رسید و هر انشای سطح میانی را درست گرفت. باید صادقانه بگوییم که Prepamigo محصول خود ماست. هرجا یک چتبات در سطحی خاص از ما جلو زد، میگوییم؛ دوتا از آنها چنین کردند.
جدول رتبهبندی
سه رده در نمودار بالا دیده میشود. Prepamigo با 86% تنها ایستاده است. GPT 5.6 sol با 78% و GPT 5.6 luna با 69% رده دوم را میسازند: قابلاستفاده، با عادتهای شناختهشده. باقی همه روی 60% یا نزدیک آن هستند، که برای یک مقیاس سهبازهای چندان بهتر از یک حدس آگاهانه نیست.
الگو با اسپیکینگ فرق دارد، جایی که مدلهای Claude خوب و مدلهای GPT بد عمل کردند. در رایتینگ برعکس است. مدلهای GPT اندکی سختگیرند: یک 7 کلیگو را به 6 پایین میکشند و یک انشای قوی با یک لغزش را در 9 نگه میدارند. مدلهای Claude دستودلبازند: یک 7 کلیگو را به 9 یا 10 بالا میبرند و به انشاهای ضعیف کممایه نمره 3 میدهند. Gemini در میانه مثل Claude رفتار میکند. GPT-4o mini با 9 بهعنوان سقف رفتار میکند.
نتایج در هر سطح
انشاهای ضعیف (تأییدشده 4 یا 5)
12 انشای رسمی برای هر سیستم.
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
Prepamigo Writing Scorer
67%
Claude Opus 5
58%
Gemini
50%
Claude Sonnet 5
انشاهای ضعیف انتهای آسان مقیاس هستند، و سه مدل GPT با 83% مساویاند، جلوتر از Prepamigo با 75%. هر سه خطای Prepamigo یک پله بالاتر رفتند، به 6 یا 7، در انشاهای کوتاه اما مرتب. مدلهای Claude در جهت دیگر خطا میکنند: Sonnet 5 به چهار انشا از دوازده انشای ضعیف نمره 3 داد، یک سطح پایینتر، و Opus 5 به دوتا از آنها 3 داد. انشای کممایهای که همچنان تسک را انجام میدهد 4 است، نه 3، و مدلی که هیچ نمونهای از 4 ندارد نمیتواند تفاوت را تشخیص دهد.
انشاهای میانی (تأییدشده 7 یا 8)
12 انشای رسمی برای هر سیستم. سطحی که بیشتر داوطلبان در آن هستند.
100%
Prepamigo Writing Scorer
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
42%
Gemini
33%
Claude Sonnet 5
25%
Claude Opus 5
بازه میانی صف را از هم جدا میکند. Prepamigo هر دوازدهتا را درست گرفت. GPT 5.6 sol نُهتا را گرفت و سهتا را به 6 پایین کشید. GPT-4o mini هشتتا را گرفت و چهارتا را به 9 بالا برد. luna هفتتا را گرفت، بیشتر با پایین کشیدن. Gemini پنجتا را گرفت و ششتا را به 9 یا 10 بالا برد. Claude Sonnet 5 چهارتا را گرفت، با خطاهایی تقسیمشده میان 6 و 9. Claude Opus 5 سهتا را گرفت و به هفتتا از دوازدهتا 9 یا 10 داد.
اگر نویسنده 7 یا 8 هستید، و بیشتر داوطلبان هستند، این همان نموداری است که باید به خاطر بسپارید. از Claude Opus 5 بپرسید و بیش از نیمی از مواقع به شما خواهد گفت که کارتان تمام است. از Gemini بپرسید و نیمی از مواقع همین را خواهد گفت. از GPT 5.6 sol بپرسید و یک بار از هر چهار بار به شما خواهد گفت که به 6 سقوط کردهاید.
انشاهای قوی (تأییدشده 10 یا بالاتر)
12 انشای رسمی برای هر سیستم. تقریباً هر خطا یک 9 است.
92%
Claude Opus 5
83%
Prepamigo Writing Scorer
83%
Gemini
83%
Claude Sonnet 5
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
در بالا، Claude Opus 5 با شناسایی یازده انشای قوی از دوازدهتا بهترین ارزیاب این آزمون است؛ به پنجتای آنها 11 داد. Prepamigo، Gemini و Sonnet 5 هرکدام دهتا را شناسایی کردند. GPT 5.6 sol نُهتا و luna هشتتا را شناسایی کردند و باقی را در 9 نگه داشتند. GPT-4o mini سهتا را شناسایی کرد و به نُهتا 9 داد: این مدل 10 نمیدهد. دستودلبازی Claude اینجا درست و در هر جای دیگری اشتباه است؛ سختگیری مدلهای GPT اینجا اشتباه و در جاهای دیگر کموبیش درست است.
چرا مدلها درباره میانه اختلاف دارند
یک انشای سطح میانی CELPIP چیز مشخصی است: تسک را پوشش میدهد، سازمانیافته است، خطاهای کمی دارد که مانع فهم شوند، و کلیگو است، با دلایلی که ادعا شدهاند نه پرورشیافته و واژگانی که امن است نه دقیق. یک ارزیاب آموزشدیده صدها نمونه از اینها دیده و میداند کجا مینشینند. یک مدل عمومی یک نوشته مرتب، سازمانیافته و عمدتاً درست دیده و باید از روی برداشت تصمیم بگیرد. برداشت Claude این است که مرتب یعنی قوی. برداشت GPT این است که کلیگو یعنی ضعیف. هر دو درباره یک 7 اشتباه میکنند، در جهتهای مخالف.
نمرهدهنده Prepamigo از روی برداشت قضاوت نمیکند. انشا را با پاسخهای واقعی نمرهگذاریشده به همان نوع تسک در هر سطح مقایسه میکند، همه انشاهای واقعی با لغزشهای واقعی، و آن را در هر یک از چهار بُعد کنار آنی میگذارد که بیش از همه به آن شبیه است. یک انشای تمیز اما کلیگو کنار نمونه میانی مینشیند، چون همان چیزی است که هست. بر فراز مقایسه، یک لایه قواعد برای چیزهایی نشسته که یک مدل در شمردنشان بد است: آیا هر نکته الزامی پوشش داده شده، آیا پاسخ نظرسنجی یک طرف را انتخاب میکند، آیا ایمیل سلام و خداحافظی دارد، و چقدر طولانی است. یک نکته الزامی ازقلمافتاده، صرفنظر از انگلیسی، نمره انجام تسک را در 8 یا پایینتر نگه میدارد، چون آزمون همینطور کار میکند.
همچنین امتحان کردیم به نمرهدهنده رایتینگ طراحی دو ارزیاب با رأیگیری و تطبیق را بدهیم که نمرهدهنده اسپیکینگ ما استفاده میکند. رایتینگ را بدتر کرد، چون سطحهای رسمی رایتینگ در مقیاس 0 تا 12 فقط دو واحد از هم فاصله دارند و یک انتخاب اجباری میان نمونهها انشاهای میانی را به 9 هل داد. رایتینگ طراحیای را نگه میدارد که میانه را درست میگیرد.
چرا رتبهبندی برعکس اسپیکینگ است
اگر مقایسه اسپیکینگ ما را خوانده باشید، جدول رتبهبندی رایتینگ وارونه به نظر میرسد. روی متنهای پیادهشده اسپیکینگ، Claude Opus 5 با 62% بهترین چتبات و GPT 5.6 sol با 35% بدترین مدل بزرگ بود. در رایتینگ، GPT 5.6 sol با 78% است و مدلهای Claude در انتها.
دلیلش این است که هر مدل درباره چه چیزی دستودلباز است. یک متن پیادهشده اسپیکینگ CELPIP انگلیسی گفتاری است که نوشته شده: جملههای ناتمام، تکرارها، خودتصحیحیها. GPT آن را شکسته میخواند و سخت نمره میدهد، که روی یک متن پیادهشده اشتباه است؛ Claude از میان آن به ایدهها میرسد. یک انشای CELPIP برعکس است: ویرایششده، سازمانیافته، در ظاهر مرتب، و اغلب در زیر کلیگو. Claude مرتب بودن را قوت میخواند و میانه را بالا میبرد؛ GPT محتوای کلیگو را ضعف میخواند و کموبیش درست است، یا یک واحد پایین.
درس عملی این است که هیچ چتبات تکی بهترین برای CELPIP وجود ندارد. مدلی که اسپیکینگ شما را خوب نمره میدهد همانی است که به رایتینگ شما تعارف خواهد کرد، و برعکس. یک نمرهدهنده اختصاصی با مقایسه در برابر نمونههای نمرهگذاریشده از نوع درست برای هر تسک، از این سؤال عبور میکند. موتور اسپیکینگ و موتور رایتینگ Prepamigo سیستمهای جداگانهای با طراحیهای متفاوت هستند، چون این دو تسک به شیوههای متفاوتی شکست میخورند.
پاراگرافی که همراه عدد میآید
هر چتباتی با نمرهاش یک پاراگراف بازخورد برمیگرداند، و پاراگراف معمولاً مطمئنتر از آن است که عدد سزاوارش باشد. سه چیز را پیش از عمل کردن به آن بررسی کنید.
- آیا از شما نقلقول میکند؟ اصلاحی که به کلمات دقیق شما اشاره نمیکند یک قاعده کلی است، نه بازخورد روی انشای شما. بیشتر توصیههای چتبات از آن نوعی است که به هر انشایی میخورد: ساختار جملههایتان را متنوع کنید، واژگان دقیقتری به کار ببرید، دلایلتان را پرورش دهید. درست، و غیرقابلاجرا.
- آیا نکته جاافتاده را نام میبرد؟ اگر تسک را وارد کرده باشید، یک پاسخ خوب به شما میگوید کدام نکته الزامی را پوشش ندادهاید. اگر وارد نکرده باشید، چتبات نمیتواند بداند، و با این حال پوشش را تحسین خواهد کرد.
- آیا انتقاد با نمره همخوان است؟ پاراگراف چتبات اغلب سه یا چهار مشکل را فهرست میکند و بعد 10 میدهد، یا انشا را تحسین میکند و 6 میدهد. وقتی کلمات و عدد با هم اختلاف دارند، هیچکدام قابلاتکا نیست.
بازخورد Prepamigo از سمت دیگر ساخته میشود: نمرهدهنده باید پیش از دادن نمره، عبارتهایی را که نمره هر بُعد را پشتیبانی میکنند نقل کند، و نقلقولی که در انشای شما پیدا نشود کنار گذاشته میشود. نکات ازقلمافتاده با نام فهرست میشوند، و یک نکته ازقلمافتاده سقف نمره انجام تسک را تعیین میکند، پس کلمات و عدد نمیتوانند با هم اختلاف داشته باشند. بخش پایین فهرست میکند چه چیزی در آن هست.
یادداشتهایی درباره هر مدل
- GPT 5.6 sol. بهترین چتبات برای رایتینگ با 78%، و همانی که اگر از یکی استفاده میکنید باید استفاده کنید. اندکی سختگیر: سه انشای میانی به 6 کشیده شد، سه انشای قوی در 9 نگه داشته شد. در انشاهای ضعیف از Prepamigo بهتر است، 83% در برابر 75%.
- GPT 5.6 luna. 69%. همان شکل sol اما سختگیرتر در میانه، جایی که هفتتا از دوازدهتا را درست گرفت. در انشاهای ضعیف خوب است.
- Gemini. 61%. در دو انتها خوب، در میانه با 42% ضعیف، جایی که شش انشا از دوازدهتا را به 9 یا 10 بالا برد.
- Claude Opus 5. در مجموع 61% اما در انشاهای قوی با 92% بهترین ارزیاب این آزمون. در میانه با 25% بدترین است، و به هفتتا از دوازدهتا 9 یا 10 میدهد. اگر رایتینگ شما همین حالا قوی است، Opus 5 آن را تأیید خواهد کرد؛ اگر متوسط است، Opus 5 به شما خواهد گفت که قوی است.
- GPT-4o mini. 58%. با 9 بهعنوان بالای مقیاس رفتار میکند: نُه انشا از دوازده انشای قوی نمره 9 گرفتند. اگر جایی نزدیک 10 هستید، از آن برای نمرهدهی رایتینگ استفاده نکنید.
- Claude Sonnet 5. 56%، کمدقتترین. به چهار انشای ضعیف نمره 3 داد و بازه میانی را میان 6 و 9 تقسیم کرد.
اگر به هر حال قرار است از چتبات استفاده کنید
- از GPT 5.6 sol استفاده کنید. نه از یک مدل Claude برای هر چیزی پایینتر از انشای قوی، و نه از یک مدل کوچک برای هر چیزی بالاتر از انشای ضعیف.
- کل تسک را وارد کنید. نکات الزامی برای تسک ایمیل و گزینهها برای تسک نظرسنجی نمره را تغییر میدهند. مدلی که نکات را نمیداند نمیتواند به شما بگوید یکی جا افتاده.
- از آن بخواهید اول نکات را بررسی کند. برای هر نکته الزامی یک بله یا خیر بخواهید، بعد نمره را. این همان لایه قواعد است، بهصورت دستی.
- دو بار بپرسید، پاسخ پایینتر را نگه دارید. GPT 5.6 sol در سه اجرا روی همان انشاها 78%، 83% و 81% گرفت؛ یک پاسخ تکی چند واحد شانس با خود دارد.
- 9 و 6 را با تردید بخوانید. از یک مدل GPT، 9 اغلب یک 10 نگهداشتهشده است و 6 اغلب یک 7 پایینکشیدهشده. از یک مدل Claude، 9 اغلب یک 7 ترفیعگرفته است.
تنها ورودیای که نمیتوانید خودتان فراهم کنید، یک انشای تأییدشده نمرهگذاریشده برای همان تسک در هر سطح است، که همان چیزی است که یک نمرهدهنده اختصاصی با آن مقایسه میکند. این، و بررسی نکات الزامی، تفاوت میان 78% و 86% است.
چه چیزی در بازخورد رایتینگ شما تازه است
نمره فقط نیمی از چیزی است که دریافت میکنید. لایه بازخورد رایتینگ همراه با نمرهدهنده از نو ساخته شده، و همهچیز در آن به متن خود شما گره خورده است. اینها چیزهایی است که تغییر کرده.
- اصلاحهایی که میتوانید در نوشته خودتان پیدا کنید. هر اصلاح گرامری، املایی و واژگانی دقیقاً همان کلمات پاسخ شما را نقل میکند، تا اپ بتواند آنها را همانجا که نوشتهاید برجسته کند. هر چیزی که بررسیکننده نتواند کلمهبهکلمه در نوشته شما پیدا کند، پیش از آنکه ببینید حذف میشود.
- یک پاسخ نمونه، ساختهشده از پاسخ خودتان. نسخهای بازنویسیشده از پاسخ خودتان دریافت میکنید که ایدههای شما را حفظ میکند، همه نکتههای الزامی را پوشش میدهد و در بازه 150 تا 200 کلمهای که تسک میخواهد قرار میگیرد. اگر بازنویسی اول به این طول نرسد، پیش از نمایش یک بار دیگر انجام میشود.
- نکته الزامیای که از قلم انداختید، با نام. برای تسک ایمیل، بازخورد نکتههایی از صورت سؤال را که پاسخ شما پوشش نداده فهرست میکند. یک نکته جاافتاده همچنین نمره انجام تسک را در 8 یا پایینتر نگه میدارد، بنابراین عدد و بازخورد هرگز با هم ناسازگار نمیشوند.
- یک عامل محدودکننده برای هر بُعد. برای هر یک از چهار بُعد، بازخورد آن یک چیزی را که نمره را پایین نگه داشته، بهطور مشخص نام میبرد، یا بهصراحت میگوید هیچ چیزی مانع نیست و چه چیزی آن نمره را بالا نگه داشته است. اینکه تصمیم گرفته شود یک بُعد مشکلی ندارد، خودش یک پاسخ واقعی است، نه یک جای خالی.
- انتقاد در جای درست. لحن ضعیف مشکلِ انجام تسک است، انتخاب واژه مبهم مشکلِ واژگان است، جمله بیپایان مشکلِ خوانایی است. هر نکته زیر همان بُعدی ثبت میشود که به آن تعلق دارد، بهجای اینکه همه در خلاصه کلی روی هم ریخته شوند.
- بازنویسی در سطح جمله. جملههای مشخصی از نوشته شما با یک نسخه بهبودیافته و یک خط توضیح درباره اینکه چرا بهتر است برمیگردند، تا تغییر را ببینید نه اینکه فقط دربارهاش بخوانید.
- قویترین و ضعیفترین بُعد شما، کنار هم. بازخورد به شما میگوید کدام یک از چهار بُعد نمره شما را بالا نگه داشته و کدام آن را پایین میکشد، تا بدون رمزگشایی چهار عدد بدانید بعد از این چه چیزی را تمرین کنید.
هر نقلقول در بازخورد پیش از نمایش با نوشته شما مطابقت داده میشود. اگر بررسیکننده نتواند آن کلمات را پیدا کند، آن خط حذف میشود. به همین دلیل بازخورد هرگز از شما نمیخواهد چیزی را اصلاح کنید که ننوشتهاید.
سوالات متداول
کدام هوش مصنوعی در نمرهدهی رایتینگ CELPIP دقیقترین است؟ میان چتباتها، GPT 5.6 sol با 78%، سپس luna 69%، Gemini و Claude Opus 5 61%، GPT-4o mini 58%، Claude Sonnet 5 56%. نمرهدهنده رایتینگ Prepamigo روی همان انشاها به 86% رسید.
ChatGPT یا Claude برای رایتینگ؟ ChatGPT، بهروشنی: 78% در برابر 61% و 56%. مدلهای Claude انشاهای سطح میانی را به 9 یا 10 بالا میبرند. Opus 5 در انشاهای قوی بهترین همه است.
چرا به انشای متوسط من 9 میدهند؟ مرتب و سازمانیافته برای مدلی که چیزی برای مقایسه ندارد قوی خوانده میشود. Prepamigo با نمونههای واقعی نمرهگذاریشده برای همان تسک مقایسه میکند.
چطور از یک چتبات نمره بهتری بگیرم؟ از GPT 5.6 sol استفاده کنید، تسک کامل را وارد کنید، از آن بخواهید اول هر نکته الزامی را بررسی کند، دو بار بپرسید، و 9 و 6 را با تردید بخوانید.
برای دو مقایسه رودررو، بخوانید Prepamigo در برابر Claude برای رایتینگ و Prepamigo در برابر ChatGPT برای رایتینگ. برای اینکه نمرهدهنده چگونه کار میکند، بخوانید درون نمرهدهنده رایتینگ Prepamigo. یا نوشتن پاسخ کنید و از حدس زدن بگذرید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.
