نمره‌دهی

کدام هوش مصنوعی رایتینگ CELPIP را دقیق‌تر نمره می‌دهد؟ هفت‌تا را آزمودیم

۸ سپتامبر ۲۰۲۶

سهم انشاهایی که در سطح تأییدشده نمره گرفتند

36 پاسخ رایتینگ رسمی CELPIP، 12 در هر سطح، هر دو تسک رایتینگ. به هر مدل تسک و انشا داده شد و با کلماتی ساده از آن خواسته شد در مقیاس CELPIP نمره بدهد. نمره‌دهنده رایتینگ Prepamigo در پیکربندی عادی عملیاتی خودش اجرا شد.

86%

Prepamigo Writing Scorer

78%

GPT 5.6 sol

69%

GPT 5.6 luna

61%

Gemini

61%

Claude Opus 5

58%

GPT-4o mini

56%

Claude Sonnet 5

مقایسه Prepamigo با پرطرفدارترین طرح‌های چت‌بات

بر اساس دلار کانادا. قیمت‌های Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شده‌اند. دقت، سهم 36 نوشته رسمی است که وقتی از مدل نام‌برده با کلماتی ساده درخواست امتیازدهی به نوشته می‌شود، در سطح تأییدشده امتیاز می‌گیرند؛ یک اجرا.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
قیمت ماهانه
CA$24.98 (با مالیات)
+CA$138 (بدون مالیات)
CA$276 (بدون مالیات)
امتیازدهی
نامحدود
محدود
محدود
بانک سوال آماده
بله
خیر
خیر
مجموعه‌های تمرینی
80
ندارد
ندارد
تمرین‌ها
+2,000
ندارد
ندارد
قالب CELPIP
بله
خیر
خیر
دقت
86%
61%
78%
نوشته‌های سطح میانی
100%
25%
75%

بسیاری از داوطلبان CELPIP رایتینگ خود را با یک چت‌بات هوش مصنوعی بررسی می‌کنند. ایمیل را وارد کن، نمره بخواه، پاراگراف را بخوان. برای رایتینگ آسان است: نه ضبطی، نه متن پیاده‌شده‌ای. چیزی که هیچ‌کس به شما نمی‌گوید این است که آن عدد چند بار درست است، یا به کدام مدل اعتماد کنید، یا هرکدام چه اشتباه‌هایی می‌کنند. می‌خواستیم بدانیم، پس به شش چت‌بات و نمره‌دهنده خودمان همان 36 انشای رسمی با نمره‌های تأییدشده را دادیم و شمردیم.

نسخه یک‌جمله‌ای: GPT 5.6 sol با 78% دقیق‌ترین چت‌بات برای رایتینگ CELPIP است، مدل‌های Claude با 61% و 56% کم‌دقت‌ترین هستند چون انشاهای سطح میانی را بالا می‌برند، و یک نمره‌دهنده اختصاصی، مال Prepamigo، روی همان انشاها به 86% رسید و هر انشای سطح میانی را درست گرفت. باید صادقانه بگوییم که Prepamigo محصول خود ماست. هرجا یک چت‌بات در سطحی خاص از ما جلو زد، می‌گوییم؛ دوتا از آن‌ها چنین کردند.

جدول رتبه‌بندی

سه رده در نمودار بالا دیده می‌شود. Prepamigo با 86% تنها ایستاده است. GPT 5.6 sol با 78% و GPT 5.6 luna با 69% رده دوم را می‌سازند: قابل‌استفاده، با عادت‌های شناخته‌شده. باقی همه روی 60% یا نزدیک آن هستند، که برای یک مقیاس سه‌بازه‌ای چندان بهتر از یک حدس آگاهانه نیست.

الگو با اسپیکینگ فرق دارد، جایی که مدل‌های Claude خوب و مدل‌های GPT بد عمل کردند. در رایتینگ برعکس است. مدل‌های GPT اندکی سخت‌گیرند: یک 7 کلی‌گو را به 6 پایین می‌کشند و یک انشای قوی با یک لغزش را در 9 نگه می‌دارند. مدل‌های Claude دست‌ودل‌بازند: یک 7 کلی‌گو را به 9 یا 10 بالا می‌برند و به انشاهای ضعیف کم‌مایه نمره 3 می‌دهند. Gemini در میانه مثل Claude رفتار می‌کند. GPT-4o mini با 9 به‌عنوان سقف رفتار می‌کند.

نتایج در هر سطح

انشاهای ضعیف (تأییدشده 4 یا 5)

12 انشای رسمی برای هر سیستم.

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

Prepamigo Writing Scorer

67%

Claude Opus 5

58%

Gemini

50%

Claude Sonnet 5

انشاهای ضعیف انتهای آسان مقیاس هستند، و سه مدل GPT با 83% مساوی‌اند، جلوتر از Prepamigo با 75%. هر سه خطای Prepamigo یک پله بالاتر رفتند، به 6 یا 7، در انشاهای کوتاه اما مرتب. مدل‌های Claude در جهت دیگر خطا می‌کنند: Sonnet 5 به چهار انشا از دوازده انشای ضعیف نمره 3 داد، یک سطح پایین‌تر، و Opus 5 به دوتا از آن‌ها 3 داد. انشای کم‌مایه‌ای که همچنان تسک را انجام می‌دهد 4 است، نه 3، و مدلی که هیچ نمونه‌ای از 4 ندارد نمی‌تواند تفاوت را تشخیص دهد.

انشاهای میانی (تأییدشده 7 یا 8)

12 انشای رسمی برای هر سیستم. سطحی که بیشتر داوطلبان در آن هستند.

100%

Prepamigo Writing Scorer

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

42%

Gemini

33%

Claude Sonnet 5

25%

Claude Opus 5

بازه میانی صف را از هم جدا می‌کند. Prepamigo هر دوازده‌تا را درست گرفت. GPT 5.6 sol نُه‌تا را گرفت و سه‌تا را به 6 پایین کشید. GPT-4o mini هشت‌تا را گرفت و چهارتا را به 9 بالا برد. luna هفت‌تا را گرفت، بیشتر با پایین کشیدن. Gemini پنج‌تا را گرفت و شش‌تا را به 9 یا 10 بالا برد. Claude Sonnet 5 چهارتا را گرفت، با خطاهایی تقسیم‌شده میان 6 و 9. Claude Opus 5 سه‌تا را گرفت و به هفت‌تا از دوازده‌تا 9 یا 10 داد.

اگر نویسنده 7 یا 8 هستید، و بیشتر داوطلبان هستند، این همان نموداری است که باید به خاطر بسپارید. از Claude Opus 5 بپرسید و بیش از نیمی از مواقع به شما خواهد گفت که کارتان تمام است. از Gemini بپرسید و نیمی از مواقع همین را خواهد گفت. از GPT 5.6 sol بپرسید و یک بار از هر چهار بار به شما خواهد گفت که به 6 سقوط کرده‌اید.

انشاهای قوی (تأییدشده 10 یا بالاتر)

12 انشای رسمی برای هر سیستم. تقریباً هر خطا یک 9 است.

92%

Claude Opus 5

83%

Prepamigo Writing Scorer

83%

Gemini

83%

Claude Sonnet 5

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

در بالا، Claude Opus 5 با شناسایی یازده انشای قوی از دوازده‌تا بهترین ارزیاب این آزمون است؛ به پنج‌تای آن‌ها 11 داد. Prepamigo، Gemini و Sonnet 5 هرکدام ده‌تا را شناسایی کردند. GPT 5.6 sol نُه‌تا و luna هشت‌تا را شناسایی کردند و باقی را در 9 نگه داشتند. GPT-4o mini سه‌تا را شناسایی کرد و به نُه‌تا 9 داد: این مدل 10 نمی‌دهد. دست‌ودل‌بازی Claude این‌جا درست و در هر جای دیگری اشتباه است؛ سخت‌گیری مدل‌های GPT این‌جا اشتباه و در جاهای دیگر کم‌وبیش درست است.

از هر چت‌باتی که استفاده می‌کنید، یک 9 روی انشایی که فکر می‌کردید قوی است، بیشتر احتمال دارد یک 10 نگه‌داشته‌شده باشد تا یک 9 واقعی، مگر این‌که از یک مدل Claude آمده باشد، که در آن صورت یک 9 بیشتر احتمال دارد یک 7 یا 8 باشد که ترفیع گرفته. جهت خطا به مدل بستگی دارد.

چرا مدل‌ها درباره میانه اختلاف دارند

یک انشای سطح میانی CELPIP چیز مشخصی است: تسک را پوشش می‌دهد، سازمان‌یافته است، خطاهای کمی دارد که مانع فهم شوند، و کلی‌گو است، با دلایلی که ادعا شده‌اند نه پرورش‌یافته و واژگانی که امن است نه دقیق. یک ارزیاب آموزش‌دیده صدها نمونه از این‌ها دیده و می‌داند کجا می‌نشینند. یک مدل عمومی یک نوشته مرتب، سازمان‌یافته و عمدتاً درست دیده و باید از روی برداشت تصمیم بگیرد. برداشت Claude این است که مرتب یعنی قوی. برداشت GPT این است که کلی‌گو یعنی ضعیف. هر دو درباره یک 7 اشتباه می‌کنند، در جهت‌های مخالف.

نمره‌دهنده Prepamigo از روی برداشت قضاوت نمی‌کند. انشا را با پاسخ‌های واقعی نمره‌گذاری‌شده به همان نوع تسک در هر سطح مقایسه می‌کند، همه انشاهای واقعی با لغزش‌های واقعی، و آن را در هر یک از چهار بُعد کنار آنی می‌گذارد که بیش از همه به آن شبیه است. یک انشای تمیز اما کلی‌گو کنار نمونه میانی می‌نشیند، چون همان چیزی است که هست. بر فراز مقایسه، یک لایه قواعد برای چیزهایی نشسته که یک مدل در شمردن‌شان بد است: آیا هر نکته الزامی پوشش داده شده، آیا پاسخ نظرسنجی یک طرف را انتخاب می‌کند، آیا ایمیل سلام و خداحافظی دارد، و چقدر طولانی است. یک نکته الزامی ازقلم‌افتاده، صرف‌نظر از انگلیسی، نمره انجام تسک را در 8 یا پایین‌تر نگه می‌دارد، چون آزمون همین‌طور کار می‌کند.

همچنین امتحان کردیم به نمره‌دهنده رایتینگ طراحی دو ارزیاب با رأی‌گیری و تطبیق را بدهیم که نمره‌دهنده اسپیکینگ ما استفاده می‌کند. رایتینگ را بدتر کرد، چون سطح‌های رسمی رایتینگ در مقیاس 0 تا 12 فقط دو واحد از هم فاصله دارند و یک انتخاب اجباری میان نمونه‌ها انشاهای میانی را به 9 هل داد. رایتینگ طراحی‌ای را نگه می‌دارد که میانه را درست می‌گیرد.

چرا رتبه‌بندی برعکس اسپیکینگ است

اگر مقایسه اسپیکینگ ما را خوانده باشید، جدول رتبه‌بندی رایتینگ وارونه به نظر می‌رسد. روی متن‌های پیاده‌شده اسپیکینگ، Claude Opus 5 با 62% بهترین چت‌بات و GPT 5.6 sol با 35% بدترین مدل بزرگ بود. در رایتینگ، GPT 5.6 sol با 78% است و مدل‌های Claude در انتها.

دلیلش این است که هر مدل درباره چه چیزی دست‌ودل‌باز است. یک متن پیاده‌شده اسپیکینگ CELPIP انگلیسی گفتاری است که نوشته شده: جمله‌های ناتمام، تکرارها، خودتصحیحی‌ها. GPT آن را شکسته می‌خواند و سخت نمره می‌دهد، که روی یک متن پیاده‌شده اشتباه است؛ Claude از میان آن به ایده‌ها می‌رسد. یک انشای CELPIP برعکس است: ویرایش‌شده، سازمان‌یافته، در ظاهر مرتب، و اغلب در زیر کلی‌گو. Claude مرتب بودن را قوت می‌خواند و میانه را بالا می‌برد؛ GPT محتوای کلی‌گو را ضعف می‌خواند و کم‌وبیش درست است، یا یک واحد پایین.

درس عملی این است که هیچ چت‌بات تکی بهترین برای CELPIP وجود ندارد. مدلی که اسپیکینگ شما را خوب نمره می‌دهد همانی است که به رایتینگ شما تعارف خواهد کرد، و برعکس. یک نمره‌دهنده اختصاصی با مقایسه در برابر نمونه‌های نمره‌گذاری‌شده از نوع درست برای هر تسک، از این سؤال عبور می‌کند. موتور اسپیکینگ و موتور رایتینگ Prepamigo سیستم‌های جداگانه‌ای با طراحی‌های متفاوت هستند، چون این دو تسک به شیوه‌های متفاوتی شکست می‌خورند.

پاراگرافی که همراه عدد می‌آید

هر چت‌باتی با نمره‌اش یک پاراگراف بازخورد برمی‌گرداند، و پاراگراف معمولاً مطمئن‌تر از آن است که عدد سزاوارش باشد. سه چیز را پیش از عمل کردن به آن بررسی کنید.

  • آیا از شما نقل‌قول می‌کند؟ اصلاحی که به کلمات دقیق شما اشاره نمی‌کند یک قاعده کلی است، نه بازخورد روی انشای شما. بیشتر توصیه‌های چت‌بات از آن نوعی است که به هر انشایی می‌خورد: ساختار جمله‌هایتان را متنوع کنید، واژگان دقیق‌تری به کار ببرید، دلایل‌تان را پرورش دهید. درست، و غیرقابل‌اجرا.
  • آیا نکته جاافتاده را نام می‌برد؟ اگر تسک را وارد کرده باشید، یک پاسخ خوب به شما می‌گوید کدام نکته الزامی را پوشش نداده‌اید. اگر وارد نکرده باشید، چت‌بات نمی‌تواند بداند، و با این حال پوشش را تحسین خواهد کرد.
  • آیا انتقاد با نمره هم‌خوان است؟ پاراگراف چت‌بات اغلب سه یا چهار مشکل را فهرست می‌کند و بعد 10 می‌دهد، یا انشا را تحسین می‌کند و 6 می‌دهد. وقتی کلمات و عدد با هم اختلاف دارند، هیچ‌کدام قابل‌اتکا نیست.

بازخورد Prepamigo از سمت دیگر ساخته می‌شود: نمره‌دهنده باید پیش از دادن نمره، عبارت‌هایی را که نمره هر بُعد را پشتیبانی می‌کنند نقل کند، و نقل‌قولی که در انشای شما پیدا نشود کنار گذاشته می‌شود. نکات ازقلم‌افتاده با نام فهرست می‌شوند، و یک نکته ازقلم‌افتاده سقف نمره انجام تسک را تعیین می‌کند، پس کلمات و عدد نمی‌توانند با هم اختلاف داشته باشند. بخش پایین فهرست می‌کند چه چیزی در آن هست.

یادداشت‌هایی درباره هر مدل

  • GPT 5.6 sol. بهترین چت‌بات برای رایتینگ با 78%، و همانی که اگر از یکی استفاده می‌کنید باید استفاده کنید. اندکی سخت‌گیر: سه انشای میانی به 6 کشیده شد، سه انشای قوی در 9 نگه داشته شد. در انشاهای ضعیف از Prepamigo بهتر است، 83% در برابر 75%.
  • GPT 5.6 luna. 69%. همان شکل sol اما سخت‌گیرتر در میانه، جایی که هفت‌تا از دوازده‌تا را درست گرفت. در انشاهای ضعیف خوب است.
  • Gemini. 61%. در دو انتها خوب، در میانه با 42% ضعیف، جایی که شش انشا از دوازده‌تا را به 9 یا 10 بالا برد.
  • Claude Opus 5. در مجموع 61% اما در انشاهای قوی با 92% بهترین ارزیاب این آزمون. در میانه با 25% بدترین است، و به هفت‌تا از دوازده‌تا 9 یا 10 می‌دهد. اگر رایتینگ شما همین حالا قوی است، Opus 5 آن را تأیید خواهد کرد؛ اگر متوسط است، Opus 5 به شما خواهد گفت که قوی است.
  • GPT-4o mini. 58%. با 9 به‌عنوان بالای مقیاس رفتار می‌کند: نُه انشا از دوازده انشای قوی نمره 9 گرفتند. اگر جایی نزدیک 10 هستید، از آن برای نمره‌دهی رایتینگ استفاده نکنید.
  • Claude Sonnet 5. 56%، کم‌دقت‌ترین. به چهار انشای ضعیف نمره 3 داد و بازه میانی را میان 6 و 9 تقسیم کرد.

اگر به هر حال قرار است از چت‌بات استفاده کنید

  1. از GPT 5.6 sol استفاده کنید. نه از یک مدل Claude برای هر چیزی پایین‌تر از انشای قوی، و نه از یک مدل کوچک برای هر چیزی بالاتر از انشای ضعیف.
  2. کل تسک را وارد کنید. نکات الزامی برای تسک ایمیل و گزینه‌ها برای تسک نظرسنجی نمره را تغییر می‌دهند. مدلی که نکات را نمی‌داند نمی‌تواند به شما بگوید یکی جا افتاده.
  3. از آن بخواهید اول نکات را بررسی کند. برای هر نکته الزامی یک بله یا خیر بخواهید، بعد نمره را. این همان لایه قواعد است، به‌صورت دستی.
  4. دو بار بپرسید، پاسخ پایین‌تر را نگه دارید. GPT 5.6 sol در سه اجرا روی همان انشاها 78%، 83% و 81% گرفت؛ یک پاسخ تکی چند واحد شانس با خود دارد.
  5. 9 و 6 را با تردید بخوانید. از یک مدل GPT، 9 اغلب یک 10 نگه‌داشته‌شده است و 6 اغلب یک 7 پایین‌کشیده‌شده. از یک مدل Claude، 9 اغلب یک 7 ترفیع‌گرفته است.

تنها ورودی‌ای که نمی‌توانید خودتان فراهم کنید، یک انشای تأییدشده نمره‌گذاری‌شده برای همان تسک در هر سطح است، که همان چیزی است که یک نمره‌دهنده اختصاصی با آن مقایسه می‌کند. این، و بررسی نکات الزامی، تفاوت میان 78% و 86% است.

چه چیزی در بازخورد رایتینگ شما تازه است

نمره فقط نیمی از چیزی است که دریافت می‌کنید. لایه بازخورد رایتینگ همراه با نمره‌دهنده از نو ساخته شده، و همه‌چیز در آن به متن خود شما گره خورده است. این‌ها چیزهایی است که تغییر کرده.

  • اصلاح‌هایی که می‌توانید در نوشته خودتان پیدا کنید. هر اصلاح گرامری، املایی و واژگانی دقیقاً همان کلمات پاسخ شما را نقل می‌کند، تا اپ بتواند آن‌ها را همان‌جا که نوشته‌اید برجسته کند. هر چیزی که بررسی‌کننده نتواند کلمه‌به‌کلمه در نوشته شما پیدا کند، پیش از آنکه ببینید حذف می‌شود.
  • یک پاسخ نمونه، ساخته‌شده از پاسخ خودتان. نسخه‌ای بازنویسی‌شده از پاسخ خودتان دریافت می‌کنید که ایده‌های شما را حفظ می‌کند، همه نکته‌های الزامی را پوشش می‌دهد و در بازه 150 تا 200 کلمه‌ای که تسک می‌خواهد قرار می‌گیرد. اگر بازنویسی اول به این طول نرسد، پیش از نمایش یک بار دیگر انجام می‌شود.
  • نکته الزامی‌ای که از قلم انداختید، با نام. برای تسک ایمیل، بازخورد نکته‌هایی از صورت سؤال را که پاسخ شما پوشش نداده فهرست می‌کند. یک نکته جاافتاده همچنین نمره انجام تسک را در 8 یا پایین‌تر نگه می‌دارد، بنابراین عدد و بازخورد هرگز با هم ناسازگار نمی‌شوند.
  • یک عامل محدودکننده برای هر بُعد. برای هر یک از چهار بُعد، بازخورد آن یک چیزی را که نمره را پایین نگه داشته، به‌طور مشخص نام می‌برد، یا به‌صراحت می‌گوید هیچ چیزی مانع نیست و چه چیزی آن نمره را بالا نگه داشته است. این‌که تصمیم گرفته شود یک بُعد مشکلی ندارد، خودش یک پاسخ واقعی است، نه یک جای خالی.
  • انتقاد در جای درست. لحن ضعیف مشکلِ انجام تسک است، انتخاب واژه مبهم مشکلِ واژگان است، جمله بی‌پایان مشکلِ خوانایی است. هر نکته زیر همان بُعدی ثبت می‌شود که به آن تعلق دارد، به‌جای اینکه همه در خلاصه کلی روی هم ریخته شوند.
  • بازنویسی در سطح جمله. جمله‌های مشخصی از نوشته شما با یک نسخه بهبودیافته و یک خط توضیح درباره اینکه چرا بهتر است برمی‌گردند، تا تغییر را ببینید نه اینکه فقط درباره‌اش بخوانید.
  • قوی‌ترین و ضعیف‌ترین بُعد شما، کنار هم. بازخورد به شما می‌گوید کدام یک از چهار بُعد نمره شما را بالا نگه داشته و کدام آن را پایین می‌کشد، تا بدون رمزگشایی چهار عدد بدانید بعد از این چه چیزی را تمرین کنید.

هر نقل‌قول در بازخورد پیش از نمایش با نوشته شما مطابقت داده می‌شود. اگر بررسی‌کننده نتواند آن کلمات را پیدا کند، آن خط حذف می‌شود. به همین دلیل بازخورد هرگز از شما نمی‌خواهد چیزی را اصلاح کنید که ننوشته‌اید.

سوالات متداول

کدام هوش مصنوعی در نمره‌دهی رایتینگ CELPIP دقیق‌ترین است؟ میان چت‌بات‌ها، GPT 5.6 sol با 78%، سپس luna 69%، Gemini و Claude Opus 5 61%، GPT-4o mini 58%، Claude Sonnet 5 56%. نمره‌دهنده رایتینگ Prepamigo روی همان انشاها به 86% رسید.

ChatGPT یا Claude برای رایتینگ؟ ChatGPT، به‌روشنی: 78% در برابر 61% و 56%. مدل‌های Claude انشاهای سطح میانی را به 9 یا 10 بالا می‌برند. Opus 5 در انشاهای قوی بهترین همه است.

چرا به انشای متوسط من 9 می‌دهند؟ مرتب و سازمان‌یافته برای مدلی که چیزی برای مقایسه ندارد قوی خوانده می‌شود. Prepamigo با نمونه‌های واقعی نمره‌گذاری‌شده برای همان تسک مقایسه می‌کند.

چطور از یک چت‌بات نمره بهتری بگیرم؟ از GPT 5.6 sol استفاده کنید، تسک کامل را وارد کنید، از آن بخواهید اول هر نکته الزامی را بررسی کند، دو بار بپرسید، و 9 و 6 را با تردید بخوانید.

برای دو مقایسه رودررو، بخوانید Prepamigo در برابر Claude برای رایتینگ و Prepamigo در برابر ChatGPT برای رایتینگ. برای این‌که نمره‌دهنده چگونه کار می‌کند، بخوانید درون نمره‌دهنده رایتینگ Prepamigo. یا نوشتن پاسخ کنید و از حدس زدن بگذرید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.

کدام هوش مصنوعی رایتینگ CELPIP را دقیق‌تر نمره می‌دهد؟ هفت‌تا را آزمودیم | PrepAmigo