نمره‌دهی

آیا نمره‌دهی رایتینگ CELPIP در Prepamigo دقیق است؟ اعداد، صادقانه

۸ سپتامبر ۲۰۲۶

نمره‌دهنده رایتینگ Prepamigo روی 36 انشای رسمی

سهم انشاهایی که داخل سطح تأییدشده نمره گرفتند، در مجموع و به تفکیک سطح. دوازده انشا در هر سطح در هر دو تسک رایتینگ؛ شش انشای نمونه‌ای که نمره‌دهنده برای کالیبراسیون استفاده می‌کند کنار گذاشته شده‌اند.

86%

در مجموع

75%

ضعیف (4–5)

100%

میانی (7–8)

83%

قوی (+10)

مقایسه Prepamigo با پرطرفدارترین طرح‌های چت‌بات

بر اساس دلار کانادا. قیمت‌های Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شده‌اند. دقت، سهم 36 نوشته رسمی است که وقتی از مدل نام‌برده با کلماتی ساده درخواست امتیازدهی به نوشته می‌شود، در سطح تأییدشده امتیاز می‌گیرند؛ یک اجرا.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
قیمت ماهانه
CA$24.98 (با مالیات)
+CA$138 (بدون مالیات)
CA$276 (بدون مالیات)
امتیازدهی
نامحدود
محدود
محدود
بانک سوال آماده
بله
خیر
خیر
مجموعه‌های تمرینی
80
ندارد
ندارد
تمرین‌ها
+2,000
ندارد
ندارد
قالب CELPIP
بله
خیر
خیر
دقت
86%
61%
78%
نوشته‌های سطح میانی
100%
25%
75%

این سؤال درستی است که باید از هر ابزار تمرینی پرسید، و بیشتر ابزارها به آن پاسخ نمی‌دهند. یک نمره رایتینگ فقط وقتی ارزش دارد که به شما بگوید یک ارزیاب واقعی چه می‌گفت، و تنها راه فهمیدن این‌که آیا چنین می‌کند، اندازه‌گیری است. پس این مقاله همان اندازه‌گیری است، به‌روشنی چیده‌شده، با بخش‌هایی که به نفع ماست و بخش‌هایی که نیست.

پاسخ در یک پاراگراف: روی 36 پاسخ رایتینگ رسمی CELPIP، هرکدام با نمره‌ای مستقل تأییدشده، نمره‌دهنده رایتینگ Prepamigo در 86% مواقع به سطح تأییدشده رسید. هر انشای سطح میانی را درست گرفت، 75% انشاهای ضعیف و 83% انشاهای قوی را. در سه اجرای جداگانه، با اختلاف یک انشا کم یا زیاد، همان نتیجه را تولید کرد. وقتی با کلماتی ساده از مدل‌ها خواسته شد همان انشاها را نمره بدهند، بهترین مدل پیشرفته، GPT 5.6 sol، به 78% رسید؛ مدل‌های Claude به 61% و 56% رسیدند.

آن‌چه در ادامه می‌آید این است که اعداد در هر سطح چه معنایی دارند، خطاها کجا و در چه جهتی می‌افتند، نمره چقدر پایدار است، در مقایسه با چت‌بات‌هایی که شاید به‌جای آن استفاده می‌کنید چگونه است، چه چیزی در بازخورد تازه است، و با در نظر گرفتن همه این‌ها نمره خودتان را چطور بخوانید.

«دقیق» در این‌جا یعنی چه

ادعا نمی‌کنیم که نمره Prepamigo نتیجه آزمون شما را پیش‌بینی می‌کند. هیچ ابزار تمرینی نمی‌تواند این را قول بدهد. چیزی که اندازه می‌گیریم محدودتر و صادقانه‌تر است: با انشایی که نمره‌اش به‌طور مستقل تأیید شده، نمره‌دهنده چند بار نمره‌ای در همان سطح تولید می‌کند؟

رایتینگ CELPIP در مقیاسی گزارش می‌شود که تا 12 می‌رود، و نمره‌های تأییدشده در داده‌های مرجع ما در سه بازه می‌آیند: ضعیف، یعنی 4 یا 5؛ میانی، یعنی 7 یا 8؛ و قوی، یعنی 10 و بالاتر. نمره‌دهنده را وقتی درست می‌شماریم که نمره‌اش داخل بازه تأییدشده بیفتد. انشای قوی‌ای که 10، 11 یا 12 گرفته درست است؛ اگر 9 گرفته باشد یک خطاست، هرچند خطایی نزدیک.

دقت در هر سطح

انشاهای ضعیف: 75%. نُه از دوازده داخل بازه. هر سه خطا یک پله بالاتر رفتند: دو انشا نمره 6 و یکی نمره 7 گرفت. هرکدام کوتاه و کم‌مایه اما مرتب بود، با خطاهای کم، و همین مرتب بودن یک واحدی را برایش خرید که از نظر محتوا به دست نیاورده بود. این خطای مشخصه نمره‌دهنده در انتهای پایین مقیاس است، و خطایی دست‌ودل‌بازانه است: به یک نویسنده ضعیف گفته می‌شود کمی بهتر از آن‌چه هست است، هرگز بدتر.

انشاهای میانی: 100%. دوازده از دوازده داخل بازه 7 تا 8، در هر سه اجرا. این سطحی است که بیشتر داوطلبان در آن هستند و سطحی که بیشتر هدف‌های مهاجرتی را تعیین می‌کند، و همان‌جایی است که نمره‌دهنده قوی‌ترین است. همچنین جایی است که هر چت‌باتی که آزمودیم ضعیف‌ترین است، به دلایلی که بخش مقایسه توضیح می‌دهد.

انشاهای قوی: 83%. ده از دوازده. هر دو خطا یک 9 بودند، یک پله پایین‌تر. یک انشای قوی CELPIP بی‌نقص نیست، و نمره‌دهنده گاهی یک لغزش بیش از حد می‌خواند. هیچ‌کدام از خطاها 7 یا 8 نبودند؛ به یک انشای قوی هرگز گفته نمی‌شود که متوسط است.

به تفکیک تسک، نمره‌دهنده روی 89% پاسخ‌های ایمیل و 83% پاسخ‌های نظرسنجی درست بود. پاسخ‌های نظرسنجی سخت‌تر جای می‌گیرند چون تسک به یک موضع روشن و دلایل پرورش‌یافته پاداش می‌دهد، و پاسخی که میان گزینه‌ها این‌پا‌و‌آن‌پا می‌کند طبق قاعده جریمه می‌شود.

خطاها به کدام سو می‌روند

ارزیابی که در 14% مواقع اشتباه می‌کند می‌تواند به شیوه‌ای بی‌ضرر یا به شیوه‌ای زیان‌بار اشتباه کند. زیان‌بار این است که به داوطلبی که به 8 نیاز دارد بگوید آن را دارد در حالی که ندارد. بی‌ضرر این است که به او بگوید یک واحد کم دارد در حالی که ندارد؛ این یک هفته تمرین هزینه دارد و نه چیزی بیشتر.

از پنج خطای نمره‌دهنده روی 36 انشا، سه‌تا انشاهای ضعیفی بودند که 6 یا 7 گرفتند و دوتا انشاهای قوی‌ای که 9 گرفتند. هیچ انشای سطح میانی بالا نمره‌دهی نشد، و هیچ انشای ضعیفی قوی نمره‌دهی نشد. به زبان عملی: اگر نمره‌دهنده می‌گوید به سطح میانی رسیده‌اید، رسیده‌اید، یا یک واحد کم دارید. اگر می‌گوید به سطح قوی رسیده‌اید، رسیده‌اید. تنها جایی که تعارف می‌کند پایین مقیاس است، جایی که یک انشای کوتاه و مرتب می‌تواند واحدی را بگیرد که به دست نیاورده.

این را با چت‌بات‌ها روی همان انشاها مقایسه کنید. Claude Opus 5 هفت انشای سطح میانی را 9 یا 10 خواند، که برای داوطلبانی که بیشترین تأثیر را می‌بینند جهت زیان‌بار است. GPT 5.6 sol سه انشای سطح میانی را 6 خواند، که جهت بی‌ضرر است، و سه انشای قوی را در 9 نگه داشت. عدد دقت یک ارزیاب به شما می‌گوید چند بار اشتباه می‌کند؛ جهت به شما می‌گوید وقتی اشتباه می‌کند چه هزینه‌ای برایتان دارد.

ایمیل در برابر نظرسنجی

36 انشا میان دو تسک رایتینگ تقسیم شده بودند، و نمره‌دهنده در تسک ایمیل، با 89%، اندکی بهتر از پاسخ نظرسنجی، با 83%، عمل کرد. این یک خطای اضافه در سمت نظرسنجی است، و در همان جهتی است که انتظار دارید.

پاسخ‌های ایمیل عمدتاً بر اساس پوشش نمره می‌گیرند: آیا نکات الزامی پرداخته شده‌اند، آیا لحن برای خواننده مناسب است، آیا سلام و خداحافظی وجود دارد. این‌ها چیزهایی هستند که نمره‌دهنده پیش از هر قضاوتی طبق قاعده بررسی می‌کند، پس ایمیلی که آن‌ها را دارد به‌طور قابل‌اتکا جای می‌گیرد. پاسخ‌های نظرسنجی بر اساس کیفیت یک استدلال نمره می‌گیرند: یک موضع روشن و دلایلی که پرورش یافته‌اند نه فقط فهرست شده‌اند. پرورش یک قضاوت است، و قضاوت جایی است که یک ارزیاب، انسانی یا غیر آن، جا برای یک واحد اختلاف دارد.

برای شما، این یعنی نمره نظرسنجی اندکی نرم‌تر از نمره ایمیل است. اگر در پاسخ‌های نظرسنجی روی لبه هدف‌تان معلق هستید، پیش از آن‌که تصمیم بگیرید کجا ایستاده‌اید، دو تا بنویسید نه یکی.

از سمت شما پشت صفحه

نمای سطح به شما می‌گوید نمره‌دهنده روی انشایی با سطح معلوم چه می‌کند. شما از سمت دیگر به آن نگاه می‌کنید: نمره‌ای دارید و می‌خواهید بدانید چقدر باید آن را باور کنید.

  • اگر می‌گوید 4 یا 5: انشا نُه بار از نُه بار در سطح ضعیف بود. نمره پایین از نمره‌دهنده درست است.
  • اگر می‌گوید 7 یا 8: انشا دوازده بار از پانزده بار در سطح میانی بود؛ سه‌تای دیگر انشاهای ضعیفی بودند که یک پله بالا نمره گرفتند. 7 یا 8 یعنی میانی، و شاید کمی پایین‌تر.
  • اگر می‌گوید 10 یا بالاتر: انشا ده بار از ده بار در سطح قوی بود. یک 10 از نمره‌دهنده یک 10 است.
  • اگر می‌گوید 9: هر دو 9 در این آزمون انشاهای قوی تأییدشده بودند. 9 نمره‌ای است که باید با دقت خواند: یعنی نزدیک به بالا، و یک دلیل پرورش‌یافته یا یک انتخاب واژه دقیق تا آن فاصله دارد.
اگر روی انشایی که فکر می‌کردید عالی است 9 گرفتید، نتیجه نگیرید که متوقف شده‌اید. پاسخ نمونه را کنار انشای خود باز کنید، همان یک جایی را پیدا کنید که دلیلی را پرورش داده که شما فقط ادعا کرده‌اید، بازنویسی کنید، و دوباره نمره بگیرید.

آیا همان انشا همان نمره را می‌گیرد؟

دقت بدون ثبات، شانس است. پس هر 36 انشا را سه بار در روزهای مختلف نمره دادیم بدون این‌که چیزی در این میان تغییر کند. نمره‌دهنده 86%، 89% و 86% برگرداند. همان دوازده انشای سطح میانی هر بار داخل بازه بودند، و هیچ انشایی میان اجراها بیش از یک واحد جابه‌جا نشد.

ثبات از نحوه اجرای مدل نمره‌دهی می‌آید: استدلال خاموش، دمای ثابت، و مقایسه در برابر نمونه‌های ثابت نمره‌گذاری‌شده به‌جای یک قضاوت آزاد. برای شما، این یعنی تغییر در نمره شما تغییری در رایتینگ شماست. اگر انشایی را بازنویسی کنید و از 8 به 10 برود، این ارزیاب نیست که روز خوبی داشته.

این در مقایسه با چیزی که شاید به‌جایش استفاده کنید چگونه است

یک عدد دقت با چیزی برای مقایسه معنای بیشتری دارد. پس همان 36 انشا را به چت‌بات‌هایی دادیم که مردم واقعاً برای بررسی رایتینگ خود استفاده می‌کنند، به همان شیوه‌ای که یک نفر انجام می‌داد: تسک، انشا، و یک درخواست ساده برای نمره‌ای از 0 تا 12.

سهم انشاهایی که داخل سطح تأییدشده نمره گرفتند

همان 36 انشای رسمی. از هر مدل با کلماتی ساده خواسته شد انشا را نمره بدهد؛ Prepamigo در پیکربندی عادی عملیاتی خودش اجرا شد.

86%

Prepamigo Writing Scorer

78%

GPT 5.6 sol

69%

GPT 5.6 luna

61%

Gemini

61%

Claude Opus 5

58%

GPT-4o mini

56%

Claude Sonnet 5

نمره‌دهنده هشت واحد از بهترین چت‌بات و 25 تا 30 واحد از مدل‌های Claude جلوتر است. شکل خطاها همان چیزی است که اهمیت دارد. در انشاهای سطح میانی، Prepamigo روی 100% است، GPT 5.6 sol روی 75%، Gemini 42%، Claude Sonnet 5 33% و Claude Opus 5 25%: چت‌باتی که چیزی برای مقایسه ندارد یک 7 تمیز و کلی‌گو را 9 می‌خواند، یا یک 7 کلی‌گو با چند خطا را 6. در انشاهای قوی، Claude Opus 5 در واقع بهترین ارزیاب این آزمون است با 92% در برابر 83% Prepamigo؛ دست‌ودل‌باز است، که در بالا درست است و در هر جای دیگری اشتباه. GPT-4o mini به نُه انشا از دوازده انشای قوی نمره 9 داد.

چیزی که نمره‌دهنده دارد و چت‌بات‌ها ندارند، انشاهای واقعی نمره‌گذاری‌شده برای همان تسک در هر سطح است تا با آن مقایسه کند، و یک لایه قواعد که پیش از آن‌که هیچ مدلی نظر بدهد نکات الزامی، موضع نظرسنجی، سلام و خداحافظی، و طول متن را بررسی می‌کند. این تفاوت میان 86% و 78% است، و تقریباً همه‌اش در میانه مقیاس است.

چه چیزی در بازخورد رایتینگ شما تازه است

نمره فقط نیمی از چیزی است که دریافت می‌کنید. لایه بازخورد رایتینگ همراه با نمره‌دهنده از نو ساخته شده، و همه‌چیز در آن به متن خود شما گره خورده است. این‌ها چیزهایی است که تغییر کرده.

  • اصلاح‌هایی که می‌توانید در نوشته خودتان پیدا کنید. هر اصلاح گرامری، املایی و واژگانی دقیقاً همان کلمات پاسخ شما را نقل می‌کند، تا اپ بتواند آن‌ها را همان‌جا که نوشته‌اید برجسته کند. هر چیزی که بررسی‌کننده نتواند کلمه‌به‌کلمه در نوشته شما پیدا کند، پیش از آنکه ببینید حذف می‌شود.
  • یک پاسخ نمونه، ساخته‌شده از پاسخ خودتان. نسخه‌ای بازنویسی‌شده از پاسخ خودتان دریافت می‌کنید که ایده‌های شما را حفظ می‌کند، همه نکته‌های الزامی را پوشش می‌دهد و در بازه 150 تا 200 کلمه‌ای که تسک می‌خواهد قرار می‌گیرد. اگر بازنویسی اول به این طول نرسد، پیش از نمایش یک بار دیگر انجام می‌شود.
  • نکته الزامی‌ای که از قلم انداختید، با نام. برای تسک ایمیل، بازخورد نکته‌هایی از صورت سؤال را که پاسخ شما پوشش نداده فهرست می‌کند. یک نکته جاافتاده همچنین نمره انجام تسک را در 8 یا پایین‌تر نگه می‌دارد، بنابراین عدد و بازخورد هرگز با هم ناسازگار نمی‌شوند.
  • یک عامل محدودکننده برای هر بُعد. برای هر یک از چهار بُعد، بازخورد آن یک چیزی را که نمره را پایین نگه داشته، به‌طور مشخص نام می‌برد، یا به‌صراحت می‌گوید هیچ چیزی مانع نیست و چه چیزی آن نمره را بالا نگه داشته است. این‌که تصمیم گرفته شود یک بُعد مشکلی ندارد، خودش یک پاسخ واقعی است، نه یک جای خالی.
  • انتقاد در جای درست. لحن ضعیف مشکلِ انجام تسک است، انتخاب واژه مبهم مشکلِ واژگان است، جمله بی‌پایان مشکلِ خوانایی است. هر نکته زیر همان بُعدی ثبت می‌شود که به آن تعلق دارد، به‌جای اینکه همه در خلاصه کلی روی هم ریخته شوند.
  • بازنویسی در سطح جمله. جمله‌های مشخصی از نوشته شما با یک نسخه بهبودیافته و یک خط توضیح درباره اینکه چرا بهتر است برمی‌گردند، تا تغییر را ببینید نه اینکه فقط درباره‌اش بخوانید.
  • قوی‌ترین و ضعیف‌ترین بُعد شما، کنار هم. بازخورد به شما می‌گوید کدام یک از چهار بُعد نمره شما را بالا نگه داشته و کدام آن را پایین می‌کشد، تا بدون رمزگشایی چهار عدد بدانید بعد از این چه چیزی را تمرین کنید.

هر نقل‌قول در بازخورد پیش از نمایش با نوشته شما مطابقت داده می‌شود. اگر بررسی‌کننده نتواند آن کلمات را پیدا کند، آن خط حذف می‌شود. به همین دلیل بازخورد هرگز از شما نمی‌خواهد چیزی را اصلاح کنید که ننوشته‌اید.

نمره خود را چطور بخوانید

  1. 4 یا 5 درست است. اصلاحات را بخوانید؛ از متن خودتان نقل شده‌اند. سپس نکات ازقلم‌افتاده و پاسخ نمونه را بخوانید، و همان تسک را دوباره بنویسید.
  2. 7 یا 8 یعنی میانی، شاید کمی پایین‌تر. به عامل محدودکننده هر بُعد نگاه کنید. آن‌که یک مشکل مشخص را نام می‌برد، همان است که باید روی آن کار کنید.
  3. 9 یعنی نزدیک. انشای خود را پاراگراف به پاراگراف با پاسخ نمونه مقایسه کنید. فاصله معمولاً یک دلیل پرورش‌نیافته یا یک انتخاب واژه کلی است.
  4. 10 یا بالاتر یک 10 است. در آن نوع تسک آماده‌اید. سراغ تسکی بروید که از آن پرهیز می‌کنید.
  5. به تغییرها بیشتر از سطح‌ها اعتماد کنید. چون نمره پایدار است، تغییر میان تلاش‌ها در همان تسک، تغییری در رایتینگ شماست.

یک برنامه تمرینی که از عدد استفاده می‌کند

نکته یک نمره دقیق و پایدار این است که می‌توانید دست از شک کردن به آن بردارید و شروع به استفاده از آن کنید. این برنامه‌ای است که پیشنهاد می‌کنیم، ساخته‌شده حول آن‌چه اعداد این صفحه می‌گویند نمره می‌تواند و نمی‌تواند به شما بگوید.

  1. یک ایمیل و یک پاسخ نظرسنجی بنویسید، بدون آمادگی. اول به پاسخ نمونه نگاه نکنید. هر دو را ارسال کنید. دو نمره با هم سطح شروع شما هستند؛ اگر بیش از یک واحد با هم فرق دارند، پایین‌تر همان تسکی است که باید تمرین کنید.
  2. نکات ازقلم‌افتاده و عامل محدودکننده را پیش از اصلاحات بخوانید. اصلاحات جمله‌ها را درست می‌کنند؛ نکات ازقلم‌افتاده و عوامل محدودکننده نمره‌ها را درست می‌کنند. یک نکته الزامی جاافتاده بیشتر از همه ویرگول‌ها می‌ارزد.
  3. همان پاسخ را با پاسخ نمونه باز بازنویسی کنید. ایده‌های خودتان را نگه دارید، ساختار آن را قرض بگیرید. دوباره ارسال کنید. چون نمره‌دهنده به همان انشا همان نمره را می‌دهد، تفاوت میان دو ارسال کاملاً حاصل بازنویسی شماست.
  4. وقتی بازنویسی پابرجا ماند، سراغ تسک جدیدی بروید. یک 10 تکی روی یک بازنویسی هنوز یک سطح نیست. دو 10 روی دو تسک متفاوت هست.
  5. 9 را یک خطای نزدیک و 6 را یک 6 واقعی بخوانید. نمره‌دهنده انشاهای میانی را پایین نمی‌کشد. اگر می‌گوید 6، انشا کم‌مایه است، و عامل محدودکننده می‌گوید کجا.

سوالات متداول

نمره رایتینگ Prepamigo چقدر دقیق است؟ 86% در سطح دقیق روی 36 انشای رسمی: 75% ضعیف، 100% میانی، 83% قوی. همان نتیجه، با اختلاف یک انشا کم یا زیاد، در سه اجرا.

آیا همان نمره واقعی من است؟ هیچ ابزار تمرینی نمی‌تواند این را قول بدهد. چیزی که اندازه می‌گیریم این است که نمره‌دهنده چند بار با یک نمره تأییدشده روی همان انشا هم‌نظر است.

چرا روی یک انشای قوی 9 گرفتم؟ این رایج‌ترین خطای نمره‌دهنده در بالاست: دو انشا از دوازده انشای قوی 9 گرفتند. با پاسخ نمونه در کنارتان بازنویسی کنید و دوباره نمره بگیرید.

آیا از ChatGPT یا Claude بهتر است؟ 86% در برابر 78% برای GPT 5.6 sol و 61% و 56% برای مدل‌های Claude. در انشاهای سطح میانی، 100% در برابر 75% برای بهترین آن‌ها.

برای دیدن این‌که نمره‌دهنده چگونه کار می‌کند، بخوانید درون نمره‌دهنده رایتینگ Prepamigo. برای دیدن همین آزمون روی هر شش چت‌بات، بخوانید کدام هوش مصنوعی رایتینگ CELPIP را دقیق‌تر نمره می‌دهد. یا نوشتن پاسخ کنید و اعداد را خودتان ببینید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.

آیا نمره‌دهی رایتینگ CELPIP در Prepamigo دقیق است؟ اعداد، صادقانه | PrepAmigo