نمرهدهنده رایتینگ Prepamigo روی 36 انشای رسمی
سهم انشاهایی که داخل سطح تأییدشده نمره گرفتند، در مجموع و به تفکیک سطح. دوازده انشا در هر سطح در هر دو تسک رایتینگ؛ شش انشای نمونهای که نمرهدهنده برای کالیبراسیون استفاده میکند کنار گذاشته شدهاند.
86%
در مجموع
75%
ضعیف (4–5)
100%
میانی (7–8)
83%
قوی (+10)
مقایسه Prepamigo با پرطرفدارترین طرحهای چتبات
بر اساس دلار کانادا. قیمتهای Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شدهاند. دقت، سهم 36 نوشته رسمی است که وقتی از مدل نامبرده با کلماتی ساده درخواست امتیازدهی به نوشته میشود، در سطح تأییدشده امتیاز میگیرند؛ یک اجرا.
این سؤال درستی است که باید از هر ابزار تمرینی پرسید، و بیشتر ابزارها به آن پاسخ نمیدهند. یک نمره رایتینگ فقط وقتی ارزش دارد که به شما بگوید یک ارزیاب واقعی چه میگفت، و تنها راه فهمیدن اینکه آیا چنین میکند، اندازهگیری است. پس این مقاله همان اندازهگیری است، بهروشنی چیدهشده، با بخشهایی که به نفع ماست و بخشهایی که نیست.
پاسخ در یک پاراگراف: روی 36 پاسخ رایتینگ رسمی CELPIP، هرکدام با نمرهای مستقل تأییدشده، نمرهدهنده رایتینگ Prepamigo در 86% مواقع به سطح تأییدشده رسید. هر انشای سطح میانی را درست گرفت، 75% انشاهای ضعیف و 83% انشاهای قوی را. در سه اجرای جداگانه، با اختلاف یک انشا کم یا زیاد، همان نتیجه را تولید کرد. وقتی با کلماتی ساده از مدلها خواسته شد همان انشاها را نمره بدهند، بهترین مدل پیشرفته، GPT 5.6 sol، به 78% رسید؛ مدلهای Claude به 61% و 56% رسیدند.
آنچه در ادامه میآید این است که اعداد در هر سطح چه معنایی دارند، خطاها کجا و در چه جهتی میافتند، نمره چقدر پایدار است، در مقایسه با چتباتهایی که شاید بهجای آن استفاده میکنید چگونه است، چه چیزی در بازخورد تازه است، و با در نظر گرفتن همه اینها نمره خودتان را چطور بخوانید.
«دقیق» در اینجا یعنی چه
ادعا نمیکنیم که نمره Prepamigo نتیجه آزمون شما را پیشبینی میکند. هیچ ابزار تمرینی نمیتواند این را قول بدهد. چیزی که اندازه میگیریم محدودتر و صادقانهتر است: با انشایی که نمرهاش بهطور مستقل تأیید شده، نمرهدهنده چند بار نمرهای در همان سطح تولید میکند؟
رایتینگ CELPIP در مقیاسی گزارش میشود که تا 12 میرود، و نمرههای تأییدشده در دادههای مرجع ما در سه بازه میآیند: ضعیف، یعنی 4 یا 5؛ میانی، یعنی 7 یا 8؛ و قوی، یعنی 10 و بالاتر. نمرهدهنده را وقتی درست میشماریم که نمرهاش داخل بازه تأییدشده بیفتد. انشای قویای که 10، 11 یا 12 گرفته درست است؛ اگر 9 گرفته باشد یک خطاست، هرچند خطایی نزدیک.
دقت در هر سطح
انشاهای ضعیف: 75%. نُه از دوازده داخل بازه. هر سه خطا یک پله بالاتر رفتند: دو انشا نمره 6 و یکی نمره 7 گرفت. هرکدام کوتاه و کممایه اما مرتب بود، با خطاهای کم، و همین مرتب بودن یک واحدی را برایش خرید که از نظر محتوا به دست نیاورده بود. این خطای مشخصه نمرهدهنده در انتهای پایین مقیاس است، و خطایی دستودلبازانه است: به یک نویسنده ضعیف گفته میشود کمی بهتر از آنچه هست است، هرگز بدتر.
انشاهای میانی: 100%. دوازده از دوازده داخل بازه 7 تا 8، در هر سه اجرا. این سطحی است که بیشتر داوطلبان در آن هستند و سطحی که بیشتر هدفهای مهاجرتی را تعیین میکند، و همانجایی است که نمرهدهنده قویترین است. همچنین جایی است که هر چتباتی که آزمودیم ضعیفترین است، به دلایلی که بخش مقایسه توضیح میدهد.
انشاهای قوی: 83%. ده از دوازده. هر دو خطا یک 9 بودند، یک پله پایینتر. یک انشای قوی CELPIP بینقص نیست، و نمرهدهنده گاهی یک لغزش بیش از حد میخواند. هیچکدام از خطاها 7 یا 8 نبودند؛ به یک انشای قوی هرگز گفته نمیشود که متوسط است.
به تفکیک تسک، نمرهدهنده روی 89% پاسخهای ایمیل و 83% پاسخهای نظرسنجی درست بود. پاسخهای نظرسنجی سختتر جای میگیرند چون تسک به یک موضع روشن و دلایل پرورشیافته پاداش میدهد، و پاسخی که میان گزینهها اینپاوآنپا میکند طبق قاعده جریمه میشود.
خطاها به کدام سو میروند
ارزیابی که در 14% مواقع اشتباه میکند میتواند به شیوهای بیضرر یا به شیوهای زیانبار اشتباه کند. زیانبار این است که به داوطلبی که به 8 نیاز دارد بگوید آن را دارد در حالی که ندارد. بیضرر این است که به او بگوید یک واحد کم دارد در حالی که ندارد؛ این یک هفته تمرین هزینه دارد و نه چیزی بیشتر.
از پنج خطای نمرهدهنده روی 36 انشا، سهتا انشاهای ضعیفی بودند که 6 یا 7 گرفتند و دوتا انشاهای قویای که 9 گرفتند. هیچ انشای سطح میانی بالا نمرهدهی نشد، و هیچ انشای ضعیفی قوی نمرهدهی نشد. به زبان عملی: اگر نمرهدهنده میگوید به سطح میانی رسیدهاید، رسیدهاید، یا یک واحد کم دارید. اگر میگوید به سطح قوی رسیدهاید، رسیدهاید. تنها جایی که تعارف میکند پایین مقیاس است، جایی که یک انشای کوتاه و مرتب میتواند واحدی را بگیرد که به دست نیاورده.
این را با چتباتها روی همان انشاها مقایسه کنید. Claude Opus 5 هفت انشای سطح میانی را 9 یا 10 خواند، که برای داوطلبانی که بیشترین تأثیر را میبینند جهت زیانبار است. GPT 5.6 sol سه انشای سطح میانی را 6 خواند، که جهت بیضرر است، و سه انشای قوی را در 9 نگه داشت. عدد دقت یک ارزیاب به شما میگوید چند بار اشتباه میکند؛ جهت به شما میگوید وقتی اشتباه میکند چه هزینهای برایتان دارد.
ایمیل در برابر نظرسنجی
36 انشا میان دو تسک رایتینگ تقسیم شده بودند، و نمرهدهنده در تسک ایمیل، با 89%، اندکی بهتر از پاسخ نظرسنجی، با 83%، عمل کرد. این یک خطای اضافه در سمت نظرسنجی است، و در همان جهتی است که انتظار دارید.
پاسخهای ایمیل عمدتاً بر اساس پوشش نمره میگیرند: آیا نکات الزامی پرداخته شدهاند، آیا لحن برای خواننده مناسب است، آیا سلام و خداحافظی وجود دارد. اینها چیزهایی هستند که نمرهدهنده پیش از هر قضاوتی طبق قاعده بررسی میکند، پس ایمیلی که آنها را دارد بهطور قابلاتکا جای میگیرد. پاسخهای نظرسنجی بر اساس کیفیت یک استدلال نمره میگیرند: یک موضع روشن و دلایلی که پرورش یافتهاند نه فقط فهرست شدهاند. پرورش یک قضاوت است، و قضاوت جایی است که یک ارزیاب، انسانی یا غیر آن، جا برای یک واحد اختلاف دارد.
برای شما، این یعنی نمره نظرسنجی اندکی نرمتر از نمره ایمیل است. اگر در پاسخهای نظرسنجی روی لبه هدفتان معلق هستید، پیش از آنکه تصمیم بگیرید کجا ایستادهاید، دو تا بنویسید نه یکی.
از سمت شما پشت صفحه
نمای سطح به شما میگوید نمرهدهنده روی انشایی با سطح معلوم چه میکند. شما از سمت دیگر به آن نگاه میکنید: نمرهای دارید و میخواهید بدانید چقدر باید آن را باور کنید.
- اگر میگوید 4 یا 5: انشا نُه بار از نُه بار در سطح ضعیف بود. نمره پایین از نمرهدهنده درست است.
- اگر میگوید 7 یا 8: انشا دوازده بار از پانزده بار در سطح میانی بود؛ سهتای دیگر انشاهای ضعیفی بودند که یک پله بالا نمره گرفتند. 7 یا 8 یعنی میانی، و شاید کمی پایینتر.
- اگر میگوید 10 یا بالاتر: انشا ده بار از ده بار در سطح قوی بود. یک 10 از نمرهدهنده یک 10 است.
- اگر میگوید 9: هر دو 9 در این آزمون انشاهای قوی تأییدشده بودند. 9 نمرهای است که باید با دقت خواند: یعنی نزدیک به بالا، و یک دلیل پرورشیافته یا یک انتخاب واژه دقیق تا آن فاصله دارد.
آیا همان انشا همان نمره را میگیرد؟
دقت بدون ثبات، شانس است. پس هر 36 انشا را سه بار در روزهای مختلف نمره دادیم بدون اینکه چیزی در این میان تغییر کند. نمرهدهنده 86%، 89% و 86% برگرداند. همان دوازده انشای سطح میانی هر بار داخل بازه بودند، و هیچ انشایی میان اجراها بیش از یک واحد جابهجا نشد.
ثبات از نحوه اجرای مدل نمرهدهی میآید: استدلال خاموش، دمای ثابت، و مقایسه در برابر نمونههای ثابت نمرهگذاریشده بهجای یک قضاوت آزاد. برای شما، این یعنی تغییر در نمره شما تغییری در رایتینگ شماست. اگر انشایی را بازنویسی کنید و از 8 به 10 برود، این ارزیاب نیست که روز خوبی داشته.
این در مقایسه با چیزی که شاید بهجایش استفاده کنید چگونه است
یک عدد دقت با چیزی برای مقایسه معنای بیشتری دارد. پس همان 36 انشا را به چتباتهایی دادیم که مردم واقعاً برای بررسی رایتینگ خود استفاده میکنند، به همان شیوهای که یک نفر انجام میداد: تسک، انشا، و یک درخواست ساده برای نمرهای از 0 تا 12.
سهم انشاهایی که داخل سطح تأییدشده نمره گرفتند
همان 36 انشای رسمی. از هر مدل با کلماتی ساده خواسته شد انشا را نمره بدهد؛ Prepamigo در پیکربندی عادی عملیاتی خودش اجرا شد.
86%
Prepamigo Writing Scorer
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
نمرهدهنده هشت واحد از بهترین چتبات و 25 تا 30 واحد از مدلهای Claude جلوتر است. شکل خطاها همان چیزی است که اهمیت دارد. در انشاهای سطح میانی، Prepamigo روی 100% است، GPT 5.6 sol روی 75%، Gemini 42%، Claude Sonnet 5 33% و Claude Opus 5 25%: چتباتی که چیزی برای مقایسه ندارد یک 7 تمیز و کلیگو را 9 میخواند، یا یک 7 کلیگو با چند خطا را 6. در انشاهای قوی، Claude Opus 5 در واقع بهترین ارزیاب این آزمون است با 92% در برابر 83% Prepamigo؛ دستودلباز است، که در بالا درست است و در هر جای دیگری اشتباه. GPT-4o mini به نُه انشا از دوازده انشای قوی نمره 9 داد.
چیزی که نمرهدهنده دارد و چتباتها ندارند، انشاهای واقعی نمرهگذاریشده برای همان تسک در هر سطح است تا با آن مقایسه کند، و یک لایه قواعد که پیش از آنکه هیچ مدلی نظر بدهد نکات الزامی، موضع نظرسنجی، سلام و خداحافظی، و طول متن را بررسی میکند. این تفاوت میان 86% و 78% است، و تقریباً همهاش در میانه مقیاس است.
چه چیزی در بازخورد رایتینگ شما تازه است
نمره فقط نیمی از چیزی است که دریافت میکنید. لایه بازخورد رایتینگ همراه با نمرهدهنده از نو ساخته شده، و همهچیز در آن به متن خود شما گره خورده است. اینها چیزهایی است که تغییر کرده.
- اصلاحهایی که میتوانید در نوشته خودتان پیدا کنید. هر اصلاح گرامری، املایی و واژگانی دقیقاً همان کلمات پاسخ شما را نقل میکند، تا اپ بتواند آنها را همانجا که نوشتهاید برجسته کند. هر چیزی که بررسیکننده نتواند کلمهبهکلمه در نوشته شما پیدا کند، پیش از آنکه ببینید حذف میشود.
- یک پاسخ نمونه، ساختهشده از پاسخ خودتان. نسخهای بازنویسیشده از پاسخ خودتان دریافت میکنید که ایدههای شما را حفظ میکند، همه نکتههای الزامی را پوشش میدهد و در بازه 150 تا 200 کلمهای که تسک میخواهد قرار میگیرد. اگر بازنویسی اول به این طول نرسد، پیش از نمایش یک بار دیگر انجام میشود.
- نکته الزامیای که از قلم انداختید، با نام. برای تسک ایمیل، بازخورد نکتههایی از صورت سؤال را که پاسخ شما پوشش نداده فهرست میکند. یک نکته جاافتاده همچنین نمره انجام تسک را در 8 یا پایینتر نگه میدارد، بنابراین عدد و بازخورد هرگز با هم ناسازگار نمیشوند.
- یک عامل محدودکننده برای هر بُعد. برای هر یک از چهار بُعد، بازخورد آن یک چیزی را که نمره را پایین نگه داشته، بهطور مشخص نام میبرد، یا بهصراحت میگوید هیچ چیزی مانع نیست و چه چیزی آن نمره را بالا نگه داشته است. اینکه تصمیم گرفته شود یک بُعد مشکلی ندارد، خودش یک پاسخ واقعی است، نه یک جای خالی.
- انتقاد در جای درست. لحن ضعیف مشکلِ انجام تسک است، انتخاب واژه مبهم مشکلِ واژگان است، جمله بیپایان مشکلِ خوانایی است. هر نکته زیر همان بُعدی ثبت میشود که به آن تعلق دارد، بهجای اینکه همه در خلاصه کلی روی هم ریخته شوند.
- بازنویسی در سطح جمله. جملههای مشخصی از نوشته شما با یک نسخه بهبودیافته و یک خط توضیح درباره اینکه چرا بهتر است برمیگردند، تا تغییر را ببینید نه اینکه فقط دربارهاش بخوانید.
- قویترین و ضعیفترین بُعد شما، کنار هم. بازخورد به شما میگوید کدام یک از چهار بُعد نمره شما را بالا نگه داشته و کدام آن را پایین میکشد، تا بدون رمزگشایی چهار عدد بدانید بعد از این چه چیزی را تمرین کنید.
هر نقلقول در بازخورد پیش از نمایش با نوشته شما مطابقت داده میشود. اگر بررسیکننده نتواند آن کلمات را پیدا کند، آن خط حذف میشود. به همین دلیل بازخورد هرگز از شما نمیخواهد چیزی را اصلاح کنید که ننوشتهاید.
نمره خود را چطور بخوانید
- 4 یا 5 درست است. اصلاحات را بخوانید؛ از متن خودتان نقل شدهاند. سپس نکات ازقلمافتاده و پاسخ نمونه را بخوانید، و همان تسک را دوباره بنویسید.
- 7 یا 8 یعنی میانی، شاید کمی پایینتر. به عامل محدودکننده هر بُعد نگاه کنید. آنکه یک مشکل مشخص را نام میبرد، همان است که باید روی آن کار کنید.
- 9 یعنی نزدیک. انشای خود را پاراگراف به پاراگراف با پاسخ نمونه مقایسه کنید. فاصله معمولاً یک دلیل پرورشنیافته یا یک انتخاب واژه کلی است.
- 10 یا بالاتر یک 10 است. در آن نوع تسک آمادهاید. سراغ تسکی بروید که از آن پرهیز میکنید.
- به تغییرها بیشتر از سطحها اعتماد کنید. چون نمره پایدار است، تغییر میان تلاشها در همان تسک، تغییری در رایتینگ شماست.
یک برنامه تمرینی که از عدد استفاده میکند
نکته یک نمره دقیق و پایدار این است که میتوانید دست از شک کردن به آن بردارید و شروع به استفاده از آن کنید. این برنامهای است که پیشنهاد میکنیم، ساختهشده حول آنچه اعداد این صفحه میگویند نمره میتواند و نمیتواند به شما بگوید.
- یک ایمیل و یک پاسخ نظرسنجی بنویسید، بدون آمادگی. اول به پاسخ نمونه نگاه نکنید. هر دو را ارسال کنید. دو نمره با هم سطح شروع شما هستند؛ اگر بیش از یک واحد با هم فرق دارند، پایینتر همان تسکی است که باید تمرین کنید.
- نکات ازقلمافتاده و عامل محدودکننده را پیش از اصلاحات بخوانید. اصلاحات جملهها را درست میکنند؛ نکات ازقلمافتاده و عوامل محدودکننده نمرهها را درست میکنند. یک نکته الزامی جاافتاده بیشتر از همه ویرگولها میارزد.
- همان پاسخ را با پاسخ نمونه باز بازنویسی کنید. ایدههای خودتان را نگه دارید، ساختار آن را قرض بگیرید. دوباره ارسال کنید. چون نمرهدهنده به همان انشا همان نمره را میدهد، تفاوت میان دو ارسال کاملاً حاصل بازنویسی شماست.
- وقتی بازنویسی پابرجا ماند، سراغ تسک جدیدی بروید. یک 10 تکی روی یک بازنویسی هنوز یک سطح نیست. دو 10 روی دو تسک متفاوت هست.
- 9 را یک خطای نزدیک و 6 را یک 6 واقعی بخوانید. نمرهدهنده انشاهای میانی را پایین نمیکشد. اگر میگوید 6، انشا کممایه است، و عامل محدودکننده میگوید کجا.
سوالات متداول
نمره رایتینگ Prepamigo چقدر دقیق است؟ 86% در سطح دقیق روی 36 انشای رسمی: 75% ضعیف، 100% میانی، 83% قوی. همان نتیجه، با اختلاف یک انشا کم یا زیاد، در سه اجرا.
آیا همان نمره واقعی من است؟ هیچ ابزار تمرینی نمیتواند این را قول بدهد. چیزی که اندازه میگیریم این است که نمرهدهنده چند بار با یک نمره تأییدشده روی همان انشا همنظر است.
چرا روی یک انشای قوی 9 گرفتم؟ این رایجترین خطای نمرهدهنده در بالاست: دو انشا از دوازده انشای قوی 9 گرفتند. با پاسخ نمونه در کنارتان بازنویسی کنید و دوباره نمره بگیرید.
آیا از ChatGPT یا Claude بهتر است؟ 86% در برابر 78% برای GPT 5.6 sol و 61% و 56% برای مدلهای Claude. در انشاهای سطح میانی، 100% در برابر 75% برای بهترین آنها.
برای دیدن اینکه نمرهدهنده چگونه کار میکند، بخوانید درون نمرهدهنده رایتینگ Prepamigo. برای دیدن همین آزمون روی هر شش چتبات، بخوانید کدام هوش مصنوعی رایتینگ CELPIP را دقیقتر نمره میدهد. یا نوشتن پاسخ کنید و اعداد را خودتان ببینید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.
