نمره‌دهی

آیا نمره‌دهی اسپیکینگ CELPIP در Prepamigo دقیق است؟ اعداد، صادقانه

۶ سپتامبر ۲۰۲۶

Engine 2.0 روی 48 پاسخ کنارگذاشته‌شده

سهم پاسخ‌هایی که در باند تأییدشده نمره گرفتند. سه اجرای مجزا در روزهای مختلف هرکدام 81.3% کلی تولید کردند.

81%

سطح دقیق

مقایسه Prepamigo با پرطرفدارترین طرح‌های چت‌بات

بر اساس دلار کانادا. قیمت‌های Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شده‌اند. دقت، سهم پاسخ‌های مجموعه آزمون کنارگذاشته‌شده است که وقتی از مدل نام‌برده با کلماتی ساده درخواست امتیازدهی می‌شود، در سطح تأییدشده امتیاز می‌گیرند؛ میانگین سه اجرا.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
قیمت ماهانه
CA$24.98 (با مالیات)
+CA$138 (بدون مالیات)
CA$276 (بدون مالیات)
امتیازدهی
نامحدود
محدود
محدود
بانک سوال آماده
بله
خیر
خیر
مجموعه‌های تمرینی
80
ندارد
ندارد
تمرین‌ها
+2,000
ندارد
ندارد
قالب CELPIP
بله
خیر
خیر
دقت
81%
62%
35%
پاسخ‌های سطح بالا
71%
50%
25%

این سؤال درستی است که باید از هر ابزار تمرینی پرسید، و بیشتر ابزارها به آن پاسخ نمی‌دهند. یک نمره اسپیکینگ فقط وقتی ارزش دارد که به شما بگوید یک ارزیاب واقعی چه می‌گوید، و تنها راه دانستن این‌که آیا این کار را می‌کند اندازه‌گیری است. پس این مقاله همان اندازه‌گیری است، به‌روشنی چیده‌شده، با بخش‌هایی که به نفع ما هستند و بخش‌هایی که نیستند.

پاسخ در یک پاراگراف: روی 48 پاسخ اسپیکینگ که Scoring Engine 2.0 پرپامیگو هرگز نمی‌دیده، هرکدام با نمره‌ای مستقل تأییدشده، موتور در 81% مواقع به سطح تأییدشده و در 92% مواقع در فاصله یک واحد از آن رسید. در هر سه اجرای مجزا همان 81% را تولید کرد. بیشترین دقت را روی پاسخ‌های ضعیف و سطح میانی دارد، 88% و 85%، و کمترین دقت را روی پاسخ‌های سطح بالا، 71%، جایی که خطای مشخصه‌اش دادن عدد 8 به‌جای 10 است. وقتی با کلماتی ساده از آن خواسته شد همان متن‌ها را نمره بدهد، بهترین مدل عمومی هوش مصنوعی که آزمودیم به 62% رسید، و ضعیف‌ترین به 31%؛ با رویه کامل نمره‌دهی ما، بهترین آن‌ها به 77% رسید.

آن‌چه در ادامه می‌آید این است که چگونه این اعداد را به‌دست آوردیم، در هر سطح نمره چه معنایی دارند، چقدر باثبات‌اند، خطاها کجا می‌افتند، نمره چگونه با جایگزین‌هایی که ممکن است به‌جای آن استفاده کنید مقایسه می‌شود، و چگونه نمره خودتان را با همه این‌ها بخوانید. اگر فقط توصیه عملی می‌خواهید، به بخش خواندن نمره خودتان بروید. اگر می‌خواهید تصمیم بگیرید که آیا اصلاً به این عدد اعتماد کنید، همه‌اش را بخوانید.

معنای «دقیق» در این‌جا

پیش از هر عددی، تعریف. ادعا نمی‌کنیم نمره Prepamigo نتیجه آزمون شما را پیش‌بینی می‌کند. هیچ ابزار تمرینی نمی‌تواند آن را تعهد کند، و هرکسی که این کار را می‌کند تخمین می‌زند. آن‌چه اندازه می‌گیریم محدودتر و صادقانه‌تر است: با پاسخی گفتاری که نمره‌اش به‌طور مستقل تأیید شده، موتور چند بار نمره‌ای در همان سطح تولید می‌کند؟

اسپیکینگ CELPIP در مقیاسی گزارش می‌شود که تا 12 می‌رود، و نمره‌های تأییدشده در داده مرجع ما در سه باند می‌آیند: پایین، یعنی 4 یا 5؛ میانی، یعنی 7 یا 8؛ و بالا، یعنی 10 و بیشتر. موتور را وقتی درست می‌شماریم که نمره‌اش درون باند تأییدشده بیفتد. پاسخی که در بالا تأیید شده، اگر موتور به آن 9، 10 یا 11 بدهد درست نمره‌دهی شده است. با خوانشی سخت‌گیرانه‌تر که فقط 10 و بالاتر را می‌پذیرد، هر رقم این صفحه چند واحد پایین می‌آید و هر مقایسه در همان ترتیب باقی می‌ماند.

اعداد اصلی

81% در عمل چه معنایی دارد؟ اگر ده پاسخ در سطحی ثابت ضبط کنید، موتور حدود هشت‌تای آن‌ها را در باند درست و حدود یکی دیگر را در فاصله یک واحد از آن قرار می‌دهد. یک 5 را در باند 10 یا یک 10 را در باند 5 نمی‌گذارد؛ این حتی یک‌بار هم در 144 پاسخ نمره‌گرفته در سه اجرا اتفاق نیفتاد. اشتباهاتی که می‌کند اشتباهات یک ارزیاب دقیق روی یک پاسخ مرزی هستند، و بخش بعدی نشان می‌دهد کجا متمرکز می‌شوند.

دقت در هر سطح نمره

دقت بر اساس باند تأییدشده

16 پاسخ کنارگذاشته‌شده در هر باند. هر ستون سهم پاسخ‌های آن باند است که درون باند نمره گرفتند.

88%

پایین (4–5)

85%

میانی (7–8)

71%

بالا (+10)

پاسخ‌های سطح پایین: 88%. پاسخ‌های ضعیف آسان‌ترین برای شناسایی هستند. آن‌ها گرایش دارند کوتاه باشند، عبارت‌های دستور را دوباره استفاده کنند، و بخش‌هایی از تسک را ناتمام بگذارند. موتور بیشتر مواقع آن نشانه‌ها را می‌گیرد. وقتی اشتباه می‌کند، به‌سمت بالا اشتباه می‌کند: در هر مورد، پاسخ عدد 8 گرفته به‌جای 4 یا 5. علت تقریباً همیشه پاسخی است که روان و مطمئن به‌نظر می‌رسد اما کم می‌گوید؛ ارائه سطحی به آن می‌دهد که در محتوا کسبش نکرده. این را می‌دانیم چون می‌بینیم کدام ابعاد را ارزیاب‌ها بالا گذاشته‌اند، و هر بار مورد قابلیت شنیدن است.

پاسخ‌های سطح میانی: 85%. این‌ها به یک معنا سخت‌ترین برای نمره‌دهی هستند، چون مخلوطی واقعی از نقاط قوت و ضعف دارند که باید سنجیده شود نه فقط شناسایی شود. خطاهای موتور در این‌جا به هر دو جهت می‌روند. چند پاسخ با مکث قابل‌مشاهده اما ایده‌های قوی به 5 یا 6 کشیده شدند؛ چند پاسخ با ارائه صیقلی به 10 رانده شدند. مرحله تطبیق میان دو ارزیاب بیشتر این‌ها را می‌گیرد، که چرا این رقم به این اندازه بالاست.

پاسخ‌های سطح بالا: 71%. این ضعیف‌ترین باند و آن‌که بیشترین حرف در موردش می‌زنیم است، چون خطایش این‌قدر پیوسته است. وقتی موتور یک پاسخ سطح بالا را از دست می‌دهد، عدد 8 به آن می‌دهد. نه 7، نه 6؛ 8، در هر مورد جز چند 9 که درست شمرده می‌شوند. موتور یک پاسخ قوی را می‌بیند و یک درجه عقب می‌نشیند.

این ارزش زمینه دارد. کشیده‌شدن به‌سوی 8 روی پاسخ‌های قوی یک ویژگی خاص Prepamigo نیست؛ شکست مشخصه هر ارزیاب خودکاری است که آزموده‌ایم، کالیبره‌شده یا نه. موتور قبلی ما این مشکل را بسیار بدتر داشت. وقتی به‌سادگی پرسیده شد همان پاسخ‌ها را نمره بدهد، بهترین مدل عمومی 56% پاسخ‌های سطح بالا را شناسایی کرد؛ مدل پشت طرح‌های پولی ChatGPT 25% را شناسایی کرد؛ و حتی با رویه کامل ما، هیچ‌کدام از 63% فراتر نرفت. هفتادویک درصد بهترین رقمی است که به‌دست آورده‌ایم، و همچنان همان عددی است که بیشتر می‌خواهیم بهبود دهیم.

مشکل 8، از سمت شما پشت صفحه

نمای سطح به شما می‌گوید موتور روی پاسخی با سطح مشخص چه می‌کند. شما آن را از جهت دیگر نگاه می‌کنید: نمره‌ای دارید و می‌خواهید بدانید چقدر باور کنید. پس این‌جا همان داده برعکس شده. برای هر نمره‌ای که موتور می‌دهد، پاسخ واقعاً چند بار در آن سطح بوده؟

  • اگر موتور می‌گوید 4 یا 5: پاسخ در 93% مواقع واقعاً در سطح پایین بود. باقی پاسخ‌های سطح میانی با مکث زیاد بودند. یک نمره پایین از Engine 2.0 تقریباً همیشه درست است.
  • اگر موتور می‌گوید 10: پاسخ در 92% مواقع واقعاً در سطح بالا بود. یک 10 از Engine 2.0 یک 10 است.
  • اگر موتور می‌گوید 8: پاسخ در 67% مواقع در سطح میانی، در 23% مواقع در سطح بالا، و در 10% مواقع در سطح پایین بود. 8 تنها نمره‌ای است که ارزش خواندن دقیق دارد.

به‌زبان ساده: یک 8 از Engine 2.0 یعنی «احتمالاً میانی، اما شاید بهتر». تقریباً یک پاسخ از هر چهاری که 8 می‌گیرد واقعاً یک 10 بود. اگر روی پاسخی 8 گرفتید که فکر می‌کردید عالی بود، نتیجه نگیرید که آماده نیستید. همان تسک را دوباره ضبط کنید. یک 10 پیوسته در سه تلاش یک 10 است؛ یک 8 پیوسته در سه تلاش یک 8 است؛ یک مخلوط یعنی پاسخی روی مرز است، و بازخورد به شما می‌گوید کدام بعد آن را آن‌جا نگه داشته.

سودمندترین عادت برای یک داوطلب قوی این است که یک 8 را سؤال بداند نه یک حکم. بازخورد عبارت‌هایی را که ارزیاب‌ها به آن‌ها واکنش دادند نقل می‌کند. اگر آن عبارت‌ها همه درباره مکث و شروع دوباره هستند، احتمالاً 10 در محتوا و 9 در ارائه هستید، و یک تلاش دیگر آن را نشان خواهد داد.

آیا همان ضبط همان نمره را می‌گیرد؟

دقت بدون ثبات شانس است. اگر همان ضبط بتواند امروز 8 و فردا 10 بگیرد، رقم 81% میانگینی روی نویز بود و نمی‌توانستید از نمره برای ردیابی چیزی استفاده کنید. پس تکرارپذیری را مستقیماً آزمودیم.

48 پاسخ کنارگذاشته‌شده سه بار مجزا، در روزهای مختلف، بدون تغییری در میان، نمره گرفتند. رقم کلی در هر اجرا 81.3% بود. در سطح پاسخ‌های تکی، 87.5% هر سه بار نمره‌ای یکسان گرفتند، و فقط 4.2% دو واحد یا بیشتر حرکت کردند. آن تعداد کم پاسخ‌هایی هستند که دقیقاً روی مرز میان دو باند نشسته‌اند، جایی که تفاوت کوچکی در قضاوت به‌طور مشروع نمره را به یک سو می‌کشاند.

این ثبات از یک انتخاب طراحی مشخص می‌آید. هر یک از دو ارزیاب موتور روی هر پاسخ سه بار رأی می‌دهد، و رأی میانی نگه داشته می‌شود. وقتی همان پیکربندی را با یک رأی به‌جای سه رأی آزمودیم، نمرات یکسان میان اجراها از 87.5% به 77% سقوط کرد، و سهم پاسخ‌هایی که دو واحد یا بیشتر جهش می‌کنند بیش از دو برابر شد. رأی‌گیری رقم دقت را تغییر نداد. تغییر داد که آیا رقم دقت معنایی دارد یا نه.

برای شما، ثبات یعنی تغییر در نمره‌تان تغییری در اسپیکینگ‌تان است. اگر همان نوع تسک را سه بار در طول یک هفته ضبط کنید و نمره از 8 به 10 برود، این حال‌وهوای خوب ارزیاب نیست. خود شمایید.

این چگونه با چیزی که ممکن است به‌جای آن استفاده کنید مقایسه می‌شود

یک رقم دقت با چیزی برای مقایسه معنای بیشتری دارد. پس همان 48 پاسخ کنارگذاشته‌شده را از میان مدل‌های عمومی هوش مصنوعی که مردم واقعاً برای نمره‌دهی تمرین‌شان استفاده می‌کنند عبور دادیم، همان‌طور که یک فرد این کار را می‌کند: به هر مدل متن پیاده‌شده کلمه‌به‌کلمه و تسک را دادیم، به آن گفتیم یک ارزیاب باتجربه CELPIP است، و برای نمره‌ای از 0 تا 12 پرسیدیم. سه اجرا از هرکدام، میانگین‌گیری‌شده.

سهم پاسخ‌هایی که در باند تأییدشده نمره گرفتند

همان 48 پاسخ کنارگذاشته‌شده. به هر مدل با کلماتی ساده خواسته شد متن پیاده‌شده را نمره بدهد؛ میانگین سه اجرا. Engine 2.0 در پیکربندی عادی عملیاتی خودش اجرا شد.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Engine 2.0 از هر مدل بین نوزده و پنجاه‌ویک واحد پیشی می‌گیرد. وقتی به‌سادگی پرسیده می‌شود، هر مدل عمومی سخت‌گیرانه نمره می‌دهد: خطای روی پاسخ ضعیف معمولاً 3 است، خطای روی پاسخ قوی 7 یا 8. Claude Opus 5 و Gemini تنها دو موردی هستند که بالای نیمی‌اند. سه مدل بزرگ‌تر GPT بین 31% و 37% هستند، و پاسخ سطح بالا را بین 13% و 27% مواقع شناسایی می‌کنند.

سپس رویه کامل خودمان را به هر مدل دادیم: همان مثال‌های کالیبراسیون برای تسک دقیق، همان مقایسه اجباری، و یک یادداشت کالیبراسیون کوتاه متناسب با گرایش‌های خودش. این بهترین چیزی است که هر مدل در دستان ما به‌دست آورد، و چیزی نیست که یک داوطلب بتواند بدون مثال‌ها بازتولید کند. Opus 5 به 77% رسید، GPT 5.6 sol و Gemini به 71%، GPT 5.5 و Sonnet 5 به 69%، luna به 63% و GPT-4o mini به 50%. هرکدام از آن‌ها همچنان پشت Engine 2.0 تمام کردند، و هیچ‌کدام بیش از 63% پاسخ‌های سطح بالا را شناسایی نکرد.

چه چیزی در بازخورد شما تازه است

Engine 2.0 با یک لایه بازخورد کاملاً بازسازی‌شده عرضه می‌شود. این لایه شواهد دو ارزیاب را می‌خواند، نه فقط نمره را، و در برابر سه نوع داوطلب آزمایش شده است: کسی که برای اولین بار با CELPIP آشنا می‌شود، کسی با زبان انگلیسی ضعیف که به دنبال ترفند است، و کسی که فقط نیم ساعت در روز وقت دارد و آزمونش هفته آینده است. این‌ها چیزهایی است که تغییر کرده.

  • نقل‌قول از حرف‌های خودتان. هر نکته بازخورد، دقیقاً همان عبارتی از متن پاسخ شما را نقل می‌کند که ارزیاب‌ها به آن واکنش داده‌اند. اگر عبارتی داخل گیومه باشد، عیناً کپی شده است؛ در بررسی ما 157 از 158 نقل‌قول این‌گونه بودند. بازخورد هرگز چیزی را که نگفته‌اید اختراع نمی‌کند.
  • اولین چیزی که باید اصلاح کنید. هر پاسخ یک اقدام اصلی می‌گیرد: تغییری که بیشترین تأثیر را بر نمره شما دارد و با ساده‌ترین کلمات ممکن روی صفحه نوشته شده است. پس از آن دو اقدام عملی دیگر می‌آید، سپس یک فهرست بررسی سه‌موردی که پیش از شروع صحبت باید در ذهن مرور کنید.
  • توصیه‌ای متناسب با نوع تسک. دادن توصیه، توصیف یک صحنه و قانع کردن کسی بر اساس معیارهای متفاوتی نمره می‌گیرند. بازخورد اکنون می‌داند هر یک از هشت نوع تسک به چه چیزی امتیاز می‌دهد و بر همان تمرکز می‌کند، به‌جای تکرار همان نکته‌های کلی در همه تسک‌ها.
  • کدام بُعد را اول تمرین کنید. بازخورد به شما می‌گوید کدام یک از چهار بُعد ضعیف‌ترین و کدام قوی‌ترین شماست، تا بدانید نمره بعدی از کجا می‌آید، بدون اینکه این موضوع پشت یک عدد پنهان بماند.
  • چه چیزی از خواسته تسک را از قلم انداختید. برای معیار انجام تسک، بازخورد بخش‌های مشخصی از دستور تسک را که پوشش نداده‌اید فهرست می‌کند، یا به‌صراحت می‌گوید که همه آن‌ها را پوشش داده‌اید.
  • چیزهایی که واقعاً می‌توانید تمرین کنید. هر راهکار چیزی است که می‌توانید پیش از تلاش بعدی با صدای بلند تمرین کنید. هیچ توصیه‌ای برای واضح‌تر صحبت کردن یا کم کردن لهجه وجود ندارد: لهجه چیزی نیست که «قابل‌فهم بودن» بسنجد، و بازخورد هرگز درباره آن نظر نمی‌دهد.
  • هیچ سرزنشی برای زمان‌سنج. پاسخی که پس از تکمیل تسک به‌خاطر پایان زمان قطع شده باشد، برای همین قطع‌شدن نمره از دست نمی‌دهد، و بازخورد به‌خاطر آن شما را سرزنش نمی‌کند.

وقتی یک مدل داوری مستقل این بازخورد را با آنچه سیستم قبلی ما برای همان پاسخ‌ها تولید کرده بود مقایسه کرد، بدون اینکه بداند کدام‌یک متعلق به کدام سیستم است، در 20 از 24 مقایسه بازخورد جدید را ترجیح داد؛ هم در قضاوت به‌شیوه یک ارزیاب و هم در قضاوت به‌شیوه یک داوطلب.

چگونه نمره خودتان را بخوانید

  1. یک 4 یا 5 تقریباً حتماً درست است. موتور پاسخ‌های ضعیف را در 88% مواقع شناسایی می‌کند، و وقتی می‌گوید 4 یا 5 در 93% مواقع درست است. بازخورد را بخوانید تا ببینید کدام بعد پایین‌ترین است و روی همان کار کنید.
  2. یک 10 یک 10 است. وقتی موتور می‌گوید 10، پاسخ در 92% مواقع واقعاً در سطح بالا بود. برای آن نوع تسک آماده‌اید. به تسک‌هایی بروید که از آن‌ها اجتناب می‌کنید.
  3. یک 8 یک سؤال است. دو‌سوم مواقع یعنی میانی. یک بار از چهار یعنی بالا. همان تسک را دوباره ضبط کنید و به الگو در تلاش‌ها نگاه کنید.
  4. اعتماد بیشتر از سطح تغییر می‌کند. چون نمره باثبات است، تغییری میان تلاش‌ها تغییری در اسپیکینگ شماست. تکرار همان نوع تسک سریع‌ترین راه فهمیدن این است که آیا یک عادت جدید کار می‌کند.
  5. نقل‌قول‌ها را بخوانید. عبارت‌های نقل‌شده در بازخورد شما همان‌هایی هستند که ارزیاب‌ها به آن‌ها واکنش دادند. آن‌ها کلمات مشخصی هستند که باید تغییر دهید.

سوالات متداول

نمره اسپیکینگ Prepamigo چقدر دقیق است؟ روی 48 پاسخ نادیده با نمره‌های تأییدشده: 81% در باند دقیق، 92% در فاصله یک واحد، یکسان در سه اجرا. بر اساس باند: 88% پایین، 85% میانی، 71% بالا.

آیا همان نمره واقعی من است؟ هیچ ابزار تمرینی نمی‌تواند آن را تعهد کند. آن‌چه اندازه می‌گیریم این است که موتور چند بار روی همان پاسخ با نمره‌ای تأییدشده موافق است. نمره خودتان را به‌عنوان سطحی با جهت بخوانید، و به الگو در چند تلاش نگاه کنید.

چرا روی پاسخی که فکر می‌کردم عالی است 8 گرفتم؟ این بزرگ‌ترین خطای باقی‌مانده موتور است: یک 8 از هر چهار واقعاً یک 10 بود. همان تسک را دوباره ضبط کنید. یک 10 پیوسته در چند تلاش یک 10 است.

آیا همان ضبط دو بار همان نمره را می‌گیرد؟ 87.5% یکسان در سه اجرا؛ فقط 4.2% دو واحد یا بیشتر حرکت کردند، همه روی مرزهای باند.

برای دیدن این‌که موتور مرحله‌به‌مرحله چگونه کار می‌کند، بخوانید درون Scoring Engine 2.0. برای دیدن همان آزمون اجراشده روی GPT، Claude و Gemini، بخوانید کدام هوش مصنوعی اسپیکینگ CELPIP را دقیق‌تر نمره می‌دهد. یا ضبط پاسخ کنید و اعداد را خودتان ببینید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.

آیا نمره‌دهی اسپیکینگ CELPIP در Prepamigo دقیق است؟ اعداد، صادقانه | PrepAmigo