نمره‌دهی

معرفی Prepamigo Scoring Engine 2.0 برای اسپیکینگ

۶ سپتامبر ۲۰۲۶

Prepamigo Scoring Engine 2.0 در برابر مدل‌های پیشرفته به‌عنوان ارزیاب

سهم پاسخ‌های اسپیکینگ که نمره‌شان با نمره مستقل تأییدشده مطابقت داشت. 48 پاسخ که این سیستم‌ها هرگز نمی‌دیدند، به‌طور مساوی در نمره‌های پایین، میانی و بالا پخش شده‌اند. به هر مدل متن پیاده‌شده داده شد و از آن خواسته شد با کلماتی ساده آن را در مقیاس CELPIP نمره بدهد؛ میانگین سه اجرا.

81%

Prepamigo Scoring Engine 2.0Prepamigo

62%

Claude Opus 5Anthropic

58%

GeminiGoogle

45%

Claude Sonnet 5Anthropic

45%

GPT-4o miniOpenAI

37%

GPT 5.5OpenAI

35%

GPT 5.6 solOpenAI

31%

GPT 5.6 lunaOpenAI

مقایسه Prepamigo با پرطرفدارترین طرح‌های چت‌بات

بر اساس دلار کانادا. قیمت‌های Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شده‌اند. دقت، سهم پاسخ‌های مجموعه آزمون کنارگذاشته‌شده است که وقتی از مدل نام‌برده با کلماتی ساده درخواست امتیازدهی می‌شود، در سطح تأییدشده امتیاز می‌گیرند؛ میانگین سه اجرا.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
قیمت ماهانه
CA$24.98 (با مالیات)
+CA$138 (بدون مالیات)
CA$276 (بدون مالیات)
امتیازدهی
نامحدود
محدود
محدود
بانک سوال آماده
بله
خیر
خیر
مجموعه‌های تمرینی
80
ندارد
ندارد
تمرین‌ها
+2,000
ندارد
ندارد
قالب CELPIP
بله
خیر
خیر
دقت
81%
62%
35%
پاسخ‌های سطح بالا
71%
50%
25%

دقیق‌ترین ارزیاب اسپیکینگ ما تا امروز. روی پاسخ‌هایی که هرگز نمی‌دیده، Prepamigo Scoring Engine 2.0 در 81% مواقع با نمره‌های تأییدشده مطابقت داشت، پیشتاز از هر مدل پیشرفته‌ای که در همان کار آزمودیم، و گامی روشن جلوتر از Engine 1.0، ارزیابی که جایگزینش شده است.

امروز Prepamigo Scoring Engine 2.0 برای اسپیکینگ را عرضه می‌کنیم، سیستمی که هر پاسخ تمرین گفتاری در Prepamigo را نمره می‌دهد. Engine 2.0 بازطراحی کامل نحوه نمره‌دهی ماست. به‌جای یک مرحله نمره‌دهی تنها، از دو ارزیاب مستقل استفاده می‌کند که هر پاسخ را مستقیماً با مثال‌های کالیبره‌شده مقایسه می‌کنند، چندین بار رأی می‌دهند، و پیش از نمایش نمره، پاسخ‌هایشان را تطبیق می‌دهند.

نتیجه ارزیابی است که بسیار دقیق‌تر از هر مدل پیشرفته‌ای است که همان‌طور که یک داوطلب استفاده می‌کند به‌کار رفته. روی مجموعه‌ای کنارگذاشته‌شده از پاسخ‌های گفتاری واقعی با نمره‌های مستقل تأییدشده، Engine 2.0 در 81% مواقع به نمره درست رسید. وقتی با کلماتی ساده از آن خواسته شد همان متن‌ها را نمره بدهد، قوی‌ترین آن‌ها، Claude Opus 5، به 62% رسید. Gemini به 58% رسید. Claude Sonnet 5 و GPT-4o mini به 45%، GPT 5.5 به 37%، GPT 5.6 sol به 35%، و GPT 5.6 luna به 31%. وقتی سپس رویه خود Engine 2.0 را با مثال‌های کالیبراسیون واقعی برای هر تسک به هر مدل دادیم، بهترین آن‌ها به 77% رسید و همچنان پشت ماند.

دقت دقیقاً آن‌جا مهم‌ترین است که سخت‌ترین به‌دست‌آمدن است. Engine 2.0 یک پاسخ سطح بالا را در 71% مواقع شناسایی می‌کند. وقتی به‌سادگی پرسیده شد، هیچ مدل دیگری بیش از 56% را شناسایی نکرد، و مدل‌های GPT بین 13% و 27% شناسایی کردند. Engine 2.0 همچنین در برابر رایج‌ترین شکست ارزیاب‌های خودکار مقاوم است: نمره‌هایی که، بدون توجه به این‌که پاسخ واقعاً چقدر قوی یا ضعیف است، پایین و به‌سمت وسط مقیاس حرکت می‌کنند. آن گرایش ضعفی بود که بیشتر در Engine 1.0 می‌دیدیم.

Engine 2.0 سریع‌تر است، باثبات‌تر است، و بازخوردی تولید می‌کند که کلمات خود داوطلب را نقل می‌کند. از امروز برای هر کاربر Prepamigo فعال است. این صفحه توضیح می‌دهد چه کاری انجام می‌دهد، چگونه آن را اندازه گرفتیم، و محدودیت‌های فعلی آن کجاست.

دقت در برابر نمره‌های تأییدشده

سؤالی که برایمان اهمیت دارد ساده است. وقتی یک داوطلب پاسخی را ضبط می‌کند، آیا نمره روی صفحه با نمره‌ای که یک ارزیاب معتبر می‌داد مطابقت دارد؟ برای پاسخ به آن، مجموعه آزمونی از پاسخ‌های گفتاری واقعی در هر هشت نوع تسک اسپیکینگ ساختیم، هرکدام با نمره‌ای که به‌طور مستقل تأیید شده بود، و مجموعه را به‌طور مساوی در نمره‌های پایین، میانی و بالا تقسیم کردیم تا هیچ سطح تکی بر نتیجه غالب نشود.

این مقایسه از 48 پاسخ استفاده می‌کند که از ابتدا کنار گذاشته شده بودند. هیچ‌کس در تیم هنگام ساخت یا تنظیم Engine 2.0 از آن‌ها استفاده نکرد. هر پاسخ کلمه‌به‌کلمه پیاده‌سازی شد. سپس به هر مدل گفته شد یک ارزیاب باتجربه CELPIP است، متن تسک و متن پیاده‌شده به آن داده شد، و خواسته شد پاسخ را از 0 تا 12، سه بار، در روزهای مختلف نمره بدهد. سه اجرا را میانگین گرفتیم و شمارش کردیم نمره چند بار با سطح نمره تأییدشده مطابقت داشت.

۵۱٪

خطای کمتر نسبت به Claude Opus 5

19 نمره اشتباه در هر 100 پاسخ، در برابر 38.

۷۱٪

خطای کمتر نسبت به GPT 5.6 sol

19 نمره اشتباه در هر 100، در برابر 65.

۷۱٪

پاسخ‌های سطح بالا شناسایی‌شده

بهترین مدل‌های دیگر 56% را شناسایی می‌کنند؛ GPT 5.6 sol 25% را.

سه نکته در این اعداد برجسته است. اول، فاصله کوچک نیست. نوزده واحد در برابر قوی‌ترین مدل پیشرفته و چهل‌وشش واحد در برابر مدل پشت طرح‌های پولی ChatGPT، در یک آزمون 48 پاسخی، تفاوت میان نُه و بیست‌ودو نمره درست بیشتر است. دوم، این فاصله ساخته یک آزمون دوستانه نیست. 48 پاسخ پیش از قطعی‌شدن طراحی Engine 2.0 انتخاب شدند و در طول توسعه هرگز دستکاری نشدند. سوم، این مقایسه همان چیزی است که برای یک داوطلب اهمیت دارد: چیزی را اندازه می‌گیرد که وقتی متن پیاده‌شده را در یک چت‌بات وارد می‌کنید و می‌پرسید می‌گیرید، که همان روشی است که تقریباً همه از این مدل‌ها استفاده می‌کنند.

نکته‌ای درباره معنای «درست» در این‌جا. نمره‌های تأییدشده در این مقیاس به‌صورت سطح می‌آیند نه یک عدد تکی، پس نمره‌ای را درست می‌شماریم که در سطح تأییدشده بیفتد. برای مثال، پاسخی که در سطح بالا تأیید شده، اگر موتور به آن 9، 10 یا 11 بدهد درست نمره‌دهی شده است. با خوانشی سخت‌گیرانه‌تر که فقط 10 و بالاتر را می‌پذیرد، هر سیستم چند واحد از دست می‌دهد و رتبه‌بندی تغییر نمی‌کند.

سیستمدرخواست سادهبا رویه کامل ما
Prepamigo Scoring Engine 2.081.3%
Claude Opus 561.8%77.1%
Gemini58.3%70.8%
Claude Sonnet 545.1%68.8%
GPT-4o mini45.1%50.0%
GPT 5.536.8%68.8%
GPT 5.6 sol35.4%70.8%
GPT 5.6 luna30.6%62.5%

عملکرد در هر سطح نمره

یک رقم دقت میانگین می‌تواند بسیاری چیزها را پنهان کند. ارزیابی که در پاسخ‌های ضعیف عالی است و در پاسخ‌های قوی ناامیدکننده، ممکن است عددی محترمانه ثبت کند در حالی که داوطلبانی را که بیشترین نیاز به یک پاسخ دقیق دارند ناکام می‌گذارد. پس دقت را به‌طور جداگانه برای هر یک از سه سطح مجموعه آزمون گزارش می‌کنیم: نمره‌های پایین 4 یا 5، نمره‌های میانی 7 یا 8، و نمره‌های بالای 10 و بیشتر.

بیشتر ارزیاب‌ها، انسانی یا ماشینی، به‌سوی وسط می‌روند. یک پاسخ قوی به‌جای 10 عدد 8 می‌گیرد. یک پاسخ ضعیف به‌جای 5 عدد 6 می‌گیرد. بدون چیزی برای مقایسه، مدل‌های پیشرفته یک عادت دوم اضافه می‌کنند: به‌سمت پایین هم می‌روند، به‌طوری که یک پاسخ ضعیف اغلب 3 و یک پاسخ قوی اغلب 7 می‌گیرد. Engine 2.0 مشخصاً برای مقاومت در برابر هر دو کشش ساخته شد، و نتایج این را واضح‌ترین در بالای مقیاس نشان می‌دهند.

نمره‌های پایین · نمره تأییدشده 4 یا 5

16 پاسخ کنارگذاشته‌شده در هر سیستم، درخواست ساده، میانگین سه اجرا.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

نمره‌های میانی · نمره تأییدشده 7 یا 8

16 پاسخ کنارگذاشته‌شده در هر سیستم، درخواست ساده، میانگین سه اجرا.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

نمره‌های بالا · نمره تأییدشده 10 یا بالاتر

16 پاسخ کنارگذاشته‌شده در هر سیستم، درخواست ساده، میانگین سه اجرا. تقریباً هر خطا نمره 7 یا 8 است.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

برای داوطلبانی که از قبل قوی هستند، این تفاوتی است که اهمیت دارد. وقتی به‌سادگی پرسیده شد، هیچ‌کدام از مدل‌های دیگر بیش از 56% پاسخ‌های سطح بالا را شناسایی نمی‌کند؛ GPT 5.6 sol یکی از هر چهار را شناسایی می‌کند، و GPT 5.6 luna یکی از هر هشت را. Engine 2.0 71% را شناسایی می‌کند.

در سطح پایین، Engine 2.0 با 88% پیشتاز است، Claude Opus 5 با 77% و GPT-4o mini با 75%. هر مدل دیگری حدود نیمی است، و Claude Sonnet 5 روی 44% است. خطا تقریباً همیشه نمره 3 است: مدل یک پاسخ ضعیف را می‌بیند و آن را زیر سطح خودش نمره می‌دهد به‌جای درون آن. رقم قابل‌قبول GPT-4o mini در این‌جا اولین نشانه مشکل آن است، که این است که تقریباً همه‌چیز را پایین نمره می‌دهد؛ در بالای مقیاس یک پاسخ از هر شش را شناسایی می‌کند.

در سطح میانی، Engine 2.0 با 85% پیشتاز است. Gemini و Claude Sonnet 5 روی 63% هستند، Claude Opus 5 روی 58%، و سپس یک پرتگاه: GPT-4o mini روی 44% و سه مدل بزرگ‌تر GPT بین 27% و 29%. پاسخ‌های سطح میانی مخلوطی از نقاط قوت و ضعف دارند که باید سنجیده شود نه فقط شناسایی شود، و بدون چیزی برای مقایسه، مدل‌های GPT ضعف‌ها را می‌بینند و عدد 5 یا 6 می‌دهند.

در سطح بالا، فاصله بازتر است. Engine 2.0 به‌درستی 71% پاسخ‌های سطح بالا را شناسایی می‌کند. Gemini 56% را شناسایی می‌کند و Opus 5 دقیقاً نیمی را. پنج از هفت مدل دیگر به حداقل هفت از هر ده پاسخی که ارزش 10 دارد، عدد 7 یا 8 می‌دهند. این مشکل گرایش‌به‌وسط در خالص‌ترین شکل آن است. یک پاسخ سطح بالا بی‌نقص نیست؛ یک لغزش گاه‌به‌گاه، یک شروع دوباره، یک جمله ساده در میان جمله‌های پیچیده دارد، و ارزیابی که آن را در برابر یک پاسخ تصورشده کامل می‌سنجد، برای هرکدام کسر می‌کند. Engine 2.0 در برابر مثال‌هایی کالیبره شده است که نشان می‌دهند یک پاسخ سطح بالای واقعی، با لغزش‌هایش، چه شکلی دارد، و مشخصاً طراحی شده تا در برابر آن مثال‌ها مقایسه کند نه در برابر کمال.

اگر رویه کامل خودمان را به آن‌ها بدهیم چه می‌شود؟

اعداد درخواست ساده حکمی درباره میزان باهوشی این مدل‌ها نیست. حکمی است درباره آن‌چه اتفاق می‌افتد وقتی از مدلی برای یک عدد پرسیده می‌شود بدون چیزی برای مقایسه. پس آزمون دومی اجرا کردیم و دقیقاً همان چیزی را که ارزیاب‌های خود Engine 2.0 دریافت می‌کنند به هر مدل دادیم: متن پیاده‌شده، تسک، دو مثال کالیبراسیون واقعی در هر سطح برای همان تسک مشخص، و دستوری برای نام بردن نزدیک‌ترین مثال برای هر یک از چهار بعد به‌جای تولید یک عدد. هر مدل همچنین یک یادداشت کالیبراسیون کوتاه متناسب با گرایش‌های خودش گرفت.

با رویه کامل ما: سهم پاسخ‌هایی که در سطح تأییدشده نمره گرفتند

همان 48 پاسخ کنارگذاشته‌شده. همان متن‌های پیاده‌شده، دستورالعمل‌ها و مثال‌های کالیبراسیون برای هر سیستم؛ هر مدل هر پاسخ را یک‌بار نمره داد.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

هر مدل بهبود می‌یابد، برخی به‌طور چشمگیر. GPT 5.6 sol دو برابر می‌شود، از 35% به 71%. Opus 5 از 62% به 77% می‌رسد. GPT-4o mini به‌سختی حرکت می‌کند، از 45% به 50%، چون بدون توجه به آن‌چه به آن نشان داده می‌شود همه‌چیز را پایین نمره می‌دهد. و هر مدل همچنان پشت Engine 2.0 تمام می‌کند. در بالای مقیاس فاصله باقی می‌ماند: Opus 5، GPT 5.6 sol، Gemini و GPT 5.5 همه روی 63% پاسخ‌های سطح بالا متوقف می‌شوند، Sonnet 5 روی 38%، GPT-4o mini روی صفر، در برابر 71% برای Engine 2.0.

این آزمون دوم به شما می‌گوید ارزش واقعی Engine 2.0 کجاست. مدل باهوش‌تری نیست؛ از مدل‌های همین فهرست استفاده می‌کند. نمونه‌های واقعی از این‌که هر سطح در هر تسک مشخص چه صدایی دارد است، پرسشی که مدل را وادار می‌کند مقایسه کند نه تخمین بزند، و سپس سه چیز دیگر که یک اجرای تکی نمی‌تواند فراهم کند: دو ارزیاب مستقل از دو ارائه‌دهنده متفاوت، سه رأی از هرکدام با نگه‌داشتن رأی میانی، و یک قانون تطبیق که وقتی دو ارزیاب به‌شدت اختلاف دارند نمره بالاتر را می‌گیرد، چون تحلیل نشان داد رأی پایین‌تر تقریباً همیشه در پاسخ‌های قوی اشتباه بود.

ثبات و پایداری

یک ارزیاب قابل‌اعتماد باید باثبات باشد. اگر همان ضبط بتواند امروز 8 و فردا 10 بگیرد، هیچ‌کدام از آن اعداد معنای زیادی ندارند، و یک داوطلب نمی‌تواند بگوید آیا تمرینش کار می‌کند. پس در کنار دقت، اندازه می‌گیریم که آیا Engine 2.0 وقتی همان سؤال دو بار پرسیده می‌شود همان پاسخ را می‌دهد.

Engine 2.0 را روی 48 پاسخ کنارگذاشته‌شده سه بار مجزا، در روزهای مختلف، بدون تغییری در میان، اجرا کردیم. در هر اجرا 81.3% نمره گرفت. نه تقریباً 81%: همان 39 پاسخ درست از 48 هر بار، به‌علاوه یا منهای یک. وقتی به پاسخ‌های تکی به‌جای مجموع نگاه می‌کنیم، 87.5% در هر سه اجرا نمره‌ای یکسان گرفتند، و فقط 4.2% میان اجراها دو واحد یا بیشتر حرکت کردند. آن تعداد کم پاسخ‌هایی هستند که دقیقاً روی مرز میان دو سطح قرار دارند، جایی که تفاوت کوچکی در قضاوت به‌طور مشروع نمره را به یک سو می‌کشاند.

آزمون درخواست ساده روی مدل‌های پیشرفته بسیار بیشتر میان اجراها حرکت کرد. GPT 5.6 sol در سه اجرای خودش 31%، 40% و 35% نمره گرفت؛ Opus 5 نمرات 62%، 65% و 58% گرفت. از یک چت‌بات بخواهید همان متن پیاده‌شده را در دو روز مختلف نمره بدهد، و به‌طور نسبتاً منظمی دو نمره متفاوت می‌گیرید.

ثبات از دو انتخاب طراحی می‌آید. هر یک از دو ارزیاب Engine 2.0 روی هر پاسخ سه بار رأی می‌دهد و رأی میانی نگه داشته می‌شود، که مقدار پرت گاه‌به‌گاه یک اجرای تنها را حذف می‌کند. و احکام دو ارزیاب با یک قانون ثابت، نه توسط مدل دیگری، تطبیق می‌یابند، پس همان جفت احکام همیشه همان نمره نهایی را تولید می‌کند. هر دو انتخاب مستقیماً آزموده شدند: با یک رأی به‌جای سه رأی، توافق اجرا‌به‌اجرا از 87.5% به 77.1% سقوط کرد، و سهم پاسخ‌هایی که دو واحد یا بیشتر جهش می‌کنند بیش از دو برابر شد.

Engine 2.0 چگونه یک پاسخ را نمره می‌دهد

Engine 2.0 یک مدل تکی نیست. یک رویه است، و همان رویه چیزی است که تفاوت را می‌سازد. این‌جا آن‌چه در حدود ده ثانیه‌ای که میان زدن دکمه توقف توسط داوطلب و ظاهرشدن نمره روی صفحه می‌گذرد اتفاق می‌افتد.

  1. ضبط کلمه‌به‌کلمه پیاده‌سازی می‌شود. هر مکث، هر شروع دوباره، هر خودتصحیحی نگه داشته می‌شود. این ضروری از آب درآمد. وقتی یک متن «پاکسازی‌شده» با مکث‌های حذف‌شده را آزمودیم، دقت پانزده واحد کاهش یافت، چون مکث‌ها بخشی از شواهدی هستند که یک ارزیاب برای قضاوت درباره صدای یک پاسخ به آن نیاز دارد.
  2. دو ارزیاب مستقل متن پیاده‌شده را می‌خوانند. آن‌ها روی مدل‌های بنیادین متفاوت از ارائه‌دهندگان متفاوت ساخته شده‌اند، پس نقاط کور یکسانی ندارند. هر ارزیاب متن تسک، متن پیاده‌شده، و مجموعه‌ای کوچک از مثال‌های کالیبراسیون برای همان تسک دقیق را دریافت می‌کند: پاسخ‌های واقعی در سطح پایین، میانی و بالا، دوتا در هر سطح، تا هر سطح به‌عنوان یک بازه نمایش داده شود نه یک نقطه تکی.
  3. هر ارزیاب مقایسه می‌کند به‌جای نمره‌دادن. این تغییر اصلی نسبت به Engine 1.0 است. به‌جای این‌که از هر ارزیاب یک عدد خواسته شود، از او برای هر یک از چهار بعد پاسخ پرسیده می‌شود که پاسخ به کدام مثال کالیبراسیون بیشتر شباهت دارد. گزینه «جایی در میان» وجود ندارد. مجبور بودن به تعیین نزدیک‌ترین مثال چیزی است که گرایش به‌سمت وسط را متوقف می‌کند. نمره سپس با یک قانون ثابت، نه توسط مدل، از سطح انتخاب‌شده استخراج می‌شود.
  4. هر ارزیاب سه بار رأی می‌دهد. رأی میانی روی هر بعد نگه داشته می‌شود. این پاسخ روزهای بد گاه‌به‌گاه را حذف می‌کند بدون این‌که قضاوت واقعی را با میانگین‌گیری از بین ببرد.
  5. دو حکم تطبیق می‌یابند. اگر ارزیاب‌ها موافق باشند یا یک واحد اختلاف داشته باشند، نمره نهایی میانگین آن‌ها است. اگر دو واحد یا بیشتر اختلاف داشته باشند، نمره بالاتر استفاده می‌شود. آن قانون بخشندگی نیست؛ کالیبراسیون است. وقتی هر موردی را که دو ارزیاب به‌شدت اختلاف داشتند تحلیل کردیم، حکم پایین‌تر تقریباً همیشه اشتباه بود، چون آن اختلاف تقریباً همیشه روی یک پاسخ سطح بالایی پیش می‌آمد که یک ارزیاب درباره آن بیش‌ازحد محتاط بوده است.
  6. محافظ‌ها اعمال می‌شوند. مجموعه‌ای کوتاه از قوانین ثابت مواردی را مدیریت می‌کند که هیچ ارزیابی نباید درباره‌شان تخمین بزند: پاسخی که ساکت است، چند کلمه طول دارد، به زبان دیگری است، یا کاملاً خارج از موضوع است، بدون توجه به آن‌چه ارزیاب‌ها برمی‌گردانند، یک نمره کف می‌گیرد. در آزمایش، سکوت نمره 3 گرفت، یک پاسخ چندکلمه‌ای نمره 4، و یک پاسخ خارج‌از‌موضوع یا غیرانگلیسی نمره 5، بدون هیچ شکستی در مجموعه.

دو ویژگی از طرح نهایی ارزش تأکید دارند. Engine 2.0 فقط از متن پیاده‌شده نمره می‌دهد، پس بعد از پیاده‌سازی به صدا نیازی ندارد و به مدل صدای هیچ ارائه‌دهنده‌ای وابسته نیست. و چون دو ارزیاب از ارائه‌دهندگان متفاوت هستند، اگر یکی در دسترس نباشد دیگری ادامه می‌دهد، با یک مدل سوم جایگزین تا نمره همیشه تولید شود.

چه چیزی در بازخورد شما تازه است

Engine 2.0 با یک لایه بازخورد کاملاً بازسازی‌شده عرضه می‌شود. این لایه شواهد دو ارزیاب را می‌خواند، نه فقط نمره را، و در برابر سه نوع داوطلب آزمایش شده است: کسی که برای اولین بار با CELPIP آشنا می‌شود، کسی با زبان انگلیسی ضعیف که به دنبال ترفند است، و کسی که فقط نیم ساعت در روز وقت دارد و آزمونش هفته آینده است. این‌ها چیزهایی است که تغییر کرده.

  • نقل‌قول از حرف‌های خودتان. هر نکته بازخورد، دقیقاً همان عبارتی از متن پاسخ شما را نقل می‌کند که ارزیاب‌ها به آن واکنش داده‌اند. اگر عبارتی داخل گیومه باشد، عیناً کپی شده است؛ در بررسی ما 157 از 158 نقل‌قول این‌گونه بودند. بازخورد هرگز چیزی را که نگفته‌اید اختراع نمی‌کند.
  • اولین چیزی که باید اصلاح کنید. هر پاسخ یک اقدام اصلی می‌گیرد: تغییری که بیشترین تأثیر را بر نمره شما دارد و با ساده‌ترین کلمات ممکن روی صفحه نوشته شده است. پس از آن دو اقدام عملی دیگر می‌آید، سپس یک فهرست بررسی سه‌موردی که پیش از شروع صحبت باید در ذهن مرور کنید.
  • توصیه‌ای متناسب با نوع تسک. دادن توصیه، توصیف یک صحنه و قانع کردن کسی بر اساس معیارهای متفاوتی نمره می‌گیرند. بازخورد اکنون می‌داند هر یک از هشت نوع تسک به چه چیزی امتیاز می‌دهد و بر همان تمرکز می‌کند، به‌جای تکرار همان نکته‌های کلی در همه تسک‌ها.
  • کدام بُعد را اول تمرین کنید. بازخورد به شما می‌گوید کدام یک از چهار بُعد ضعیف‌ترین و کدام قوی‌ترین شماست، تا بدانید نمره بعدی از کجا می‌آید، بدون اینکه این موضوع پشت یک عدد پنهان بماند.
  • چه چیزی از خواسته تسک را از قلم انداختید. برای معیار انجام تسک، بازخورد بخش‌های مشخصی از دستور تسک را که پوشش نداده‌اید فهرست می‌کند، یا به‌صراحت می‌گوید که همه آن‌ها را پوشش داده‌اید.
  • چیزهایی که واقعاً می‌توانید تمرین کنید. هر راهکار چیزی است که می‌توانید پیش از تلاش بعدی با صدای بلند تمرین کنید. هیچ توصیه‌ای برای واضح‌تر صحبت کردن یا کم کردن لهجه وجود ندارد: لهجه چیزی نیست که «قابل‌فهم بودن» بسنجد، و بازخورد هرگز درباره آن نظر نمی‌دهد.
  • هیچ سرزنشی برای زمان‌سنج. پاسخی که پس از تکمیل تسک به‌خاطر پایان زمان قطع شده باشد، برای همین قطع‌شدن نمره از دست نمی‌دهد، و بازخورد به‌خاطر آن شما را سرزنش نمی‌کند.

وقتی یک مدل داوری مستقل این بازخورد را با آنچه سیستم قبلی ما برای همان پاسخ‌ها تولید کرده بود مقایسه کرد، بدون اینکه بداند کدام‌یک متعلق به کدام سیستم است، در 20 از 24 مقایسه بازخورد جدید را ترجیح داد؛ هم در قضاوت به‌شیوه یک ارزیاب و هم در قضاوت به‌شیوه یک داوطلب.

تمرین نامحدود با CA$25 در ماه

دقت فقط وقتی مفید است که بتوانید هرروز از آن استفاده کنید. یک نمره اسپیکینگ قابل‌اعتماد بیشترین ارزش را در چهلمین پاسخ تمرینی شما دارد، نه چهارمین، چون آن‌جاست که نمره شروع می‌کند به شما بگوید آیا تغییری در نحوه صحبت‌کردن‌تان واقعاً کار می‌کند. پس Engine 2.0 را قیمت‌گذاری کردیم تا بدون شمارش استفاده شود.

هر طرح Prepamigo شامل نمره‌دهی نامحدود توسط Engine 2.0، تلاش‌های نامحدود، و بانک کامل سوال است: 80 مجموعه تمرینی کامل و بیش از 2,000 تمرین در Speaking، Writing، Reading و Listening، نوشته‌شده برای پیروی از انواع تسک، زمان‌بندی و قالب آزمون CELPIP General. دکمه ضبط را می‌زنید، حدود ده ثانیه بعد نمره و بازخورد مبتنی‌بر شواهد می‌گیرید، و می‌توانید هرقدر که بخواهید دوباره این کار را انجام دهید.

Prepamigo

CA$25/ ماه

CA$24.98 ماهانه · CA$8.25 در ماه در طرح سالانه (CA$98.98 در سال) · شامل مالیات · لغو در هر زمان

  • نمره‌دهی نامحدود توسط Scoring Engine 2.0، بدون سقف روزانه، جلسه‌ای یا هفتگی.
  • 80 مجموعه تمرینی و بیش از 2,000 تمرین در هر چهار بخش، بر اساس قالب واقعی آزمون، پس هرگز مجبور نیستید دستور خودتان را بنویسید.
  • ضبط کن و برو. پیاده‌سازی، نمره‌دهی و بازخورد برایتان انجام می‌شود؛ چیزی برای چسباندن یا نوشتن دستور وجود ندارد.
  • بازخورد با کلمات خودتان، با هر نقل‌قول قابل‌ردیابی به آن‌چه واقعاً گفته‌اید.

Claude Max، برای مقایسه

US$100/ ماه

حدود CA$138 پیش از مالیات · سطح 20x با US$200 در ماه · Pro با US$20 با سقف‌های بسیار سخت‌تر

  • حتی Max هم محدود است. یک بازه استفاده پنج‌ساعته چرخشی و یک سقف هفتگی، پنج تا بیست برابر آن‌چه Pro اجازه می‌دهد؛ وقتی به هرکدام برسید، باید صبر کنید.
  • بدون بانک سوال. تسک‌های خودتان را می‌آورید، خودتان تصمیم می‌گیرید آیا شبیه آزمون واقعی هستند، و خودتان ردیابی می‌کنید چه چیزی را قبلاً تمرین کرده‌اید.
  • راه‌اندازی با خودتان است. ضبط، پیاده‌سازی، چسباندن متن پیاده‌شده و نوشتن دستورالعمل‌های نمره‌دهی هرکدام هر بار با خودتان است.
  • یک درخواست ساده، نه یک ارزیاب کالیبره‌شده. وقتی به‌سادگی پرسیده شد، Claude Opus 5 در 62% مواقع و Claude Sonnet 5 در 45% مواقع با نمره‌های تأییدشده مطابقت داشتند، در برابر 81% برای Engine 2.0.

قیمت‌ها و شرایط استفاده طرح‌های Claude همان‌طور که در سپتامبر 2026 در claude.com منتشر شده‌اند و ممکن است تغییر کنند. CELPIP علامت تجاری صاحب آن است؛ Prepamigo یک پلتفرم تمرین مستقل است و به سازنده آزمون وابسته نیست، مورد تأیید آن نیست و ارتباطی با آن ندارد. تمرین‌های Prepamigo مطالب اصلی نوشته‌شده برای پیروی از قالب عمومی آزمون هستند.

دسترس‌پذیری

Prepamigo Scoring Engine 2.0 برای اسپیکینگ اکنون برای همه کاربران Prepamigo در هر نوع تسک اسپیکینگ فعال است. چیزی برای فعال‌کردن وجود ندارد. هر پاسخ اسپیکینگ جدید توسط Engine 2.0 نمره می‌گیرد، و هر نمره با بازخوردی همراه است که از کلمات خود داوطلب گرفته شده.

یک پاسخ معمولی حدود ده ثانیه‌ای نمره می‌گیرد، سریع‌تر از Engine 1.0. Engine 2.0 همچنین برای هر پاسخ کمتر از طرحی که جایگزینش شده برای ما هزینه دارد، که همان چیزی است که به ما اجازه می‌دهد دو ارزیاب با سه رأی هرکدام را برای هر داوطلب اجرا کنیم بدون تغییر هزینه Prepamigo.

اعداد این صفحه را همان‌طور که اعتبارسنجی دنیای واقعی توضیح‌داده‌شده در بالا تکمیل می‌شود به‌روزرسانی خواهیم کرد. اگر ضبطی دارید که فکر می‌کنید Engine 2.0 اشتباه نمره داده، می‌خواهیم آن را ببینیم: آن موارد سریع‌ترین راهی هستند که می‌شناسیم برای پیدا کردن بهبود بعدی.

برای مقایسه‌های رودررو، بخوانید Prepamigo در برابر Claude و Prepamigo در برابر ChatGPT. یا ضبط پاسخ کنید و اجرای Engine 2.0 را ببینید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.

معرفی Prepamigo Scoring Engine 2.0 برای اسپیکینگ | PrepAmigo