Prepamigo Scoring Engine 2.0 در برابر مدلهای پیشرفته بهعنوان ارزیاب
سهم پاسخهای اسپیکینگ که نمرهشان با نمره مستقل تأییدشده مطابقت داشت. 48 پاسخ که این سیستمها هرگز نمیدیدند، بهطور مساوی در نمرههای پایین، میانی و بالا پخش شدهاند. به هر مدل متن پیادهشده داده شد و از آن خواسته شد با کلماتی ساده آن را در مقیاس CELPIP نمره بدهد؛ میانگین سه اجرا.
81%
Prepamigo Scoring Engine 2.0Prepamigo
62%
Claude Opus 5Anthropic
58%
GeminiGoogle
45%
Claude Sonnet 5Anthropic
45%
GPT-4o miniOpenAI
37%
GPT 5.5OpenAI
35%
GPT 5.6 solOpenAI
31%
GPT 5.6 lunaOpenAI
مقایسه Prepamigo با پرطرفدارترین طرحهای چتبات
بر اساس دلار کانادا. قیمتهای Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شدهاند. دقت، سهم پاسخهای مجموعه آزمون کنارگذاشتهشده است که وقتی از مدل نامبرده با کلماتی ساده درخواست امتیازدهی میشود، در سطح تأییدشده امتیاز میگیرند؛ میانگین سه اجرا.
دقیقترین ارزیاب اسپیکینگ ما تا امروز. روی پاسخهایی که هرگز نمیدیده، Prepamigo Scoring Engine 2.0 در 81% مواقع با نمرههای تأییدشده مطابقت داشت، پیشتاز از هر مدل پیشرفتهای که در همان کار آزمودیم، و گامی روشن جلوتر از Engine 1.0، ارزیابی که جایگزینش شده است.
امروز Prepamigo Scoring Engine 2.0 برای اسپیکینگ را عرضه میکنیم، سیستمی که هر پاسخ تمرین گفتاری در Prepamigo را نمره میدهد. Engine 2.0 بازطراحی کامل نحوه نمرهدهی ماست. بهجای یک مرحله نمرهدهی تنها، از دو ارزیاب مستقل استفاده میکند که هر پاسخ را مستقیماً با مثالهای کالیبرهشده مقایسه میکنند، چندین بار رأی میدهند، و پیش از نمایش نمره، پاسخهایشان را تطبیق میدهند.
نتیجه ارزیابی است که بسیار دقیقتر از هر مدل پیشرفتهای است که همانطور که یک داوطلب استفاده میکند بهکار رفته. روی مجموعهای کنارگذاشتهشده از پاسخهای گفتاری واقعی با نمرههای مستقل تأییدشده، Engine 2.0 در 81% مواقع به نمره درست رسید. وقتی با کلماتی ساده از آن خواسته شد همان متنها را نمره بدهد، قویترین آنها، Claude Opus 5، به 62% رسید. Gemini به 58% رسید. Claude Sonnet 5 و GPT-4o mini به 45%، GPT 5.5 به 37%، GPT 5.6 sol به 35%، و GPT 5.6 luna به 31%. وقتی سپس رویه خود Engine 2.0 را با مثالهای کالیبراسیون واقعی برای هر تسک به هر مدل دادیم، بهترین آنها به 77% رسید و همچنان پشت ماند.
دقت دقیقاً آنجا مهمترین است که سختترین بهدستآمدن است. Engine 2.0 یک پاسخ سطح بالا را در 71% مواقع شناسایی میکند. وقتی بهسادگی پرسیده شد، هیچ مدل دیگری بیش از 56% را شناسایی نکرد، و مدلهای GPT بین 13% و 27% شناسایی کردند. Engine 2.0 همچنین در برابر رایجترین شکست ارزیابهای خودکار مقاوم است: نمرههایی که، بدون توجه به اینکه پاسخ واقعاً چقدر قوی یا ضعیف است، پایین و بهسمت وسط مقیاس حرکت میکنند. آن گرایش ضعفی بود که بیشتر در Engine 1.0 میدیدیم.
Engine 2.0 سریعتر است، باثباتتر است، و بازخوردی تولید میکند که کلمات خود داوطلب را نقل میکند. از امروز برای هر کاربر Prepamigo فعال است. این صفحه توضیح میدهد چه کاری انجام میدهد، چگونه آن را اندازه گرفتیم، و محدودیتهای فعلی آن کجاست.
دقت در برابر نمرههای تأییدشده
سؤالی که برایمان اهمیت دارد ساده است. وقتی یک داوطلب پاسخی را ضبط میکند، آیا نمره روی صفحه با نمرهای که یک ارزیاب معتبر میداد مطابقت دارد؟ برای پاسخ به آن، مجموعه آزمونی از پاسخهای گفتاری واقعی در هر هشت نوع تسک اسپیکینگ ساختیم، هرکدام با نمرهای که بهطور مستقل تأیید شده بود، و مجموعه را بهطور مساوی در نمرههای پایین، میانی و بالا تقسیم کردیم تا هیچ سطح تکی بر نتیجه غالب نشود.
این مقایسه از 48 پاسخ استفاده میکند که از ابتدا کنار گذاشته شده بودند. هیچکس در تیم هنگام ساخت یا تنظیم Engine 2.0 از آنها استفاده نکرد. هر پاسخ کلمهبهکلمه پیادهسازی شد. سپس به هر مدل گفته شد یک ارزیاب باتجربه CELPIP است، متن تسک و متن پیادهشده به آن داده شد، و خواسته شد پاسخ را از 0 تا 12، سه بار، در روزهای مختلف نمره بدهد. سه اجرا را میانگین گرفتیم و شمارش کردیم نمره چند بار با سطح نمره تأییدشده مطابقت داشت.
۵۱٪
خطای کمتر نسبت به Claude Opus 5
19 نمره اشتباه در هر 100 پاسخ، در برابر 38.
۷۱٪
خطای کمتر نسبت به GPT 5.6 sol
19 نمره اشتباه در هر 100، در برابر 65.
۷۱٪
پاسخهای سطح بالا شناساییشده
بهترین مدلهای دیگر 56% را شناسایی میکنند؛ GPT 5.6 sol 25% را.
سه نکته در این اعداد برجسته است. اول، فاصله کوچک نیست. نوزده واحد در برابر قویترین مدل پیشرفته و چهلوشش واحد در برابر مدل پشت طرحهای پولی ChatGPT، در یک آزمون 48 پاسخی، تفاوت میان نُه و بیستودو نمره درست بیشتر است. دوم، این فاصله ساخته یک آزمون دوستانه نیست. 48 پاسخ پیش از قطعیشدن طراحی Engine 2.0 انتخاب شدند و در طول توسعه هرگز دستکاری نشدند. سوم، این مقایسه همان چیزی است که برای یک داوطلب اهمیت دارد: چیزی را اندازه میگیرد که وقتی متن پیادهشده را در یک چتبات وارد میکنید و میپرسید میگیرید، که همان روشی است که تقریباً همه از این مدلها استفاده میکنند.
نکتهای درباره معنای «درست» در اینجا. نمرههای تأییدشده در این مقیاس بهصورت سطح میآیند نه یک عدد تکی، پس نمرهای را درست میشماریم که در سطح تأییدشده بیفتد. برای مثال، پاسخی که در سطح بالا تأیید شده، اگر موتور به آن 9، 10 یا 11 بدهد درست نمرهدهی شده است. با خوانشی سختگیرانهتر که فقط 10 و بالاتر را میپذیرد، هر سیستم چند واحد از دست میدهد و رتبهبندی تغییر نمیکند.
| سیستم | درخواست ساده | با رویه کامل ما |
|---|---|---|
| Prepamigo Scoring Engine 2.0 | 81.3% | — |
| Claude Opus 5 | 61.8% | 77.1% |
| Gemini | 58.3% | 70.8% |
| Claude Sonnet 5 | 45.1% | 68.8% |
| GPT-4o mini | 45.1% | 50.0% |
| GPT 5.5 | 36.8% | 68.8% |
| GPT 5.6 sol | 35.4% | 70.8% |
| GPT 5.6 luna | 30.6% | 62.5% |
عملکرد در هر سطح نمره
یک رقم دقت میانگین میتواند بسیاری چیزها را پنهان کند. ارزیابی که در پاسخهای ضعیف عالی است و در پاسخهای قوی ناامیدکننده، ممکن است عددی محترمانه ثبت کند در حالی که داوطلبانی را که بیشترین نیاز به یک پاسخ دقیق دارند ناکام میگذارد. پس دقت را بهطور جداگانه برای هر یک از سه سطح مجموعه آزمون گزارش میکنیم: نمرههای پایین 4 یا 5، نمرههای میانی 7 یا 8، و نمرههای بالای 10 و بیشتر.
بیشتر ارزیابها، انسانی یا ماشینی، بهسوی وسط میروند. یک پاسخ قوی بهجای 10 عدد 8 میگیرد. یک پاسخ ضعیف بهجای 5 عدد 6 میگیرد. بدون چیزی برای مقایسه، مدلهای پیشرفته یک عادت دوم اضافه میکنند: بهسمت پایین هم میروند، بهطوری که یک پاسخ ضعیف اغلب 3 و یک پاسخ قوی اغلب 7 میگیرد. Engine 2.0 مشخصاً برای مقاومت در برابر هر دو کشش ساخته شد، و نتایج این را واضحترین در بالای مقیاس نشان میدهند.
نمرههای پایین · نمره تأییدشده 4 یا 5
16 پاسخ کنارگذاشتهشده در هر سیستم، درخواست ساده، میانگین سه اجرا.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
75%
GPT-4o mini
56%
Gemini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
44%
Claude Sonnet 5
نمرههای میانی · نمره تأییدشده 7 یا 8
16 پاسخ کنارگذاشتهشده در هر سیستم، درخواست ساده، میانگین سه اجرا.
85%
Prepamigo Engine 2.0
63%
Gemini
63%
Claude Sonnet 5
58%
Claude Opus 5
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
نمرههای بالا · نمره تأییدشده 10 یا بالاتر
16 پاسخ کنارگذاشتهشده در هر سیستم، درخواست ساده، میانگین سه اجرا. تقریباً هر خطا نمره 7 یا 8 است.
71%
Prepamigo Engine 2.0
56%
Gemini
50%
Claude Opus 5
29%
Claude Sonnet 5
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
در سطح پایین، Engine 2.0 با 88% پیشتاز است، Claude Opus 5 با 77% و GPT-4o mini با 75%. هر مدل دیگری حدود نیمی است، و Claude Sonnet 5 روی 44% است. خطا تقریباً همیشه نمره 3 است: مدل یک پاسخ ضعیف را میبیند و آن را زیر سطح خودش نمره میدهد بهجای درون آن. رقم قابلقبول GPT-4o mini در اینجا اولین نشانه مشکل آن است، که این است که تقریباً همهچیز را پایین نمره میدهد؛ در بالای مقیاس یک پاسخ از هر شش را شناسایی میکند.
در سطح میانی، Engine 2.0 با 85% پیشتاز است. Gemini و Claude Sonnet 5 روی 63% هستند، Claude Opus 5 روی 58%، و سپس یک پرتگاه: GPT-4o mini روی 44% و سه مدل بزرگتر GPT بین 27% و 29%. پاسخهای سطح میانی مخلوطی از نقاط قوت و ضعف دارند که باید سنجیده شود نه فقط شناسایی شود، و بدون چیزی برای مقایسه، مدلهای GPT ضعفها را میبینند و عدد 5 یا 6 میدهند.
در سطح بالا، فاصله بازتر است. Engine 2.0 بهدرستی 71% پاسخهای سطح بالا را شناسایی میکند. Gemini 56% را شناسایی میکند و Opus 5 دقیقاً نیمی را. پنج از هفت مدل دیگر به حداقل هفت از هر ده پاسخی که ارزش 10 دارد، عدد 7 یا 8 میدهند. این مشکل گرایشبهوسط در خالصترین شکل آن است. یک پاسخ سطح بالا بینقص نیست؛ یک لغزش گاهبهگاه، یک شروع دوباره، یک جمله ساده در میان جملههای پیچیده دارد، و ارزیابی که آن را در برابر یک پاسخ تصورشده کامل میسنجد، برای هرکدام کسر میکند. Engine 2.0 در برابر مثالهایی کالیبره شده است که نشان میدهند یک پاسخ سطح بالای واقعی، با لغزشهایش، چه شکلی دارد، و مشخصاً طراحی شده تا در برابر آن مثالها مقایسه کند نه در برابر کمال.
اگر رویه کامل خودمان را به آنها بدهیم چه میشود؟
اعداد درخواست ساده حکمی درباره میزان باهوشی این مدلها نیست. حکمی است درباره آنچه اتفاق میافتد وقتی از مدلی برای یک عدد پرسیده میشود بدون چیزی برای مقایسه. پس آزمون دومی اجرا کردیم و دقیقاً همان چیزی را که ارزیابهای خود Engine 2.0 دریافت میکنند به هر مدل دادیم: متن پیادهشده، تسک، دو مثال کالیبراسیون واقعی در هر سطح برای همان تسک مشخص، و دستوری برای نام بردن نزدیکترین مثال برای هر یک از چهار بعد بهجای تولید یک عدد. هر مدل همچنین یک یادداشت کالیبراسیون کوتاه متناسب با گرایشهای خودش گرفت.
با رویه کامل ما: سهم پاسخهایی که در سطح تأییدشده نمره گرفتند
همان 48 پاسخ کنارگذاشتهشده. همان متنهای پیادهشده، دستورالعملها و مثالهای کالیبراسیون برای هر سیستم؛ هر مدل هر پاسخ را یکبار نمره داد.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
71%
GPT 5.6 sol
71%
Gemini
69%
GPT 5.5
69%
Claude Sonnet 5
63%
GPT 5.6 luna
50%
GPT-4o mini
هر مدل بهبود مییابد، برخی بهطور چشمگیر. GPT 5.6 sol دو برابر میشود، از 35% به 71%. Opus 5 از 62% به 77% میرسد. GPT-4o mini بهسختی حرکت میکند، از 45% به 50%، چون بدون توجه به آنچه به آن نشان داده میشود همهچیز را پایین نمره میدهد. و هر مدل همچنان پشت Engine 2.0 تمام میکند. در بالای مقیاس فاصله باقی میماند: Opus 5، GPT 5.6 sol، Gemini و GPT 5.5 همه روی 63% پاسخهای سطح بالا متوقف میشوند، Sonnet 5 روی 38%، GPT-4o mini روی صفر، در برابر 71% برای Engine 2.0.
این آزمون دوم به شما میگوید ارزش واقعی Engine 2.0 کجاست. مدل باهوشتری نیست؛ از مدلهای همین فهرست استفاده میکند. نمونههای واقعی از اینکه هر سطح در هر تسک مشخص چه صدایی دارد است، پرسشی که مدل را وادار میکند مقایسه کند نه تخمین بزند، و سپس سه چیز دیگر که یک اجرای تکی نمیتواند فراهم کند: دو ارزیاب مستقل از دو ارائهدهنده متفاوت، سه رأی از هرکدام با نگهداشتن رأی میانی، و یک قانون تطبیق که وقتی دو ارزیاب بهشدت اختلاف دارند نمره بالاتر را میگیرد، چون تحلیل نشان داد رأی پایینتر تقریباً همیشه در پاسخهای قوی اشتباه بود.
ثبات و پایداری
یک ارزیاب قابلاعتماد باید باثبات باشد. اگر همان ضبط بتواند امروز 8 و فردا 10 بگیرد، هیچکدام از آن اعداد معنای زیادی ندارند، و یک داوطلب نمیتواند بگوید آیا تمرینش کار میکند. پس در کنار دقت، اندازه میگیریم که آیا Engine 2.0 وقتی همان سؤال دو بار پرسیده میشود همان پاسخ را میدهد.
Engine 2.0 را روی 48 پاسخ کنارگذاشتهشده سه بار مجزا، در روزهای مختلف، بدون تغییری در میان، اجرا کردیم. در هر اجرا 81.3% نمره گرفت. نه تقریباً 81%: همان 39 پاسخ درست از 48 هر بار، بهعلاوه یا منهای یک. وقتی به پاسخهای تکی بهجای مجموع نگاه میکنیم، 87.5% در هر سه اجرا نمرهای یکسان گرفتند، و فقط 4.2% میان اجراها دو واحد یا بیشتر حرکت کردند. آن تعداد کم پاسخهایی هستند که دقیقاً روی مرز میان دو سطح قرار دارند، جایی که تفاوت کوچکی در قضاوت بهطور مشروع نمره را به یک سو میکشاند.
آزمون درخواست ساده روی مدلهای پیشرفته بسیار بیشتر میان اجراها حرکت کرد. GPT 5.6 sol در سه اجرای خودش 31%، 40% و 35% نمره گرفت؛ Opus 5 نمرات 62%، 65% و 58% گرفت. از یک چتبات بخواهید همان متن پیادهشده را در دو روز مختلف نمره بدهد، و بهطور نسبتاً منظمی دو نمره متفاوت میگیرید.
ثبات از دو انتخاب طراحی میآید. هر یک از دو ارزیاب Engine 2.0 روی هر پاسخ سه بار رأی میدهد و رأی میانی نگه داشته میشود، که مقدار پرت گاهبهگاه یک اجرای تنها را حذف میکند. و احکام دو ارزیاب با یک قانون ثابت، نه توسط مدل دیگری، تطبیق مییابند، پس همان جفت احکام همیشه همان نمره نهایی را تولید میکند. هر دو انتخاب مستقیماً آزموده شدند: با یک رأی بهجای سه رأی، توافق اجرابهاجرا از 87.5% به 77.1% سقوط کرد، و سهم پاسخهایی که دو واحد یا بیشتر جهش میکنند بیش از دو برابر شد.
Engine 2.0 چگونه یک پاسخ را نمره میدهد
Engine 2.0 یک مدل تکی نیست. یک رویه است، و همان رویه چیزی است که تفاوت را میسازد. اینجا آنچه در حدود ده ثانیهای که میان زدن دکمه توقف توسط داوطلب و ظاهرشدن نمره روی صفحه میگذرد اتفاق میافتد.
- ضبط کلمهبهکلمه پیادهسازی میشود. هر مکث، هر شروع دوباره، هر خودتصحیحی نگه داشته میشود. این ضروری از آب درآمد. وقتی یک متن «پاکسازیشده» با مکثهای حذفشده را آزمودیم، دقت پانزده واحد کاهش یافت، چون مکثها بخشی از شواهدی هستند که یک ارزیاب برای قضاوت درباره صدای یک پاسخ به آن نیاز دارد.
- دو ارزیاب مستقل متن پیادهشده را میخوانند. آنها روی مدلهای بنیادین متفاوت از ارائهدهندگان متفاوت ساخته شدهاند، پس نقاط کور یکسانی ندارند. هر ارزیاب متن تسک، متن پیادهشده، و مجموعهای کوچک از مثالهای کالیبراسیون برای همان تسک دقیق را دریافت میکند: پاسخهای واقعی در سطح پایین، میانی و بالا، دوتا در هر سطح، تا هر سطح بهعنوان یک بازه نمایش داده شود نه یک نقطه تکی.
- هر ارزیاب مقایسه میکند بهجای نمرهدادن. این تغییر اصلی نسبت به Engine 1.0 است. بهجای اینکه از هر ارزیاب یک عدد خواسته شود، از او برای هر یک از چهار بعد پاسخ پرسیده میشود که پاسخ به کدام مثال کالیبراسیون بیشتر شباهت دارد. گزینه «جایی در میان» وجود ندارد. مجبور بودن به تعیین نزدیکترین مثال چیزی است که گرایش بهسمت وسط را متوقف میکند. نمره سپس با یک قانون ثابت، نه توسط مدل، از سطح انتخابشده استخراج میشود.
- هر ارزیاب سه بار رأی میدهد. رأی میانی روی هر بعد نگه داشته میشود. این پاسخ روزهای بد گاهبهگاه را حذف میکند بدون اینکه قضاوت واقعی را با میانگینگیری از بین ببرد.
- دو حکم تطبیق مییابند. اگر ارزیابها موافق باشند یا یک واحد اختلاف داشته باشند، نمره نهایی میانگین آنها است. اگر دو واحد یا بیشتر اختلاف داشته باشند، نمره بالاتر استفاده میشود. آن قانون بخشندگی نیست؛ کالیبراسیون است. وقتی هر موردی را که دو ارزیاب بهشدت اختلاف داشتند تحلیل کردیم، حکم پایینتر تقریباً همیشه اشتباه بود، چون آن اختلاف تقریباً همیشه روی یک پاسخ سطح بالایی پیش میآمد که یک ارزیاب درباره آن بیشازحد محتاط بوده است.
- محافظها اعمال میشوند. مجموعهای کوتاه از قوانین ثابت مواردی را مدیریت میکند که هیچ ارزیابی نباید دربارهشان تخمین بزند: پاسخی که ساکت است، چند کلمه طول دارد، به زبان دیگری است، یا کاملاً خارج از موضوع است، بدون توجه به آنچه ارزیابها برمیگردانند، یک نمره کف میگیرد. در آزمایش، سکوت نمره 3 گرفت، یک پاسخ چندکلمهای نمره 4، و یک پاسخ خارجازموضوع یا غیرانگلیسی نمره 5، بدون هیچ شکستی در مجموعه.
دو ویژگی از طرح نهایی ارزش تأکید دارند. Engine 2.0 فقط از متن پیادهشده نمره میدهد، پس بعد از پیادهسازی به صدا نیازی ندارد و به مدل صدای هیچ ارائهدهندهای وابسته نیست. و چون دو ارزیاب از ارائهدهندگان متفاوت هستند، اگر یکی در دسترس نباشد دیگری ادامه میدهد، با یک مدل سوم جایگزین تا نمره همیشه تولید شود.
چه چیزی در بازخورد شما تازه است
Engine 2.0 با یک لایه بازخورد کاملاً بازسازیشده عرضه میشود. این لایه شواهد دو ارزیاب را میخواند، نه فقط نمره را، و در برابر سه نوع داوطلب آزمایش شده است: کسی که برای اولین بار با CELPIP آشنا میشود، کسی با زبان انگلیسی ضعیف که به دنبال ترفند است، و کسی که فقط نیم ساعت در روز وقت دارد و آزمونش هفته آینده است. اینها چیزهایی است که تغییر کرده.
- نقلقول از حرفهای خودتان. هر نکته بازخورد، دقیقاً همان عبارتی از متن پاسخ شما را نقل میکند که ارزیابها به آن واکنش دادهاند. اگر عبارتی داخل گیومه باشد، عیناً کپی شده است؛ در بررسی ما 157 از 158 نقلقول اینگونه بودند. بازخورد هرگز چیزی را که نگفتهاید اختراع نمیکند.
- اولین چیزی که باید اصلاح کنید. هر پاسخ یک اقدام اصلی میگیرد: تغییری که بیشترین تأثیر را بر نمره شما دارد و با سادهترین کلمات ممکن روی صفحه نوشته شده است. پس از آن دو اقدام عملی دیگر میآید، سپس یک فهرست بررسی سهموردی که پیش از شروع صحبت باید در ذهن مرور کنید.
- توصیهای متناسب با نوع تسک. دادن توصیه، توصیف یک صحنه و قانع کردن کسی بر اساس معیارهای متفاوتی نمره میگیرند. بازخورد اکنون میداند هر یک از هشت نوع تسک به چه چیزی امتیاز میدهد و بر همان تمرکز میکند، بهجای تکرار همان نکتههای کلی در همه تسکها.
- کدام بُعد را اول تمرین کنید. بازخورد به شما میگوید کدام یک از چهار بُعد ضعیفترین و کدام قویترین شماست، تا بدانید نمره بعدی از کجا میآید، بدون اینکه این موضوع پشت یک عدد پنهان بماند.
- چه چیزی از خواسته تسک را از قلم انداختید. برای معیار انجام تسک، بازخورد بخشهای مشخصی از دستور تسک را که پوشش ندادهاید فهرست میکند، یا بهصراحت میگوید که همه آنها را پوشش دادهاید.
- چیزهایی که واقعاً میتوانید تمرین کنید. هر راهکار چیزی است که میتوانید پیش از تلاش بعدی با صدای بلند تمرین کنید. هیچ توصیهای برای واضحتر صحبت کردن یا کم کردن لهجه وجود ندارد: لهجه چیزی نیست که «قابلفهم بودن» بسنجد، و بازخورد هرگز درباره آن نظر نمیدهد.
- هیچ سرزنشی برای زمانسنج. پاسخی که پس از تکمیل تسک بهخاطر پایان زمان قطع شده باشد، برای همین قطعشدن نمره از دست نمیدهد، و بازخورد بهخاطر آن شما را سرزنش نمیکند.
وقتی یک مدل داوری مستقل این بازخورد را با آنچه سیستم قبلی ما برای همان پاسخها تولید کرده بود مقایسه کرد، بدون اینکه بداند کدامیک متعلق به کدام سیستم است، در 20 از 24 مقایسه بازخورد جدید را ترجیح داد؛ هم در قضاوت بهشیوه یک ارزیاب و هم در قضاوت بهشیوه یک داوطلب.
تمرین نامحدود با CA$25 در ماه
دقت فقط وقتی مفید است که بتوانید هرروز از آن استفاده کنید. یک نمره اسپیکینگ قابلاعتماد بیشترین ارزش را در چهلمین پاسخ تمرینی شما دارد، نه چهارمین، چون آنجاست که نمره شروع میکند به شما بگوید آیا تغییری در نحوه صحبتکردنتان واقعاً کار میکند. پس Engine 2.0 را قیمتگذاری کردیم تا بدون شمارش استفاده شود.
هر طرح Prepamigo شامل نمرهدهی نامحدود توسط Engine 2.0، تلاشهای نامحدود، و بانک کامل سوال است: 80 مجموعه تمرینی کامل و بیش از 2,000 تمرین در Speaking، Writing، Reading و Listening، نوشتهشده برای پیروی از انواع تسک، زمانبندی و قالب آزمون CELPIP General. دکمه ضبط را میزنید، حدود ده ثانیه بعد نمره و بازخورد مبتنیبر شواهد میگیرید، و میتوانید هرقدر که بخواهید دوباره این کار را انجام دهید.
Prepamigo
CA$25/ ماه
CA$24.98 ماهانه · CA$8.25 در ماه در طرح سالانه (CA$98.98 در سال) · شامل مالیات · لغو در هر زمان
- نمرهدهی نامحدود توسط Scoring Engine 2.0، بدون سقف روزانه، جلسهای یا هفتگی.
- 80 مجموعه تمرینی و بیش از 2,000 تمرین در هر چهار بخش، بر اساس قالب واقعی آزمون، پس هرگز مجبور نیستید دستور خودتان را بنویسید.
- ضبط کن و برو. پیادهسازی، نمرهدهی و بازخورد برایتان انجام میشود؛ چیزی برای چسباندن یا نوشتن دستور وجود ندارد.
- بازخورد با کلمات خودتان، با هر نقلقول قابلردیابی به آنچه واقعاً گفتهاید.
Claude Max، برای مقایسه
US$100/ ماه
حدود CA$138 پیش از مالیات · سطح 20x با US$200 در ماه · Pro با US$20 با سقفهای بسیار سختتر
- حتی Max هم محدود است. یک بازه استفاده پنجساعته چرخشی و یک سقف هفتگی، پنج تا بیست برابر آنچه Pro اجازه میدهد؛ وقتی به هرکدام برسید، باید صبر کنید.
- بدون بانک سوال. تسکهای خودتان را میآورید، خودتان تصمیم میگیرید آیا شبیه آزمون واقعی هستند، و خودتان ردیابی میکنید چه چیزی را قبلاً تمرین کردهاید.
- راهاندازی با خودتان است. ضبط، پیادهسازی، چسباندن متن پیادهشده و نوشتن دستورالعملهای نمرهدهی هرکدام هر بار با خودتان است.
- یک درخواست ساده، نه یک ارزیاب کالیبرهشده. وقتی بهسادگی پرسیده شد، Claude Opus 5 در 62% مواقع و Claude Sonnet 5 در 45% مواقع با نمرههای تأییدشده مطابقت داشتند، در برابر 81% برای Engine 2.0.
قیمتها و شرایط استفاده طرحهای Claude همانطور که در سپتامبر 2026 در claude.com منتشر شدهاند و ممکن است تغییر کنند. CELPIP علامت تجاری صاحب آن است؛ Prepamigo یک پلتفرم تمرین مستقل است و به سازنده آزمون وابسته نیست، مورد تأیید آن نیست و ارتباطی با آن ندارد. تمرینهای Prepamigo مطالب اصلی نوشتهشده برای پیروی از قالب عمومی آزمون هستند.
دسترسپذیری
Prepamigo Scoring Engine 2.0 برای اسپیکینگ اکنون برای همه کاربران Prepamigo در هر نوع تسک اسپیکینگ فعال است. چیزی برای فعالکردن وجود ندارد. هر پاسخ اسپیکینگ جدید توسط Engine 2.0 نمره میگیرد، و هر نمره با بازخوردی همراه است که از کلمات خود داوطلب گرفته شده.
یک پاسخ معمولی حدود ده ثانیهای نمره میگیرد، سریعتر از Engine 1.0. Engine 2.0 همچنین برای هر پاسخ کمتر از طرحی که جایگزینش شده برای ما هزینه دارد، که همان چیزی است که به ما اجازه میدهد دو ارزیاب با سه رأی هرکدام را برای هر داوطلب اجرا کنیم بدون تغییر هزینه Prepamigo.
اعداد این صفحه را همانطور که اعتبارسنجی دنیای واقعی توضیحدادهشده در بالا تکمیل میشود بهروزرسانی خواهیم کرد. اگر ضبطی دارید که فکر میکنید Engine 2.0 اشتباه نمره داده، میخواهیم آن را ببینیم: آن موارد سریعترین راهی هستند که میشناسیم برای پیدا کردن بهبود بعدی.
برای مقایسههای رودررو، بخوانید Prepamigo در برابر Claude و Prepamigo در برابر ChatGPT. یا ضبط پاسخ کنید و اجرای Engine 2.0 را ببینید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.
