نمره‌دهی

کدام هوش مصنوعی اسپیکینگ CELPIP را دقیق‌تر نمره می‌دهد؟ ما هشت مدل را آزمودیم

۵ سپتامبر ۲۰۲۶

سهم پاسخ‌هایی که در سطح تأییدشده نمره گرفتند

48 پاسخ کنارگذاشته‌شده، 16 پاسخ در هر باند. به هر مدل متن پیاده‌شده داده شد و از آن خواسته شد با کلماتی ساده آن را در مقیاس CELPIP نمره بدهد؛ میانگین سه اجرا. Engine 2.0 در پیکربندی عادی عملیاتی خودش اجرا شد.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

مقایسه Prepamigo با پرطرفدارترین طرح‌های چت‌بات

بر اساس دلار کانادا. قیمت‌های Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شده‌اند. دقت، سهم پاسخ‌های مجموعه آزمون کنارگذاشته‌شده است که وقتی از مدل نام‌برده با کلماتی ساده درخواست امتیازدهی می‌شود، در سطح تأییدشده امتیاز می‌گیرند؛ میانگین سه اجرا.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
قیمت ماهانه
CA$24.98 (با مالیات)
+CA$138 (بدون مالیات)
CA$276 (بدون مالیات)
امتیازدهی
نامحدود
محدود
محدود
بانک سوال آماده
بله
خیر
خیر
مجموعه‌های تمرینی
80
ندارد
ندارد
تمرین‌ها
+2,000
ندارد
ندارد
قالب CELPIP
بله
خیر
خیر
دقت
81%
62%
35%
پاسخ‌های سطح بالا
71%
50%
25%

بسیاری از داوطلبان CELPIP اکنون تمرین اسپیکینگ خودشان را با یک چت‌بات هوش مصنوعی نمره می‌دهند. یک پاسخ ضبط کنید، پیاده‌سازی کنید، بچسبانید، نمره بخواهید. سریع است و رایگان یا تقریباً رایگان، و توضیحات معتبر به‌نظر می‌رسند. چیزی که هیچ‌کس به شما نمی‌گوید این است که این عدد چند بار درست است، یا به کدام مدل باید اعتماد کرد، یا آیا نحوه پرسیدن شما پاسخ را تغییر می‌دهد. می‌خواستیم بدانیم، پس آزمون را ساختیم و روی هشت سیستم، به دو روش، اجرا کردیم.

روش اول همان نمودار بالاست: چسباندن متن پیاده‌شده، خواستن یک نمره، همان‌طور که یک داوطلب انجام می‌دهد. در میان مدل‌های عمومی، Claude Opus 5 با 62% دقیق‌ترین بود، Gemini با 58% دنبال کرد، و باقی همه زیر نیمی بودند: Claude Sonnet 5 و GPT-4o mini با 45%، GPT 5.5 با 37%، GPT 5.6 sol با 35%، GPT 5.6 luna با 31%. یک سیستم اختصاصی، Prepamigo Scoring Engine 2.0، روی همان پاسخ‌ها به 81% رسید.

روش دوم همان‌طوری است که فکر می‌کنیم آموزنده‌ترین است: رویه نمره‌دهی خودمان را، با مثال‌های کالیبراسیون واقعی و یک مقایسه اجباری، به هر مدل دادیم تا ببینیم حداکثر توان هرکدام چقدر است. هر مدل بهبود یافت، برخی به‌طور چشمگیر، و هر مدل همچنان پشت Engine 2.0 تمام کرد. باید صادقانه بگوییم Prepamigo محصول خود ماست. تلاش کرده‌ایم هر دو آزمون را برای همه منصفانه کنیم، و هرجا که یک مدل ما را در یک سطح خاص شکست داد، آن را می‌گوییم.

جدول رتبه‌بندی دستور ساده

سه سطح در نمودار بالا قابل‌مشاهده است. Engine 2.0 با 81% تنها ایستاده است. Claude Opus 5 با 62% و Gemini با 58% سطح دومی می‌سازند: قابل‌استفاده، اگر بپذیرید دو بار از پنج بار اشتباه باشید. باقی زیر 50% است، که یعنی بدتر از یک شیرت‌وخط میان سه باند اگر هیچ‌چیز درباره پاسخ نمی‌دانستید.

این ویژگی مشخصه آزمون ساده است: هر مدل عمومی سخت‌گیرانه نمره می‌دهد. میانگین نمره‌ای که به یک پاسخ سطح بالای تأییدشده دادند از 7.2 (luna) تا 8.6 (Opus 5) متغیر بود. میانگینی که به یک پاسخ سطح پایین تأییدشده دادند از 3.7 تا 4.3 متغیر بود، زیر باند برای همه جز Opus 5 و Gemini. بدون هیچ نمونه‌ای از این‌که هر سطح واقعاً چه صدایی دارد، مدل‌ها پاسخ را در برابر یک پاسخ تصورشده کامل می‌سنجند و کسر می‌کنند.

نتایج در هر سطح نمره

یک رقم کلی پنهان می‌کند که خطاها کجا می‌افتند، و این‌که کجا می‌افتند همان چیزی است که تعیین می‌کند آیا یک ارزیاب برای شما مفید است. این‌جا نتایج آزمون ساده به تفکیک باند است.

پاسخ‌های سطح پایین (تأییدشده 4 یا 5)

16 پاسخ کنارگذاشته‌شده در هر سیستم، دستور ساده، میانگین سه اجرا.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

پاسخ‌های ضعیف باید آسان‌ترین انتهای مقیاس باشند، و با یک دستور ساده نیستند. Engine 2.0 روی 88% است، Opus 5 روی 77%، GPT-4o mini روی 75%. باقی حدود نیمی است، و Sonnet 5 روی 44% است. خطا تقریباً همیشه نمره 3 است: مدل یک پاسخ ضعیف را می‌بیند و آن را زیر باند نمره می‌دهد به‌جای درون آن. رقم قابل‌قبول GPT-4o mini در این‌جا اولین نشانه مشکل آن است، که این است که تقریباً همه‌چیز را پایین نمره می‌دهد.

پاسخ‌های سطح میانی (تأییدشده 7 یا 8)

16 پاسخ کنارگذاشته‌شده در هر سیستم، دستور ساده، میانگین سه اجرا.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

باند میانی میدان را جدا می‌کند. Engine 2.0 روی 85% است. Gemini و Sonnet 5 روی 63%، Opus 5 روی 58%. سپس یک پرتگاه: GPT-4o mini روی 44% و سه مدل بزرگ‌تر GPT بین 27% و 29%. پاسخ‌های سطح میانی مخلوطی واقعی از نقاط قوت و ضعف دارند که باید سنجیده شود، و بدون چیزی برای مقایسه، مدل‌های GPT ضعف‌ها را می‌بینند و عدد 5 یا 6 می‌دهند. یک داوطلب سطح 7 یا 8 که از GPT 5.6 sol نمره می‌خواهد کمتر از سه بار از هر ده بار باند درست را می‌شنود.

پاسخ‌های سطح بالا (تأییدشده 10 یا بالاتر)

16 پاسخ کنارگذاشته‌شده در هر سیستم، دستور ساده، میانگین سه اجرا. تقریباً هر خطا نمره 7 یا 8 است.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

باند بالا جایی است که تفاوت‌ها بیشترین اهمیت را دارند، و جایی است که دستور ساده بیشترین آسیب را می‌زند. Engine 2.0 71% پاسخ‌های سطح بالا را شناسایی می‌کند. Gemini 56% را شناسایی می‌کند و Opus 5 دقیقاً نیمی را. سپس Sonnet 5 با 29%، GPT 5.5 با 27%، GPT 5.6 sol با 25%، GPT-4o mini با 17% و GPT 5.6 luna با 13%. پنج از هفت مدل عمومی به حداقل هفت از هر ده پاسخی که ارزش 10 دارد، عدد 7 یا 8 می‌دهند.

اگر داوطلبی قوی هستید که خودتان را با یک چت‌بات نمره می‌دهید، این عددی است که باید به‌خاطر بسپارید. شانس این‌که یک درخواست ساده به GPT 5.6 sol به شما بگوید یک 10 یک 10 است، یک به چهار است.

جدول رتبه‌بندی دوم: با رویه کامل ما

اعداد آزمون ساده حکمی درباره میزان باهوشی این مدل‌ها نیست. حکمی است درباره آن‌چه اتفاق می‌افتد وقتی از مدلی برای یک عدد پرسیده می‌شود بدون چیزی برای مقایسه. پس آزمون دوم را اجرا کردیم، و مثال‌های کالیبراسیون و مقایسه اجباری‌ای را که ارزیاب‌های خود Engine 2.0 استفاده می‌کنند به هر مدل دادیم.

با رویه کامل ما: سهم پاسخ‌هایی که در سطح تأییدشده نمره گرفتند

همان 48 پاسخ کنارگذاشته‌شده. همان متن‌های پیاده‌شده، دستورالعمل‌ها و مثال‌های کالیبراسیون برای هر سیستم؛ هر مدل هر پاسخ را یک‌بار نمره داد. Gemini صدا را هم دریافت کرد.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

هر مدل بهبود می‌یابد. Opus 5 از 62% به 77% می‌رود. GPT 5.6 sol دو برابر می‌شود، از 35% به 71%. GPT 5.5 از 37% به 69% می‌رود، Sonnet 5 از 45% به 69%، luna از 31% به 63%، Gemini از 58% به 71%. GPT-4o mini به‌سختی حرکت می‌کند، از 45% به 50%، چون بدون توجه به آن‌چه به آن نشان داده می‌شود همچنان همه‌چیز را پایین نمره می‌دهد.

ترتیب هم تغییر می‌کند. با یک دستور ساده، مدل‌های Claude بسیار جلوتر از مدل‌های GPT بودند. با رویه کامل، GPT 5.6 sol از Sonnet 5 پیشی می‌گیرد و با Gemini مساوی می‌شود، و چهار مدل میان 69% و 71% خوشه‌ای می‌سازند، از نظر آمار در این نمونه غیرقابل‌تشخیص. Opus 5 در بالای میدان مدل‌های عمومی با 77% باقی می‌ماند، چهار واحد پشت Engine 2.0.

در نمای سطحی، رویه کامل دقت باند پایین را برای چهار مدل به 88% می‌رساند، همان رقم Engine 2.0، و دقت باند میانی را برای دو مدل Claude به 81%. باند بالا جایی است که فاصله باقی می‌ماند: Opus 5، GPT 5.6 sol، Gemini و GPT 5.5 همه روی 63% متوقف می‌شوند، Sonnet 5 روی 38%، و GPT-4o mini روی صفر، در برابر 71% برای Engine 2.0. یک مدل تنها که یک اجرای واحد انجام می‌دهد همچنان روی یک پاسخ قوی که یک لغزش دارد عقب‌نشینی می‌کند. Engine 2.0 آن فاصله باقی‌مانده را با دو ارزیاب مستقل از دو ارائه‌دهنده متفاوت، سه رأی از هرکدام با نگه‌داشتن رأی میانی، و یک قانون تطبیق که وقتی دو ارزیاب به‌شدت اختلاف دارند نمره بالاتر را می‌گیرد، می‌بندد، چون تحلیل نشان داد رأی پایین‌تر تقریباً همیشه در پاسخ‌های قوی اشتباه بود.

خلاصه صادقانه هر دو جدول رتبه‌بندی این است: رویه بیشتر از مدل اهمیت دارد. همان GPT 5.6 sol از 35% به 71% رفت بدون تغییر حتی یک وزن، فقط با نشان‌دادن این‌که هر سطح چه صدایی دارد و پرسیدن این‌که پاسخ به کدام مثال شباهت دارد.

چرا مدل‌ها پایین و به‌سمت وسط می‌روند

این الگو در مدل‌هایی از سه شرکت متفاوت این‌قدر پیوسته است که نمی‌تواند عجیبیِ فقط یکی از آن‌ها باشد. این ویژگی خود تسک است.

وقتی از یک مدل خواسته می‌شود پاسخی را روی یک مقیاس قرار دهد، وقتی نامطمئن است به‌سمت مرکز حرکت می‌کند، چون مرکز جایی است که یک پاسخ اشتباه کمترین هزینه را دارد. و وقتی هیچ نمونه‌ای از این‌که یک سطح واقعاً چه صدایی دارد ندارد، پاسخ را در برابر یک پاسخ تصورشده کامل می‌سنجد و برای هر لغزش کسر می‌کند. یک پاسخ سطح بالا هرگز بی‌نقص نیست. یک شروع دوباره، یک جمله ساده در میان جمله‌های پیچیده، یک مکث پیش از یک کلمه سخت دارد. سنجیده‌شده در برابر کمال، آن لغزش‌ها یک یا دو درجه هزینه دارند، و یک 10 می‌شود 8 یا 7.

دستورالعمل این را رفع نمی‌کند. تلاش کردیم به‌طور صریح به مدل‌ها بگوییم یک سطح 9 نیازی به پاسخ بدون‌خطا ندارد، که کم‌نمره‌دادن یک پاسخ قوی به‌همان اندازه جدی است که بیش‌نمره‌دادن یک پاسخ ضعیف. هر دستورالعمل پذیرفته شد و بعد در عمل نادیده گرفته شد. وقتی همان مثال کالیبراسیونی را که به یک مدل گفته بودیم نماینده یک پاسخ سطح بالاست به آن دادیم و از آن خواستیم نمره‌اش بدهد، به آن عدد 8 داد.

چیزی که آن را رفع می‌کند، تقریباً همیشه، تغییر پرسش از «چه عددی؟» به «کدام مثال؟» و ارائه مثال‌های واقعی است. این همان تفاوت میان دو جدول رتبه‌بندی است. حتی در آن حالت، یک اجرای تنها همچنان کمی کشیده می‌شود، چون مثال‌های کالیبراسیون کامل نیستند و یک خوانش از آن‌ها یک خوانش است. دو ارزیاب، سه رأی و یک قانون تطبیق همان چیزی هستند که باقی را می‌بندند.

یادداشت‌هایی درباره هر مدل

  • Claude Opus 5. بهترین ارزیاب عمومی در هر دو آزمون: 62% ساده (62%، 65% و 58% در سه اجرا) و 77% با رویه کامل. ضعف آن در دستور ساده باند میانی است، جایی که عدد 6 می‌دهد؛ ضعف آن در رویه کامل باند بالا است، جایی که روی 63% متوقف می‌شود. همچنین به فاصله زیادی گران‌ترین مدل این‌جا است.
  • Gemini. دوم در آزمون ساده با 58%، یکسان در هر سه اجرا، و یکنواخت‌ترین در میان باندها، با 56%، 63% و 56%. با رویه کامل و ضبط صوتی به 71% رسید، هم‌سطح با GPT 5.6 sol که فقط از متن کار کرده بود. شنیدن ضبط چیزی فراتر از آن‌چه یک متن پیاده‌شده کلمه‌به‌کلمه فراهم می‌کند به آن اضافه نکرد.
  • Claude Sonnet 5. 45% ساده، با نمایه‌ای عجیب: معقول در باند میانی با 63%، ضعیف روی پاسخ‌های ضعیف با 44% چون به آن‌ها عدد 3 می‌دهد، و ضعیف در بالا با 29%. با رویه کامل به 69% می‌رسد اما روی پاسخ‌های سطح بالا در 38% باقی می‌ماند. اگر Sonnet 5 مدام 8 می‌دهد، آن را باور نکنید.
  • GPT-4o mini. 45% ساده، 50% با رویه کامل، و در هر دو حالت این عدد آن را بهتر از واقعیت جلوه می‌دهد. تقریباً همه‌چیز را پایین نمره می‌دهد: 75% روی پاسخ‌های ضعیف، 17% و بعد 0% روی پاسخ‌های سطح بالا. هرکاری می‌کنید، اسپیکینگ خودتان را با این مدل نمره ندهید.
  • GPT 5.5. 37% ساده (35%، 42%، 33%)، 69% با رویه کامل. باند میانی دستور ساده آن 29% است. در نسخه قبلی خط پردازش خودمان ارزیاب متنی بود و به‌دلیل ضعف دقیقاً در همان باند جایگزین شد.
  • GPT 5.6 sol. 35% ساده (31%، 40%، 35%)، بزرگ‌ترین نوسان اجرا‌به‌اجرای هر مدل، و 71% با رویه کامل، بزرگ‌ترین بهبود هر مدل. یک ارزیاب توانا وقتی مثال به آن نشان داده می‌شود، و یک ارزیاب ضعیف وقتی نشان داده نمی‌شود. عادت رویه‌کامل آن پاداش‌دادن بیش‌ازحد به صیقل در باند میانی است.
  • GPT 5.6 luna. آخرین در هر دو آزمون: 31% ساده و 63% با رویه کامل. پاسخ‌های میانی را به‌سمت 5 می‌کشد و 13% پاسخ‌های سطح بالا را در حالت ساده شناسایی کرد. به‌قدری ارزان که به‌عنوان نظر دوم درون یک سیستم دو‌ارزیابی مفید است؛ نه به‌قدری دقیق که به‌تنهایی استفاده شود.

یک سیستم اختصاصی چه چیزی اضافه می‌کند

Engine 2.0 یک مدل بهتر نیست. از مدل‌های همین جدول رتبه‌بندی استفاده می‌کند. آن‌چه اضافه می‌کند رویه است، و هر بخش از آن رویه با اندازه‌گیری انتخاب شده.

  1. پیاده‌سازی کلمه‌به‌کلمه، به‌طور خودکار. هر مکث و شروع دوباره نگه داشته می‌شود، چون حذف آن‌ها در آزمایش پانزده واحد دقت را کاهش داد. شما نباید ابزار پیاده‌سازی‌ای پیدا کنید که این کار را انجام دهد؛ بیشتر ابزارهای مصرفی به‌طور پیش‌فرض پاکسازی می‌کنند.
  2. مثال‌های کالیبراسیون متصل به هر تسک. دو پاسخ واقعی در هر سطح برای هر یک از هشت نوع تسک، از قبل آماده. این تنها ورودی‌ای است که دقت GPT 5.6 sol را دو برابر کرد، و همان چیزی است که نمی‌توانید در خانه تولید کنید.
  3. مقایسه، نه یک عدد. هر ارزیاب نزدیک‌ترین مثال را در هر یک از چهار بعد نام می‌برد؛ نمره با یک قانون دنبال می‌شود. این چیزی است که گرایش را متوقف می‌کند.
  4. دو ارزیاب از دو ارائه‌دهنده. مدل‌های متفاوت نقاط کور متفاوتی دارند. دو مدل، با یک قانون ثابت تطبیق‌یافته، از هرکدام به‌تنهایی بهتر عمل می‌کنند.
  5. سه رأی از هرکدام، رأی میانی نگه‌داشته‌شده. این دقت را بالا نبرد، اما ثبات اجرا‌به‌اجرا را از 77% به 87.5% برد. یک پاسخ تک از یک چت‌بات یک رأی تنها است.
  6. تطبیقی که در اختلاف شدید نمره بالاتر را می‌گیرد. چون رأی پایین‌تر تقریباً همیشه در پاسخ‌های قوی اشتباه بود. یک میانگین ساده در آزمایش به اواسط شصت سقوط کرد.
  7. محافظ‌ها. پاسخ‌های ساکت، چند‌کلمه‌ای، خارج‌از‌موضوع و غیرانگلیسی نمره کف را با قانون می‌گیرند نه با تخمین یک مدل.

نتیجه 81% در نمای کلی و 71% در بالا است، یکسان در سه اجرای مجزا، در حدود ده ثانیه برای هر پاسخ بدون چیزی برای چسباندن.

اگر به‌هرحال از یک چت‌بات استفاده می‌کنید

برخی خوانندگان همچنان با یک چت‌بات نمره می‌دهند، و این انتخاب معقولی برای داوطلبی با بودجه محدود یا کسی است که می‌خواهد درباره پاسخ‌هایش گفتگو کند. این مراحل همان تفاوت میان دو جدول رتبه‌بندی هستند، و شما را به جدول دوم نزدیک‌تر می‌کنند تا اول.

  1. از متن پیاده‌شده کلمه‌به‌کلمه استفاده کنید. مکث‌ها، شروع‌های دوباره و خودتصحیحی‌های خودتان را نگه دارید. اگر ابزار پیاده‌سازی شما آن‌ها را پاک می‌کند، ارزیاب پاسخی بهتر از آن‌چه گفته‌اید را نمره می‌دهد.
  2. به آن مثال بدهید، نه چک‌لیست. یک یا دو پاسخ واقعی در هر سطح برای همان نوع تسک، با سطح‌هایشان برچسب‌گذاری‌شده، بیشتر از هر توضیحی درباره شکل یک سطح 9 مفیدند. اگر مثال‌های تأییدشده ندارید، این همان مرحله‌ای است که نمی‌توانید در خانه بازتولید کنید، و همان چیزی است که بیشترین اهمیت دارد.
  3. بپرسید کدام مثال، نه چه عدد. برای هر یک از چهار بعد، از مدل بخواهید نزدیک‌ترین مثال را نام ببرد و «جایی در میان» را ممنوع کنید. خودتان نمره را از سطوحی که نام می‌برد استخراج کنید.
  4. بیش از یک‌بار بپرسید. همان پاسخ را دو یا سه بار در گفتگوهای جدید نمره‌گذاری کنید و پاسخ میانی را نگه دارید. GPT 5.6 sol نُه واحد میان اجراها در آزمون ساده نوسان داشت.
  5. مدلی با سابقه خوب در باند بالا انتخاب کنید. Opus 5 یا Gemini اگر به‌سادگی می‌پرسید؛ Opus 5 یا GPT 5.6 sol اگر مثال دارید. هرگز GPT-4o mini، اگر به سطح 10 نزدیک هستید.
  6. به یک 7 یا 8 بی‌اعتماد باشید. در هر مدل عمومی، یک 7 یا 8 روی پاسخی که فکر می‌کردید عالی است، احتمال بیشتری دارد که یک خطا باشد تا یک حکم.

به کدام مدل اعتماد کنید، بسته به جایی که هستید

خوانش درست این جدول‌های رتبه‌بندی به سطح فعلی شما بستگی دارد، چون مدل‌ها در جاهای متفاوتی شکست می‌خورند.

  • اگر امروز سطح 4 یا 5 هستید، Opus 5 وقتی به‌سادگی می‌پرسید تقریباً سه از هر چهار بار این را به شما می‌گوید؛ بیشتر مدل‌های دیگر حدود نیمی از مواقع به شما می‌گویند 3 هستید. مشکل شما واقعاً ارزیاب نیست؛ بازخورد است، و برای آن به چیزی نیاز دارید که کلمات شما را نقل کند نه خلاصه کند.
  • اگر سطح 7 یا 8 هستید، از مدل‌های GPT با دستور ساده اجتناب کنید، که هفت بار از ده بار به شما می‌گویند 5 یا 6 هستید. Gemini و Sonnet 5 قابل‌اعتمادترین ارزیاب‌های دستور ساده در باند میانی با 63% هستند. Engine 2.0 روی 85% است.
  • اگر سطح 10 یا بالاتر هستید، این‌جا انتخاب بیشترین اهمیت را دارد. وقتی به‌سادگی پرسیده شود، هیچ مدل عمومی بیش از 56% مواقع یک 10 را شناسایی نمی‌کند، و مدل‌های GPT بین 13% و 27% مواقع این کار را می‌کنند. Engine 2.0 هفت از ده را شناسایی می‌کند و، مهم‌تر، هر بار که می‌پرسید همان پاسخ را می‌دهد.

الگو در هر سه باند همان است که کل مقاله توصیف کرده. مدل‌ها احمق نیستند؛ محتاط‌اند، و احتیاط بدون چیزی برای مقایسه یعنی یک عدد پایین. هرچه از وسط دورتر باشید، احتیاط یک ارزیاب بیشتر برای شما هزینه دارد، و بیشتر اهمیت دارد که ارزیاب برای مقاومت در برابر آن ساخته شده باشد.

چه چیزی در بازخورد شما تازه است

Engine 2.0 با یک لایه بازخورد کاملاً بازسازی‌شده عرضه می‌شود. این لایه شواهد دو ارزیاب را می‌خواند، نه فقط نمره را، و در برابر سه نوع داوطلب آزمایش شده است: کسی که برای اولین بار با CELPIP آشنا می‌شود، کسی با زبان انگلیسی ضعیف که به دنبال ترفند است، و کسی که فقط نیم ساعت در روز وقت دارد و آزمونش هفته آینده است. این‌ها چیزهایی است که تغییر کرده.

  • نقل‌قول از حرف‌های خودتان. هر نکته بازخورد، دقیقاً همان عبارتی از متن پاسخ شما را نقل می‌کند که ارزیاب‌ها به آن واکنش داده‌اند. اگر عبارتی داخل گیومه باشد، عیناً کپی شده است؛ در بررسی ما 157 از 158 نقل‌قول این‌گونه بودند. بازخورد هرگز چیزی را که نگفته‌اید اختراع نمی‌کند.
  • اولین چیزی که باید اصلاح کنید. هر پاسخ یک اقدام اصلی می‌گیرد: تغییری که بیشترین تأثیر را بر نمره شما دارد و با ساده‌ترین کلمات ممکن روی صفحه نوشته شده است. پس از آن دو اقدام عملی دیگر می‌آید، سپس یک فهرست بررسی سه‌موردی که پیش از شروع صحبت باید در ذهن مرور کنید.
  • توصیه‌ای متناسب با نوع تسک. دادن توصیه، توصیف یک صحنه و قانع کردن کسی بر اساس معیارهای متفاوتی نمره می‌گیرند. بازخورد اکنون می‌داند هر یک از هشت نوع تسک به چه چیزی امتیاز می‌دهد و بر همان تمرکز می‌کند، به‌جای تکرار همان نکته‌های کلی در همه تسک‌ها.
  • کدام بُعد را اول تمرین کنید. بازخورد به شما می‌گوید کدام یک از چهار بُعد ضعیف‌ترین و کدام قوی‌ترین شماست، تا بدانید نمره بعدی از کجا می‌آید، بدون اینکه این موضوع پشت یک عدد پنهان بماند.
  • چه چیزی از خواسته تسک را از قلم انداختید. برای معیار انجام تسک، بازخورد بخش‌های مشخصی از دستور تسک را که پوشش نداده‌اید فهرست می‌کند، یا به‌صراحت می‌گوید که همه آن‌ها را پوشش داده‌اید.
  • چیزهایی که واقعاً می‌توانید تمرین کنید. هر راهکار چیزی است که می‌توانید پیش از تلاش بعدی با صدای بلند تمرین کنید. هیچ توصیه‌ای برای واضح‌تر صحبت کردن یا کم کردن لهجه وجود ندارد: لهجه چیزی نیست که «قابل‌فهم بودن» بسنجد، و بازخورد هرگز درباره آن نظر نمی‌دهد.
  • هیچ سرزنشی برای زمان‌سنج. پاسخی که پس از تکمیل تسک به‌خاطر پایان زمان قطع شده باشد، برای همین قطع‌شدن نمره از دست نمی‌دهد، و بازخورد به‌خاطر آن شما را سرزنش نمی‌کند.

وقتی یک مدل داوری مستقل این بازخورد را با آنچه سیستم قبلی ما برای همان پاسخ‌ها تولید کرده بود مقایسه کرد، بدون اینکه بداند کدام‌یک متعلق به کدام سیستم است، در 20 از 24 مقایسه بازخورد جدید را ترجیح داد؛ هم در قضاوت به‌شیوه یک ارزیاب و هم در قضاوت به‌شیوه یک داوطلب.

سوالات متداول

کدام مدل هوش مصنوعی در نمره‌دهی اسپیکینگ CELPIP دقیق‌ترین است؟ وقتی به‌سادگی پرسیده شود: Claude Opus 5 با 62%، Gemini 58%، Claude Sonnet 5 و GPT-4o mini 45%، GPT 5.5 37%، GPT 5.6 sol 35%، GPT 5.6 luna 31%. Prepamigo Scoring Engine 2.0 روی همان پاسخ‌ها به 81% رسید.

ChatGPT یا Claude؟ Claude، به‌روشنی، وقتی به‌سادگی پرسیده شود: 62% و 45% در برابر 35% و 37%. با رویه کامل ما فاصله به 77% برای Opus 5 در برابر 71% برای GPT 5.6 sol باریک می‌شود.

چرا همه به پاسخ‌های قوی من عدد 7 یا 8 می‌دهند؟ مدل‌هایی که چیزی برای مقایسه ندارند پایین و به‌سمت وسط تخمین می‌زنند، و یک پاسخ قوی همیشه لغزش‌های کوچکی دارد. وقتی به‌سادگی پرسیده شد، هیچ مدل عمومی بیش از 56% پاسخ‌های سطح بالا را شناسایی نکرد.

چگونه نمره بهتری از یک چت‌بات بگیرم؟ متن پیاده‌شده کلمه‌به‌کلمه، پاسخ‌های نمونه در هر سطح، پرسیدن کدام مثال به‌جای چه عدد، پرسیدن بیش از یک‌بار و نگه‌داشتن پاسخ میانی. آن رویه در آزمون ما GPT 5.6 sol را از 35% به 71% دو برابر کرد.

برای نگاهی دقیق‌تر به دو مقایسه رودررو، بخوانید Prepamigo در برابر Claude و Prepamigo در برابر ChatGPT. برای این‌که رویه مرحله‌به‌مرحله چگونه کار می‌کند، بخوانید درون Scoring Engine 2.0. یا ضبط پاسخ کنید و پیاده‌سازی را کنار بگذارید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.

کدام هوش مصنوعی اسپیکینگ CELPIP را دقیق‌تر نمره می‌دهد؟ ما هشت مدل را آزمودیم | PrepAmigo