محصول

Prepamigo در برابر ChatGPT برای اسپیکینگ CELPIP: دقت، محدودیت‌ها و هزینه

۷ سپتامبر ۲۰۲۶

سهم پاسخ‌هایی که در سطح تأییدشده نمره گرفتند

48 پاسخ اسپیکینگ کنارگذاشته‌شده، 16 پاسخ در هر باند. به هر مدل GPT متن پیاده‌شده داده شد و از آن خواسته شد با کلماتی ساده آن را در مقیاس CELPIP نمره بدهد؛ میانگین سه اجرا. Engine 2.0 در پیکربندی عادی عملیاتی خودش اجرا شد.

81%

Prepamigo Engine 2.0

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

مقایسه Prepamigo با پرطرفدارترین طرح‌های چت‌بات

بر اساس دلار کانادا. قیمت‌های Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شده‌اند. دقت، سهم پاسخ‌های مجموعه آزمون کنارگذاشته‌شده است که وقتی از مدل نام‌برده با کلماتی ساده درخواست امتیازدهی می‌شود، در سطح تأییدشده امتیاز می‌گیرند؛ میانگین سه اجرا.

Prepamigo
ChatGPT ProGPT 5.6 sol
قیمت ماهانه
CA$24.98 (با مالیات)
CA$276 (بدون مالیات)
امتیازدهی
نامحدود
محدود
بانک سوال آماده
بله
خیر
مجموعه‌های تمرینی
80
ندارد
تمرین‌ها
+2,000
ندارد
قالب CELPIP
بله
خیر
دقت
81%
35%
پاسخ‌های سطح بالا
71%
25%

ChatGPT احتمالاً رایج‌ترین ابزاری است که داوطلبان CELPIP برای نمره‌دهی تمرین اسپیکینگ خودشان به‌کار می‌برند. روی گوشی همه هست، در چند ثانیه پاسخ می‌دهد، و با خرسندی به شما می‌گوید پاسخ‌تان چه سطحی دارد. سؤالی که این مقاله پاسخ می‌دهد این است که آیا سطحی که به شما می‌گوید همان سطحی است که واقعاً می‌گیرید. آزمون را همان‌طور که یک داوطلب انجام می‌دهد اجرا کردیم: چسباندن متن پیاده‌شده، خواستن یک نمره، و شمارش.

پاسخ کوتاه این است: روی 48 پاسخ اسپیکینگ که هیچ‌یک از این سیستم‌ها نمی‌دیده بودند، هرکدام با نمره‌ای مستقل تأییدشده، Prepamigo Scoring Engine 2.0 در 81% مواقع به سطح درست رسید. وقتی به‌سادگی پرسیده شد، GPT 5.6 sol، مدل پشت طرح‌های پولی ChatGPT، در 35% مواقع به سطح درست رسید. GPT 5.5 به 37% رسید، GPT 5.6 luna به 31%، و GPT-4o mini به 45%، رقمی که بهتر از واقعیت به‌نظر می‌رسد، چون آن مدل تقریباً همه‌چیز را پایین نمره می‌دهد و به همین دلیل تصادفاً پاسخ‌های ضعیف را درست می‌گیرد.

سپس کاری کردیم که بیشتر مقایسه‌ها از آن صرف‌نظر می‌کنند. رویه نمره‌دهی خودمان را، با مثال‌های کالیبراسیون واقعی برای هر تسک و یک مقایسه اجباری در برابر آن‌ها، به هر مدل GPT دادیم تا ببینیم حداکثر توانش چقدر است. GPT 5.6 sol به 71%، GPT 5.5 به 69%، luna به 63% و GPT-4o mini به 50% رسیدند. هر چهار مدل همچنان پشت Engine 2.0 ماندند، و هر چهار همچنان بیشترین مشکل را در پاسخ‌های سطح بالا داشتند. باقی این مقاله هر دو آزمون را بررسی می‌کند، نتایج در هر سطح نمره، چرا یک دستیار عمومی به‌سوی وسط مقیاس می‌رود، روند روزانه کار در هر طرف چگونه است، و اگر قصد تمرین جدی دارید هرکدام چه هزینه‌ای دارد.

آزمون ساده: چیزی که یک داوطلب واقعاً می‌گیرد

هشتاد و یک درصد در برابر سی‌وپنج. در یک آزمون 48 پاسخی، این یعنی بیست‌ودو نمره درست بیشتر برای Engine 2.0 نسبت به GPT 5.6 sol. به بیان دیگر، Engine 2.0 نسبت به GPT 5.6 sol 71% اشتباه نمره‌دهی کمتر دارد، نسبت به GPT 5.5 70% کمتر، نسبت به GPT 5.6 luna 73% کمتر و نسبت به GPT-4o mini 66% کمتر.

سه اجرای مجزا از آزمون ساده به GPT 5.6 sol اعداد 31%، 40% و 35% داد، و به GPT 5.5 اعداد 35%، 42% و 33%. آن پراکندگی میان اجراها خودش یک یافته است: اگر از ChatGPT بخواهید همان متن پیاده‌شده را در دو روز مختلف نمره بدهد، به‌طور نسبتاً منظمی دو نمره متفاوت می‌گیرید. Engine 2.0 در هر سه اجرای خودش 81.3% نمره گرفت.

جایی که فاصله باز می‌شود: سطح‌به‌سطح

یک عدد کلی پنهان می‌کند که خطاها کجا می‌افتند. ارزیابی که در پاسخ‌های ضعیف عالی است و در پاسخ‌های قوی ناامیدکننده، برای یک تازه‌کار خوب است و برای کسی که به‌دنبال 10 است فعالانه مضر است. پس این‌جا نتایج آزمون ساده به تفکیک باند تأییدشده است.

پاسخ‌های سطح پایین (نمره تأییدشده 4 یا 5)

16 پاسخ کنارگذاشته‌شده، دستور ساده، میانگین سه اجرا. بیشتر خطاها نمره 3 است.

88%

Prepamigo Engine 2.0

75%

GPT-4o mini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

در پاسخ‌های ضعیف، Engine 2.0 با 88% پیشتاز است. GPT-4o mini با 75% دنبال می‌کند، که تنها جایی است که عادت پایین‌نمره‌دادن آن به نفعش کار می‌کند. سه مدل بزرگ‌تر GPT روی 52% تا 54% هستند: تقریباً نیمی از مواقع به یک پاسخ 4 یا 5 عدد 3 می‌دهند، که باند اشتباهی است حتی اگر جهت آن قابل‌درک باشد. یک تازه‌کار که از ChatGPT برای نمره‌دهی استفاده می‌کند، تقریباً نیمی از مواقع به او گفته می‌شود که ضعیف‌تر از واقعیت است.

پاسخ‌های سطح میانی (نمره تأییدشده 7 یا 8)

16 پاسخ کنارگذاشته‌شده، دستور ساده، میانگین سه اجرا. خطاها تقریباً همه نمره 5 یا 6 هستند.

85%

Prepamigo Engine 2.0

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

باند میانی جایی است که مدل‌های GPT با دستور ساده از هم می‌پاشند. Engine 2.0 روی 85% است؛ GPT-4o mini روی 44%؛ GPT 5.5، GPT 5.6 sol و luna بین 27% و 29%. پاسخ‌های سطح میانی مخلوطی واقعی از نقاط قوت و ضعف دارند که باید سنجیده شود، و بدون مثال کالیبراسیونی برای مقایسه، مدل‌های GPT ضعف‌ها را می‌بینند و عدد 5 یا 6 می‌دهند. یک داوطلب سطح 7 یا 8 که از GPT 5.6 sol نمره می‌خواهد، کمتر از سه بار از هر ده بار باند درست را می‌شنود.

پاسخ‌های سطح بالا (نمره تأییدشده 10 یا بالاتر)

16 پاسخ کنارگذاشته‌شده، دستور ساده، میانگین سه اجرا. تقریباً هر خطا نمره 7 یا 8 است.

71%

Prepamigo Engine 2.0

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

در بالا، Engine 2.0 71% پاسخ‌های سطح بالا را شناسایی می‌کند. GPT 5.5 27% را شناسایی می‌کند، GPT 5.6 sol 25%، GPT-4o mini 17% و GPT 5.6 luna 13%. هر مدل GPT به حداقل هفت از هر ده پاسخی که ارزش 10 دارد، عدد 7 یا 8 می‌دهد.

به معنای این موضوع برای یک داوطلب قوی فکر کنید. هشت پاسخ ضبط می‌کنید، پیاده‌سازی می‌کنید، در ChatGPT وارد می‌کنید و نمره می‌خواهید، و به شما می‌گوید شش‌تای آن‌ها 7 و 8 هستند. نتیجه می‌گیرید یک صحبت‌کننده متوسط قوی هستید که باید روی آن کار کنید. در تمام این مدت سطح 10 بودید. این فرضی نیست. این همان کاری بود که هر مدل GPT روی بیشتر پاسخ‌های سطح بالای آزمون ما کرد.

اگر از ChatGPT برای نمره‌دهی استفاده می‌کنید و مدام 7 و 8 می‌دهد، آن را خودکار باور نکنید. در آزمون ما، یک پاسخ سطح بالا سه برابر بیشتر احتمال داشت از GPT 5.6 sol عدد 7 یا 8 بگیرد تا نمره‌ای در باند خودش.

اگر رویه کامل خودمان را به ChatGPT بدهیم چه می‌شود؟

وسوسه‌انگیز است که اعداد آزمون ساده را نشانه ضعف خانواده مدل‌های GPT بدانیم. این‌طور نیست. مشکل هوش نیست. مشکل این است که مدلی که برای دادن یک عدد پرسیده می‌شود، بدون چیزی برای مقایسه، تخمین می‌زند، و وقتی تخمین می‌زند، پایین و به‌سمت وسط تخمین می‌زند.

پس آزمون دوم را اجرا کردیم. هر مدل GPT همان بسته‌ای را دریافت کرد که ارزیاب‌های خود Engine 2.0 دریافت می‌کنند: متن پیاده‌شده، تسک، دو مثال کالیبراسیون واقعی در هر سطح برای همان تسک دقیق، و دستوری برای نام بردن نزدیک‌ترین مثال برای هر یک از چهار بعد به‌جای تولید یک عدد. هر مدل همچنین یک یادداشت کالیبراسیون کوتاه متناسب با گرایش‌های خودش گرفت.

با رویه کامل ما: سهم پاسخ‌هایی که در سطح تأییدشده نمره گرفتند

همان 48 پاسخ کنارگذاشته‌شده. هر مدل GPT هر پاسخ را یک‌بار با همان متن‌های پیاده‌شده، دستورالعمل‌ها و مثال‌های کالیبراسیون ارزیاب‌های خود Engine 2.0 نمره داد.

81%

Prepamigo Engine 2.0

71%

GPT 5.6 sol

69%

GPT 5.5

63%

GPT 5.6 luna

50%

GPT-4o mini

مثال‌های کالیبراسیون تفاوت بسیار بزرگی ایجاد می‌کنند. GPT 5.6 sol دو برابر می‌شود، از 35% به 71%. GPT 5.5 از 37% به 69% می‌رود، luna از 31% به 63%. GPT-4o mini به‌سختی حرکت می‌کند، از 45% به 50%، چون بدون توجه به آن‌چه به آن نشان داده می‌شود همچنان همه‌چیز را پایین نمره می‌دهد؛ با رویه کامل همچنان هیچ پاسخ سطح بالایی را شناسایی نکرد. این به شما می‌گوید ارزش واقعی یک ارزیاب اختصاصی کجاست: نه در یک مدل باهوش‌تر، بلکه در نمونه‌های واقعی از این‌که هر سطح در هر تسک مشخص چه صدایی دارد، و در پرسشی که مدل را وادار می‌کند مقایسه کند به‌جای تخمین بزند.

با این حال، هر مدل GPT همچنان عقب می‌ماند. با رویه کامل، GPT 5.6 sol ده واحد پشت Engine 2.0 در نمای کلی است، ده واحد پشت در باند میانی (75% در برابر 85%)، و هشت واحد پشت در بالا (63% در برابر 71%). عادت باقی‌مانده آن، پاداش‌دادن بیش‌ازحد به صیقل است: یک پاسخ 8 توانا با ارائه‌ای روان به 9 یا 10 رانده می‌شود. GPT 5.6 luna برعکس عمل می‌کند، پاسخ‌های میانی را به‌سمت 5 می‌کشد، و باند میانی را روی 44% تمام می‌کند. یک مدل تنها که یک اجرای واحد انجام می‌دهد همچنان تعصبی مشخص دارد، و Engine 2.0 فاصله باقی‌مانده را با دو ارزیاب مستقل از دو ارائه‌دهنده متفاوت، سه رأی از هرکدام با نگه‌داشتن رأی میانی، و یک قانون تطبیق که وقتی دو ارزیاب به‌شدت اختلاف دارند نمره بالاتر را می‌گیرد، می‌بندد.

همچنین یک راه‌حل ساده و بدیهی را آزمایش کردیم: نگه‌داشتن دستور ساده و افزودن دستورالعمل‌هایی مانند «به‌سمت وسط نرو» یا «یک پاسخ سطح 9 نیازی به بی‌نقصی ندارد». هیچ تغییر قابل‌سنجشی ایجاد نکردند. چیزی که کار می‌کند تغییر پرسش است، و دادن چیزی واقعی به مدل برای مقایسه.

فاصله روند کار: ضبط و برو، یا همه‌چیز را خودتان انجام بده

اعداد دقت فرض می‌کنند نمره‌دهی واقعاً اتفاق می‌افتد. با ChatGPT، مقدار شگفت‌انگیزی کار میان زدن دکمه توقف ضبط و خواندن یک نمره قرار دارد، و بخشی از آن کار نمره را تغییر می‌دهد.

اول، به یک متن پیاده‌شده نیاز دارید. حالت صوتی ChatGPT یک گفتگو است، نه یک ارزیاب؛ برای نمره‌دادن یک پاسخ ضبط‌شده به متن نیاز دارید. این یعنی یا تایپ کردن آن‌چه گفته‌اید، که آن را تغییر می‌دهد، یا عبور دادن ضبط از یک ابزار پیاده‌سازی. و متن باید کلمه‌به‌کلمه باشد. هر مکث، هر شروع دوباره، هر خودتصحیحی باید در متن بماند. وقتی یک متن «پاکسازی‌شده» با مکث‌های حذف‌شده را آزمایش کردیم، دقت پانزده واحد کاهش یافت، چون آن مکث‌ها دقیقاً شاهدی هستند که یک ارزیاب برای قضاوت درباره صدای یک پاسخ به آن نیاز دارد. بیشتر ابزارهای پیاده‌سازی مصرفی، از جمله ابزار داخلی بیشتر گوشی‌ها، به‌طور پیش‌فرض پاکسازی می‌کنند.

دوم، به تسک نیاز دارید. ChatGPT می‌تواند اگر بخواهید یک دستور به‌سبک CELPIP بسازد، اما در حال تخمین‌زدن قالب، زمان‌بندی و نوع سناریویی است که آزمون واقعی استفاده می‌کند. نمی‌دانید آیا دستوری که نوشته شبیه چیزی است که واقعاً با آن مواجه خواهید شد.

سوم، اگر چیزی بهتر از اعداد آزمون ساده می‌خواهید، به مثال‌های کالیبراسیون نیاز دارید: پاسخ‌های واقعی در هر سطح برای همان نوع تسک، با سطوح تأییدشده. این همان ورودی است که دقت GPT 5.6 sol را در آزمون ما دو برابر کرد، و همان چیزی است که یک داوطلب نمی‌تواند در خانه تولید کند.

چهارم، برای پاسخ بعدی دوباره همه این کار را انجام می‌دهید، و هرکدام از سهمیه پیام‌های شما کسر می‌شود.

در Prepamigo، یک تسک از بانک انتخاب می‌کنید، تایمر اجرا می‌شود، صحبت می‌کنید، و حدود ده ثانیه بعد از توقف، نمره و بازخورد روی صفحه است. پیاده‌سازی به‌طور طبیعی کلمه‌به‌کلمه است، مثال‌های کالیبراسیون به‌طور خودکار به تسک متصل‌اند، و چیزی برای چسباندن یا نوشتن دستور وجود ندارد. یازدهمین پاسخ آن شب همان تلاشی را از شما می‌گیرد که پاسخ اول.

ثبات: همان پاسخ، همان نمره

نمره‌ای که نتوانید تکرار کنید، یک اندازه‌گیری نیست. اگر همان ضبط دوشنبه 8 بگیرد و سه‌شنبه 10، چیزی درباره اسپیکینگ خودتان یاد نگرفته‌اید. پس تکرارپذیری را هم آزمودیم.

Engine 2.0 روی 48 پاسخ کنارگذاشته‌شده سه بار مجزا در روزهای مختلف اجرا شد. هر بار 81.3% نمره گرفت. با نگاه به پاسخ‌های تکی، 87.5% در هر سه اجرا نمره‌ای یکسان گرفتند، و فقط 4.2% دو واحد یا بیشتر حرکت کردند، همه از پاسخ‌هایی که روی مرز میان دو باند نشسته‌اند.

آزمون ساده روی GPT 5.6 sol میان بهترین و بدترین اجرای خودش نُه واحد حرکت کرد. آن فاصله ثبات از رأی‌گیری می‌آید. هر ارزیاب در Engine 2.0 روی هر پاسخ سه بار رأی می‌دهد و رأی میانی نگه داشته می‌شود. وقتی همان پیکربندی را با یک رأی به‌جای سه رأی آزمودیم، نمرات یکسان میان اجراها از 87.5% به 77% سقوط کرد، و سهم پاسخ‌هایی که دو واحد یا بیشتر جهش می‌کنند بیش از دو برابر شد. یک گفتگوی تک با ChatGPT یک رأی تنها است. همچنین بررسی کردیم که آیا تعیین یک seed تصادفی ثابت از طریق API مدل‌های GPT را تکرارپذیرتر می‌کند. نکرد؛ روی GPT 5.6 luna، تکرارپذیری در واقع کاهش یافت.

بازخوردی که می‌توانید روی آن عمل کنید

ChatGPT توضیح‌دهنده خوبی است. اگر بپرسید چرا نمره‌ای داد، طولانی، به انگلیسی روشن، به شما می‌گوید، و بهبودها را پیشنهاد می‌دهد. برای داوطلبی که می‌خواهد درباره یک پاسخ گفتگو کند، این واقعاً ارزشمند است.

خطر این است که توضیح روان همان چیزی نیست که تشخیص دقیق است. مدلی که یک 10 را 7 نمره داده، به‌طور قانع‌کننده‌ای توضیح می‌دهد چرا 7 است. چیزی برای اشاره کردن پیدا می‌کند. و چون پیش از نمره‌دهی مجبور نبود به شواهد متعهد شود، توضیح بعد از واقعه نوشته می‌شود تا عددی را که از قبل انتخاب کرده توجیه کند.

Engine 2.0 برعکس عمل می‌کند. هر ارزیاب پیش از نام‌بردن یک سطح باید برای هر بعد به شواهد اشاره کند، و بازخورد از همان شواهد نوشته می‌شود. کلمات خودتان را نقل می‌کند: در بازرسی 158 نقل‌قول در نمونه‌ای از بازخوردها، 157 مورد عیناً در متن پیاده‌شده ظاهر شدند. وقتی یک مدل قضاوت مستقل بازخورد Engine 2.0 را با بازخورد سیستم قبلی‌مان روی همان پاسخ‌ها، به‌صورت بی‌اطلاع، مقایسه کرد، در 20 از 24 مقایسه Engine 2.0 را ترجیح داد، هم وقتی مانند یک ارزیاب قضاوت می‌کرد و هم وقتی مانند یک داوطلب.

همچنین بررسی کردیم که آیا بازخورد انتقاد را در جای درست می‌گذارد، با برداشتن پاسخ‌های قوی و خراب‌کردن عمدی یک بعد در هر زمان. در سه از چهار مورد، بعد خراب‌شده همان بعدی بود که نمره‌اش بیشترین کاهش یافت. این نوع بررسی‌ای است که یک چت‌بات نمی‌تواند به‌راحتی از آن عبور کند، چون ابعاد ثابتی برای بررسی‌شدن در برابر آن‌ها ندارد.

هزینه تمرین روزانه

یک نمره اسپیکینگ بیشترین سود را در چهلمین پاسخ شما دارد، نه چهارمین. آن‌جاست که شروع می‌کند به شما بگوید آیا تغییری در نحوه صحبت‌کردن‌تان واقعاً کار می‌کند یا نه. پس سؤال عملی این است که استفاده حجیم از هرکدام چقدر هزینه دارد.

ChatGPT Plus ماهانه US$20 است، حدود CA$28، با صورت‌حساب ماهانه، همان‌طور که در سپتامبر 2026 منتشر شده. خانواده GPT 5.6 را با سقفی روی پیام‌ها در هر بازه چرخشی به شما می‌دهد؛ متن‌های پیاده‌شده طولانی به‌همراه مثال‌های کالیبراسیون دقیقاً نوع پیامی هستند که سهم زیادی از آن سهمیه را مصرف می‌کنند، و پس از رسیدن به آن باید صبر کنید یا به مدلی کوچک‌تر تغییر دهید. ChatGPT Pro، با US$200 در ماه، حدود CA$276 پیش از مالیات، محدودیت‌ها را به‌طور قابل‌توجهی بالا می‌برد. سطح رایگان بخش زیادی از ترافیک خود را به مدل‌های کوچک‌تر می‌فرستد، و در این آزمون کوچک‌ترین آن‌ها تقریباً هیچ پاسخ سطح بالایی را شناسایی نکرد. هیچ‌کدام از طرح‌ها بانک سوال، تایمر، پیاده‌سازی کلمه‌به‌کلمه، مثال‌های کالیبراسیون، یا چیزی خاص برای CELPIP ندارند.

Prepamigo ماهانه CA$24.98 است، یا CA$8.25 در ماه در طرح سالانه، که CA$98.98 برای سال است، شامل مالیات، و می‌توانید هر زمان لغو کنید. هر طرح شامل نمره‌دهی نامحدود توسط Engine 2.0 بدون سقف روزانه، جلسه‌ای یا هفتگی، تلاش‌های نامحدود، و بانک کامل سوال است: 80 مجموعه تمرینی کامل و بیش از 2,000 تمرین در Speaking، Writing، Reading و Listening، نوشته‌شده برای پیروی از انواع تسک، زمان‌بندی و قالب آزمون CELPIP General.

به‌زبان ساده: با هزینه‌ای کمتر از ChatGPT Plus، ارزیابی می‌گیرید که در یک مقایسه ساده بیش از دو برابر دقیق‌تر است، هرگز از شما نمی‌خواهد صبر کنید، و سوال‌ها و مثال‌های کالیبراسیون از قبل آماده‌اند.

وقتی ChatGPT ابزار بهتری است

این استدلالی برای هرگز باز نکردن ChatGPT هنگام آماده‌شدن برای CELPIP نیست. یک داوطلب جدی ممکن است از هر دو استفاده کند.

  • گفتگو درباره یک پاسخ. اگر می‌خواهید بفهمید چرا یک دلیل ضعیف بود یا سه دلیل بهتر پیدا کنید، یک گفتگو شکل درستی دارد. Engine 2.0 به شما حکم و شواهد می‌دهد؛ گفتگو نمی‌کند.
  • واژگان و عبارت‌سازی. پرسیدن برای پنج راه طبیعی‌تر گفتن چیزی سریع و مفید است.
  • صحبت‌کردن با چیزی که پاسخ می‌دهد. حالت صوتی ChatGPT راهی معقول برای عادت‌کردن به صحبت بلند به انگلیسی است. ارزیاب نیست، اما همراهی می‌کند.
  • تمرین رایتینگ. پاسخ‌های نوشتاری نیازی به پیاده‌سازی ندارند، پس فاصله روند کار کوچک‌تر است. دقت GPT در رایتینگ بخشی از این آزمون نبود و ما هیچ ادعایی درباره آن نمی‌کنیم.
  • هرچیز خارج از آزمون. ChatGPT یک دستیار عمومی است و Prepamigo نیست.

چیزی که ChatGPT، بر اساس شواهد این‌جا، نباید باشد، همان چیزی است که به شما بگوید آماده هستید یا نه. برای آن به ارزیابی نیاز دارید که برای همین کار ساخته شده، روی پاسخ‌هایی که ندیده آزموده شده، و سطح‌به‌سطح اندازه‌گیری شده است.

چه چیزی در بازخورد شما تازه است

Engine 2.0 با یک لایه بازخورد کاملاً بازسازی‌شده عرضه می‌شود. این لایه شواهد دو ارزیاب را می‌خواند، نه فقط نمره را، و در برابر سه نوع داوطلب آزمایش شده است: کسی که برای اولین بار با CELPIP آشنا می‌شود، کسی با زبان انگلیسی ضعیف که به دنبال ترفند است، و کسی که فقط نیم ساعت در روز وقت دارد و آزمونش هفته آینده است. این‌ها چیزهایی است که تغییر کرده.

  • نقل‌قول از حرف‌های خودتان. هر نکته بازخورد، دقیقاً همان عبارتی از متن پاسخ شما را نقل می‌کند که ارزیاب‌ها به آن واکنش داده‌اند. اگر عبارتی داخل گیومه باشد، عیناً کپی شده است؛ در بررسی ما 157 از 158 نقل‌قول این‌گونه بودند. بازخورد هرگز چیزی را که نگفته‌اید اختراع نمی‌کند.
  • اولین چیزی که باید اصلاح کنید. هر پاسخ یک اقدام اصلی می‌گیرد: تغییری که بیشترین تأثیر را بر نمره شما دارد و با ساده‌ترین کلمات ممکن روی صفحه نوشته شده است. پس از آن دو اقدام عملی دیگر می‌آید، سپس یک فهرست بررسی سه‌موردی که پیش از شروع صحبت باید در ذهن مرور کنید.
  • توصیه‌ای متناسب با نوع تسک. دادن توصیه، توصیف یک صحنه و قانع کردن کسی بر اساس معیارهای متفاوتی نمره می‌گیرند. بازخورد اکنون می‌داند هر یک از هشت نوع تسک به چه چیزی امتیاز می‌دهد و بر همان تمرکز می‌کند، به‌جای تکرار همان نکته‌های کلی در همه تسک‌ها.
  • کدام بُعد را اول تمرین کنید. بازخورد به شما می‌گوید کدام یک از چهار بُعد ضعیف‌ترین و کدام قوی‌ترین شماست، تا بدانید نمره بعدی از کجا می‌آید، بدون اینکه این موضوع پشت یک عدد پنهان بماند.
  • چه چیزی از خواسته تسک را از قلم انداختید. برای معیار انجام تسک، بازخورد بخش‌های مشخصی از دستور تسک را که پوشش نداده‌اید فهرست می‌کند، یا به‌صراحت می‌گوید که همه آن‌ها را پوشش داده‌اید.
  • چیزهایی که واقعاً می‌توانید تمرین کنید. هر راهکار چیزی است که می‌توانید پیش از تلاش بعدی با صدای بلند تمرین کنید. هیچ توصیه‌ای برای واضح‌تر صحبت کردن یا کم کردن لهجه وجود ندارد: لهجه چیزی نیست که «قابل‌فهم بودن» بسنجد، و بازخورد هرگز درباره آن نظر نمی‌دهد.
  • هیچ سرزنشی برای زمان‌سنج. پاسخی که پس از تکمیل تسک به‌خاطر پایان زمان قطع شده باشد، برای همین قطع‌شدن نمره از دست نمی‌دهد، و بازخورد به‌خاطر آن شما را سرزنش نمی‌کند.

وقتی یک مدل داوری مستقل این بازخورد را با آنچه سیستم قبلی ما برای همان پاسخ‌ها تولید کرده بود مقایسه کرد، بدون اینکه بداند کدام‌یک متعلق به کدام سیستم است، در 20 از 24 مقایسه بازخورد جدید را ترجیح داد؛ هم در قضاوت به‌شیوه یک ارزیاب و هم در قضاوت به‌شیوه یک داوطلب.

سوالات متداول

آیا ChatGPT می‌تواند اسپیکینگ CELPIP من را نمره بدهد؟ یک عدد به شما می‌دهد. وقتی به‌سادگی روی 48 پاسخ نادیده با نمره‌های تأییدشده پرسیده شد، GPT 5.6 sol در 35% مواقع، GPT 5.5 در 37%، luna در 31%، GPT-4o mini در 45% درست بود، در برابر 81% برای Engine 2.0. در پاسخ‌های سطح بالا GPT 5.6 sol در 25% مواقع درست بود.

آیا Prepamigo از ChatGPT دقیق‌تر است؟ 81% در برابر 35% برای GPT 5.6 sol با یک درخواست ساده. با رویه کامل ما همراه با مثال‌های کالیبراسیون، GPT 5.6 sol به 71% رسید، همچنان ده واحد پشت.

هزینه هرکدام چقدر است؟ ChatGPT Pro ماهانه US$200 است، حدود CA$276 پیش از مالیات؛ Plus با US$20 محدودیت پیام دارد. Prepamigo ماهانه CA$24.98 با مالیات، یا CA$8.25 در ماه در طرح سالانه، با نمره‌دهی نامحدود و 80 مجموعه تمرینی است.

اگر از ChatGPT استفاده می‌کنم، کدام مدل GPT را باید انتخاب کنم؟ با دستور ساده، هیچ‌کدام خوب عمل نمی‌کند. با مثال‌های کالیبراسیون، GPT 5.6 sol. اگر به سطح 10 نزدیک هستید، هرگز GPT-4o mini را انتخاب نکنید.

برای همین مقایسه در برابر Claude، بخوانید Prepamigo در برابر Claude. برای جدول کامل رتبه‌بندی هشت سیستم، بخوانید کدام هوش مصنوعی اسپیکینگ CELPIP را دقیق‌تر نمره می‌دهد. یا پیاده‌سازی را کنار بگذارید و ضبط پاسخ کنید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.

Prepamigo در برابر ChatGPT برای اسپیکینگ CELPIP: دقت، محدودیت‌ها و هزینه | PrepAmigo