سهم پاسخهایی که در سطح تأییدشده نمره گرفتند
48 پاسخ اسپیکینگ کنارگذاشتهشده، 16 پاسخ در هر باند. به هر مدل GPT متن پیادهشده داده شد و از آن خواسته شد با کلماتی ساده آن را در مقیاس CELPIP نمره بدهد؛ میانگین سه اجرا. Engine 2.0 در پیکربندی عادی عملیاتی خودش اجرا شد.
81%
Prepamigo Engine 2.0
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
مقایسه Prepamigo با پرطرفدارترین طرحهای چتبات
بر اساس دلار کانادا. قیمتهای Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شدهاند. دقت، سهم پاسخهای مجموعه آزمون کنارگذاشتهشده است که وقتی از مدل نامبرده با کلماتی ساده درخواست امتیازدهی میشود، در سطح تأییدشده امتیاز میگیرند؛ میانگین سه اجرا.
ChatGPT احتمالاً رایجترین ابزاری است که داوطلبان CELPIP برای نمرهدهی تمرین اسپیکینگ خودشان بهکار میبرند. روی گوشی همه هست، در چند ثانیه پاسخ میدهد، و با خرسندی به شما میگوید پاسختان چه سطحی دارد. سؤالی که این مقاله پاسخ میدهد این است که آیا سطحی که به شما میگوید همان سطحی است که واقعاً میگیرید. آزمون را همانطور که یک داوطلب انجام میدهد اجرا کردیم: چسباندن متن پیادهشده، خواستن یک نمره، و شمارش.
پاسخ کوتاه این است: روی 48 پاسخ اسپیکینگ که هیچیک از این سیستمها نمیدیده بودند، هرکدام با نمرهای مستقل تأییدشده، Prepamigo Scoring Engine 2.0 در 81% مواقع به سطح درست رسید. وقتی بهسادگی پرسیده شد، GPT 5.6 sol، مدل پشت طرحهای پولی ChatGPT، در 35% مواقع به سطح درست رسید. GPT 5.5 به 37% رسید، GPT 5.6 luna به 31%، و GPT-4o mini به 45%، رقمی که بهتر از واقعیت بهنظر میرسد، چون آن مدل تقریباً همهچیز را پایین نمره میدهد و به همین دلیل تصادفاً پاسخهای ضعیف را درست میگیرد.
سپس کاری کردیم که بیشتر مقایسهها از آن صرفنظر میکنند. رویه نمرهدهی خودمان را، با مثالهای کالیبراسیون واقعی برای هر تسک و یک مقایسه اجباری در برابر آنها، به هر مدل GPT دادیم تا ببینیم حداکثر توانش چقدر است. GPT 5.6 sol به 71%، GPT 5.5 به 69%، luna به 63% و GPT-4o mini به 50% رسیدند. هر چهار مدل همچنان پشت Engine 2.0 ماندند، و هر چهار همچنان بیشترین مشکل را در پاسخهای سطح بالا داشتند. باقی این مقاله هر دو آزمون را بررسی میکند، نتایج در هر سطح نمره، چرا یک دستیار عمومی بهسوی وسط مقیاس میرود، روند روزانه کار در هر طرف چگونه است، و اگر قصد تمرین جدی دارید هرکدام چه هزینهای دارد.
آزمون ساده: چیزی که یک داوطلب واقعاً میگیرد
هشتاد و یک درصد در برابر سیوپنج. در یک آزمون 48 پاسخی، این یعنی بیستودو نمره درست بیشتر برای Engine 2.0 نسبت به GPT 5.6 sol. به بیان دیگر، Engine 2.0 نسبت به GPT 5.6 sol 71% اشتباه نمرهدهی کمتر دارد، نسبت به GPT 5.5 70% کمتر، نسبت به GPT 5.6 luna 73% کمتر و نسبت به GPT-4o mini 66% کمتر.
سه اجرای مجزا از آزمون ساده به GPT 5.6 sol اعداد 31%، 40% و 35% داد، و به GPT 5.5 اعداد 35%، 42% و 33%. آن پراکندگی میان اجراها خودش یک یافته است: اگر از ChatGPT بخواهید همان متن پیادهشده را در دو روز مختلف نمره بدهد، بهطور نسبتاً منظمی دو نمره متفاوت میگیرید. Engine 2.0 در هر سه اجرای خودش 81.3% نمره گرفت.
جایی که فاصله باز میشود: سطحبهسطح
یک عدد کلی پنهان میکند که خطاها کجا میافتند. ارزیابی که در پاسخهای ضعیف عالی است و در پاسخهای قوی ناامیدکننده، برای یک تازهکار خوب است و برای کسی که بهدنبال 10 است فعالانه مضر است. پس اینجا نتایج آزمون ساده به تفکیک باند تأییدشده است.
پاسخهای سطح پایین (نمره تأییدشده 4 یا 5)
16 پاسخ کنارگذاشتهشده، دستور ساده، میانگین سه اجرا. بیشتر خطاها نمره 3 است.
88%
Prepamigo Engine 2.0
75%
GPT-4o mini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
در پاسخهای ضعیف، Engine 2.0 با 88% پیشتاز است. GPT-4o mini با 75% دنبال میکند، که تنها جایی است که عادت پاییننمرهدادن آن به نفعش کار میکند. سه مدل بزرگتر GPT روی 52% تا 54% هستند: تقریباً نیمی از مواقع به یک پاسخ 4 یا 5 عدد 3 میدهند، که باند اشتباهی است حتی اگر جهت آن قابلدرک باشد. یک تازهکار که از ChatGPT برای نمرهدهی استفاده میکند، تقریباً نیمی از مواقع به او گفته میشود که ضعیفتر از واقعیت است.
پاسخهای سطح میانی (نمره تأییدشده 7 یا 8)
16 پاسخ کنارگذاشتهشده، دستور ساده، میانگین سه اجرا. خطاها تقریباً همه نمره 5 یا 6 هستند.
85%
Prepamigo Engine 2.0
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
باند میانی جایی است که مدلهای GPT با دستور ساده از هم میپاشند. Engine 2.0 روی 85% است؛ GPT-4o mini روی 44%؛ GPT 5.5، GPT 5.6 sol و luna بین 27% و 29%. پاسخهای سطح میانی مخلوطی واقعی از نقاط قوت و ضعف دارند که باید سنجیده شود، و بدون مثال کالیبراسیونی برای مقایسه، مدلهای GPT ضعفها را میبینند و عدد 5 یا 6 میدهند. یک داوطلب سطح 7 یا 8 که از GPT 5.6 sol نمره میخواهد، کمتر از سه بار از هر ده بار باند درست را میشنود.
پاسخهای سطح بالا (نمره تأییدشده 10 یا بالاتر)
16 پاسخ کنارگذاشتهشده، دستور ساده، میانگین سه اجرا. تقریباً هر خطا نمره 7 یا 8 است.
71%
Prepamigo Engine 2.0
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
در بالا، Engine 2.0 71% پاسخهای سطح بالا را شناسایی میکند. GPT 5.5 27% را شناسایی میکند، GPT 5.6 sol 25%، GPT-4o mini 17% و GPT 5.6 luna 13%. هر مدل GPT به حداقل هفت از هر ده پاسخی که ارزش 10 دارد، عدد 7 یا 8 میدهد.
به معنای این موضوع برای یک داوطلب قوی فکر کنید. هشت پاسخ ضبط میکنید، پیادهسازی میکنید، در ChatGPT وارد میکنید و نمره میخواهید، و به شما میگوید ششتای آنها 7 و 8 هستند. نتیجه میگیرید یک صحبتکننده متوسط قوی هستید که باید روی آن کار کنید. در تمام این مدت سطح 10 بودید. این فرضی نیست. این همان کاری بود که هر مدل GPT روی بیشتر پاسخهای سطح بالای آزمون ما کرد.
اگر رویه کامل خودمان را به ChatGPT بدهیم چه میشود؟
وسوسهانگیز است که اعداد آزمون ساده را نشانه ضعف خانواده مدلهای GPT بدانیم. اینطور نیست. مشکل هوش نیست. مشکل این است که مدلی که برای دادن یک عدد پرسیده میشود، بدون چیزی برای مقایسه، تخمین میزند، و وقتی تخمین میزند، پایین و بهسمت وسط تخمین میزند.
پس آزمون دوم را اجرا کردیم. هر مدل GPT همان بستهای را دریافت کرد که ارزیابهای خود Engine 2.0 دریافت میکنند: متن پیادهشده، تسک، دو مثال کالیبراسیون واقعی در هر سطح برای همان تسک دقیق، و دستوری برای نام بردن نزدیکترین مثال برای هر یک از چهار بعد بهجای تولید یک عدد. هر مدل همچنین یک یادداشت کالیبراسیون کوتاه متناسب با گرایشهای خودش گرفت.
با رویه کامل ما: سهم پاسخهایی که در سطح تأییدشده نمره گرفتند
همان 48 پاسخ کنارگذاشتهشده. هر مدل GPT هر پاسخ را یکبار با همان متنهای پیادهشده، دستورالعملها و مثالهای کالیبراسیون ارزیابهای خود Engine 2.0 نمره داد.
81%
Prepamigo Engine 2.0
71%
GPT 5.6 sol
69%
GPT 5.5
63%
GPT 5.6 luna
50%
GPT-4o mini
مثالهای کالیبراسیون تفاوت بسیار بزرگی ایجاد میکنند. GPT 5.6 sol دو برابر میشود، از 35% به 71%. GPT 5.5 از 37% به 69% میرود، luna از 31% به 63%. GPT-4o mini بهسختی حرکت میکند، از 45% به 50%، چون بدون توجه به آنچه به آن نشان داده میشود همچنان همهچیز را پایین نمره میدهد؛ با رویه کامل همچنان هیچ پاسخ سطح بالایی را شناسایی نکرد. این به شما میگوید ارزش واقعی یک ارزیاب اختصاصی کجاست: نه در یک مدل باهوشتر، بلکه در نمونههای واقعی از اینکه هر سطح در هر تسک مشخص چه صدایی دارد، و در پرسشی که مدل را وادار میکند مقایسه کند بهجای تخمین بزند.
با این حال، هر مدل GPT همچنان عقب میماند. با رویه کامل، GPT 5.6 sol ده واحد پشت Engine 2.0 در نمای کلی است، ده واحد پشت در باند میانی (75% در برابر 85%)، و هشت واحد پشت در بالا (63% در برابر 71%). عادت باقیمانده آن، پاداشدادن بیشازحد به صیقل است: یک پاسخ 8 توانا با ارائهای روان به 9 یا 10 رانده میشود. GPT 5.6 luna برعکس عمل میکند، پاسخهای میانی را بهسمت 5 میکشد، و باند میانی را روی 44% تمام میکند. یک مدل تنها که یک اجرای واحد انجام میدهد همچنان تعصبی مشخص دارد، و Engine 2.0 فاصله باقیمانده را با دو ارزیاب مستقل از دو ارائهدهنده متفاوت، سه رأی از هرکدام با نگهداشتن رأی میانی، و یک قانون تطبیق که وقتی دو ارزیاب بهشدت اختلاف دارند نمره بالاتر را میگیرد، میبندد.
همچنین یک راهحل ساده و بدیهی را آزمایش کردیم: نگهداشتن دستور ساده و افزودن دستورالعملهایی مانند «بهسمت وسط نرو» یا «یک پاسخ سطح 9 نیازی به بینقصی ندارد». هیچ تغییر قابلسنجشی ایجاد نکردند. چیزی که کار میکند تغییر پرسش است، و دادن چیزی واقعی به مدل برای مقایسه.
فاصله روند کار: ضبط و برو، یا همهچیز را خودتان انجام بده
اعداد دقت فرض میکنند نمرهدهی واقعاً اتفاق میافتد. با ChatGPT، مقدار شگفتانگیزی کار میان زدن دکمه توقف ضبط و خواندن یک نمره قرار دارد، و بخشی از آن کار نمره را تغییر میدهد.
اول، به یک متن پیادهشده نیاز دارید. حالت صوتی ChatGPT یک گفتگو است، نه یک ارزیاب؛ برای نمرهدادن یک پاسخ ضبطشده به متن نیاز دارید. این یعنی یا تایپ کردن آنچه گفتهاید، که آن را تغییر میدهد، یا عبور دادن ضبط از یک ابزار پیادهسازی. و متن باید کلمهبهکلمه باشد. هر مکث، هر شروع دوباره، هر خودتصحیحی باید در متن بماند. وقتی یک متن «پاکسازیشده» با مکثهای حذفشده را آزمایش کردیم، دقت پانزده واحد کاهش یافت، چون آن مکثها دقیقاً شاهدی هستند که یک ارزیاب برای قضاوت درباره صدای یک پاسخ به آن نیاز دارد. بیشتر ابزارهای پیادهسازی مصرفی، از جمله ابزار داخلی بیشتر گوشیها، بهطور پیشفرض پاکسازی میکنند.
دوم، به تسک نیاز دارید. ChatGPT میتواند اگر بخواهید یک دستور بهسبک CELPIP بسازد، اما در حال تخمینزدن قالب، زمانبندی و نوع سناریویی است که آزمون واقعی استفاده میکند. نمیدانید آیا دستوری که نوشته شبیه چیزی است که واقعاً با آن مواجه خواهید شد.
سوم، اگر چیزی بهتر از اعداد آزمون ساده میخواهید، به مثالهای کالیبراسیون نیاز دارید: پاسخهای واقعی در هر سطح برای همان نوع تسک، با سطوح تأییدشده. این همان ورودی است که دقت GPT 5.6 sol را در آزمون ما دو برابر کرد، و همان چیزی است که یک داوطلب نمیتواند در خانه تولید کند.
چهارم، برای پاسخ بعدی دوباره همه این کار را انجام میدهید، و هرکدام از سهمیه پیامهای شما کسر میشود.
در Prepamigo، یک تسک از بانک انتخاب میکنید، تایمر اجرا میشود، صحبت میکنید، و حدود ده ثانیه بعد از توقف، نمره و بازخورد روی صفحه است. پیادهسازی بهطور طبیعی کلمهبهکلمه است، مثالهای کالیبراسیون بهطور خودکار به تسک متصلاند، و چیزی برای چسباندن یا نوشتن دستور وجود ندارد. یازدهمین پاسخ آن شب همان تلاشی را از شما میگیرد که پاسخ اول.
ثبات: همان پاسخ، همان نمره
نمرهای که نتوانید تکرار کنید، یک اندازهگیری نیست. اگر همان ضبط دوشنبه 8 بگیرد و سهشنبه 10، چیزی درباره اسپیکینگ خودتان یاد نگرفتهاید. پس تکرارپذیری را هم آزمودیم.
Engine 2.0 روی 48 پاسخ کنارگذاشتهشده سه بار مجزا در روزهای مختلف اجرا شد. هر بار 81.3% نمره گرفت. با نگاه به پاسخهای تکی، 87.5% در هر سه اجرا نمرهای یکسان گرفتند، و فقط 4.2% دو واحد یا بیشتر حرکت کردند، همه از پاسخهایی که روی مرز میان دو باند نشستهاند.
آزمون ساده روی GPT 5.6 sol میان بهترین و بدترین اجرای خودش نُه واحد حرکت کرد. آن فاصله ثبات از رأیگیری میآید. هر ارزیاب در Engine 2.0 روی هر پاسخ سه بار رأی میدهد و رأی میانی نگه داشته میشود. وقتی همان پیکربندی را با یک رأی بهجای سه رأی آزمودیم، نمرات یکسان میان اجراها از 87.5% به 77% سقوط کرد، و سهم پاسخهایی که دو واحد یا بیشتر جهش میکنند بیش از دو برابر شد. یک گفتگوی تک با ChatGPT یک رأی تنها است. همچنین بررسی کردیم که آیا تعیین یک seed تصادفی ثابت از طریق API مدلهای GPT را تکرارپذیرتر میکند. نکرد؛ روی GPT 5.6 luna، تکرارپذیری در واقع کاهش یافت.
بازخوردی که میتوانید روی آن عمل کنید
ChatGPT توضیحدهنده خوبی است. اگر بپرسید چرا نمرهای داد، طولانی، به انگلیسی روشن، به شما میگوید، و بهبودها را پیشنهاد میدهد. برای داوطلبی که میخواهد درباره یک پاسخ گفتگو کند، این واقعاً ارزشمند است.
خطر این است که توضیح روان همان چیزی نیست که تشخیص دقیق است. مدلی که یک 10 را 7 نمره داده، بهطور قانعکنندهای توضیح میدهد چرا 7 است. چیزی برای اشاره کردن پیدا میکند. و چون پیش از نمرهدهی مجبور نبود به شواهد متعهد شود، توضیح بعد از واقعه نوشته میشود تا عددی را که از قبل انتخاب کرده توجیه کند.
Engine 2.0 برعکس عمل میکند. هر ارزیاب پیش از نامبردن یک سطح باید برای هر بعد به شواهد اشاره کند، و بازخورد از همان شواهد نوشته میشود. کلمات خودتان را نقل میکند: در بازرسی 158 نقلقول در نمونهای از بازخوردها، 157 مورد عیناً در متن پیادهشده ظاهر شدند. وقتی یک مدل قضاوت مستقل بازخورد Engine 2.0 را با بازخورد سیستم قبلیمان روی همان پاسخها، بهصورت بیاطلاع، مقایسه کرد، در 20 از 24 مقایسه Engine 2.0 را ترجیح داد، هم وقتی مانند یک ارزیاب قضاوت میکرد و هم وقتی مانند یک داوطلب.
همچنین بررسی کردیم که آیا بازخورد انتقاد را در جای درست میگذارد، با برداشتن پاسخهای قوی و خرابکردن عمدی یک بعد در هر زمان. در سه از چهار مورد، بعد خرابشده همان بعدی بود که نمرهاش بیشترین کاهش یافت. این نوع بررسیای است که یک چتبات نمیتواند بهراحتی از آن عبور کند، چون ابعاد ثابتی برای بررسیشدن در برابر آنها ندارد.
هزینه تمرین روزانه
یک نمره اسپیکینگ بیشترین سود را در چهلمین پاسخ شما دارد، نه چهارمین. آنجاست که شروع میکند به شما بگوید آیا تغییری در نحوه صحبتکردنتان واقعاً کار میکند یا نه. پس سؤال عملی این است که استفاده حجیم از هرکدام چقدر هزینه دارد.
ChatGPT Plus ماهانه US$20 است، حدود CA$28، با صورتحساب ماهانه، همانطور که در سپتامبر 2026 منتشر شده. خانواده GPT 5.6 را با سقفی روی پیامها در هر بازه چرخشی به شما میدهد؛ متنهای پیادهشده طولانی بههمراه مثالهای کالیبراسیون دقیقاً نوع پیامی هستند که سهم زیادی از آن سهمیه را مصرف میکنند، و پس از رسیدن به آن باید صبر کنید یا به مدلی کوچکتر تغییر دهید. ChatGPT Pro، با US$200 در ماه، حدود CA$276 پیش از مالیات، محدودیتها را بهطور قابلتوجهی بالا میبرد. سطح رایگان بخش زیادی از ترافیک خود را به مدلهای کوچکتر میفرستد، و در این آزمون کوچکترین آنها تقریباً هیچ پاسخ سطح بالایی را شناسایی نکرد. هیچکدام از طرحها بانک سوال، تایمر، پیادهسازی کلمهبهکلمه، مثالهای کالیبراسیون، یا چیزی خاص برای CELPIP ندارند.
Prepamigo ماهانه CA$24.98 است، یا CA$8.25 در ماه در طرح سالانه، که CA$98.98 برای سال است، شامل مالیات، و میتوانید هر زمان لغو کنید. هر طرح شامل نمرهدهی نامحدود توسط Engine 2.0 بدون سقف روزانه، جلسهای یا هفتگی، تلاشهای نامحدود، و بانک کامل سوال است: 80 مجموعه تمرینی کامل و بیش از 2,000 تمرین در Speaking، Writing، Reading و Listening، نوشتهشده برای پیروی از انواع تسک، زمانبندی و قالب آزمون CELPIP General.
بهزبان ساده: با هزینهای کمتر از ChatGPT Plus، ارزیابی میگیرید که در یک مقایسه ساده بیش از دو برابر دقیقتر است، هرگز از شما نمیخواهد صبر کنید، و سوالها و مثالهای کالیبراسیون از قبل آمادهاند.
وقتی ChatGPT ابزار بهتری است
این استدلالی برای هرگز باز نکردن ChatGPT هنگام آمادهشدن برای CELPIP نیست. یک داوطلب جدی ممکن است از هر دو استفاده کند.
- گفتگو درباره یک پاسخ. اگر میخواهید بفهمید چرا یک دلیل ضعیف بود یا سه دلیل بهتر پیدا کنید، یک گفتگو شکل درستی دارد. Engine 2.0 به شما حکم و شواهد میدهد؛ گفتگو نمیکند.
- واژگان و عبارتسازی. پرسیدن برای پنج راه طبیعیتر گفتن چیزی سریع و مفید است.
- صحبتکردن با چیزی که پاسخ میدهد. حالت صوتی ChatGPT راهی معقول برای عادتکردن به صحبت بلند به انگلیسی است. ارزیاب نیست، اما همراهی میکند.
- تمرین رایتینگ. پاسخهای نوشتاری نیازی به پیادهسازی ندارند، پس فاصله روند کار کوچکتر است. دقت GPT در رایتینگ بخشی از این آزمون نبود و ما هیچ ادعایی درباره آن نمیکنیم.
- هرچیز خارج از آزمون. ChatGPT یک دستیار عمومی است و Prepamigo نیست.
چیزی که ChatGPT، بر اساس شواهد اینجا، نباید باشد، همان چیزی است که به شما بگوید آماده هستید یا نه. برای آن به ارزیابی نیاز دارید که برای همین کار ساخته شده، روی پاسخهایی که ندیده آزموده شده، و سطحبهسطح اندازهگیری شده است.
چه چیزی در بازخورد شما تازه است
Engine 2.0 با یک لایه بازخورد کاملاً بازسازیشده عرضه میشود. این لایه شواهد دو ارزیاب را میخواند، نه فقط نمره را، و در برابر سه نوع داوطلب آزمایش شده است: کسی که برای اولین بار با CELPIP آشنا میشود، کسی با زبان انگلیسی ضعیف که به دنبال ترفند است، و کسی که فقط نیم ساعت در روز وقت دارد و آزمونش هفته آینده است. اینها چیزهایی است که تغییر کرده.
- نقلقول از حرفهای خودتان. هر نکته بازخورد، دقیقاً همان عبارتی از متن پاسخ شما را نقل میکند که ارزیابها به آن واکنش دادهاند. اگر عبارتی داخل گیومه باشد، عیناً کپی شده است؛ در بررسی ما 157 از 158 نقلقول اینگونه بودند. بازخورد هرگز چیزی را که نگفتهاید اختراع نمیکند.
- اولین چیزی که باید اصلاح کنید. هر پاسخ یک اقدام اصلی میگیرد: تغییری که بیشترین تأثیر را بر نمره شما دارد و با سادهترین کلمات ممکن روی صفحه نوشته شده است. پس از آن دو اقدام عملی دیگر میآید، سپس یک فهرست بررسی سهموردی که پیش از شروع صحبت باید در ذهن مرور کنید.
- توصیهای متناسب با نوع تسک. دادن توصیه، توصیف یک صحنه و قانع کردن کسی بر اساس معیارهای متفاوتی نمره میگیرند. بازخورد اکنون میداند هر یک از هشت نوع تسک به چه چیزی امتیاز میدهد و بر همان تمرکز میکند، بهجای تکرار همان نکتههای کلی در همه تسکها.
- کدام بُعد را اول تمرین کنید. بازخورد به شما میگوید کدام یک از چهار بُعد ضعیفترین و کدام قویترین شماست، تا بدانید نمره بعدی از کجا میآید، بدون اینکه این موضوع پشت یک عدد پنهان بماند.
- چه چیزی از خواسته تسک را از قلم انداختید. برای معیار انجام تسک، بازخورد بخشهای مشخصی از دستور تسک را که پوشش ندادهاید فهرست میکند، یا بهصراحت میگوید که همه آنها را پوشش دادهاید.
- چیزهایی که واقعاً میتوانید تمرین کنید. هر راهکار چیزی است که میتوانید پیش از تلاش بعدی با صدای بلند تمرین کنید. هیچ توصیهای برای واضحتر صحبت کردن یا کم کردن لهجه وجود ندارد: لهجه چیزی نیست که «قابلفهم بودن» بسنجد، و بازخورد هرگز درباره آن نظر نمیدهد.
- هیچ سرزنشی برای زمانسنج. پاسخی که پس از تکمیل تسک بهخاطر پایان زمان قطع شده باشد، برای همین قطعشدن نمره از دست نمیدهد، و بازخورد بهخاطر آن شما را سرزنش نمیکند.
وقتی یک مدل داوری مستقل این بازخورد را با آنچه سیستم قبلی ما برای همان پاسخها تولید کرده بود مقایسه کرد، بدون اینکه بداند کدامیک متعلق به کدام سیستم است، در 20 از 24 مقایسه بازخورد جدید را ترجیح داد؛ هم در قضاوت بهشیوه یک ارزیاب و هم در قضاوت بهشیوه یک داوطلب.
سوالات متداول
آیا ChatGPT میتواند اسپیکینگ CELPIP من را نمره بدهد؟ یک عدد به شما میدهد. وقتی بهسادگی روی 48 پاسخ نادیده با نمرههای تأییدشده پرسیده شد، GPT 5.6 sol در 35% مواقع، GPT 5.5 در 37%، luna در 31%، GPT-4o mini در 45% درست بود، در برابر 81% برای Engine 2.0. در پاسخهای سطح بالا GPT 5.6 sol در 25% مواقع درست بود.
آیا Prepamigo از ChatGPT دقیقتر است؟ 81% در برابر 35% برای GPT 5.6 sol با یک درخواست ساده. با رویه کامل ما همراه با مثالهای کالیبراسیون، GPT 5.6 sol به 71% رسید، همچنان ده واحد پشت.
هزینه هرکدام چقدر است؟ ChatGPT Pro ماهانه US$200 است، حدود CA$276 پیش از مالیات؛ Plus با US$20 محدودیت پیام دارد. Prepamigo ماهانه CA$24.98 با مالیات، یا CA$8.25 در ماه در طرح سالانه، با نمرهدهی نامحدود و 80 مجموعه تمرینی است.
اگر از ChatGPT استفاده میکنم، کدام مدل GPT را باید انتخاب کنم؟ با دستور ساده، هیچکدام خوب عمل نمیکند. با مثالهای کالیبراسیون، GPT 5.6 sol. اگر به سطح 10 نزدیک هستید، هرگز GPT-4o mini را انتخاب نکنید.
برای همین مقایسه در برابر Claude، بخوانید Prepamigo در برابر Claude. برای جدول کامل رتبهبندی هشت سیستم، بخوانید کدام هوش مصنوعی اسپیکینگ CELPIP را دقیقتر نمره میدهد. یا پیادهسازی را کنار بگذارید و ضبط پاسخ کنید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.
