سهم پاسخهایی که در سطح تأییدشده نمره گرفتند
48 پاسخ اسپیکینگ کنارگذاشتهشده، 16 پاسخ در هر یک از سه سطح. به Claude متن پیادهشده داده شد و از آن خواسته شد با کلماتی ساده آن را در مقیاس CELPIP نمره بدهد؛ میانگین سه اجرا. Engine 2.0 در پیکربندی عادی عملیاتی خودش اجرا شد.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
45%
Claude Sonnet 5
مقایسه Prepamigo با پرطرفدارترین طرحهای چتبات
بر اساس دلار کانادا. قیمتهای Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شدهاند. دقت، سهم پاسخهای مجموعه آزمون کنارگذاشتهشده است که وقتی از مدل نامبرده با کلماتی ساده درخواست امتیازدهی میشود، در سطح تأییدشده امتیاز میگیرند؛ میانگین سه اجرا.
اگر تا به حال متن پیادهشده یک پاسخ اسپیکینگ را در Claude وارد کردهاید و از آن خواستهاید مثل یک ارزیاب CELPIP به شما نمره بدهد، جذابیت این کار را میدانید. فوراً پاسخ میدهد، خودش را توضیح میدهد، و هرگز خسته نمیشود. سؤال این است که آیا عددی که به شما میدهد همان عددی است که واقعاً میگیرید. ما این آزمون را دقیقاً همانطور که یک داوطلب انجامش میدهد اجرا کردیم: همان متن پیادهشده، یک درخواست ساده برای نمره، و بعد شمارش کردیم.
پاسخ کوتاه این است: روی 48 پاسخ اسپیکینگ که این سیستمها هرگز ندیده بودند، هرکدام با نمرهای مستقل تأییدشده، Prepamigo Scoring Engine 2.0 در 81% مواقع به سطح درست رسید. وقتی با کلماتی ساده از آنها خواسته شد همان متنها را نمره بدهند، Claude Opus 5 در 62% مواقع و Claude Sonnet 5 در 45% مواقع به سطح درست رسیدند. این فاصله دقیقاً همانجایی که برای هر کسی که بهدنبال نمره بالاست بیشترین اهمیت را دارد، بازتر میشود: در پاسخهای سطح بالا، Engine 2.0 71% را شناسایی کرد، Opus 5 50% را، و Sonnet 5 29% را.
سپس کاری کردیم که بیشتر مقایسهها از آن صرفنظر میکنند. رویه نمرهدهی خودمان را، با مثالهای کالیبراسیون واقعی برای هر تسک و یک مقایسه اجباری در برابر آنها، به Claude دادیم تا ببینیم حداکثر توانش چقدر است. Opus 5 به 77% و Sonnet 5 به 69% رسیدند. هر دو همچنان پشت Engine 2.0 ماندند، و هر دو همچنان بیشترین مشکل را در پاسخهای سطح بالا داشتند. باقی این مقاله هر دو آزمون را بررسی میکند، اینکه اعداد در هر سطح نمره چه شکلی دارند، چرا یک دستیار عمومی بهسوی وسط مقیاس میرود، روند روزانه کار در هر طرف چگونه است، و اگر قصد تمرین جدی دارید هرکدام چه هزینهای دارد.
آزمون ساده: چیزی که یک داوطلب واقعاً میگیرد
هشتاد و یک درصد در برابر شصتودو و چهلوپنج. در یک آزمون 48 پاسخی، تفاوت میان Engine 2.0 و Opus 5 نُه نمره درست بیشتر است، و تفاوت میان Engine 2.0 و Sonnet 5 هفده نمره. به بیان دیگر، Engine 2.0 نسبت به Opus 5 51% اشتباه نمرهدهی کمتر و نسبت به Sonnet 5 66% کمتر دارد.
سه اجرای مجزا از آزمون ساده به Opus 5 اعداد 62%، 65% و 58% داد، و به Sonnet 5 اعداد 44%، 46% و 46%. آن پراکندگی چند واحدی میان اجراها خودش یک یافته است: اگر از Claude بخواهید همان متن پیادهشده را در دو روز مختلف نمره بدهد، بهطور نسبتاً منظمی دو نمره متفاوت میگیرید. Engine 2.0 در هر سه اجرای خودش 81.3% نمره گرفت.
جایی که فاصله باز میشود: سطحبهسطح
بیشتر ارزیابها، انسانی یا ماشینی، بهسوی وسط مقیاس میروند. یک پاسخ قوی بهجای 10 میشود 8؛ یک پاسخ ضعیف بهجای 5 میشود 6. این گرایش در میانگین دیده نمیشود و لحظهای که نتایج را بر اساس سطح تفکیک کنید کاملاً واضح میشود. با یک دستور ساده، Claude یک عادت دوم هم اضافه میکند: بهسمت پایین هم میرود، بهطوری که حتی پاسخهای ضعیف هم اغلب پایینتر از سطح خودشان نمره میگیرند.
پاسخهای سطح پایین (نمره تأییدشده 4 یا 5)
16 پاسخ کنارگذاشتهشده، دستور ساده، میانگین سه اجرا. خطاهای Sonnet 5 در اینجا بیشتر نمره 3 است.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
44%
Claude Sonnet 5
در پاسخهای ضعیف، Engine 2.0 با 88% پیشتاز است، Opus 5 با 77% دنبال میکند، و Sonnet 5 به 44% سقوط میکند. این آسانترین انتهای مقیاس است، و Opus 5 آن را نسبتاً خوب مدیریت میکند. Sonnet 5 نه: به یک پاسخ 4 یا 5، بیشتر از نیمی از مواقع، عدد 3 میدهد، که سطح اشتباهی است حتی اگر جهت آن قابلدرک باشد. داوطلبی در این سطح که از Sonnet 5 برای نمرهدهی استفاده میکند، بیشتر مواقع به او گفته میشود که ضعیفتر از واقعیت است.
پاسخهای سطح میانی (نمره تأییدشده 7 یا 8)
16 پاسخ کنارگذاشتهشده، دستور ساده، میانگین سه اجرا. خطاها تقریباً همه نمره 6 هستند.
85%
Prepamigo Engine 2.0
63%
Claude Sonnet 5
58%
Claude Opus 5
در میانه، Engine 2.0 روی 85% است و دو مدل Claude روی 63% و 58%. پاسخهای سطح میانی مخلوطی از نقاط قوت و ضعف دارند که باید سنجیده شود، نه فقط شناسایی شود، و بدون مثال کالیبراسیونی برای مقایسه، هر دو مدل Claude گرایش دارند ضعفها را ببینند و عدد 6 بدهند. یک داوطلب سطح 7 یا 8 حدود چهار بار از هر ده بار میشنود که سطح 6 است.
پاسخهای سطح بالا (نمره تأییدشده 10 یا بالاتر)
16 پاسخ کنارگذاشتهشده، دستور ساده، میانگین سه اجرا. تقریباً هر خطا نمره 7 یا 8 است.
71%
Prepamigo Engine 2.0
50%
Claude Opus 5
29%
Claude Sonnet 5
در بالا، Engine 2.0 71% پاسخهای سطح بالا را شناسایی میکند. Opus 5 نیمی از آنها را شناسایی میکند. Sonnet 5 29% را شناسایی میکند، یعنی به هفت از هر ده پاسخی که ارزش 10 دارد، عدد 7 یا 8 میدهد.
به معنای عملی این موضوع فکر کنید. فرض کنید امروز اسپیکینگ شما واقعاً سطح 10 است. هشت پاسخ ضبط میکنید، پیادهسازی میکنید، در Claude Sonnet 5 وارد میکنید و نمره میخواهید، و به شما میگوید ششتای آنها 7 و 8 هستند. نتیجه میگیرید آماده نیستید. سه هفته دیگر تمرین میکنید. در تمام این مدت آماده بودید. این یک شکست فرضی نیست؛ رایجترین خطای تکی در تمام آزمون ما بود، و سختترین ضربه را به داوطلبانی میزند که بیشترین تلاش را کردهاند.
اگر رویه کامل خودمان را به Claude بدهیم چه میشود؟
وسوسهانگیز است که اعداد آزمون ساده را نشانه ضعف مدل Claude بدانیم. اینطور نیست. Opus 5، تا حد زیادی، قویترین ارزیاب عمومی است که آزمودهایم. مشکل هوش نیست. مشکل این است که مدلی که برای دادن یک عدد پرسیده میشود، بدون چیزی برای مقایسه، تخمین میزند، و وقتی تخمین میزند، پایین و بهسمت وسط تخمین میزند.
پس آزمون دوم را اجرا کردیم. به Claude همان بستهای داده شد که ارزیابهای خود Engine 2.0 دریافت میکنند: متن پیادهشده، تسک، دو مثال کالیبراسیون واقعی در هر سطح برای همان تسک دقیق، و دستوری برای نام بردن نزدیکترین مثال برای هر یک از چهار بعد بهجای تولید یک عدد. هر مدل همچنین یک یادداشت کالیبراسیون کوتاه متناسب با گرایشهای خودش گرفت.
با رویه کامل ما: سهم پاسخهایی که در سطح تأییدشده نمره گرفتند
همان 48 پاسخ کنارگذاشتهشده. هر مدل Claude هر پاسخ را یکبار با همان متنهای پیادهشده، دستورالعملها و مثالهای کالیبراسیون ارزیابهای خود Engine 2.0 نمره داد.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
69%
Claude Sonnet 5
مثالهای کالیبراسیون تفاوت بزرگی ایجاد میکنند. Opus 5 از 62% به 77% میرسد؛ Sonnet 5 از 45% به 69%. دقت سطح پایین برای هر دو به 88% میرسد، همان رقم Engine 2.0. دقت سطح میانی برای هر دو به 81% میرسد. این ارزش مکث کردن دارد، چون به شما میگوید ارزش واقعی یک ارزیاب اختصاصی کجاست: نه در یک مدل باهوشتر، بلکه در نمونههای واقعی از اینکه هر سطح در هر تسک مشخص چه صدایی دارد، و در پرسشی که مدل را وادار میکند مقایسه کند بهجای تخمین بزند.
با این حال، هر دو مدل در بالای مقیاس همچنان عقب میمانند. با رویه کامل، Opus 5 63% پاسخهای سطح بالا و Sonnet 5 38% را شناسایی میکند، در برابر 71% برای Engine 2.0. یک مدل تنها که یک اجرای واحد انجام میدهد همچنان روی یک پاسخ قوی که یک لغزش دارد عقبنشینی میکند. Engine 2.0 فاصله باقیمانده را با سه چیز دیگر میبندد: دو ارزیاب مستقل از دو ارائهدهنده متفاوت، سه رأی از هرکدام با نگهداشتن رأی میانی، و یک قانون تطبیق که وقتی دو ارزیاب بهشدت اختلاف دارند نمره بالاتر را میگیرد، چون تحلیل نشان داد رأی پایینتر تقریباً همیشه در پاسخهای قوی اشتباه بود.
همچنین یک راهحل ساده و بدیهی را آزمایش کردیم: نگهداشتن دستور ساده و افزودن دستورالعملهایی مانند «بهسمت وسط نرو» یا «یک پاسخ سطح 9 نیازی به بینقصی ندارد». هیچ تغییر قابلسنجشی ایجاد نکردند. مدل با دستورالعمل موافقت میکند و بعد همان کاری را میکند که قرار بود بکند. چیزی که کار میکند تغییر پرسش است، و دادن چیزی واقعی برای مقایسه.
فاصله روند کار: ضبط و برو، یا همهچیز را خودتان انجام بده
اعداد دقت فرض میکنند نمرهدهی واقعاً اتفاق میافتد. با Claude، مقدار شگفتانگیزی کار میان زدن دکمه توقف ضبط و خواندن یک نمره قرار دارد.
اول، به یک متن پیادهشده نیاز دارید. رابط چت Claude ضبطهای صوتی را نمره نمیدهد، پس باید متن تولید کنید. این یعنی یا تایپ کردن آنچه گفتهاید، که آن را تغییر میدهد، یا عبور دادن ضبط از یک ابزار پیادهسازی. و اینجا جزئیاتی است که پیش از فهمیدنش دقت زیادی به ما هزینه داد: متن باید کلمهبهکلمه باشد. هر مکث، هر شروع دوباره، هر خودتصحیحی باید در متن بماند. وقتی یک متن «پاکسازیشده» با مکثهای حذفشده را آزمایش کردیم، دقت پانزده واحد کاهش یافت، چون آن مکثها دقیقاً شاهدی هستند که یک ارزیاب برای قضاوت درباره صدای یک پاسخ به آن نیاز دارد. بیشتر ابزارهای پیادهسازی مصرفی بهطور پیشفرض پاکسازی میکنند.
دوم، به تسک نیاز دارید. Claude بانکی از دستورهای سبک CELPIP با زمانبندی و قالب درست ندارد. یا باید خودتان بنویسید، که یعنی تخمین زدن آنچه آزمون واقعی میپرسد، یا از جای دیگری پیدا کنید و همراه متن پیادهشده وارد کنید.
سوم، اگر چیزی بهتر از اعداد آزمون ساده میخواهید، به مثالهای کالیبراسیون نیاز دارید: پاسخهای واقعی در هر سطح برای همان نوع تسک، با سطوح تأییدشده. این همان ورودی است که Opus 5 را در آزمون ما از 62% به 77% رساند، و همان چیزی است که یک داوطلب نمیتواند در خانه تولید کند.
چهارم، برای پاسخ بعدی دوباره همه این کار را انجام میدهید. و پاسخ بعد از آن.
در Prepamigo، یک تسک از بانک انتخاب میکنید، تایمر اجرا میشود، صحبت میکنید، و حدود ده ثانیه بعد از توقف، نمره و بازخورد روی صفحه است. پیادهسازی بهطور طبیعی کلمهبهکلمه است، مثالهای کالیبراسیون بهطور خودکار به تسک متصلاند، و چیزی برای چسباندن یا نوشتن دستور وجود ندارد. یازدهمین پاسخ آن شب همان تلاشی را از شما میگیرد که پاسخ اول.
ثبات: همان پاسخ، همان نمره
نمرهای که نتوانید تکرار کنید، یک اندازهگیری نیست. اگر همان ضبط دوشنبه 8 بگیرد و سهشنبه 10، چیزی درباره اسپیکینگ خودتان یاد نگرفتهاید، بلکه چیزی درباره حالوهوای ارزیاب یاد گرفتهاید. پس این را هم آزمودیم که آیا هر سیستم دو بار همان پاسخ را میدهد.
Engine 2.0 روی 48 پاسخ کنارگذاشتهشده سه بار مجزا اجرا شد. در هر اجرا 81.3% نمره گرفت. با نگاه به پاسخهای تکی بهجای مجموع، 87.5% در هر سه اجرا نمرهای یکسان گرفتند، و فقط 4.2% دو واحد یا بیشتر حرکت کردند. آن تعداد کم پاسخهایی هستند که دقیقاً روی مرز میان دو سطح قرار دارند، جایی که تفاوت کوچکی در قضاوت بهطور مشروع نمره را به یک سو میکشاند.
آزمون ساده روی Claude در سطح مجموع چند واحد میان اجراها حرکت کرد، و در سطح پاسخهای تکی حتی بیشتر. آن فاصله ثبات تصادفی مدلهای درگیر نیست. از رأیگیری میآید. هر ارزیاب در Engine 2.0 روی هر پاسخ سه بار رأی میدهد و رأی میانی نگه داشته میشود، که مقدار پرت گاهبهگاه یک اجرای تنها را حذف میکند. وقتی همان پیکربندی را با یک رأی بهجای سه رأی آزمودیم، توافق اجرابهاجرا از 87.5% به 77.1% سقوط کرد. یک گفتگوی تک با Claude یک رأی تنها است.
بازخوردی که میتوانید روی آن عمل کنید
یک نمره به شما میگوید کجا هستید. بازخورد به شما میگوید بعدی چه کنید، و این حوزهای است که Claude واقعاً خوب است. روشن مینویسد، صبور است، و اگر بپرسید چرا نمره خاصی داد، به هر اندازه که بخواهید توضیح میدهد. برای داوطلبی که میخواهد درباره یک پاسخ گفتگو کند، این ارزشمند است.
خطر همان است که با نمره: توضیح روان همان چیزی نیست که تشخیص دقیق است. مدلی که یک 10 را 7 نمره داده، بهطور قانعکنندهای توضیح میدهد چرا 7 است. چیزی برای اشاره کردن پیدا میکند. و چون Claude پیش از نمرهدهی مجبور نبود به شواهد متعهد شود، توضیح بعد از واقعه نوشته میشود، برای توجیه عددی که از قبل انتخاب کرده است.
Engine 2.0 برعکس عمل میکند. چون هر ارزیاب باید برای هر بعدی که قضاوت میکند به شواهد اشاره کند، لایه بازخورد آن شواهد را مستقیماً دریافت میکند: عبارتهای دقیق از متن پیادهشده که حکم را در مورد محتوا، واژگان، صدای پاسخ، و تکمیل تسک تأیید کردند. بازخورد از همان شواهد نوشته میشود و کلمات خودتان را نقل میکند. در بازرسی 158 نقلقول در نمونهای از بازخوردها، 157 مورد عیناً در متن پیادهشده ظاهر شدند. وقتی از یک مدل قضاوت مستقل خواستیم بازخورد Engine 2.0 را با بازخورد سیستم قبلیمان مقایسه کند، بدون اینکه بداند کدام کدام است، در 20 از 24 مقایسه Engine 2.0 را ترجیح داد، هم وقتی مانند یک ارزیاب قضاوت میکرد و هم وقتی مانند یک داوطلب.
همچنین آزمودیم که آیا بازخورد انتقاد را در جای درست میگذارد. پاسخهای قوی را برداشتیم و عمداً یک جنبه از هرکدام را خراب کردیم: افزودن خطاهای گرامری و مکثها، جایگزین کردن کلمات دقیق با کلمات مبهم، حذف جزئیات پشتیبان، یا حذف کنش اصلی که تسک میخواست. در سه از چهار مورد، بعدی که خراب کرده بودیم همان بعدی بود که نمرهاش بیشترین کاهش یافت. این نوع بررسیای است که یک چتبات نمیتواند بهراحتی از آن عبور کند، چون ابعاد ثابتی برای بررسیشدن در برابر آنها ندارد.
هزینه تمرین روزانه
یک نمره اسپیکینگ بیشترین سود را در چهلمین پاسخ شما دارد، نه چهارمین. آنجاست که شروع میکند به شما بگوید آیا تغییری در نحوه صحبتکردنتان واقعاً کار میکند یا نه. پس سؤال عملی این نیست که هرکدام چقدر هزینه دارد، بلکه استفاده حجیم از آن چقدر هزینه دارد.
Claude Pro ماهانه US$20 است، حدود CA$28، یا US$17 در ماه با صورتحساب سالانه، همانطور که در سپتامبر 2026 در claude.com منتشر شده. با یک بازه استفاده پنجساعته چرخشی و یک سقف هفتگی میآید؛ وقتی به هرکدام برسید، باید صبر کنید. متنهای پیادهشده طولانی بههمراه مثالهای کالیبراسیون دقیقاً نوع پیامی هستند که سهم زیادی از آن سهمیه را مصرف میکنند. طرحهای Max، از US$100 در ماه، حدود CA$138 پیش از مالیات، محدودیتها را بهطور قابلتوجهی بالا میبرند اما آنها را حذف نمیکنند. هیچکدام از طرحها بانک سوال، تایمر، پیادهسازی، مثالهای کالیبراسیون، یا چیزی خاص برای CELPIP ندارند.
Prepamigo ماهانه CA$24.98 است، یا CA$8.25 در ماه در طرح سالانه، که CA$98.98 برای سال است، شامل مالیات، و میتوانید هر زمان لغو کنید. هر طرح شامل نمرهدهی نامحدود توسط Engine 2.0 بدون سقف روزانه، جلسهای یا هفتگی، تلاشهای نامحدود، و بانک کامل سوال است: 80 مجموعه تمرینی کامل و بیش از 2,000 تمرین در Speaking، Writing، Reading و Listening، نوشتهشده برای پیروی از انواع تسک، زمانبندی و قالب آزمون CELPIP General.
بهزبان ساده: با هزینهای کمتر از Claude Pro، ارزیابی میگیرید که در پاسخهایی که بیشترین اهمیت دارند بسیار دقیقتر است، هرگز از شما نمیخواهد صبر کنید، و سوالها و مثالهای کالیبراسیون از قبل آمادهاند.
وقتی Claude ابزار بهتری است
این مقالهای نیست که بگوید هرگز نباید هنگام آمادهشدن برای CELPIP Claude را باز کنید. چند کار وجود دارد که آن را بهتر از یک موتور نمرهدهی تخصصی انجام میدهد، و یک داوطلب جدی ممکن است از هر دو استفاده کند.
- گفتگو درباره یک پاسخ. اگر میخواهید بفهمید چرا یک دلیل خاص ضعیف بود، یا سه دلیل بهتر پیدا کنید، یک گفتگو شکل درستی دارد. Engine 2.0 به شما حکم و شواهد میدهد؛ گفتگو نمیکند.
- کمک واژگان و عبارتسازی. پرسیدن از Claude برای پنج راه طبیعیتر گفتن چیزی سریع و مفید است، و پیشنهادهایش عموماً خوب است.
- تمرین رایتینگ. پاسخهای نوشتاری نیازی به پیادهسازی ندارند، پس فاصله روند کار بسیار کوچکتر است. دقت Claude در رایتینگ بخشی از این آزمون نبود، و ما در اینجا هیچ ادعایی درباره آن نمیکنیم.
- هرچیز خارج از آزمون. سؤالات مربوط به مدارک مهاجرت، برنامه مطالعه، توضیح یک نکته گرامری: Claude یک دستیار عمومی است و Prepamigo نیست.
چیزی که Claude، بر اساس شواهد اینجا، نباید باشد، همان چیزی است که به شما بگوید آماده هستید یا نه. برای آن به ارزیابی نیاز دارید که برای همین کار ساخته شده، روی پاسخهایی که ندیده آزموده شده، و سطحبهسطح اندازهگیری شده است.
چه چیزی در بازخورد شما تازه است
Engine 2.0 با یک لایه بازخورد کاملاً بازسازیشده عرضه میشود. این لایه شواهد دو ارزیاب را میخواند، نه فقط نمره را، و در برابر سه نوع داوطلب آزمایش شده است: کسی که برای اولین بار با CELPIP آشنا میشود، کسی با زبان انگلیسی ضعیف که به دنبال ترفند است، و کسی که فقط نیم ساعت در روز وقت دارد و آزمونش هفته آینده است. اینها چیزهایی است که تغییر کرده.
- نقلقول از حرفهای خودتان. هر نکته بازخورد، دقیقاً همان عبارتی از متن پاسخ شما را نقل میکند که ارزیابها به آن واکنش دادهاند. اگر عبارتی داخل گیومه باشد، عیناً کپی شده است؛ در بررسی ما 157 از 158 نقلقول اینگونه بودند. بازخورد هرگز چیزی را که نگفتهاید اختراع نمیکند.
- اولین چیزی که باید اصلاح کنید. هر پاسخ یک اقدام اصلی میگیرد: تغییری که بیشترین تأثیر را بر نمره شما دارد و با سادهترین کلمات ممکن روی صفحه نوشته شده است. پس از آن دو اقدام عملی دیگر میآید، سپس یک فهرست بررسی سهموردی که پیش از شروع صحبت باید در ذهن مرور کنید.
- توصیهای متناسب با نوع تسک. دادن توصیه، توصیف یک صحنه و قانع کردن کسی بر اساس معیارهای متفاوتی نمره میگیرند. بازخورد اکنون میداند هر یک از هشت نوع تسک به چه چیزی امتیاز میدهد و بر همان تمرکز میکند، بهجای تکرار همان نکتههای کلی در همه تسکها.
- کدام بُعد را اول تمرین کنید. بازخورد به شما میگوید کدام یک از چهار بُعد ضعیفترین و کدام قویترین شماست، تا بدانید نمره بعدی از کجا میآید، بدون اینکه این موضوع پشت یک عدد پنهان بماند.
- چه چیزی از خواسته تسک را از قلم انداختید. برای معیار انجام تسک، بازخورد بخشهای مشخصی از دستور تسک را که پوشش ندادهاید فهرست میکند، یا بهصراحت میگوید که همه آنها را پوشش دادهاید.
- چیزهایی که واقعاً میتوانید تمرین کنید. هر راهکار چیزی است که میتوانید پیش از تلاش بعدی با صدای بلند تمرین کنید. هیچ توصیهای برای واضحتر صحبت کردن یا کم کردن لهجه وجود ندارد: لهجه چیزی نیست که «قابلفهم بودن» بسنجد، و بازخورد هرگز درباره آن نظر نمیدهد.
- هیچ سرزنشی برای زمانسنج. پاسخی که پس از تکمیل تسک بهخاطر پایان زمان قطع شده باشد، برای همین قطعشدن نمره از دست نمیدهد، و بازخورد بهخاطر آن شما را سرزنش نمیکند.
وقتی یک مدل داوری مستقل این بازخورد را با آنچه سیستم قبلی ما برای همان پاسخها تولید کرده بود مقایسه کرد، بدون اینکه بداند کدامیک متعلق به کدام سیستم است، در 20 از 24 مقایسه بازخورد جدید را ترجیح داد؛ هم در قضاوت بهشیوه یک ارزیاب و هم در قضاوت بهشیوه یک داوطلب.
سوالات متداول
آیا Claude میتواند تمرین اسپیکینگ CELPIP من را نمره بدهد؟ یک عدد به شما میدهد. وقتی بهسادگی روی 48 پاسخ نادیده با نمرههای تأییدشده پرسیده شد، Claude Opus 5 در 62% مواقع و Claude Sonnet 5 در 45% مواقع به سطح تأییدشده رسید، در برابر 81% برای Prepamigo Scoring Engine 2.0. در پاسخهای سطح بالا Sonnet 5 در 29% مواقع درست بود.
آیا Prepamigo از Claude دقیقتر است؟ بله: 81% در برابر 62% و 45% با یک درخواست ساده. با رویه کامل ما همراه با مثالهای کالیبراسیون، Opus 5 به 77% و Sonnet 5 به 69% رسیدند، همچنان پایینتر، و همچنان ضعیفترین در بالای مقیاس.
هزینه هرکدام چقدر است؟ Claude Max از US$100 در ماه شروع میشود، حدود CA$138 پیش از مالیات، با سقف مصرف؛ Claude Pro با US$20 محدودیتهای سختتری دارد. Prepamigo ماهانه CA$24.98 با مالیات، یا CA$8.25 در ماه در طرح سالانه، با نمرهدهی نامحدود و 80 مجموعه تمرینی است.
چرا Claude مدام به پاسخهای قوی من 7 یا 8 میدهد؟ مدلی که برای عدد پرسیده میشود و چیزی برای مقایسه ندارد، پایین و بهسمت وسط میرود، و یک پاسخ سطح بالا هرگز بینقص نیست. وقتی بهسادگی پرسیده شد، Sonnet 5 تنها در 29% مواقع به یک پاسخ سطح بالا عدد 9 یا بالاتر داد.
برای دیدن اینکه نمرهدهی واقعاً چگونه کار میکند، بخوانید درون Scoring Engine 2.0. برای دیدن جدول کامل رتبهبندی شامل GPT و Gemini، بخوانید کدام هوش مصنوعی اسپیکینگ CELPIP را دقیقتر نمره میدهد. یا خواندن را کنار بگذارید و ضبط پاسخ کنید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.
