محصول

Prepamigo در برابر Claude برای اسپیکینگ CELPIP: کدام نمره درست را می‌دهد؟

۷ سپتامبر ۲۰۲۶

سهم پاسخ‌هایی که در سطح تأییدشده نمره گرفتند

48 پاسخ اسپیکینگ کنارگذاشته‌شده، 16 پاسخ در هر یک از سه سطح. به Claude متن پیاده‌شده داده شد و از آن خواسته شد با کلماتی ساده آن را در مقیاس CELPIP نمره بدهد؛ میانگین سه اجرا. Engine 2.0 در پیکربندی عادی عملیاتی خودش اجرا شد.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

45%

Claude Sonnet 5

مقایسه Prepamigo با پرطرفدارترین طرح‌های چت‌بات

بر اساس دلار کانادا. قیمت‌های Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شده‌اند. دقت، سهم پاسخ‌های مجموعه آزمون کنارگذاشته‌شده است که وقتی از مدل نام‌برده با کلماتی ساده درخواست امتیازدهی می‌شود، در سطح تأییدشده امتیاز می‌گیرند؛ میانگین سه اجرا.

Prepamigo
Claude MaxOpus 5
قیمت ماهانه
CA$24.98 (با مالیات)
+CA$138 (بدون مالیات)
امتیازدهی
نامحدود
محدود
بانک سوال آماده
بله
خیر
مجموعه‌های تمرینی
80
ندارد
تمرین‌ها
+2,000
ندارد
قالب CELPIP
بله
خیر
دقت
81%
62%
پاسخ‌های سطح بالا
71%
50%

اگر تا به حال متن پیاده‌شده یک پاسخ اسپیکینگ را در Claude وارد کرده‌اید و از آن خواسته‌اید مثل یک ارزیاب CELPIP به شما نمره بدهد، جذابیت این کار را می‌دانید. فوراً پاسخ می‌دهد، خودش را توضیح می‌دهد، و هرگز خسته نمی‌شود. سؤال این است که آیا عددی که به شما می‌دهد همان عددی است که واقعاً می‌گیرید. ما این آزمون را دقیقاً همان‌طور که یک داوطلب انجامش می‌دهد اجرا کردیم: همان متن پیاده‌شده، یک درخواست ساده برای نمره، و بعد شمارش کردیم.

پاسخ کوتاه این است: روی 48 پاسخ اسپیکینگ که این سیستم‌ها هرگز ندیده بودند، هرکدام با نمره‌ای مستقل تأییدشده، Prepamigo Scoring Engine 2.0 در 81% مواقع به سطح درست رسید. وقتی با کلماتی ساده از آن‌ها خواسته شد همان متن‌ها را نمره بدهند، Claude Opus 5 در 62% مواقع و Claude Sonnet 5 در 45% مواقع به سطح درست رسیدند. این فاصله دقیقاً همان‌جایی که برای هر کسی که به‌دنبال نمره بالاست بیشترین اهمیت را دارد، بازتر می‌شود: در پاسخ‌های سطح بالا، Engine 2.0 71% را شناسایی کرد، Opus 5 50% را، و Sonnet 5 29% را.

سپس کاری کردیم که بیشتر مقایسه‌ها از آن صرف‌نظر می‌کنند. رویه نمره‌دهی خودمان را، با مثال‌های کالیبراسیون واقعی برای هر تسک و یک مقایسه اجباری در برابر آن‌ها، به Claude دادیم تا ببینیم حداکثر توانش چقدر است. Opus 5 به 77% و Sonnet 5 به 69% رسیدند. هر دو همچنان پشت Engine 2.0 ماندند، و هر دو همچنان بیشترین مشکل را در پاسخ‌های سطح بالا داشتند. باقی این مقاله هر دو آزمون را بررسی می‌کند، این‌که اعداد در هر سطح نمره چه شکلی دارند، چرا یک دستیار عمومی به‌سوی وسط مقیاس می‌رود، روند روزانه کار در هر طرف چگونه است، و اگر قصد تمرین جدی دارید هرکدام چه هزینه‌ای دارد.

آزمون ساده: چیزی که یک داوطلب واقعاً می‌گیرد

هشتاد و یک درصد در برابر شصت‌ودو و چهل‌وپنج. در یک آزمون 48 پاسخی، تفاوت میان Engine 2.0 و Opus 5 نُه نمره درست بیشتر است، و تفاوت میان Engine 2.0 و Sonnet 5 هفده نمره. به بیان دیگر، Engine 2.0 نسبت به Opus 5 51% اشتباه نمره‌دهی کمتر و نسبت به Sonnet 5 66% کمتر دارد.

سه اجرای مجزا از آزمون ساده به Opus 5 اعداد 62%، 65% و 58% داد، و به Sonnet 5 اعداد 44%، 46% و 46%. آن پراکندگی چند واحدی میان اجراها خودش یک یافته است: اگر از Claude بخواهید همان متن پیاده‌شده را در دو روز مختلف نمره بدهد، به‌طور نسبتاً منظمی دو نمره متفاوت می‌گیرید. Engine 2.0 در هر سه اجرای خودش 81.3% نمره گرفت.

جایی که فاصله باز می‌شود: سطح‌به‌سطح

بیشتر ارزیاب‌ها، انسانی یا ماشینی، به‌سوی وسط مقیاس می‌روند. یک پاسخ قوی به‌جای 10 می‌شود 8؛ یک پاسخ ضعیف به‌جای 5 می‌شود 6. این گرایش در میانگین دیده نمی‌شود و لحظه‌ای که نتایج را بر اساس سطح تفکیک کنید کاملاً واضح می‌شود. با یک دستور ساده، Claude یک عادت دوم هم اضافه می‌کند: به‌سمت پایین هم می‌رود، به‌طوری که حتی پاسخ‌های ضعیف هم اغلب پایین‌تر از سطح خودشان نمره می‌گیرند.

پاسخ‌های سطح پایین (نمره تأییدشده 4 یا 5)

16 پاسخ کنارگذاشته‌شده، دستور ساده، میانگین سه اجرا. خطاهای Sonnet 5 در این‌جا بیشتر نمره 3 است.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

44%

Claude Sonnet 5

در پاسخ‌های ضعیف، Engine 2.0 با 88% پیشتاز است، Opus 5 با 77% دنبال می‌کند، و Sonnet 5 به 44% سقوط می‌کند. این آسان‌ترین انتهای مقیاس است، و Opus 5 آن را نسبتاً خوب مدیریت می‌کند. Sonnet 5 نه: به یک پاسخ 4 یا 5، بیشتر از نیمی از مواقع، عدد 3 می‌دهد، که سطح اشتباهی است حتی اگر جهت آن قابل‌درک باشد. داوطلبی در این سطح که از Sonnet 5 برای نمره‌دهی استفاده می‌کند، بیشتر مواقع به او گفته می‌شود که ضعیف‌تر از واقعیت است.

پاسخ‌های سطح میانی (نمره تأییدشده 7 یا 8)

16 پاسخ کنارگذاشته‌شده، دستور ساده، میانگین سه اجرا. خطاها تقریباً همه نمره 6 هستند.

85%

Prepamigo Engine 2.0

63%

Claude Sonnet 5

58%

Claude Opus 5

در میانه، Engine 2.0 روی 85% است و دو مدل Claude روی 63% و 58%. پاسخ‌های سطح میانی مخلوطی از نقاط قوت و ضعف دارند که باید سنجیده شود، نه فقط شناسایی شود، و بدون مثال کالیبراسیونی برای مقایسه، هر دو مدل Claude گرایش دارند ضعف‌ها را ببینند و عدد 6 بدهند. یک داوطلب سطح 7 یا 8 حدود چهار بار از هر ده بار می‌شنود که سطح 6 است.

پاسخ‌های سطح بالا (نمره تأییدشده 10 یا بالاتر)

16 پاسخ کنارگذاشته‌شده، دستور ساده، میانگین سه اجرا. تقریباً هر خطا نمره 7 یا 8 است.

71%

Prepamigo Engine 2.0

50%

Claude Opus 5

29%

Claude Sonnet 5

در بالا، Engine 2.0 71% پاسخ‌های سطح بالا را شناسایی می‌کند. Opus 5 نیمی از آن‌ها را شناسایی می‌کند. Sonnet 5 29% را شناسایی می‌کند، یعنی به هفت از هر ده پاسخی که ارزش 10 دارد، عدد 7 یا 8 می‌دهد.

به معنای عملی این موضوع فکر کنید. فرض کنید امروز اسپیکینگ شما واقعاً سطح 10 است. هشت پاسخ ضبط می‌کنید، پیاده‌سازی می‌کنید، در Claude Sonnet 5 وارد می‌کنید و نمره می‌خواهید، و به شما می‌گوید شش‌تای آن‌ها 7 و 8 هستند. نتیجه می‌گیرید آماده نیستید. سه هفته دیگر تمرین می‌کنید. در تمام این مدت آماده بودید. این یک شکست فرضی نیست؛ رایج‌ترین خطای تکی در تمام آزمون ما بود، و سخت‌ترین ضربه را به داوطلبانی می‌زند که بیشترین تلاش را کرده‌اند.

اگر از Claude برای نمره‌دهی استفاده می‌کنید و مدام 7 و 8 می‌دهد، آن را خودکار باور نکنید. در آزمون ما، احتمال گرفتن عدد 8 از Sonnet 5 برای یک پاسخ سطح بالا بیشتر از احتمال گرفتن عدد 10 بود. یک 8 از Claude دلیلی برای گرفتن نظر دوم است، نه یک حکم قطعی.

اگر رویه کامل خودمان را به Claude بدهیم چه می‌شود؟

وسوسه‌انگیز است که اعداد آزمون ساده را نشانه ضعف مدل Claude بدانیم. این‌طور نیست. Opus 5، تا حد زیادی، قوی‌ترین ارزیاب عمومی است که آزموده‌ایم. مشکل هوش نیست. مشکل این است که مدلی که برای دادن یک عدد پرسیده می‌شود، بدون چیزی برای مقایسه، تخمین می‌زند، و وقتی تخمین می‌زند، پایین و به‌سمت وسط تخمین می‌زند.

پس آزمون دوم را اجرا کردیم. به Claude همان بسته‌ای داده شد که ارزیاب‌های خود Engine 2.0 دریافت می‌کنند: متن پیاده‌شده، تسک، دو مثال کالیبراسیون واقعی در هر سطح برای همان تسک دقیق، و دستوری برای نام بردن نزدیک‌ترین مثال برای هر یک از چهار بعد به‌جای تولید یک عدد. هر مدل همچنین یک یادداشت کالیبراسیون کوتاه متناسب با گرایش‌های خودش گرفت.

با رویه کامل ما: سهم پاسخ‌هایی که در سطح تأییدشده نمره گرفتند

همان 48 پاسخ کنارگذاشته‌شده. هر مدل Claude هر پاسخ را یک‌بار با همان متن‌های پیاده‌شده، دستورالعمل‌ها و مثال‌های کالیبراسیون ارزیاب‌های خود Engine 2.0 نمره داد.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

69%

Claude Sonnet 5

مثال‌های کالیبراسیون تفاوت بزرگی ایجاد می‌کنند. Opus 5 از 62% به 77% می‌رسد؛ Sonnet 5 از 45% به 69%. دقت سطح پایین برای هر دو به 88% می‌رسد، همان رقم Engine 2.0. دقت سطح میانی برای هر دو به 81% می‌رسد. این ارزش مکث کردن دارد، چون به شما می‌گوید ارزش واقعی یک ارزیاب اختصاصی کجاست: نه در یک مدل باهوش‌تر، بلکه در نمونه‌های واقعی از این‌که هر سطح در هر تسک مشخص چه صدایی دارد، و در پرسشی که مدل را وادار می‌کند مقایسه کند به‌جای تخمین بزند.

با این حال، هر دو مدل در بالای مقیاس همچنان عقب می‌مانند. با رویه کامل، Opus 5 63% پاسخ‌های سطح بالا و Sonnet 5 38% را شناسایی می‌کند، در برابر 71% برای Engine 2.0. یک مدل تنها که یک اجرای واحد انجام می‌دهد همچنان روی یک پاسخ قوی که یک لغزش دارد عقب‌نشینی می‌کند. Engine 2.0 فاصله باقی‌مانده را با سه چیز دیگر می‌بندد: دو ارزیاب مستقل از دو ارائه‌دهنده متفاوت، سه رأی از هرکدام با نگه‌داشتن رأی میانی، و یک قانون تطبیق که وقتی دو ارزیاب به‌شدت اختلاف دارند نمره بالاتر را می‌گیرد، چون تحلیل نشان داد رأی پایین‌تر تقریباً همیشه در پاسخ‌های قوی اشتباه بود.

همچنین یک راه‌حل ساده و بدیهی را آزمایش کردیم: نگه‌داشتن دستور ساده و افزودن دستورالعمل‌هایی مانند «به‌سمت وسط نرو» یا «یک پاسخ سطح 9 نیازی به بی‌نقصی ندارد». هیچ تغییر قابل‌سنجشی ایجاد نکردند. مدل با دستورالعمل موافقت می‌کند و بعد همان کاری را می‌کند که قرار بود بکند. چیزی که کار می‌کند تغییر پرسش است، و دادن چیزی واقعی برای مقایسه.

فاصله روند کار: ضبط و برو، یا همه‌چیز را خودتان انجام بده

اعداد دقت فرض می‌کنند نمره‌دهی واقعاً اتفاق می‌افتد. با Claude، مقدار شگفت‌انگیزی کار میان زدن دکمه توقف ضبط و خواندن یک نمره قرار دارد.

اول، به یک متن پیاده‌شده نیاز دارید. رابط چت Claude ضبط‌های صوتی را نمره نمی‌دهد، پس باید متن تولید کنید. این یعنی یا تایپ کردن آن‌چه گفته‌اید، که آن را تغییر می‌دهد، یا عبور دادن ضبط از یک ابزار پیاده‌سازی. و این‌جا جزئیاتی است که پیش از فهمیدنش دقت زیادی به ما هزینه داد: متن باید کلمه‌به‌کلمه باشد. هر مکث، هر شروع دوباره، هر خودتصحیحی باید در متن بماند. وقتی یک متن «پاکسازی‌شده» با مکث‌های حذف‌شده را آزمایش کردیم، دقت پانزده واحد کاهش یافت، چون آن مکث‌ها دقیقاً شاهدی هستند که یک ارزیاب برای قضاوت درباره صدای یک پاسخ به آن نیاز دارد. بیشتر ابزارهای پیاده‌سازی مصرفی به‌طور پیش‌فرض پاکسازی می‌کنند.

دوم، به تسک نیاز دارید. Claude بانکی از دستورهای سبک CELPIP با زمان‌بندی و قالب درست ندارد. یا باید خودتان بنویسید، که یعنی تخمین زدن آن‌چه آزمون واقعی می‌پرسد، یا از جای دیگری پیدا کنید و همراه متن پیاده‌شده وارد کنید.

سوم، اگر چیزی بهتر از اعداد آزمون ساده می‌خواهید، به مثال‌های کالیبراسیون نیاز دارید: پاسخ‌های واقعی در هر سطح برای همان نوع تسک، با سطوح تأییدشده. این همان ورودی است که Opus 5 را در آزمون ما از 62% به 77% رساند، و همان چیزی است که یک داوطلب نمی‌تواند در خانه تولید کند.

چهارم، برای پاسخ بعدی دوباره همه این کار را انجام می‌دهید. و پاسخ بعد از آن.

در Prepamigo، یک تسک از بانک انتخاب می‌کنید، تایمر اجرا می‌شود، صحبت می‌کنید، و حدود ده ثانیه بعد از توقف، نمره و بازخورد روی صفحه است. پیاده‌سازی به‌طور طبیعی کلمه‌به‌کلمه است، مثال‌های کالیبراسیون به‌طور خودکار به تسک متصل‌اند، و چیزی برای چسباندن یا نوشتن دستور وجود ندارد. یازدهمین پاسخ آن شب همان تلاشی را از شما می‌گیرد که پاسخ اول.

ثبات: همان پاسخ، همان نمره

نمره‌ای که نتوانید تکرار کنید، یک اندازه‌گیری نیست. اگر همان ضبط دوشنبه 8 بگیرد و سه‌شنبه 10، چیزی درباره اسپیکینگ خودتان یاد نگرفته‌اید، بلکه چیزی درباره حال‌وهوای ارزیاب یاد گرفته‌اید. پس این را هم آزمودیم که آیا هر سیستم دو بار همان پاسخ را می‌دهد.

Engine 2.0 روی 48 پاسخ کنارگذاشته‌شده سه بار مجزا اجرا شد. در هر اجرا 81.3% نمره گرفت. با نگاه به پاسخ‌های تکی به‌جای مجموع، 87.5% در هر سه اجرا نمره‌ای یکسان گرفتند، و فقط 4.2% دو واحد یا بیشتر حرکت کردند. آن تعداد کم پاسخ‌هایی هستند که دقیقاً روی مرز میان دو سطح قرار دارند، جایی که تفاوت کوچکی در قضاوت به‌طور مشروع نمره را به یک سو می‌کشاند.

آزمون ساده روی Claude در سطح مجموع چند واحد میان اجراها حرکت کرد، و در سطح پاسخ‌های تکی حتی بیشتر. آن فاصله ثبات تصادفی مدل‌های درگیر نیست. از رأی‌گیری می‌آید. هر ارزیاب در Engine 2.0 روی هر پاسخ سه بار رأی می‌دهد و رأی میانی نگه داشته می‌شود، که مقدار پرت گاه‌به‌گاه یک اجرای تنها را حذف می‌کند. وقتی همان پیکربندی را با یک رأی به‌جای سه رأی آزمودیم، توافق اجرا‌به‌اجرا از 87.5% به 77.1% سقوط کرد. یک گفتگوی تک با Claude یک رأی تنها است.

بازخوردی که می‌توانید روی آن عمل کنید

یک نمره به شما می‌گوید کجا هستید. بازخورد به شما می‌گوید بعدی چه کنید، و این حوزه‌ای است که Claude واقعاً خوب است. روشن می‌نویسد، صبور است، و اگر بپرسید چرا نمره خاصی داد، به هر اندازه که بخواهید توضیح می‌دهد. برای داوطلبی که می‌خواهد درباره یک پاسخ گفتگو کند، این ارزشمند است.

خطر همان است که با نمره: توضیح روان همان چیزی نیست که تشخیص دقیق است. مدلی که یک 10 را 7 نمره داده، به‌طور قانع‌کننده‌ای توضیح می‌دهد چرا 7 است. چیزی برای اشاره کردن پیدا می‌کند. و چون Claude پیش از نمره‌دهی مجبور نبود به شواهد متعهد شود، توضیح بعد از واقعه نوشته می‌شود، برای توجیه عددی که از قبل انتخاب کرده است.

Engine 2.0 برعکس عمل می‌کند. چون هر ارزیاب باید برای هر بعدی که قضاوت می‌کند به شواهد اشاره کند، لایه بازخورد آن شواهد را مستقیماً دریافت می‌کند: عبارت‌های دقیق از متن پیاده‌شده که حکم را در مورد محتوا، واژگان، صدای پاسخ، و تکمیل تسک تأیید کردند. بازخورد از همان شواهد نوشته می‌شود و کلمات خودتان را نقل می‌کند. در بازرسی 158 نقل‌قول در نمونه‌ای از بازخوردها، 157 مورد عیناً در متن پیاده‌شده ظاهر شدند. وقتی از یک مدل قضاوت مستقل خواستیم بازخورد Engine 2.0 را با بازخورد سیستم قبلی‌مان مقایسه کند، بدون این‌که بداند کدام کدام است، در 20 از 24 مقایسه Engine 2.0 را ترجیح داد، هم وقتی مانند یک ارزیاب قضاوت می‌کرد و هم وقتی مانند یک داوطلب.

همچنین آزمودیم که آیا بازخورد انتقاد را در جای درست می‌گذارد. پاسخ‌های قوی را برداشتیم و عمداً یک جنبه از هرکدام را خراب کردیم: افزودن خطاهای گرامری و مکث‌ها، جایگزین کردن کلمات دقیق با کلمات مبهم، حذف جزئیات پشتیبان، یا حذف کنش اصلی که تسک می‌خواست. در سه از چهار مورد، بعدی که خراب کرده بودیم همان بعدی بود که نمره‌اش بیشترین کاهش یافت. این نوع بررسی‌ای است که یک چت‌بات نمی‌تواند به‌راحتی از آن عبور کند، چون ابعاد ثابتی برای بررسی‌شدن در برابر آن‌ها ندارد.

هزینه تمرین روزانه

یک نمره اسپیکینگ بیشترین سود را در چهلمین پاسخ شما دارد، نه چهارمین. آن‌جاست که شروع می‌کند به شما بگوید آیا تغییری در نحوه صحبت‌کردن‌تان واقعاً کار می‌کند یا نه. پس سؤال عملی این نیست که هرکدام چقدر هزینه دارد، بلکه استفاده حجیم از آن چقدر هزینه دارد.

Claude Pro ماهانه US$20 است، حدود CA$28، یا US$17 در ماه با صورت‌حساب سالانه، همان‌طور که در سپتامبر 2026 در claude.com منتشر شده. با یک بازه استفاده پنج‌ساعته چرخشی و یک سقف هفتگی می‌آید؛ وقتی به هرکدام برسید، باید صبر کنید. متن‌های پیاده‌شده طولانی به‌همراه مثال‌های کالیبراسیون دقیقاً نوع پیامی هستند که سهم زیادی از آن سهمیه را مصرف می‌کنند. طرح‌های Max، از US$100 در ماه، حدود CA$138 پیش از مالیات، محدودیت‌ها را به‌طور قابل‌توجهی بالا می‌برند اما آن‌ها را حذف نمی‌کنند. هیچ‌کدام از طرح‌ها بانک سوال، تایمر، پیاده‌سازی، مثال‌های کالیبراسیون، یا چیزی خاص برای CELPIP ندارند.

Prepamigo ماهانه CA$24.98 است، یا CA$8.25 در ماه در طرح سالانه، که CA$98.98 برای سال است، شامل مالیات، و می‌توانید هر زمان لغو کنید. هر طرح شامل نمره‌دهی نامحدود توسط Engine 2.0 بدون سقف روزانه، جلسه‌ای یا هفتگی، تلاش‌های نامحدود، و بانک کامل سوال است: 80 مجموعه تمرینی کامل و بیش از 2,000 تمرین در Speaking، Writing، Reading و Listening، نوشته‌شده برای پیروی از انواع تسک، زمان‌بندی و قالب آزمون CELPIP General.

به‌زبان ساده: با هزینه‌ای کمتر از Claude Pro، ارزیابی می‌گیرید که در پاسخ‌هایی که بیشترین اهمیت دارند بسیار دقیق‌تر است، هرگز از شما نمی‌خواهد صبر کنید، و سوال‌ها و مثال‌های کالیبراسیون از قبل آماده‌اند.

وقتی Claude ابزار بهتری است

این مقاله‌ای نیست که بگوید هرگز نباید هنگام آماده‌شدن برای CELPIP Claude را باز کنید. چند کار وجود دارد که آن را بهتر از یک موتور نمره‌دهی تخصصی انجام می‌دهد، و یک داوطلب جدی ممکن است از هر دو استفاده کند.

  • گفتگو درباره یک پاسخ. اگر می‌خواهید بفهمید چرا یک دلیل خاص ضعیف بود، یا سه دلیل بهتر پیدا کنید، یک گفتگو شکل درستی دارد. Engine 2.0 به شما حکم و شواهد می‌دهد؛ گفتگو نمی‌کند.
  • کمک واژگان و عبارت‌سازی. پرسیدن از Claude برای پنج راه طبیعی‌تر گفتن چیزی سریع و مفید است، و پیشنهادهایش عموماً خوب است.
  • تمرین رایتینگ. پاسخ‌های نوشتاری نیازی به پیاده‌سازی ندارند، پس فاصله روند کار بسیار کوچک‌تر است. دقت Claude در رایتینگ بخشی از این آزمون نبود، و ما در این‌جا هیچ ادعایی درباره آن نمی‌کنیم.
  • هرچیز خارج از آزمون. سؤالات مربوط به مدارک مهاجرت، برنامه مطالعه، توضیح یک نکته گرامری: Claude یک دستیار عمومی است و Prepamigo نیست.

چیزی که Claude، بر اساس شواهد این‌جا، نباید باشد، همان چیزی است که به شما بگوید آماده هستید یا نه. برای آن به ارزیابی نیاز دارید که برای همین کار ساخته شده، روی پاسخ‌هایی که ندیده آزموده شده، و سطح‌به‌سطح اندازه‌گیری شده است.

چه چیزی در بازخورد شما تازه است

Engine 2.0 با یک لایه بازخورد کاملاً بازسازی‌شده عرضه می‌شود. این لایه شواهد دو ارزیاب را می‌خواند، نه فقط نمره را، و در برابر سه نوع داوطلب آزمایش شده است: کسی که برای اولین بار با CELPIP آشنا می‌شود، کسی با زبان انگلیسی ضعیف که به دنبال ترفند است، و کسی که فقط نیم ساعت در روز وقت دارد و آزمونش هفته آینده است. این‌ها چیزهایی است که تغییر کرده.

  • نقل‌قول از حرف‌های خودتان. هر نکته بازخورد، دقیقاً همان عبارتی از متن پاسخ شما را نقل می‌کند که ارزیاب‌ها به آن واکنش داده‌اند. اگر عبارتی داخل گیومه باشد، عیناً کپی شده است؛ در بررسی ما 157 از 158 نقل‌قول این‌گونه بودند. بازخورد هرگز چیزی را که نگفته‌اید اختراع نمی‌کند.
  • اولین چیزی که باید اصلاح کنید. هر پاسخ یک اقدام اصلی می‌گیرد: تغییری که بیشترین تأثیر را بر نمره شما دارد و با ساده‌ترین کلمات ممکن روی صفحه نوشته شده است. پس از آن دو اقدام عملی دیگر می‌آید، سپس یک فهرست بررسی سه‌موردی که پیش از شروع صحبت باید در ذهن مرور کنید.
  • توصیه‌ای متناسب با نوع تسک. دادن توصیه، توصیف یک صحنه و قانع کردن کسی بر اساس معیارهای متفاوتی نمره می‌گیرند. بازخورد اکنون می‌داند هر یک از هشت نوع تسک به چه چیزی امتیاز می‌دهد و بر همان تمرکز می‌کند، به‌جای تکرار همان نکته‌های کلی در همه تسک‌ها.
  • کدام بُعد را اول تمرین کنید. بازخورد به شما می‌گوید کدام یک از چهار بُعد ضعیف‌ترین و کدام قوی‌ترین شماست، تا بدانید نمره بعدی از کجا می‌آید، بدون اینکه این موضوع پشت یک عدد پنهان بماند.
  • چه چیزی از خواسته تسک را از قلم انداختید. برای معیار انجام تسک، بازخورد بخش‌های مشخصی از دستور تسک را که پوشش نداده‌اید فهرست می‌کند، یا به‌صراحت می‌گوید که همه آن‌ها را پوشش داده‌اید.
  • چیزهایی که واقعاً می‌توانید تمرین کنید. هر راهکار چیزی است که می‌توانید پیش از تلاش بعدی با صدای بلند تمرین کنید. هیچ توصیه‌ای برای واضح‌تر صحبت کردن یا کم کردن لهجه وجود ندارد: لهجه چیزی نیست که «قابل‌فهم بودن» بسنجد، و بازخورد هرگز درباره آن نظر نمی‌دهد.
  • هیچ سرزنشی برای زمان‌سنج. پاسخی که پس از تکمیل تسک به‌خاطر پایان زمان قطع شده باشد، برای همین قطع‌شدن نمره از دست نمی‌دهد، و بازخورد به‌خاطر آن شما را سرزنش نمی‌کند.

وقتی یک مدل داوری مستقل این بازخورد را با آنچه سیستم قبلی ما برای همان پاسخ‌ها تولید کرده بود مقایسه کرد، بدون اینکه بداند کدام‌یک متعلق به کدام سیستم است، در 20 از 24 مقایسه بازخورد جدید را ترجیح داد؛ هم در قضاوت به‌شیوه یک ارزیاب و هم در قضاوت به‌شیوه یک داوطلب.

سوالات متداول

آیا Claude می‌تواند تمرین اسپیکینگ CELPIP من را نمره بدهد؟ یک عدد به شما می‌دهد. وقتی به‌سادگی روی 48 پاسخ نادیده با نمره‌های تأییدشده پرسیده شد، Claude Opus 5 در 62% مواقع و Claude Sonnet 5 در 45% مواقع به سطح تأییدشده رسید، در برابر 81% برای Prepamigo Scoring Engine 2.0. در پاسخ‌های سطح بالا Sonnet 5 در 29% مواقع درست بود.

آیا Prepamigo از Claude دقیق‌تر است؟ بله: 81% در برابر 62% و 45% با یک درخواست ساده. با رویه کامل ما همراه با مثال‌های کالیبراسیون، Opus 5 به 77% و Sonnet 5 به 69% رسیدند، همچنان پایین‌تر، و همچنان ضعیف‌ترین در بالای مقیاس.

هزینه هرکدام چقدر است؟ Claude Max از US$100 در ماه شروع می‌شود، حدود CA$138 پیش از مالیات، با سقف مصرف؛ Claude Pro با US$20 محدودیت‌های سخت‌تری دارد. Prepamigo ماهانه CA$24.98 با مالیات، یا CA$8.25 در ماه در طرح سالانه، با نمره‌دهی نامحدود و 80 مجموعه تمرینی است.

چرا Claude مدام به پاسخ‌های قوی من 7 یا 8 می‌دهد؟ مدلی که برای عدد پرسیده می‌شود و چیزی برای مقایسه ندارد، پایین و به‌سمت وسط می‌رود، و یک پاسخ سطح بالا هرگز بی‌نقص نیست. وقتی به‌سادگی پرسیده شد، Sonnet 5 تنها در 29% مواقع به یک پاسخ سطح بالا عدد 9 یا بالاتر داد.

برای دیدن این‌که نمره‌دهی واقعاً چگونه کار می‌کند، بخوانید درون Scoring Engine 2.0. برای دیدن جدول کامل رتبه‌بندی شامل GPT و Gemini، بخوانید کدام هوش مصنوعی اسپیکینگ CELPIP را دقیق‌تر نمره می‌دهد. یا خواندن را کنار بگذارید و ضبط پاسخ کنید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.

Prepamigo در برابر Claude برای اسپیکینگ CELPIP: کدام نمره درست را می‌دهد؟ | PrepAmigo