Engine 2.0 روی 48 پاسخ کنارگذاشتهشده
سهم پاسخهایی که در باند تأییدشده نمره گرفتند. سه اجرای مجزا در روزهای مختلف هرکدام 81.3% کلی تولید کردند.
81%
سطح دقیق
مقایسه Prepamigo با پرطرفدارترین طرحهای چتبات
بر اساس دلار کانادا. قیمتهای Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شدهاند. دقت، سهم پاسخهای مجموعه آزمون کنارگذاشتهشده است که وقتی از مدل نامبرده با کلماتی ساده درخواست امتیازدهی میشود، در سطح تأییدشده امتیاز میگیرند؛ میانگین سه اجرا.
این سؤال درستی است که باید از هر ابزار تمرینی پرسید، و بیشتر ابزارها به آن پاسخ نمیدهند. یک نمره اسپیکینگ فقط وقتی ارزش دارد که به شما بگوید یک ارزیاب واقعی چه میگوید، و تنها راه دانستن اینکه آیا این کار را میکند اندازهگیری است. پس این مقاله همان اندازهگیری است، بهروشنی چیدهشده، با بخشهایی که به نفع ما هستند و بخشهایی که نیستند.
پاسخ در یک پاراگراف: روی 48 پاسخ اسپیکینگ که Scoring Engine 2.0 پرپامیگو هرگز نمیدیده، هرکدام با نمرهای مستقل تأییدشده، موتور در 81% مواقع به سطح تأییدشده و در 92% مواقع در فاصله یک واحد از آن رسید. در هر سه اجرای مجزا همان 81% را تولید کرد. بیشترین دقت را روی پاسخهای ضعیف و سطح میانی دارد، 88% و 85%، و کمترین دقت را روی پاسخهای سطح بالا، 71%، جایی که خطای مشخصهاش دادن عدد 8 بهجای 10 است. وقتی با کلماتی ساده از آن خواسته شد همان متنها را نمره بدهد، بهترین مدل عمومی هوش مصنوعی که آزمودیم به 62% رسید، و ضعیفترین به 31%؛ با رویه کامل نمرهدهی ما، بهترین آنها به 77% رسید.
آنچه در ادامه میآید این است که چگونه این اعداد را بهدست آوردیم، در هر سطح نمره چه معنایی دارند، چقدر باثباتاند، خطاها کجا میافتند، نمره چگونه با جایگزینهایی که ممکن است بهجای آن استفاده کنید مقایسه میشود، و چگونه نمره خودتان را با همه اینها بخوانید. اگر فقط توصیه عملی میخواهید، به بخش خواندن نمره خودتان بروید. اگر میخواهید تصمیم بگیرید که آیا اصلاً به این عدد اعتماد کنید، همهاش را بخوانید.
معنای «دقیق» در اینجا
پیش از هر عددی، تعریف. ادعا نمیکنیم نمره Prepamigo نتیجه آزمون شما را پیشبینی میکند. هیچ ابزار تمرینی نمیتواند آن را تعهد کند، و هرکسی که این کار را میکند تخمین میزند. آنچه اندازه میگیریم محدودتر و صادقانهتر است: با پاسخی گفتاری که نمرهاش بهطور مستقل تأیید شده، موتور چند بار نمرهای در همان سطح تولید میکند؟
اسپیکینگ CELPIP در مقیاسی گزارش میشود که تا 12 میرود، و نمرههای تأییدشده در داده مرجع ما در سه باند میآیند: پایین، یعنی 4 یا 5؛ میانی، یعنی 7 یا 8؛ و بالا، یعنی 10 و بیشتر. موتور را وقتی درست میشماریم که نمرهاش درون باند تأییدشده بیفتد. پاسخی که در بالا تأیید شده، اگر موتور به آن 9، 10 یا 11 بدهد درست نمرهدهی شده است. با خوانشی سختگیرانهتر که فقط 10 و بالاتر را میپذیرد، هر رقم این صفحه چند واحد پایین میآید و هر مقایسه در همان ترتیب باقی میماند.
اعداد اصلی
81% در عمل چه معنایی دارد؟ اگر ده پاسخ در سطحی ثابت ضبط کنید، موتور حدود هشتتای آنها را در باند درست و حدود یکی دیگر را در فاصله یک واحد از آن قرار میدهد. یک 5 را در باند 10 یا یک 10 را در باند 5 نمیگذارد؛ این حتی یکبار هم در 144 پاسخ نمرهگرفته در سه اجرا اتفاق نیفتاد. اشتباهاتی که میکند اشتباهات یک ارزیاب دقیق روی یک پاسخ مرزی هستند، و بخش بعدی نشان میدهد کجا متمرکز میشوند.
دقت در هر سطح نمره
دقت بر اساس باند تأییدشده
16 پاسخ کنارگذاشتهشده در هر باند. هر ستون سهم پاسخهای آن باند است که درون باند نمره گرفتند.
88%
پایین (4–5)
85%
میانی (7–8)
71%
بالا (+10)
پاسخهای سطح پایین: 88%. پاسخهای ضعیف آسانترین برای شناسایی هستند. آنها گرایش دارند کوتاه باشند، عبارتهای دستور را دوباره استفاده کنند، و بخشهایی از تسک را ناتمام بگذارند. موتور بیشتر مواقع آن نشانهها را میگیرد. وقتی اشتباه میکند، بهسمت بالا اشتباه میکند: در هر مورد، پاسخ عدد 8 گرفته بهجای 4 یا 5. علت تقریباً همیشه پاسخی است که روان و مطمئن بهنظر میرسد اما کم میگوید؛ ارائه سطحی به آن میدهد که در محتوا کسبش نکرده. این را میدانیم چون میبینیم کدام ابعاد را ارزیابها بالا گذاشتهاند، و هر بار مورد قابلیت شنیدن است.
پاسخهای سطح میانی: 85%. اینها به یک معنا سختترین برای نمرهدهی هستند، چون مخلوطی واقعی از نقاط قوت و ضعف دارند که باید سنجیده شود نه فقط شناسایی شود. خطاهای موتور در اینجا به هر دو جهت میروند. چند پاسخ با مکث قابلمشاهده اما ایدههای قوی به 5 یا 6 کشیده شدند؛ چند پاسخ با ارائه صیقلی به 10 رانده شدند. مرحله تطبیق میان دو ارزیاب بیشتر اینها را میگیرد، که چرا این رقم به این اندازه بالاست.
پاسخهای سطح بالا: 71%. این ضعیفترین باند و آنکه بیشترین حرف در موردش میزنیم است، چون خطایش اینقدر پیوسته است. وقتی موتور یک پاسخ سطح بالا را از دست میدهد، عدد 8 به آن میدهد. نه 7، نه 6؛ 8، در هر مورد جز چند 9 که درست شمرده میشوند. موتور یک پاسخ قوی را میبیند و یک درجه عقب مینشیند.
این ارزش زمینه دارد. کشیدهشدن بهسوی 8 روی پاسخهای قوی یک ویژگی خاص Prepamigo نیست؛ شکست مشخصه هر ارزیاب خودکاری است که آزمودهایم، کالیبرهشده یا نه. موتور قبلی ما این مشکل را بسیار بدتر داشت. وقتی بهسادگی پرسیده شد همان پاسخها را نمره بدهد، بهترین مدل عمومی 56% پاسخهای سطح بالا را شناسایی کرد؛ مدل پشت طرحهای پولی ChatGPT 25% را شناسایی کرد؛ و حتی با رویه کامل ما، هیچکدام از 63% فراتر نرفت. هفتادویک درصد بهترین رقمی است که بهدست آوردهایم، و همچنان همان عددی است که بیشتر میخواهیم بهبود دهیم.
مشکل 8، از سمت شما پشت صفحه
نمای سطح به شما میگوید موتور روی پاسخی با سطح مشخص چه میکند. شما آن را از جهت دیگر نگاه میکنید: نمرهای دارید و میخواهید بدانید چقدر باور کنید. پس اینجا همان داده برعکس شده. برای هر نمرهای که موتور میدهد، پاسخ واقعاً چند بار در آن سطح بوده؟
- اگر موتور میگوید 4 یا 5: پاسخ در 93% مواقع واقعاً در سطح پایین بود. باقی پاسخهای سطح میانی با مکث زیاد بودند. یک نمره پایین از Engine 2.0 تقریباً همیشه درست است.
- اگر موتور میگوید 10: پاسخ در 92% مواقع واقعاً در سطح بالا بود. یک 10 از Engine 2.0 یک 10 است.
- اگر موتور میگوید 8: پاسخ در 67% مواقع در سطح میانی، در 23% مواقع در سطح بالا، و در 10% مواقع در سطح پایین بود. 8 تنها نمرهای است که ارزش خواندن دقیق دارد.
بهزبان ساده: یک 8 از Engine 2.0 یعنی «احتمالاً میانی، اما شاید بهتر». تقریباً یک پاسخ از هر چهاری که 8 میگیرد واقعاً یک 10 بود. اگر روی پاسخی 8 گرفتید که فکر میکردید عالی بود، نتیجه نگیرید که آماده نیستید. همان تسک را دوباره ضبط کنید. یک 10 پیوسته در سه تلاش یک 10 است؛ یک 8 پیوسته در سه تلاش یک 8 است؛ یک مخلوط یعنی پاسخی روی مرز است، و بازخورد به شما میگوید کدام بعد آن را آنجا نگه داشته.
آیا همان ضبط همان نمره را میگیرد؟
دقت بدون ثبات شانس است. اگر همان ضبط بتواند امروز 8 و فردا 10 بگیرد، رقم 81% میانگینی روی نویز بود و نمیتوانستید از نمره برای ردیابی چیزی استفاده کنید. پس تکرارپذیری را مستقیماً آزمودیم.
48 پاسخ کنارگذاشتهشده سه بار مجزا، در روزهای مختلف، بدون تغییری در میان، نمره گرفتند. رقم کلی در هر اجرا 81.3% بود. در سطح پاسخهای تکی، 87.5% هر سه بار نمرهای یکسان گرفتند، و فقط 4.2% دو واحد یا بیشتر حرکت کردند. آن تعداد کم پاسخهایی هستند که دقیقاً روی مرز میان دو باند نشستهاند، جایی که تفاوت کوچکی در قضاوت بهطور مشروع نمره را به یک سو میکشاند.
این ثبات از یک انتخاب طراحی مشخص میآید. هر یک از دو ارزیاب موتور روی هر پاسخ سه بار رأی میدهد، و رأی میانی نگه داشته میشود. وقتی همان پیکربندی را با یک رأی بهجای سه رأی آزمودیم، نمرات یکسان میان اجراها از 87.5% به 77% سقوط کرد، و سهم پاسخهایی که دو واحد یا بیشتر جهش میکنند بیش از دو برابر شد. رأیگیری رقم دقت را تغییر نداد. تغییر داد که آیا رقم دقت معنایی دارد یا نه.
برای شما، ثبات یعنی تغییر در نمرهتان تغییری در اسپیکینگتان است. اگر همان نوع تسک را سه بار در طول یک هفته ضبط کنید و نمره از 8 به 10 برود، این حالوهوای خوب ارزیاب نیست. خود شمایید.
این چگونه با چیزی که ممکن است بهجای آن استفاده کنید مقایسه میشود
یک رقم دقت با چیزی برای مقایسه معنای بیشتری دارد. پس همان 48 پاسخ کنارگذاشتهشده را از میان مدلهای عمومی هوش مصنوعی که مردم واقعاً برای نمرهدهی تمرینشان استفاده میکنند عبور دادیم، همانطور که یک فرد این کار را میکند: به هر مدل متن پیادهشده کلمهبهکلمه و تسک را دادیم، به آن گفتیم یک ارزیاب باتجربه CELPIP است، و برای نمرهای از 0 تا 12 پرسیدیم. سه اجرا از هرکدام، میانگینگیریشده.
سهم پاسخهایی که در باند تأییدشده نمره گرفتند
همان 48 پاسخ کنارگذاشتهشده. به هر مدل با کلماتی ساده خواسته شد متن پیادهشده را نمره بدهد؛ میانگین سه اجرا. Engine 2.0 در پیکربندی عادی عملیاتی خودش اجرا شد.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Engine 2.0 از هر مدل بین نوزده و پنجاهویک واحد پیشی میگیرد. وقتی بهسادگی پرسیده میشود، هر مدل عمومی سختگیرانه نمره میدهد: خطای روی پاسخ ضعیف معمولاً 3 است، خطای روی پاسخ قوی 7 یا 8. Claude Opus 5 و Gemini تنها دو موردی هستند که بالای نیمیاند. سه مدل بزرگتر GPT بین 31% و 37% هستند، و پاسخ سطح بالا را بین 13% و 27% مواقع شناسایی میکنند.
سپس رویه کامل خودمان را به هر مدل دادیم: همان مثالهای کالیبراسیون برای تسک دقیق، همان مقایسه اجباری، و یک یادداشت کالیبراسیون کوتاه متناسب با گرایشهای خودش. این بهترین چیزی است که هر مدل در دستان ما بهدست آورد، و چیزی نیست که یک داوطلب بتواند بدون مثالها بازتولید کند. Opus 5 به 77% رسید، GPT 5.6 sol و Gemini به 71%، GPT 5.5 و Sonnet 5 به 69%، luna به 63% و GPT-4o mini به 50%. هرکدام از آنها همچنان پشت Engine 2.0 تمام کردند، و هیچکدام بیش از 63% پاسخهای سطح بالا را شناسایی نکرد.
چه چیزی در بازخورد شما تازه است
Engine 2.0 با یک لایه بازخورد کاملاً بازسازیشده عرضه میشود. این لایه شواهد دو ارزیاب را میخواند، نه فقط نمره را، و در برابر سه نوع داوطلب آزمایش شده است: کسی که برای اولین بار با CELPIP آشنا میشود، کسی با زبان انگلیسی ضعیف که به دنبال ترفند است، و کسی که فقط نیم ساعت در روز وقت دارد و آزمونش هفته آینده است. اینها چیزهایی است که تغییر کرده.
- نقلقول از حرفهای خودتان. هر نکته بازخورد، دقیقاً همان عبارتی از متن پاسخ شما را نقل میکند که ارزیابها به آن واکنش دادهاند. اگر عبارتی داخل گیومه باشد، عیناً کپی شده است؛ در بررسی ما 157 از 158 نقلقول اینگونه بودند. بازخورد هرگز چیزی را که نگفتهاید اختراع نمیکند.
- اولین چیزی که باید اصلاح کنید. هر پاسخ یک اقدام اصلی میگیرد: تغییری که بیشترین تأثیر را بر نمره شما دارد و با سادهترین کلمات ممکن روی صفحه نوشته شده است. پس از آن دو اقدام عملی دیگر میآید، سپس یک فهرست بررسی سهموردی که پیش از شروع صحبت باید در ذهن مرور کنید.
- توصیهای متناسب با نوع تسک. دادن توصیه، توصیف یک صحنه و قانع کردن کسی بر اساس معیارهای متفاوتی نمره میگیرند. بازخورد اکنون میداند هر یک از هشت نوع تسک به چه چیزی امتیاز میدهد و بر همان تمرکز میکند، بهجای تکرار همان نکتههای کلی در همه تسکها.
- کدام بُعد را اول تمرین کنید. بازخورد به شما میگوید کدام یک از چهار بُعد ضعیفترین و کدام قویترین شماست، تا بدانید نمره بعدی از کجا میآید، بدون اینکه این موضوع پشت یک عدد پنهان بماند.
- چه چیزی از خواسته تسک را از قلم انداختید. برای معیار انجام تسک، بازخورد بخشهای مشخصی از دستور تسک را که پوشش ندادهاید فهرست میکند، یا بهصراحت میگوید که همه آنها را پوشش دادهاید.
- چیزهایی که واقعاً میتوانید تمرین کنید. هر راهکار چیزی است که میتوانید پیش از تلاش بعدی با صدای بلند تمرین کنید. هیچ توصیهای برای واضحتر صحبت کردن یا کم کردن لهجه وجود ندارد: لهجه چیزی نیست که «قابلفهم بودن» بسنجد، و بازخورد هرگز درباره آن نظر نمیدهد.
- هیچ سرزنشی برای زمانسنج. پاسخی که پس از تکمیل تسک بهخاطر پایان زمان قطع شده باشد، برای همین قطعشدن نمره از دست نمیدهد، و بازخورد بهخاطر آن شما را سرزنش نمیکند.
وقتی یک مدل داوری مستقل این بازخورد را با آنچه سیستم قبلی ما برای همان پاسخها تولید کرده بود مقایسه کرد، بدون اینکه بداند کدامیک متعلق به کدام سیستم است، در 20 از 24 مقایسه بازخورد جدید را ترجیح داد؛ هم در قضاوت بهشیوه یک ارزیاب و هم در قضاوت بهشیوه یک داوطلب.
چگونه نمره خودتان را بخوانید
- یک 4 یا 5 تقریباً حتماً درست است. موتور پاسخهای ضعیف را در 88% مواقع شناسایی میکند، و وقتی میگوید 4 یا 5 در 93% مواقع درست است. بازخورد را بخوانید تا ببینید کدام بعد پایینترین است و روی همان کار کنید.
- یک 10 یک 10 است. وقتی موتور میگوید 10، پاسخ در 92% مواقع واقعاً در سطح بالا بود. برای آن نوع تسک آمادهاید. به تسکهایی بروید که از آنها اجتناب میکنید.
- یک 8 یک سؤال است. دوسوم مواقع یعنی میانی. یک بار از چهار یعنی بالا. همان تسک را دوباره ضبط کنید و به الگو در تلاشها نگاه کنید.
- اعتماد بیشتر از سطح تغییر میکند. چون نمره باثبات است، تغییری میان تلاشها تغییری در اسپیکینگ شماست. تکرار همان نوع تسک سریعترین راه فهمیدن این است که آیا یک عادت جدید کار میکند.
- نقلقولها را بخوانید. عبارتهای نقلشده در بازخورد شما همانهایی هستند که ارزیابها به آنها واکنش دادند. آنها کلمات مشخصی هستند که باید تغییر دهید.
سوالات متداول
نمره اسپیکینگ Prepamigo چقدر دقیق است؟ روی 48 پاسخ نادیده با نمرههای تأییدشده: 81% در باند دقیق، 92% در فاصله یک واحد، یکسان در سه اجرا. بر اساس باند: 88% پایین، 85% میانی، 71% بالا.
آیا همان نمره واقعی من است؟ هیچ ابزار تمرینی نمیتواند آن را تعهد کند. آنچه اندازه میگیریم این است که موتور چند بار روی همان پاسخ با نمرهای تأییدشده موافق است. نمره خودتان را بهعنوان سطحی با جهت بخوانید، و به الگو در چند تلاش نگاه کنید.
چرا روی پاسخی که فکر میکردم عالی است 8 گرفتم؟ این بزرگترین خطای باقیمانده موتور است: یک 8 از هر چهار واقعاً یک 10 بود. همان تسک را دوباره ضبط کنید. یک 10 پیوسته در چند تلاش یک 10 است.
آیا همان ضبط دو بار همان نمره را میگیرد؟ 87.5% یکسان در سه اجرا؛ فقط 4.2% دو واحد یا بیشتر حرکت کردند، همه روی مرزهای باند.
برای دیدن اینکه موتور مرحلهبهمرحله چگونه کار میکند، بخوانید درون Scoring Engine 2.0. برای دیدن همان آزمون اجراشده روی GPT، Claude و Gemini، بخوانید کدام هوش مصنوعی اسپیکینگ CELPIP را دقیقتر نمره میدهد. یا ضبط پاسخ کنید و اعداد را خودتان ببینید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.
