Prepamigo Writing Scoring Engine در برابر مدلهای پیشرفته در نقش ارزیاب
سهم پاسخهای رایتینگ CELPIP که نمرهشان با نمره مستقل تأییدشده مطابقت داشت. 36 انشای رسمی، بهطور مساوی در سطحهای ضعیف، میانی و قوی و در هر دو تسک رایتینگ. به هر مدل تسک و انشا داده شد و با کلماتی ساده از آن خواسته شد در مقیاس CELPIP نمره بدهد.
86%
Prepamigo Writing Scoring EnginePrepamigo
78%
GPT 5.6 solOpenAI
69%
GPT 5.6 lunaOpenAI
61%
GeminiGoogle
61%
Claude Opus 5Anthropic
58%
GPT-4o miniOpenAI
56%
Claude Sonnet 5Anthropic
مقایسه Prepamigo با پرطرفدارترین طرحهای چتبات
بر اساس دلار کانادا. قیمتهای Prepamigo شامل مالیات است. Claude Max (از US$100) و ChatGPT Pro (US$200) با نرخ 1.38 و پیش از مالیات تبدیل شدهاند. دقت، سهم 36 نوشته رسمی است که وقتی از مدل نامبرده با کلماتی ساده درخواست امتیازدهی به نوشته میشود، در سطح تأییدشده امتیاز میگیرند؛ یک اجرا.
نمرهدهنده رایتینگ Prepamigo روی 86% از انشاهای رسمی CELPIP با نمرههای تأییدشده مطابقت داشت، جلوتر از هر مدل پیشرفتهای که همین کار به آن سپرده شد، و در سطح میانی، جایی که بیشتر داوطلبان هستند، هر انشا را درست نمره داد.
این صفحه Prepamigo Writing Scoring Engine را معرفی میکند، سیستمی که هر ایمیل و پاسخ نظرسنجی نوشتهشده در Prepamigo را نمره میدهد. این یک مدل عمومی نیست که از آن خواسته باشند نمره بدهد. یک نمرهدهنده است که برای یک کار ساخته شده: قرار دادن یک پاسخ رایتینگ CELPIP در همان سطحی که یک ارزیاب آموزشدیده آن را قرار میداد، و توضیح آن جایگاه با کلمات خود نویسنده.
نتیجه، ارزیابی است که از هر مدل پیشرفتهای که به شیوه یک دانشآموز از آن استفاده شود دقیقتر است. روی 36 پاسخ رایتینگ رسمی CELPIP با نمرههای مستقل تأییدشده، موتور در 86% مواقع به سطح درست رسید. وقتی با کلماتی ساده از مدلها خواسته شد همان انشاها را نمره بدهند، GPT 5.6 sol به 78% رسید. GPT 5.6 luna به 69%، Gemini و Claude Opus 5 به 61%، GPT-4o mini به 58%، و Claude Sonnet 5 به 56% رسیدند.
دقت بیشترین اهمیت را جایی دارد که داوطلبان واقعاً هستند. 7 یا 8 رایجترین نمره واقعی رایتینگ است، و همان نمرهای است که تعیین میکند هدف محقق شده یا نه. موتور هر دوازده انشای سطح میانی را داخل همان بازه قرار داد. بهترین مدل پیشرفته نُهتا را قرار داد؛ Claude Opus 5 سهتا را. این صفحه توضیح میدهد موتور چگونه نمره میدهد، در مقایسه چگونه است، چه چیزی در بازخوردی که با هر نمره میآید تازه است، و تمرین بدون شمارش چقدر هزینه دارد.
دقت در برابر نمرههای تأییدشده
سؤالی که برایمان اهمیت دارد ساده است. وقتی یک دانشآموز انشایی را ارسال میکند، آیا نمره روی صفحه با نمرهای که یک ارزیاب آموزشدیده میداد مطابقت دارد؟ برای پاسخ به آن از مجموعهای از پاسخهای رایتینگ رسمی CELPIP استفاده کردیم، هرکدام با نمرهای که بهطور مستقل تأیید شده بود، پوششدهنده هر دو تسک رایتینگ و بهطور مساوی تقسیمشده میان سطحهای ضعیف، میانی و قوی: دوازده انشا در هر سطح، در مجموع 36. شش انشای نمونهای که موتور برای کالیبراسیون استفاده میکند در میان آنها نیستند.
هر سیستم همان تسک را دید، شامل نکات الزامی برای تسک ایمیل و گزینهها برای تسک نظرسنجی، و همان انشا را. به هر مدل پیشرفته گفته شد یک ممتحن باتجربه رایتینگ CELPIP است و از آن یک نمره از 0 تا 12 خواسته شد. موتور همانطور که در محیط عملیاتی کار میکند اجرا شد. نمرهای درست است که داخل سطح تأییدشده بیفتد: 4 یا 5 برای یک انشای ضعیف، 7 یا 8 برای یک انشای میانی، 10 تا 12 برای یک انشای قوی.
۳۷٪
خطای کمتر نسبت به GPT 5.6 sol
5 نمره اشتباه از 36، در برابر 8.
۶۴٪
خطای کمتر نسبت به Claude Opus 5
5 نمره اشتباه از 36، در برابر 14.
۱۰۰٪
از انشاهای سطح میانی درست نمرهدهی شدند
بهترین مدلهای دیگر: 75%. Claude Opus 5: 25%.
سه نکته برجسته است. اول، فاصله با بهترین مدل پیشرفته هشت واحد است، که روی 36 انشا یعنی سه نمره درست بیشتر، و در هر اجرای تکراری هم پابرجا ماند. دوم، فاصله با مدلهای Claude 25 تا 30 واحد است، و در میانه مقیاس متمرکز شده، جایی که یک مدل عمومی یک انشای تمیز و کلیگو را قوی میخواند. سوم، این مقایسه همانی است که برای یک دانشآموز اهمیت دارد: چیزی را اندازه میگیرد که وقتی انشایی را در یک چتبات وارد میکنید و میپرسید میگیرید، که همان روشی است که تقریباً همه از این مدلها استفاده میکنند.
| سیستم | همه انشاها | ضعیف | میانی | قوی |
|---|---|---|---|---|
| Prepamigo Writing Scoring Engine | 86% | 75% | 100% | 83% |
| GPT 5.6 sol | 78% | 83% | 75% | 75% |
| GPT 5.6 luna | 69% | 83% | 58% | 67% |
| Gemini | 61% | 58% | 42% | 83% |
| Claude Opus 5 | 61% | 67% | 25% | 92% |
| GPT-4o mini | 58% | 83% | 67% | 25% |
| Claude Sonnet 5 | 56% | 50% | 33% | 83% |
سهم انشاهایی که داخل سطح تأییدشده نمره گرفتند، یک اجرا. دوازده انشا در هر سطح، پس هر انشا در نمای هر سطح حدود هشت واحد و در مجموع سه واحد ارزش دارد.
عملکرد در هر سطح
میانگین پنهان میکند خطاها کجا میافتند. در رایتینگ، برای یک مدل عمومی خطاها در دو جا میافتند: میانه، جایی که یک انشای تمیز اما کلیگو قوی خوانده میشود، و بالا، جایی که یک انشای قوی با یک لغزش در 9 نگه داشته میشود.
انشاهای ضعیف · نمره تأییدشده 4 یا 5
12 انشای رسمی برای هر سیستم.
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
Prepamigo Writing Engine
67%
Claude Opus 5
58%
Gemini
50%
Claude Sonnet 5
انشاهای میانی · نمره تأییدشده 7 یا 8
12 انشای رسمی برای هر سیستم. سطحی که بیشتر داوطلبان در آن هستند.
100%
Prepamigo Writing Engine
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
42%
Gemini
33%
Claude Sonnet 5
25%
Claude Opus 5
انشاهای قوی · نمره تأییدشده 10 یا بالاتر
12 انشای رسمی برای هر سیستم. تقریباً هر خطا یک 9 است.
92%
Claude Opus 5
83%
Prepamigo Writing Engine
83%
Gemini
83%
Claude Sonnet 5
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
در انشاهای ضعیف، مدلهای GPT روی 83% هستند و موتور روی 75%. هر سه خطای موتور یک پله بالاتر رفتند، به 6 یا 7، در انشاهایی که کوتاه اما مرتب بودند؛ خطاهای مدلهای Claude در جهت مخالف رفتند و به انشاهای کممایه نمره 3 دادند. رایتینگ ضعیف، انتهای آسان مقیاس برای هر کسی است، و این تنها سطحی است که یک چتبات میتواند با موتور برابر شود یا از آن جلو بزند.
در میانه، موتور بهتنهایی روی 100% است. GPT 5.6 sol سه انشا از دوازدهتا را به 6 پایین کشید. Claude Opus 5 هفت انشا از دوازدهتا را به 9 یا 10 بالا برد. Gemini پنجتا را بالا برد. یک انشای سطح میانی تسک را پوشش میدهد، سازمانیافته است و در عین حال کلیگو است؛ مدلی که چیزی برای مقایسه ندارد آن را بر اساس برداشت میخواند، و برداشت از مدلی به مدل دیگر فرق میکند. موتور آن را در برابر یک 7 واقعی نمرهگذاریشده میخواند.
در بالا، Claude Opus 5 بهترین ارزیاب این آزمون است، با شناسایی یازده انشای قوی از دوازدهتا در برابر دهتای موتور. Claude دستودلباز است، که در انشاهای قوی درست است و در هر چیز دیگری اشتباه. GPT-4o mini به نُهتا از دوازدهتا نمره 9 داد: این مدل 10 نمیدهد.
ثبات و پایداری
ارزیابی که بتوان به آن اعتماد کرد باید دو بار همان پاسخ را بدهد. پس از اجرای اصلی، هر 36 انشا را دو بار دیگر در روزهای مختلف نمره دادیم. موتور 86%، 89% و 86% گرفت، با همان دوازده انشای سطح میانی داخل بازه در هر بار و بدون اینکه هیچ انشایی میان اجراها بیش از یک واحد جابهجا شود. GPT 5.6 sol در همان سه روز 78%، 83% و 81% گرفت.
موتور، مدل نمرهدهی را با استدلال خاموش و در دمای ثابت اجرا میکند، و همین است که عدد را تکرارپذیر میکند. یک پاسخ تکی از چتبات چند واحد شانس در هر دو جهت با خود دارد؛ نمرهای که در روزهای مختلف پایدار است، نمرهای است که میتوانید بر اساس آن برنامهریزی کنید.
دو تسک، دو نوع اشتباه
رایتینگ CELPIP دو تسک دارد، و به شیوههای متفاوتی شکست میخورند. تسک ایمیل یک موقعیت و سه یا چهار نکته که باید پوشش دهید به شما میدهد. تسک نظرسنجی دو گزینه به شما میدهد و از شما میخواهد یکی را انتخاب کنید و از آن دفاع کنید. ارزیابی که با هر دو یکسان رفتار کند، درباره هر دو اشتباه خواهد کرد.
در تسک ایمیل، موتور روی 89% انشاها درست بود. اشتباههایی که اینجا بیشترین هزینه را برای داوطلبان دارند گرامر نیستند؛ یک نکته ازقلمافتاده، لحنی که با خواننده جور نیست، یا شروع و پایانی که وجود ندارد. لایه قواعد هر یک از اینها را پیش از آنکه ارزیاب نظر بدهد بررسی میکند، و یک نکته ازقلمافتاده، هرقدر هم انگلیسی صیقلخورده باشد، نمره انجام تسک را در 8 یا پایینتر نگه میدارد. چتباتی که با کلماتی ساده از آن نمره خواسته شده نمیداند کدام نکات الزامی بودند مگر اینکه آنها را وارد کنید، و حتی در آن صورت هم بهندرت آنها را یکییکی بررسی میکند.
در تسک نظرسنجی، موتور روی 83% انشاها درست بود. تسک نظرسنجی به یک موضع روشن و دو دلیل پرورشیافته پاداش میدهد، و پاسخی را که اینپاوآنپا میکند جریمه میکند. موتور اول موضع را میخواند: پاسخی که هرگز تعهد نمیدهد نمیتواند در انجام تسک بالاتر از میانه نمره بگیرد. چتباتها گرایش دارند به پاسخ متعادل پاداش بدهند، که در یک پاسخ نظرسنجی اشتباه است.
نکته یک ارزیاب تسکآگاه این است که نمره بازتاب چیزی است که یک ارزیاب در آن تسک به آن واکنش نشان میداد، نه یک برداشت کلی از انگلیسی. یک ایمیل سطح میانی معمولاً بهخاطر نکته سوم کممایه، ایمیل سطح میانی است؛ یک پاسخ نظرسنجی سطح میانی معمولاً به این خاطر است که دلیلی ادعا شده ولی پرورش نیافته. موتور به شما میگوید کدامیک، با نام.
جایی که موتور بهترین نیست
موتور در مجموع و در میانه پیشتاز است. در هر دو انتها پیشتاز نیست، و منصفانهتر است این را بگوییم تا اینکه آن را پشت یک میانگین پنهان کنیم.
در انشاهای ضعیف، هر سه مدل GPT 83% گرفتند در برابر 75% موتور. خطاهای موتور همگی یک پله بالاتر بودند، در انشاهای کوتاه و مرتبی که چیزی را پرورش نداده بودند. یک مدل GPT، که نوشته کلیگو را ضعیف میخواند، اینها را درست میگیرد. اگر در سطح ضعیف هستید و فقط تأیید همین را میخواهید، GPT 5.6 sol کمی بیشتر مواقع آن را به شما خواهد داد. همچنین، سه بار از دوازده بار، به یک نویسنده سطح میانی خواهد گفت که 6 است.
در انشاهای قوی، Claude Opus 5 92% گرفت در برابر 83% موتور. Claude نوشته صیقلخورده را دستودلبازانه میخواند، که در یک انشای قوی درست است. همین دستودلبازی به هفت انشا از دوازده انشای سطح میانی 9 یا 10 داد. اگر همین حالا در سطح قوی مینویسید، Claude Opus 5 کمی بیشتر از موتور آن را تأیید خواهد کرد. اگر نه، این همان مدلی است که بیش از همه احتمال دارد به شما بگوید که هستید.
موتور تنها ارزیاب این آزمون است که در هر سطح در فاصله ده واحدی از پیشتاز قرار دارد، و تنها ارزیابی که در میانه روی 100% است. این همان پروفایلی است که یک داوطلب نیاز دارد: ارزیابی که در یک سطح درخشان و در سطح دیگر اشتباه نباشد، بلکه تقریباً همهجا درست باشد و درست همانجایی که بیشتر داوطلبان هستند.
موتور چگونه یک پاسخ را نمره میدهد
این چیزی است که در حدود یک دقیقه میان زدن دکمه ارسال و خواندن نمره اتفاق میافتد.
- لایه قواعد اول انشا را میخواند. پیش از آنکه هیچ مدلی آن را ببیند، موتور کلمات را میشمارد، ایمیل را برای سلام و خداحافظی بررسی میکند، پاسخ نظرسنجی را برای یک انتخاب روشن بررسی میکند، و انشا را با نکات الزامی در صورتسؤال تطبیق میدهد. این بررسیها به محدودیتهای سختی تبدیل میشوند که ارزیاب نمیتواند از آنها عبور کند: پاسخ نظرسنجیای که هرگز یک طرف را انتخاب نمیکند، یا ایمیلی که شبیه یک پاسخ نظرسنجی خوانده میشود، نمیتواند در انجام تسک بالاتر از میانه مقیاس نمره بگیرد.
- انشا با نمونههای واقعی نمرهگذاریشده مقایسه میشود. ارزیاب سه پاسخ واقعی CELPIP به همان نوع تسک را میبیند، یکی در سطح ضعیف، یکی در میانه، یکی در بالا، همه با لغزشهای واقعی خودشان، و انشا را نسبت به آنها در هر یک از چهار بُعد قرار میدهد: محتوا و انسجام، واژگان، خوانایی، انجام تسک. قابلمقایسه با نمونه میانی یعنی 7 یا 8؛ قابلمقایسه با نمونه بالا یعنی 10 یا 11؛ بهوضوح قویتر از نمونه بالا یعنی 12.
- هر قضاوت به شواهد نیاز دارد. برای هر بُعد، ارزیاب باید پیش از دادن نمره، عبارتهایی از انشا را که نمره را پشتیبانی میکنند نقل کند. نقلقولهایی که در انشا پیدا نشوند کنار گذاشته میشوند.
- نکات ازقلمافتاده سقف نمره را تعیین میکنند. اگر ارزیاب گزارش دهد که یک نکته الزامی جا افتاده، نمره انجام تسک در 8 یا پایینتر نگه داشته میشود، تا عدد و بازخورد با هم همخوان باشند.
- چهار بُعد به یک نمره تبدیل میشوند. نمره کلی میانگین چهار بُعد است، پس از اعمال محدودیتهای لایه قواعد.
- بازخورد از همان شواهد ساخته میشود. اصلاحات، یک پاسخ نمونه با طول مناسب، نکات ازقلمافتاده با نام و یک عامل محدودکننده برای هر بُعد، همه نقلشده از متن خود نویسنده. بخش پایین فهرست میکند چه چیزی تغییر کرده.
همچنین انتقال موتور به طراحی دو ارزیاب با رأیگیری و تطبیق را که نمرهدهنده اسپیکینگ ما استفاده میکند آزمایش کردیم. به رایتینگ کمکی نکرد: سطحهای رسمی رایتینگ در مقیاس 0 تا 12 نزدیکتر از سطحهای اسپیکینگ به هم نشستهاند، و وادار کردن ارزیاب به انتخاب میان نمونهها بدون گزینهای در میانه، انشاهای سطح میانی را به 9 هل داد. موتور رایتینگ طراحیای را نگه میدارد که میانه را درست نمره میدهد.
چه چیزی در بازخورد رایتینگ شما تازه است
نمره فقط نیمی از چیزی است که دریافت میکنید. لایه بازخورد رایتینگ همراه با نمرهدهنده از نو ساخته شده، و همهچیز در آن به متن خود شما گره خورده است. اینها چیزهایی است که تغییر کرده.
- اصلاحهایی که میتوانید در نوشته خودتان پیدا کنید. هر اصلاح گرامری، املایی و واژگانی دقیقاً همان کلمات پاسخ شما را نقل میکند، تا اپ بتواند آنها را همانجا که نوشتهاید برجسته کند. هر چیزی که بررسیکننده نتواند کلمهبهکلمه در نوشته شما پیدا کند، پیش از آنکه ببینید حذف میشود.
- یک پاسخ نمونه، ساختهشده از پاسخ خودتان. نسخهای بازنویسیشده از پاسخ خودتان دریافت میکنید که ایدههای شما را حفظ میکند، همه نکتههای الزامی را پوشش میدهد و در بازه 150 تا 200 کلمهای که تسک میخواهد قرار میگیرد. اگر بازنویسی اول به این طول نرسد، پیش از نمایش یک بار دیگر انجام میشود.
- نکته الزامیای که از قلم انداختید، با نام. برای تسک ایمیل، بازخورد نکتههایی از صورت سؤال را که پاسخ شما پوشش نداده فهرست میکند. یک نکته جاافتاده همچنین نمره انجام تسک را در 8 یا پایینتر نگه میدارد، بنابراین عدد و بازخورد هرگز با هم ناسازگار نمیشوند.
- یک عامل محدودکننده برای هر بُعد. برای هر یک از چهار بُعد، بازخورد آن یک چیزی را که نمره را پایین نگه داشته، بهطور مشخص نام میبرد، یا بهصراحت میگوید هیچ چیزی مانع نیست و چه چیزی آن نمره را بالا نگه داشته است. اینکه تصمیم گرفته شود یک بُعد مشکلی ندارد، خودش یک پاسخ واقعی است، نه یک جای خالی.
- انتقاد در جای درست. لحن ضعیف مشکلِ انجام تسک است، انتخاب واژه مبهم مشکلِ واژگان است، جمله بیپایان مشکلِ خوانایی است. هر نکته زیر همان بُعدی ثبت میشود که به آن تعلق دارد، بهجای اینکه همه در خلاصه کلی روی هم ریخته شوند.
- بازنویسی در سطح جمله. جملههای مشخصی از نوشته شما با یک نسخه بهبودیافته و یک خط توضیح درباره اینکه چرا بهتر است برمیگردند، تا تغییر را ببینید نه اینکه فقط دربارهاش بخوانید.
- قویترین و ضعیفترین بُعد شما، کنار هم. بازخورد به شما میگوید کدام یک از چهار بُعد نمره شما را بالا نگه داشته و کدام آن را پایین میکشد، تا بدون رمزگشایی چهار عدد بدانید بعد از این چه چیزی را تمرین کنید.
هر نقلقول در بازخورد پیش از نمایش با نوشته شما مطابقت داده میشود. اگر بررسیکننده نتواند آن کلمات را پیدا کند، آن خط حذف میشود. به همین دلیل بازخورد هرگز از شما نمیخواهد چیزی را اصلاح کنید که ننوشتهاید.
با نمره چه کنید
نمرهای که بتوان به آن اعتماد کرد، شیوه تمرین شما را تغییر میدهد. با یک چتبات، هرگز مطمئن نیستید حرکت از 8 به 9 کار شماست یا کار مدل، پس هر نمره باید با یک حس سنجیده شود. با یک ارزیاب پایدار و دقیق، خود نمره بازخورد است.
- همان تسک را دو بار بنویسید. ارسال کنید، نکات ازقلمافتاده و عامل محدودکننده هر بُعد را بخوانید، با پاسخ نمونه در کنارتان بازنویسی کنید، و دوباره ارسال کنید. تغییر یک واحد یا بیشتر میان این دو، تغییری در رایتینگ شماست، چون موتور به همان انشا همان نمره را میدهد.
- ضعیفترین بُعد را دنبال کنید، نه مجموع را. نمره کلی میانگین چهار بُعد است. دو داوطلب با نمره 8 میتوانند مشکلات کاملاً متفاوتی داشته باشند. بازخورد بُعدی را که شما را عقب نگه داشته نام میبرد، و همان است که باید روی آن کار کنید.
- 9 را یک خطای نزدیک بدانید. هر دو خطای موتور در انشاهای قوی یک 9 بودند. یک 9 از موتور یعنی یک دلیل پرورشیافته یا یک انتخاب واژه دقیق تا 10 فاصله دارید.
- تسکها را نوبتی انجام دهید. بیشتر داوطلبان تسکی را تمرین میکنند که دوست دارند. موتور پاسخهای ایمیل و نظرسنجی را در برابر نمونههای متفاوت و قواعد متفاوت نمره میدهد، پس نمره قوی در ایمیل چیزی درباره پاسخ نظرسنجی شما نمیگوید.
تمرین نامحدود با CA$25 در ماه
دقت فقط وقتی مفید است که بتوانید هرروز از آن استفاده کنید. یک نمره رایتینگ قابلاعتماد بیشترین ارزش را در سیامین انشای شما دارد، نه سومین، چون آنجاست که شروع میکند به شما بگوید آیا تغییری در نحوه نوشتنتان واقعاً کار میکند. پس موتور را قیمتگذاری کردیم تا بدون شمارش استفاده شود.
هر طرح Prepamigo شامل نمرهدهی نامحدود، تلاشهای نامحدود، و بانک کامل سوال است: 80 مجموعه تمرینی کامل و بیش از 2,000 تمرین در Writing، Speaking، Reading و Listening، نوشتهشده برای پیروی از انواع تسک، زمانبندی و قالب آزمون CELPIP General. مینویسید، ارسال میکنید، و حدود یک دقیقه بعد نمره، اصلاحات و یک پاسخ نمونه دارید.
Prepamigo
CA$25/ ماه
CA$24.98 ماهانه · CA$8.25 در ماه در طرح سالانه (CA$98.98 در سال) · شامل مالیات · لغو در هر زمان
- نمرهدهی نامحدود برای رایتینگ و اسپیکینگ، بدون سقف روزانه، جلسهای یا هفتگی.
- 80 مجموعه تمرینی و بیش از 2,000 تمرین در هر چهار بخش، بر اساس قالب واقعی آزمون، پس هرگز مجبور نیستید دستور خودتان را بنویسید.
- بنویس و ارسال کن. نمرهدهی، اصلاحات، بررسی نکات ازقلمافتاده و پاسخ نمونه برایتان انجام میشود.
- بازخورد با کلمات خودتان، با هر نقلقول بررسیشده در برابر آنچه واقعاً نوشتهاید.
Claude Max، برای مقایسه
US$100/ ماه
حدود CA$138 پیش از مالیات · سطح 20x با US$200 در ماه · Pro با US$20 با سقفهای بسیار سختتر
- حتی Max هم محدود است. یک بازه استفاده پنجساعته چرخشی و یک سقف هفتگی؛ وقتی به هرکدام برسید، باید صبر کنید.
- بدون بانک سوال. تسکهای خودتان را میآورید، خودتان تصمیم میگیرید آیا شبیه آزمون واقعی هستند، و خودتان ردیابی میکنید چه چیزی را قبلاً تمرین کردهاید.
- بدون بررسی نکات الزامی، بدون پاسخ نمونه. یک عدد و یک پاراگراف میگیرید.
- یک درخواست ساده، نه یک ارزیاب کالیبرهشده. وقتی بهسادگی پرسیده شد، Claude Opus 5 در 61% مواقع و Claude Sonnet 5 در 56% مواقع با نمرههای تأییدشده مطابقت داشتند، در برابر 86% برای موتور.
قیمتها و شرایط استفاده طرحهای Claude همانطور که در سپتامبر 2026 در claude.com منتشر شدهاند و ممکن است تغییر کنند. CELPIP علامت تجاری صاحب آن است؛ Prepamigo یک پلتفرم تمرین مستقل است و به سازنده آزمون وابسته نیست، مورد تأیید آن نیست و ارتباطی با آن ندارد. تمرینهای Prepamigo مطالب اصلی نوشتهشده برای پیروی از قالب عمومی آزمون هستند.
دسترسپذیری
Prepamigo Writing Scoring Engine اکنون برای همه کاربران Prepamigo در هر دو تسک رایتینگ فعال است. چیزی برای فعالکردن وجود ندارد. هر ایمیل و پاسخ نظرسنجی توسط آن نمره میگیرد، و هر نمره با بازخوردی همراه است که از متن خود نویسنده گرفته شده.
برای مقایسههای رودررو، بخوانید Prepamigo در برابر Claude برای رایتینگ و Prepamigo در برابر ChatGPT برای رایتینگ. برای بخش اسپیکینگ، بخوانید Scoring Engine 2.0 برای اسپیکینگ. یا نوشتن پاسخ کنید و اجرای موتور را تماشا کنید. برای نسخه انگلیسی این مطلب، این راهنما را به انگلیسی بخوانید.
