محرك Prepamigo Scoring Engine 2.0 مقارنةً بالنماذج المتقدمة كمقيّمين
نسبة إجابات المحادثة التي تطابقت درجتها مع الدرجة الموثّقة بشكل مستقل. 48 إجابة لم ترها الأنظمة من قبل، موزّعة بالتساوي على الدرجات المنخفضة والمتوسطة والعليا. أُعطي كل نموذج النص المكتوب وطُلب منه، بكلمات بسيطة، تقييمه على مقياس CELPIP؛ متوسط ثلاث محاولات.
81%
Prepamigo Scoring Engine 2.0Prepamigo
62%
Claude Opus 5Anthropic
58%
GeminiGoogle
45%
Claude Sonnet 5Anthropic
45%
GPT-4o miniOpenAI
37%
GPT 5.5OpenAI
35%
GPT 5.6 solOpenAI
31%
GPT 5.6 lunaOpenAI
Prepamigo مقارنةً بأشهر باقات روبوتات المحادثة
بالدولار الكندي. أسعار Prepamigo شاملة الضريبة. تم تحويل Claude Max (بدءًا من US$100) و ChatGPT Pro (US$200) بسعر 1.38، قبل الضريبة. الدقة هي نسبة الإجابات في مجموعة الاختبار المحجوزة التي حصلت على الدرجة الصحيحة عند طلب تقييمها من النموذج المذكور بكلمات بسيطة؛ وهي متوسط ثلاث محاولات.
أدق مقيّم محادثة لدينا حتى الآن. في إجابات لم يرها من قبل، تطابق Prepamigo Scoring Engine 2.0 مع الدرجات الموثّقة في 81% من الحالات، متقدمًا على كل نموذج متقدم اختبرناه في نفس المهمة، وخطوة واضحة إلى الأمام عن Engine 1.0، المقيّم الذي يحل محله.
نُطلق اليوم Prepamigo Scoring Engine 2.0 للمحادثة، النظام الذي يقيّم كل إجابة محادثة تدريبية على Prepamigo. يمثّل Engine 2.0 إعادة تصميم كاملة لطريقة التقييم. بدلًا من تمريرة تقييم واحدة، يستخدم مقيّمين مستقلين يقارنان كل إجابة مباشرة بأمثلة معايَرة، ويصوّتان عدة مرات، ويوفّقان بين إجابتيهما قبل عرض الدرجة.
النتيجة مقيّم أدق بكثير من أي نموذج متقدم يُستخدم بالطريقة التي يستخدمها الطالب. على مجموعة من إجابات محادثة حقيقية محجوزة بدرجات موثّقة بشكل مستقل، حصل Engine 2.0 على الدرجة الصحيحة في 81% من الحالات. عند الطلب بكلمات بسيطة لتقييم نفس النصوص، بلغ أقواها، Claude Opus 5، نسبة 62%. بلغ Gemini نسبة 58%. وبلغ Claude Sonnet 5 وGPT-4o mini نسبة 45%، وGPT 5.5 نسبة 37%، وGPT 5.6 sol نسبة 35%، وGPT 5.6 luna نسبة 31%. وعندما أعطينا كل نموذج إجراء Engine 2.0 الخاص بنا، مع أمثلة معايرة حقيقية لكل مهمة، ارتفع أفضلها إلى 77% وبقي متأخرًا.
الدقة تهم أكثر حيث يكون تحقيقها أصعب. يتعرّف Engine 2.0 على الإجابة من المستوى الأعلى في 71% من الحالات. عند الطلب البسيط، لم يتعرّف أي نموذج آخر على أكثر من 56%، وتراوحت نماذج GPT بين 13% و27%. يقاوم Engine 2.0 أيضًا أكثر خلل شائع في المقيّمين الآليين: الدرجات التي تنحرف منخفضة ونحو وسط المقياس بغض النظر عن قوة الإجابة أو ضعفها فعليًا. كان ذلك الانحراف أكبر نقطة ضعف رأيناها في Engine 1.0.
Engine 2.0 أسرع، وأكثر اتساقًا، ويُصدر ملاحظات تقتبس كلمات الطالب بنفسها. وهو متاح اليوم لكل مستخدمي Prepamigo. توضّح هذه الصفحة ما يفعله، وكيف قسنا أدائه، وأين حدوده الحالية.
الدقة مقابل الدرجات الموثّقة
السؤال الذي يهمنا بسيط. عندما يسجّل الطالب إجابة، هل تتطابق الدرجة على الشاشة مع الدرجة التي سيعطيها مقيّم موثوق؟ للإجابة عن ذلك بنينا مجموعة اختبار من إجابات محادثة حقيقية تغطي جميع أنواع مهام المحادثة الثمانية، كل واحدة بدرجة موثّقة بشكل مستقل، وقسّمنا المجموعة بالتساوي على المستويات المنخفضة والمتوسطة والعليا حتى لا يسيطر مستوى واحد على النتيجة.
تستخدم المقارنة 48 من تلك الإجابات التي جُنّبت منذ البداية. لم يستخدمها أحد في الفريق أثناء بناء أو ضبط Engine 2.0. جرى تفريغ كل إجابة كلمة بكلمة. ثم قيل لكل نموذج إنه ممتحن CELPIP خبير، وأُعطي نص المهمة والنص المكتوب، وطُلب منه تقييم الإجابة من 0 إلى 12، ثلاث مرات، في أيام مختلفة. أخذنا متوسط المحاولات الثلاث وعددنا مرات تطابق الدرجة مع مستوى الدرجة الموثّقة.
51%
أخطاء أقل من Claude Opus 5
19 درجة خاطئة لكل 100 إجابة، مقابل 38.
71%
أخطاء أقل من GPT 5.6 sol
19 درجة خاطئة لكل 100، مقابل 65.
71%
من الإجابات من المستوى الأعلى معروفة بشكل صحيح
أفضل النماذج الأخرى يتعرّف على 56%؛ يتعرّف GPT 5.6 sol على 25%.
تبرز ثلاثة أمور في هذه الأرقام. أولًا، الفجوة ليست صغيرة. تسع عشرة نقطة مقابل أقوى نموذج متقدم وستّ وأربعون مقابل النموذج الذي يقف خلف باقات ChatGPT المدفوعة، في اختبار من 48 إجابة، هي الفرق بين تسع وعشرين ودرجة صحيحة إضافية. ثانيًا، الفجوة ليست نتاج اختبار ودّي. اختيرت الـ48 إجابة قبل اكتمال تصميم Engine 2.0 ولم تُلمس أثناء التطوير. ثالثًا، المقارنة هي التي تهم الطالب فعليًا: إنها تقيس ما تحصل عليه عندما تلصق نصًا في روبوت محادثة وتطلب، وهي الطريقة التي يستخدم بها الجميع تقريبًا هذه النماذج.
كلمة عن معنى «صحيح» هنا. الدرجات الموثّقة على هذا المقياس تأتي في مستويات وليست نقاطًا مفردة، فنحن نعدّ الدرجة صحيحة عندما تقع داخل المستوى الموثّق. الإجابة الموثّقة عند المستوى الأعلى، مثلاً، تُعدّ مصنّفة بشكل صحيح إن أعطاها المحرك 9 أو 10 أو 11. وبقراءة أكثر تشددًا لا تقبل إلا 10 فأعلى، يفقد كل نظام بعض النقاط ولا يتغيّر الترتيب.
| النظام | طلب بسيط | مع إجرائنا الكامل |
|---|---|---|
| Prepamigo Scoring Engine 2.0 | 81.3% | — |
| Claude Opus 5 | 61.8% | 77.1% |
| Gemini | 58.3% | 70.8% |
| Claude Sonnet 5 | 45.1% | 68.8% |
| GPT-4o mini | 45.1% | 50.0% |
| GPT 5.5 | 36.8% | 68.8% |
| GPT 5.6 sol | 35.4% | 70.8% |
| GPT 5.6 luna | 30.6% | 62.5% |
الأداء عند كل مستوى درجة
يمكن لرقم دقة إجمالي أن يخفي الكثير. المقيّم الممتاز على الإجابات الضعيفة والعاجز على القوية قد يُظهر رقمًا مقبولًا بينما يخذل الطلاب الذين هم بأشد الحاجة إلى إجابة دقيقة. لذا نُبلغ عن الدقة بشكل منفصل لكل من المستويات الثلاثة في مجموعة الاختبار: درجات منخفضة من 4 أو 5، ودرجات متوسطة من 7 أو 8، ودرجات عليا من 10 فأعلى.
معظم المقيّمين، البشر أو الآلات، ينحرفون نحو الوسط. تحصل الإجابة القوية على 8 بدلاً من 10. تحصل الإجابة الضعيفة على 6 بدلاً من 5. مع غياب أي شيء للمقارنة، تضيف النماذج المتقدمة عادة ثانية: تنحرف نحو الأسفل، حتى تُقيَّم الإجابة الضعيفة غالبًا بدرجة 3 والقوية بدرجة 7. بُني Engine 2.0 خصيصًا لمقاومة كلا الانحرافين، وتظهر النتائج ذلك بوضوح أكبر عند قمة المقياس.
الدرجات المنخفضة · الدرجة الموثّقة 4 أو 5
16 إجابة من مجموعة الاختبار المحجوزة لكل نظام، طلب بسيط، متوسط ثلاث محاولات.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
75%
GPT-4o mini
56%
Gemini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
44%
Claude Sonnet 5
الدرجات المتوسطة · الدرجة الموثّقة 7 أو 8
16 إجابة من مجموعة الاختبار المحجوزة لكل نظام، طلب بسيط، متوسط ثلاث محاولات.
85%
Prepamigo Engine 2.0
63%
Gemini
63%
Claude Sonnet 5
58%
Claude Opus 5
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
الدرجات العليا · الدرجة الموثّقة 10 فأعلى
16 إجابة من مجموعة الاختبار المحجوزة لكل نظام، طلب بسيط، متوسط ثلاث محاولات. معظم الزلات تقريبًا هي درجة 7 أو 8.
71%
Prepamigo Engine 2.0
56%
Gemini
50%
Claude Opus 5
29%
Claude Sonnet 5
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
عند المستوى المنخفض، يتصدر Engine 2.0 بنسبة 88%، وClaude Opus 5 بنسبة 77%، وGPT-4o mini بنسبة 75%. كل نموذج آخر عند نحو النصف، وClaude Sonnet 5 عند 44%. الزلة غالبًا هي درجة 3: يرى النموذج إجابة ضعيفة ويقيّمها تحت المستوى بدلاً من فيه. الرقم المحترم لـ GPT-4o mini هنا هو أول إشارة على مشكلته، وهي أنه يقيّم كل شيء تقريبًا منخفضًا؛ عند قمة المقياس يتعرّف على إجابة واحدة من كل ست.
عند المستوى المتوسط، يتصدر Engine 2.0 بنسبة 85%. Gemini وClaude Sonnet 5 عند 63%، وClaude Opus 5 عند 58%، وبعد ذلك هاوية: GPT-4o mini عند 44% ونماذج GPT الثلاثة الأكبر عند 27% إلى 29%. تحتوي الإجابات من المستوى المتوسط على مزيج من نقاط القوة والضعف يجب وزنها بدلاً من رصدها فقط، ومع غياب ما يُقارن به، ترى نماذج GPT نقاط الضعف وتمنح درجة 5 أو 6.
عند المستوى الأعلى، تكون الفجوة أوسع ما تكون. يتعرّف Engine 2.0 بشكل صحيح على 71% من الإجابات من المستوى الأعلى. يتعرّف Gemini على 56% وOpus 5 على النصف تمامًا. خمسة من النماذج السبعة الأخرى تمنح درجة 7 أو 8 لسبع من كل عشر إجابات على الأقل تستحق درجة 10. هذا هو انحراف الوسط في أنقى صوره. الإجابة من المستوى الأعلى ليست خالية من العيوب؛ تحتوي على زلة عابرة، أو إعادة انطلاق، أو جملة عادية بين الجمل المعقدة، والمقيّم الذي يقيسها بإجابة مثالية متخيّلة يخصم لكل واحدة منها. Engine 2.0 معايَر بأمثلة تُظهر شكل الإجابة الحقيقية من المستوى الأعلى، بما فيها زلاتها، وهو مصمم صريحًا للمقارنة مع تلك الأمثلة بدلاً من الكمال.
ماذا لو أعطيناها إجراءنا الكامل؟
أرقام الطلب البسيط ليست حكمًا على مدى ذكاء هذه النماذج. إنها حكم على ما يحدث عندما يُطلب من نموذج رقم من دون ما يقارن به. فأجرينا اختبارًا ثانيًا، أعطينا فيه كل نموذج بالضبط ما يتلقاه مقيّمو Engine 2.0 الخاصون بنا: النص المكتوب، والمهمة، ومثالان حقيقيان للمعايرة عند كل مستوى لتلك المهمة بالذات، وتعليمات بتسمية أقرب مثال لكل من الأبعاد الأربعة بدلاً من إعطاء رقم. حصل كل نموذج أيضًا على ملاحظة معايرة قصيرة مصممة لنزعاته الخاصة.
مع إجرائنا الكامل: نسبة الإجابات التي حصلت على الدرجة الموثّقة
نفس 48 إجابة من مجموعة الاختبار المحجوزة. نفس النصوص والتعليمات وأمثلة المعايرة لكل نظام؛ قيّم كل نموذج كل إجابة مرة واحدة.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
71%
GPT 5.6 sol
71%
Gemini
69%
GPT 5.5
69%
Claude Sonnet 5
63%
GPT 5.6 luna
50%
GPT-4o mini
يتحسن كل نموذج، بعضها بشكل كبير. يتضاعف GPT 5.6 sol من 35% إلى 71%. يرتفع Opus 5 من 62% إلى 77%. GPT-4o mini بالكاد يتحرك، من 45% إلى 50%، لأنه يقيّم كل شيء منخفضًا بغض النظر عن ما يُعرض عليه. وكل نموذج لا يزال ينتهي خلف Engine 2.0. عند قمة المقياس تستمر الفجوة: يتوقف Opus 5 وGPT 5.6 sol وGemini وGPT 5.5 عند 63% من الإجابات من المستوى الأعلى، وSonnet 5 عند 38%، وGPT-4o mini عند صفر، مقابل 71% لـ Engine 2.0.
يوضح هذا الاختبار الثاني أين تقع القيمة الحقيقية لـ Engine 2.0 فعليًا. إنها ليست نموذجًا أذكى؛ فهو يستخدم نماذج من هذه القائمة نفسها. إنها أمثلة حقيقية عن شكل كل مستوى في كل مهمة بعينها، وسؤال يفرض على النموذج المقارنة بدلاً من التخمين، وبعد ذلك ثلاثة أمور أخرى لا يمكن لتمريرة واحدة تقديمها: مقيّمان مستقلان من مزودين مختلفين، وثلاثة تصويتات من كل منهما مع الاحتفاظ بالتصويت الأوسط، وقاعدة تسوية تأخذ الدرجة الأعلى عندما يختلف المقيّمان بشدة، لأن التحليل أظهر أن الحكم الأدنى كان تقريبًا دائمًا الحكم الخاطئ على الإجابات القوية.
الاتساق والاستقرار
المقيّم الذي يمكن الوثوق به يجب أن يكون متسقًا. إن استطاع نفس التسجيل الحصول على 8 اليوم و10 في اليوم التالي، فلا يعني أي من الرقمين شيئًا كثيرًا، ولا يستطيع الطالب معرفة هل تدريبه يُجدي. لذا، بجانب الدقة، نقيس هل يعطي Engine 2.0 الجواب نفسه عند سؤاله السؤال نفسه مرتين.
أجرينا Engine 2.0 على الـ48 إجابة المحجوزة ثلاث مرات منفصلة، في أيام مختلفة، من دون تغيير أي شيء بين المحاولات. سجّل 81.3% في كل مرة. ليس تقريبًا 81%: بل نفس 39 إجابة صحيحة من أصل 48 في كل مرة، بفارق إجابة أو أقل. عند النظر إلى الإجابات الفردية بدلاً من الإجمالي، حصلت 87.5% منها على درجة متطابقة تمامًا عبر الثلاث محاولات، ولم تتحرك سوى 4.2% منها بمقدار نقطتين أو أكثر بين المحاولات. هذه القلة هي إجابات تقع تمامًا على الحدود بين مستويين، حيث يميل فرق طفيف في التقدير بطبيعة الحال الدرجة في اتجاه أو آخر.
تحرّك اختبار الطلب البسيط على النماذج المتقدمة أكثر بكثير بين المحاولات. سجّل GPT 5.6 sol نسب 31% و40% و35% في محاولاته الثلاث؛ وسجّل Opus 5 نسب 62% و65% و58%. اطلب من روبوت محادثة تقييم النص نفسه في يومين مختلفين، وستحصل غالبًا على درجتين مختلفتين.
الاتساق يأتي من قرارين تصميميين. يصوّت كل من مقيّمي المحرك ثلاث مرات على كل إجابة ويُحتفظ بالتصويت الأوسط، وهذا يُزيل الحالة الشاذة العرضية التي تنتجها تمريرة واحدة. وتتم تسوية حكمي المقيّمين بقاعدة ثابتة بدلاً من نموذج آخر، فتُنتج نفس الحكمين نفس الدرجة النهائية دائمًا. اختُبر كلا القرارين مباشرة: بتصويت واحد بدلاً من ثلاثة، انخفض الاتساق بين المحاولات من 87.5% إلى 77.1%، وتضاعفت نسبة الإجابات المتحركة بنقطتين أو أكثر.
كيف يقيّم Engine 2.0 إجابة
Engine 2.0 ليس نموذجًا واحدًا. إنه إجراء، والإجراء هو ما يصنع الفرق. هذا ما يحدث في العشر ثوانٍ أو نحوها بين ضغط الطالب على زر الإيقاف وظهور درجة على الشاشة.
- يُفرَّغ التسجيل كلمة بكلمة. يُحتفظ بكل كلمة حشو، وكل إعادة انطلاق، وكل تصحيح ذاتي. تبيّن أن هذا أمر ضروري. عندما اختبرنا نصًا «منظّفًا» بإزالة التوقفات المتردّدة، انخفضت الدقة بخمس عشرة نقطة، لأن التوقفات المتردّدة جزء من الدليل الذي يحتاجه المقيّم للحكم على شكل الإجابة صوتيًا.
- يقرأ مقيّمان مستقلان النص المكتوب. بُنيا على نموذجين أساسيين مختلفين من مزودين مختلفين، فلا يتشاركان نقاط العمى نفسها. يتلقى كل مقيّم نص المهمة، والنص المكتوب، ومجموعة صغيرة من أمثلة المعايرة لتلك المهمة بالذات: إجابات حقيقية عند المستوى المنخفض والمتوسط والأعلى، مثالان لكل مستوى، بحيث يُعرض كل مستوى كنطاق بدلاً من نقطة واحدة.
- كل مقيّم يقارن بدلاً من أن يُصدر رقمًا. هذا هو التغيير الجوهري عن Engine 1.0. بدلاً من أن يُطلب منه رقم، يُطلب من كل مقيّم، لكل من أبعاد الإجابة الأربعة، تحديد المثال الذي تشبهه الإجابة أكثر. لا يوجد خيار «في مكان ما بينهما». الالتزام بتسمية أقرب مثال هو ما يوقف الانحراف نحو الوسط. تُستمد الدرجة بعد ذلك من المستوى المختار بقاعدة ثابتة، لا من النموذج.
- يصوّت كل مقيّم ثلاث مرات. يُحتفظ بالتصويت الأوسط على كل بُعد. هذا يُزيل الإجابة العرضية السيئة من دون أن يمحو الحكم الحقيقي بالمتوسط.
- تتم تسوية الحكمين. إن توافق المقيّمان أو اختلفا بنقطة واحدة، تكون الدرجة النهائية متوسطهما. إن اختلفا بنقطتين أو أكثر، تُستخدم الدرجة الأعلى. هذه القاعدة ليست تسامحًا؛ إنها معايرة. عندما حللنا كل حالة اختلف فيها المقيّمان بشدة، كان الحكم الأدنى تقريبًا دائمًا هو الحكم الخاطئ، لأن الاختلاف كان يحدث دائمًا تقريبًا على إجابة من المستوى الأعلى كان أحد المقيّمين حذرًا فيها أكثر من اللازم.
- تُطبَّق ضوابط أمان. مجموعة صغيرة من القواعد الثابتة تتعامل مع حالات لا ينبغي على أي مقيّم التخمين فيها: إجابة صامتة، أو بضع كلمات فقط، أو بلغة أخرى، أو خارجة عن الموضوع تمامًا تحصل على درجة قاعدية بغض النظر عن ما يُعيده المقيّمان. في الاختبار، حصل الصمت على درجة 3، والإجابة من بضع كلمات على درجة 4، والإجابة الخارجة عن الموضوع أو غير الإنجليزية على درجة 5، بلا أي فشل عبر المجموعة.
تستحق خاصيتان من التصميم النهائي التوقف عندهما. يقيّم Engine 2.0 من النص المكتوب فقط، فهو لا يحتاج الصوت بعد التفريغ ولا يعتمد على نموذج صوت أي مزود بمفرده. ولأن المقيّمين من مزودين مختلفين، إن كان أحدهما غير متاح يستمر الآخر، مع نموذج ثالث بديل حتى تُنتج الدرجة دائمًا.
ما الجديد في ملاحظاتك
يأتي Engine 2.0 بطبقة ملاحظات أُعيد بناؤها بالكامل. فهي تقرأ أدلة المُقيِّمين الاثنين، لا الدرجة فقط، وقد اختُبرت مع ثلاثة أنواع من الطلاب: من يواجه CELPIP لأول مرة، ومن لديه إنجليزية ضعيفة ويبحث عن الحيلة السريعة، ومن لديه نصف ساعة يوميًا واختبار الأسبوع القادم. وهذا ما تغيّر.
- كلماتك أنت، تُعاد إليك بين علامتي تنصيص. تستشهد كل نقطة ملاحظات بالعبارة الدقيقة من نص إجابتك التي تفاعل المُقيِّمون معها. وإذا وُضعت عبارة بين علامتي تنصيص، فهي مُقتبَسة حرفيًا؛ وفي تدقيقنا كانت 157 من 158 اقتباسًا كذلك. لا تبتكر الملاحظات أبدًا شيئًا لم تقله.
- شيء واحد تصلحه أولًا. تحصل كل إجابة على خطوة واحدة رئيسية: التغيير الوحيد الذي سيرفع درجتك أكثر من غيره، مكتوبًا بأبسط الكلمات في الصفحة. يليه إجراءان عمليان آخران، ثم قائمة تحقق من ثلاثة عناصر تراجعها في ذهنك قبل أن تبدأ الكلام.
- نصيحة تلائم المهمة. تُقيَّم مهام مثل إعطاء نصيحة، أو وصف مشهد، أو إقناع شخص ما، بناءً على معايير مختلفة. تعرف الملاحظات الآن ما تُثيبه كل واحدة من أنواع المهام الثمانية وتتحدث إلى ذلك بالتحديد، بدلًا من تكرار نفس النصائح العامة في كل المهام.
- أي بُعد تتدرّب عليه أولًا. تخبرك الملاحظات بأي الأبعاد الأربعة هو الأضعف عندك وأيها الأقوى، لتعرف أين تكمن نقطتك التالية، دون أن يُحجب ذلك خلف رقم.
- ما طلبته المهمة وفوّتَه. بالنسبة لتحقيق المهمة، تسرد الملاحظات الأجزاء المحددة من السؤال التي لم تتناولها، أو تذكر بوضوح أنك تناولتها جميعًا.
- أمور يمكنك التدرّب عليها بالفعل. كل توجيه عملي هو شيء يمكنك أن تقوله بصوت مرتفع قبل محاولتك التالية. لا نصيحة بالتحدث بوضوح أكبر أو تقليل لكنتك: فاللكنة ليست ما يقيسه معيار سهولة الاستماع، ولا تعلّق الملاحظات عليها أبدًا.
- لا لوم على المؤقّت. الإجابة التي يقطعها المؤقّت بعد أن أكملت المهمة لا تُخصم منها درجات لأجل ذلك القطع، ولا تُعنّفك الملاحظات على ذلك.
عندما قارن نموذج تحكيم مستقل هذه الملاحظات بما أنتجه نظامنا السابق لنفس الإجابات، دون أن يعرف أيّهما أيّ، فضّل الملاحظات الجديدة في 20 من 24 مقارنة، سواء عند التقييم بمنظور ممتحن أو بمنظور طالب.
تدريب غير محدود بسعر CA$25 شهريًا
الدقة لا تفيد إلا إن كان بإمكانك استخدامها كل يوم. درجة المحادثة التي يمكنك الوثوق بها أكثر قيمة عند إجابتك التدريبية الأربعين، لا الرابعة، لأن ذلك حين تبدأ الدرجة بإخبارك هل تغيير طريقة حديثك يعمل فعليًا. لذا سعّرنا Engine 2.0 لكي يُستخدم من دون عدّ.
تشمل كل باقة Prepamigo تقييمًا غير محدود من Engine 2.0، ومحاولات غير محدودة، وبنك الأسئلة الكامل: 80 مجموعة تدريب كاملة وأكثر من 2,000 مهمة تدريبية عبر أقسام المحادثة والكتابة والقراءة والاستماع، مكتوبة لتتبع أنواع المهام والتوقيت والصيغة في اختبار CELPIP العام. تضغط على زر التسجيل، وتحصل على درجة وملاحظات مؤسسة على دليل في نحو عشر ثوانٍ، ويمكنك تكرار ذلك بقدر ما تشاء.
Prepamigo
CA$25/ شهريًا
CA$24.98 شهريًا · CA$8.25 شهريًا في الباقة السنوية (CA$98.98 للسنة) · شامل الضريبة · إلغاء في أي وقت
- تقييم غير محدود من Scoring Engine 2.0، بلا حد يومي أو للجلسة أو أسبوعي.
- 80 مجموعة تدريب و+2,000 مهمة عبر كل الأقسام الأربعة، مصممة على غرار صيغة الاختبار الحقيقي، فلن تحتاج أبدًا لكتابة تعليماتك الخاصة.
- سجّل وانطلق. التفريغ والتقييم والملاحظات تتم لك؛ لا شيء تلصقه ولا شيء تكتب تعليمة له.
- ملاحظات بكلماتك الخاصة، مع كل اقتباس يمكن تتبعه إلى ما قلته فعليًا.
Claude Max، للمقارنة
US$100/ شهريًا
نحو CA$138 قبل الضريبة · فئة 20x بسعر US$200 شهريًا · Pro بسعر US$20 بحدود أشد صرامة
- حتى Max محدودة. نافذة استخدام متجددة مدتها خمس ساعات وحد أسبوعي، خمسة أو عشرون ضعف ما تسمح به Pro؛ وعندما تصل إلى أي منهما، تنتظر.
- بلا بنك أسئلة. تجلب مهامك الخاصة، وتقرر بنفسك هل تشبه الاختبار الحقيقي، وتتابع ما تدرّبت عليه من قبل.
- أنت تقوم بالإعداد. التسجيل والتفريغ ولصق النص وكتابة تعليمات التقييم كل ذلك عليك، كل مرة.
- طلب بسيط، لا مقيّم معايَر. عند الطلب بكلمات بسيطة، تطابق Claude Opus 5 مع الدرجات الموثّقة في 62% من الحالات وClaude Sonnet 5 في 45%، مقابل 81% لـ Engine 2.0.
أسعار وشروط استخدام باقات Claude كما نُشرت على claude.com في سبتمبر 2026 وقد تتغير. CELPIP علامة تجارية مملوكة لصاحبها؛ وPrepamigo منصة تدريب مستقلة وغير منتسبة أو معتمدة أو مرتبطة بجهة الاختبار. مهام التدريب في Prepamigo مواد أصلية كُتبت لتتبع صيغة الاختبار العامة.
التوفر
محرك Prepamigo Scoring Engine 2.0 للمحادثة متاح الآن لكل مستخدمي Prepamigo في كل أنواع مهام المحادثة. لا شيء لتفعيله. كل إجابة محادثة جديدة يقيّمها Engine 2.0، وكل درجة تأتي بملاحظات مستمدة من كلمات الطالب بنفسها.
تُقيَّم الإجابة النموذجية في نحو عشر ثوانٍ، أسرع من Engine 1.0. كما يكلّفنا Engine 2.0 أقل لتشغيله لكل إجابة من التصميم الذي حلّ محله، وهذا ما يسمح لنا بتشغيل مقيّمين بثلاثة تصويتات لكل منهما لكل طالب من دون تغيير تكلفة Prepamigo.
سننشر تحديثات للأرقام في هذه الصفحة مع اكتمال التحقق من العالم الحقيقي الموصوف أعلاه. إن كان لديك تسجيل تعتقد أن Engine 2.0 قيّمه خطأً، نريد رؤيته: تلك الحالات هي أسرع طريقة نعرفها لاكتشاف التحسين التالي.
للمقارنات المباشرة، اقرأ Prepamigo مقارنةً بـ Claude وPrepamigo مقارنةً بـ ChatGPT. أو سجّل إجابة وشاهد Engine 2.0 يعمل. يمكنك أيضًا اقرأ هذا الدليل بالإنجليزية.
