المنتج

Prepamigo مقارنةً بـ Claude لمحادثة CELPIP: أي منهما يعطيك الدرجة الصحيحة؟

7 سبتمبر 2026

نسبة الإجابات التي حصلت على الدرجة الموثّقة

48 إجابة محادثة من مجموعة اختبار محجوزة، 16 عند كل من المستويات الثلاثة. أُعطي Claude النص المكتوب وطُلب منه، بكلمات بسيطة، تقييمه على مقياس CELPIP؛ متوسط ثلاث محاولات. عمل Engine 2.0 بتكوينه الإنتاجي المعتاد.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

45%

Claude Sonnet 5

Prepamigo مقارنةً بأشهر باقات روبوتات المحادثة

بالدولار الكندي. أسعار Prepamigo شاملة الضريبة. تم تحويل Claude Max (بدءًا من US$100) و ChatGPT Pro (US$200) بسعر 1.38، قبل الضريبة. الدقة هي نسبة الإجابات في مجموعة الاختبار المحجوزة التي حصلت على الدرجة الصحيحة عند طلب تقييمها من النموذج المذكور بكلمات بسيطة؛ وهي متوسط ثلاث محاولات.

Prepamigo
Claude MaxOpus 5
السعر الشهري
CA$24.98 (شامل الضريبة)
+CA$138 (قبل الضريبة)
التقييم
غير محدود
محدود
بنك أسئلة جاهز
نعم
لا
مجموعات تدريب
80
لا يوجد
مهام تدريب
+2,000
لا يوجد
صيغة CELPIP
نعم
لا
الدقة
81%
62%
إجابات المستوى الأعلى
71%
50%

إن كنت قد لصقت نصًا لمحادثة في Claude وطلبت منه تقييمك كما يفعل ممتحن CELPIP، فأنت تعرف بالفعل سر جاذبيته. يجيب فورًا، ويشرح نفسه، ولا يتعب أبدًا. السؤال هو هل الرقم الذي يعطيك هو الرقم الذي ستحصل عليه فعليًا. أجرينا هذا الاختبار بالطريقة التي يفعلها طالب حقيقي: نفس النص، طلب بسيط لدرجة، ثم قمنا بالعدّ.

الجواب المختصر: في 48 إجابة محادثة لم تر الأنظمة مثلها من قبل، ولكل واحدة درجة موثّقة بشكل مستقل، حصل محرك Prepamigo Scoring Engine 2.0 على المستوى الصحيح في 81% من الحالات. عند الطلب بكلمات بسيطة لتقييم نفس النصوص، حصل Claude Opus 5 على المستوى الصحيح في 62% من الحالات وClaude Sonnet 5 في 45% من الحالات. الفجوة أوسع ما تكون تمامًا حيث تهم أكثر لكل من يسعى لدرجة مرتفعة: عند الإجابات من المستوى الأعلى، تعرّف Engine 2.0 على 71% منها، وOpus 5 على 50%، وSonnet 5 على 29%.

ثم فعلنا شيئًا تتجاهله معظم المقارنات. أعطينا Claude إجراء التقييم الخاص بنا، مع أمثلة معايرة حقيقية لكل مهمة ومقارنة إجبارية معها، لنرى إلى أي مدى يمكن أن يكون جيدًا. ارتفع Opus 5 إلى 77% وSonnet 5 إلى 69%. بقي كلاهما خلف Engine 2.0، وبقي كلاهما يواجه أكبر صعوبة في الإجابات من المستوى الأعلى. يستعرض باقي هذا المقال كلا الاختبارين، وشكل الأرقام عند كل مستوى درجة، وسبب انحراف المساعد العام نحو وسط المقياس، وشكل سير العمل اليومي عند كل جانب، وتكلفة كل خيار إن كنت تنوي التدرب بجدية.

الاختبار البسيط: ما يحصل عليه الطالب فعليًا

واحد وثمانون بالمئة مقابل اثنين وستين وخمسة وأربعين. في اختبار من 48 إجابة، الفرق بين Engine 2.0 وOpus 5 هو تسع درجات صحيحة إضافية، والفرق بين Engine 2.0 وSonnet 5 هو سبع عشرة. بعبارة أخرى، يرتكب Engine 2.0 أخطاء تقييم أقل بنسبة 51% من Opus 5 وأقل بنسبة 66% من Sonnet 5.

أعطت ثلاث محاولات منفصلة للاختبار البسيط Opus 5 نسب 62% و65% و58%، وSonnet 5 نسب 44% و46% و46%. هذا التباين البالغ عدة نقاط بين المحاولات هو بذاته نتيجة مهمة: اطلب من Claude تقييم النص نفسه في يومين مختلفين، وستحصل غالبًا على درجتين مختلفتين. سجّل Engine 2.0 نسبة 81.3% في كل من محاولاته الثلاث.

أين تتسع الفجوة: مستوى الدرجة تلو الآخر

معظم المقيّمين، البشر والآلات، ينحرفون نحو وسط المقياس. تتحول الإجابة القوية إلى 8 بدلاً من 10؛ وتتحول الإجابة الضعيفة إلى 6 بدلاً من 5. هذا الانحراف غير مرئي في المتوسط وواضح تمامًا لحظة تقسيم النتائج بحسب المستوى. مع الطلب البسيط، يضيف Claude عادة ثانية فوق ذلك: ينحرف نحو الأسفل، حتى الإجابات الضعيفة غالبًا ما تُقيَّم تحت مستواها.

الإجابات من المستوى الأدنى (الدرجة الموثّقة 4 أو 5)

16 إجابة من مجموعة الاختبار المحجوزة، طلب بسيط، متوسط ثلاث محاولات. معظم زلات Sonnet 5 هنا هي درجة 3.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

44%

Claude Sonnet 5

في الإجابات الضعيفة، يتصدر Engine 2.0 بنسبة 88%، ويليه Opus 5 بنسبة 77%، وينخفض Sonnet 5 إلى 44%. هذا هو الطرف السهل من المقياس، ويتعامل Opus 5 معه بشكل معقول. أما Sonnet 5 فلا: فهو يقيّم الإجابة من مستوى 4 أو 5 بدرجة 3 في أكثر من نصف الأحيان، وهو المستوى الخاطئ حتى وإن كان الاتجاه مفهومًا. الطالب عند هذا المستوى الذي يستخدم Sonnet 5 للتقييم سيُقال له إنه أضعف من واقعه في معظم الأحيان.

الإجابات من المستوى المتوسط (الدرجة الموثّقة 7 أو 8)

16 إجابة من مجموعة الاختبار المحجوزة، طلب بسيط، متوسط ثلاث محاولات. الزلات تقريبًا كلها درجة 6.

85%

Prepamigo Engine 2.0

63%

Claude Sonnet 5

58%

Claude Opus 5

في المستوى المتوسط، يقف Engine 2.0 عند 85%، ونموذجا Claude عند 63% و58%. تحتوي الإجابات من المستوى المتوسط على مزيج من نقاط القوة والضعف يجب وزنها بدلاً من رصدها فقط، ومع غياب أمثلة معايرة للموازنة، يميل كلا نموذجي Claude إلى رؤية نقاط الضعف ومنح درجة 6. سيسمع المتحدث من مستوى 7 أو 8 أنه من مستوى 6 في نحو أربع من كل عشر مرات.

الإجابات من المستوى الأعلى (الدرجة الموثّقة 10 فأعلى)

16 إجابة من مجموعة الاختبار المحجوزة، طلب بسيط، متوسط ثلاث محاولات. معظم الزلات تقريبًا هي درجة 7 أو 8.

71%

Prepamigo Engine 2.0

50%

Claude Opus 5

29%

Claude Sonnet 5

في القمة، يتعرّف Engine 2.0 على 71% من الإجابات من المستوى الأعلى. يتعرّف Opus 5 على نصفها. أما Sonnet 5 فيتعرّف على 29% منها فقط، وهذا يعني أنه يمنح درجة 7 أو 8 لسبع من كل عشر إجابات تستحق درجة 10.

فكّر في ما يعنيه ذلك عمليًا. لنفترض أن مستوى محادثتك اليوم هو 10 فعلاً. تسجّل ثماني إجابات، وتُفرّغها، وتلصقها في Claude Sonnet 5 وتطلب درجة، فيخبرك أن ستًا منها بدرجة 7 و8. تستنتج أنك لست جاهزًا. تُنفق ثلاثة أسابيع إضافية في التمرين. كنت جاهزًا منذ البداية. هذا ليس سيناريو افتراضيًا؛ إنه الخطأ الفردي الأكثر شيوعًا في اختبارنا كله، وهو يضرب بأقسى قوة أولئك الذين اجتهدوا أكثر من غيرهم.

إن كنت تستخدم Claude للتقييم وظلّ يمنحك درجة 7 و8، فلا تصدّقه تلقائيًا. في اختبارنا، كانت الإجابة من المستوى الأعلى أكثر عرضة للحصول على 8 من Sonnet 5 مما تحصل على 10. درجة 8 من Claude سبب لطلب رأي ثانٍ، لا حكم نهائي.

ماذا لو أعطينا Claude إجراءنا الكامل؟

من المغري قراءة أرقام الاختبار البسيط على أنها دليل ضعف Claude. لكن الأمر ليس كذلك. Opus 5 هو، بفارق واضح، أقوى مقيّم عام اختبرناه. المشكلة ليست في الذكاء. المشكلة أن نموذجًا يُطلب منه رقم، من دون ما يقارن به، يخمّن، وعندما يخمّن يخمّن منخفضًا ونحو الوسط.

فأجرينا الاختبار الثاني. تلقّى Claude نفس الحزمة التي يتلقاها مقيّمو Engine 2.0: النص المكتوب، والمهمة، ومثالان حقيقيان للمعايرة عند كل مستوى لتلك المهمة بالذات، وتعليمات بتسمية أقرب مثال لكل من الأبعاد الأربعة بدلاً من إعطاء رقم. حصل كل نموذج أيضًا على ملاحظة معايرة قصيرة مصممة لنزعاته الخاصة.

مع إجرائنا الكامل: نسبة الإجابات التي حصلت على الدرجة الموثّقة

نفس 48 إجابة من مجموعة الاختبار المحجوزة. قيّم كل نموذج من Claude كل إجابة مرة واحدة بنفس النصوص والتعليمات وأمثلة المعايرة التي يتلقاها مقيّمو Engine 2.0 الخاصون بنا.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

69%

Claude Sonnet 5

أمثلة المعايرة تصنع فرقًا كبيرًا. يرتفع Opus 5 من 62% إلى 77%؛ وSonnet 5 من 45% إلى 69%. تبلغ الدقة عند المستوى الأدنى لكليهما 88%، مثل Engine 2.0 تمامًا. وتبلغ الدقة عند المستوى المتوسط 81% لكليهما. هذا يستحق التوقف عنده، لأنه يوضح أين تقع القيمة الحقيقية في مقيّم مصمم خصيصًا لهذا الغرض: ليس في نموذج أذكى، بل في أمثلة حقيقية عن شكل كل مستوى في كل مهمة بعينها، وفي سؤال يفرض على النموذج المقارنة بدلاً من التخمين.

ومع ذلك، يظل كلا النموذجين متأخرين عند قمة المقياس. مع الإجراء الكامل، يتعرّف Opus 5 على 63% من الإجابات من المستوى الأعلى وSonnet 5 على 38%، مقابل 71% لـ Engine 2.0. نموذج واحد يقوم بتمريرة واحدة لا يزال يتراجع أمام إجابة قوية تحتوي على زلة. يُغلق Engine 2.0 الفجوة المتبقية بثلاثة أمور أخرى: مقيّمان مستقلان من مزودين مختلفين، وثلاثة تصويتات من كل منهما مع الاحتفاظ بالتصويت الأوسط، وقاعدة تسوية تأخذ الدرجة الأعلى عندما يختلف المقيّمان بشدة، لأن التحليل أظهر أن الحكم الأدنى كان تقريبًا دائمًا الحكم الخاطئ على الإجابات القوية.

جرّبنا أيضًا الحل السريع الواضح: الاحتفاظ بالطلب البسيط وإضافة تعليمات مثل «لا تنحرف نحو الوسط» أو «إجابة المستوى 9 لا يلزم أن تكون خالية من العيوب». لم تُحدث تغييرًا يُذكر. يوافق النموذج على التعليمة ثم يفعل ما كان سيفعله على أي حال. ما ينجح هو تغيير السؤال، وإعطاء النموذج شيئًا حقيقيًا للمقارنة معه.

فجوة سير العمل: سجّل وانطلق، أو قم بكل شيء بنفسك

أرقام الدقة تفترض أن التقييم يحدث فعليًا. مع Claude، يقع كمّ مفاجئ من العمل بين الضغط على زر الإيقاف في تسجيلك وقراءة درجة.

أولًا، تحتاج إلى نص مكتوب. واجهة محادثة Claude لا تقيّم التسجيلات الصوتية، فأنت تحتاج إلى إنتاج نص. هذا يعني إما كتابة ما قلته يدويًا، وهو ما يغيّره، أو تمرير التسجيل عبر أداة تفريغ صوتي. وهنا تفصيل كلّفنا الكثير من الدقة قبل أن نفهمه: يجب أن يكون النص حرفيًا تمامًا. كل كلمة حشو، وكل إعادة انطلاق، وكل تصحيح ذاتي يجب أن يبقى. عندما اختبرنا نصًا «منظّفًا» بإزالة التوقفات المتردّدة، انخفضت الدقة بخمس عشرة نقطة، لأن تلك التوقفات هي بالضبط الدليل الذي يحتاجه المقيّم للحكم على شكل الإجابة صوتيًا. معظم أدوات التفريغ الاستهلاكية تُنظّف النص تلقائيًا.

ثانيًا، تحتاج إلى المهمة نفسها. لا يملك Claude بنك أسئلة على طراز CELPIP بالتوقيت والصيغة الصحيحين. فأنت إما تكتب مهمتك الخاصة، وهو ما يعني التخمين بشأن ما يطرحه الاختبار الحقيقي، أو تجد واحدة في مكان آخر وتلصقها مع النص المكتوب.

ثالثًا، إن كنت تريد نتيجة أفضل من أرقام الاختبار البسيط، تحتاج إلى أمثلة معايرة: إجابات حقيقية عند كل مستوى لنفس نوع المهمة، بمستويات موثّقة. هذا هو المدخل الذي رفع دقة Opus 5 من 62% إلى 77% في اختبارنا، وهو ما لا يستطيع الطالب إنتاجه في المنزل.

رابعًا، تفعل كل ذلك من جديد للإجابة التالية. وللإجابة التي تليها.

في Prepamigo، تختار مهمة من البنك، ويبدأ المؤقّت، وتتحدث، وبعد نحو عشر ثوانٍ من التوقف تظهر الدرجة والملاحظات على الشاشة. التفريغ حرفي بحكم التصميم، وأمثلة المعايرة مُرفقة بالمهمة تلقائيًا، ولا شيء تلصقه ولا شيء تكتب تعليمة له. تكلّفك الإجابة الحادية عشرة في المساء نفس الجهد الذي تكلّفك به الإجابة الأولى.

الاتساق: نفس الإجابة، نفس الدرجة

الدرجة التي لا يمكنك إعادة إنتاجها ليست قياسًا. إن حصل نفس التسجيل على 8 يوم الإثنين و10 يوم الثلاثاء، فأنت لم تتعلم شيئًا عن مستوى محادثتك بل تعلّمت شيئًا عن مزاج المقيّم. لذا اختبرنا أيضًا هل يعطي كل نظام الإجابة نفسها مرتين.

أُجري Engine 2.0 على الـ48 إجابة المحجوزة ثلاث مرات منفصلة. سجّل 81.3% في كل مرة. عند النظر إلى الإجابات الفردية بدلاً من الإجمالي، حصلت 87.5% منها على درجة متطابقة تمامًا عبر الثلاث محاولات، ولم تتحرك سوى 4.2% منها بمقدار نقطتين أو أكثر. هذه القلة هي إجابات تقع تمامًا على الحدود بين مستويين، حيث يميل فرق طفيف في التقدير بطبيعة الحال الدرجة في اتجاه أو آخر.

تحرّك الاختبار البسيط على Claude بعدة نقاط بين المحاولات على مستوى الإجمالي، وأكثر من ذلك على مستوى الإجابات الفردية. فجوة الاتساق هذه ليست عرضًا جانبيًا للنماذج المستخدمة. تأتي من التصويت. يصوّت كل مقيّم في Engine 2.0 ثلاث مرات على كل إجابة ويُحتفظ بالتصويت الأوسط، وهذا يُزيل الحالة الشاذة العرضية التي تنتجها تمريرة واحدة. عندما اختبرنا نفس التكوين بتصويت واحد بدلاً من ثلاثة، انخفض الاتساق بين المحاولات من 87.5% إلى 77.1%. محادثة واحدة مع Claude هي تصويت واحد.

ملاحظات يمكنك التصرف بموجبها

الدرجة تخبرك بمكانك. الملاحظات تخبرك بما تفعله بعد ذلك، وهذا مجال يبرع فيه Claude فعلًا. يكتب بوضوح، وهو صبور، وإن سألته عن سبب درجة معينة سيشرح بأي طول تريده. لطالب يريد التحدث في تفاصيل إجابته، هذا أمر ذو قيمة.

الخطر مماثل لخطر الدرجة نفسها: الشرح الفصيح ليس بديلًا عن التشخيص الدقيق. النموذج الذي قيّم إجابة من مستوى 10 بدرجة 7 سيشرح، بشكل مقنع، سبب كونها 7. سيجد شيئًا يشير إليه. وبسبب أن Claude لم يُلزم بالاستدلال على الأدلة قبل التقييم، فإن الشرح يُكتب بعد اتخاذ القرار، لتبرير رقم اختاره مسبقًا.

يعمل Engine 2.0 بالاتجاه المعاكس. لأن كل مقيّم عليه الإشارة إلى دليل لكل بُعد يحكم عليه، تتلقى طبقة الملاحظات هذا الدليل مباشرة: العبارات الدقيقة من نصّك التي دعمت الحكم على المحتوى، والمفردات، وطريقة صوتك، وهل أكملت المهمة. تُكتب الملاحظات من ذلك الدليل وتقتبس كلماتك بنفسها. في مراجعتنا لـ158 اقتباسًا عبر عيّنة من الملاحظات، ظهر 157 منها حرفيًا في النص المكتوب. وعندما طلبنا من نموذج تحكيم مستقل مقارنة ملاحظات Engine 2.0 بملاحظات نظامنا السابق، دون معرفة أيهما أيهما، فضّل Engine 2.0 في 20 من أصل 24 مقارنة، سواء عند الحكم كممتحن أو كطالب.

اختبرنا أيضًا هل تضع الملاحظات الانتقاد في المكان الصحيح. أخذنا إجابات قوية وأضررنا عمدًا جانبًا واحدًا في كل منها: إدخال أخطاء نحوية وكلمات حشو، أو استبدال كلمات دقيقة بكلمات غامضة، أو حذف تفاصيل داعمة، أو إزالة الفعل الجوهري الذي تطلبه المهمة. في ثلاث من أصل أربع حالات، كان البُعد الذي أضررناه هو البُعد الذي انخفضت درجته أكثر من غيره. هذا نوع من الفحص لا يستطيع روبوت محادثة تجاوزه بسهولة، لأنه ليس لديه أبعاد ثابتة يُفحص في ضوئها.

كم تكلفة التدرب يوميًا

الدرجة في المحادثة أكثر فائدة عند إجابتك الأربعين، لا الرابعة. عندها تبدأ في إخبارك هل تغيير طريقة حديثك يعمل فعليًا. فالسؤال العملي ليس تكلفة كل أداة، بل تكلفة استخدامها بكثرة.

سعر Claude Pro هو US$20 شهريًا، أي نحو CA$28، أو US$17 شهريًا عند الفوترة السنوية، حسب ما نُشر على claude.com في سبتمبر 2026. يأتي مع نافذة استخدام متجددة مدتها خمس ساعات وحد أسبوعي؛ وعندما تصل إلى أي منهما، تنتظر. النصوص الطويلة المصحوبة بأمثلة معايرة هي بالضبط نوع الرسالة التي تستهلك كثيرًا من هذا الحد. باقات Max، من US$100 شهريًا، أي نحو CA$138 قبل الضريبة، ترفع الحدود بشكل كبير لكن لا تزيلها. لا تشمل أي من الباقات بنك أسئلة، أو مؤقتًا، أو تفريغًا صوتيًا، أو أمثلة معايرة، أو أي شيء خاص بـ CELPIP.

سعر Prepamigo هو CA$24.98 شهريًا، أو CA$8.25 شهريًا في الباقة السنوية، وهو CA$98.98 للسنة، شامل الضريبة، ويمكنك الإلغاء في أي وقت. تشمل كل باقة تقييمًا غير محدود من Engine 2.0 من دون حد يومي أو جلسة أو أسبوعي، ومحاولات غير محدودة، وبنك الأسئلة الكامل: 80 مجموعة تدريب كاملة وأكثر من 2,000 مهمة تدريبية عبر أقسام المحادثة والكتابة والقراءة والاستماع، مكتوبة لتتبع أنواع المهام والتوقيت والصيغة في اختبار CELPIP العام.

بعبارة مبسطة: بأقل من سعر Claude Pro، تحصل على مقيّم أدق بكثير في الإجابات الأهم، لا يطلب منك الانتظار أبدًا، ويأتي بالأسئلة وأمثلة المعايرة جاهزة مسبقًا.

عندما يكون Claude الأداة الأفضل

هذا ليس مقالًا يدعوك لعدم فتح Claude أبدًا أثناء التحضير لـ CELPIP. هناك عدة أشياء يقوم بها أفضل من محرك تقييم متخصص، وقد يستخدم المرشح الجاد كلاهما معًا.

  • التحدث في تفاصيل إجابة. إن كنت تريد فهم سبب ضعف سبب معيّن، أو ابتكار ثلاثة أسباب أفضل، فالمحادثة هي الشكل المناسب. يمنحك Engine 2.0 حكمًا ودليلًا؛ ولا يتحدث معك.
  • المساعدة في المفردات والصياغة. طلب خمس طرق أكثر طبيعية للتعبير عن شيء من Claude سريع ومفيد، واقتراحاته عمومًا جيدة.
  • تدريب الكتابة. الإجابات المكتوبة لا تحتاج إلى تفريغ صوتي، فتصبح فجوة سير العمل أصغر بكثير. لم تكن دقة Claude في الكتابة جزءًا من هذا الاختبار، ولا نقدّم أي حكم عليها هنا.
  • أي شيء خارج الاختبار. أسئلة أوراق الهجرة، وجداول الدراسة، وشرح نقطة نحوية: Claude مساعد عام وPrepamigo ليس كذلك.

ما لا ينبغي أن يكون Claude، بحسب الأدلة هنا، هو الشيء الذي يخبرك إن كنت جاهزًا. لذلك تريد مقيّمًا بُني خصيصًا لهذا الغرض، واختُبر على إجابات لم يرها، وقُيس مستوى تلو الآخر.

ما الجديد في ملاحظاتك

يأتي Engine 2.0 بطبقة ملاحظات أُعيد بناؤها بالكامل. فهي تقرأ أدلة المُقيِّمين الاثنين، لا الدرجة فقط، وقد اختُبرت مع ثلاثة أنواع من الطلاب: من يواجه CELPIP لأول مرة، ومن لديه إنجليزية ضعيفة ويبحث عن الحيلة السريعة، ومن لديه نصف ساعة يوميًا واختبار الأسبوع القادم. وهذا ما تغيّر.

  • كلماتك أنت، تُعاد إليك بين علامتي تنصيص. تستشهد كل نقطة ملاحظات بالعبارة الدقيقة من نص إجابتك التي تفاعل المُقيِّمون معها. وإذا وُضعت عبارة بين علامتي تنصيص، فهي مُقتبَسة حرفيًا؛ وفي تدقيقنا كانت 157 من 158 اقتباسًا كذلك. لا تبتكر الملاحظات أبدًا شيئًا لم تقله.
  • شيء واحد تصلحه أولًا. تحصل كل إجابة على خطوة واحدة رئيسية: التغيير الوحيد الذي سيرفع درجتك أكثر من غيره، مكتوبًا بأبسط الكلمات في الصفحة. يليه إجراءان عمليان آخران، ثم قائمة تحقق من ثلاثة عناصر تراجعها في ذهنك قبل أن تبدأ الكلام.
  • نصيحة تلائم المهمة. تُقيَّم مهام مثل إعطاء نصيحة، أو وصف مشهد، أو إقناع شخص ما، بناءً على معايير مختلفة. تعرف الملاحظات الآن ما تُثيبه كل واحدة من أنواع المهام الثمانية وتتحدث إلى ذلك بالتحديد، بدلًا من تكرار نفس النصائح العامة في كل المهام.
  • أي بُعد تتدرّب عليه أولًا. تخبرك الملاحظات بأي الأبعاد الأربعة هو الأضعف عندك وأيها الأقوى، لتعرف أين تكمن نقطتك التالية، دون أن يُحجب ذلك خلف رقم.
  • ما طلبته المهمة وفوّتَه. بالنسبة لتحقيق المهمة، تسرد الملاحظات الأجزاء المحددة من السؤال التي لم تتناولها، أو تذكر بوضوح أنك تناولتها جميعًا.
  • أمور يمكنك التدرّب عليها بالفعل. كل توجيه عملي هو شيء يمكنك أن تقوله بصوت مرتفع قبل محاولتك التالية. لا نصيحة بالتحدث بوضوح أكبر أو تقليل لكنتك: فاللكنة ليست ما يقيسه معيار سهولة الاستماع، ولا تعلّق الملاحظات عليها أبدًا.
  • لا لوم على المؤقّت. الإجابة التي يقطعها المؤقّت بعد أن أكملت المهمة لا تُخصم منها درجات لأجل ذلك القطع، ولا تُعنّفك الملاحظات على ذلك.

عندما قارن نموذج تحكيم مستقل هذه الملاحظات بما أنتجه نظامنا السابق لنفس الإجابات، دون أن يعرف أيّهما أيّ، فضّل الملاحظات الجديدة في 20 من 24 مقارنة، سواء عند التقييم بمنظور ممتحن أو بمنظور طالب.

الأسئلة الشائعة

هل يمكن لـ Claude تقييم تدريبي على محادثة CELPIP؟ سيعطيك رقمًا. عند الطلب بكلمات بسيطة على 48 إجابة لم تُر من قبل وذات درجات موثّقة، حصل Claude Opus 5 على المستوى الموثّق في 62% من الحالات وClaude Sonnet 5 في 45% من الحالات، مقابل 81% لمحرك Prepamigo Scoring Engine 2.0. وفي الإجابات من المستوى الأعلى كان Sonnet 5 صحيحًا في 29% من الحالات.

هل Prepamigo أدق من Claude؟ نعم: 81% مقابل 62% و45% عند الطلب البسيط. مع إجرائنا الكامل وأمثلة المعايرة، ارتفع Opus 5 إلى 77% وSonnet 5 إلى 69%، وبقيا خلف Engine 2.0، وأضعف ما يكونا عند قمة المقياس.

كم تكلفة كل خيار؟ تبدأ باقة Claude Max من US$100 شهريًا، أي نحو CA$138 قبل الضريبة، بحدود استخدام؛ وسعر Claude Pro هو US$20 بحدود أشد. سعر Prepamigo هو CA$24.98 شهريًا شامل الضريبة، أو CA$8.25 شهريًا في الباقة السنوية، مع تقييم غير محدود و80 مجموعة تدريب.

لماذا يستمر Claude بمنح إجاباتي القوية درجة 7 أو 8؟ النموذج المطلوب منه رقم من دون ما يقارن به ينحرف منخفضًا ونحو الوسط، والإجابة من المستوى الأعلى ليست خالية من العيوب أبدًا. عند الطلب البسيط، أعطى Sonnet 5 الإجابة من المستوى الأعلى درجة 9 أو أعلى في 29% فقط من الحالات.

لمعرفة كيف يعمل التقييم فعليًا، اقرأ داخل Scoring Engine 2.0. ولرؤية لوحة الترتيب الكاملة بما فيها GPT وGemini، اقرأ أي ذكاء اصطناعي يقيّم محادثة CELPIP بدقة أكبر. أو تخطَّ القراءة وسجّل إجابة. يمكنك أيضًا اقرأ هذا الدليل بالإنجليزية.

Prepamigo مقارنةً بـ Claude لمحادثة CELPIP: أي منهما يعطيك الدرجة الصحيحة؟ | PrepAmigo