Engine 2.0 على 48 إجابة من مجموعة اختبار محجوزة
نسبة الإجابات التي حصلت على درجة داخل المستوى الموثّق. ثلاث محاولات منفصلة في أيام مختلفة أعطت كل واحدة منها 81.3% إجمالًا.
81%
المستوى الدقيق
Prepamigo مقارنةً بأشهر باقات روبوتات المحادثة
بالدولار الكندي. أسعار Prepamigo شاملة الضريبة. تم تحويل Claude Max (بدءًا من US$100) و ChatGPT Pro (US$200) بسعر 1.38، قبل الضريبة. الدقة هي نسبة الإجابات في مجموعة الاختبار المحجوزة التي حصلت على الدرجة الصحيحة عند طلب تقييمها من النموذج المذكور بكلمات بسيطة؛ وهي متوسط ثلاث محاولات.
هذا هو السؤال الصحيح الذي يجب طرحه على أي أداة تدريب، ومعظم الأدوات لا تجيب عنه. درجة المحادثة لا تساوي شيئًا إلا إن أخبرتك بما سيقوله مقيّم حقيقي، والطريقة الوحيدة لمعرفة هل تفعل ذلك هي القياس. لذا فهذا المقال هو القياس، موضوعًا بوضوح، بما فيه الأجزاء التي تُجملنا والأجزاء التي لا تفعل.
الجواب في فقرة واحدة: في 48 إجابة محادثة لم يرها محرك Prepamigo Scoring Engine 2.0 من قبل، كل واحدة بدرجة موثّقة بشكل مستقل، حصل المحرك على المستوى الموثّق في 81% من الحالات وضمن نقطة واحدة منه في 92% من الحالات. أنتج نفس النسبة 81% في كل من ثلاث محاولات منفصلة. أدق ما يكون على الإجابات الضعيفة والمتوسطة، عند 88% و85%، وأقل دقة على الإجابات من المستوى الأعلى، عند 71%، حيث خطأه المميز هو منح إجابة من مستوى 10 درجة 8. عند الطلب بكلمات بسيطة لتقييم نفس النصوص، بلغ أفضل نموذج ذكاء اصطناعي عام اختبرناه نسبة 62%، وأضعفها 31%؛ ومع إجراء التقييم الكامل لدينا، بلغ أفضلها 77%.
فيما يلي كيف حصلنا على تلك الأرقام، وماذا تعني عند كل مستوى درجة، ومدى استقرارها، وأين تقع الأخطاء، وكيف تُقارَن الدرجة بالبدائل التي قد تستخدمها بدلاً منها، وكيف تقرأ درجتك في ضوء كل ذلك. إن كنت تريد فقط النصيحة العملية، انتقل إلى قسم قراءة درجتك. وإن كنت تريد أن تقرر هل تثق بالرقم على الإطلاق، اقرأ كل المقال.
ماذا يعني «دقيق» هنا
قبل أي رقم، التعريف. نحن لا نزعم أن درجة Prepamigo تتنبأ بنتيجة اختبارك. لا تستطيع أي أداة تدريب أن تعِد بذلك، ومن يفعل فهو يخمّن. ما نقيسه أضيق وأكثر صدقًا: بالنظر إلى إجابة محادثة تمت التحقق من درجتها بشكل مستقل، كم مرة يُصدر المحرك درجة عند المستوى نفسه؟
تُرصد محادثة CELPIP على مقياس يصل إلى 12، وتأتي الدرجات الموثّقة في بياناتنا المرجعية في ثلاثة مستويات: منخفض، يعني 4 أو 5؛ ومتوسط، يعني 7 أو 8؛ وأعلى، يعني 10 فأعلى. نعدّ المحرك صحيحًا عندما تقع درجته داخل المستوى الموثّق. الإجابة الموثّقة عند المستوى الأعلى تُعدّ مصنّفة بشكل صحيح إن أعطاها المحرك 9 أو 10 أو 11. وبقراءة أكثر تشددًا لا تقبل إلا 10 فأعلى، ينخفض كل رقم في هذه الصفحة ببضع نقاط ويبقى كل ترتيب مقارن كما هو.
الأرقام الرئيسية
ماذا تعني نسبة 81% عمليًا؟ إن سجّلت عشر إجابات بمستوى ثابت، سيضع المحرك نحو ثمان منها في المستوى الصحيح ونحو واحدة إضافية ضمن نقطة منه. لن يضع درجة 5 في مستوى 10 أو درجة 10 في مستوى 5؛ لم يحدث ذلك ولا مرة واحدة عبر 144 إجابة مُقيَّمة في الثلاث محاولات. الأخطاء التي يرتكبها هي أخطاء مقيّم حريص على إجابة حدّية، والقسم التالي يُظهر أين تتركز.
الدقة عند كل مستوى درجة
الدقة بحسب المستوى الموثّق
16 إجابة من مجموعة الاختبار المحجوزة لكل مستوى. كل عمود هو نصيب إجابات ذلك المستوى التي حصلت على درجة داخل المستوى.
88%
المستوى الأدنى (4-5)
85%
المستوى المتوسط (7-8)
71%
المستوى الأعلى (+10)
الإجابات من المستوى الأدنى: 88%. الإجابات الضعيفة هي الأسهل للتعرّف عليها. تميل إلى أن تكون قصيرة، وتُعيد استخدام صياغة السؤال، وتترك أجزاء من المهمة غير مكتملة. يرصد المحرك تلك العلامات في معظم الأحيان. وعندما يُخطئ، يُخطئ للأعلى: في كل حالة، قُيّمت الإجابة بدرجة 8 بدلاً من 4 أو 5. السبب غالبًا ما يكون إجابة تبدو سلسة وواثقة لكنها تقول القليل؛ فتمنحها طلاقة الأداء مستوى لم تكسبه في المحتوى. نعرف ذلك لأننا نستطيع رؤية أي الأبعاد وضعها المقيّمان مرتفعًا، وهي دائمًا وضوح الأداء الصوتي.
الإجابات من المستوى المتوسط: 85%. هذه هي الأصعب في التقييم بمعنى واحد، لأنها تحتوي على مزيج حقيقي من نقاط القوة والضعف يجب وزنه بدلاً من رصده. زلات المحرك هنا تسير في كلا الاتجاهين. بعض الإجابات التي تحمل تردّدًا واضحًا لكن أفكارًا متينة سُحبت إلى 5 أو 6؛ وبعض الإجابات ذات الصوت المصقول دُفعت إلى 10. خطوة التسوية بين المقيّمين ترصد معظم هذه الحالات، وهذا سبب ارتفاع هذا الرقم.
الإجابات من المستوى الأعلى: 71%. هذا هو المستوى الأضعف والذي نتحدث عنه أكثر، لأن الخطأ متسق جدًا. عندما يفوّت المحرك إجابة من المستوى الأعلى، يمنحها 8. ليس 7، ولا 6؛ بل 8، في كل حالة تقريبًا باستثناء عدد قليل من درجات 9 التي تُحسب صحيحة. يرى المحرك إجابة قوية ويتراجع درجة واحدة.
هذا يستحق سياقًا. الانحراف نحو 8 على الإجابات القوية ليس خاصية فريدة لـ Prepamigo؛ إنه الخلل المميز لكل مقيّم آلي اختبرناه، معايَرًا كان أم لا. كان محركنا السابق أسوأ بكثير في هذا. عند الطلب بكلمات بسيطة لتقييم نفس الإجابات، تعرّف أفضل نموذج عام على 56% من الإجابات من المستوى الأعلى؛ وتعرّف النموذج الذي يقف خلف باقات ChatGPT المدفوعة على 25%؛ وحتى مع إجرائنا الكامل، لم يتجاوز أي منها 63%. واحد وسبعون بالمئة هو أفضل رقم حققناه، وهو لا يزال الرقم الذي نريد تحسينه أكثر من أي شيء آخر.
مشكلة الدرجة 8، من جهتك أمام الشاشة
يخبرك عرض المستوى بأداء المحرك على إجابة من مستوى معروف. أنت تنظر إليه من الاتجاه المعاكس: لديك درجة وتريد أن تعرف كم تثق بها. لذا هذه هي البيانات نفسها مقلوبة. لكل درجة يعطيها المحرك، كم مرة كانت الإجابة فعليًا عند ذلك المستوى؟
- إن قال المحرك 4 أو 5: كانت الإجابة عند المستوى الأدنى في 93% من الحالات. الباقي إجابات من المستوى المتوسط بتردّد شديد. الدرجة المنخفضة من Engine 2.0 صحيحة تقريبًا دائمًا.
- إن قال المحرك 10: كانت الإجابة عند المستوى الأعلى في 92% من الحالات. درجة 10 من Engine 2.0 هي 10.
- إن قال المحرك 8: كانت الإجابة عند المستوى المتوسط في 67% من الحالات، وعند المستوى الأعلى في 23% من الحالات، وعند المستوى الأدنى في 10% من الحالات. الدرجة 8 هي الدرجة الوحيدة التي تستحق قراءة متأنية.
بعبارة واضحة: الدرجة 8 من Engine 2.0 تعني «متوسط، على الأرجح، لكن يمكن أن يكون أفضل». إجابة واحدة تقريبًا من كل أربع حصلت على 8 كانت في الواقع 10. إن حصلت على 8 في إجابة كنت تعتقد أنها ممتازة، لا تستنتج أنك غير جاهز. سجّل نفس المهمة مرة أخرى. درجة 10 ثابتة عبر ثلاث محاولات هي 10؛ ودرجة 8 ثابتة عبر ثلاث محاولات هي 8؛ والمزيج بينهما إجابة على الحدود، وستخبرك الملاحظات بأي بُعد يبقيها هناك.
هل يحصل نفس التسجيل على نفس الدرجة؟
الدقة بلا اتساق مجرد حظ. إن استطاع نفس التسجيل الحصول على 8 اليوم و10 في اليوم التالي، فإن نسبة 81% كانت متوسطًا على تشويش ولا يمكنك استخدام الدرجة لتتبّع أي شيء. لذا اختبرنا الاستقرار مباشرة.
جرى تقييم الـ48 إجابة المحجوزة ثلاث مرات منفصلة، في أيام مختلفة، من دون تغيير أي شيء بين المحاولات. كان الرقم الإجمالي 81.3% في كل محاولة. على مستوى الإجابات الفردية، حصلت 87.5% منها على درجة متطابقة في الثلاث محاولات، ولم تتحرك سوى 4.2% منها بمقدار نقطتين أو أكثر. هذه القلة هي إجابات تقع تمامًا على الحدود بين مستويين، حيث يميل فرق طفيف في التقدير بطبيعة الحال الدرجة في اتجاه أو آخر.
الاتساق يأتي من قرار تصميمي محدد. يصوّت كل من مقيّمي المحرك ثلاث مرات على كل إجابة، ويُحتفظ بالتصويت الأوسط. عندما اختبرنا نفس التكوين بتصويت واحد بدلاً من ثلاثة، انخفض تطابق الدرجات بين المحاولات من 87.5% إلى 77%، وتضاعفت نسبة الإجابات التي تتحرك بنقطتين أو أكثر. التصويت لم يغيّر رقم الدقة. غيّر هل يعني رقم الدقة شيئًا.
بالنسبة لك، الاتساق يعني أن تغيّرًا في درجتك هو تغيّر في محادثتك. إن سجّلت نفس نوع المهمة ثلاث مرات خلال أسبوع وتحرّكت الدرجة من 8 إلى 10، فليس ذلك يومًا جيدًا للمقيّم. إنه أنت.
كيف يُقارَن هذا بما قد تستخدمه بدلاً منه
رقم الدقة يعني أكثر عندما يكون له ما يُقارَن به. لذا شغّلنا نفس الـ48 إجابة المحجوزة عبر نماذج الذكاء الاصطناعي العامة التي يستخدمها الناس فعليًا لتقييم تدريبهم، بالطريقة التي يفعلها أي شخص: أعطينا كل نموذج النص الحرفي والمهمة، وقلنا له إنه ممتحن CELPIP خبير، وطلبنا درجة من 0 إلى 12. ثلاث محاولات لكل نموذج، بمتوسطها.
نسبة الإجابات التي حصلت على درجة داخل المستوى الموثّق
نفس 48 إجابة من مجموعة الاختبار المحجوزة. طُلب من كل نموذج، بكلمات بسيطة، تقييم النص المكتوب؛ متوسط ثلاث محاولات. عمل Engine 2.0 بتكوينه الإنتاجي المعتاد.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
يتقدم Engine 2.0 على كل نموذج بفارق يتراوح بين تسع عشرة وواحد وخمسين نقطة. عند الطلب البسيط، يقيّم كل نموذج عام بقسوة: الزلة على الإجابة الضعيفة غالبًا درجة 3، والزلة على القوية درجة 7 أو 8. Claude Opus 5 وGemini هما الوحيدان فوق النصف. نماذج GPT الثلاثة الأكبر بين 31% و37%، وتتعرّف على الإجابة من المستوى الأعلى بين 13% و27% من الحالات.
ثم أعطينا كل نموذج إجراءنا الكامل: نفس أمثلة المعايرة لتلك المهمة بالذات، ونفس المقارنة الإجبارية، وملاحظة معايرة قصيرة مصممة لنزعاته الخاصة. هذه أفضل نتيجة استطاع كل نموذج تحقيقها في يدنا، وليست شيئًا يستطيع الطالب إعادة إنتاجه من دون الأمثلة. ارتفع Opus 5 إلى 77%، وGPT 5.6 sol وGemini إلى 71%، وGPT 5.5 وSonnet 5 إلى 69%، وluna إلى 63%، وGPT-4o mini إلى 50%. كل واحد منها لا يزال ينتهي خلف Engine 2.0، ولم يتعرّف أي منها على أكثر من 63% من الإجابات من المستوى الأعلى.
ما الجديد في ملاحظاتك
يأتي Engine 2.0 بطبقة ملاحظات أُعيد بناؤها بالكامل. فهي تقرأ أدلة المُقيِّمين الاثنين، لا الدرجة فقط، وقد اختُبرت مع ثلاثة أنواع من الطلاب: من يواجه CELPIP لأول مرة، ومن لديه إنجليزية ضعيفة ويبحث عن الحيلة السريعة، ومن لديه نصف ساعة يوميًا واختبار الأسبوع القادم. وهذا ما تغيّر.
- كلماتك أنت، تُعاد إليك بين علامتي تنصيص. تستشهد كل نقطة ملاحظات بالعبارة الدقيقة من نص إجابتك التي تفاعل المُقيِّمون معها. وإذا وُضعت عبارة بين علامتي تنصيص، فهي مُقتبَسة حرفيًا؛ وفي تدقيقنا كانت 157 من 158 اقتباسًا كذلك. لا تبتكر الملاحظات أبدًا شيئًا لم تقله.
- شيء واحد تصلحه أولًا. تحصل كل إجابة على خطوة واحدة رئيسية: التغيير الوحيد الذي سيرفع درجتك أكثر من غيره، مكتوبًا بأبسط الكلمات في الصفحة. يليه إجراءان عمليان آخران، ثم قائمة تحقق من ثلاثة عناصر تراجعها في ذهنك قبل أن تبدأ الكلام.
- نصيحة تلائم المهمة. تُقيَّم مهام مثل إعطاء نصيحة، أو وصف مشهد، أو إقناع شخص ما، بناءً على معايير مختلفة. تعرف الملاحظات الآن ما تُثيبه كل واحدة من أنواع المهام الثمانية وتتحدث إلى ذلك بالتحديد، بدلًا من تكرار نفس النصائح العامة في كل المهام.
- أي بُعد تتدرّب عليه أولًا. تخبرك الملاحظات بأي الأبعاد الأربعة هو الأضعف عندك وأيها الأقوى، لتعرف أين تكمن نقطتك التالية، دون أن يُحجب ذلك خلف رقم.
- ما طلبته المهمة وفوّتَه. بالنسبة لتحقيق المهمة، تسرد الملاحظات الأجزاء المحددة من السؤال التي لم تتناولها، أو تذكر بوضوح أنك تناولتها جميعًا.
- أمور يمكنك التدرّب عليها بالفعل. كل توجيه عملي هو شيء يمكنك أن تقوله بصوت مرتفع قبل محاولتك التالية. لا نصيحة بالتحدث بوضوح أكبر أو تقليل لكنتك: فاللكنة ليست ما يقيسه معيار سهولة الاستماع، ولا تعلّق الملاحظات عليها أبدًا.
- لا لوم على المؤقّت. الإجابة التي يقطعها المؤقّت بعد أن أكملت المهمة لا تُخصم منها درجات لأجل ذلك القطع، ولا تُعنّفك الملاحظات على ذلك.
عندما قارن نموذج تحكيم مستقل هذه الملاحظات بما أنتجه نظامنا السابق لنفس الإجابات، دون أن يعرف أيّهما أيّ، فضّل الملاحظات الجديدة في 20 من 24 مقارنة، سواء عند التقييم بمنظور ممتحن أو بمنظور طالب.
كيف تقرأ درجتك
- درجة 4 أو 5 صحيحة تقريبًا بشكل مؤكد. يتعرّف المحرك على الإجابات الضعيفة في 88% من الحالات، وعندما يقول 4 أو 5 يكون صحيحًا في 93% من الحالات. اقرأ الملاحظات لمعرفة أي بُعد هو الأدنى واعمل عليه.
- درجة 10 هي 10. عندما يقول المحرك 10، كانت الإجابة عند المستوى الأعلى في 92% من الحالات. أنت جاهز في نوع المهمة تلك. انتقل إلى الأنواع التي تتجنّبها.
- درجة 8 سؤال. ثلثا الأحيان تعني متوسط. مرة من كل أربع تعني أعلى. سجّل نفس المهمة مرة أخرى وانظر إلى النمط عبر المحاولات.
- الثقة تتغيّر أكثر من المستويات. لأن الدرجة مستقرة، تغيّرها عبر المحاولات يعني تغيّرًا في محادثتك. تكرار نوع المهمة نفسها أسرع طريقة لمعرفة هل عادة جديدة تعمل.
- اقرأ الاقتباسات. العبارات المقتبسة في ملاحظاتك هي ما تفاعل معه المقيّمان. إنها الكلمات المحددة التي عليك تغييرها.
الأسئلة الشائعة
ما مدى دقة درجة محادثة Prepamigo؟ على 48 إجابة لم تُر من قبل بدرجات موثّقة: 81% عند المستوى الدقيق، و92% ضمن نقطة واحدة، بشكل متطابق عبر ثلاث محاولات. بحسب المستوى: 88% للأدنى، و85% للمتوسط، و71% للأعلى.
هل هي نفس درجتي الحقيقية؟ لا تستطيع أي أداة تدريب أن تعِد بذلك. ما نقيسه هو كم مرة يتفق المحرك مع درجة موثّقة على نفس الإجابة. اقرأ درجتك كمستوى مع اتجاه، وانظر إلى النمط عبر المحاولات.
لماذا حصلت على 8 على إجابة اعتقدت أنها ممتازة؟ هذا أكبر خطأ متبقٍ للمحرك: درجة 8 واحدة من كل أربع كانت في الواقع 10. سجّل نفس المهمة مرة أخرى. درجة 10 ثابتة عبر المحاولات هي 10.
هل سيحصل نفس التسجيل على الدرجة نفسها مرتين؟ 87.5% متطابقة عبر ثلاث محاولات؛ ولم تتحرك سوى 4.2% منها بنقطتين أو أكثر، وكلها على حدود المستويات.
لمعرفة كيف يعمل المحرك خطوة بخطوة، اقرأ داخل Scoring Engine 2.0. ولرؤية الاختبار نفسه على GPT وClaude وGemini، اقرأ أي ذكاء اصطناعي يقيّم محادثة CELPIP بدقة أكبر. أو سجّل إجابة وشاهد الأرقام بنفسك. يمكنك أيضًا اقرأ هذا الدليل بالإنجليزية.
