التقييم

أي ذكاء اصطناعي يقيّم محادثة CELPIP بدقة أكبر؟ اختبرنا ثمانية

5 سبتمبر 2026

نسبة الإجابات التي حصلت على الدرجة الموثّقة

48 إجابة من مجموعة اختبار محجوزة، 16 لكل مستوى. أُعطي كل نموذج النص المكتوب وطُلب منه، بكلمات بسيطة، تقييمه على مقياس CELPIP؛ متوسط ثلاث محاولات. عمل Engine 2.0 بتكوينه الإنتاجي المعتاد.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo مقارنةً بأشهر باقات روبوتات المحادثة

بالدولار الكندي. أسعار Prepamigo شاملة الضريبة. تم تحويل Claude Max (بدءًا من US$100) و ChatGPT Pro (US$200) بسعر 1.38، قبل الضريبة. الدقة هي نسبة الإجابات في مجموعة الاختبار المحجوزة التي حصلت على الدرجة الصحيحة عند طلب تقييمها من النموذج المذكور بكلمات بسيطة؛ وهي متوسط ثلاث محاولات.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
السعر الشهري
CA$24.98 (شامل الضريبة)
+CA$138 (قبل الضريبة)
CA$276 (قبل الضريبة)
التقييم
غير محدود
محدود
محدود
بنك أسئلة جاهز
نعم
لا
لا
مجموعات تدريب
80
لا يوجد
لا يوجد
مهام تدريب
+2,000
لا يوجد
لا يوجد
صيغة CELPIP
نعم
لا
لا
الدقة
81%
62%
35%
إجابات المستوى الأعلى
71%
50%
25%

كثير من متقدمي CELPIP يقيّمون تدريبهم على المحادثة بأنفسهم بواسطة روبوت محادثة بالذكاء الاصطناعي. تسجّل إجابة، وتُفرّغها، وتلصقها، وتطلب درجة. الأمر سريع ومجاني أو شبه مجاني، والشروحات تبدو موثوقة. ما لا يخبرك به أحد هو كم مرة يكون الرقم صحيحًا، أو أي نموذج تثق به، أو هل تغيير طريقة سؤالك يغيّر الجواب. أردنا أن نعرف، فبنينا الاختبار وشغّلناه على ثمانية أنظمة، بطريقتين.

الطريقة الأولى هي الرسم البياني أعلاه: لصق النص، طلب درجة، بالطريقة التي يفعلها الطالب. بين النماذج العامة، كان Claude Opus 5 الأدق بنسبة 62%، يليه Gemini بنسبة 58%، وكل ما عداهما كان تحت النصف: Claude Sonnet 5 وGPT-4o mini عند 45%، وGPT 5.5 عند 37%، وGPT 5.6 sol عند 35%، وGPT 5.6 luna عند 31%. بلغ نظام مصمم خصيصًا لهذا الغرض، Prepamigo Scoring Engine 2.0، نسبة 81% على نفس الإجابات.

الطريقة الثانية هي التي نعتقد أنها الأكثر إفادة: أعطينا كل نموذج إجراء التقييم الخاص بنا، مع أمثلة معايرة حقيقية ومقارنة إجبارية، لنرى إلى أي مدى يمكن أن يكون كل واحد جيدًا. تحسّن كل نموذج، بعضها بشكل كبير، وانتهى كل نموذج خلف Engine 2.0. علينا أن نكون صريحين بأن Prepamigo هو منتجنا. حاولنا أن نجعل كلا الاختبارين عادلين للجميع، وحيث تفوّق نموذج علينا في مستوى معيّن، نقول ذلك.

لوحة ترتيب الطلب البسيط

تظهر ثلاث طبقات في الرسم البياني أعلاه. يقف Engine 2.0 عند 81% منفردًا. يشكّل Claude Opus 5 عند 62% وGemini عند 58% طبقة ثانية: قابلة للاستخدام، إن قبلت أن تكون مخطئًا مرتين من كل خمس. كل ما عدا ذلك تحت 50%، أي أضعف من رمي عملة بين المستويات الثلاثة لو لم تعرف شيئًا عن الإجابة أصلًا.

هذه هي الخاصية المميزة للاختبار البسيط: كل نموذج عام يقيّم بقسوة. تراوح متوسط الدرجة التي منحوها لإجابة موثّقة من المستوى الأعلى بين 7.2 (luna) و8.6 (Opus 5). تراوح متوسط الدرجة التي منحوها لإجابة موثّقة من المستوى الأدنى بين 3.7 و4.3، وهو تحت المستوى لكل النماذج باستثناء Opus 5 وGemini. مع غياب أمثلة عن شكل كل مستوى فعليًا، تقارن النماذج الإجابة بإجابة مثالية متخيّلة وتخصم.

النتائج عند كل مستوى درجة

الرقم الإجمالي يُخفي أين تقع الأخطاء، وأين تقع هو ما يحدد هل المقيّم مفيد لك. هذه نتائج الاختبار البسيط بحسب المستوى.

الإجابات من المستوى الأدنى (الموثّق 4 أو 5)

16 إجابة لكل نظام من مجموعة الاختبار المحجوزة، طلب بسيط، متوسط ثلاث محاولات.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

الإجابات الضعيفة ينبغي أن تكون الطرف السهل من المقياس، ومع الطلب البسيط لا تكون كذلك. Engine 2.0 عند 88%، وOpus 5 عند 77%، وGPT-4o mini عند 75%. كل ما عداها عند نحو النصف، وSonnet 5 عند 44%. الزلة تكاد تكون دائمًا درجة 3: يرى النموذج إجابة ضعيفة ويقيّمها تحت المستوى بدلاً من فيه. الرقم المحترم لـ GPT-4o mini هنا هو أول إشارة على مشكلته، وهي أنه يقيّم كل شيء تقريبًا منخفضًا.

الإجابات من المستوى المتوسط (الموثّق 7 أو 8)

16 إجابة لكل نظام من مجموعة الاختبار المحجوزة، طلب بسيط، متوسط ثلاث محاولات.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

المستوى المتوسط يفرّق بين النماذج. Engine 2.0 عند 85%. Gemini وSonnet 5 عند 63%، وOpus 5 عند 58%. وبعدها هاوية: GPT-4o mini عند 44% ونماذج GPT الثلاثة الأكبر عند 27% إلى 29%. تحتوي الإجابات من المستوى المتوسط على مزيج حقيقي من نقاط القوة والضعف يجب وزنها، ومع غياب ما يُقارن به، ترى نماذج GPT نقاط الضعف وتمنح درجة 5 أو 6. سيسمع المتحدث من مستوى 7 أو 8 الذي يسأل GPT 5.6 sol عن درجة المستوى الصحيح في أقل من ثلاث من كل عشر مرات.

الإجابات من المستوى الأعلى (الموثّق 10 فأعلى)

16 إجابة لكل نظام من مجموعة الاختبار المحجوزة، طلب بسيط، متوسط ثلاث محاولات. معظم الزلات تقريبًا هي درجة 7 أو 8.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

المستوى الأعلى هو حيث تهم الفروق أكثر، وحيث يُلحق الطلب البسيط أكبر ضرر. يتعرّف Engine 2.0 على 71% من الإجابات من المستوى الأعلى. يتعرّف Gemini على 56% وOpus 5 على النصف تمامًا. ثم Sonnet 5 عند 29%، وGPT 5.5 عند 27%، وGPT 5.6 sol عند 25%، وGPT-4o mini عند 17%، وGPT 5.6 luna عند 13%. خمسة من النماذج العامة السبعة تمنح درجة 7 أو 8 لسبع من كل عشر إجابات على الأقل تستحق درجة 10.

إن كنت مرشحًا قويًا تقيّم نفسك بروبوت محادثة، هذا هو الرقم الذي تتذكّره. فرصة أن يخبرك طلب بسيط لـ GPT 5.6 sol أن درجة 10 هي 10 هي واحدة من كل أربع.

لوحة الترتيب الثانية: مع إجرائنا الكامل

أرقام الاختبار البسيط ليست حكمًا على مدى ذكاء هذه النماذج. إنها حكم على ما يحدث عندما يُطلب من نموذج رقم من دون ما يقارن به. فأجرينا الاختبار الثاني، أعطينا فيه كل نموذج أمثلة المعايرة والمقارنة الإجبارية التي يستخدمها مقيّمو Engine 2.0 الخاصون بنا.

مع إجرائنا الكامل: نسبة الإجابات التي حصلت على الدرجة الموثّقة

نفس 48 إجابة من مجموعة الاختبار المحجوزة. نفس النصوص والتعليمات وأمثلة المعايرة لكل نظام؛ قيّم كل نموذج كل إجابة مرة واحدة. تلقّى Gemini أيضًا الصوت.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

يتحسن كل نموذج. يرتفع Opus 5 من 62% إلى 77%. يتضاعف GPT 5.6 sol تقريبًا، من 35% إلى 71%. يرتفع GPT 5.5 من 37% إلى 69%، وSonnet 5 من 45% إلى 69%، وluna من 31% إلى 63%، وGemini من 58% إلى 71%. بالكاد يتحرك GPT-4o mini، من 45% إلى 50%، لأنه يقيّم كل شيء منخفضًا بغض النظر عن ما يُعرض عليه.

الترتيب يتغيّر أيضًا. مع الطلب البسيط، كانت نماذج Claude متقدمة بفارق كبير على نماذج GPT. مع الإجراء الكامل، يتجاوز GPT 5.6 sol نموذج Sonnet 5 ويتساوى مع Gemini، وتتجمّع أربعة نماذج بين 69% و71%، غير قابلة للتمييز إحصائيًا على هذه العيّنة. يبقى Opus 5 في القمة بين النماذج العامة عند 77%، أربع نقاط خلف Engine 2.0.

على مستوى عرض المستويات، يرفع الإجراء الكامل الدقة عند المستوى الأدنى إلى 88% لأربعة نماذج، مثل Engine 2.0، والدقة عند المستوى المتوسط إلى 81% لنموذجي Claude. المستوى الأعلى هو حيث تستمر الفجوة: يتوقف Opus 5 وGPT 5.6 sol وGemini وGPT 5.5 عند 63%، وSonnet 5 عند 38%، وGPT-4o mini عند صفر، مقابل 71% لـ Engine 2.0. نموذج واحد بتمريرة واحدة لا يزال يتراجع أمام إجابة قوية تحتوي على زلة. يُغلق Engine 2.0 تلك الفجوة المتبقية بمقيّمين مستقلين من مزودين مختلفين، وثلاثة تصويتات من كل منهما مع الاحتفاظ بالتصويت الأوسط، وقاعدة تسوية تأخذ الدرجة الأعلى عندما يختلف المقيّمان بشدة، لأن التحليل أظهر أن الحكم الأدنى كان تقريبًا دائمًا الحكم الخاطئ على الإجابات القوية.

الخلاصة الصادقة لكلا اللوحتين هي هذه: الإجراء يهم أكثر من النموذج. نفس نموذج GPT 5.6 sol ارتفع من 35% إلى 71% من دون تغيير وزن واحد، فقط بإظهار شكل كل مستوى له وسؤاله عن المثال الذي تشبهه الإجابة.

لماذا تنحرف النماذج منخفضة ونحو الوسط

النمط متسق جدًا عبر نماذج من ثلاث شركات مختلفة بحيث لا يمكن أن يكون خاصية فريدة لأي واحد منها. إنها خاصية للمهمة نفسها.

عندما يُطلب من نموذج وضع إجابة على مقياس، فإنه يميل نحو الوسط عندما يكون غير متأكد، لأن الوسط هو حيث تكلّف الإجابة الخاطئة أقل. وعندما لا تكون لديه أمثلة عن شكل مستوى فعليًا، يقارن الإجابة بإجابة مثالية متخيّلة ويخصم لكل زلة. الإجابة من المستوى الأعلى ليست خالية من العيوب أبدًا. تحتوي على إعادة انطلاق، أو جملة عادية بين الجمل المعقدة، أو تردّد قبل كلمة صعبة. مقاسة بالكمال، تُكلّف تلك الزلات درجة أو درجتين، فتتحول 10 إلى 8 أو 7.

التعليمات لا تحل هذا. جرّبنا إخبار النماذج صريحًا أن المستوى 9 لا يتطلب إجابة خالية من الأخطاء، وأن التقييم الناقص لإجابة قوية خطأ لا يقل جدية عن التقييم المُبالَغ فيه لإجابة ضعيفة. قُبلت كل تعليمة ثم جُوهلت عمليًا. عندما أعطينا نموذجًا نفس مثال المعايرة الذي أُخبر أنه يمثّل إجابة من المستوى الأعلى وطلبنا منه تقييمه، أعطاه 8.

ما ينجح، غالبًا، هو تغيير السؤال من «أي رقم؟» إلى «أي مثال؟» وتوفير أمثلة حقيقية. هذا هو الفارق بين اللوحتين. وحتى في هذه الحالة، لا تزال تمريرة واحدة تنحرف قليلًا، لأن أمثلة المعايرة ليست مثالية وقراءة واحدة لها هي قراءة واحدة. مقيّمان، وثلاثة تصويتات، وقاعدة تسوية هي ما تُغلق ما تبقّى.

ملاحظات عن كل نموذج

  • Claude Opus 5. أفضل مقيّم عام في كلا الاختبارين: 62% بسيط (62% و65% و58% عبر ثلاث محاولات) و77% مع الإجراء الكامل. نقطة ضعفه في الطلب البسيط هي المستوى المتوسط، حيث يمنح درجة 6؛ ونقطة ضعفه في الإجراء الكامل هي المستوى الأعلى، حيث يتوقف عند 63%. وهو أيضًا أغلى نموذج هنا بفارق واسع.
  • Gemini. الثاني في الاختبار البسيط بنسبة 58%، متطابقة عبر الثلاث محاولات، والأكثر اتساقًا عبر المستويات، بنسب 56% و63% و56%. مع الإجراء الكامل والتسجيل الصوتي بلغ 71%، مساويًا لـ GPT 5.6 sol الذي عمل من النص فقط. الاستماع إلى التسجيل لم يساعده إلى ما هو أبعد من نص حرفي.
  • Claude Sonnet 5. 45% بسيط، بصفة غريبة: معقول في المستوى المتوسط عند 63%، ضعيف على الإجابات الضعيفة عند 44% لأنه يمنحها درجة 3، وضعيف في المستوى الأعلى عند 29%. مع الإجراء الكامل يرتفع إلى 69% لكنه يبقى عند 38% في الإجابات من المستوى الأعلى. إن ظلّ Sonnet 5 يمنحك درجة 8، فلا تصدّقه.
  • GPT-4o mini. 45% بسيط، و50% مع الإجراء الكامل، وفي كلتا الحالتين الرقم يجمّله. يقيّم كل شيء تقريبًا منخفضًا: 75% على الإجابات الضعيفة، و17% ثم صفر على الإجابات من المستوى الأعلى. مهما فعلت، لا تُقيّم محادثتك بهذا النموذج.
  • GPT 5.5. 37% بسيط (35% و42% و33%)، و69% مع الإجراء الكامل. مستواه المتوسط في الطلب البسيط هو 29%. كان المقيّم النصّي في نسخة سابقة من منظومتنا الخاصة واستُبدل لضعفه في هذا المستوى بالضبط.
  • GPT 5.6 sol. 35% بسيط (31% و40% و35%)، أكبر تباين بين المحاولات لأي نموذج، و71% مع الإجراء الكامل، أكبر تحسّن لأي نموذج. مقيّم قادر عندما يُعرض عليه أمثلة، وضعيف عندما لا يُعرض عليه. عادته في الإجراء الكامل هي المبالغة في تقدير الطلاقة في المستوى المتوسط.
  • GPT 5.6 luna. الأخير في كلا الاختبارين: 31% بسيط و63% مع الإجراء الكامل. يسحب الإجابات المتوسطة نحو 5 وتعرّف على 13% من الإجابات من المستوى الأعلى بالطلب البسيط. رخيص كفاية ليكون مفيدًا كرأي ثانٍ داخل نظام بمقيّمين؛ غير دقيق كفاية لاستخدامه بمفرده.

ما يُضيفه نظام مصمم خصيصًا

Engine 2.0 ليس نموذجًا أفضل. يستخدم نماذج من نفس لوحة الترتيب هذه. ما يضيفه هو إجراء، واختير كل جزء من ذلك الإجراء بالقياس.

  1. تفريغ حرفي تلقائيًا. يُحتفظ بكل كلمة حشو وإعادة انطلاق، لأن إزالتهما خفّضت الدقة بخمس عشرة نقطة في الاختبار. لا تحتاج إلى إيجاد أداة تفريغ تفعل ذلك؛ معظم الأدوات الاستهلاكية تُنظّف النص تلقائيًا.
  2. أمثلة معايرة مُرفقة بكل مهمة. إجابتان حقيقيتان لكل مستوى لكل من أنواع المهام الثمانية، جاهزة مسبقًا. هذا هو المدخل الوحيد الذي ضاعف دقة GPT 5.6 sol، وهو ما لا يمكنك إنتاجه في المنزل.
  3. مقارنة، لا رقم. يسمّي كل مقيّم أقرب مثال على كل من الأبعاد الأربعة؛ وتُستمد الدرجة بقاعدة. هذا ما يوقف الانحراف.
  4. مقيّمان من مزودين. نماذج مختلفة لها نقاط عمى مختلفة. اثنان منها، مُسوَّيان بقاعدة ثابتة، يتغلّبان على أي واحد بمفرده.
  5. ثلاثة تصويتات لكل منهما، يُحتفظ بالوسطى. هذا لم يرفع الدقة، لكنه رفع الاتساق بين المحاولات من 77% إلى 87.5%. إجابة روبوت محادثة واحدة هي تصويت واحد.
  6. تسوية تأخذ الدرجة الأعلى عند اختلاف شديد. لأن الحكم الأدنى كان تقريبًا دائمًا الحكم الخاطئ على الإجابات القوية. المتوسط البسيط انخفض إلى منتصف الستينات في الاختبار.
  7. ضوابط أمان. الصمت، وبضع كلمات، والإجابات الخارجة عن الموضوع وغير الإنجليزية تحصل على درجات قاعدية بقاعدة ثابتة بدلاً من تخمين نموذج.

النتيجة هي 81% إجمالًا و71% في القمة، بشكل متطابق عبر ثلاث محاولات منفصلة، في نحو عشر ثوانٍ لكل إجابة من دون شيء يُلصق.

إن كنت ستستخدم روبوت محادثة على أي حال

سيستمر بعض القرّاء في التقييم بروبوت محادثة، وهذا خيار معقول لمرشح بميزانية محدودة أو من يريد التحدث في تفاصيل إجاباته. هذه الخطوات هي الفارق بين اللوحتين، وستقربك من الثانية أكثر من الأولى.

  1. استخدم نصًا حرفيًا. احتفظ بكلمات الحشو، وإعادة الانطلاق، والتصحيحات الذاتية. إن كانت أداة التفريغ تُنظّفها، فإن المقيّم يُقيّم إجابة أفضل مما قدّمت.
  2. أعطه أمثلة، لا معيار تقييم. مثال أو اثنان لإجابات حقيقية عند كل مستوى لنفس نوع المهمة، بمستوياتها موضّحة، يفعلان أكثر من أي وصف لشكل مستوى 9. إن لم تكن لديك أمثلة موثّقة، هذه الخطوة هي ما لا يمكنك تكراره في المنزل، وهي التي تهم أكثر.
  3. اسأل عن أي مثال، لا عن أي رقم. لكل من الأبعاد الأربعة، اطلب من النموذج تسمية أقرب مثال وامنع «في مكان ما بينهما». استخرج الدرجة أنت بنفسك من المستويات التي يسمّيها.
  4. اسأل أكثر من مرة. قيّم الإجابة نفسها مرتين أو ثلاثًا في محادثات جديدة واحتفظ بالإجابة الوسطى. تباين GPT 5.6 sol بتسع نقاط بين المحاولات في الاختبار البسيط.
  5. اختر نموذجًا بسجل قوي في القمة. Opus 5 أو Gemini إن كنت تسأل ببسيط؛ Opus 5 أو GPT 5.6 sol إن كانت لديك أمثلة. لا GPT-4o mini أبدًا إن كنت قريبًا من مستوى 10.
  6. لا تصدّق درجة 7 أو 8. على كل نموذج عام، درجة 7 أو 8 على إجابة اعتقدت أنها ممتازة أقرب إلى زلة من كونها حكمًا نهائيًا.

أي نموذج تثق به، حسب مستواك الحالي

القراءة الصحيحة لهاتين اللوحتين تعتمد على مستواك الحالي، لأن النماذج تفشل في أماكن مختلفة.

  • إن كنت عند مستوى 4 أو 5 اليوم، سيخبرك Opus 5 بالطلب البسيط بذلك نحو ثلاث مرات من أربع؛ ستُسمّيك معظم النماذج الأخرى 3 في نحو نصف الأحيان. مشكلتك الفعلية ليست المقيّم؛ إنها الملاحظات، ولذلك تريد شيئًا يقتبس كلماتك بدلاً من تلخيصها.
  • إن كنت عند مستوى 7 أو 8، تجنّب نماذج GPT بالطلب البسيط، التي ستسمّيك 5 أو 6 سبع مرات من عشر. Gemini وSonnet 5 هما الأكثر موثوقية في المستوى المتوسط بالطلب البسيط عند 63%. Engine 2.0 عند 85%.
  • إن كنت عند مستوى 10 فأعلى، هنا يهم الخيار أكثر. عند الطلب البسيط، لن يتعرّف أي نموذج عام على درجة 10 بأكثر من 56% من الحالات، وستفعل نماذج GPT ذلك بين 13% و27% من الحالات. يتعرّف Engine 2.0 على سبع من كل عشرة، والأهم أنه يعطي نفس الجواب في كل مرة تسأل.

النمط عبر المستويات الثلاثة هو نفس النمط الذي وصفه المقال كله. النماذج ليست غبية؛ إنها حذرة، والحذر من دون ما يُقارن به يعني رقمًا منخفضًا. وكلما بعدت عن الوسط، كلّفك حذر المقيّم أكثر، وكلما أهم أن يكون المقيّم مصممًا لمقاومته.

ما الجديد في ملاحظاتك

يأتي Engine 2.0 بطبقة ملاحظات أُعيد بناؤها بالكامل. فهي تقرأ أدلة المُقيِّمين الاثنين، لا الدرجة فقط، وقد اختُبرت مع ثلاثة أنواع من الطلاب: من يواجه CELPIP لأول مرة، ومن لديه إنجليزية ضعيفة ويبحث عن الحيلة السريعة، ومن لديه نصف ساعة يوميًا واختبار الأسبوع القادم. وهذا ما تغيّر.

  • كلماتك أنت، تُعاد إليك بين علامتي تنصيص. تستشهد كل نقطة ملاحظات بالعبارة الدقيقة من نص إجابتك التي تفاعل المُقيِّمون معها. وإذا وُضعت عبارة بين علامتي تنصيص، فهي مُقتبَسة حرفيًا؛ وفي تدقيقنا كانت 157 من 158 اقتباسًا كذلك. لا تبتكر الملاحظات أبدًا شيئًا لم تقله.
  • شيء واحد تصلحه أولًا. تحصل كل إجابة على خطوة واحدة رئيسية: التغيير الوحيد الذي سيرفع درجتك أكثر من غيره، مكتوبًا بأبسط الكلمات في الصفحة. يليه إجراءان عمليان آخران، ثم قائمة تحقق من ثلاثة عناصر تراجعها في ذهنك قبل أن تبدأ الكلام.
  • نصيحة تلائم المهمة. تُقيَّم مهام مثل إعطاء نصيحة، أو وصف مشهد، أو إقناع شخص ما، بناءً على معايير مختلفة. تعرف الملاحظات الآن ما تُثيبه كل واحدة من أنواع المهام الثمانية وتتحدث إلى ذلك بالتحديد، بدلًا من تكرار نفس النصائح العامة في كل المهام.
  • أي بُعد تتدرّب عليه أولًا. تخبرك الملاحظات بأي الأبعاد الأربعة هو الأضعف عندك وأيها الأقوى، لتعرف أين تكمن نقطتك التالية، دون أن يُحجب ذلك خلف رقم.
  • ما طلبته المهمة وفوّتَه. بالنسبة لتحقيق المهمة، تسرد الملاحظات الأجزاء المحددة من السؤال التي لم تتناولها، أو تذكر بوضوح أنك تناولتها جميعًا.
  • أمور يمكنك التدرّب عليها بالفعل. كل توجيه عملي هو شيء يمكنك أن تقوله بصوت مرتفع قبل محاولتك التالية. لا نصيحة بالتحدث بوضوح أكبر أو تقليل لكنتك: فاللكنة ليست ما يقيسه معيار سهولة الاستماع، ولا تعلّق الملاحظات عليها أبدًا.
  • لا لوم على المؤقّت. الإجابة التي يقطعها المؤقّت بعد أن أكملت المهمة لا تُخصم منها درجات لأجل ذلك القطع، ولا تُعنّفك الملاحظات على ذلك.

عندما قارن نموذج تحكيم مستقل هذه الملاحظات بما أنتجه نظامنا السابق لنفس الإجابات، دون أن يعرف أيّهما أيّ، فضّل الملاحظات الجديدة في 20 من 24 مقارنة، سواء عند التقييم بمنظور ممتحن أو بمنظور طالب.

الأسئلة الشائعة

أي نموذج ذكاء اصطناعي هو الأدق في تقييم محادثة CELPIP؟ بالطلب البسيط: Claude Opus 5 عند 62%، وGemini عند 58%، وClaude Sonnet 5 وGPT-4o mini عند 45%، وGPT 5.5 عند 37%، وGPT 5.6 sol عند 35%، وGPT 5.6 luna عند 31%. بلغ محرك Prepamigo Scoring Engine 2.0 نسبة 81% على نفس الإجابات.

ChatGPT أم Claude؟ Claude، بوضوح، عند الطلب البسيط: 62% و45% مقابل 35% و37%. مع إجرائنا الكامل تضيق الفجوة إلى 77% لـ Opus 5 مقابل 71% لـ GPT 5.6 sol.

لماذا تعطي كلها إجاباتي القوية درجة 7 أو 8؟ النماذج التي لا تملك ما تقارن به تخمّن منخفضًا ونحو الوسط، والإجابة القوية تحتوي دائمًا على زلات صغيرة. عند الطلب البسيط، لم يتعرّف أي نموذج عام على أكثر من 56% من الإجابات من المستوى الأعلى.

كيف أحصل على درجة أفضل من روبوت محادثة؟ نص حرفي، أمثلة إجابات عند كل مستوى، اسأل عن المثال بدلاً من الرقم، اسأل أكثر من مرة واحتفظ بالإجابة الوسطى. ضاعف هذا الإجراء دقة GPT 5.6 sol من 35% إلى 71% في اختبارنا.

لمقارنة أقرب لكل مواجهة مباشرة، اقرأ Prepamigo مقارنةً بـ Claude وPrepamigo مقارنةً بـ ChatGPT. ولمعرفة كيف يعمل الإجراء خطوة بخطوة، اقرأ داخل Scoring Engine 2.0. أو سجّل إجابة وتخطَّ التفريغ الصوتي. يمكنك أيضًا اقرأ هذا الدليل بالإنجليزية.

أي ذكاء اصطناعي يقيّم محادثة CELPIP بدقة أكبر؟ اختبرنا ثمانية | PrepAmigo