المنتج

Prepamigo مقارنةً بـ ChatGPT لمحادثة CELPIP: الدقة والحدود والتكلفة

7 سبتمبر 2026

نسبة الإجابات التي حصلت على الدرجة الموثّقة

48 إجابة محادثة من مجموعة اختبار محجوزة، 16 لكل مستوى. أُعطي كل نموذج من GPT النص المكتوب وطُلب منه، بكلمات بسيطة، تقييمه على مقياس CELPIP؛ متوسط ثلاث محاولات. عمل Engine 2.0 بتكوينه الإنتاجي المعتاد.

81%

Prepamigo Engine 2.0

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo مقارنةً بأشهر باقات روبوتات المحادثة

بالدولار الكندي. أسعار Prepamigo شاملة الضريبة. تم تحويل Claude Max (بدءًا من US$100) و ChatGPT Pro (US$200) بسعر 1.38، قبل الضريبة. الدقة هي نسبة الإجابات في مجموعة الاختبار المحجوزة التي حصلت على الدرجة الصحيحة عند طلب تقييمها من النموذج المذكور بكلمات بسيطة؛ وهي متوسط ثلاث محاولات.

Prepamigo
ChatGPT ProGPT 5.6 sol
السعر الشهري
CA$24.98 (شامل الضريبة)
CA$276 (قبل الضريبة)
التقييم
غير محدود
محدود
بنك أسئلة جاهز
نعم
لا
مجموعات تدريب
80
لا يوجد
مهام تدريب
+2,000
لا يوجد
صيغة CELPIP
نعم
لا
الدقة
81%
35%
إجابات المستوى الأعلى
71%
25%

ChatGPT هو على الأرجح الأداة الأكثر شيوعًا التي يستخدمها متقدمو CELPIP لتقييم تدريبهم على المحادثة بأنفسهم. موجود على هاتف الجميع، يجيب في ثوانٍ، ويخبرك بسعادة عن مستوى إجابتك. السؤال الذي يجيب عنه هذا المقال هو هل المستوى الذي يخبرك به هو المستوى الذي ستحصل عليه فعليًا. أجرينا الاختبار بالطريقة التي يفعلها الطالب: لصق النص، طلب درجة، والعدّ.

الجواب المختصر: في 48 إجابة محادثة لم تر الأنظمة مثلها من قبل، ولكل واحدة درجة موثّقة بشكل مستقل، حصل محرك Prepamigo Scoring Engine 2.0 على المستوى الصحيح في 81% من الحالات. عند الطلب بكلمات بسيطة، حصل GPT 5.6 sol، النموذج الذي يقف خلف باقات ChatGPT المدفوعة، على المستوى الصحيح في 35% من الحالات. حقق GPT 5.5 نسبة 37%، وGPT 5.6 luna 31%، وGPT-4o mini 45%، وهو رقم يبدو أفضل مما هو عليه فعلاً، لأن هذا النموذج يقيّم كل شيء تقريبًا منخفضًا فيصادف أن يصيب الإجابات الضعيفة.

ثم فعلنا شيئًا تتجاهله معظم المقارنات. أعطينا كل نموذج من GPT إجراء التقييم الخاص بنا، مع أمثلة معايرة حقيقية لكل مهمة ومقارنة إجبارية معها، لنرى إلى أي مدى يمكن أن يكون جيدًا. ارتفع GPT 5.6 sol إلى 71%، وGPT 5.5 إلى 69%، وluna إلى 63%، وGPT-4o mini إلى 50%. بقيت الأربعة خلف Engine 2.0، وبقيت الأربعة تواجه أكبر صعوبة في الإجابات من المستوى الأعلى. يستعرض باقي هذا المقال كلا الاختبارين، والنتائج عند كل مستوى درجة، وسبب انحراف المساعد العام نحو وسط المقياس، وشكل سير العمل اليومي عند كل جانب، وتكلفة كل خيار إن كنت تنوي التدرب بجدية.

الاختبار البسيط: ما يحصل عليه الطالب فعليًا

واحد وثمانون بالمئة مقابل خمسة وثلاثين. في اختبار من 48 إجابة، ذلك يعني اثنتين وعشرين درجة صحيحة إضافية لـ Engine 2.0 مقارنةً بـ GPT 5.6 sol. بعبارة أخرى، يرتكب Engine 2.0 أخطاء تقييم أقل بنسبة 71% من GPT 5.6 sol، وأقل بنسبة 70% من GPT 5.5، وأقل بنسبة 73% من GPT 5.6 luna، وأقل بنسبة 66% من GPT-4o mini.

أعطت ثلاث محاولات منفصلة للاختبار البسيط GPT 5.6 sol نسب 31% و40% و35%، وGPT 5.5 نسب 35% و42% و33%. هذا التباين بين المحاولات هو بذاته نتيجة مهمة: اطلب من ChatGPT تقييم النص نفسه في يومين مختلفين، وستحصل غالبًا على درجتين مختلفتين. سجّل Engine 2.0 نسبة 81.3% في كل من محاولاته الثلاث.

أين تتسع الفجوة: مستوى الدرجة تلو الآخر

الرقم الإجمالي يُخفي أين تقع الأخطاء. المقيّم الممتاز على الإجابات الضعيفة والعاجز على القوية جيّد للمبتدئ ومؤذٍ فعليًا لمن يسعى إلى درجة 10. لذا فهذه نتائج الاختبار البسيط بحسب المستوى الموثّق.

الإجابات من المستوى الأدنى (الدرجة الموثّقة 4 أو 5)

16 إجابة من مجموعة الاختبار المحجوزة، طلب بسيط، متوسط ثلاث محاولات. معظم الزلات هي درجة 3.

88%

Prepamigo Engine 2.0

75%

GPT-4o mini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

في الإجابات الضعيفة، يتصدر Engine 2.0 بنسبة 88%. يليه GPT-4o mini بنسبة 75%، وهو المكان الوحيد الذي تعمل فيه عادته في التقييم المنخفض لمصلحته. أما نماذج GPT الثلاثة الأكبر فعند 52% إلى 54%: في نحو نصف الأحيان يقيّمون الإجابة من مستوى 4 أو 5 بدرجة 3، وهو المستوى الخاطئ حتى وإن كان الاتجاه مفهومًا. المبتدئ الذي يستخدم ChatGPT للتقييم سيُقال له إنه أضعف من واقعه في نحو نصف الأحيان.

الإجابات من المستوى المتوسط (الدرجة الموثّقة 7 أو 8)

16 إجابة من مجموعة الاختبار المحجوزة، طلب بسيط، متوسط ثلاث محاولات. الزلات تقريبًا كلها درجة 5 أو 6.

85%

Prepamigo Engine 2.0

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

المستوى المتوسط هو حيث تنهار نماذج GPT مع الطلب البسيط. يقف Engine 2.0 عند 85%؛ وGPT-4o mini عند 44%؛ وGPT 5.5 وGPT 5.6 sol وluna بين 27% و29%. تحتوي الإجابات من المستوى المتوسط على مزيج حقيقي من نقاط القوة والضعف يجب وزنها، ومع غياب أمثلة معايرة للموازنة، ترى نماذج GPT نقاط الضعف وتمنح درجة 5 أو 6. سيسمع المتحدث من مستوى 7 أو 8 الذي يسأل GPT 5.6 sol عن درجة المستوى الصحيح في أقل من ثلاث من كل عشر مرات.

الإجابات من المستوى الأعلى (الدرجة الموثّقة 10 فأعلى)

16 إجابة من مجموعة الاختبار المحجوزة، طلب بسيط، متوسط ثلاث محاولات. معظم الزلات تقريبًا هي درجة 7 أو 8.

71%

Prepamigo Engine 2.0

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

في القمة، يتعرّف Engine 2.0 على 71% من الإجابات من المستوى الأعلى. يتعرّف GPT 5.5 على 27%، وGPT 5.6 sol على 25%، وGPT-4o mini على 17%، وGPT 5.6 luna على 13%. كل نموذج من GPT يمنح درجة 7 أو 8 لسبع من كل عشر إجابات على الأقل تستحق درجة 10.

فكّر في ما يعنيه ذلك لمرشح قوي. تسجّل ثماني إجابات، وتُفرّغها، وتلصقها في ChatGPT وتطلب درجة، فيخبرك أن ستًا منها بدرجة 7 و8. تستنتج أنك متحدث جيد من المستوى المتوسط ولديك عمل لتقوم به. كنت في مستوى 10 منذ البداية. هذا ليس سيناريو افتراضيًا. هذا ما فعله كل نموذج من GPT في معظم الإجابات من المستوى الأعلى في اختبارنا.

إن كنت تستخدم ChatGPT للتقييم وظلّ يمنحك درجة 7 و8، فلا تصدّقه تلقائيًا. في اختبارنا، كانت الإجابة من المستوى الأعلى أكثر عرضة بثلاث مرات للحصول على 7 أو 8 من GPT 5.6 sol مما تحصل على درجة في مستواها الصحيح.

ماذا لو أعطينا ChatGPT إجراءنا الكامل؟

من المغري قراءة أرقام الاختبار البسيط على أنها دليل ضعف عائلة GPT. لكن الأمر ليس كذلك. المشكلة ليست في الذكاء. المشكلة أن نموذجًا يُطلب منه رقم، من دون ما يقارن به، يخمّن، وعندما يخمّن يخمّن منخفضًا ونحو الوسط.

فأجرينا الاختبار الثاني. تلقّى كل نموذج من GPT نفس الحزمة التي يتلقاها مقيّمو Engine 2.0: النص المكتوب، والمهمة، ومثالان حقيقيان للمعايرة عند كل مستوى لتلك المهمة بالذات، وتعليمات بتسمية أقرب مثال لكل من الأبعاد الأربعة بدلاً من إعطاء رقم. حصل كل نموذج أيضًا على ملاحظة معايرة قصيرة مصممة لنزعاته الخاصة.

مع إجرائنا الكامل: نسبة الإجابات التي حصلت على الدرجة الموثّقة

نفس 48 إجابة من مجموعة الاختبار المحجوزة. قيّم كل نموذج من GPT كل إجابة مرة واحدة بنفس النصوص والتعليمات وأمثلة المعايرة التي يتلقاها مقيّمو Engine 2.0 الخاصون بنا.

81%

Prepamigo Engine 2.0

71%

GPT 5.6 sol

69%

GPT 5.5

63%

GPT 5.6 luna

50%

GPT-4o mini

أمثلة المعايرة تصنع فرقًا هائلًا. يتضاعف GPT 5.6 sol تقريبًا، من 35% إلى 71%. يرتفع GPT 5.5 من 37% إلى 69%، وluna من 31% إلى 63%. GPT-4o mini بالكاد يتحرك، من 45% إلى 50%، لأنه يستمر في تقييم كل شيء منخفضًا بغض النظر عن ما يُعرض عليه؛ ومع الإجراء الكامل لم يتعرّف على أي إجابة من المستوى الأعلى على الإطلاق. هذا يوضح أين تقع القيمة الحقيقية في مقيّم مصمم خصيصًا لهذا الغرض: ليس في نموذج أذكى، بل في أمثلة حقيقية عن شكل كل مستوى في كل مهمة بعينها، وفي سؤال يفرض على النموذج المقارنة بدلاً من التخمين.

ومع ذلك، يظل كل نموذج من GPT متأخرًا. مع الإجراء الكامل، يتأخر GPT 5.6 sol عن Engine 2.0 بعشر نقاط إجمالًا، وبعشر نقاط في المستوى المتوسط (75% مقابل 85%)، وبثماني نقاط في القمة (63% مقابل 71%). عادته المتبقية هي المبالغة في تقدير الطلاقة: الإجابة الجيدة من مستوى 8 بأداء صوتي سلس تُرفع إلى 9 أو 10. أما GPT 5.6 luna فيفعل العكس، فيسحب الإجابات المتوسطة نحو 5، وينتهي في المستوى المتوسط عند 44%. نموذج واحد يقوم بتمريرة واحدة لا يزال يحمل انحيازًا مميزًا، ويُغلق Engine 2.0 الفجوة المتبقية بمقيّمين مستقلين من مزودين مختلفين، وثلاثة تصويتات من كل منهما مع الاحتفاظ بالتصويت الأوسط، وقاعدة تسوية تأخذ الدرجة الأعلى عندما يختلف المقيّمان بشدة.

جرّبنا أيضًا الحل السريع الواضح: الاحتفاظ بالطلب البسيط وإضافة تعليمات مثل «لا تنحرف نحو الوسط» أو «إجابة المستوى 9 لا يلزم أن تكون خالية من العيوب». لم تُحدث تغييرًا يُذكر. ما ينجح هو تغيير السؤال، وإعطاء النموذج شيئًا حقيقيًا للمقارنة معه.

فجوة سير العمل: سجّل وانطلق، أو قم بكل شيء بنفسك

أرقام الدقة تفترض أن التقييم يحدث فعليًا. مع ChatGPT، يقع كمّ مفاجئ من العمل بين الضغط على زر الإيقاف في تسجيلك وقراءة درجة، وبعض ذلك العمل يغيّر الدرجة نفسها.

أولًا، تحتاج إلى نص مكتوب. الوضع الصوتي لـ ChatGPT هو محادثة، لا مقيّم؛ لتقييم إجابة مسجّلة تحتاج إلى نص. هذا يعني إما كتابة ما قلته يدويًا، وهو ما يغيّره، أو تمرير التسجيل عبر أداة تفريغ صوتي. ويجب أن يكون النص حرفيًا تمامًا. كل كلمة حشو، وكل إعادة انطلاق، وكل تصحيح ذاتي يجب أن يبقى. عندما اختبرنا نصًا «منظّفًا» بإزالة التوقفات المتردّدة، انخفضت الدقة بخمس عشرة نقطة، لأن تلك التوقفات هي بالضبط الدليل الذي يحتاجه المقيّم للحكم على شكل الإجابة صوتيًا. معظم أدوات التفريغ الاستهلاكية، بما فيها الأداة المدمجة في معظم الهواتف، تُنظّف النص تلقائيًا.

ثانيًا، تحتاج إلى المهمة نفسها. يمكن لـ ChatGPT ابتكار مهمة على طراز CELPIP إن طلبت منه، لكنه يخمّن بشأن الصيغة والتوقيت ونوع السيناريو الذي يستخدمه الاختبار الحقيقي. لن تعرف هل المهمة التي كتبها تشبه ما ستواجهه.

ثالثًا، إن كنت تريد نتيجة أفضل من أرقام الاختبار البسيط، تحتاج إلى أمثلة معايرة: إجابات حقيقية عند كل مستوى لنفس نوع المهمة، بمستويات موثّقة. هذا هو المدخل الذي ضاعف دقة GPT 5.6 sol في اختبارنا، وهو ما لا يستطيع الطالب إنتاجه في المنزل.

رابعًا، تفعل كل ذلك من جديد للإجابة التالية، وكل واحدة تُحسب من حد رسائلك.

في Prepamigo، تختار مهمة من البنك، ويبدأ المؤقّت، وتتحدث، وبعد نحو عشر ثوانٍ من التوقف تظهر الدرجة والملاحظات على الشاشة. التفريغ حرفي بحكم التصميم، وأمثلة المعايرة مُرفقة بالمهمة تلقائيًا، ولا شيء تلصقه ولا شيء تكتب تعليمة له. تكلّفك الإجابة الحادية عشرة في المساء نفس الجهد الذي تكلّفك به الإجابة الأولى.

الاتساق: نفس الإجابة، نفس الدرجة

الدرجة التي لا يمكنك إعادة إنتاجها ليست قياسًا. إن حصل نفس التسجيل على 8 يوم الإثنين و10 يوم الثلاثاء، فأنت لم تتعلم شيئًا عن مستوى محادثتك. لذا اختبرنا الاتساق مباشرة.

أُجري Engine 2.0 على الـ48 إجابة المحجوزة ثلاث مرات منفصلة في أيام مختلفة. سجّل 81.3% في كل مرة. عند النظر إلى الإجابات الفردية، حصلت 87.5% منها على درجة متطابقة تمامًا عبر الثلاث محاولات، ولم تتحرك سوى 4.2% منها بمقدار نقطتين أو أكثر، وكلها إجابات تقع على الحدود بين مستويين.

تحرّك الاختبار البسيط على GPT 5.6 sol بتسع نقاط بين أفضل محاولاته وأضعفها. فجوة الاستقرار هذه تأتي من التصويت. يصوّت كل مقيّم في Engine 2.0 ثلاث مرات على كل إجابة ويُحتفظ بالتصويت الأوسط. عندما اختبرنا نفس التكوين بتصويت واحد بدلاً من ثلاثة، انخفض تطابق الدرجات بين المحاولات من 87.5% إلى 77%، وتضاعفت نسبة الإجابات التي تتحرك بنقطتين أو أكثر. محادثة واحدة مع ChatGPT هي تصويت واحد. تحققنا أيضًا هل يجعل ضبط بذرة عشوائية ثابتة عبر واجهة برمجة التطبيقات نماذج GPT أكثر ثباتًا. لم يفعل؛ بل انخفض الثبات فعليًا على GPT 5.6 luna.

ملاحظات يمكنك التصرف بموجبها

ChatGPT شارح جيد. إن سألته عن سبب درجة ما، سيخبرك بتفصيل، بلغة إنجليزية واضحة، ويقترح تحسينات. لطالب يريد التحدث في تفاصيل إجابته، هذا أمر ذو قيمة فعلية.

الخطر هو أن الشرح الفصيح ليس بديلًا عن التشخيص الدقيق. النموذج الذي قيّم إجابة من مستوى 10 بدرجة 7 سيشرح، بشكل مقنع، سبب كونها 7. سيجد شيئًا يشير إليه. وبسبب أنه لم يُلزم بالاستدلال على الأدلة قبل التقييم، فإن الشرح يُكتب بعد اتخاذ القرار لتبرير رقم اختاره مسبقًا.

يعمل Engine 2.0 بالاتجاه المعاكس. على كل مقيّم الإشارة إلى دليل لكل بُعد قبل تسمية مستوى، وتُكتب الملاحظات من ذلك الدليل. تقتبس كلماتك بنفسها: في مراجعة لـ158 اقتباسًا عبر عيّنة من الملاحظات، ظهر 157 منها حرفيًا في النص المكتوب. وعندما قارن نموذج تحكيم مستقل ملاحظات Engine 2.0 بملاحظات نظامنا السابق على نفس الإجابات، من دون معرفة أيهما أيهما، فضّل Engine 2.0 في 20 من أصل 24 مقارنة، سواء عند الحكم كممتحن أو كطالب.

تحققنا أيضًا من أن الملاحظات تضع الانتقاد في المكان الصحيح، بأخذ إجابات قوية وإضرار بُعد واحد فيها في كل مرة. في ثلاث من أصل أربع حالات كان البُعد المُضرَّر هو البُعد الذي انخفضت درجته أكثر من غيره. هذا نوع من الفحص لا يستطيع روبوت محادثة تجاوزه بسهولة، لأنه ليس لديه أبعاد ثابتة يُفحص في ضوئها.

كم تكلفة التدرب يوميًا

الدرجة في المحادثة أكثر فائدة عند إجابتك الأربعين، لا الرابعة. عندها تبدأ في إخبارك هل تغيير طريقة حديثك يعمل فعليًا. فالسؤال العملي هو تكلفة استخدام كل أداة بكثرة.

سعر ChatGPT Plus هو US$20 شهريًا، أي نحو CA$28، بفاتورة شهرية، حسب ما نُشر في سبتمبر 2026. يعطيك عائلة GPT 5.6 بحدّ على الرسائل لكل نافذة متجددة؛ والنصوص الطويلة المصحوبة بأمثلة معايرة هي بالضبط نوع الرسالة التي تستهلك كثيرًا من هذا الحد، وعندما تصل إليه تنتظر أو تنتقل إلى نموذج أصغر. أما ChatGPT Pro، بسعر US$200 شهريًا، أي نحو CA$276 قبل الضريبة، فيرفع الحدود بشكل كبير. الفئة المجانية توجّه معظم حركتها إلى نماذج أصغر، وفي هذا الاختبار لم يتعرّف أصغرها تقريبًا على أي إجابة من المستوى الأعلى. لا تشمل أي من الباقات بنك أسئلة، أو مؤقتًا، أو تفريغًا صوتيًا حرفيًا، أو أمثلة معايرة، أو أي شيء خاص بـ CELPIP.

سعر Prepamigo هو CA$24.98 شهريًا، أو CA$8.25 شهريًا في الباقة السنوية، وهو CA$98.98 للسنة، شامل الضريبة، ويمكنك الإلغاء في أي وقت. تشمل كل باقة تقييمًا غير محدود من Engine 2.0 من دون حد يومي أو جلسة أو أسبوعي، ومحاولات غير محدودة، وبنك الأسئلة الكامل: 80 مجموعة تدريب كاملة وأكثر من 2,000 مهمة تدريبية عبر أقسام المحادثة والكتابة والقراءة والاستماع، مكتوبة لتتبع أنواع المهام والتوقيت والصيغة في اختبار CELPIP العام.

بعبارة مبسطة: بأقل من سعر ChatGPT Plus، تحصل على مقيّم أدق بأكثر من مرتين في مقارنة بسيطة، لا يطلب منك الانتظار أبدًا، ويأتي بالأسئلة وأمثلة المعايرة جاهزة مسبقًا.

عندما يكون ChatGPT الأداة الأفضل

هذا ليس مقالًا يدعوك لعدم فتح ChatGPT أبدًا أثناء التحضير لـ CELPIP. قد يستخدم المرشح الجاد كلا الأداتين معًا.

  • التحدث في تفاصيل إجابة. إن كنت تريد فهم سبب ضعف سبب معيّن أو ابتكار ثلاثة أسباب أفضل، فالمحادثة هي الشكل المناسب. يمنحك Engine 2.0 حكمًا ودليلًا؛ ولا يتحدث معك.
  • المفردات والصياغة. طلب خمس طرق أكثر طبيعية للتعبير عن شيء سريع ومفيد.
  • التحدث إلى شيء يجيبك صوتيًا. الوضع الصوتي لـ ChatGPT وسيلة معقولة للتعوّد على التحدث بالإنجليزية بصوت مرتفع. ليس مقيّمًا، لكنه رفيق جيد.
  • تدريب الكتابة. الإجابات المكتوبة لا تحتاج إلى تفريغ صوتي، فتصبح فجوة سير العمل أصغر. لم تكن دقة GPT في الكتابة جزءًا من هذا الاختبار، ولا نقدّم أي حكم عليها.
  • أي شيء خارج الاختبار. ChatGPT مساعد عام وPrepamigo ليس كذلك.

ما لا ينبغي أن يكون ChatGPT، بحسب الأدلة هنا، هو الشيء الذي يخبرك إن كنت جاهزًا. لذلك تريد مقيّمًا بُني خصيصًا لهذا الغرض، واختُبر على إجابات لم يرها، وقُيس مستوى تلو الآخر.

ما الجديد في ملاحظاتك

يأتي Engine 2.0 بطبقة ملاحظات أُعيد بناؤها بالكامل. فهي تقرأ أدلة المُقيِّمين الاثنين، لا الدرجة فقط، وقد اختُبرت مع ثلاثة أنواع من الطلاب: من يواجه CELPIP لأول مرة، ومن لديه إنجليزية ضعيفة ويبحث عن الحيلة السريعة، ومن لديه نصف ساعة يوميًا واختبار الأسبوع القادم. وهذا ما تغيّر.

  • كلماتك أنت، تُعاد إليك بين علامتي تنصيص. تستشهد كل نقطة ملاحظات بالعبارة الدقيقة من نص إجابتك التي تفاعل المُقيِّمون معها. وإذا وُضعت عبارة بين علامتي تنصيص، فهي مُقتبَسة حرفيًا؛ وفي تدقيقنا كانت 157 من 158 اقتباسًا كذلك. لا تبتكر الملاحظات أبدًا شيئًا لم تقله.
  • شيء واحد تصلحه أولًا. تحصل كل إجابة على خطوة واحدة رئيسية: التغيير الوحيد الذي سيرفع درجتك أكثر من غيره، مكتوبًا بأبسط الكلمات في الصفحة. يليه إجراءان عمليان آخران، ثم قائمة تحقق من ثلاثة عناصر تراجعها في ذهنك قبل أن تبدأ الكلام.
  • نصيحة تلائم المهمة. تُقيَّم مهام مثل إعطاء نصيحة، أو وصف مشهد، أو إقناع شخص ما، بناءً على معايير مختلفة. تعرف الملاحظات الآن ما تُثيبه كل واحدة من أنواع المهام الثمانية وتتحدث إلى ذلك بالتحديد، بدلًا من تكرار نفس النصائح العامة في كل المهام.
  • أي بُعد تتدرّب عليه أولًا. تخبرك الملاحظات بأي الأبعاد الأربعة هو الأضعف عندك وأيها الأقوى، لتعرف أين تكمن نقطتك التالية، دون أن يُحجب ذلك خلف رقم.
  • ما طلبته المهمة وفوّتَه. بالنسبة لتحقيق المهمة، تسرد الملاحظات الأجزاء المحددة من السؤال التي لم تتناولها، أو تذكر بوضوح أنك تناولتها جميعًا.
  • أمور يمكنك التدرّب عليها بالفعل. كل توجيه عملي هو شيء يمكنك أن تقوله بصوت مرتفع قبل محاولتك التالية. لا نصيحة بالتحدث بوضوح أكبر أو تقليل لكنتك: فاللكنة ليست ما يقيسه معيار سهولة الاستماع، ولا تعلّق الملاحظات عليها أبدًا.
  • لا لوم على المؤقّت. الإجابة التي يقطعها المؤقّت بعد أن أكملت المهمة لا تُخصم منها درجات لأجل ذلك القطع، ولا تُعنّفك الملاحظات على ذلك.

عندما قارن نموذج تحكيم مستقل هذه الملاحظات بما أنتجه نظامنا السابق لنفس الإجابات، دون أن يعرف أيّهما أيّ، فضّل الملاحظات الجديدة في 20 من 24 مقارنة، سواء عند التقييم بمنظور ممتحن أو بمنظور طالب.

الأسئلة الشائعة

هل يمكن لـ ChatGPT تقييم محادثتي في CELPIP؟ سيعطيك رقمًا. عند الطلب البسيط على 48 إجابة لم تُر من قبل وذات درجات موثّقة، كان GPT 5.6 sol صحيحًا في 35% من الحالات، وGPT 5.5 في 37%، وluna في 31%، وGPT-4o mini في 45%، مقابل 81% لـ Engine 2.0. وفي الإجابات من المستوى الأعلى كان GPT 5.6 sol صحيحًا في 25% من الحالات.

هل Prepamigo أدق من ChatGPT؟ 81% مقابل 35% لـ GPT 5.6 sol عند الطلب البسيط. مع إجرائنا الكامل وأمثلة المعايرة، ارتفع GPT 5.6 sol إلى 71%، وبقي متأخرًا بعشر نقاط.

كم تكلفة كل خيار؟ سعر ChatGPT Pro هو US$200 شهريًا، أي نحو CA$276 قبل الضريبة؛ وPlus هو US$20 بحدود رسائل. سعر Prepamigo هو CA$24.98 شهريًا شامل الضريبة، أو CA$8.25 شهريًا في الباقة السنوية، مع تقييم غير محدود و80 مجموعة تدريب.

أي نموذج من GPT يجب أن أستخدمه إن كنت سأستخدم ChatGPT؟ مع الطلب البسيط، لا يؤدي أي منها بشكل جيد. مع أمثلة المعايرة، GPT 5.6 sol. لا تستخدم GPT-4o mini أبدًا إن كنت قريبًا من مستوى 10.

للمقارنة نفسها مقابل Claude، اقرأ Prepamigo مقارنةً بـ Claude. ولرؤية لوحة الترتيب الكاملة لثمانية أنظمة، اقرأ أي ذكاء اصطناعي يقيّم محادثة CELPIP بدقة أكبر. أو تخطَّ التفريغ الصوتي وسجّل إجابة. يمكنك أيضًا اقرأ هذا الدليل بالإنجليزية.

Prepamigo مقارنةً بـ ChatGPT لمحادثة CELPIP: الدقة والحدود والتكلفة | PrepAmigo