التقييم

أي ذكاء اصطناعي يقيّم كتابة CELPIP بأعلى دقة؟ اختبرنا سبعة

8 سبتمبر 2026

نسبة المقالات التي قُيّمت عند المستوى الموثّق

36 إجابة كتابة رسمية من CELPIP، 12 لكل مستوى، عبر مهمتي الكتابة. أُعطي كل نموذج المهمة والمقال وطُلب منه، بكلمات بسيطة، تقييمه على مقياس CELPIP. عمل مقيّم الكتابة في Prepamigo بإعداده الإنتاجي المعتاد.

86%

مقيّم الكتابة في Prepamigo

78%

GPT 5.6 sol

69%

GPT 5.6 luna

61%

Gemini

61%

Claude Opus 5

58%

GPT-4o mini

56%

Claude Sonnet 5

Prepamigo مقارنةً بأشهر باقات روبوتات المحادثة

بالدولار الكندي. أسعار Prepamigo شاملة الضريبة. تم تحويل Claude Max (بدءًا من US$100) و ChatGPT Pro (US$200) بسعر 1.38، قبل الضريبة. الدقة هي نسبة المقالات الرسمية الـ36 التي حصلت على الدرجة الموثّقة عند طلب تقييم المقال من النموذج المذكور بكلمات بسيطة؛ محاولة واحدة.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
السعر الشهري
CA$24.98 (شامل الضريبة)
+CA$138 (قبل الضريبة)
CA$276 (قبل الضريبة)
التقييم
غير محدود
محدود
محدود
بنك أسئلة جاهز
نعم
لا
لا
مجموعات تدريب
80
لا يوجد
لا يوجد
مهام تدريب
+2,000
لا يوجد
لا يوجد
صيغة CELPIP
نعم
لا
لا
الدقة
86%
61%
78%
مقالات المستوى المتوسط
100%
25%
75%

كثير من مرشحي CELPIP يفحصون كتابتهم بروبوت محادثة ذكي. تلصق البريد الإلكتروني، وتطلب درجة، وتقرأ الفقرة. في الكتابة الأمر سهل: لا تسجيل ولا تفريغ. ما لا يخبرك به أحد هو كم مرة يكون الرقم صحيحًا، أو أي نموذج تثق به، أو أي الأخطاء يرتكبها كل واحد منها. أردنا أن نعرف، فأعطينا ستة روبوتات محادثة ومقيّمنا نحن نفس 36 مقالًا رسميًا بدرجات موثّقة وعددنا.

النسخة في جملة واحدة: GPT 5.6 sol هو أدق روبوت محادثة لكتابة CELPIP بنسبة 78%، ونماذج Claude هي الأقل دقة بنسبتي 61% و56% لأنها تضخّم مقالات المستوى المتوسط، والمقيّم المخصص، مقيّم Prepamigo، بلغ 86% على المقالات نفسها وأصاب في كل مقال من المستوى المتوسط. ينبغي أن نصرّح مقدمًا بأن Prepamigo منتجنا. حيث تفوّق علينا روبوت محادثة عند مستوى بعينه، نقول ذلك؛ وقد فعل اثنان منها.

لوحة الترتيب

ثلاث فئات ظاهرة في الرسم أعلاه. Prepamigo عند 86% يقف وحده. GPT 5.6 sol عند 78% وGPT 5.6 luna عند 69% يشكّلان فئة ثانية: قابلة للاستخدام، بعادات معروفة. كل ما عداها عند 60% أو قربها، وهذا على مقياس من ثلاثة نطاقات ليس أفضل بكثير من تخمين مطّلع.

النمط مختلف عن المحادثة، حيث أبلت نماذج Claude بلاءً حسنًا وأبلت نماذج GPT بلاءً سيئًا. في الكتابة ينعكس الأمر. نماذج GPT صارمة قليلًا: تسحب درجة 7 عامة إلى 6 وتحبس المقال القوي الذي فيه زلة عند 9. ونماذج Claude كريمة: تدفع درجة 7 عامة إلى 9 أو 10 وتقيّم المقالات الضعيفة الهزيلة بدرجة 3. يتصرف Gemini مثل Claude في الوسط. ويعامل GPT-4o mini درجة 9 على أنها السقف.

النتائج عند كل مستوى

المقالات الضعيفة (الموثّقة 4 أو 5)

12 مقالًا رسميًا لكل نظام.

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

مقيّم الكتابة في Prepamigo

67%

Claude Opus 5

58%

Gemini

50%

Claude Sonnet 5

المقالات الضعيفة هي الطرف السهل من المقياس، وتتعادل نماذج GPT الثلاثة عند 83%، متقدمة على Prepamigo عند 75%. زلات Prepamigo الثلاث ذهبت كلها درجة واحدة أعلى، إلى 6 أو 7، على مقالات قصيرة لكن مرتبة. أما نماذج Claude فتخطئ في الاتجاه الآخر: قيّم Sonnet 5 أربعة من اثني عشر مقالًا ضعيفًا بدرجة 3، مستوى أدنى، وقيّم Opus 5 اثنين منها بدرجة 3. المقال الهزيل الذي يؤدي المهمة مع ذلك هو 4 لا 3، والنموذج الذي لا يملك مثالًا على درجة 4 لا يستطيع التمييز.

المقالات المتوسطة (الموثّقة 7 أو 8)

12 مقالًا رسميًا لكل نظام. المستوى الذي يقف عنده معظم المرشحين.

100%

مقيّم الكتابة في Prepamigo

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

42%

Gemini

33%

Claude Sonnet 5

25%

Claude Opus 5

النطاق المتوسط هو ما يفصل بين المتنافسين. أصاب Prepamigo في الاثني عشر كلها. أصاب GPT 5.6 sol في تسعة، وسحب ثلاثة إلى درجة 6. أصاب GPT-4o mini في ثمانية ودفع أربعة إلى درجة 9. أصاب luna في سبعة، بالسحب إلى الأسفل غالبًا. أصاب Gemini في خمسة ودفع ستة إلى 9 أو 10. أصاب Claude Sonnet 5 في أربعة، موزّعًا الباقي بين 6 و9. أصاب Claude Opus 5 في ثلاثة وأعطى درجة 9 أو 10 لسبعة من الاثني عشر.

إن كنت كاتبًا عند 7 أو 8، ومعظم المرشحين كذلك، فهذا هو الرسم الذي يجب تذكّره. اسأل Claude Opus 5 وسيخبرك في أكثر من نصف المرات أنك انتهيت. اسأل Gemini وسيقول الشيء نفسه في نصف المرات. اسأل GPT 5.6 sol وسيخبرك مرة من كل أربع أنك تراجعت إلى 6.

المقالات القوية (الموثّقة 10 فأعلى)

12 مقالًا رسميًا لكل نظام. كل زلة تقريبًا هي درجة 9.

92%

Claude Opus 5

83%

مقيّم الكتابة في Prepamigo

83%

Gemini

83%

Claude Sonnet 5

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

عند القمة، Claude Opus 5 هو أفضل مقيّم في الاختبار إذ تعرّف على أحد عشر من اثني عشر مقالًا قويًا؛ وأعطى خمسة منها درجة 11. تعرّف Prepamigo وGemini وSonnet 5 على عشرة لكل منها. تعرّف GPT 5.6 sol على تسعة وluna على ثمانية، وحبسا الباقي عند درجة 9. تعرّف GPT-4o mini على ثلاثة وأعطى درجة 9 لتسعة: فهو لا يمنح درجات 10. كرم Claude صحيح هنا وخاطئ في كل مكان آخر؛ وصرامة نماذج GPT خاطئة هنا وصحيحة تقريبًا في غيره.

أيًا كان روبوت المحادثة الذي تستخدمه، درجة 9 على مقال ظننته قويًا هي على الأرجح درجة 10 محبوسة لا درجة 9 حقيقية، إلا إن جاءت من نموذج Claude، وعندها تكون درجة 9 على الأرجح 7 أو 8 رُفّعت. اتجاه الخطأ يعتمد على النموذج.

لماذا تختلف النماذج حول الوسط

مقال CELPIP من المستوى المتوسط شيء محدد: يغطي المهمة، ومنظّم، وفيه أخطاء قليلة تعيق الفهم، وهو عام، بأسباب مذكورة لا مطوَّرة ومفردات آمنة لا دقيقة. المقيّم المدرَّب رأى مئات من هذه ويعرف أين تقع. أما النموذج العام فقد رأى قطعة كتابة مرتبة ومنظّمة وصحيحة في معظمها وعليه أن يقرر من الانطباع. انطباع Claude أن المرتب يعني قويًا. وانطباع GPT أن العام يعني ضعيفًا. كلاهما مخطئ بشأن درجة 7، في اتجاهين متعاكسين.

مقيّم Prepamigo لا يحكم من الانطباع. إنه يقارن المقال بإجابات حقيقية مقيَّمة لنفس نوع المهمة عند كل مستوى، كلها مقالات حقيقية بزلات حقيقية، ويضعه بجانب أكثرها شبهًا به على كل من الأبعاد الأربعة. المقال النظيف لكن العام يقع بجانب العينة المتوسطة، لأن هذا ما هو عليه. وفوق المقارنة تجلس طبقة قواعد للأمور التي يسيء النموذج عدّها: هل غُطّيت كل نقطة مطلوبة، وهل تختار إجابة الاستبيان جانبًا، وهل في البريد الإلكتروني تحية وخاتمة، وما طوله. النقطة المطلوبة المفقودة تُبقي تحقيق المهمة عند 8 أو أقل بغض النظر عن الإنجليزية، لأن هكذا يعمل الاختبار.

جرّبنا أيضًا إعطاء مقيّم الكتابة تصميم المقيّمين الاثنين مع التصويت والتسوية الذي يستخدمه مقيّم المحادثة لدينا. جعل ذلك الكتابة أسوأ، لأن مستويات الكتابة الرسمية لا تبعد سوى نقطتين عن بعضها على مقياس 0 إلى 12 والاختيار الإجباري بين العينات دفع المقالات المتوسطة إلى درجة 9. تحتفظ الكتابة بالتصميم الذي يصيب الوسط.

لماذا الترتيب معكوس عن المحادثة

إن كنت قد قرأت مقارنتنا في المحادثة، فستبدو لوحة ترتيب الكتابة مقلوبة. على نصوص المحادثة كان Claude Opus 5 أفضل روبوت محادثة بنسبة 62% وGPT 5.6 sol أسوأ النماذج الكبيرة بنسبة 35%. وفي الكتابة GPT 5.6 sol عند 78% ونماذج Claude في القاع.

السبب هو ما يكون كل نموذج كريمًا بشأنه. نص محادثة CELPIP هو إنجليزية منطوقة مكتوبة: شذرات، وتكرارات، وتصحيحات ذاتية. يقرأ GPT ذلك على أنه مكسور ويقيّمه بقسوة، وهذا على النص المنطوق خطأ؛ أما Claude فيقرأ من خلاله إلى الأفكار. مقال CELPIP هو العكس: محرَّر، ومنظّم، ومرتب على السطح، وعام غالبًا تحته. يقرأ Claude الترتيب على أنه قوة ويضخّم الوسط؛ ويقرأ GPT المحتوى العام على أنه ضعف ويكون صائبًا تقريبًا، أو أقل بنقطة.

الدرس العملي أنه لا يوجد روبوت محادثة واحد هو الأفضل لـ CELPIP. النموذج الذي يقيّم محادثتك جيدًا هو الذي سيجامل كتابتك، والعكس بالعكس. أما المقيّم المخصص فيتجاوز السؤال بالمقارنة مع عينات مقيَّمة من النوع المناسب لكل مهمة. محرك المحادثة ومحرك الكتابة في Prepamigo نظامان منفصلان بتصميمين مختلفين، لأن المهمتين تفشلان بطريقتين مختلفتين.

الفقرة التي تأتي مع الرقم

يعيد كل روبوت محادثة فقرة ملاحظات مع درجته، وتكون الفقرة عادةً أكثر ثقة مما يستحقه الرقم. ثلاثة أمور تفحصها قبل أن تتصرف بناءً عليها.

  • هل يقتبس كلامك؟ التصحيح الذي لا يشير إلى كلماتك بالضبط قاعدة عامة، لا ملاحظات على مقالك. معظم نصائح روبوتات المحادثة من النوع الذي ينطبق على أي مقال: نوّع بنية جملك، واستخدم مفردات أدق، وطوّر أسبابك. صحيح، وغير قابل للتنفيذ.
  • هل يسمّي النقطة المفقودة؟ إن لصقت المهمة، فالإجابة الجيدة تخبرك أي نقطة مطلوبة لم تغطها. وإن لم تلصقها، فلا يمكن لروبوت المحادثة أن يعرف، وسيمدح التغطية على أي حال.
  • هل يتطابق النقد مع الدرجة؟ كثيرًا ما تسرد فقرة روبوت المحادثة ثلاث أو أربع مشكلات ثم تعطي 10، أو تمدح المقال وتعطي 6. عندما تختلف الكلمات والرقم، لا يُعتمد على أي منهما.

ملاحظات Prepamigo مبنية بالطريقة المعاكسة: يجب على المقيّم اقتباس العبارات التي تدعم درجة كل بُعد قبل أن يعطي الدرجة، والاقتباس الذي لا يمكن العثور عليه في مقالك يُستبعد. تُسرد النقاط المفقودة بالاسم، والنقطة المفقودة تحدّ من درجة تحقيق المهمة، فلا يمكن للكلمات والرقم أن يختلفا. يسرد القسم أدناه ما فيها.

ملاحظات على كل نموذج

  • GPT 5.6 sol. أفضل روبوت محادثة للكتابة بنسبة 78%، وهو الذي تستخدمه إن كنت ستستخدم واحدًا. صارم قليلًا: ثلاثة مقالات متوسطة سُحبت إلى 6، وثلاثة مقالات قوية حُبست عند 9. على المقالات الضعيفة أفضل من Prepamigo، 83% مقابل 75%.
  • GPT 5.6 luna. 69%. الشكل نفسه كـ sol لكن أشد صرامة في الوسط، حيث أصاب في سبعة من اثني عشر. جيد على المقالات الضعيفة.
  • Gemini. 61%. لا بأس به عند الطرفين، ضعيف في الوسط عند 42%، حيث دفع ستة من اثني عشر مقالًا إلى 9 أو 10.
  • Claude Opus 5. 61% إجمالًا لكنه أفضل مقيّم في الاختبار على المقالات القوية بنسبة 92%. في الوسط هو الأسوأ عند 25%، إذ أعطى سبعة من اثني عشر درجة 9 أو 10. إن كانت كتابتك قوية بالفعل، فسيؤكد لك Opus 5 ذلك؛ وإن كانت متوسطة، فسيخبرك Opus 5 أنها قوية.
  • GPT-4o mini. 58%. يعامل درجة 9 على أنها قمة المقياس: تسعة من اثني عشر مقالًا قويًا قُيّمت بدرجة 9. لا تستخدمه لتقييم الكتابة إن كنت قريبًا بأي شكل من درجة 10.
  • Claude Sonnet 5. 56%، الأقل دقة. قيّم أربعة مقالات ضعيفة بدرجة 3 ووزّع النطاق المتوسط بين 6 و9.

إن كنت ستستخدم روبوت محادثة على أي حال

  1. استخدم GPT 5.6 sol. لا نموذج Claude لأي شيء دون المقال القوي، ولا نموذجًا صغيرًا لأي شيء فوق المقال الضعيف.
  2. الصق المهمة كاملة. النقاط المطلوبة لمهمة البريد الإلكتروني وخيارات مهمة الاستبيان تغيّر الدرجة. النموذج الذي لا يعرف النقاط لا يستطيع إخبارك بأن إحداها مفقودة.
  3. اطلب منه فحص النقاط أولًا. اطلب نعم أو لا على كل نقطة مطلوبة، ثم الدرجة. هذه هي طبقة القواعد، يدويًا.
  4. اسأل مرتين، واحتفظ بالإجابة الأدنى. سجّل GPT 5.6 sol نسب 78% و83% و81% في ثلاث محاولات على المقالات نفسها؛ والإجابة الواحدة تحمل بضع نقاط من الحظ.
  5. اقرأ 9 و6 بريبة. من نموذج GPT، درجة 9 غالبًا 10 محبوسة ودرجة 6 غالبًا 7 مسحوبة. ومن نموذج Claude، درجة 9 غالبًا 7 مرفّعة.

المدخل الوحيد الذي لا يمكنك توفيره بنفسك هو مقال حقيقي مقيَّم موثّق لنفس المهمة عند كل مستوى، وهو ما يقارن به المقيّم المخصص. ذلك، وفحص النقاط المطلوبة، هما الفرق بين 78% و86%.

ما الجديد في ملاحظات الكتابة

الدرجة ليست سوى نصف ما تحصل عليه. أُعيد بناء طبقة ملاحظات الكتابة جنبًا إلى جنب مع المقيّم، وكل ما فيها مرتبط بنصّك أنت. وهذا ما تغيّر.

  • تصحيحات تجدها في مقالك نفسه. يقتبس كل تصحيح في النحو والإملاء والمفردات الكلمات الدقيقة من إجابتك، ليتمكّن التطبيق من تظليلها في المكان الذي كتبتها فيه. وأي شيء لا يجده المدقّق كلمةً بكلمة في مقالك يُحذف قبل أن تراه.
  • إجابة نموذجية مبنية من إجابتك. تحصل على نسخة معاد كتابتها من إجابتك تحتفظ بأفكارك، وتغطي كل نقطة مطلوبة، وتقع ضمن 150 إلى 200 كلمة التي تطلبها المهمة. وإذا لم تصل إعادة الكتابة الأولى إلى هذا الطول، تُعاد مرة واحدة قبل عرضها.
  • النقطة المطلوبة التي فوّتَها، بالاسم. في مهمة البريد الإلكتروني، تسرد الملاحظات النقاط الواردة في السؤال التي لم تغطّها إجابتك. كما أن تفويت نقطة يُبقي درجة تحقيق المهمة عند 8 أو أقل، فلا تتعارض الدرجة مع الملاحظات أبدًا.
  • عامل محدِّد واحد لكل بُعد. لكل بُعد من الأبعاد الأربعة، تسمّي الملاحظات الشيء الوحيد الذي يُبقي تلك الدرجة منخفضة، بعبارات ملموسة، أو تقول بوضوح إنه لا شيء يعيقها وما الذي يرفعها. فالحكم بأن بُعدًا ما لا مشكلة فيه جواب حقيقي، لا فراغ.
  • الانتقاد في مكانه الصحيح. النبرة الضعيفة مشكلة في تحقيق المهمة، واختيار الكلمة الغامضة مشكلة في المفردات، والجملة المتصلة بلا توقف مشكلة في سهولة القراءة. تُصنَّف كل نقطة تحت البُعد الذي تنتمي إليه بدلًا من حشرها في الملخص العام.
  • إعادة كتابة على مستوى الجملة. تعود إليك جمل محددة من مقالك بنسخة محسّنة وسطر واحد عن سبب كونها أفضل، لترى التغيير بدلًا من أن تقرأ عنه.
  • أقوى أبعادك وأضعفها، جنبًا إلى جنب. تخبرك الملاحظات بأي الأبعاد الأربعة يرفع درجتك وأيها يعيقها، لتعرف ما تتدرّب عليه لاحقًا دون فك شفرة أربعة أرقام.

يُفحص كل اقتباس في الملاحظات مقابل مقالك قبل عرضه. وإذا لم يجد المدقّق الكلمات، يُحذف السطر. ولهذا لا تطلب منك الملاحظات أبدًا إصلاح شيء لم تكتبه.

الأسئلة الشائعة

أي ذكاء اصطناعي هو الأدق في تقييم كتابة CELPIP؟ بين روبوتات المحادثة، GPT 5.6 sol بنسبة 78%، ثم luna 69%، وGemini وClaude Opus 5 61%، وGPT-4o mini 58%، وClaude Sonnet 5 56%. بلغ مقيّم الكتابة في Prepamigo نسبة 86% على المقالات نفسها.

ChatGPT أم Claude للكتابة؟ ChatGPT، بوضوح: 78% مقابل 61% و56%. تضخّم نماذج Claude مقالات المستوى المتوسط إلى 9 أو 10. Opus 5 هو أفضلها جميعًا على المقالات القوية.

لماذا تعطي مقالي المتوسط درجة 9؟ المرتب والمنظّم يُقرأ قويًا لدى نموذج لا يملك ما يقارن به. يقارن Prepamigo بعينات حقيقية مقيَّمة لنفس المهمة.

كيف أحصل على درجة أفضل من روبوت محادثة؟ استخدم GPT 5.6 sol، والصق المهمة كاملة، واطلب منه فحص كل نقطة مطلوبة أولًا، واسأل مرتين، واقرأ درجات 9 و6 بريبة.

للمقارنتين المباشرتين، اقرأ Prepamigo مقارنةً بـ Claude في الكتابة وPrepamigo مقارنةً بـ ChatGPT في الكتابة. ولمعرفة كيف يعمل المقيّم، اقرأ داخل مقيّم الكتابة في Prepamigo. أو اكتب إجابة وتجاوز التخمين. يمكنك أيضًا اقرأ هذا الدليل بالإنجليزية.

أي ذكاء اصطناعي يقيّم كتابة CELPIP بأعلى دقة؟ اختبرنا سبعة | PrepAmigo