مقيّم الكتابة في Prepamigo على 36 مقالًا رسميًا
نسبة المقالات التي قُيّمت داخل المستوى الموثّق، إجمالًا وبحسب المستوى. اثنا عشر مقالًا لكل مستوى عبر مهمتي الكتابة؛ المقالات النموذجية الستة التي يستخدمها المقيّم للمعايرة مستبعدة.
86%
الإجمالي
75%
ضعيف (4–5)
100%
متوسط (7–8)
83%
قوي (+10)
Prepamigo مقارنةً بأشهر باقات روبوتات المحادثة
بالدولار الكندي. أسعار Prepamigo شاملة الضريبة. تم تحويل Claude Max (بدءًا من US$100) و ChatGPT Pro (US$200) بسعر 1.38، قبل الضريبة. الدقة هي نسبة المقالات الرسمية الـ36 التي حصلت على الدرجة الموثّقة عند طلب تقييم المقال من النموذج المذكور بكلمات بسيطة؛ محاولة واحدة.
هذا هو السؤال الصحيح الذي يجب طرحه على أي أداة تدريب، ومعظم الأدوات لا تجيب عنه. درجة الكتابة لا تساوي شيئًا إلا إن أخبرتك بما سيقوله مقيّم حقيقي، والطريقة الوحيدة لمعرفة هل تفعل ذلك هي القياس. لذا فهذا المقال هو القياس، موضوعًا بوضوح، بما فيه الأجزاء التي تُجملنا والأجزاء التي لا تفعل.
الجواب في فقرة واحدة: في 36 إجابة كتابة رسمية من CELPIP، كل واحدة بدرجة موثّقة بشكل مستقل، حصل مقيّم الكتابة في Prepamigo على المستوى الموثّق في 86% من الحالات. أصاب في كل مقال من المستوى المتوسط، وفي 75% من المقالات الضعيفة و83% من القوية. وأنتج النتيجة نفسها، بفارق مقال واحد زيادة أو نقصانًا، في ثلاث محاولات منفصلة. عند الطلب بكلمات بسيطة لتقييم نفس المقالات، بلغ أفضل نموذج متقدم، GPT 5.6 sol، نسبة 78%؛ وبلغت نماذج Claude نسبتي 61% و56%.
فيما يلي ماذا تعني الأرقام عند كل مستوى، وأين تقع الأخطاء وفي أي اتجاه، ومدى استقرار الدرجة، وكيف تُقارَن بروبوتات المحادثة التي قد تستخدمها بدلًا منها، وما الجديد في الملاحظات، وكيف تقرأ درجتك في ضوء كل ذلك.
ماذا تعني «الدقة» هنا
نحن لا ندّعي أن درجة Prepamigo تتنبأ بنتيجة اختبارك. لا يمكن لأي أداة تدريب أن تعد بذلك. ما نقيسه أضيق وأصدق: إذا أُعطي المقيّم مقالًا وُثّقت درجته بشكل مستقل، كم مرة يُنتج درجة عند المستوى نفسه؟
تُبلَّغ درجة الكتابة في CELPIP على مقياس يصل إلى 12، والدرجات الموثّقة في بياناتنا المرجعية تأتي في ثلاثة نطاقات: ضعيف، أي 4 أو 5؛ ومتوسط، أي 7 أو 8؛ وقوي، أي 10 فأعلى. نعدّ المقيّم صائبًا عندما تقع درجته داخل النطاق الموثّق. المقال القوي المقيَّم بدرجة 10 أو 11 أو 12 صحيح؛ والمقيَّم بدرجة 9 زلة، وإن كانت زلة قريبة.
الدقة عند كل مستوى
المقالات الضعيفة: 75%. تسعة من اثني عشر داخل النطاق. الزلات الثلاث كلها ذهبت درجة واحدة أعلى من اللازم: مقالان قُيّما بدرجة 6 وواحد بدرجة 7. كان كل منها قصيرًا وهزيلًا لكن مرتبًا، بقليل من الأخطاء، واشترى له الترتيب نقطة لم يستحقها على المحتوى. هذا هو الخطأ المميز للمقيّم عند الطرف الأدنى، وهو خطأ كريم: يُقال للكاتب الضعيف إنه أفضل قليلًا مما هو عليه، ولا يُقال له أسوأ أبدًا.
المقالات المتوسطة: 100%. اثنا عشر من اثني عشر داخل نطاق 7 إلى 8، في المحاولات الثلاث كلها. هذا هو المستوى الذي يقف عنده معظم المرشحين والمستوى الذي يحسم معظم أهداف الهجرة، وهو حيث يكون المقيّم أقوى ما يكون. وهو أيضًا حيث يكون كل روبوت محادثة اختبرناه أضعف ما يكون، لأسباب يشرحها قسم المقارنة.
المقالات القوية: 83%. عشرة من اثني عشر. كلتا الزلتين كانتا درجة 9، درجة واحدة تحت. المقال القوي في CELPIP ليس خاليًا من العيوب، ويقرأ المقيّم أحيانًا زلة واحدة زيادة عن اللازم. لم تكن أي من الزلتين درجة 7 أو 8؛ فالمقال القوي لا يُقال له أبدًا إنه متوسط.
بحسب المهمة، كان المقيّم محقًا في 89% من إجابات البريد الإلكتروني و83% من إجابات الاستبيان. إجابات الاستبيان أصعب تصنيفًا لأن المهمة تكافئ موقفًا واضحًا وأسبابًا مطوَّرة، والإجابة التي تتردد بين الخيارين تُعاقَب بالقاعدة.
في أي اتجاه تذهب الأخطاء
المقيّم الذي يخطئ في 14% من الحالات يمكن أن يخطئ بطريقة غير مؤذية أو بطريقة مؤذية. المؤذية أن يُقال للمرشح الذي يحتاج إلى 8 إنه حصل عليها وهو لم يحصل. وغير المؤذية أن يُقال له إنه أقل بنقطة وهو ليس كذلك؛ فذلك يكلّف أسبوعًا من التدريب ولا شيء غير ذلك.
من زلات المقيّم الخمس على 36 مقالًا، كانت ثلاث منها مقالات ضعيفة قُيّمت بدرجة 6 أو 7 واثنتان مقالات قوية قُيّمت بدرجة 9. لم يُقيَّم أي مقال من المستوى المتوسط عاليًا، ولم يُقيَّم أي مقال ضعيف قويًا. عمليًا: إن قال المقيّم إنك بلغت المستوى المتوسط، فقد بلغته، أو أنت أقل بنقطة واحدة. وإن قال إنك بلغت المستوى القوي، فقد بلغته. المكان الوحيد الذي يجامل فيه هو الأسفل، حيث يمكن للمقال القصير المرتب أن يلتقط نقطة لم يستحقها.
قارن ذلك بروبوتات المحادثة على المقالات نفسها. سمّى Claude Opus 5 سبعة مقالات من المستوى المتوسط درجة 9 أو 10، وهذا هو الاتجاه المؤذي للمرشحين الذين يتأثرون به أكثر. وسمّى GPT 5.6 sol ثلاثة مقالات من المستوى المتوسط درجة 6، وهذا هو الاتجاه غير المؤذي، وحبس ثلاثة مقالات قوية عند درجة 9. رقم دقة المقيّم يخبرك كم مرة يخطئ؛ والاتجاه يخبرك ماذا يكلّفك حين يخطئ.
البريد الإلكتروني مقابل الاستبيان
قُسّمت المقالات الـ36 بين مهمتي الكتابة، وكان أداء المقيّم أفضل قليلًا على مهمة البريد الإلكتروني، عند 89%، منه على إجابة الاستبيان، عند 83%. هذه زلة واحدة إضافية في جانب الاستبيان، وهي في الاتجاه الذي تتوقعه.
تُقيَّم إجابات البريد الإلكتروني إلى حد كبير على التغطية: هل تناولت النقاط المطلوبة، وهل النبرة مناسبة للقارئ، وهل هناك تحية وخاتمة. تلك أمور يفحصها المقيّم بالقاعدة قبل إصدار أي حكم، فالبريد الإلكتروني الذي يحتويها يُصنَّف بشكل موثوق. أما إجابات الاستبيان فتُقيَّم على جودة الحجة: موقف واضح وأسباب مطوَّرة لا مسرودة. التطوير حكم، والحكم هو حيث يجد المقيّم، بشريًا كان أم غيره، مجالًا للاختلاف بنقطة.
بالنسبة لك، هذا يعني أن درجة الاستبيان ألين قليلًا جدًا من درجة البريد الإلكتروني. إن كنت تحوم عند حافة هدفك في إجابات الاستبيان، فاكتب اثنتين بدلًا من واحدة قبل أن تقرر أين تقف.
من جانبك من الشاشة
تخبرك نظرة المستوى كيف يؤدي المقيّم على مقال معروف المستوى. أما أنت فتنظر إليه من الجهة المقابلة: لديك درجة وتريد أن تعرف إلى أي حد تصدّقها.
- إن قال 4 أو 5: كان المقال عند المستوى الضعيف تسع مرات من تسع. الدرجة المنخفضة من المقيّم صحيحة.
- إن قال 7 أو 8: كان المقال عند المستوى المتوسط اثنتي عشرة مرة من خمس عشرة؛ والثلاث الأخرى كانت مقالات ضعيفة قُيّمت درجة واحدة أعلى. درجة 7 أو 8 تعني متوسطًا، وربما أقل قليلًا.
- إن قال 10 فأعلى: كان المقال عند المستوى القوي عشر مرات من عشر. درجة 10 من المقيّم هي 10.
- إن قال 9: كلتا درجتي 9 في الاختبار كانتا مقالين قويين موثّقين. درجة 9 هي الدرجة التي يجب قراءتها بعناية: تعني قريبًا من القمة، وعلى بُعد سبب واحد مطوَّر أو اختيار كلمة واحدة دقيقة منها.
هل يحصل المقال نفسه على الدرجة نفسها؟
الدقة من دون اتساق حظ. لذا قيّمنا المقالات الـ36 كلها ثلاث مرات في أيام مختلفة من دون تغيير أي شيء بينها. أعاد المقيّم 86% و89% و86%. كانت نفس مقالات المستوى المتوسط الاثني عشر داخل النطاق في كل مرة، ولم يتحرك أي مقال بأكثر من نقطة واحدة بين المحاولات.
يأتي الاتساق من طريقة تشغيل نموذج التقييم: الاستدلال موقوف، ودرجة حرارة ثابتة، ومقارنة مع عينات مقيَّمة ثابتة بدلًا من حكم حر. بالنسبة لك، يعني ذلك أن التغيّر في درجتك هو تغيّر في كتابتك. إن أعدت كتابة مقال وانتقل من 8 إلى 10، فليس ذلك لأن المقيّم في يوم جيد.
كيف يُقارَن هذا بما قد تستخدمه بدلًا منه
رقم الدقة يعني أكثر حين يكون هناك ما يُقارَن به. لذا أعطينا المقالات الـ36 نفسها لروبوتات المحادثة التي يستخدمها الناس فعليًا لفحص كتابتهم، بالطريقة التي يفعلها شخص عادي: المهمة، والمقال، وطلب بسيط لدرجة من 0 إلى 12.
نسبة المقالات التي قُيّمت داخل المستوى الموثّق
نفس 36 مقالًا رسميًا. طُلب من كل نموذج، بكلمات بسيطة، تقييم المقال؛ وعمل Prepamigo بإعداده الإنتاجي المعتاد.
86%
مقيّم الكتابة في Prepamigo
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
يتقدم المقيّم على أفضل روبوت محادثة بثماني نقاط وعلى نماذج Claude بـ 25 إلى 30. شكل الأخطاء هو ما يهم. على مقالات المستوى المتوسط، Prepamigo عند 100%، وGPT 5.6 sol عند 75%، وGemini 42%، وClaude Sonnet 5 33%، وClaude Opus 5 25%: روبوت المحادثة الذي لا يملك ما يقارن به يقرأ درجة 7 نظيفة عامة على أنها 9، أو درجة 7 عامة فيها بضعة أخطاء على أنها 6. على المقالات القوية، Claude Opus 5 هو فعليًا أفضل مقيّم في الاختبار عند 92% مقابل 83% لـ Prepamigo؛ وهو كريم، وهذا صحيح عند القمة وخاطئ في كل مكان آخر. أعطى GPT-4o mini درجة 9 لتسعة من اثني عشر مقالًا قويًا.
ما يملكه المقيّم ولا تملكه روبوتات المحادثة هو مقالات حقيقية مقيَّمة لنفس المهمة عند كل مستوى ليقارن بها، وطبقة قواعد تفحص النقاط المطلوبة، وموقف الاستبيان، والتحية والخاتمة، والطول قبل أن يبدي أي نموذج رأيه. ذلك هو الفرق بين 86% و78%، وهو يقع كله تقريبًا في وسط المقياس.
ما الجديد في ملاحظات الكتابة
الدرجة ليست سوى نصف ما تحصل عليه. أُعيد بناء طبقة ملاحظات الكتابة جنبًا إلى جنب مع المقيّم، وكل ما فيها مرتبط بنصّك أنت. وهذا ما تغيّر.
- تصحيحات تجدها في مقالك نفسه. يقتبس كل تصحيح في النحو والإملاء والمفردات الكلمات الدقيقة من إجابتك، ليتمكّن التطبيق من تظليلها في المكان الذي كتبتها فيه. وأي شيء لا يجده المدقّق كلمةً بكلمة في مقالك يُحذف قبل أن تراه.
- إجابة نموذجية مبنية من إجابتك. تحصل على نسخة معاد كتابتها من إجابتك تحتفظ بأفكارك، وتغطي كل نقطة مطلوبة، وتقع ضمن 150 إلى 200 كلمة التي تطلبها المهمة. وإذا لم تصل إعادة الكتابة الأولى إلى هذا الطول، تُعاد مرة واحدة قبل عرضها.
- النقطة المطلوبة التي فوّتَها، بالاسم. في مهمة البريد الإلكتروني، تسرد الملاحظات النقاط الواردة في السؤال التي لم تغطّها إجابتك. كما أن تفويت نقطة يُبقي درجة تحقيق المهمة عند 8 أو أقل، فلا تتعارض الدرجة مع الملاحظات أبدًا.
- عامل محدِّد واحد لكل بُعد. لكل بُعد من الأبعاد الأربعة، تسمّي الملاحظات الشيء الوحيد الذي يُبقي تلك الدرجة منخفضة، بعبارات ملموسة، أو تقول بوضوح إنه لا شيء يعيقها وما الذي يرفعها. فالحكم بأن بُعدًا ما لا مشكلة فيه جواب حقيقي، لا فراغ.
- الانتقاد في مكانه الصحيح. النبرة الضعيفة مشكلة في تحقيق المهمة، واختيار الكلمة الغامضة مشكلة في المفردات، والجملة المتصلة بلا توقف مشكلة في سهولة القراءة. تُصنَّف كل نقطة تحت البُعد الذي تنتمي إليه بدلًا من حشرها في الملخص العام.
- إعادة كتابة على مستوى الجملة. تعود إليك جمل محددة من مقالك بنسخة محسّنة وسطر واحد عن سبب كونها أفضل، لترى التغيير بدلًا من أن تقرأ عنه.
- أقوى أبعادك وأضعفها، جنبًا إلى جنب. تخبرك الملاحظات بأي الأبعاد الأربعة يرفع درجتك وأيها يعيقها، لتعرف ما تتدرّب عليه لاحقًا دون فك شفرة أربعة أرقام.
يُفحص كل اقتباس في الملاحظات مقابل مقالك قبل عرضه. وإذا لم يجد المدقّق الكلمات، يُحذف السطر. ولهذا لا تطلب منك الملاحظات أبدًا إصلاح شيء لم تكتبه.
كيف تقرأ درجتك
- درجة 4 أو 5 صحيحة. اقرأ التصحيحات؛ فهي مقتبسة من نصك أنت. ثم اقرأ النقاط المفقودة والإجابة النموذجية، واكتب المهمة نفسها مجددًا.
- درجة 7 أو 8 متوسطة، وربما أقل قليلًا. انظر إلى العامل المحدِّد لكل بُعد. ذلك الذي يسمّي مشكلة ملموسة هو الذي يجب العمل عليه.
- درجة 9 قريبة. قارن مقالك بالإجابة النموذجية فقرة فقرة. الفجوة عادةً سبب واحد غير مطوَّر أو اختيار كلمة واحدة عامة.
- درجة 10 فأعلى هي 10. أنت جاهز في نوع المهمة هذا. انتقل إلى النوع الذي تتجنبه.
- ثق بالتغيّرات أكثر من المستويات. لأن الدرجة مستقرة، فالتغيّر عبر المحاولات على المهمة نفسها هو تغيّر في كتابتك.
روتين تدريب يستفيد من الرقم
الغاية من درجة دقيقة ومستقرة أن تتوقف عن التشكيك فيها وتبدأ باستخدامها. إليك الروتين الذي نقترحه، مبنيًا حول ما تقوله الأرقام في هذه الصفحة عما يمكن للدرجة أن تخبرك به وما لا يمكنها.
- اكتب بريدًا إلكترونيًا واحدًا وإجابة استبيان واحدة، من دون تحضير. لا تنظر إلى الإجابة النموذجية أولًا. أرسل كليهما. الدرجتان معًا هما مستوى البداية لديك؛ وإن اختلفتا بأكثر من نقطة، فالأدنى هي المهمة التي يجب التدرب عليها.
- اقرأ النقاط المفقودة والعامل المحدِّد قبل التصحيحات. التصحيحات تصلح الجمل؛ والنقاط المفقودة والعوامل المحدِّدة تصلح الدرجات. النقطة المطلوبة المفقودة تساوي أكثر من كل الفواصل.
- أعد كتابة الإجابة نفسها والإجابة النموذجية مفتوحة. احتفظ بأفكارك، واستعر بنيتها. أرسل مجددًا. لأن المقيّم يعطي المقال نفسه الدرجة نفسها، فالفرق بين الإرسالين هو إعادة كتابتك بالكامل.
- انتقل إلى مهمة جديدة عندما تصمد إعادة الكتابة. درجة 10 واحدة في إعادة كتابة ليست مستوى بعد. درجتا 10 في مهمتين مختلفتين هما كذلك.
- اقرأ 9 كإخفاق قريب و6 كدرجة 6 حقيقية. المقيّم لا يسحب المقالات المتوسطة إلى الأسفل. إن قال 6، فالمقال هزيل، والعامل المحدِّد سيقول أين.
الأسئلة الشائعة
ما مدى دقة درجة الكتابة في Prepamigo؟ 86% عند المستوى الدقيق على 36 مقالًا رسميًا: 75% ضعيف، و100% متوسط، و83% قوي. النتيجة نفسها، بفارق مقال واحد زيادة أو نقصانًا، في ثلاث محاولات.
هل هي نفسها درجتي الحقيقية؟ لا يمكن لأي أداة تدريب أن تعد بذلك. ما نقيسه هو كم مرة يتوافق المقيّم مع درجة موثّقة على المقال نفسه.
لماذا حصلت على 9 في مقال قوي؟ هذه هي زلة المقيّم الأكثر شيوعًا عند القمة: اثنان من اثني عشر مقالًا قويًا قُيّما بدرجة 9. أعد الكتابة والإجابة النموذجية بجانبك وقيّم مجددًا.
هل هو أفضل من ChatGPT أو Claude؟ 86% مقابل 78% لـ GPT 5.6 sol و61% و56% لنماذج Claude. على مقالات المستوى المتوسط، 100% مقابل 75% لأفضلها.
لترى كيف يعمل المقيّم، اقرأ داخل مقيّم الكتابة في Prepamigo. ولترى الاختبار نفسه على روبوتات المحادثة الستة كلها، اقرأ أي ذكاء اصطناعي يقيّم كتابة CELPIP بأعلى دقة. أو اكتب إجابة وشاهد الأرقام بنفسك. يمكنك أيضًا اقرأ هذا الدليل بالإنجليزية.
