Notation

Voici le moteur de notation du Writing de Prepamigo

8 septembre 2026

Prepamigo Writing Scoring Engine comparé aux modèles de pointe comme correcteurs

Part des réponses écrites du CELPIP dont la note correspond à la note vérifiée de façon indépendante. 36 rédactions officielles, réparties également entre les niveaux faible, moyen et fort et les deux tâches de Writing. Chaque modèle a reçu la tâche et la rédaction et a été invité, en langage simple, à la noter sur l'échelle du CELPIP.

86%

Prepamigo Writing Scoring EnginePrepamigo

78%

GPT 5.6 solOpenAI

69%

GPT 5.6 lunaOpenAI

61%

GeminiGoogle

61%

Claude Opus 5Anthropic

58%

GPT-4o miniOpenAI

56%

Claude Sonnet 5Anthropic

Prepamigo comparé aux meilleurs forfaits de clavardeurs IA

En dollars canadiens. Les prix de Prepamigo incluent les taxes. Claude Max (à partir de US$100) et ChatGPT Pro (US$200) sont convertis au taux de 1,38, avant taxes. La précision correspond à la part des 36 rédactions officielles notées au niveau vérifié lorsque le modèle nommé est invité, en langage simple, à noter la rédaction; un seul essai.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Prix mensuel
CA$24.98 (taxe incl.)
CA$138+ (taxe en sus)
CA$276 (taxe en sus)
Notation
Illimitée
Plafonnée
Plafonnée
Banque de questions prête à l'emploi
Oui
Non
Non
Séries d'exercices
80
Aucune
Aucune
Tâches d'exercice
2,000+
Aucune
Aucune
Format CELPIP
Oui
Non
Non
Précision
86%
61%
78%
Rédactions de niveau moyen
100%
25%
75%

Le correcteur de Writing de Prepamigo a trouvé la note vérifiée sur 86% des rédactions officielles du CELPIP, devant chaque modèle de pointe à qui l’on a confié le même travail, et au niveau moyen, là où se trouvent la plupart des candidats, il a noté chaque rédaction correctement.

Cette page présente le Prepamigo Writing Scoring Engine, le système qui note chaque courriel et chaque réponse au sondage rédigés sur Prepamigo. Ce n’est pas un modèle généraliste à qui l’on demande de corriger. C’est un correcteur conçu pour une seule tâche : placer une réponse écrite du CELPIP au niveau où un correcteur formé la placerait, et expliquer ce placement avec les propres mots de la personne qui écrit.

Le résultat est un correcteur plus précis que n’importe quel modèle de pointe utilisé comme un étudiant l’utiliserait. Sur 36 réponses écrites officielles du CELPIP aux notes vérifiées de façon indépendante, le moteur a trouvé le bon niveau 86% du temps. Invité en langage simple à noter les mêmes rédactions, GPT 5.6 sol a atteint 78%. GPT 5.6 luna a atteint 69%, Gemini et Claude Opus 5 61%, GPT-4o mini 58%, et Claude Sonnet 5 56%.

La précision compte le plus là où se trouvent réellement les candidats. Un 7 ou un 8 est la note réelle de Writing la plus fréquente, et c’est la note qui décide si un objectif a été atteint. Le moteur a placé les douze rédactions de niveau moyen à l’intérieur de cette bande. Le meilleur modèle de pointe en a placé neuf; Claude Opus 5 en a placé trois. Cette page explique comment le moteur note, comment il se compare, ce qui est nouveau dans la rétroaction qui accompagne chaque note, et ce que coûte une pratique sans compter.

Précision par rapport aux notes vérifiées

La question qui nous intéresse est simple. Lorsqu’un étudiant soumet une rédaction, la note à l’écran correspond-elle à celle qu’un correcteur formé aurait donnée? Pour y répondre, nous avons utilisé un ensemble de réponses écrites officielles du CELPIP, chacune avec une note vérifiée de façon indépendante, couvrant les deux tâches de Writing et réparties également entre les niveaux faible, moyen et fort : douze rédactions par niveau, 36 en tout. Les six rédactions modèles que le moteur utilise pour l’étalonnage n’en font pas partie.

Chaque système a vu la même tâche, y compris les points obligatoires de la tâche du courriel et les options de la tâche du sondage, et la même rédaction. Chaque modèle de pointe s’est fait dire qu’il était un examinateur de Writing CELPIP expérimenté et on lui a demandé une seule note de 0 à 12. Le moteur a fonctionné comme il le fait en production. Une note est correcte lorsqu’elle se situe à l’intérieur du niveau vérifié : 4 ou 5 pour une rédaction faible, 7 ou 8 pour une rédaction moyenne, 10 à 12 pour une rédaction forte.

37%

moins d'erreurs que GPT 5.6 sol

5 mauvaises notes sur 36, contre 8.

64%

moins d'erreurs que Claude Opus 5

5 mauvaises notes sur 36, contre 14.

100%

des rédactions de niveau moyen notées correctement

Le meilleur des autres modèles : 75%. Claude Opus 5 : 25%.

Trois choses ressortent. Premièrement, l’écart sur le meilleur modèle de pointe est de huit points, ce qui sur 36 rédactions représente trois notes correctes de plus, et il s’est maintenu à chaque exécution répétée. Deuxièmement, l’écart sur les modèles Claude est de 25 à 30 points, et il se concentre au milieu de l’échelle, là où un modèle généraliste lit une rédaction propre et générique comme une rédaction forte. Troisièmement, la comparaison est celle qui compte pour un étudiant : elle mesure ce que vous obtenez lorsque vous collez une rédaction dans un clavardeur et que vous demandez une note, ce qui est la façon dont presque tout le monde utilise ces modèles.

SystèmeToutes les rédactionsFaiblesMoyennesFortes
Prepamigo Writing Scoring Engine86%75%100%83%
GPT 5.6 sol78%83%75%75%
GPT 5.6 luna69%83%58%67%
Gemini61%58%42%83%
Claude Opus 561%67%25%92%
GPT-4o mini58%83%67%25%
Claude Sonnet 556%50%33%83%

Part des rédactions notées à l’intérieur du niveau vérifié, une seule exécution. Douze rédactions par niveau, donc une rédaction vaut environ huit points dans la vue par niveau et trois points au global.

Performance à chaque niveau

Une moyenne cache où tombent les erreurs. En Writing, pour un modèle généraliste, elles tombent à deux endroits : au milieu, où une rédaction propre mais générique est lue comme forte, et au sommet, où une rédaction forte comportant un seul faux pas est retenue à un 9.

Rédactions faibles · note vérifiée de 4 ou 5

12 rédactions officielles par système.

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

Prepamigo Writing Engine

67%

Claude Opus 5

58%

Gemini

50%

Claude Sonnet 5

Rédactions moyennes · note vérifiée de 7 ou 8

12 rédactions officielles par système. Le niveau où se trouvent la plupart des candidats.

100%

Prepamigo Writing Engine

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

42%

Gemini

33%

Claude Sonnet 5

25%

Claude Opus 5

Rédactions fortes · note vérifiée de 10 ou plus

12 rédactions officielles par système. Presque chaque erreur est un 9.

92%

Claude Opus 5

83%

Prepamigo Writing Engine

83%

Gemini

83%

Claude Sonnet 5

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

Pour les candidats qui forment la majorité des personnes qui passent le test, c’est la différence qui compte. Sur les rédactions de niveau moyen, le moteur a eu raison douze fois sur douze. Le meilleur modèle de pointe a eu raison neuf fois; Claude Opus 5 a eu raison trois fois et a donné un 9 ou un 10 à sept des douze.

Sur les rédactions faibles, les modèles GPT sont à 83% et le moteur à 75%. Les trois erreurs du moteur sont toutes allées un cran trop haut, à un 6 ou un 7, sur des rédactions courtes mais soignées; les erreurs des modèles Claude sont allées dans l’autre sens, en donnant un 3 à des rédactions minces. L’écriture faible est l’extrémité facile de l’échelle pour n’importe qui, et c’est le seul niveau où un clavardeur peut égaler ou battre le moteur.

Au milieu, le moteur est seul à 100%. GPT 5.6 sol a tiré trois rédactions sur douze vers le bas, à un 6. Claude Opus 5 en a poussé sept sur douze vers le haut, à un 9 ou un 10. Gemini en a poussé cinq vers le haut. Une rédaction de niveau moyen couvre la tâche, est organisée et est aussi générique; un modèle sans rien pour comparer la lit à l’impression, et l’impression varie d’un modèle à l’autre. Le moteur la lit par rapport à un vrai 7 noté.

Au sommet, Claude Opus 5 est le meilleur correcteur du test, avec onze rédactions fortes sur douze reconnues contre dix pour le moteur. Claude est généreux, ce qui est juste sur les rédactions fortes et faux sur tout le reste. GPT-4o mini a donné un 9 à neuf des douze : il ne distribue pas de 10.

Constance et stabilité

Un correcteur digne de confiance doit donner la même réponse deux fois. Après l’exécution principale, nous avons noté les 36 rédactions deux fois de plus à des jours différents. Le moteur a obtenu 86%, 89% et 86%, avec les mêmes douze rédactions de niveau moyen à l’intérieur de la bande chaque fois et aucune rédaction ne bougeant de plus d’un point entre les exécutions. GPT 5.6 sol a obtenu 78%, 83% et 81% les trois mêmes jours.

Le moteur fait tourner le modèle de notation avec le raisonnement désactivé et à une température fixe, ce qui rend le chiffre reproductible. Une seule réponse de clavardeur porte quelques points de chance dans un sens ou dans l’autre; une note stable d’un jour à l’autre est une note sur laquelle vous pouvez planifier.

Deux tâches, deux sortes d’erreurs

Le Writing du CELPIP comporte deux tâches, et elles échouent de façons différentes. La tâche du courriel vous donne une situation et trois ou quatre points que vous devez couvrir. La tâche du sondage vous donne deux options et vous demande d’en choisir une et de la défendre. Un correcteur qui les traite de la même façon se trompera sur les deux.

Sur la tâche du courriel, le moteur a eu raison sur 89% des rédactions. Les erreurs qui coûtent le plus aux candidats ici ne sont pas la grammaire; ce sont un point manquant, un ton qui ne convient pas au destinataire, ou une formule d’ouverture et de clôture absentes. La couche de règles vérifie chacun de ces éléments avant que le correcteur donne son avis, et un point manquant limite l’exécution de la tâche à 8 ou moins, aussi soigné que soit l’anglais. Un clavardeur à qui l’on demande une note en langage simple ne sait pas quels points étaient exigés à moins que vous ne les colliez, et même alors, il les vérifie rarement un par un.

Sur la tâche du sondage, le moteur a eu raison sur 83% des rédactions. La tâche du sondage récompense une position claire et deux raisons développées, et pénalise une réponse qui reste entre les deux. Le moteur lit d’abord la position : une réponse qui ne s’engage jamais ne peut pas dépasser le milieu de l’échelle en exécution de la tâche. Les clavardeurs ont tendance à récompenser une réponse équilibrée, ce qui, dans une réponse au sondage, est une erreur.

L’intérêt d’un correcteur qui connaît la tâche, c’est que la note reflète ce à quoi un correcteur réagirait sur cette tâche, et non une impression générale de l’anglais. Un courriel de niveau moyen est généralement un courriel de niveau moyen à cause d’un troisième point trop mince; une réponse au sondage de niveau moyen l’est généralement parce qu’une raison est affirmée sans être développée. Le moteur vous dit laquelle, par son nom.

Là où le moteur n’est pas le meilleur

Le moteur est en tête au global et au milieu. Il n’est pas en tête aux deux extrémités, et il est plus honnête de le dire que de le cacher dans une moyenne.

Sur les rédactions faibles, les trois modèles GPT ont chacun obtenu 83% contre 75% pour le moteur. Les erreurs du moteur étaient toutes un cran trop haut, sur des rédactions courtes et soignées qui ne développaient rien. Un modèle GPT, qui lit l’écriture générique comme faible, a raison sur celles-ci. Si vous êtes au niveau faible et que vous voulez seulement une confirmation, GPT 5.6 sol vous la donnera légèrement plus souvent. Il dira aussi, trois fois sur douze, à une personne de niveau moyen qu’elle est un 6.

Sur les rédactions fortes, Claude Opus 5 a obtenu 92% contre 83% pour le moteur. Claude lit l’écriture soignée avec générosité, ce qui, sur une rédaction forte, est juste. La même générosité a donné un 9 ou un 10 à sept rédactions de niveau moyen sur douze. Si vous écrivez déjà au niveau fort, Claude Opus 5 le confirmera légèrement plus souvent que le moteur. Sinon, c’est le modèle le plus susceptible de vous dire que vous y êtes.

Le moteur est le seul correcteur du test à moins de dix points du meneur à chaque niveau, et le seul à 100% au milieu. C’est le profil dont un candidat a besoin : un correcteur qui n’est pas brillant à un niveau et faux à un autre, mais juste presque partout et juste là où se trouvent la plupart des candidats.

Comment le moteur note une réponse

Voici ce qui se passe pendant la minute environ qui sépare le moment où vous appuyez sur soumettre et celui où vous lisez une note.

  1. La couche de règles lit d’abord la rédaction. Avant qu’un modèle la voie, le moteur compte les mots, vérifie que le courriel a une formule d’ouverture et de clôture, vérifie que la réponse au sondage fait un choix clair, et confronte la rédaction aux points obligatoires de la consigne. Ces vérifications deviennent des limites fermes que le correcteur ne peut pas contourner : une réponse au sondage qui ne prend jamais parti, ou un courriel qui se lit comme une réponse au sondage, ne peut pas dépasser le milieu de l’échelle en exécution de la tâche.
  2. La rédaction est comparée à de vrais exemples notés. Le correcteur voit trois vraies réponses CELPIP au même type de tâche, une au niveau faible, une au milieu, une au sommet, toutes avec leurs vrais faux pas, et place la rédaction par rapport à elles sur chacune des quatre dimensions : contenu et cohérence, vocabulaire, lisibilité, exécution de la tâche. Comparable à l’exemple du milieu donne un 7 ou un 8; comparable à l’exemple du sommet donne un 10 ou un 11; nettement plus fort que l’exemple du sommet donne un 12.
  3. Chaque jugement exige des preuves. Pour chaque dimension, le correcteur doit citer les passages de la rédaction qui appuient la note avant de donner la note. Les citations introuvables dans la rédaction sont écartées.
  4. Les points manqués plafonnent la note. Si le correcteur signale un point obligatoire comme manquant, la note d’exécution de la tâche est retenue à 8 ou moins, de sorte que le chiffre et la rétroaction concordent.
  5. Les quatre dimensions deviennent une seule note. La note globale est la moyenne des quatre, après application des limites de la couche de règles.
  6. La rétroaction est construite à partir des mêmes preuves. Des corrections, une réponse modèle de la bonne longueur, les points manqués nommés un à un et un facteur limitant par dimension, tous cités du propre texte de la personne qui écrit. La section ci-dessous énumère ce qui a changé.

Nous avons aussi testé le passage du moteur à la conception à deux correcteurs, avec vote et réconciliation, qu’utilise notre correcteur de Speaking. Cela n’a pas aidé le Writing : les niveaux officiels de Writing sont plus rapprochés sur l’échelle de 0 à 12 que ceux du Speaking, et forcer un correcteur à choisir entre des exemples sans option intermédiaire poussait les rédactions de niveau moyen vers un 9. Le moteur de Writing conserve la conception qui note le milieu correctement.

Ce qui est nouveau dans vos commentaires de Writing

La note n'est que la moitié de ce que vous recevez. La couche de commentaires de Writing a été reconstruite en même temps que le correcteur, et tout ce qu'elle contient est ancré dans votre propre texte. Voici ce qui a changé.

  • Des corrections que vous pouvez retrouver dans votre propre rédaction. Chaque correction de grammaire, d'orthographe et de vocabulaire cite les mots exacts de votre réponse, de sorte que l'application peut les surligner là où vous les avez écrits. Tout ce que le vérificateur ne retrouve pas mot pour mot dans votre rédaction est retiré avant que vous le voyiez.
  • Une réponse modèle, construite à partir de votre réponse. Vous recevez une version réécrite de votre propre réponse qui conserve vos idées, couvre chaque point exigé et tient dans les 150 à 200 mots que demande la tâche. Si la première réécriture rate cette longueur, elle est refaite une fois avant de vous être montrée.
  • Le point exigé que vous avez manqué, nommé. Pour la tâche du courriel, les commentaires énumèrent les points de la consigne que votre réponse n'a pas couverts. Un point manqué maintient aussi la note d'exécution de la tâche à 8 ou moins, de sorte que le chiffre et les commentaires ne se contredisent jamais.
  • Un seul facteur limitant par dimension. Pour chacune des quatre dimensions, les commentaires nomment la seule chose qui retient cette note, en termes concrets, ou disent clairement que rien ne la retient et ce qui la porte. Conclure qu'une dimension n'a aucun problème est une vraie réponse, pas un vide.
  • La critique au bon endroit. Un ton faible est un problème d'exécution de la tâche, un choix de mot vague est un problème de vocabulaire, une phrase interminable est un problème de lisibilité. Chaque point est classé sous la dimension à laquelle il appartient, au lieu d'être fondu dans le résumé général.
  • Des réécritures phrase par phrase. Des phrases précises de votre rédaction vous reviennent avec une version améliorée et une ligne expliquant pourquoi elle est meilleure, pour que vous voyiez le changement au lieu de simplement le lire.
  • Votre dimension la plus forte et la plus faible, côte à côte. Les commentaires vous indiquent laquelle des quatre dimensions porte votre note et laquelle la retient, pour que vous sachiez quoi pratiquer ensuite sans avoir à décoder quatre chiffres.

Chaque citation des commentaires est vérifiée dans votre rédaction avant d'être affichée. Si le vérificateur ne retrouve pas les mots, la ligne est supprimée. C'est pourquoi les commentaires ne vous demandent jamais de corriger quelque chose que vous n'avez pas écrit.

Quoi faire avec la note

Une note digne de confiance change votre façon de pratiquer. Avec un clavardeur, vous ne savez jamais si un passage de 8 à 9 vient de vous ou du modèle, si bien que chaque note doit être confrontée à une impression. Avec un correcteur stable et précis, la note est la rétroaction.

  • Écrivez la même tâche deux fois. Soumettez, lisez les points manqués et le facteur limitant de chaque dimension, réécrivez avec la réponse modèle à côté de vous, et soumettez de nouveau. Un changement d’un point ou plus entre les deux est un changement dans votre écriture, parce que le moteur donne la même note à la même rédaction.
  • Suivez la dimension la plus faible, pas le total. La note globale est une moyenne de quatre. Deux candidats avec un 8 peuvent avoir des problèmes complètement différents. La rétroaction nomme la dimension qui vous retient, et c’est celle-là qu’il faut travailler.
  • Traitez un 9 comme un presque. Les deux erreurs du moteur sur les rédactions fortes étaient un 9. Un 9 du moteur signifie qu’il manque une raison développée ou un mot précis pour atteindre un 10.
  • Alternez les tâches. La plupart des candidats pratiquent la tâche qu’ils préfèrent. Le moteur note les courriels et les réponses au sondage par rapport à des exemples et à des règles différents, si bien qu’une bonne note de courriel ne dit rien de votre réponse au sondage.

Pratique illimitée pour CA$25 par mois

La précision n’est utile que si vous pouvez vous permettre de l’utiliser tous les jours. Une note de Writing digne de confiance a le plus de valeur à votre trentième rédaction, pas à votre troisième, car c’est à ce moment qu’elle commence à vous dire si un changement dans votre façon d’écrire fonctionne. Le moteur est donc tarifé pour être utilisé sans compter.

Chaque forfait Prepamigo inclut une notation illimitée, des tentatives illimitées, et la banque de questions complète : 80 séries d’exercices complètes et plus de 2,000 tâches d’exercice couvrant le Writing, le Speaking, le Reading et le Listening, conçues pour suivre les types de tâches, le minutage et le format du test CELPIP General. Vous écrivez, vous soumettez, et environ une minute plus tard vous avez la note, les corrections et une réponse modèle.

Prepamigo

CA$25/ mois

CA$24.98 par mois au mois · CA$8.25 par mois sur le forfait annuel (CA$98.98 par an) · taxes incluses · annulation à tout moment

  • Notation illimitée pour le Writing et le Speaking, sans plafond quotidien, par séance ou hebdomadaire.
  • 80 séries d’exercices et plus de 2,000 tâches couvrant les quatre sections, conçues sur le format du vrai test, pour que vous n’ayez jamais à écrire vos propres consignes.
  • Écrivez et soumettez. La notation, les corrections, la vérification des points manqués et la réponse modèle sont prises en charge pour vous.
  • Une rétroaction dans vos propres mots, avec chaque citation vérifiée par rapport à ce que vous avez réellement écrit.

Claude Max, à titre de comparaison

US$100/ mois

environ CA$138 avant taxes · palier 20x à US$200 par mois · Pro à US$20 avec des plafonds bien plus serrés

  • Même Max est plafonné. Une fenêtre d’utilisation glissante de cinq heures et une limite hebdomadaire; lorsque vous atteignez l’une ou l’autre, vous attendez.
  • Aucune banque de questions. Vous apportez vos propres tâches, décidez vous-même si elles ressemblent au vrai test, et suivez vous-même ce que vous avez déjà pratiqué.
  • Aucune vérification des points obligatoires, aucune réponse modèle. Vous obtenez un chiffre et un paragraphe.
  • Une demande simple, pas un correcteur calibré. Interrogé en langage simple, Claude Opus 5 a trouvé les notes vérifiées 61% du temps et Claude Sonnet 5 56%, contre 86% pour le moteur.

Les prix et modalités d’utilisation des forfaits Claude sont tels que publiés sur claude.com en septembre 2026 et peuvent changer. CELPIP est une marque de commerce de son propriétaire; Prepamigo est une plateforme de pratique indépendante et n’est ni affiliée, ni approuvée, ni liée au concepteur du test. Les tâches de pratique de Prepamigo sont du matériel original rédigé pour suivre le format public du test.

Disponibilité

Le Prepamigo Writing Scoring Engine est maintenant en ligne pour tous les utilisateurs de Prepamigo, sur les deux tâches de Writing. Il n’y a rien à activer. Chaque courriel et chaque réponse au sondage sont notés par lui, et chaque note vient avec une rétroaction tirée du propre texte de la personne qui écrit.

Pour les comparaisons en tête-à-tête, lisez Prepamigo contre Claude pour le Writing et Prepamigo contre ChatGPT pour le Writing. Pour le côté Speaking, lisez Scoring Engine 2.0 pour le Speaking. Vous pouvez aussi Lire ce guide en anglais. Ou Rédiger une réponse et observez le moteur à l’œuvre.

Voici le moteur de notation du Writing de Prepamigo | PrepAmigo