Part des rédactions notées au niveau vérifié
36 réponses écrites officielles du CELPIP, 12 par niveau, les deux tâches de Writing. Chaque modèle a reçu la tâche et la rédaction et a été invité, en langage simple, à la noter sur l'échelle du CELPIP. Le correcteur de Writing de Prepamigo a fonctionné dans sa configuration de production normale.
86%
Correcteur de Writing Prepamigo
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
Prepamigo comparé aux meilleurs forfaits de clavardeurs IA
En dollars canadiens. Les prix de Prepamigo incluent les taxes. Claude Max (à partir de US$100) et ChatGPT Pro (US$200) sont convertis au taux de 1,38, avant taxes. La précision correspond à la part des 36 rédactions officielles notées au niveau vérifié lorsque le modèle nommé est invité, en langage simple, à noter la rédaction; un seul essai.
Bien des candidats au CELPIP vérifient leur écriture avec un clavardeur IA. Coller le courriel, demander une note, lire le paragraphe. Pour le Writing, c’est facile : pas d’enregistrement, pas de transcription. Ce que personne ne vous dit, c’est à quelle fréquence le chiffre est juste, quel modèle croire, ou quelles erreurs chacun commet. Nous voulions le savoir, alors nous avons donné à six clavardeurs et à notre propre correcteur les mêmes 36 rédactions officielles aux notes vérifiées, et nous avons compté.
La version en une phrase : GPT 5.6 sol est le clavardeur le plus précis pour le Writing du CELPIP à 78%, les modèles Claude sont les moins précis à 61% et 56% parce qu’ils gonflent les rédactions de niveau moyen, et un correcteur spécialisé, celui de Prepamigo, a atteint 86% sur les mêmes rédactions et a eu raison sur chaque rédaction de niveau moyen. Nous devons dire d’emblée que Prepamigo est notre produit. Là où un clavardeur nous a battus à un niveau précis, nous le disons; deux d’entre eux l’ont fait.
Le classement
Trois paliers apparaissent dans le graphique ci-dessus. Prepamigo à 86% est seul. GPT 5.6 sol à 78% et GPT 5.6 luna à 69% forment un deuxième palier : utilisables, avec des habitudes connues. Tout le reste est à 60% ou près de là, ce qui, pour une échelle à trois bandes, ne vaut guère mieux qu’une supposition éclairée.
Le portrait est différent du Speaking, où les modèles Claude ont bien fait et les modèles GPT ont mal fait. En Writing, c’est l’inverse. Les modèles GPT sont légèrement sévères : ils tirent un 7 générique vers un 6 et retiennent une rédaction forte comportant un faux pas à un 9. Les modèles Claude sont généreux : ils poussent un 7 générique vers un 9 ou un 10 et donnent un 3 aux rédactions faibles et minces. Gemini se comporte comme Claude au milieu. GPT-4o mini traite le 9 comme un plafond.
Résultats à chaque niveau
Rédactions faibles (note vérifiée de 4 ou 5)
12 rédactions officielles par système.
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
Correcteur de Writing Prepamigo
67%
Claude Opus 5
58%
Gemini
50%
Claude Sonnet 5
Les rédactions faibles sont l’extrémité facile de l’échelle, et les trois modèles GPT sont à égalité à 83%, devant Prepamigo à 75%. Les trois erreurs de Prepamigo sont toutes allées un cran trop haut, à un 6 ou un 7, sur des rédactions courtes mais soignées. Les modèles Claude se trompent dans l’autre direction : Sonnet 5 a donné un 3 à quatre rédactions faibles sur douze, un niveau en dessous, et Opus 5 a donné un 3 à deux d’entre elles. Une rédaction mince qui accomplit tout de même la tâche est un 4, pas un 3, et un modèle sans exemple de 4 ne peut pas faire la différence.
Rédactions moyennes (note vérifiée de 7 ou 8)
12 rédactions officielles par système. Le niveau où se trouvent la plupart des candidats.
100%
Correcteur de Writing Prepamigo
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
42%
Gemini
33%
Claude Sonnet 5
25%
Claude Opus 5
La bande du milieu sépare le peloton. Prepamigo a eu raison sur les douze. GPT 5.6 sol en a eu neuf, en tirant trois vers un 6. GPT-4o mini en a eu huit et en a poussé quatre vers un 9. Luna en a eu sept, surtout en tirant vers le bas. Gemini en a eu cinq et en a poussé six vers un 9 ou un 10. Claude Sonnet 5 en a eu quatre, le reste partagé entre des 6 et des 9. Claude Opus 5 en a eu trois et a donné un 9 ou un 10 à sept des douze.
Si vous écrivez au niveau 7 ou 8, et c’est le cas de la plupart des candidats, c’est le graphique à retenir. Demandez à Claude Opus 5 et plus de la moitié du temps il vous dira que vous y êtes. Demandez à Gemini et la moitié du temps il dira la même chose. Demandez à GPT 5.6 sol et une fois sur quatre il vous dira que vous avez glissé à un 6.
Rédactions fortes (note vérifiée de 10 ou plus)
12 rédactions officielles par système. Presque chaque erreur est un 9.
92%
Claude Opus 5
83%
Correcteur de Writing Prepamigo
83%
Gemini
83%
Claude Sonnet 5
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
Au sommet, Claude Opus 5 est le meilleur correcteur du test avec onze rédactions fortes sur douze reconnues; il a donné un 11 à cinq d’entre elles. Prepamigo, Gemini et Sonnet 5 en ont reconnu dix chacun. GPT 5.6 sol en a reconnu neuf et luna huit, retenant les autres à un 9. GPT-4o mini en a reconnu trois et a donné un 9 à neuf : il ne distribue pas de 10. La générosité de Claude est juste ici et fausse partout ailleurs; la sévérité des modèles GPT est fausse ici et à peu près juste ailleurs.
Pourquoi les modèles ne s’entendent pas sur le milieu
Une rédaction CELPIP de niveau moyen est une chose précise : elle couvre la tâche, elle est organisée, elle comporte peu d’erreurs qui nuisent à la compréhension, et elle est générique, avec des raisons affirmées plutôt que développées et un vocabulaire prudent plutôt que précis. Un correcteur formé en a vu des centaines et sait où elles se situent. Un modèle généraliste a vu un texte soigné, organisé et généralement correct, et doit décider à l’impression. L’impression de Claude, c’est que soigné veut dire fort. L’impression de GPT, c’est que générique veut dire faible. Les deux se trompent sur un 7, dans des directions opposées.
Le correcteur de Prepamigo ne juge pas à l’impression. Il compare la rédaction à de vraies réponses notées au même type de tâche à chaque niveau, toutes de vraies rédactions avec de vrais faux pas, et la place à côté de celle à laquelle elle ressemble le plus sur chacune des quatre dimensions. Une rédaction propre mais générique atterrit à côté de l’exemple du milieu, parce que c’est ce qu’elle est. Par-dessus la comparaison se trouve une couche de règles pour les choses qu’un modèle compte mal : si chaque point obligatoire est couvert, si une réponse au sondage prend parti, si le courriel a une formule d’ouverture et de clôture, et quelle est sa longueur. Un point obligatoire manqué retient l’exécution de la tâche à 8 ou moins, peu importe l’anglais, parce que c’est ainsi que le test fonctionne.
Nous avons aussi essayé de donner au correcteur de Writing la conception à deux correcteurs, avec vote et réconciliation, qu’utilise notre correcteur de Speaking. Cela a empiré le Writing, parce que les niveaux officiels de Writing ne sont séparés que de deux points sur l’échelle de 0 à 12 et qu’un choix forcé entre des exemples poussait les rédactions moyennes vers un 9. Le Writing conserve la conception qui réussit le milieu.
Pourquoi le classement est l’inverse du Speaking
Si vous avez lu notre comparaison pour le Speaking, le classement du Writing vous semblera à l’envers. Sur les transcriptions de Speaking, Claude Opus 5 était le meilleur clavardeur à 62% et GPT 5.6 sol le pire des grands modèles à 35%. En Writing, c’est GPT 5.6 sol à 78% et les modèles Claude en queue de peloton.
La raison, c’est ce sur quoi chaque modèle est généreux. Une transcription de Speaking du CELPIP, c’est de l’anglais parlé mis par écrit : des fragments, des répétitions, des autocorrections. GPT lit cela comme du texte cassé et note sévèrement, ce qui, sur une transcription, est faux; Claude lit à travers pour trouver les idées. Une rédaction CELPIP est le contraire : elle est révisée, organisée, soignée en surface, et souvent générique en dessous. Claude lit la propreté comme une force et gonfle le milieu; GPT lit le contenu générique comme une faiblesse et a à peu près raison, ou un point trop bas.
La leçon pratique, c’est qu’il n’y a pas un seul meilleur clavardeur pour le CELPIP. Le modèle qui note bien votre Speaking est celui qui flattera votre Writing, et inversement. Un correcteur spécialisé contourne la question en comparant avec des exemples notés du bon type pour chaque tâche. Le moteur de Speaking et le moteur de Writing de Prepamigo sont des systèmes distincts aux conceptions différentes, parce que les deux tâches échouent différemment.
Le paragraphe qui accompagne le chiffre
Chaque clavardeur renvoie un paragraphe de rétroaction avec sa note, et le paragraphe est généralement plus confiant que le chiffre ne le mérite. Trois choses à vérifier avant d’agir en fonction de celui-ci.
- Vous cite-t-il? Une correction qui ne pointe pas vos mots exacts est une règle générale, pas une rétroaction sur votre rédaction. La plupart des conseils des clavardeurs sont du genre qui s’applique à n’importe quelle rédaction : variez la structure de vos phrases, utilisez un vocabulaire plus précis, développez vos raisons. Vrai, et pas exploitable.
- Nomme-t-il le point manquant? Si vous avez collé la tâche, une bonne réponse vous dit quel point obligatoire vous n’avez pas couvert. Si vous ne l’avez pas collée, le clavardeur ne peut pas le savoir, et il vantera la couverture quand même.
- La critique correspond-elle à la note? Un paragraphe de clavardeur énumère souvent trois ou quatre problèmes puis donne un 10, ou vante la rédaction et donne un 6. Quand les mots et le chiffre ne concordent pas, aucun des deux n’est fiable.
La rétroaction de Prepamigo est construite dans l’autre sens : le correcteur doit citer les passages qui appuient la note de chaque dimension avant de donner la note, et une citation introuvable dans votre rédaction est écartée. Les points manqués sont énumérés par leur nom, et un point manqué plafonne la note d’exécution de la tâche, si bien que les mots et le chiffre ne peuvent pas se contredire. La section ci-dessous énumère ce qu’elle contient.
Notes sur chaque modèle
- GPT 5.6 sol. Le meilleur clavardeur pour le Writing à 78%, et celui à utiliser si vous en utilisez un. Légèrement sévère : trois rédactions moyennes tirées vers un 6, trois rédactions fortes retenues à un 9. Sur les rédactions faibles, il est meilleur que Prepamigo, 83% contre 75%.
- GPT 5.6 luna. 69%. Même profil que sol mais plus sévère au milieu, où il en a eu sept sur douze. Bon sur les rédactions faibles.
- Gemini. 61%. Correct aux extrémités, faible au milieu à 42%, où il a poussé six rédactions sur douze vers un 9 ou un 10.
- Claude Opus 5. 61% au global, mais le meilleur correcteur du test sur les rédactions fortes à 92%. Au milieu, il est le pire à 25%, donnant un 9 ou un 10 à sept sur douze. Si votre écriture est déjà forte, Opus 5 le confirmera; si elle est moyenne, Opus 5 vous dira qu’elle est forte.
- GPT-4o mini. 58%. Traite le 9 comme le sommet de l’échelle : neuf rédactions fortes sur douze ont reçu un 9. Ne l’utilisez pas pour corriger votre Writing si vous approchez d’un 10.
- Claude Sonnet 5. 56%, le moins précis. A donné un 3 à quatre rédactions faibles et a partagé la bande du milieu entre des 6 et des 9.
Si vous comptez utiliser un clavardeur malgré tout
- Utilisez GPT 5.6 sol. Pas un modèle Claude pour tout ce qui est sous une rédaction forte, et pas un petit modèle pour tout ce qui dépasse une rédaction faible.
- Collez la tâche en entier. Les points obligatoires de la tâche du courriel et les options de la tâche du sondage changent la note. Un modèle qui ne connaît pas les points ne peut pas vous dire qu’il en manque un.
- Demandez-lui de vérifier les points d’abord. Demandez un oui ou un non pour chaque point obligatoire, puis la note. C’est la couche de règles, faite à la main.
- Demandez deux fois, gardez la réponse la plus basse. GPT 5.6 sol a obtenu 78%, 83% et 81% sur trois exécutions des mêmes rédactions; une seule réponse porte quelques points de chance.
- Lisez un 9 et un 6 avec méfiance. D’un modèle GPT, un 9 est souvent un 10 retenu et un 6 est souvent un 7 tiré vers le bas. D’un modèle Claude, un 9 est souvent un 7 promu.
Le seul intrant que vous ne pouvez pas fournir vous-même est une rédaction notée et vérifiée pour la même tâche à chaque niveau, ce à quoi un correcteur spécialisé compare. Cela, et la vérification des points obligatoires, est la différence entre 78% et 86%.
Ce qui est nouveau dans vos commentaires de Writing
La note n'est que la moitié de ce que vous recevez. La couche de commentaires de Writing a été reconstruite en même temps que le correcteur, et tout ce qu'elle contient est ancré dans votre propre texte. Voici ce qui a changé.
- Des corrections que vous pouvez retrouver dans votre propre rédaction. Chaque correction de grammaire, d'orthographe et de vocabulaire cite les mots exacts de votre réponse, de sorte que l'application peut les surligner là où vous les avez écrits. Tout ce que le vérificateur ne retrouve pas mot pour mot dans votre rédaction est retiré avant que vous le voyiez.
- Une réponse modèle, construite à partir de votre réponse. Vous recevez une version réécrite de votre propre réponse qui conserve vos idées, couvre chaque point exigé et tient dans les 150 à 200 mots que demande la tâche. Si la première réécriture rate cette longueur, elle est refaite une fois avant de vous être montrée.
- Le point exigé que vous avez manqué, nommé. Pour la tâche du courriel, les commentaires énumèrent les points de la consigne que votre réponse n'a pas couverts. Un point manqué maintient aussi la note d'exécution de la tâche à 8 ou moins, de sorte que le chiffre et les commentaires ne se contredisent jamais.
- Un seul facteur limitant par dimension. Pour chacune des quatre dimensions, les commentaires nomment la seule chose qui retient cette note, en termes concrets, ou disent clairement que rien ne la retient et ce qui la porte. Conclure qu'une dimension n'a aucun problème est une vraie réponse, pas un vide.
- La critique au bon endroit. Un ton faible est un problème d'exécution de la tâche, un choix de mot vague est un problème de vocabulaire, une phrase interminable est un problème de lisibilité. Chaque point est classé sous la dimension à laquelle il appartient, au lieu d'être fondu dans le résumé général.
- Des réécritures phrase par phrase. Des phrases précises de votre rédaction vous reviennent avec une version améliorée et une ligne expliquant pourquoi elle est meilleure, pour que vous voyiez le changement au lieu de simplement le lire.
- Votre dimension la plus forte et la plus faible, côte à côte. Les commentaires vous indiquent laquelle des quatre dimensions porte votre note et laquelle la retient, pour que vous sachiez quoi pratiquer ensuite sans avoir à décoder quatre chiffres.
Chaque citation des commentaires est vérifiée dans votre rédaction avant d'être affichée. Si le vérificateur ne retrouve pas les mots, la ligne est supprimée. C'est pourquoi les commentaires ne vous demandent jamais de corriger quelque chose que vous n'avez pas écrit.
FAQ
Quelle IA est la plus précise pour noter le Writing du CELPIP? Parmi les clavardeurs, GPT 5.6 sol à 78%, puis luna 69%, Gemini et Claude Opus 5 61%, GPT-4o mini 58%, Claude Sonnet 5 56%. Le correcteur de Writing de Prepamigo a atteint 86% sur les mêmes rédactions.
ChatGPT ou Claude pour le Writing? ChatGPT, nettement : 78% contre 61% et 56%. Les modèles Claude gonflent les rédactions de niveau moyen à un 9 ou un 10. Opus 5 est le meilleur de tous sur les rédactions fortes.
Pourquoi donnent-ils un 9 à ma rédaction moyenne? Soigné et organisé se lit comme fort pour un modèle sans rien pour comparer. Prepamigo compare avec de vrais exemples notés pour la même tâche.
Comment obtenir une meilleure note d’un clavardeur? Utilisez GPT 5.6 sol, collez la tâche complète, demandez-lui de vérifier chaque point obligatoire d’abord, demandez deux fois, et lisez les 9 et les 6 avec méfiance.
Pour les deux tête-à-tête, lisez Prepamigo contre Claude pour le Writing et Prepamigo contre ChatGPT pour le Writing. Pour savoir comment fonctionne le correcteur, lisez à l’intérieur du correcteur de Writing de Prepamigo. Vous pouvez aussi Lire ce guide en anglais. Ou Rédiger une réponse et évitez les devinettes.
