Le correcteur de Writing de Prepamigo sur 36 rédactions officielles
Part des rédactions notées à l'intérieur du niveau vérifié, au global et par niveau. Douze rédactions par niveau réparties sur les deux tâches de Writing; les six rédactions modèles que le correcteur utilise pour l'étalonnage sont exclues.
86%
Global
75%
Faibles (4–5)
100%
Moyennes (7–8)
83%
Fortes (10+)
Prepamigo comparé aux meilleurs forfaits de clavardeurs IA
En dollars canadiens. Les prix de Prepamigo incluent les taxes. Claude Max (à partir de US$100) et ChatGPT Pro (US$200) sont convertis au taux de 1,38, avant taxes. La précision correspond à la part des 36 rédactions officielles notées au niveau vérifié lorsque le modèle nommé est invité, en langage simple, à noter la rédaction; un seul essai.
C’est la bonne question à poser à propos de tout outil de pratique, et la plupart des outils n’y répondent pas. Une note de Writing ne vaut quelque chose que si elle indique ce qu’un vrai correcteur dirait, et la seule façon de savoir si c’est le cas est de mesurer. Cet article est donc la mesure, présentée simplement, avec les parties qui nous avantagent et celles qui ne nous avantagent pas.
La réponse en un paragraphe : sur 36 réponses écrites officielles du CELPIP, chacune avec une note vérifiée de façon indépendante, le correcteur de Writing de Prepamigo a trouvé le niveau vérifié 86% du temps. Il a eu raison sur chaque rédaction de niveau moyen, sur 75% des rédactions faibles et sur 83% des rédactions fortes. Il a produit le même résultat, à une rédaction près, sur trois exécutions distinctes. Invité en langage simple à noter les mêmes rédactions, le meilleur modèle de pointe, GPT 5.6 sol, a atteint 78%; les modèles Claude ont atteint 61% et 56%.
Ce qui suit explique ce que signifient les chiffres à chaque niveau, où tombent les erreurs et dans quelle direction, à quel point la note est stable, comment elle se compare aux clavardeurs que vous utilisez peut-être à la place, ce qui est nouveau dans la rétroaction, et comment lire votre propre note à la lumière de tout cela.
Ce que signifie « précis » ici
Nous n’affirmons pas qu’une note Prepamigo prédit votre résultat au test. Aucun outil de pratique ne peut le promettre. Ce que nous mesurons est plus étroit et plus honnête : étant donné une rédaction dont la note a été vérifiée de façon indépendante, à quelle fréquence le correcteur produit-il une note au même niveau?
Le Writing du CELPIP est présenté sur une échelle qui va jusqu’à 12, et les notes vérifiées de nos données de référence se présentent en trois bandes : faible, c’est-à-dire 4 ou 5; moyenne, c’est-à-dire 7 ou 8; et forte, c’est-à-dire 10 et plus. Nous considérons le correcteur comme correct lorsque sa note se situe à l’intérieur de la bande vérifiée. Une rédaction forte notée 10, 11 ou 12 est correcte; notée 9, c’est une erreur, même si c’est une erreur de justesse.
Précision à chaque niveau
Rédactions faibles : 75%. Neuf sur douze à l’intérieur de la bande. Les trois erreurs sont toutes allées un cran trop haut : deux rédactions ont reçu un 6 et une un 7. Chacune était courte et mince mais soignée, avec peu d’erreurs, et la propreté lui a valu un point qu’elle n’avait pas mérité sur le contenu. C’est l’erreur caractéristique du correcteur au bas de l’échelle, et c’est une erreur généreuse : une personne de niveau faible se fait dire qu’elle est un peu meilleure qu’elle ne l’est, jamais pire.
Rédactions moyennes : 100%. Douze sur douze à l’intérieur de la bande 7 à 8, sur les trois exécutions. C’est le niveau où se trouvent la plupart des candidats et le niveau qui décide de la plupart des objectifs d’immigration, et c’est là que le correcteur est le plus fort. C’est aussi là que chaque clavardeur que nous avons testé est le plus faible, pour des raisons que la section de comparaison explique.
Rédactions fortes : 83%. Dix sur douze. Les deux erreurs étaient un 9, un cran en dessous. Une rédaction forte du CELPIP n’est pas sans faute, et le correcteur lit parfois un faux pas de trop. Aucune des deux erreurs n’était un 7 ou un 8; une rédaction forte ne se fait jamais dire qu’elle est moyenne.
Par tâche, le correcteur a eu raison sur 89% des courriels et sur 83% des réponses au sondage. Les réponses au sondage sont plus difficiles à placer parce que la tâche récompense une position claire et des raisons développées, et qu’une réponse qui hésite entre les options est pénalisée par une règle.
Dans quelle direction vont les erreurs
Un correcteur qui se trompe 14% du temps peut se tromper de façon inoffensive ou de façon nuisible. Nuisible, c’est dire à un candidat qui a besoin d’un 8 qu’il l’a alors que ce n’est pas le cas. Inoffensif, c’est lui dire qu’il lui manque un point alors que non; cela coûte une semaine de pratique et rien d’autre.
Sur les cinq erreurs du correcteur sur 36 rédactions, trois étaient des rédactions faibles notées 6 ou 7 et deux des rédactions fortes notées 9. Aucune rédaction de niveau moyen n’a été surnotée, et aucune rédaction faible n’a été notée forte. En pratique : si le correcteur dit que vous avez atteint le niveau moyen, c’est le cas, ou il vous manque un point. S’il dit que vous avez atteint le niveau fort, c’est le cas. Le seul endroit où il flatte est le bas de l’échelle, où une rédaction courte et soignée peut gagner un point qu’elle n’a pas mérité.
Comparez cela aux clavardeurs sur les mêmes rédactions. Claude Opus 5 a donné un 9 ou un 10 à sept rédactions de niveau moyen, ce qui est la direction nuisible pour les candidats que cela touche le plus. GPT 5.6 sol a donné un 6 à trois rédactions de niveau moyen, ce qui est la direction inoffensive, et a retenu trois rédactions fortes à un 9. Le taux de précision d’un correcteur vous dit à quelle fréquence il se trompe; la direction vous dit ce que cela vous coûte quand il se trompe.
Courriel contre sondage
Les 36 rédactions étaient réparties entre les deux tâches de Writing, et le correcteur a fait légèrement mieux sur la tâche du courriel, à 89%, que sur la réponse au sondage, à 83%. Cela représente une erreur de plus du côté du sondage, et elle va dans la direction à laquelle on s’attendrait.
Les courriels sont notés en grande partie sur la couverture : les points obligatoires ont-ils été traités, le ton convient-il au destinataire, y a-t-il une formule d’ouverture et de clôture. Ce sont des choses que le correcteur vérifie par règle avant tout jugement, si bien qu’un courriel qui les a est placé de façon fiable. Les réponses au sondage sont notées sur la qualité d’une argumentation : une position claire et des raisons développées plutôt qu’énumérées. Le développement est un jugement, et le jugement est là où un correcteur, humain ou non, peut différer d’un point.
Pour vous, cela signifie qu’une note de sondage est très légèrement plus molle qu’une note de courriel. Si vous flottez à la limite de votre objectif sur les réponses au sondage, écrivez-en deux plutôt qu’une avant de décider où vous en êtes.
De votre côté de l’écran
La vue par niveau vous dit comment le correcteur se comporte sur une rédaction de niveau connu. Vous, vous regardez dans l’autre sens : vous avez une note et vous voulez savoir jusqu’à quel point la croire.
- S’il dit 4 ou 5 : la rédaction était au niveau faible neuf fois sur neuf. Une note basse du correcteur est juste.
- S’il dit 7 ou 8 : la rédaction était au niveau moyen douze fois sur quinze; les trois autres étaient des rédactions faibles notées un cran trop haut. Un 7 ou un 8 signifie moyen, et peut-être un peu moins.
- S’il dit 10 ou plus : la rédaction était au niveau fort dix fois sur dix. Un 10 du correcteur est un 10.
- S’il dit 9 : les deux 9 du test étaient des rédactions vérifiées comme fortes. Un 9 est la note à lire attentivement : il signifie proche du sommet, à une raison développée ou à un mot précis près.
La même rédaction reçoit-elle la même note?
La précision sans la constance, c’est de la chance. Nous avons donc noté les 36 rédactions trois fois à des jours différents sans rien changer entre les exécutions. Le correcteur a renvoyé 86%, 89% et 86%. Les mêmes douze rédactions de niveau moyen étaient à l’intérieur de la bande chaque fois, et aucune rédaction n’a bougé de plus d’un point entre les exécutions.
La constance vient de la façon dont le modèle de notation est exécuté : raisonnement désactivé, température fixe, et comparaison avec des exemples notés fixes plutôt qu’un jugement libre. Pour vous, cela signifie qu’un changement dans votre note est un changement dans votre écriture. Si vous réécrivez une rédaction et qu’elle passe de 8 à 10, ce n’est pas le correcteur qui a passé une bonne journée.
Comment cela se compare à ce que vous utilisez peut-être à la place
Un taux de précision veut dire davantage avec quelque chose à quoi le comparer. Nous avons donc donné les mêmes 36 rédactions aux clavardeurs que les gens utilisent réellement pour vérifier leur écriture, comme une personne le ferait : la tâche, la rédaction, et une simple demande de note de 0 à 12.
Part des rédactions notées à l'intérieur du niveau vérifié
Les mêmes 36 rédactions officielles. Chaque modèle a été invité, en langage simple, à noter la rédaction; Prepamigo a fonctionné dans sa configuration de production normale.
86%
Correcteur de Writing Prepamigo
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
Le correcteur devance le meilleur clavardeur de huit points et les modèles Claude de 25 à 30. La forme des erreurs est ce qui compte. Sur les rédactions de niveau moyen, Prepamigo est à 100%, GPT 5.6 sol à 75%, Gemini à 42%, Claude Sonnet 5 à 33% et Claude Opus 5 à 25% : un clavardeur sans rien pour comparer lit un 7 propre et générique comme un 9, ou un 7 générique avec quelques erreurs comme un 6. Sur les rédactions fortes, Claude Opus 5 est en fait le meilleur correcteur du test à 92% contre 83% pour Prepamigo; il est généreux, ce qui est juste au sommet et faux partout ailleurs. GPT-4o mini a donné un 9 à neuf rédactions fortes sur douze.
Ce que le correcteur a et que les clavardeurs n’ont pas, ce sont de vraies rédactions notées pour la même tâche à chaque niveau pour comparer, et une couche de règles qui vérifie les points obligatoires, la position dans le sondage, la formule d’ouverture et de clôture, et la longueur avant qu’un modèle donne son avis. C’est la différence entre 86% et 78%, et elle se trouve presque entièrement au milieu de l’échelle.
Ce qui est nouveau dans vos commentaires de Writing
La note n'est que la moitié de ce que vous recevez. La couche de commentaires de Writing a été reconstruite en même temps que le correcteur, et tout ce qu'elle contient est ancré dans votre propre texte. Voici ce qui a changé.
- Des corrections que vous pouvez retrouver dans votre propre rédaction. Chaque correction de grammaire, d'orthographe et de vocabulaire cite les mots exacts de votre réponse, de sorte que l'application peut les surligner là où vous les avez écrits. Tout ce que le vérificateur ne retrouve pas mot pour mot dans votre rédaction est retiré avant que vous le voyiez.
- Une réponse modèle, construite à partir de votre réponse. Vous recevez une version réécrite de votre propre réponse qui conserve vos idées, couvre chaque point exigé et tient dans les 150 à 200 mots que demande la tâche. Si la première réécriture rate cette longueur, elle est refaite une fois avant de vous être montrée.
- Le point exigé que vous avez manqué, nommé. Pour la tâche du courriel, les commentaires énumèrent les points de la consigne que votre réponse n'a pas couverts. Un point manqué maintient aussi la note d'exécution de la tâche à 8 ou moins, de sorte que le chiffre et les commentaires ne se contredisent jamais.
- Un seul facteur limitant par dimension. Pour chacune des quatre dimensions, les commentaires nomment la seule chose qui retient cette note, en termes concrets, ou disent clairement que rien ne la retient et ce qui la porte. Conclure qu'une dimension n'a aucun problème est une vraie réponse, pas un vide.
- La critique au bon endroit. Un ton faible est un problème d'exécution de la tâche, un choix de mot vague est un problème de vocabulaire, une phrase interminable est un problème de lisibilité. Chaque point est classé sous la dimension à laquelle il appartient, au lieu d'être fondu dans le résumé général.
- Des réécritures phrase par phrase. Des phrases précises de votre rédaction vous reviennent avec une version améliorée et une ligne expliquant pourquoi elle est meilleure, pour que vous voyiez le changement au lieu de simplement le lire.
- Votre dimension la plus forte et la plus faible, côte à côte. Les commentaires vous indiquent laquelle des quatre dimensions porte votre note et laquelle la retient, pour que vous sachiez quoi pratiquer ensuite sans avoir à décoder quatre chiffres.
Chaque citation des commentaires est vérifiée dans votre rédaction avant d'être affichée. Si le vérificateur ne retrouve pas les mots, la ligne est supprimée. C'est pourquoi les commentaires ne vous demandent jamais de corriger quelque chose que vous n'avez pas écrit.
Comment lire votre note
- Un 4 ou un 5 est juste. Lisez les corrections; elles sont citées de votre propre texte. Lisez ensuite les points manqués et la réponse modèle, et écrivez la même tâche de nouveau.
- Un 7 ou un 8 est moyen, peut-être un peu moins. Regardez le facteur limitant de chaque dimension. Celui qui nomme un problème concret est celui qu’il faut travailler.
- Un 9 est proche. Comparez votre rédaction avec la réponse modèle paragraphe par paragraphe. L’écart est généralement une raison non développée ou un mot générique.
- Un 10 ou plus est un 10. Vous êtes prêt sur ce type de tâche. Passez à celui que vous évitez.
- Fiez-vous aux changements plus qu’aux niveaux. Comme la note est stable, un changement entre deux tentatives sur la même tâche est un changement dans votre écriture.
Une routine de pratique qui utilise le chiffre
L’intérêt d’une note précise et stable, c’est que vous pouvez arrêter de la remettre en question et commencer à l’utiliser. Voici la routine que nous suggérons, construite autour de ce que les chiffres de cette page disent que la note peut et ne peut pas vous apprendre.
- Écrivez un courriel et une réponse au sondage, à froid. Ne regardez pas la réponse modèle d’abord. Soumettez les deux. Les deux notes ensemble sont votre niveau de départ; si elles diffèrent de plus d’un point, la plus basse indique la tâche à pratiquer.
- Lisez les points manqués et le facteur limitant avant les corrections. Les corrections réparent des phrases; les points manqués et les facteurs limitants réparent des notes. Un point obligatoire manquant vaut plus que toutes les virgules.
- Réécrivez la même réponse avec la réponse modèle ouverte. Gardez vos idées, empruntez sa structure. Soumettez de nouveau. Comme le correcteur donne la même note à la même rédaction, la différence entre les deux soumissions vient entièrement de votre réécriture.
- Passez à une nouvelle tâche quand la réécriture tient. Un seul 10 sur une réécriture n’est pas encore un niveau. Deux 10 sur deux tâches différentes en sont un.
- Lisez un 9 comme un presque et un 6 comme un vrai 6. Le correcteur ne tire pas les rédactions moyennes vers le bas. S’il dit 6, la rédaction est mince, et le facteur limitant dira où.
FAQ
Quelle est la précision de la note de Writing de Prepamigo? 86% au niveau exact sur 36 rédactions officielles : 75% faibles, 100% moyennes, 83% fortes. Le même résultat, à une rédaction près, sur trois exécutions.
Est-ce la même chose que ma vraie note? Aucun outil de pratique ne peut le promettre. Ce que nous mesurons, c’est à quelle fréquence le correcteur s’accorde avec une note vérifiée sur la même rédaction.
Pourquoi ai-je eu un 9 sur une rédaction forte? C’est l’erreur la plus fréquente du correcteur au sommet : deux rédactions fortes sur douze ont reçu un 9. Réécrivez avec la réponse modèle à côté de vous et faites noter de nouveau.
Est-il meilleur que ChatGPT ou Claude? 86% contre 78% pour GPT 5.6 sol et 61% et 56% pour les modèles Claude. Sur les rédactions de niveau moyen, 100% contre 75% pour le meilleur d’entre eux.
Pour voir comment fonctionne le correcteur, lisez à l’intérieur du correcteur de Writing de Prepamigo. Pour voir le même test sur les six clavardeurs, lisez quelle IA note le Writing du CELPIP le plus précisément. Vous pouvez aussi Lire ce guide en anglais. Ou Rédiger une réponse et voyez les chiffres par vous-même.
