Part des réponses notées au niveau vérifié
48 réponses de Speaking mises à l'écart, 16 à chacun des trois niveaux. Claude a reçu la transcription et a été invité, en langage simple, à la noter sur l'échelle du CELPIP; moyenne de trois essais. Engine 2.0 a fonctionné dans sa configuration de production normale.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
45%
Claude Sonnet 5
Prepamigo comparé aux meilleurs forfaits de clavardeurs IA
En dollars canadiens. Les prix de Prepamigo incluent les taxes. Claude Max (à partir de US$100) et ChatGPT Pro (US$200) sont convertis au taux de 1,38, avant taxes. La précision correspond à la part des réponses du test réservé notées au niveau vérifié lorsque le modèle nommé est invité, en langage simple, à noter la réponse; moyenne de trois essais.
Si vous avez déjà collé une transcription de Speaking dans Claude en lui demandant de vous noter comme le ferait un correcteur du CELPIP, vous connaissez déjà l’attrait de la chose. Il répond instantanément, il s’explique, et il ne se fatigue jamais. La question est de savoir si le chiffre qu’il vous donne est bien celui que vous obtiendriez réellement. Nous avons fait ce test comme le ferait un candidat : la même transcription, une simple demande de note, puis nous avons compté.
La réponse courte : sur 48 réponses de Speaking que les systèmes n’avaient jamais vues, chacune avec une note vérifiée de façon indépendante, Prepamigo Scoring Engine 2.0 a trouvé le bon niveau 81% du temps. Invités en langage simple à noter les mêmes transcriptions, Claude Opus 5 a trouvé le bon niveau 62% du temps et Claude Sonnet 5 45% du temps. L’écart est le plus large exactement là où cela compte le plus pour quiconque vise une note élevée : sur les réponses de niveau supérieur, Engine 2.0 en a reconnu 71%, Opus 5 50%, et Sonnet 5 29%.
Nous avons ensuite fait ce que la plupart des comparaisons omettent. Nous avons donné à Claude notre propre procédure de correction, avec de vrais exemples d’étalonnage pour chaque tâche et une comparaison forcée par rapport à ceux-ci, pour voir jusqu’où il pouvait aller. Opus 5 est monté à 77% et Sonnet 5 à 69%. Les deux sont tout de même restés derrière Engine 2.0, et les deux ont continué d’éprouver le plus de difficulté sur les réponses de niveau supérieur. Le reste de cet article passe en revue les deux tests, ce que donnent les chiffres à chaque niveau de note, pourquoi un assistant généraliste dérive vers le milieu de l’échelle, à quoi ressemble le flux de travail quotidien de chaque côté, et ce que coûte chaque option si vous comptez pratiquer sérieusement.
Le test simple : ce qu’obtient réellement un candidat
Quatre-vingt-un pourcent contre soixante-deux et quarante-cinq. Sur un test de 48 réponses, l’écart entre Engine 2.0 et Opus 5 représente neuf notes correctes supplémentaires, et l’écart entre Engine 2.0 et Sonnet 5 en représente dix-sept. Autrement dit, Engine 2.0 commet 51% moins d’erreurs de notation qu’Opus 5 et 66% moins que Sonnet 5.
Trois exécutions distinctes du test simple ont donné à Opus 5 62%, 65% et 58%, et à Sonnet 5 44%, 46% et 46%. Cet écart de plusieurs points entre les exécutions est en soi une constatation : demandez à Claude de noter la même transcription à deux jours différents, et vous obtiendrez, assez souvent, deux notes différentes. Engine 2.0 a obtenu 81.3% à chacune de ses trois exécutions.
Là où l’écart s’ouvre : niveau de note par niveau de note
La plupart des correcteurs, humains ou machines, dérivent vers le milieu de l’échelle. Une réponse solide devient un 8 au lieu d’un 10; une réponse faible devient un 6 au lieu d’un 5. Cette dérive est invisible dans une moyenne et devient évidente dès que l’on répartit les résultats par niveau. Avec une consigne simple, Claude ajoute une seconde habitude par-dessus : il dérive vers le bas, si bien que même les réponses faibles sont souvent notées sous leur niveau.
Réponses de niveau inférieur (note vérifiée de 4 ou 5)
16 réponses mises à l'écart, consigne simple, moyenne de trois exécutions. Les erreurs de Sonnet 5 ici sont surtout des notes de 3.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
44%
Claude Sonnet 5
Sur les réponses faibles, Engine 2.0 est en tête avec 88%, Opus 5 suit avec 77%, et Sonnet 5 chute à 44%. C’est l’extrémité facile de l’échelle, et Opus 5 s’en tire raisonnablement bien. Sonnet 5, non : il donne un 3 à une réponse de 4 ou 5 plus souvent qu’autrement, ce qui est le mauvais niveau même si la direction de l’erreur est compréhensible. Un candidat à ce niveau qui utilise Sonnet 5 pour se corriger se fera dire qu’il est plus faible qu’il ne l’est réellement, la plupart du temps.
Réponses de niveau moyen (note vérifiée de 7 ou 8)
16 réponses mises à l'écart, consigne simple, moyenne de trois exécutions. Les erreurs sont presque toutes des 6.
85%
Prepamigo Engine 2.0
63%
Claude Sonnet 5
58%
Claude Opus 5
Au milieu, Engine 2.0 est à 85% et les deux modèles de Claude sont à 63% et 58%. Les réponses de niveau moyen renferment un mélange de forces et de faiblesses qu’il faut soupeser plutôt que simplement repérer, et sans exemples d’étalonnage pour comparer, les deux modèles de Claude ont tendance à voir les faiblesses et à donner un 6. Un candidat de niveau 7 ou 8 s’entendra dire qu’il est un 6 environ quatre fois sur dix.
Réponses de niveau supérieur (note vérifiée de 10 ou plus)
16 réponses mises à l'écart, consigne simple, moyenne de trois exécutions. Presque toutes les erreurs sont des 7 ou des 8.
71%
Prepamigo Engine 2.0
50%
Claude Opus 5
29%
Claude Sonnet 5
Au sommet, Engine 2.0 reconnaît 71% des réponses de niveau supérieur. Opus 5 en reconnaît la moitié. Sonnet 5 en reconnaît 29%, ce qui signifie qu’il donne un 7 ou un 8 à sept réponses sur dix qui mériteraient un 10.
Réfléchissez à ce que cela signifie en pratique. Supposons que votre niveau de Speaking soit réellement un 10 aujourd’hui. Vous enregistrez huit réponses, vous les transcrivez, vous les collez dans Claude Sonnet 5 et vous demandez une note, et il vous dit que six d’entre elles sont des 7 et des 8. Vous concluez que vous n’êtes pas prêt. Vous passez trois semaines de plus à vous entraîner. Vous étiez prêt depuis le début. Ce n’est pas un scénario hypothétique; c’est l’erreur unique la plus fréquente de tout notre test, et elle frappe le plus durement les candidats qui ont travaillé le plus fort.
Et si l’on donnait à Claude notre procédure complète?
Il est tentant de lire les chiffres du test simple comme la preuve que Claude est un modèle faible. Ce n’est pas le cas. Opus 5 est, de loin, le meilleur correcteur généraliste que nous ayons testé. Le problème n’est pas l’intelligence. C’est qu’un modèle à qui l’on demande un chiffre, sans rien pour comparer, devine, et lorsqu’il devine, il devine bas et vers le milieu.
Nous avons donc exécuté le second test. Claude a reçu le même ensemble que celui remis aux correcteurs d’Engine 2.0 : la transcription, la tâche, deux vrais exemples d’étalonnage à chaque niveau pour cette tâche précise, et l’instruction de nommer l’exemple le plus proche pour chacune des quatre dimensions plutôt que de produire un chiffre. Chaque modèle a aussi reçu une courte note d’étalonnage adaptée à ses propres tendances.
Avec notre procédure complète : part des réponses notées au niveau vérifié
Les mêmes 48 réponses mises à l'écart. Chaque modèle de Claude a noté chaque réponse une fois, avec les mêmes transcriptions, instructions et exemples d'étalonnage que les correcteurs d'Engine 2.0 eux-mêmes.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
69%
Claude Sonnet 5
Les exemples d’étalonnage font une grande différence. Opus 5 grimpe de 62% à 77%; Sonnet 5 passe de 45% à 69%. La précision de niveau inférieur des deux atteint 88%, comme Engine 2.0. La précision de niveau moyen atteint 81% pour les deux. Cela vaut la peine de s’y arrêter, car cela indique où se trouve réellement la valeur d’un correcteur conçu sur mesure : pas dans un modèle plus intelligent, mais dans de vrais exemples de ce à quoi ressemble chaque niveau pour chaque tâche précise, et dans une question qui force le modèle à comparer plutôt qu’à deviner.
Malgré cela, les deux modèles restent derrière au sommet de l’échelle. Avec la procédure complète, Opus 5 reconnaît 63% des réponses de niveau supérieur et Sonnet 5 en reconnaît 38%, contre 71% pour Engine 2.0. Un seul modèle qui fait un seul passage se retient encore devant une réponse solide comportant un faux pas. Engine 2.0 comble l’écart restant grâce à trois autres éléments : deux correcteurs indépendants provenant de fournisseurs différents, trois votes de chacun dont on retient le vote médian, et une règle de réconciliation qui retient la note la plus élevée lorsque les deux correcteurs sont fortement en désaccord, car l’analyse a montré que le verdict le plus bas était presque toujours le mauvais sur les réponses solides.
Nous avons aussi essayé le raccourci évident : conserver la consigne simple et ajouter des instructions comme « ne dérivez pas vers le milieu » ou « une réponse de niveau 9 n’a pas besoin d’être parfaite ». Cela n’a produit aucun changement mesurable. Le modèle est d’accord avec l’instruction, puis fait ce qu’il allait faire de toute façon. Ce qui fonctionne, c’est de changer la question, et de lui donner quelque chose de réel à quoi comparer.
L’écart de flux de travail : enregistrer et c’est parti, ou tout faire soi-même
Les chiffres de précision présument que la correction a effectivement lieu. Avec Claude, une quantité surprenante de travail se situe entre le moment où vous appuyez sur arrêt pour votre enregistrement et celui où vous lisez une note.
Premièrement, il vous faut une transcription. L’interface de clavardage de Claude ne note pas les enregistrements audio, il faut donc produire du texte. Cela signifie soit taper ce que vous avez dit, ce qui le modifie, soit passer l’enregistrement dans un outil de transcription. Et voici un détail qui nous a coûté beaucoup de précision avant que nous le comprenions : la transcription doit être intégrale. Chaque hésitation, chaque reprise, chaque autocorrection doit être conservée. Lorsque nous avons testé une transcription « nettoyée » dont les hésitations avaient été retirées, la précision a chuté de quinze points, parce que ces hésitations sont exactement la preuve dont un correcteur a besoin pour juger comment sonne une réponse. La plupart des outils de transcription grand public nettoient par défaut.
Deuxièmement, il vous faut la tâche. Claude ne possède pas de banque de consignes de style CELPIP avec le bon minutage et le bon format. Vous devez soit écrire la vôtre, ce qui signifie deviner ce que demande le vrai test, soit en trouver une ailleurs et la coller avec la transcription.
Troisièmement, si vous voulez mieux que les chiffres du test simple, il vous faut des exemples d’étalonnage : de vraies réponses à chaque niveau pour le même type de tâche, avec des niveaux vérifiés. C’est l’intrant qui a fait passer Opus 5 de 62% à 77% dans notre test, et c’est celui qu’un candidat ne peut pas produire à la maison.
Quatrièmement, vous refaites tout cela pour la réponse suivante. Et pour celle d’après.
Sur Prepamigo, vous choisissez une tâche dans la banque, le minuteur démarre, vous parlez, et environ dix secondes après avoir arrêté, la note et la rétroaction apparaissent à l’écran. La transcription est intégrale par conception, les exemples d’étalonnage sont rattachés à la tâche automatiquement, et il n’y a rien à coller ni aucune consigne à écrire. La onzième réponse de la soirée vous coûte le même effort que la première.
Constance : la même réponse, la même note
Une note que l’on ne peut pas reproduire n’est pas une mesure. Si le même enregistrement obtient un 8 lundi et un 10 mardi, vous n’avez rien appris sur votre expression orale, mais quelque chose sur l’humeur du correcteur. Nous avons donc aussi testé si chaque système donne la même réponse deux fois.
Engine 2.0 a été exécuté sur les 48 réponses mises à l’écart trois fois distinctes. Il a obtenu 81.3% à chaque exécution. En examinant les réponses individuelles plutôt que l’ensemble, 87.5% ont reçu une note identique aux trois exécutions, et seulement 4.2% ont bougé de deux points ou plus. Ces quelques cas sont des réponses qui se situent juste à la frontière entre deux niveaux, où une petite différence de jugement fait légitimement basculer la note d’un côté ou de l’autre.
Le test simple sur Claude a bougé de plusieurs points entre les exécutions au niveau global, et davantage au niveau des réponses individuelles. Cet écart de constance n’est pas un accident propre aux modèles en cause. Il vient du vote. Chaque correcteur d’Engine 2.0 vote trois fois sur chaque réponse et l’on retient le vote médian, ce qui élimine l’écart occasionnel qu’un seul passage produit. Lorsque nous avons testé la même configuration avec un seul vote plutôt que trois, la concordance entre les exécutions est tombée de 87.5% à 77.1%. Une seule conversation avec Claude est un seul vote.
Une rétroaction sur laquelle agir
Une note vous indique où vous en êtes. La rétroaction vous indique quoi faire ensuite, et c’est un domaine où Claude est vraiment bon. Il écrit clairement, il est patient, et si vous lui demandez pourquoi il a donné telle note, il expliquera aussi longuement que vous le souhaitez. Pour un candidat qui veut discuter d’une réponse, cela a de la valeur.
Le risque est le même qu’avec la note : une explication fluide n’équivaut pas à un diagnostic exact. Un modèle qui a noté un 10 comme un 7 expliquera, de façon convaincante, pourquoi c’est un 7. Il trouvera quelque chose à pointer. Et comme Claude n’a pas eu à s’appuyer sur des preuves avant de noter, l’explication est écrite après coup, pour justifier un chiffre déjà choisi.
Engine 2.0 fonctionne dans l’autre sens. Comme chaque correcteur doit s’appuyer sur des preuves pour chaque dimension qu’il juge, la couche de rétroaction reçoit ces preuves directement : les phrases exactes de votre transcription qui ont appuyé le verdict sur le contenu, le vocabulaire, la façon dont vous sonnez, et si vous avez accompli la tâche. La rétroaction est écrite à partir de ces preuves et cite vos propres mots. Dans notre vérification de 158 citations sur un échantillon de rétroactions, 157 apparaissaient mot pour mot dans la transcription. Lorsque nous avons demandé à un modèle juge indépendant de comparer la rétroaction d’Engine 2.0 à celle produite par notre système précédent, sans savoir laquelle était laquelle, il a préféré Engine 2.0 dans 20 comparaisons sur 24, tant en jugeant comme le ferait un correcteur qu’en jugeant comme le ferait un candidat.
Nous avons aussi testé si la rétroaction place la critique au bon endroit. Nous avons pris des réponses solides et avons délibérément endommagé un aspect de chacune : en insérant des erreurs de grammaire et des hésitations, en remplaçant des mots précis par des mots vagues, en retirant des détails d’appui, ou en supprimant l’action centrale demandée par la tâche. Dans trois des quatre cas, la dimension que nous avions endommagée était celle dont la note chutait le plus. C’est le genre de vérification qu’un clavardeur IA ne peut pas facilement réussir, parce qu’il n’a pas de dimensions fixes auxquelles se mesurer.
Ce que coûte la pratique au quotidien
Une note de Speaking est la plus utile à votre quarantième réponse, pas à votre quatrième. C’est à ce moment qu’elle commence à vous dire si un changement dans votre façon de parler fonctionne réellement. La question pratique n’est donc pas ce que coûte chaque outil, mais ce qu’il coûte de l’utiliser en grand volume.
Claude Pro coûte US$20 par mois, environ CA$28, ou US$17 par mois en facturation annuelle, tel que publié sur claude.com en septembre 2026. Il vient avec une fenêtre d’utilisation glissante de cinq heures et une limite hebdomadaire; lorsque vous atteignez l’une ou l’autre, vous attendez. De longues transcriptions avec des exemples d’étalonnage joints sont exactement le genre de message qui consomme une bonne partie de cette allocation. Les forfaits Max, à partir de US$100 par mois, environ CA$138 avant taxes, relèvent nettement les limites mais ne les éliminent pas. Aucun des forfaits n’inclut de banque de questions, de minuteur, de transcription, d’exemples d’étalonnage, ni rien de spécifique au CELPIP.
Prepamigo coûte CA$24.98 par mois, ou CA$8.25 par mois sur le forfait annuel, soit CA$98.98 pour l’année, taxes incluses, et vous pouvez annuler à tout moment. Chaque forfait inclut une notation illimitée par Engine 2.0 sans plafond quotidien, par séance ou hebdomadaire, des tentatives illimitées, et la banque de questions complète : 80 séries d’exercices complètes et plus de 2,000 tâches d’exercice couvrant le Speaking, le Writing, le Reading et le Listening, conçues pour suivre les types de tâches, le minutage et le format du test CELPIP General.
En résumé : pour moins que le prix de Claude Pro, vous obtenez un correcteur beaucoup plus précis sur les réponses qui comptent le plus, qui ne vous demande jamais d’attendre, et qui arrive avec les questions et les exemples d’étalonnage déjà en place.
Quand Claude est le meilleur outil
Cet article ne prétend pas que vous ne devriez jamais ouvrir Claude en préparant votre CELPIP. Il fait plusieurs choses mieux qu’un moteur de notation spécialisé, et un candidat sérieux pourrait bien utiliser les deux.
- Discuter d’une réponse. Si vous voulez comprendre pourquoi une raison en particulier était faible, ou trouver trois meilleures idées, une conversation est le bon format. Engine 2.0 vous donne un verdict et des preuves; il ne clavarde pas.
- Aide au vocabulaire et à la formulation. Demander à Claude cinq façons plus naturelles de dire quelque chose est rapide et utile, et ses suggestions sont généralement bonnes.
- Pratique du Writing. Les réponses écrites n’ont pas besoin de transcription, donc l’écart de flux de travail est beaucoup plus petit. La précision de Claude en Writing ne faisait pas partie de ce test, et nous n’avançons aucune affirmation à ce sujet ici.
- Tout ce qui sort du test. Questions sur les formulaires d’immigration, horaires d’étude, explication d’un point de grammaire : Claude est un assistant généraliste et Prepamigo ne l’est pas.
Ce que Claude ne devrait pas être, selon les preuves présentées ici, c’est ce qui vous dit si vous êtes prêt. Pour cela, vous voulez un correcteur conçu pour cette tâche précise, testé sur des réponses qu’il n’avait pas vues, et mesuré niveau par niveau.
Ce qui est nouveau dans vos commentaires
Engine 2.0 arrive avec une couche de commentaires entièrement reconstruite. Elle s'appuie sur les preuves des deux correcteurs, pas seulement sur la note, et elle a été testée auprès de trois profils d'élèves : quelqu'un qui découvre le CELPIP pour la première fois, quelqu'un dont l'anglais est faible et qui cherche l'astuce, et quelqu'un qui n'a qu'une demi-heure par jour avec un test la semaine prochaine. Voici ce qui a changé.
- Vos propres mots, cités. Chaque point de commentaire cite la phrase exacte de votre transcription à laquelle les correcteurs ont réagi. Si une phrase est entre guillemets, elle est copiée mot pour mot; dans notre audit, 157 citations sur 158 l'étaient. Les commentaires n'inventent jamais quelque chose que vous n'avez pas dit.
- Une seule chose à corriger d'abord. Chaque réponse reçoit une seule action prioritaire : le changement qui ferait le plus grimper votre note, formulé dans les mots les plus simples possibles. Deux autres actions concrètes suivent, puis une liste de trois points à repasser dans votre tête avant de commencer à parler.
- Des conseils adaptés à la tâche. Donner un conseil, décrire une scène et convaincre quelqu'un sont notés sur des critères différents. Les commentaires savent désormais ce que chacun des huit types de tâches récompense et s'y adressent directement, au lieu de répéter les mêmes conseils génériques d'une tâche à l'autre.
- Quelle dimension travailler en premier. Les commentaires vous indiquent laquelle des quatre dimensions est votre point faible et laquelle est votre point fort, afin que vous sachiez où se trouve le prochain point, sans cacher cela derrière un chiffre.
- Ce que la tâche demandait et que vous avez manqué. Pour l'exécution de la tâche, les commentaires énumèrent les parties précises de la consigne que vous n'avez pas couvertes, ou indiquent clairement que vous les avez toutes couvertes.
- Des choses que vous pouvez vraiment répéter. Chaque conseil pratique est quelque chose que vous pouvez dire à voix haute avant votre prochaine tentative. Aucun conseil du type « parlez plus clairement » ou « réduisez votre accent » : ce n'est pas ce que mesure la facilité d'écoute, et les commentaires n'en parlent jamais.
- Aucun reproche pour le chronomètre. Une réponse interrompue par le chronomètre après avoir rempli la tâche n'est pas pénalisée pour cette interruption, et les commentaires ne vous le reprochent pas.
Lorsqu'un modèle de jugement indépendant a comparé ces commentaires à ce que produisait notre ancien système pour les mêmes réponses, sans savoir lequel était lequel, il a préféré les nouveaux commentaires dans 20 comparaisons sur 24, aussi bien en jugeant comme le ferait un examinateur qu'en jugeant comme le ferait un élève.
FAQ
Claude peut-il noter ma pratique du CELPIP Speaking? Il vous donnera un chiffre. Interrogé simplement sur 48 réponses inédites aux notes vérifiées, Claude Opus 5 a trouvé le niveau vérifié 62% du temps et Claude Sonnet 5 45% du temps, contre 81% pour Prepamigo Scoring Engine 2.0. Sur les réponses de niveau supérieur, Sonnet 5 avait raison 29% du temps.
Prepamigo est-il plus précis que Claude? Oui : 81% contre 62% et 45% avec une demande simple. Avec notre procédure complète et des exemples d’étalonnage, Opus 5 a atteint 77% et Sonnet 5 69%, toujours derrière, et toujours les plus faibles au sommet de l’échelle.
Combien coûte chacun? Claude Max commence à US$100 par mois, environ CA$138 avant taxes, avec des plafonds d’utilisation; Claude Pro coûte US$20 avec des plafonds plus serrés. Prepamigo coûte CA$24.98 par mois taxes incluses, ou CA$8.25 par mois sur le forfait annuel, avec une notation illimitée et 80 séries d’exercices.
Pourquoi Claude donne-t-il sans cesse un 7 ou un 8 à mes réponses solides? Un modèle à qui l’on demande un chiffre sans rien pour comparer dérive bas et vers le milieu, et une réponse de niveau supérieur n’est jamais parfaite. Interrogé simplement, Sonnet 5 n’a donné 9 ou plus à une réponse de niveau supérieur que 29% du temps.
Pour voir comment fonctionne réellement la notation, lisez à l’intérieur de Scoring Engine 2.0. Pour voir le classement complet incluant GPT et Gemini, lisez quelle IA note le Speaking du CELPIP le plus précisément. Vous pouvez aussi Lire ce guide en anglais. Ou passez la lecture et Enregistrer une réponse.
