Notation

La notation du CELPIP Speaking de Prepamigo est-elle précise? Les chiffres, honnêtement

6 septembre 2026

Engine 2.0 sur 48 réponses mises à l'écart

Part des réponses notées dans la bande vérifiée. Trois exécutions distinctes à des jours différents ont chacune produit 81.3% au global.

81%

Bande exacte

Prepamigo comparé aux meilleurs forfaits de clavardeurs IA

En dollars canadiens. Les prix de Prepamigo incluent les taxes. Claude Max (à partir de US$100) et ChatGPT Pro (US$200) sont convertis au taux de 1,38, avant taxes. La précision correspond à la part des réponses du test réservé notées au niveau vérifié lorsque le modèle nommé est invité, en langage simple, à noter la réponse; moyenne de trois essais.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Prix mensuel
CA$24.98 (taxe incl.)
CA$138+ (taxe en sus)
CA$276 (taxe en sus)
Notation
Illimitée
Plafonnée
Plafonnée
Banque de questions prête à l'emploi
Oui
Non
Non
Séries d'exercices
80
Aucune
Aucune
Tâches d'exercice
2,000+
Aucune
Aucune
Format CELPIP
Oui
Non
Non
Précision
81%
62%
35%
Réponses de niveau supérieur
71%
50%
25%

C’est la bonne question à poser à propos de tout outil de pratique, et la plupart des outils n’y répondent pas. Une note de Speaking ne vaut quelque chose que si elle indique ce qu’un vrai correcteur dirait, et la seule façon de le savoir est de mesurer. Cet article est donc la mesure, présentée simplement, avec les parties qui nous avantagent et celles qui ne nous avantagent pas.

La réponse en un paragraphe : sur 48 réponses de Speaking que Scoring Engine 2.0 de Prepamigo n’avait jamais vues, chacune avec une note vérifiée de façon indépendante, le moteur a trouvé le niveau vérifié 81% du temps et à un point près 92% du temps. Il a produit le même 81% à chacune de trois exécutions distinctes. Il est le plus précis sur les réponses faibles et de niveau moyen, à 88% et 85%, et le moins précis sur les réponses de niveau supérieur, à 71%, où son erreur caractéristique est de donner un 8 à un 10. Interrogé en langage simple pour noter les mêmes transcriptions, le meilleur modèle d’IA généraliste que nous avons testé a atteint 62%, et le plus faible a atteint 31%; avec notre procédure de correction complète, le meilleur a atteint 77%.

Ce qui suit explique comment nous avons obtenu ces chiffres, ce qu’ils signifient à chaque niveau de note, à quel point ils sont stables, où se situent les erreurs, comment la note se compare aux solutions de rechange que vous utilisez peut-être, et comment lire votre propre note à la lumière de tout cela. Si vous voulez seulement le conseil pratique, passez à la section sur la lecture de votre note. Si vous voulez décider si vous devez croire le chiffre du tout, lisez l’article en entier.

Ce que signifie « précis » ici

Avant tout chiffre, la définition. Nous n’affirmons pas qu’une note Prepamigo prédit votre résultat au vrai test. Aucun outil de pratique ne peut le promettre, et quiconque le fait ne fait que deviner. Ce que nous mesurons est plus étroit et plus honnête : étant donné une réponse orale dont la note a été vérifiée de façon indépendante, à quelle fréquence le moteur produit-il une note au même niveau?

Le Speaking du CELPIP est présenté sur une échelle qui va jusqu’à 12, et les notes vérifiées de nos données de référence se présentent en trois bandes : inférieure, c’est-à-dire 4 ou 5; moyenne, c’est-à-dire 7 ou 8; et supérieure, c’est-à-dire 10 et plus. Nous considérons le moteur comme correct lorsque sa note se situe dans la bande vérifiée. Une réponse vérifiée au niveau supérieur est notée correctement si le moteur lui donne un 9, un 10 ou un 11. Sous une lecture plus stricte qui n’accepte que 10 et plus, chaque chiffre de cette page baisse de quelques points et chaque comparaison garde le même ordre.

Les chiffres clés

Que signifie 81% en pratique? Si vous enregistrez dix réponses à un niveau constant, le moteur en placera environ huit dans la bonne bande et environ une de plus à un point près. Il ne placera pas un 5 dans la bande 10 ni un 10 dans la bande 5; cela ne s’est pas produit une seule fois sur 144 réponses notées à travers les trois exécutions. Les erreurs qu’il commet sont les erreurs d’un correcteur prudent sur une réponse limite, et la section suivante montre où elles se concentrent.

Précision à chaque niveau de note

Précision par bande vérifiée

16 réponses mises à l'écart par bande. Chaque barre représente la part des réponses de cette bande notées dans la bande.

88%

Inférieure (4–5)

85%

Moyenne (7–8)

71%

Supérieure (10+)

Réponses de niveau inférieur : 88%. Les réponses faibles sont les plus faciles à reconnaître. Elles ont tendance à être courtes, à reprendre le libellé de la consigne, et à laisser des parties de la tâche inachevées. Le moteur détecte ces signes la plupart du temps. Lorsqu’il se trompe, il se trompe vers le haut : dans tous les cas, la réponse a été notée 8 plutôt que 4 ou 5. La cause est presque toujours une réponse qui sonne fluide et confiante mais qui dit peu de choses; la livraison lui vaut un niveau qu’elle n’a pas gagné sur le contenu. Nous le savons parce que nous pouvons voir quelles dimensions les correcteurs ont placées haut, et c’est chaque fois la facilité d’écoute.

Réponses de niveau moyen : 85%. Ce sont, en un sens, les plus difficiles à noter, parce qu’elles renferment un vrai mélange de forces et de faiblesses qu’il faut soupeser plutôt que simplement repérer. Les erreurs du moteur ici vont dans les deux directions. Quelques réponses avec une hésitation visible mais des idées solides ont été tirées vers le bas à un 5 ou un 6; quelques réponses qui sonnaient soignées ont été poussées vers un 10. L’étape de réconciliation entre les deux correcteurs corrige la plupart de ces cas, ce qui explique pourquoi ce chiffre est aussi élevé.

Réponses de niveau supérieur : 71%. C’est la bande la plus faible et celle dont nous parlons le plus, parce que l’erreur est si constante. Lorsque le moteur rate une réponse de niveau supérieur, il lui donne un 8. Pas un 7, pas un 6; un 8, dans tous les cas sauf une poignée de 9 qui comptent comme corrects. Le moteur voit une réponse solide et se retient d’un cran.

Cela mérite un peu de contexte. La dérive vers le 8 sur les réponses solides n’est pas une particularité de Prepamigo; c’est l’échec caractéristique de chaque correcteur automatisé que nous avons testé, calibré par des humains ou non. Notre moteur précédent souffrait de ce problème bien davantage. Interrogé simplement pour noter les mêmes réponses, le meilleur modèle généraliste a reconnu 56% des réponses de niveau supérieur; le modèle derrière les forfaits payants de ChatGPT en a reconnu 25%; et même avec notre procédure complète, aucun d’entre eux n’a dépassé 63%. Soixante et onze pourcent est le meilleur chiffre que nous ayons atteint, et c’est encore le chiffre que nous voulons le plus améliorer.

Le problème du 8, de votre côté de l’écran

La vue par niveau indique comment le moteur se comporte sur une réponse de niveau connu. Vous, vous regardez les choses dans l’autre sens : vous avez une note et voulez savoir à quel point y croire. Voici donc les mêmes données, mais retournées. Pour chaque note que donne le moteur, à quelle fréquence la réponse était-elle réellement à ce niveau?

  • Si le moteur dit 4 ou 5 : la réponse était de niveau inférieur 93% du temps. Le reste était des réponses de niveau moyen avec beaucoup d’hésitation. Une note basse d’Engine 2.0 est presque toujours juste.
  • Si le moteur dit 10 : la réponse était de niveau supérieur 92% du temps. Un 10 d’Engine 2.0 est un 10.
  • Si le moteur dit 8 : la réponse était de niveau moyen 67% du temps, de niveau supérieur 23% du temps, et de niveau inférieur 10% du temps. Un 8 est la seule note qui vaut la peine d’être lue attentivement.

Autrement dit : un 8 d’Engine 2.0 signifie « probablement moyen, mais peut-être mieux ». Environ une réponse sur quatre qui reçoit un 8 était en fait un 10. Si vous obtenez un 8 sur une réponse que vous croyiez excellente, n’en concluez pas que vous n’êtes pas prêt. Enregistrez la même tâche à nouveau. Un 10 constant sur trois tentatives est un 10; un 8 constant sur trois tentatives est un 8; un résultat mixte est une réponse à la frontière, et la rétroaction vous dira quelle dimension la retient là.

L’habitude la plus utile pour un candidat fort est de traiter un 8 comme une question plutôt que comme un verdict. La rétroaction cite les phrases auxquelles les correcteurs ont réagi. Si ces phrases portent toutes sur l’hésitation et les reprises, vous êtes probablement un 10 sur le contenu et un 9 sur la livraison, et une nouvelle tentative le montrera.

Le même enregistrement obtient-il la même note?

La précision sans constance n’est que de la chance. Si le même enregistrement pouvait obtenir un 8 aujourd’hui et un 10 demain, le chiffre de 81% ne serait qu’une moyenne sur du bruit, et vous ne pourriez pas utiliser la note pour suivre quoi que ce soit. Nous avons donc testé directement la répétabilité.

Les 48 réponses mises à l’écart ont été notées trois fois distinctes, à des jours différents, sans rien changer entre les exécutions. Le chiffre global était 81.3% à chaque exécution. Au niveau des réponses individuelles, 87.5% ont reçu une note identique les trois fois, et seulement 4.2% ont bougé de deux points ou plus. Ces quelques cas sont des réponses qui se situent juste à la frontière entre deux bandes, où une petite différence de jugement fait légitimement basculer la note d’un côté ou de l’autre.

La constance vient d’un choix de conception précis. Chacun des deux correcteurs du moteur vote trois fois sur chaque réponse, et l’on retient le vote médian. Lorsque nous avons testé la même configuration avec un seul vote plutôt que trois, les notes identiques entre les exécutions sont tombées de 87.5% à 77%, et la part des réponses bougeant de deux points ou plus a plus que doublé. Le vote n’a pas changé le chiffre de précision. Il a changé si le chiffre de précision voulait dire quelque chose.

Pour vous, la constance signifie qu’un changement dans votre note est un changement dans votre expression orale. Si vous enregistrez le même type de tâche trois fois en une semaine et que la note passe de 8 à 10, ce n’est pas le correcteur qui a une bonne journée. C’est vous.

Comment cela se compare aux solutions de rechange que vous utilisez peut-être

Un chiffre de précision veut dire davantage lorsqu’on a quelque chose à quoi le comparer. Nous avons donc fait passer les mêmes 48 réponses mises à l’écart dans les modèles d’IA généralistes que les gens utilisent réellement pour noter leur pratique, comme le ferait une personne : nous avons donné à chaque modèle la transcription intégrale et la tâche, lui avons dit qu’il était un correcteur CELPIP expérimenté, et lui avons demandé une note de 0 à 12. Trois exécutions chacune, moyennées.

Part des réponses notées dans la bande vérifiée

Les mêmes 48 réponses mises à l'écart. Chaque modèle a été invité, en langage simple, à noter la transcription; moyenne de trois essais. Engine 2.0 a fonctionné dans sa configuration de production normale.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Engine 2.0 devance chaque modèle par un écart de dix-neuf à cinquante et un points. Interrogé simplement, chaque modèle généraliste note sévèrement : l’erreur sur une réponse faible est habituellement un 3, l’erreur sur une réponse solide un 7 ou un 8. Claude Opus 5 et Gemini sont les deux seuls au-dessus de la moitié. Les trois plus grands modèles GPT se situent entre 31% et 37%, et reconnaissent une réponse de niveau supérieur entre 13% et 27% du temps.

Nous avons ensuite donné à chaque modèle notre procédure complète : les mêmes exemples d’étalonnage pour la tâche précise, la même comparaison forcée, et une courte note d’étalonnage adaptée à ses propres tendances. C’est le meilleur résultat que chaque modèle ait pu atteindre entre nos mains, et ce n’est pas quelque chose qu’un étudiant peut reproduire sans les exemples. Opus 5 est monté à 77%, GPT 5.6 sol et Gemini à 71%, GPT 5.5 et Sonnet 5 à 69%, luna à 63% et GPT-4o mini à 50%. Chacun d’entre eux est tout de même resté derrière Engine 2.0, et aucun n’a reconnu plus de 63% des réponses de niveau supérieur.

Ce qui est nouveau dans vos commentaires

Engine 2.0 arrive avec une couche de commentaires entièrement reconstruite. Elle s'appuie sur les preuves des deux correcteurs, pas seulement sur la note, et elle a été testée auprès de trois profils d'élèves : quelqu'un qui découvre le CELPIP pour la première fois, quelqu'un dont l'anglais est faible et qui cherche l'astuce, et quelqu'un qui n'a qu'une demi-heure par jour avec un test la semaine prochaine. Voici ce qui a changé.

  • Vos propres mots, cités. Chaque point de commentaire cite la phrase exacte de votre transcription à laquelle les correcteurs ont réagi. Si une phrase est entre guillemets, elle est copiée mot pour mot; dans notre audit, 157 citations sur 158 l'étaient. Les commentaires n'inventent jamais quelque chose que vous n'avez pas dit.
  • Une seule chose à corriger d'abord. Chaque réponse reçoit une seule action prioritaire : le changement qui ferait le plus grimper votre note, formulé dans les mots les plus simples possibles. Deux autres actions concrètes suivent, puis une liste de trois points à repasser dans votre tête avant de commencer à parler.
  • Des conseils adaptés à la tâche. Donner un conseil, décrire une scène et convaincre quelqu'un sont notés sur des critères différents. Les commentaires savent désormais ce que chacun des huit types de tâches récompense et s'y adressent directement, au lieu de répéter les mêmes conseils génériques d'une tâche à l'autre.
  • Quelle dimension travailler en premier. Les commentaires vous indiquent laquelle des quatre dimensions est votre point faible et laquelle est votre point fort, afin que vous sachiez où se trouve le prochain point, sans cacher cela derrière un chiffre.
  • Ce que la tâche demandait et que vous avez manqué. Pour l'exécution de la tâche, les commentaires énumèrent les parties précises de la consigne que vous n'avez pas couvertes, ou indiquent clairement que vous les avez toutes couvertes.
  • Des choses que vous pouvez vraiment répéter. Chaque conseil pratique est quelque chose que vous pouvez dire à voix haute avant votre prochaine tentative. Aucun conseil du type « parlez plus clairement » ou « réduisez votre accent » : ce n'est pas ce que mesure la facilité d'écoute, et les commentaires n'en parlent jamais.
  • Aucun reproche pour le chronomètre. Une réponse interrompue par le chronomètre après avoir rempli la tâche n'est pas pénalisée pour cette interruption, et les commentaires ne vous le reprochent pas.

Lorsqu'un modèle de jugement indépendant a comparé ces commentaires à ce que produisait notre ancien système pour les mêmes réponses, sans savoir lequel était lequel, il a préféré les nouveaux commentaires dans 20 comparaisons sur 24, aussi bien en jugeant comme le ferait un examinateur qu'en jugeant comme le ferait un élève.

Comment lire votre note

  1. Un 4 ou un 5 est presque certainement juste. Le moteur identifie les réponses faibles 88% du temps, et lorsqu’il dit 4 ou 5, il a raison 93% du temps. Lisez la rétroaction pour savoir quelle dimension est la plus basse et travaillez celle-là.
  2. Un 10 est un 10. Lorsque le moteur dit 10, la réponse était de niveau supérieur 92% du temps. Vous êtes prêt sur ce type de tâche. Passez à ceux que vous évitez.
  3. Un 8 est une question. Deux fois sur trois, cela signifie moyen. Une fois sur quatre, cela signifie supérieur. Enregistrez la même tâche à nouveau et observez la tendance sur plusieurs tentatives.
  4. Faites confiance aux changements plus qu’aux niveaux. Comme la note est stable, un changement entre les tentatives est un changement dans votre expression orale. Répéter le même type de tâche est la façon la plus rapide de savoir si une nouvelle habitude fonctionne.
  5. Lisez les citations. Les phrases citées dans votre rétroaction sont celles auxquelles les correcteurs ont réagi. Ce sont les mots précis à changer.

FAQ

Quelle est la précision de la note de Speaking de Prepamigo? Sur 48 réponses inédites aux notes vérifiées : 81% à la bande exacte, 92% à un point près, identique sur trois exécutions. Par bande : 88% inférieure, 85% moyenne, 71% supérieure.

Est-ce la même chose que ma vraie note? Aucun outil de pratique ne peut le promettre. Ce que nous mesurons, c’est à quelle fréquence le moteur est en accord avec une note vérifiée sur la même réponse. Lisez votre note comme un niveau accompagné d’une direction, et observez la tendance sur plusieurs tentatives.

Pourquoi ai-je eu un 8 sur une réponse que je croyais excellente? C’est la plus grande erreur restante du moteur : un 8 sur quatre était en fait un 10. Enregistrez la même tâche à nouveau. Un 10 constant sur plusieurs tentatives est un 10.

Le même enregistrement obtiendra-t-il la même note deux fois? 87.5% identique sur trois exécutions; seulement 4.2% ont bougé de deux points ou plus, tous à la frontière entre bandes.

Pour voir comment le moteur fonctionne étape par étape, lisez à l’intérieur de Scoring Engine 2.0. Pour voir le même test exécuté sur GPT, Claude et Gemini, lisez quelle IA note le Speaking du CELPIP le plus précisément. Vous pouvez aussi Lire ce guide en anglais. Ou Enregistrer une réponse et voyez les chiffres par vous-même.

La notation du CELPIP Speaking de Prepamigo est-elle précise? Les chiffres, honnêtement | PrepAmigo