Produit

Prepamigo contre ChatGPT pour le CELPIP Speaking : précision, limites et coût

7 septembre 2026

Part des réponses notées au niveau vérifié

48 réponses de Speaking mises à l'écart, 16 par bande. Chaque modèle GPT a reçu la transcription et a été invité, en langage simple, à la noter sur l'échelle du CELPIP; moyenne de trois essais. Engine 2.0 a fonctionné dans sa configuration de production normale.

81%

Prepamigo Engine 2.0

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo comparé aux meilleurs forfaits de clavardeurs IA

En dollars canadiens. Les prix de Prepamigo incluent les taxes. Claude Max (à partir de US$100) et ChatGPT Pro (US$200) sont convertis au taux de 1,38, avant taxes. La précision correspond à la part des réponses du test réservé notées au niveau vérifié lorsque le modèle nommé est invité, en langage simple, à noter la réponse; moyenne de trois essais.

Prepamigo
ChatGPT ProGPT 5.6 sol
Prix mensuel
CA$24.98 (taxe incl.)
CA$276 (taxe en sus)
Notation
Illimitée
Plafonnée
Banque de questions prête à l'emploi
Oui
Non
Séries d'exercices
80
Aucune
Tâches d'exercice
2,000+
Aucune
Format CELPIP
Oui
Non
Précision
81%
35%
Réponses de niveau supérieur
71%
25%

ChatGPT est probablement l’outil le plus utilisé par les candidats au CELPIP pour corriger eux-mêmes leur pratique du Speaking. Il est sur le téléphone de tout le monde, il répond en quelques secondes, et il vous dira volontiers à quel niveau se situait votre réponse. La question à laquelle répond cet article est de savoir si le niveau qu’il vous annonce est celui que vous obtiendriez réellement. Nous avons mené le test comme le ferait un candidat : coller la transcription, demander une note, et compter.

La réponse courte : sur 48 réponses de Speaking qu’aucun des systèmes n’avait vues, chacune avec une note vérifiée de façon indépendante, Prepamigo Scoring Engine 2.0 a trouvé le bon niveau 81% du temps. Interrogé en langage simple, GPT 5.6 sol, le modèle derrière les forfaits payants de ChatGPT, a trouvé le bon niveau 35% du temps. GPT 5.5 a réussi 37%, GPT 5.6 luna 31%, et GPT-4o mini 45%, un chiffre qui paraît meilleur qu’il ne l’est, parce que ce modèle note presque tout trop bas et se trouve donc à avoir raison sur les réponses faibles.

Nous avons ensuite fait ce que la plupart des comparaisons omettent. Nous avons donné à chaque modèle GPT notre propre procédure de correction, avec de vrais exemples d’étalonnage pour chaque tâche et une comparaison forcée par rapport à ceux-ci, pour voir jusqu’où chacun pouvait aller. GPT 5.6 sol est monté à 71%, GPT 5.5 à 69%, luna à 63% et GPT-4o mini à 50%. Les quatre sont tout de même restés derrière Engine 2.0, et les quatre ont continué d’éprouver le plus de difficulté sur les réponses de niveau supérieur. Le reste de cet article passe en revue les deux tests, les résultats à chaque niveau de note, pourquoi un assistant généraliste dérive vers le milieu de l’échelle, à quoi ressemble le flux de travail quotidien de chaque côté, et ce que coûte chaque option si vous comptez pratiquer sérieusement.

Le test simple : ce qu’obtient réellement un candidat

Quatre-vingt-un pourcent contre trente-cinq. Sur un test de 48 réponses, cela représente vingt-deux notes correctes supplémentaires pour Engine 2.0 par rapport à GPT 5.6 sol. Autrement dit, Engine 2.0 commet 71% moins d’erreurs de notation que GPT 5.6 sol, 70% moins que GPT 5.5, 73% moins que GPT 5.6 luna et 66% moins que GPT-4o mini.

Trois exécutions distinctes du test simple ont donné à GPT 5.6 sol 31%, 40% et 35%, et à GPT 5.5 35%, 42% et 33%. Cet écart entre les exécutions est en soi une constatation : demandez à ChatGPT de noter la même transcription à deux jours différents, et vous obtiendrez, assez souvent, deux notes différentes. Engine 2.0 a obtenu 81.3% à chacune de ses trois exécutions.

Là où l’écart s’ouvre : niveau de note par niveau de note

Un chiffre global cache où se situent les erreurs. Un correcteur excellent sur les réponses faibles et désastreux sur les réponses solides convient à un débutant et nuit activement à quelqu’un qui vise un 10. Voici donc les résultats du test simple répartis par bande vérifiée.

Réponses de niveau inférieur (note vérifiée de 4 ou 5)

16 réponses mises à l'écart, consigne simple, moyenne de trois exécutions. La plupart des erreurs sont une note de 3.

88%

Prepamigo Engine 2.0

75%

GPT-4o mini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

Sur les réponses faibles, Engine 2.0 est en tête avec 88%. GPT-4o mini suit avec 75%, le seul endroit où son habitude de noter trop bas joue en sa faveur. Les trois plus grands modèles GPT se situent entre 52% et 54% : environ une fois sur deux, ils donnent un 3 à une réponse de 4 ou 5, ce qui est la mauvaise bande même si la direction de l’erreur est compréhensible. Un débutant qui utilise ChatGPT pour se corriger se fera dire qu’il est plus faible qu’il ne l’est environ une fois sur deux.

Réponses de niveau moyen (note vérifiée de 7 ou 8)

16 réponses mises à l'écart, consigne simple, moyenne de trois exécutions. Les erreurs sont presque toutes des 5 ou des 6.

85%

Prepamigo Engine 2.0

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

La bande moyenne est là où les modèles GPT avec consigne simple s’effondrent. Engine 2.0 est à 85%; GPT-4o mini à 44%; GPT 5.5, GPT 5.6 sol et luna entre 27% et 29%. Les réponses de niveau moyen renferment un mélange réel de forces et de faiblesses qu’il faut soupeser, et sans exemples d’étalonnage pour comparer, les modèles GPT voient les faiblesses et donnent un 5 ou un 6. Un candidat de niveau 7 ou 8 qui demande une note à GPT 5.6 sol entendra la bonne bande moins de trois fois sur dix.

Réponses de niveau supérieur (note vérifiée de 10 ou plus)

16 réponses mises à l'écart, consigne simple, moyenne de trois exécutions. Presque toutes les erreurs sont des 7 ou des 8.

71%

Prepamigo Engine 2.0

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

Au sommet, Engine 2.0 reconnaît 71% des réponses de niveau supérieur. GPT 5.5 en reconnaît 27%, GPT 5.6 sol 25%, GPT-4o mini 17%, et GPT 5.6 luna 13%. Chaque modèle GPT donne un 7 ou un 8 à au moins sept réponses sur dix qui mériteraient un 10.

Songez à ce que cela signifie pour un candidat fort. Vous enregistrez huit réponses, vous les transcrivez, vous les collez dans ChatGPT et vous demandez une note, et il vous dit que six d’entre elles sont des 7 et des 8. Vous concluez que vous êtes un bon candidat de niveau moyen qui a encore du travail à faire. Vous étiez à un 10 depuis le début. Ce n’est pas hypothétique. C’est ce qu’a fait chaque modèle GPT sur la plupart des réponses de niveau supérieur de notre test.

Si vous utilisez ChatGPT pour vous corriger et qu’il vous donne sans cesse des 7 et des 8, ne le croyez pas automatiquement. Dans notre test, une réponse de niveau supérieur avait trois fois plus de chances de recevoir un 7 ou un 8 de GPT 5.6 sol qu’une note dans sa propre bande.

Et si l’on donnait à ChatGPT notre procédure complète?

Il est tentant de lire les chiffres du test simple comme la preuve que GPT est une famille de modèles faible. Ce n’est pas le cas. Le problème n’est pas l’intelligence. C’est qu’un modèle à qui l’on demande un chiffre, sans rien pour comparer, devine, et lorsqu’il devine, il devine bas et vers le milieu.

Nous avons donc exécuté le second test. Chaque modèle GPT a reçu le même ensemble que celui remis aux correcteurs d’Engine 2.0 : la transcription, la tâche, deux vrais exemples d’étalonnage à chaque niveau pour cette tâche précise, et l’instruction de nommer l’exemple le plus proche pour chacune des quatre dimensions plutôt que de produire un chiffre. Chaque modèle a aussi reçu une courte note d’étalonnage adaptée à ses propres tendances.

Avec notre procédure complète : part des réponses notées au niveau vérifié

Les mêmes 48 réponses mises à l'écart. Chaque modèle GPT a noté chaque réponse une fois, avec les mêmes transcriptions, instructions et exemples d'étalonnage que les correcteurs d'Engine 2.0 eux-mêmes.

81%

Prepamigo Engine 2.0

71%

GPT 5.6 sol

69%

GPT 5.5

63%

GPT 5.6 luna

50%

GPT-4o mini

Les exemples d’étalonnage font une différence énorme. GPT 5.6 sol double, passant de 35% à 71%. GPT 5.5 passe de 37% à 69%, luna de 31% à 63%. GPT-4o mini bouge à peine, de 45% à 50%, parce qu’il continue de noter tout trop bas peu importe ce qu’on lui montre; avec la procédure complète, il n’a reconnu aucune réponse de niveau supérieur. Cela indique où se trouve réellement la valeur d’un correcteur conçu sur mesure : pas dans un modèle plus intelligent, mais dans de vrais exemples de ce à quoi ressemble chaque niveau pour chaque tâche précise, et dans une question qui force le modèle à comparer plutôt qu’à deviner.

Malgré cela, chaque modèle GPT reste derrière. Avec la procédure complète, GPT 5.6 sol est dix points derrière Engine 2.0 au global, dix points derrière dans la bande moyenne (75% contre 85%), et huit points derrière au sommet (63% contre 71%). Son habitude restante est de trop récompenser l’aisance : un 8 compétent livré avec fluidité se retrouve poussé vers un 9 ou un 10. GPT 5.6 luna fait l’inverse, tirant les réponses moyennes vers le bas près de 5, et termine la bande moyenne à 44%. Un seul modèle qui fait un seul passage garde toujours un biais caractéristique, et Engine 2.0 comble l’écart restant grâce à deux correcteurs indépendants provenant de fournisseurs différents, trois votes de chacun dont on retient le vote médian, et une règle de réconciliation qui retient la note la plus élevée lorsque les deux correcteurs sont fortement en désaccord.

Nous avons aussi essayé le raccourci évident : conserver la consigne simple et ajouter des instructions comme « ne dérivez pas vers le milieu » ou « une réponse de niveau 9 n’a pas besoin d’être parfaite ». Cela n’a produit aucun changement mesurable. Ce qui fonctionne, c’est de changer la question, et de donner au modèle quelque chose de réel à quoi comparer.

L’écart de flux de travail : enregistrer et c’est parti, ou tout faire soi-même

Les chiffres de précision présument que la correction a effectivement lieu. Avec ChatGPT, une quantité surprenante de travail se situe entre le moment où vous appuyez sur arrêt pour votre enregistrement et celui où vous lisez une note, et une partie de ce travail modifie la note.

Premièrement, il vous faut une transcription. Le mode vocal de ChatGPT est une conversation, pas un correcteur; pour corriger une réponse enregistrée, il vous faut du texte. Cela signifie soit taper ce que vous avez dit, ce qui le modifie, soit passer l’enregistrement dans un outil de transcription. Et la transcription doit être intégrale. Chaque hésitation, chaque reprise, chaque autocorrection doit être conservée. Lorsque nous avons testé une transcription « nettoyée » dont les hésitations avaient été retirées, la précision a chuté de quinze points, parce que ces hésitations sont exactement la preuve dont un correcteur a besoin pour juger comment sonne une réponse. La plupart des outils de transcription grand public, y compris celui intégré à la plupart des téléphones, nettoient par défaut.

Deuxièmement, il vous faut la tâche. ChatGPT peut inventer une consigne de style CELPIP si vous le lui demandez, mais il devine le format, le minutage et le genre de scénario utilisé par le vrai test. Vous ne saurez pas si la consigne qu’il a écrite ressemble à ce que vous affronterez.

Troisièmement, si vous voulez mieux que les chiffres du test simple, il vous faut des exemples d’étalonnage : de vraies réponses à chaque niveau pour le même type de tâche, avec des niveaux vérifiés. C’est l’intrant qui a doublé la précision de GPT 5.6 sol dans notre test, et c’est celui qu’un candidat ne peut pas produire à la maison.

Quatrièmement, vous refaites tout cela pour la réponse suivante, et chacune compte contre votre allocation de messages.

Sur Prepamigo, vous choisissez une tâche dans la banque, le minuteur démarre, vous parlez, et environ dix secondes après avoir arrêté, la note et la rétroaction apparaissent à l’écran. La transcription est intégrale par conception, les exemples d’étalonnage sont rattachés à la tâche automatiquement, et il n’y a rien à coller ni aucune consigne à écrire. La onzième réponse de la soirée vous coûte le même effort que la première.

Constance : la même réponse, la même note

Une note que l’on ne peut pas reproduire n’est pas une mesure. Si le même enregistrement obtient un 8 lundi et un 10 mardi, vous n’avez rien appris sur votre expression orale. Nous avons donc aussi testé la répétabilité.

Engine 2.0 a été exécuté sur les 48 réponses mises à l’écart trois fois distinctes, à des jours différents. Il a obtenu 81.3% chaque fois. En examinant les réponses individuelles, 87.5% ont reçu une note identique aux trois exécutions, et seulement 4.2% ont bougé de deux points ou plus, toutes des réponses situées à la frontière entre deux bandes.

Le test simple sur GPT 5.6 sol a bougé de neuf points entre sa meilleure et sa pire exécution. Cet écart de stabilité vient du vote. Chaque correcteur d’Engine 2.0 vote trois fois sur chaque réponse et l’on retient le vote médian. Lorsque nous avons testé la même configuration avec un seul vote plutôt que trois, les notes identiques entre les exécutions sont tombées de 87.5% à 77%, et la part des réponses bougeant de deux points ou plus a plus que doublé. Une seule conversation avec ChatGPT est un seul vote. Nous avons aussi vérifié si le fait de fixer une graine aléatoire fixe via l’API rendait les modèles GPT plus répétables. Ce n’était pas le cas; sur GPT 5.6 luna, la répétabilité a même chuté.

Une rétroaction sur laquelle agir

ChatGPT est un bon vulgarisateur. Si vous lui demandez pourquoi il a donné telle note, il vous répondra longuement, de façon claire, et suggérera des améliorations. Pour un candidat qui veut discuter d’une réponse, cela a une réelle valeur.

Le risque est qu’une explication fluide n’équivaut pas à un diagnostic exact. Un modèle qui a noté un 10 comme un 7 expliquera, de façon convaincante, pourquoi c’est un 7. Il trouvera quelque chose à pointer. Et comme il n’a pas eu à s’appuyer sur des preuves avant de noter, l’explication est écrite après coup pour justifier un chiffre déjà choisi.

Engine 2.0 fonctionne dans l’autre sens. Chaque correcteur doit s’appuyer sur des preuves pour chaque dimension avant de nommer un niveau, et la rétroaction est écrite à partir de ces preuves. Elle cite vos propres mots : dans une vérification de 158 citations sur un échantillon de rétroactions, 157 apparaissaient mot pour mot dans la transcription. Lorsqu’un modèle juge indépendant a comparé la rétroaction d’Engine 2.0 à celle de notre système précédent sur les mêmes réponses, à l’aveugle, il a préféré Engine 2.0 dans 20 comparaisons sur 24, tant en jugeant comme le ferait un correcteur qu’en jugeant comme le ferait un candidat.

Nous avons aussi vérifié que la rétroaction place la critique au bon endroit, en prenant des réponses solides et en endommageant délibérément une dimension à la fois. Dans trois des quatre cas, la dimension endommagée était celle dont la note chutait le plus. C’est une vérification qu’un clavardeur IA ne peut pas facilement réussir, parce qu’il n’a pas de dimensions fixes auxquelles se mesurer.

Ce que coûte la pratique au quotidien

Une note de Speaking est la plus utile à votre quarantième réponse, pas à votre quatrième. C’est à ce moment qu’elle commence à vous dire si un changement dans votre façon de parler fonctionne réellement. La question pratique est donc ce que coûte chaque outil à utiliser en grand volume.

ChatGPT Plus coûte US$20 par mois, environ CA$28, facturé mensuellement, tel que publié en septembre 2026. Il vous donne accès à la famille GPT 5.6 avec un plafond de messages par fenêtre glissante; de longues transcriptions avec des exemples d’étalonnage joints sont exactement le genre de message qui consomme une bonne partie de cette allocation, et une fois le plafond atteint, vous attendez ou basculez vers un modèle plus petit. ChatGPT Pro, à US$200 par mois, environ CA$276 avant taxes, relève nettement les limites. Le forfait gratuit dirige une grande partie de son trafic vers des modèles plus petits, et dans ce test, le plus petit d’entre eux n’a reconnu presque aucune réponse de niveau supérieur. Aucun des forfaits n’inclut de banque de questions, de minuteur, de transcription intégrale, d’exemples d’étalonnage, ni rien de spécifique au CELPIP.

Prepamigo coûte CA$24.98 par mois, ou CA$8.25 par mois sur le forfait annuel, soit CA$98.98 pour l’année, taxes incluses, et vous pouvez annuler à tout moment. Chaque forfait inclut une notation illimitée par Engine 2.0 sans plafond quotidien, par séance ou hebdomadaire, des tentatives illimitées, et la banque de questions complète : 80 séries d’exercices complètes et plus de 2,000 tâches d’exercice couvrant le Speaking, le Writing, le Reading et le Listening, conçues pour suivre les types de tâches, le minutage et le format du test CELPIP General.

En résumé : pour moins que le prix de ChatGPT Plus, vous obtenez un correcteur plus de deux fois plus précis dans une comparaison simple, qui ne vous demande jamais d’attendre, et qui arrive avec les questions et les exemples d’étalonnage déjà en place.

Quand ChatGPT est le meilleur outil

Ceci n’est pas un argument pour ne jamais ouvrir ChatGPT en préparant votre CELPIP. Un candidat sérieux pourrait bien utiliser les deux.

  • Discuter d’une réponse. Si vous voulez comprendre pourquoi une raison était faible ou trouver trois meilleures idées, une conversation est le bon format. Engine 2.0 vous donne un verdict et des preuves; il ne clavarde pas.
  • Vocabulaire et formulation. Demander cinq façons plus naturelles de dire quelque chose est rapide et utile.
  • Parler à quelque chose qui répond. Le mode vocal de ChatGPT est une façon raisonnable de se sentir à l’aise de parler anglais à voix haute. Ce n’est pas un correcteur, mais c’est une présence.
  • Pratique du Writing. Les réponses écrites n’ont pas besoin de transcription, donc l’écart de flux de travail est plus petit. La précision de GPT en Writing ne faisait pas partie de ce test et nous n’avançons aucune affirmation à ce sujet.
  • Tout ce qui sort du test. ChatGPT est un assistant généraliste et Prepamigo ne l’est pas.

Ce que ChatGPT ne devrait pas être, selon les preuves présentées ici, c’est ce qui vous dit si vous êtes prêt. Pour cela, vous voulez un correcteur conçu pour cette tâche précise, testé sur des réponses qu’il n’avait pas vues, et mesuré niveau par niveau.

Ce qui est nouveau dans vos commentaires

Engine 2.0 arrive avec une couche de commentaires entièrement reconstruite. Elle s'appuie sur les preuves des deux correcteurs, pas seulement sur la note, et elle a été testée auprès de trois profils d'élèves : quelqu'un qui découvre le CELPIP pour la première fois, quelqu'un dont l'anglais est faible et qui cherche l'astuce, et quelqu'un qui n'a qu'une demi-heure par jour avec un test la semaine prochaine. Voici ce qui a changé.

  • Vos propres mots, cités. Chaque point de commentaire cite la phrase exacte de votre transcription à laquelle les correcteurs ont réagi. Si une phrase est entre guillemets, elle est copiée mot pour mot; dans notre audit, 157 citations sur 158 l'étaient. Les commentaires n'inventent jamais quelque chose que vous n'avez pas dit.
  • Une seule chose à corriger d'abord. Chaque réponse reçoit une seule action prioritaire : le changement qui ferait le plus grimper votre note, formulé dans les mots les plus simples possibles. Deux autres actions concrètes suivent, puis une liste de trois points à repasser dans votre tête avant de commencer à parler.
  • Des conseils adaptés à la tâche. Donner un conseil, décrire une scène et convaincre quelqu'un sont notés sur des critères différents. Les commentaires savent désormais ce que chacun des huit types de tâches récompense et s'y adressent directement, au lieu de répéter les mêmes conseils génériques d'une tâche à l'autre.
  • Quelle dimension travailler en premier. Les commentaires vous indiquent laquelle des quatre dimensions est votre point faible et laquelle est votre point fort, afin que vous sachiez où se trouve le prochain point, sans cacher cela derrière un chiffre.
  • Ce que la tâche demandait et que vous avez manqué. Pour l'exécution de la tâche, les commentaires énumèrent les parties précises de la consigne que vous n'avez pas couvertes, ou indiquent clairement que vous les avez toutes couvertes.
  • Des choses que vous pouvez vraiment répéter. Chaque conseil pratique est quelque chose que vous pouvez dire à voix haute avant votre prochaine tentative. Aucun conseil du type « parlez plus clairement » ou « réduisez votre accent » : ce n'est pas ce que mesure la facilité d'écoute, et les commentaires n'en parlent jamais.
  • Aucun reproche pour le chronomètre. Une réponse interrompue par le chronomètre après avoir rempli la tâche n'est pas pénalisée pour cette interruption, et les commentaires ne vous le reprochent pas.

Lorsqu'un modèle de jugement indépendant a comparé ces commentaires à ce que produisait notre ancien système pour les mêmes réponses, sans savoir lequel était lequel, il a préféré les nouveaux commentaires dans 20 comparaisons sur 24, aussi bien en jugeant comme le ferait un examinateur qu'en jugeant comme le ferait un élève.

FAQ

ChatGPT peut-il noter mon Speaking du CELPIP? Il vous donnera un chiffre. Interrogé simplement sur 48 réponses inédites aux notes vérifiées, GPT 5.6 sol avait raison 35% du temps, GPT 5.5 37%, luna 31%, GPT-4o mini 45%, contre 81% pour Engine 2.0. Sur les réponses de niveau supérieur, GPT 5.6 sol avait raison 25% du temps.

Prepamigo est-il plus précis que ChatGPT? 81% contre 35% pour GPT 5.6 sol avec une demande simple. Avec notre procédure complète et des exemples d’étalonnage, GPT 5.6 sol a atteint 71%, toujours dix points derrière.

Combien coûte chacun? ChatGPT Pro coûte US$200 par mois, environ CA$276 avant taxes; Plus coûte US$20 avec des plafonds de messages. Prepamigo coûte CA$24.98 par mois taxes incluses, ou CA$8.25 par mois sur le forfait annuel, avec une notation illimitée et 80 séries d’exercices.

Quel modèle GPT devrais-je utiliser si j’utilise ChatGPT? Avec une consigne simple, aucun ne s’en tire bien. Avec des exemples d’étalonnage, GPT 5.6 sol. Jamais GPT-4o mini si vous êtes près d’un 10.

Pour la même comparaison face à Claude, lisez Prepamigo contre Claude. Pour le classement complet des huit systèmes, lisez quelle IA note le Speaking du CELPIP le plus précisément. Vous pouvez aussi Lire ce guide en anglais. Ou passez la transcription et Enregistrer une réponse.

Prepamigo contre ChatGPT pour le CELPIP Speaking : précision, limites et coût | PrepAmigo