Part des réponses notées au niveau vérifié
48 réponses mises à l'écart, 16 par bande. Chaque modèle a reçu la transcription et a été invité, en langage simple, à la noter sur l'échelle du CELPIP; moyenne de trois essais. Engine 2.0 a fonctionné dans sa configuration de production normale.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Prepamigo comparé aux meilleurs forfaits de clavardeurs IA
En dollars canadiens. Les prix de Prepamigo incluent les taxes. Claude Max (à partir de US$100) et ChatGPT Pro (US$200) sont convertis au taux de 1,38, avant taxes. La précision correspond à la part des réponses du test réservé notées au niveau vérifié lorsque le modèle nommé est invité, en langage simple, à noter la réponse; moyenne de trois essais.
Beaucoup de candidats au CELPIP notent maintenant eux-mêmes leur pratique du Speaking avec un clavardeur IA. Enregistrer une réponse, la transcrire, la coller, demander une note. C’est rapide et gratuit ou presque, et les explications semblent faire autorité. Ce que personne ne vous dit, c’est à quelle fréquence le chiffre est juste, quel modèle croire, ou si la façon dont vous posez la question change la réponse. Nous voulions le savoir, alors nous avons construit le test et l’avons exécuté sur huit systèmes, de deux façons.
La première façon est le graphique ci-dessus : coller la transcription, demander une note, comme le ferait un étudiant. Parmi les modèles généralistes, Claude Opus 5 était le plus précis à 62%, Gemini suivait à 58%, et tout le reste était sous la moitié : Claude Sonnet 5 et GPT-4o mini à 45%, GPT 5.5 à 37%, GPT 5.6 sol à 35%, GPT 5.6 luna à 31%. Un système conçu sur mesure, Prepamigo Scoring Engine 2.0, a atteint 81% sur les mêmes réponses.
La seconde façon est celle que nous jugeons la plus instructive : nous avons donné à chaque modèle notre propre procédure de correction, avec de vrais exemples d’étalonnage et une comparaison forcée, pour voir jusqu’où chacun pouvait aller. Chaque modèle s’est amélioré, certains de façon spectaculaire, et chaque modèle est tout de même resté derrière Engine 2.0. Nous devons être transparents : Prepamigo est notre produit. Nous avons essayé de rendre les deux tests équitables pour tous les autres, et là où un modèle nous a devancés à un niveau précis, nous le disons.
Le classement de la consigne simple
Trois paliers sont visibles dans le graphique en haut. Engine 2.0 à 81% se tient seul. Claude Opus 5 à 62% et Gemini à 58% forment un second palier : utilisables, si vous acceptez de vous tromper deux fois sur cinq. Tout le reste est sous 50%, c’est-à-dire pire qu’un tirage au sort entre les trois bandes le serait si vous ne saviez rien du tout sur la réponse.
C’est la caractéristique déterminante du test simple : chaque modèle généraliste note sévèrement. La note moyenne qu’ils ont donnée à une réponse vérifiée de niveau supérieur allait de 7.2 (luna) à 8.6 (Opus 5). La note moyenne qu’ils ont donnée à une réponse vérifiée de niveau inférieur allait de 3.7 à 4.3, sous la bande pour tous sauf Opus 5 et Gemini. Sans exemples de ce à quoi ressemble réellement chaque niveau, les modèles comparent la réponse à une réponse parfaite imaginaire et déduisent des points.
Résultats à chaque niveau de note
Un chiffre global cache où se situent les erreurs, et c’est cet endroit qui détermine si un correcteur vous est utile. Voici les résultats du test simple par bande.
Réponses de niveau inférieur (note vérifiée de 4 ou 5)
16 réponses mises à l'écart par système, consigne simple, moyenne de trois exécutions.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
75%
GPT-4o mini
56%
Gemini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
44%
Claude Sonnet 5
Les réponses faibles devraient être l’extrémité facile de l’échelle, et avec une consigne simple, elles ne le sont pas. Engine 2.0 est à 88%, Opus 5 à 77%, GPT-4o mini à 75%. Tout le reste se situe environ à la moitié, et Sonnet 5 est à 44%. L’erreur est presque toujours un 3 : le modèle voit une réponse faible et la note sous la bande plutôt que dans la bande. Le chiffre respectable de GPT-4o mini ici est le premier signe de son problème, qui est qu’il note presque tout trop bas.
Réponses de niveau moyen (note vérifiée de 7 ou 8)
16 réponses mises à l'écart par système, consigne simple, moyenne de trois exécutions.
85%
Prepamigo Engine 2.0
63%
Gemini
63%
Claude Sonnet 5
58%
Claude Opus 5
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
La bande moyenne sépare le terrain. Engine 2.0 est à 85%. Gemini et Sonnet 5 sont à 63%, Opus 5 à 58%. Puis une chute : GPT-4o mini à 44% et les trois plus grands modèles GPT entre 27% et 29%. Les réponses de niveau moyen renferment un mélange réel de forces et de faiblesses qu’il faut soupeser, et sans rien pour comparer, les modèles GPT voient les faiblesses et donnent un 5 ou un 6. Un candidat de niveau 7 ou 8 qui demande une note à GPT 5.6 sol entendra la bonne bande moins de trois fois sur dix.
Réponses de niveau supérieur (note vérifiée de 10 ou plus)
16 réponses mises à l'écart par système, consigne simple, moyenne de trois exécutions. Presque toutes les erreurs sont des 7 ou des 8.
71%
Prepamigo Engine 2.0
56%
Gemini
50%
Claude Opus 5
29%
Claude Sonnet 5
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
La bande supérieure est celle où les différences comptent le plus, et où la consigne simple fait le plus de dégâts. Engine 2.0 reconnaît 71% des réponses de niveau supérieur. Gemini en reconnaît 56% et Opus 5 exactement la moitié. Puis Sonnet 5 à 29%, GPT 5.5 à 27%, GPT 5.6 sol à 25%, GPT-4o mini à 17% et GPT 5.6 luna à 13%. Cinq des sept modèles généralistes donnent un 7 ou un 8 à au moins sept réponses sur dix qui mériteraient un 10.
Si vous êtes un candidat fort qui se corrige avec un clavardeur IA, c’est le chiffre à retenir. La probabilité qu’une demande simple à GPT 5.6 sol vous dise qu’un 10 est un 10 est de une sur quatre.
Le second classement : avec notre procédure complète
Les chiffres du test simple ne sont pas un verdict sur l’intelligence de ces modèles. Ils sont un verdict sur ce qui se passe lorsqu’on demande à un modèle un chiffre sans rien pour comparer. Nous avons donc mené le second test, donnant à chaque modèle les exemples d’étalonnage et la comparaison forcée qu’utilisent les correcteurs d’Engine 2.0 eux-mêmes.
Avec notre procédure complète : part des réponses notées au niveau vérifié
Les mêmes 48 réponses mises à l'écart. Mêmes transcriptions, instructions et exemples d'étalonnage pour chaque système; chaque modèle a noté chaque réponse une fois. Gemini a aussi reçu l'audio.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
71%
GPT 5.6 sol
71%
Gemini
69%
GPT 5.5
69%
Claude Sonnet 5
63%
GPT 5.6 luna
50%
GPT-4o mini
Chaque modèle s’améliore. Opus 5 passe de 62% à 77%. GPT 5.6 sol double, passant de 35% à 71%. GPT 5.5 passe de 37% à 69%, Sonnet 5 de 45% à 69%, luna de 31% à 63%, Gemini de 58% à 71%. GPT-4o mini bouge à peine, de 45% à 50%, parce qu’il note tout trop bas peu importe ce qu’on lui montre.
L’ordre change aussi. Avec une consigne simple, les modèles de Claude étaient bien devant les modèles GPT. Avec la procédure complète, GPT 5.6 sol dépasse Sonnet 5 et fait match nul avec Gemini, et quatre modèles se regroupent entre 69% et 71%, statistiquement indistinguables sur cet échantillon. Opus 5 reste en tête du champ généraliste à 77%, quatre points derrière Engine 2.0.
À l’échelle du niveau, la procédure complète fait grimper la précision de la bande inférieure à 88% pour quatre modèles, comme Engine 2.0, et la précision de la bande moyenne à 81% pour les deux modèles de Claude. La bande supérieure est là où l’écart persiste : Opus 5, GPT 5.6 sol, Gemini et GPT 5.5 s’arrêtent tous à 63%, Sonnet 5 à 38%, et GPT-4o mini à zéro, contre 71% pour Engine 2.0. Un seul modèle qui fait un seul passage se retient encore devant une réponse solide comportant un faux pas. Engine 2.0 comble cet écart restant grâce à deux correcteurs indépendants provenant de fournisseurs différents, trois votes de chacun dont on retient le vote médian, et une règle de réconciliation qui retient la note la plus élevée lorsque les deux correcteurs sont fortement en désaccord, car l’analyse a montré que le verdict le plus bas était presque toujours le mauvais sur les réponses solides.
Pourquoi les modèles dérivent bas et vers le milieu
Le motif est si constant à travers des modèles de trois entreprises différentes qu’il ne peut pas être une particularité de l’un d’entre eux. C’est une propriété de la tâche.
Lorsqu’on demande à un modèle de placer une réponse sur une échelle, il se réfugie vers le centre lorsqu’il n’est pas certain, parce que c’est là où une mauvaise réponse coûte le moins. Et lorsqu’il n’a pas d’exemples de ce à quoi ressemble réellement un niveau, il compare la réponse à une réponse parfaite imaginaire et déduit des points pour chaque faux pas. Une réponse de niveau supérieur n’est jamais parfaite. Elle contient une reprise, une phrase simple parmi les phrases complexes, une hésitation avant un mot difficile. Mesurés contre la perfection, ces faux pas coûtent un ou deux crans, et un 10 devient un 8 ou un 7.
Les instructions ne corrigent pas cela. Nous avons essayé de dire explicitement aux modèles qu’un niveau 9 ne requiert pas une réponse sans erreur, que sous-noter une réponse solide est aussi grave que sur-noter une réponse faible. Chaque instruction était acceptée puis ignorée en pratique. Lorsque nous avons fourni à un modèle l’exemple d’étalonnage même dont on lui avait dit qu’il représentait une réponse de niveau supérieur et lui avons demandé de le noter, il lui a donné un 8.
Ce qui corrige la plupart du problème, c’est de changer la question de « quel chiffre? » à « quel exemple? » et de fournir de vrais exemples. C’est la différence entre les deux classements. Même alors, un seul passage dérive encore un peu, parce que les exemples d’étalonnage ne sont pas parfaits et qu’une lecture d’entre eux n’est qu’une lecture. Deux correcteurs, trois votes et une règle de réconciliation sont ce qui comble le reste.
Notes sur chaque modèle
- Claude Opus 5. Le meilleur correcteur généraliste sur les deux tests : 62% en simple (62%, 65% et 58% sur trois exécutions) et 77% avec la procédure complète. Sa faiblesse en consigne simple est la bande moyenne, où il donne des 6; sa faiblesse en procédure complète est la bande supérieure, où il s’arrête à 63%. C’est aussi le modèle le plus cher ici, et de loin.
- Gemini. Deuxième au test simple à 58%, identique sur les trois exécutions, et le plus régulier entre les bandes, avec 56%, 63% et 56%. Avec la procédure complète et l’enregistrement audio, il a atteint 71%, à égalité avec GPT 5.6 sol, qui travaillait uniquement à partir du texte. Entendre l’enregistrement ne l’a pas aidé au-delà de ce que fournit une transcription intégrale.
- Claude Sonnet 5. 45% en simple, avec un profil particulier : raisonnable dans la bande moyenne à 63%, faible sur les réponses faibles à 44% parce qu’il les note 3, et faible au sommet à 29%. Avec la procédure complète, il grimpe à 69% mais reste à 38% sur les réponses de niveau supérieur. Si Sonnet 5 vous donne sans cesse des 8, ne le croyez pas.
- GPT-4o mini. 45% en simple, 50% avec la procédure complète, et dans les deux cas, le chiffre l’avantage. Il note presque tout trop bas : 75% sur les réponses faibles, 17% puis 0% sur les réponses de niveau supérieur. Quoi que vous fassiez, ne notez pas votre Speaking avec ce modèle.
- GPT 5.5. 37% en simple (35%, 42%, 33%), 69% avec la procédure complète. Sa bande moyenne en consigne simple est de 29%. Il était le correcteur de texte d’une version antérieure de notre propre pipeline, et il a été remplacé pour sa faiblesse dans exactement cette bande.
- GPT 5.6 sol. 35% en simple (31%, 40%, 35%), le plus grand écart d’une exécution à l’autre de tous les modèles, et 71% avec la procédure complète, la plus grande amélioration de tous les modèles. Un correcteur compétent lorsqu’on lui montre des exemples, et un mauvais lorsqu’on ne le fait pas. Son habitude en procédure complète est de trop récompenser l’aisance dans la bande moyenne.
- GPT 5.6 luna. Dernier sur les deux tests : 31% en simple et 63% avec la procédure complète. Il tire les réponses moyennes vers le bas près de 5 et a reconnu 13% des réponses de niveau supérieur en simple. Assez peu coûteux pour être utile comme second avis dans un système à deux correcteurs; pas assez précis pour être utilisé seul.
Ce qu’ajoute un système conçu sur mesure
Engine 2.0 n’est pas un meilleur modèle. Il utilise des modèles de ce même classement. Ce qu’il ajoute, c’est de la procédure, et chaque élément de cette procédure a été choisi par la mesure.
- Transcription intégrale, automatiquement. Chaque hésitation et chaque reprise sont conservées, car les retirer a réduit la précision de quinze points lors des tests. Vous n’avez pas à trouver un outil de transcription qui fait cela; la plupart des outils grand public nettoient par défaut.
- Des exemples d’étalonnage rattachés à chaque tâche. Deux vraies réponses par niveau pour chacun des huit types de tâches, déjà en place. C’est l’unique intrant qui a doublé la précision de GPT 5.6 sol, et celui que vous ne pouvez pas produire à la maison.
- Une comparaison, pas un chiffre. Chaque correcteur nomme l’exemple le plus proche sur chacune des quatre dimensions; la note suit par une règle. C’est ce qui arrête la dérive.
- Deux correcteurs de deux fournisseurs. Des modèles différents ont des angles morts différents. Deux d’entre eux, réconciliés par une règle fixe, font mieux que chacun seul.
- Trois votes chacun, on retient le vote médian. Cela n’a pas augmenté la précision, mais cela a fait passer la constance d’une exécution à l’autre de 77% à 87.5%. Une seule réponse d’un clavardeur IA est un seul vote.
- Une réconciliation qui retient la note la plus élevée en cas de fort désaccord. Parce que le verdict le plus bas était presque toujours le mauvais sur les réponses solides. Une simple moyenne est tombée au milieu des soixante lors des tests.
- Des garde-fous. Le silence, quelques mots, les réponses hors sujet et non anglaises reçoivent des notes plancher par règle plutôt que par la supposition d’un modèle.
Le résultat est 81% au global et 71% au sommet, identique sur trois exécutions distinctes, en environ dix secondes par réponse, sans rien à coller.
Si vous allez utiliser un clavardeur IA de toute façon
Certains lecteurs continueront de se corriger avec un clavardeur IA, et c’est un choix raisonnable pour un candidat avec un budget serré ou qui veut discuter de ses réponses. Ces étapes sont la différence entre les deux classements, et elles vous rapprocheront davantage du second que du premier.
- Utilisez une transcription intégrale. Conservez vos hésitations, vos reprises et vos autocorrections. Si votre outil de transcription les retire, le correcteur note une meilleure réponse que celle que vous avez donnée.
- Donnez-lui des exemples, pas une grille. Une ou deux vraies réponses à chaque niveau pour le même type de tâche, avec leur niveau indiqué, font plus que n’importe quelle description de ce à quoi ressemble un niveau 9. Si vous n’avez pas d’exemples vérifiés, c’est l’étape que vous ne pouvez pas reproduire à la maison, et c’est celle qui compte le plus.
- Demandez quel exemple, pas quel chiffre. Pour chacune des quatre dimensions, demandez au modèle de nommer l’exemple le plus proche et interdisez « entre les deux ». Dérivez vous-même la note à partir des niveaux qu’il nomme.
- Demandez plus d’une fois. Notez la même réponse deux ou trois fois dans des conversations distinctes et retenez la réponse médiane. GPT 5.6 sol a varié de neuf points entre les exécutions du test simple.
- Choisissez un modèle avec de bons résultats dans la bande supérieure. Opus 5 ou Gemini si vous demandez simplement; Opus 5 ou GPT 5.6 sol si vous avez des exemples. Jamais GPT-4o mini si vous êtes près d’un 10.
- Méfiez-vous d’un 7 ou d’un 8. Sur chaque modèle généraliste, un 7 ou un 8 sur une réponse que vous croyiez excellente est plus probablement une erreur qu’un verdict.
Quel modèle croire, selon où vous en êtes
La bonne lecture de ces classements dépend de votre niveau actuel, car les modèles échouent à des endroits différents.
- Si vous êtes à un 4 ou un 5 aujourd’hui, Opus 5 interrogé simplement vous le dira environ trois fois sur quatre; la plupart des autres modèles vous diront que vous êtes un 3 environ une fois sur deux. Votre problème n’est pas vraiment le correcteur; c’est la rétroaction, et pour cela vous voulez quelque chose qui vous cite vos propres mots plutôt que de résumer.
- Si vous êtes à un 7 ou un 8, évitez les modèles GPT avec une consigne simple, qui vous diront que vous êtes un 5 ou un 6 sept fois sur dix. Gemini et Sonnet 5 sont les correcteurs en consigne simple les plus fiables dans la bande moyenne, à 63%. Engine 2.0 est à 85%.
- Si vous êtes à un 10 ou plus, c’est là que le choix compte le plus. Interrogé simplement, aucun modèle généraliste ne reconnaîtra un 10 plus de 56% du temps, et les modèles GPT le feront entre 13% et 27% du temps. Engine 2.0 en reconnaît sept sur dix et, plus important encore, donne la même réponse chaque fois que vous demandez.
Le motif à travers les trois bandes est le même que celui que tout l’article décrit. Les modèles ne sont pas stupides; ils sont prudents, et la prudence sans rien pour comparer donne un chiffre bas. Plus vous êtes loin du milieu, plus la prudence d’un correcteur vous coûte cher, et plus il importe que le correcteur ait été conçu pour y résister.
Ce qui est nouveau dans vos commentaires
Engine 2.0 arrive avec une couche de commentaires entièrement reconstruite. Elle s'appuie sur les preuves des deux correcteurs, pas seulement sur la note, et elle a été testée auprès de trois profils d'élèves : quelqu'un qui découvre le CELPIP pour la première fois, quelqu'un dont l'anglais est faible et qui cherche l'astuce, et quelqu'un qui n'a qu'une demi-heure par jour avec un test la semaine prochaine. Voici ce qui a changé.
- Vos propres mots, cités. Chaque point de commentaire cite la phrase exacte de votre transcription à laquelle les correcteurs ont réagi. Si une phrase est entre guillemets, elle est copiée mot pour mot; dans notre audit, 157 citations sur 158 l'étaient. Les commentaires n'inventent jamais quelque chose que vous n'avez pas dit.
- Une seule chose à corriger d'abord. Chaque réponse reçoit une seule action prioritaire : le changement qui ferait le plus grimper votre note, formulé dans les mots les plus simples possibles. Deux autres actions concrètes suivent, puis une liste de trois points à repasser dans votre tête avant de commencer à parler.
- Des conseils adaptés à la tâche. Donner un conseil, décrire une scène et convaincre quelqu'un sont notés sur des critères différents. Les commentaires savent désormais ce que chacun des huit types de tâches récompense et s'y adressent directement, au lieu de répéter les mêmes conseils génériques d'une tâche à l'autre.
- Quelle dimension travailler en premier. Les commentaires vous indiquent laquelle des quatre dimensions est votre point faible et laquelle est votre point fort, afin que vous sachiez où se trouve le prochain point, sans cacher cela derrière un chiffre.
- Ce que la tâche demandait et que vous avez manqué. Pour l'exécution de la tâche, les commentaires énumèrent les parties précises de la consigne que vous n'avez pas couvertes, ou indiquent clairement que vous les avez toutes couvertes.
- Des choses que vous pouvez vraiment répéter. Chaque conseil pratique est quelque chose que vous pouvez dire à voix haute avant votre prochaine tentative. Aucun conseil du type « parlez plus clairement » ou « réduisez votre accent » : ce n'est pas ce que mesure la facilité d'écoute, et les commentaires n'en parlent jamais.
- Aucun reproche pour le chronomètre. Une réponse interrompue par le chronomètre après avoir rempli la tâche n'est pas pénalisée pour cette interruption, et les commentaires ne vous le reprochent pas.
Lorsqu'un modèle de jugement indépendant a comparé ces commentaires à ce que produisait notre ancien système pour les mêmes réponses, sans savoir lequel était lequel, il a préféré les nouveaux commentaires dans 20 comparaisons sur 24, aussi bien en jugeant comme le ferait un examinateur qu'en jugeant comme le ferait un élève.
FAQ
Quel modèle d’IA est le plus précis pour noter le Speaking du CELPIP? Interrogé simplement : Claude Opus 5 à 62%, Gemini 58%, Claude Sonnet 5 et GPT-4o mini 45%, GPT 5.5 37%, GPT 5.6 sol 35%, GPT 5.6 luna 31%. Prepamigo Scoring Engine 2.0 a atteint 81% sur les mêmes réponses.
ChatGPT ou Claude? Claude, clairement, lorsqu’on demande simplement : 62% et 45% contre 35% et 37%. Avec notre procédure complète, l’écart se rétrécit à 77% pour Opus 5 contre 71% pour GPT 5.6 sol.
Pourquoi me donnent-ils tous un 7 ou un 8 sur mes réponses solides? Les modèles qui n’ont rien pour comparer devinent bas et vers le milieu, et une réponse solide comporte toujours de petits faux pas. Interrogé simplement, aucun modèle généraliste n’a reconnu plus de 56% des réponses de niveau supérieur.
Comment obtenir une meilleure note d’un clavardeur IA? Transcription intégrale, réponses exemples à chaque niveau, demandez quel exemple plutôt que quel chiffre, demandez plus d’une fois et retenez la réponse médiane. Cette procédure a doublé GPT 5.6 sol, de 35% à 71%, dans notre test.
Pour un examen plus approfondi des deux comparaisons directes, lisez Prepamigo contre Claude et Prepamigo contre ChatGPT. Pour voir comment la procédure fonctionne étape par étape, lisez à l’intérieur de Scoring Engine 2.0. Vous pouvez aussi Lire ce guide en anglais. Ou Enregistrer une réponse et sautez la transcription.
