Prepamigo Scoring Engine 2.0 contre les modèles de pointe en tant que correcteurs
Part des réponses de Speaking où la note correspondait à la note vérifiée de façon indépendante. 48 réponses que les systèmes n'avaient jamais vues, réparties également entre notes inférieures, moyennes et supérieures. Chaque modèle a reçu la transcription et a été invité, en langage simple, à la noter sur l'échelle du CELPIP; moyenne de trois essais.
81%
Prepamigo Scoring Engine 2.0Prepamigo
62%
Claude Opus 5Anthropic
58%
GeminiGoogle
45%
Claude Sonnet 5Anthropic
45%
GPT-4o miniOpenAI
37%
GPT 5.5OpenAI
35%
GPT 5.6 solOpenAI
31%
GPT 5.6 lunaOpenAI
Prepamigo comparé aux meilleurs forfaits de clavardeurs IA
En dollars canadiens. Les prix de Prepamigo incluent les taxes. Claude Max (à partir de US$100) et ChatGPT Pro (US$200) sont convertis au taux de 1,38, avant taxes. La précision correspond à la part des réponses du test réservé notées au niveau vérifié lorsque le modèle nommé est invité, en langage simple, à noter la réponse; moyenne de trois essais.
Notre correcteur de Speaking le plus précis à ce jour. Sur des réponses qu’il n’avait jamais vues, Prepamigo Scoring Engine 2.0 a trouvé la note vérifiée 81% du temps, devant chaque modèle de pointe que nous avons testé sur la même tâche, et une nette avancée par rapport à Engine 1.0, le correcteur qu’il remplace.
Nous lançons aujourd’hui Prepamigo Scoring Engine 2.0 pour le Speaking, le système qui note chaque réponse de pratique orale sur Prepamigo. Engine 2.0 est une refonte complète de notre façon de noter. Au lieu d’un seul passage de correction, il utilise deux correcteurs indépendants qui comparent chaque réponse directement à des exemples calibrés, votent plusieurs fois, et réconcilient leurs réponses avant qu’une note ne soit affichée.
Le résultat est un correcteur bien plus précis que n’importe quel modèle de pointe utilisé comme le ferait un candidat. Sur un ensemble mis à l’écart de vraies réponses orales aux notes vérifiées de façon indépendante, Engine 2.0 a trouvé la bonne note 81% du temps. Interrogé en langage simple pour noter les mêmes transcriptions, le plus fort d’entre eux, Claude Opus 5, a atteint 62%. Gemini a atteint 58%. Claude Sonnet 5 et GPT-4o mini ont atteint 45%, GPT 5.5 37%, GPT 5.6 sol 35%, et GPT 5.6 luna 31%. Lorsque nous avons ensuite remis à chaque modèle la propre procédure d’Engine 2.0, avec de vrais exemples d’étalonnage pour chaque tâche, le meilleur d’entre eux est monté à 77% et est tout de même resté derrière.
La précision compte le plus là où elle est la plus difficile à atteindre. Engine 2.0 reconnaît une réponse de niveau supérieur 71% du temps. Interrogé simplement, aucun autre modèle n’en a reconnu plus de 56%, et les modèles GPT en ont reconnu entre 13% et 27%. Engine 2.0 résiste aussi à l’échec le plus fréquent des correcteurs automatisés : des notes qui dérivent bas et vers le milieu de l’échelle, peu importe à quel point la réponse est réellement forte ou faible. Cette dérive était la faiblesse que nous observions le plus souvent chez Engine 1.0.
Engine 2.0 est plus rapide, plus constant, et produit une rétroaction qui cite les propres mots de l’étudiant. Il est en ligne dès aujourd’hui pour chaque utilisateur de Prepamigo. Cette page explique ce qu’il fait, comment nous l’avons mesuré, et où se situent encore ses limites.
Précision par rapport aux notes vérifiées
La question qui nous importe est simple. Lorsqu’un étudiant enregistre une réponse, la note à l’écran correspond-elle à celle qu’aurait donnée un correcteur fiable? Pour y répondre, nous avons construit un ensemble de test composé de vraies réponses orales couvrant les huit types de tâches de Speaking, chacune avec une note vérifiée de façon indépendante, et nous avons divisé l’ensemble de façon égale entre notes inférieures, moyennes et supérieures afin qu’aucun niveau ne domine le résultat.
La comparaison utilise 48 de ces réponses qui ont été mises à l’écart dès le départ. Personne sur l’équipe ne les a utilisées pendant la conception ou l’ajustement d’Engine 2.0. Chaque réponse a été transcrite mot pour mot. On a ensuite dit à chaque modèle qu’il était un correcteur CELPIP expérimenté, on lui a donné la consigne de la tâche et la transcription, et on lui a demandé de noter la réponse de 0 à 12, trois fois, à des jours différents. Nous avons fait la moyenne des trois exécutions et compté à quelle fréquence la note correspondait au niveau de la note vérifiée.
51%
moins d'erreurs que Claude Opus 5
19 mauvaises notes par 100 réponses, contre 38.
71%
moins d'erreurs que GPT 5.6 sol
19 mauvaises notes par 100, contre 65.
71%
des réponses de niveau supérieur reconnues
Le meilleur des autres modèles en reconnaît 56%; GPT 5.6 sol en reconnaît 25%.
Trois éléments se dégagent de ces chiffres. Premièrement, l’écart n’est pas mince. Dix-neuf points contre le modèle de pointe le plus fort et quarante-six contre le modèle derrière les forfaits payants de ChatGPT, sur un test de 48 réponses, représentent la différence entre neuf et vingt-deux notes correctes supplémentaires. Deuxièmement, l’écart n’est pas un artefact d’un test complaisant. Les 48 réponses ont été choisies avant que la conception d’Engine 2.0 ne soit finalisée et n’ont jamais été touchées pendant le développement. Troisièmement, la comparaison est celle qui compte pour un étudiant : elle mesure ce que l’on obtient en collant une transcription dans un clavardeur IA et en demandant une note, ce qui est la façon dont presque tout le monde utilise ces modèles.
Un mot sur ce que signifie « correct » ici. Les notes vérifiées sur cette échelle se présentent en niveaux plutôt qu’en points isolés, alors nous comptons une note comme correcte lorsqu’elle se situe dans le niveau vérifié. Une réponse vérifiée au niveau supérieur, par exemple, est notée correctement si le moteur lui donne un 9, un 10 ou un 11. Sous une lecture plus stricte qui n’accepte que 10 et plus, chaque système perd quelques points et le classement ne change pas.
| Système | Demande simple | Avec notre procédure complète |
|---|---|---|
| Prepamigo Scoring Engine 2.0 | 81.3% | — |
| Claude Opus 5 | 61.8% | 77.1% |
| Gemini | 58.3% | 70.8% |
| Claude Sonnet 5 | 45.1% | 68.8% |
| GPT-4o mini | 45.1% | 50.0% |
| GPT 5.5 | 36.8% | 68.8% |
| GPT 5.6 sol | 35.4% | 70.8% |
| GPT 5.6 luna | 30.6% | 62.5% |
Performance à chaque niveau de note
Un chiffre de précision moyen peut cacher beaucoup de choses. Un correcteur excellent sur les réponses faibles et désastreux sur les réponses solides pourrait afficher un chiffre respectable tout en laissant tomber les étudiants qui ont le plus besoin d’une réponse précise. Nous présentons donc la précision séparément pour chacun des trois niveaux de l’ensemble de test : des notes inférieures de 4 ou 5, des notes moyennes de 7 ou 8, et des notes supérieures de 10 et plus.
La plupart des correcteurs, humains ou machines, dérivent vers le milieu. Une réponse solide reçoit un 8 au lieu d’un 10. Une réponse faible reçoit un 6 au lieu d’un 5. Sans rien pour comparer, les modèles de pointe ajoutent une seconde habitude : ils dérivent vers le bas, si bien qu’une réponse faible est souvent notée 3 et une réponse solide 7. Engine 2.0 a été conçu spécifiquement pour résister aux deux tendances, et les résultats le montrent le plus clairement au sommet de l’échelle.
Notes inférieures · note vérifiée de 4 ou 5
16 réponses mises à l'écart par système, demande simple, moyenne de trois exécutions.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
75%
GPT-4o mini
56%
Gemini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
44%
Claude Sonnet 5
Notes moyennes · note vérifiée de 7 ou 8
16 réponses mises à l'écart par système, demande simple, moyenne de trois exécutions.
85%
Prepamigo Engine 2.0
63%
Gemini
63%
Claude Sonnet 5
58%
Claude Opus 5
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
Notes supérieures · note vérifiée de 10 ou plus
16 réponses mises à l'écart par système, demande simple, moyenne de trois exécutions. Presque toutes les erreurs sont des 7 ou des 8.
71%
Prepamigo Engine 2.0
56%
Gemini
50%
Claude Opus 5
29%
Claude Sonnet 5
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
Au niveau inférieur, Engine 2.0 est en tête avec 88%, Claude Opus 5 avec 77% et GPT-4o mini avec 75%. Tous les autres modèles se situent environ à la moitié, et Claude Sonnet 5 est à 44%. L’erreur est presque toujours un 3 : le modèle voit une réponse faible et la note sous le niveau plutôt que dans le niveau. Le chiffre respectable de GPT-4o mini ici est le premier signe de son problème, qui est qu’il note presque tout trop bas; au sommet de l’échelle, il reconnaît une réponse sur six.
Au niveau moyen, Engine 2.0 est en tête avec 85%. Gemini et Claude Sonnet 5 sont à 63%, Claude Opus 5 à 58%, puis une chute : GPT-4o mini à 44% et les trois plus grands modèles GPT entre 27% et 29%. Les réponses de niveau moyen renferment un mélange de forces et de faiblesses qu’il faut soupeser plutôt que simplement repérer, et sans rien pour comparer, les modèles GPT voient les faiblesses et donnent un 5 ou un 6.
Au niveau supérieur, l’écart est le plus large. Engine 2.0 identifie correctement 71% des réponses de niveau supérieur. Gemini en identifie 56% et Opus 5 exactement la moitié. Cinq des sept autres modèles donnent un 7 ou un 8 à au moins sept réponses sur dix qui mériteraient un 10. C’est le problème de dérive vers le milieu dans sa forme la plus pure. Une réponse de niveau supérieur n’est pas parfaite; elle contient parfois un faux pas, une reprise, une phrase simple parmi les phrases complexes, et un correcteur qui la mesure par rapport à une réponse parfaite imaginaire déduit des points pour chacun. Engine 2.0 est calibré par rapport à des exemples qui montrent à quoi ressemble une vraie réponse de niveau supérieur, faux pas inclus, et il est explicitement conçu pour comparer par rapport à ces exemples plutôt qu’à la perfection.
Et si on leur donnait notre procédure complète?
Les chiffres de la demande simple ne sont pas un verdict sur l’intelligence de ces modèles. Ils sont un verdict sur ce qui se passe lorsqu’on demande à un modèle un chiffre sans rien pour comparer. Nous avons donc mené un second test, donnant à chaque modèle exactement ce que reçoivent les correcteurs d’Engine 2.0 eux-mêmes : la transcription, la tâche, deux vrais exemples d’étalonnage à chaque niveau pour cette tâche précise, et l’instruction de nommer l’exemple le plus proche pour chacune des quatre dimensions plutôt que de produire un chiffre. Chaque modèle a aussi reçu une courte note d’étalonnage adaptée à ses propres tendances.
Avec notre procédure complète : part des réponses notées au niveau vérifié
Les mêmes 48 réponses mises à l'écart. Mêmes transcriptions, instructions et exemples d'étalonnage pour chaque système; chaque modèle a noté chaque réponse une fois.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
71%
GPT 5.6 sol
71%
Gemini
69%
GPT 5.5
69%
Claude Sonnet 5
63%
GPT 5.6 luna
50%
GPT-4o mini
Chaque modèle s’améliore, certains de façon spectaculaire. GPT 5.6 sol double, passant de 35% à 71%. Opus 5 grimpe de 62% à 77%. GPT-4o mini bouge à peine, de 45% à 50%, parce qu’il note tout trop bas peu importe ce qu’on lui montre. Et chaque modèle reste tout de même derrière Engine 2.0. Au sommet de l’échelle, l’écart persiste : Opus 5, GPT 5.6 sol, Gemini et GPT 5.5 s’arrêtent tous à 63% des réponses de niveau supérieur, Sonnet 5 à 38%, GPT-4o mini à zéro, contre 71% pour Engine 2.0.
Ce second test indique où se trouve réellement la valeur d’Engine 2.0. Ce n’est pas un modèle plus intelligent; il utilise des modèles de cette même liste. C’est de vrais exemples de ce à quoi ressemble chaque niveau pour chaque tâche précise, une question qui force le modèle à comparer plutôt qu’à deviner, puis trois autres éléments qu’un seul passage ne peut pas fournir : deux correcteurs indépendants provenant de fournisseurs différents, trois votes de chacun dont on retient le vote médian, et une règle de réconciliation qui retient la note la plus élevée lorsque les deux correcteurs sont fortement en désaccord, car l’analyse a montré que le verdict le plus bas était presque toujours le mauvais sur les réponses solides.
Constance et stabilité
Un correcteur digne de confiance doit être constant. Si le même enregistrement peut recevoir un 8 aujourd’hui et un 10 demain, ni l’un ni l’autre chiffre ne veut dire grand-chose, et un étudiant ne peut pas savoir si sa pratique fonctionne. Alors, en plus de la précision, nous mesurons si Engine 2.0 donne la même réponse lorsqu’on lui pose la même question deux fois.
Nous avons exécuté Engine 2.0 sur les 48 réponses mises à l’écart trois fois distinctes, à des jours différents, sans rien changer entre les exécutions. Il a obtenu 81.3% à chaque exécution. Pas approximativement 81% : les mêmes 39 réponses correctes sur 48 chaque fois, à une près. Lorsqu’on regarde les réponses individuelles plutôt que l’ensemble, 87.5% ont reçu une note identique aux trois exécutions, et seulement 4.2% ont bougé de deux points ou plus entre les exécutions. Ces quelques cas sont des réponses qui se situent juste à la frontière entre deux niveaux, où une petite différence de jugement fait légitimement basculer la note d’un côté ou de l’autre.
Le test de demande simple sur les modèles de pointe a bougé bien davantage entre les exécutions. GPT 5.6 sol a obtenu 31%, 40% et 35% sur ses trois exécutions; Opus 5 a obtenu 62%, 65% et 58%. Demandez à un clavardeur IA de noter la même transcription à deux jours différents, et vous obtiendrez, assez souvent, deux notes différentes.
La constance vient de deux décisions de conception. Chaque correcteur d’Engine 2.0 vote trois fois sur chaque réponse et l’on retient le vote médian, ce qui élimine l’écart occasionnel qu’un seul passage produirait. Et les verdicts des deux correcteurs sont réconciliés par une règle fixe plutôt que par un autre modèle, si bien que la même paire de verdicts produit toujours la même note finale. Les deux décisions ont été testées directement : avec un seul vote plutôt que trois, la concordance entre les exécutions est tombée de 87.5% à 77.1%, et la part des réponses bougeant de deux points ou plus a plus que doublé.
Comment Engine 2.0 note une réponse
Engine 2.0 n’est pas un seul modèle. C’est une procédure, et c’est la procédure qui fait toute la différence. Voici ce qui se passe dans les dix secondes environ entre le moment où un étudiant appuie sur arrêt et celui où une note apparaît à l’écran.
- L’enregistrement est transcrit mot pour mot. Chaque hésitation, chaque reprise, chaque autocorrection est conservée. Cela s’est révélé essentiel. Lorsque nous avons testé une transcription « nettoyée » dont les hésitations avaient été retirées, la précision a chuté de quinze points, parce que les hésitations font partie de la preuve dont un correcteur a besoin pour juger comment sonne une réponse.
- Deux correcteurs indépendants lisent la transcription. Ils sont construits sur des modèles sous-jacents différents provenant de fournisseurs différents, afin de ne pas partager les mêmes angles morts. Chaque correcteur reçoit la consigne de la tâche, la transcription, et un petit ensemble d’exemples d’étalonnage pour cette tâche précise : de vraies réponses aux niveaux inférieur, moyen et supérieur, deux par niveau, afin que chaque niveau soit présenté comme un intervalle plutôt que comme un point unique.
- Chaque correcteur compare plutôt que de noter. C’est le changement central par rapport à Engine 1.0. Au lieu qu’on lui demande un chiffre, on demande à chaque correcteur, pour chacune des quatre dimensions de la réponse, à quel exemple d’étalonnage elle ressemble le plus. Il n’y a pas d’option « quelque part entre les deux ». Le fait de devoir s’engager envers l’exemple le plus proche est ce qui arrête la dérive vers le milieu. La note est ensuite dérivée du niveau choisi par une règle fixe, et non par le modèle.
- Chaque correcteur vote trois fois. On retient le vote médian sur chaque dimension. Cela élimine la réponse occasionnelle d’une mauvaise journée sans effacer par la moyenne un jugement authentique.
- Les deux verdicts sont réconciliés. Si les correcteurs sont d’accord ou diffèrent d’un seul point, la note finale est leur moyenne. S’ils diffèrent de deux points ou plus, on retient la note la plus élevée. Cette règle n’est pas de la générosité; c’est de l’étalonnage. Lorsque nous avons analysé chaque cas où les deux correcteurs étaient fortement en désaccord, le verdict le plus bas était presque toujours le mauvais, car le désaccord survenait presque toujours sur une réponse de niveau supérieur pour laquelle un correcteur avait été trop prudent.
- Des garde-fous sont appliqués. Un court ensemble de règles fixes gère les cas sur lesquels aucun correcteur ne devrait avoir à deviner : une réponse silencieuse, longue de quelques mots seulement, dans une autre langue, ou entièrement hors sujet reçoit une note plancher, peu importe ce que renvoient les correcteurs. Lors des tests, le silence a reçu un 3, une réponse de quelques mots un 4, et une réponse hors sujet ou non anglaise un 5, sans aucun échec sur l’ensemble.
Deux propriétés de la conception finale méritent d’être soulignées. Engine 2.0 note uniquement à partir de la transcription, il n’a donc pas besoin de l’audio après la transcription et ne dépend du modèle audio d’aucun fournisseur en particulier. Et comme les deux correcteurs proviennent de fournisseurs différents, si l’un est indisponible, l’autre continue, avec un troisième modèle en relève afin qu’une note soit toujours produite.
Ce qui est nouveau dans vos commentaires
Engine 2.0 arrive avec une couche de commentaires entièrement reconstruite. Elle s'appuie sur les preuves des deux correcteurs, pas seulement sur la note, et elle a été testée auprès de trois profils d'élèves : quelqu'un qui découvre le CELPIP pour la première fois, quelqu'un dont l'anglais est faible et qui cherche l'astuce, et quelqu'un qui n'a qu'une demi-heure par jour avec un test la semaine prochaine. Voici ce qui a changé.
- Vos propres mots, cités. Chaque point de commentaire cite la phrase exacte de votre transcription à laquelle les correcteurs ont réagi. Si une phrase est entre guillemets, elle est copiée mot pour mot; dans notre audit, 157 citations sur 158 l'étaient. Les commentaires n'inventent jamais quelque chose que vous n'avez pas dit.
- Une seule chose à corriger d'abord. Chaque réponse reçoit une seule action prioritaire : le changement qui ferait le plus grimper votre note, formulé dans les mots les plus simples possibles. Deux autres actions concrètes suivent, puis une liste de trois points à repasser dans votre tête avant de commencer à parler.
- Des conseils adaptés à la tâche. Donner un conseil, décrire une scène et convaincre quelqu'un sont notés sur des critères différents. Les commentaires savent désormais ce que chacun des huit types de tâches récompense et s'y adressent directement, au lieu de répéter les mêmes conseils génériques d'une tâche à l'autre.
- Quelle dimension travailler en premier. Les commentaires vous indiquent laquelle des quatre dimensions est votre point faible et laquelle est votre point fort, afin que vous sachiez où se trouve le prochain point, sans cacher cela derrière un chiffre.
- Ce que la tâche demandait et que vous avez manqué. Pour l'exécution de la tâche, les commentaires énumèrent les parties précises de la consigne que vous n'avez pas couvertes, ou indiquent clairement que vous les avez toutes couvertes.
- Des choses que vous pouvez vraiment répéter. Chaque conseil pratique est quelque chose que vous pouvez dire à voix haute avant votre prochaine tentative. Aucun conseil du type « parlez plus clairement » ou « réduisez votre accent » : ce n'est pas ce que mesure la facilité d'écoute, et les commentaires n'en parlent jamais.
- Aucun reproche pour le chronomètre. Une réponse interrompue par le chronomètre après avoir rempli la tâche n'est pas pénalisée pour cette interruption, et les commentaires ne vous le reprochent pas.
Lorsqu'un modèle de jugement indépendant a comparé ces commentaires à ce que produisait notre ancien système pour les mêmes réponses, sans savoir lequel était lequel, il a préféré les nouveaux commentaires dans 20 comparaisons sur 24, aussi bien en jugeant comme le ferait un examinateur qu'en jugeant comme le ferait un élève.
Pratique illimitée pour CA$25 par mois
La précision n’est utile que si vous pouvez vous permettre de l’utiliser tous les jours. Une note de Speaking digne de confiance a le plus de valeur à votre quarantième réponse de pratique, pas à votre quatrième, car c’est à ce moment que la note commence à vous dire si un changement dans votre façon de parler fonctionne réellement. Nous avons donc fixé le prix d’Engine 2.0 pour qu’il soit utilisé sans compter.
Chaque forfait Prepamigo inclut une notation illimitée par Engine 2.0, des tentatives illimitées, et la banque de questions complète : 80 séries d’exercices complètes et plus de 2,000 tâches d’exercice couvrant le Speaking, le Writing, le Reading et le Listening, conçues pour suivre les types de tâches, le minutage et le format du test CELPIP General. Vous appuyez sur enregistrer, vous obtenez une note et une rétroaction fondée sur des preuves en environ dix secondes, et vous pouvez recommencer autant de fois que vous le voulez.
Prepamigo
CA$25/ mois
CA$24.98 par mois au mois · CA$8.25 par mois sur le forfait annuel (CA$98.98 par an) · taxes incluses · annulation à tout moment
- Notation illimitée par Scoring Engine 2.0, sans plafond quotidien, par séance ou hebdomadaire.
- 80 séries d’exercices et plus de 2,000 tâches couvrant les quatre sections, conçues sur le format du vrai test, pour que vous n’ayez jamais à écrire vos propres consignes.
- Enregistrez et c’est parti. La transcription, la correction et la rétroaction sont prises en charge pour vous; il n’y a rien à coller ni aucune consigne à écrire.
- Une rétroaction dans vos propres mots, avec chaque citation traçable jusqu’à ce que vous avez réellement dit.
Claude Max, à titre de comparaison
US$100/ mois
environ CA$138 avant taxes · palier 20x à US$200 par mois · Pro à US$20 avec des plafonds bien plus serrés
- Même Max est plafonné. Une fenêtre d’utilisation glissante de cinq heures et une limite hebdomadaire, cinq ou vingt fois ce que permet Pro; lorsque vous atteignez l’une ou l’autre, vous attendez.
- Aucune banque de questions. Vous apportez vos propres tâches, décidez vous-même si elles ressemblent au vrai test, et suivez vous-même ce que vous avez déjà pratiqué.
- Vous faites toute la préparation. Enregistrer, transcrire, coller la transcription et écrire les instructions de correction sont entièrement à votre charge, chaque fois.
- Une demande simple, pas un correcteur calibré. Interrogé en langage simple, Claude Opus 5 a trouvé les notes vérifiées 62% du temps et Claude Sonnet 5 45%, contre 81% pour Engine 2.0.
Les prix et modalités d’utilisation des forfaits Claude sont tels que publiés sur claude.com en septembre 2026 et peuvent changer. CELPIP est une marque de commerce de son propriétaire; Prepamigo est une plateforme de pratique indépendante et n’est ni affiliée, ni approuvée, ni liée au concepteur du test. Les tâches de pratique de Prepamigo sont du matériel original rédigé pour suivre le format public du test.
Disponibilité
Prepamigo Scoring Engine 2.0 pour le Speaking est maintenant en ligne pour tous les utilisateurs de Prepamigo, sur chaque type de tâche de Speaking. Il n’y a rien à activer. Chaque nouvelle réponse de Speaking est notée par Engine 2.0, et chaque note vient avec une rétroaction tirée des propres mots de l’étudiant.
Une réponse typique est notée en environ dix secondes, plus rapidement qu’Engine 1.0. Engine 2.0 nous coûte aussi moins cher à faire fonctionner par réponse que la conception qu’il remplace, ce qui nous permet de faire fonctionner deux correcteurs avec trois votes chacun pour chaque étudiant sans changer ce que coûte Prepamigo.
Nous publierons des mises à jour des chiffres de cette page à mesure que la validation en conditions réelles décrite ci-dessus avance. Si vous avez un enregistrement que vous croyez avoir été mal noté par Engine 2.0, nous voulons le voir : ces cas sont, à notre connaissance, la façon la plus rapide de trouver la prochaine amélioration.
Pour les comparaisons directes, lisez Prepamigo contre Claude et Prepamigo contre ChatGPT. Vous pouvez aussi Lire ce guide en anglais. Ou Enregistrer une réponse et observez Engine 2.0 à l’œuvre.
