Engine 2.0 在 48 段留出应答上的表现
落在核实等级内的应答占比。三次不同日子的独立运行,总体都得到 81.3%。
81%
确切等级
Prepamigo 对比主流 AI 聊天机器人套餐
单位为加元。Prepamigo 价格已含税。Claude Max(US$100 起)和 ChatGPT Pro(US$200)按 1.38 的汇率换算为加元,税前价格。准确率是指在保留测试集上,模型被用大白话要求打分时,得分落在核实等级内的应答占比;三次运行的平均值。
这是任何一个练习工具都应该被问到的正确问题,而大多数工具都没有回答它。一个口语分数只有在能反映真实评分员会怎么说的情况下才有价值,而想知道它是否做到了这一点,唯一的办法就是测量。所以这篇文章就是这次测量,我们坦率地摆出来,无论是对我们有利的部分,还是不利的部分。
用一段话说完答案:在 48 段 Prepamigo Scoring Engine 2.0 从未见过、且每一段都经过独立核实分数的口语应答上,引擎命中核实等级的比例是 81%,一分以内的比例是 92%。三次独立运行都产生了同样的 81%。它在弱应答和中间等级应答上最准确,分别是 88% 和 85%,在顶级应答上最不准确,只有 71%,它在这里的典型失误是把一段 10 分应答打成 8 分。用大白话让其打分同样的转写文本,我们测试过的表现最好的通用 AI 模型达到 62%,表现最弱的只有 31%;给出我们的完整评分流程后,表现最好的达到 77%。
接下来的内容会讲述我们如何得到这些数字、它们在每个分数等级下分别意味着什么、有多稳定、错误具体出在哪里、这个分数与你可能正在使用的其他工具相比如何,以及在了解了所有这些之后,该如何解读你自己的分数。如果你只想要实用的建议,可以直接跳到关于如何解读分数的部分。如果你想判断这个数字到底能不能信,请读完全文。
这里所说的“准确”是什么意思
在给出任何数字之前,先说清楚定义。我们并不是在说 Prepamigo 的分数能够预测你的考试结果。没有任何练习工具能做出这样的承诺,做出这种承诺的人只是在猜。我们测量的东西范围更窄,也更诚实:给定一段分数已经被独立核实过的口语应答,引擎给出同一等级分数的频率是多少?
CELPIP 口语的评分量表最高到 12 分,我们参考数据中的核实分数分为三个等级:较低,指 4 或 5 分;中间,指 7 或 8 分;顶级,指 10 分及以上。只要引擎的分数落在核实等级内,我们就算它正确。一段核实为顶级的应答,只要引擎给出 9、10 或 11 分,就算打分正确。如果采用更严格的标准,只接受 10 分及以上,本页上的每个数字都会下降几个百分点,但每一项对比的排序都不会改变。
头条数字
81% 在实际中意味着什么?如果你以稳定的水平录制十段应答,引擎会把其中大约八段放进正确的等级,还有大约一段落在一分以内。它不会把一段 5 分的应答放进 10 分的等级,也不会把一段 10 分的应答放进 5 分的等级;在三次运行、总共 144 段打分的应答中,这种情况一次都没有发生过。它犯的错误,是一个谨慎的评分员在边界应答上会犯的那种错误,下一节会展示这些错误具体集中在哪里。
各分数等级下的准确率
按核实等级划分的准确率
每个等级 16 段留出应答。每根柱子代表该等级中落在等级内的应答占比。
88%
较低(4–5)
85%
中间(7–8)
71%
顶级(10+)
较低等级应答:88%。弱应答是最容易识别的。它们往往简短,会重复题目本身的措辞,并且会漏掉任务的一部分。引擎大多数时候都能捕捉到这些信号。它出错的时候,是往上错:无一例外,都是把应答打成 8 分而不是 4 或 5 分。原因几乎总是同一个:应答听起来流利自信,但实际内容很少;流畅的表达让它获得了一个在内容上并不匹配的等级。我们知道这一点,是因为我们能看到评分员把哪个维度打得高,而每一次都是听感这个维度。
中间等级应答:85%。从某种意义上说,这是最难打分的一类,因为它们混合着真实的优点和缺点,需要权衡而不是简单地发现。引擎在这里的失误会朝两个方向发生。有些明显带有停顿但想法扎实的应答被拉低到 5 分或 6 分;有些听起来很流畅的应答被推高到 10 分。两个评分员之间的调和步骤能捕捉到大多数这类情况,这也是这个数字能达到这么高的原因。
顶级应答:71%。这是表现最弱的一个等级,也是我们谈论最多的一个,因为这里的错误如此一致。当引擎漏判一段顶级应答时,它给出的是 8 分。不是 7 分,也不是 6 分;除了少数被算作正确的 9 分之外,几乎全部都是 8 分。引擎看到了一段强应答,却压低了一个档次。
这一点需要放在背景中理解。强应答被压向 8 分的这种漂移,不是 Prepamigo 特有的怪癖;它是我们测试过的每一个自动评分系统的典型失败模式,无论是否经过人工校准。我们的上一代引擎在这方面的问题要严重得多。用简单提问打分同样的应答,表现最好的通用模型只识别出 56% 的顶级应答;支撑 ChatGPT 付费套餐的模型识别出 25%;即便给出我们的完整流程,也没有一个能超过 63%。71% 是我们目前达到的最好数字,也仍然是我们最想提升的那个数字。
8 分问题:从你这一侧看
按等级看的视图告诉你,引擎在一个已知等级的应答上表现如何。而你看这件事的方向恰恰相反:你手里有一个分数,想知道该在多大程度上相信它。所以这里把同一份数据反过来呈现:对于引擎给出的每一个分数,应答实际处于该等级的频率是多少?
- 如果引擎给出 4 分或 5 分:应答有 93% 的时间确实处于较低等级。剩下的部分是带有大量停顿的中间等级应答。Engine 2.0 给出的低分几乎总是对的。
- 如果引擎给出 10 分:应答有 92% 的时间确实处于顶级。Engine 2.0 给出的 10 分就是 10 分。
- 如果引擎给出 8 分:应答有 67% 的时间处于中间等级,23% 的时间处于顶级,10% 的时间处于较低等级。8 分是唯一一个值得仔细解读的分数。
说得直白一点:Engine 2.0 给出的 8 分,意思是“大概是中间等级,但也可能更好”。大约每四段得到 8 分的应答中,就有一段实际上是 10 分。如果你在一段自己认为表现优秀的应答上得到了 8 分,不要就此断定自己还没准备好。再录一次同样的题目。三次练习都稳定在 10 分,那就是 10 分;三次练习都稳定在 8 分,那就是 8 分;如果结果参差不齐,说明这段应答正处在边界上,反馈会告诉你是哪个维度把它拦在那里的。
同一段录音会得到同一个分数吗?
没有一致性的准确率不过是运气。如果同一段录音今天能得到 8 分,明天能得到 10 分,那么这个 81% 的数字就只是噪音上的一个平均值,你也无法用这个分数追踪任何东西。所以我们直接测试了可重复性。
这 48 段留出应答在不同的日子里被独立打分了三次,期间没有改变任何东西。每次的总体数字都是 81.3%。落到单个应答的层面,有 87.5% 三次都拿到了完全相同的分数,只有 4.2% 曾经移动过两分或更多。这少数几段正好处在两个等级的边界上,判断上的细微差异确实会合理地把分数推向一边或另一边。
这种一致性来自一个具体的设计选择。引擎的两个评分员分别对每段应答投三次票,取中间票。当我们把同样的配置改成单次投票而不是三次时,跨运行的相同分数比例从 87.5% 降到了 77%,移动两分或更多的应答比例翻了一倍还多。投票机制没有改变准确率数字本身。它改变的是这个准确率数字是否真的有意义。
对你来说,一致性意味着你分数上的变化就是你口语上的变化。如果你在一周内三次录制同一题型,分数从 8 分变成了 10 分,那不是评分系统那天心情好,而是你真的进步了。
这与你可能正在使用的其他工具相比如何
一个准确率数字,只有在有东西可以比较时才更有意义。所以我们把同样的 48 段留出应答,按照人们实际会用的方式,输入给大家真正会用来给自己练习打分的通用 AI 模型:我们给每个模型逐字转写文本和题目,告诉它它是一名经验丰富的 CELPIP 考官,然后要求它给出一个 0 到 12 的分数。每个模型跑三次并取平均值。
落在核实等级内的应答占比
同样的 48 段留出应答。每个模型都被用大白话要求给转写文本打分;三次运行的平均值。Engine 2.0 以正常生产环境配置运行。
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Engine 2.0 领先每个模型 19 到 51 个百分点。用简单提问测试,每个通用模型都打分偏严:弱应答的失误通常是打成 3 分,强应答的失误通常是打成 7 分或 8 分。Claude Opus 5 和 Gemini 是唯二超过一半的模型。三个较大的 GPT 模型在 31% 到 37% 之间,识别顶级应答的比例在 13% 到 27% 之间。
接着我们又给每个模型都提供了我们的完整流程:该具体题目相同的校准样例、相同的强制比较,以及一份根据其自身倾向调整的简短校准说明。这是我们能让每个模型达到的最好结果,也是学生在没有这些样例的情况下无法复现的结果。Opus 5 提高到 77%,GPT 5.6 sol 和 Gemini 提高到 71%,GPT 5.5 和 Sonnet 5 提高到 69%,luna 提高到 63%,GPT-4o mini 提高到 50%。每一个模型仍然落后于 Engine 2.0,也没有一个能识别出超过 63% 的顶级应答。
你的评语有哪些新变化
Engine 2.0 搭载了全新重构的评语层。它读取的是两位评分员给出的依据,而不只是分数,并针对三类学生做过测试:第一次接触 CELPIP 的学生、英语基础较弱只想要诀窍的学生,以及每天只有半小时、下周就要考试的学生。以下是具体的变化。
- 原话引用,逐字对应. 每一条评语都会引用评分员实际关注的那句原话。凡是加了引号的内容,都是逐字摘录;在我们的审核中,158 处引用里有 157 处确实如此。评语绝不会编造你没有说过的话。
- 先改这一件事. 每篇应答都会给出一个首要改进点:那个最能提升你分数的改动,会用整页里最直白的话写出来。紧接着是两条更具体的行动建议,最后是一份三项检查清单,供你开口前在心里过一遍。
- 针对题型给出的建议. 给建议、描述场景和说服他人,评分标准各不相同。评语现在能识别八种题型各自看重什么,并据此给出建议,而不是在所有题型里重复同一套泛泛的技巧。
- 该先练哪个维度. 评语会告诉你四个维度中哪个最弱、哪个最强,让你清楚下一分该从哪里拿,而不是把这一切都藏在一个分数背后。
- 题目要求了什么、你漏了什么. 在任务完成度这一项上,评语会具体列出题目要求中你没有覆盖到的部分,或者直接说明你已经全部覆盖。
- 真正能拿来练习的建议. 每一条方法都是你在下一次尝试前可以大声练习的内容。评语不会建议你说得更清楚或减少口音:口音不是可理解度所衡量的内容,评语也从不对此作出评价。
- 不会因为计时而扣分. 如果一篇应答已经完成了任务要求,只是被时间截断,不会因为这个截断而被扣分,评语也不会因此责怪你。
在一次独立评判中,一个不知道哪份来自哪个系统的评判模型,对同一批应答分别用新旧两套系统生成的评语做了盲测比较:无论是以考官的视角评判,还是以学生的视角评判,它在 24 次比较中有 20 次更倾向于新的评语。
如何解读你的分数
- 4 分或 5 分几乎肯定是对的。引擎识别弱应答的比例是 88%,而当它给出 4 分或 5 分时,正确率是 93%。读一读反馈,看看哪个维度最低,然后专攻那一项。
- 10 分就是 10 分。当引擎给出 10 分时,应答有 92% 的时间确实处于顶级。你在这个题型上已经准备好了。去练那些你一直回避的题型吧。
- 8 分是一个问题。三分之二的时候它意味着中间等级。四分之一的时候它意味着顶级。再录一次同样的题目,观察多次练习之间的规律。
- 相信变化,比相信单一等级更重要。由于分数是稳定的,多次练习之间的变化就是你口语水平的变化。重复练习同一题型,是判断一个新习惯是否真的有效最快的方法。
- 读一读引用的原文。反馈中引用的那些话,正是评分员做出反应的地方。它们就是你该修改的具体用词。
常见问题
Prepamigo 的口语分数有多准确? 在 48 段分数已核实的从未见过的应答上:确切等级命中率 81%,一分以内 92%,三次运行结果完全一致。按等级看:较低 88%,中间 85%,顶级 71%。
这和我真实的分数一样吗? 没有任何练习工具能做出这样的承诺。我们测量的是引擎在同一段应答上与核实分数一致的频率。请把你的分数当作一个带方向的等级来解读,并关注多次练习之间的规律。
为什么我在一段自认为表现优秀的应答上得到了 8 分? 这是引擎目前最大的剩余误差:每四个 8 分中就有一个实际上是 10 分。再录一次同样的题目。多次练习都稳定在 10 分,那就是 10 分。
同一段录音会两次都得到同样的分数吗? 三次运行中有 87.5% 完全一致;只有 4.2% 移动了两分或更多,且全部处在等级边界上。
想一步步了解引擎的运作方式,可以读一读 深入了解 Scoring Engine 2.0。想看同样的测试在 GPT、Claude 和 Gemini 上的结果,可以读 哪个 AI 打 CELPIP 口语分最准。如果想看英文原文,可以读 阅读英文版指南。或者 录制一段应答,亲自看看这些数字。
