评分

隆重推出 Prepamigo 口语 Scoring Engine 2.0

2026年9月6日

Prepamigo Scoring Engine 2.0 与前沿模型作为评分者的对比

分数与独立核实分数相符的口语应答占比。48 段这些系统从未见过的应答,在较低、中间和顶级分数之间平均分布。每个模型拿到转写文本后被用大白话要求按 CELPIP 量表打分;三次运行的平均值。

81%

Prepamigo Scoring Engine 2.0Prepamigo

62%

Claude Opus 5Anthropic

58%

GeminiGoogle

45%

Claude Sonnet 5Anthropic

45%

GPT-4o miniOpenAI

37%

GPT 5.5OpenAI

35%

GPT 5.6 solOpenAI

31%

GPT 5.6 lunaOpenAI

Prepamigo 对比主流 AI 聊天机器人套餐

单位为加元。Prepamigo 价格已含税。Claude Max(US$100 起)和 ChatGPT Pro(US$200)按 1.38 的汇率换算为加元,税前价格。准确率是指在保留测试集上,模型被用大白话要求打分时,得分落在核实等级内的应答占比;三次运行的平均值。

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
月费
CA$24.98(含税)
CA$138+(税前)
CA$276(税前)
评分次数
无限
有上限
有上限
现成题库
练习套题
80 套
练习题量
2,000+ 题
CELPIP 真实格式
准确率
81%
62%
35%
顶分识别率
71%
50%
25%

这是迄今为止我们最准确的口语评分系统。在从未见过的应答上,Prepamigo Scoring Engine 2.0 命中核实分数的比例达到 81%,领先于我们测试过的所有前沿模型,也比它所取代的 Engine 1.0 有明显的提升。

今天我们正式发布 Prepamigo 口语 Scoring Engine 2.0,这套系统负责给 Prepamigo 上每一段口语练习应答打分。Engine 2.0 是我们评分方式的一次彻底重新设计。它不再是单次评分,而是使用两个独立评分员,直接把每段应答与经过校准的样例进行比较,多次投票,并在显示分数之前先调和各自的答案。

结果是一个远比任何前沿模型(以学生使用它们的方式)更准确的评分系统。在一批分数已独立核实的真实口语留出应答上,Engine 2.0 命中正确分数的比例是 81%。用大白话让这些模型打分同样的转写文本,其中最强的 Claude Opus 5 达到 62%。Gemini 达到 58%。Claude Sonnet 5 和 GPT-4o mini 达到 45%,GPT 5.5 是 37%,GPT 5.6 sol 是 35%,GPT 5.6 luna 是 31%。当我们随后把 Engine 2.0 自己的评分流程、每道题的真实校准样例都交给每个模型时,其中最好的提高到 77%,但仍然落后。

准确率最重要的地方,恰恰是最难做到的地方。Engine 2.0 识别顶级应答的比例是 71%。用简单提问测试,没有其他模型的识别率超过 56%,GPT 模型的识别率在 13% 到 27% 之间。Engine 2.0 还抵御住了自动评分系统最常见的失败模式:无论应答实际有多强或多弱,分数都会向低分和分数区间中间漂移。这种漂移正是我们在 Engine 1.0 中最常见到的弱点。

Engine 2.0 更快、更一致,产生的反馈也会引用学生自己说过的话。它今天已经对所有 Prepamigo 用户上线。本页会说明它具体做了什么、我们如何测量它,以及它目前还存在哪些局限。

与核实分数的准确率对比

我们关心的问题很简单。当学生录制一段应答时,屏幕上的分数是否与一个可信评分者会给出的分数一致?为了回答这个问题,我们构建了一批涵盖全部八种口语题型的真实应答测试集,每一段都配有经过独立核实的分数,并把这批应答按较低、中间和顶级分数平均分配,以避免某一个等级主导结果。

本次对比使用了其中从一开始就被留出来的 48 段应答。团队中没有任何人在构建或调优 Engine 2.0 时用过它们。每段应答都被逐字转写。然后我们告诉每个模型它是一名经验丰富的 CELPIP 考官,给它任务提示和转写文本,让它在不同的日子里给应答打三次 0 到 12 分。我们取三次运行的平均值,并统计分数与核实分数等级相符的比例。

51%

比 Claude Opus 5 少犯的失误

每 100 段应答中错 19 个,对比 38 个。

71%

比 GPT 5.6 sol 少犯的失误

每 100 段错 19 个,对比 65 个。

71%

顶级应答的识别率

其他模型中表现最好的识别率是 56%;GPT 5.6 sol 是 25%。

这些数字里有三点值得注意。第一,差距并不小。在一个 48 段应答的测试中,与最强的前沿模型相差 19 个百分点,与支撑 ChatGPT 付费套餐的模型相差 46 个百分点,分别相当于多命中 9 个和 22 个正确分数。第二,这个差距不是一次“友好测试”的产物。这 48 段应答是在 Engine 2.0 设计定稿之前选定的,在整个开发过程中都没有被触碰过。第三,这个对比恰恰是对学生最重要的那种对比:它衡量的是当你把转写文本粘贴进聊天机器人并提问时会得到什么,而这正是几乎所有人使用这些模型的方式。

这里要说明一下“正确”的含义。这个量表上的核实分数是以等级而非单一分数呈现的,所以只要分数落在核实等级内,我们就算它正确。举例来说,一段核实为顶级的应答,只要引擎给出 9、10 或 11 分,就算打分正确。如果采用更严格的标准,只接受 10 分及以上,每个系统的数字都会下降几个百分点,但排名不会改变。

系统简单提问完整流程下
Prepamigo Scoring Engine 2.081.3%
Claude Opus 561.8%77.1%
Gemini58.3%70.8%
Claude Sonnet 545.1%68.8%
GPT-4o mini45.1%50.0%
GPT 5.536.8%68.8%
GPT 5.6 sol35.4%70.8%
GPT 5.6 luna30.6%62.5%

各分数等级下的表现

一个平均准确率数字可能掩盖很多东西。一个在弱应答上表现出色、在强应答上一塌糊涂的评分系统,可能会打出一个看起来不错的数字,却让最需要精确答案的学生失望。所以我们分别报告测试集中三个等级各自的准确率:4 或 5 分的较低等级、7 或 8 分的中间等级,以及 10 分及以上的顶级。

无论是人还是机器,大多数评分者都会向中间漂移。强应答会被打成 8 分而不是 10 分。弱应答会被打成 6 分而不是 5 分。在没有任何比较对象的情况下,前沿模型还多了一个习惯:它们会向下漂移,导致弱应答常常被打成 3 分,强应答被打成 7 分。Engine 2.0 就是专门为了抵御这两种拉力而设计的,而这一点在分数区间的顶端表现得最为明显。

较低分数 · 核实分数为 4 或 5

每个系统 16 段留出应答,简单提问,三次运行平均值。

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

中间分数 · 核实分数为 7 或 8

每个系统 16 段留出应答,简单提问,三次运行平均值。

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

顶级分数 · 核实分数为 10 及以上

每个系统 16 段留出应答,简单提问,三次运行平均值。几乎所有失误都是打成 7 分或 8 分。

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

对已经很强的学生来说,这才是真正重要的差距。用简单提问测试,其他模型的顶级应答识别率都不超过 56%;GPT 5.6 sol 只能识别出四分之一,GPT 5.6 luna 只能识别出八分之一。而 Engine 2.0 能识别出 71%。

在较低等级,Engine 2.0 以 88% 领先,Claude Opus 5 是 77%,GPT-4o mini 是 75%。其他每个模型都在一半左右,Claude Sonnet 5 是 44%。失误几乎总是打成 3 分:模型看到弱应答,把它打到低于该等级而不是等级内。GPT-4o mini 在这里看起来不错的数字,正是它问题的第一个信号——它几乎对所有应答都打低分;在分数区间顶端,它只能识别出六段中的一段。

在中间等级,Engine 2.0 以 85% 领先。Gemini 和 Claude Sonnet 5 是 63%,Claude Opus 5 是 58%,然后是断崖式下跌:GPT-4o mini 是 44%,三个较大的 GPT 模型在 27% 到 29% 之间。中间等级的应答混合着优点和缺点,需要权衡而不是简单地发现,而在没有任何比较对象的情况下,GPT 模型只看到缺点,给出 5 分或 6 分。

在顶级,差距最大。Engine 2.0 能正确识别出 71% 的顶级应答。Gemini 能识别出 56%,Opus 5 恰好是一半。其他七个模型中有五个,会在十段本该得到 10 分的应答里,至少给七段打出 7 分或 8 分。这正是“向中间漂移”问题最纯粹的表现。顶级应答并不是完美无缺的;它会有偶尔的小失误、一次重新开始、复杂句子中夹杂的一句平淡表述,而一个拿它去和想象中的完美答案比较的评分者,会为每一个瑕疵扣分。Engine 2.0 是根据展示真实顶级应答长什么样(包括瑕疵)的样例来校准的,并且明确设计为与这些样例比较,而不是与完美比较。

如果把我们的完整流程交给它们会怎样?

简单提问下的数字,并不是对这些模型智能水平的判断。它们判断的是,当一个模型被要求给出数字、却没有任何比较对象时会发生什么。所以我们跑了第二项测试,给每个模型都提供与 Engine 2.0 自己的评分员完全相同的材料:转写文本、题目、该具体题目在每个等级各两个的真实校准样例,以及一条指令——针对四个维度分别说出最接近的样例,而不是直接给出数字。每个模型还配有一份根据其自身倾向调整的简短校准说明。

在完整流程下:落在核实等级内的应答占比

同样的 48 段留出应答。每个系统使用相同的转写文本、指令和校准样例;每个模型对每段应答只打分一次。

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

每个模型都有提升,有些提升得很明显。GPT 5.6 sol 翻了一倍,从 35% 提高到 71%。Opus 5 从 62% 提高到 77%。GPT-4o mini 几乎没有变化,从 45% 提高到 50%,因为无论给它看什么,它都还是把一切都打低分。而每个模型仍然落后于 Engine 2.0。在分数区间顶端,差距依然存在:Opus 5、GPT 5.6 sol、Gemini 和 GPT 5.5 都停在 63% 的顶级应答识别率,Sonnet 5 是 38%,GPT-4o mini 是零,而 Engine 2.0 是 71%。

这第二项测试告诉你 Engine 2.0 的价值究竟在哪里。它不是一个更聪明的模型;它用的模型就来自这同一份名单。它的价值在于每道具体题目上每个等级听起来到底是什么样的真实样例,在于一个强迫模型去比较而不是去猜的问题设计,以及单次评分无法提供的另外三件事:来自不同提供方的两个独立评分员、每个评分员投三次票并取中间票,以及在两个评分员严重分歧时采用较高分数的调和规则,因为分析显示,在强应答上,较低的那个判断几乎总是错的。

一致性与稳定性

一个值得信任的评分系统必须是一致的。如果同一段录音今天能得到 8 分,明天能得到 10 分,那么这两个数字都没什么意义,学生也无法判断自己的练习是否真的有效。所以除了准确率之外,我们还测量了 Engine 2.0 在被问两次同样问题时是否会给出同样的答案。

我们在不同的日子里,对 48 段留出应答独立运行了 Engine 2.0 三次,期间没有改变任何东西。每次都得到 81.3%。不是大约 81%:每次都是 48 段中同样的 39 段正确,上下浮动不超过一段。如果不看汇总数字,而是看每一段应答,有 87.5% 在三次运行中拿到了完全相同的分数,只有 4.2% 曾经在不同运行之间移动过两分或更多。这少数几段正好处在两个等级的边界上,判断上的细微差异确实会合理地把分数推向一边或另一边。

前沿模型在简单提问测试中,不同运行之间的波动要大得多。GPT 5.6 sol 三次运行分别得到 31%、40% 和 35%;Opus 5 分别得到 62%、65% 和 58%。让聊天机器人在不同的两天给同一段转写文本打分,你相当常见地会得到两个不同的分数。

一致性来自两个设计决策。Engine 2.0 中的每个评分员对每段应答都投三次票,取中间票,这样就能去掉单次评分偶尔产生的异常值。而且两个评分员的判断结果是由一条固定规则来调和的,不是靠另一个模型,所以同样一对判断结果总会得出同样的最终分数。这两个决策都经过直接测试:把三次投票改成单次投票后,运行之间的一致率从 87.5% 降到了 77.1%,移动两分或更多的应答比例翻了一倍还多。

Engine 2.0 如何为一段应答打分

Engine 2.0 不是单一模型,而是一套流程,真正带来差异的正是这套流程。以下是学生按下停止键到屏幕上出现分数之间,大约十秒钟里发生的事情。

  1. 录音会被逐字转写。每一个语气词、每一次重新开始、每一次自我纠正都被保留下来。这一点被证明至关重要。当我们测试把这些停顿去掉的“清理版”转写文本时,准确率下降了十五个百分点,因为这些停顿正是评分者判断一段应答听起来如何所需要的一部分证据。
  2. 两个独立评分员会阅读转写文本。它们基于不同提供方的不同底层模型构建,所以不会有相同的盲点。每个评分员会拿到任务提示、转写文本,以及该具体题目的一小组校准样例:较低、中间和顶级各两个真实应答,让每个等级都呈现为一个范围,而不是单一的点。
  3. 每个评分员是在比较,而不是在打分。这是与 Engine 1.0 相比最核心的改变。评分员不再被要求给出数字,而是针对应答的四个维度分别被问:它最像哪一个校准样例。没有“介于两者之间”这个选项。必须明确选定一个最接近的样例,正是这一点阻止了向中间漂移。最终分数由固定规则根据所选等级推导得出,而不是由模型来定。
  4. 每个评分员投三次票。每个维度都取中间票。这样既能去掉偶尔的“状态不好”的答案,又不会用平均化的方式抹掉真正的判断。
  5. 两个判断结果会被调和。如果两个评分员的结果一致或只相差一分,最终分数取两者的平均值。如果相差两分或更多,则采用较高的那个分数。这条规则不是宽容,而是一种校准。当我们分析每一个两个评分员严重分歧的案例时发现,较低的那个判断几乎总是错的,因为这种分歧几乎总是出现在某个评分员对一段顶级应答过于谨慎的情况下。
  6. 安全机制会介入。一小组固定规则会处理那些评分员根本不该靠猜的情况:静音、只有几个词、使用其他语言,或完全偏离主题的应答,都会获得一个保底分数,无论评分员返回什么结果。在测试中,静音打 3 分,只有几个词的应答打 4 分,偏离主题或非英语的应答打 5 分,整个测试集中没有出现任何失效。

最终设计中有两个特性值得强调。Engine 2.0 仅根据转写文本打分,所以转写完成后就不再需要音频,也不依赖任何一家提供方的音频模型。而且由于两个评分员来自不同的提供方,如果其中一个不可用,另一个仍能继续工作,还有第三个模型可以顶替,从而始终能给出分数。

你的评语有哪些新变化

Engine 2.0 搭载了全新重构的评语层。它读取的是两位评分员给出的依据,而不只是分数,并针对三类学生做过测试:第一次接触 CELPIP 的学生、英语基础较弱只想要诀窍的学生,以及每天只有半小时、下周就要考试的学生。以下是具体的变化。

  • 原话引用,逐字对应. 每一条评语都会引用评分员实际关注的那句原话。凡是加了引号的内容,都是逐字摘录;在我们的审核中,158 处引用里有 157 处确实如此。评语绝不会编造你没有说过的话。
  • 先改这一件事. 每篇应答都会给出一个首要改进点:那个最能提升你分数的改动,会用整页里最直白的话写出来。紧接着是两条更具体的行动建议,最后是一份三项检查清单,供你开口前在心里过一遍。
  • 针对题型给出的建议. 给建议、描述场景和说服他人,评分标准各不相同。评语现在能识别八种题型各自看重什么,并据此给出建议,而不是在所有题型里重复同一套泛泛的技巧。
  • 该先练哪个维度. 评语会告诉你四个维度中哪个最弱、哪个最强,让你清楚下一分该从哪里拿,而不是把这一切都藏在一个分数背后。
  • 题目要求了什么、你漏了什么. 在任务完成度这一项上,评语会具体列出题目要求中你没有覆盖到的部分,或者直接说明你已经全部覆盖。
  • 真正能拿来练习的建议. 每一条方法都是你在下一次尝试前可以大声练习的内容。评语不会建议你说得更清楚或减少口音:口音不是可理解度所衡量的内容,评语也从不对此作出评价。
  • 不会因为计时而扣分. 如果一篇应答已经完成了任务要求,只是被时间截断,不会因为这个截断而被扣分,评语也不会因此责怪你。

在一次独立评判中,一个不知道哪份来自哪个系统的评判模型,对同一批应答分别用新旧两套系统生成的评语做了盲测比较:无论是以考官的视角评判,还是以学生的视角评判,它在 24 次比较中有 20 次更倾向于新的评语。

每月 CA$25,无限次练习

准确率只有在你能够每天负担得起使用它的情况下才有意义。一个你可以信任的口语分数,在你第四十次练习应答时最有价值,而不是第四次,因为到那时,分数才开始告诉你说话方式上的某个改变是否真的起了作用。所以我们给 Engine 2.0 定的价格,是让你用起来完全不需要计数。

每种 Prepamigo 套餐都包含 Engine 2.0 提供的无限次打分、无限次练习机会,以及完整的题库:80 套完整练习题和超过 2,000 道练习题目,覆盖 Speaking、Writing、Reading 和 Listening 四个部分,均按照 CELPIP General 考试的题型、时长和格式编写。你按下录音键,大约十秒后就能得到分数和有依据的反馈,而且可以随心所欲地重复多少次都行。

Prepamigo

CA$25/ 月

按月付费 CA$24.98 · 年付每月 CA$8.25(全年 CA$98.98) · 含税 · 随时可取消

  • 无限次打分,由 Scoring Engine 2.0 提供,没有每日、单次或每周上限。
  • 80 套练习题和 2,000 多道题目,覆盖全部四个部分,按照真实考试格式设计,你永远不需要自己编题目。
  • 录完就走。转写、评分和反馈全部替你完成;没有任何需要粘贴、需要提问的地方。
  • 用你自己的话给出反馈,每一句引用都能追溯到你实际说过的话。

Claude Max,作为对比

US$100/ 月

税前约合 CA$138 · 20 倍档位每月 US$200 · Pro 每月 US$20,限制更严

  • 即便是 Max 也有上限。滚动五小时的使用窗口和每周限额,是 Pro 允许额度的五倍或二十倍;一旦触及其中任何一个,你就得等待。
  • 没有题库。你需要自带题目,自己判断它们像不像真实考试,还要自己记录已经练过什么。
  • 准备工作都靠你自己。录音、转写、粘贴转写文本、写评分指令,每一次都要你自己来。
  • 只是简单提问,不是经过校准的评分系统。用大白话测试,Claude Opus 5 命中核实分数的比例是 62%,Claude Sonnet 5 是 45%,而 Engine 2.0 是 81%。

Claude 套餐的价格和使用条款以 claude.com 在 2026 年 9 月公布的信息为准,可能会有变动。CELPIP 是其所有者的注册商标;Prepamigo 是一个独立的练习平台,与考试出题方没有任何隶属、认可或关联关系。Prepamigo 的练习题目均为原创内容,按照公开的考试格式编写。

上线情况

Prepamigo 口语 Scoring Engine 2.0 现已对所有 Prepamigo 用户、在所有口语题型上上线。没有任何需要开启的设置。每一段新的口语应答都由 Engine 2.0 打分,每一个分数都配有从学生自己的话中提炼出的反馈。

一段典型的应答大约十秒就能打分完成,比 Engine 1.0 更快。Engine 2.0 每段应答的运行成本也比它取代的那套设计更低,这正是我们能够为每个学生运行两个评分员、每个投三次票,却不改变 Prepamigo 定价的原因。

随着上文提到的真实世界验证工作的完成,我们会发布本页数字的更新。如果你有一段录音,你认为 Engine 2.0 打分打错了,我们希望看到它:这些案例是我们已知找到下一个改进点最快的方式。

想看正面对比,可以读一读 Prepamigo 对比 Claude Prepamigo 对比 ChatGPT。如果想看英文原文,可以读 阅读英文版指南。或者直接 录制一段应答,看 Engine 2.0 实际运行。

隆重推出 Prepamigo 口语 Scoring Engine 2.0 | PrepAmigo