落在核实等级内的应答占比
48 段留出应答,每个等级 16 段。每个模型拿到转写文本后被用大白话要求按 CELPIP 量表打分;三次运行的平均值。Engine 2.0 以正常生产环境配置运行。
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Prepamigo 对比主流 AI 聊天机器人套餐
单位为加元。Prepamigo 价格已含税。Claude Max(US$100 起)和 ChatGPT Pro(US$200)按 1.38 的汇率换算为加元,税前价格。准确率是指在保留测试集上,模型被用大白话要求打分时,得分落在核实等级内的应答占比;三次运行的平均值。
现在有不少 CELPIP 考生用 AI 聊天机器人给自己的口语练习打分。录一段应答,转写出来,粘贴进去,要求打分。这个过程既快,又免费或几乎免费,给出的解释听起来也很权威。但没有人告诉你,这个数字对的频率有多高,该信哪个模型,或者你提问的方式会不会改变答案。我们想知道答案,所以构建了这项测试,用两种方式在八个系统上跑了一遍。
第一种方式就是上面的图表:像学生一样粘贴转写文本,要求打分。在通用模型中,Claude Opus 5 最准确,为 62%,Gemini 紧随其后为 58%,其他所有模型都不到一半:Claude Sonnet 5 和 GPT-4o mini 是 45%,GPT 5.5 是 37%,GPT 5.6 sol 是 35%,GPT 5.6 luna 是 31%。一个专门打造的系统 Prepamigo Scoring Engine 2.0 在同样的应答上达到了 81%。
第二种方式,我们认为是最有启发性的:我们把自己的评分流程交给每个模型,配上真实的校准样例并强制其进行比较,看看它究竟能做到多好。每个模型都有提升,有些提升得很明显,而每个模型仍然落后于 Engine 2.0。我们要坦白说明:Prepamigo 是我们自己的产品。我们尽力让这两项测试对所有其他系统都保持公平,如果某个模型在某个等级上表现超过我们,我们也会明确说出来。
简单提问排行榜
顶部图表中可以看出三个层级。Engine 2.0 以 81% 独自站在第一层。Claude Opus 5 的 62% 和 Gemini 的 58% 构成第二层:如果你能接受五次里错两次,这个层级还算可用。其他所有模型都在 50% 以下,也就是说,比你对应答一无所知、在三个等级之间随便抛硬币还要差。
这正是简单测试最鲜明的特征:每个通用模型都打分偏严。它们给核实为顶级的应答打出的平均分从 7.2(luna)到 8.6(Opus 5)不等。它们给核实为较低等级的应答打出的平均分在 3.7 到 4.3 之间,除了 Opus 5 和 Gemini 之外都低于该等级。由于没有任何样例展示每个等级听起来到底是什么样,这些模型只能把应答拿去和想象中的完美答案比较,然后扣分。
各分数等级下的结果
一个总体数字会掩盖错误具体出在哪里,而错误出在哪里,恰恰决定了一个评分工具对你有没有用。以下是按等级拆分的简单测试结果。
较低等级应答(核实分数 4 或 5)
每个系统 16 段留出应答,简单提问,三次运行平均值。
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
75%
GPT-4o mini
56%
Gemini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
44%
Claude Sonnet 5
弱应答本该是量表上比较容易的一端,但在简单提问下并非如此。Engine 2.0 是 88%,Opus 5 是 77%,GPT-4o mini 是 75%。其他所有模型都在一半左右,Sonnet 5 是 44%。失误几乎总是打成 3 分:模型看到弱应答,把它打到低于该等级而不是等级内。GPT-4o mini 在这里看起来不错的数字,正是它问题的第一个信号——它几乎对所有应答都打低分。
中间等级应答(核实分数 7 或 8)
每个系统 16 段留出应答,简单提问,三次运行平均值。
85%
Prepamigo Engine 2.0
63%
Gemini
63%
Claude Sonnet 5
58%
Claude Opus 5
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
中间等级把各家系统的差距拉开了。Engine 2.0 是 85%。Gemini 和 Sonnet 5 是 63%,Opus 5 是 58%。然后是断崖式下跌:GPT-4o mini 是 44%,三个较大的 GPT 模型在 27% 到 29% 之间。中间等级的应答混合着真实的优点和缺点,需要权衡,而在没有任何比较对象的情况下,GPT 模型只看到缺点,给出 5 分或 6 分。一个 7 分或 8 分水平的考生问 GPT 5.6 sol 要分数,十次里不到三次会听到正确的等级。
顶级应答(核实分数 10 及以上)
每个系统 16 段留出应答,简单提问,三次运行平均值。几乎所有失误都是打成 7 分或 8 分。
71%
Prepamigo Engine 2.0
56%
Gemini
50%
Claude Opus 5
29%
Claude Sonnet 5
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
顶级正是差距最重要、也是简单提问伤害最大的地方。Engine 2.0 能识别出 71% 的顶级应答。Gemini 能识别出 56%,Opus 5 恰好是一半。然后是 Sonnet 5 的 29%,GPT 5.5 的 27%,GPT 5.6 sol 的 25%,GPT-4o mini 的 17%,以及 GPT 5.6 luna 的 13%。七个通用模型中有五个,会在十段本该得到 10 分的应答里,至少给七段打出 7 分或 8 分。
如果你是一个用聊天机器人给自己打分的实力强的考生,这是一个要记住的数字:用简单提问问 GPT 5.6 sol,它告诉你 10 分就是 10 分的概率只有四分之一。
第二份排行榜:在我们的完整流程下
简单测试的数字,并不是对这些模型智能水平的判断。它们判断的是,当一个模型被要求给出数字、却没有任何比较对象时会发生什么。所以我们跑了第二项测试,给每个模型都提供 Engine 2.0 自己的评分员使用的校准样例和强制比较。
在完整流程下:落在核实等级内的应答占比
同样的 48 段留出应答。每个系统使用相同的转写文本、指令和校准样例;每个模型对每段应答只打分一次。Gemini 还额外拿到了音频。
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
71%
GPT 5.6 sol
71%
Gemini
69%
GPT 5.5
69%
Claude Sonnet 5
63%
GPT 5.6 luna
50%
GPT-4o mini
每个模型都有提升。Opus 5 从 62% 提高到 77%。GPT 5.6 sol 翻了一倍,从 35% 提高到 71%。GPT 5.5 从 37% 提高到 69%,Sonnet 5 从 45% 提高到 69%,luna 从 31% 提高到 63%,Gemini 从 58% 提高到 71%。GPT-4o mini 几乎没有变化,从 45% 提高到 50%,因为无论给它看什么,它都还是把一切都打低分。
排序也发生了变化。在简单提问下,Claude 模型远远领先于 GPT 模型。在完整流程下,GPT 5.6 sol 反超 Sonnet 5,并与 Gemini 打平,四个模型聚集在 69% 到 71% 之间,在这个样本上统计意义上难以区分。Opus 5 在通用模型阵营中依然是第一,为 77%,落后 Engine 2.0 四个百分点。
按等级看,完整流程把四个模型的较低等级准确率都提高到 88%,与 Engine 2.0 相同,两个 Claude 模型的中间等级准确率也提高到 81%。差距持续存在的地方是顶级:Opus 5、GPT 5.6 sol、Gemini 和 GPT 5.5 都停在 63%,Sonnet 5 是 38%,GPT-4o mini 是零,而 Engine 2.0 是 71%。一个单一模型只跑一次,仍然会对带有一点瑕疵的强应答留有保留。Engine 2.0 靠来自不同提供方的两个独立评分员、每个评分员投三次票并取中间票,以及在两个评分员严重分歧时采用较高分数的调和规则,补上了剩下的这段差距,因为分析显示,在强应答上,较低的那个判断几乎总是错的。
为什么模型会向低分和中间漂移
这种模式在来自三家不同公司的模型身上表现得如此一致,不可能是某一家的个别怪癖。它是这项任务本身的属性。
当一个模型被要求把一段应答放到量表上的某个位置时,一旦不确定,它就会向中间靠拢,因为中间是答错代价最小的地方。而当它没有任何样例可以参照每个等级到底听起来是什么样时,它就会把应答拿去和想象中的完美答案比较,为每一个瑕疵扣分。顶级应答从来都不是完美无缺的。它会有一次重新开始,复杂句子中夹杂的一句平淡表述,遇到难词前的一次停顿。拿去和完美比较,这些瑕疵会付出一到两个档次的代价,10 分就变成了 8 分或 7 分。
指令解决不了这个问题。我们尝试过明确告诉模型,9 分等级不需要无差错的应答,压低一段强应答的分数和抬高一段弱应答的分数一样严重。每一条指令都被模型接受了,然后在实践中被忽略。当我们把模型自己被告知代表顶级应答的那个校准样例,反过来喂给它让它打分时,它给出的是 8 分。
真正能大体解决这个问题的,是把问题从“打几分?”换成“像哪个样例?”,并提供真实的样例。这就是两份排行榜之间的差别。即便如此,单次评分仍然会有一点漂移,因为校准样例并不完美,而对它们的一次解读也只是一次解读。两个评分员、三次投票和一条调和规则,才是补上剩余差距的关键。
各模型说明
- Claude Opus 5。在两项测试中都是表现最好的通用评分模型:简单提问 62%(三次运行分别为 62%、65% 和 58%),完整流程下 77%。它在简单提问下的弱点是中间等级,那里它常给出 6 分;在完整流程下的弱点是顶级,那里它停在 63%。它也是这里价格最高的模型,而且差距不小。
- Gemini。在简单测试中排第二,为 58%,三次运行结果完全相同,也是各等级之间最均衡的模型,分别是 56%、63% 和 56%。在完整流程加音频录音下,它达到 71%,与仅靠文字工作的 GPT 5.6 sol 打平。听录音相比逐字转写文本并没有带来额外的帮助。
- Claude Sonnet 5。简单提问 45%,呈现出一种特殊的表现模式:在中间等级还算合理,为 63%,在弱应答上表现不佳,只有 44%(因为它把它们打成 3 分),在顶级上也不佳,只有 29%。在完整流程下提高到 69%,但在顶级应答上仍然只有 38%。如果 Sonnet 5 一直给你 8 分,不要相信它。
- GPT-4o mini。简单提问 45%,完整流程下 50%,但这两个数字都比实际情况要好看。它几乎对所有应答都打低分:弱应答上 75%,顶级应答上先是 17%,然后在完整流程下变成 0%。无论如何,都不要用这个模型给你的口语打分。
- GPT 5.5。简单提问 37%(35%、42%、33%),完整流程下 69%。它在简单提问下的中间等级是 29%。它曾是我们自己评分流程早期版本中的文本评分模型,正是因为在这个等级上的弱点而被替换掉。
- GPT 5.6 sol。简单提问 35%(31%、40%、35%),是所有模型中运行之间波动最大的一个,完整流程下达到 71%,是所有模型中提升幅度最大的一个。在被展示样例时是一个有能力的评分员,不展示时则表现很差。它在完整流程下的习惯是在中间等级过度奖励流利度。
- GPT 5.6 luna。两项测试中都排在最后:简单提问 31%,完整流程下 63%。它会把中间等级的应答往下拉向 5 分,用简单提问只能识别出 13% 的顶级应答。它便宜到足以在一个双评分员系统里充当第二意见;但单独使用的话准确率不够。
一个专门打造的系统能带来什么
Engine 2.0 不是一个更好的模型。它用的模型就来自这同一份排行榜。它增添的是流程,而这套流程中的每一个环节都是通过测量选定的。
- 自动逐字转写。每一个语气词和重新开始的部分都被保留下来,因为在测试中去掉它们会让准确率下降十五个百分点。你不需要自己去找一个能做到这一点的转写工具;大多数消费级工具默认都会清理掉它们。
- 每道题都自带校准样例。八种题型每个等级各两个真实应答,已经准备就位。这是唯一一个能让 GPT 5.6 sol 准确率翻倍的输入,也是你在家无法生产出来的东西。
- 是比较,不是数字。每个评分员针对四个维度分别说出最接近的样例;分数由规则据此推导。这正是阻止漂移的关键。
- 来自两家提供方的两个评分员。不同的模型有不同的盲点。两个评分员经过一条固定规则调和后,表现胜过单独任何一个。
- 每个评分员投三次票,取中间票。这没有提高准确率,但把运行之间的一致率从 77% 提高到了 87.5%。一次聊天机器人的回答就等于一次投票。
- 在严重分歧时采用较高分数的调和规则。因为在强应答上,较低的那个判断几乎总是错的。测试中,直接取平均值的方式准确率跌到了六十几。
- 安全机制。静音、只有几个词、偏离主题和非英语的应答,都由规则给出保底分数,而不是靠模型去猜。
结果是总体 81%、顶级 71%,三次独立运行结果完全一致,每段应答大约十秒钟就能完成,没有任何需要粘贴的东西。
如果你还是打算用聊天机器人
有些读者仍然会继续用聊天机器人打分,对于预算紧张、或者想就应答展开讨论的考生来说,这是一个合理的选择。以下这些步骤正是两份排行榜之间的差别,能让你更接近第二份排行榜,而不是第一份。
- 使用逐字转写文本。保留你的语气词、重新开始和自我纠正。如果你的转写工具把它们清理掉了,评分员打分的对象就比你实际给出的应答更好。
- 给它样例,而不是评分标准。同一题型每个等级一到两个带有等级标注的真实应答,效果比任何关于 9 分等级长什么样的描述都要好。如果你没有经过核实的样例,这一步是你在家无法复制的,也是最重要的一步。
- 问它像哪个样例,而不是问它打几分。针对四个维度,分别让模型说出最接近的样例,并禁止它回答“介于两者之间”。再由你自己根据它所说的等级推导出分数。
- 多问几次。在全新的对话里对同一段应答打分两到三次,取中间的答案。GPT 5.6 sol 在简单测试中不同运行之间波动了九个百分点。
- 选一个在顶级上有良好记录的模型。如果用简单提问,选 Opus 5 或 Gemini;如果有样例,选 Opus 5 或 GPT 5.6 sol。如果你的水平接近 10 分,无论如何都不要用 GPT-4o mini。
- 对 7 分或 8 分保持怀疑。在每一个通用模型上,一段你自认为表现优秀的应答如果得到 7 分或 8 分,更可能是一次失误,而不是真正的裁决。
该信哪个模型,取决于你现在的水平
解读这些排行榜的正确方式取决于你目前的水平,因为这些模型的失误集中在不同的地方。
- 如果你现在是 4 分或 5 分,用简单提问问 Opus 5,四次里大约三次会告诉你正确的分数;大多数其他模型大约有一半的时间会把你打成 3 分。你的问题其实不在于评分工具本身,而在于反馈——为此你需要的是那种会引用你原话、而不是简单总结的反馈。
- 如果你在 7 分或 8 分,用简单提问时要避开 GPT 模型,它们十次里有七次会把你打成 5 分或 6 分。Gemini 和 Sonnet 5 是简单提问下中间等级最可靠的评分模型,为 63%。Engine 2.0 则是 85%。
- 如果你在 10 分或以上,这是选择最重要的地方。用简单提问,没有任何通用模型识别 10 分的频率超过 56%,GPT 模型的识别频率在 13% 到 27% 之间。Engine 2.0 能识别出十段中的七段,更重要的是,每次问它都会给出同样的答案。
在这三个等级上呈现的模式,正是本文一直在描述的那一个模式。这些模型不是笨,它们只是谨慎,而在没有任何比较对象的情况下,谨慎就意味着一个偏低的数字。你离中间越远,评分工具的这种谨慎给你造成的代价就越大,一个专门为抵御这种谨慎而设计的评分工具也就越重要。
你的评语有哪些新变化
Engine 2.0 搭载了全新重构的评语层。它读取的是两位评分员给出的依据,而不只是分数,并针对三类学生做过测试:第一次接触 CELPIP 的学生、英语基础较弱只想要诀窍的学生,以及每天只有半小时、下周就要考试的学生。以下是具体的变化。
- 原话引用,逐字对应. 每一条评语都会引用评分员实际关注的那句原话。凡是加了引号的内容,都是逐字摘录;在我们的审核中,158 处引用里有 157 处确实如此。评语绝不会编造你没有说过的话。
- 先改这一件事. 每篇应答都会给出一个首要改进点:那个最能提升你分数的改动,会用整页里最直白的话写出来。紧接着是两条更具体的行动建议,最后是一份三项检查清单,供你开口前在心里过一遍。
- 针对题型给出的建议. 给建议、描述场景和说服他人,评分标准各不相同。评语现在能识别八种题型各自看重什么,并据此给出建议,而不是在所有题型里重复同一套泛泛的技巧。
- 该先练哪个维度. 评语会告诉你四个维度中哪个最弱、哪个最强,让你清楚下一分该从哪里拿,而不是把这一切都藏在一个分数背后。
- 题目要求了什么、你漏了什么. 在任务完成度这一项上,评语会具体列出题目要求中你没有覆盖到的部分,或者直接说明你已经全部覆盖。
- 真正能拿来练习的建议. 每一条方法都是你在下一次尝试前可以大声练习的内容。评语不会建议你说得更清楚或减少口音:口音不是可理解度所衡量的内容,评语也从不对此作出评价。
- 不会因为计时而扣分. 如果一篇应答已经完成了任务要求,只是被时间截断,不会因为这个截断而被扣分,评语也不会因此责怪你。
在一次独立评判中,一个不知道哪份来自哪个系统的评判模型,对同一批应答分别用新旧两套系统生成的评语做了盲测比较:无论是以考官的视角评判,还是以学生的视角评判,它在 24 次比较中有 20 次更倾向于新的评语。
常见问题
哪个 AI 模型给 CELPIP 口语打分最准确? 用简单提问测试:Claude Opus 5 是 62%,Gemini 是 58%,Claude Sonnet 5 和 GPT-4o mini 是 45%,GPT 5.5 是 37%,GPT 5.6 sol 是 35%,GPT 5.6 luna 是 31%。Prepamigo Scoring Engine 2.0 在同样的应答上达到 81%。
ChatGPT 还是 Claude? 用简单提问,明显是 Claude 更好:62% 和 45%,对比 35% 和 37%。在我们的完整流程下,差距缩小到 Opus 5 的 77% 对 GPT 5.6 sol 的 71%。
为什么它们全都把我的强应答打成 7 分或 8 分? 没有任何比较对象的模型只能猜得偏低、偏向中间,而强应答总会带有一些小瑕疵。用简单提问测试,没有任何通用模型的顶级应答识别率超过 56%。
怎样才能从聊天机器人那里得到更好的分数? 逐字转写文本、每个等级的样例应答、问它像哪个样例而不是问它打几分、多问几次并取中间答案。这套流程在我们的测试中让 GPT 5.6 sol 的准确率从 35% 翻倍提高到了 71%。
想更仔细地看两组正面对比,可以读一读 Prepamigo 对比 Claude 和 Prepamigo 对比 ChatGPT。想一步步了解流程的运作方式,可以读 深入了解 Scoring Engine 2.0。如果想看英文原文,可以读 阅读英文版指南。或者 录制一段应答,跳过转写这一步。
