产品

Prepamigo 对比 Claude 打分 CELPIP 口语:谁给你的分数才是对的?

2026年9月7日

落在核实等级内的应答占比

48 段留出测试集口语应答,三个等级各 16 段。Claude 拿到转写文本后被用大白话要求按 CELPIP 量表打分;三次运行的平均值。Engine 2.0 以正常生产环境配置运行。

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

45%

Claude Sonnet 5

Prepamigo 对比主流 AI 聊天机器人套餐

单位为加元。Prepamigo 价格已含税。Claude Max(US$100 起)和 ChatGPT Pro(US$200)按 1.38 的汇率换算为加元,税前价格。准确率是指在保留测试集上,模型被用大白话要求打分时,得分落在核实等级内的应答占比;三次运行的平均值。

Prepamigo
Claude MaxOpus 5
月费
CA$24.98(含税)
CA$138+(税前)
评分次数
无限
有上限
现成题库
练习套题
80 套
练习题量
2,000+ 题
CELPIP 真实格式
准确率
81%
62%
顶分识别率
71%
50%

如果你曾经把口语转写文本粘贴进 Claude,让它像 CELPIP 考官一样给你打分,你一定明白这么做的吸引力:它立刻回答,会解释自己的判断,也永远不会疲惫。问题在于,它给你的那个数字,是不是你真正会拿到的分数。我们像学生一样跑了这个测试:同样的转写文本,简单地要求打分,然后统计结果。

先说结论:在这些系统从未见过、且每一段都经过独立核实分数的 48 段口语应答上,Prepamigo Scoring Engine 2.0 命中正确等级的比例是 81%。用大白话让 Claude Opus 5 打分同样的转写文本,命中正确等级的比例是 62%,Claude Sonnet 5 是 45%。差距最大的地方恰恰是对追求高分的人最重要的地方:在顶级应答上,Engine 2.0 识别出 71%,Opus 5 识别出 50%,Sonnet 5 只识别出 29%。

接着我们又做了大多数对比文章都会省略的一步:把我们自己的评分流程交给 Claude,为每道题配上真实的校准样例,并强制它与这些样例逐一比较,看看它究竟能做到多好。结果 Opus 5 提高到 77%,Sonnet 5 提高到 69%。两者仍然落后于 Engine 2.0,也仍然在顶级应答上表现最差。本文接下来会依次讲解这两项测试、各个分数等级下的具体数字、通用助手为什么会向中间漂移、双方的日常使用流程有什么不同,以及如果你打算认真练习,每种选择分别要花多少钱。

简单测试:学生实际会得到什么

81% 对 62% 和 45%。在一个 48 段应答的测试里,Engine 2.0 比 Opus 5 多命中 9 个正确分数,比 Sonnet 5 多命中 17 个。换句话说,Engine 2.0 的打分失误比 Opus 5 少 51%,比 Sonnet 5 少 66%。

简单测试三次独立运行中,Opus 5 分别得到 62%、65% 和 58%,Sonnet 5 分别得到 44%、46% 和 46%。这几个百分点的波动本身就是一个发现:让 Claude 在不同的两天给同一段转写文本打分,你相当常见地会得到两个不同的分数。Engine 2.0 在三次运行中都得到 81.3%。

差距在哪里出现:按分数等级逐一拆解

无论是人还是机器,大多数评分者都会向分数区间的中间漂移。强应答会被打成 8 分而不是 10 分;弱应答会被打成 6 分而不是 5 分。这种漂移在平均值里看不出来,但只要按等级拆分结果就会一目了然。在简单提问下,Claude 还多了一个习惯:它会向下漂移,导致即便是弱应答,也常常被打到低于其真实等级的分数。

较低等级应答(核实分数 4 或 5)

16 段留出应答,简单提问,三次运行平均值。Sonnet 5 在这里的失误大多是打成 3 分。

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

44%

Claude Sonnet 5

在弱应答上,Engine 2.0 以 88% 领先,Opus 5 紧随其后为 77%,Sonnet 5 则跌到 44%。这是量表上比较容易的一端,Opus 5 处理得还算合理。Sonnet 5 却不然:它把 4 分或 5 分的应答打成 3 分的情况占了多数,尽管方向可以理解,但这仍然是错误的等级。处于这一等级的学生如果用 Sonnet 5 打分,大多数时候都会被告知自己比实际水平更差。

中间等级应答(核实分数 7 或 8)

16 段留出应答,简单提问,三次运行平均值。失误几乎全部是打成 6 分。

85%

Prepamigo Engine 2.0

63%

Claude Sonnet 5

58%

Claude Opus 5

在中间等级,Engine 2.0 是 85%,两个 Claude 模型分别是 63% 和 58%。中间等级的应答混合着优点和缺点,需要权衡而不是简单地发现,而在没有校准样例可供权衡的情况下,两个 Claude 模型都倾向于只看到缺点,给出 6 分。一个 7 分或 8 分水平的考生大约十次中有四次会被告知自己是 6 分。

顶级应答(核实分数 10 及以上)

16 段留出应答,简单提问,三次运行平均值。几乎所有失误都是打成 7 分或 8 分。

71%

Prepamigo Engine 2.0

50%

Claude Opus 5

29%

Claude Sonnet 5

在顶级,Engine 2.0 能识别出 71% 的顶级应答。Opus 5 能识别出一半。Sonnet 5 只能识别出 29%,也就是说,在十段本该得到 10 分的应答里,它会给七段打出 7 分或 8 分。

想想这在实际中意味着什么。假设你今天的口语水平真的是 10 分。你录制八段应答,转写出来,粘贴进 Claude Sonnet 5 并要求打分,它告诉你其中六段是 7 分或 8 分。你就此认为自己还没准备好,又多花三周时间苦练。而实际上,你一直都已经准备好了。这不是一种假设中的失败模式,而是我们整个测试中最常见的单一错误,并且最重打击的正是那些最努力的考生。

如果你用 Claude 打分,而它一直给你 7 分或 8 分,不要不假思索地相信它。在我们的测试中,一段顶级应答从 Sonnet 5 那里拿到 8 分的可能性比拿到 10 分更高。Claude 给出的 8 分应该是让你去找第二意见的理由,而不是最终裁决。

如果把我们的完整流程交给 Claude 会怎样?

很容易把简单测试的数字解读成 Claude 是一个弱模型。事实并非如此。Opus 5 是我们测试过的通用评分模型中,遥遥领先的最强者。问题不在于智能水平,而在于一个被要求给出数字、却没有任何比较对象的模型只能靠猜,而猜的时候它会猜得偏低、偏向中间。

所以我们跑了第二项测试。Claude 拿到了与 Engine 2.0 的评分员完全相同的一套材料:转写文本、题目、该具体题目在每个等级各两个的真实校准样例,以及一条指令——针对四个维度分别说出最接近的样例,而不是直接给出数字。每个模型还配有一份根据自身倾向调整的简短校准说明。

在完整流程下:落在核实等级内的应答占比

同样的 48 段留出应答。每个 Claude 模型对每段应答只打分一次,使用与 Engine 2.0 自己的评分员相同的转写文本、指令和校准样例。

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

69%

Claude Sonnet 5

校准样例带来了巨大的差异。Opus 5 从 62% 提高到 77%;Sonnet 5 从 45% 提高到 69%。两者在较低等级上的准确率都达到 88%,与 Engine 2.0 相同。两者在中间等级上的准确率都达到 81%。这一点值得细想,因为它告诉你专门打造的评分系统的价值究竟在哪里:不在于更聪明的模型,而在于每道具体题目上每个等级听起来到底是什么样的真实样例,以及一个强迫模型去比较而不是去猜的问题设计。

即便如此,两个模型在量表顶端仍然落后。在完整流程下,Opus 5 能识别出 63% 的顶级应答,Sonnet 5 能识别出 38%,而 Engine 2.0 是 71%。一个单一模型只跑一次,仍然会对带有一点瑕疵的强应答留有保留。Engine 2.0 靠另外三件事补上了剩下的差距:来自不同提供方的两个独立评分员、每个评分员投三次票并取中间票,以及在两个评分员严重分歧时采用较高分数的调和规则,因为分析显示,在强应答上,较低的那个判断几乎总是错的。

我们还尝试了显而易见的捷径:保留简单提问,但加上诸如“不要向中间漂移”或“9 分应答不必完美无缺”这样的指令。结果没有产生任何可测量的变化。模型会表示同意这条指令,然后依旧按原来的方式打分。真正有效的做法是改变问题本身,并给它一些真实的比较对象。

使用流程的差距:录完就走,还是事事亲力亲为

准确率数字的前提是打分真的能够发生。而用 Claude 的话,从你按下录音的停止键到看到分数之间,要做的工作出乎意料地多。

首先,你需要一份转写文本。Claude 的聊天界面不会给音频录音打分,所以你需要先把它变成文字。这意味着你要么自己把说的话打出来(这会改变内容本身),要么把录音丢进转写工具。这里有一个细节,在我们弄清楚之前吃了不少准确率的亏:转写文本必须逐字逐句。每一个语气词、每一次重新开始、每一次自我纠正都要保留。当我们测试把这些停顿去掉的“清理版”转写文本时,准确率下降了十五个百分点,因为这些停顿恰恰是评分者判断一段应答听起来如何所需要的证据。大多数消费级转写工具默认会清理掉它们。

第二,你需要题目本身。Claude 没有一个带有正确时长和格式的 CELPIP 风格题库。你只能自己写题(这意味着要猜测真实考试到底会问什么),或者从别处找一个题目,再和转写文本一起粘贴进去。

第三,如果你想要比简单测试更好的结果,就需要校准样例:同一题型每个等级的真实应答,并带有核实过的等级。这正是在我们的测试中让 Opus 5 从 62% 提高到 77% 的那个输入,也是学生在家无法生产出来的东西。

第四,下一段应答又要把这些全部重来一遍。再下一段还要重来。

在 Prepamigo 上,你从题库里选一道题,计时器开始运行,你开口说话,停下后大约十秒钟,分数和反馈就出现在屏幕上。转写在设计上就是逐字进行的,校准样例会自动附加到题目上,没有任何需要粘贴、需要提问的地方。当晚的第十一段应答花费的精力和第一段完全一样。

一致性:同一段应答,同一个分数

一个无法复现的分数根本不是一种衡量。如果同一段录音星期一得到 8 分,星期二得到 10 分,你对自己的口语水平什么都没学到,倒是了解到了评分者的“心情”。所以我们也测试了每个系统被问两次同样的问题时,是否会给出同样的答案。

Engine 2.0 在 48 段留出应答上被独立运行了三次,每次都得到 81.3%。如果不看汇总数字,而是看每一段应答,有 87.5% 在三次运行中拿到了完全相同的分数,只有 4.2% 曾经移动过两分或更多。这少数几段正好处在两个等级的边界上,判断上的细微差异确实会合理地把分数推向一边或另一边。

Claude 上的简单测试在汇总层面就已经在不同运行之间移动了几个百分点,落到单个应答层面波动更大。这种一致性上的差距并不是这些模型的偶然表现,而是来自投票机制。Engine 2.0 中的每个评分员对每段应答都投三次票,取中间票,这样就能去掉单次运行偶尔产生的异常值。当我们把同样的配置改成单次投票而不是三次时,运行之间的一致率从 87.5% 降到了 77.1%。一次 Claude 对话就等于一次投票。

能落地行动的反馈

分数告诉你现在处于什么位置,反馈告诉你接下来该做什么,而这恰恰是 Claude 真正擅长的地方。它写得清楚,也很有耐心,如果你问它为什么给出某个分数,它会按你想要的篇幅解释给你听。对于想要就一段应答展开讨论的考生来说,这很有价值。

风险和打分本身一样:流畅的解释并不等于准确的诊断。一个把 10 分打成 7 分的模型,会非常有说服力地解释为什么是 7 分。它总能找到东西来支撑自己的说法。而且,由于 Claude 在打分之前并不需要先给出证据,它的解释是事后写成的,目的是为已经选定的数字找理由。

Engine 2.0 的运作方式恰恰相反。由于每个评分员在评判每个维度时都必须给出证据,反馈层会直接拿到这些证据:转写文本中支撑内容、词汇、听感以及是否完成任务这几项判断的确切原文。反馈就是根据这些证据写成的,并会引用你自己说过的话。在我们对一批反馈样本中 158 条引用的审核中,157 条与转写文本逐字相符。当我们请一个独立的评审模型在不知道哪个是哪个的情况下,比较 Engine 2.0 的反馈和我们上一代系统产生的反馈时,无论是按考官的标准评判,还是按学生的标准评判,它都在 24 次比较中的 20 次更偏好 Engine 2.0。

我们还测试了反馈是否能把批评准确地落在该落的地方。我们拿强应答,故意破坏其中一个方面:插入语法错误和语气词、把精确的用词换成模糊的、去掉支撑性的细节,或者去掉题目要求的核心动作。在四种情况中的三种里,我们破坏的那个维度恰好就是分数下降最多的维度。这是一种聊天机器人很难轻易通过的检验,因为它没有固定的维度可供对照检查。

每天练习要花多少钱

口语分数在你第四十次练习时最有用,而不是第四次。因为到那时,它才开始告诉你说话方式上的某个改变是否真的起了作用。所以实际的问题不是每个工具单次要花多少钱,而是大量使用它要花多少钱。

根据 claude.com 在 2026 年 9 月公布的信息,Claude Pro 每月 US$20,约合 CA$28,年付则为每月 US$17。它带有滚动五小时的使用窗口和每周上限;一旦触及其中任何一个,你就得等待。附带校准样例的长转写文本恰恰是最消耗这份配额的那种消息。Max 系列起价每月 US$100,税前约合 CA$138,大幅提高了限制,但并没有取消限制。这些套餐都不包含题库、计时器、转写、校准样例,或任何与 CELPIP 相关的专属内容。

Prepamigo 每月 CA$24.98,或年付每月 CA$8.25(全年 CA$98.98),均已含税,并且可以随时取消。每种套餐都包含 Engine 2.0 提供的无限次打分,没有每日、单次或每周上限,以及无限次练习机会,还有完整的题库:80 套完整练习题和超过 2,000 道练习题目,覆盖 Speaking、Writing、Reading 和 Listening 四个部分,均按照 CELPIP General 考试的题型、时长和格式编写。

简单来说:花不到 Claude Pro 的价钱,你得到的是一个在最关键的应答上准确得多的评分系统,它从不需要你等待,而且题目和校准样例早已准备就位。

什么时候 Claude 是更好的工具

这篇文章并不是在说你准备 CELPIP 时永远不该打开 Claude。有几件事它做得比专门的评分系统更好,一个认真的考生完全可以两者并用。

  • 就一段应答展开讨论。如果你想弄清楚某个理由为什么不够有力,或者想头脑风暴出三个更好的理由,对话正是合适的形式。Engine 2.0 给你的是判断和证据,它不会跟你聊天。
  • 词汇和表达上的帮助。让 Claude 给出五种更自然的说法既快又有用,它给出的建议通常也不错。
  • 写作练习。书面应答不需要转写,所以使用流程上的差距要小得多。Claude 在写作上的准确率不在本次测试范围之内,我们在此不作任何评价。
  • 任何与考试无关的事。移民文件相关的问题、学习计划、解释某个语法点:Claude 是一个通用助手,Prepamigo 不是。

根据这里的证据,Claude 不应该充当的角色,是告诉你是否已经准备好了。对于这件事,你需要的是一个专门为这项工作打造、在从未见过的应答上测试过、并按等级逐一衡量过的评分系统。

你的评语有哪些新变化

Engine 2.0 搭载了全新重构的评语层。它读取的是两位评分员给出的依据,而不只是分数,并针对三类学生做过测试:第一次接触 CELPIP 的学生、英语基础较弱只想要诀窍的学生,以及每天只有半小时、下周就要考试的学生。以下是具体的变化。

  • 原话引用,逐字对应. 每一条评语都会引用评分员实际关注的那句原话。凡是加了引号的内容,都是逐字摘录;在我们的审核中,158 处引用里有 157 处确实如此。评语绝不会编造你没有说过的话。
  • 先改这一件事. 每篇应答都会给出一个首要改进点:那个最能提升你分数的改动,会用整页里最直白的话写出来。紧接着是两条更具体的行动建议,最后是一份三项检查清单,供你开口前在心里过一遍。
  • 针对题型给出的建议. 给建议、描述场景和说服他人,评分标准各不相同。评语现在能识别八种题型各自看重什么,并据此给出建议,而不是在所有题型里重复同一套泛泛的技巧。
  • 该先练哪个维度. 评语会告诉你四个维度中哪个最弱、哪个最强,让你清楚下一分该从哪里拿,而不是把这一切都藏在一个分数背后。
  • 题目要求了什么、你漏了什么. 在任务完成度这一项上,评语会具体列出题目要求中你没有覆盖到的部分,或者直接说明你已经全部覆盖。
  • 真正能拿来练习的建议. 每一条方法都是你在下一次尝试前可以大声练习的内容。评语不会建议你说得更清楚或减少口音:口音不是可理解度所衡量的内容,评语也从不对此作出评价。
  • 不会因为计时而扣分. 如果一篇应答已经完成了任务要求,只是被时间截断,不会因为这个截断而被扣分,评语也不会因此责怪你。

在一次独立评判中,一个不知道哪份来自哪个系统的评判模型,对同一批应答分别用新旧两套系统生成的评语做了盲测比较:无论是以考官的视角评判,还是以学生的视角评判,它在 24 次比较中有 20 次更倾向于新的评语。

常见问题

Claude 能给我的 CELPIP 口语练习打分吗? 它会给你一个数字。用简单提问在 48 段从未见过、且分数已核实的应答上测试,Claude Opus 5 命中核实等级的比例是 62%,Claude Sonnet 5 是 45%,而 Prepamigo Scoring Engine 2.0 是 81%。在顶级应答上,Sonnet 5 只有 29% 的时间是对的。

Prepamigo 比 Claude 更准确吗? 是的:用简单提问时是 81% 对 62% 和 45%。给出带校准样例的完整流程后,Opus 5 提高到 77%,Sonnet 5 提高到 69%,仍然落后,并且仍然在量表顶端表现最弱。

各自的价格是多少? Claude Max 起价每月 US$100,税前约合 CA$138,有使用上限;Claude Pro 是每月 US$20,限制更严。Prepamigo 每月 CA$24.98(含税),或年付每月 CA$8.25,打分次数不限,并配有 80 套练习题。

为什么 Claude 总把我的强应答打成 7 分或 8 分? 一个被要求给出数字、却没有任何比较对象的模型会向低分和中间漂移,而顶级应答从来都不是完美无缺的。用简单提问测试,Sonnet 5 只有 29% 的时间会给顶级应答打出 9 分或更高。

想看看打分具体是怎么运作的,可以读一读 深入了解 Scoring Engine 2.0。想看包含 GPT 和 Gemini 的完整排行榜,可以读 哪个 AI 打 CELPIP 口语分最准。如果想看英文原文,可以读 阅读英文版指南。或者跳过阅读,直接 录制一段应答

Prepamigo 对比 Claude 打分 CELPIP 口语:谁给你的分数才是对的? | PrepAmigo