产品

Prepamigo 对比 ChatGPT 打分 CELPIP 口语:准确率、局限与花费

2026年9月7日

落在核实等级内的应答占比

48 段留出测试集口语应答,每个等级 16 段。每个 GPT 模型拿到转写文本后被用大白话要求按 CELPIP 量表打分;三次运行的平均值。Engine 2.0 以正常生产环境配置运行。

81%

Prepamigo Engine 2.0

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo 对比主流 AI 聊天机器人套餐

单位为加元。Prepamigo 价格已含税。Claude Max(US$100 起)和 ChatGPT Pro(US$200)按 1.38 的汇率换算为加元,税前价格。准确率是指在保留测试集上,模型被用大白话要求打分时,得分落在核实等级内的应答占比;三次运行的平均值。

Prepamigo
ChatGPT ProGPT 5.6 sol
月费
CA$24.98(含税)
CA$276(税前)
评分次数
无限
有上限
现成题库
练习套题
80 套
练习题量
2,000+ 题
CELPIP 真实格式
准确率
81%
35%
顶分识别率
71%
25%

ChatGPT 大概是 CELPIP 考生用来给自己口语练习打分最常见的工具。几乎每个人的手机上都有它,几秒钟就能给出回答,也很乐意告诉你你的应答是什么等级。本文要回答的问题是:它告诉你的那个等级,是不是你真正会拿到的等级。我们像学生一样跑了这个测试:粘贴转写文本,要求打分,然后统计结果。

先说结论:在这些系统都从未见过、且每一段都经过独立核实分数的 48 段口语应答上,Prepamigo Scoring Engine 2.0 命中正确等级的比例是 81%。用大白话测试,支撑 ChatGPT 付费套餐的模型 GPT 5.6 sol 命中正确等级的比例是 35%。GPT 5.5 是 37%,GPT 5.6 luna 是 31%,GPT-4o mini 是 45%——这个数字看起来比实际情况要好,因为这个模型几乎对所有应答都打低分,正好就蒙对了弱应答。

接着我们又做了大多数对比文章都会省略的一步:把我们自己的评分流程交给每个 GPT 模型,为每道题配上真实的校准样例,并强制它与这些样例逐一比较,看看它究竟能做到多好。结果 GPT 5.6 sol 提高到 71%,GPT 5.5 提高到 69%,luna 提高到 63%,GPT-4o mini 提高到 50%。这四个模型仍然全部落后于 Engine 2.0,也仍然在顶级应答上表现最差。本文接下来会依次讲解这两项测试、各个分数等级下的具体结果、通用助手为什么会向中间漂移、双方的日常使用流程有什么不同,以及如果你打算认真练习,每种选择分别要花多少钱。

简单测试:学生实际会得到什么

81% 对 35%。在一个 48 段应答的测试里,Engine 2.0 比 GPT 5.6 sol 多命中 22 个正确分数。换句话说,Engine 2.0 的打分失误比 GPT 5.6 sol 少 71%,比 GPT 5.5 少 70%,比 GPT 5.6 luna 少 73%,比 GPT-4o mini 少 66%。

简单测试三次独立运行中,GPT 5.6 sol 分别得到 31%、40% 和 35%,GPT 5.5 分别得到 35%、42% 和 33%。这种运行之间的波动本身就是一个发现:让 ChatGPT 在不同的两天给同一段转写文本打分,你相当常见地会得到两个不同的分数。Engine 2.0 在三次运行中都得到 81.3%。

差距在哪里出现:按分数等级逐一拆解

一个总体数字会掩盖错误具体出在哪里。一个在弱应答上表现出色、在强应答上一塌糊涂的评分工具,对初学者来说没什么问题,但对追求 10 分的人来说却是实实在在的伤害。所以下面是按核实等级拆分的简单测试结果。

较低等级应答(核实分数 4 或 5)

16 段留出应答,简单提问,三次运行平均值。大多数失误都是打成 3 分。

88%

Prepamigo Engine 2.0

75%

GPT-4o mini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

在弱应答上,Engine 2.0 以 88% 领先。GPT-4o mini 紧随其后为 75%,这是它“打低分”的习惯唯一对自己有利的地方。三个较大的 GPT 模型则在 52% 到 54% 之间:大约一半的时间,它们会把 4 分或 5 分的应答打成 3 分,尽管方向可以理解,但这仍然是错误的等级。用 ChatGPT 打分的初学者大约有一半的时间会被告知自己比实际水平更差。

中间等级应答(核实分数 7 或 8)

16 段留出应答,简单提问,三次运行平均值。失误几乎全部是打成 5 分或 6 分。

85%

Prepamigo Engine 2.0

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

中间等级正是简单提问下 GPT 模型全面崩溃的地方。Engine 2.0 是 85%;GPT-4o mini 是 44%;GPT 5.5、GPT 5.6 sol 和 luna 在 27% 到 29% 之间。中间等级的应答混合着真实的优点和缺点,需要权衡,而在没有校准样例可供权衡的情况下,GPT 模型只看到缺点,给出 5 分或 6 分。一个 7 分或 8 分水平的考生问 GPT 5.6 sol 要分数,十次里不到三次会听到正确的等级。

顶级应答(核实分数 10 及以上)

16 段留出应答,简单提问,三次运行平均值。几乎所有失误都是打成 7 分或 8 分。

71%

Prepamigo Engine 2.0

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

在顶级,Engine 2.0 能识别出 71% 的顶级应答。GPT 5.5 能识别出 27%,GPT 5.6 sol 是 25%,GPT-4o mini 是 17%,GPT 5.6 luna 是 13%。每个 GPT 模型都会在十段本该得到 10 分的应答里,至少给七段打出 7 分或 8 分。

想想这对一个实力很强的考生意味着什么。你录制八段应答,转写出来,粘贴进 ChatGPT 并要求打分,它告诉你其中六段是 7 分或 8 分。你就此认为自己是一个还需努力的中等水平考生。而实际上,你一直都是 10 分。这不是一种假设。这就是每个 GPT 模型在我们测试中对大多数顶级应答做出的判断。

如果你用 ChatGPT 打分,而它一直给你 7 分或 8 分,不要不假思索地相信它。在我们的测试中,一段顶级应答从 GPT 5.6 sol 那里拿到 7 分或 8 分的可能性,是拿到其真实等级分数的三倍。

如果把我们的完整流程交给 ChatGPT 会怎样?

很容易把简单测试的数字解读成 GPT 是一个弱系列模型。事实并非如此。问题不在于智能水平,而在于一个被要求给出数字、却没有任何比较对象的模型只能靠猜,而猜的时候它会猜得偏低、偏向中间。

所以我们跑了第二项测试。每个 GPT 模型都拿到了与 Engine 2.0 的评分员完全相同的一套材料:转写文本、题目、该具体题目在每个等级各两个的真实校准样例,以及一条指令——针对四个维度分别说出最接近的样例,而不是直接给出数字。每个模型还配有一份根据自身倾向调整的简短校准说明。

在完整流程下:落在核实等级内的应答占比

同样的 48 段留出应答。每个 GPT 模型对每段应答只打分一次,使用与 Engine 2.0 自己的评分员相同的转写文本、指令和校准样例。

81%

Prepamigo Engine 2.0

71%

GPT 5.6 sol

69%

GPT 5.5

63%

GPT 5.6 luna

50%

GPT-4o mini

校准样例带来了巨大的差异。GPT 5.6 sol 翻了一倍,从 35% 提高到 71%。GPT 5.5 从 37% 提高到 69%,luna 从 31% 提高到 63%。GPT-4o mini 几乎没有变化,从 45% 提高到 50%,因为无论给它看什么,它都还是把一切都打低分;在完整流程下,它甚至一个顶级应答都没能识别出来。这告诉你专门打造的评分系统的价值究竟在哪里:不在于更聪明的模型,而在于每道具体题目上每个等级听起来到底是什么样的真实样例,以及一个强迫模型去比较而不是去猜的问题设计。

即便如此,每个 GPT 模型仍然落后。在完整流程下,GPT 5.6 sol 总体上落后 Engine 2.0 十个百分点,在中间等级上落后十个百分点(75% 对 85%),在顶级上落后八个百分点(63% 对 71%)。它剩下的习惯是过度奖励流利度:一个表现不错、表达流畅的 8 分应答会被推高到 9 分或 10 分。GPT 5.6 luna 则恰恰相反,会把中间等级的应答往下拉向 5 分,中间等级最终只有 44%。一个单一模型只跑一次,仍然会带有其特有的偏差,而 Engine 2.0 靠来自不同提供方的两个独立评分员、每个评分员投三次票并取中间票,以及在两个评分员严重分歧时采用较高分数的调和规则,补上了剩下的差距。

我们还尝试了显而易见的捷径:保留简单提问,但加上诸如“不要向中间漂移”或“9 分应答不必完美无缺”这样的指令。结果没有产生任何可测量的变化。真正有效的做法是改变问题本身,并给模型一些真实的比较对象。

使用流程的差距:录完就走,还是事事亲力亲为

准确率数字的前提是打分真的能够发生。而用 ChatGPT 的话,从你按下录音的停止键到看到分数之间,要做的工作出乎意料地多,其中一些工作还会改变分数本身。

首先,你需要一份转写文本。ChatGPT 的语音模式是在跟你对话,不是在给你打分;要给一段录音打分,你需要文字。这意味着你要么自己把说的话打出来(这会改变内容本身),要么把录音丢进转写工具。而且转写文本必须逐字逐句。每一个语气词、每一次重新开始、每一次自我纠正都要保留。当我们测试把这些停顿去掉的“清理版”转写文本时,准确率下降了十五个百分点,因为这些停顿恰恰是评分者判断一段应答听起来如何所需要的证据。大多数消费级转写工具,包括大多数手机自带的那种,默认都会清理掉它们。

第二,你需要题目本身。如果你要求,ChatGPT 可以编一个 CELPIP 风格的题目,但它只是在猜测格式、时长和真实考试会用到的情景类型。你无法知道它写出来的题目和你将要面对的题目到底像不像。

第三,如果你想要比简单测试更好的结果,就需要校准样例:同一题型每个等级的真实应答,并带有核实过的等级。这正是在我们的测试中让 GPT 5.6 sol 准确率翻倍的那个输入,也是学生在家无法生产出来的东西。

第四,下一段应答又要把这些全部重来一遍,而且每一次都会消耗你的消息配额。

在 Prepamigo 上,你从题库里选一道题,计时器开始运行,你开口说话,停下后大约十秒钟,分数和反馈就出现在屏幕上。转写在设计上就是逐字进行的,校准样例会自动附加到题目上,没有任何需要粘贴、需要提问的地方。当晚的第十一段应答花费的精力和第一段完全一样。

一致性:同一段应答,同一个分数

一个无法复现的分数根本不是一种衡量。如果同一段录音星期一得到 8 分,星期二得到 10 分,你对自己的口语水平什么都没学到。所以我们也测试了可重复性。

Engine 2.0 在不同的日子里,对 48 段留出应答独立运行了三次,每次都得到 81.3%。如果看每一段应答,有 87.5% 在三次运行中拿到了完全相同的分数,只有 4.2% 曾经移动过两分或更多,而这些全部是正好处在两个等级边界上的应答。

GPT 5.6 sol 的简单测试在最好和最差的一次运行之间波动了九个百分点。这种稳定性上的差距来自投票机制。Engine 2.0 中的每个评分员对每段应答都投三次票,取中间票。当我们把同样的配置改成单次投票而不是三次时,跨运行的相同分数比例从 87.5% 降到了 77%,而移动两分或更多的应答比例翻了一倍还多。一次 ChatGPT 对话就等于一次投票。我们还检验了通过 API 设置固定随机种子是否能让 GPT 模型更具可重复性。结果并没有;在 GPT 5.6 luna 上,可重复性反而下降了。

能落地行动的反馈

ChatGPT 是一个很擅长解释的工具。如果你问它为什么给出某个分数,它会用清晰的英语详细讲给你听,还会提出改进建议。对于想要就一段应答展开讨论的考生来说,这确实很有价值。

风险在于,流畅的解释并不等于准确的诊断。一个把 10 分打成 7 分的模型,会非常有说服力地解释为什么是 7 分。它总能找到东西来支撑自己的说法。而且,由于它在打分之前并不需要先给出证据,它的解释是事后写成的,目的是为已经选定的数字找理由。

Engine 2.0 的运作方式恰恰相反。每个评分员在给出等级之前,都必须为每个维度给出证据,反馈就是根据这些证据写成的。它会引用你自己说过的话:在我们对一批反馈样本中 158 条引用的审核中,157 条与转写文本逐字相符。当一个独立的评审模型在不知情的情况下,比较 Engine 2.0 的反馈和我们上一代系统在同样应答上产生的反馈时,无论是按考官的标准评判,还是按学生的标准评判,它都在 24 次比较中的 20 次更偏好 Engine 2.0。

我们还检验了反馈是否能把批评准确地落在该落的地方,方法是拿强应答,每次故意破坏其中一个维度。在四种情况中的三种里,我们破坏的那个维度恰好就是分数下降最多的维度。这是一种聊天机器人很难轻易通过的检验,因为它没有固定的维度可供对照检查。

每天练习要花多少钱

口语分数在你第四十次练习时最有用,而不是第四次。因为到那时,它才开始告诉你说话方式上的某个改变是否真的起了作用。所以实际的问题是大量使用每个工具要花多少钱。

根据 2026 年 9 月公布的信息,ChatGPT Plus 按月计费,每月 US$20,约合 CA$28。它让你用上 GPT 5.6 系列,但在滚动窗口内有消息数量上限;附带校准样例的长转写文本恰恰是最消耗这份配额的那种消息,一旦触及上限,你就得等待或降级到更小的模型。ChatGPT Pro 每月 US$200,税前约合 CA$276,大幅提高了限制。免费版会把大量流量分配给更小的模型,而在本次测试中,其中最小的模型几乎无法识别任何顶级应答。这些套餐都不包含题库、计时器、逐字转写、校准样例,或任何与 CELPIP 相关的专属内容。

Prepamigo 每月 CA$24.98,或年付每月 CA$8.25(全年 CA$98.98),均已含税,并且可以随时取消。每种套餐都包含 Engine 2.0 提供的无限次打分,没有每日、单次或每周上限,以及无限次练习机会,还有完整的题库:80 套完整练习题和超过 2,000 道练习题目,覆盖 Speaking、Writing、Reading 和 Listening 四个部分,均按照 CELPIP General 考试的题型、时长和格式编写。

简单来说:花不到 ChatGPT Plus 的价钱,在简单测试中你得到的评分系统准确率是它的两倍多,它从不需要你等待,而且题目和校准样例早已准备就位。

什么时候 ChatGPT 是更好的工具

这并不是在说你准备 CELPIP 时永远不该打开 ChatGPT。一个认真的考生完全可以两者并用。

  • 就一段应答展开讨论。如果你想弄清楚某个理由为什么不够有力,或者想头脑风暴出三个更好的理由,对话正是合适的形式。Engine 2.0 给你的是判断和证据,它不会跟你聊天。
  • 词汇和表达。让它给出五种更自然的说法既快又有用。
  • 找个能回应你的对象说话。ChatGPT 的语音模式是一种练习大声说英语、让自己更自然的合理方式。它不是评分工具,但可以陪你练。
  • 写作练习。书面应答不需要转写,所以使用流程上的差距要小一些。GPT 在写作上的准确率不在本次测试范围之内,我们不作任何评价。
  • 任何与考试无关的事。ChatGPT 是一个通用助手,Prepamigo 不是。

根据这里的证据,ChatGPT 不应该充当的角色,是告诉你是否已经准备好了。对于这件事,你需要的是一个专门为这项工作打造、在从未见过的应答上测试过、并按等级逐一衡量过的评分系统。

你的评语有哪些新变化

Engine 2.0 搭载了全新重构的评语层。它读取的是两位评分员给出的依据,而不只是分数,并针对三类学生做过测试:第一次接触 CELPIP 的学生、英语基础较弱只想要诀窍的学生,以及每天只有半小时、下周就要考试的学生。以下是具体的变化。

  • 原话引用,逐字对应. 每一条评语都会引用评分员实际关注的那句原话。凡是加了引号的内容,都是逐字摘录;在我们的审核中,158 处引用里有 157 处确实如此。评语绝不会编造你没有说过的话。
  • 先改这一件事. 每篇应答都会给出一个首要改进点:那个最能提升你分数的改动,会用整页里最直白的话写出来。紧接着是两条更具体的行动建议,最后是一份三项检查清单,供你开口前在心里过一遍。
  • 针对题型给出的建议. 给建议、描述场景和说服他人,评分标准各不相同。评语现在能识别八种题型各自看重什么,并据此给出建议,而不是在所有题型里重复同一套泛泛的技巧。
  • 该先练哪个维度. 评语会告诉你四个维度中哪个最弱、哪个最强,让你清楚下一分该从哪里拿,而不是把这一切都藏在一个分数背后。
  • 题目要求了什么、你漏了什么. 在任务完成度这一项上,评语会具体列出题目要求中你没有覆盖到的部分,或者直接说明你已经全部覆盖。
  • 真正能拿来练习的建议. 每一条方法都是你在下一次尝试前可以大声练习的内容。评语不会建议你说得更清楚或减少口音:口音不是可理解度所衡量的内容,评语也从不对此作出评价。
  • 不会因为计时而扣分. 如果一篇应答已经完成了任务要求,只是被时间截断,不会因为这个截断而被扣分,评语也不会因此责怪你。

在一次独立评判中,一个不知道哪份来自哪个系统的评判模型,对同一批应答分别用新旧两套系统生成的评语做了盲测比较:无论是以考官的视角评判,还是以学生的视角评判,它在 24 次比较中有 20 次更倾向于新的评语。

常见问题

ChatGPT 能给我的 CELPIP 口语打分吗? 它会给你一个数字。用简单提问在 48 段从未见过、且分数已核实的应答上测试,GPT 5.6 sol 有 35% 的时间是对的,GPT 5.5 是 37%,luna 是 31%,GPT-4o mini 是 45%,而 Engine 2.0 是 81%。在顶级应答上,GPT 5.6 sol 只有 25% 的时间是对的。

Prepamigo 比 ChatGPT 更准确吗? 用简单提问时是 81% 对 GPT 5.6 sol 的 35%。给出带校准样例的完整流程后,GPT 5.6 sol 提高到 71%,仍然落后十个百分点。

各自的价格是多少? ChatGPT Pro 每月 US$200,税前约合 CA$276;Plus 是每月 US$20,有消息数量上限。Prepamigo 每月 CA$24.98(含税),或年付每月 CA$8.25,打分次数不限,并配有 80 套练习题。

如果我还是要用 ChatGPT,该选哪个 GPT 模型? 用简单提问,没有一个表现出色。有校准样例的话,选 GPT 5.6 sol。如果你的水平接近 10 分,无论如何都不要用 GPT-4o mini。

想看同样针对 Claude 的对比,可以读一读 Prepamigo 对比 Claude。想看包含八个系统的完整排行榜,可以读 哪个 AI 打 CELPIP 口语分最准。如果想看英文原文,可以读 阅读英文版指南。或者跳过转写这一步,直接 录制一段应答

Prepamigo 对比 ChatGPT 打分 CELPIP 口语:准确率、局限与花费 | PrepAmigo