产品

Prepamigo 对比 Claude 打分 CELPIP 写作:谁给你的分数才是对的?

2026年9月8日

落在核实等级内的作文占比

36 篇 CELPIP 官方写作应答,三个等级各 12 篇,覆盖两种写作任务。Claude 拿到题目和作文后,被用大白话要求按 CELPIP 量表打分。Prepamigo 写作评分系统以正常生产环境配置运行。

86%

Prepamigo 写作评分系统

61%

Claude Opus 5

56%

Claude Sonnet 5

Prepamigo 对比主流 AI 聊天机器人套餐

单位为加元。Prepamigo 价格已含税。Claude Max(US$100 起)和 ChatGPT Pro(US$200)按 1.38 的汇率换算为加元,税前价格。准确率是指在 36 篇官方作文上,模型被用大白话要求打分时,得分落在核实等级内的作文占比;单次运行。

Prepamigo
Claude MaxOpus 5
月费
CA$24.98(含税)
CA$138+(税前)
评分次数
无限
有上限
现成题库
练习套题
80 套
练习题量
2,000+ 题
CELPIP 真实格式
准确率
86%
61%
中等作文识别率
100%
25%

写作是聊天机器人看起来最像一位合格评分员的那项技能。没有录音需要转写,不用担心口音,只是文字放进去、一个数字出来,再附上一段自信满满的解释。所以我们测试了这个数字。我们把用来衡量我们自己评分系统的那 36 篇 CELPIP 官方写作应答原样交给 Claude,每个等级十二篇,并像学生提问那样让它打分。

先说结论:Prepamigo 写作评分系统有 86% 的时间落在核实等级内。Claude Opus 5 是 61%,Claude Sonnet 5 是 56%。这个差距并不是均匀分布的。在弱作文和强作文上,Claude 的表现还算体面,在顶级作文上 Opus 5 甚至比我们更好。而在中等作文上,也就是大多数考生实际写出的那些 7 分和 8 分作文上,Opus 5 四次里只对一次,Sonnet 5 三次里只对一次。Prepamigo 十二篇全部正确。

本文接下来会按等级逐一讲解这些结果,解释通用模型为什么会丢掉量表的中段,看看双方的评语各自值多少,并比较认真练习写作时每种选择分别要花多少钱。我们通篇都尽量对 Claude 保持公平,包括它胜过我们的那一处。

简单测试:学生实际会得到什么

86% 对 61% 和 56%。在 36 篇作文上,这意味着 Prepamigo 比 Opus 5 多命中 9 个正确分数,比 Sonnet 5 多命中 11 个。换句话说,在同样这些作文上,Prepamigo 的打分失误比 Opus 5 少 64%,比 Sonnet 5 少 69%。

Claude 拿到了什么很重要,所以这里如实说明。每个模型都被告知自己是一位经验丰富的 CELPIP 写作考官,拿到与考生所见完全相同的题目,包括邮件任务的必答要点和问卷任务的选项,然后拿到作文。它被要求给出一个 0 到 12 之间的分数。整条提示就是这样。这正是你会在聊天窗口里输入的内容,也比一句“给这篇打个分”更公平,因为模型至少知道题目要求了什么。

Prepamigo 的评分系统收到的是同样的题目和同样的作文。它还拥有生产环境中一直具备的东西:该题目每个等级的真实已评分范例作文可供比较,以及一个规则层,用来检查评分员最先检查的那些事项,比如每个必答要点是否都写到了、问卷应答是否真的选了一边、邮件是否有称呼和结尾,以及应答的篇幅有多长。

差距在哪里出现:按等级逐一拆解

一个总体数字掩盖了错误落在哪里,而在写作上,错误集中在一处。下面是按核实等级拆分的同一批结果:弱作文得 4 或 5 分,中等作文得 7 或 8 分,强作文得 10 分及以上。

弱作文(核实分数 4 或 5)

12 篇官方作文。Claude 在这里的失误大多是打成 3 分,低了一个等级。

75%

Prepamigo 写作评分系统

67%

Claude Opus 5

50%

Claude Sonnet 5

在弱作文上,Prepamigo 是 75%,Opus 5 是 67%,Sonnet 5 是 50%。Prepamigo 的三次失误全都高了一档,把篇幅短但写得整洁的作文打成了 6 分或 7 分。Claude 的失误方向相反:Sonnet 5 把十二篇弱作文中的四篇打成 3 分,Opus 5 把其中两篇打成 3 分。在这个量表上,3 分意味着一篇几乎没有回应题目的应答。而这些作文是回应了题目的,只是内容单薄。Claude 没有 4 分作文的样例可参照,就把单薄当成了不及格。

中等作文(核实分数 7 或 8)

12 篇官方作文。这是大多数考生所处的等级,也是 Claude 失手的等级。

100%

Prepamigo 写作评分系统

33%

Claude Sonnet 5

25%

Claude Opus 5

中段就是整个故事。Prepamigo 把十二篇中等作文全部打在了 7 到 8 分区间内。Opus 5 只对了三篇,Sonnet 5 对了四篇。Opus 5 的失误几乎全是往高打:它给十二篇中的六篇打了 9 分,给一篇打了 10 分。Sonnet 5 则两头都有,四篇被压到 6 分,四篇被推到 9 分或 10 分。

想想这对写出其中一篇作文的考生意味着什么。7 分或 8 分是考试中最常见的真实分数,也是决定你是否达到移民目标的那个分数。问 Opus 5,超过一半的时候它会告诉你你是 9 分或 10 分,可以停止练习了。其实你还没到。问 Sonnet 5,三次里有一次它会告诉你你已经掉到了 6 分。其实你并没有。这两个答案都无法帮你决定接下来该做什么。

强作文(核实分数 10 及以上)

12 篇官方作文。这是 Claude Opus 5 唯一胜过 Prepamigo 的等级。

92%

Claude Opus 5

83%

Prepamigo 写作评分系统

83%

Claude Sonnet 5

在顶级,Opus 5 是本次测试中最好的评分员:十二篇强作文识别出了十一篇。Prepamigo 和 Sonnet 5 各识别出十篇。Prepamigo 的两次失误都是 9 分,低了一档;Sonnet 5 的失误分别是一个 9 分和一个 7 分。我们如实报告这一点,因为它是事实,也因为它解释了整体的规律:Claude 很慷慨。它大方地发出 9 分、10 分和 11 分,这在强作文上恰好是对的,在其他所有作文上则是错的。

如果你用 Claude 给写作打分,而它给了你 9 分,在有其他证据确认之前,先把它当作一个中等分数看待。在我们的测试中,一篇被 Opus 5 打了 9 分的作文,更有可能是核实的 7 分或 8 分,而不是核实的 9 分或 10 分。

聊天机器人为什么会丢掉量表的中段

一篇中等水平的 CELPIP 作文是一种很具体的东西。它覆盖了题目要求,有条理,很少有影响理解的错误,同时也很泛泛:理由只是陈述而没有展开,词汇求稳,句子全是一个样子。看过几百篇这种作文的评分员清楚地知道它处在什么位置。通用模型却没有见过几百篇被标记为 7 分的这类作文。它看到的是一篇整洁、有条理、基本正确的文字,于是伸手去拿一个高分。

差别就在这里。Prepamigo 的评分系统不是拿作文去对照某种“好文章”的概念,而是拿它去对照同一题目的真实已评分作文:弱等级一篇、中等一篇、顶级一篇,全都是带着真实小错的真实应答。一篇整洁但泛泛的作文会落在中等样例旁边,因为那才是它最像的。一篇单薄的作文会落在弱样例旁边而不是更低,因为弱样例同样单薄,却仍然是 4 分。

在这种比较之上还有一个规则层,负责处理模型不擅长数的那些事情。邮件是否覆盖了全部三个必答要点,还是只写了两个?问卷应答是真的选了一个选项,还是在两者之间含糊其辞?有没有称呼和结尾?应答是 180 个词还是 60 个词?漏掉一个必答要点,无论英语写得多好,任务完成度得分都会被压在 8 分或以下,因为考试就是这样运作的。被简单提问的 Claude 没有这样的下限或上限;它全凭印象决定一切。

我们测试过告诉 Claude 各个等级的标准能否解决这个问题。单靠这一点不行。给模型一份评分标准,产生的漂移是一样的。真正能改变数字的是给它真实的已评分样例和一个规则层,换句话说:打造一个评分系统。

使用流程的差距:你得自己准备什么

写作是最容易把 Claude 当评分员来用的一项技能,这一点值得坦率承认。你粘贴作文,几秒钟内就得到分数,如果你想让它解释,它会详详细细地解释。没有转写步骤,没有音频,没有任何设置。想要一个快速的第二意见,它确实很方便。

你得不到的是题目本身。Claude 没有一个带有正确必答要点、选项和字数要求的 CELPIP 风格邮件和问卷题库,所以你要么自己写题并希望它和真实考试相像,要么找到什么就拿什么来练。你得不到必答要点检查,因为 Claude 不知道真实考试会列出哪些要点。你得不到一篇以你自己的作文为基础、按正确篇幅改写的范文。你也得不到一个用真实已评分作文校准过的数字,这正是量表中段出错的原因。

在 Prepamigo 上,你从题库里打开一道题,计时器开始运行,你动笔写,提交后大约一分钟,你就会得到四个维度的分数、一个总分、一份你遗漏内容的清单、引用自你原文的修改建议,以及一篇改写后的范文。这个月的第四十篇作文花费的精力和第一篇完全一样。

同一篇作文,同一个分数

一个无法复现的分数根本不是一种衡量。如果同一篇作文今天得 8 分、明天得 10 分,你对自己的写作什么都没学到。所以在主测试之后,我们又在不同的日子里把全部 36 篇作文再打了两次分。Prepamigo 写作评分系统在三次运行中分别得到 86%、89% 和 86%,同样那十二篇中等作文每次都落在区间内。

Claude 的几次运行也在变动,但它错误的形态没有变:每一次运行里,大多数中等作文都被 Opus 5 打成了 9 分,弱作文也一直从 Sonnet 5 那里收到 3 分。这种一致性正是有用的发现。问题不在于 Claude 不稳定,而在于 Claude 每次都朝同一个方向自信地失准,而这更难被察觉。

评语:对一个错误数字的漂亮解释

Claude 写的评语文字非常出色。它清楚、耐心、具体,如果你让它解释为什么一篇作文是 9 分,它会写出一段很有说服力的话。麻烦在于,这段话是为一个已经选定的数字写的辩护,一旦数字错了,解释也跟着错。一篇实际上是 7 分的作文会因为它并不具备的优点而受到表扬,考生也就带着安心离开了。

Prepamigo 的评语从另一头出发。每一条修改建议都会引用你作文里的确切原文,凡是检查器在你的文本中找不到的内容,都会在你看到之前被去掉。漏掉的必答要点会被点名。每个维度都会给出一个限制因素,或者直白地说明没有什么在拖后腿。你还会得到一篇以你自己的应答为基础、按题目要求篇幅改写的范文,让你看到差距,而不只是读到差距。下面这一节列出了评语层的具体变化。

你的写作评语有哪些新变化

分数只是你拿回来的一半。写作评语层与评分系统一同重构,其中的每一条内容都锚定在你自己的文字上。以下是具体的变化。

  • 在你自己的作文里找得到的修改建议. 每一条语法、拼写和词汇的修改建议都会引用你应答中的确切原文,这样应用就能在你写下它们的位置直接高亮出来。凡是检查器无法在你的作文里逐字找到的内容,都会在你看到之前被去掉。
  • 一篇以你的答案为基础的范文. 你会得到一篇由你自己的应答改写而成的版本:保留你的想法,覆盖每一个必答要点,篇幅落在题目要求的 150 到 200 个词之间。如果第一次改写没有达到这个篇幅,它会在展示之前再重做一次。
  • 点名指出你漏掉的必答要点. 对于邮件任务,评语会列出题目中你的应答没有覆盖到的要点。漏掉一个要点也会把任务完成度得分压在 8 分或以下,所以数字和评语绝不会自相矛盾。
  • 每个维度一个限制因素. 对四个维度中的每一个,评语都会用具体的措辞点出拖低这项得分的那一件事,或者直白地说明没有什么在拖后腿、是什么在支撑它。判定某个维度没有问题是一个真正的答案,而不是空白。
  • 批评落在该落的地方. 语气不当是任务完成度的问题,用词模糊是词汇的问题,句子拖沓不断是可读性的问题。每一条意见都归入它所属的维度,而不是一股脑堆进总体评价里。
  • 句子层面的改写. 你作文里的具体句子会带着一个改进后的版本回到你面前,并附一句话说明为什么它更好,让你看到变化,而不只是读到变化。
  • 最强和最弱的维度,并排呈现. 评语会告诉你四个维度中哪一个在撑起你的分数、哪一个在拖后腿,让你不必解读四个数字就知道接下来该练什么。

评语中的每一处引用在显示之前都会与你的作文核对。如果检查器找不到这些文字,这一行就会被删除。这就是为什么评语绝不会让你去修改你没有写过的东西。

每天练习要花多少钱

写作分数在你第三十篇作文时最有用,而不是第三篇。到那时,它才开始告诉你写法上的某个改变是否真的起了作用。所以实际的问题是每种选择大量使用时要花多少钱。

根据 claude.com 在 2026 年 9 月公布的信息,Claude Pro 每月 US$20,约合 CA$28,年付则为每月 US$17,带有滚动五小时的使用窗口和每周上限。Max 系列起价每月 US$100,税前约合 CA$138,提高了这些限制,但并没有取消。这些套餐都不包含题库、计时器、必答要点检查、范文,或一个用真实已评分作文校准过的分数。

Prepamigo 每月 CA$24.98,或年付每月 CA$8.25(全年 CA$98.98),均已含税,并且可以随时取消。每种套餐都包含无限次打分,没有每日、单次或每周上限,以及无限次练习机会,还有完整的题库:80 套完整练习题和超过 2,000 道练习题目,覆盖 Writing、Speaking、Reading 和 Listening 四个部分,均按照 CELPIP General 考试的题型、时长和格式编写。

什么时候 Claude 是更好的工具

  • 打磨一篇强作文。如果你已经是 10 分,想知道 11 分或 12 分还需要什么,Opus 5 能可靠地识别出强写作,也解释得很好。那正是它胜过我们的那一个等级。
  • 把一个句子改写成五种说法。让它为一个笨拙的句子给出替代写法既快,建议也不错。
  • 就一篇作文展开讨论。如果你想弄清楚某个理由为什么不够有力,对话正是合适的形式。Prepamigo 给你的是判断和证据,它不会跟你聊天。
  • 任何与考试无关的事。Claude 是一个通用助手,Prepamigo 不是。

根据这里的证据,Claude 不应该充当的角色,是告诉一个 7 分或 8 分水平的写作者自己处在什么位置。这是大多数考生所处的位置,也恰恰是 Claude 四次里错三次的地方。

常见问题

Claude 能给我的 CELPIP 写作打分吗? 它会给你一个数字。在 36 篇分数已核实的官方应答上,Claude Opus 5 有 61% 的时间是对的,Claude Sonnet 5 是 56%,而 Prepamigo 是 86%。在中等作文上:25% 和 33% 对 100%。

Prepamigo 在写作上比 Claude 更准确吗? 总体上是的,领先 25 到 30 个百分点。在强作文上 Opus 5 更好,92% 对 83%。在大多数考生所处的中等作文上,差距是 100% 对 25%。

为什么 Claude 给我的普通作文打 9 分? 没有任何比较对象时,一篇整洁、有条理、泛泛的作文读起来就像强作文。Opus 5 给十二篇核实为 7 到 8 分的作文中的七篇打了 9 分或 10 分。Prepamigo 会把每篇作文与同一题目的真实已评分样例作比较。

各自的价格是多少? Claude Max 起价每月 US$100,税前约合 CA$138;Pro 是每月 US$20,限制更严。Prepamigo 每月 CA$24.98(含税),或年付每月 CA$8.25,打分次数不限,并配有 80 套练习题。

想看与 ChatGPT 的同类对比,可以读 Prepamigo 对比 ChatGPT 打分写作。想了解写作评分系统是怎么运作的,可以读 深入了解 Prepamigo 写作评分系统。如果想看英文原文,可以读 阅读英文版指南。或者直接 写一篇应答,看看自己的分数。

Prepamigo 对比 Claude 打分 CELPIP 写作:谁给你的分数才是对的? | PrepAmigo