评分

Prepamigo 的 CELPIP 写作打分准吗?用数字如实回答

2026年9月8日

Prepamigo 写作评分器在 36 篇官方作文上的表现

落在核实等级内的作文占比,整体以及按等级划分。两种写作题型合计每个等级十二篇作文;评分器用于校准的六篇样例作文不计入其中。

86%

整体

75%

较弱(4–5 分)

100%

中等(7–8 分)

83%

顶级(10 分以上)

Prepamigo 对比主流 AI 聊天机器人套餐

单位为加元。Prepamigo 价格已含税。Claude Max(US$100 起)和 ChatGPT Pro(US$200)按 1.38 的汇率换算为加元,税前价格。准确率是指在 36 篇官方作文上,模型被用大白话要求打分时,得分落在核实等级内的作文占比;单次运行。

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
月费
CA$24.98(含税)
CA$138+(税前)
CA$276(税前)
评分次数
无限
有上限
有上限
现成题库
练习套题
80 套
练习题量
2,000+ 题
CELPIP 真实格式
准确率
86%
61%
78%
中等作文识别率
100%
25%
75%

对任何练习工具,这都是该问的问题,而大多数工具并不回答它。一个写作分数只有在能告诉你真实评分员会怎么说的时候才有价值,而想知道它是否做到了,唯一的办法就是去测量。所以这篇文章就是那次测量,原原本本地摆出来,既有对我们有利的部分,也有不利的部分。

一段话说清答案:在 36 篇 CELPIP 官方写作应答上,每一篇都有独立核实的分数,Prepamigo 的写作评分器有 86% 落在了核实等级内。它把每一篇中等作文都打对了,较弱作文对了 75%,顶级作文对了 83%。三次独立运行,它给出的结果上下不过一篇作文的差别。用大白话让各模型给同样的作文打分,最好的前沿模型 GPT 5.6 sol 达到 78%;Claude 模型分别达到 61% 和 56%。

接下来会讲这些数字在每个等级上意味着什么、失误出现在哪里以及往哪个方向偏、分数有多稳定、它与你可能在用的聊天机器人相比如何、评语有哪些新变化,以及综合这一切,该如何解读你自己的分数。

这里所说的“准确”是什么意思

我们并不是在宣称 Prepamigo 的分数能预测你的考试结果。没有哪个练习工具能许下这种承诺。我们测量的东西范围更窄,也更诚实:给定一篇分数已经过独立核实的作文,评分器有多大比例会给出同一等级的分数?

CELPIP 写作的报告量表最高到 12 分,我们参考数据中的核实分数分为三个区间:较弱,即 4 或 5 分;中等,即 7 或 8 分;顶级,即 10 分及以上。评分器的分数落在核实区间内,我们就算它正确。一篇顶级作文被打成 10、11 或 12 分是正确的;被打成 9 分就是失误,尽管只差一点点。

各个等级上的准确率

较弱作文:75%。十二篇中有九篇落在区间内。三次失误全都高了一档:两篇打成了 6 分,一篇打成了 7 分。每一篇都篇幅短、内容单薄,但写得整洁,错误很少,而这份整洁换来了它在内容上并不配得的一分。这是评分器在低端的典型失误,而且是慷慨的一种:一个较弱的写作者会被告知自己比实际水平稍好一点,从不会被说得更差。

中等作文:100%。十二篇全部落在 7 到 8 分区间内,三次运行都是如此。这是大多数考生所处的等级,也是决定大多数移民目标的等级,而评分器在这里最强。这里同样是我们测试过的每一个聊天机器人最弱的地方,原因在对比部分会解释。

顶级作文:83%。十二篇中对了十篇。两次失误都打成了 9 分,低了一档。一篇顶级的 CELPIP 作文并非完美无缺,评分器偶尔会多计较一处小瑕疵。两次失误都不是 7 分或 8 分;顶级作文从不会被说成中等。

按题型看,评分器在邮件回复上对了 89%,在问卷回复上对了 83%。问卷回复更难定位,因为这种题奖励明确的立场和展开的理由,而在两个选项之间摇摆的回复会按规则被扣分。

失误往哪个方向偏

一个有 14% 的时候出错的评分者,出错的方式可以是无害的,也可以是有害的。有害的是告诉一个需要 8 分的考生他已经拿到了,而实际上没有。无害的是告诉他还差一分,而实际上并不差;那只是多花一周练习,别无损失。

评分器在 36 篇作文上的五次失误里,三次是较弱作文被打成 6 或 7 分,两次是顶级作文被打成 9 分。没有任何中等作文被打高,也没有任何较弱作文被打成顶级。实际意义是:如果评分器说你到了中等水平,那你要么确实到了,要么只差一分。如果它说你到了顶级水平,那你就是到了。它唯一会“放水”的地方是在底端,一篇短小整洁的作文可能会拿到并不配得的一分。

再对比一下聊天机器人在同样作文上的表现。Claude Opus 5 把七篇中等作文打成了 9 或 10 分,对于受影响最大的那些考生,这是有害的方向。GPT 5.6 sol 把三篇中等作文打成了 6 分,这是无害的方向,另外把三篇顶级作文压在了 9 分。评分者的准确率数字告诉你它多久错一次;错的方向则告诉你它错的时候会让你付出什么代价。

邮件题与问卷题

36 篇作文在两种写作题型之间平分,评分器在邮件题上的表现略好,为 89%,在问卷回复上为 83%。这相当于问卷这边多错了一篇,而且偏差的方向正如你所料。

邮件回复的打分主要看覆盖情况:必答要点有没有写到,语气是否适合收件人,有没有问候语和结尾。这些是评分器在做出任何判断之前就按规则检查的项目,所以一封具备这些要素的邮件会被稳定地定位。问卷回复的打分则看论证的质量:立场是否明确,理由是展开了还是只是罗列。展开与否是一种判断,而判断正是评分者,无论是人还是机器,有可能相差一分的地方。

对你而言,这意味着问卷分数比邮件分数稍微“软”一点点。如果你在问卷回复上徘徊在目标分数的边缘,先写两篇而不是一篇,再决定自己处在什么位置。

从你这一侧的屏幕看

等级视图告诉你评分器在一篇已知等级的作文上表现如何。你看它的角度是反过来的:你手里有一个分数,想知道该有多相信它。

  • 如果它说 4 或 5 分:九次里有九次,作文确实处于较弱等级。评分器给出的低分是对的。
  • 如果它说 7 或 8 分:十五次里有十二次,作文确实处于中等等级;另外三次是较弱作文被打高了一档。7 或 8 分意味着中等,也可能稍低一点。
  • 如果它说 10 分或以上:十次里有十次,作文确实处于顶级等级。评分器给出的 10 分就是 10 分。
  • 如果它说 9 分:测试中的两个 9 分都是核实为顶级的作文。9 分是需要仔细解读的分数:它意味着接近顶端,只差一个展开的理由或一个精准的用词。
如果你自认为写得很出色的作文拿到了 9 分,不要就此认定自己停滞了。把范文放在你的作文旁边,找到它把某个理由展开、而你只是断言了一句的那个地方,重写,再打一次分。

同一篇作文会得到同样的分数吗?

没有一致性的准确率只是运气。所以我们在不同的日子里把全部 36 篇作文打了三次分,中间没有改动任何东西。评分器分别给出 86%、89% 和 86%。同样的十二篇中等作文每次都落在区间内,没有任何一篇作文在不同运行之间移动超过一分。

这种一致性来自评分模型的运行方式:关闭推理功能、固定温度参数,并且是与固定的已评分样例作比较,而不是自由判断。对你来说,这意味着分数的变化就是你写作的变化。如果你重写一篇作文,分数从 8 分变成 10 分,那不是评分者今天心情好。

与你可能改用的工具相比如何

准确率数字有了参照物才更有意义。所以我们把同样的 36 篇作文交给了人们真正用来检查写作的那些聊天机器人,用法和普通人一样:题目、作文,再加一句要求给出 0 到 12 分的简单提问。

落在核实等级内的作文占比

同样的 36 篇官方作文。每个模型都被用大白话要求给作文打分;Prepamigo 以正常生产环境配置运行。

86%

Prepamigo 写作评分器

78%

GPT 5.6 sol

69%

GPT 5.6 luna

61%

Gemini

61%

Claude Opus 5

58%

GPT-4o mini

56%

Claude Sonnet 5

评分器领先最好的聊天机器人八个百分点,领先 Claude 模型 25 到 30 个百分点。真正重要的是失误的形态。在中等作文上,Prepamigo 是 100%,GPT 5.6 sol 是 75%,Gemini 42%,Claude Sonnet 5 33%,Claude Opus 5 25%:一个没有任何比较对象的聊天机器人,会把一篇干净但泛泛的 7 分作文读成 9 分,或者把一篇带几处错误的泛泛 7 分作文读成 6 分。在顶级作文上,Claude Opus 5 反而是测试中最好的评分者,为 92%,Prepamigo 是 83%;它打分慷慨,这在顶端是对的,在其他所有地方都是错的。GPT-4o mini 给十二篇顶级作文中的九篇打了 9 分。

评分器有而聊天机器人没有的,是同一题型在每个等级上的真实已评分作文可供比较,以及一个在任何模型给出意见之前先检查必答要点、问卷立场、问候语和结尾以及篇幅的规则层。这就是 86% 和 78% 之间的差别,而且几乎全部体现在量表的中段。

你的写作评语有哪些新变化

分数只是你拿回来的一半。写作评语层与评分系统一同重构,其中的每一条内容都锚定在你自己的文字上。以下是具体的变化。

  • 在你自己的作文里找得到的修改建议. 每一条语法、拼写和词汇的修改建议都会引用你应答中的确切原文,这样应用就能在你写下它们的位置直接高亮出来。凡是检查器无法在你的作文里逐字找到的内容,都会在你看到之前被去掉。
  • 一篇以你的答案为基础的范文. 你会得到一篇由你自己的应答改写而成的版本:保留你的想法,覆盖每一个必答要点,篇幅落在题目要求的 150 到 200 个词之间。如果第一次改写没有达到这个篇幅,它会在展示之前再重做一次。
  • 点名指出你漏掉的必答要点. 对于邮件任务,评语会列出题目中你的应答没有覆盖到的要点。漏掉一个要点也会把任务完成度得分压在 8 分或以下,所以数字和评语绝不会自相矛盾。
  • 每个维度一个限制因素. 对四个维度中的每一个,评语都会用具体的措辞点出拖低这项得分的那一件事,或者直白地说明没有什么在拖后腿、是什么在支撑它。判定某个维度没有问题是一个真正的答案,而不是空白。
  • 批评落在该落的地方. 语气不当是任务完成度的问题,用词模糊是词汇的问题,句子拖沓不断是可读性的问题。每一条意见都归入它所属的维度,而不是一股脑堆进总体评价里。
  • 句子层面的改写. 你作文里的具体句子会带着一个改进后的版本回到你面前,并附一句话说明为什么它更好,让你看到变化,而不只是读到变化。
  • 最强和最弱的维度,并排呈现. 评语会告诉你四个维度中哪一个在撑起你的分数、哪一个在拖后腿,让你不必解读四个数字就知道接下来该练什么。

评语中的每一处引用在显示之前都会与你的作文核对。如果检查器找不到这些文字,这一行就会被删除。这就是为什么评语绝不会让你去修改你没有写过的东西。

如何解读你的分数

  1. 4 或 5 分是对的。读一读修改建议;它们引用的都是你自己的原文。然后读遗漏要点和范文,把同一道题再写一遍。
  2. 7 或 8 分是中等,可能稍低一点。看看每个维度的限制因素。那个点出具体问题的维度,就是要下功夫的地方。
  3. 9 分是差一点点。把你的作文和范文逐段对比。差距通常是一个没有展开的理由,或者一处泛泛的用词。
  4. 10 分或以上就是 10 分。你在这种题型上已经准备好了。转向你一直回避的那种题型。
  5. 相信变化胜过相信等级。因为分数是稳定的,同一道题不同尝试之间的变化,就是你写作的变化。

一套用得上这个数字的练习方法

一个准确又稳定的分数,意义在于你可以不再反复怀疑它,而是开始使用它。下面是我们建议的练习方法,围绕本页数字所说明的分数能告诉你什么、不能告诉你什么来设计。

  1. 不做准备,直接写一封邮件和一篇问卷回复。不要先看范文。两篇都提交。这两个分数合在一起就是你的起点;如果两者相差超过一分,较低的那个就是该练的题型。
  2. 先读遗漏要点和限制因素,再读修改建议。修改建议修的是句子;遗漏要点和限制因素修的是分数。一个漏掉的必答要点,比所有逗号加起来都值钱。
  3. 打开范文,把同一篇回复重写一遍。保留你的想法,借用它的结构。再提交一次。因为评分器给同一篇作文的分数相同,两次提交之间的差别完全来自你的重写。
  4. 重写的分数站得住了,再换新题。重写拿到一个 10 分还不算一个等级。两道不同的题各拿一个 10 分才算。
  5. 把 9 分当作差一点点,把 6 分当作真正的 6 分。评分器不会把中等作文往下压。如果它说 6 分,那作文就是单薄,限制因素会告诉你薄在哪里。

常见问题

Prepamigo 的写作分数有多准确? 在 36 篇官方作文上精确到等级为 86%:较弱 75%,中等 100%,顶级 83%。三次运行的结果上下不过一篇作文的差别。

它和我的真实分数一样吗? 没有哪个练习工具能许下这种承诺。我们测量的是评分器在同一篇作文上与核实分数一致的频率。

为什么我的强作文拿了 9 分? 这是评分器在顶端最常见的失误:十二篇顶级作文中有两篇被打成了 9 分。对照范文重写,再打一次分。

它比 ChatGPT 或 Claude 更好吗? 86% 对 GPT 5.6 sol 的 78%,以及 Claude 模型的 61% 和 56%。在中等作文上,100% 对它们当中最好的 75%。

想了解评分器是怎么运作的,可以读一读 深入了解 Prepamigo 写作评分器。想看同一测试在全部六个聊天机器人上的结果,可以读 哪个 AI 打 CELPIP 写作分最准。如果想看英文原文,可以读 阅读英文版指南。或者直接 写一篇应答,亲自看看这些数字。

Prepamigo 的 CELPIP 写作打分准吗?用数字如实回答 | PrepAmigo