评分

Prepamigo 写作评分引擎正式发布

2026年9月8日

Prepamigo 写作评分引擎对比充当评分者的前沿模型

分数与独立核实分数相符的 CELPIP 写作应答占比。36 篇官方作文,在较弱、中等、顶级三个等级以及两种写作题型之间平均分布。每个模型都拿到题目和作文,并被用大白话要求按 CELPIP 量表打分。

86%

Prepamigo 写作评分引擎Prepamigo

78%

GPT 5.6 solOpenAI

69%

GPT 5.6 lunaOpenAI

61%

GeminiGoogle

61%

Claude Opus 5Anthropic

58%

GPT-4o miniOpenAI

56%

Claude Sonnet 5Anthropic

Prepamigo 对比主流 AI 聊天机器人套餐

单位为加元。Prepamigo 价格已含税。Claude Max(US$100 起)和 ChatGPT Pro(US$200)按 1.38 的汇率换算为加元,税前价格。准确率是指在 36 篇官方作文上,模型被用大白话要求打分时,得分落在核实等级内的作文占比;单次运行。

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
月费
CA$24.98(含税)
CA$138+(税前)
CA$276(税前)
评分次数
无限
有上限
有上限
现成题库
练习套题
80 套
练习题量
2,000+ 题
CELPIP 真实格式
准确率
86%
61%
78%
中等作文识别率
100%
25%
75%

Prepamigo 的写作评分器在 86% 的 CELPIP 官方作文上与核实分数相符,领先于所有被交付同一任务的前沿模型;而在大多数考生所处的中等等级上,它给每一篇作文都打对了。

本页介绍 Prepamigo 写作评分引擎,也就是给 Prepamigo 上每一封邮件和每一篇问卷回复打分的系统。它不是一个被要求打分的通用模型,而是一个专为一件事打造的评分器:把一篇 CELPIP 写作应答放在受过训练的评分员会放的那个等级上,并用写作者自己的话解释这个判断。

结果是一个比任何前沿模型都更准确的评分者,前提是那些模型按学生实际的用法来使用。在 36 篇分数经过独立核实的 CELPIP 官方写作应答上,引擎有 86% 落在了正确等级。用大白话让各模型给同样的作文打分,GPT 5.6 sol 达到 78%。GPT 5.6 luna 达到 69%,Gemini 和 Claude Opus 5 是 61%,GPT-4o mini 是 58%,Claude Sonnet 5 是 56%。

准确率最重要的地方,就是考生真正所处的位置。7 分或 8 分是最常见的真实写作分数,也是决定目标是否达成的那个分数。引擎把全部十二篇中等作文都放进了这个区间。最好的前沿模型放进了九篇;Claude Opus 5 放进了三篇。本页会解释引擎如何打分、它与其他模型相比如何、每个分数附带的评语有哪些新变化,以及不必计数地练习要花多少钱。

对照核实分数的准确率

我们关心的问题很简单:学生提交一篇作文时,屏幕上的分数是否与受过训练的评分员会给的分数一致?为了回答它,我们用了一组 CELPIP 官方写作应答,每一篇都有独立核实的分数,覆盖两种写作题型,并在较弱、中等和顶级三个等级之间平均分布:每个等级十二篇,共 36 篇。引擎用来校准的六篇样例作文不在其中。

每个系统看到的都是同样的题目,包括邮件题的必答要点和问卷题的选项,以及同样的作文。每个前沿模型都被告知它是一位经验丰富的 CELPIP 写作考官,并被要求给出一个 0 到 12 之间的分数。引擎则按生产环境的方式运行。分数落在核实等级内即算正确:较弱作文为 4 或 5 分,中等作文为 7 或 8 分,顶级作文为 10 到 12 分。

37%

比 GPT 5.6 sol 少犯的失误

36 篇中错 5 个分数,对比 8 个。

64%

比 Claude Opus 5 少犯的失误

36 篇中错 5 个分数,对比 14 个。

100%

中等作文的打分正确率

其他模型中表现最好的是 75%;Claude Opus 5 是 25%。

有三点很突出。第一,对最好的前沿模型的领先幅度是八个百分点,在 36 篇作文里相当于多打对三个分数,而且在每次重复运行中都保持住了。第二,对 Claude 模型的领先幅度是 25 到 30 个百分点,并且集中在量表的中段,也就是通用模型会把一篇整洁但泛泛的作文当成强作文的地方。第三,这个对比正是对学生有意义的那种:它衡量的是你把作文粘贴进聊天机器人然后提问时会得到什么,而这几乎就是所有人使用这些模型的方式。

系统全部作文较弱中等顶级
Prepamigo 写作评分引擎86%75%100%83%
GPT 5.6 sol78%83%75%75%
GPT 5.6 luna69%83%58%67%
Gemini61%58%42%83%
Claude Opus 561%67%25%92%
GPT-4o mini58%83%67%25%
Claude Sonnet 556%50%33%83%

落在核实等级内的作文占比,单次运行。每个等级十二篇作文,因此一篇作文在等级视图中约合八个百分点,在整体视图中约合三个百分点。

各个等级下的表现

平均值会掩盖失误出现的位置。在写作上,通用模型的失误集中在两个地方:中段,一篇整洁但泛泛的作文会被当成强作文;顶端,一篇带有一处小瑕疵的强作文会被压到 9 分。

较弱作文 · 核实分数 4 或 5

每个系统 12 篇官方作文。

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

Prepamigo 写作引擎

67%

Claude Opus 5

58%

Gemini

50%

Claude Sonnet 5

中等作文 · 核实分数 7 或 8

每个系统 12 篇官方作文。这是大多数考生所处的等级。

100%

Prepamigo 写作引擎

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

42%

Gemini

33%

Claude Sonnet 5

25%

Claude Opus 5

顶级作文 · 核实分数 10 及以上

每个系统 12 篇官方作文。几乎所有失误都是打成 9 分。

92%

Claude Opus 5

83%

Prepamigo 写作引擎

83%

Gemini

83%

Claude Sonnet 5

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

对于构成考生主体的那些人来说,这才是真正重要的差距。在中等作文上,引擎十二次里对了十二次。最好的前沿模型对了九次;Claude Opus 5 对了三次,并把十二篇中的七篇打成了 9 分或 10 分。

在较弱作文上,GPT 模型是 83%,引擎是 75%。引擎的三次失误全都高了一档,打成了 6 分或 7 分,作文本身篇幅短但很整洁;Claude 模型的失误则朝另一个方向,把内容单薄的作文打成了 3 分。较弱的写作对任何人来说都是量表上容易的一端,这也是聊天机器人唯一能追平或超过引擎的等级。

在中段,引擎以 100% 独占鳌头。GPT 5.6 sol 把十二篇中的三篇压到了 6 分。Claude Opus 5 把十二篇中的七篇推到了 9 分或 10 分。Gemini 推高了五篇。一篇中等作文覆盖了题目要求、结构清楚,同时内容也泛泛;一个没有任何比较对象的模型只能凭印象来读它,而印象因模型而异。引擎则是拿它对照一篇真实的、已评为 7 分的作文来读。

在顶端,Claude Opus 5 是测试中最好的评分者,十二篇顶级作文识别出了十一篇,引擎识别出十篇。Claude 打分慷慨,这在顶级作文上是对的,在其他所有作文上是错的。GPT-4o mini 给十二篇中的九篇打了 9 分:它不会给出 10 分。

一致性与稳定性

一个值得信任的评分者,必须两次给出同样的答案。在首轮运行之后,我们又在不同的日子里把全部 36 篇作文再打了两次分。引擎分别得到 86%、89% 和 86%,同样的十二篇中等作文每次都落在区间内,没有任何一篇作文在不同运行之间移动超过一分。GPT 5.6 sol 在同样的三天里分别得到 78%、83% 和 81%。

引擎运行评分模型时关闭了推理功能,并使用固定的温度参数,这正是数字可以复现的原因。聊天机器人的单次回答在两个方向上都带着几个百分点的运气成分;而一个跨越不同日子都保持稳定的分数,才是你可以据此制定计划的分数。

两种题型,两种失误

CELPIP 写作有两种题型,它们出错的方式不同。邮件题给你一个情境和三四个必须覆盖的要点。问卷题给你两个选项,要求你选一个并为它辩护。一个把两者一视同仁的评分者,在两者上都会出错。

在邮件题上,引擎有 89% 的作文打对了。这里最让考生丢分的不是语法,而是漏掉一个要点、语气不符合收件人,或者缺少开头和结尾。规则层会在评分员给出意见之前逐一检查这几项,而漏掉一个要点就会把任务完成度压在 8 分或以下,无论英语写得多么漂亮。一个被用大白话要求打分的聊天机器人并不知道哪些要点是必答的,除非你把它们粘贴进去,而即便如此,它也很少逐条检查。

在问卷题上,引擎有 83% 的作文打对了。问卷题奖励明确的立场和两个有展开的理由,惩罚模棱两可的回答。引擎会先读立场:一篇始终不表态的回复,在任务完成度上不可能超过中等水平。聊天机器人则倾向于奖励平衡的回答,而这在问卷回复里恰恰是个错误。

一个懂题型的评分者,其意义在于分数反映的是评分员在那道题上会有的反应,而不是对英语水平的笼统印象。一封中等水平的邮件,通常是因为第三个要点写得单薄;一篇中等水平的问卷回复,通常是因为某个理由只是断言而没有展开。引擎会明确告诉你是哪一种。

引擎并非最强的地方

引擎在整体和中段领先。它在两端都不是领先者,与其把这一点藏进平均值里,不如直接说出来更公平。

在较弱作文上,三个 GPT 模型各得 83%,引擎是 75%。引擎的失误全都高了一档,出在那些篇幅短、写得整洁但什么都没有展开的作文上。GPT 模型把泛泛的写作读成弱作文,所以在这些作文上是对的。如果你处于较弱等级,只想确认这一点,GPT 5.6 sol 给出确认的频率会略高一些。但它同时也会在十二次里有三次告诉一个中等水平的写作者,说他是 6 分。

在顶级作文上,Claude Opus 5 得到 92%,引擎是 83%。Claude 读起润色过的文字很慷慨,这在顶级作文上是正确的。同样的慷慨也让十二篇中等作文中的七篇拿到了 9 分或 10 分。如果你已经写到了顶级水平,Claude Opus 5 确认这一点的频率会略高于引擎。如果你还没有,它则是最有可能告诉你已经到了的那个模型。

引擎是测试中唯一在每个等级上都与领先者相差不到十个百分点的评分者,也是唯一在中段达到 100% 的评分者。这正是考生需要的那种特性:不是在某个等级上出色、在另一个等级上出错,而是几乎处处正确,并且在大多数考生所处的地方正确。

引擎如何给一篇应答打分

从按下提交到读到分数之间的那一分钟左右,发生的事情如下。

  1. 规则层先读作文。在任何模型看到它之前,引擎会先统计字数,检查邮件有没有问候语和结尾,检查问卷回复有没有明确选边,并把作文与题目中的必答要点逐一对照。这些检查会变成评分员无法推翻的硬性上限:一篇始终不选边的问卷回复,或者一封读起来像问卷回答的邮件,在任务完成度上不可能超过量表的中段。
  2. 作文与真实的已评分样例作比较。评分员会看到三篇同类题型的真实 CELPIP 应答,一篇在较弱等级,一篇在中等,一篇在顶级,全都保留着各自真实的小瑕疵,然后在四个维度上分别把作文相对于它们定位:内容与连贯性、词汇、可读性、任务完成度。与中等样例相当就是 7 或 8 分;与顶级样例相当就是 10 或 11 分;明显强于顶级样例就是 12 分。
  3. 每一项判断都需要证据。对每个维度,评分员在给出分数之前,必须先引用作文中支撑该分数的语句。在作文里找不到的引用会被丢弃。
  4. 遗漏要点会封顶分数。如果评分员报告某个必答要点缺失,任务完成度分数就会被压在 8 分或以下,这样数字和评语才能一致。
  5. 四个维度合成一个分数。总分是四个维度在应用规则层上限之后的平均值。
  6. 评语基于同一批证据生成。修改建议、一篇篇幅合适的范文、逐条点名的遗漏要点,以及每个维度的限制因素,全都引用自写作者自己的文字。下面的部分列出了具体的变化。

我们也测试过把引擎改成口语评分器所用的双评分员、投票再调和的设计。它对写作没有帮助:官方写作等级在 0 到 12 的量表上比口语等级挨得更近,强迫评分员在样例之间做出非此即彼的选择、没有中间选项,会把中等作文推到 9 分。写作引擎保留了能把中段打对的那套设计。

你的写作评语有哪些新变化

分数只是你拿回来的一半。写作评语层与评分系统一同重构,其中的每一条内容都锚定在你自己的文字上。以下是具体的变化。

  • 在你自己的作文里找得到的修改建议. 每一条语法、拼写和词汇的修改建议都会引用你应答中的确切原文,这样应用就能在你写下它们的位置直接高亮出来。凡是检查器无法在你的作文里逐字找到的内容,都会在你看到之前被去掉。
  • 一篇以你的答案为基础的范文. 你会得到一篇由你自己的应答改写而成的版本:保留你的想法,覆盖每一个必答要点,篇幅落在题目要求的 150 到 200 个词之间。如果第一次改写没有达到这个篇幅,它会在展示之前再重做一次。
  • 点名指出你漏掉的必答要点. 对于邮件任务,评语会列出题目中你的应答没有覆盖到的要点。漏掉一个要点也会把任务完成度得分压在 8 分或以下,所以数字和评语绝不会自相矛盾。
  • 每个维度一个限制因素. 对四个维度中的每一个,评语都会用具体的措辞点出拖低这项得分的那一件事,或者直白地说明没有什么在拖后腿、是什么在支撑它。判定某个维度没有问题是一个真正的答案,而不是空白。
  • 批评落在该落的地方. 语气不当是任务完成度的问题,用词模糊是词汇的问题,句子拖沓不断是可读性的问题。每一条意见都归入它所属的维度,而不是一股脑堆进总体评价里。
  • 句子层面的改写. 你作文里的具体句子会带着一个改进后的版本回到你面前,并附一句话说明为什么它更好,让你看到变化,而不只是读到变化。
  • 最强和最弱的维度,并排呈现. 评语会告诉你四个维度中哪一个在撑起你的分数、哪一个在拖后腿,让你不必解读四个数字就知道接下来该练什么。

评语中的每一处引用在显示之前都会与你的作文核对。如果检查器找不到这些文字,这一行就会被删除。这就是为什么评语绝不会让你去修改你没有写过的东西。

拿到分数后该做什么

一个可以信任的分数会改变你的练习方式。用聊天机器人时,你永远不确定从 8 分到 9 分的变化是你的进步还是模型的波动,所以每个分数都得拿感觉去核对一遍。有了稳定、准确的评分者,分数本身就是反馈。

  • 同一道题写两遍。提交,读一读遗漏要点和每个维度的限制因素,对照范文重写,再提交一次。两次之间相差一分或更多,就是你的写作发生了变化,因为引擎给同一篇作文的分数是相同的。
  • 盯住最弱的维度,而不是总分。总分是四个维度的平均值。两个都拿 8 分的考生可能有完全不同的问题。评语会点名拖你后腿的那个维度,那才是要下功夫的地方。
  • 把 9 分当作差一点点。引擎在顶级作文上的两次失误都是打成了 9 分。引擎给出的 9 分,意味着离 10 分只差一个展开的理由或一个精准的用词。
  • 两种题型交替练。大多数考生只练自己喜欢的那种题。引擎给邮件和问卷回复打分时用的是不同的样例和不同的规则,所以邮件的高分说明不了你的问卷回复水平。

每月 CA$25,无限次练习

准确率只有在你能负担得起每天使用它的情况下才有用。一个可以信任的写作分数,在你写第三十篇作文时最有价值,而不是第三篇,因为到那时它才开始告诉你写法上的某个改变是否真的起了作用。所以引擎的定价,是让你用起来完全不需要计数。

每种 Prepamigo 套餐都包含无限次打分、无限次练习机会,以及完整的题库:80 套完整练习题和超过 2,000 道练习题目,覆盖 Writing、Speaking、Reading 和 Listening 四个部分,均按照 CELPIP General 考试的题型、时长和格式编写。你写完,提交,大约一分钟后就能拿到分数、修改建议和一篇范文。

Prepamigo

CA$25/ 月

按月付费 CA$24.98 · 年付每月 CA$8.25(全年 CA$98.98) · 含税 · 随时可取消

  • 无限次打分,写作和口语都包含在内,没有每日、单次或每周上限。
  • 80 套练习题和 2,000 多道题目,覆盖全部四个部分,按照真实考试格式设计,你永远不需要自己编题目。
  • 写完就提交。评分、修改建议、必答要点检查和范文全部替你完成。
  • 用你自己的话给出评语,每一句引用都对照过你实际写下的内容。

Claude Max,作为对比

US$100/ 月

税前约合 CA$138 · 20 倍档位每月 US$200 · Pro 每月 US$20,限制更严

  • 即便是 Max 也有上限。滚动五小时的使用窗口和每周限额;一旦触及其中任何一个,你就得等待。
  • 没有题库。你需要自带题目,自己判断它们像不像真实考试,还要自己记录已经练过什么。
  • 没有必答要点检查,没有范文。你得到的是一个数字和一段话。
  • 只是简单提问,不是经过校准的评分系统。用大白话测试,Claude Opus 5 命中核实分数的比例是 61%,Claude Sonnet 5 是 56%,而引擎是 86%。

Claude 套餐的价格和使用条款以 claude.com 在 2026 年 9 月公布的信息为准,可能会有变动。CELPIP 是其所有者的注册商标;Prepamigo 是一个独立的练习平台,与考试出题方没有任何隶属、认可或关联关系。Prepamigo 的练习题目均为原创内容,按照公开的考试格式编写。

上线情况

Prepamigo 写作评分引擎现已对所有 Prepamigo 用户、在两种写作题型上上线。没有任何需要开启的设置。每一封邮件和每一篇问卷回复都由它打分,每一个分数都配有从写作者自己的文字中提炼出的评语。

想看正面对比,可以读一读 Prepamigo 对比 Claude 写作打分 Prepamigo 对比 ChatGPT 写作打分。想看口语那一边,可以读 口语 Scoring Engine 2.0。如果想看英文原文,可以读 阅读英文版指南。或者直接 写一篇应答,看引擎实际运行。

Prepamigo 写作评分引擎正式发布 | PrepAmigo