评分

哪个 AI 给 CELPIP 写作打分最准?我们测了七个

2026年9月8日

打在核实等级上的作文占比

36 篇 CELPIP 官方写作应答,每个等级 12 篇,覆盖两种写作题型。每个模型都拿到题目和作文,并被用大白话要求按 CELPIP 量表打分。Prepamigo 的写作评分器以正常生产环境配置运行。

86%

Prepamigo 写作评分器

78%

GPT 5.6 sol

69%

GPT 5.6 luna

61%

Gemini

61%

Claude Opus 5

58%

GPT-4o mini

56%

Claude Sonnet 5

Prepamigo 对比主流 AI 聊天机器人套餐

单位为加元。Prepamigo 价格已含税。Claude Max(US$100 起)和 ChatGPT Pro(US$200)按 1.38 的汇率换算为加元,税前价格。准确率是指在 36 篇官方作文上,模型被用大白话要求打分时,得分落在核实等级内的作文占比;单次运行。

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
月费
CA$24.98(含税)
CA$138+(税前)
CA$276(税前)
评分次数
无限
有上限
有上限
现成题库
练习套题
80 套
练习题量
2,000+ 题
CELPIP 真实格式
准确率
86%
61%
78%
中等作文识别率
100%
25%
75%

很多 CELPIP 考生都用 AI 聊天机器人检查自己的写作。把邮件粘贴进去,要一个分数,读一段评语。写作这么做很容易:不用录音,不用转写。没人告诉你的是,那个数字多久才对一次,该信哪个模型,以及每个模型各会犯什么错。我们想知道答案,所以把同样的 36 篇分数已核实的官方作文交给了六个聊天机器人和我们自己的评分器,然后数了数。

一句话版本:GPT 5.6 sol 是给 CELPIP 写作打分最准的聊天机器人,为 78%;Claude 模型最不准,为 61% 和 56%,因为它们会抬高中等作文;而一个专门打造的评分器,也就是 Prepamigo 的,在同样的作文上达到 86%,并把每一篇中等作文都打对了。我们要先说明,Prepamigo 是我们自己的产品。凡是某个聊天机器人在某个等级上胜过我们的地方,我们都会如实说出来;有两个做到了。

排行榜

上面的图表里能看出三个梯队。Prepamigo 以 86% 独占一档。GPT 5.6 sol 的 78% 和 GPT 5.6 luna 的 69% 构成第二梯队:能用,但有已知的习惯。其余的都在 60% 上下,对于一个三区间的量表来说,这比有根据的猜测好不了多少。

这个格局和口语不同,口语上 Claude 模型表现好,GPT 模型表现差。写作上正好反过来。GPT 模型略显严格:它们会把一篇泛泛的 7 分压到 6 分,把一篇带有小瑕疵的强作文压在 9 分。Claude 模型则慷慨:它们会把一篇泛泛的 7 分推到 9 或 10 分,把内容单薄的较弱作文打成 3 分。Gemini 在中段的表现和 Claude 类似。GPT-4o mini 把 9 分当成天花板。

各个等级的结果

较弱作文(核实分数 4 或 5)

每个系统 12 篇官方作文。

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

Prepamigo 写作评分器

67%

Claude Opus 5

58%

Gemini

50%

Claude Sonnet 5

较弱作文是量表上容易的一端,三个 GPT 模型并列 83%,领先于 75% 的 Prepamigo。Prepamigo 的三次失误全都高了一档,打成了 6 或 7 分,出在篇幅短但整洁的作文上。Claude 模型的失误方向相反:Sonnet 5 把十二篇较弱作文中的四篇打成了 3 分,低了一个等级;Opus 5 把其中两篇打成了 3 分。一篇内容单薄但仍然完成了任务的作文是 4 分,不是 3 分,而一个手里没有 4 分样例的模型分不清这两者的区别。

中等作文(核实分数 7 或 8)

每个系统 12 篇官方作文。这是大多数考生所处的等级。

100%

Prepamigo 写作评分器

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

42%

Gemini

33%

Claude Sonnet 5

25%

Claude Opus 5

中等区间拉开了差距。Prepamigo 十二篇全对。GPT 5.6 sol 对了九篇,把三篇压到了 6 分。GPT-4o mini 对了八篇,把四篇推到了 9 分。Luna 对了七篇,大多是往下压。Gemini 对了五篇,把六篇推到了 9 或 10 分。Claude Sonnet 5 对了四篇,失误分散在 6 分和 9 分之间。Claude Opus 5 对了三篇,给十二篇中的七篇打了 9 或 10 分。

如果你是 7 分或 8 分水平的写作者,而大多数考生都是,那这张图就是该记住的那张。问 Claude Opus 5,超过一半的时候它会告诉你已经大功告成。问 Gemini,一半的时候它会说同样的话。问 GPT 5.6 sol,四次里有一次它会告诉你已经滑到了 6 分。

顶级作文(核实分数 10 及以上)

每个系统 12 篇官方作文。几乎所有失误都是打成 9 分。

92%

Claude Opus 5

83%

Prepamigo 写作评分器

83%

Gemini

83%

Claude Sonnet 5

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

在顶端,Claude Opus 5 是测试中最好的评分者,十二篇顶级作文识别出了十一篇;它给其中五篇打了 11 分。Prepamigo、Gemini 和 Sonnet 5 各识别出十篇。GPT 5.6 sol 识别出九篇,luna 识别出八篇,其余的都压在 9 分。GPT-4o mini 识别出三篇,给九篇打了 9 分:它不发 10 分。Claude 的慷慨在这里是对的,在其他所有地方都是错的;GPT 模型的严格在这里是错的,在其他地方大致是对的。

无论你用哪个聊天机器人,一篇你自认为很强的作文拿到 9 分,更可能是被压下来的 10 分,而不是真正的 9 分,除非它来自 Claude 模型,那样的话 9 分更可能是被抬上去的 7 或 8 分。失误的方向取决于模型。

为什么这些模型对中段的看法不一致

一篇中等水平的 CELPIP 作文有明确的特征:它覆盖了题目要求,结构清楚,几乎没有妨碍理解的错误,同时内容泛泛,理由只是断言而没有展开,用词求稳而不求精准。受过训练的评分员见过成百上千篇这样的作文,知道它们该落在哪里。通用模型看到的则是一篇整洁、有条理、大体正确的文字,只能凭印象来决定。Claude 的印象是整洁就等于强。GPT 的印象是泛泛就等于弱。对于一篇 7 分作文,两者都错了,只是方向相反。

Prepamigo 的评分器不凭印象判断。它把作文与同类题型在每个等级上的真实已评分应答作比较,那些全是带着真实小瑕疵的真实作文,然后在四个维度中的每一个上,把它放到最相似的那一篇旁边。一篇干净但泛泛的作文会落在中等样例旁边,因为它就是那样的作文。在这层比较之上还有一个规则层,专门处理模型不擅长计数的事情:每个必答要点是否都覆盖到了,问卷回复有没有选边,邮件有没有问候语和结尾,以及篇幅有多长。漏掉一个必答要点,无论英语写得如何,任务完成度都会被压在 8 分或以下,因为考试就是这么运作的。

我们也试过给写作评分器套用口语评分器所用的双评分员、投票再调和的设计。结果让写作变得更差,因为官方写作等级在 0 到 12 的量表上只相隔两分,强迫在样例之间做出选择会把中等作文推到 9 分。写作保留了能把中段打对的那套设计。

为什么排名和口语正好相反

如果你读过我们的 口语对比,写作排行榜看起来会像是倒过来的。在口语转写文本上,Claude Opus 5 是最好的聊天机器人,为 62%,而 GPT 5.6 sol 是大模型中最差的,为 35%。在写作上,GPT 5.6 sol 以 78% 领先,Claude 模型垫底。

原因在于每个模型对什么东西慷慨。一段 CELPIP 口语转写文本是写下来的口头英语:有断句、有重复、有自我纠正。GPT 把这些读成破碎的英语并严厉打分,这在转写文本上是错的;Claude 则能透过这些看到想法。一篇 CELPIP 作文正好相反:它经过修改,结构清楚,表面整洁,而内里常常泛泛。Claude 把整洁读成实力,抬高了中段;GPT 把泛泛的内容读成弱点,大致是对的,或者低了一分。

实际的教训是,CELPIP 没有唯一最好的聊天机器人。给你口语打分打得好的那个模型,恰恰会在写作上“放水”,反之亦然。一个专门打造的评分器绕开了这个问题,办法是针对每种题型都与合适类型的已评分样例作比较。Prepamigo 的口语引擎和写作引擎是设计不同的两套独立系统,因为这两种任务出错的方式不一样。

跟着数字一起来的那段话

每个聊天机器人都会在分数旁边附上一段评语,而这段话通常比那个数字更自信,超出了它应有的程度。在照着它行动之前,有三件事要核对。

  • 它引用了你的原文吗?一条不指向你确切用词的修改建议,是一条通用规则,而不是针对你这篇作文的评语。大多数聊天机器人的建议都属于适用于任何作文的那种:变换句式,用词更精准,展开你的理由。没错,但没法照着做。
  • 它点出了缺失的要点吗?如果你粘贴了题目,一个好的回复会告诉你哪个必答要点没有覆盖到。如果你没粘贴,聊天机器人根本无从得知,却照样会夸你覆盖得全面。
  • 批评和分数对得上吗?聊天机器人的评语常常列出三四个问题,然后给出 10 分,或者把作文夸一遍,然后给出 6 分。当文字和数字互相矛盾时,两者都不可靠。

Prepamigo 的评语是反过来构建的:评分器必须先引用支撑每个维度分数的语句,然后才能给出分数,而在你作文里找不到的引用会被丢弃。遗漏要点会逐条点名,一个遗漏要点会封顶任务完成度分数,所以文字和数字不可能互相矛盾。下面的部分列出了它包含的内容。

各模型点评

  • GPT 5.6 sol。写作上最好的聊天机器人,为 78%,如果你要用一个,就用它。略显严格:三篇中等作文被压到 6 分,三篇顶级作文被压在 9 分。在较弱作文上它比 Prepamigo 更好,83% 对 75%。
  • GPT 5.6 luna。69%。形态和 sol 相同,但在中段更严格,十二篇只对了七篇。在较弱作文上表现不错。
  • Gemini。61%。在两端还可以,在中段较差,为 42%,把十二篇中的六篇推到了 9 或 10 分。
  • Claude Opus 5。整体 61%,但在顶级作文上是测试中最好的评分者,为 92%。在中段它是最差的,为 25%,给十二篇中的七篇打了 9 或 10 分。如果你的写作已经很强,Opus 5 会确认这一点;如果只是中等,Opus 5 会告诉你它很强。
  • GPT-4o mini。58%。把 9 分当作量表的顶端:十二篇顶级作文中有九篇被打成了 9 分。如果你的水平接近 10 分,不要用它给写作打分。
  • Claude Sonnet 5。56%,最不准确的一个。把四篇较弱作文打成了 3 分,在中等区间的失误分散在 6 分和 9 分之间。

如果你无论如何都要用聊天机器人

  1. 用 GPT 5.6 sol。只要作文没到顶级,就别用 Claude 模型;只要作文超过较弱等级,就别用小模型。
  2. 把整道题粘贴进去。邮件题的必答要点和问卷题的选项会改变分数。一个不知道要点的模型,没法告诉你漏了哪一个。
  3. 让它先检查要点。要求它对每个必答要点逐一回答是或否,然后再给分数。这就是规则层,只不过是手动完成的。
  4. 问两次,取较低的答案。GPT 5.6 sol 在同样的作文上三次运行分别得到 78%、83% 和 81%;单次回答带着几个百分点的运气成分。
  5. 对 9 分和 6 分保持怀疑。来自 GPT 模型的 9 分常常是被压下来的 10 分,6 分常常是被压下来的 7 分。来自 Claude 模型的 9 分常常是被抬上去的 7 分。

你自己无法提供的那一项输入,是同一题型在每个等级上经过核实的已评分作文,也就是专门打造的评分器所比较的对象。这一点,再加上必答要点检查,就是 78% 和 86% 之间的差别。

你的写作评语有哪些新变化

分数只是你拿回来的一半。写作评语层与评分系统一同重构,其中的每一条内容都锚定在你自己的文字上。以下是具体的变化。

  • 在你自己的作文里找得到的修改建议. 每一条语法、拼写和词汇的修改建议都会引用你应答中的确切原文,这样应用就能在你写下它们的位置直接高亮出来。凡是检查器无法在你的作文里逐字找到的内容,都会在你看到之前被去掉。
  • 一篇以你的答案为基础的范文. 你会得到一篇由你自己的应答改写而成的版本:保留你的想法,覆盖每一个必答要点,篇幅落在题目要求的 150 到 200 个词之间。如果第一次改写没有达到这个篇幅,它会在展示之前再重做一次。
  • 点名指出你漏掉的必答要点. 对于邮件任务,评语会列出题目中你的应答没有覆盖到的要点。漏掉一个要点也会把任务完成度得分压在 8 分或以下,所以数字和评语绝不会自相矛盾。
  • 每个维度一个限制因素. 对四个维度中的每一个,评语都会用具体的措辞点出拖低这项得分的那一件事,或者直白地说明没有什么在拖后腿、是什么在支撑它。判定某个维度没有问题是一个真正的答案,而不是空白。
  • 批评落在该落的地方. 语气不当是任务完成度的问题,用词模糊是词汇的问题,句子拖沓不断是可读性的问题。每一条意见都归入它所属的维度,而不是一股脑堆进总体评价里。
  • 句子层面的改写. 你作文里的具体句子会带着一个改进后的版本回到你面前,并附一句话说明为什么它更好,让你看到变化,而不只是读到变化。
  • 最强和最弱的维度,并排呈现. 评语会告诉你四个维度中哪一个在撑起你的分数、哪一个在拖后腿,让你不必解读四个数字就知道接下来该练什么。

评语中的每一处引用在显示之前都会与你的作文核对。如果检查器找不到这些文字,这一行就会被删除。这就是为什么评语绝不会让你去修改你没有写过的东西。

常见问题

哪个 AI 给 CELPIP 写作打分最准? 在聊天机器人当中,GPT 5.6 sol 为 78%,其后是 luna 69%,Gemini 和 Claude Opus 5 61%,GPT-4o mini 58%,Claude Sonnet 5 56%。Prepamigo 的写作评分器在同样的作文上达到 86%。

写作用 ChatGPT 还是 Claude? 明显是 ChatGPT:78% 对 61% 和 56%。Claude 模型会把中等作文抬到 9 或 10 分。在顶级作文上,Opus 5 是所有模型中最好的。

为什么它们给我普通的作文打 9 分? 对一个没有任何比较对象的模型来说,整洁有条理读起来就像强作文。Prepamigo 则与同一题型的真实已评分样例作比较。

怎样从聊天机器人那里得到更准的分数? 用 GPT 5.6 sol,粘贴完整的题目,让它先逐一检查每个必答要点,问两次,并对 9 分和 6 分保持怀疑。

想看两场正面对比,可以读 Prepamigo 对比 Claude 写作打分 Prepamigo 对比 ChatGPT 写作打分。想了解评分器是怎么运作的,可以读 深入了解 Prepamigo 写作评分器。如果想看英文原文,可以读 阅读英文版指南。或者直接 写一篇应答,跳过猜测。

哪个 AI 给 CELPIP 写作打分最准?我们测了七个 | PrepAmigo