产品

Prepamigo 对比 ChatGPT 打分 CELPIP 写作:准确率、限制与费用

2026年9月8日

落在核实等级内的作文占比

36 篇 CELPIP 官方写作应答,三个等级各 12 篇,覆盖两种写作任务。每个 GPT 模型拿到题目和作文后,被用大白话要求按 CELPIP 量表打分。Prepamigo 写作评分系统以正常生产环境配置运行。

86%

Prepamigo 写作评分系统

78%

GPT 5.6 sol

69%

GPT 5.6 luna

58%

GPT-4o mini

Prepamigo 对比主流 AI 聊天机器人套餐

单位为加元。Prepamigo 价格已含税。Claude Max(US$100 起)和 ChatGPT Pro(US$200)按 1.38 的汇率换算为加元,税前价格。准确率是指在 36 篇官方作文上,模型被用大白话要求打分时,得分落在核实等级内的作文占比;单次运行。

Prepamigo
ChatGPT ProGPT 5.6 sol
月费
CA$24.98(含税)
CA$276(税前)
评分次数
无限
有上限
现成题库
练习套题
80 套
练习题量
2,000+ 题
CELPIP 真实格式
准确率
86%
78%
中等作文识别率
100%
75%

ChatGPT 大概是 CELPIP 考生用来检查写作最常见的工具。粘贴邮件,要一个分数,拿到一个数字和一段话。它很快,就在你的手机上,而且对写作来说,中间没有转写这一步碍事。所以我们测试了这个数字。我们把用来衡量我们自己评分系统的那 36 篇 CELPIP 官方写作应答原样交给三个 GPT 模型,每个等级十二篇,并像学生提问那样让它们给作文打分。

先说结论:Prepamigo 写作评分系统有 86% 的时间落在核实等级内。支撑 ChatGPT 付费套餐的模型 GPT 5.6 sol 是 78%。GPT 5.6 luna 做到了 69%,GPT-4o mini 是 58%。八个百分点是实实在在的差距,它来自两个地方:一是量表的中段,Prepamigo 十二篇作文全部打对,GPT 5.6 sol 打对了九篇;二是顶端,GPT 5.6 sol 把四分之一的强作文压在了 9 分。

我们要先说明,GPT 5.6 sol 是我们测试过的最好的通用写作评分模型,在同样这些作文上远远领先于任何 Claude 模型。本文接下来会按等级逐一讲解结果,解释这八个百分点来自哪里,看看双方的评语,并比较认真练习写作时每种选择分别要花多少钱。

简单测试:学生实际会得到什么

86% 对 78%。在 36 篇作文上,这意味着 Prepamigo 比 GPT 5.6 sol 多命中 3 个正确分数,比 GPT 5.6 luna 多命中 6 个,比 GPT-4o mini 多命中 10 个。换句话说,Prepamigo 的打分失误比 GPT 5.6 sol 少 37%,比 luna 少 55%,比 GPT-4o mini 少 67%。

GPT 模型拿到了什么很重要。每个模型都被告知自己是一位经验丰富的 CELPIP 写作考官,拿到与考生所见完全相同的题目,包括邮件任务的必答要点和问卷任务的选项,然后拿到作文。它被要求给出一个 0 到 12 之间的分数。这正是你会输入 ChatGPT 的内容,也比光秃秃的一句“给这篇打个分”更公平,因为模型至少知道题目要求了什么。

Prepamigo 的评分系统收到的是同样的题目和同样的作文,外加它在生产环境中一直具备的东西:该题目每个等级的真实已评分范例作文可供比较,以及一个规则层,用来检查评分员最先检查的那些事项,比如每个必答要点是否都覆盖到了、问卷应答是否真的选了一边、邮件是否有称呼和结尾,以及应答的篇幅是否接近题目的要求。

这八个百分点来自哪里:按等级逐一拆解

弱作文(核实分数 4 或 5)

12 篇官方作文。这是 GPT 模型唯一略微领先的等级。

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

Prepamigo 写作评分系统

在弱作文上,三个 GPT 模型都是 83%,Prepamigo 是 75%。这是 ChatGPT 唯一领先的等级,我们如实报告。Prepamigo 的三次失误全都高了一档,把篇幅短但写得整洁的作文打成了 6 分或 7 分。GPT 5.6 sol 的两次失误都是 6 分。弱作文是聊天机器人最容易应付的一端:短小、泛泛、错误不少的文字,谁看都觉得弱。

中等作文(核实分数 7 或 8)

12 篇官方作文。这是大多数考生所处的等级。

100%

Prepamigo 写作评分系统

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

在中段,Prepamigo 把十二篇作文全部打在了 7 到 8 分区间内。GPT 5.6 sol 打对了九篇,三次失误都是 6 分,低了一档。GPT 5.6 luna 打对了七篇,把三篇压到 6 分,一篇压到 5 分,一篇推到 9 分。GPT-4o mini 打对了八篇,把另外四篇推到了 9 分。

7 分或 8 分是考试中最常见的真实分数,也是决定考生是否达到目标的那个分数。GPT 5.6 sol 会告诉这样的考生中的四分之一,说他们已经掉到了 6 分。Luna 会这样告诉十个里的四个。这两者都不像 Claude 在中段的结果那样是一场灾难,但这正是一个可以据此做计划的练习分数,和一个你不得不反复怀疑的分数之间的区别。

强作文(核实分数 10 及以上)

12 篇官方作文。这里的失误都是 9 分:作文很强,评分者却留了一手。

83%

Prepamigo 写作评分系统

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

在顶级,Prepamigo 识别出十二篇强作文中的十篇,GPT 5.6 sol 九篇,luna 八篇,GPT-4o mini 三篇。除了一次之外,所有失误都是 9 分。GPT-4o mini 给十二篇强作文中的九篇打了 9 分:它根本就不发 10 分。如果你的写作很强,却用 ChatGPT 的免费版来检查,而免费版至今仍把大量流量分配给小模型,那么你几乎每次都会被告知自己是 9 分。

如果你自认为写得很出色的一篇作文从 ChatGPT 那里拿到了 9 分,那它更有可能是一个被压低的 10 分,而不是真正的 9 分。对照范文把它改写一遍,再打一次分;两次尝试都稳定拿到 10 分,那就是 10 分。

聊天机器人为什么会在中段和顶端失手

一篇中等水平的 CELPIP 作文覆盖了题目要求,有条理,同时也很泛泛:理由只是陈述而没有展开,词汇求稳,句子只有一种样子。一篇强作文并非完美无缺;它有一两处小错,展开充分的句子之间夹着一句平淡的话。一个没有已评分样例可供比较的模型只能凭印象判断。GPT 5.6 sol 的印象略显严苛:泛泛的 7 分读起来像 6 分,带一处小错的 10 分读起来像 9 分。Luna 更严苛。GPT-4o mini 则把 9 分当成了天花板。

Prepamigo 的评分系统不是拿作文去对照某种“好文章”的概念。它把作文与同一题目的真实已评分作文作比较,每个等级一篇,全都是带着真实小错的真实应答。一篇泛泛但完整的作文会落在中等样例旁边,因为那才是它最像的。一篇有一个笨拙句子的强作文会落在强样例旁边,因为强样例也有这么一句。在这种比较之上还有一个规则层,负责处理模型不擅长数的那些事情:每个必答要点是否都写到了、问卷应答是否选了一边、邮件是否有称呼和结尾,以及篇幅有多长。漏掉一个必答要点,无论英语如何,任务完成度都会被压在 8 分或以下,因为考试就是这样运作的。

使用流程的差距:你得自己准备什么

对写作来说,ChatGPT 很容易被当作评分员来用,我们不会假装不是这样。粘贴作文,拿到数字,再要一段解释。没有录音,没有转写文本。想要对单篇作文快速获得第二意见,它很方便,而且用 GPT 5.6 sol 的话,还算准确。

你得不到的是题目本身。你要的话,ChatGPT 可以编出一道 CELPIP 风格的题,但它只是在猜真实考试所用的必答要点、问卷选项和字数要求。你得不到必答要点检查,因为它不知道真实考试会列出哪些要点。你得不到一篇以你自己的作文为基础、按正确篇幅改写的范文。而且你粘贴的每一篇作文都会消耗你的消息配额。

在 Prepamigo 上,你从题库里打开一道题,计时器开始运行,你动笔写,提交后大约一分钟,你就会得到四个维度的分数、一个总分、一份你遗漏内容的清单、引用自你原文的修改建议,以及一篇改写后的范文。这个月的第四十篇作文花费的精力和第一篇完全一样。

同一篇作文,同一个分数

在主测试之后,我们又在不同的日子里把全部 36 篇作文再打了两次分。Prepamigo 写作评分系统在三次运行中分别得到 86%、89% 和 86%,同样那十二篇中等作文每次都落在区间内。GPT 5.6 sol 分别得到 78%、83% 和 81%:第二次和第三次运行更好一些,这也提醒我们,聊天机器人的单次回答在两个方向上都带着几个百分点的运气成分。如果你确实要用 ChatGPT 打分,问两次,取较低的那个答案。

评语:解释与证据之别

ChatGPT 解释得很好。问它为什么一篇作文是 6 分,它会用清晰的英语告诉你,还附上建议。问题在于,这段解释是为一个已经选定的数字写的辩护,所以当数字低了一档时,解释就会找出与之匹配的毛病。一个实际上处于 7 分的考生,读到的是整整一页关于那些并不起决定作用的弱点的文字。

Prepamigo 的评语从文本出发。每一条修改建议都会引用你作文里的确切原文,凡是检查器在你的文本中找不到的内容,都会在你看到之前被去掉。漏掉的必答要点会被点名。每个维度都会给出一个限制因素,或者直白地说明没有什么在拖后腿。你还会得到一篇以你自己的应答为基础、按题目要求篇幅改写的范文。下面这一节列出了具体的变化。

你的写作评语有哪些新变化

分数只是你拿回来的一半。写作评语层与评分系统一同重构,其中的每一条内容都锚定在你自己的文字上。以下是具体的变化。

  • 在你自己的作文里找得到的修改建议. 每一条语法、拼写和词汇的修改建议都会引用你应答中的确切原文,这样应用就能在你写下它们的位置直接高亮出来。凡是检查器无法在你的作文里逐字找到的内容,都会在你看到之前被去掉。
  • 一篇以你的答案为基础的范文. 你会得到一篇由你自己的应答改写而成的版本:保留你的想法,覆盖每一个必答要点,篇幅落在题目要求的 150 到 200 个词之间。如果第一次改写没有达到这个篇幅,它会在展示之前再重做一次。
  • 点名指出你漏掉的必答要点. 对于邮件任务,评语会列出题目中你的应答没有覆盖到的要点。漏掉一个要点也会把任务完成度得分压在 8 分或以下,所以数字和评语绝不会自相矛盾。
  • 每个维度一个限制因素. 对四个维度中的每一个,评语都会用具体的措辞点出拖低这项得分的那一件事,或者直白地说明没有什么在拖后腿、是什么在支撑它。判定某个维度没有问题是一个真正的答案,而不是空白。
  • 批评落在该落的地方. 语气不当是任务完成度的问题,用词模糊是词汇的问题,句子拖沓不断是可读性的问题。每一条意见都归入它所属的维度,而不是一股脑堆进总体评价里。
  • 句子层面的改写. 你作文里的具体句子会带着一个改进后的版本回到你面前,并附一句话说明为什么它更好,让你看到变化,而不只是读到变化。
  • 最强和最弱的维度,并排呈现. 评语会告诉你四个维度中哪一个在撑起你的分数、哪一个在拖后腿,让你不必解读四个数字就知道接下来该练什么。

评语中的每一处引用在显示之前都会与你的作文核对。如果检查器找不到这些文字,这一行就会被删除。这就是为什么评语绝不会让你去修改你没有写过的东西。

每天练习要花多少钱

根据 2026 年 9 月公布的信息,ChatGPT Plus 每月 US$20,约合 CA$28,按月计费,在滚动窗口内有消息数量上限;ChatGPT Pro 每月 US$200,税前约合 CA$276,提高了这个上限。免费版把大部分流量分配给较小的模型,而在本次测试中,其中最小的那个模型十二篇强作文只识别出了三篇。这些套餐都不包含题库、计时器、必答要点检查、范文,或一个用真实已评分作文校准过的分数。

Prepamigo 每月 CA$24.98,或年付每月 CA$8.25(全年 CA$98.98),均已含税,并且可以随时取消。每种套餐都包含无限次打分,没有每日、单次或每周上限,以及无限次练习机会,还有完整的题库:80 套完整练习题和超过 2,000 道练习题目,覆盖 Writing、Speaking、Reading 和 Listening 四个部分,均按照 CELPIP General 考试的题型、时长和格式编写。

什么时候 ChatGPT 是更好的工具

  • 对单篇作文快速获得第二意见。GPT 5.6 sol 是一个还不错的评分员,只需十秒钟。如果你已经有了题目,只是想再听一个看法,它没有问题。
  • 把一个句子改写成五种说法。让它为一个笨拙的句子给出替代写法既快,建议也不错。
  • 就一篇作文展开讨论。如果你想弄清楚某个理由为什么不够有力,对话正是合适的形式。Prepamigo 给你的是判断和证据,它不会跟你聊天。
  • 任何与考试无关的事。ChatGPT 是一个通用助手,Prepamigo 不是。

它不应该充当的角色,是唯一一个告诉 7 分或 8 分水平的写作者自己处在什么位置的东西,或是那个告诉强写作者他们只有 9 分的东西。这正是它最常出错的两个地方。

常见问题

ChatGPT 能给我的 CELPIP 写作打分吗? 能,而且比大多数聊天机器人更好:在 36 篇官方应答上,GPT 5.6 sol 有 78% 的时间是对的,luna 是 69%,GPT-4o mini 是 58%,而 Prepamigo 是 86%。

Prepamigo 在写作上比 ChatGPT 更准确吗? 比最好的 GPT 模型高八个百分点。中等作文 100% 对 75%;强作文 83% 对 75%;弱作文 75% 对 83%。

我该用哪个 GPT 模型? GPT 5.6 sol。不要用 GPT-4o mini,它给十二篇强作文中的九篇打了 9 分。

各自的价格是多少? ChatGPT Pro 每月 US$200,税前约合 CA$276;Plus 是每月 US$20,有消息数量上限。Prepamigo 每月 CA$24.98(含税),或年付每月 CA$8.25,打分次数不限,并配有 80 套练习题。

想看与 Claude 的同类对比,可以读 Prepamigo 对比 Claude 打分写作。想了解写作评分系统是怎么运作的,可以读 深入了解 Prepamigo 写作评分系统。如果想看英文原文,可以读 阅读英文版指南。或者直接 写一篇应答,看看自己的分数。

Prepamigo 对比 ChatGPT 打分 CELPIP 写作:准确率、限制与费用 | PrepAmigo