Sản phẩm

Prepamigo so với Claude cho CELPIP Writing: Công cụ nào cho bạn điểm số đúng?

8 tháng 9, 2026

Tỷ lệ bài viết được chấm đúng mức điểm đã xác minh

36 bài viết CELPIP chính thức, mỗi mức 12 bài trong ba mức điểm, trải đều cả hai dạng bài Writing. Claude được cung cấp đề bài và bài viết, rồi được yêu cầu, bằng lời đơn giản, chấm điểm theo thang CELPIP. Hệ thống chấm Writing của Prepamigo chạy ở cấu hình vận hành bình thường.

86%

Hệ thống chấm Writing của Prepamigo

61%

Claude Opus 5

56%

Claude Sonnet 5

Prepamigo so với các gói chatbot phổ biến nhất

Đơn vị: đô la Canada. Giá của Prepamigo đã bao gồm thuế. Claude Max (từ US$100) và ChatGPT Pro (US$200) được quy đổi theo tỷ giá 1.38, chưa gồm thuế. Độ chính xác là tỷ lệ trong 36 bài viết chính thức được chấm đúng mức điểm đã xác minh khi mô hình được nêu tên được yêu cầu, bằng lời đơn giản, chấm điểm bài viết đó; một lần chạy.

Prepamigo
Claude MaxOpus 5
Giá mỗi tháng
CA$24.98 (đã gồm thuế)
CA$138+ (chưa gồm thuế)
Chấm điểm
Không giới hạn
Có giới hạn
Ngân hàng câu hỏi có sẵn
Không
Bộ đề luyện tập
80
Không có
Bài luyện tập
2,000+
Không có
Đúng định dạng CELPIP
Không
Độ chính xác
86%
61%
Bài viết mức giữa
100%
25%

Writing là kỹ năng mà một chatbot trông thuyết phục nhất trong vai trò người chấm. Không có bản ghi âm cần chép lời, không phải lo về giọng vùng miền, chỉ có văn bản đi vào và một con số đi ra, kèm một đoạn giải thích đầy tự tin. Vì vậy chúng tôi đã kiểm tra con số đó. Chúng tôi đưa cho Claude cùng 36 bài viết CELPIP chính thức mà hệ thống chấm của chính chúng tôi được đo lường trên đó, mỗi mức mười hai bài, và yêu cầu nó chấm điểm theo đúng cách một học viên sẽ hỏi.

Câu trả lời ngắn: hệ thống chấm Writing của Prepamigo cho ra đúng mức điểm đã xác minh 86% số lần. Claude Opus 5 đạt 61% và Claude Sonnet 5 đạt 56%. Khoảng cách này không rải đều. Với các bài viết yếu và bài viết mạnh, Claude làm khá tốt, và ở mức cao nhất Opus 5 thực sự còn tốt hơn chúng tôi. Với các bài viết mức giữa, những bài 7 và 8 điểm mà hầu hết thí sinh thực sự viết, Opus 5 chỉ đúng một trong bốn lần và Sonnet 5 đúng một trong ba lần. Prepamigo đúng cả mười hai bài.

Phần còn lại của bài viết này sẽ đi qua các kết quả đó theo từng mức điểm, giải thích vì sao một mô hình đa dụng lại để mất phần giữa của thang điểm, xem xét phần đánh giá của mỗi bên đáng giá đến đâu, và so sánh chi phí để luyện Writing một cách nghiêm túc với mỗi lựa chọn. Chúng tôi đã cố gắng công bằng với Claude xuyên suốt, kể cả ở chỗ duy nhất nó vượt qua chúng tôi.

Bài kiểm tra đơn giản: một học viên thực sự nhận được gì

Tám mươi sáu phần trăm so với sáu mươi mốt và năm mươi sáu. Trên 36 bài viết, đó là nhiều hơn chín điểm số chấm đúng so với Opus 5 và nhiều hơn mười một so với Sonnet 5. Nói cách khác, Prepamigo mắc ít hơn 64% lỗi chấm điểm so với Opus 5 và ít hơn 69% so với Sonnet 5 trên cùng các bài viết.

Claude được cung cấp những gì là điều quan trọng, nên đây là chi tiết. Mỗi mô hình được cho biết nó là một giám khảo CELPIP Writing giàu kinh nghiệm, được đưa đề bài đúng như thí sinh nhìn thấy, bao gồm các điểm bắt buộc của bài email và các lựa chọn của bài khảo sát, và được đưa bài viết. Nó được yêu cầu cho một điểm số từ 0 đến 12. Đó là toàn bộ yêu cầu. Đó là những gì bạn sẽ gõ vào một cửa sổ chat, và đây là một bài kiểm tra công bằng hơn một dòng “chấm bài này” vì ít nhất mô hình biết đề bài yêu cầu gì.

Hệ thống chấm của Prepamigo nhận được cùng đề bài và cùng bài viết. Nó cũng có những gì nó luôn có khi vận hành: các bài mẫu thực tế đã được chấm cho đề bài đó ở từng mức điểm để đối chiếu, và một lớp quy tắc kiểm tra những điều mà một người chấm kiểm tra đầu tiên, chẳng hạn mọi điểm bắt buộc có đủ không, bài khảo sát có thực sự chọn một phía không, email có lời chào và lời kết không, và bài viết dài bao nhiêu.

Khoảng cách mở rộng ở đâu: xét theo từng mức điểm

Một con số tổng che giấu nơi các lỗi rơi vào, và với Writing các lỗi rơi vào một chỗ. Đây là cùng các kết quả được tách theo mức điểm đã xác minh: bài yếu được chấm 4 hoặc 5, bài mức giữa được chấm 7 hoặc 8, và bài mạnh được chấm 10 trở lên.

Bài viết yếu (điểm đã xác minh 4 hoặc 5)

12 bài viết chính thức. Các lần chấm sai của Claude ở đây chủ yếu là điểm 3, thấp hơn một mức.

75%

Hệ thống chấm Writing của Prepamigo

67%

Claude Opus 5

50%

Claude Sonnet 5

Với các bài viết yếu, Prepamigo đạt 75%, Opus 5 đạt 67%, Sonnet 5 đạt 50%. Ba lần chấm sai của Prepamigo đều cao hơn một nấc, lên 6 hoặc 7, trên những bài ngắn nhưng gọn gàng. Các lần chấm sai của Claude đi theo chiều ngược lại: Sonnet 5 chấm bốn trong mười hai bài yếu thành 3 điểm, và Opus 5 chấm hai bài thành 3 điểm. Điểm 3 trên thang này là một bài gần như không bám vào đề bài. Những bài này có bám vào đề; chúng chỉ sơ sài. Claude, không có ví dụ nào cho thấy một bài 4 điểm trông như thế nào, đọc sơ sài thành trượt.

Bài viết mức giữa (điểm đã xác minh 7 hoặc 8)

12 bài viết chính thức. Đây là mức mà hầu hết thí sinh đang ở, và là mức mà Claude thất bại.

100%

Hệ thống chấm Writing của Prepamigo

33%

Claude Sonnet 5

25%

Claude Opus 5

Phần giữa là toàn bộ câu chuyện. Prepamigo chấm cả mười hai bài viết mức giữa nằm trong khoảng 7 đến 8. Opus 5 đúng ba bài; Sonnet 5 đúng bốn bài. Các lần chấm sai của Opus 5 hầu như đều lệch lên: nó cho 9 điểm cho sáu trong mười hai bài và 10 điểm cho một bài. Sonnet 5 lệch cả hai chiều, với bốn bài bị đẩy xuống 6 và bốn bài bị đẩy lên 9 hoặc 10.

Hãy nghĩ xem điều đó có ý nghĩa gì với thí sinh đã viết một trong những bài đó. Điểm 7 hoặc 8 là điểm thật phổ biến nhất trong kỳ thi, và đó là điểm số quyết định bạn đã đạt mục tiêu nhập cư hay chưa. Hỏi Opus 5, và hơn một nửa số lần nó sẽ bảo bạn rằng bạn là 9 hoặc 10, sẵn sàng ngừng luyện tập. Bạn chưa. Hỏi Sonnet 5, và một trong ba lần nó sẽ bảo bạn rằng bạn đã tụt xuống 6. Bạn không hề. Không câu trả lời nào giúp bạn quyết định nên làm gì tiếp theo.

Bài viết mạnh (điểm đã xác minh 10 trở lên)

12 bài viết chính thức. Mức duy nhất mà Claude Opus 5 vượt qua Prepamigo.

92%

Claude Opus 5

83%

Hệ thống chấm Writing của Prepamigo

83%

Claude Sonnet 5

Ở mức cao, Opus 5 là người chấm tốt nhất trong bài kiểm tra này: nhận đúng mười một trong mười hai bài mạnh. Prepamigo và Sonnet 5 mỗi bên nhận đúng mười bài. Hai lần chấm sai của Prepamigo đều là 9 điểm, thấp hơn một nấc; của Sonnet 5 là một điểm 9 và một điểm 7. Chúng tôi báo cáo điều này vì nó đúng, và vì nó giải thích toàn bộ xu hướng: Claude hào phóng. Nó cho điểm 9, 10 và 11 khá thoải mái, điều tình cờ đúng với các bài mạnh và sai với mọi bài còn lại.

Nếu bạn dùng Claude để chấm bài viết và nó cho bạn 9 điểm, hãy coi đó là điểm mức giữa cho đến khi có điều gì khác xác nhận. Trong bài kiểm tra của chúng tôi, một bài viết được Opus 5 chấm 9 điểm có nhiều khả năng là bài đã xác minh ở mức 7 hoặc 8 hơn là ở mức 9 hoặc 10.

Vì sao một chatbot để mất phần giữa của thang điểm

Một bài viết CELPIP mức giữa là một thứ rất cụ thể. Nó bao quát đề bài, có bố cục, có ít lỗi cản trở việc hiểu, và nó cũng chung chung: các lý do được nêu ra chứ không được triển khai, từ vựng an toàn, các câu đều cùng một khuôn. Một người chấm đã xem hàng trăm bài như vậy biết chính xác nó nằm ở đâu. Một mô hình đa dụng chưa từng xem hàng trăm bài như vậy được dán nhãn 7 điểm. Nó chỉ thấy một bài viết sạch sẽ, có bố cục, gần như đúng hết, và nó với tới một con số cao.

Đó là toàn bộ sự khác biệt. Hệ thống chấm của Prepamigo không đánh giá một bài viết dựa trên một hình dung về bài viết hay. Nó đánh giá bài viết đó so với các bài thực tế đã được chấm cho cùng đề bài: một bài ở mức yếu, một bài ở mức giữa, một bài ở mức cao, tất cả đều là bài thật với những sai sót thật. Một bài sạch sẽ nhưng chung chung sẽ nằm cạnh bài mẫu mức giữa vì đó là thứ nó giống nhất. Một bài sơ sài sẽ nằm cạnh bài mẫu mức yếu thay vì thấp hơn, vì bài mẫu mức yếu cũng sơ sài và vẫn là 4 điểm.

Bên trên phép so sánh đó là một lớp quy tắc xử lý những điều mà một mô hình đếm rất kém. Email có bao quát cả ba điểm bắt buộc không, hay chỉ hai? Bài khảo sát có thực sự chọn một phương án không, hay lấp lửng giữa các phương án? Có lời chào và lời kết không? Bài viết dài 180 từ hay 60 từ? Một điểm bắt buộc bị bỏ sót sẽ giữ điểm hoàn thành nhiệm vụ ở mức 8 trở xuống bất kể tiếng Anh tốt đến đâu, vì kỳ thi vận hành như vậy. Claude, khi được hỏi đơn giản, không có sàn hay trần nào như thế; nó quyết định mọi thứ bằng ấn tượng.

Chúng tôi đã kiểm tra xem việc nói cho Claude về các mức điểm có khắc phục được điều này không. Tự nó thì không. Đưa cho mô hình một bảng tiêu chí tạo ra cùng một độ lệch. Điều thực sự làm thay đổi con số là đưa cho nó các bài mẫu thực tế đã được chấm và một lớp quy tắc, tức là một cách nói khác của: xây dựng một hệ thống chấm điểm.

Khoảng cách về quy trình: bạn phải tự mang theo những gì

Writing là kỹ năng mà Claude dễ dùng nhất trong vai trò người chấm, và cần thành thật về điều đó. Bạn dán bài viết, bạn có điểm trong vài giây, và nếu bạn muốn nó tự giải thích, nó sẽ giải thích, rất dài. Không có bước chép lời, không có âm thanh, không cần thiết lập gì. Để có một ý kiến thứ hai nhanh chóng, nó thực sự tiện lợi.

Thứ bạn không có là đề bài. Claude không có ngân hàng đề email và khảo sát theo kiểu CELPIP với đúng các điểm bắt buộc, các lựa chọn và số từ, nên hoặc bạn tự viết đề và hy vọng nó giống bài thi, hoặc bạn luyện trên bất cứ thứ gì bạn tìm được. Bạn không có phần kiểm tra điểm bắt buộc, vì Claude không biết bài thi thật sẽ liệt kê những điểm nào. Bạn không có bài mẫu được viết lại từ chính bài của bạn ở đúng độ dài. Và bạn không có một con số đã được hiệu chỉnh dựa trên các bài thực tế đã được chấm, đó là lý do phần giữa của thang điểm bị sai.

Trên Prepamigo, bạn mở một đề từ ngân hàng, bộ đếm giờ chạy, bạn viết, và khoảng một phút sau khi nộp, bạn có bốn điểm tiêu chí, một điểm tổng, danh sách bất cứ điều gì bạn bỏ sót, các chỗ sửa được trích dẫn từ chính văn bản của bạn, và một bài mẫu được viết lại. Bài viết thứ bốn mươi trong tháng tốn công sức đúng bằng bài đầu tiên.

Cùng một bài viết, cùng một điểm số

Một điểm số bạn không thể tái lập không phải là một phép đo. Nếu cùng một bài viết nhận 8 điểm hôm nay và 10 điểm ngày mai, bạn chẳng học được gì về khả năng viết của mình. Vì vậy sau lần chạy chính, chúng tôi chấm cả 36 bài viết thêm hai lần nữa vào những ngày khác nhau. Hệ thống chấm Writing của Prepamigo đạt 86%, 89% và 86% qua ba lần chạy, với cùng mười hai bài viết mức giữa nằm trong khoảng đúng ở mọi lần.

Các lần chạy của Claude cũng dịch chuyển, nhưng hình dạng của các lỗi thì không: ở mọi lần chạy, hầu hết các bài viết mức giữa được Opus 5 trả về là 9 điểm, và các bài yếu tiếp tục nhận điểm 3 từ Sonnet 5. Sự nhất quán đó chính là phát hiện hữu ích. Vấn đề không phải là Claude nhiễu. Vấn đề là Claude tự tin lệch chuẩn theo cùng một hướng ở mọi lần, điều khó nhận ra hơn.

Phần đánh giá: một lời giải thích hay cho một con số sai

Claude viết nhận xét rất xuất sắc. Rõ ràng, kiên nhẫn và cụ thể, và nếu bạn hỏi vì sao một bài viết là 9 điểm, nó sẽ tạo ra một đoạn văn thuyết phục. Rắc rối là đoạn văn đó được viết để biện minh cho một con số nó đã chọn sẵn, và khi con số sai thì lời giải thích cũng sai theo. Một bài viết thực chất là 7 điểm được khen vì những phẩm chất nó không có, và thí sinh ra về với cảm giác yên tâm.

Phần đánh giá của Prepamigo hoạt động từ đầu bên kia. Mỗi chỗ sửa đều trích dẫn đúng những từ trong bài của bạn, và bất cứ điều gì bộ kiểm tra không tìm thấy trong văn bản của bạn sẽ bị loại bỏ trước khi bạn nhìn thấy. Một điểm bắt buộc bị bỏ sót được nêu đích danh. Mỗi tiêu chí nhận một yếu tố kìm hãm, hoặc một lời khẳng định rõ ràng rằng không có gì đang kéo nó xuống. Và bạn nhận được một bài mẫu được viết lại từ chính câu trả lời của bạn ở độ dài đề bài yêu cầu, để bạn nhìn thấy khoảng cách thay vì đọc về nó. Phần dưới đây liệt kê những gì đã thay đổi trong lớp đánh giá.

Điều gì mới trong phần đánh giá bài viết của bạn

Điểm số chỉ là một nửa những gì bạn nhận lại. Lớp đánh giá bài viết đã được xây dựng lại cùng với hệ thống chấm điểm, và mọi thứ trong đó đều bám sát vào chính văn bản của bạn. Đây là những điều đã thay đổi.

  • Những chỗ sửa bạn có thể tìm thấy ngay trong bài viết của mình. Mỗi chỗ sửa về ngữ pháp, chính tả và từ vựng đều trích dẫn đúng những từ trong bài của bạn, để ứng dụng có thể tô sáng chúng ngay tại chỗ bạn đã viết. Bất cứ điều gì bộ kiểm tra không tìm thấy nguyên văn trong bài viết của bạn sẽ bị loại bỏ trước khi bạn nhìn thấy.
  • Một bài mẫu, được xây dựng từ chính bài của bạn. Bạn nhận được một phiên bản viết lại từ chính câu trả lời của mình, giữ nguyên các ý của bạn, đề cập đầy đủ mọi điểm bắt buộc và đạt đúng độ dài 150 đến 200 từ mà đề bài yêu cầu. Nếu bản viết lại đầu tiên chưa đạt độ dài đó, nó sẽ được làm lại một lần trước khi hiển thị.
  • Điểm bắt buộc bạn đã bỏ sót, được nêu đích danh. Với bài viết email, phần đánh giá liệt kê những gạch đầu dòng trong đề bài mà câu trả lời của bạn chưa đề cập. Một điểm bị bỏ sót cũng giữ điểm hoàn thành nhiệm vụ ở mức 8 trở xuống, nên con số và phần đánh giá không bao giờ mâu thuẫn với nhau.
  • Một yếu tố kìm hãm cho mỗi tiêu chí. Với mỗi tiêu chí trong bốn tiêu chí, phần đánh giá nêu đúng một điều đang kéo điểm đó xuống, bằng lời cụ thể, hoặc nói thẳng rằng không có gì kìm hãm và điều gì đang nâng đỡ điểm đó. Kết luận rằng một tiêu chí không có vấn đề là một câu trả lời thực sự, không phải một khoảng trống.
  • Lời chê đặt đúng chỗ. Giọng văn yếu là vấn đề của hoàn thành nhiệm vụ, lựa chọn từ mơ hồ là vấn đề của từ vựng, câu quá dài lê thê là vấn đề của tính dễ đọc. Mỗi nhận xét được xếp vào đúng tiêu chí sở hữu nó thay vì bị gộp chung vào phần tóm tắt tổng thể.
  • Viết lại ở cấp độ từng câu. Những câu cụ thể trong bài viết của bạn được trả lại kèm một phiên bản tốt hơn và một dòng giải thích vì sao nó tốt hơn, để bạn nhìn thấy sự thay đổi thay vì chỉ đọc về nó.
  • Tiêu chí mạnh nhất và yếu nhất của bạn, đặt cạnh nhau. Phần đánh giá cho bạn biết tiêu chí nào trong bốn tiêu chí đang nâng điểm của bạn và tiêu chí nào đang kéo nó xuống, để bạn biết nên luyện gì tiếp theo mà không phải tự giải mã bốn con số.

Mọi trích dẫn trong phần đánh giá đều được đối chiếu với bài viết của bạn trước khi hiển thị. Nếu bộ kiểm tra không tìm thấy những từ đó, dòng nhận xét sẽ bị loại bỏ. Đó là lý do phần đánh giá không bao giờ bảo bạn sửa một điều bạn không hề viết.

Chi phí luyện tập mỗi ngày

Một điểm Writing hữu ích nhất ở bài viết thứ ba mươi của bạn, không phải bài thứ ba. Đó là lúc nó bắt đầu cho bạn biết liệu một thay đổi trong cách bạn viết có đang hiệu quả hay không. Vì vậy câu hỏi thực tế là chi phí để dùng mỗi lựa chọn với số lượng lớn.

Claude Pro có giá US$20 mỗi tháng, khoảng CA$28, hoặc US$17 mỗi tháng nếu thanh toán theo năm, theo công bố trên claude.com vào tháng 9 năm 2026, với hạn mức sử dụng luân phiên 5 giờ và giới hạn theo tuần. Các gói Max, từ US$100 mỗi tháng, khoảng CA$138 chưa gồm thuế, nâng các giới hạn đó nhưng không loại bỏ chúng. Không gói nào bao gồm ngân hàng đề, bộ đếm giờ, kiểm tra điểm bắt buộc, bài mẫu, hay một điểm số được hiệu chỉnh dựa trên các bài thực tế đã được chấm.

Prepamigo có giá CA$24.98 mỗi tháng, hoặc CA$8.25 mỗi tháng nếu chọn gói theo năm, tức CA$98.98 cho cả năm, đã gồm thuế, và bạn có thể hủy bất cứ lúc nào. Mọi gói đều bao gồm chấm điểm không giới hạn, không có giới hạn theo ngày, theo buổi hay theo tuần, số lần làm bài không giới hạn, và toàn bộ ngân hàng câu hỏi: 80 bộ đề luyện tập hoàn chỉnh và hơn 2,000 bài luyện tập trải rộng bốn kỹ năng Writing, Speaking, Reading và Listening, được viết theo đúng dạng bài, thời gian và định dạng của bài thi CELPIP General.

Khi nào Claude là công cụ tốt hơn

  • Trau chuốt một bài viết mạnh. Nếu bạn đã ở mức 10 và muốn biết một bài 11 hoặc 12 cần những gì, Opus 5 nhận ra bài viết mạnh một cách đáng tin cậy và giải thích tốt. Đó là mức duy nhất nó vượt qua chúng tôi.
  • Viết lại một câu theo năm cách. Hỏi các phương án thay thế cho một câu vụng về là nhanh, và các gợi ý khá tốt.
  • Trao đổi kỹ. Nếu bạn muốn tranh luận vì sao một lý do còn yếu, một cuộc trò chuyện là hình thức phù hợp. Prepamigo cho bạn một kết luận và bằng chứng; nó không trò chuyện.
  • Bất cứ điều gì ngoài bài thi. Claude là một trợ lý đa dụng, còn Prepamigo thì không.

Điều Claude không nên là, dựa trên các bằng chứng này, là công cụ cho một người viết ở mức 7 hoặc 8 biết mình đang ở đâu. Đó là hầu hết thí sinh, và đó chính là chỗ Claude sai ba trong bốn lần.

Câu hỏi thường gặp

Claude có thể chấm điểm bài Writing CELPIP của tôi không? Nó sẽ cho bạn một con số. Trên 36 bài viết chính thức có điểm đã xác minh, Claude Opus 5 đúng 61% số lần và Claude Sonnet 5 là 56%, so với 86% của Prepamigo. Với các bài viết mức giữa: 25% và 33% so với 100%.

Prepamigo có chính xác hơn Claude khi chấm Writing không? Nhìn chung, có, hơn từ 25 đến 30 điểm. Với các bài viết mạnh, Opus 5 tốt hơn, 92% so với 83%. Với các bài viết mức giữa, nơi hầu hết thí sinh đang ở, khoảng cách là 100% so với 25%.

Vì sao Claude cho bài viết trung bình của tôi 9 điểm? Không có gì để đối chiếu, một bài sạch sẽ, có bố cục, chung chung sẽ được đọc như bài mạnh. Opus 5 cho 9 hoặc 10 điểm cho bảy trong mười hai bài đã xác minh ở mức 7 đến 8. Prepamigo so sánh mỗi bài viết với các bài mẫu thực tế đã được chấm cho cùng đề bài.

Mỗi công cụ tốn bao nhiêu? Claude Max có giá khởi điểm US$100 mỗi tháng, khoảng CA$138 chưa gồm thuế; Pro là US$20 với giới hạn chặt hơn. Prepamigo là CA$24.98 mỗi tháng đã gồm thuế, hoặc CA$8.25 mỗi tháng theo gói năm, với chấm điểm không giới hạn và 80 bộ đề luyện tập.

Để xem cùng so sánh này với ChatGPT, đọc Prepamigo so với ChatGPT cho Writing. Để xem hệ thống chấm Writing hoạt động như thế nào, đọc bên trong hệ thống chấm Writing của Prepamigo. Hoặc Viết một bài trả lời và xem điểm số. Đọc bài này bằng tiếng Anh

Prepamigo so với Claude cho CELPIP Writing: Công cụ nào cho bạn điểm số đúng? | PrepAmigo