Sản phẩm

Prepamigo so với ChatGPT cho CELPIP Writing: Độ chính xác, giới hạn và chi phí

8 tháng 9, 2026

Tỷ lệ bài viết được chấm đúng mức điểm đã xác minh

36 bài viết CELPIP chính thức, mỗi mức 12 bài trong ba mức điểm, trải đều cả hai dạng bài Writing. Mỗi mô hình GPT được cung cấp đề bài và bài viết, rồi được yêu cầu, bằng lời đơn giản, chấm điểm theo thang CELPIP. Hệ thống chấm Writing của Prepamigo chạy ở cấu hình vận hành bình thường.

86%

Hệ thống chấm Writing của Prepamigo

78%

GPT 5.6 sol

69%

GPT 5.6 luna

58%

GPT-4o mini

Prepamigo so với các gói chatbot phổ biến nhất

Đơn vị: đô la Canada. Giá của Prepamigo đã bao gồm thuế. Claude Max (từ US$100) và ChatGPT Pro (US$200) được quy đổi theo tỷ giá 1.38, chưa gồm thuế. Độ chính xác là tỷ lệ trong 36 bài viết chính thức được chấm đúng mức điểm đã xác minh khi mô hình được nêu tên được yêu cầu, bằng lời đơn giản, chấm điểm bài viết đó; một lần chạy.

Prepamigo
ChatGPT ProGPT 5.6 sol
Giá mỗi tháng
CA$24.98 (đã gồm thuế)
CA$276 (chưa gồm thuế)
Chấm điểm
Không giới hạn
Có giới hạn
Ngân hàng câu hỏi có sẵn
Không
Bộ đề luyện tập
80
Không có
Bài luyện tập
2,000+
Không có
Đúng định dạng CELPIP
Không
Độ chính xác
86%
78%
Bài viết mức giữa
100%
75%

ChatGPT có lẽ là công cụ phổ biến nhất mà thí sinh CELPIP dùng để kiểm tra bài viết của mình. Dán email vào, xin một điểm số, nhận về một con số và một đoạn nhận xét. Nó nhanh, nó có sẵn trên điện thoại, và với Writing thì không có bước chép lời nào cản trở. Vì vậy chúng tôi đã kiểm tra con số đó. Chúng tôi đưa cho ba mô hình GPT cùng 36 bài viết CELPIP chính thức mà hệ thống chấm của chính chúng tôi được đo lường trên đó, mỗi mức mười hai bài, và yêu cầu chúng chấm điểm theo đúng cách một học viên sẽ hỏi.

Câu trả lời ngắn: hệ thống chấm Writing của Prepamigo cho ra đúng mức điểm đã xác minh 86% số lần. GPT 5.6 sol, mô hình đứng sau các gói trả phí của ChatGPT, đạt 78%. GPT 5.6 luna đạt 69% và GPT-4o mini đạt 58%. Tám điểm là một khoảng cách thực sự, và nó đến từ hai chỗ: phần giữa của thang điểm, nơi Prepamigo chấm đúng cả mười hai bài còn GPT 5.6 sol chấm đúng chín bài, và phần cao nhất, nơi GPT 5.6 sol ghìm một phần tư số bài mạnh xuống 9 điểm.

Chúng tôi nên nói ngay từ đầu rằng GPT 5.6 sol là hệ thống chấm Writing đa dụng tốt nhất mà chúng tôi từng kiểm tra, vượt xa mọi mô hình Claude trên cùng các bài viết. Phần còn lại của bài viết này sẽ đi qua các kết quả theo từng mức điểm, giải thích tám điểm khác biệt đến từ đâu, xem xét phần đánh giá của mỗi bên, và so sánh chi phí để luyện Writing một cách nghiêm túc với mỗi lựa chọn.

Bài kiểm tra đơn giản: một học viên thực sự nhận được gì

Tám mươi sáu phần trăm so với bảy mươi tám. Trên 36 bài viết, đó là Prepamigo chấm đúng nhiều hơn ba bài so với GPT 5.6 sol, nhiều hơn sáu bài so với GPT 5.6 luna, và nhiều hơn mười bài so với GPT-4o mini. Nói cách khác, Prepamigo mắc ít hơn 37% lỗi chấm điểm so với GPT 5.6 sol, ít hơn 55% so với luna và ít hơn 67% so với GPT-4o mini.

Các mô hình GPT được cung cấp những gì là điều quan trọng. Mỗi mô hình được cho biết nó là một giám khảo CELPIP Writing giàu kinh nghiệm, được đưa đề bài đúng như thí sinh nhìn thấy, bao gồm các điểm bắt buộc của bài email và các lựa chọn của bài khảo sát, và được đưa bài viết. Nó được yêu cầu cho một điểm số từ 0 đến 12. Đó là những gì bạn sẽ gõ vào ChatGPT, và đây là một bài kiểm tra công bằng hơn một câu “chấm bài này” trống trơn vì ít nhất mô hình biết đề bài yêu cầu gì.

Hệ thống chấm của Prepamigo nhận được cùng đề bài và cùng bài viết, cộng thêm những gì nó luôn có khi vận hành: các bài mẫu thực tế đã được chấm cho đề bài đó ở từng mức điểm để đối chiếu, và một lớp quy tắc kiểm tra những điều mà một người chấm kiểm tra đầu tiên, chẳng hạn mọi điểm bắt buộc có được đề cập không, bài khảo sát có thực sự chọn một phía không, email có lời chào và lời kết không, và bài viết có gần với độ dài đề bài yêu cầu không.

Tám điểm khác biệt đến từ đâu: xét theo từng mức điểm

Bài viết yếu (điểm đã xác minh 4 hoặc 5)

12 bài viết chính thức. Mức duy nhất mà các mô hình GPT nhỉnh hơn.

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

Hệ thống chấm Writing của Prepamigo

Với các bài viết yếu, cả ba mô hình GPT đều đạt 83% và Prepamigo đạt 75%. Đây là mức duy nhất mà ChatGPT dẫn trước, và chúng tôi báo cáo đúng như vậy. Ba lần chấm sai của Prepamigo đều cao hơn một nấc, lên 6 hoặc 7, trên những bài ngắn nhưng gọn gàng. Hai lần chấm sai của GPT 5.6 sol đều là 6 điểm. Bài viết yếu là đầu dễ của thang điểm với một chatbot: bài viết ngắn, chung chung và nhiều lỗi trông yếu với bất kỳ ai.

Bài viết mức giữa (điểm đã xác minh 7 hoặc 8)

12 bài viết chính thức. Mức mà hầu hết thí sinh đang ở.

100%

Hệ thống chấm Writing của Prepamigo

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

Ở mức giữa, Prepamigo chấm cả mười hai bài viết nằm trong khoảng 7 đến 8. GPT 5.6 sol đúng chín bài; ba lần chấm sai của nó đều là 6 điểm, thấp hơn một nấc. GPT 5.6 luna đúng bảy bài, kéo ba bài xuống 6, một bài xuống 5 và một bài lên 9. GPT-4o mini đúng tám bài và đẩy bốn bài còn lại lên 9.

Điểm 7 hoặc 8 là điểm thật phổ biến nhất trong kỳ thi, và đó là điểm số quyết định một thí sinh đã đạt mục tiêu hay chưa. GPT 5.6 sol sẽ bảo một trong bốn thí sinh như vậy rằng họ đã tụt xuống 6. Luna sẽ bảo bốn trong mười người như vậy. Không cái nào là thảm họa như kết quả mức giữa của Claude, nhưng đó là sự khác biệt giữa một điểm luyện tập bạn có thể lên kế hoạch dựa vào và một điểm bạn phải hoài nghi.

Bài viết mạnh (điểm đã xác minh 10 trở lên)

12 bài viết chính thức. Các lần chấm sai ở đây là điểm 9: bài viết mạnh nhưng người chấm đã ghìm lại.

83%

Hệ thống chấm Writing của Prepamigo

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

Ở mức cao, Prepamigo nhận đúng mười trong mười hai bài mạnh, GPT 5.6 sol chín bài, luna tám bài, và GPT-4o mini ba bài. Mọi lần chấm sai, trừ một, đều là 9 điểm. GPT-4o mini cho 9 điểm cho chín trong mười hai bài mạnh: đơn giản là nó không cho điểm 10. Nếu bài viết của bạn mạnh và bạn kiểm tra nó bằng gói miễn phí của ChatGPT, vốn vẫn chuyển rất nhiều lưu lượng sang các mô hình nhỏ, bạn sẽ gần như luôn được bảo rằng bạn là 9 điểm.

Một điểm 9 từ ChatGPT cho một bài viết bạn nghĩ là xuất sắc có nhiều khả năng là một điểm 10 bị ghìm lại hơn là một điểm 9 thật. Hãy viết lại một lần với bài mẫu đặt bên cạnh rồi chấm lại; một điểm 10 ổn định qua hai lần thử là một điểm 10.

Vì sao một chatbot trượt ở mức giữa và ở mức cao

Một bài viết CELPIP mức giữa bao quát đề bài, có bố cục, và cũng chung chung: lý do được nêu ra chứ không được triển khai, từ vựng an toàn, các câu cùng một khuôn. Một bài mạnh không hoàn hảo; nó có một hai sai sót, và một câu đơn giản xen giữa những câu được triển khai kỹ. Một mô hình không có ví dụ đã chấm để đối chiếu phải quyết định bằng ấn tượng. Ấn tượng của GPT 5.6 sol hơi khắt khe: bài 7 chung chung được đọc thành 6, bài 10 mạnh nhưng có sai sót được đọc thành 9. Luna còn khắt khe hơn nữa. GPT-4o mini coi 9 là mức trần.

Hệ thống chấm của Prepamigo không đánh giá một bài viết dựa trên một hình dung về bài viết hay. Nó so sánh bài viết đó với các bài thực tế đã được chấm cho cùng đề bài, mỗi mức một bài, tất cả đều là bài thật với những sai sót thật. Một bài chung chung nhưng đầy đủ sẽ nằm cạnh bài mẫu mức giữa vì đó là thứ nó giống. Một bài mạnh có một câu vụng về sẽ nằm cạnh bài mẫu mức mạnh, vốn cũng có một câu như vậy. Bên trên phép so sánh đó là một lớp quy tắc cho những điều mà một mô hình đếm rất kém: mọi điểm bắt buộc có đủ không, bài khảo sát có chọn một phía không, email có lời chào và lời kết không, và bài dài bao nhiêu. Một điểm bắt buộc bị bỏ sót giữ điểm hoàn thành nhiệm vụ ở mức 8 trở xuống bất kể tiếng Anh thế nào, vì kỳ thi vận hành như vậy.

Khoảng cách về quy trình: bạn phải tự mang theo những gì

Với Writing, ChatGPT dễ dùng trong vai trò người chấm, và chúng tôi sẽ không giả vờ ngược lại. Dán bài viết, nhận một con số, hỏi lời giải thích. Không ghi âm, không chép lời. Để có một ý kiến thứ hai nhanh chóng cho một bài viết đơn lẻ, nó tiện lợi và, với GPT 5.6 sol, khá chính xác.

Thứ bạn không có là đề bài. ChatGPT có thể bịa ra một đề theo kiểu CELPIP nếu bạn yêu cầu, nhưng nó chỉ đoán các điểm bắt buộc, các lựa chọn khảo sát và số từ mà bài thi thật sử dụng. Bạn không có phần kiểm tra điểm bắt buộc, vì nó không biết bài thi thật sẽ liệt kê những điểm nào. Bạn không có bài mẫu được viết lại từ chính bài của bạn ở đúng độ dài. Và mỗi bài viết bạn dán vào đều tính vào hạn mức tin nhắn của bạn.

Trên Prepamigo, bạn mở một đề từ ngân hàng, bộ đếm giờ chạy, bạn viết, và khoảng một phút sau khi nộp, bạn có bốn điểm tiêu chí, một điểm tổng, danh sách bất cứ điều gì bạn bỏ sót, các chỗ sửa được trích dẫn từ chính văn bản của bạn, và một bài mẫu được viết lại. Bài viết thứ bốn mươi trong tháng tốn công sức đúng bằng bài đầu tiên.

Cùng một bài viết, cùng một điểm số

Sau lần chạy chính, chúng tôi chấm cả 36 bài viết thêm hai lần nữa vào những ngày khác nhau. Hệ thống chấm Writing của Prepamigo đạt 86%, 89% và 86% qua ba lần chạy, với cùng mười hai bài viết mức giữa nằm trong khoảng đúng ở mọi lần. GPT 5.6 sol đạt 78%, 83% và 81%: tốt hơn ở lần chạy thứ hai và thứ ba, và là một lời nhắc rằng một câu trả lời đơn lẻ của chatbot mang theo vài điểm may rủi theo cả hai chiều. Nếu bạn vẫn chấm bằng ChatGPT, hãy hỏi hai lần và giữ câu trả lời thấp hơn.

Phần đánh giá: lời giải thích so với bằng chứng

ChatGPT giải thích tốt. Hỏi vì sao một bài viết là 6 điểm và nó sẽ nói cho bạn, bằng tiếng Anh rõ ràng, kèm gợi ý. Cái bẫy là lời giải thích được viết để biện minh cho một con số đã chọn sẵn, nên khi con số thấp hơn một nấc, lời giải thích sẽ tìm ra lỗi cho khớp. Một thí sinh thực chất ở mức 7 đọc cả một trang về những điểm yếu vốn không mang tính quyết định.

Phần đánh giá của Prepamigo hoạt động từ văn bản đi lên. Mỗi chỗ sửa đều trích dẫn đúng những từ trong bài của bạn, và bất cứ điều gì bộ kiểm tra không tìm thấy trong văn bản của bạn sẽ bị loại bỏ trước khi bạn nhìn thấy. Một điểm bắt buộc bị bỏ sót được nêu đích danh. Mỗi tiêu chí nhận một yếu tố kìm hãm, hoặc một lời khẳng định rõ ràng rằng không có gì đang kéo nó xuống. Và bạn nhận được một bài mẫu được viết lại từ chính câu trả lời của bạn ở độ dài đề bài yêu cầu. Phần dưới đây liệt kê những gì đã thay đổi.

Điều gì mới trong phần đánh giá bài viết của bạn

Điểm số chỉ là một nửa những gì bạn nhận lại. Lớp đánh giá bài viết đã được xây dựng lại cùng với hệ thống chấm điểm, và mọi thứ trong đó đều bám sát vào chính văn bản của bạn. Đây là những điều đã thay đổi.

  • Những chỗ sửa bạn có thể tìm thấy ngay trong bài viết của mình. Mỗi chỗ sửa về ngữ pháp, chính tả và từ vựng đều trích dẫn đúng những từ trong bài của bạn, để ứng dụng có thể tô sáng chúng ngay tại chỗ bạn đã viết. Bất cứ điều gì bộ kiểm tra không tìm thấy nguyên văn trong bài viết của bạn sẽ bị loại bỏ trước khi bạn nhìn thấy.
  • Một bài mẫu, được xây dựng từ chính bài của bạn. Bạn nhận được một phiên bản viết lại từ chính câu trả lời của mình, giữ nguyên các ý của bạn, đề cập đầy đủ mọi điểm bắt buộc và đạt đúng độ dài 150 đến 200 từ mà đề bài yêu cầu. Nếu bản viết lại đầu tiên chưa đạt độ dài đó, nó sẽ được làm lại một lần trước khi hiển thị.
  • Điểm bắt buộc bạn đã bỏ sót, được nêu đích danh. Với bài viết email, phần đánh giá liệt kê những gạch đầu dòng trong đề bài mà câu trả lời của bạn chưa đề cập. Một điểm bị bỏ sót cũng giữ điểm hoàn thành nhiệm vụ ở mức 8 trở xuống, nên con số và phần đánh giá không bao giờ mâu thuẫn với nhau.
  • Một yếu tố kìm hãm cho mỗi tiêu chí. Với mỗi tiêu chí trong bốn tiêu chí, phần đánh giá nêu đúng một điều đang kéo điểm đó xuống, bằng lời cụ thể, hoặc nói thẳng rằng không có gì kìm hãm và điều gì đang nâng đỡ điểm đó. Kết luận rằng một tiêu chí không có vấn đề là một câu trả lời thực sự, không phải một khoảng trống.
  • Lời chê đặt đúng chỗ. Giọng văn yếu là vấn đề của hoàn thành nhiệm vụ, lựa chọn từ mơ hồ là vấn đề của từ vựng, câu quá dài lê thê là vấn đề của tính dễ đọc. Mỗi nhận xét được xếp vào đúng tiêu chí sở hữu nó thay vì bị gộp chung vào phần tóm tắt tổng thể.
  • Viết lại ở cấp độ từng câu. Những câu cụ thể trong bài viết của bạn được trả lại kèm một phiên bản tốt hơn và một dòng giải thích vì sao nó tốt hơn, để bạn nhìn thấy sự thay đổi thay vì chỉ đọc về nó.
  • Tiêu chí mạnh nhất và yếu nhất của bạn, đặt cạnh nhau. Phần đánh giá cho bạn biết tiêu chí nào trong bốn tiêu chí đang nâng điểm của bạn và tiêu chí nào đang kéo nó xuống, để bạn biết nên luyện gì tiếp theo mà không phải tự giải mã bốn con số.

Mọi trích dẫn trong phần đánh giá đều được đối chiếu với bài viết của bạn trước khi hiển thị. Nếu bộ kiểm tra không tìm thấy những từ đó, dòng nhận xét sẽ bị loại bỏ. Đó là lý do phần đánh giá không bao giờ bảo bạn sửa một điều bạn không hề viết.

Chi phí luyện tập mỗi ngày

ChatGPT Plus có giá US$20 mỗi tháng, khoảng CA$28, thanh toán hằng tháng, theo công bố vào tháng 9 năm 2026, với giới hạn số tin nhắn theo từng khung thời gian luân phiên; ChatGPT Pro, với giá US$200 mỗi tháng, khoảng CA$276 chưa gồm thuế, nâng giới hạn đó lên. Gói miễn phí chuyển phần lớn lưu lượng sang các mô hình nhỏ hơn, và trong bài kiểm tra này mô hình nhỏ nhất trong số đó chỉ nhận ra ba trong mười hai bài mạnh. Không gói nào bao gồm ngân hàng đề, bộ đếm giờ, kiểm tra điểm bắt buộc, bài mẫu, hay một điểm số được hiệu chỉnh dựa trên các bài thực tế đã được chấm.

Prepamigo có giá CA$24.98 mỗi tháng, hoặc CA$8.25 mỗi tháng nếu chọn gói theo năm, tức CA$98.98 cho cả năm, đã gồm thuế, và bạn có thể hủy bất cứ lúc nào. Mọi gói đều bao gồm chấm điểm không giới hạn, không có giới hạn theo ngày, theo buổi hay theo tuần, số lần làm bài không giới hạn, và toàn bộ ngân hàng câu hỏi: 80 bộ đề luyện tập hoàn chỉnh và hơn 2,000 bài luyện tập trải rộng bốn kỹ năng Writing, Speaking, Reading và Listening, được viết theo đúng dạng bài, thời gian và định dạng của bài thi CELPIP General.

Khi nào ChatGPT là công cụ tốt hơn

  • Một ý kiến thứ hai nhanh chóng cho một bài viết. GPT 5.6 sol là một người chấm khá ổn và chỉ mất mười giây. Nếu bạn đã có đề bài và chỉ muốn thêm một góc nhìn khác, nó ổn.
  • Viết lại một câu theo năm cách. Hỏi các phương án thay thế cho một câu vụng về là nhanh, và các gợi ý khá tốt.
  • Trao đổi kỹ. Nếu bạn muốn tranh luận vì sao một lý do còn yếu, một cuộc trò chuyện là hình thức phù hợp. Prepamigo cho bạn một kết luận và bằng chứng; nó không trò chuyện.
  • Bất cứ điều gì ngoài bài thi. ChatGPT là một trợ lý đa dụng, còn Prepamigo thì không.

Điều nó không nên là, là thứ duy nhất cho một người viết ở mức 7 hoặc 8 biết mình đang ở đâu, hay thứ bảo một người viết mạnh rằng họ là 9 điểm. Đó là hai chỗ nó sai thường xuyên nhất.

Câu hỏi thường gặp

ChatGPT có thể chấm điểm bài Writing CELPIP của tôi không? Có, và tốt hơn hầu hết các chatbot khác: GPT 5.6 sol đúng 78% số lần trên 36 bài viết chính thức, luna 69%, GPT-4o mini 58%, so với 86% của Prepamigo.

Prepamigo có chính xác hơn ChatGPT khi chấm Writing không? Hơn tám điểm so với mô hình GPT tốt nhất. Bài viết mức giữa 100% so với 75%; bài viết mạnh 83% so với 75%; bài viết yếu 75% so với 83%.

Tôi nên dùng mô hình GPT nào? GPT 5.6 sol. Không phải GPT-4o mini, vốn cho 9 điểm cho chín trong mười hai bài viết mạnh.

Mỗi công cụ tốn bao nhiêu? ChatGPT Pro có giá US$200 mỗi tháng, khoảng CA$276 chưa gồm thuế; Plus là US$20 với giới hạn tin nhắn. Prepamigo là CA$24.98 mỗi tháng đã gồm thuế, hoặc CA$8.25 mỗi tháng theo gói năm, với chấm điểm không giới hạn và 80 bộ đề luyện tập.

Để xem cùng so sánh này với Claude, đọc Prepamigo so với Claude cho Writing. Để xem hệ thống chấm Writing hoạt động như thế nào, đọc bên trong hệ thống chấm Writing của Prepamigo. Hoặc Viết một bài trả lời và xem điểm số. Đọc bài này bằng tiếng Anh

Prepamigo so với ChatGPT cho CELPIP Writing: Độ chính xác, giới hạn và chi phí | PrepAmigo