Tỷ lệ bài viết được chấm ở mức đã xác minh
36 bài viết CELPIP chính thức, 12 bài mỗi mức, cả hai dạng bài Writing. Mỗi mô hình được cung cấp đề bài và bài viết, rồi được yêu cầu, bằng lời đơn giản, chấm điểm theo thang CELPIP. Bộ chấm điểm Writing của Prepamigo chạy trong cấu hình thực tế thông thường của nó.
86%
Bộ chấm điểm Writing Prepamigo
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
Prepamigo so với các gói chatbot phổ biến nhất
Đơn vị: đô la Canada. Giá của Prepamigo đã bao gồm thuế. Claude Max (từ US$100) và ChatGPT Pro (US$200) được quy đổi theo tỷ giá 1.38, chưa gồm thuế. Độ chính xác là tỷ lệ trong 36 bài viết chính thức được chấm đúng mức điểm đã xác minh khi mô hình được nêu tên được yêu cầu, bằng lời đơn giản, chấm điểm bài viết đó; một lần chạy.
Rất nhiều thí sinh CELPIP kiểm tra bài viết của mình bằng một chatbot AI. Dán bài email vào, hỏi điểm, đọc đoạn nhận xét. Với Writing thì việc này rất dễ: không cần ghi âm, không cần chép lời. Điều không ai nói với bạn là con số đó đúng thường xuyên đến mức nào, hay nên tin mô hình nào, hay mỗi mô hình mắc lỗi gì. Chúng tôi muốn biết, nên đã đưa cho sáu chatbot và bộ chấm điểm của chính mình cùng 36 bài viết chính thức có điểm đã xác minh và đếm.
Phiên bản một câu: GPT 5.6 sol là chatbot chính xác nhất cho CELPIP Writing với 78%, các mô hình Claude kém chính xác nhất với 61% và 56% vì chúng thổi phồng bài viết mức giữa, và một bộ chấm điểm chuyên dụng, của Prepamigo, đạt 86% trên cùng các bài viết đó và chấm đúng mọi bài viết mức giữa. Chúng tôi nên nói thẳng rằng Prepamigo là sản phẩm của chúng tôi. Ở đâu một chatbot vượt chúng tôi ở một mức cụ thể, chúng tôi nói rõ; có hai chatbot đã làm được vậy.
Bảng xếp hạng
Có thể thấy ba nhóm trong biểu đồ phía trên. Prepamigo ở mức 86% đứng một mình. GPT 5.6 sol ở mức 78% và GPT 5.6 luna ở mức 69% tạo thành nhóm thứ hai: dùng được, với những thói quen đã biết. Mọi thứ còn lại ở mức hoặc gần 60%, mà với một thang ba khoảng thì không tốt hơn nhiều so với một phỏng đoán có hiểu biết.
Mô hình này khác với Speaking, nơi các mô hình Claude làm tốt và các mô hình GPT làm kém. Với Writing thì ngược lại. Các mô hình GPT hơi khắt khe: chúng kéo một bài điểm 7 chung chung xuống 6 và giữ một bài viết mạnh có một sai sót ở điểm 9. Các mô hình Claude thì rộng rãi: chúng đẩy một bài điểm 7 chung chung lên 9 hoặc 10 và chấm những bài viết yếu sơ sài điểm 3. Gemini cư xử giống Claude ở mức giữa. GPT-4o mini coi 9 là trần.
Kết quả ở từng mức
Bài viết yếu (đã xác minh 4 hoặc 5)
12 bài viết chính thức cho mỗi hệ thống.
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
Bộ chấm điểm Writing Prepamigo
67%
Claude Opus 5
58%
Gemini
50%
Claude Sonnet 5
Bài viết yếu là đầu dễ của thang điểm, và ba mô hình GPT hòa nhau ở mức 83%, dẫn trước Prepamigo ở mức 75%. Ba lần chấm sai của Prepamigo đều lệch cao hơn một bậc, thành 6 hoặc 7, trên những bài ngắn nhưng gọn gàng. Các mô hình Claude sai theo chiều ngược lại: Sonnet 5 chấm bốn trong mười hai bài viết yếu điểm 3, thấp hơn một mức, và Opus 5 chấm hai bài trong số đó điểm 3. Một bài viết sơ sài nhưng vẫn làm đúng nhiệm vụ là điểm 4, không phải 3, và một mô hình không có ví dụ nào về điểm 4 thì không thể phân biệt được.
Bài viết mức giữa (đã xác minh 7 hoặc 8)
12 bài viết chính thức cho mỗi hệ thống. Mức mà phần lớn thí sinh đang ở.
100%
Bộ chấm điểm Writing Prepamigo
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
42%
Gemini
33%
Claude Sonnet 5
25%
Claude Opus 5
Khoảng giữa là nơi phân tách các hệ thống. Prepamigo chấm đúng cả mười hai bài. GPT 5.6 sol chấm đúng chín bài, kéo ba bài xuống điểm 6. GPT-4o mini chấm đúng tám bài và đẩy bốn bài lên điểm 9. Luna chấm đúng bảy bài, chủ yếu kéo xuống. Gemini chấm đúng năm bài và đẩy sáu bài lên điểm 9 hoặc 10. Claude Sonnet 5 chấm đúng bốn bài, số còn lại chia giữa điểm 6 và điểm 9. Claude Opus 5 chấm đúng ba bài và cho điểm 9 hoặc 10 cho bảy trong mười hai bài.
Nếu bạn là người viết ở mức 7 hoặc 8, và phần lớn thí sinh là vậy, đây là biểu đồ cần ghi nhớ. Hỏi Claude Opus 5 và hơn một nửa số lần nó sẽ nói với bạn rằng bạn đã xong. Hỏi Gemini và một nửa số lần nó sẽ nói điều tương tự. Hỏi GPT 5.6 sol và một trong bốn lần nó sẽ nói với bạn rằng bạn đã tụt xuống điểm 6.
Bài viết mạnh (đã xác minh 10 trở lên)
12 bài viết chính thức cho mỗi hệ thống. Gần như mọi lần chấm sai đều là điểm 9.
92%
Claude Opus 5
83%
Bộ chấm điểm Writing Prepamigo
83%
Gemini
83%
Claude Sonnet 5
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
Ở mức cao nhất, Claude Opus 5 là giám khảo tốt nhất trong bài kiểm tra với mười một trong mười hai bài viết mạnh được nhận đúng; nó cho năm bài trong số đó điểm 11. Prepamigo, Gemini và Sonnet 5 mỗi hệ thống nhận đúng mười bài. GPT 5.6 sol nhận đúng chín bài và luna tám bài, giữ số còn lại ở điểm 9. GPT-4o mini nhận đúng ba bài và cho điểm 9 cho chín bài: nó không bao giờ cho điểm 10. Sự rộng rãi của Claude đúng ở đây và sai ở mọi nơi khác; sự khắt khe của các mô hình GPT sai ở đây và gần đúng ở những nơi khác.
Vì sao các mô hình bất đồng về mức giữa
Một bài viết CELPIP mức giữa là một thứ cụ thể: nó đề cập đủ đề bài, nó có tổ chức, nó có ít lỗi cản trở việc hiểu, và nó chung chung, với các lý do được nêu ra thay vì được phát triển và từ vựng an toàn thay vì chính xác. Một giám khảo được đào tạo đã thấy hàng trăm bài như vậy và biết chúng nằm ở đâu. Một mô hình đa dụng thấy một bài viết gọn gàng, có tổ chức, phần lớn đúng và phải quyết định từ cảm nhận. Cảm nhận của Claude là gọn gàng nghĩa là mạnh. Cảm nhận của GPT là chung chung nghĩa là yếu. Cả hai đều sai về một bài điểm 7, theo hai chiều ngược nhau.
Bộ chấm điểm của Prepamigo không phán đoán từ cảm nhận. Nó so sánh bài viết với các bài trả lời thực tế đã chấm cho cùng dạng bài ở mỗi mức, tất cả đều là bài viết thật với những sai sót thật, và đặt nó cạnh bài mà nó giống nhất trên mỗi tiêu chí trong bốn tiêu chí. Một bài viết sạch sẽ nhưng chung chung rơi vào cạnh bài mẫu mức giữa, vì đó chính là nó. Bên trên phép so sánh là một lớp quy tắc cho những điều mà mô hình đếm kém: mọi ý bắt buộc đã được đề cập chưa, bài khảo sát có chọn phe không, bài email có lời chào mở đầu và kết thúc không, và nó dài bao nhiêu. Một ý bắt buộc bị bỏ sót giữ điểm hoàn thành nhiệm vụ ở mức 8 trở xuống bất kể tiếng Anh ra sao, vì bài thi hoạt động như vậy.
Chúng tôi cũng đã thử đưa cho bộ chấm điểm Writing thiết kế hai giám khảo, bỏ phiếu rồi dung hòa mà bộ chấm điểm Speaking của chúng tôi dùng. Nó làm Writing tệ hơn, vì các mức Writing chính thức chỉ cách nhau hai điểm trên thang 0 đến 12 và một lựa chọn bắt buộc giữa các bài mẫu đã đẩy bài viết mức giữa lên điểm 9. Writing giữ lại thiết kế chấm đúng mức giữa.
Vì sao thứ hạng ngược lại với Speaking
Nếu bạn đã đọc bài so sánh Speaking của chúng tôi, bảng xếp hạng Writing sẽ trông như bị lộn ngược. Trên các bản chép lời Speaking, Claude Opus 5 là chatbot tốt nhất với 62% và GPT 5.6 sol là kém nhất trong các mô hình lớn với 35%. Với Writing thì là GPT 5.6 sol với 78% và các mô hình Claude ở cuối bảng.
Lý do là mỗi mô hình rộng rãi về điều gì. Một bản chép lời Speaking CELPIP là tiếng Anh nói được viết ra: câu rời rạc, lặp lại, tự sửa. GPT đọc điều đó là hỏng và chấm gắt, điều mà với một bản chép lời là sai; Claude đọc xuyên qua nó tới các ý tưởng. Một bài viết CELPIP thì ngược lại: nó được biên tập, có tổ chức, gọn gàng trên bề mặt, và thường chung chung bên dưới. Claude đọc sự gọn gàng là sức mạnh và thổi phồng mức giữa; GPT đọc nội dung chung chung là điểm yếu và gần đúng, hoặc thấp hơn một điểm.
Bài học thực tế là không có một chatbot tốt nhất duy nhất cho CELPIP. Mô hình chấm Speaking của bạn tốt chính là mô hình sẽ nương tay với bài viết của bạn, và ngược lại. Một bộ chấm điểm chuyên dụng né được câu hỏi đó bằng cách so sánh với các bài mẫu đã chấm đúng loại cho từng dạng bài. Engine Speaking và engine Writing của Prepamigo là hai hệ thống riêng biệt với thiết kế khác nhau, vì hai dạng bài thất bại theo cách khác nhau.
Đoạn nhận xét đi kèm con số
Mọi chatbot đều trả về một đoạn nhận xét cùng với điểm số, và đoạn nhận xét thường tự tin hơn mức con số xứng đáng. Ba điều cần kiểm tra trước khi bạn hành động dựa trên nó.
- Nó có trích dẫn bạn không? Một lời sửa không chỉ vào đúng từ ngữ của bạn là một quy tắc chung, không phải nhận xét về bài viết của bạn. Phần lớn lời khuyên của chatbot thuộc loại áp dụng cho bất kỳ bài viết nào: đa dạng cấu trúc câu, dùng từ vựng chính xác hơn, phát triển lý do. Đúng, và không làm được gì với nó.
- Nó có gọi tên ý bị thiếu không? Nếu bạn đã dán đề bài, một phản hồi tốt sẽ cho bạn biết ý bắt buộc nào bạn chưa đề cập. Nếu bạn không dán, chatbot không thể biết, và nó vẫn sẽ khen độ bao phủ.
- Lời phê có khớp với điểm số không? Một đoạn nhận xét của chatbot thường liệt kê ba hoặc bốn vấn đề rồi cho điểm 10, hoặc khen bài viết rồi cho điểm 6. Khi lời và con số bất đồng, không cái nào đáng tin.
Phần nhận xét của Prepamigo được xây dựng theo chiều ngược lại: bộ chấm điểm phải trích dẫn những cụm từ làm căn cứ cho điểm của mỗi tiêu chí trước khi cho điểm, và một trích dẫn không tìm thấy trong bài viết của bạn sẽ bị loại bỏ. Các ý bị bỏ sót được liệt kê theo tên, và một ý bị bỏ sót giới hạn điểm hoàn thành nhiệm vụ, nên lời và con số không thể bất đồng. Phần dưới đây liệt kê những gì có trong đó.
Ghi chú về từng mô hình
- GPT 5.6 sol. Chatbot tốt nhất cho Writing với 78%, và là mô hình nên dùng nếu bạn dùng một chatbot. Hơi khắt khe: ba bài viết mức giữa bị kéo xuống 6, ba bài viết mạnh bị giữ ở 9. Với bài viết yếu nó tốt hơn Prepamigo, 83% so với 75%.
- GPT 5.6 luna. 69%. Cùng hình dạng với sol nhưng khắt khe hơn ở mức giữa, nơi nó chấm đúng bảy trong mười hai bài. Tốt với bài viết yếu.
- Gemini. 61%. Ổn ở hai đầu, kém ở mức giữa với 42%, nơi nó đẩy sáu trong mười hai bài lên điểm 9 hoặc 10.
- Claude Opus 5. 61% tổng thể nhưng là giám khảo tốt nhất trong bài kiểm tra với bài viết mạnh ở mức 92%. Ở mức giữa nó kém nhất với 25%, cho bảy trong mười hai bài điểm 9 hoặc 10. Nếu bài viết của bạn đã mạnh, Opus 5 sẽ xác nhận điều đó; nếu nó trung bình, Opus 5 sẽ nói với bạn rằng nó mạnh.
- GPT-4o mini. 58%. Coi 9 là đỉnh của thang điểm: chín trong mười hai bài viết mạnh được chấm điểm 9. Đừng dùng nó để chấm bài viết nếu bạn ở bất cứ đâu gần điểm 10.
- Claude Sonnet 5. 56%, kém chính xác nhất. Chấm bốn bài viết yếu điểm 3 và chia khoảng giữa thành các điểm 6 và điểm 9.
Nếu bạn vẫn sẽ dùng chatbot
- Dùng GPT 5.6 sol. Không dùng mô hình Claude cho bất cứ thứ gì dưới mức bài viết mạnh, và không dùng mô hình nhỏ cho bất cứ thứ gì trên mức bài viết yếu.
- Dán toàn bộ đề bài. Các ý bắt buộc của bài email và các lựa chọn của bài khảo sát làm thay đổi điểm số. Một mô hình không biết các ý đó thì không thể nói với bạn rằng một ý bị thiếu.
- Yêu cầu nó kiểm tra các ý trước. Yêu cầu trả lời có hoặc không cho từng ý bắt buộc, rồi mới đến điểm số. Đây chính là lớp quy tắc, làm bằng tay.
- Hỏi hai lần, giữ câu trả lời thấp hơn. GPT 5.6 sol đạt 78%, 83% và 81% trong ba lần chạy cùng các bài viết; một câu trả lời đơn lẻ mang theo vài điểm may rủi.
- Đọc điểm 9 và điểm 6 với sự nghi ngờ. Từ một mô hình GPT, điểm 9 thường là điểm 10 bị giữ lại và điểm 6 thường là điểm 7 bị kéo xuống. Từ một mô hình Claude, điểm 9 thường là điểm 7 được nâng lên.
Đầu vào duy nhất bạn không thể tự cung cấp là một bài viết đã chấm và xác minh cho cùng dạng bài ở mỗi mức, thứ mà một bộ chấm điểm chuyên dụng dùng để đối chiếu. Điều đó, cùng với việc kiểm tra ý bắt buộc, là sự khác biệt giữa 78% và 86%.
Điều gì mới trong phần đánh giá bài viết của bạn
Điểm số chỉ là một nửa những gì bạn nhận lại. Lớp đánh giá bài viết đã được xây dựng lại cùng với hệ thống chấm điểm, và mọi thứ trong đó đều bám sát vào chính văn bản của bạn. Đây là những điều đã thay đổi.
- Những chỗ sửa bạn có thể tìm thấy ngay trong bài viết của mình. Mỗi chỗ sửa về ngữ pháp, chính tả và từ vựng đều trích dẫn đúng những từ trong bài của bạn, để ứng dụng có thể tô sáng chúng ngay tại chỗ bạn đã viết. Bất cứ điều gì bộ kiểm tra không tìm thấy nguyên văn trong bài viết của bạn sẽ bị loại bỏ trước khi bạn nhìn thấy.
- Một bài mẫu, được xây dựng từ chính bài của bạn. Bạn nhận được một phiên bản viết lại từ chính câu trả lời của mình, giữ nguyên các ý của bạn, đề cập đầy đủ mọi điểm bắt buộc và đạt đúng độ dài 150 đến 200 từ mà đề bài yêu cầu. Nếu bản viết lại đầu tiên chưa đạt độ dài đó, nó sẽ được làm lại một lần trước khi hiển thị.
- Điểm bắt buộc bạn đã bỏ sót, được nêu đích danh. Với bài viết email, phần đánh giá liệt kê những gạch đầu dòng trong đề bài mà câu trả lời của bạn chưa đề cập. Một điểm bị bỏ sót cũng giữ điểm hoàn thành nhiệm vụ ở mức 8 trở xuống, nên con số và phần đánh giá không bao giờ mâu thuẫn với nhau.
- Một yếu tố kìm hãm cho mỗi tiêu chí. Với mỗi tiêu chí trong bốn tiêu chí, phần đánh giá nêu đúng một điều đang kéo điểm đó xuống, bằng lời cụ thể, hoặc nói thẳng rằng không có gì kìm hãm và điều gì đang nâng đỡ điểm đó. Kết luận rằng một tiêu chí không có vấn đề là một câu trả lời thực sự, không phải một khoảng trống.
- Lời chê đặt đúng chỗ. Giọng văn yếu là vấn đề của hoàn thành nhiệm vụ, lựa chọn từ mơ hồ là vấn đề của từ vựng, câu quá dài lê thê là vấn đề của tính dễ đọc. Mỗi nhận xét được xếp vào đúng tiêu chí sở hữu nó thay vì bị gộp chung vào phần tóm tắt tổng thể.
- Viết lại ở cấp độ từng câu. Những câu cụ thể trong bài viết của bạn được trả lại kèm một phiên bản tốt hơn và một dòng giải thích vì sao nó tốt hơn, để bạn nhìn thấy sự thay đổi thay vì chỉ đọc về nó.
- Tiêu chí mạnh nhất và yếu nhất của bạn, đặt cạnh nhau. Phần đánh giá cho bạn biết tiêu chí nào trong bốn tiêu chí đang nâng điểm của bạn và tiêu chí nào đang kéo nó xuống, để bạn biết nên luyện gì tiếp theo mà không phải tự giải mã bốn con số.
Mọi trích dẫn trong phần đánh giá đều được đối chiếu với bài viết của bạn trước khi hiển thị. Nếu bộ kiểm tra không tìm thấy những từ đó, dòng nhận xét sẽ bị loại bỏ. Đó là lý do phần đánh giá không bao giờ bảo bạn sửa một điều bạn không hề viết.
Câu hỏi thường gặp
AI nào chính xác nhất khi chấm điểm CELPIP Writing? Trong các chatbot, GPT 5.6 sol với 78%, rồi luna 69%, Gemini và Claude Opus 5 61%, GPT-4o mini 58%, Claude Sonnet 5 56%. Bộ chấm điểm Writing của Prepamigo đạt 86% trên cùng các bài viết đó.
ChatGPT hay Claude cho Writing? ChatGPT, rõ ràng: 78% so với 61% và 56%. Các mô hình Claude thổi phồng bài viết mức giữa lên điểm 9 hoặc 10. Opus 5 là tốt nhất trong tất cả với bài viết mạnh.
Vì sao chúng cho bài viết trung bình của tôi điểm 9? Gọn gàng và có tổ chức được đọc là mạnh đối với một mô hình không có gì để đối chiếu. Prepamigo so sánh với các bài mẫu thực tế đã chấm cho cùng dạng bài.
Làm sao để nhận điểm tốt hơn từ một chatbot? Dùng GPT 5.6 sol, dán toàn bộ đề bài, yêu cầu nó kiểm tra từng ý bắt buộc trước, hỏi hai lần, và đọc điểm 9 và điểm 6 với sự nghi ngờ.
Để xem hai phép so sánh trực tiếp, đọc Prepamigo so với Claude cho Writing và Prepamigo so với ChatGPT cho Writing. Để xem bộ chấm điểm hoạt động như thế nào, đọc bên trong bộ chấm điểm Writing của Prepamigo. Hoặc Viết một bài trả lời và bỏ qua việc đoán mò. Đọc bài này bằng tiếng Anh
