Bộ chấm điểm Writing của Prepamigo trên 36 bài viết chính thức
Tỷ lệ bài viết được chấm trong mức đã xác minh, tổng thể và theo từng mức. Mười hai bài mỗi mức trên cả hai dạng bài Writing; sáu bài mẫu mà bộ chấm điểm dùng để chuẩn hóa được loại trừ.
86%
Tổng thể
75%
Yếu (4–5)
100%
Giữa (7–8)
83%
Mạnh (10+)
Prepamigo so với các gói chatbot phổ biến nhất
Đơn vị: đô la Canada. Giá của Prepamigo đã bao gồm thuế. Claude Max (từ US$100) và ChatGPT Pro (US$200) được quy đổi theo tỷ giá 1.38, chưa gồm thuế. Độ chính xác là tỷ lệ trong 36 bài viết chính thức được chấm đúng mức điểm đã xác minh khi mô hình được nêu tên được yêu cầu, bằng lời đơn giản, chấm điểm bài viết đó; một lần chạy.
Đó là câu hỏi đúng để đặt ra với bất kỳ công cụ luyện tập nào, và phần lớn công cụ không trả lời nó. Một điểm Writing chỉ có giá trị nếu nó cho bạn biết một giám khảo thật sẽ nói gì, và cách duy nhất để biết nó có làm được điều đó không là đo lường. Vì vậy bài viết này chính là phép đo lường đó, được trình bày rõ ràng, với cả những phần có lợi cho chúng tôi và những phần không.
Câu trả lời trong một đoạn: trên 36 bài viết CELPIP chính thức, mỗi bài có một điểm đã được xác minh độc lập, bộ chấm điểm Writing của Prepamigo rơi đúng mức điểm đã xác minh 86% số lần. Nó chấm đúng mọi bài viết mức giữa, 75% bài viết yếu và 83% bài viết mạnh. Nó cho ra cùng kết quả, xê dịch một bài, trong ba lần chạy riêng biệt. Khi được yêu cầu bằng lời đơn giản chấm cùng các bài viết đó, mô hình hàng đầu tốt nhất, GPT 5.6 sol, đạt 78%; các mô hình Claude đạt 61% và 56%.
Phần tiếp theo là ý nghĩa của các con số ở từng mức, lỗi rơi vào đâu và theo chiều nào, điểm số ổn định đến mức nào, nó so với các chatbot bạn có thể đang dùng thay thế ra sao, điều gì mới trong phần nhận xét, và cách đọc điểm số của chính bạn dựa trên tất cả những điều đó.
“Chính xác” ở đây nghĩa là gì
Chúng tôi không khẳng định rằng một điểm Prepamigo dự đoán kết quả thi của bạn. Không công cụ luyện tập nào có thể hứa điều đó. Điều chúng tôi đo lường hẹp hơn và trung thực hơn: với một bài viết có điểm đã được xác minh độc lập, bộ chấm điểm cho ra một điểm số ở cùng mức thường xuyên đến mức nào?
CELPIP Writing được báo cáo trên một thang điểm tới 12, và các điểm đã xác minh trong dữ liệu tham chiếu của chúng tôi thuộc ba khoảng: yếu, nghĩa là 4 hoặc 5; giữa, nghĩa là 7 hoặc 8; và mạnh, nghĩa là 10 trở lên. Chúng tôi tính bộ chấm điểm là đúng khi điểm của nó rơi vào trong khoảng đã xác minh. Một bài viết mạnh được chấm 10, 11 hoặc 12 là đúng; được chấm 9 là sai, dù chỉ suýt sai.
Độ chính xác ở từng mức
Bài viết yếu: 75%. Chín trong mười hai bài nằm trong khoảng. Cả ba lần chấm sai đều lệch cao hơn một bậc: hai bài được chấm 6 và một bài được chấm 7. Mỗi bài đều ngắn và sơ sài nhưng gọn gàng, ít lỗi, và sự gọn gàng đó mua được một điểm mà bài viết chưa xứng đáng về nội dung. Đây là lỗi đặc trưng của bộ chấm điểm ở đầu thấp, và đó là một lỗi rộng rãi: một người viết yếu được bảo rằng họ khá hơn thực tế một chút, không bao giờ kém hơn.
Bài viết mức giữa: 100%. Mười hai trong mười hai bài nằm trong khoảng 7 đến 8, ở cả ba lần chạy. Đây là mức mà phần lớn thí sinh đang ở và là mức quyết định phần lớn mục tiêu định cư, và đó là nơi bộ chấm điểm mạnh nhất. Đó cũng là nơi mọi chatbot chúng tôi kiểm tra yếu nhất, vì những lý do phần so sánh sẽ giải thích.
Bài viết mạnh: 83%. Mười trong mười hai bài. Cả hai lần chấm sai đều là điểm 9, thấp hơn một bậc. Một bài viết CELPIP mạnh không hoàn hảo tuyệt đối, và bộ chấm điểm thỉnh thoảng đọc thêm một sai sót quá mức. Không lần chấm sai nào là 7 hoặc 8; một bài viết mạnh không bao giờ bị bảo là trung bình.
Theo dạng bài, bộ chấm điểm đúng trên 89% bài email và 83% bài trả lời khảo sát. Bài khảo sát khó xếp mức hơn vì dạng bài này thưởng cho một lập trường rõ ràng và các lý do được phát triển, và một bài trả lời nước đôi giữa hai lựa chọn bị phạt theo quy tắc.
Lỗi đi theo chiều nào
Một bộ chấm điểm sai 14% số lần có thể sai theo cách vô hại hoặc theo cách có hại. Có hại là nói với một thí sinh cần điểm 8 rằng họ đã có nó trong khi chưa. Vô hại là nói với họ rằng họ còn thiếu một điểm trong khi không phải; điều đó tốn một tuần luyện tập và không gì khác.
Trong năm lần chấm sai của bộ chấm điểm trên 36 bài viết, ba lần là bài viết yếu được chấm 6 hoặc 7 và hai lần là bài viết mạnh được chấm 9. Không bài viết mức giữa nào bị chấm cao, và không bài viết yếu nào bị chấm là mạnh. Nói một cách thực tế: nếu bộ chấm điểm nói bạn đã đạt mức giữa, bạn đã đạt, hoặc còn thiếu một điểm. Nếu nó nói bạn đã đạt mức mạnh, bạn đã đạt. Nơi duy nhất nó nương tay là ở đáy thang, nơi một bài viết ngắn, gọn gàng có thể nhận được một điểm mà nó chưa xứng đáng.
Hãy so sánh với các chatbot trên cùng các bài viết. Claude Opus 5 gọi bảy bài viết mức giữa là 9 hoặc 10, đó là chiều có hại đối với những thí sinh bị ảnh hưởng nhiều nhất. GPT 5.6 sol gọi ba bài viết mức giữa là 6, đó là chiều vô hại, và giữ ba bài viết mạnh ở điểm 9. Con số độ chính xác của một bộ chấm điểm cho bạn biết nó sai thường xuyên đến mức nào; chiều hướng cho bạn biết nó khiến bạn trả giá gì khi nó sai.
Email so với khảo sát
36 bài viết được chia giữa hai dạng bài Writing, và bộ chấm điểm làm tốt hơn một chút ở bài email, với 89%, so với bài trả lời khảo sát, với 83%. Đó là thêm một lần chấm sai ở phía khảo sát, và nó đi theo chiều bạn có thể đoán được.
Bài email được chấm chủ yếu dựa trên độ bao phủ: các ý bắt buộc đã được đề cập chưa, giọng điệu có phù hợp với người đọc không, có lời chào mở đầu và kết thúc không. Đó là những điều bộ chấm điểm kiểm tra theo quy tắc trước khi đưa ra bất kỳ nhận định nào, nên một bài email có đủ những điều đó được xếp mức một cách đáng tin cậy. Bài trả lời khảo sát được chấm dựa trên chất lượng của một lập luận: một lập trường rõ ràng và các lý do được phát triển thay vì chỉ liệt kê. Sự phát triển là một nhận định, và nhận định là nơi một bộ chấm điểm, dù là con người hay không, có thể lệch nhau một điểm.
Với bạn, điều này nghĩa là điểm khảo sát mềm hơn rất nhẹ so với điểm email. Nếu bạn đang lơ lửng ở ranh giới mục tiêu của mình với bài khảo sát, hãy viết hai bài thay vì một trước khi quyết định mình đang đứng ở đâu.
Từ phía màn hình của bạn
Góc nhìn theo mức cho bạn biết bộ chấm điểm làm thế nào với một bài viết đã biết mức. Bạn đang nhìn nó theo chiều ngược lại: bạn có một điểm số và muốn biết nên tin nó đến mức nào.
- Nếu nó nói 4 hoặc 5: bài viết ở mức yếu chín lần trên chín. Một điểm thấp từ bộ chấm điểm là đúng.
- Nếu nó nói 7 hoặc 8: bài viết ở mức giữa mười hai lần trên mười lăm; ba lần còn lại là bài viết yếu được chấm cao hơn một bậc. Điểm 7 hoặc 8 nghĩa là mức giữa, và có thể thấp hơn một chút.
- Nếu nó nói 10 trở lên: bài viết ở mức mạnh mười lần trên mười. Điểm 10 từ bộ chấm điểm là điểm 10.
- Nếu nó nói 9: cả hai điểm 9 trong bài kiểm tra đều là bài viết mạnh đã xác minh. Điểm 9 là điểm số cần đọc kỹ: nó nghĩa là gần tới mức cao nhất, và chỉ còn thiếu một lý do được phát triển hoặc một lựa chọn từ chính xác.
Cùng một bài viết có nhận cùng một điểm không?
Chính xác mà không ổn định thì chỉ là may mắn. Vì vậy chúng tôi chấm cả 36 bài viết ba lần vào các ngày khác nhau, không thay đổi gì giữa các lần. Bộ chấm điểm trả về 86%, 89% và 86%. Cùng mười hai bài viết mức giữa nằm trong khoảng ở mọi lần, và không bài viết nào dịch chuyển quá một điểm giữa các lần chạy.
Tính ổn định đến từ cách mô hình chấm điểm được vận hành: chế độ suy luận tắt, một mức temperature cố định, và so sánh với các bài mẫu đã chấm cố định thay vì một nhận định tự do. Với bạn, điều đó nghĩa là một thay đổi trong điểm số là một thay đổi trong bài viết của bạn. Nếu bạn viết lại một bài và nó chuyển từ 8 lên 10, đó không phải là do bộ chấm điểm đang có một ngày đẹp trời.
So với những gì bạn có thể dùng thay thế
Một con số độ chính xác có ý nghĩa hơn khi có thứ để so sánh. Vì vậy chúng tôi đưa cùng 36 bài viết đó cho các chatbot mà mọi người thực sự dùng để kiểm tra bài viết của mình, theo cách một người sẽ làm: đề bài, bài viết, và một yêu cầu đơn giản cho một điểm số từ 0 đến 12.
Tỷ lệ bài viết được chấm trong mức đã xác minh
Cùng 36 bài viết chính thức. Mỗi mô hình được yêu cầu, bằng lời đơn giản, chấm điểm bài viết; Prepamigo chạy trong cấu hình thực tế thông thường của nó.
86%
Bộ chấm điểm Writing Prepamigo
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
Bộ chấm điểm dẫn trước chatbot tốt nhất tám điểm và các mô hình Claude 25 đến 30 điểm. Hình dạng của các lỗi mới là điều quan trọng. Với bài viết mức giữa, Prepamigo ở mức 100%, GPT 5.6 sol 75%, Gemini 42%, Claude Sonnet 5 33% và Claude Opus 5 25%: một chatbot không có gì để đối chiếu đọc một bài điểm 7 sạch sẽ, chung chung thành điểm 9, hoặc một bài điểm 7 chung chung có vài lỗi thành điểm 6. Với bài viết mạnh, Claude Opus 5 thực sự là giám khảo tốt nhất trong bài kiểm tra với 92% so với 83% của Prepamigo; nó rộng rãi, điều đó đúng ở mức cao nhất và sai ở mọi nơi khác. GPT-4o mini cho điểm 9 cho chín trong mười hai bài viết mạnh.
Điều bộ chấm điểm có mà các chatbot không có là những bài viết thực tế đã chấm cho cùng dạng bài ở mỗi mức để đối chiếu, và một lớp quy tắc kiểm tra các ý bắt buộc, lập trường trong bài khảo sát, lời chào mở đầu và kết thúc, và độ dài trước khi bất kỳ mô hình nào đưa ra nhận định. Đó là sự khác biệt giữa 86% và 78%, và nó nằm gần như hoàn toàn ở giữa thang điểm.
Điều gì mới trong phần đánh giá bài viết của bạn
Điểm số chỉ là một nửa những gì bạn nhận lại. Lớp đánh giá bài viết đã được xây dựng lại cùng với hệ thống chấm điểm, và mọi thứ trong đó đều bám sát vào chính văn bản của bạn. Đây là những điều đã thay đổi.
- Những chỗ sửa bạn có thể tìm thấy ngay trong bài viết của mình. Mỗi chỗ sửa về ngữ pháp, chính tả và từ vựng đều trích dẫn đúng những từ trong bài của bạn, để ứng dụng có thể tô sáng chúng ngay tại chỗ bạn đã viết. Bất cứ điều gì bộ kiểm tra không tìm thấy nguyên văn trong bài viết của bạn sẽ bị loại bỏ trước khi bạn nhìn thấy.
- Một bài mẫu, được xây dựng từ chính bài của bạn. Bạn nhận được một phiên bản viết lại từ chính câu trả lời của mình, giữ nguyên các ý của bạn, đề cập đầy đủ mọi điểm bắt buộc và đạt đúng độ dài 150 đến 200 từ mà đề bài yêu cầu. Nếu bản viết lại đầu tiên chưa đạt độ dài đó, nó sẽ được làm lại một lần trước khi hiển thị.
- Điểm bắt buộc bạn đã bỏ sót, được nêu đích danh. Với bài viết email, phần đánh giá liệt kê những gạch đầu dòng trong đề bài mà câu trả lời của bạn chưa đề cập. Một điểm bị bỏ sót cũng giữ điểm hoàn thành nhiệm vụ ở mức 8 trở xuống, nên con số và phần đánh giá không bao giờ mâu thuẫn với nhau.
- Một yếu tố kìm hãm cho mỗi tiêu chí. Với mỗi tiêu chí trong bốn tiêu chí, phần đánh giá nêu đúng một điều đang kéo điểm đó xuống, bằng lời cụ thể, hoặc nói thẳng rằng không có gì kìm hãm và điều gì đang nâng đỡ điểm đó. Kết luận rằng một tiêu chí không có vấn đề là một câu trả lời thực sự, không phải một khoảng trống.
- Lời chê đặt đúng chỗ. Giọng văn yếu là vấn đề của hoàn thành nhiệm vụ, lựa chọn từ mơ hồ là vấn đề của từ vựng, câu quá dài lê thê là vấn đề của tính dễ đọc. Mỗi nhận xét được xếp vào đúng tiêu chí sở hữu nó thay vì bị gộp chung vào phần tóm tắt tổng thể.
- Viết lại ở cấp độ từng câu. Những câu cụ thể trong bài viết của bạn được trả lại kèm một phiên bản tốt hơn và một dòng giải thích vì sao nó tốt hơn, để bạn nhìn thấy sự thay đổi thay vì chỉ đọc về nó.
- Tiêu chí mạnh nhất và yếu nhất của bạn, đặt cạnh nhau. Phần đánh giá cho bạn biết tiêu chí nào trong bốn tiêu chí đang nâng điểm của bạn và tiêu chí nào đang kéo nó xuống, để bạn biết nên luyện gì tiếp theo mà không phải tự giải mã bốn con số.
Mọi trích dẫn trong phần đánh giá đều được đối chiếu với bài viết của bạn trước khi hiển thị. Nếu bộ kiểm tra không tìm thấy những từ đó, dòng nhận xét sẽ bị loại bỏ. Đó là lý do phần đánh giá không bao giờ bảo bạn sửa một điều bạn không hề viết.
Cách đọc điểm số của bạn
- Điểm 4 hoặc 5 là đúng. Đọc các lỗi được sửa; chúng được trích dẫn từ chính bài viết của bạn. Rồi đọc các ý bị bỏ sót và bài mẫu, và viết lại cùng đề bài đó.
- Điểm 7 hoặc 8 là mức giữa, có thể thấp hơn một chút. Nhìn vào yếu tố kìm hãm của mỗi tiêu chí. Tiêu chí nào gọi tên một vấn đề cụ thể chính là tiêu chí cần luyện.
- Điểm 9 là gần đạt. So sánh bài viết của bạn với bài mẫu từng đoạn một. Khoảng cách thường là một lý do chưa được phát triển hoặc một lựa chọn từ chung chung.
- Điểm 10 trở lên là điểm 10. Bạn đã sẵn sàng ở dạng bài đó. Chuyển sang dạng bài bạn hay né.
- Tin vào thay đổi hơn là mức. Vì điểm số ổn định, một thay đổi giữa các lần làm cùng đề là một thay đổi trong bài viết của bạn.
Một lịch luyện tập tận dụng con số
Ý nghĩa của một điểm số chính xác, ổn định là bạn có thể ngừng nghi ngờ nó và bắt đầu sử dụng nó. Đây là lịch luyện tập chúng tôi gợi ý, xây dựng dựa trên những gì các con số trên trang này nói rằng điểm số có thể và không thể cho bạn biết.
- Viết một bài email và một bài khảo sát, không chuẩn bị trước. Đừng xem bài mẫu trước. Nộp cả hai. Hai điểm số cùng nhau là mức khởi điểm của bạn; nếu chúng chênh nhau hơn một điểm, bài thấp hơn là dạng bài cần luyện.
- Đọc các ý bị bỏ sót và yếu tố kìm hãm trước các lỗi được sửa. Lỗi được sửa chữa từng câu; ý bị bỏ sót và yếu tố kìm hãm chữa điểm số. Một ý bắt buộc bị thiếu đáng giá hơn mọi dấu phẩy.
- Viết lại cùng bài đó với bài mẫu mở bên cạnh. Giữ ý tưởng của bạn, mượn cấu trúc của nó. Nộp lại. Vì bộ chấm điểm cho cùng một bài viết cùng một điểm số, sự khác biệt giữa hai lần nộp hoàn toàn là do bạn viết lại.
- Chuyển sang đề mới khi bài viết lại giữ được điểm. Một điểm 10 đơn lẻ trên một bài viết lại chưa phải là một mức. Hai điểm 10 trên hai đề khác nhau mới là.
- Đọc điểm 9 là suýt đạt và điểm 6 là 6 thật. Bộ chấm điểm không kéo bài viết mức giữa xuống. Nếu nó nói 6, bài viết còn sơ sài, và yếu tố kìm hãm sẽ cho biết ở đâu.
Câu hỏi thường gặp
Điểm Writing của Prepamigo chính xác đến mức nào? 86% ở đúng mức trên 36 bài viết chính thức: 75% yếu, 100% giữa, 83% mạnh. Cùng kết quả, xê dịch một bài, trong ba lần chạy.
Nó có giống điểm thật của tôi không? Không công cụ luyện tập nào có thể hứa điều đó. Điều chúng tôi đo lường là bộ chấm điểm đồng ý với một điểm đã xác minh trên cùng bài viết thường xuyên đến mức nào.
Vì sao tôi nhận điểm 9 cho một bài viết mạnh? Đó là lần chấm sai phổ biến nhất của bộ chấm điểm ở mức cao nhất: hai trong mười hai bài viết mạnh được chấm điểm 9. Viết lại với bài mẫu bên cạnh và chấm lại.
Nó có tốt hơn ChatGPT hay Claude không? 86% so với 78% của GPT 5.6 sol và 61% và 56% của các mô hình Claude. Với bài viết mức giữa, 100% so với 75% của mô hình tốt nhất trong số đó.
Để xem bộ chấm điểm hoạt động như thế nào, đọc bên trong bộ chấm điểm Writing của Prepamigo. Để xem cùng bài kiểm tra trên cả sáu chatbot, đọc AI nào chấm điểm CELPIP Writing chính xác nhất. Hoặc Viết một bài trả lời và tự mình xem các con số. Đọc bài này bằng tiếng Anh
