Tỷ lệ câu trả lời được chấm đúng mức điểm đã xác minh
48 câu trả lời Speaking được giữ riêng để kiểm tra, mỗi mức 16 câu trong ba mức điểm. Claude được cung cấp bản chép lời và được yêu cầu, bằng lời đơn giản, chấm điểm theo thang CELPIP; trung bình của ba lần chạy. Engine 2.0 chạy ở cấu hình vận hành bình thường.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
45%
Claude Sonnet 5
Prepamigo so với các gói chatbot phổ biến nhất
Đơn vị: đô la Canada. Giá của Prepamigo đã bao gồm thuế. Claude Max (từ US$100) và ChatGPT Pro (US$200) được quy đổi theo tỷ giá 1.38, chưa gồm thuế. Độ chính xác là tỷ lệ câu trả lời trong bộ dữ liệu giữ riêng được chấm đúng mức điểm đã xác minh khi mô hình được nêu tên được yêu cầu, bằng lời đơn giản, chấm điểm câu trả lời đó; trung bình của ba lần chạy.
Nếu bạn đã từng dán một bản chép lời Speaking vào Claude và yêu cầu nó chấm điểm cho bạn như một giám khảo CELPIP, bạn đã biết sức hút của cách làm này. Nó trả lời ngay lập tức, tự giải thích lý do, và không bao giờ mệt. Câu hỏi là liệu con số nó đưa ra có phải là con số bạn thực sự sẽ nhận được không. Chúng tôi đã chạy bài kiểm tra đó theo đúng cách một học viên sẽ làm: cùng một bản chép lời, một yêu cầu chấm điểm đơn giản, rồi đếm kết quả.
Câu trả lời ngắn: trên 48 câu trả lời Speaking mà các hệ thống chưa từng thấy, mỗi câu có điểm đã được xác minh độc lập, Prepamigo Scoring Engine 2.0 cho ra đúng mức điểm 81% số lần. Khi được yêu cầu bằng lời đơn giản để chấm cùng các bản chép lời đó, Claude Opus 5 cho ra đúng mức điểm 62% số lần và Claude Sonnet 5 là 45%. Khoảng cách lớn nhất lại nằm đúng ở nơi quan trọng nhất với bất kỳ ai đang nhắm tới điểm cao: với các câu trả lời ở mức cao, Engine 2.0 nhận đúng 71%, Opus 5 nhận đúng 50%, và Sonnet 5 nhận đúng 29%.
Sau đó, chúng tôi làm một điều mà hầu hết các bài so sánh khác bỏ qua. Chúng tôi đưa cho Claude quy trình chấm điểm của riêng mình, với các ví dụ chuẩn hóa thực tế cho từng bài và yêu cầu so sánh bắt buộc với các ví dụ đó, để xem nó có thể đạt mức tốt nhất là bao nhiêu. Opus 5 tăng lên 77% và Sonnet 5 lên 69%. Cả hai vẫn thấp hơn Engine 2.0, và cả hai vẫn gặp khó khăn nhất với các câu trả lời ở mức cao. Phần còn lại của bài viết này sẽ đi qua cả hai bài kiểm tra, các con số ở từng mức điểm, lý do một trợ lý đa dụng có xu hướng dồn về giữa thang điểm, quy trình sử dụng hằng ngày của mỗi bên, và chi phí của mỗi lựa chọn nếu bạn có ý định luyện tập một cách nghiêm túc.
Bài kiểm tra đơn giản: một học viên thực sự nhận được gì
Tám mươi mốt phần trăm so với sáu mươi hai và bốn mươi lăm. Trong bài kiểm tra 48 câu trả lời, khoảng cách giữa Engine 2.0 và Opus 5 là chín điểm số chấm đúng thêm, và khoảng cách giữa Engine 2.0 và Sonnet 5 là mười bảy. Nói cách khác, Engine 2.0 mắc ít hơn 51% lỗi chấm điểm so với Opus 5 và ít hơn 66% so với Sonnet 5.
Ba lần chạy riêng biệt của bài kiểm tra đơn giản cho ra kết quả của Opus 5 là 62%, 65% và 58%, và của Sonnet 5 là 44%, 46% và 46%. Mức chênh lệch vài điểm giữa các lần chạy đó cũng chính là một phát hiện: yêu cầu Claude chấm cùng một bản chép lời vào hai ngày khác nhau và khá thường xuyên bạn sẽ nhận được hai điểm số khác nhau. Engine 2.0 đạt 81.3% ở mỗi trong ba lần chạy.
Khoảng cách mở rộng ở đâu: xét theo từng mức điểm
Hầu hết người chấm, cả con người và máy, đều có xu hướng dồn về giữa thang điểm. Một câu trả lời mạnh trở thành 8 điểm thay vì 10; một câu trả lời yếu trở thành 6 điểm thay vì 5. Xu hướng này vô hình trong một con số trung bình nhưng lộ rõ ngay khi bạn tách kết quả theo từng mức điểm. Với một yêu cầu đơn giản, Claude còn có thêm một thói quen thứ hai: nó dồn điểm xuống thấp, khiến cho ngay cả câu trả lời yếu cũng thường bị chấm dưới mức của nó.
Câu trả lời mức thấp (điểm đã xác minh 4 hoặc 5)
16 câu trả lời được giữ riêng để kiểm tra, yêu cầu đơn giản, trung bình của ba lần chạy. Các lần chấm sai của Sonnet 5 ở đây chủ yếu là điểm 3.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
44%
Claude Sonnet 5
Với các câu trả lời yếu, Engine 2.0 dẫn đầu ở 88%, Opus 5 theo sau ở 77%, và Sonnet 5 tụt xuống 44%. Đây là đầu dễ của thang điểm, và Opus 5 xử lý khá tốt. Sonnet 5 thì không: nó chấm một câu trả lời 4 hoặc 5 điểm thành 3 điểm nhiều hơn là không, đây là sai mức dù chiều lệch có thể hiểu được. Một học viên ở mức này nếu dùng Sonnet 5 để chấm điểm sẽ, hầu hết thời gian, bị bảo rằng mình kém hơn thực tế.
Câu trả lời mức giữa (điểm đã xác minh 7 hoặc 8)
16 câu trả lời được giữ riêng để kiểm tra, yêu cầu đơn giản, trung bình của ba lần chạy. Các lần chấm sai gần như đều là điểm 6.
85%
Prepamigo Engine 2.0
63%
Claude Sonnet 5
58%
Claude Opus 5
Ở mức giữa, Engine 2.0 đạt 85% và hai mô hình Claude đạt 63% và 58%. Câu trả lời mức giữa chứa một sự pha trộn giữa điểm mạnh và điểm yếu cần được cân nhắc kỹ hơn là chỉ phát hiện, và không có ví dụ chuẩn hóa để đối chiếu, cả hai mô hình Claude có xu hướng chỉ nhìn thấy điểm yếu và cho ra điểm 6. Một người nói ở mức 7 hoặc 8 sẽ nghe được rằng mình là mức 6 khoảng bốn trong mười lần.
Câu trả lời mức cao (điểm đã xác minh 10 trở lên)
16 câu trả lời được giữ riêng để kiểm tra, yêu cầu đơn giản, trung bình của ba lần chạy. Gần như mọi lần chấm sai đều là điểm 7 hoặc 8.
71%
Prepamigo Engine 2.0
50%
Claude Opus 5
29%
Claude Sonnet 5
Ở mức cao, Engine 2.0 nhận đúng 71% các câu trả lời mức cao. Opus 5 nhận đúng một nửa. Sonnet 5 nhận đúng 29%, nghĩa là nó cho điểm 7 hoặc 8 cho bảy trong mỗi mười câu trả lời đáng được điểm 10.
Hãy nghĩ về ý nghĩa thực tế của điều này. Giả sử khả năng nói của bạn hôm nay thực sự đang ở mức 10. Bạn ghi âm tám câu trả lời, chép lời chúng, dán vào Claude Sonnet 5 và xin điểm, và nó báo rằng sáu trong số đó là 7 và 8 điểm. Bạn kết luận rằng mình chưa sẵn sàng. Bạn dành thêm ba tuần để luyện tập. Trong khi đó bạn đã sẵn sàng từ đầu. Đây không phải là một tình huống giả định; đây là lỗi đơn lẻ phổ biến nhất trong toàn bộ bài kiểm tra của chúng tôi, và nó rơi nặng nhất lên những thí sinh đã cố gắng nhiều nhất.
Nếu bạn đưa cho Claude quy trình đầy đủ của chúng tôi thì sao?
Rất dễ để đọc các con số của bài kiểm tra đơn giản và kết luận rằng Claude là một mô hình yếu. Không phải vậy. Opus 5, với một khoảng cách khá xa, là hệ thống chấm điểm đa dụng mạnh nhất mà chúng tôi từng kiểm tra. Vấn đề không nằm ở trí tuệ. Vấn đề là khi một mô hình được yêu cầu cho một con số mà không có gì để đối chiếu, nó phải đoán, và khi đoán, nó đoán thấp và dồn về giữa thang điểm.
Vì vậy chúng tôi đã chạy bài kiểm tra thứ hai. Claude nhận được đúng bộ tài liệu mà các giám khảo của Engine 2.0 nhận được: bản chép lời, đề bài, hai ví dụ chuẩn hóa thực tế ở mỗi mức cho đúng bài đó, và một hướng dẫn yêu cầu chỉ ra ví dụ gần nhất cho mỗi trong bốn tiêu chí, thay vì đưa ra một con số. Mỗi mô hình cũng nhận được một lưu ý chuẩn hóa ngắn được điều chỉnh theo xu hướng riêng của nó.
Với quy trình đầy đủ của chúng tôi: tỷ lệ câu trả lời được chấm đúng mức điểm đã xác minh
Cùng 48 câu trả lời được giữ riêng để kiểm tra. Mỗi mô hình Claude chấm mỗi câu trả lời một lần với cùng bản chép lời, hướng dẫn và ví dụ chuẩn hóa như các giám khảo của Engine 2.0.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
69%
Claude Sonnet 5
Các ví dụ chuẩn hóa tạo ra sự khác biệt lớn. Opus 5 tăng từ 62% lên 77%; Sonnet 5 từ 45% lên 69%. Độ chính xác ở mức thấp của cả hai đạt 88%, ngang với Engine 2.0. Độ chính xác ở mức giữa đạt 81% cho cả hai. Điều này đáng để suy ngẫm, vì nó cho thấy giá trị thực sự của một hệ thống chấm điểm được xây dựng chuyên biệt nằm ở đâu: không phải ở một mô hình thông minh hơn, mà ở những ví dụ thực tế cho thấy mỗi mức điểm thực sự nghe như thế nào trên từng bài cụ thể, và ở một câu hỏi buộc mô hình phải so sánh thay vì đoán.
Dù vậy, cả hai mô hình vẫn thấp hơn ở đầu cao của thang điểm. Với quy trình đầy đủ, Opus 5 nhận đúng 63% các câu trả lời mức cao và Sonnet 5 nhận đúng 38%, so với 71% của Engine 2.0. Một mô hình đơn lẻ chấm một lượt vẫn giữ điểm thấp hơn với một câu trả lời mạnh có chút sai sót. Engine 2.0 rút ngắn khoảng cách còn lại bằng ba yếu tố nữa: hai giám khảo độc lập từ hai nhà cung cấp khác nhau, ba lượt chấm từ mỗi giám khảo với phiếu ở giữa được giữ lại, và một quy tắc dung hòa lấy điểm cao hơn khi hai giám khảo bất đồng mạnh, vì phân tích cho thấy phán quyết thấp hơn hầu như luôn là phán quyết sai đối với các câu trả lời mạnh.
Chúng tôi cũng đã thử cách tắt hiển nhiên: giữ nguyên yêu cầu đơn giản và thêm các hướng dẫn như “không dồn điểm về giữa thang” hoặc “một câu trả lời mức 9 không cần phải hoàn hảo”. Chúng không tạo ra thay đổi đáng kể nào. Mô hình đồng ý với hướng dẫn rồi vẫn làm đúng như những gì nó đã định làm. Điều thực sự hiệu quả là thay đổi câu hỏi, và cho nó một thứ thực tế để đối chiếu.
Khoảng cách về quy trình: ghi âm và xong, hay tự làm tất cả
Các con số về độ chính xác giả định rằng việc chấm điểm thực sự diễn ra. Với Claude, có một lượng công việc đáng ngạc nhiên nằm giữa việc bấm dừng ghi âm và việc đọc được điểm số.
Đầu tiên, bạn cần một bản chép lời. Giao diện chat của Claude không chấm điểm bản ghi âm, vì vậy bạn cần tạo ra văn bản. Điều đó có nghĩa là hoặc tự đánh máy lại những gì bạn đã nói, việc này sẽ làm thay đổi câu trả lời, hoặc chạy bản ghi âm qua một công cụ chuyển giọng nói thành văn bản. Và đây là một chi tiết đã khiến chúng tôi mất nhiều độ chính xác trước khi hiểu ra: bản chép lời phải nguyên văn. Mọi từ đệm, mọi đoạn nói lại, mọi lần tự sửa lời đều phải được giữ nguyên. Khi chúng tôi thử một bản chép lời đã “làm sạch” với các khoảng ngần ngừ bị loại bỏ, độ chính xác giảm mười lăm điểm, vì những khoảng ngần ngừ đó chính là bằng chứng mà người chấm cần để đánh giá câu trả lời nghe như thế nào. Hầu hết các công cụ chuyển giọng nói thành văn bản dành cho người dùng phổ thông đều tự động làm sạch.
Thứ hai, bạn cần đề bài. Claude không có một ngân hàng đề theo kiểu CELPIP với đúng thời gian và định dạng. Bạn phải tự viết đề, nghĩa là phải đoán xem bài thi thật sẽ hỏi gì, hoặc tìm một đề ở nơi khác và dán nó cùng với bản chép lời.
Thứ ba, nếu bạn muốn kết quả tốt hơn con số của bài kiểm tra đơn giản, bạn cần các ví dụ chuẩn hóa: những câu trả lời thực tế ở mỗi mức điểm cho cùng dạng bài, với mức điểm đã được xác minh. Đây chính là đầu vào đã đưa Opus 5 từ 62% lên 77% trong bài kiểm tra của chúng tôi, và đây là thứ một học viên không thể tự tạo ra ở nhà.
Thứ tư, bạn phải làm lại toàn bộ điều đó cho câu trả lời tiếp theo. Và câu tiếp theo nữa.
Trên Prepamigo, bạn chọn một bài từ ngân hàng đề, bộ đếm giờ chạy, bạn nói, và khoảng mười giây sau khi bạn dừng lại, điểm số và nhận xét đã hiện trên màn hình. Việc chép lời được thiết kế để luôn nguyên văn, các ví dụ chuẩn hóa được gắn sẵn vào bài tự động, và không có gì để dán, không có gì để nhập yêu cầu. Câu trả lời thứ mười một trong buổi tối tốn công sức đúng bằng câu đầu tiên.
Tính ổn định: cùng một câu trả lời, cùng một điểm số
Một điểm số bạn không thể tái lập không phải là một phép đo. Nếu cùng một bản ghi âm nhận điểm 8 vào thứ Hai và điểm 10 vào thứ Ba, bạn chẳng học được gì về khả năng nói của mình, mà chỉ học được điều gì đó về “tâm trạng” của người chấm. Vì vậy chúng tôi cũng kiểm tra xem mỗi hệ thống có cho ra cùng một câu trả lời hai lần không.
Engine 2.0 được chạy trên 48 câu trả lời giữ riêng ba lần riêng biệt. Nó đạt 81.3% ở mỗi lần chạy. Nhìn vào từng câu trả lời riêng lẻ thay vì con số tổng, 87.5% nhận được điểm số giống hệt nhau qua cả ba lần chạy, và chỉ 4.2% từng dịch chuyển hai điểm hoặc hơn. Số ít đó là những câu trả lời nằm ngay trên ranh giới giữa hai mức điểm, nơi một khác biệt nhỏ trong đánh giá có thể hợp lý đẩy điểm số theo một chiều hay chiều khác.
Bài kiểm tra đơn giản trên Claude dịch chuyển vài điểm giữa các lần chạy ở mức tổng, và dịch chuyển nhiều hơn ở mức từng câu trả lời riêng lẻ. Khoảng cách về tính ổn định này không phải là điều ngẫu nhiên của các mô hình liên quan. Nó xuất phát từ việc bỏ phiếu. Mỗi giám khảo trong Engine 2.0 chấm ba lần trên mỗi câu trả lời và phiếu ở giữa được giữ lại, điều này loại bỏ những kết quả bất thường ngẫu nhiên mà một lượt chấm đơn lẻ có thể tạo ra. Khi chúng tôi thử cùng cấu hình đó nhưng chỉ với một lượt chấm thay vì ba, mức độ đồng thuận giữa các lần chạy giảm từ 87.5% xuống 77.1%. Một cuộc trò chuyện đơn lẻ với Claude là một lượt chấm duy nhất.
Nhận xét bạn có thể hành động theo
Điểm số cho bạn biết bạn đang ở đâu. Nhận xét cho bạn biết nên làm gì tiếp theo, và đây là một lĩnh vực mà Claude thực sự làm tốt. Nó viết rõ ràng, kiên nhẫn, và nếu bạn hỏi vì sao nó cho một điểm số cụ thể, nó sẽ giải thích dài bao nhiêu tùy bạn muốn. Với một thí sinh muốn trao đổi kỹ hơn về một câu trả lời, điều đó rất có giá trị.
Rủi ro cũng giống như với điểm số: một lời giải thích trôi chảy không đồng nghĩa với một chẩn đoán chính xác. Một mô hình đã chấm một câu trả lời 10 điểm thành 7 điểm sẽ giải thích, một cách thuyết phục, vì sao đó là 7 điểm. Nó sẽ tìm ra thứ gì đó để chỉ vào. Và vì Claude không buộc phải xác định bằng chứng trước khi chấm điểm, lời giải thích được viết ra sau, để biện minh cho một con số nó đã chọn từ trước.
Engine 2.0 hoạt động theo chiều ngược lại. Vì mỗi giám khảo phải chỉ ra bằng chứng cho từng tiêu chí nó đánh giá, lớp tạo nhận xét nhận trực tiếp các bằng chứng đó: những câu chữ chính xác từ bản chép lời của bạn đã làm cơ sở cho phán quyết về nội dung, từ vựng, cách bạn nghe, và việc bạn có hoàn thành bài hay không. Nhận xét được viết ra từ chính những bằng chứng đó và trích dẫn đúng lời của bạn. Trong một cuộc kiểm tra 158 trích dẫn trên một mẫu nhận xét, 157 trích dẫn xuất hiện nguyên văn trong bản chép lời. Khi chúng tôi yêu cầu một mô hình đánh giá độc lập so sánh nhận xét của Engine 2.0 với nhận xét mà hệ thống trước đây của chúng tôi tạo ra, mà không biết cái nào là cái nào, nó chọn Engine 2.0 trong 20 trên 24 lần so sánh, cả khi đánh giá theo góc nhìn giám khảo và theo góc nhìn học viên.
Chúng tôi cũng kiểm tra xem nhận xét có đặt lời chê đúng chỗ không. Chúng tôi lấy các câu trả lời mạnh và cố ý làm hỏng một khía cạnh của mỗi câu: chèn lỗi ngữ pháp và từ đệm, đổi từ chính xác thành từ mơ hồ, cắt bỏ chi tiết bổ trợ, hoặc loại bỏ hành động cốt lõi mà đề bài yêu cầu. Trong ba trên bốn trường hợp, tiêu chí mà chúng tôi đã làm hỏng chính là tiêu chí có điểm giảm nhiều nhất. Đây là loại kiểm tra mà một chatbot khó có thể vượt qua, vì nó không có các tiêu chí cố định để đối chiếu.
Chi phí luyện tập mỗi ngày
Một điểm Speaking hữu ích nhất ở câu trả lời thứ bốn mươi của bạn, không phải câu thứ tư. Đó là lúc nó bắt đầu cho bạn biết liệu một thay đổi trong cách bạn nói có thực sự hiệu quả hay không. Vì vậy câu hỏi thực tế không phải là mỗi công cụ tốn bao nhiêu, mà là chi phí để sử dụng nó với số lượng lớn.
Claude Pro có giá US$20 mỗi tháng, khoảng CA$28, hoặc US$17 mỗi tháng nếu thanh toán theo năm, theo công bố trên claude.com vào tháng 9 năm 2026. Nó đi kèm hạn mức sử dụng luân phiên 5 giờ và giới hạn theo tuần; khi bạn chạm một trong hai giới hạn đó, bạn phải chờ. Những bản chép lời dài kèm ví dụ chuẩn hóa chính là loại tin nhắn tiêu tốn nhiều hạn mức đó nhất. Các gói Max, từ US$100 mỗi tháng, khoảng CA$138 chưa gồm thuế, nâng đáng kể các giới hạn nhưng không loại bỏ chúng. Không gói nào trong số này bao gồm ngân hàng câu hỏi, bộ đếm giờ, chép lời, ví dụ chuẩn hóa, hay bất cứ thứ gì riêng cho CELPIP.
Prepamigo có giá CA$24.98 mỗi tháng, hoặc CA$8.25 mỗi tháng nếu chọn gói theo năm, tức CA$98.98 cho cả năm, đã gồm thuế, và bạn có thể hủy bất cứ lúc nào. Mọi gói đều bao gồm chấm điểm không giới hạn bởi Engine 2.0, không có giới hạn theo ngày, theo buổi hay theo tuần, số lần làm bài không giới hạn, và toàn bộ ngân hàng câu hỏi: 80 bộ đề luyện tập hoàn chỉnh và hơn 2,000 bài luyện tập trải rộng bốn kỹ năng Speaking, Writing, Reading và Listening, được viết theo đúng dạng bài, thời gian và định dạng của bài thi CELPIP General.
Nói đơn giản: với chi phí thấp hơn giá của Claude Pro, bạn có được một hệ thống chấm điểm chính xác hơn nhiều với đúng những câu trả lời quan trọng nhất, không bao giờ bắt bạn phải chờ, và đã có sẵn đề bài cùng các ví dụ chuẩn hóa.
Khi nào Claude là công cụ tốt hơn
Đây không phải là một bài viết cho rằng bạn không nên mở Claude khi luyện thi CELPIP. Có một số điều nó làm tốt hơn một hệ thống chấm điểm chuyên biệt, và một thí sinh nghiêm túc hoàn toàn có thể dùng cả hai.
- Trao đổi kỹ về một câu trả lời. Nếu bạn muốn hiểu vì sao một lý do cụ thể còn yếu, hoặc muốn tìm ba lý do tốt hơn, một cuộc trò chuyện là hình thức phù hợp. Engine 2.0 cho bạn một kết luận và bằng chứng; nó không trò chuyện.
- Hỗ trợ từ vựng và cách diễn đạt. Hỏi Claude về năm cách nói tự nhiên hơn cho một ý nào đó là nhanh và hữu ích, và các gợi ý của nó thường khá tốt.
- Luyện Writing. Bài viết không cần chép lời, nên khoảng cách về quy trình nhỏ hơn nhiều. Độ chính xác của Claude khi chấm Writing không thuộc phạm vi bài kiểm tra này, và chúng tôi không đưa ra nhận định nào về nó ở đây.
- Bất cứ điều gì ngoài bài thi. Câu hỏi về hồ sơ nhập cư, lịch học, giải thích một điểm ngữ pháp: Claude là một trợ lý đa dụng, còn Prepamigo không phải vậy.
Điều Claude không nên là, dựa trên các bằng chứng ở đây, là công cụ cho bạn biết bạn đã sẵn sàng hay chưa. Cho việc đó, bạn cần một hệ thống chấm điểm được xây dựng riêng cho công việc này, được kiểm tra trên những câu trả lời nó chưa từng thấy, và được đo lường theo từng mức điểm.
Điều gì mới trong phần đánh giá của bạn
Engine 2.0 đi kèm một lớp đánh giá được xây dựng lại hoàn toàn. Nó đọc các bằng chứng của hai người chấm, không chỉ nhìn vào điểm số, và đã được kiểm tra trên ba kiểu học viên: người lần đầu làm quen với CELPIP, người có nền tiếng Anh yếu muốn tìm bí quyết, và người chỉ có nửa giờ mỗi ngày với kỳ thi tuần sau. Đây là những điều đã thay đổi.
- Trích dẫn đúng lời của chính bạn. Mỗi điểm đánh giá đều trích dẫn chính xác cụm từ trong bài ghi âm của bạn mà người chấm đã phản ứng lại. Nếu một cụm từ được đặt trong dấu ngoặc kép, đó là trích dẫn nguyên văn; trong lần kiểm tra của chúng tôi, 157 trên 158 trích dẫn là như vậy. Phần đánh giá không bao giờ bịa ra điều bạn không nói.
- Một điều cần sửa trước tiên. Mỗi câu trả lời được gợi ý một hành động quan trọng nhất: thay đổi duy nhất giúp nâng điểm của bạn nhiều nhất, được viết bằng lời đơn giản nhất trên trang. Tiếp theo là hai hành động cụ thể khác, rồi một danh sách kiểm tra gồm ba mục để bạn ôn lại trong đầu trước khi bắt đầu nói.
- Lời khuyên phù hợp với từng dạng bài. Đưa ra lời khuyên, miêu tả một khung cảnh và thuyết phục ai đó được chấm dựa trên những tiêu chí khác nhau. Giờ đây phần đánh giá biết mỗi dạng bài trong tám dạng bài đề cao điều gì và nói đúng vào điều đó, thay vì lặp lại những lời khuyên chung cho mọi dạng bài.
- Nên luyện tiêu chí nào trước. Phần đánh giá cho bạn biết tiêu chí nào trong bốn tiêu chí là điểm yếu nhất và tiêu chí nào là điểm mạnh nhất của bạn, để bạn biết điểm tiếp theo nằm ở đâu, mà không giấu điều đó sau một con số.
- Đề bài yêu cầu gì mà bạn đã bỏ lỡ. Đối với tiêu chí hoàn thành nhiệm vụ, phần đánh giá liệt kê cụ thể những phần của đề bài mà bạn chưa đề cập, hoặc nói rõ rằng bạn đã đề cập đầy đủ tất cả.
- Những điều bạn có thể thực sự luyện tập. Mỗi cách làm được gợi ý đều là điều bạn có thể nói ra miệng trước lần thử tiếp theo. Không có lời khuyên nói rõ hơn hay giảm giọng vùng miền: giọng vùng miền không phải là điều mà mức độ dễ nghe đo lường, và phần đánh giá không bao giờ nhận xét về nó.
- Không đổ lỗi vì hết giờ. Một câu trả lời bị đồng hồ cắt ngang sau khi đã hoàn thành nhiệm vụ sẽ không bị trừ điểm vì bị cắt ngang, và phần đánh giá không trách bạn vì điều đó.
Khi một mô hình chấm độc lập so sánh phần đánh giá này với những gì hệ thống trước đây tạo ra cho cùng các câu trả lời, mà không biết đâu là đâu, mô hình này đã chọn phần đánh giá mới trong 20 trên 24 lần so sánh, cả khi chấm theo góc nhìn của người khảo thí và theo góc nhìn của học viên.
Câu hỏi thường gặp
Claude có thể chấm điểm phần luyện Speaking CELPIP của tôi không? Nó sẽ cho bạn một con số. Khi được hỏi đơn giản trên 48 câu trả lời chưa từng thấy với điểm đã xác minh, Claude Opus 5 cho ra đúng mức điểm 62% số lần và Claude Sonnet 5 là 45%, so với 81% của Prepamigo Scoring Engine 2.0. Với các câu trả lời mức cao, Sonnet 5 chỉ đúng 29% số lần.
Prepamigo có chính xác hơn Claude không? Có: 81% so với 62% và 45% với một yêu cầu đơn giản. Với quy trình đầy đủ của chúng tôi cùng các ví dụ chuẩn hóa, Opus 5 đạt 77% và Sonnet 5 đạt 69%, vẫn thấp hơn, và vẫn yếu nhất ở đầu cao của thang điểm.
Mỗi công cụ tốn bao nhiêu? Claude Max có giá khởi điểm US$100 mỗi tháng, khoảng CA$138 chưa gồm thuế, với giới hạn sử dụng; Claude Pro là US$20 với giới hạn chặt hơn. Prepamigo là CA$24.98 mỗi tháng đã gồm thuế, hoặc CA$8.25 mỗi tháng theo gói năm, với chấm điểm không giới hạn và 80 bộ đề luyện tập.
Vì sao Claude cứ cho câu trả lời mạnh của tôi điểm 7 hoặc 8? Một mô hình được yêu cầu cho một con số mà không có gì để đối chiếu sẽ dồn điểm thấp và về giữa thang, và một câu trả lời mức cao không bao giờ hoàn hảo tuyệt đối. Khi được hỏi đơn giản, Sonnet 5 chỉ cho câu trả lời mức cao điểm 9 hoặc cao hơn 29% số lần.
Để xem cách chấm điểm thực sự hoạt động, đọc bên trong Scoring Engine 2.0. Để xem bảng xếp hạng đầy đủ bao gồm GPT và Gemini, đọc AI nào chấm CELPIP Speaking chính xác nhất. Hoặc bỏ qua phần đọc và Ghi âm một câu trả lời. Đọc bài này bằng tiếng Anh
