Engine 2.0 trên 48 câu trả lời được giữ riêng để kiểm tra
Tỷ lệ câu trả lời được chấm đúng mức điểm đã xác minh. Ba lần chạy riêng biệt vào các ngày khác nhau đều cho ra 81.3% ở mức tổng.
81%
Đúng mức điểm
Prepamigo so với các gói chatbot phổ biến nhất
Đơn vị: đô la Canada. Giá của Prepamigo đã bao gồm thuế. Claude Max (từ US$100) và ChatGPT Pro (US$200) được quy đổi theo tỷ giá 1.38, chưa gồm thuế. Độ chính xác là tỷ lệ câu trả lời trong bộ dữ liệu giữ riêng được chấm đúng mức điểm đã xác minh khi mô hình được nêu tên được yêu cầu, bằng lời đơn giản, chấm điểm câu trả lời đó; trung bình của ba lần chạy.
Đây là câu hỏi đúng cần đặt ra cho bất kỳ công cụ luyện tập nào, và hầu hết các công cụ không trả lời được nó. Một điểm Speaking chỉ có giá trị nếu nó cho biết một giám khảo thật sẽ nói gì, và cách duy nhất để biết điều đó là đo lường. Vì vậy bài viết này chính là phần đo lường đó, được trình bày một cách trung thực, bao gồm cả những phần khiến chúng tôi tự hào và những phần không.
Câu trả lời trong một đoạn văn: trên 48 câu trả lời Speaking mà Scoring Engine 2.0 của Prepamigo chưa từng thấy, mỗi câu có một điểm số đã được xác minh độc lập, hệ thống cho ra đúng mức điểm 81% số lần và trong phạm vi 1 điểm của nó 92% số lần. Nó cho ra cùng con số 81% ở mỗi trong ba lần chạy riêng biệt. Nó chính xác nhất với câu trả lời mức yếu và mức giữa, ở 88% và 85%, và kém chính xác nhất với câu trả lời mức cao, ở 71%, nơi lỗi đặc trưng của nó là cho một câu trả lời 10 điểm thành 8 điểm. Khi được yêu cầu bằng lời đơn giản để chấm cùng các bản chép lời, mô hình AI đa dụng tốt nhất mà chúng tôi kiểm tra đạt 62%, và mô hình yếu nhất đạt 31%; với quy trình chấm điểm đầy đủ của chúng tôi, mô hình tốt nhất đạt 77%.
Phần tiếp theo trình bày cách chúng tôi có được các con số này, ý nghĩa của chúng ở từng mức điểm, mức độ ổn định của chúng, nơi các lỗi xuất hiện, cách điểm số này so với các lựa chọn khác mà bạn có thể đang dùng, và cách đọc điểm số của riêng bạn dựa trên tất cả những điều đó. Nếu bạn chỉ muốn lời khuyên thực tế, hãy chuyển đến phần đọc điểm số của bạn. Nếu bạn muốn quyết định có nên tin con số này hay không, hãy đọc toàn bộ bài viết.
“Chính xác” ở đây nghĩa là gì
Trước khi đến với bất kỳ con số nào, hãy nói rõ định nghĩa. Chúng tôi không tuyên bố rằng điểm số trên Prepamigo dự đoán kết quả bài thi của bạn. Không công cụ luyện tập nào có thể hứa điều đó, và ai làm vậy đang đoán mò. Điều chúng tôi đo hẹp hơn và trung thực hơn: với một câu trả lời nói đã có điểm được xác minh độc lập, hệ thống cho ra điểm ở đúng mức đó bao nhiêu lần?
CELPIP Speaking được báo cáo trên một thang điểm lên đến 12, và các điểm đã xác minh trong dữ liệu tham chiếu của chúng tôi nằm trong ba mức: thấp, nghĩa là 4 hoặc 5; giữa, nghĩa là 7 hoặc 8; và cao, nghĩa là 10 trở lên. Chúng tôi tính hệ thống là đúng khi điểm số của nó rơi vào đúng mức đã xác minh. Một câu trả lời được xác minh ở mức cao được chấm đúng nếu hệ thống cho nó điểm 9, 10 hoặc 11. Với cách tính chặt hơn chỉ chấp nhận 10 và cao hơn, mọi con số trên trang này giảm đi vài điểm nhưng mọi phép so sánh vẫn giữ đúng thứ tự.
Các con số chính
81% có ý nghĩa gì trong thực tế? Nếu bạn ghi âm mười câu trả lời ở một trình độ ổn định, hệ thống sẽ đặt khoảng tám câu vào đúng mức và khoảng một câu nữa trong phạm vi 1 điểm của mức đó. Nó sẽ không đặt một câu trả lời 5 điểm vào mức 10 hoặc một câu 10 điểm vào mức 5; điều đó không xảy ra một lần nào trong 144 câu trả lời được chấm qua ba lần chạy. Những lỗi hệ thống mắc phải là lỗi của một giám khảo cẩn trọng trên một câu trả lời nằm ở ranh giới, và phần tiếp theo cho thấy chúng tập trung ở đâu.
Độ chính xác ở từng mức điểm
Độ chính xác theo mức đã xác minh
16 câu trả lời được giữ riêng để kiểm tra cho mỗi mức. Mỗi cột là tỷ lệ câu trả lời của mức đó được chấm đúng mức.
88%
Mức thấp (4–5)
85%
Mức giữa (7–8)
71%
Mức cao (10+)
Câu trả lời mức thấp: 88%. Câu trả lời yếu là dễ nhận biết nhất. Chúng thường ngắn, lặp lại từ ngữ của đề bài, và bỏ dở một phần của bài. Hệ thống nhận ra những dấu hiệu đó hầu hết thời gian. Khi nó chấm sai, nó chấm sai lên trên: trong mọi trường hợp, câu trả lời đó bị chấm điểm 8 thay vì 4 hoặc 5. Nguyên nhân gần như luôn là một câu trả lời nghe trôi chảy và tự tin nhưng nói rất ít; sự trôi chảy khiến câu trả lời nhận một mức nó chưa xứng đáng về mặt nội dung. Chúng tôi biết điều này vì có thể thấy các giám khảo đặt tiêu chí nào ở mức cao, và luôn là độ dễ nghe.
Câu trả lời mức giữa: 85%. Đây là những câu khó chấm nhất theo một nghĩa nào đó, vì chúng chứa một sự pha trộn thực sự giữa điểm mạnh và điểm yếu cần được cân nhắc kỹ hơn là chỉ phát hiện. Các lần chấm sai của hệ thống ở đây đi theo cả hai chiều. Một vài câu trả lời có ngần ngừ rõ nhưng ý tưởng vững bị kéo xuống mức 5 hoặc 6; một vài câu trả lời nghe trau chuốt bị đẩy lên mức 10. Bước dung hòa giữa hai giám khảo bắt được hầu hết các trường hợp này, đó là lý do vì sao con số này cao như vậy.
Câu trả lời mức cao: 71%. Đây là mức yếu nhất và là mức chúng tôi nói đến nhiều nhất, vì lỗi ở đây rất nhất quán. Khi hệ thống chấm sai một câu trả lời mức cao, nó cho điểm 8. Không phải 7, không phải 6; là 8, trong mọi trường hợp trừ một vài điểm 9 vẫn được tính là đúng. Hệ thống nhìn thấy một câu trả lời mạnh và giữ lại đúng một nấc.
Điều này cần thêm bối cảnh. Xu hướng dồn về điểm 8 với câu trả lời mạnh không phải là một điểm kỳ quặc riêng của Prepamigo; đó là lỗi đặc trưng của mọi hệ thống chấm điểm tự động chúng tôi từng kiểm tra, đã được chuẩn hóa theo con người hay chưa. Hệ thống trước đây của chúng tôi còn tệ hơn nhiều. Khi được hỏi đơn giản để chấm cùng các câu trả lời, mô hình đa dụng tốt nhất chỉ nhận đúng 56% các câu trả lời mức cao; mô hình đứng sau các gói trả phí của ChatGPT nhận đúng 25%; và ngay cả với quy trình đầy đủ của chúng tôi, không mô hình nào vượt qua 63%. Bảy mươi mốt phần trăm là con số tốt nhất chúng tôi đạt được, và nó vẫn là con số chúng tôi muốn cải thiện nhất.
Vấn đề điểm 8, nhìn từ phía bạn
Góc nhìn theo mức cho biết hệ thống làm gì với một câu trả lời có mức đã biết. Bạn đang nhìn theo chiều ngược lại: bạn có một điểm số và muốn biết nên tin nó đến đâu. Vì vậy đây là cùng dữ liệu đó, xoay ngược lại. Với mỗi điểm số hệ thống cho ra, câu trả lời thực ra ở mức nào bao nhiêu lần?
- Nếu hệ thống báo 4 hoặc 5: câu trả lời ở mức thấp 93% số lần. Số còn lại là các câu trả lời mức giữa có ngần ngừ nặng. Một điểm số thấp từ Engine 2.0 hầu như luôn đúng.
- Nếu hệ thống báo 10: câu trả lời ở mức cao 92% số lần. Một điểm 10 từ Engine 2.0 là một điểm 10.
- Nếu hệ thống báo 8: câu trả lời ở mức giữa 67% số lần, ở mức cao 23% số lần, và ở mức thấp 10% số lần. Điểm 8 là điểm số duy nhất đáng để đọc kỹ.
Nói đơn giản: một điểm 8 từ Engine 2.0 có nghĩa là “mức giữa, khả năng cao, nhưng có thể tốt hơn”. Khoảng một trong bốn câu trả lời nhận điểm 8 thực ra là một điểm 10. Nếu bạn nhận điểm 8 cho một câu trả lời bạn nghĩ là xuất sắc, đừng kết luận rằng mình chưa sẵn sàng. Hãy ghi âm lại đúng bài đó. Một điểm 10 nhất quán qua ba lần luyện là một điểm 10; một điểm 8 nhất quán qua ba lần luyện là một điểm 8; một kết quả pha trộn là một câu trả lời nằm trên ranh giới, và nhận xét sẽ cho bạn biết tiêu chí nào đang giữ nó ở đó.
Cùng một bản ghi âm có nhận cùng một điểm số không?
Độ chính xác mà không có tính ổn định chỉ là may rủi. Nếu cùng một bản ghi âm có thể nhận điểm 8 hôm nay và điểm 10 ngày mai, con số 81% chỉ là một trung bình trên sự nhiễu và bạn không thể dùng điểm số để theo dõi bất cứ điều gì. Vì vậy chúng tôi đã kiểm tra khả năng tái lập một cách trực tiếp.
48 câu trả lời giữ riêng được chấm ba lần riêng biệt, vào các ngày khác nhau, không thay đổi gì giữa các lần. Con số tổng là 81.3% ở mỗi lần chạy. Ở mức từng câu trả lời riêng lẻ, 87.5% nhận được điểm số giống hệt nhau cả ba lần, và chỉ 4.2% từng dịch chuyển hai điểm hoặc hơn. Số ít đó là những câu trả lời nằm ngay trên ranh giới giữa hai mức, nơi một khác biệt nhỏ trong đánh giá có thể hợp lý đẩy điểm số theo một chiều hay chiều khác.
Tính ổn định đến từ một lựa chọn thiết kế cụ thể. Mỗi trong hai giám khảo của hệ thống chấm ba lần trên mỗi câu trả lời, và phiếu ở giữa được giữ lại. Khi chúng tôi thử cùng cấu hình đó nhưng chỉ với một lượt chấm thay vì ba, tỷ lệ điểm số giống nhau qua các lần chạy giảm từ 87.5% xuống 77%, và tỷ lệ câu trả lời dịch chuyển hai điểm hoặc hơn tăng hơn gấp đôi. Việc bỏ phiếu không làm thay đổi con số độ chính xác. Nó thay đổi việc con số độ chính xác đó có ý nghĩa hay không.
Với bạn, tính ổn định có nghĩa là một thay đổi trong điểm số là một thay đổi trong cách nói của bạn. Nếu bạn ghi âm cùng một dạng bài ba lần trong một tuần và điểm số thay đổi từ 8 lên 10, đó không phải là do người chấm gặp ngày tốt. Đó là do chính bạn.
So với những công cụ bạn có thể đang dùng thay thế
Một con số độ chính xác có ý nghĩa hơn khi có thứ để so sánh. Vì vậy chúng tôi cho cùng 48 câu trả lời giữ riêng chạy qua các mô hình AI đa dụng mà mọi người thực sự dùng để chấm điểm luyện tập của mình, theo đúng cách một người sẽ làm: chúng tôi cung cấp cho mỗi mô hình bản chép lời nguyên văn và đề bài, cho biết nó là một giám khảo CELPIP giàu kinh nghiệm, và xin một điểm số từ 0 đến 12. Ba lần chạy mỗi mô hình, lấy trung bình.
Tỷ lệ câu trả lời được chấm đúng mức điểm đã xác minh
Cùng 48 câu trả lời được giữ riêng để kiểm tra. Mỗi mô hình được yêu cầu, bằng lời đơn giản, chấm điểm bản chép lời; trung bình của ba lần chạy. Engine 2.0 chạy ở cấu hình vận hành bình thường.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Engine 2.0 dẫn trước mọi mô hình từ mười chín đến năm mươi mốt điểm. Khi được hỏi đơn giản, mọi mô hình đa dụng đều chấm khắt khe: lỗi trên một câu trả lời yếu thường là điểm 3, lỗi trên một câu trả lời mạnh thường là 7 hoặc 8. Claude Opus 5 và Gemini là hai mô hình duy nhất vượt mức một nửa. Ba mô hình GPT lớn hơn đạt từ 31% đến 37%, và nhận đúng một câu trả lời mức cao từ 13% đến 27% số lần.
Sau đó chúng tôi đưa cho mọi mô hình quy trình đầy đủ của mình: cùng ví dụ chuẩn hóa cho đúng bài, cùng phép so sánh bắt buộc, và một lưu ý chuẩn hóa ngắn điều chỉnh theo xu hướng riêng của nó. Đây là kết quả tốt nhất mỗi mô hình có thể đạt được trong tay chúng tôi, và không phải là điều một học viên có thể tái tạo nếu không có các ví dụ đó. Opus 5 tăng lên 77%, GPT 5.6 sol và Gemini lên 71%, GPT 5.5 và Sonnet 5 lên 69%, luna lên 63% và GPT-4o mini lên 50%. Mỗi mô hình trong số đó vẫn thấp hơn Engine 2.0, và không mô hình nào nhận đúng hơn 63% các câu trả lời mức cao.
Điều gì mới trong phần đánh giá của bạn
Engine 2.0 đi kèm một lớp đánh giá được xây dựng lại hoàn toàn. Nó đọc các bằng chứng của hai người chấm, không chỉ nhìn vào điểm số, và đã được kiểm tra trên ba kiểu học viên: người lần đầu làm quen với CELPIP, người có nền tiếng Anh yếu muốn tìm bí quyết, và người chỉ có nửa giờ mỗi ngày với kỳ thi tuần sau. Đây là những điều đã thay đổi.
- Trích dẫn đúng lời của chính bạn. Mỗi điểm đánh giá đều trích dẫn chính xác cụm từ trong bài ghi âm của bạn mà người chấm đã phản ứng lại. Nếu một cụm từ được đặt trong dấu ngoặc kép, đó là trích dẫn nguyên văn; trong lần kiểm tra của chúng tôi, 157 trên 158 trích dẫn là như vậy. Phần đánh giá không bao giờ bịa ra điều bạn không nói.
- Một điều cần sửa trước tiên. Mỗi câu trả lời được gợi ý một hành động quan trọng nhất: thay đổi duy nhất giúp nâng điểm của bạn nhiều nhất, được viết bằng lời đơn giản nhất trên trang. Tiếp theo là hai hành động cụ thể khác, rồi một danh sách kiểm tra gồm ba mục để bạn ôn lại trong đầu trước khi bắt đầu nói.
- Lời khuyên phù hợp với từng dạng bài. Đưa ra lời khuyên, miêu tả một khung cảnh và thuyết phục ai đó được chấm dựa trên những tiêu chí khác nhau. Giờ đây phần đánh giá biết mỗi dạng bài trong tám dạng bài đề cao điều gì và nói đúng vào điều đó, thay vì lặp lại những lời khuyên chung cho mọi dạng bài.
- Nên luyện tiêu chí nào trước. Phần đánh giá cho bạn biết tiêu chí nào trong bốn tiêu chí là điểm yếu nhất và tiêu chí nào là điểm mạnh nhất của bạn, để bạn biết điểm tiếp theo nằm ở đâu, mà không giấu điều đó sau một con số.
- Đề bài yêu cầu gì mà bạn đã bỏ lỡ. Đối với tiêu chí hoàn thành nhiệm vụ, phần đánh giá liệt kê cụ thể những phần của đề bài mà bạn chưa đề cập, hoặc nói rõ rằng bạn đã đề cập đầy đủ tất cả.
- Những điều bạn có thể thực sự luyện tập. Mỗi cách làm được gợi ý đều là điều bạn có thể nói ra miệng trước lần thử tiếp theo. Không có lời khuyên nói rõ hơn hay giảm giọng vùng miền: giọng vùng miền không phải là điều mà mức độ dễ nghe đo lường, và phần đánh giá không bao giờ nhận xét về nó.
- Không đổ lỗi vì hết giờ. Một câu trả lời bị đồng hồ cắt ngang sau khi đã hoàn thành nhiệm vụ sẽ không bị trừ điểm vì bị cắt ngang, và phần đánh giá không trách bạn vì điều đó.
Khi một mô hình chấm độc lập so sánh phần đánh giá này với những gì hệ thống trước đây tạo ra cho cùng các câu trả lời, mà không biết đâu là đâu, mô hình này đã chọn phần đánh giá mới trong 20 trên 24 lần so sánh, cả khi chấm theo góc nhìn của người khảo thí và theo góc nhìn của học viên.
Cách đọc điểm số của bạn
- Một điểm 4 hoặc 5 hầu như chắc chắn đúng. Hệ thống nhận ra câu trả lời yếu 88% số lần, và khi nó báo 4 hoặc 5, nó đúng 93% số lần. Hãy đọc nhận xét để biết tiêu chí nào thấp nhất và tập trung vào tiêu chí đó.
- Một điểm 10 là một điểm 10. Khi hệ thống báo 10, câu trả lời ở mức cao 92% số lần. Bạn đã sẵn sàng với dạng bài đó. Hãy chuyển sang những dạng bài bạn còn tránh.
- Một điểm 8 là một câu hỏi. Hai phần ba số lần nó có nghĩa là mức giữa. Một lần trong bốn nó có nghĩa là mức cao. Hãy ghi âm lại đúng bài đó và nhìn vào xu hướng qua nhiều lần luyện.
- Tin vào sự thay đổi hơn là các mức riêng lẻ. Vì điểm số ổn định, một thay đổi qua các lần luyện là một thay đổi trong cách nói của bạn. Lặp lại cùng một dạng bài là cách nhanh nhất để biết một thói quen mới có hiệu quả hay không.
- Đọc các trích dẫn. Những câu chữ được trích dẫn trong nhận xét của bạn là những gì các giám khảo phản ứng lại. Đó là những từ ngữ cụ thể cần thay đổi.
Câu hỏi thường gặp
Điểm Speaking của Prepamigo chính xác đến mức nào? Trên 48 câu trả lời chưa từng thấy với điểm đã xác minh: 81% đúng mức, 92% trong phạm vi 1 điểm, giống hệt nhau qua ba lần chạy. Theo mức: 88% mức thấp, 85% mức giữa, 71% mức cao.
Nó có giống điểm thi thật của tôi không? Không công cụ luyện tập nào có thể hứa điều đó. Điều chúng tôi đo là tần suất hệ thống đồng thuận với một điểm đã xác minh trên cùng câu trả lời. Hãy đọc điểm số của bạn như một mức kèm một chiều hướng, và nhìn vào xu hướng qua nhiều lần luyện.
Vì sao tôi nhận điểm 8 cho một câu trả lời tôi nghĩ là xuất sắc? Đó là lỗi lớn nhất còn lại của hệ thống: một trong bốn điểm 8 thực ra là một điểm 10. Hãy ghi âm lại đúng bài đó. Một điểm 10 nhất quán qua nhiều lần luyện là một điểm 10.
Cùng một bản ghi âm sẽ nhận cùng một điểm số hai lần chứ? 87.5% giống hệt nhau qua ba lần chạy; chỉ 4.2% dịch chuyển hai điểm hoặc hơn, tất cả đều nằm trên ranh giới giữa hai mức.
Để xem cách hệ thống hoạt động từng bước, đọc bên trong Scoring Engine 2.0. Để xem cùng bài kiểm tra chạy trên GPT, Claude và Gemini, đọc AI nào chấm CELPIP Speaking chính xác nhất. Hoặc Ghi âm một câu trả lời và tự mình xem các con số. Đọc bài này bằng tiếng Anh
