Chấm điểm

Giới thiệu Prepamigo Scoring Engine 2.0 cho Speaking

6 tháng 9, 2026

Prepamigo Scoring Engine 2.0 so với các mô hình hàng đầu làm giám khảo

Tỷ lệ câu trả lời Speaking mà điểm số khớp với điểm đã xác minh độc lập. 48 câu trả lời mà các hệ thống chưa từng thấy, chia đều giữa mức thấp, mức giữa và mức cao. Mỗi mô hình được cung cấp bản chép lời và được yêu cầu, bằng lời đơn giản, chấm điểm theo thang CELPIP; trung bình của ba lần chạy.

81%

Prepamigo Scoring Engine 2.0Prepamigo

62%

Claude Opus 5Anthropic

58%

GeminiGoogle

45%

Claude Sonnet 5Anthropic

45%

GPT-4o miniOpenAI

37%

GPT 5.5OpenAI

35%

GPT 5.6 solOpenAI

31%

GPT 5.6 lunaOpenAI

Prepamigo so với các gói chatbot phổ biến nhất

Đơn vị: đô la Canada. Giá của Prepamigo đã bao gồm thuế. Claude Max (từ US$100) và ChatGPT Pro (US$200) được quy đổi theo tỷ giá 1.38, chưa gồm thuế. Độ chính xác là tỷ lệ câu trả lời trong bộ dữ liệu giữ riêng được chấm đúng mức điểm đã xác minh khi mô hình được nêu tên được yêu cầu, bằng lời đơn giản, chấm điểm câu trả lời đó; trung bình của ba lần chạy.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Giá mỗi tháng
CA$24.98 (đã gồm thuế)
CA$138+ (chưa gồm thuế)
CA$276 (chưa gồm thuế)
Chấm điểm
Không giới hạn
Có giới hạn
Có giới hạn
Ngân hàng câu hỏi có sẵn
Không
Không
Bộ đề luyện tập
80
Không có
Không có
Bài luyện tập
2,000+
Không có
Không có
Đúng định dạng CELPIP
Không
Không
Độ chính xác
81%
62%
35%
Câu trả lời mức cao
71%
50%
25%

Hệ thống chấm điểm Speaking chính xác nhất của chúng tôi từ trước đến nay. Trên các câu trả lời nó chưa từng thấy, Prepamigo Scoring Engine 2.0 khớp với điểm đã xác minh 81% số lần, vượt qua mọi mô hình hàng đầu mà chúng tôi kiểm tra trên cùng công việc, và là một bước tiến rõ rệt so với Engine 1.0, hệ thống mà nó thay thế.

Hôm nay chúng tôi phát hành Prepamigo Scoring Engine 2.0 cho Speaking, hệ thống chấm điểm mọi câu trả lời luyện Speaking trên Prepamigo. Engine 2.0 là một thiết kế lại hoàn toàn cách chúng tôi chấm điểm. Thay cho một lượt chấm đơn lẻ, nó dùng hai giám khảo độc lập, so sánh trực tiếp mỗi câu trả lời với các ví dụ đã chuẩn hóa, chấm nhiều lần, rồi dung hòa các câu trả lời của chúng trước khi hiện điểm số.

Kết quả là một hệ thống chấm điểm chính xác hơn hẳn bất kỳ mô hình hàng đầu nào khi được dùng theo cách một học viên sẽ dùng. Trên một bộ dữ liệu giữ riêng gồm các câu trả lời nói thực tế với điểm đã được xác minh độc lập, Engine 2.0 cho ra đúng điểm số 81% số lần. Khi được yêu cầu bằng lời đơn giản để chấm cùng các bản chép lời, mô hình mạnh nhất trong số đó, Claude Opus 5, đạt 62%. Gemini đạt 58%. Claude Sonnet 5 và GPT-4o mini đạt 45%, GPT 5.5 đạt 37%, GPT 5.6 sol đạt 35%, và GPT 5.6 luna đạt 31%. Khi chúng tôi sau đó đưa cho mọi mô hình quy trình của riêng Engine 2.0, với các ví dụ chuẩn hóa thực tế cho từng bài, mô hình tốt nhất trong số đó tăng lên 77% và vẫn thấp hơn.

Độ chính xác quan trọng nhất ở nơi khó đạt được nhất. Engine 2.0 nhận đúng một câu trả lời mức cao 71% số lần. Khi được hỏi đơn giản, không mô hình nào khác nhận đúng hơn 56%, và các mô hình GPT chỉ nhận đúng từ 13% đến 27%. Engine 2.0 cũng chống lại được lỗi phổ biến nhất của các hệ thống chấm điểm tự động: điểm số dồn thấp và về giữa thang bất kể câu trả lời thực sự mạnh hay yếu đến đâu. Đó chính là điểm yếu chúng tôi thấy thường xuyên nhất ở Engine 1.0.

Engine 2.0 nhanh hơn, ổn định hơn, và tạo ra nhận xét trích dẫn đúng lời của học viên. Nó đã hoạt động ngay hôm nay cho mọi người dùng Prepamigo. Trang này giải thích nó làm gì, chúng tôi đo lường nó như thế nào, và giới hạn của nó hiện đang ở đâu.

Độ chính xác so với điểm đã xác minh

Câu hỏi chúng tôi quan tâm rất đơn giản. Khi một học viên ghi âm một câu trả lời, điểm số hiện trên màn hình có khớp với điểm mà một giám khảo đáng tin cậy sẽ cho không? Để trả lời, chúng tôi xây dựng một tập dữ liệu kiểm tra gồm các câu trả lời nói thực tế trên cả tám dạng bài Speaking, mỗi câu có một điểm số đã được xác minh độc lập, và chúng tôi chia tập dữ liệu đều nhau giữa mức thấp, mức giữa và mức cao để không mức nào có thể chi phối kết quả.

Phép so sánh dùng 48 câu trả lời trong số đó, được giữ riêng ngay từ đầu. Không ai trong nhóm sử dụng chúng khi xây dựng hoặc tinh chỉnh Engine 2.0. Mọi câu trả lời đều được chép lời từng từ. Sau đó mỗi mô hình được cho biết nó là một giám khảo CELPIP giàu kinh nghiệm, được cung cấp đề bài và bản chép lời, và được yêu cầu chấm điểm câu trả lời từ 0 đến 12, ba lần, vào các ngày khác nhau. Chúng tôi lấy trung bình ba lần chạy và đếm số lần điểm số khớp với mức của điểm đã xác minh.

51%

ít lỗi hơn so với Claude Opus 5

19 điểm chấm sai trên mỗi 100 câu trả lời, so với 38.

71%

ít lỗi hơn so với GPT 5.6 sol

19 điểm chấm sai trên mỗi 100, so với 65.

71%

câu trả lời mức cao được nhận đúng

Mô hình tốt nhất trong số còn lại nhận đúng 56%; GPT 5.6 sol nhận đúng 25%.

Có ba điều đáng chú ý trong các con số này. Thứ nhất, khoảng cách không nhỏ. Mười chín điểm so với mô hình hàng đầu mạnh nhất và bốn mươi sáu điểm so với mô hình đứng sau các gói trả phí của ChatGPT, trên một bài kiểm tra 48 câu trả lời, tương ứng với khoảng cách giữa chín và hai mươi hai điểm số chấm đúng thêm. Thứ hai, khoảng cách này không phải là kết quả của một bài kiểm tra dễ dãi. 48 câu trả lời được chọn trước khi thiết kế của Engine 2.0 hoàn tất và không hề bị đụng đến trong suốt quá trình phát triển. Thứ ba, phép so sánh này chính là phép so sánh quan trọng với một học viên: nó đo lường điều bạn nhận được khi dán một bản chép lời vào chatbot và hỏi điểm, đúng như cách hầu hết mọi người đang dùng các mô hình này.

Một lưu ý về ý nghĩa của “đúng” ở đây. Điểm đã xác minh trên thang này đến theo mức chứ không phải một điểm số đơn lẻ, vì vậy chúng tôi tính một điểm số là đúng khi nó rơi vào đúng mức đã xác minh. Chẳng hạn, một câu trả lời được xác minh ở mức cao được chấm đúng nếu hệ thống cho nó điểm 9, 10 hoặc 11. Với cách tính chặt hơn chỉ chấp nhận 10 và cao hơn, mọi hệ thống mất đi vài điểm nhưng thứ hạng không thay đổi.

Hệ thốngYêu cầu đơn giảnVới quy trình đầy đủ của chúng tôi
Prepamigo Scoring Engine 2.081.3%
Claude Opus 561.8%77.1%
Gemini58.3%70.8%
Claude Sonnet 545.1%68.8%
GPT-4o mini45.1%50.0%
GPT 5.536.8%68.8%
GPT 5.6 sol35.4%70.8%
GPT 5.6 luna30.6%62.5%

Kết quả ở từng mức điểm

Một con số độ chính xác trung bình có thể che giấu rất nhiều điều. Một hệ thống chấm điểm xuất sắc với câu trả lời yếu nhưng bất lực với câu trả lời mạnh có thể vẫn cho ra một con số tổng khá ổn, trong khi lại làm hại đúng những học viên cần một câu trả lời chính xác nhất. Vì vậy chúng tôi báo cáo độ chính xác riêng cho từng mức trong ba mức của tập dữ liệu kiểm tra: mức thấp 4 hoặc 5, mức giữa 7 hoặc 8, và mức cao 10 trở lên.

Hầu hết người chấm, cả con người và máy, đều có xu hướng dồn về giữa thang điểm. Một câu trả lời mạnh nhận điểm 8 thay vì 10. Một câu trả lời yếu nhận điểm 6 thay vì 5. Không có gì để đối chiếu, các mô hình hàng đầu còn có thêm một thói quen thứ hai: chúng dồn điểm xuống thấp, khiến một câu trả lời yếu thường bị chấm điểm 3 và một câu trả lời mạnh bị chấm điểm 7. Engine 2.0 được xây dựng đặc biệt để chống lại cả hai xu hướng này, và kết quả thể hiện rõ nhất ở đầu cao của thang điểm.

Mức thấp · điểm đã xác minh 4 hoặc 5

16 câu trả lời được giữ riêng để kiểm tra cho mỗi hệ thống, yêu cầu đơn giản, trung bình của ba lần chạy.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

Mức giữa · điểm đã xác minh 7 hoặc 8

16 câu trả lời được giữ riêng để kiểm tra cho mỗi hệ thống, yêu cầu đơn giản, trung bình của ba lần chạy.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

Mức cao · điểm đã xác minh 10 trở lên

16 câu trả lời được giữ riêng để kiểm tra cho mỗi hệ thống, yêu cầu đơn giản, trung bình của ba lần chạy. Gần như mọi lần chấm sai đều là điểm 7 hoặc 8.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

Với những học viên đã ở trình độ mạnh, đây là sự khác biệt quan trọng nhất. Khi được hỏi đơn giản, không mô hình nào khác nhận đúng hơn 56% các câu trả lời mức cao; GPT 5.6 sol nhận đúng một trong bốn, và GPT 5.6 luna một trong tám. Engine 2.0 nhận đúng 71%.

Ở mức thấp, Engine 2.0 dẫn đầu với 88%, Claude Opus 5 đạt 77% và GPT-4o mini đạt 75%. Mọi mô hình khác đều quanh mức một nửa, và Claude Sonnet 5 chỉ đạt 44%. Lỗi hầu như luôn là điểm 3: mô hình thấy một câu trả lời yếu và chấm nó dưới mức thay vì trong mức. Con số khá ổn của GPT-4o mini ở đây là dấu hiệu đầu tiên của vấn đề của nó, đó là nó chấm gần như mọi thứ thấp; ở đầu cao của thang điểm nó chỉ nhận đúng một trong sáu câu trả lời.

Ở mức giữa, Engine 2.0 dẫn đầu với 85%. Gemini và Claude Sonnet 5 đạt 63%, Claude Opus 5 đạt 58%, và rồi một vách đá: GPT-4o mini đạt 44% và ba mô hình GPT lớn hơn đạt từ 27% đến 29%. Câu trả lời mức giữa chứa một sự pha trộn giữa điểm mạnh và điểm yếu cần được cân nhắc kỹ hơn là chỉ phát hiện, và không có gì để đối chiếu, các mô hình GPT chỉ nhìn thấy điểm yếu và cho ra điểm 5 hoặc 6.

Ở mức cao, khoảng cách rộng nhất. Engine 2.0 nhận đúng 71% các câu trả lời mức cao. Gemini nhận đúng 56% và Opus 5 đúng một nửa. Năm trong bảy mô hình còn lại cho điểm 7 hoặc 8 cho ít nhất bảy trong mỗi mười câu trả lời đáng được điểm 10. Đây là vấn đề dồn về giữa thang thể hiện ở dạng rõ nhất. Một câu trả lời mức cao không hoàn hảo tuyệt đối; nó vẫn có một vài sai sót nhỏ, một lần nói lại, một câu đơn giản lẫn trong những câu phức tạp, và một người chấm đo lường nó dựa trên một câu trả lời hoàn hảo tưởng tượng sẽ trừ điểm cho từng chi tiết đó. Engine 2.0 được chuẩn hóa theo các ví dụ cho thấy một câu trả lời mức cao thực sự nghe như thế nào, kể cả với những sai sót nhỏ, và nó được thiết kế rõ ràng để so sánh với những ví dụ đó thay vì với sự hoàn hảo.

Nếu đưa cho chúng quy trình đầy đủ của chúng tôi thì sao?

Các con số của bài kiểm tra đơn giản không phải là một lời kết luận về việc các mô hình này thông minh đến đâu. Chúng là một lời kết luận về điều xảy ra khi một mô hình được yêu cầu cho một con số mà không có gì để đối chiếu. Vì vậy chúng tôi chạy bài kiểm tra thứ hai, đưa cho mọi mô hình đúng những gì các giám khảo của Engine 2.0 nhận được: bản chép lời, đề bài, hai ví dụ chuẩn hóa thực tế ở mỗi mức cho đúng bài đó, và một hướng dẫn yêu cầu chỉ ra ví dụ gần nhất cho mỗi trong bốn tiêu chí, thay vì đưa ra một con số. Mỗi mô hình cũng nhận được một lưu ý chuẩn hóa ngắn được điều chỉnh theo xu hướng riêng của nó.

Với quy trình đầy đủ của chúng tôi: tỷ lệ câu trả lời được chấm đúng mức điểm đã xác minh

Cùng 48 câu trả lời được giữ riêng để kiểm tra. Cùng bản chép lời, hướng dẫn và ví dụ chuẩn hóa cho mọi hệ thống; mỗi mô hình chấm mỗi câu trả lời một lần.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

Mọi mô hình đều cải thiện, một số cải thiện rất mạnh. GPT 5.6 sol tăng gấp đôi từ 35% lên 71%. Opus 5 tăng từ 62% lên 77%. GPT-4o mini hầu như không thay đổi, từ 45% lên 50%, vì nó chấm mọi thứ thấp bất kể được cho xem gì. Và mọi mô hình vẫn thấp hơn Engine 2.0. Ở đầu cao của thang điểm, khoảng cách vẫn còn: Opus 5, GPT 5.6 sol, Gemini và GPT 5.5 đều dừng ở 63% các câu trả lời mức cao, Sonnet 5 ở 38%, GPT-4o mini ở 0%, so với 71% của Engine 2.0.

Bài kiểm tra thứ hai này cho thấy giá trị thực sự của Engine 2.0 nằm ở đâu. Đó không phải là một mô hình thông minh hơn; nó dùng chính các mô hình trong danh sách này. Đó là những ví dụ thực tế cho thấy mỗi mức điểm thực sự nghe như thế nào trên từng bài cụ thể, một câu hỏi buộc mô hình phải so sánh thay vì đoán, và sau đó là ba yếu tố nữa mà một lượt chấm đơn lẻ không thể cung cấp: hai giám khảo độc lập từ hai nhà cung cấp khác nhau, ba lượt chấm từ mỗi giám khảo với phiếu ở giữa được giữ lại, và một quy tắc dung hòa lấy điểm cao hơn khi hai giám khảo bất đồng mạnh, vì phân tích cho thấy phán quyết thấp hơn hầu như luôn là phán quyết sai đối với các câu trả lời mạnh.

Tính ổn định và bền vững

Một hệ thống chấm điểm đáng tin cậy phải nhất quán. Nếu cùng một bản ghi âm có thể nhận điểm 8 hôm nay và 10 ngày mai, cả hai con số đều không có nhiều ý nghĩa, và một học viên không thể biết việc luyện tập của mình có hiệu quả hay không. Vì vậy, cùng với độ chính xác, chúng tôi đo xem Engine 2.0 có cho ra cùng một câu trả lời khi được hỏi cùng một câu hỏi hai lần không.

Chúng tôi chạy Engine 2.0 trên 48 câu trả lời giữ riêng ba lần riêng biệt, vào các ngày khác nhau, không thay đổi gì giữa các lần. Nó đạt 81.3% ở mỗi lần chạy. Không phải xấp xỉ 81%: cùng 39 câu trả lời đúng trên 48 mỗi lần, xấp xỉ chính xác. Khi nhìn vào từng câu trả lời riêng lẻ thay vì con số tổng, 87.5% nhận được điểm số giống hệt nhau qua cả ba lần chạy, và chỉ 4.2% từng dịch chuyển hai điểm hoặc hơn giữa các lần chạy. Số ít đó là những câu trả lời nằm ngay trên ranh giới giữa hai mức điểm, nơi một khác biệt nhỏ trong đánh giá có thể hợp lý đẩy điểm số theo một chiều hay chiều khác.

Bài kiểm tra đơn giản trên các mô hình hàng đầu dịch chuyển nhiều hơn hẳn giữa các lần chạy. GPT 5.6 sol đạt 31%, 40% và 35% trên ba lần chạy của nó; Opus 5 đạt 62%, 65% và 58%. Yêu cầu một chatbot chấm cùng một bản chép lời vào hai ngày khác nhau và khá thường xuyên bạn sẽ nhận được hai điểm số khác nhau.

Tính ổn định đến từ hai lựa chọn thiết kế. Mỗi giám khảo trong Engine 2.0 chấm ba lần trên mỗi câu trả lời và phiếu ở giữa được giữ lại, điều này loại bỏ những kết quả bất thường ngẫu nhiên mà một lượt chấm đơn lẻ có thể tạo ra. Và hai phán quyết của các giám khảo được dung hòa theo một quy tắc cố định thay vì bởi một mô hình khác, vì vậy cùng một cặp phán quyết luôn cho ra cùng một điểm cuối cùng. Cả hai lựa chọn đều được kiểm tra trực tiếp: với một lượt chấm thay vì ba, mức độ đồng thuận giữa các lần chạy giảm từ 87.5% xuống 77.1%, và tỷ lệ câu trả lời dịch chuyển hai điểm hoặc hơn tăng hơn gấp đôi.

Engine 2.0 chấm một câu trả lời như thế nào

Engine 2.0 không phải là một mô hình đơn lẻ. Nó là một quy trình, và chính quy trình đó tạo nên sự khác biệt. Đây là những gì xảy ra trong khoảng mười giây, giữa lúc học viên bấm dừng và lúc điểm số hiện lên màn hình.

  1. Bản ghi âm được chép lời từng từ. Mọi từ đệm, mọi đoạn nói lại, mọi lần tự sửa lời đều được giữ nguyên. Điều này hóa ra là thiết yếu. Khi chúng tôi thử một bản chép lời đã “làm sạch” với các khoảng ngần ngừ bị loại bỏ, độ chính xác giảm mười lăm điểm, vì những khoảng ngần ngừ đó là một phần bằng chứng mà người chấm cần để đánh giá câu trả lời nghe như thế nào.
  2. Hai giám khảo độc lập đọc bản chép lời. Chúng được xây dựng trên các mô hình nền khác nhau từ các nhà cung cấp khác nhau, nên không cùng chia sẻ những điểm mù giống nhau. Mỗi giám khảo nhận đề bài, bản chép lời, và một bộ ví dụ chuẩn hóa nhỏ cho đúng bài đó: những câu trả lời thực tế ở mức thấp, mức giữa và mức cao, hai câu mỗi mức, để mỗi mức được thể hiện như một khoảng chứ không phải một điểm đơn lẻ.
  3. Mỗi giám khảo so sánh thay vì chấm điểm. Đây là thay đổi trọng tâm so với Engine 1.0. Thay vì được hỏi cho một con số, mỗi giám khảo được hỏi, với mỗi trong bốn tiêu chí của câu trả lời, nó giống ví dụ chuẩn hóa nào nhất. Không có lựa chọn “nằm giữa đâu đó”. Việc buộc phải chọn một ví dụ gần nhất chính là điều ngăn xu hướng dồn về giữa thang. Điểm số sau đó được suy ra từ mức đã chọn theo một quy tắc cố định, không phải do mô hình quyết định.
  4. Mỗi giám khảo chấm ba lần. Phiếu ở giữa trên mỗi tiêu chí được giữ lại. Điều này loại bỏ câu trả lời bất thường ngẫu nhiên của một lần chấm mà không làm mất đi đánh giá thật.
  5. Hai phán quyết được dung hòa. Nếu hai giám khảo đồng ý hoặc chỉ lệch nhau 1 điểm, điểm cuối cùng là trung bình của chúng. Nếu chúng lệch nhau 2 điểm hoặc hơn, điểm cao hơn được sử dụng. Quy tắc này không phải là sự rộng lượng; đó là chuẩn hóa. Khi chúng tôi phân tích mọi trường hợp hai giám khảo bất đồng mạnh, phán quyết thấp hơn hầu như luôn là phán quyết sai, vì sự bất đồng đó gần như luôn xảy ra trên một câu trả lời mức cao mà một giám khảo đã quá thận trọng.
  6. Các cơ chế an toàn được áp dụng. Một bộ quy tắc cố định ngắn xử lý những trường hợp không giám khảo nào nên phải đoán: một câu trả lời im lặng, chỉ vài từ, bằng ngôn ngữ khác, hoặc hoàn toàn lạc đề sẽ nhận một điểm sàn bất kể các giám khảo trả về gì. Trong kiểm tra, sự im lặng nhận điểm 3, câu trả lời vài từ nhận điểm 4, và câu trả lời lạc đề hoặc không phải tiếng Anh nhận điểm 5, không có trường hợp thất bại nào trong toàn bộ tập dữ liệu.

Hai đặc điểm của thiết kế cuối cùng đáng được nhấn mạnh. Engine 2.0 chấm điểm chỉ từ bản chép lời, vì vậy nó không cần bản ghi âm sau khi đã chép lời và không phụ thuộc vào mô hình âm thanh của riêng một nhà cung cấp nào. Và vì hai giám khảo đến từ hai nhà cung cấp khác nhau, nếu một trong hai gặp trục trặc, giám khảo còn lại vẫn tiếp tục, với một mô hình thứ ba đứng dự phòng để luôn có một điểm số được tạo ra.

Điều gì mới trong phần đánh giá của bạn

Engine 2.0 đi kèm một lớp đánh giá được xây dựng lại hoàn toàn. Nó đọc các bằng chứng của hai người chấm, không chỉ nhìn vào điểm số, và đã được kiểm tra trên ba kiểu học viên: người lần đầu làm quen với CELPIP, người có nền tiếng Anh yếu muốn tìm bí quyết, và người chỉ có nửa giờ mỗi ngày với kỳ thi tuần sau. Đây là những điều đã thay đổi.

  • Trích dẫn đúng lời của chính bạn. Mỗi điểm đánh giá đều trích dẫn chính xác cụm từ trong bài ghi âm của bạn mà người chấm đã phản ứng lại. Nếu một cụm từ được đặt trong dấu ngoặc kép, đó là trích dẫn nguyên văn; trong lần kiểm tra của chúng tôi, 157 trên 158 trích dẫn là như vậy. Phần đánh giá không bao giờ bịa ra điều bạn không nói.
  • Một điều cần sửa trước tiên. Mỗi câu trả lời được gợi ý một hành động quan trọng nhất: thay đổi duy nhất giúp nâng điểm của bạn nhiều nhất, được viết bằng lời đơn giản nhất trên trang. Tiếp theo là hai hành động cụ thể khác, rồi một danh sách kiểm tra gồm ba mục để bạn ôn lại trong đầu trước khi bắt đầu nói.
  • Lời khuyên phù hợp với từng dạng bài. Đưa ra lời khuyên, miêu tả một khung cảnh và thuyết phục ai đó được chấm dựa trên những tiêu chí khác nhau. Giờ đây phần đánh giá biết mỗi dạng bài trong tám dạng bài đề cao điều gì và nói đúng vào điều đó, thay vì lặp lại những lời khuyên chung cho mọi dạng bài.
  • Nên luyện tiêu chí nào trước. Phần đánh giá cho bạn biết tiêu chí nào trong bốn tiêu chí là điểm yếu nhất và tiêu chí nào là điểm mạnh nhất của bạn, để bạn biết điểm tiếp theo nằm ở đâu, mà không giấu điều đó sau một con số.
  • Đề bài yêu cầu gì mà bạn đã bỏ lỡ. Đối với tiêu chí hoàn thành nhiệm vụ, phần đánh giá liệt kê cụ thể những phần của đề bài mà bạn chưa đề cập, hoặc nói rõ rằng bạn đã đề cập đầy đủ tất cả.
  • Những điều bạn có thể thực sự luyện tập. Mỗi cách làm được gợi ý đều là điều bạn có thể nói ra miệng trước lần thử tiếp theo. Không có lời khuyên nói rõ hơn hay giảm giọng vùng miền: giọng vùng miền không phải là điều mà mức độ dễ nghe đo lường, và phần đánh giá không bao giờ nhận xét về nó.
  • Không đổ lỗi vì hết giờ. Một câu trả lời bị đồng hồ cắt ngang sau khi đã hoàn thành nhiệm vụ sẽ không bị trừ điểm vì bị cắt ngang, và phần đánh giá không trách bạn vì điều đó.

Khi một mô hình chấm độc lập so sánh phần đánh giá này với những gì hệ thống trước đây tạo ra cho cùng các câu trả lời, mà không biết đâu là đâu, mô hình này đã chọn phần đánh giá mới trong 20 trên 24 lần so sánh, cả khi chấm theo góc nhìn của người khảo thí và theo góc nhìn của học viên.

Luyện tập không giới hạn với CA$25 mỗi tháng

Độ chính xác chỉ có ích nếu bạn có thể dùng nó mỗi ngày. Một điểm Speaking đáng tin cậy hữu ích nhất ở câu trả lời thứ bốn mươi của bạn, không phải câu thứ tư, vì đó là lúc điểm số bắt đầu cho bạn biết liệu một thay đổi trong cách bạn nói có thực sự hiệu quả hay không. Vì vậy chúng tôi định giá Engine 2.0 để được dùng mà không cần đếm.

Mọi gói Prepamigo đều bao gồm chấm điểm không giới hạn bởi Engine 2.0, số lần làm bài không giới hạn, và toàn bộ ngân hàng câu hỏi: 80 bộ đề luyện tập hoàn chỉnh và hơn 2,000 bài luyện tập trải rộng bốn kỹ năng Speaking, Writing, Reading và Listening, được viết theo đúng dạng bài, thời gian và định dạng của bài thi CELPIP General. Bạn bấm ghi âm, nhận điểm số và nhận xét dựa trên bằng chứng trong khoảng mười giây, và có thể làm lại bao nhiêu lần tùy ý.

Prepamigo

CA$25/ tháng

CA$24.98 mỗi tháng · CA$8.25 mỗi tháng theo gói năm (CA$98.98 mỗi năm) · đã gồm thuế · hủy bất cứ lúc nào

  • Chấm điểm không giới hạn bởi Scoring Engine 2.0, không giới hạn theo ngày, theo buổi hay theo tuần.
  • 80 bộ đề luyện tập và hơn 2,000 bài tập trải rộng cả bốn kỹ năng, theo đúng định dạng bài thi thật, nên bạn không cần tự viết đề.
  • Ghi âm rồi xong. Việc chép lời, chấm điểm và nhận xét đều được xử lý cho bạn; không có gì để dán, không có gì để nhập yêu cầu.
  • Nhận xét bằng đúng lời của bạn, mọi trích dẫn đều có thể truy về những gì bạn thực sự đã nói.

Claude Max, để so sánh

US$100/ tháng

khoảng CA$138 chưa gồm thuế · gói 20x là US$200 mỗi tháng · Pro US$20 với giới hạn chặt hơn nhiều

  • Ngay cả gói Max cũng có giới hạn. Một hạn mức sử dụng luân phiên 5 giờ và giới hạn theo tuần, gấp năm đến hai mươi lần so với gói Pro; khi bạn chạm một trong hai giới hạn, bạn phải chờ.
  • Không có ngân hàng câu hỏi. Bạn phải tự chuẩn bị đề bài, tự quyết định xem chúng có giống bài thi thật không, và tự theo dõi những gì mình đã luyện.
  • Bạn phải tự chuẩn bị mọi thứ. Ghi âm, chép lời, dán bản chép lời và viết hướng dẫn chấm điểm, tất cả đều do bạn làm, mỗi lần.
  • Một yêu cầu đơn giản, không phải một hệ thống chấm điểm đã chuẩn hóa. Khi được hỏi đơn giản, Claude Opus 5 khớp điểm đã xác minh 62% số lần và Claude Sonnet 5 45%, so với 81% của Engine 2.0.

Giá và điều khoản sử dụng của các gói Claude theo công bố trên claude.com vào tháng 9 năm 2026 và có thể thay đổi. CELPIP là nhãn hiệu thuộc quyền sở hữu của chủ sở hữu; Prepamigo là một nền tảng luyện tập độc lập, không liên kết, không được chứng thực và không có quan hệ với đơn vị tổ chức kỳ thi. Các bài luyện tập của Prepamigo là tài liệu gốc được viết theo đúng định dạng công khai của bài thi.

Tình trạng phát hành

Prepamigo Scoring Engine 2.0 cho Speaking đã hoạt động ngay bây giờ cho mọi người dùng Prepamigo trên mọi dạng bài Speaking. Không có gì cần bật lên. Mọi câu trả lời Speaking mới đều được Engine 2.0 chấm điểm, và mỗi điểm số đi kèm nhận xét được lấy từ chính lời của học viên.

Một câu trả lời thông thường được chấm trong khoảng mười giây, nhanh hơn Engine 1.0. Engine 2.0 cũng tốn ít chi phí hơn cho mỗi câu trả lời so với thiết kế nó thay thế, đây chính là điều cho phép chúng tôi chạy hai giám khảo với ba lượt chấm mỗi giám khảo cho mỗi học viên mà không làm thay đổi giá của Prepamigo.

Chúng tôi sẽ công bố các cập nhật cho những con số trên trang này khi việc kiểm định thực tế nói trên hoàn tất. Nếu bạn có một bản ghi âm mà bạn cho rằng Engine 2.0 đã chấm sai, chúng tôi muốn xem nó: đó là những trường hợp nhanh nhất giúp chúng tôi tìm ra bước cải thiện tiếp theo.

Để xem các phép so sánh trực tiếp, đọc Prepamigo so với Claude Prepamigo so với ChatGPT. Hoặc Ghi âm một câu trả lời và xem Engine 2.0 hoạt động. Đọc bài này bằng tiếng Anh

Giới thiệu Prepamigo Scoring Engine 2.0 cho Speaking | PrepAmigo