Sản phẩm

Prepamigo so với ChatGPT cho CELPIP Speaking: Độ chính xác, giới hạn và chi phí

7 tháng 9, 2026

Tỷ lệ câu trả lời được chấm đúng mức điểm đã xác minh

48 câu trả lời Speaking được giữ riêng để kiểm tra, mỗi mức 16 câu. Mỗi mô hình GPT được cung cấp bản chép lời và được yêu cầu, bằng lời đơn giản, chấm điểm theo thang CELPIP; trung bình của ba lần chạy. Engine 2.0 chạy ở cấu hình vận hành bình thường.

81%

Prepamigo Engine 2.0

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo so với các gói chatbot phổ biến nhất

Đơn vị: đô la Canada. Giá của Prepamigo đã bao gồm thuế. Claude Max (từ US$100) và ChatGPT Pro (US$200) được quy đổi theo tỷ giá 1.38, chưa gồm thuế. Độ chính xác là tỷ lệ câu trả lời trong bộ dữ liệu giữ riêng được chấm đúng mức điểm đã xác minh khi mô hình được nêu tên được yêu cầu, bằng lời đơn giản, chấm điểm câu trả lời đó; trung bình của ba lần chạy.

Prepamigo
ChatGPT ProGPT 5.6 sol
Giá mỗi tháng
CA$24.98 (đã gồm thuế)
CA$276 (chưa gồm thuế)
Chấm điểm
Không giới hạn
Có giới hạn
Ngân hàng câu hỏi có sẵn
Không
Bộ đề luyện tập
80
Không có
Bài luyện tập
2,000+
Không có
Đúng định dạng CELPIP
Không
Độ chính xác
81%
35%
Câu trả lời mức cao
71%
25%

ChatGPT có lẽ là công cụ phổ biến nhất mà các thí sinh CELPIP dùng để tự chấm điểm phần luyện Speaking của mình. Nó có trên điện thoại của mọi người, trả lời trong vài giây, và sẵn lòng cho bạn biết câu trả lời của bạn ở mức nào. Câu hỏi mà bài viết này trả lời là liệu mức điểm nó đưa ra có phải là mức bạn thực sự sẽ nhận được không. Chúng tôi đã chạy bài kiểm tra theo đúng cách một học viên sẽ làm: dán bản chép lời, xin điểm, và đếm kết quả.

Câu trả lời ngắn: trên 48 câu trả lời Speaking mà không hệ thống nào từng thấy, mỗi câu có điểm đã được xác minh độc lập, Prepamigo Scoring Engine 2.0 cho ra đúng mức điểm 81% số lần. Khi được yêu cầu bằng lời đơn giản, GPT 5.6 sol, mô hình đứng sau các gói trả phí của ChatGPT, cho ra đúng mức điểm 35% số lần. GPT 5.5 đạt 37%, GPT 5.6 luna 31%, và GPT-4o mini 45%, một con số trông có vẻ tốt hơn thực tế, vì mô hình này chấm gần như mọi thứ thấp nên vô tình chấm đúng các câu trả lời yếu.

Sau đó chúng tôi làm một điều mà hầu hết các bài so sánh khác bỏ qua. Chúng tôi đưa cho mỗi mô hình GPT quy trình chấm điểm của riêng mình, với các ví dụ chuẩn hóa thực tế cho từng bài và yêu cầu so sánh bắt buộc với các ví dụ đó, để xem mỗi mô hình có thể đạt mức tốt nhất là bao nhiêu. GPT 5.6 sol tăng lên 71%, GPT 5.5 lên 69%, luna lên 63% và GPT-4o mini lên 50%. Cả bốn mô hình vẫn thấp hơn Engine 2.0, và cả bốn vẫn gặp khó khăn nhất với các câu trả lời ở mức cao. Phần còn lại của bài viết này sẽ đi qua cả hai bài kiểm tra, kết quả ở từng mức điểm, lý do một trợ lý đa dụng có xu hướng dồn về giữa thang điểm, quy trình sử dụng hằng ngày của mỗi bên, và chi phí của mỗi lựa chọn nếu bạn có ý định luyện tập một cách nghiêm túc.

Bài kiểm tra đơn giản: một học viên thực sự nhận được gì

Tám mươi mốt phần trăm so với ba mươi lăm. Trong bài kiểm tra 48 câu trả lời, đó là hai mươi hai điểm số chấm đúng thêm cho Engine 2.0 so với GPT 5.6 sol. Nói cách khác, Engine 2.0 mắc ít hơn 71% lỗi chấm điểm so với GPT 5.6 sol, ít hơn 70% so với GPT 5.5, ít hơn 73% so với GPT 5.6 luna và ít hơn 66% so với GPT-4o mini.

Ba lần chạy riêng biệt của bài kiểm tra đơn giản cho ra kết quả của GPT 5.6 sol là 31%, 40% và 35%, và của GPT 5.5 là 35%, 42% và 33%. Mức chênh lệch giữa các lần chạy đó cũng chính là một phát hiện: yêu cầu ChatGPT chấm cùng một bản chép lời vào hai ngày khác nhau và khá thường xuyên bạn sẽ nhận được hai điểm số khác nhau. Engine 2.0 đạt 81.3% ở mỗi trong ba lần chạy.

Khoảng cách mở rộng ở đâu: xét theo từng mức điểm

Một con số tổng quát che khuất nơi các lỗi nằm ở đâu. Một người chấm xuất sắc với câu trả lời yếu nhưng bất lực với câu trả lời mạnh thì ổn cho người mới bắt đầu và thực sự gây hại cho ai đang nhắm tới điểm 10. Vì vậy đây là kết quả của bài kiểm tra đơn giản, tách theo từng mức điểm đã xác minh.

Câu trả lời mức thấp (điểm đã xác minh 4 hoặc 5)

16 câu trả lời được giữ riêng để kiểm tra, yêu cầu đơn giản, trung bình của ba lần chạy. Hầu hết các lần chấm sai là điểm 3.

88%

Prepamigo Engine 2.0

75%

GPT-4o mini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

Với các câu trả lời yếu, Engine 2.0 dẫn đầu ở 88%. GPT-4o mini theo sau ở 75%, đây là nơi duy nhất thói quen chấm thấp của nó lại có lợi. Ba mô hình GPT lớn hơn đạt từ 52% đến 54%: khoảng một nửa số lần, chúng chấm một câu trả lời 4 hoặc 5 điểm thành 3 điểm, đây là sai mức dù chiều lệch có thể hiểu được. Một người mới bắt đầu dùng ChatGPT để chấm điểm sẽ, khoảng một nửa thời gian, bị bảo rằng mình kém hơn thực tế.

Câu trả lời mức giữa (điểm đã xác minh 7 hoặc 8)

16 câu trả lời được giữ riêng để kiểm tra, yêu cầu đơn giản, trung bình của ba lần chạy. Các lần chấm sai gần như đều là điểm 5 hoặc 6.

85%

Prepamigo Engine 2.0

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

Mức giữa là nơi các mô hình GPT với yêu cầu đơn giản sụp đổ hoàn toàn. Engine 2.0 đạt 85%; GPT-4o mini đạt 44%; GPT 5.5, GPT 5.6 sol và luna đạt từ 27% đến 29%. Câu trả lời mức giữa chứa một sự pha trộn thực sự giữa điểm mạnh và điểm yếu cần được cân nhắc kỹ, và không có ví dụ chuẩn hóa để đối chiếu, các mô hình GPT chỉ nhìn thấy điểm yếu và cho ra điểm 5 hoặc 6. Một người nói ở mức 7 hoặc 8 hỏi GPT 5.6 sol để xin điểm sẽ nghe được đúng mức của mình ít hơn ba trong mười lần.

Câu trả lời mức cao (điểm đã xác minh 10 trở lên)

16 câu trả lời được giữ riêng để kiểm tra, yêu cầu đơn giản, trung bình của ba lần chạy. Gần như mọi lần chấm sai đều là điểm 7 hoặc 8.

71%

Prepamigo Engine 2.0

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

Ở mức cao, Engine 2.0 nhận đúng 71% các câu trả lời mức cao. GPT 5.5 nhận đúng 27%, GPT 5.6 sol 25%, GPT-4o mini 17%, và GPT 5.6 luna 13%. Mọi mô hình GPT đều cho điểm 7 hoặc 8 cho ít nhất bảy trong mỗi mười câu trả lời đáng được điểm 10.

Hãy nghĩ về ý nghĩa của điều này với một thí sinh mạnh. Bạn ghi âm tám câu trả lời, chép lời chúng, dán vào ChatGPT và xin điểm, và nó báo rằng sáu trong số đó là 7 và 8 điểm. Bạn kết luận rằng mình là một người nói ở mức giữa khá tốt nhưng còn phải cố gắng. Trong khi đó bạn đã ở mức 10 từ đầu. Đây không phải là một tình huống giả định. Đây là điều mọi mô hình GPT đã làm với hầu hết các câu trả lời mức cao trong bài kiểm tra của chúng tôi.

Nếu bạn dùng ChatGPT để chấm điểm và nó liên tục cho bạn điểm 7 và 8, đừng vội tin ngay. Trong bài kiểm tra của chúng tôi, một câu trả lời mức cao có khả năng nhận điểm 7 hoặc 8 từ GPT 5.6 sol gấp ba lần so với việc nhận đúng mức điểm của nó.

Nếu bạn đưa cho ChatGPT quy trình đầy đủ của chúng tôi thì sao?

Rất dễ để đọc các con số của bài kiểm tra đơn giản và kết luận rằng GPT là một thế hệ mô hình yếu. Không phải vậy. Vấn đề không nằm ở trí tuệ. Vấn đề là khi một mô hình được yêu cầu cho một con số mà không có gì để đối chiếu, nó phải đoán, và khi đoán, nó đoán thấp và dồn về giữa thang điểm.

Vì vậy chúng tôi đã chạy bài kiểm tra thứ hai. Mỗi mô hình GPT nhận được đúng bộ tài liệu mà các giám khảo của Engine 2.0 nhận được: bản chép lời, đề bài, hai ví dụ chuẩn hóa thực tế ở mỗi mức cho đúng bài đó, và một hướng dẫn yêu cầu chỉ ra ví dụ gần nhất cho mỗi trong bốn tiêu chí, thay vì đưa ra một con số. Mỗi mô hình cũng nhận được một lưu ý chuẩn hóa ngắn được điều chỉnh theo xu hướng riêng của nó.

Với quy trình đầy đủ của chúng tôi: tỷ lệ câu trả lời được chấm đúng mức điểm đã xác minh

Cùng 48 câu trả lời được giữ riêng để kiểm tra. Mỗi mô hình GPT chấm mỗi câu trả lời một lần với cùng bản chép lời, hướng dẫn và ví dụ chuẩn hóa như các giám khảo của Engine 2.0.

81%

Prepamigo Engine 2.0

71%

GPT 5.6 sol

69%

GPT 5.5

63%

GPT 5.6 luna

50%

GPT-4o mini

Các ví dụ chuẩn hóa tạo ra một sự khác biệt rất lớn. GPT 5.6 sol tăng gấp đôi, từ 35% lên 71%. GPT 5.5 tăng từ 37% lên 69%, luna từ 31% lên 63%. GPT-4o mini hầu như không thay đổi, từ 45% lên 50%, vì nó vẫn chấm mọi thứ thấp bất kể được cho xem gì; với quy trình đầy đủ nó vẫn không nhận đúng bất kỳ câu trả lời mức cao nào. Điều này cho thấy giá trị thực sự của một hệ thống chấm điểm được xây dựng chuyên biệt nằm ở đâu: không phải ở một mô hình thông minh hơn, mà ở những ví dụ thực tế cho thấy mỗi mức điểm thực sự nghe như thế nào trên từng bài cụ thể, và ở một câu hỏi buộc mô hình phải so sánh thay vì đoán.

Dù vậy, mọi mô hình GPT vẫn thấp hơn. Với quy trình đầy đủ, GPT 5.6 sol kém Engine 2.0 mười điểm ở mức tổng, kém mười điểm ở mức giữa (75% so với 85%), và kém tám điểm ở mức cao (63% so với 71%). Thói quen còn lại của nó là đề cao sự trau chuốt: một câu trả lời 8 điểm vững chắc với cách nói trôi chảy bị đẩy lên 9 hoặc 10. GPT 5.6 luna thì làm điều ngược lại, kéo các câu trả lời mức giữa xuống gần 5, và kết thúc ở mức giữa với 44%. Một mô hình đơn lẻ chấm một lượt vẫn mang một thiên hướng đặc trưng, và Engine 2.0 rút ngắn khoảng cách còn lại bằng hai giám khảo độc lập từ hai nhà cung cấp khác nhau, ba lượt chấm từ mỗi giám khảo với phiếu ở giữa được giữ lại, và một quy tắc dung hòa lấy điểm cao hơn khi hai giám khảo bất đồng mạnh.

Chúng tôi cũng đã thử cách tắt hiển nhiên: giữ nguyên yêu cầu đơn giản và thêm các hướng dẫn như “không dồn điểm về giữa thang” hoặc “một câu trả lời mức 9 không cần phải hoàn hảo”. Chúng không tạo ra thay đổi đáng kể nào. Điều thực sự hiệu quả là thay đổi câu hỏi, và cho mô hình một thứ thực tế để đối chiếu.

Khoảng cách về quy trình: ghi âm và xong, hay tự làm tất cả

Các con số về độ chính xác giả định rằng việc chấm điểm thực sự diễn ra. Với ChatGPT, có một lượng công việc đáng ngạc nhiên nằm giữa việc bấm dừng ghi âm và việc đọc được điểm số, và một phần công việc đó làm thay đổi điểm số.

Đầu tiên, bạn cần một bản chép lời. Chế độ giọng nói của ChatGPT là một cuộc trò chuyện, không phải một người chấm điểm; để chấm một câu trả lời đã ghi âm, bạn cần văn bản. Điều đó có nghĩa là hoặc tự đánh máy lại những gì bạn đã nói, việc này sẽ làm thay đổi câu trả lời, hoặc chạy bản ghi âm qua một công cụ chuyển giọng nói thành văn bản. Và bản chép lời phải nguyên văn. Mọi từ đệm, mọi đoạn nói lại, mọi lần tự sửa lời đều phải được giữ nguyên. Khi chúng tôi thử một bản chép lời đã “làm sạch” với các khoảng ngần ngừ bị loại bỏ, độ chính xác giảm mười lăm điểm, vì những khoảng ngần ngừ đó chính là bằng chứng mà người chấm cần để đánh giá câu trả lời nghe như thế nào. Hầu hết các công cụ chuyển giọng nói thành văn bản dành cho người dùng phổ thông, bao gồm công cụ có sẵn trên hầu hết điện thoại, đều tự động làm sạch.

Thứ hai, bạn cần đề bài. ChatGPT có thể tự nghĩ ra một đề theo kiểu CELPIP nếu bạn yêu cầu, nhưng nó đang đoán về định dạng, thời gian và kiểu tình huống mà bài thi thật sử dụng. Bạn sẽ không biết liệu đề nó viết có giống với đề bạn sẽ gặp hay không.

Thứ ba, nếu bạn muốn kết quả tốt hơn con số của bài kiểm tra đơn giản, bạn cần các ví dụ chuẩn hóa: những câu trả lời thực tế ở mỗi mức điểm cho cùng dạng bài, với mức điểm đã được xác minh. Đây chính là đầu vào đã giúp độ chính xác của GPT 5.6 sol tăng gấp đôi trong bài kiểm tra của chúng tôi, và đây là thứ một học viên không thể tự tạo ra ở nhà.

Thứ tư, bạn phải làm lại toàn bộ điều đó cho câu trả lời tiếp theo, và mỗi lần đó lại tính vào hạn mức tin nhắn của bạn.

Trên Prepamigo, bạn chọn một bài từ ngân hàng đề, bộ đếm giờ chạy, bạn nói, và khoảng mười giây sau khi bạn dừng lại, điểm số và nhận xét đã hiện trên màn hình. Việc chép lời được thiết kế để luôn nguyên văn, các ví dụ chuẩn hóa được gắn sẵn vào bài tự động, và không có gì để dán, không có gì để nhập yêu cầu. Câu trả lời thứ mười một trong buổi tối tốn công sức đúng bằng câu đầu tiên.

Tính ổn định: cùng một câu trả lời, cùng một điểm số

Một điểm số bạn không thể tái lập không phải là một phép đo. Nếu cùng một bản ghi âm nhận điểm 8 vào thứ Hai và điểm 10 vào thứ Ba, bạn chẳng học được gì về khả năng nói của mình. Vì vậy chúng tôi cũng kiểm tra khả năng tái lập.

Engine 2.0 được chạy trên 48 câu trả lời giữ riêng ba lần riêng biệt vào các ngày khác nhau. Nó đạt 81.3% mỗi lần. Nhìn vào từng câu trả lời riêng lẻ, 87.5% nhận được điểm số giống hệt nhau qua cả ba lần chạy, và chỉ 4.2% từng dịch chuyển hai điểm hoặc hơn, tất cả đều là những câu trả lời nằm ngay trên ranh giới giữa hai mức điểm.

Bài kiểm tra đơn giản trên GPT 5.6 sol dịch chuyển chín điểm giữa lần chạy tốt nhất và tệ nhất của nó. Khoảng cách về độ ổn định này xuất phát từ việc bỏ phiếu. Mỗi giám khảo trong Engine 2.0 chấm ba lần trên mỗi câu trả lời và phiếu ở giữa được giữ lại. Khi chúng tôi thử cùng cấu hình đó nhưng chỉ với một lượt chấm thay vì ba, tỷ lệ điểm số giống nhau giữa các lần chạy giảm từ 87.5% xuống 77%, và tỷ lệ câu trả lời dịch chuyển hai điểm hoặc hơn tăng hơn gấp đôi. Một cuộc trò chuyện đơn lẻ với ChatGPT là một lượt chấm duy nhất. Chúng tôi cũng kiểm tra xem việc đặt một hạt giống ngẫu nhiên cố định qua API có làm các mô hình GPT ổn định hơn không. Không hề; trên GPT 5.6 luna, khả năng tái lập thực tế còn giảm.

Nhận xét bạn có thể hành động theo

ChatGPT là một công cụ giải thích tốt. Nếu bạn hỏi vì sao nó cho một điểm số, nó sẽ nói dài dòng, bằng tiếng Anh rõ ràng, và sẽ gợi ý cách cải thiện. Với một thí sinh muốn trao đổi kỹ hơn về một câu trả lời, điều đó thực sự có giá trị.

Rủi ro là một lời giải thích trôi chảy không đồng nghĩa với một chẩn đoán chính xác. Một mô hình đã chấm một câu trả lời 10 điểm thành 7 điểm sẽ giải thích, một cách thuyết phục, vì sao đó là 7 điểm. Nó sẽ tìm ra thứ gì đó để chỉ vào. Và vì nó không buộc phải xác định bằng chứng trước khi chấm điểm, lời giải thích được viết ra sau, để biện minh cho một con số nó đã chọn từ trước.

Engine 2.0 hoạt động theo chiều ngược lại. Mỗi giám khảo phải chỉ ra bằng chứng cho từng tiêu chí trước khi gọi tên một mức điểm, và nhận xét được viết ra từ chính những bằng chứng đó. Nó trích dẫn đúng lời của bạn: trong một cuộc kiểm tra 158 trích dẫn trên một mẫu nhận xét, 157 trích dẫn xuất hiện nguyên văn trong bản chép lời. Khi một mô hình đánh giá độc lập so sánh nhận xét của Engine 2.0 với nhận xét của hệ thống trước đây của chúng tôi trên cùng các câu trả lời, mà không biết cái nào là cái nào, nó chọn Engine 2.0 trong 20 trên 24 lần so sánh, cả khi đánh giá theo góc nhìn giám khảo và theo góc nhìn học viên.

Chúng tôi cũng kiểm tra xem nhận xét có đặt lời chê đúng chỗ không, bằng cách lấy các câu trả lời mạnh và cố ý làm hỏng từng khía cạnh một. Trong ba trên bốn trường hợp, tiêu chí bị làm hỏng chính là tiêu chí có điểm giảm nhiều nhất. Đây là loại kiểm tra mà một chatbot khó có thể vượt qua, vì nó không có các tiêu chí cố định để đối chiếu.

Chi phí luyện tập mỗi ngày

Một điểm Speaking hữu ích nhất ở câu trả lời thứ bốn mươi của bạn, không phải câu thứ tư. Đó là lúc nó bắt đầu cho bạn biết liệu một thay đổi trong cách bạn nói có thực sự hiệu quả hay không. Vì vậy câu hỏi thực tế là chi phí để sử dụng mỗi công cụ với số lượng lớn.

ChatGPT Plus có giá US$20 mỗi tháng, khoảng CA$28, thanh toán theo tháng, theo công bố vào tháng 9 năm 2026. Nó cho bạn dùng thế hệ GPT 5.6 với giới hạn số tin nhắn theo từng khung thời gian luân phiên; những bản chép lời dài kèm ví dụ chuẩn hóa chính là loại tin nhắn tiêu tốn nhiều hạn mức đó nhất, và khi bạn chạm giới hạn, bạn phải chờ hoặc chuyển sang một mô hình nhỏ hơn. ChatGPT Pro, với US$200 mỗi tháng, khoảng CA$276 chưa gồm thuế, nâng đáng kể các giới hạn. Gói miễn phí chuyển phần lớn lưu lượng sang các mô hình nhỏ hơn, và trong bài kiểm tra này, mô hình nhỏ nhất trong số đó gần như không nhận đúng câu trả lời mức cao nào. Không gói nào trong số này bao gồm ngân hàng câu hỏi, bộ đếm giờ, chép lời nguyên văn, ví dụ chuẩn hóa, hay bất cứ thứ gì riêng cho CELPIP.

Prepamigo có giá CA$24.98 mỗi tháng, hoặc CA$8.25 mỗi tháng nếu chọn gói theo năm, tức CA$98.98 cho cả năm, đã gồm thuế, và bạn có thể hủy bất cứ lúc nào. Mọi gói đều bao gồm chấm điểm không giới hạn bởi Engine 2.0, không có giới hạn theo ngày, theo buổi hay theo tuần, số lần làm bài không giới hạn, và toàn bộ ngân hàng câu hỏi: 80 bộ đề luyện tập hoàn chỉnh và hơn 2,000 bài luyện tập trải rộng bốn kỹ năng Speaking, Writing, Reading và Listening, được viết theo đúng dạng bài, thời gian và định dạng của bài thi CELPIP General.

Nói đơn giản: với chi phí thấp hơn giá của ChatGPT Plus, bạn có được một hệ thống chấm điểm chính xác hơn gấp hơn hai lần trong một phép so sánh đơn giản, không bao giờ bắt bạn phải chờ, và đã có sẵn đề bài cùng các ví dụ chuẩn hóa.

Khi nào ChatGPT là công cụ tốt hơn

Đây không phải là một lập luận rằng bạn không nên bao giờ mở ChatGPT khi luyện thi CELPIP. Một thí sinh nghiêm túc hoàn toàn có thể dùng cả hai.

  • Trao đổi kỹ về một câu trả lời. Nếu bạn muốn hiểu vì sao một lý do còn yếu hoặc muốn tìm ba lý do tốt hơn, một cuộc trò chuyện là hình thức phù hợp. Engine 2.0 cho bạn một kết luận và bằng chứng; nó không trò chuyện.
  • Từ vựng và cách diễn đạt. Hỏi về năm cách nói tự nhiên hơn cho một ý nào đó là nhanh và hữu ích.
  • Nói chuyện với thứ có thể đáp lại. Chế độ giọng nói của ChatGPT là một cách khá hợp lý để tập nói tiếng Anh thành tiếng cho thoải mái hơn. Nó không phải là một người chấm điểm, nhưng là một người bạn đồng hành.
  • Luyện Writing. Bài viết không cần chép lời, nên khoảng cách về quy trình nhỏ hơn. Độ chính xác của GPT khi chấm Writing không thuộc phạm vi bài kiểm tra này và chúng tôi không đưa ra nhận định nào về nó.
  • Bất cứ điều gì ngoài bài thi. ChatGPT là một trợ lý đa dụng, còn Prepamigo không phải vậy.

Điều ChatGPT không nên là, dựa trên các bằng chứng ở đây, là công cụ cho bạn biết bạn đã sẵn sàng hay chưa. Cho việc đó, bạn cần một hệ thống chấm điểm được xây dựng riêng cho công việc này, được kiểm tra trên những câu trả lời nó chưa từng thấy, và được đo lường theo từng mức điểm.

Điều gì mới trong phần đánh giá của bạn

Engine 2.0 đi kèm một lớp đánh giá được xây dựng lại hoàn toàn. Nó đọc các bằng chứng của hai người chấm, không chỉ nhìn vào điểm số, và đã được kiểm tra trên ba kiểu học viên: người lần đầu làm quen với CELPIP, người có nền tiếng Anh yếu muốn tìm bí quyết, và người chỉ có nửa giờ mỗi ngày với kỳ thi tuần sau. Đây là những điều đã thay đổi.

  • Trích dẫn đúng lời của chính bạn. Mỗi điểm đánh giá đều trích dẫn chính xác cụm từ trong bài ghi âm của bạn mà người chấm đã phản ứng lại. Nếu một cụm từ được đặt trong dấu ngoặc kép, đó là trích dẫn nguyên văn; trong lần kiểm tra của chúng tôi, 157 trên 158 trích dẫn là như vậy. Phần đánh giá không bao giờ bịa ra điều bạn không nói.
  • Một điều cần sửa trước tiên. Mỗi câu trả lời được gợi ý một hành động quan trọng nhất: thay đổi duy nhất giúp nâng điểm của bạn nhiều nhất, được viết bằng lời đơn giản nhất trên trang. Tiếp theo là hai hành động cụ thể khác, rồi một danh sách kiểm tra gồm ba mục để bạn ôn lại trong đầu trước khi bắt đầu nói.
  • Lời khuyên phù hợp với từng dạng bài. Đưa ra lời khuyên, miêu tả một khung cảnh và thuyết phục ai đó được chấm dựa trên những tiêu chí khác nhau. Giờ đây phần đánh giá biết mỗi dạng bài trong tám dạng bài đề cao điều gì và nói đúng vào điều đó, thay vì lặp lại những lời khuyên chung cho mọi dạng bài.
  • Nên luyện tiêu chí nào trước. Phần đánh giá cho bạn biết tiêu chí nào trong bốn tiêu chí là điểm yếu nhất và tiêu chí nào là điểm mạnh nhất của bạn, để bạn biết điểm tiếp theo nằm ở đâu, mà không giấu điều đó sau một con số.
  • Đề bài yêu cầu gì mà bạn đã bỏ lỡ. Đối với tiêu chí hoàn thành nhiệm vụ, phần đánh giá liệt kê cụ thể những phần của đề bài mà bạn chưa đề cập, hoặc nói rõ rằng bạn đã đề cập đầy đủ tất cả.
  • Những điều bạn có thể thực sự luyện tập. Mỗi cách làm được gợi ý đều là điều bạn có thể nói ra miệng trước lần thử tiếp theo. Không có lời khuyên nói rõ hơn hay giảm giọng vùng miền: giọng vùng miền không phải là điều mà mức độ dễ nghe đo lường, và phần đánh giá không bao giờ nhận xét về nó.
  • Không đổ lỗi vì hết giờ. Một câu trả lời bị đồng hồ cắt ngang sau khi đã hoàn thành nhiệm vụ sẽ không bị trừ điểm vì bị cắt ngang, và phần đánh giá không trách bạn vì điều đó.

Khi một mô hình chấm độc lập so sánh phần đánh giá này với những gì hệ thống trước đây tạo ra cho cùng các câu trả lời, mà không biết đâu là đâu, mô hình này đã chọn phần đánh giá mới trong 20 trên 24 lần so sánh, cả khi chấm theo góc nhìn của người khảo thí và theo góc nhìn của học viên.

Câu hỏi thường gặp

ChatGPT có thể chấm điểm Speaking CELPIP của tôi không? Nó sẽ cho bạn một con số. Khi được hỏi đơn giản trên 48 câu trả lời chưa từng thấy với điểm đã xác minh, GPT 5.6 sol đúng 35% số lần, GPT 5.5 37%, luna 31%, GPT-4o mini 45%, so với 81% của Engine 2.0. Với các câu trả lời mức cao, GPT 5.6 sol chỉ đúng 25% số lần.

Prepamigo có chính xác hơn ChatGPT không? 81% so với 35% của GPT 5.6 sol với một yêu cầu đơn giản. Với quy trình đầy đủ của chúng tôi cùng các ví dụ chuẩn hóa, GPT 5.6 sol đạt 71%, vẫn kém mười điểm.

Mỗi công cụ tốn bao nhiêu? ChatGPT Pro có giá US$200 mỗi tháng, khoảng CA$276 chưa gồm thuế; Plus là US$20 với giới hạn số tin nhắn. Prepamigo là CA$24.98 mỗi tháng đã gồm thuế, hoặc CA$8.25 mỗi tháng theo gói năm, với chấm điểm không giới hạn và 80 bộ đề luyện tập.

Nếu vẫn dùng ChatGPT, tôi nên chọn mô hình GPT nào? Với một yêu cầu đơn giản, không mô hình nào làm tốt. Với các ví dụ chuẩn hóa, GPT 5.6 sol. Đừng bao giờ dùng GPT-4o mini nếu bạn đang gần đạt mức 10.

Để xem cùng phép so sánh này với Claude, đọc Prepamigo so với Claude. Để xem bảng xếp hạng đầy đủ của tám hệ thống, đọc AI nào chấm CELPIP Speaking chính xác nhất. Hoặc bỏ qua việc chép lời và Ghi âm một câu trả lời. Đọc bài này bằng tiếng Anh

Prepamigo so với ChatGPT cho CELPIP Speaking: Độ chính xác, giới hạn và chi phí | PrepAmigo