Chấm điểm

AI nào chấm điểm CELPIP Speaking chính xác nhất? Chúng tôi đã thử nghiệm tám mô hình

5 tháng 9, 2026

Tỷ lệ câu trả lời được chấm đúng mức điểm đã xác minh

48 câu trả lời được giữ riêng để kiểm tra, mỗi mức 16 câu. Mỗi mô hình được cung cấp bản chép lời và được yêu cầu, bằng lời đơn giản, chấm điểm theo thang CELPIP; trung bình của ba lần chạy. Engine 2.0 chạy ở cấu hình vận hành bình thường.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo so với các gói chatbot phổ biến nhất

Đơn vị: đô la Canada. Giá của Prepamigo đã bao gồm thuế. Claude Max (từ US$100) và ChatGPT Pro (US$200) được quy đổi theo tỷ giá 1.38, chưa gồm thuế. Độ chính xác là tỷ lệ câu trả lời trong bộ dữ liệu giữ riêng được chấm đúng mức điểm đã xác minh khi mô hình được nêu tên được yêu cầu, bằng lời đơn giản, chấm điểm câu trả lời đó; trung bình của ba lần chạy.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Giá mỗi tháng
CA$24.98 (đã gồm thuế)
CA$138+ (chưa gồm thuế)
CA$276 (chưa gồm thuế)
Chấm điểm
Không giới hạn
Có giới hạn
Có giới hạn
Ngân hàng câu hỏi có sẵn
Không
Không
Bộ đề luyện tập
80
Không có
Không có
Bài luyện tập
2,000+
Không có
Không có
Đúng định dạng CELPIP
Không
Không
Độ chính xác
81%
62%
35%
Câu trả lời mức cao
71%
50%
25%

Rất nhiều thí sinh CELPIP hiện nay tự chấm điểm phần luyện Speaking của mình bằng một chatbot AI. Ghi âm một câu trả lời, chép lời, dán vào, xin điểm. Cách này nhanh và miễn phí hoặc gần như miễn phí, và các lời giải thích nghe rất có uy quyền. Điều không ai nói cho bạn biết là con số đó đúng bao nhiêu lần, mô hình nào nên tin, hoặc cách bạn hỏi có làm thay đổi câu trả lời hay không. Chúng tôi muốn biết, vì vậy chúng tôi đã xây dựng bài kiểm tra và chạy nó trên tám hệ thống, theo hai cách.

Cách thứ nhất là biểu đồ ở trên: dán bản chép lời, xin điểm, theo đúng cách một học viên làm. Trong số các mô hình đa dụng, Claude Opus 5 chính xác nhất với 62%, Gemini theo sau với 58%, và mọi mô hình khác đều dưới một nửa: Claude Sonnet 5 và GPT-4o mini ở 45%, GPT 5.5 ở 37%, GPT 5.6 sol ở 35%, GPT 5.6 luna ở 31%. Một hệ thống được xây dựng chuyên biệt, Prepamigo Scoring Engine 2.0, đạt 81% trên cùng các câu trả lời.

Cách thứ hai là cách chúng tôi nghĩ mang lại nhiều bài học nhất: chúng tôi đưa cho mọi mô hình quy trình chấm điểm của riêng mình, với các ví dụ chuẩn hóa thực tế và phép so sánh bắt buộc, để xem mỗi mô hình có thể đạt mức tốt nhất là bao nhiêu. Mọi mô hình đều cải thiện, một số cải thiện rất mạnh, và mọi mô hình vẫn thấp hơn Engine 2.0. Chúng tôi nên nói rõ rằng Prepamigo là sản phẩm của chúng tôi. Chúng tôi đã cố gắng làm cả hai bài kiểm tra công bằng với mọi bên khác, và ở đâu một mô hình vượt qua chúng tôi ở một mức nào đó, chúng tôi sẽ nói rõ điều đó.

Bảng xếp hạng với yêu cầu đơn giản

Ba tầng có thể thấy rõ trong biểu đồ ở trên. Engine 2.0 với 81% đứng riêng một mình. Claude Opus 5 với 62% và Gemini với 58% tạo thành tầng thứ hai: dùng được, nếu bạn chấp nhận sai hai trong năm lần giữa ba mức. Mọi mô hình khác đều dưới 50%, tức là còn kém hơn việc tung đồng xu ngẫu nhiên giữa ba mức nếu bạn không biết gì về câu trả lời.

Đó là đặc điểm xác định của bài kiểm tra đơn giản: mọi mô hình đa dụng đều chấm khắt khe. Điểm trung bình chúng cho một câu trả lời mức cao đã xác minh dao động từ 7.2 (luna) đến 8.6 (Opus 5). Điểm trung bình chúng cho một câu trả lời mức thấp đã xác minh dao động từ 3.7 đến 4.3, dưới mức đối với mọi mô hình trừ Opus 5 và Gemini. Không có ví dụ về mỗi mức thực sự nghe như thế nào, các mô hình so sánh câu trả lời với một câu trả lời hoàn hảo tưởng tượng và trừ điểm.

Kết quả ở từng mức điểm

Một con số tổng che khuất nơi các lỗi nằm ở đâu, và nơi chúng nằm mới là điều quyết định một hệ thống chấm điểm có hữu ích với bạn hay không. Đây là kết quả của bài kiểm tra đơn giản, tách theo từng mức.

Câu trả lời mức thấp (điểm đã xác minh 4 hoặc 5)

16 câu trả lời được giữ riêng để kiểm tra cho mỗi hệ thống, yêu cầu đơn giản, trung bình của ba lần chạy.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

Câu trả lời yếu nên là đầu dễ của thang điểm, và với một yêu cầu đơn giản thì không phải vậy. Engine 2.0 đạt 88%, Opus 5 đạt 77%, GPT-4o mini đạt 75%. Mọi mô hình khác đều quanh mức một nửa, và Sonnet 5 chỉ đạt 44%. Lỗi hầu như luôn là điểm 3: mô hình thấy một câu trả lời yếu và chấm nó dưới mức thay vì trong mức. Con số khá ổn của GPT-4o mini ở đây là dấu hiệu đầu tiên của vấn đề của nó, đó là nó chấm gần như mọi thứ thấp.

Câu trả lời mức giữa (điểm đã xác minh 7 hoặc 8)

16 câu trả lời được giữ riêng để kiểm tra cho mỗi hệ thống, yêu cầu đơn giản, trung bình của ba lần chạy.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

Mức giữa là nơi tách biệt các mô hình. Engine 2.0 đạt 85%. Gemini và Sonnet 5 đạt 63%, Opus 5 đạt 58%. Rồi một vách đá: GPT-4o mini đạt 44% và ba mô hình GPT lớn hơn đạt từ 27% đến 29%. Câu trả lời mức giữa chứa một sự pha trộn thực sự giữa điểm mạnh và điểm yếu cần được cân nhắc kỹ, và không có gì để đối chiếu, các mô hình GPT chỉ nhìn thấy điểm yếu và cho ra điểm 5 hoặc 6. Một người nói ở mức 7 hoặc 8 hỏi GPT 5.6 sol để xin điểm sẽ nghe được đúng mức của mình ít hơn ba trong mười lần.

Câu trả lời mức cao (điểm đã xác minh 10 trở lên)

16 câu trả lời được giữ riêng để kiểm tra cho mỗi hệ thống, yêu cầu đơn giản, trung bình của ba lần chạy. Gần như mọi lần chấm sai đều là điểm 7 hoặc 8.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

Mức cao là nơi các khác biệt quan trọng nhất, và cũng là nơi yêu cầu đơn giản gây thiệt hại nhiều nhất. Engine 2.0 nhận đúng 71% các câu trả lời mức cao. Gemini nhận đúng 56% và Opus 5 đúng một nửa. Rồi Sonnet 5 ở 29%, GPT 5.5 ở 27%, GPT 5.6 sol ở 25%, GPT-4o mini ở 17% và GPT 5.6 luna ở 13%. Năm trong bảy mô hình đa dụng cho điểm 7 hoặc 8 cho ít nhất bảy trong mỗi mười câu trả lời đáng được điểm 10.

Nếu bạn là một thí sinh mạnh tự chấm điểm bằng một chatbot, đây là con số cần nhớ. Khả năng một yêu cầu đơn giản gửi tới GPT 5.6 sol sẽ nói với bạn rằng một câu 10 điểm là một câu 10 điểm chỉ là một trong bốn.

Bảng xếp hạng thứ hai: khi được cho quy trình đầy đủ của chúng tôi

Các con số của bài kiểm tra đơn giản không phải là một lời kết luận về việc các mô hình này thông minh đến đâu. Chúng là một lời kết luận về điều xảy ra khi một mô hình được yêu cầu cho một con số mà không có gì để đối chiếu. Vì vậy chúng tôi chạy bài kiểm tra thứ hai, đưa cho mọi mô hình các ví dụ chuẩn hóa và phép so sánh bắt buộc mà các giám khảo của Engine 2.0 sử dụng.

Với quy trình đầy đủ của chúng tôi: tỷ lệ câu trả lời được chấm đúng mức điểm đã xác minh

Cùng 48 câu trả lời được giữ riêng để kiểm tra. Cùng bản chép lời, hướng dẫn và ví dụ chuẩn hóa cho mọi hệ thống; mỗi mô hình chấm mỗi câu trả lời một lần. Gemini còn nhận thêm bản ghi âm.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

Mọi mô hình đều cải thiện. Opus 5 tăng từ 62% lên 77%. GPT 5.6 sol tăng gấp đôi, từ 35% lên 71%. GPT 5.5 tăng từ 37% lên 69%, Sonnet 5 từ 45% lên 69%, luna từ 31% lên 63%, Gemini từ 58% lên 71%. GPT-4o mini hầu như không thay đổi, từ 45% lên 50%, vì nó chấm mọi thứ thấp bất kể được cho xem gì.

Thứ hạng cũng thay đổi. Với một yêu cầu đơn giản, các mô hình Claude vượt xa các mô hình GPT. Với quy trình đầy đủ, GPT 5.6 sol vượt qua Sonnet 5 và hòa với Gemini, và bốn mô hình dồn lại trong khoảng 69% đến 71%, không thể phân biệt nhau về mặt thống kê trên mẫu này. Opus 5 vẫn dẫn đầu nhóm đa dụng ở 77%, kém Engine 2.0 bốn điểm.

Ở góc nhìn theo mức, quy trình đầy đủ nâng độ chính xác mức thấp lên 88% cho bốn mô hình, ngang với Engine 2.0, và nâng độ chính xác mức giữa lên 81% cho hai mô hình Claude. Mức cao là nơi khoảng cách vẫn còn: Opus 5, GPT 5.6 sol, Gemini và GPT 5.5 đều dừng ở 63%, Sonnet 5 ở 38%, và GPT-4o mini ở 0%, so với 71% của Engine 2.0. Một mô hình đơn lẻ chấm một lượt vẫn giữ điểm thấp hơn với một câu trả lời mạnh có chút sai sót. Engine 2.0 rút ngắn khoảng cách còn lại đó bằng hai giám khảo độc lập từ hai nhà cung cấp khác nhau, ba lượt chấm từ mỗi giám khảo với phiếu ở giữa được giữ lại, và một quy tắc dung hòa lấy điểm cao hơn khi hai giám khảo bất đồng mạnh, vì phân tích cho thấy phán quyết thấp hơn hầu như luôn là phán quyết sai đối với các câu trả lời mạnh.

Tổng kết trung thực của cả hai bảng xếp hạng là: quy trình quan trọng hơn mô hình. Chính cùng một GPT 5.6 sol đã tăng từ 35% lên 71% mà không thay đổi một trọng số nào, chỉ bằng cách được cho thấy mỗi mức thực sự nghe như thế nào và được hỏi câu trả lời giống ví dụ nào nhất.

Vì sao các mô hình dồn thấp và về giữa thang

Kiểu mẫu này nhất quán đến mức xuất hiện trên các mô hình từ ba công ty khác nhau, nên nó không thể là một điểm kỳ quặc của riêng mô hình nào. Đó là một đặc tính của bản chất công việc.

Khi một mô hình được yêu cầu đặt một câu trả lời vào một thang điểm, nó có xu hướng dồn về giữa khi không chắc chắn, vì giữa là nơi một câu trả lời sai gây thiệt hại ít nhất. Và khi không có ví dụ về việc một mức thực sự nghe như thế nào, nó so sánh câu trả lời với một câu trả lời hoàn hảo tưởng tượng và trừ điểm cho từng sai sót. Một câu trả lời mức cao không bao giờ hoàn hảo tuyệt đối. Nó có một lần nói lại, một câu đơn giản lẫn trong những câu phức tạp, một khoảng ngần ngừ trước một từ khó. Đo lường so với sự hoàn hảo, những sai sót đó tốn một hoặc hai nấc, và một điểm 10 trở thành 8 hoặc 7.

Hướng dẫn không sửa được điều này. Chúng tôi đã thử nói rõ với các mô hình rằng một mức 9 không cần một câu trả lời không lỗi, rằng chấm quá thấp một câu trả lời mạnh cũng nghiêm trọng như chấm quá cao một câu trả lời yếu. Mỗi hướng dẫn đều được chấp nhận rồi bị bỏ qua trong thực tế. Khi chúng tôi đưa cho một mô hình đúng ví dụ chuẩn hóa mà nó được cho biết là đại diện cho mức cao và yêu cầu nó chấm điểm ví dụ đó, nó cho điểm 8.

Điều thực sự sửa được nó, phần lớn, là thay đổi câu hỏi từ “con số nào?” sang “ví dụ nào?” và cung cấp các ví dụ thực tế. Đó là sự khác biệt giữa hai bảng xếp hạng. Ngay cả khi đó, một lượt chấm đơn lẻ vẫn dồn nhẹ về giữa, vì các ví dụ chuẩn hóa không hoàn hảo và một cách đọc chúng chỉ là một cách đọc. Hai giám khảo, ba lượt chấm và một quy tắc dung hòa là những gì khép lại phần còn lại.

Ghi chú về từng mô hình

  • Claude Opus 5. Người chấm đa dụng tốt nhất trên cả hai bài kiểm tra: 62% với yêu cầu đơn giản (62%, 65% và 58% qua ba lần chạy) và 77% với quy trình đầy đủ. Điểm yếu của nó với yêu cầu đơn giản là mức giữa, nơi nó cho ra điểm 6; điểm yếu của nó với quy trình đầy đủ là mức cao, nơi nó dừng ở 63%. Nó cũng là mô hình đắt nhất ở đây, chênh lệch một khoảng lớn.
  • Gemini. Đứng thứ hai trong bài kiểm tra đơn giản với 58%, giống hệt nhau qua cả ba lần chạy, và đều nhất giữa các mức, với 56%, 63% và 56%. Với quy trình đầy đủ cùng bản ghi âm, nó đạt 71%, ngang với GPT 5.6 sol, một mô hình chỉ làm việc từ văn bản. Nghe bản ghi âm không giúp nó vượt qua những gì một bản chép lời nguyên văn đã cung cấp.
  • Claude Sonnet 5. 45% với yêu cầu đơn giản, với một đặc điểm kỳ lạ: khá tốt ở mức giữa với 63%, kém ở câu trả lời yếu với 44% vì nó chấm chúng thành điểm 3, và kém ở mức cao với 29%. Với quy trình đầy đủ, nó tăng lên 69% nhưng vẫn dừng ở 38% với câu trả lời mức cao. Nếu Sonnet 5 cứ cho bạn điểm 8, đừng tin nó.
  • GPT-4o mini. 45% với yêu cầu đơn giản, 50% với quy trình đầy đủ, và trong cả hai trường hợp con số này đánh giá nó quá cao. Nó chấm gần như mọi thứ thấp: 75% với câu trả lời yếu, 17% rồi 0% với câu trả lời mức cao. Dù thế nào, đừng dùng mô hình này để chấm điểm Speaking của bạn.
  • GPT 5.5. 37% với yêu cầu đơn giản (35%, 42%, 33%), 69% với quy trình đầy đủ. Mức giữa của nó với yêu cầu đơn giản là 29%. Nó là mô hình chấm văn bản trong một phiên bản trước đây của quy trình của chính chúng tôi và đã bị thay thế vì điểm yếu đúng ở mức đó.
  • GPT 5.6 sol. 35% với yêu cầu đơn giản (31%, 40%, 35%), mức chênh lệch lớn nhất giữa các lần chạy trong số mọi mô hình, và 71% với quy trình đầy đủ, mức cải thiện lớn nhất trong số mọi mô hình. Một người chấm có khả năng khi được cho xem ví dụ, và kém khi không được cho xem. Thói quen của nó với quy trình đầy đủ là đề cao quá mức sự trau chuốt ở mức giữa.
  • GPT 5.6 luna. Cuối bảng ở cả hai bài kiểm tra: 31% với yêu cầu đơn giản và 63% với quy trình đầy đủ. Nó kéo câu trả lời mức giữa xuống gần 5 và chỉ nhận đúng 13% câu trả lời mức cao với yêu cầu đơn giản. Đủ rẻ để dùng làm ý kiến thứ hai trong một hệ thống hai giám khảo; không đủ chính xác để dùng riêng.

Một hệ thống được xây dựng chuyên biệt thêm vào điều gì

Engine 2.0 không phải là một mô hình tốt hơn. Nó dùng chính các mô hình trong bảng xếp hạng này. Điều nó thêm vào là quy trình, và mỗi phần của quy trình đó được chọn bằng đo lường.

  1. Chép lời nguyên văn, tự động. Mọi từ đệm và đoạn nói lại được giữ nguyên, vì loại bỏ chúng làm giảm độ chính xác mười lăm điểm trong kiểm tra. Bạn không cần tự tìm một công cụ chuyển giọng nói thành văn bản làm được điều này; hầu hết công cụ phổ thông đều tự động làm sạch.
  2. Ví dụ chuẩn hóa gắn sẵn cho mọi bài. Hai câu trả lời thực tế mỗi mức cho từng trong tám dạng bài, đã có sẵn. Đây là đầu vào duy nhất đã giúp độ chính xác của GPT 5.6 sol tăng gấp đôi, và là thứ bạn không thể tự tạo ra ở nhà.
  3. Một phép so sánh, không phải một con số. Mỗi giám khảo gọi tên ví dụ gần nhất cho mỗi trong bốn tiêu chí; điểm số theo sau bằng một quy tắc. Đây là điều ngăn chặn xu hướng dồn về giữa thang.
  4. Hai giám khảo từ hai nhà cung cấp. Các mô hình khác nhau có những điểm mù khác nhau. Hai giám khảo, được dung hòa theo một quy tắc cố định, vượt trội hơn bất kỳ giám khảo đơn lẻ nào.
  5. Ba lượt chấm mỗi giám khảo, giữ lại phiếu ở giữa. Điều này không làm tăng độ chính xác, nhưng đưa tính ổn định giữa các lần chạy từ 77% lên 87.5%. Một câu trả lời chatbot đơn lẻ là một lượt chấm duy nhất.
  6. Dung hòa lấy điểm cao hơn khi có bất đồng mạnh. Vì phán quyết thấp hơn hầu như luôn là phán quyết sai đối với các câu trả lời mạnh. Một phép trung bình đơn giản đã tụt xuống khoảng giữa sáu mươi phần trăm trong kiểm tra.
  7. Các cơ chế an toàn. Sự im lặng, câu trả lời vài từ, lạc đề và không phải tiếng Anh nhận điểm sàn theo quy tắc thay vì theo phỏng đoán của một mô hình.

Kết quả là 81% ở mức tổng và 71% ở mức cao, giống hệt nhau qua ba lần chạy riêng biệt, trong khoảng mười giây mỗi câu trả lời và không có gì để dán.

Nếu bạn vẫn muốn dùng một chatbot

Một số bạn đọc sẽ vẫn tiếp tục chấm điểm bằng chatbot, và đó là một lựa chọn hợp lý cho một thí sinh có ngân sách hạn hẹp hoặc muốn trao đổi kỹ về câu trả lời của mình. Những bước sau đây chính là sự khác biệt giữa hai bảng xếp hạng trên, và chúng sẽ đưa bạn đến gần bảng thứ hai hơn là bảng thứ nhất.

  1. Dùng một bản chép lời nguyên văn. Giữ nguyên từ đệm, đoạn nói lại và lần tự sửa lời. Nếu công cụ chuyển giọng nói thành văn bản của bạn tự động làm sạch chúng, người chấm đang chấm một câu trả lời tốt hơn câu bạn thực sự đã nói.
  2. Cho nó ví dụ, không phải một thang chấm. Một hoặc hai câu trả lời thực tế ở mỗi mức cho cùng dạng bài, có ghi rõ mức điểm, mang lại nhiều giá trị hơn bất kỳ mô tả nào về hình dạng của một mức 9. Nếu bạn không có các ví dụ đã được xác minh, đây là bước bạn không thể tự làm ở nhà, và cũng là bước quan trọng nhất.
  3. Hỏi ví dụ nào, không phải con số nào. Với mỗi trong bốn tiêu chí, hãy yêu cầu mô hình gọi tên ví dụ gần nhất và cấm câu trả lời “nằm ở giữa”. Tự bạn suy ra điểm số từ các mức mà nó nêu tên.
  4. Hỏi nhiều hơn một lần. Chấm cùng một câu trả lời hai hoặc ba lần trong các cuộc trò chuyện mới và giữ lại câu trả lời ở giữa. GPT 5.6 sol dao động chín điểm giữa các lần chạy trong bài kiểm tra đơn giản.
  5. Chọn một mô hình có thành tích tốt ở mức cao. Opus 5 hoặc Gemini nếu bạn hỏi đơn giản; Opus 5 hoặc GPT 5.6 sol nếu bạn có ví dụ. Không bao giờ dùng GPT-4o mini nếu bạn đang gần đạt mức 10.
  6. Nghi ngờ một điểm 7 hoặc 8. Trên mọi mô hình đa dụng, một điểm 7 hoặc 8 cho một câu trả lời bạn nghĩ là xuất sắc nhiều khả năng là một lỗi chấm điểm hơn là một kết luận.

Nên tin mô hình nào, tùy vào bạn đang ở đâu

Cách đọc đúng các bảng xếp hạng này phụ thuộc vào trình độ hiện tại của bạn, vì các mô hình thất bại ở những nơi khác nhau.

  • Nếu hôm nay bạn ở mức 4 hoặc 5, Opus 5 khi hỏi đơn giản sẽ nói đúng với bạn khoảng ba trong bốn lần; hầu hết mô hình khác sẽ gọi bạn là mức 3 khoảng một nửa số lần. Vấn đề của bạn không thực sự là người chấm; đó là nhận xét, và với việc đó bạn cần thứ trích dẫn lại lời của bạn thay vì chỉ tóm tắt.
  • Nếu bạn ở mức 7 hoặc 8, tránh các mô hình GPT với yêu cầu đơn giản, chúng sẽ gọi bạn là mức 5 hoặc 6 bảy trong mười lần. Gemini và Sonnet 5 là những mô hình đơn giản đáng tin cậy nhất ở mức giữa với 63%. Engine 2.0 đạt 85%.
  • Nếu bạn ở mức 10 trở lên, đây là nơi lựa chọn quan trọng nhất. Khi hỏi đơn giản, không mô hình đa dụng nào nhận đúng một điểm 10 hơn 56% số lần, và các mô hình GPT chỉ làm được điều đó từ 13% đến 27% số lần. Engine 2.0 nhận đúng bảy trong mười, và quan trọng hơn, cho ra cùng câu trả lời mỗi lần bạn hỏi.

Kiểu mẫu ở cả ba mức đều giống với điều toàn bài viết này đang mô tả. Các mô hình không ngốc; chúng cẩn trọng, và sự cẩn trọng khi không có gì để đối chiếu đồng nghĩa với một con số thấp. Bạn càng xa mức giữa, sự cẩn trọng của một người chấm càng gây thiệt hại cho bạn, và việc người chấm đó được xây dựng để chống lại nó càng quan trọng.

Điều gì mới trong phần đánh giá của bạn

Engine 2.0 đi kèm một lớp đánh giá được xây dựng lại hoàn toàn. Nó đọc các bằng chứng của hai người chấm, không chỉ nhìn vào điểm số, và đã được kiểm tra trên ba kiểu học viên: người lần đầu làm quen với CELPIP, người có nền tiếng Anh yếu muốn tìm bí quyết, và người chỉ có nửa giờ mỗi ngày với kỳ thi tuần sau. Đây là những điều đã thay đổi.

  • Trích dẫn đúng lời của chính bạn. Mỗi điểm đánh giá đều trích dẫn chính xác cụm từ trong bài ghi âm của bạn mà người chấm đã phản ứng lại. Nếu một cụm từ được đặt trong dấu ngoặc kép, đó là trích dẫn nguyên văn; trong lần kiểm tra của chúng tôi, 157 trên 158 trích dẫn là như vậy. Phần đánh giá không bao giờ bịa ra điều bạn không nói.
  • Một điều cần sửa trước tiên. Mỗi câu trả lời được gợi ý một hành động quan trọng nhất: thay đổi duy nhất giúp nâng điểm của bạn nhiều nhất, được viết bằng lời đơn giản nhất trên trang. Tiếp theo là hai hành động cụ thể khác, rồi một danh sách kiểm tra gồm ba mục để bạn ôn lại trong đầu trước khi bắt đầu nói.
  • Lời khuyên phù hợp với từng dạng bài. Đưa ra lời khuyên, miêu tả một khung cảnh và thuyết phục ai đó được chấm dựa trên những tiêu chí khác nhau. Giờ đây phần đánh giá biết mỗi dạng bài trong tám dạng bài đề cao điều gì và nói đúng vào điều đó, thay vì lặp lại những lời khuyên chung cho mọi dạng bài.
  • Nên luyện tiêu chí nào trước. Phần đánh giá cho bạn biết tiêu chí nào trong bốn tiêu chí là điểm yếu nhất và tiêu chí nào là điểm mạnh nhất của bạn, để bạn biết điểm tiếp theo nằm ở đâu, mà không giấu điều đó sau một con số.
  • Đề bài yêu cầu gì mà bạn đã bỏ lỡ. Đối với tiêu chí hoàn thành nhiệm vụ, phần đánh giá liệt kê cụ thể những phần của đề bài mà bạn chưa đề cập, hoặc nói rõ rằng bạn đã đề cập đầy đủ tất cả.
  • Những điều bạn có thể thực sự luyện tập. Mỗi cách làm được gợi ý đều là điều bạn có thể nói ra miệng trước lần thử tiếp theo. Không có lời khuyên nói rõ hơn hay giảm giọng vùng miền: giọng vùng miền không phải là điều mà mức độ dễ nghe đo lường, và phần đánh giá không bao giờ nhận xét về nó.
  • Không đổ lỗi vì hết giờ. Một câu trả lời bị đồng hồ cắt ngang sau khi đã hoàn thành nhiệm vụ sẽ không bị trừ điểm vì bị cắt ngang, và phần đánh giá không trách bạn vì điều đó.

Khi một mô hình chấm độc lập so sánh phần đánh giá này với những gì hệ thống trước đây tạo ra cho cùng các câu trả lời, mà không biết đâu là đâu, mô hình này đã chọn phần đánh giá mới trong 20 trên 24 lần so sánh, cả khi chấm theo góc nhìn của người khảo thí và theo góc nhìn của học viên.

Câu hỏi thường gặp

Mô hình AI nào chính xác nhất khi chấm điểm CELPIP Speaking? Khi hỏi đơn giản: Claude Opus 5 ở 62%, Gemini 58%, Claude Sonnet 5 và GPT-4o mini 45%, GPT 5.5 37%, GPT 5.6 sol 35%, GPT 5.6 luna 31%. Prepamigo Scoring Engine 2.0 đạt 81% trên cùng các câu trả lời.

ChatGPT hay Claude? Claude, rõ ràng, khi hỏi đơn giản: 62% và 45% so với 35% và 37%. Với quy trình đầy đủ của chúng tôi, khoảng cách hẹp lại thành 77% cho Opus 5 so với 71% cho GPT 5.6 sol.

Vì sao chúng đều cho câu trả lời mạnh của tôi điểm 7 hoặc 8? Các mô hình không có gì để đối chiếu sẽ đoán thấp và dồn về giữa, và một câu trả lời mạnh luôn có những sai sót nhỏ. Khi hỏi đơn giản, không mô hình đa dụng nào nhận đúng hơn 56% các câu trả lời mức cao.

Làm sao để có điểm tốt hơn từ một chatbot? Bản chép lời nguyên văn, câu trả lời mẫu ở mỗi mức, hỏi ví dụ nào thay vì con số nào, hỏi nhiều hơn một lần và giữ lại câu trả lời ở giữa. Quy trình đó đã giúp GPT 5.6 sol tăng gấp đôi từ 35% lên 71% trong bài kiểm tra của chúng tôi.

Để xem hai phép so sánh trực tiếp gần hơn, đọc Prepamigo so với Claude Prepamigo so với ChatGPT. Để xem quy trình hoạt động từng bước, đọc bên trong Scoring Engine 2.0. Hoặc Ghi âm một câu trả lời và bỏ qua việc chép lời. Đọc bài này bằng tiếng Anh

AI nào chấm điểm CELPIP Speaking chính xác nhất? Chúng tôi đã thử nghiệm tám mô hình | PrepAmigo