채점

어떤 AI가 CELPIP 스피킹을 가장 정확하게 채점하는가? 8개 모델을 테스트했다

2026년 9월 5일

검증된 등급과 일치한 응답의 비율

48개의 보류된 응답, 등급당 16개. 각 모델에게 전사문을 주고 평범한 말로 CELPIP 척도에 따라 채점하도록 요청했으며, 3회 실행의 평균입니다. Engine 2.0은 일반 프로덕션 구성으로 실행되었습니다.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo와 인기 챗봇 요금제 비교

캐나다 달러 기준입니다. Prepamigo 가격은 세금이 포함되어 있습니다. Claude Max(월 US$100부터)와 ChatGPT Pro(월 US$200)는 세전 가격을 1.38 환율로 환산한 값입니다. 정확도는 해당 모델에게 평범한 말로 채점을 요청했을 때 검증된 등급과 일치한 응답의 비율이며, 3회 실행의 평균입니다.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
월 요금
CA$24.98 (세금 포함)
CA$138+ (세금 별도)
CA$276 (세금 별도)
채점
무제한
제한
제한
완성된 문제 은행
있음
없음
없음
연습 세트
80개
없음
없음
연습 과제
2,000개+
없음
없음
CELPIP 형식
있음
없음
없음
정확도
81%
62%
35%
최상위 응답
71%
50%
25%

많은 CELPIP 응시자들이 이제 AI 챗봇으로 자신의 스피킹 연습을 채점합니다. 응답을 녹음하고, 전사하고, 붙여넣고, 점수를 요청합니다. 빠르고 무료이거나 거의 무료이며, 설명은 권위 있게 들립니다. 아무도 말해주지 않는 것은 그 숫자가 얼마나 자주 맞는지, 어느 모델을 믿어야 하는지, 물어보는 방식이 답을 바꾸는지입니다. 우리는 그것을 알고 싶었기 때문에 테스트를 만들어 8개 시스템에 두 가지 방식으로 실행했습니다.

첫 번째 방식은 위 차트입니다: 학생이 하는 방식대로 전사문을 붙여넣고 점수를 요청합니다. 범용 모델 중에서는 Claude Opus 5가 62%로 가장 정확했고, Gemini가 58%로 뒤따랐으며, 나머지는 모두 절반 이하였습니다: Claude Sonnet 5와 GPT-4o mini는 45%, GPT 5.5는 37%, GPT 5.6 sol은 35%, GPT 5.6 luna는 31%였습니다. 목적에 맞게 설계된 시스템인 Prepamigo Scoring Engine 2.0은 같은 응답에서 81%를 기록했습니다.

두 번째 방식이 우리가 가장 유익하다고 생각하는 방식입니다: 우리는 모든 모델에게 실제 보정 예시와 강제 비교가 포함된 우리 자체의 채점 절차를 제공하여, 각 모델이 얼마나 잘할 수 있는지 확인했습니다. 모든 모델이 개선되었고, 일부는 극적으로 개선되었지만, 모든 모델이 여전히 Engine 2.0에 뒤졌습니다. 우리는 Prepamigo가 우리 제품이라는 점을 솔직히 밝힙니다. 우리는 두 테스트 모두 다른 모든 모델에게 공정하도록 노력했으며, 특정 등급에서 어떤 모델이 우리를 이겼다면 그 사실도 밝힙니다.

평범한 프롬프트 순위표

상단 차트에서 세 단계가 보입니다. 81%의 Engine 2.0은 독보적입니다. 62%의 Claude Opus 5와 58% 의 Gemini가 두 번째 단계를 형성합니다: 다섯 번 중 두 번은 틀린다는 것을 받아들인다면 사용할 만합니다. 나머지는 모두 50% 미만인데, 이는 응답에 대해 전혀 아는 것이 없는 상태에서 세 등급 중 동전을 던지는 것보다도 나쁜 수준입니다.

이것이 평범한 테스트의 결정적인 특징입니다: 모든 범용 모델이 가혹하게 채점합니다. 검증된 최상위 응답에 준 평균 점수는 7.2(luna)에서 8.6(Opus 5)까지였습니다. 검증된 하위 응답에 준 평균 점수는 3.7에서 4.3까지였는데, Opus 5와 Gemini를 제외한 모든 모델에서 등급보다 낮았습니다. 각 등급이 실제로 어떻게 들리는지 보여주는 예시가 없으면, 모델들은 응답을 상상 속의 완벽한 응답과 비교하여 점수를 깎습니다.

각 점수 등급에서의 결과

전체 수치는 오류가 어디에서 발생하는지 숨기며, 그것이 어디에서 발생하는지가 채점기가 당신에게 유용한지를 결정합니다. 여기 등급별 평범한 테스트 결과가 있습니다.

하위 등급 응답 (검증됨 4점 또는 5점)

시스템당 보류된 16개의 응답, 평범한 프롬프트, 3회 실행 평균.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

약한 응답은 척도에서 쉬운 쪽 끝이어야 하지만, 평범한 프롬프트를 사용하면 그렇지 않습니다. Engine 2.0은 88%, Opus 5는 77%, GPT-4o mini는 75%입니다. 나머지는 모두 대략 절반 수준이고, Sonnet 5는 44%입니다. 놓치는 경우는 거의 항상 3점입니다: 모델이 약한 응답을 보고 그 등급 안이 아니라 그 아래로 채점합니다. GPT-4o mini의 여기서 나름 괜찮은 수치는 이 모델의 문제, 즉 거의 모든 것을 낮게 채점한다는 문제의 첫 번째 신호입니다.

중위 등급 응답 (검증됨 7점 또는 8점)

시스템당 보류된 16개의 응답, 평범한 프롬프트, 3회 실행 평균.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

중위 등급이 순위를 가릅니다. Engine 2.0은 85%입니다. Gemini와 Sonnet 5는 63%, Opus 5는 58%입니다. 그다음 급격히 떨어집니다: GPT-4o mini는 44%, 더 큰 세 GPT 모델은 27%에서 29%입니다. 중위 등급 응답은 저울질해야 하는 실제 강점과 약점의 혼합을 담고 있는데, 저울질할 대상이 없으면 GPT 모델들은 약점 쪽으로 기울어 5점이나 6점을 줍니다. GPT 5.6 sol에게 점수를 물어보는 7점 또는 8점 수준의 화자는 열 번 중 세 번도 채 되지 않게 올바른 등급을 듣게 됩니다.

최상위 등급 응답 (검증됨 10점 이상)

시스템당 보류된 16개의 응답, 평범한 프롬프트, 3회 실행 평균. 놓치는 경우는 거의 전부 7점 또는 8점입니다.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

최상위 등급은 차이가 가장 중요한 지점이며, 평범한 프롬프트가 가장 큰 피해를 주는 지점입니다. Engine 2.0은 최상위 응답의 71%를 인식합니다. Gemini는 56%, Opus 5는 정확히 절반을 인식합니다. 그다음 Sonnet 5는 29%, GPT 5.5는 27%, GPT 5.6 sol은 25%, GPT-4o mini는 17%, GPT 5.6 luna는 13%입니다. 일곱 범용 모델 중 다섯 개가 10점을 받아야 할 응답 열 개 중 적어도 일곱 개에 7점 또는 8점을 줍니다.

챗봇으로 스스로 채점하는 우수한 응시자라면, 이 숫자를 기억해야 합니다. GPT 5.6 sol에게 평범하게 물었을 때 10점을 10점이라고 알려줄 확률은 넷 중 하나입니다.

두 번째 순위표: 우리의 전체 절차를 적용했을 때

평범한 테스트 수치는 이 모델들이 얼마나 똑똑한지에 대한 판정이 아닙니다. 비교할 대상이 없는 상태에서 모델에게 숫자를 요구했을 때 벌어지는 일에 대한 판정입니다. 그래서 우리는 모든 모델에게 Engine 2.0의 채점자들이 사용하는 보정 예시와 강제 비교를 제공하는 두 번째 테스트를 진행했습니다.

우리의 전체 절차를 적용했을 때: 검증된 등급과 일치한 응답의 비율

동일한 48개의 보류된 응답. 모든 시스템에 동일한 전사문, 지시, 보정 예시를 사용했으며, 각 모델은 모든 응답을 한 번씩 채점했습니다. Gemini는 음성도 함께 받았습니다.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

모든 모델이 개선됩니다. Opus 5는 62%에서 77%로 올라갑니다. GPT 5.6 sol은 35%에서 71%로 두 배가 됩니다. GPT 5.5는 37%에서 69%로, Sonnet 5는 45%에서 69%로, luna는 31%에서 63%로, Gemini 는 58%에서 71%로 올라갑니다. GPT-4o mini는 45%에서 50%로 거의 움직이지 않는데, 무엇을 보여주든 모든 것을 낮게 채점하기 때문입니다.

순서도 바뀝니다. 평범한 프롬프트에서는 Claude 모델들이 GPT 모델들을 크게 앞섰습니다. 전체 절차를 적용하면 GPT 5.6 sol이 Sonnet 5를 앞지르고 Gemini와 동률이 되며, 네 모델이 69%에서 71% 사이에 몰려 있어 이 표본에서는 통계적으로 구분되지 않습니다. Opus 5는 77%로 범용 모델군 중 최상위를 유지하지만 Engine 2.0에는 4포인트 뒤집니다.

등급별 관점에서 보면, 전체 절차는 네 모델의 하위 등급 정확도를 Engine 2.0과 같은 88%로 끌어올리고, 두 Claude 모델의 중위 등급 정확도를 81%로 끌어올립니다. 격차가 계속되는 곳은 최상위 등급입니다: Opus 5, GPT 5.6 sol, Gemini, GPT 5.5는 모두 63%에서 멈추고, Sonnet 5는 38%, GPT-4o mini는 0%인 반면 Engine 2.0은 71%입니다. 단일 모델의 단일 시도는 여전히 작은 실수가 있는 우수한 응답에 대해 점수를 낮춥니다. Engine 2.0은 서로 다른 제공사의 독립적인 채점자 두 명, 각각 세 번씩 투표하여 중간 값을 취하는 방식, 그리고 두 채점자가 크게 의견이 갈릴 때 더 높은 점수를 채택하는 조정 규칙으로 그 나머지 격차를 좁힙니다. 분석 결과 우수한 응답에서는 낮은 판정이 거의 항상 틀린 판정이었기 때문입니다.

두 순위표를 솔직하게 요약하면 이렇습니다: 절차가 모델보다 더 중요합니다. 동일한 GPT 5.6 sol 이 가중치를 하나도 바꾸지 않고도, 각 등급이 어떻게 들리는지 보여주고 응답이 어느 예시와 비슷한지 묻는 것만으로 35%에서 71%로 올라갔습니다.

모델들이 왜 낮은 쪽, 중간 쪽으로 치우치는가

이 패턴은 세 개의 서로 다른 회사의 모델들에서 너무나 일관되게 나타나므로 어느 한 모델만의 특이한 현상일 수 없습니다. 이는 과제 자체의 속성입니다.

모델이 응답을 척도 위에 배치하도록 요청받으면, 확신이 없을 때 중심 쪽으로 물러섭니다. 중심이 틀린 답의 비용이 가장 적은 곳이기 때문입니다. 그리고 각 등급이 실제로 어떻게 들리는지 보여주는 예시가 없으면, 모델은 응답을 상상 속의 완벽한 응답과 비교하여 모든 실수에 대해 점수를 깎습니다. 최상위 응답도 결코 완벽하지 않습니다. 다시 말하기, 복잡한 문장들 사이에 낀 평범한 문장, 어려운 단어 앞에서의 망설임이 섞여 있습니다. 완벽함과 비교해 측정하면 이런 실수들은 한두 단계의 비용을 치르게 되고, 10점이 8점이나 7점이 됩니다.

지시로는 이 문제를 고칠 수 없습니다. 우리는 9등급이 오류 없는 응답을 요구하지 않으며, 우수한 응답을 과소평가하는 것이 약한 응답을 과대평가하는 것만큼 심각하다고 모델에게 명시적으로 말해 보았습니다. 각 지시는 받아들여졌지만 실제로는 무시되었습니다. 최상위 응답을 나타낸다고 알려준 바로 그 보정 예시를 모델에게 주고 채점하도록 요청했을 때, 모델은 그것에 8점을 줬습니다.

대체로 이를 고치는 것은 질문을 “몇 점인가?”에서 “어느 예시인가?”로 바꾸고 실제 예시를 제공하는 것입니다. 이것이 두 순위표 사이의 차이입니다. 그렇게 해도 단일 시도는 여전히 약간 치우치는데, 보정 예시가 완벽하지 않고 그것을 한 번 읽는 것은 하나의 해석일 뿐이기 때문입니다. 채점자 두 명, 투표 세 번, 조정 규칙이 나머지를 닫아줍니다.

모델별 설명

  • Claude Opus 5. 두 테스트 모두에서 최고의 범용 채점자입니다: 평범한 프롬프트 62%(세 번의 실행에서 62%, 65%, 58%), 전체 절차 77%. 평범한 프롬프트에서의 약점은 6점을 주는 중위 등급이고, 전체 절차에서의 약점은 63%에서 멈추는 최상위 등급입니다. 여기서 가장 비싼 모델이기도 하며, 그 차이가 큽니다.
  • Gemini. 평범한 테스트에서 58%로 2위이며, 세 번의 실행 모두에서 동일했고, 등급별로 56%, 63%, 56%로 가장 균등했습니다. 전체 절차와 음성 녹음을 적용하면 71%에 이르러, 텍스트만으로 작동한 GPT 5.6 sol과 같은 수준이 됩니다. 녹음을 듣는 것은 있는 그대로의 전사문이 제공하는 것 이상으로 도움이 되지 않았습니다.
  • Claude Sonnet 5. 평범한 프롬프트에서 45%이며, 독특한 양상을 보입니다: 중위 등급에서는 63%로 무난하지만, 약한 응답에서는 3점을 주는 탓에 44%로 부진하고, 최상위 등급에서도 29%로 부진합니다. 전체 절차를 적용하면 69%까지 올라가지만 최상위 응답에서는 38%에 머뭅니다. Sonnet 5가 계속 8점을 준다면 믿지 마십시오.
  • GPT-4o mini. 평범한 프롬프트에서 45%, 전체 절차에서 50%이지만, 두 경우 모두 이 숫자는 실제보다 좋아 보이는 것입니다. 거의 모든 것을 낮게 채점합니다: 약한 응답에서 75%, 최상위 응답에서는 17%, 그리고 0%까지 떨어집니다. 무엇을 하든 이 모델로 스피킹을 채점하지는 마십시오.
  • GPT 5.5. 평범한 프롬프트에서 37%(35%, 42%, 33%), 전체 절차에서 69%입니다. 평범한 프롬프트의 중위 등급은 29%입니다. 이 모델은 우리 자체 파이프라인의 이전 버전에서 텍스트 채점자였으나, 정확히 그 등급에서의 약점 때문에 교체되었습니다.
  • GPT 5.6 sol. 평범한 프롬프트에서 35%(31%, 40%, 35%)로 어느 모델보다도 실행 간 변동이 가장 크며, 전체 절차에서는 71%로 어느 모델보다도 가장 크게 개선되었습니다. 예시를 보여주면 능력 있는 채점자가 되지만, 그렇지 않으면 부실한 채점자가 됩니다. 전체 절차에서의 습성은 중위 등급에서 매끄러움을 과대평가하는 것입니다.
  • GPT 5.6 luna. 두 테스트 모두에서 최하위입니다: 평범한 프롬프트 31%, 전체 절차 63%. 중위권 응답을 5점 쪽으로 끌어내리며, 평범하게 물었을 때 최상위 응답의 13%를 인식했습니다. 두 채점자 시스템 안에서 두 번째 의견으로 쓸 만큼 저렴하지만, 단독으로 사용 하기에는 정확도가 부족합니다.

목적에 맞게 설계된 시스템이 더하는 것

Engine 2.0은 더 나은 모델이 아닙니다. 바로 이 순위표에 있는 모델들을 사용합니다. Engine 2.0이 더하는 것은 절차이며, 그 절차의 각 요소는 측정에 의해 선택되었습니다.

  1. 있는 그대로의 전사, 자동으로. 모든 간투사와 다시 말하기가 그대로 남습니다. 테스트에서 이를 제거하면 정확도가 15포인트 떨어졌기 때문입니다. 이렇게 해주는 전사 도구를 직접 찾을 필요가 없습니다. 대부분의 일반 소비자용 도구는 기본적으로 이를 정리해 버립니다.
  2. 모든 과제에 첨부된 보정 예시. 8개 과제 유형 각각에 대해 등급당 실제 응답 두 개가 이미 준비되어 있습니다. 이것이 GPT 5.6 sol의 정확도를 두 배로 만든 단 하나의 입력값이며, 집에서 만들어낼 수 없는 것입니다.
  3. 숫자가 아니라 비교. 각 채점자는 네 가지 항목 각각에 대해 가장 가까운 예시를 지목하며, 점수는 그에 따라 규칙으로 도출됩니다. 이것이 치우침을 막는 요인입니다.
  4. 두 제공사에서 온 두 채점자. 서로 다른 모델은 서로 다른 사각지대를 갖습니다. 고정된 규칙으로 조정된 두 채점자는 그 어느 하나보다 낫습니다.
  5. 각각 세 번씩 투표, 중간 값 채택. 이는 정확도를 높이지는 않았지만, 실행 간 일관성을 77%에서 87.5%로 끌어올렸습니다. 챗봇의 단일 답변은 단일 투표입니다.
  6. 크게 의견이 갈릴 때 더 높은 점수를 채택하는 조정. 우수한 응답에서는 낮은 판정이 거의 항상 틀린 판정이었기 때문입니다. 단순 평균은 테스트에서 60%대 중반으로 떨어졌습니다.
  7. 안전장치. 무음, 몇 단어짜리, 주제 이탈, 비영어 응답은 모델의 추측이 아니라 규칙에 따라 최저 점수를 받습니다.

그 결과는 전체 81%, 최상위 등급 71%이며, 세 번의 별도 실행 모두에서 동일했고, 응답당 약 10초 가 걸리며 붙여넣을 것이 전혀 없습니다.

그래도 챗봇을 사용하겠다면

일부 독자는 계속 챗봇으로 채점할 것이며, 예산이 빠듯하거나 응답에 대해 이야기를 나누고 싶은 응시자에게는 합리적인 선택입니다. 다음 단계들은 두 순위표 사이의 차이이며, 첫 번째 순위표 보다는 두 번째 순위표에 더 가까워지게 해줍니다.

  1. 있는 그대로의 전사문을 사용하십시오. 간투사, 다시 말하기, 자기 수정을 그대로 남기십시오. 전사 도구가 이를 정리해 버린다면, 채점자는 당신이 실제로 한 것보다 더 나은 응답을 채점하고 있는 것입니다.
  2. 채점 기준이 아니라 예시를 주십시오. 같은 과제 유형의 각 등급에 대한 실제 응답 하나나 두 개에 등급을 표시해 주는 것이, 9등급이 어떤 모습인지에 대한 어떤 설명보다도 더 효과적입니다. 검증된 예시가 없다면, 이것이 집에서 따라 할 수 없는 단계이며 가장 중요한 단계입니다.
  3. 몇 점인지가 아니라 어느 예시인지 물어보십시오. 네 가지 항목 각각에 대해 모델에게 가장 가까운 예시를 지목하도록 요청하고 “중간 어딘가”는 금지하십시오. 모델이 지목한 등급으로부터 점수는 직접 도출하십시오.
  4. 한 번 이상 물어보십시오. 같은 응답을 새로운 대화에서 두세 번 채점하고 중간 값을 채택하십시오. GPT 5.6 sol은 평범한 테스트에서 실행 간 9포인트나 흔들렸습니다.
  5. 최상위 등급 성적이 좋은 모델을 고르십시오. 평범하게 물어본다면 Opus 5나 Gemini, 예시가 있다면 Opus 5나 GPT 5.6 sol입니다. 10점에 가깝다면 GPT-4o mini는 절대 쓰지 마십시오.
  6. 7점이나 8점은 의심하십시오. 모든 범용 모델에서, 훌륭했다고 생각한 응답에 대한 7점이나 8점은 최종 판정이라기보다 놓친 경우일 가능성이 더 큽니다.

당신의 수준에 따라 어떤 모델을 믿어야 하는가

이 순위표를 올바르게 읽는 방법은 당신의 현재 수준에 따라 달라지는데, 모델들이 실패하는 지점이 서로 다르기 때문입니다.

  • 오늘 당신이 4점이나 5점 수준이라면, 평범하게 물어본 Opus 5는 네 번 중 세 번 정도 그렇게 알려줄 것입니다. 다른 대부분의 모델은 절반 정도의 확률로 당신을 3점이라고 부를 것입니다. 당신의 진짜 문제는 채점기가 아니라 피드백입니다. 그것을 위해서는 요약하는 대신 당신의 말을 그대로 인용해 주는 것이 필요합니다.
  • 당신이 7점이나 8점 수준이라면, 평범한 프롬프트로는 GPT 모델을 피하십시오. 열 번 중 일곱 번은 당신을 5점이나 6점이라고 부를 것입니다. Gemini와 Sonnet 5는 중위 등급 에서 63%로 가장 신뢰할 수 있는 평범한 프롬프트 채점자입니다. Engine 2.0은 85%입니다.
  • 당신이 10점 이상이라면, 여기가 선택이 가장 중요한 지점입니다. 평범하게 물었을 때 어떤 범용 모델도 10점을 56% 이상 인식하지 못하며, GPT 모델들은 13%에서 27% 사이의 확률로만 인식합니다. Engine 2.0은 열 중 일곱을 인식하며, 더 중요한 것은 물을 때마다 같은 답을 준다는 것입니다.

세 등급 전체에 걸친 패턴은 이 글 전체가 설명해 온 것과 같습니다. 모델들은 멍청한 것이 아니라 신중한 것이며, 비교할 대상이 없는 상태에서의 신중함은 낮은 숫자를 의미합니다. 중간에서 멀어질수록 채점기의 신중함이 당신에게 더 큰 비용을 치르게 하며, 그 채점기가 그것에 저항하도록 만들어졌는지가 더 중요해집니다.

피드백에서 새로워진 점

Engine 2.0에는 완전히 새로 만든 피드백 레이어가 탑재됩니다. 이 레이어는 단순히 점수만이 아니라 두 채점자의 근거를 함께 읽어내며, CELPIP을 처음 접하는 학생, 영어가 약해서 요령을 원하는 학생, 하루 30분씩 시간을 내고 다음 주 시험을 앞둔 학생이라는 세 유형의 학생을 대상으로 검증되었습니다. 무엇이 달라졌는지 살펴보겠습니다.

  • 당신의 표현을 그대로 인용합니다. 모든 피드백 항목은 채점자가 반응한 실제 표현을 당신의 응답 스크립트에서 그대로 인용합니다. 인용부호로 표시된 문구는 원문 그대로 옮긴 것이며, 저희 검토 결과 158건 중 157건이 그러했습니다. 피드백은 당신이 말하지 않은 내용을 지어내지 않습니다.
  • 가장 먼저 고쳐야 할 한 가지. 각 응답에는 단 하나의 최우선 개선점이 제시됩니다. 점수를 가장 크게 끌어올릴 하나의 변화를 가장 쉬운 말로 짚어줍니다. 이어서 구체적인 실천 방법 두 가지가 뒤따르고, 말하기를 시작하기 전 머릿속으로 훑어볼 세 가지 체크리스트가 이어집니다.
  • 과제에 맞는 조언. 조언하기, 상황 묘사하기, 누군가를 설득하기는 각각 다른 기준으로 채점됩니다. 이제 피드백은 여덟 가지 과제 유형이 각각 무엇에 점수를 주는지 파악하고 그에 맞게 이야기하며, 모든 과제에 똑같은 일반적인 팁을 반복하지 않습니다.
  • 가장 먼저 연습해야 할 영역. 피드백은 네 가지 영역 중 어느 것이 당신의 가장 약한 부분이고 어느 것이 가장 강한 부분인지 알려주므로, 다음 점수가 어디에 있는지 숫자 뒤에 숨기지 않고 바로 알 수 있습니다.
  • 과제가 요구했지만 놓친 부분. 과제 수행(task fulfillment) 영역에서는 피드백이 프롬프트에서 다루지 않은 구체적인 부분을 나열하거나, 모두 다루었다면 그렇다고 명확히 알려줍니다.
  • 실제로 연습할 수 있는 조언. 모든 실천 방법은 다음 시도 전에 소리 내어 연습해볼 수 있는 것들입니다. 더 명확하게 말하라거나 억양을 줄이라는 조언은 없습니다. 억양은 청취 가능성(listenability) 평가 대상이 아니며, 피드백은 이에 대해 절대 언급하지 않습니다.
  • 시간 초과에 대한 불이익 없음. 과제를 완수한 뒤 시간이 다 되어 응답이 중단된 경우, 그 중단 자체로 감점되지 않으며 피드백도 이를 문제 삼지 않습니다.

독립적인 평가 모델이 어느 쪽이 어느 시스템의 결과인지 모르는 상태에서 동일한 응답에 대해 이 피드백과 이전 시스템이 생성한 피드백을 비교했을 때, 시험관의 관점과 학생의 관점 모두에서 24건 중 20건에서 새 피드백을 더 선호했습니다.

자주 묻는 질문

CELPIP 스피킹 채점에서 가장 정확한 AI 모델은 무엇인가요? 평범하게 물었을 때: Claude Opus 5는 62%, Gemini는 58%, Claude Sonnet 5와 GPT-4o mini는 45%, GPT 5.5는 37%, GPT 5.6 sol은 35%, GPT 5.6 luna는 31%였습니다. Prepamigo Scoring Engine 2.0은 같은 응답에서 81%를 기록했습니다.

ChatGPT와 Claude 중 어느 쪽인가요? 평범하게 물었을 때는 확실히 Claude입니다: 62%와 45% 대 35%와 37%입니다. 우리의 전체 절차를 적용하면 격차가 좁혀져 Opus 5는 77%, GPT 5.6 sol은 71%가 됩니다.

왜 다들 제 우수한 응답에 7점이나 8점을 주나요? 비교할 대상이 없는 모델은 낮은 쪽, 중간 쪽으로 추측하며, 우수한 응답에도 항상 작은 실수가 있습니다. 평범하게 물었을 때 어떤 범용 모델도 최상위 응답의 56% 이상을 인식하지 못했습니다.

챗봇에서 더 좋은 점수를 받으려면 어떻게 해야 하나요? 있는 그대로의 전사문, 각 등급의 예시 응답, 몇 점인지가 아니라 어느 예시인지 물어보기, 한 번 이상 물어보고 중간 값 채택하기입니다. 이 절차가 우리 테스트에서 GPT 5.6 sol을 35%에서 71%로 두 배로 만들었습니다.

두 직접 비교를 더 자세히 보려면 Prepamigo vs Claude Prepamigo vs ChatGPT를 읽어보세요. 절차가 단계별로 어떻게 작동하는지 보려면 Scoring Engine 2.0 내부 들여다보기를 읽어보세요. 아니면 응답 녹음하기로 전사 과정을 건너뛰세요. 영어로 이 가이드 읽기

어떤 AI가 CELPIP 스피킹을 가장 정확하게 채점하는가? 8개 모델을 테스트했다 | PrepAmigo