검증된 등급과 일치한 응답의 비율
48개의 보류된 스피킹 응답, 세 등급에 각각 16개씩. Claude에게 전사문을 주고 평범한 말로 CELPIP 척도에 따라 채점하도록 요청했으며, 3회 실행의 평균입니다. Engine 2.0은 일반 프로덕션 구성으로 실행되었습니다.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
45%
Claude Sonnet 5
Prepamigo와 인기 챗봇 요금제 비교
캐나다 달러 기준입니다. Prepamigo 가격은 세금이 포함되어 있습니다. Claude Max(월 US$100부터)와 ChatGPT Pro(월 US$200)는 세전 가격을 1.38 환율로 환산한 값입니다. 정확도는 해당 모델에게 평범한 말로 채점을 요청했을 때 검증된 등급과 일치한 응답의 비율이며, 3회 실행의 평균입니다.
스피킹 전사문을 Claude에 붙여넣고 CELPIP 채점관처럼 채점해 달라고 요청해 본 적이 있다면, 그 매력을 이미 알고 있을 것입니다. 즉시 답이 나오고, 스스로 설명도 해주며, 지치지도 않습니다. 문제는 그 숫자가 실제로 받게 될 점수와 같은가입니다. 우리는 학생이 실제로 할 법한 방식으로 그 테스트를 진행했습니다: 동일한 전사문, 평범한 채점 요청, 그리고 결과를 집계했습니다.
짧게 답하자면: 시스템이 한 번도 본 적 없는, 각각 독립적으로 검증된 점수가 있는 48개의 스피킹 응답에서 Prepamigo Scoring Engine 2.0은 81%의 확률로 정확한 등급을 맞혔습니다. 동일한 전사문을 평범한 말로 채점하도록 요청했을 때 Claude Opus 5는 62%, Claude Sonnet 5는 45%의 확률로 정확한 등급을 맞혔습니다. 높은 점수를 노리는 사람에게 가장 중요한 지점에서 그 차이가 가장 크게 벌어집니다. 최상위 응답에서 Engine 2.0은 71%, Opus 5는 50%, Sonnet 5는 29%를 인식했습니다.
그런 다음 대부분의 비교 기사가 생략하는 작업을 했습니다. Claude에게 모든 과제에 대한 실제 보정 예시와 그에 대한 강제 비교가 포함된 우리 자체의 채점 절차를 제공하여, 이 모델이 얼마나 잘할 수 있는지 확인했습니다. Opus 5는 77%까지, Sonnet 5는 69%까지 올라갔습니다. 둘 다 여전히 Engine 2.0에 뒤졌고, 둘 다 여전히 최상위 응답에서 가장 어려움을 겪었습니다. 이 글의 나머지 부분에서는 두 테스트를 모두 살펴보고, 각 점수 등급에서 숫자가 어떻게 나타나는지, 범용 어시스턴트가 왜 척도의 중간으로 치우치는지, 양쪽의 일상적인 사용 흐름은 어떤지, 그리고 진지하게 연습할 계획이라면 각 옵션에 드는 비용이 얼마인지 다룹니다.
평범한 테스트: 학생이 실제로 얻는 것
81%대 62%, 그리고 45%. 48개 응답 테스트에서 Engine 2.0과 Opus 5의 차이는 9개의 추가 정답이며, Engine 2.0과 Sonnet 5의 차이는 17개입니다. 달리 말하면, Engine 2.0은 Opus 5보다 채점 실수를 51% 더 적게 하고, Sonnet 5보다는 66% 더 적게 합니다.
평범한 테스트를 세 번 별도로 실행한 결과 Opus 5는 62%, 65%, 58%를, Sonnet 5는 44%, 46%, 46%를 기록했습니다. 실행 간에 이렇게 몇 포인트씩 벌어지는 것 자체가 하나의 발견입니다: 서로 다른 날에 같은 전사문을 Claude에게 채점하도록 하면 상당히 자주 서로 다른 점수를 받게 됩니다. Engine 2.0은 세 번의 실행 모두에서 81.3%를 기록했습니다.
격차가 벌어지는 지점: 등급별로 살펴보기
인간이든 기계든 대부분의 채점자는 척도의 중간으로 치우치는 경향이 있습니다. 우수한 응답은 10점이 아니라 8점이 되고, 약한 응답은 5점이 아니라 6점이 됩니다. 이런 치우침은 평균에서는 보이지 않지만 결과를 등급별로 나누는 순간 명확해집니다. 평범한 프롬프트를 사용하면 Claude는 여기에 한 가지 습성을 더 얹습니다: 아래쪽으로 치우쳐서, 약한 응답조차 자기 등급보다 낮게 채점되는 경우가 많습니다.
하위 등급 응답 (검증된 점수 4점 또는 5점)
보류된 16개의 응답, 평범한 프롬프트, 3회 실행 평균. 여기서 Sonnet 5가 놓치는 경우는 대부분 3점입니다.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
44%
Claude Sonnet 5
약한 응답에서는 Engine 2.0이 88%로 앞서고, Opus 5가 77%로 뒤따르며, Sonnet 5는 44%로 떨어집니다. 이는 척도에서 쉬운 쪽 끝이고, Opus 5는 이를 무난하게 처리합니다. Sonnet 5는 그렇지 않습니다: 4점 또는 5점 응답을 3점으로 채점하는 경우가 절반을 넘는데, 방향은 이해할 만하지만 등급 자체는 틀린 것입니다. 이 등급의 학생이 Sonnet 5로 채점받으면 대부분의 경우 실제보다 못하다는 말을 듣게 됩니다.
중위 등급 응답 (검증된 점수 7점 또는 8점)
보류된 16개의 응답, 평범한 프롬프트, 3회 실행 평균. 놓치는 경우는 거의 전부 6점입니다.
85%
Prepamigo Engine 2.0
63%
Claude Sonnet 5
58%
Claude Opus 5
중위 등급에서는 Engine 2.0이 85%, 두 Claude 모델은 각각 63%와 58%입니다. 중위 등급 응답은 단순히 발견하는 것이 아니라 저울질해야 하는 강점과 약점의 혼합을 담고 있는데, 저울질할 보정 예시가 없으면 두 Claude 모델은 약점 쪽으로 기울어 6점을 주는 경향이 있습니다. 7점 또는 8점 수준의 화자는 열 번 중 약 네 번은 6점이라는 말을 듣게 됩니다.
최상위 등급 응답 (검증된 점수 10점 이상)
보류된 16개의 응답, 평범한 프롬프트, 3회 실행 평균. 놓치는 경우는 거의 전부 7점 또는 8점입니다.
71%
Prepamigo Engine 2.0
50%
Claude Opus 5
29%
Claude Sonnet 5
최상위 등급에서 Engine 2.0은 최상위 응답의 71%를 인식합니다. Opus 5는 절반을 인식합니다. Sonnet 5는 29%를 인식하는데, 이는 10점을 받아야 할 응답 열 개 중 일곱 개에 7점 또는 8점을 준다는 뜻입니다.
이것이 실제로 어떤 의미인지 생각해 보십시오. 오늘 당신의 스피킹이 정말로 10점 수준이라고 가정해 봅시다. 응답 여덟 개를 녹음하고, 전사한 뒤, Claude Sonnet 5에 붙여넣고 점수를 요청하면 그중 여섯 개가 7점이나 8점이라고 알려줍니다. 당신은 아직 준비가 안 됐다고 결론짓습니다. 그래서 3주를 더 훈련합니다. 그러나 당신은 처음부터 준비되어 있었습니다. 이것은 가상의 실패 사례가 아닙니다. 우리 테스트 전체에서 가장 흔한 단일 오류이며, 가장 열심히 노력한 응시자에게 가장 무겁게 떨어집니다.
Claude에게 우리의 전체 절차를 제공하면 어떨까?
평범한 테스트 수치를 보고 Claude가 약한 모델이라고 결론짓기 쉽지만, 그렇지 않습니다. Opus 5는 우리가 테스트한 범용 채점자 중 상당한 차이로 가장 강력합니다. 문제는 지능이 아닙니다. 비교할 대상이 없는 상태에서 숫자를 요구받은 모델은 추측을 하게 되고, 추측할 때는 낮은 쪽, 중간 쪽으로 추측한다는 것입니다.
그래서 두 번째 테스트를 진행했습니다. Claude는 Engine 2.0의 채점자들이 받는 것과 동일한 자료 묶음을 받았습니다: 전사문, 과제, 그 정확한 과제의 각 등급에 대한 실제 보정 예시 두 개씩, 그리고 숫자를 만들어 내는 대신 네 가지 항목 각각에 대해 가장 가까운 예시를 지목하라는 지시입니다. 각 모델은 또한 그 모델 고유의 성향에 맞춘 짧은 보정 노트도 받았습니다.
우리의 전체 절차를 적용했을 때: 검증된 등급과 일치한 응답의 비율
동일한 48개의 보류된 응답. 각 Claude 모델은 Engine 2.0의 채점자들과 동일한 전사문, 지시, 보정 예시를 사용해 모든 응답을 한 번씩 채점했습니다.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
69%
Claude Sonnet 5
보정 예시는 큰 차이를 만듭니다. Opus 5는 62%에서 77%로, Sonnet 5는 45%에서 69%로 올라갑니다. 두 모델 모두 하위 등급 정확도는 Engine 2.0과 같은 88%에 이릅니다. 중위 등급 정확도도 두 모델 모두 81%에 이릅니다. 이는 목적에 맞게 설계된 채점자의 가치가 실제로 어디에 있는지를 알려주기 때문에 깊이 생각해 볼 만합니다: 더 똑똑한 모델에 있는 것이 아니라, 각 과제에서 각 등급이 실제로 어떻게 들리는지에 대한 실제 예시, 그리고 모델이 추측하는 대신 비교하도록 강제하는 질문에 그 가치가 있습니다.
그렇더라도 두 모델 모두 척도 상단에서는 여전히 뒤처집니다. 전체 절차를 적용해도 Opus 5는 최상위 응답의 63%, Sonnet 5는 38%를 인식하는 데 그치는 반면 Engine 2.0은 71%입니다. 단일 모델의 단일 시도는 작은 실수가 있는 우수한 응답에 대해 여전히 점수를 낮춥니다. Engine 2.0은 나머지 격차를 세 가지로 좁힙니다: 서로 다른 제공사의 독립적인 채점자 두 명, 각각 세 번씩 투표하여 중간 값을 취하는 방식, 그리고 두 채점자가 크게 의견이 갈릴 때 더 높은 점수를 채택하는 조정 규칙입니다. 분석 결과 우수한 응답에서는 낮은 판정이 거의 항상 틀린 판정이었기 때문입니다.
우리는 뻔한 지름길도 시도해 보았습니다: 평범한 프롬프트를 유지한 채 “중간으로 치우치지 말 것” 또는 “9등급 응답이 반드시 완벽할 필요는 없음”과 같은 지시를 추가하는 것입니다. 이는 측정 가능한 변화를 전혀 만들어내지 못했습니다. 모델은 지시에 동의한 뒤 결국 원래 하려던 대로 합니다. 효과가 있는 것은 질문 자체를 바꾸고, 실제로 비교할 대상을 주는 것입니다.
사용 흐름의 격차: 녹음하고 끝내거나, 모든 것을 직접 하거나
정확도 수치는 채점이 실제로 이루어진다는 것을 전제로 합니다. Claude를 사용하면 녹음을 멈추는 순간과 점수를 읽는 순간 사이에 놀라울 정도로 많은 작업이 놓여 있습니다.
첫째, 전사문이 필요합니다. Claude의 채팅 인터페이스는 음성 녹음을 채점하지 않으므로 텍스트를 직접 만들어야 합니다. 이는 말한 내용을 직접 타이핑하는 방법(이 경우 내용이 바뀝니다) 또는 녹음을 전사 도구에 통과시키는 방법 중 하나를 의미합니다. 그리고 여기 우리가 이해하기 전까지 정확도에 큰 대가를 치르게 한 세부 사항이 있습니다: 전사문은 있는 그대로여야 합니다. 모든 간투사, 모든 다시 말하기, 모든 자기 수정이 그대로 남아 있어야 합니다. 우리가 망설임을 제거한 “정리된” 전사문을 테스트했을 때 정확도가 15포인트 떨어졌는데, 그런 망설임이야말로 채점자가 응답이 어떻게 들리는지 판단하는 데 필요한 증거이기 때문입니다. 대부분의 일반 소비자용 전사 도구는 기본적으로 이를 정리해 버립니다.
둘째, 과제가 필요합니다. Claude는 올바른 시간 배분과 형식을 갖춘 CELPIP 형식의 프롬프트 은행을 갖고 있지 않습니다. 실제 시험이 무엇을 요구하는지 추측하며 직접 만들거나, 다른 곳에서 찾아 전사문과 함께 붙여넣어야 합니다.
셋째, 평범한 테스트 수치보다 나은 결과를 원한다면 보정 예시가 필요합니다: 같은 과제 유형에서 각 등급에 해당하는 검증된 등급의 실제 응답입니다. 이것이 우리 테스트에서 Opus 5를 62%에서 77%로 끌어올린 입력값이며, 학생이 집에서 만들어낼 수 없는 것입니다.
넷째, 다음 응답에 대해서도 이 모든 과정을 다시 해야 합니다. 그다음 응답에도 마찬가지입니다.
Prepamigo에서는 은행에서 과제를 고르면 타이머가 돌아가고, 말을 하고, 멈춘 지 약 10초 후에 점수와 피드백이 화면에 나타납니다. 전사는 설계상 있는 그대로 이루어지고, 보정 예시는 과제에 자동으로 첨부되며, 붙여넣을 것도 프롬프트를 쓸 것도 없습니다. 그날 저녁 열한 번째 응답도 첫 번째 응답과 똑같은 수고만 듭니다.
일관성: 같은 응답, 같은 점수
재현할 수 없는 점수는 측정이 아닙니다. 같은 녹음이 월요일에는 8점, 화요일에는 10점을 받는다면, 당신은 자신의 스피킹에 대해서는 아무것도 배우지 못하고 채점자의 기분에 대해서만 배우게 됩니다. 그래서 우리는 각 시스템이 두 번 물었을 때 같은 답을 주는지도 테스트했습니다.
Engine 2.0은 48개의 보류된 응답에 대해 세 번 별도로 실행되었습니다. 매 실행에서 81.3%를 기록했습니다. 집계가 아닌 개별 응답을 살펴보면, 87.5%가 세 번의 실행 모두에서 동일한 점수를 받았고, 2점 이상 움직인 경우는 4.2%뿐이었습니다. 그 소수의 응답은 두 등급 사이의 경계에 정확히 걸쳐 있어서, 판단의 작은 차이가 정당하게 점수를 한쪽으로든 다른 쪽으로든 기울이는 경우입니다.
Claude에 대한 평범한 테스트는 집계 수준에서도 실행 간에 몇 포인트씩 움직였고, 개별 응답 수준에서는 더 심하게 움직였습니다. 이 일관성 격차는 관련된 모델들의 우연한 결과가 아닙니다. 이는 투표 방식에서 나옵니다. Engine 2.0의 각 채점자는 모든 응답에 대해 세 번 투표하고 그중 중간 값을 채택하는데, 이는 단일 시도가 만들어내는 간헐적인 이상치를 제거합니다. 세 번 대신 한 번만 투표하도록 같은 구성을 테스트했을 때, 실행 간 일치율은 87.5%에서 77.1%로 떨어졌습니다. 단일 Claude 대화는 단일 투표입니다.
실제로 행동으로 옮길 수 있는 피드백
점수는 당신이 지금 어디에 있는지 알려줍니다. 피드백은 다음에 무엇을 해야 하는지 알려주며, 이 부분에서는 Claude가 정말로 뛰어납니다. 명료하게 글을 쓰고, 인내심이 있으며, 왜 그 점수를 줬는지 물으면 원하는 만큼 길게 설명해 줍니다. 응답에 대해 이야기를 나누고 싶은 응시자에게는 이것이 가치가 있습니다.
위험은 점수와 마찬가지입니다: 유창한 설명이 정확한 진단과 같은 것은 아닙니다. 10점짜리를 7점으로 채점한 모델은 왜 7점인지 설득력 있게 설명할 것입니다. 짚을 만한 무언가를 찾아낼 것입니다. 그리고 Claude는 채점하기 전에 증거를 확정해야 할 필요가 없었기 때문에, 그 설명은 이미 정해진 숫자를 정당화하기 위해 사후에 작성된 것입니다.
Engine 2.0은 그 반대로 작동합니다. 각 채점자가 판단하는 모든 항목에 대해 증거를 짚어야 하므로, 피드백 계층은 그 증거를 직접 전달받습니다: 내용, 어휘, 들리는 방식, 과제 완수 여부에 대한 판정을 뒷받침한 전사문 속 정확한 표현들입니다. 피드백은 그 증거를 바탕으로 작성되며 당신 자신의 말을 인용합니다. 우리가 표본 피드백에서 인용문 158개를 감사한 결과, 157개가 전사문에 그대로 등장했습니다. 독립적인 판정 모델에게 어느 쪽인지 모르는 상태로 Engine 2.0의 피드백과 이전 시스템이 만든 피드백을 비교하도록 요청했을 때, 시험관의 입장으로 판단할 때와 학생의 입장으로 판단할 때 모두 24건 중 20건에서 Engine 2.0을 더 선호했습니다.
우리는 피드백이 비판을 올바른 위치에 놓는지도 테스트했습니다. 우수한 응답을 가져와 각각 한 가지 측면을 의도적으로 손상시켰습니다: 문법 오류와 간투사를 삽입하거나, 정확한 단어를 모호한 단어로 바꾸거나, 뒷받침하는 세부 사항을 제거하거나, 과제가 요구한 핵심 행동을 없앴습니다. 네 가지 경우 중 세 가지에서 우리가 손상시킨 항목이 가장 크게 점수가 떨어진 항목이었습니다. 이는 챗봇이 쉽게 통과하기 어려운 종류의 검사인데, 챗봇에게는 대조할 고정된 항목이 없기 때문입니다.
매일 연습하는 데 드는 비용
스피킹 점수는 네 번째 응답이 아니라 마흔 번째 응답에서 가장 유용합니다. 그때가 바로 말하는 방식의 변화가 실제로 효과가 있는지 알려주기 시작하는 시점이기 때문입니다. 그러므로 실질적인 질문은 각 도구가 얼마인지가 아니라, 많이 사용할 때 얼마가 드는지입니다.
Claude Pro는 2026년 9월 claude.com에 게시된 기준으로 월 US$20, 약 CA$28이며, 연간 결제 시 월 US$17입니다. 5시간 단위로 순환하는 사용량 한도와 주간 한도가 있으며, 어느 쪽이든 도달하면 기다려야 합니다. 보정 예시가 첨부된 긴 전사문은 바로 그 한도를 많이 소모하는 유형의 메시지입니다. Max 요금제는 월 US$100부터, 세전 약 CA$138이며 한도를 상당히 높여주지만 완전히 없애지는 않습니다. 어떤 요금제도 문제 은행, 타이머, 전사, 보정 예시, 또는 CELPIP에 특화된 어떤 것도 포함하지 않습니다.
Prepamigo는 월 CA$24.98, 또는 연간 요금제로 월 CA$8.25(연 CA$98.98)이며 세금이 포함되어 있고 언제든지 해지할 수 있습니다. 모든 요금제에는 일일, 세션, 주간 한도가 전혀 없는 Engine 2.0의 무제한 채점, 무제한 시도, 그리고 전체 문제 은행이 포함됩니다: Speaking, Writing, Reading, Listening 전 영역에 걸쳐 80개의 완성된 연습 세트와 2,000개 이상의 연습 과제로, CELPIP General 시험의 과제 유형, 시간 배분, 형식을 따르도록 작성되었습니다.
간단히 말하면: Claude Pro보다 저렴한 가격으로, 가장 중요한 응답에서 훨씬 더 정확한 채점자를 얻을 수 있고, 절대 기다리게 하지 않으며, 문제와 보정 예시가 이미 준비되어 있습니다.
Claude가 더 나은 도구일 때
이 글은 CELPIP을 준비하는 동안 Claude를 절대 열어서는 안 된다고 주장하는 글이 아닙니다. Claude가 전문 채점 엔진보다 더 잘하는 것들이 여러 가지 있으며, 진지한 응시자라면 둘 다 사용하는 것이 합리적일 수 있습니다.
- 응답에 대해 이야기 나누기. 특정 이유가 왜 약했는지 이해하고 싶거나 더 나은 이유 세 가지를 구상하고 싶다면, 대화가 알맞은 형태입니다. Engine 2.0은 판정과 증거를 주지만 대화하지는 않습니다.
- 어휘와 표현 도움. 무언가를 말하는 더 자연스러운 방법 다섯 가지를 Claude에게 물어보는 것은 빠르고 유용하며, 제안도 대체로 좋습니다.
- 작문 연습. 작문 응답은 전사가 필요 없으므로 사용 흐름의 격차가 훨씬 작습니다. Claude의 작문 정확도는 이 테스트의 대상이 아니었으며, 여기서는 그에 대해 아무런 주장도 하지 않습니다.
- 시험 밖의 모든 것. 이민 서류 관련 질문, 학습 일정, 문법 설명 등: Claude는 범용 어시스턴트이고 Prepamigo는 그렇지 않습니다.
여기서 제시한 근거로 볼 때, Claude가 되어서는 안 되는 역할은 당신이 준비되었는지 알려주는 존재입니다. 그 역할을 위해서는 그 일을 위해 만들어졌고, 한 번도 본 적 없는 응답으로 테스트되었으며, 등급별로 측정된 채점자가 필요합니다.
피드백에서 새로워진 점
Engine 2.0에는 완전히 새로 만든 피드백 레이어가 탑재됩니다. 이 레이어는 단순히 점수만이 아니라 두 채점자의 근거를 함께 읽어내며, CELPIP을 처음 접하는 학생, 영어가 약해서 요령을 원하는 학생, 하루 30분씩 시간을 내고 다음 주 시험을 앞둔 학생이라는 세 유형의 학생을 대상으로 검증되었습니다. 무엇이 달라졌는지 살펴보겠습니다.
- 당신의 표현을 그대로 인용합니다. 모든 피드백 항목은 채점자가 반응한 실제 표현을 당신의 응답 스크립트에서 그대로 인용합니다. 인용부호로 표시된 문구는 원문 그대로 옮긴 것이며, 저희 검토 결과 158건 중 157건이 그러했습니다. 피드백은 당신이 말하지 않은 내용을 지어내지 않습니다.
- 가장 먼저 고쳐야 할 한 가지. 각 응답에는 단 하나의 최우선 개선점이 제시됩니다. 점수를 가장 크게 끌어올릴 하나의 변화를 가장 쉬운 말로 짚어줍니다. 이어서 구체적인 실천 방법 두 가지가 뒤따르고, 말하기를 시작하기 전 머릿속으로 훑어볼 세 가지 체크리스트가 이어집니다.
- 과제에 맞는 조언. 조언하기, 상황 묘사하기, 누군가를 설득하기는 각각 다른 기준으로 채점됩니다. 이제 피드백은 여덟 가지 과제 유형이 각각 무엇에 점수를 주는지 파악하고 그에 맞게 이야기하며, 모든 과제에 똑같은 일반적인 팁을 반복하지 않습니다.
- 가장 먼저 연습해야 할 영역. 피드백은 네 가지 영역 중 어느 것이 당신의 가장 약한 부분이고 어느 것이 가장 강한 부분인지 알려주므로, 다음 점수가 어디에 있는지 숫자 뒤에 숨기지 않고 바로 알 수 있습니다.
- 과제가 요구했지만 놓친 부분. 과제 수행(task fulfillment) 영역에서는 피드백이 프롬프트에서 다루지 않은 구체적인 부분을 나열하거나, 모두 다루었다면 그렇다고 명확히 알려줍니다.
- 실제로 연습할 수 있는 조언. 모든 실천 방법은 다음 시도 전에 소리 내어 연습해볼 수 있는 것들입니다. 더 명확하게 말하라거나 억양을 줄이라는 조언은 없습니다. 억양은 청취 가능성(listenability) 평가 대상이 아니며, 피드백은 이에 대해 절대 언급하지 않습니다.
- 시간 초과에 대한 불이익 없음. 과제를 완수한 뒤 시간이 다 되어 응답이 중단된 경우, 그 중단 자체로 감점되지 않으며 피드백도 이를 문제 삼지 않습니다.
독립적인 평가 모델이 어느 쪽이 어느 시스템의 결과인지 모르는 상태에서 동일한 응답에 대해 이 피드백과 이전 시스템이 생성한 피드백을 비교했을 때, 시험관의 관점과 학생의 관점 모두에서 24건 중 20건에서 새 피드백을 더 선호했습니다.
자주 묻는 질문
Claude로 CELPIP 스피킹 연습을 채점할 수 있나요? 숫자는 나옵니다. 검증된 점수가 있는 48개의 미공개 응답을 평범하게 물었을 때 Claude Opus 5는 62%, Claude Sonnet 5는 45%의 확률로 검증된 등급과 일치했으며, Prepamigo Scoring Engine 2.0은 81%였습니다. 최상위 응답에서는 Sonnet 5가 29%만 맞혔습니다.
Prepamigo가 Claude보다 더 정확한가요? 네: 평범한 요청 기준으로 81% 대 62%, 45%입니다. 보정 예시가 포함된 우리의 전체 절차를 적용해도 Opus 5는 77%, Sonnet 5는 69%에 그쳐 여전히 뒤처지며, 척도 상단에서는 여전히 가장 약합니다.
각각 비용은 얼마인가요? Claude Max는 월 US$100부터, 세전 약 CA$138이며 사용량 한도가 있습니다. Claude Pro는 US$20이지만 한도가 더 엄격합니다. Prepamigo는 세금 포함 월 CA$24.98, 또는 연간 요금제로 월 CA$8.25이며 무제한 채점과 80개의 연습 세트를 제공합니다.
왜 Claude는 제 우수한 응답에 계속 7점이나 8점을 주나요? 비교할 대상 없이 숫자를 요구받은 모델은 낮은 쪽, 중간 쪽으로 치우치며, 최상위 응답도 결코 완벽하지는 않습니다. 평범한 요청에서 Sonnet 5는 최상위 응답에 9점 이상을 준 경우가 29%에 불과했습니다.
채점이 실제로 어떻게 작동하는지 보려면 Scoring Engine 2.0 내부 들여다보기를 읽어보세요. GPT와 Gemini를 포함한 전체 순위를 보려면 어떤 AI가 CELPIP 스피킹을 가장 정확하게 채점하는가를 읽어보세요. 아니면 읽는 대신 바로 응답 녹음하기를 해보세요. 영어로 이 가이드 읽기
