48개의 보류된 응답에 대한 Engine 2.0
검증된 등급 안에 채점된 응답의 비율입니다. 서로 다른 날에 진행된 세 번의 별도 실행 모두 전체적으로 81.3%를 기록했습니다.
81%
정확한 등급
Prepamigo와 인기 챗봇 요금제 비교
캐나다 달러 기준입니다. Prepamigo 가격은 세금이 포함되어 있습니다. Claude Max(월 US$100부터)와 ChatGPT Pro(월 US$200)는 세전 가격을 1.38 환율로 환산한 값입니다. 정확도는 해당 모델에게 평범한 말로 채점을 요청했을 때 검증된 등급과 일치한 응답의 비율이며, 3회 실행의 평균입니다.
이것은 어떤 연습 도구에든 물어야 할 올바른 질문이지만, 대부분의 도구는 이에 답하지 않습니다. 스피킹 점수는 실제 채점관이 뭐라고 말할지 알려줄 때만 가치가 있으며, 그런지 아는 유일한 방법은 측정하는 것입니다. 그래서 이 글은 그 측정 결과이며, 우리에게 유리한 부분과 그렇지 않은 부분을 모두 담아 있는 그대로 정리했습니다.
한 문단으로 답하자면: Prepamigo의 Scoring Engine 2.0이 한 번도 본 적 없는, 각각 독립적으로 검증된 점수가 있는 48개의 스피킹 응답에서 엔진은 81%의 확률로 검증된 등급과 일치했고 92%의 확률로 1점 이내에 들어왔습니다. 세 번의 별도 실행 모두에서 동일하게 81%를 기록했습니다. 약한 응답과 중위 응답에서 가장 정확하여 각각 88%와 85%이며, 최상위 응답에서 가장 부정확하여 71%인데, 이 등급에서의 특징적인 실수는 10점짜리에 8점을 주는 것입니다. 동일한 전사문을 평범한 말로 채점하도록 요청했을 때, 우리가 테스트한 최고의 범용 AI 모델은 62%에 그쳤고 가장 약한 모델은 31%였습니다. 우리의 전체 채점 절차를 적용했을 때 최고는 77%에 그쳤습니다.
이어지는 내용에서는 우리가 이 수치들을 어떻게 얻었는지, 각 점수 등급에서 그것이 무엇을 의미하는지, 얼마나 안정적인지, 오류가 어디에서 발생하는지, 대신 사용할 수 있는 대안들과 비교하면 어떤지, 그리고 이 모든 것을 고려하여 자신의 점수를 어떻게 읽어야 하는지를 다룹니다. 실용적인 조언만 원한다면 점수 읽는 방법 섹션으로 바로 가십시오. 이 숫자를 애초에 믿을지 판단하고 싶다면 전체를 읽어보십시오.
여기서 “정확하다”는 것이 무슨 의미인가
숫자에 앞서 정의부터 짚겠습니다. 우리는 Prepamigo 점수가 시험 결과를 예측한다고 주장하지 않습니다. 어떤 연습 도구도 그것을 보장할 수 없으며, 그렇게 주장하는 곳은 그냥 추측하고 있는 것입니다. 우리가 측정하는 것은 더 좁고 더 정직합니다: 점수가 독립적으로 검증된 구술 응답이 주어졌을 때, 엔진이 같은 등급의 점수를 얼마나 자주 내놓는가입니다.
CELPIP 스피킹은 12점까지 있는 척도로 보고되며, 우리 기준 데이터의 검증된 점수는 세 등급으로 나뉩니다: 하위(4점 또는 5점), 중위(7점 또는 8점), 최상위(10점 이상). 우리는 엔진의 점수가 검증된 등급 안에 들어올 때 정확한 것으로 간주합니다. 최상위로 검증된 응답은 엔진이 9점, 10점, 11점 중 하나를 주면 정확하게 채점된 것입니다. 10점 이상만 인정하는 더 엄격한 기준으로 보면 이 페이지의 모든 수치가 몇 포인트씩 떨어지지만 모든 비교의 순서는 그대로 유지됩니다.
핵심 수치
81%는 실제로 무엇을 의미할까요? 일정한 수준으로 응답 열 개를 녹음하면, 엔진은 그중 약 여덟 개를 올바른 등급에 놓고 하나 더는 1점 이내에 놓습니다. 5점을 10점 등급에 놓거나 10점을 5점 등급에 놓는 일은 없습니다. 세 번의 실행에 걸친 144개의 채점된 응답에서 그런 일은 단 한 번도 없었습니다. 엔진이 하는 실수는 경계선상의 응답에 대해 신중한 채점관이 하는 실수이며, 다음 섹션에서 그것이 어디에 집중되는지 보여줍니다.
각 점수 등급에서의 정확도
검증된 등급별 정확도
등급당 보류된 16개의 응답. 각 막대는 그 등급의 응답 중 등급 안에 채점된 비율입니다.
88%
하위 (4~5)
85%
중위 (7~8)
71%
최상위 (10 이상)
하위 등급 응답: 88%. 약한 응답은 가장 알아보기 쉽습니다. 대체로 짧고, 프롬프트 의 표현을 재사용하며, 과제의 일부를 완수하지 못합니다. 엔진은 대부분의 경우 이런 신호를 포착합니다. 놓칠 때는 위쪽으로 놓칩니다: 모든 경우에서 응답은 4점이나 5점이 아니라 8점으로 채점되었습니다. 원인은 거의 항상 유창하고 자신감 있게 들리지만 내용은 거의 없는 응답입니다. 전달력이 내용에서는 얻지 못한 등급을 벌어다 주는 것입니다. 채점자들이 어느 항목을 높게 평가했는지 볼 수 있기 때문에 이를 알 수 있는데, 매번 전달력이었습니다.
중위 등급 응답: 85%. 어떤 의미에서는 이것이 채점하기 가장 어려운 등급인데, 단순히 발견하는 것이 아니라 저울질해야 하는 실제 강점과 약점의 혼합을 담고 있기 때문입니다. 엔진이 여기서 놓치는 경우는 양방향으로 나타납니다. 눈에 띄는 망설임이 있지만 아이디어가 견실한 일부 응답은 5점이나 6점으로 끌어내려졌습니다. 매끄럽게 들리는 일부 응답은 10점으로 밀려 올라갔습니다. 두 채점자 사이의 조정 단계가 이런 경우 대부분을 잡아내며, 이것이 이 수치가 이렇게 높은 이유입니다.
최상위 등급 응답: 71%. 이것이 가장 약한 등급이며 우리가 가장 자주 언급하는 등급인데, 오류가 매우 일관적이기 때문입니다. 엔진이 최상위 응답을 놓칠 때는 8점을 줍니다. 7점도 6점도 아니라, 정답으로 간주되는 몇 개의 9점을 제외하면 모든 경우에서 8점입니다. 엔진은 우수한 응답을 보고도 한 단계 점수를 낮춥니다.
이는 맥락이 필요합니다. 우수한 응답에 대해 8점으로 치우치는 것은 Prepamigo만의 특이한 현상이 아닙니다. 이는 우리가 테스트한 모든 자동 채점기, 사람이 보정했든 아니든 상관없이 나타나는 특징적인 실패입니다. 우리의 이전 엔진은 이 문제가 훨씬 더 심했습니다. 동일한 응답을 평범하게 채점하도록 요청했을 때, 최고의 범용 모델은 최상위 응답의 56%를 인식했습니다. ChatGPT 유료 요금제의 기반 모델은 25%를 인식했습니다. 우리의 전체 절차를 적용해도 어느 모델도 63%를 넘지 못했습니다. 71%는 우리가 달성한 최고의 수치이며, 여전히 우리가 가장 개선하고 싶은 숫자입니다.
화면 이쪽에서 본 8점 문제
등급별 관점은 알려진 등급의 응답에 대해 엔진이 어떻게 하는지 알려줍니다. 당신은 그것을 반대 방향에서 보고 있습니다: 점수를 받았고 그것을 얼마나 믿어야 할지 알고 싶은 것입니다. 그래서 여기 같은 데이터를 뒤집어 보겠습니다. 엔진이 주는 각 점수에 대해, 응답이 실제로 그 등급이었던 빈도는 얼마나 될까요?
- 엔진이 4점 또는 5점을 준다면: 응답이 하위 등급이었던 경우가 93%였습니다. 나머지는 망설임이 심한 중위 등급 응답이었습니다. Engine 2.0의 낮은 점수는 거의 항상 맞습니다.
- 엔진이 10점을 준다면: 응답이 최상위 등급이었던 경우가 92%였습니다. Engine 2.0의 10점은 10점입니다.
- 엔진이 8점을 준다면: 응답이 중위 등급이었던 경우가 67%, 최상위 등급이었던 경우가 23%, 하위 등급이었던 경우가 10%였습니다. 8점은 신중하게 읽어볼 만한 유일한 점수입니다.
쉽게 말하면: Engine 2.0의 8점은 “아마 중위 등급이지만, 더 좋을 수도 있음”을 의미합니다. 8점을 받은 응답 중 대략 네 개 중 하나는 실제로 10점짜리였습니다. 훌륭하다고 생각한 응답에서 8점을 받았다면, 준비가 안 됐다고 결론짓지 마십시오. 같은 과제를 다시 녹음해 보십시오. 세 번의 시도 에서 꾸준히 10점이 나오면 10점입니다. 세 번의 시도에서 꾸준히 8점이 나오면 8점입니다. 결과가 뒤섞여 있다면 경계선상의 응답이며, 피드백이 어느 항목이 그것을 붙잡고 있는지 알려줄 것입니다.
같은 녹음은 같은 점수를 받는가?
일관성 없는 정확도는 운입니다. 같은 녹음이 오늘 8점을 받고 내일 10점을 받을 수 있다면, 81% 라는 수치는 잡음에 대한 평균일 뿐이고 그 점수로는 아무것도 추적할 수 없습니다. 그래서 우리는 재현성을 직접 테스트했습니다.
48개의 보류된 응답은 서로 다른 날에, 그 사이 아무것도 바꾸지 않은 채 세 번 별도로 채점되었 습니다. 전체 수치는 매 실행에서 81.3%였습니다. 개별 응답 수준에서는 87.5%가 세 번 모두 동일한 점수를 받았고, 2점 이상 움직인 경우는 4.2%뿐이었습니다. 그 소수의 응답은 두 등급 사이의 경계에 정확히 걸쳐 있어서, 판단의 작은 차이가 정당하게 점수를 한쪽으로든 다른 쪽으로든 기울이는 경우입니다.
이 일관성은 특정한 설계 선택에서 나옵니다. 엔진의 두 채점자 각각은 모든 응답에 대해 세 번 투표하고 중간 값을 채택합니다. 세 번 대신 한 번만 투표하도록 같은 구성을 테스트했을 때, 실행 간 동일한 점수의 비율은 87.5%에서 77%로 떨어졌고, 2점 이상 움직이는 응답의 비율은 두 배 이상 으로 늘었습니다. 투표는 정확도 수치를 바꾸지 않았습니다. 그것은 정확도 수치가 의미가 있는지 없는지를 바꿨습니다.
당신에게 이 일관성은 점수의 변화가 곧 당신의 스피킹의 변화라는 것을 의미합니다. 일주일 동안 같은 과제 유형을 세 번 녹음했는데 점수가 8점에서 10점으로 움직였다면, 그것은 채점기가 컨디션 이 좋았던 것이 아닙니다. 바로 당신입니다.
대신 사용할 수 있는 대안들과의 비교
정확도 수치는 비교할 대상이 있어야 더 의미가 있습니다. 그래서 우리는 사람들이 실제로 연습을 채점하는 데 사용하는 범용 AI 모델에 같은 48개의 보류된 응답을 사람이 하는 방식대로 통과시켰습니다: 각 모델에게 있는 그대로의 전사문과 과제를 주고, 자신이 경험 많은 CELPIP 시험관이라고 알려준 뒤 0점에서 12점 사이의 점수를 요청했습니다. 각각 세 번씩 실행하여 평균을 냈습니다.
검증된 등급 안에 채점된 응답의 비율
동일한 48개의 보류된 응답. 각 모델에게 평범한 말로 전사문을 채점하도록 요청했으며, 3회 실행의 평균입니다. Engine 2.0은 일반 프로덕션 구성으로 실행되었습니다.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Engine 2.0은 모든 모델을 19포인트에서 51포인트까지 앞섭니다. 평범하게 물었을 때 모든 범용 모델이 가혹하게 채점합니다: 약한 응답에서의 실수는 대체로 3점, 우수한 응답에서의 실수는 7점 이나 8점입니다. Claude Opus 5와 Gemini만이 절반을 넘습니다. 더 큰 세 GPT 모델은 31%에서 37% 사이이며, 최상위 응답을 13%에서 27% 사이의 확률로 인식합니다.
그런 다음 우리는 모든 모델에게 우리의 전체 절차를 제공했습니다: 그 정확한 과제에 대한 동일한 보정 예시, 동일한 강제 비교, 그리고 그 모델 고유의 성향에 맞춘 짧은 보정 노트입니다. 이는 우리 손에서 각 모델이 달성할 수 있는 최선의 결과이며, 예시 없이는 학생이 재현할 수 없는 것입니다. Opus 5는 77%까지, GPT 5.6 sol과 Gemini는 71%까지, GPT 5.5와 Sonnet 5는 69%까지, luna는 63% 까지, GPT-4o mini는 50%까지 올라갔습니다. 그들 모두 여전히 Engine 2.0에 뒤졌으며, 어느 모델도 최상위 응답의 63% 이상을 인식하지 못했습니다.
피드백에서 새로워진 점
Engine 2.0에는 완전히 새로 만든 피드백 레이어가 탑재됩니다. 이 레이어는 단순히 점수만이 아니라 두 채점자의 근거를 함께 읽어내며, CELPIP을 처음 접하는 학생, 영어가 약해서 요령을 원하는 학생, 하루 30분씩 시간을 내고 다음 주 시험을 앞둔 학생이라는 세 유형의 학생을 대상으로 검증되었습니다. 무엇이 달라졌는지 살펴보겠습니다.
- 당신의 표현을 그대로 인용합니다. 모든 피드백 항목은 채점자가 반응한 실제 표현을 당신의 응답 스크립트에서 그대로 인용합니다. 인용부호로 표시된 문구는 원문 그대로 옮긴 것이며, 저희 검토 결과 158건 중 157건이 그러했습니다. 피드백은 당신이 말하지 않은 내용을 지어내지 않습니다.
- 가장 먼저 고쳐야 할 한 가지. 각 응답에는 단 하나의 최우선 개선점이 제시됩니다. 점수를 가장 크게 끌어올릴 하나의 변화를 가장 쉬운 말로 짚어줍니다. 이어서 구체적인 실천 방법 두 가지가 뒤따르고, 말하기를 시작하기 전 머릿속으로 훑어볼 세 가지 체크리스트가 이어집니다.
- 과제에 맞는 조언. 조언하기, 상황 묘사하기, 누군가를 설득하기는 각각 다른 기준으로 채점됩니다. 이제 피드백은 여덟 가지 과제 유형이 각각 무엇에 점수를 주는지 파악하고 그에 맞게 이야기하며, 모든 과제에 똑같은 일반적인 팁을 반복하지 않습니다.
- 가장 먼저 연습해야 할 영역. 피드백은 네 가지 영역 중 어느 것이 당신의 가장 약한 부분이고 어느 것이 가장 강한 부분인지 알려주므로, 다음 점수가 어디에 있는지 숫자 뒤에 숨기지 않고 바로 알 수 있습니다.
- 과제가 요구했지만 놓친 부분. 과제 수행(task fulfillment) 영역에서는 피드백이 프롬프트에서 다루지 않은 구체적인 부분을 나열하거나, 모두 다루었다면 그렇다고 명확히 알려줍니다.
- 실제로 연습할 수 있는 조언. 모든 실천 방법은 다음 시도 전에 소리 내어 연습해볼 수 있는 것들입니다. 더 명확하게 말하라거나 억양을 줄이라는 조언은 없습니다. 억양은 청취 가능성(listenability) 평가 대상이 아니며, 피드백은 이에 대해 절대 언급하지 않습니다.
- 시간 초과에 대한 불이익 없음. 과제를 완수한 뒤 시간이 다 되어 응답이 중단된 경우, 그 중단 자체로 감점되지 않으며 피드백도 이를 문제 삼지 않습니다.
독립적인 평가 모델이 어느 쪽이 어느 시스템의 결과인지 모르는 상태에서 동일한 응답에 대해 이 피드백과 이전 시스템이 생성한 피드백을 비교했을 때, 시험관의 관점과 학생의 관점 모두에서 24건 중 20건에서 새 피드백을 더 선호했습니다.
자신의 점수를 읽는 방법
- 4점이나 5점은 거의 확실히 맞습니다. 엔진은 88%의 확률로 약한 응답을 식별하며, 4점이나 5점을 줄 때는 93%의 확률로 맞습니다. 어느 항목이 가장 낮은지 피드백을 읽고 그 항목을 개선하세요.
- 10점은 10점입니다. 엔진이 10점을 줄 때, 응답이 최상위 등급이었던 경우가 92%였습니다. 그 과제 유형은 준비가 되었습니다. 피하고 있는 유형으로 넘어가세요.
- 8점은 질문입니다. 3분의 2는 중위 등급을 의미합니다. 네 번 중 한 번은 최상위 등급을 의미합니다. 같은 과제를 다시 녹음하고 여러 번 시도한 패턴을 살펴보세요.
- 등급보다 변화를 더 믿으세요. 점수가 안정적이므로, 여러 시도에 걸친 변화는 곧 당신의 스피킹의 변화입니다. 같은 과제 유형을 반복하는 것이 새로운 습관이 효과가 있는지 알아내는 가장 빠른 방법입니다.
- 인용문을 읽으세요. 피드백에 인용된 표현들은 채점자가 반응한 부분입니다. 그것이 바꿔야 할 구체적인 단어들입니다.
자주 묻는 질문
Prepamigo의 스피킹 점수는 얼마나 정확한가요? 검증된 점수가 있는 48개의 미공개 응답에서: 정확한 등급 81%, 1점 이내 92%, 세 번의 실행 모두에서 동일했습니다. 등급별로는 하위 88%, 중위 85%, 최상위 71%입니다.
제 실제 점수와 같은가요? 어떤 연습 도구도 그것을 보장할 수 없습니다. 우리가 측정하는 것은 엔진이 같은 응답에 대해 검증된 점수와 얼마나 자주 일치하는가입니다. 자신의 점수를 방향성이 있는 등급으로 읽고, 여러 시도에 걸친 패턴을 살펴보세요.
훌륭하다고 생각한 응답에서 왜 8점을 받았나요? 이것은 엔진에 남아 있는 가장 큰 오류입니다: 8점 중 하나는 실제로 10점짜리였습니다. 같은 과제를 다시 녹음해 보세요. 여러 시도에서 꾸준히 10점이 나오면 10점입니다.
같은 녹음은 두 번 다 같은 점수를 받나요? 세 번의 실행에서 87.5%가 동일했고, 2점 이상 움직인 경우는 4.2%뿐이었으며 모두 등급 경계에 있었습니다.
엔진이 단계별로 어떻게 작동하는지 보려면 Scoring Engine 2.0 내부 들여다보기를 읽어보세요. 동일한 테스트를 GPT, Claude, Gemini에 대해 실행한 결과를 보려면 어떤 AI가 CELPIP 스피킹을 가장 정확하게 채점하는가를 읽어보세요. 아니면 응답 녹음하기를 통해 직접 수치를 확인해 보세요. 영어로 이 가이드 읽기
