채점자로서 Prepamigo Scoring Engine 2.0과 최첨단 모델 비교
점수가 독립적으로 검증된 점수와 일치한 스피킹 응답의 비율입니다. 시스템이 한 번도 본 적 없는 48개의 응답이며, 하위·중위·최상위 점수에 균등하게 분포되어 있습니다. 각 모델에게 전사문을 주고 평범한 말로 CELPIP 척도에 따라 채점하도록 요청했으며, 3회 실행의 평균입니다.
81%
Prepamigo Scoring Engine 2.0Prepamigo
62%
Claude Opus 5Anthropic
58%
GeminiGoogle
45%
Claude Sonnet 5Anthropic
45%
GPT-4o miniOpenAI
37%
GPT 5.5OpenAI
35%
GPT 5.6 solOpenAI
31%
GPT 5.6 lunaOpenAI
Prepamigo와 인기 챗봇 요금제 비교
캐나다 달러 기준입니다. Prepamigo 가격은 세금이 포함되어 있습니다. Claude Max(월 US$100부터)와 ChatGPT Pro(월 US$200)는 세전 가격을 1.38 환율로 환산한 값입니다. 정확도는 해당 모델에게 평범한 말로 채점을 요청했을 때 검증된 등급과 일치한 응답의 비율이며, 3회 실행의 평균입니다.
지금까지 가장 정확한 스피킹 채점기입니다. 한 번도 본 적 없는 응답에서 Prepamigo Scoring Engine 2.0은 81%의 확률로 검증된 점수와 일치했으며, 같은 작업으로 테스트한 모든 최첨단 모델을 앞섰고, 이를 대체하는 이전 채점기인 Engine 1.0에서 확실히 한 단계 발전했습니다.
오늘 우리는 Prepamigo에서 모든 스피킹 연습 응답을 채점하는 시스템인 Prepamigo Scoring Engine 2.0 for Speaking을 출시합니다. Engine 2.0은 채점 방식을 완전히 새로 설계한 결과물입니다. 단일 채점 시도 대신, 각 응답을 보정된 예시와 직접 비교하는 독립적인 채점자 두 명을 사용하고, 여러 번 투표한 뒤 점수를 표시하기 전에 답을 조정합니다.
그 결과는 학생이 실제로 사용하는 방식으로 사용했을 때 어떤 최첨단 모델보다 훨씬 더 정확한 채점기 입니다. 독립적으로 검증된 점수가 있는 실제 구술 응답의 보류 세트에서 Engine 2.0은 81%의 확률로 정확한 점수를 맞혔습니다. 동일한 전사문을 평범한 말로 채점하도록 요청했을 때, 그중 가장 강력한 Claude Opus 5는 62%에 그쳤습니다. Gemini는 58%였습니다. Claude Sonnet 5와 GPT-4o mini는 45%, GPT 5.5는 37%, GPT 5.6 sol은 35%, GPT 5.6 luna는 31%였습니다. 그런 다음 모든 모델에게 모든 과제에 대한 실제 보정 예시가 포함된 Engine 2.0 자체의 절차를 건네주자, 그중 최고는 77%까지 올라갔지만 여전히 뒤처졌습니다.
정확도는 달성하기 가장 어려운 곳에서 가장 중요합니다. Engine 2.0은 최상위 응답의 71%를 인식합니다. 평범하게 물었을 때 다른 어떤 모델도 56%를 넘기지 못했고, GPT 모델들은 13%에서 27% 사이였습니다. Engine 2.0은 또한 자동 채점기들의 가장 흔한 실패, 즉 응답이 실제로 얼마나 강하든 약하든 상관없이 낮은 쪽, 척도의 중간 쪽으로 점수가 치우치는 현상에도 저항합니다. 이 치우침은 우리가 Engine 1.0에서 가장 자주 목격했던 약점이었습니다.
Engine 2.0은 더 빠르고, 더 일관되며, 학생 자신의 말을 인용하는 피드백을 만들어냅니다. 오늘부터 모든 Prepamigo 사용자에게 적용됩니다. 이 페이지에서는 무엇을 하는지, 어떻게 측정했는지, 그리고 그 한계가 어디에 있는지 설명합니다.
검증된 점수 대비 정확도
우리가 신경 쓰는 질문은 단순합니다. 학생이 응답을 녹음할 때, 화면에 나타난 점수가 믿을 수 있는 채점자가 줬을 점수와 일치하는가? 이 질문에 답하기 위해 우리는 8개 스피킹 과제 유형을 모두 포괄하는 실제 구술 응답의 테스트 세트를 만들었고, 각각 독립적으로 검증된 점수를 부여했으며, 어느 한 등급도 결과를 지배하지 못하도록 하위·중위·최상위 점수에 균등하게 세트를 나눴습니다.
이 비교는 처음부터 따로 보관해 둔 그중 48개의 응답을 사용합니다. 팀의 누구도 Engine 2.0을 만들거나 조정하는 동안 이를 사용하지 않았습니다. 모든 응답은 한 단어도 빠짐없이 전사되었습니다. 그런 다음 각 모델에게 자신이 경험 많은 CELPIP 시험관이라고 알려주고, 과제 프롬프트와 전사문을 준 뒤 응답을 0점에서 12점 사이로, 서로 다른 날에 세 번 채점하도록 요청했습니다. 우리는 세 번의 실행을 평균 내고 점수가 검증된 점수의 등급과 얼마나 자주 일치하는지 집계했습니다.
51%
Claude Opus 5보다 실수가 적음
응답 100개당 오답 19개, Claude Opus 5는 38개.
71%
GPT 5.6 sol보다 실수가 적음
100개당 오답 19개, GPT 5.6 sol은 65개.
71%
최상위 응답 인식률
다른 모델 중 최고는 56%, GPT 5.6 sol은 25%를 인식합니다.
이 수치에서 세 가지가 눈에 띕니다. 첫째, 격차가 작지 않습니다. 48개 응답 테스트에서 가장 강력한 최첨단 모델 대비 19포인트, ChatGPT 유료 요금제의 기반 모델 대비 46포인트는 각각 9개와 22개의 추가 정답 차이에 해당합니다. 둘째, 이 격차는 우호적인 테스트의 산물이 아닙니다. 48개의 응답은 Engine 2.0의 설계가 확정되기 전에 선정되었고 개발 과정에서 전혀 손대지 않았습니다. 셋째, 이 비교는 학생에게 중요한 비교입니다: 전사문을 챗봇에 붙여넣고 물었을 때 얻게 되는 것을 측정하는데, 이는 거의 모든 사람이 이 모델들을 사용하는 방식입니다.
여기서 “정확하다”는 것이 무엇을 의미하는지 한마디 덧붙입니다. 이 척도에서 검증된 점수는 단일 점수가 아니라 등급으로 나오므로, 점수가 검증된 등급 안에 들어올 때 정확한 것으로 간주합니다. 예를 들어 최상위 등급으로 검증된 응답은 엔진이 9점, 10점, 11점 중 하나를 주면 정확하게 채점된 것입니다. 10점 이상만 인정하는 더 엄격한 기준으로 보면 모든 시스템이 몇 포인트씩 잃지만 순위는 바뀌지 않습니다.
| 시스템 | 평범한 요청 | 전체 절차 적용 시 |
|---|---|---|
| Prepamigo Scoring Engine 2.0 | 81.3% | — |
| Claude Opus 5 | 61.8% | 77.1% |
| Gemini | 58.3% | 70.8% |
| Claude Sonnet 5 | 45.1% | 68.8% |
| GPT-4o mini | 45.1% | 50.0% |
| GPT 5.5 | 36.8% | 68.8% |
| GPT 5.6 sol | 35.4% | 70.8% |
| GPT 5.6 luna | 30.6% | 62.5% |
모든 점수 등급에서의 성능
평균 정확도 수치는 많은 것을 숨길 수 있습니다. 약한 응답에서는 뛰어나지만 강한 응답에서는 형편없는 채점기는, 정확한 답이 가장 필요한 학생들을 저버리면서도 그럴듯한 수치를 내세울 수 있습니다. 그래서 우리는 테스트 세트의 세 등급, 즉 4점 또는 5점의 하위 점수, 7점 또는 8점의 중위 점수, 10점 이상의 최상위 점수 각각에 대해 정확도를 따로 보고합니다.
인간이든 기계든 대부분의 채점자는 중간으로 치우칩니다. 우수한 응답은 10점이 아니라 8점을 받습니다. 약한 응답은 5점이 아니라 6점을 받습니다. 비교할 대상이 없으면 최첨단 모델들은 한 가지 습성을 더 추가합니다: 아래쪽으로 치우쳐서, 약한 응답이 종종 3점, 우수한 응답이 7점으로 채점됩니다. Engine 2.0은 이 두 가지 편향 모두에 저항하도록 특별히 설계되었으며, 그 결과는 척도 상단에서 가장 명확하게 드러납니다.
하위 점수 · 검증된 점수 4점 또는 5점
시스템당 보류된 16개의 응답, 평범한 요청, 3회 실행 평균.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
75%
GPT-4o mini
56%
Gemini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
44%
Claude Sonnet 5
중위 점수 · 검증된 점수 7점 또는 8점
시스템당 보류된 16개의 응답, 평범한 요청, 3회 실행 평균.
85%
Prepamigo Engine 2.0
63%
Gemini
63%
Claude Sonnet 5
58%
Claude Opus 5
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
최상위 점수 · 검증된 점수 10점 이상
시스템당 보류된 16개의 응답, 평범한 요청, 3회 실행 평균. 놓치는 경우는 거의 전부 7점 또는 8점입니다.
71%
Prepamigo Engine 2.0
56%
Gemini
50%
Claude Opus 5
29%
Claude Sonnet 5
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
하위 등급에서는 Engine 2.0이 88%로 앞서고, Claude Opus 5는 77%, GPT-4o mini는 75%입니다. 다른 모든 모델은 대략 절반 수준이고, Claude Sonnet 5는 44%입니다. 놓치는 경우는 거의 항상 3점입니다: 모델이 약한 응답을 보고 그 등급 안이 아니라 그 아래로 채점합니다. GPT-4o mini의 여기서 나름 괜찮은 수치는 이 모델의 문제, 즉 거의 모든 것을 낮게 채점한다는 문제의 첫 번째 신호입니다. 척도 상단에서는 여섯 개 중 하나만 인식합니다.
중위 등급에서는 Engine 2.0이 85%로 앞섭니다. Gemini와 Claude Sonnet 5는 63%, Claude Opus 5는 58%이며, 그다음 급격히 떨어집니다: GPT-4o mini는 44%, 더 큰 세 GPT 모델은 27%에서 29%입니다. 중위 등급 응답은 단순히 발견하는 것이 아니라 저울질해야 하는 강점과 약점의 혼합을 담고 있는데, 저울질할 대상이 없으면 GPT 모델들은 약점 쪽으로 기울어 5점이나 6점을 줍니다.
최상위 등급에서 격차가 가장 큽니다. Engine 2.0은 최상위 응답의 71%를 정확하게 식별합니다. Gemini 는 56%, Opus 5는 정확히 절반을 식별합니다. 다른 일곱 모델 중 다섯 개가 10점을 받아야 할 응답 열 개 중 적어도 일곱 개에 7점 또는 8점을 줍니다. 이는 중간 치우침 문제가 가장 순수한 형태로 나타난 것입니다. 최상위 응답도 완벽하지는 않습니다. 간간이 실수, 다시 말하기, 복잡한 문장들 사이에 낀 평범한 문장이 섞여 있으며, 상상 속의 완벽한 답과 비교해 채점하는 채점자는 그 하나하나에 점수를 깎습니다. Engine 2.0은 실수를 포함한 실제 최상위 응답이 어떤 모습인지 보여주는 예시에 맞춰 보정되어 있으며, 완벽함이 아니라 그 예시들과 비교하도록 명시적으로 설계되었습니다.
그들에게 우리의 전체 절차를 제공하면 어떨까?
평범한 요청 수치는 이 모델들이 얼마나 똑똑한지에 대한 판정이 아닙니다. 비교할 대상이 없는 상태 에서 모델에게 숫자를 요구했을 때 벌어지는 일에 대한 판정입니다. 그래서 우리는 두 번째 테스트를 진행하여 모든 모델에게 Engine 2.0의 채점자들이 실제로 받는 것, 즉 전사문, 과제, 그 특정 과제의 각 등급에 대한 실제 보정 예시 두 개씩, 그리고 숫자를 만들어 내는 대신 네 가지 항목 각각에 대해 가장 가까운 예시를 지목하라는 지시를 제공했습니다. 각 모델은 또한 그 모델 고유의 성향에 맞춘 짧은 보정 노트도 받았습니다.
우리의 전체 절차를 적용했을 때: 검증된 등급과 일치한 응답의 비율
동일한 48개의 보류된 응답. 모든 시스템에 동일한 전사문, 지시, 보정 예시를 사용했으며, 각 모델은 모든 응답을 한 번씩 채점했습니다.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
71%
GPT 5.6 sol
71%
Gemini
69%
GPT 5.5
69%
Claude Sonnet 5
63%
GPT 5.6 luna
50%
GPT-4o mini
모든 모델이 개선되며, 일부는 극적으로 개선됩니다. GPT 5.6 sol은 35%에서 71%로 두 배가 됩니다. Opus 5는 62%에서 77%로 올라갑니다. GPT-4o mini는 45%에서 50%로 거의 움직이지 않는데, 무엇을 보여주든 모든 것을 낮게 채점하기 때문입니다. 그리고 모든 모델이 여전히 Engine 2.0에 뒤처집니다. 척도 상단에서는 격차가 계속됩니다: Opus 5, GPT 5.6 sol, Gemini, GPT 5.5는 모두 최상위 응답의 63%에서 멈추고, Sonnet 5는 38%, GPT-4o mini는 0%인 반면 Engine 2.0은 71%입니다.
이 두 번째 테스트는 Engine 2.0의 가치가 실제로 어디에 있는지 알려줍니다. 더 똑똑한 모델이 아닙니다. 바로 이 목록에 있는 모델들을 사용합니다. 각 과제에서 각 등급이 실제로 어떻게 들리는지 에 대한 실제 예시, 모델이 추측하는 대신 비교하도록 강제하는 질문, 그리고 단일 시도로는 제공할 수 없는 세 가지가 더 있습니다: 서로 다른 제공사의 독립적인 채점자 두 명, 각각 세 번씩 투표하여 중간 값을 취하는 방식, 그리고 두 채점자가 크게 의견이 갈릴 때 더 높은 점수를 채택하는 조정 규칙입니다. 분석 결과 우수한 응답에서는 낮은 판정이 거의 항상 틀린 판정이었기 때문입니다.
일관성과 안정성
믿을 수 있는 채점기는 일관성이 있어야 합니다. 같은 녹음이 오늘 8점을 받고 내일 10점을 받을 수 있다면, 어느 숫자도 큰 의미가 없고 학생은 자신의 연습이 효과가 있는지 알 수 없습니다. 그래서 정확도와 함께, 우리는 Engine 2.0이 같은 질문을 두 번 받았을 때 같은 답을 주는지도 측정합니다.
우리는 Engine 2.0을 48개의 보류된 응답에 대해 서로 다른 날에, 그 사이 아무것도 바꾸지 않은 채 세 번 별도로 실행했습니다. 매 실행에서 81.3%를 기록했습니다. 대략 81%가 아니라, 매번 48개 중 같은 39개의 정답, 오차는 하나 정도였습니다. 집계가 아닌 개별 응답을 살펴보면, 87.5%가 세 번의 실행 모두에서 동일한 점수를 받았고, 실행 간 2점 이상 움직인 경우는 4.2%뿐이었습니다. 그 소수의 응답은 두 등급 사이의 경계에 정확히 걸쳐 있어서, 판단의 작은 차이가 정당하게 점수를 한쪽으로든 다른 쪽으로든 기울이는 경우입니다.
최첨단 모델들에 대한 평범한 요청 테스트는 실행 간에 훨씬 더 크게 움직였습니다. GPT 5.6 sol은 세 번의 실행에서 31%, 40%, 35%를, Opus 5는 62%, 65%, 58%를 기록했습니다. 서로 다른 날에 같은 전사문을 챗봇에게 채점하도록 하면 상당히 자주 서로 다른 점수를 받게 됩니다.
일관성은 두 가지 설계 결정에서 나옵니다. Engine 2.0의 각 채점자는 모든 응답에 대해 세 번 투표 하고 중간 값을 채택하는데, 이는 단일 시도가 만들어낼 간헐적인 이상치를 제거합니다. 그리고 두 채점자의 판정은 또 다른 모델이 아니라 고정된 규칙에 따라 조정되므로, 같은 두 판정은 항상 같은 최종 점수를 만들어냅니다. 두 결정 모두 직접 테스트되었습니다: 세 번 대신 한 번만 투표했을 때 실행 간 일치율은 87.5%에서 77.1%로 떨어졌고, 2점 이상 움직이는 응답의 비율은 두 배 이상으로 늘었습니다.
Engine 2.0이 응답을 채점하는 방법
Engine 2.0은 단일 모델이 아닙니다. 하나의 절차이며, 그 절차가 차이를 만듭니다. 학생이 멈춤을 누르는 순간과 점수가 화면에 나타나는 순간 사이 약 10초 동안 일어나는 일은 다음과 같습니다.
- 녹음은 한 단어도 빠짐없이 전사됩니다. 모든 간투사, 모든 다시 말하기, 모든 자기 수정이 그대로 남습니다. 이는 필수적인 것으로 드러났습니다. 우리가 망설임을 제거한 “정리된” 전사문을 테스트했을 때 정확도가 15포인트 떨어졌는데, 그 망설임이 채점자가 응답이 어떻게 들리는지 판단하는 데 필요한 증거의 일부이기 때문입니다.
- 독립적인 채점자 두 명이 전사문을 읽습니다. 이들은 서로 다른 제공사의 서로 다른 기반 모델로 만들어져 있어 같은 사각지대를 공유하지 않습니다. 각 채점자는 과제 프롬프트, 전사문, 그리고 그 정확한 과제에 대한 작은 보정 예시 모음, 즉 하위·중위·최상위 등급의 실제 응답 각 두 개씩을 받아서 각 등급이 단일 지점이 아니라 범위로 제시되도록 합니다.
- 각 채점자는 점수를 매기는 대신 비교합니다. 이는 Engine 1.0으로부터의 핵심적인 변화입니다. 숫자를 요구받는 대신, 각 채점자는 응답의 네 가지 항목 각각에 대해 어느 보정 예시와 가장 비슷한지 질문받습니다. “중간 어딘가”라는 선택지는 없습니다. 가장 가까운 예시에 확정적으로 답해야 한다는 점이 중간으로의 치우침을 막습니다. 점수는 그다음 선택된 등급으로부터 모델이 아니라 고정된 규칙에 의해 도출됩니다.
- 각 채점자는 세 번 투표합니다. 각 항목에서 중간 값이 채택됩니다. 이는 간헐적인 컨디션 난조의 답을 제거하면서도 진정한 판단을 평균으로 희석시키지 않습니다.
- 두 판정이 조정됩니다. 채점자들이 일치하거나 1점 차이라면, 최종 점수는 그 둘의 평균입니다. 2점 이상 차이가 나면 더 높은 점수가 사용됩니다. 이 규칙은 관대함이 아니라 보정입니다. 두 채점자가 크게 의견이 갈린 모든 경우를 분석했을 때, 낮은 판정이 거의 항상 틀린 판정이었습니다. 그 의견 차이가 거의 항상 한 채점자가 지나치게 신중했던 최상위 응답에서 발생했기 때문입니다.
- 안전장치가 적용됩니다. 짧은 고정 규칙 모음이 어떤 채점자도 추측할 필요가 없어야 하는 경우들을 처리합니다: 무음이거나, 몇 단어에 불과하거나, 다른 언어로 되어 있거나, 완전히 주제에서 벗어난 응답은 채점자가 무엇을 반환하든 상관없이 최저 점수를 받습니다. 테스트 에서 무음은 3점, 몇 단어짜리 응답은 4점, 주제 이탈이나 비영어 응답은 5점을 받았으며, 세트 전체에서 실패는 없었습니다.
최종 설계에서 두 가지 특성은 강조할 만합니다. Engine 2.0은 전사문만으로 채점하므로 전사 후에는 음성이 필요 없고 어느 한 제공사의 음성 모델에도 의존하지 않습니다. 그리고 두 채점자가 서로 다른 제공사이기 때문에, 하나를 사용할 수 없어도 다른 하나가 계속 작동하며, 세 번째 모델이 대체로 나서서 항상 점수가 산출되도록 합니다.
피드백에서 새로워진 점
Engine 2.0에는 완전히 새로 만든 피드백 레이어가 탑재됩니다. 이 레이어는 단순히 점수만이 아니라 두 채점자의 근거를 함께 읽어내며, CELPIP을 처음 접하는 학생, 영어가 약해서 요령을 원하는 학생, 하루 30분씩 시간을 내고 다음 주 시험을 앞둔 학생이라는 세 유형의 학생을 대상으로 검증되었습니다. 무엇이 달라졌는지 살펴보겠습니다.
- 당신의 표현을 그대로 인용합니다. 모든 피드백 항목은 채점자가 반응한 실제 표현을 당신의 응답 스크립트에서 그대로 인용합니다. 인용부호로 표시된 문구는 원문 그대로 옮긴 것이며, 저희 검토 결과 158건 중 157건이 그러했습니다. 피드백은 당신이 말하지 않은 내용을 지어내지 않습니다.
- 가장 먼저 고쳐야 할 한 가지. 각 응답에는 단 하나의 최우선 개선점이 제시됩니다. 점수를 가장 크게 끌어올릴 하나의 변화를 가장 쉬운 말로 짚어줍니다. 이어서 구체적인 실천 방법 두 가지가 뒤따르고, 말하기를 시작하기 전 머릿속으로 훑어볼 세 가지 체크리스트가 이어집니다.
- 과제에 맞는 조언. 조언하기, 상황 묘사하기, 누군가를 설득하기는 각각 다른 기준으로 채점됩니다. 이제 피드백은 여덟 가지 과제 유형이 각각 무엇에 점수를 주는지 파악하고 그에 맞게 이야기하며, 모든 과제에 똑같은 일반적인 팁을 반복하지 않습니다.
- 가장 먼저 연습해야 할 영역. 피드백은 네 가지 영역 중 어느 것이 당신의 가장 약한 부분이고 어느 것이 가장 강한 부분인지 알려주므로, 다음 점수가 어디에 있는지 숫자 뒤에 숨기지 않고 바로 알 수 있습니다.
- 과제가 요구했지만 놓친 부분. 과제 수행(task fulfillment) 영역에서는 피드백이 프롬프트에서 다루지 않은 구체적인 부분을 나열하거나, 모두 다루었다면 그렇다고 명확히 알려줍니다.
- 실제로 연습할 수 있는 조언. 모든 실천 방법은 다음 시도 전에 소리 내어 연습해볼 수 있는 것들입니다. 더 명확하게 말하라거나 억양을 줄이라는 조언은 없습니다. 억양은 청취 가능성(listenability) 평가 대상이 아니며, 피드백은 이에 대해 절대 언급하지 않습니다.
- 시간 초과에 대한 불이익 없음. 과제를 완수한 뒤 시간이 다 되어 응답이 중단된 경우, 그 중단 자체로 감점되지 않으며 피드백도 이를 문제 삼지 않습니다.
독립적인 평가 모델이 어느 쪽이 어느 시스템의 결과인지 모르는 상태에서 동일한 응답에 대해 이 피드백과 이전 시스템이 생성한 피드백을 비교했을 때, 시험관의 관점과 학생의 관점 모두에서 24건 중 20건에서 새 피드백을 더 선호했습니다.
월 CA$25로 무제한 연습
정확도는 매일 사용할 수 있어야 의미가 있습니다. 믿을 수 있는 스피킹 점수는 네 번째 연습 응답이 아니라 마흔 번째 연습 응답에서 가장 가치가 있습니다. 그때가 바로 그 점수가 말하는 방식의 변화가 실제로 효과가 있는지 알려주기 시작하는 시점이기 때문입니다. 그래서 우리는 개수를 세지 않고 사용할 수 있도록 Engine 2.0의 가격을 책정했습니다.
모든 Prepamigo 요금제에는 Engine 2.0의 무제한 채점, 무제한 시도, 그리고 전체 문제 은행이 포함됩니다: Speaking, Writing, Reading, Listening 전 영역에 걸쳐 80개의 완성된 연습 세트와 2,000개 이상의 연습 과제로, CELPIP General 시험의 과제 유형, 시간 배분, 형식을 따르도록 작성 되었습니다. 녹음 버튼을 누르면 약 10초 안에 점수와 증거 기반 피드백을 받을 수 있고, 원하는 만큼 몇 번이든 다시 할 수 있습니다.
Prepamigo
CA$25/ 월
월간 결제 CA$24.98 · 연간 요금제 월 CA$8.25(연 CA$98.98) · 세금 포함 · 언제든지 해지 가능
- 무제한 채점. Scoring Engine 2.0으로, 일일·세션·주간 한도가 전혀 없습니다.
- 80개의 연습 세트와 2,000개 이상의 과제를 네 영역 전체에서 실제 시험 형식을 본떠 제공하므로, 직접 프롬프트를 작성할 필요가 전혀 없습니다.
- 녹음하고 끝. 전사, 채점, 피드백을 모두 대신 처리해 드리므로 붙여넣을 것도 프롬프트를 쓸 것도 없습니다.
- 당신 자신의 말로 된 피드백, 모든 인용은 실제로 말한 내용까지 추적할 수 있습니다.
비교: Claude Max
US$100/ 월
세전 약 CA$138 · 20x 등급 월 US$200 · Pro는 US$20이지만 한도가 훨씬 더 엄격함
- Max조차 한도가 있습니다. 5시간 단위로 순환하는 사용량 한도와 주간 한도가 있는데, 이는 Pro가 허용하는 것의 5배 또는 20배이며, 어느 쪽이든 도달하면 기다려야 합니다.
- 문제 은행이 없습니다. 직접 과제를 가져와야 하고, 실제 시험과 비슷한지 스스로 판단해야 하며, 이미 연습한 것을 스스로 기록해야 합니다.
- 설정은 직접 해야 합니다. 녹음, 전사, 전사문 붙여넣기, 채점 지시 작성까지 매번 모두 당신이 직접 해야 합니다.
- 보정된 채점기가 아니라 평범한 요청일 뿐입니다. 평범한 말로 물었을 때 Claude Opus 5는 62%, Claude Sonnet 5는 45%의 확률로 검증된 점수와 일치한 반면 Engine 2.0은 81%였습니다.
Claude 요금제 가격과 사용 조건은 2026년 9월 claude.com에 게시된 기준이며 변경될 수 있습니다. CELPIP은 해당 소유자의 상표입니다. Prepamigo는 독립적인 연습 플랫폼이며 시험 주관사와 제휴, 후원 또는 연관되어 있지 않습니다. Prepamigo의 연습 과제는 공개된 시험 형식을 따르도록 작성된 독자적인 자료입니다.
제공 현황
Prepamigo Scoring Engine 2.0 for Speaking은 이제 모든 Prepamigo 사용자에게 모든 스피킹 과제 유형에서 적용되고 있습니다. 따로 활성화할 필요가 없습니다. 모든 새로운 스피킹 응답은 Engine 2.0으로 채점되며, 모든 점수에는 학생 자신의 말에서 끌어낸 피드백이 함께 제공됩니다.
일반적인 응답은 약 10초 안에 채점되며, 이는 Engine 1.0보다 빠릅니다. Engine 2.0은 또한 응답당 운영 비용이 이전 설계보다 적게 들며, 이것이 Prepamigo의 가격을 바꾸지 않으면서도 모든 학생에게 각각 세 번씩 투표하는 채점자 두 명을 운영할 수 있게 해주는 이유입니다.
위에서 설명한 실제 검증이 완료되는 대로 이 페이지의 수치를 업데이트해 발표할 것입니다. Engine 2.0이 잘못 채점했다고 생각되는 녹음이 있다면 꼭 보여주세요: 그런 사례가 우리가 아는 가장 빠른 다음 개선 방법입니다.
직접 비교 글을 보려면 Prepamigo vs Claude와 Prepamigo vs ChatGPT를 읽어보세요. 아니면 응답 녹음하기를 통해 Engine 2.0이 작동하는 모습을 직접 확인해 보세요. 영어로 이 가이드 읽기
