제품

CELPIP 스피킹, Prepamigo와 ChatGPT: 정확도, 한계, 비용

2026년 9월 7일

검증된 등급과 일치한 응답의 비율

48개의 보류된 스피킹 응답, 등급당 16개. 각 GPT 모델에게 전사문을 주고 평범한 말로 CELPIP 척도에 따라 채점하도록 요청했으며, 3회 실행의 평균입니다. Engine 2.0은 일반 프로덕션 구성으로 실행되었습니다.

81%

Prepamigo Engine 2.0

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo와 인기 챗봇 요금제 비교

캐나다 달러 기준입니다. Prepamigo 가격은 세금이 포함되어 있습니다. Claude Max(월 US$100부터)와 ChatGPT Pro(월 US$200)는 세전 가격을 1.38 환율로 환산한 값입니다. 정확도는 해당 모델에게 평범한 말로 채점을 요청했을 때 검증된 등급과 일치한 응답의 비율이며, 3회 실행의 평균입니다.

Prepamigo
ChatGPT ProGPT 5.6 sol
월 요금
CA$24.98 (세금 포함)
CA$276 (세금 별도)
채점
무제한
제한
완성된 문제 은행
있음
없음
연습 세트
80개
없음
연습 과제
2,000개+
없음
CELPIP 형식
있음
없음
정확도
81%
35%
최상위 응답
71%
25%

ChatGPT는 아마 CELPIP 응시자들이 자신의 스피킹 연습을 채점하는 데 가장 많이 사용하는 도구일 것입니다. 모두의 휴대폰에 있고, 몇 초 안에 답하며, 당신의 응답이 어느 등급인지 기꺼이 알려줍니다. 이 글이 답하려는 질문은 그것이 알려주는 등급이 실제로 받게 될 등급과 같은가입니다. 우리는 학생이 하는 방식대로 테스트를 진행했습니다: 전사문을 붙여넣고, 점수를 요청하고, 집계했습니다.

짧게 답하자면: 어떤 시스템도 본 적 없는, 각각 독립적으로 검증된 점수가 있는 48개의 스피킹 응답에서 Prepamigo Scoring Engine 2.0은 81%의 확률로 정확한 등급을 맞혔습니다. 평범한 말로 물었을 때 ChatGPT 유료 요금제의 기반 모델인 GPT 5.6 sol은 35%의 확률로 정확한 등급을 맞혔습니다. GPT 5.5는 37%, GPT 5.6 luna는 31%, GPT-4o mini는 45%였는데, 이 수치는 실제보다 좋아 보이는데, 이 모델이 거의 모든 것을 낮게 채점하다 보니 약한 응답을 우연히 맞히는 경우가 많기 때문입니다.

그런 다음 대부분의 비교 기사가 생략하는 작업을 했습니다. 각 GPT 모델에게 모든 과제에 대한 실제 보정 예시와 그에 대한 강제 비교가 포함된 우리 자체의 채점 절차를 제공하여, 이 모델이 얼마나 잘할 수 있는지 확인했습니다. GPT 5.6 sol은 71%까지, GPT 5.5는 69%까지, luna는 63%까지, GPT-4o mini는 50%까지 올라갔습니다. 네 모델 모두 여전히 Engine 2.0에 뒤졌고, 네 모델 모두 여전히 최상위 응답에서 가장 어려움을 겪었습니다. 이 글의 나머지 부분에서는 두 테스트를 모두 살펴보고, 각 점수 등급에서의 결과, 범용 어시스턴트가 왜 척도의 중간으로 치우치는지, 양쪽의 일상적인 사용 흐름은 어떤지, 그리고 진지하게 연습할 계획이라면 각 옵션에 드는 비용이 얼마인지 다룹니다.

평범한 테스트: 학생이 실제로 얻는 것

81%대 35%. 48개 응답 테스트에서 이는 Engine 2.0이 GPT 5.6 sol보다 22개 더 많은 정답을 맞혔다는 뜻입니다. 달리 말하면, Engine 2.0은 GPT 5.6 sol보다 채점 실수를 71% 더 적게 하고, GPT 5.5보다 70%, GPT 5.6 luna보다 73%, GPT-4o mini보다 66% 더 적게 합니다.

평범한 테스트를 세 번 별도로 실행한 결과 GPT 5.6 sol은 31%, 40%, 35%를, GPT 5.5는 35%, 42%, 33%를 기록했습니다. 실행 간의 이런 편차 자체가 하나의 발견입니다: 서로 다른 날에 같은 전사문을 ChatGPT 에게 채점하도록 하면 상당히 자주 서로 다른 점수를 받게 됩니다. Engine 2.0은 세 번의 실행 모두에서 81.3%를 기록했습니다.

격차가 벌어지는 지점: 등급별로 살펴보기

전체 수치는 오류가 어디에서 발생하는지 숨깁니다. 약한 응답에서는 훌륭하지만 강한 응답에서는 형편없는 채점자는 초급자에게는 괜찮지만 10점을 노리는 사람에게는 오히려 해롭습니다. 그래서 여기 검증된 등급별로 나눈 평범한 테스트 결과가 있습니다.

하위 등급 응답 (검증된 점수 4점 또는 5점)

보류된 16개의 응답, 평범한 프롬프트, 3회 실행 평균. 놓치는 경우는 대부분 3점입니다.

88%

Prepamigo Engine 2.0

75%

GPT-4o mini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

약한 응답에서는 Engine 2.0이 88%로 앞서고, GPT-4o mini가 75%로 뒤따르는데, 이는 낮게 채점하는 습성이 유일하게 유리하게 작용하는 지점입니다. 더 큰 세 GPT 모델은 52%에서 54% 사이입니다: 약 절반의 경우 4점 또는 5점 응답을 3점으로 채점하는데, 방향은 이해할 만하지만 등급 자체는 틀린 것입니다. ChatGPT로 채점받는 초급자는 대략 절반의 경우 실제보다 못하다는 말을 듣게 됩니다.

중위 등급 응답 (검증된 점수 7점 또는 8점)

보류된 16개의 응답, 평범한 프롬프트, 3회 실행 평균. 놓치는 경우는 거의 전부 5점 또는 6점입니다.

85%

Prepamigo Engine 2.0

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

중위 등급은 평범한 프롬프트를 사용한 GPT 모델들이 무너지는 지점입니다. Engine 2.0은 85%, GPT-4o mini는 44%, GPT 5.5, GPT 5.6 sol, luna는 27%에서 29% 사이입니다. 중위 등급 응답은 저울질해야 하는 실제 강점과 약점의 혼합을 담고 있는데, 저울질할 보정 예시가 없으면 GPT 모델들은 약점 쪽으로 기울어 5점이나 6점을 줍니다. GPT 5.6 sol에게 점수를 물어보는 7점 또는 8점 수준의 화자는 열 번 중 세 번도 채 되지 않게 올바른 등급을 듣게 됩니다.

최상위 등급 응답 (검증된 점수 10점 이상)

보류된 16개의 응답, 평범한 프롬프트, 3회 실행 평균. 놓치는 경우는 거의 전부 7점 또는 8점입니다.

71%

Prepamigo Engine 2.0

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

최상위 등급에서 Engine 2.0은 최상위 응답의 71%를 인식합니다. GPT 5.5는 27%, GPT 5.6 sol은 25%, GPT-4o mini는 17%, GPT 5.6 luna는 13%를 인식합니다. 모든 GPT 모델이 10점을 받아야 할 응답 열 개 중 적어도 일곱 개에 7점 또는 8점을 줍니다.

이것이 우수한 응시자에게 어떤 의미인지 생각해 보십시오. 응답 여덟 개를 녹음하고, 전사한 뒤, ChatGPT에 붙여넣고 점수를 요청하면 그중 여섯 개가 7점이나 8점이라고 알려줍니다. 당신은 스스로가 아직 노력이 필요한 견실한 중위권 화자라고 결론짓습니다. 그러나 당신은 처음부터 10점 수준이었습니다. 이것은 가상의 이야기가 아닙니다. 우리 테스트에서 모든 GPT 모델이 대부분의 최상위 응답에 대해 실제로 그렇게 했습니다.

ChatGPT로 채점하는데 계속 7점이나 8점이 나온다면, 그것을 곧이곧대로 믿지 마십시오. 우리 테스트에서 최상위 응답은 GPT 5.6 sol로부터 자기 등급에 맞는 점수보다 7점이나 8점을 받을 가능성이 세 배 더 높았습니다.

ChatGPT에게 우리의 전체 절차를 제공하면 어떨까?

평범한 테스트 수치를 보고 GPT 모델군이 약하다고 결론짓기 쉽지만, 그렇지 않습니다. 문제는 지능이 아닙니다. 비교할 대상이 없는 상태에서 숫자를 요구받은 모델은 추측을 하게 되고, 추측할 때는 낮은 쪽, 중간 쪽으로 추측한다는 것입니다.

그래서 두 번째 테스트를 진행했습니다. 각 GPT 모델은 Engine 2.0의 채점자들이 받는 것과 동일한 자료 묶음을 받았습니다: 전사문, 과제, 그 정확한 과제의 각 등급에 대한 실제 보정 예시 두 개씩, 그리고 숫자를 만들어 내는 대신 네 가지 항목 각각에 대해 가장 가까운 예시를 지목하라는 지시입니다. 각 모델은 또한 그 모델 고유의 성향에 맞춘 짧은 보정 노트도 받았습니다.

우리의 전체 절차를 적용했을 때: 검증된 등급과 일치한 응답의 비율

동일한 48개의 보류된 응답. 각 GPT 모델은 Engine 2.0의 채점자들과 동일한 전사문, 지시, 보정 예시를 사용해 모든 응답을 한 번씩 채점했습니다.

81%

Prepamigo Engine 2.0

71%

GPT 5.6 sol

69%

GPT 5.5

63%

GPT 5.6 luna

50%

GPT-4o mini

보정 예시는 엄청난 차이를 만듭니다. GPT 5.6 sol은 35%에서 71%로 두 배가 됩니다. GPT 5.5는 37%에서 69%로, luna는 31%에서 63%로 올라갑니다. GPT-4o mini는 45%에서 50%로 거의 움직이지 않는데, 이는 무엇을 보여주든 계속 모든 것을 낮게 채점하기 때문입니다. 전체 절차를 적용해도 이 모델은 최상위 응답을 단 하나도 인식하지 못했습니다. 이는 목적에 맞게 설계된 채점자의 가치가 실제로 어디에 있는지 를 알려줍니다: 더 똑똑한 모델에 있는 것이 아니라, 각 과제에서 각 등급이 실제로 어떻게 들리는지에 대한 실제 예시, 그리고 모델이 추측하는 대신 비교하도록 강제하는 질문에 그 가치가 있습니다.

그렇더라도 모든 GPT 모델은 여전히 뒤처집니다. 전체 절차를 적용해도 GPT 5.6 sol은 전체적으로 Engine 2.0에 10포인트 뒤지고, 중위 등급에서도 10포인트 뒤지며(75% 대 85%), 최상위 등급에서는 8포인트 뒤집니다(63% 대 71%). 이 모델에 남은 습성은 매끄러움을 과대평가하는 것입니다: 전달이 매끄러운 능숙한 8점짜리가 9점이나 10점으로 밀려 올라갑니다. GPT 5.6 luna는 반대로 중위권 응답을 5점 쪽으로 끌어내려 중위 등급에서 44%에 그칩니다. 단일 모델의 단일 시도는 여전히 특유의 편향을 갖고 있으며, Engine 2.0은 서로 다른 제공사의 독립적인 채점자 두 명, 각각 세 번씩 투표하여 중간 값을 취하는 방식, 그리고 두 채점자가 크게 의견이 갈릴 때 더 높은 점수를 채택하는 조정 규칙으로 나머지 격차를 좁힙니다.

우리는 뻔한 지름길도 시도해 보았습니다: 평범한 프롬프트를 유지한 채 “중간으로 치우치지 말 것” 또는 “9등급 응답이 반드시 완벽할 필요는 없음”과 같은 지시를 추가하는 것입니다. 이는 측정 가능한 변화를 전혀 만들어내지 못했습니다. 효과가 있는 것은 질문 자체를 바꾸고, 모델에게 실제로 비교할 대상을 주는 것입니다.

사용 흐름의 격차: 녹음하고 끝내거나, 모든 것을 직접 하거나

정확도 수치는 채점이 실제로 이루어진다는 것을 전제로 합니다. ChatGPT를 사용하면 녹음을 멈추는 순간과 점수를 읽는 순간 사이에 놀라울 정도로 많은 작업이 놓여 있으며, 그 작업 중 일부는 점수 자체를 바꿔놓습니다.

첫째, 전사문이 필요합니다. ChatGPT의 음성 모드는 대화이지 채점자가 아닙니다. 녹음된 응답을 채점하려면 텍스트가 필요합니다. 이는 말한 내용을 직접 타이핑하는 방법(이 경우 내용이 바뀝니다) 또는 녹음을 전사 도구에 통과시키는 방법 중 하나를 의미합니다. 그리고 전사문은 있는 그대로여야 합니다. 모든 간투사, 모든 다시 말하기, 모든 자기 수정이 그대로 남아 있어야 합니다. 우리가 망설임을 제거한 “정리된” 전사문을 테스트했을 때 정확도가 15포인트 떨어졌는데, 그런 망설임이야말로 채점자가 응답이 어떻게 들리는지 판단하는 데 필요한 증거이기 때문입니다. 대부분의 휴대폰에 내장된 것을 포함한 대부분의 일반 소비자용 전사 도구는 기본적으로 이를 정리해 버립니다.

둘째, 과제가 필요합니다. ChatGPT는 요청하면 CELPIP 형식의 프롬프트를 만들어낼 수 있지만, 이는 형식, 시간 배분, 그리고 실제 시험이 사용하는 상황의 종류를 추측한 것입니다. 그것이 쓴 프롬프트가 실제로 마주하게 될 것과 비슷한지는 알 수 없습니다.

셋째, 평범한 테스트 수치보다 나은 결과를 원한다면 보정 예시가 필요합니다: 같은 과제 유형에서 각 등급에 해당하는 검증된 등급의 실제 응답입니다. 이것이 우리 테스트에서 GPT 5.6 sol의 정확도를 두 배로 만든 입력값이며, 학생이 집에서 만들어낼 수 없는 것입니다.

넷째, 다음 응답에 대해서도 이 모든 과정을 다시 해야 하며, 각각이 당신의 메시지 한도를 소모합니다.

Prepamigo에서는 은행에서 과제를 고르면 타이머가 돌아가고, 말을 하고, 멈춘 지 약 10초 후에 점수와 피드백이 화면에 나타납니다. 전사는 설계상 있는 그대로 이루어지고, 보정 예시는 과제에 자동으로 첨부되며, 붙여넣을 것도 프롬프트를 쓸 것도 없습니다. 그날 저녁 열한 번째 응답도 첫 번째 응답과 똑같은 수고만 듭니다.

일관성: 같은 응답, 같은 점수

재현할 수 없는 점수는 측정이 아닙니다. 같은 녹음이 월요일에는 8점, 화요일에는 10점을 받는다면, 당신은 자신의 스피킹에 대해 아무것도 배우지 못한 것입니다. 그래서 우리는 재현성도 테스트했습니다.

Engine 2.0은 48개의 보류된 응답에 대해 서로 다른 날에 세 번 별도로 실행되었습니다. 매번 81.3%를 기록했습니다. 개별 응답을 살펴보면, 87.5%가 세 번의 실행 모두에서 동일한 점수를 받았고, 2점 이상 움직인 경우는 4.2%뿐이었으며 모두 두 등급 사이의 경계에 걸쳐 있는 응답이었습니다.

GPT 5.6 sol에 대한 평범한 테스트는 가장 좋은 실행과 가장 나쁜 실행 사이에 9포인트나 움직였습니다. 이 안정성 격차는 투표 방식에서 나옵니다. Engine 2.0의 각 채점자는 모든 응답에 대해 세 번 투표하고 중간 값을 채택합니다. 세 번 대신 한 번만 투표하도록 같은 구성을 테스트했을 때, 실행 간 동일한 점수의 비율은 87.5%에서 77%로 떨어졌고, 2점 이상 움직이는 응답의 비율은 두 배 이상으로 늘었습니다. 단일 ChatGPT 대화는 단일 투표입니다. 우리는 또한 API를 통해 고정된 랜덤 시드를 설정하면 GPT 모델이 더 재현 가능해지는지도 확인했습니다. 그렇지 않았습니다. GPT 5.6 luna의 경우 재현성이 오히려 떨어졌습니다.

실제로 행동으로 옮길 수 있는 피드백

ChatGPT는 설명을 잘합니다. 왜 그 점수를 줬는지 물으면 명료한 영어로 길게 설명해 주고, 개선 방안도 제안합니다. 응답에 대해 이야기를 나누고 싶은 응시자에게는 이것이 정말로 가치가 있습니다.

위험은 유창한 설명이 정확한 진단과 같은 것은 아니라는 점입니다. 10점짜리를 7점으로 채점한 모델은 왜 7점인지 설득력 있게 설명할 것입니다. 짚을 만한 무언가를 찾아낼 것입니다. 그리고 채점하기 전에 증거를 확정해야 할 필요가 없었기 때문에, 그 설명은 이미 정해진 숫자를 정당화하기 위해 사후에 작성된 것입니다.

Engine 2.0은 그 반대로 작동합니다. 각 채점자는 등급을 정하기 전에 모든 항목에 대해 증거를 짚어야 하며, 피드백은 그 증거를 바탕으로 작성됩니다. 당신 자신의 말을 인용합니다: 표본 피드백에서 인용문 158개를 감사한 결과, 157개가 전사문에 그대로 등장했습니다. 독립적인 판정 모델이 어느 쪽인지 모르는 상태로 같은 응답에 대한 Engine 2.0의 피드백과 이전 시스템의 피드백을 비교했을 때, 시험관의 입장으로 판단할 때와 학생의 입장으로 판단할 때 모두 24건 중 20건에서 Engine 2.0을 더 선호했습니다.

우리는 또한 우수한 응답을 가져와 한 번에 한 항목씩 의도적으로 손상시켜, 피드백이 비판을 올바른 위치에 놓는지도 확인했습니다. 네 가지 경우 중 세 가지에서 손상된 항목이 가장 크게 점수가 떨어진 항목이었습니다. 이는 챗봇이 쉽게 통과하기 어려운 검사인데, 챗봇에게는 대조할 고정된 항목이 없기 때문입니다.

매일 연습하는 데 드는 비용

스피킹 점수는 네 번째 응답이 아니라 마흔 번째 응답에서 가장 유용합니다. 그때가 바로 말하는 방식의 변화가 실제로 효과가 있는지 알려주기 시작하는 시점이기 때문입니다. 그러므로 실질적인 질문은 많이 사용할 때 각 도구에 얼마가 드는지입니다.

ChatGPT Plus는 2026년 9월 게시된 기준으로 월 US$20, 약 CA$28이며 매월 결제됩니다. GPT 5.6 계열을 사용할 수 있지만 순환 주기당 메시지 한도가 있습니다. 보정 예시가 첨부된 긴 전사문은 바로 그 한도를 많이 소모하는 유형의 메시지이며, 한도에 도달하면 기다리거나 더 작은 모델로 전환해야 합니다. ChatGPT Pro는 월 US$200, 세전 약 CA$276이며 한도를 상당히 높여줍니다. 무료 등급은 트래픽의 상당 부분을 더 작은 모델로 보내는데, 이 테스트에서 가장 작은 모델은 최상위 응답을 거의 인식하지 못했습니다. 어떤 요금제도 문제 은행, 타이머, 있는 그대로의 전사, 보정 예시, 또는 CELPIP에 특화된 어떤 것도 포함하지 않습니다.

Prepamigo는 월 CA$24.98, 또는 연간 요금제로 월 CA$8.25(연 CA$98.98)이며 세금이 포함되어 있고 언제든지 해지할 수 있습니다. 모든 요금제에는 일일, 세션, 주간 한도가 전혀 없는 Engine 2.0의 무제한 채점, 무제한 시도, 그리고 전체 문제 은행이 포함됩니다: Speaking, Writing, Reading, Listening 전 영역에 걸쳐 80개의 완성된 연습 세트와 2,000개 이상의 연습 과제로, CELPIP General 시험의 과제 유형, 시간 배분, 형식을 따르도록 작성되었습니다.

간단히 말하면: ChatGPT Plus보다 저렴한 가격으로, 평범한 비교에서 두 배 이상 더 정확한 채점자를 얻을 수 있고, 절대 기다리게 하지 않으며, 문제와 보정 예시가 이미 준비되어 있습니다.

ChatGPT가 더 나은 도구일 때

이 글은 CELPIP을 준비하는 동안 ChatGPT를 절대 열어서는 안 된다는 주장이 아닙니다. 진지한 응시자 라면 둘 다 사용하는 것이 합리적일 수 있습니다.

  • 응답에 대해 이야기 나누기. 이유가 왜 약했는지 이해하고 싶거나 더 나은 이유 세 가지를 구상하고 싶다면, 대화가 알맞은 형태입니다. Engine 2.0은 판정과 증거를 주지만 대화하지는 않습니다.
  • 어휘와 표현. 무언가를 말하는 더 자연스러운 방법 다섯 가지를 물어보는 것은 빠르고 유용합니다.
  • 대답해 주는 상대에게 말하기. ChatGPT의 음성 모드는 영어로 소리 내어 말하는 데 익숙해지는 합리적인 방법입니다. 채점자는 아니지만 함께해 주는 존재입니다.
  • 작문 연습. 작문 응답은 전사가 필요 없으므로 사용 흐름의 격차가 더 작습니다. GPT의 작문 정확도는 이 테스트의 대상이 아니었으며 그에 대해 아무런 주장도 하지 않습니다.
  • 시험 밖의 모든 것. ChatGPT는 범용 어시스턴트이고 Prepamigo는 그렇지 않습니다.

여기서 제시한 근거로 볼 때, ChatGPT가 되어서는 안 되는 역할은 당신이 준비되었는지 알려주는 존재입니다. 그 역할을 위해서는 그 일을 위해 만들어졌고, 한 번도 본 적 없는 응답으로 테스트되었으며, 등급별로 측정된 채점자가 필요합니다.

피드백에서 새로워진 점

Engine 2.0에는 완전히 새로 만든 피드백 레이어가 탑재됩니다. 이 레이어는 단순히 점수만이 아니라 두 채점자의 근거를 함께 읽어내며, CELPIP을 처음 접하는 학생, 영어가 약해서 요령을 원하는 학생, 하루 30분씩 시간을 내고 다음 주 시험을 앞둔 학생이라는 세 유형의 학생을 대상으로 검증되었습니다. 무엇이 달라졌는지 살펴보겠습니다.

  • 당신의 표현을 그대로 인용합니다. 모든 피드백 항목은 채점자가 반응한 실제 표현을 당신의 응답 스크립트에서 그대로 인용합니다. 인용부호로 표시된 문구는 원문 그대로 옮긴 것이며, 저희 검토 결과 158건 중 157건이 그러했습니다. 피드백은 당신이 말하지 않은 내용을 지어내지 않습니다.
  • 가장 먼저 고쳐야 할 한 가지. 각 응답에는 단 하나의 최우선 개선점이 제시됩니다. 점수를 가장 크게 끌어올릴 하나의 변화를 가장 쉬운 말로 짚어줍니다. 이어서 구체적인 실천 방법 두 가지가 뒤따르고, 말하기를 시작하기 전 머릿속으로 훑어볼 세 가지 체크리스트가 이어집니다.
  • 과제에 맞는 조언. 조언하기, 상황 묘사하기, 누군가를 설득하기는 각각 다른 기준으로 채점됩니다. 이제 피드백은 여덟 가지 과제 유형이 각각 무엇에 점수를 주는지 파악하고 그에 맞게 이야기하며, 모든 과제에 똑같은 일반적인 팁을 반복하지 않습니다.
  • 가장 먼저 연습해야 할 영역. 피드백은 네 가지 영역 중 어느 것이 당신의 가장 약한 부분이고 어느 것이 가장 강한 부분인지 알려주므로, 다음 점수가 어디에 있는지 숫자 뒤에 숨기지 않고 바로 알 수 있습니다.
  • 과제가 요구했지만 놓친 부분. 과제 수행(task fulfillment) 영역에서는 피드백이 프롬프트에서 다루지 않은 구체적인 부분을 나열하거나, 모두 다루었다면 그렇다고 명확히 알려줍니다.
  • 실제로 연습할 수 있는 조언. 모든 실천 방법은 다음 시도 전에 소리 내어 연습해볼 수 있는 것들입니다. 더 명확하게 말하라거나 억양을 줄이라는 조언은 없습니다. 억양은 청취 가능성(listenability) 평가 대상이 아니며, 피드백은 이에 대해 절대 언급하지 않습니다.
  • 시간 초과에 대한 불이익 없음. 과제를 완수한 뒤 시간이 다 되어 응답이 중단된 경우, 그 중단 자체로 감점되지 않으며 피드백도 이를 문제 삼지 않습니다.

독립적인 평가 모델이 어느 쪽이 어느 시스템의 결과인지 모르는 상태에서 동일한 응답에 대해 이 피드백과 이전 시스템이 생성한 피드백을 비교했을 때, 시험관의 관점과 학생의 관점 모두에서 24건 중 20건에서 새 피드백을 더 선호했습니다.

자주 묻는 질문

ChatGPT로 제 CELPIP 스피킹을 채점할 수 있나요? 숫자는 나옵니다. 검증된 점수가 있는 48개의 미공개 응답을 평범하게 물었을 때 GPT 5.6 sol은 35%, GPT 5.5는 37%, luna는 31%, GPT-4o mini는 45%가 맞았고, Engine 2.0은 81%였습니다. 최상위 응답에서는 GPT 5.6 sol이 25%만 맞혔습니다.

Prepamigo가 ChatGPT보다 더 정확한가요? 평범한 요청 기준으로 81% 대 GPT 5.6 sol의 35%입니다. 보정 예시가 포함된 우리의 전체 절차를 적용해도 GPT 5.6 sol은 71%에 그쳐 여전히 10포인트 뒤졌습니다.

각각 비용은 얼마인가요? ChatGPT Pro는 월 US$200, 세전 약 CA$276입니다. Plus는 US$20이지만 메시지 한도가 있습니다. Prepamigo는 세금 포함 월 CA$24.98, 또는 연간 요금제로 월 CA$8.25이며 무제한 채점과 80개의 연습 세트를 제공합니다.

그래도 ChatGPT를 쓴다면 어떤 GPT 모델을 써야 하나요? 평범한 프롬프트로는 어느 모델도 잘하지 못합니다. 보정 예시가 있다면 GPT 5.6 sol입니다. 10점에 가깝다면 GPT-4o mini는 절대 쓰지 마십시오.

Claude와의 동일한 비교를 보려면 Prepamigo vs Claude를 읽어보세요. 여덟 개 시스템의 전체 순위를 보려면 어떤 AI가 CELPIP 스피킹을 가장 정확하게 채점하는가를 읽어보세요. 아니면 전사 과정을 생략하고 바로 응답 녹음하기를 해보세요. 영어로 이 가이드 읽기

CELPIP 스피킹, Prepamigo와 ChatGPT: 정확도, 한계, 비용 | PrepAmigo