36개의 공식 에세이에서 Prepamigo 라이팅 채점기
검증된 등급 안에 채점된 에세이의 비율, 전체와 등급별입니다. 두 가지 라이팅 과제에 걸쳐 등급당 에세이 열두 개이며, 채점기가 보정에 사용하는 예시 에세이 여섯 개는 제외했습니다.
86%
전체
75%
하위 (4–5점)
100%
중위 (7–8점)
83%
최상위 (10점 이상)
Prepamigo와 인기 챗봇 요금제 비교
캐나다 달러 기준입니다. Prepamigo 가격은 세금이 포함되어 있습니다. Claude Max(월 US$100부터)와 ChatGPT Pro(월 US$200)는 세전 가격을 1.38 환율로 환산한 값입니다. 정확도는 해당 모델에게 평범한 말로 에세이 채점을 요청했을 때 36편의 공식 에세이 중 검증된 등급과 일치한 비율이며, 1회 실행 결과입니다.
어떤 연습 도구에든 마땅히 던져야 할 질문인데, 대부분의 도구는 답하지 않습니다. 라이팅 점수는 실제 채점관이 무엇이라고 말할지 알려줄 때만 가치가 있고, 그런지 아닌지 알 수 있는 유일한 방법은 측정하는 것입니다. 그래서 이 글은 그 측정 결과를 있는 그대로, 우리에게 유리한 부분과 그렇지 않은 부분까지 모두 펼쳐 놓은 것입니다.
한 문단으로 답하면: 각각 독립적으로 검증된 점수가 있는 36개의 공식 CELPIP 라이팅 응답에서 Prepamigo의 라이팅 채점기는 86%의 확률로 검증된 등급을 맞혔습니다. 중위 등급 에세이는 모두 맞혔고, 하위 에세이는 75%, 최상위 에세이는 83%를 맞혔습니다. 세 번의 개별 실행에서 에세이 한 개 정도의 차이로 같은 결과를 냈습니다. 같은 에세이를 평범한 말로 채점하도록 요청했을 때 최고의 최첨단 모델인 GPT 5.6 sol은 78%, Claude 모델들은 61%와 56%였습니다.
이어지는 내용은 각 등급에서 숫자가 무엇을 의미하는지, 오류가 어디에서 어느 방향으로 발생하는지, 점수가 얼마나 안정적인지, 대신 사용할 법한 챗봇과 어떻게 비교되는지, 피드백에서 무엇이 새로워졌는지, 그리고 이 모든 것을 바탕으로 자신의 점수를 어떻게 읽어야 하는지입니다.
여기서 “정확하다”는 것의 의미
우리는 Prepamigo 점수가 당신의 시험 결과를 예측한다고 주장하지 않습니다. 어떤 연습 도구도 그것을 약속할 수 없습니다. 우리가 측정하는 것은 더 좁고 더 정직한 것입니다: 점수가 독립적으로 검증된 에세이가 주어졌을 때, 채점기가 같은 등급의 점수를 내는 경우가 얼마나 자주인가?
CELPIP 라이팅은 12점까지의 척도로 보고되며, 우리 참조 데이터의 검증된 점수는 세 등급으로 나뉩니다: 하위는 4점 또는 5점, 중위는 7점 또는 8점, 최상위는 10점 이상입니다. 채점기의 점수가 검증된 등급 안에 들어오면 정확한 것으로 셉니다. 최상위 에세이에 10점, 11점, 12점을 주면 정확한 것이고, 9점을 주면 아깝더라도 놓친 것입니다.
등급별 정확도
하위 에세이: 75%. 열두 개 중 아홉 개가 등급 안에 들어왔습니다. 놓친 세 개는 모두 한 단계 높게 갔습니다: 두 개는 6점, 하나는 7점으로 채점되었습니다. 각각 짧고 빈약하지만 정돈된 글이었고 오류가 적어서, 그 정돈됨이 내용으로는 얻지 못한 1점을 벌어줬습니다. 이것이 척도 하단에서 채점기가 보이는 특징적인 오류이며 관대한 쪽의 오류입니다: 약한 글쓴이는 실제보다 조금 낫다는 말을 들을 뿐, 못하다는 말은 결코 듣지 않습니다.
중위 에세이: 100%. 세 번의 실행 모두에서 열두 개 중 열두 개가 7점에서 8점 등급 안에 들어왔습니다. 대부분의 응시자가 있는 등급이자 대부분의 이민 목표를 결정하는 등급이며, 채점기가 가장 강한 곳입니다. 동시에 우리가 테스트한 모든 챗봇이 가장 약한 곳이기도 한데, 그 이유는 비교 섹션에서 설명합니다.
최상위 에세이: 83%. 열두 개 중 열 개입니다. 놓친 두 개는 모두 한 단계 아래인 9점이었습니다. 최상위 CELPIP 에세이도 흠이 없지는 않으며, 채점기는 가끔 실수 하나를 더 무겁게 읽습니다. 놓친 두 개 중 7점이나 8점은 없었습니다. 최상위 에세이가 평범하다는 말을 듣는 일은 없습니다.
과제별로 보면 채점기는 이메일 응답의 89%, 설문 응답의 83%를 맞혔습니다. 설문 응답은 자리를 잡기가 더 어려운데, 과제가 분명한 입장과 잘 전개된 이유에 점수를 주고, 두 선택지 사이에서 얼버무리는 응답은 규칙에 따라 감점되기 때문입니다.
오류는 어느 방향으로 가는가
14%의 확률로 틀리는 채점자는 무해한 방식으로 틀릴 수도, 해로운 방식으로 틀릴 수도 있습니다. 해로운 것은 8점이 필요한 응시자에게 아직 아닌데도 됐다고 말하는 것입니다. 무해한 것은 아닌데도 1점 모자란다고 말하는 것입니다. 그 대가는 일주일의 연습뿐, 그 밖에는 없습니다.
36개 에세이에서 채점기가 놓친 다섯 개 중 세 개는 6점이나 7점으로 채점된 하위 에세이였고, 두 개는 9점으로 채점된 최상위 에세이였습니다. 높게 채점된 중위 에세이는 없었고, 최상위로 채점된 하위 에세이도 없었습니다. 실제로는 이런 뜻입니다: 채점기가 중위 등급에 도달했다고 하면 도달했거나 1점 모자란 것입니다. 최상위 등급에 도달했다고 하면 도달한 것입니다. 후하게 주는 유일한 지점은 척도 하단으로, 짧고 정돈된 에세이가 얻지 못한 1점을 챙길 수 있는 곳입니다.
같은 에세이에서 챗봇들과 비교해 보세요. Claude Opus 5는 중위 등급 에세이 일곱 개를 9점이나 10점이라고 했는데, 이는 가장 큰 영향을 받는 응시자들에게 해로운 방향입니다. GPT 5.6 sol은 중위 등급 에세이 세 개를 6점이라고 했는데 이는 무해한 방향이며, 최상위 에세이 세 개를 9점에 묶었습니다. 채점자의 정확도 수치는 얼마나 자주 틀리는지를 알려주고, 방향은 틀렸을 때 당신이 치르는 대가를 알려줍니다.
이메일 대 설문
36개 에세이는 두 가지 라이팅 과제로 나뉘어 있었고, 채점기는 이메일 과제에서 89%로 설문 응답의 83%보다 약간 더 잘했습니다. 설문 쪽에서 하나를 더 놓친 것이며, 예상할 수 있는 방향입니다.
이메일 응답은 주로 충족 여부로 채점됩니다: 필수 항목을 다루었는지, 읽는 사람에게 맞는 어조인지, 인사말과 맺음말이 있는지. 이것들은 채점기가 어떤 판정을 내리기 전에 규칙으로 확인하는 것들이라, 이를 갖춘 이메일은 안정적으로 자리를 잡습니다. 설문 응답은 논증의 질로 채점됩니다: 분명한 입장과 나열이 아니라 전개된 이유입니다. 전개 여부는 판단이고, 판단은 인간이든 아니든 채점자가 1점 차이로 갈릴 여지가 있는 곳입니다.
당신에게 이것은 설문 점수가 이메일 점수보다 아주 약간 느슨하다는 뜻입니다. 설문 응답에서 목표 경계선에 걸쳐 있다면, 자신의 위치를 판단하기 전에 하나가 아니라 두 개를 써 보세요.
화면 이쪽에서 보면
등급별 보기는 등급을 아는 에세이에서 채점기가 어떻게 하는지 알려줍니다. 당신은 반대 방향에서 보고 있습니다: 점수를 손에 들고 그것을 얼마나 믿어야 할지 알고 싶은 것입니다.
- 4점 또는 5점이라고 하면: 아홉 번 중 아홉 번 그 에세이는 하위 등급이었습니다. 채점기가 준 낮은 점수는 맞습니다.
- 7점 또는 8점이라고 하면: 열다섯 번 중 열두 번 그 에세이는 중위 등급이었고, 나머지 세 번은 한 단계 높게 채점된 하위 에세이였습니다. 7점 또는 8점은 중위, 어쩌면 조금 아래를 뜻합니다.
- 10점 이상이라고 하면: 열 번 중 열 번 그 에세이는 최상위 등급이었습니다. 채점기가 준 10점은 10점입니다.
- 9점이라고 하면: 테스트에서 나온 9점 두 개는 모두 검증된 최상위 에세이였습니다. 9점은 주의 깊게 읽어야 할 점수입니다: 최상위에 가깝고, 잘 전개된 이유 하나 또는 정확한 단어 선택 하나가 모자란다는 뜻입니다.
같은 에세이는 같은 점수를 받는가?
일관성 없는 정확도는 운입니다. 그래서 우리는 36개 에세이 전체를 아무것도 바꾸지 않고 서로 다른 날에 세 번 채점했습니다. 채점기는 86%, 89%, 86%를 돌려줬습니다. 매번 같은 열두 개의 중위 등급 에세이가 등급 안에 들어왔고, 실행 간에 1점 넘게 움직인 에세이는 없었습니다.
이 일관성은 채점 모델을 실행하는 방식에서 나옵니다: 추론 기능을 끄고, 온도를 고정하고, 자유로운 판단이 아니라 고정된 채점 예시와 비교합니다. 당신에게는 점수의 변화가 곧 글의 변화라는 뜻입니다. 에세이를 다시 써서 8점에서 10점으로 올랐다면, 그것은 채점자의 기분이 좋은 날이어서가 아닙니다.
대신 사용할 법한 도구와의 비교
정확도 수치는 비교할 대상이 있을 때 더 큰 의미를 갖습니다. 그래서 같은 36개 에세이를 사람들이 실제로 글을 확인할 때 쓰는 챗봇들에게, 사람이 하는 방식 그대로 줬습니다: 과제, 에세이, 그리고 0점에서 12점 사이의 점수를 달라는 평범한 요청입니다.
검증된 등급 안에 채점된 에세이의 비율
같은 36개의 공식 에세이입니다. 각 모델에게 평범한 말로 에세이를 채점하도록 요청했고, Prepamigo는 일반 프로덕션 구성으로 실행되었습니다.
86%
Prepamigo 라이팅 채점기
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
채점기는 최고의 챗봇을 8포인트, Claude 모델들을 25에서 30포인트 앞섭니다. 중요한 것은 오류의 모양입니다. 중위 등급 에세이에서 Prepamigo는 100%, GPT 5.6 sol은 75%, Gemini는 42%, Claude Sonnet 5는 33%, Claude Opus 5는 25%입니다: 비교할 대상이 없는 챗봇은 깔끔하고 평범한 7점을 9점으로, 오류가 몇 개 있는 평범한 7점을 6점으로 읽습니다. 최상위 에세이에서는 Claude Opus 5가 실제로 이 테스트에서 최고의 채점자로 92%를 기록해 Prepamigo의 83%를 앞섭니다. Claude는 관대한데, 상단에서는 그것이 맞고 다른 모든 곳에서는 틀립니다. GPT-4o mini는 최상위 에세이 열두 개 중 아홉 개에 9점을 줬습니다.
챗봇에는 없고 채점기에는 있는 것은 같은 과제의 각 등급에 해당하는 실제 채점된 에세이라는 비교 대상, 그리고 어떤 모델이 의견을 내기 전에 필수 항목, 설문 입장, 인사말과 맺음말, 길이를 확인하는 규칙 레이어입니다. 그것이 86%와 78%의 차이이며, 거의 전부 척도의 중간에 있습니다.
라이팅 피드백에서 새로워진 점
점수는 당신이 돌려받는 것의 절반에 불과합니다. 라이팅 피드백 레이어는 채점기와 함께 새로 만들어졌으며, 그 안의 모든 내용은 당신이 직접 쓴 글에 근거합니다. 무엇이 달라졌는지 살펴보겠습니다.
- 자신의 에세이에서 바로 찾을 수 있는 교정. 모든 문법, 철자, 어휘 교정은 당신의 응답에서 정확한 표현을 그대로 인용하므로, 앱이 당신이 쓴 그 자리에 바로 표시해 줄 수 있습니다. 검사기가 에세이에서 단어 그대로 찾아내지 못한 내용은 당신에게 보이기 전에 제거됩니다.
- 당신의 답안으로 만든 모범 답안. 당신의 아이디어를 그대로 유지하면서 요구된 모든 요점을 다루고, 과제가 요구하는 150~200단어 분량에 맞춘 재작성 버전을 받게 됩니다. 첫 번째 재작성이 이 분량을 벗어나면, 보여드리기 전에 한 번 더 다시 작성됩니다.
- 놓친 필수 요점을 이름 그대로. 이메일 과제에서는 피드백이 프롬프트의 요점 중 당신의 응답이 다루지 않은 것을 나열합니다. 요점을 하나라도 놓치면 과제 수행(task fulfillment) 점수는 8점 이하로 제한되므로, 숫자와 피드백이 서로 어긋나는 일이 없습니다.
- 영역마다 하나의 제한 요인. 네 가지 영역 각각에 대해 피드백은 그 점수를 끌어내리는 단 하나의 요인을 구체적으로 짚거나, 아무 문제도 없다면 그렇다고 분명히 말하고 무엇이 그 점수를 떠받치고 있는지 알려줍니다. 어떤 영역에 문제가 없다고 판단하는 것도 빈칸이 아니라 하나의 진짜 답입니다.
- 비판은 알맞은 자리에. 어조가 약한 것은 과제 수행 문제이고, 모호한 단어 선택은 어휘 문제이며, 끝없이 이어지는 문장은 가독성 문제입니다. 각 지적은 전체 요약에 뭉뚱그려지는 대신 그것을 담당하는 영역 아래에 정리됩니다.
- 문장 단위 재작성. 에세이의 특정 문장들이 개선된 버전과 함께, 왜 더 나은지 한 줄 설명을 달고 돌아옵니다. 그래서 변화에 대해 읽는 것이 아니라 변화를 직접 볼 수 있습니다.
- 가장 강한 영역과 가장 약한 영역을 나란히. 피드백은 네 가지 영역 중 어느 것이 당신의 점수를 떠받치고 어느 것이 발목을 잡고 있는지 알려주므로, 네 개의 숫자를 해독하지 않고도 다음에 무엇을 연습해야 할지 알 수 있습니다.
피드백의 모든 인용문은 표시되기 전에 당신의 에세이와 대조하여 확인됩니다. 검사기가 그 표현을 찾지 못하면 해당 줄은 제거됩니다. 그래서 피드백은 당신이 쓰지 않은 것을 고치라고 절대 말하지 않습니다.
자신의 점수를 읽는 법
- 4점 또는 5점은 맞습니다. 교정을 읽으세요. 당신의 글에서 그대로 인용된 것입니다. 그런 다음 놓친 항목과 모범 답안을 읽고 같은 과제를 다시 쓰세요.
- 7점 또는 8점은 중위, 어쩌면 조금 아래입니다. 영역별 제한 요인을 보세요. 구체적인 문제를 지목하는 영역이 집중해야 할 영역입니다.
- 9점은 가깝다는 뜻입니다. 당신의 에세이를 모범 답안과 문단별로 비교하세요. 격차는 대개 전개되지 않은 이유 하나 또는 평범한 단어 선택 하나입니다.
- 10점 이상은 10점입니다. 그 과제 유형은 준비된 것입니다. 피하고 있던 과제로 넘어가세요.
- 등급보다 변화를 믿으세요. 점수가 안정적이기 때문에, 같은 과제의 여러 시도에 걸친 변화는 당신의 글의 변화입니다.
숫자를 활용하는 연습 루틴
정확하고 안정적인 점수의 핵심은 그것을 의심하기를 멈추고 활용하기 시작할 수 있다는 것입니다. 이 페이지의 숫자가 점수로 알 수 있는 것과 알 수 없는 것이라고 말해주는 내용을 바탕으로 짠, 우리가 제안하는 루틴입니다.
- 이메일 하나와 설문 응답 하나를 준비 없이 쓰세요. 모범 답안을 먼저 보지 마세요. 둘 다 제출하세요. 두 점수를 합쳐 보면 당신의 출발 등급입니다. 둘이 1점 넘게 차이 나면 낮은 쪽이 연습해야 할 과제입니다.
- 교정보다 놓친 항목과 제한 요인을 먼저 읽으세요. 교정은 문장을 고치고, 놓친 항목과 제한 요인은 점수를 고칩니다. 빠진 필수 항목 하나가 모든 쉼표보다 더 큰 가치가 있습니다.
- 모범 답안을 열어 두고 같은 응답을 다시 쓰세요. 아이디어는 유지하고 구조를 빌리세요. 다시 제출하세요. 채점기는 같은 에세이에 같은 점수를 주므로, 두 제출 사이의 차이는 전부 당신의 수정 결과입니다.
- 수정한 결과가 유지되면 새 과제로 넘어가세요. 다시 쓴 글에서 받은 10점 하나는 아직 등급이 아닙니다. 서로 다른 두 과제에서 받은 10점 두 개가 등급입니다.
- 9점은 아깝게 놓친 것으로, 6점은 진짜 6점으로 읽으세요. 채점기는 중위 에세이를 끌어내리지 않습니다. 6점이라고 하면 그 에세이는 빈약한 것이고, 제한 요인이 어디가 그런지 알려줄 것입니다.
자주 묻는 질문
Prepamigo의 라이팅 점수는 얼마나 정확한가요? 36개의 공식 에세이에서 정확한 등급 기준 86%: 하위 75%, 중위 100%, 최상위 83%입니다. 세 번의 실행에서 에세이 한 개 정도의 차이로 같은 결과였습니다.
제 실제 점수와 같은가요? 어떤 연습 도구도 그것을 약속할 수 없습니다. 우리가 측정하는 것은 채점기가 같은 에세이에 대해 검증된 점수와 얼마나 자주 일치하는가입니다.
우수한 에세이에서 왜 9점을 받았나요? 그것이 상단에서 채점기가 가장 흔하게 놓치는 경우입니다: 최상위 에세이 열두 개 중 두 개가 9점으로 채점되었습니다. 모범 답안을 옆에 두고 다시 쓴 뒤 다시 채점해 보세요.
ChatGPT나 Claude보다 나은가요? 86% 대 GPT 5.6 sol의 78%, Claude 모델들의 61%와 56%입니다. 중위 등급 에세이에서는 100% 대 나머지 중 최고의 75%입니다.
채점기가 어떻게 작동하는지 보려면 Prepamigo 라이팅 채점기 내부 들여다보기를 읽어보세요. 여섯 개 챗봇 전체에 대한 같은 테스트를 보려면 어떤 AI가 CELPIP 라이팅을 가장 정확하게 채점하는가를 읽어보세요. 아니면 응답 작성하기를 통해 직접 수치를 확인해 보세요. 영어로 이 가이드 읽기
