제품

CELPIP 라이팅, Prepamigo와 Claude 중 어느 쪽이 정확한 점수를 주는가?

2026년 9월 8일

검증된 등급으로 채점된 에세이의 비율

36편의 공식 CELPIP 라이팅 응답, 세 등급에 각각 12편씩, 두 가지 라이팅 과제 모두 포함. Claude에게 과제와 에세이를 주고 평범한 말로 CELPIP 척도에 따라 채점하도록 요청했습니다. Prepamigo의 라이팅 채점기는 일반 프로덕션 구성으로 실행되었습니다.

86%

Prepamigo 라이팅 채점기

61%

Claude Opus 5

56%

Claude Sonnet 5

Prepamigo와 인기 챗봇 요금제 비교

캐나다 달러 기준입니다. Prepamigo 가격은 세금이 포함되어 있습니다. Claude Max(월 US$100부터)와 ChatGPT Pro(월 US$200)는 세전 가격을 1.38 환율로 환산한 값입니다. 정확도는 해당 모델에게 평범한 말로 에세이 채점을 요청했을 때 36편의 공식 에세이 중 검증된 등급과 일치한 비율이며, 1회 실행 결과입니다.

Prepamigo
Claude MaxOpus 5
월 요금
CA$24.98 (세금 포함)
CA$138+ (세금 별도)
채점
무제한
제한
완성된 문제 은행
있음
없음
연습 세트
80개
없음
연습 과제
2,000개+
없음
CELPIP 형식
있음
없음
정확도
86%
61%
중위 등급 에세이
100%
25%

라이팅은 챗봇이 채점자로서 가장 그럴듯해 보이는 영역입니다. 전사할 녹음도 없고, 신경 쓸 억양도 없으며, 그저 텍스트가 들어가고 숫자가 나오며 자신감 넘치는 설명 한 단락이 덧붙습니다. 그래서 우리는 그 숫자를 테스트했습니다. 우리 자체 채점기의 성능을 측정하는 데 쓰는 동일한 36편의 공식 CELPIP 라이팅 응답을 각 등급별로 열두 편씩 Claude에게 주고, 학생이 요청하듯이 채점을 요청했습니다.

짧게 답하자면: Prepamigo의 라이팅 채점기는 86%의 확률로 검증된 등급을 맞혔습니다. Claude Opus 5는 61%, Claude Sonnet 5는 56%였습니다. 이 격차는 고르게 퍼져 있지 않습니다. 약한 에세이와 강한 에세이에서는 Claude도 준수하며, 최상위에서는 Opus 5가 실제로 우리보다 낫습니다. 그러나 대부분의 응시자가 실제로 쓰는 7점과 8점, 즉 중위 등급 에세이에서는 Opus 5가 네 번 중 한 번, Sonnet 5가 세 번 중 한 번만 맞혔습니다. Prepamigo는 열두 편 모두 맞혔습니다.

이 글의 나머지 부분에서는 그 결과를 등급별로 살펴보고, 범용 모델이 왜 척도의 중간을 놓치는지 설명하며, 양쪽 피드백이 얼마나 가치가 있는지 살펴보고, 각각으로 라이팅을 진지하게 연습할 때 드는 비용을 비교합니다. Claude가 우리를 이긴 한 지점을 포함해, 처음부터 끝까지 Claude에게 공정하려고 노력했습니다.

평범한 테스트: 학생이 실제로 얻는 것

86% 대 61%, 그리고 56%. 36편의 에세이에서 이는 Opus 5보다 9개, Sonnet 5보다 11개 더 많은 정답입니다. 달리 말하면, 같은 에세이에서 Prepamigo는 Opus 5보다 채점 실수를 64% 더 적게 하고, Sonnet 5보다는 69% 더 적게 합니다.

Claude에게 무엇을 주었는지가 중요하므로 여기 밝혀 둡니다. 각 모델에게 당신은 경험 많은 CELPIP 라이팅 시험관이라고 알려주고, 이메일 과제의 필수 요점과 설문 과제의 선택지를 포함해 응시자가 본 그대로의 과제를 주고, 에세이를 주었습니다. 그리고 0점에서 12점 사이의 점수 하나를 요청했습니다. 그것이 프롬프트 전부입니다. 채팅창에 직접 입력할 법한 내용이며, 모델이 적어도 과제가 무엇을 요구했는지는 알기 때문에 한 줄짜리 “이거 채점해 줘”보다 더 공정한 테스트입니다.

Prepamigo의 채점기도 같은 과제와 같은 에세이를 받았습니다. 거기에 프로덕션에서 항상 갖추고 있는 것도 함께 있었습니다: 비교할 수 있는 그 과제의 각 등급별 실제 채점 샘플 에세이, 그리고 채점관이 가장 먼저 확인하는 것들을 점검하는 규칙 레이어입니다. 예를 들어 모든 필수 요점이 들어 있는지, 설문 응답이 실제로 한쪽 입장을 택했는지, 이메일에 인사말과 맺음말이 있는지, 응답 길이가 얼마나 되는지 같은 것들입니다.

격차가 벌어지는 지점: 등급별로 살펴보기

전체 수치는 오류가 어디에 몰려 있는지를 감추는데, 라이팅에서는 오류가 한 곳에 몰려 있습니다. 같은 결과를 검증된 등급별로 나누어 보면 다음과 같습니다: 4점 또는 5점을 받은 약한 에세이, 7점 또는 8점을 받은 중위 에세이, 그리고 10점 이상을 받은 강한 에세이입니다.

약한 에세이 (검증된 점수 4점 또는 5점)

공식 에세이 12편. 여기서 Claude가 놓치는 경우는 대부분 한 등급 아래인 3점입니다.

75%

Prepamigo 라이팅 채점기

67%

Claude Opus 5

50%

Claude Sonnet 5

약한 에세이에서는 Prepamigo가 75%, Opus 5가 67%, Sonnet 5가 50%입니다. Prepamigo가 놓친 세 편은 모두 짧지만 깔끔한 에세이에서 한 단계 높은 6점이나 7점으로 간 경우였습니다. Claude가 놓친 경우는 반대 방향입니다: Sonnet 5는 약한 에세이 열두 편 중 네 편에 3점을 주었고, Opus 5는 두 편에 3점을 주었습니다. 이 척도에서 3점은 과제에 거의 대응하지 못한 응답입니다. 이 에세이들은 과제에 대응하고 있습니다. 다만 내용이 빈약할 뿐입니다. 4점이 어떤 모습인지에 대한 예시가 없는 Claude는 빈약함을 낙제로 읽습니다.

중위 에세이 (검증된 점수 7점 또는 8점)

공식 에세이 12편. 대부분의 응시자가 위치한 등급이자, Claude가 실패하는 등급입니다.

100%

Prepamigo 라이팅 채점기

33%

Claude Sonnet 5

25%

Claude Opus 5

중간이 이야기의 전부입니다. Prepamigo는 중위 등급 에세이 열두 편 모두를 7~8점 범위 안에서 채점했습니다. Opus 5는 세 편, Sonnet 5는 네 편을 맞혔습니다. Opus 5가 놓친 경우는 거의 모두 위쪽으로 벗어났습니다: 열두 편 중 여섯 편에 9점을, 한 편에 10점을 주었습니다. Sonnet 5는 양쪽으로 갈렸는데, 네 편은 6점으로 내려갔고 네 편은 9점이나 10점으로 올라갔습니다.

이런 에세이를 쓴 응시자에게 이것이 무엇을 의미하는지 생각해 보십시오. 7점이나 8점은 시험에서 가장 흔한 실제 점수이며, 이민 목표 점수에 도달했는지 여부를 가르는 점수입니다. Opus 5에게 물으면 절반이 넘는 확률로 당신은 9점이나 10점이고 연습을 그만해도 된다고 말할 것입니다. 그렇지 않습니다. Sonnet 5에게 물으면 세 번 중 한 번은 6점으로 떨어졌다고 말할 것입니다. 그렇지 않습니다. 어느 쪽 대답도 다음에 무엇을 해야 할지 결정하는 데 도움이 되지 않습니다.

강한 에세이 (검증된 점수 10점 이상)

공식 에세이 12편. Claude Opus 5가 Prepamigo를 이기는 유일한 등급입니다.

92%

Claude Opus 5

83%

Prepamigo 라이팅 채점기

83%

Claude Sonnet 5

최상위에서는 Opus 5가 이 테스트에서 최고의 채점자입니다: 강한 에세이 열두 편 중 열한 편을 인식했습니다. Prepamigo와 Sonnet 5는 각각 열 편을 인식했습니다. Prepamigo가 놓친 두 편은 모두 한 단계 아래인 9점이었고, Sonnet 5가 놓친 것은 9점과 7점이었습니다. 우리는 이것이 사실이기 때문에, 그리고 전체 패턴을 설명해 주기 때문에 보고합니다: Claude는 후합니다. 9점, 10점, 11점을 아낌없이 나눠주는데, 이는 강한 에세이에서는 우연히 맞고 그 밖의 모든 것에서는 틀립니다.

Claude로 라이팅을 채점하는데 9점을 준다면, 다른 무언가가 확인해 주기 전까지는 중위 등급 점수로 여기십시오. 우리 테스트에서 Opus 5가 9점을 준 에세이는 검증된 9점이나 10점보다 검증된 7점이나 8점일 가능성이 더 높았습니다.

챗봇은 왜 척도의 중간을 놓치는가

중위 등급 CELPIP 에세이는 특정한 모습을 갖고 있습니다. 과제를 다루고, 체계적이며, 이해를 방해하는 오류가 적으면서도, 동시에 평범합니다: 이유는 전개되기보다 단언되고, 어휘는 안전하며, 문장은 모두 같은 모양입니다. 이런 에세이를 수백 편 본 채점관은 이것이 정확히 어디에 위치하는지 압니다. 범용 모델은 이런 에세이 수백 편이 7점으로 표시된 것을 본 적이 없습니다. 깔끔하고, 체계적이고, 대체로 정확한 글을 보았을 뿐이고, 그래서 높은 숫자로 손을 뻗습니다.

그것이 차이의 전부입니다. Prepamigo의 채점기는 에세이를 좋은 글에 대한 관념과 비교해 판단하지 않습니다. 같은 과제의 실제 채점 에세이와 비교해 판단합니다: 약한 등급 하나, 중간 등급 하나, 최상위 등급 하나, 모두 실제 실수가 담긴 실제 응답들입니다. 깔끔하지만 평범한 에세이는 가장 닮은 것이 중간 샘플이기 때문에 그 옆에 자리 잡습니다. 빈약한 에세이는 약한 샘플 아래가 아니라 그 옆에 자리 잡는데, 약한 샘플 역시 빈약하면서도 여전히 4점이기 때문입니다.

이 비교 위에는 모델이 세는 데 서투른 것들을 처리하는 규칙 레이어가 얹혀 있습니다. 이메일이 필수 요점 세 가지를 모두 다루었는가, 아니면 두 가지만 다루었는가? 설문 응답이 실제로 하나의 선택지를 골랐는가, 아니면 그 사이에서 얼버무렸는가? 인사말과 맺음말이 있는가? 응답이 180단어인가, 60단어인가? 필수 요점을 하나 놓치면 영어가 아무리 훌륭해도 과제 수행 점수는 8점 이하로 묶이는데, 시험이 그렇게 작동하기 때문입니다. 평범하게 요청받은 Claude에게는 그런 하한도 상한도 없습니다. 모든 것을 인상으로 결정합니다.

우리는 Claude에게 등급에 대해 알려주면 이것이 고쳐지는지도 테스트했습니다. 그것만으로는 고쳐지지 않습니다. 모델에게 채점 기준표를 주어도 같은 치우침이 나타납니다. 숫자를 움직이는 것은 실제 채점 샘플과 규칙 레이어를 주는 것인데, 이는 달리 말하면 채점기를 만드는 것입니다.

사용 흐름의 격차: 당신이 직접 가져와야 하는 것

라이팅은 Claude를 채점자로 쓰기가 가장 쉬운 영역이며, 이 점은 솔직하게 인정할 만합니다. 에세이를 붙여넣으면 몇 초 만에 점수가 나오고, 설명해 달라고 하면 길게 설명해 줍니다. 전사 단계도, 오디오도, 설정도 없습니다. 빠르게 다른 의견을 구하기에는 정말로 편리합니다.

얻지 못하는 것은 과제입니다. Claude에게는 올바른 필수 요점, 선택지, 단어 수를 갖춘 CELPIP 형식의 이메일과 설문 프롬프트 은행이 없으므로, 직접 프롬프트를 쓰고 시험과 비슷하기를 바라거나, 구할 수 있는 아무것으로나 연습해야 합니다. 필수 요점 점검도 받지 못하는데, Claude는 실제 시험이 어떤 요점을 제시할지 모르기 때문입니다. 당신의 에세이를 알맞은 길이로 다시 쓴 모범 답안도 받지 못합니다. 그리고 실제 채점 에세이에 맞춰 보정된 숫자도 받지 못하는데, 바로 그래서 척도의 중간이 틀어지는 것입니다.

Prepamigo에서는 은행에서 과제를 열면 타이머가 돌아가고, 글을 쓰고, 제출한 지 약 1분 후에 네 가지 영역별 점수, 종합 점수, 놓친 것들의 목록, 당신의 글에서 인용한 교정, 그리고 다시 쓴 모범 답안을 받습니다. 이달의 마흔 번째 에세이도 첫 번째 에세이와 똑같은 수고만 듭니다.

같은 에세이, 같은 점수

재현할 수 없는 점수는 측정이 아닙니다. 같은 에세이가 오늘은 8점, 내일은 10점을 받는다면 당신은 자신의 글에 대해 아무것도 배우지 못한 것입니다. 그래서 주요 실행 이후 36편의 에세이 전부를 다른 날에 두 번 더 채점했습니다. Prepamigo의 라이팅 채점기는 세 번의 실행에서 86%, 89%, 86%를 기록했고, 같은 열두 편의 중위 등급 에세이가 매번 범위 안에 들어왔습니다.

Claude의 실행 결과도 움직였지만, 오류의 모양은 변하지 않았습니다: 매 실행마다 중위 등급 에세이 대부분이 Opus 5에게서 9점으로 돌아왔고, 약한 에세이는 Sonnet 5에게서 계속 3점을 받았습니다. 이 일관성이야말로 유용한 발견입니다. 문제는 Claude가 들쭉날쭉하다는 것이 아닙니다. Claude가 매번 같은 방향으로 자신 있게 잘못 보정되어 있다는 것이며, 이는 알아차리기가 더 어렵습니다.

피드백: 틀린 숫자에 대한 훌륭한 설명

Claude는 뛰어난 피드백 문장을 씁니다. 명확하고, 인내심 있고, 구체적이며, 어떤 에세이가 왜 9점인지 설명해 달라고 하면 설득력 있는 단락을 만들어 냅니다. 문제는 그 단락이 이미 정해진 숫자를 정당화하기 위해 쓰였다는 것이고, 숫자가 틀리면 설명도 함께 틀린다는 것입니다. 실제로는 7점인 에세이가 갖고 있지도 않은 장점으로 칭찬받고, 응시자는 안심한 채 돌아섭니다.

Prepamigo의 피드백은 반대편에서 시작합니다. 모든 교정은 당신의 에세이에서 정확한 표현을 인용하며, 검사기가 당신의 글에서 찾지 못한 내용은 당신에게 보이기 전에 제거됩니다. 놓친 필수 요점은 이름 그대로 지목됩니다. 각 영역에는 하나의 제한 요인이 제시되거나, 아무것도 발목을 잡고 있지 않다는 분명한 언급이 붙습니다. 그리고 과제가 요구하는 길이로 당신의 응답을 다시 쓴 모범 답안을 받으므로, 격차에 대해 읽는 것이 아니라 격차를 직접 볼 수 있습니다. 아래 섹션에서는 피드백 레이어에서 무엇이 달라졌는지 정리합니다.

라이팅 피드백에서 새로워진 점

점수는 당신이 돌려받는 것의 절반에 불과합니다. 라이팅 피드백 레이어는 채점기와 함께 새로 만들어졌으며, 그 안의 모든 내용은 당신이 직접 쓴 글에 근거합니다. 무엇이 달라졌는지 살펴보겠습니다.

  • 자신의 에세이에서 바로 찾을 수 있는 교정. 모든 문법, 철자, 어휘 교정은 당신의 응답에서 정확한 표현을 그대로 인용하므로, 앱이 당신이 쓴 그 자리에 바로 표시해 줄 수 있습니다. 검사기가 에세이에서 단어 그대로 찾아내지 못한 내용은 당신에게 보이기 전에 제거됩니다.
  • 당신의 답안으로 만든 모범 답안. 당신의 아이디어를 그대로 유지하면서 요구된 모든 요점을 다루고, 과제가 요구하는 150~200단어 분량에 맞춘 재작성 버전을 받게 됩니다. 첫 번째 재작성이 이 분량을 벗어나면, 보여드리기 전에 한 번 더 다시 작성됩니다.
  • 놓친 필수 요점을 이름 그대로. 이메일 과제에서는 피드백이 프롬프트의 요점 중 당신의 응답이 다루지 않은 것을 나열합니다. 요점을 하나라도 놓치면 과제 수행(task fulfillment) 점수는 8점 이하로 제한되므로, 숫자와 피드백이 서로 어긋나는 일이 없습니다.
  • 영역마다 하나의 제한 요인. 네 가지 영역 각각에 대해 피드백은 그 점수를 끌어내리는 단 하나의 요인을 구체적으로 짚거나, 아무 문제도 없다면 그렇다고 분명히 말하고 무엇이 그 점수를 떠받치고 있는지 알려줍니다. 어떤 영역에 문제가 없다고 판단하는 것도 빈칸이 아니라 하나의 진짜 답입니다.
  • 비판은 알맞은 자리에. 어조가 약한 것은 과제 수행 문제이고, 모호한 단어 선택은 어휘 문제이며, 끝없이 이어지는 문장은 가독성 문제입니다. 각 지적은 전체 요약에 뭉뚱그려지는 대신 그것을 담당하는 영역 아래에 정리됩니다.
  • 문장 단위 재작성. 에세이의 특정 문장들이 개선된 버전과 함께, 왜 더 나은지 한 줄 설명을 달고 돌아옵니다. 그래서 변화에 대해 읽는 것이 아니라 변화를 직접 볼 수 있습니다.
  • 가장 강한 영역과 가장 약한 영역을 나란히. 피드백은 네 가지 영역 중 어느 것이 당신의 점수를 떠받치고 어느 것이 발목을 잡고 있는지 알려주므로, 네 개의 숫자를 해독하지 않고도 다음에 무엇을 연습해야 할지 알 수 있습니다.

피드백의 모든 인용문은 표시되기 전에 당신의 에세이와 대조하여 확인됩니다. 검사기가 그 표현을 찾지 못하면 해당 줄은 제거됩니다. 그래서 피드백은 당신이 쓰지 않은 것을 고치라고 절대 말하지 않습니다.

매일 연습하는 데 드는 비용

라이팅 점수는 세 번째 에세이가 아니라 서른 번째 에세이에서 가장 유용합니다. 그때가 바로 글 쓰는 방식의 변화가 실제로 효과가 있는지 알려주기 시작하는 시점이기 때문입니다. 그러므로 실질적인 질문은 각 옵션을 많이 사용할 때 얼마가 드는지입니다.

Claude Pro는 2026년 9월 claude.com에 게시된 기준으로 월 US$20, 약 CA$28이며, 연간 결제 시 월 US$17이고, 5시간 단위로 순환하는 사용량 한도와 주간 한도가 있습니다. Max 요금제는 월 US$100부터, 세전 약 CA$138이며 그 한도를 높여주지만 없애지는 않습니다. 어떤 요금제도 과제 은행, 타이머, 필수 요점 점검, 모범 답안, 또는 실제 채점 에세이에 맞춰 보정된 점수를 포함하지 않습니다.

Prepamigo는 월 CA$24.98, 또는 연간 요금제로 월 CA$8.25(연 CA$98.98)이며 세금이 포함되어 있고 언제든지 해지할 수 있습니다. 모든 요금제에는 일일, 세션, 주간 한도가 전혀 없는 무제한 채점, 무제한 시도, 그리고 전체 문제 은행이 포함됩니다: Writing, Speaking, Reading, Listening 전 영역에 걸쳐 80개의 완성된 연습 세트와 2,000개 이상의 연습 과제로, CELPIP General 시험의 과제 유형, 시간 배분, 형식을 따르도록 작성되었습니다.

Claude가 더 나은 도구일 때

  • 강한 에세이 다듬기. 이미 10점 수준이고 11점이나 12점에는 무엇이 필요한지 알고 싶다면, Opus 5는 강한 글을 안정적으로 알아보고 설명도 잘합니다. 그것이 Opus 5가 우리를 이긴 유일한 등급입니다.
  • 한 문장을 다섯 가지로 다시 쓰기. 어색한 문장의 대안을 요청하는 것은 빠르고, 제안도 좋습니다.
  • 이야기 나누기. 어떤 이유가 왜 약한지 따져보고 싶다면 대화가 알맞은 형태입니다. Prepamigo는 판정과 증거를 주지만 대화하지는 않습니다.
  • 시험 밖의 모든 것. Claude는 범용 어시스턴트이고 Prepamigo는 그렇지 않습니다.

여기서 제시한 근거로 볼 때, Claude가 되어서는 안 되는 역할은 7점이나 8점 수준의 필자에게 지금 어디에 있는지 알려주는 존재입니다. 그것이 대부분의 응시자이고, 바로 그 지점에서 Claude는 네 번 중 세 번 틀립니다.

자주 묻는 질문

Claude로 CELPIP 라이팅을 채점할 수 있나요? 숫자는 나옵니다. 검증된 점수가 있는 36편의 공식 응답에서 Claude Opus 5는 61%, Claude Sonnet 5는 56%의 확률로 맞혔으며, Prepamigo는 86%였습니다. 중위 등급 에세이에서는 25%와 33% 대 100%입니다.

라이팅에서 Prepamigo가 Claude보다 더 정확한가요? 전체적으로는 네, 25~30포인트 차이입니다. 강한 에세이에서는 Opus 5가 92% 대 83%로 더 낫습니다. 대부분의 응시자가 위치한 중위 등급 에세이에서는 격차가 100% 대 25%입니다.

왜 Claude는 제 평범한 에세이에 9점을 주나요? 비교할 대상이 없으면 깔끔하고 체계적이며 평범한 에세이가 강한 에세이로 읽힙니다. Opus 5는 검증된 7~8점 에세이 열두 편 중 일곱 편에 9점이나 10점을 주었습니다. Prepamigo는 모든 에세이를 같은 과제의 실제 채점 샘플과 비교합니다.

각각 비용은 얼마인가요? Claude Max는 월 US$100부터, 세전 약 CA$138입니다. Pro는 US$20이지만 한도가 더 엄격합니다. Prepamigo는 세금 포함 월 CA$24.98, 또는 연간 요금제로 월 CA$8.25이며 무제한 채점과 80개의 연습 세트를 제공합니다.

ChatGPT와의 같은 비교를 보려면 라이팅에서 Prepamigo와 ChatGPT 비교를 읽어보세요. 라이팅 채점기가 어떻게 작동하는지 보려면 Prepamigo 라이팅 채점기 내부 들여다보기를 읽어보세요. 아니면 바로 응답 작성하기를 해보고 점수를 확인해 보세요. 영어로 이 가이드 읽기

CELPIP 라이팅, Prepamigo와 Claude 중 어느 쪽이 정확한 점수를 주는가? | PrepAmigo