채점

어떤 AI가 CELPIP 라이팅을 가장 정확하게 채점하는가? 일곱 가지를 테스트했습니다

2026년 9월 8일

검증된 등급으로 채점된 에세이의 비율

36개의 공식 CELPIP 라이팅 응답, 등급당 12개, 두 가지 라이팅 과제 모두 포함. 각 모델에게 과제와 에세이를 주고 평범한 말로 CELPIP 척도에 따라 채점하도록 요청했습니다. Prepamigo의 라이팅 채점기는 일반 프로덕션 구성으로 실행되었습니다.

86%

Prepamigo 라이팅 채점기

78%

GPT 5.6 sol

69%

GPT 5.6 luna

61%

Gemini

61%

Claude Opus 5

58%

GPT-4o mini

56%

Claude Sonnet 5

Prepamigo와 인기 챗봇 요금제 비교

캐나다 달러 기준입니다. Prepamigo 가격은 세금이 포함되어 있습니다. Claude Max(월 US$100부터)와 ChatGPT Pro(월 US$200)는 세전 가격을 1.38 환율로 환산한 값입니다. 정확도는 해당 모델에게 평범한 말로 에세이 채점을 요청했을 때 36편의 공식 에세이 중 검증된 등급과 일치한 비율이며, 1회 실행 결과입니다.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
월 요금
CA$24.98 (세금 포함)
CA$138+ (세금 별도)
CA$276 (세금 별도)
채점
무제한
제한
제한
완성된 문제 은행
있음
없음
없음
연습 세트
80개
없음
없음
연습 과제
2,000개+
없음
없음
CELPIP 형식
있음
없음
없음
정확도
86%
61%
78%
중위 등급 에세이
100%
25%
75%

많은 CELPIP 응시자가 AI 챗봇으로 자신의 글을 확인합니다. 이메일을 붙여넣고, 점수를 요청하고, 문단을 읽습니다. 라이팅에서는 쉽습니다: 녹음도, 전사문도 필요 없습니다. 아무도 알려주지 않는 것은 그 숫자가 얼마나 자주 맞는지, 어떤 모델을 믿어야 하는지, 각 모델이 어떤 실수를 하는지입니다. 우리는 알고 싶었고, 그래서 여섯 개 챗봇과 우리 자체 채점기에 검증된 점수가 있는 같은 36개 공식 에세이를 주고 집계했습니다.

한 문장으로 정리하면: CELPIP 라이팅에서 가장 정확한 챗봇은 78%의 GPT 5.6 sol이고, 가장 부정확한 것은 중위 등급 에세이를 부풀리는 61%와 56%의 Claude 모델들이며, 목적에 맞게 만들어진 채점기인 Prepamigo의 채점기는 같은 에세이에서 86%를 기록하고 중위 등급 에세이를 모두 맞혔습니다. Prepamigo가 우리 제품이라는 점은 미리 밝혀 둡니다. 특정 등급에서 챗봇이 우리를 앞선 경우에는 그렇다고 말합니다. 두 개가 그랬습니다.

순위표

위 차트에서 세 층이 보입니다. 86%의 Prepamigo는 홀로 서 있습니다. 78%의 GPT 5.6 sol과 69%의 GPT 5.6 luna가 두 번째 층을 이룹니다: 쓸 만하고, 습성이 알려져 있습니다. 나머지는 모두 60% 언저리인데, 세 등급 척도에서 이는 정보를 가진 추측보다 크게 나을 것이 없습니다.

이 패턴은 Claude 모델들이 잘하고 GPT 모델들이 못했던 스피킹과 다릅니다. 라이팅에서는 뒤집혔습니다. GPT 모델들은 약간 엄격합니다: 평범한 7점을 6점으로 끌어내리고, 작은 실수가 있는 최상위 에세이를 9점에 묶습니다. Claude 모델들은 관대합니다: 평범한 7점을 9점이나 10점으로 밀어 올리고, 내용이 빈약한 하위 에세이에 3점을 줍니다. Gemini는 중간에서 Claude처럼 행동합니다. GPT-4o mini는 9점을 천장으로 취급합니다.

등급별 결과

하위 에세이 (검증된 점수 4점 또는 5점)

시스템당 공식 에세이 12개.

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

Prepamigo 라이팅 채점기

67%

Claude Opus 5

58%

Gemini

50%

Claude Sonnet 5

하위 에세이는 척도에서 쉬운 쪽 끝이며, 세 GPT 모델이 83%로 동률을 이루어 75%의 Prepamigo를 앞섭니다. Prepamigo가 놓친 세 개는 모두 짧지만 정돈된 에세이에서 한 단계 높은 6점이나 7점으로 갔습니다. Claude 모델들은 반대 방향으로 놓칩니다: Sonnet 5는 하위 에세이 열두 개 중 네 개에 한 등급 아래인 3점을 줬고, Opus 5는 그중 두 개에 3점을 줬습니다. 빈약하더라도 과제를 수행한 에세이는 3점이 아니라 4점인데, 4점의 예시가 없는 모델은 그 차이를 구분하지 못합니다.

중위 에세이 (검증된 점수 7점 또는 8점)

시스템당 공식 에세이 12개. 대부분의 응시자가 있는 등급입니다.

100%

Prepamigo 라이팅 채점기

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

42%

Gemini

33%

Claude Sonnet 5

25%

Claude Opus 5

중위 등급이 승부를 가릅니다. Prepamigo는 열두 개를 모두 맞혔습니다. GPT 5.6 sol은 아홉 개를 맞히고 세 개를 6점으로 끌어내렸습니다. GPT-4o mini는 여덟 개를 맞히고 네 개를 9점으로 밀어 올렸습니다. luna는 일곱 개를 맞혔고, 놓친 것은 대부분 끌어내린 쪽입니다. Gemini는 다섯 개를 맞히고 여섯 개를 9점이나 10점으로 밀어 올렸습니다. Claude Sonnet 5는 네 개를 맞혔고, 놓친 것은 6점과 9점으로 갈렸습니다. Claude Opus 5는 세 개를 맞히고 열두 개 중 일곱 개에 9점이나 10점을 줬습니다.

당신이 7점이나 8점 수준의 글쓴이라면, 그리고 대부분의 응시자가 그렇다면, 기억해야 할 차트가 바로 이것입니다. Claude Opus 5에게 물으면 절반이 넘는 확률로 다 됐다고 말할 것입니다. Gemini에게 물으면 절반의 확률로 같은 말을 할 것입니다. GPT 5.6 sol에게 물으면 네 번 중 한 번은 6점으로 떨어졌다고 말할 것입니다.

최상위 에세이 (검증된 점수 10점 이상)

시스템당 공식 에세이 12개. 놓치는 경우는 거의 전부 9점입니다.

92%

Claude Opus 5

83%

Prepamigo 라이팅 채점기

83%

Gemini

83%

Claude Sonnet 5

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

상단에서는 Claude Opus 5가 이 테스트에서 최고의 채점자로, 최상위 에세이 열두 개 중 열한 개를 인식했고 그중 다섯 개에 11점을 줬습니다. Prepamigo, Gemini, Sonnet 5는 각각 열 개를 인식했습니다. GPT 5.6 sol은 아홉 개, luna는 여덟 개를 인식했고 나머지는 9점에 묶었습니다. GPT-4o mini는 세 개를 인식하고 아홉 개에 9점을 줬습니다: 10점을 주지 않습니다. Claude의 관대함은 여기서는 맞고 다른 모든 곳에서는 틀립니다. GPT 모델들의 엄격함은 여기서는 틀리고 다른 곳에서는 대체로 맞습니다.

어떤 챗봇을 쓰든, 우수하다고 생각한 에세이에서 받은 9점은 진짜 9점보다 억눌린 10점일 가능성이 높습니다. 단, Claude 모델에서 나온 9점이라면 승격된 7점이나 8점일 가능성이 더 높습니다. 오류의 방향은 모델에 따라 다릅니다.

모델들이 중간에서 의견이 갈리는 이유

중위 등급 CELPIP 에세이는 구체적인 특징이 있습니다: 과제를 다루고, 구성이 잡혀 있고, 이해를 방해하는 오류가 적으면서도 평범합니다. 이유는 전개되기보다 주장되고, 어휘는 정확하기보다 무난합니다. 훈련된 채점관은 이런 글을 수백 편 봐 왔고 어디에 놓아야 할지 압니다. 범용 모델은 정돈되고 구성이 잡히고 대체로 정확한 글을 보고 인상으로 결정해야 합니다. Claude의 인상은 정돈됨은 곧 우수함이라는 것입니다. GPT의 인상은 평범함은 곧 약함이라는 것입니다. 둘 다 7점에 대해 서로 반대 방향으로 틀립니다.

Prepamigo의 채점기는 인상으로 판단하지 않습니다. 에세이를 같은 종류의 과제에 대한 각 등급의 실제 채점된 응답, 즉 모두 실제 실수가 담긴 실제 에세이와 비교하고, 네 가지 영역 각각에서 가장 닮은 예시 옆에 놓습니다. 깔끔하지만 평범한 에세이는 중위 예시 옆에 놓입니다. 그것이 그 에세이의 실체이기 때문입니다. 이 비교 위에는 모델이 세는 데 서투른 것들을 위한 규칙 레이어가 있습니다: 모든 필수 항목을 다루었는지, 설문 응답이 한쪽을 골랐는지, 이메일에 인사말과 맺음말이 있는지, 그리고 길이가 어떤지입니다. 필수 항목을 놓치면 영어와 상관없이 과제 수행 점수는 8점 이하로 제한됩니다. 시험이 그렇게 작동하기 때문입니다.

우리는 라이팅 채점기에 스피킹 채점기가 사용하는 채점자 두 명의 투표·조정 설계를 적용하는 것도 시도했습니다. 라이팅은 더 나빠졌습니다. 공식 라이팅 등급은 0점에서 12점 척도에서 서로 2점밖에 떨어져 있지 않아서, 예시 중 하나를 강제로 고르게 하자 중위 에세이가 9점으로 밀려 올라갔기 때문입니다. 라이팅은 중간을 맞히는 설계를 유지합니다.

순위가 스피킹과 정반대인 이유

우리의 스피킹 비교를 읽었다면 라이팅 순위표가 거꾸로 보일 것입니다. 스피킹 전사문에서는 Claude Opus 5가 62%로 최고의 챗봇이었고 GPT 5.6 sol은 35%로 대형 모델 중 최악이었습니다. 라이팅에서는 GPT 5.6 sol이 78%이고 Claude 모델들이 바닥입니다.

이유는 각 모델이 무엇에 관대한가에 있습니다. CELPIP 스피킹 전사문은 말한 영어를 받아 적은 것입니다: 문장 조각, 반복, 자기 수정이 섞여 있습니다. GPT는 그것을 망가진 영어로 읽고 가혹하게 채점하는데, 전사문에서는 그것이 틀립니다. Claude는 그것을 뚫고 아이디어를 읽습니다. CELPIP 에세이는 정반대입니다: 편집되고, 구성이 잡히고, 겉보기에 정돈되어 있지만 속은 평범한 경우가 많습니다. Claude는 정돈됨을 우수함으로 읽고 중간을 부풀립니다. GPT는 평범한 내용을 약함으로 읽고 대체로 맞거나 1점 낮습니다.

실질적인 교훈은 CELPIP에 단 하나의 최고 챗봇은 없다는 것입니다. 당신의 스피킹을 잘 채점하는 모델이 당신의 라이팅에는 후한 점수를 줄 것이고, 그 반대도 마찬가지입니다. 목적에 맞게 만들어진 채점기는 각 과제에 맞는 종류의 채점된 예시와 비교함으로써 이 문제를 비켜 갑니다. Prepamigo의 스피킹 엔진과 라이팅 엔진은 서로 다른 설계를 가진 별개의 시스템입니다. 두 과제가 서로 다른 방식으로 실패하기 때문입니다.

숫자에 딸려 오는 문단

모든 챗봇은 점수와 함께 피드백 문단을 돌려주는데, 그 문단은 대개 숫자가 받을 자격이 있는 것보다 더 자신만만합니다. 그에 따라 행동하기 전에 확인할 세 가지입니다.

  • 당신의 글을 인용하는가? 당신의 정확한 표현을 가리키지 않는 교정은 당신의 에세이에 대한 피드백이 아니라 일반적인 규칙입니다. 챗봇 조언의 대부분은 어떤 에세이에나 적용되는 종류입니다: 문장 구조를 다양하게 하라, 더 정확한 어휘를 쓰라, 이유를 전개하라. 맞는 말이지만 실행할 수 없습니다.
  • 빠진 항목을 지목하는가? 과제를 붙여넣었다면 좋은 응답은 어떤 필수 항목을 다루지 않았는지 알려줍니다. 붙여넣지 않았다면 챗봇은 알 수 없고, 그런데도 충족했다고 칭찬할 것입니다.
  • 비판이 점수와 맞는가? 챗봇 문단은 종종 문제를 서너 개 나열하고 나서 10점을 주거나, 에세이를 칭찬하고 나서 6점을 줍니다. 말과 숫자가 어긋나면 어느 쪽도 믿을 수 없습니다.

Prepamigo의 피드백은 반대 순서로 만들어집니다: 채점기는 점수를 주기 전에 각 영역 점수를 뒷받침하는 표현을 인용해야 하고, 당신의 에세이에서 찾을 수 없는 인용문은 폐기됩니다. 놓친 항목은 이름을 짚어 나열되고, 놓친 항목이 과제 수행 점수의 상한을 정하므로 말과 숫자가 어긋날 수 없습니다. 무엇이 들어 있는지는 아래 섹션에서 정리합니다.

모델별 메모

  • GPT 5.6 sol. 78%로 라이팅에 가장 좋은 챗봇이며, 챗봇을 쓴다면 이것을 쓰세요. 약간 엄격합니다: 중위 에세이 세 개를 6점으로 끌어내렸고, 최상위 에세이 세 개를 9점에 묶었습니다. 하위 에세이에서는 83% 대 75%로 Prepamigo보다 낫습니다.
  • GPT 5.6 luna. 69%. sol과 같은 모양이지만 중간에서 더 엄격해서 열두 개 중 일곱 개를 맞혔습니다. 하위 에세이에서는 좋습니다.
  • Gemini. 61%. 양 끝에서는 괜찮지만 중간에서는 42%로 부진하며, 열두 개 중 여섯 개를 9점이나 10점으로 밀어 올렸습니다.
  • Claude Opus 5. 전체 61%이지만 최상위 에세이에서는 92%로 이 테스트 최고의 채점자입니다. 중간에서는 25%로 최악이며, 열두 개 중 일곱 개에 9점이나 10점을 줬습니다. 당신의 글이 이미 우수하다면 Opus 5가 확인해 줄 것이고, 평범하다면 Opus 5는 우수하다고 말할 것입니다.
  • GPT-4o mini. 58%. 9점을 척도의 꼭대기로 취급합니다: 최상위 에세이 열두 개 중 아홉 개에 9점을 줬습니다. 10점 근처에 있다면 라이팅 채점에 쓰지 마세요.
  • Claude Sonnet 5. 56%로 가장 부정확합니다. 하위 에세이 네 개에 3점을 줬고, 중위 등급에서는 6점과 9점으로 갈렸습니다.

그래도 챗봇을 쓰겠다면

  1. GPT 5.6 sol을 쓰세요. 최상위 에세이가 아니라면 Claude 모델은 쓰지 말고, 하위 에세이가 아니라면 소형 모델은 쓰지 마세요.
  2. 과제 전체를 붙여넣으세요. 이메일 과제의 필수 항목과 설문 과제의 선택지가 점수를 바꿉니다. 항목을 모르는 모델은 하나가 빠졌다고 알려줄 수 없습니다.
  3. 항목을 먼저 확인하도록 요청하세요. 각 필수 항목에 대해 예/아니오를 먼저 받고, 그다음에 점수를 받으세요. 이것이 손으로 하는 규칙 레이어입니다.
  4. 두 번 물어서 낮은 답을 채택하세요. GPT 5.6 sol은 같은 에세이를 세 번 실행했을 때 78%, 83%, 81%를 기록했습니다. 단일 답변에는 몇 포인트의 운이 섞여 있습니다.
  5. 9점과 6점은 의심하며 읽으세요. GPT 모델에서 9점은 억눌린 10점, 6점은 끌어내려진 7점인 경우가 많습니다. Claude 모델에서 9점은 승격된 7점인 경우가 많습니다.

스스로 마련할 수 없는 유일한 입력값은 같은 과제의 각 등급에 해당하는 검증된 채점 에세이이며, 이것이 목적에 맞게 만들어진 채점기가 비교하는 대상입니다. 그것과 필수 항목 확인이 78%와 86%의 차이입니다.

라이팅 피드백에서 새로워진 점

점수는 당신이 돌려받는 것의 절반에 불과합니다. 라이팅 피드백 레이어는 채점기와 함께 새로 만들어졌으며, 그 안의 모든 내용은 당신이 직접 쓴 글에 근거합니다. 무엇이 달라졌는지 살펴보겠습니다.

  • 자신의 에세이에서 바로 찾을 수 있는 교정. 모든 문법, 철자, 어휘 교정은 당신의 응답에서 정확한 표현을 그대로 인용하므로, 앱이 당신이 쓴 그 자리에 바로 표시해 줄 수 있습니다. 검사기가 에세이에서 단어 그대로 찾아내지 못한 내용은 당신에게 보이기 전에 제거됩니다.
  • 당신의 답안으로 만든 모범 답안. 당신의 아이디어를 그대로 유지하면서 요구된 모든 요점을 다루고, 과제가 요구하는 150~200단어 분량에 맞춘 재작성 버전을 받게 됩니다. 첫 번째 재작성이 이 분량을 벗어나면, 보여드리기 전에 한 번 더 다시 작성됩니다.
  • 놓친 필수 요점을 이름 그대로. 이메일 과제에서는 피드백이 프롬프트의 요점 중 당신의 응답이 다루지 않은 것을 나열합니다. 요점을 하나라도 놓치면 과제 수행(task fulfillment) 점수는 8점 이하로 제한되므로, 숫자와 피드백이 서로 어긋나는 일이 없습니다.
  • 영역마다 하나의 제한 요인. 네 가지 영역 각각에 대해 피드백은 그 점수를 끌어내리는 단 하나의 요인을 구체적으로 짚거나, 아무 문제도 없다면 그렇다고 분명히 말하고 무엇이 그 점수를 떠받치고 있는지 알려줍니다. 어떤 영역에 문제가 없다고 판단하는 것도 빈칸이 아니라 하나의 진짜 답입니다.
  • 비판은 알맞은 자리에. 어조가 약한 것은 과제 수행 문제이고, 모호한 단어 선택은 어휘 문제이며, 끝없이 이어지는 문장은 가독성 문제입니다. 각 지적은 전체 요약에 뭉뚱그려지는 대신 그것을 담당하는 영역 아래에 정리됩니다.
  • 문장 단위 재작성. 에세이의 특정 문장들이 개선된 버전과 함께, 왜 더 나은지 한 줄 설명을 달고 돌아옵니다. 그래서 변화에 대해 읽는 것이 아니라 변화를 직접 볼 수 있습니다.
  • 가장 강한 영역과 가장 약한 영역을 나란히. 피드백은 네 가지 영역 중 어느 것이 당신의 점수를 떠받치고 어느 것이 발목을 잡고 있는지 알려주므로, 네 개의 숫자를 해독하지 않고도 다음에 무엇을 연습해야 할지 알 수 있습니다.

피드백의 모든 인용문은 표시되기 전에 당신의 에세이와 대조하여 확인됩니다. 검사기가 그 표현을 찾지 못하면 해당 줄은 제거됩니다. 그래서 피드백은 당신이 쓰지 않은 것을 고치라고 절대 말하지 않습니다.

자주 묻는 질문

CELPIP 라이팅 채점에서 가장 정확한 AI는 무엇인가요? 챗봇 중에서는 GPT 5.6 sol이 78%, 그다음 luna 69%, Gemini와 Claude Opus 5 61%, GPT-4o mini 58%, Claude Sonnet 5 56%입니다. Prepamigo의 라이팅 채점기는 같은 에세이에서 86%를 기록했습니다.

라이팅에는 ChatGPT와 Claude 중 어느 쪽인가요? 확실히 ChatGPT입니다: 78% 대 61%와 56%입니다. Claude 모델들은 중위 등급 에세이를 9점이나 10점으로 부풀립니다. 최상위 에세이에서는 Opus 5가 모든 모델 중 최고입니다.

왜 다들 제 평범한 에세이에 9점을 주나요? 비교할 대상이 없는 모델에게 정돈되고 구성이 잡힌 글은 우수한 글로 읽힙니다. Prepamigo는 같은 과제의 실제 채점된 예시와 비교합니다.

챗봇에서 더 좋은 점수를 받으려면 어떻게 해야 하나요? GPT 5.6 sol을 쓰고, 과제 전체를 붙여넣고, 각 필수 항목을 먼저 확인하도록 요청하고, 두 번 물어보고, 9점과 6점은 의심하며 읽으세요.

두 직접 비교를 보려면 라이팅에서 Prepamigo vs Claude 라이팅에서 Prepamigo vs ChatGPT를 읽어보세요. 채점기가 어떻게 작동하는지 보려면 Prepamigo 라이팅 채점기 내부 들여다보기를 읽어보세요. 아니면 응답 작성하기로 추측을 건너뛰세요. 영어로 이 가이드 읽기

어떤 AI가 CELPIP 라이팅을 가장 정확하게 채점하는가? 일곱 가지를 테스트했습니다 | PrepAmigo