Оценивание

Какой AI точнее всего оценивает письменную часть CELPIP? Мы протестировали семь

8 сентября 2026 г.

Доля эссе, оценённых на верифицированном уровне

36 официальных письменных ответов CELPIP, по 12 на уровень, оба письменных задания. Каждая модель получала задание и эссе, и её просили, простыми словами, оценить его по шкале CELPIP. Оценщик письма Prepamigo работал в своей обычной продакшен-конфигурации.

86%

Оценщик письма Prepamigo

78%

GPT 5.6 sol

69%

GPT 5.6 luna

61%

Gemini

61%

Claude Opus 5

58%

GPT-4o mini

56%

Claude Sonnet 5

Prepamigo против лучших тарифов чат-ботов

Цены в канадских долларах. Тарифы Prepamigo указаны с учётом налога. Claude Max (от US$100) и ChatGPT Pro (US$200) пересчитаны по курсу 1.38, без учёта налога. Точность — доля из 36 официальных эссе, получивших верифицированную оценку, когда указанной модели просто, без специальных инструкций, предлагали оценить эссе; один прогон.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Цена в месяц
CA$24.98 (с налогом)
CA$138+ (без налога)
CA$276 (без налога)
Оценка ответов
Без лимита
С лимитом
С лимитом
Готовый банк вопросов
Есть
Нет
Нет
Практические наборы
80
Нет
Нет
Практических заданий
2,000+
Нет
Нет
Формат CELPIP
Есть
Нет
Нет
Точность
86%
61%
78%
Эссе среднего уровня
100%
25%
75%

Немало кандидатов CELPIP проверяют своё письмо с помощью AI-чат-бота. Вставить письмо, попросить оценку, прочитать абзац. Для письма это просто: ни записи, ни расшифровки. Чего вам никто не говорит — так это как часто число верно, какой модели доверять и какие ошибки делает каждая. Мы хотели это узнать, поэтому дали шести чат-ботам и нашему собственному оценщику одни и те же 36 официальных эссе с верифицированными оценками и посчитали.

Версия в одно предложение: GPT 5.6 sol — самый точный чат-бот для письменной части CELPIP с 78%, модели Claude — наименее точные с 61% и 56%, потому что они завышают эссе среднего уровня, а специально созданный оценщик, Prepamigo, достиг 86% на тех же эссе и верно оценил каждое эссе среднего уровня. Скажем сразу: Prepamigo — наш продукт. Там, где чат-бот обошёл нас на конкретном уровне, мы так и говорим; двое из них обошли.

Таблица лидеров

На графике выше видны три яруса. Prepamigo с 86% стоит особняком. GPT 5.6 sol с 78% и GPT 5.6 luna с 69% образуют второй ярус: пригодны, с известными привычками. Всё остальное — на уровне 60% или около того, что для шкалы из трёх диапазонов ненамного лучше осведомлённой догадки.

Картина отличается от устной части, где модели Claude справились хорошо, а модели GPT — плохо. В письме всё наоборот. Модели GPT слегка строги: они опускают шаблонную семёрку до 6 и удерживают сильное эссе с оплошностью на 9. Модели Claude щедры: они поднимают шаблонную семёрку до 9 или 10 и ставят тонким слабым эссе 3. Gemini ведёт себя как Claude в середине. GPT-4o mini считает 9 потолком.

Результаты на каждом уровне

Слабые эссе (верифицированная оценка 4 или 5)

12 официальных эссе на систему.

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

Оценщик письма Prepamigo

67%

Claude Opus 5

58%

Gemini

50%

Claude Sonnet 5

Слабые эссе — лёгкий край шкалы, и три модели GPT делят 83%, опережая Prepamigo с 75%. Все три промаха Prepamigo ушли на ступень выше, к 6 или 7, на коротких, но аккуратных эссе. Модели Claude промахиваются в другую сторону: Sonnet 5 поставил четырём из двенадцати слабых эссе 3, уровнем ниже, а Opus 5 поставил 3 двум из них. Тонкое эссе, которое всё же выполняет задание, — это 4, а не 3, и модель без примера четвёрки не может отличить одно от другого.

Средние эссе (верифицированная оценка 7 или 8)

12 официальных эссе на систему. Уровень, на котором находится большинство кандидатов.

100%

Оценщик письма Prepamigo

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

42%

Gemini

33%

Claude Sonnet 5

25%

Claude Opus 5

Средний диапазон разделяет участников. Prepamigo оценил верно все двенадцать. GPT 5.6 sol — девять, опустив три до 6. GPT-4o mini — восемь, подняв четыре до 9. Luna — семь, в основном опуская. Gemini — пять, подняв шесть до 9 или 10. Claude Sonnet 5 — четыре, разделив остальные между шестёрками и девятками. Claude Opus 5 — три, поставив 9 или 10 семи из двенадцати.

Если вы пишете на 7 или 8 — а таких кандидатов большинство, — этот график стоит запомнить. Спросите Claude Opus 5 — и больше чем в половине случаев он скажет вам, что вы уже всего достигли. Спросите Gemini — и в половине случаев он скажет то же самое. Спросите GPT 5.6 sol — и один раз из четырёх он скажет вам, что вы скатились до 6.

Сильные эссе (верифицированная оценка 10 и выше)

12 официальных эссе на систему. Почти каждый промах — оценка 9.

92%

Claude Opus 5

83%

Оценщик письма Prepamigo

83%

Gemini

83%

Claude Sonnet 5

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

Наверху Claude Opus 5 — лучший оценщик в тесте: он распознал одиннадцать из двенадцати сильных эссе и пяти из них поставил 11. Prepamigo, Gemini и Sonnet 5 распознали по десять. GPT 5.6 sol распознал девять, luna — восемь, удержав остальные на 9. GPT-4o mini распознал три и поставил 9 девяти: он не выдаёт десяток. Щедрость Claude здесь верна и неверна везде остальное; строгость моделей GPT здесь неверна и примерно верна в остальных местах.

Каким бы чат-ботом вы ни пользовались, 9 за эссе, которое вы считали сильным, скорее придержанная 10, чем настоящая 9, — если только она не пришла от модели Claude, и тогда 9 скорее 7 или 8, получившие повышение. Направление ошибки зависит от модели.

Почему модели расходятся насчёт середины

Эссе CELPIP среднего уровня — вещь вполне определённая: оно раскрывает задание, организовано, в нём мало ошибок, мешающих пониманию, и оно шаблонно — причины заявлены, а не развиты, а словарь скорее безопасный, чем точный. Обученный экзаменатор видел сотни таких и знает, где они находятся. Универсальная модель увидела аккуратный, организованный, в основном правильный текст и вынуждена решать по впечатлению. Впечатление Claude — что аккуратное значит сильное. Впечатление GPT — что шаблонное значит слабое. Оба ошибаются насчёт семёрки, в противоположных направлениях.

Оценщик Prepamigo не судит по впечатлению. Он сравнивает эссе с реальными оценёнными ответами на такой же тип задания на каждом уровне — все они настоящие эссе с настоящими оплошностями — и ставит его рядом с тем, на которое оно больше всего похоже, по каждому из четырёх аспектов. Аккуратное, но шаблонное эссе оказывается рядом со средним образцом, потому что оно таким и является. Поверх сравнения лежит слой правил для того, что модель плохо считает: раскрыт ли каждый обязательный пункт, выбирает ли ответ на опрос сторону, есть ли в письме приветствие и завершение и какой у него объём. Пропущенный обязательный пункт удерживает выполнение задания на 8 и ниже независимо от английского, потому что так устроен тест.

Мы также попробовали дать оценщику письма дизайн с двумя оценщиками, голосованием и согласованием, который использует наш оценщик устной речи. Письму от этого стало хуже, потому что официальные уровни письма расположены на шкале от 0 до 12 всего в двух баллах друг от друга, и принудительный выбор между образцами поднимал средние эссе до 9. Письмо сохраняет дизайн, который верно оценивает середину.

Почему рейтинг обратен устной части

Если вы читали наше сравнение по устной части, таблица лидеров по письму покажется перевёрнутой. На расшифровках устных ответов Claude Opus 5 был лучшим чат-ботом с 62%, а GPT 5.6 sol — худшим из крупных моделей с 35%. В письме это GPT 5.6 sol с 78%, а модели Claude внизу.

Причина в том, к чему щедра каждая модель. Расшифровка устного ответа CELPIP — это записанная устная речь: обрывки, повторы, самоисправления. GPT читает это как сломанный текст и оценивает сурово, что на расшифровке неверно; Claude читает сквозь это к идеям. Эссе CELPIP — противоположность: оно отредактировано, организовано, аккуратно на поверхности и часто шаблонно внутри. Claude читает аккуратность как силу и завышает середину; GPT читает шаблонное содержание как слабость и примерно прав или на балл ниже.

Практический урок в том, что единственного лучшего чат-бота для CELPIP нет. Модель, которая хорошо оценивает вашу устную речь, будет льстить вашему письму, и наоборот. Специально созданный оценщик обходит этот вопрос, сравнивая с оценёнными образцами нужного типа для каждого задания. Движок устной речи и движок письма Prepamigo — отдельные системы с разными дизайнами, потому что два задания проваливаются по-разному.

Абзац, который приходит вместе с числом

Каждый чат-бот возвращает вместе с оценкой абзац обратной связи, и абзац обычно увереннее, чем заслуживает число. Три вещи, которые нужно проверить, прежде чем действовать по нему.

  • Цитирует ли он вас? Исправление, которое не указывает на ваши точные слова, — это общее правило, а не обратная связь по вашему эссе. Большинство советов чат-ботов из тех, что подходят любому эссе: варьируйте структуру предложений, используйте более точный словарь, развивайте причины. Верно — и неприменимо.
  • Называет ли он пропущенный пункт? Если вы вставили задание, хороший ответ говорит вам, какой обязательный пункт вы не раскрыли. Если не вставили, чат-бот не может этого знать — и всё равно похвалит охват.
  • Совпадает ли критика с оценкой? Абзац чат-бота часто перечисляет три-четыре проблемы, а затем ставит 10, или хвалит эссе и ставит 6. Когда слова и число расходятся, ни тому, ни другому нельзя доверять.

Обратная связь Prepamigo строится наоборот: оценщик должен процитировать фразы, подтверждающие оценку по каждому аспекту, прежде чем поставить её, а цитата, которой нет в вашем эссе, отбрасывается. Пропущенные пункты перечислены по имени, и пропущенный пункт ограничивает оценку за выполнение задания, так что слова и число не могут разойтись. В разделе ниже перечислено, что в неё входит.

Заметки по каждой модели

  • GPT 5.6 sol. Лучший чат-бот для письма с 78%, и тот, которым стоит пользоваться, если вы пользуетесь каким-то. Слегка строг: три средних эссе опущены до 6, три сильных эссе удержаны на 9. На слабых эссе он лучше Prepamigo: 83% против 75%.
  • GPT 5.6 luna. 69%. Та же форма, что у sol, но строже в середине, где он верно оценил семь из двенадцати. Хорош на слабых эссе.
  • Gemini. 61%. Неплох на краях, слаб в середине с 42%, где он поднял шесть из двенадцати эссе до 9 или 10.
  • Claude Opus 5. 61% в целом, но лучший оценщик в тесте на сильных эссе с 92%. В середине он худший с 25%: семи из двенадцати поставил 9 или 10. Если ваше письмо уже сильное, Opus 5 это подтвердит; если оно среднее, Opus 5 скажет вам, что оно сильное.
  • GPT-4o mini. 58%. Считает 9 верхом шкалы: девять из двенадцати сильных эссе получили 9. Не используйте его для оценки письма, если вы хоть сколько-нибудь близки к 10.
  • Claude Sonnet 5. 56%, наименее точный. Поставил четырём слабым эссе 3 и разделил средний диапазон между шестёрками и девятками.

Если вы всё равно будете пользоваться чат-ботом

  1. Используйте GPT 5.6 sol. Не модель Claude для чего-либо ниже сильного эссе и не маленькую модель для чего-либо выше слабого.
  2. Вставляйте задание целиком. Обязательные пункты для задания с письмом и варианты для задания с опросом меняют оценку. Модель, которая не знает пунктов, не может сказать вам, что один пропущен.
  3. Попросите сначала проверить пункты. Попросите «да» или «нет» по каждому обязательному пункту, а затем оценку. Это слой правил, выполненный вручную.
  4. Спросите дважды, оставьте более низкий ответ. GPT 5.6 sol набрал 78%, 83% и 81% в трёх прогонах на тех же эссе; единичный ответ несёт в себе несколько баллов удачи.
  5. Читайте 9 и 6 с подозрением. От модели GPT 9 — часто придержанная 10, а 6 — часто опущенная 7. От модели Claude 9 — часто повышенная 7.

Единственное, что вы не можете предоставить сами, — это верифицированное оценённое эссе на то же задание на каждом уровне, с которым сравнивает специально созданный оценщик. Это, вместе с проверкой обязательных пунктов, и есть разница между 78% и 86%.

Что нового в обратной связи по письму

Оценка — лишь половина того, что вы получаете в ответ. Слой обратной связи по письму был переработан вместе с оценщиком, и всё в нём привязано к вашему собственному тексту. Вот что изменилось.

  • Исправления, которые можно найти в вашем эссе. Каждое исправление грамматики, орфографии и словарного запаса цитирует точные слова из вашего ответа, чтобы приложение могло подсветить их там, где вы их написали. Всё, что проверяющий не может найти в вашем эссе слово в слово, удаляется до того, как вы это увидите.
  • Образцовый ответ, построенный из вашего ответа. Вы получаете переписанную версию вашего собственного ответа, которая сохраняет ваши идеи, раскрывает каждый обязательный пункт и укладывается в 150–200 слов, требуемых заданием. Если первая переработка не попадает в этот объём, она выполняется заново один раз, прежде чем показать её вам.
  • Пропущенный обязательный пункт, названный по имени. Для задания с письмом обратная связь перечисляет пункты из условия, которые ваш ответ не раскрыл. Пропущенный пункт также ограничивает оценку за выполнение задания до 8 и ниже, поэтому число и обратная связь никогда не противоречат друг другу.
  • Один ограничивающий фактор на каждый аспект. Для каждого из четырёх аспектов обратная связь называет конкретно то единственное, что сдерживает эту оценку, либо прямо говорит, что ничего не сдерживает, и что именно её вытягивает. Вывод о том, что у аспекта нет проблем, — это полноценный ответ, а не пробел.
  • Критика на своём месте. Слабый тон — это проблема выполнения задания, размытый выбор слова — проблема словарного запаса, слишком длинное слитное предложение — проблема читаемости. Каждое замечание относится к тому аспекту, к которому оно принадлежит, а не сваливается в общий итог.
  • Переработка на уровне предложений. Конкретные предложения из вашего эссе возвращаются с улучшенной версией и одной строкой о том, почему она лучше, — чтобы вы увидели изменение, а не читали о нём.
  • Ваш самый сильный и самый слабый аспект рядом. Обратная связь показывает, какой из четырёх аспектов вытягивает вашу оценку, а какой её сдерживает, — чтобы вы знали, что тренировать дальше, не расшифровывая четыре числа.

Каждая цитата в обратной связи сверяется с вашим эссе перед показом. Если проверяющий не может найти эти слова, строка удаляется. Именно поэтому обратная связь никогда не просит вас исправить то, чего вы не писали.

Часто задаваемые вопросы

Какой AI точнее всего оценивает письменную часть CELPIP? Среди чат-ботов — GPT 5.6 sol с 78%, затем luna 69%, Gemini и Claude Opus 5 61%, GPT-4o mini 58%, Claude Sonnet 5 56%. Оценщик письма Prepamigo достиг 86% на тех же эссе.

ChatGPT или Claude для письма? Однозначно ChatGPT: 78% против 61% и 56%. Модели Claude завышают эссе среднего уровня до 9 или 10. Opus 5 — лучший из всех на сильных эссе.

Почему они ставят моему среднему эссе 9? Аккуратное и организованное читается как сильное для модели, которой не с чем сравнивать. Prepamigo сравнивает с реальными оценёнными образцами на то же задание.

Как получить более точную оценку от чат-бота? Используйте GPT 5.6 sol, вставляйте полное задание, попросите сначала проверить каждый обязательный пункт, спросите дважды и читайте девятки и шестёрки с подозрением.

Для двух прямых сравнений читайте Prepamigo против Claude для письма и Prepamigo против ChatGPT для письма. Чтобы узнать, как работает оценщик, читайте внутри оценщика письма Prepamigo. Или напишите ответ и обойдитесь без догадок. Читайте эту статью на английском: Читать это руководство на английском.

Какой AI точнее всего оценивает письменную часть CELPIP? Мы протестировали семь | PrepAmigo