Продукт

Prepamigo против Claude для CELPIP Writing: кто даёт правильную оценку?

8 сентября 2026 г.

Доля эссе, оценённых на верифицированном уровне

36 официальных письменных ответов CELPIP, по 12 на каждый из трёх уровней, по обоим письменным заданиям. Claude получал задание и эссе, и его простыми словами просили оценить его по шкале CELPIP. Оценщик письма Prepamigo работал в своей обычной production-конфигурации.

86%

Оценщик письма Prepamigo

61%

Claude Opus 5

56%

Claude Sonnet 5

Prepamigo против лучших тарифов чат-ботов

Цены в канадских долларах. Тарифы Prepamigo указаны с учётом налога. Claude Max (от US$100) и ChatGPT Pro (US$200) пересчитаны по курсу 1.38, без учёта налога. Точность — доля из 36 официальных эссе, получивших верифицированную оценку, когда указанной модели просто, без специальных инструкций, предлагали оценить эссе; один прогон.

Prepamigo
Claude MaxOpus 5
Цена в месяц
CA$24.98 (с налогом)
CA$138+ (без налога)
Оценка ответов
Без лимита
С лимитом
Готовый банк вопросов
Есть
Нет
Практические наборы
80
Нет
Практических заданий
2,000+
Нет
Формат CELPIP
Есть
Нет
Точность
86%
61%
Эссе среднего уровня
100%
25%

Письмо — тот навык, где чат-бот выглядит как проверяющий наиболее убедительно. Нет записи, которую нужно расшифровывать, нет акцента, о котором стоит беспокоиться, — просто текст на входе и число на выходе, с абзацем уверенного объяснения. Поэтому мы проверили это число. Мы дали Claude те же 36 официальных письменных ответов CELPIP, на которых измеряется наш собственный оценщик, по двенадцать на каждом уровне, и попросили оценить их так, как попросил бы студент.

Короткий ответ: оценщик письма Prepamigo попадал в верифицированный уровень в 86% случаев. Claude Opus 5 попадал туда в 61% случаев, а Claude Sonnet 5 — в 56% случаев. Разрыв распределён неравномерно. На слабых и сильных эссе Claude выглядит достойно, а на верхнем уровне Opus 5 даже лучше нас. На эссе среднего уровня — тех самых 7 и 8, которые на самом деле пишет большинство кандидатов, — Opus 5 был прав один раз из четырёх, а Sonnet 5 — один раз из трёх. Prepamigo был прав на всех двенадцати.

Остальная часть статьи разбирает эти результаты уровень за уровнем, объясняет, почему универсальная модель теряет середину шкалы, смотрит, чего стоит обратная связь с каждой стороны, и сравнивает, сколько стоит серьёзно практиковать письмо с каждым из вариантов. Мы старались быть честными по отношению к Claude на всём протяжении, включая то единственное место, где он нас обошёл.

Простой тест: что реально получает студент

Восемьдесят шесть процентов против шестидесяти одного и пятидесяти шести. На 36 эссе это на девять верных оценок больше, чем у Opus 5, и на одиннадцать больше, чем у Sonnet 5. Иначе говоря, Prepamigo совершает на 64% меньше ошибок оценивания, чем Opus 5, и на 69% меньше, чем Sonnet 5, на тех же эссе.

Важно, что именно получал Claude, поэтому вот это. Каждой модели сообщали, что она — опытный экзаменатор CELPIP по письму, давали задание ровно в том виде, в каком его видел кандидат, включая обязательные пункты для задания с письмом и варианты для задания с опросом, и давали эссе. Её просили назвать одну оценку от 0 до 12. Это весь запрос. Это то, что вы набрали бы в окне чата, и это более честный тест, чем однострочное «оцени это», потому что модель хотя бы знает, чего требовало задание.

Оценщик Prepamigo получил то же задание и то же эссе. У него также было то, что у него всегда есть в production: реальные оценённые образцы эссе для этого задания на каждом уровне для сравнения и слой правил, который проверяет то, что экзаменатор проверяет в первую очередь: есть ли все обязательные пункты, действительно ли ответ на опрос занимает какую-то сторону, есть ли в письме приветствие и завершение и какова длина ответа.

Где открывается разрыв: уровень за уровнем

Общая цифра скрывает, где именно падают ошибки, а в письме они падают в одном месте. Вот те же результаты, разбитые по верифицированному уровню: слабые эссе с оценкой 4 или 5, средние эссе с оценкой 7 или 8 и сильные эссе с оценкой 10 и выше.

Слабые эссе (верифицированная оценка 4 или 5)

12 официальных эссе. Промахи Claude здесь — в основном оценка 3, на уровень ниже.

75%

Оценщик письма Prepamigo

67%

Claude Opus 5

50%

Claude Sonnet 5

На слабых эссе Prepamigo показывает 75%, Opus 5 — 67%, Sonnet 5 — 50%. Все три промаха Prepamigo ушли на одну ступень выше, к 6 или 7, на эссе, которые были короткими, но аккуратными. Промахи Claude идут в другую сторону: Sonnet 5 поставил 3 четырём из двенадцати слабых эссе, а Opus 5 — двум из них. Оценка 3 по этой шкале — это ответ, который едва затрагивает задание. Эти эссе его затрагивают; они просто скудные. Claude, не имея примера того, как выглядит 4, воспринимает скудное как провальное.

Средние эссе (верифицированная оценка 7 или 8)

12 официальных эссе. Это уровень, на котором находится большинство кандидатов, и уровень, на котором Claude проваливается.

100%

Оценщик письма Prepamigo

33%

Claude Sonnet 5

25%

Claude Opus 5

Середина — это вся суть истории. Prepamigo оценил все двенадцать эссе среднего уровня внутри диапазона от 7 до 8. Opus 5 угадал три из них; Sonnet 5 — четыре. Промахи Opus 5 почти все были вверх: он поставил 9 шести из двенадцати и 10 — одному. Sonnet 5 разошёлся в обе стороны: четыре эссе он опустил до 6, а четыре поднял до 9 или 10.

Подумайте, что это значит для кандидата, написавшего одно из этих эссе. 7 или 8 — самая частая реальная оценка на тесте, и именно она решает, достигли вы своей иммиграционной цели или нет. Спросите Opus 5 — и больше чем в половине случаев он скажет вам, что вы на уровне 9 или 10 и можете прекращать тренировки. Это не так. Спросите Sonnet 5 — и один раз из трёх он скажет, что вы скатились до 6. Это тоже не так. Ни один из этих ответов не помогает решить, что делать дальше.

Сильные эссе (верифицированная оценка 10 и выше)

12 официальных эссе. Единственный уровень, на котором Claude Opus 5 обходит Prepamigo.

92%

Claude Opus 5

83%

Оценщик письма Prepamigo

83%

Claude Sonnet 5

На верхнем уровне Opus 5 — лучший проверяющий в этом тесте: одиннадцать из двенадцати сильных эссе распознаны. Prepamigo и Sonnet 5 распознали по десять. Оба промаха Prepamigo были оценкой 9, на одну ступень ниже; промахи Sonnet 5 — 9 и 7. Мы сообщаем об этом, потому что это правда, и потому что это объясняет общую картину: Claude щедр. Он свободно раздаёт 9, 10 и 11, что оказывается верным на сильных эссе и неверным на всём остальном.

Если вы используете Claude для проверки письма и он ставит вам 9, считайте это оценкой среднего уровня, пока что-то другое её не подтвердит. В нашем тесте эссе, которому Opus 5 поставил 9, с большей вероятностью имело верифицированную оценку 7 или 8, чем 9 или 10.

Почему чат-бот теряет середину шкалы

Эссе среднего уровня CELPIP — это вполне конкретная вещь. Оно раскрывает задание, оно организовано, в нём мало ошибок, мешающих пониманию, и при этом оно шаблонно: причины заявлены, а не развиты, словарный запас безопасный, предложения все одной формы. Экзаменатор, видевший сотни таких, точно знает, где оно находится. Универсальная модель не видела сотен таких эссе, помеченных как 7. Она видит чистый, организованный, в основном правильный текст и тянется к высокому числу.

В этом вся разница. Оценщик Prepamigo не судит эссе по абстрактному представлению о хорошем письме. Он сравнивает его с реальными оценёнными эссе для того же задания: одно на слабом уровне, одно в середине, одно на верхнем, и все они — реальные ответы с реальными огрехами. Чистое, но шаблонное эссе оказывается рядом со средним образцом, потому что именно на него оно больше всего похоже. Скудное эссе оказывается рядом со слабым образцом, а не ниже него, потому что слабый образец тоже скудный, и всё же это 4.

Поверх сравнения работает слой правил, который занимается тем, что модель плохо умеет считать. Раскрыло ли письмо все три обязательных пункта или только два? Действительно ли ответ на опрос выбрал вариант или колебался между ними? Есть ли приветствие и завершение? В ответе 180 слов или 60? Пропущенный обязательный пункт удерживает оценку за выполнение задания на уровне 8 и ниже, каким бы хорошим ни был английский, потому что так устроен тест. У Claude при простом запросе нет такого нижнего или верхнего предела; он решает всё по впечатлению.

Мы проверили, исправит ли это рассказ Claude об уровнях. Сам по себе — нет. Если дать модели рубрику, возникает тот же сдвиг. Число сдвигают реальные оценённые образцы и слой правил — а это, по сути, другое название для создания оценщика.

Разрыв в рабочем процессе: что вам придётся принести с собой

Письмо — тот навык, где Claude проще всего использовать как проверяющего, и об этом стоит сказать честно. Вы вставляете эссе, получаете оценку за секунды, а если хотите, чтобы он объяснил себя, он объяснит, и подробно. Нет шага транскрипции, нет аудио, нет настройки. Для быстрого второго мнения это действительно удобно.

Чего вы не получаете — так это задания. У Claude нет банка заданий в стиле CELPIP с письмами и опросами, с правильными обязательными пунктами, вариантами и объёмом слов, поэтому вы либо пишете своё задание и надеетесь, что оно похоже на тест, либо тренируетесь на том, что удастся найти. Вы не получаете проверку обязательных пунктов, потому что Claude не знает, какие пункты перечислил бы настоящий тест. Вы не получаете образцовый ответ, переписанный из вашего собственного эссе в нужном объёме. И вы не получаете число, откалиброванное по реальным оценённым эссе, — именно поэтому середина шкалы идёт наперекосяк.

В Prepamigo вы открываете задание из банка, запускается таймер, вы пишете, и примерно через минуту после отправки у вас есть четыре оценки по аспектам, общая оценка, список всего, что вы упустили, исправления с цитатами из вашего собственного текста и переписанный образцовый ответ. Сороковое эссе за месяц стоит вам столько же усилий, сколько первое.

То же эссе — та же оценка

Оценка, которую нельзя воспроизвести, — это не измерение. Если одно и то же эссе сегодня получает 8, а завтра 10, вы ничего не узнали о своём письме. Поэтому после основного прогона мы оценили все 36 эссе ещё дважды в разные дни. Оценщик письма Prepamigo показал 86%, 89% и 86% в трёх прогонах, и те же двенадцать эссе среднего уровня каждый раз оказывались внутри диапазона.

Прогоны Claude тоже колебались, но форма его ошибок не менялась: в каждом прогоне большинство эссе среднего уровня возвращались от Opus 5 с оценкой 9, а слабые эссе продолжали собирать тройки от Sonnet 5. Эта стабильность — и есть полезный вывод. Проблема не в том, что Claude шумит. Проблема в том, что Claude уверенно и одинаково ошибочно откалиброван в одну и ту же сторону каждый раз, а это заметить труднее.

Обратная связь: хорошее объяснение неверного числа

Claude пишет отличные тексты обратной связи. Они ясные, терпеливые и конкретные, и если попросить его объяснить, почему эссе — это 9, он выдаст убедительный абзац. Беда в том, что абзац пишется, чтобы обосновать уже выбранное число, и когда число неверно, объяснение неверно вместе с ним. Эссе, которое на самом деле 7, хвалят за качества, которых у него нет, и кандидат уходит успокоенным.

Обратная связь Prepamigo работает с другого конца. Каждое исправление цитирует точные слова из вашего эссе, а всё, что проверяющий не может найти в вашем тексте, удаляется до того, как вы это увидите. Пропущенный обязательный пункт называется по имени. Каждый аспект получает один ограничивающий фактор либо прямое утверждение, что его ничто не сдерживает. И вы получаете образцовый ответ, переписанный из вашего собственного ответа в том объёме, который требует задание, — чтобы увидеть разрыв, а не читать о нём. Раздел ниже перечисляет, что изменилось в слое обратной связи.

Что нового в обратной связи по письму

Оценка — лишь половина того, что вы получаете в ответ. Слой обратной связи по письму был переработан вместе с оценщиком, и всё в нём привязано к вашему собственному тексту. Вот что изменилось.

  • Исправления, которые можно найти в вашем эссе. Каждое исправление грамматики, орфографии и словарного запаса цитирует точные слова из вашего ответа, чтобы приложение могло подсветить их там, где вы их написали. Всё, что проверяющий не может найти в вашем эссе слово в слово, удаляется до того, как вы это увидите.
  • Образцовый ответ, построенный из вашего ответа. Вы получаете переписанную версию вашего собственного ответа, которая сохраняет ваши идеи, раскрывает каждый обязательный пункт и укладывается в 150–200 слов, требуемых заданием. Если первая переработка не попадает в этот объём, она выполняется заново один раз, прежде чем показать её вам.
  • Пропущенный обязательный пункт, названный по имени. Для задания с письмом обратная связь перечисляет пункты из условия, которые ваш ответ не раскрыл. Пропущенный пункт также ограничивает оценку за выполнение задания до 8 и ниже, поэтому число и обратная связь никогда не противоречат друг другу.
  • Один ограничивающий фактор на каждый аспект. Для каждого из четырёх аспектов обратная связь называет конкретно то единственное, что сдерживает эту оценку, либо прямо говорит, что ничего не сдерживает, и что именно её вытягивает. Вывод о том, что у аспекта нет проблем, — это полноценный ответ, а не пробел.
  • Критика на своём месте. Слабый тон — это проблема выполнения задания, размытый выбор слова — проблема словарного запаса, слишком длинное слитное предложение — проблема читаемости. Каждое замечание относится к тому аспекту, к которому оно принадлежит, а не сваливается в общий итог.
  • Переработка на уровне предложений. Конкретные предложения из вашего эссе возвращаются с улучшенной версией и одной строкой о том, почему она лучше, — чтобы вы увидели изменение, а не читали о нём.
  • Ваш самый сильный и самый слабый аспект рядом. Обратная связь показывает, какой из четырёх аспектов вытягивает вашу оценку, а какой её сдерживает, — чтобы вы знали, что тренировать дальше, не расшифровывая четыре числа.

Каждая цитата в обратной связи сверяется с вашим эссе перед показом. Если проверяющий не может найти эти слова, строка удаляется. Именно поэтому обратная связь никогда не просит вас исправить то, чего вы не писали.

Сколько стоит практиковаться каждый день

Оценка письма наиболее полезна на вашем тридцатом эссе, а не на третьем. Именно тогда она начинает показывать, работает ли изменение в том, как вы пишете. Поэтому практический вопрос в том, сколько стоит использовать каждый вариант в больших объёмах.

Claude Pro стоит US$20 в месяц, около CA$28, или US$17 в месяц при годовой оплате, как опубликовано на claude.com в сентябре 2026 года, со скользящим пятичасовым окном использования и недельным лимитом. Тарифы Max, от US$100 в месяц, около CA$138 без налога, повышают эти лимиты, но не убирают их. Ни один из тарифов не включает банк заданий, таймер, проверку обязательных пунктов, образцовый ответ или оценку, откалиброванную по реальным оценённым эссе.

Prepamigo стоит CA$24.98 в месяц, или CA$8.25 в месяц по годовому тарифу — это CA$98.98 в год, с учётом налога, и отменить можно в любой момент. Каждый тариф включает безлимитное оценивание без дневного, сессионного или недельного лимита, безлимитные попытки и полный банк вопросов: 80 полных практических наборов и более 2 000 практических заданий по Writing, Speaking, Reading и Listening, написанных в соответствии с типами заданий, таймингом и форматом теста CELPIP General.

Когда Claude — лучший инструмент

  • Шлифовка сильного эссе. Если вы уже на уровне 10 и хотите понять, что потребуется для 11 или 12, Opus 5 надёжно распознаёт сильное письмо и хорошо объясняет. Это тот единственный уровень, где он нас обошёл.
  • Переписать предложение пятью способами. Попросить варианты для неуклюжего предложения — быстро, и предложения обычно хороши.
  • Обсудить вслух. Если вы хотите поспорить о том, почему аргумент слабый, разговор — подходящий формат. Prepamigo даёт вердикт и доказательства; он не ведёт беседу.
  • Всё, что вне теста. Claude — универсальный помощник, а Prepamigo — нет.

Чем Claude, судя по этим данным, быть не должен — так это тем, что говорит пишущему на уровне 7 или 8, где он находится. Это большинство кандидатов, и это ровно то место, где Claude ошибается три раза из четырёх.

Часто задаваемые вопросы

Может ли Claude оценивать моё письмо CELPIP? Он выдаст вам число. На 36 официальных ответах с верифицированными оценками Claude Opus 5 был прав в 61% случаев, а Claude Sonnet 5 — в 56%, против 86% у Prepamigo. На эссе среднего уровня: 25% и 33% против 100%.

Точнее ли Prepamigo, чем Claude, в оценке письма? В целом да, на 25–30 пунктов. На сильных эссе Opus 5 лучше: 92% против 83%. На эссе среднего уровня, где находится большинство кандидатов, разрыв — 100% против 25%.

Почему Claude ставит моему среднему эссе 9? Не имея ничего для сравнения, модель воспринимает чистое, организованное, шаблонное эссе как сильное. Opus 5 поставил 9 или 10 семи из двенадцати эссе с верифицированной оценкой от 7 до 8. Prepamigo сравнивает каждое эссе с реальными оценёнными образцами для того же задания.

Сколько стоит каждый вариант? Claude Max стоит от US$100 в месяц, около CA$138 без налога; Pro стоит US$20 с более жёсткими лимитами. Prepamigo стоит CA$24.98 в месяц с учётом налога, или CA$8.25 в месяц по годовому тарифу, с безлимитным оцениванием и 80 практическими наборами.

То же сравнение с ChatGPT читайте здесь: Prepamigo против ChatGPT для письма. О том, как работает оценщик письма, читайте внутри оценщика письма Prepamigo. Или Написать ответ и посмотрите на оценку. Читайте эту статью на английском: Читать это руководство на английском.

Prepamigo против Claude для CELPIP Writing: кто даёт правильную оценку? | PrepAmigo