Доля эссе, оценённых на верифицированном уровне
36 официальных письменных ответов CELPIP, по 12 на каждый из трёх уровней, по обоим письменным заданиям. Каждая модель GPT получала задание и эссе, и её простыми словами просили оценить его по шкале CELPIP. Оценщик письма Prepamigo работал в своей обычной production-конфигурации.
86%
Оценщик письма Prepamigo
78%
GPT 5.6 sol
69%
GPT 5.6 luna
58%
GPT-4o mini
Prepamigo против лучших тарифов чат-ботов
Цены в канадских долларах. Тарифы Prepamigo указаны с учётом налога. Claude Max (от US$100) и ChatGPT Pro (US$200) пересчитаны по курсу 1.38, без учёта налога. Точность — доля из 36 официальных эссе, получивших верифицированную оценку, когда указанной модели просто, без специальных инструкций, предлагали оценить эссе; один прогон.
ChatGPT — вероятно, самый распространённый инструмент, которым кандидаты CELPIP проверяют своё письмо. Вставил письмо, попросил оценку, получил число и абзац. Это быстро, это у вас в телефоне, и для письма на пути не стоит шаг транскрипции. Поэтому мы проверили это число. Мы дали трём моделям GPT те же 36 официальных письменных ответов CELPIP, на которых измеряется наш собственный оценщик, по двенадцать на каждом уровне, и попросили оценить эссе так, как попросил бы студент.
Короткий ответ: оценщик письма Prepamigo попадал в верифицированный уровень в 86% случаев. GPT 5.6 sol, модель, стоящая за платными тарифами ChatGPT, попадала туда в 78% случаев. GPT 5.6 luna справилась в 69%, а GPT-4o mini — в 58%. Восемь пунктов — это реальный разрыв, и складывается он из двух мест: середины шкалы, где Prepamigo оценил все двенадцать эссе верно, а GPT 5.6 sol — девять, и верхнего уровня, где GPT 5.6 sol придержала четверть сильных эссе на оценке 9.
Сразу скажем, что GPT 5.6 sol — лучший универсальный проверяющий письма из всех, что мы тестировали, заметно опережающий любую модель Claude на тех же эссе. Остальная часть статьи разбирает результаты уровень за уровнем, объясняет, откуда берутся эти восемь пунктов, смотрит на обратную связь с каждой стороны и сравнивает, сколько стоит серьёзно практиковать письмо с каждым из вариантов.
Простой тест: что реально получает студент
Восемьдесят шесть процентов против семидесяти восьми. На 36 эссе это на три верные оценки больше у Prepamigo, чем у GPT 5.6 sol, на шесть больше, чем у GPT 5.6 luna, и на десять больше, чем у GPT-4o mini. Иначе говоря, Prepamigo совершает на 37% меньше ошибок оценивания, чем GPT 5.6 sol, на 55% меньше, чем luna, и на 67% меньше, чем GPT-4o mini.
Важно, что именно получали модели GPT. Каждой сообщали, что она — опытный экзаменатор CELPIP по письму, давали задание ровно в том виде, в каком его видел кандидат, включая обязательные пункты для задания с письмом и варианты для задания с опросом, и давали эссе. Её просили назвать одну оценку от 0 до 12. Это то, что вы набрали бы в ChatGPT, и это более честный тест, чем голое «оцени это», потому что модель хотя бы знает, чего требовало задание.
Оценщик Prepamigo получил то же задание и то же эссе, плюс то, что у него всегда есть в production: реальные оценённые образцы эссе для этого задания на каждом уровне для сравнения и слой правил, который проверяет то, что экзаменатор проверяет в первую очередь: раскрыт ли каждый обязательный пункт, действительно ли ответ на опрос занимает какую-то сторону, есть ли в письме приветствие и завершение и хоть сколько-нибудь близка ли длина ответа к той, что требует задание.
Откуда берутся восемь пунктов: уровень за уровнем
Слабые эссе (верифицированная оценка 4 или 5)
12 официальных эссе. Единственный уровень, на котором модели GPT немного впереди.
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
Оценщик письма Prepamigo
На слабых эссе все три модели GPT показывают 83%, а Prepamigo — 75%. Это единственный уровень, где ChatGPT впереди, и мы так об этом и сообщаем. Все три промаха Prepamigo ушли на одну ступень выше, к 6 или 7, на эссе, которые были короткими, но аккуратными. Оба промаха GPT 5.6 sol были оценкой 6. Слабые эссе — лёгкий край шкалы для чат-бота: короткий, шаблонный текст с ошибками выглядит слабым для кого угодно.
Средние эссе (верифицированная оценка 7 или 8)
12 официальных эссе. Уровень, на котором находится большинство кандидатов.
100%
Оценщик письма Prepamigo
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
В середине Prepamigo оценил все двенадцать эссе внутри диапазона от 7 до 8. GPT 5.6 sol угадала девять; все три её промаха были оценкой 6, на одну ступень ниже. GPT 5.6 luna угадала семь: три эссе она опустила до 6, одно до 5 и одно подняла до 9. GPT-4o mini угадала восемь, а остальные четыре подняла до 9.
7 или 8 — самая частая реальная оценка на тесте, и именно она решает, достиг ли кандидат своей цели. GPT 5.6 sol скажет одному такому кандидату из четырёх, что он скатился до 6. Luna скажет это четырём из десяти. Ни то ни другое не катастрофа в том смысле, в каком ею являются результаты Claude в среднем диапазоне, но это разница между практической оценкой, на которую можно опираться в планах, и той, которую приходится перепроверять.
Сильные эссе (верифицированная оценка 10 и выше)
12 официальных эссе. Промахи здесь — оценка 9: эссе было сильным, а проверяющий придержал.
83%
Оценщик письма Prepamigo
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
На верхнем уровне Prepamigo распознал десять из двенадцати сильных эссе, GPT 5.6 sol — девять, luna — восемь, а GPT-4o mini — три. Каждый промах, кроме одного, был оценкой 9. GPT-4o mini поставила 9 девяти из двенадцати сильных эссе: она попросту не ставит 10. Если ваше письмо сильное и вы проверяете его в бесплатной версии ChatGPT, которая по-прежнему направляет много трафика на маленькие модели, вам почти каждый раз скажут, что вы на уровне 9.
Почему чат-бот сбивается в середине и на верхнем уровне
Эссе среднего уровня CELPIP раскрывает задание, организовано и при этом шаблонно: причины заявлены, а не развиты, словарный запас безопасный, предложения одной формы. Сильное эссе не безупречно; в нём есть одна-две огрехи и простое предложение среди развитых. Модель, у которой нет оценённых примеров для сравнения, вынуждена решать по впечатлению. Впечатление GPT 5.6 sol немного строгое: шаблонная 7 читается как 6, сильная 10 с огрехом читается как 9. Luna ещё строже. GPT-4o mini считает 9 потолком.
Оценщик Prepamigo не судит эссе по абстрактному представлению о хорошем письме. Он сравнивает его с реальными оценёнными эссе для того же задания, по одному на каждом уровне, и все они — реальные ответы с реальными огрехами. Шаблонное, но полное эссе оказывается рядом со средним образцом, потому что на него оно и похоже. Сильное эссе с одним неуклюжим предложением оказывается рядом с сильным образцом, в котором такое тоже есть. Поверх этого сравнения работает слой правил для того, что модель плохо умеет считать: есть ли все обязательные пункты, выбрал ли ответ на опрос сторону, есть ли в письме приветствие и завершение и какова его длина. Пропущенный обязательный пункт удерживает выполнение задания на уровне 8 и ниже независимо от английского, потому что так устроен тест.
Разрыв в рабочем процессе: что вам придётся принести с собой
Для письма ChatGPT легко использовать как проверяющего, и мы не будем делать вид, что это не так. Вставил эссе, получил число, попросил объяснение. Ни записи, ни расшифровки. Для быстрого второго мнения по одному эссе это удобно и, с GPT 5.6 sol, довольно точно.
Чего вы не получаете — так это задания. ChatGPT может придумать задание в стиле CELPIP, если попросить, но он гадает насчёт обязательных пунктов, вариантов опроса и объёма слов, которые использует настоящий тест. Вы не получаете проверку обязательных пунктов, потому что он не знает, какие пункты перечислил бы настоящий тест. Вы не получаете образцовый ответ, переписанный из вашего собственного эссе в нужном объёме. И каждое вставленное эссе расходует ваш лимит сообщений.
В Prepamigo вы открываете задание из банка, запускается таймер, вы пишете, и примерно через минуту после отправки у вас есть четыре оценки по аспектам, общая оценка, список всего, что вы упустили, исправления с цитатами из вашего собственного текста и переписанный образцовый ответ. Сороковое эссе за месяц стоит вам столько же усилий, сколько первое.
То же эссе — та же оценка
После основного прогона мы оценили все 36 эссе ещё дважды в разные дни. Оценщик письма Prepamigo показал 86%, 89% и 86% в трёх прогонах, и те же двенадцать эссе среднего уровня каждый раз оказывались внутри диапазона. GPT 5.6 sol показала 78%, 83% и 81%: лучше во втором и третьем прогонах — и напоминание о том, что один ответ чат-бота несёт в себе несколько пунктов удачи в ту или другую сторону. Если вы всё же проверяете с ChatGPT, спросите дважды и оставьте более низкий ответ.
Обратная связь: объяснение против доказательств
ChatGPT хорошо объясняет. Спросите, почему эссе — это 6, и он расскажет вам ясным английским, с предложениями. Подвох в том, что объяснение пишется, чтобы обосновать уже выбранное число, поэтому когда число на ступень занижено, объяснение находит подходящие недостатки. Кандидат, который на самом деле был на уровне 7, читает страницу о слабостях, которые не были решающими.
Обратная связь Prepamigo работает от текста вверх. Каждое исправление цитирует точные слова из вашего эссе, а всё, что проверяющий не может найти в вашем тексте, удаляется до того, как вы это увидите. Пропущенный обязательный пункт называется по имени. Каждый аспект получает один ограничивающий фактор либо прямое утверждение, что его ничто не сдерживает. И вы получаете образцовый ответ, переписанный из вашего собственного ответа в том объёме, который требует задание. Раздел ниже перечисляет, что изменилось.
Что нового в обратной связи по письму
Оценка — лишь половина того, что вы получаете в ответ. Слой обратной связи по письму был переработан вместе с оценщиком, и всё в нём привязано к вашему собственному тексту. Вот что изменилось.
- Исправления, которые можно найти в вашем эссе. Каждое исправление грамматики, орфографии и словарного запаса цитирует точные слова из вашего ответа, чтобы приложение могло подсветить их там, где вы их написали. Всё, что проверяющий не может найти в вашем эссе слово в слово, удаляется до того, как вы это увидите.
- Образцовый ответ, построенный из вашего ответа. Вы получаете переписанную версию вашего собственного ответа, которая сохраняет ваши идеи, раскрывает каждый обязательный пункт и укладывается в 150–200 слов, требуемых заданием. Если первая переработка не попадает в этот объём, она выполняется заново один раз, прежде чем показать её вам.
- Пропущенный обязательный пункт, названный по имени. Для задания с письмом обратная связь перечисляет пункты из условия, которые ваш ответ не раскрыл. Пропущенный пункт также ограничивает оценку за выполнение задания до 8 и ниже, поэтому число и обратная связь никогда не противоречат друг другу.
- Один ограничивающий фактор на каждый аспект. Для каждого из четырёх аспектов обратная связь называет конкретно то единственное, что сдерживает эту оценку, либо прямо говорит, что ничего не сдерживает, и что именно её вытягивает. Вывод о том, что у аспекта нет проблем, — это полноценный ответ, а не пробел.
- Критика на своём месте. Слабый тон — это проблема выполнения задания, размытый выбор слова — проблема словарного запаса, слишком длинное слитное предложение — проблема читаемости. Каждое замечание относится к тому аспекту, к которому оно принадлежит, а не сваливается в общий итог.
- Переработка на уровне предложений. Конкретные предложения из вашего эссе возвращаются с улучшенной версией и одной строкой о том, почему она лучше, — чтобы вы увидели изменение, а не читали о нём.
- Ваш самый сильный и самый слабый аспект рядом. Обратная связь показывает, какой из четырёх аспектов вытягивает вашу оценку, а какой её сдерживает, — чтобы вы знали, что тренировать дальше, не расшифровывая четыре числа.
Каждая цитата в обратной связи сверяется с вашим эссе перед показом. Если проверяющий не может найти эти слова, строка удаляется. Именно поэтому обратная связь никогда не просит вас исправить то, чего вы не писали.
Сколько стоит практиковаться каждый день
ChatGPT Plus стоит US$20 в месяц, около CA$28, с помесячной оплатой, как опубликовано в сентябре 2026 года, с лимитом сообщений на скользящее окно; ChatGPT Pro, за US$200 в месяц, около CA$276 без налога, повышает этот лимит. Бесплатная версия направляет большую часть трафика на модели поменьше, и в этом тесте самая маленькая из них распознала три сильных эссе из двенадцати. Ни один из тарифов не включает банк заданий, таймер, проверку обязательных пунктов, образцовый ответ или оценку, откалиброванную по реальным оценённым эссе.
Prepamigo стоит CA$24.98 в месяц, или CA$8.25 в месяц по годовому тарифу — это CA$98.98 в год, с учётом налога, и отменить можно в любой момент. Каждый тариф включает безлимитное оценивание без дневного, сессионного или недельного лимита, безлимитные попытки и полный банк вопросов: 80 полных практических наборов и более 2 000 практических заданий по Writing, Speaking, Reading и Listening, написанных в соответствии с типами заданий, таймингом и форматом теста CELPIP General.
Когда ChatGPT — лучший инструмент
- Быстрое второе мнение по одному эссе. GPT 5.6 sol — приличный проверяющий, и это занимает десять секунд. Если задание у вас уже есть и вы просто хотите ещё один взгляд, это вполне подходит.
- Переписать предложение пятью способами. Попросить варианты для неуклюжего предложения — быстро, и предложения обычно хороши.
- Обсудить вслух. Если вы хотите поспорить о том, почему аргумент слабый, разговор — подходящий формат. Prepamigo даёт вердикт и доказательства; он не ведёт беседу.
- Всё, что вне теста. ChatGPT — универсальный помощник, а Prepamigo — нет.
Чем он быть не должен — так это единственным, что говорит пишущему на уровне 7 или 8, где он находится, или тем, что говорит сильному автору, что он на уровне 9. Это два места, где он ошибается чаще всего.
Часто задаваемые вопросы
Может ли ChatGPT оценивать моё письмо CELPIP? Да, и лучше большинства чат-ботов: GPT 5.6 sol была права в 78% случаев на 36 официальных ответах, luna — в 69%, GPT-4o mini — в 58%, против 86% у Prepamigo.
Точнее ли Prepamigo, чем ChatGPT, в оценке письма? На восемь пунктов по сравнению с лучшей моделью GPT. Эссе среднего уровня — 100% против 75%; сильные эссе — 83% против 75%; слабые эссе — 75% против 83%.
Какую модель GPT мне использовать? GPT 5.6 sol. Не GPT-4o mini, которая поставила 9 девяти из двенадцати сильных эссе.
Сколько стоит каждый вариант? ChatGPT Pro стоит US$200 в месяц, около CA$276 без налога; Plus стоит US$20 с лимитом сообщений. Prepamigo стоит CA$24.98 в месяц с учётом налога, или CA$8.25 в месяц по годовому тарифу, с безлимитным оцениванием и 80 практическими наборами.
То же сравнение с Claude читайте здесь: Prepamigo против Claude для письма. О том, как работает оценщик письма, читайте внутри оценщика письма Prepamigo. Или Написать ответ и посмотрите на оценку. Читайте эту статью на английском: Читать это руководство на английском.
