Оценщик письма Prepamigo на 36 официальных эссе
Доля эссе, оценённых внутри верифицированного уровня, в целом и по уровням. Двенадцать эссе на уровень по обоим письменным заданиям; шесть образцовых эссе, которые оценщик использует для калибровки, исключены.
86%
В целом
75%
Слабые (4–5)
100%
Средние (7–8)
83%
Сильные (10+)
Prepamigo против лучших тарифов чат-ботов
Цены в канадских долларах. Тарифы Prepamigo указаны с учётом налога. Claude Max (от US$100) и ChatGPT Pro (US$200) пересчитаны по курсу 1.38, без учёта налога. Точность — доля из 36 официальных эссе, получивших верифицированную оценку, когда указанной модели просто, без специальных инструкций, предлагали оценить эссе; один прогон.
Это правильный вопрос к любому инструменту для практики, и большинство инструментов на него не отвечают. Оценка за письмо чего-то стоит, только если она говорит вам то, что сказал бы настоящий экзаменатор, и единственный способ узнать, так ли это, — измерить. Так что эта статья и есть измерение, изложенное прямо, с теми частями, которые нам льстят, и теми, которые нет.
Ответ в одном абзаце: на 36 официальных письменных ответах CELPIP, каждый с независимо верифицированной оценкой, оценщик письма Prepamigo попадал в верифицированный уровень в 86% случаев. Он верно оценил каждое эссе среднего уровня, 75% слабых эссе и 83% сильных. Он выдал тот же результат, плюс-минус одно эссе, в трёх отдельных прогонах. При простом запросе на оценку тех же эссе лучшая передовая модель, GPT 5.6 sol, достигла 78%; модели Claude достигли 61% и 56%.
Дальше — что означают цифры на каждом уровне, где случаются ошибки и в каком направлении, насколько стабильна оценка, как она сравнивается с чат-ботами, которыми вы, возможно, пользуетесь вместо неё, что нового в обратной связи и как читать собственную оценку в свете всего этого.
Что здесь означает «точно»
Мы не утверждаем, что оценка Prepamigo предсказывает ваш результат на тесте. Ни один инструмент для практики не может этого обещать. То, что мы измеряем, уже и честнее: если дано эссе, чья оценка была независимо верифицирована, как часто оценщик выдаёт оценку на том же уровне?
Письменная часть CELPIP оценивается по шкале до 12, и верифицированные оценки в наших эталонных данных приходят тремя диапазонами: слабый, то есть 4 или 5; средний, то есть 7 или 8; и сильный, то есть 10 и выше. Мы считаем оценщик правым, если его оценка попадает внутрь верифицированного диапазона. Сильное эссе, оценённое на 10, 11 или 12, — верно; оценённое на 9 — промах, пусть и почти попадание.
Точность на каждом уровне
Слабые эссе: 75%. Девять из двенадцати внутри диапазона. Все три промаха ушли на одну ступень выше: два эссе получили 6 и одно — 7. Каждое было коротким и тонким, но аккуратным, с немногими ошибками, и аккуратность купила ему балл, которого оно не заработало содержанием. Это характерная ошибка оценщика на нижнем краю, и она щедрая: слабому автору говорят, что он немного лучше, чем есть, и никогда — что хуже.
Средние эссе: 100%. Двенадцать из двенадцати внутри диапазона от 7 до 8, во всех трёх прогонах. Это уровень, на котором находится большинство кандидатов, и уровень, который решает большинство иммиграционных целей, и именно здесь оценщик сильнее всего. Здесь же слабее всего каждый чат-бот, который мы тестировали, по причинам, которые объясняет раздел сравнения.
Сильные эссе: 83%. Десять из двенадцати. Оба промаха были 9, на ступень ниже. Сильное эссе CELPIP не безупречно, и оценщик иногда засчитывает на одну оплошность больше, чем следует. Ни один промах не был 7 или 8; сильному эссе никогда не говорят, что оно среднее.
По заданиям оценщик был прав на 89% писем и 83% ответов на опрос. Ответы на опрос труднее расположить, потому что задание вознаграждает чёткую позицию и развёрнутые причины, а ответ, колеблющийся между вариантами, наказывается по правилу.
В какую сторону уходят ошибки
Оценщик, ошибающийся в 14% случаев, может ошибаться безобидно или вредно. Вредно — сказать кандидату, которому нужна 8, что она у него есть, когда её нет. Безобидно — сказать ему, что он на балл ниже, когда это не так; это стоит недели практики и ничего больше.
Из пяти промахов оценщика на 36 эссе три были слабыми эссе, оценёнными на 6 или 7, и два — сильными эссе, оценёнными на 9. Ни одно эссе среднего уровня не было оценено высоко, и ни одно слабое эссе не было оценено как сильное. На практике: если оценщик говорит, что вы достигли среднего уровня, вы его достигли или вам не хватает одного балла. Если он говорит, что вы достигли сильного уровня, вы его достигли. Единственное место, где он льстит, — внизу, где короткое аккуратное эссе может получить балл, которого не заработало.
Сравните это с чат-ботами на тех же эссе. Claude Opus 5 назвал семь эссе среднего уровня 9 или 10 — вредное направление для тех кандидатов, кого это касается больше всего. GPT 5.6 sol назвал три эссе среднего уровня 6 — безобидное направление — и удержал три сильных эссе на 9. Показатель точности оценщика говорит, как часто он ошибается; направление говорит, чего это вам стоит, когда он ошибается.
Письмо против опроса
36 эссе были разделены между двумя письменными заданиями, и оценщик справился чуть лучше с заданием с письмом, на 89%, чем с ответом на опрос, на 83%. Это один дополнительный промах на стороне опроса, и он в том направлении, которого можно было ожидать.
Письма оцениваются в основном по охвату: раскрыты ли обязательные пункты, подходит ли тон адресату, есть ли приветствие и завершение. Это то, что оценщик проверяет по правилу до вынесения любого суждения, поэтому письмо, в котором это есть, располагается надёжно. Ответы на опрос оцениваются по качеству аргументации: чёткая позиция и причины, которые развиты, а не перечислены. Развитие — это суждение, а суждение — то место, где у оценщика, человека или машины, есть простор разойтись на балл.
Для вас это означает, что оценка за опрос совсем чуть-чуть мягче, чем оценка за письмо. Если вы балансируете на границе своей цели в ответах на опрос, напишите два, а не один, прежде чем решать, где вы находитесь.
С вашей стороны экрана
Взгляд по уровням показывает, как оценщик справляется с эссе известного уровня. Вы смотрите на это с другой стороны: у вас есть оценка, и вы хотите знать, насколько ей верить.
- Если он говорит 4 или 5: эссе было на слабом уровне девять раз из девяти. Низкая оценка от оценщика верна.
- Если он говорит 7 или 8: эссе было на среднем уровне двенадцать раз из пятнадцати; остальные три были слабыми эссе, оценёнными на ступень выше. 7 или 8 означает средний уровень и, возможно, чуть ниже.
- Если он говорит 10 и выше: эссе было на сильном уровне десять раз из десяти. 10 от оценщика — это 10.
- Если он говорит 9: обе девятки в тесте были верифицированными сильными эссе. 9 — оценка, которую нужно читать внимательно: она означает близость к вершине и нехватку одной развёрнутой причины или одного точного слова.
Получает ли одно и то же эссе одну и ту же оценку?
Точность без стабильности — везение. Поэтому мы оценили все 36 эссе три раза в разные дни, ничего не меняя между прогонами. Оценщик вернул 86%, 89% и 86%. Одни и те же двенадцать эссе среднего уровня каждый раз были внутри диапазона, и ни одно эссе не сдвигалось больше чем на один балл между прогонами.
Стабильность возникает из того, как запускается оценивающая модель: рассуждение отключено, температура фиксирована, и сравнение идёт с фиксированными оценёнными образцами, а не по свободному суждению. Для вас это означает, что изменение в оценке — это изменение в вашем письме. Если вы переписываете эссе и оно сдвигается с 8 на 10, это не оценщику выпал удачный день.
Как это сравнивается с тем, чем вы могли бы пользоваться вместо этого
Показатель точности значит больше, когда есть с чем его сравнить. Поэтому мы дали те же 36 эссе чат-ботам, которыми люди на самом деле проверяют своё письмо, так, как это сделал бы человек: задание, эссе и простая просьба поставить оценку от 0 до 12.
Доля эссе, оценённых внутри верифицированного уровня
Те же 36 официальных эссе. Каждую модель просили, простыми словами, оценить эссе; Prepamigo работал в своей обычной продакшен-конфигурации.
86%
Оценщик письма Prepamigo
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
Оценщик опережает лучшего чат-бота на восемь пунктов, а модели Claude — на 25–30. Важна форма ошибок. На эссе среднего уровня Prepamigo на 100%, GPT 5.6 sol на 75%, Gemini — 42%, Claude Sonnet 5 — 33% и Claude Opus 5 — 25%: чат-бот, которому не с чем сравнивать, читает аккуратную шаблонную семёрку как 9, а шаблонную семёрку с несколькими ошибками — как 6. На сильных эссе Claude Opus 5 на самом деле лучший оценщик в тесте с 92% против 83% у Prepamigo; он щедр, что верно наверху и неверно везде остальное. GPT-4o mini поставил 9 девяти из двенадцати сильных эссе.
Что есть у оценщика и чего нет у чат-ботов — это реальные оценённые эссе на то же задание на каждом уровне для сравнения и слой правил, который проверяет обязательные пункты, позицию в опросе, приветствие и завершение и объём до того, как какая-либо модель выскажет мнение. В этом разница между 86% и 78%, и почти вся она в середине шкалы.
Что нового в обратной связи по письму
Оценка — лишь половина того, что вы получаете в ответ. Слой обратной связи по письму был переработан вместе с оценщиком, и всё в нём привязано к вашему собственному тексту. Вот что изменилось.
- Исправления, которые можно найти в вашем эссе. Каждое исправление грамматики, орфографии и словарного запаса цитирует точные слова из вашего ответа, чтобы приложение могло подсветить их там, где вы их написали. Всё, что проверяющий не может найти в вашем эссе слово в слово, удаляется до того, как вы это увидите.
- Образцовый ответ, построенный из вашего ответа. Вы получаете переписанную версию вашего собственного ответа, которая сохраняет ваши идеи, раскрывает каждый обязательный пункт и укладывается в 150–200 слов, требуемых заданием. Если первая переработка не попадает в этот объём, она выполняется заново один раз, прежде чем показать её вам.
- Пропущенный обязательный пункт, названный по имени. Для задания с письмом обратная связь перечисляет пункты из условия, которые ваш ответ не раскрыл. Пропущенный пункт также ограничивает оценку за выполнение задания до 8 и ниже, поэтому число и обратная связь никогда не противоречат друг другу.
- Один ограничивающий фактор на каждый аспект. Для каждого из четырёх аспектов обратная связь называет конкретно то единственное, что сдерживает эту оценку, либо прямо говорит, что ничего не сдерживает, и что именно её вытягивает. Вывод о том, что у аспекта нет проблем, — это полноценный ответ, а не пробел.
- Критика на своём месте. Слабый тон — это проблема выполнения задания, размытый выбор слова — проблема словарного запаса, слишком длинное слитное предложение — проблема читаемости. Каждое замечание относится к тому аспекту, к которому оно принадлежит, а не сваливается в общий итог.
- Переработка на уровне предложений. Конкретные предложения из вашего эссе возвращаются с улучшенной версией и одной строкой о том, почему она лучше, — чтобы вы увидели изменение, а не читали о нём.
- Ваш самый сильный и самый слабый аспект рядом. Обратная связь показывает, какой из четырёх аспектов вытягивает вашу оценку, а какой её сдерживает, — чтобы вы знали, что тренировать дальше, не расшифровывая четыре числа.
Каждая цитата в обратной связи сверяется с вашим эссе перед показом. Если проверяющий не может найти эти слова, строка удаляется. Именно поэтому обратная связь никогда не просит вас исправить то, чего вы не писали.
Как читать свою оценку
- 4 или 5 — верно. Прочитайте исправления; они процитированы из вашего собственного текста. Затем прочитайте пропущенные пункты и образцовый ответ и напишите то же задание ещё раз.
- 7 или 8 — средний уровень, возможно, чуть ниже. Посмотрите на ограничивающий фактор по каждому аспекту. Тот, что называет конкретную проблему, — тот, над которым нужно работать.
- 9 — близко. Сравните своё эссе с образцовым ответом абзац за абзацем. Разрыв — обычно одна неразвитая причина или одно шаблонное слово.
- 10 и выше — это 10. Вы готовы по этому типу задания. Переходите к тому, которого избегаете.
- Доверяйте изменениям больше, чем уровням. Поскольку оценка стабильна, изменение между попытками на одном и том же задании — это изменение в вашем письме.
Режим практики, который использует число
Смысл точной, стабильной оценки в том, что можно перестать сомневаться в ней и начать ею пользоваться. Вот режим, который мы предлагаем, построенный вокруг того, что, по цифрам на этой странице, оценка может и не может вам сказать.
- Напишите одно письмо и один ответ на опрос, без подготовки. Не смотрите сначала на образцовый ответ. Отправьте оба. Две оценки вместе — ваш стартовый уровень; если они отличаются больше чем на балл, то задание с более низкой оценкой — то, которое нужно практиковать.
- Прочитайте пропущенные пункты и ограничивающий фактор раньше исправлений.Исправления чинят предложения; пропущенные пункты и ограничивающие факторы чинят оценки. Один пропущенный обязательный пункт стоит больше, чем все запятые.
- Перепишите тот же ответ с открытым образцовым ответом. Сохраните свои идеи, позаимствуйте его структуру. Отправьте снова. Поскольку оценщик ставит одному и тому же эссе одну и ту же оценку, разница между двумя отправками — целиком ваша переработка.
- Переходите к новому заданию, когда переработка держится. Одна 10 на переработке — это ещё не уровень. Две 10 на двух разных заданиях — уровень.
- Читайте 9 как почти попадание, а 6 как настоящую 6. Оценщик не опускает средние эссе. Если он говорит 6, эссе тонкое, и ограничивающий фактор скажет, где именно.
Часто задаваемые вопросы
Насколько точна оценка письма от Prepamigo? 86% на точном уровне на 36 официальных эссе: 75% слабые, 100% средние, 83% сильные. Тот же результат, плюс-минус одно эссе, в трёх прогонах.
Совпадает ли она с моей реальной оценкой? Ни один инструмент для практики не может этого обещать. Мы измеряем то, как часто оценщик согласен с верифицированной оценкой на том же эссе.
Почему я получил 9 за сильное эссе? Это самый частый промах оценщика наверху: два из двенадцати сильных эссе получили 9. Перепишите с образцовым ответом рядом и оцените снова.
Лучше ли он, чем ChatGPT или Claude? 86% против 78% у GPT 5.6 sol и 61% и 56% у моделей Claude. На эссе среднего уровня — 100% против 75% у лучшей из них.
Чтобы узнать, как работает оценщик, читайте внутри оценщика письма Prepamigo. Чтобы увидеть тот же тест на всех шести чат-ботах, читайте какой AI точнее оценивает CELPIP writing. Или напишите ответ и увидите цифры сами. Читайте эту статью на английском: Читать это руководство на английском.
