Prepamigo Writing Scoring Engine в сравнении с передовыми моделями как оценщиками
Доля письменных ответов CELPIP, чья оценка совпала с независимо верифицированной оценкой. 36 официальных эссе, равномерно распределённых между слабым, средним и сильным уровнями и обоими письменными заданиями. Каждая модель получала задание и эссе, и её просили, простыми словами, оценить его по шкале CELPIP.
86%
Prepamigo Writing Scoring EnginePrepamigo
78%
GPT 5.6 solOpenAI
69%
GPT 5.6 lunaOpenAI
61%
GeminiGoogle
61%
Claude Opus 5Anthropic
58%
GPT-4o miniOpenAI
56%
Claude Sonnet 5Anthropic
Prepamigo против лучших тарифов чат-ботов
Цены в канадских долларах. Тарифы Prepamigo указаны с учётом налога. Claude Max (от US$100) и ChatGPT Pro (US$200) пересчитаны по курсу 1.38, без учёта налога. Точность — доля из 36 официальных эссе, получивших верифицированную оценку, когда указанной модели просто, без специальных инструкций, предлагали оценить эссе; один прогон.
Оценщик письма Prepamigo совпал с верифицированными оценками на 86% официальных эссе CELPIP — опережая все передовые модели, которым дали ту же задачу, — а на среднем уровне, где находится большинство кандидатов, он оценил верно каждое эссе.
Эта страница представляет Prepamigo Writing Scoring Engine — систему, которая оценивает каждое письмо и каждый ответ на опрос, написанные на Prepamigo. Это не универсальная модель, которую попросили поставить оценку. Это оценщик, созданный для одной задачи: поместить письменный ответ CELPIP на тот уровень, на который его поместил бы обученный экзаменатор, и объяснить это решение словами самого автора.
Результат — оценщик, который точнее любой передовой модели, используемой так, как её использовал бы студент. На 36 официальных письменных ответах CELPIP с независимо верифицированными оценками движок попадал в верный уровень в 86% случаев. При простом запросе на оценку тех же эссе GPT 5.6 sol достиг 78%. GPT 5.6 luna достиг 69%, Gemini и Claude Opus 5 — 61%, GPT-4o mini — 58%, а Claude Sonnet 5 — 56%.
Точность важнее всего там, где кандидаты находятся на самом деле. 7 или 8 — самая частая реальная оценка за письмо, и именно она решает, достигнута ли цель. Движок поместил все двенадцать эссе среднего уровня внутрь этого диапазона. Лучшая передовая модель поместила девять; Claude Opus 5 — три. Эта страница объясняет, как движок оценивает, как он выглядит в сравнении, что нового в обратной связи, которая сопровождает каждую оценку, и сколько стоит практиковаться, не считая попыток.
Точность относительно верифицированных оценок
Вопрос, который нас интересует, прост. Когда студент отправляет эссе, совпадает ли оценка на экране с той, которую поставил бы обученный экзаменатор? Чтобы ответить на него, мы использовали набор официальных письменных ответов CELPIP, каждый с независимо верифицированной оценкой, охватывающий оба письменных задания и разделённый поровну между слабым, средним и сильным уровнями: двенадцать эссе на уровень, 36 в общей сложности. Шесть образцовых эссе, которые движок использует для калибровки, в него не входят.
Каждая система видела одно и то же задание, включая обязательные пункты для задания с письмом и варианты для задания с опросом, и одно и то же эссе. Каждой передовой модели сообщали, что она опытный экзаменатор письменной части CELPIP, и просили одну оценку от 0 до 12. Движок работал так же, как в продакшене. Оценка считается верной, если она попадает внутрь верифицированного уровня: 4 или 5 для слабого эссе, 7 или 8 для среднего, от 10 до 12 для сильного.
37%
меньше ошибок, чем у GPT 5.6 sol
5 неверных оценок из 36 против 8.
64%
меньше ошибок, чем у Claude Opus 5
5 неверных оценок из 36 против 14.
100%
эссе среднего уровня оценены верно
Лучшая из других моделей: 75%. Claude Opus 5: 25%.
Выделяются три момента. Во-первых, отрыв от лучшей передовой модели составляет восемь пунктов, что на 36 эссе означает три дополнительные верные оценки, и он сохранялся при каждом повторном прогоне. Во-вторых, отрыв от моделей Claude составляет от 25 до 30 пунктов и сосредоточен в середине шкалы, где универсальная модель принимает аккуратное, но шаблонное эссе за сильное. В-третьих, это сравнение — то, что важно студенту: оно измеряет, что вы получаете, когда вставляете эссе в чат-бота и просите оценку, а именно так почти все используют эти модели.
| Система | Все эссе | Слабые | Средние | Сильные |
|---|---|---|---|---|
| Prepamigo Writing Scoring Engine | 86% | 75% | 100% | 83% |
| GPT 5.6 sol | 78% | 83% | 75% | 75% |
| GPT 5.6 luna | 69% | 83% | 58% | 67% |
| Gemini | 61% | 58% | 42% | 83% |
| Claude Opus 5 | 61% | 67% | 25% | 92% |
| GPT-4o mini | 58% | 83% | 67% | 25% |
| Claude Sonnet 5 | 56% | 50% | 33% | 83% |
Доля эссе, оценённых внутри верифицированного уровня, один прогон. Двенадцать эссе на уровень, так что одно эссе стоит около восьми пунктов на уровне и трёх пунктов в общем итоге.
Результаты на каждом уровне
Среднее скрывает, где именно случаются ошибки. В письме у универсальной модели они случаются в двух местах: в середине, где аккуратное, но шаблонное эссе принимается за сильное, и наверху, где сильное эссе с одной оплошностью придерживается на 9.
Слабые эссе · верифицированная оценка 4 или 5
12 официальных эссе на систему.
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
Prepamigo Writing Engine
67%
Claude Opus 5
58%
Gemini
50%
Claude Sonnet 5
Средние эссе · верифицированная оценка 7 или 8
12 официальных эссе на систему. Уровень, на котором находится большинство кандидатов.
100%
Prepamigo Writing Engine
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
42%
Gemini
33%
Claude Sonnet 5
25%
Claude Opus 5
Сильные эссе · верифицированная оценка 10 и выше
12 официальных эссе на систему. Почти каждый промах — оценка 9.
92%
Claude Opus 5
83%
Prepamigo Writing Engine
83%
Gemini
83%
Claude Sonnet 5
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
На слабых эссе модели GPT показывают 83%, а движок — 75%. Все три промаха движка ушли на одну ступень выше, к 6 или 7, на эссе, которые были короткими, но аккуратными; промахи моделей Claude ушли в другую сторону — тонкие эссе получали 3. Слабое письмо — лёгкий край шкалы для кого угодно, и это единственный уровень, где чат-бот может сравняться с движком или обойти его.
В середине движок в одиночестве на 100%. GPT 5.6 sol опустил три из двенадцати эссе до 6. Claude Opus 5 поднял семь из двенадцати до 9 или 10. Gemini поднял пять. Эссе среднего уровня раскрывает задание, организовано и при этом шаблонно; модель, которой не с чем сравнивать, читает его по впечатлению, а впечатление у каждой модели своё. Движок читает его на фоне реальной оценённой семёрки.
Наверху Claude Opus 5 — лучший оценщик в тесте: он распознал одиннадцать из двенадцати сильных эссе против десяти у движка. Claude щедр, что верно на сильных эссе и неверно на всех остальных. GPT-4o mini поставил 9 девяти из двенадцати: он не выдаёт 10.
Стабильность и постоянство
Оценщик, которому можно доверять, должен давать один и тот же ответ дважды. После основного прогона мы оценили все 36 эссе ещё дважды в разные дни. Движок показал 86%, 89% и 86%, при этом одни и те же двенадцать эссе среднего уровня каждый раз оставались внутри диапазона, и ни одно эссе не сдвигалось больше чем на один балл между прогонами. GPT 5.6 sol показал 78%, 83% и 81% в те же три дня.
Движок запускает оценивающую модель с отключённым рассуждением и при фиксированной температуре, и именно это делает число воспроизводимым. Единичный ответ чат-бота несёт в себе несколько баллов удачи в ту или другую сторону; оценка, стабильная изо дня в день, — это оценка, на которую можно опираться в планах.
Два задания, два вида ошибок
В письменной части CELPIP два задания, и проваливаются они по-разному. Задание с письмом даёт вам ситуацию и три или четыре пункта, которые нужно раскрыть. Задание с опросом даёт два варианта и просит выбрать один и отстоять его. Оценщик, который относится к ним одинаково, ошибётся в обоих.
На задании с письмом движок был прав на 89% эссе. Ошибки, которые обходятся кандидатам дороже всего здесь, — не грамматика; это пропущенный пункт, тон, не подходящий адресату, или отсутствующие приветствие и завершение. Слой правил проверяет каждое из этого до того, как экзаменатор выскажет мнение, и пропущенный пункт удерживает выполнение задания на 8 и ниже, каким бы отточенным ни был английский. Чат-бот, которого простыми словами попросили об оценке, не знает, какие пункты были обязательными, если вы их не вставили, и даже тогда он редко проверяет их по одному.
На задании с опросом движок был прав на 83% эссе. Задание с опросом вознаграждает чёткую позицию и две развёрнутые причины и наказывает ответ, который уклоняется. Движок сначала читает позицию: ответ, который так и не определяется, не может получить за выполнение задания выше середины. Чат-боты склонны вознаграждать сбалансированный ответ, что в ответе на опрос является ошибкой.
Смысл оценщика, понимающего задание, в том, что оценка отражает то, на что отреагировал бы экзаменатор в этом задании, а не общее впечатление от английского. Письмо среднего уровня обычно остаётся письмом среднего уровня из-за слабого третьего пункта; ответ на опрос среднего уровня обычно таков потому, что причина заявлена, но не развита. Движок говорит вам, что именно, по имени.
Где движок не лучший
Движок лидирует в общем зачёте и в середине. Он не лидер на обоих краях, и честнее сказать об этом, чем спрятать это в среднем.
На слабых эссе каждая из трёх моделей GPT набрала 83% против 75% у движка. Промахи движка все были на ступень выше, на коротких, аккуратных эссе, в которых ничего не развивалось. Модель GPT, которая читает шаблонное письмо как слабое, оценивает их верно. Если вы на слабом уровне и хотите лишь подтверждения этого, GPT 5.6 sol даст его вам чуть чаще. Он же, три раза из двенадцати, скажет автору среднего уровня, что тот на 6.
На сильных эссе Claude Opus 5 набрал 92% против 83% у движка. Claude читает отточенное письмо щедро, что на сильном эссе верно. Та же щедрость поставила семи из двенадцати эссе среднего уровня 9 или 10. Если вы уже пишете на сильном уровне, Claude Opus 5 подтвердит это чуть чаще, чем движок. Если нет — это модель, которая с наибольшей вероятностью скажет вам, что да.
Движок — единственный оценщик в тесте, который на каждом уровне находится в пределах десяти пунктов от лидера, и единственный со 100% в середине. Именно такой профиль нужен кандидату: оценщик, который не блестящ на одном уровне и не ошибается на другом, а прав почти везде и прав там, где находится большинство кандидатов.
Как движок оценивает ответ
Вот что происходит за ту примерно минуту между нажатием кнопки отправки и чтением оценки.
- Сначала эссе читает слой правил. Прежде чем его увидит какая-либо модель, движок считает слова, проверяет письмо на приветствие и завершение, проверяет ответ на опрос на чёткий выбор и сопоставляет эссе с обязательными пунктами в задании. Эти проверки становятся жёсткими ограничениями, которые экзаменатор не может обойти: ответ на опрос, который так и не выбирает сторону, или письмо, которое читается как ответ на опрос, не может получить за выполнение задания выше середины шкалы.
- Эссе сравнивается с реальными оценёнными образцами. Экзаменатор видит три реальных ответа CELPIP на такой же тип задания — один слабого уровня, один среднего, один высшего, все с их реальными оплошностями — и располагает эссе относительно них по каждому из четырёх аспектов: содержание и связность, словарный запас, читаемость, выполнение задания. Сопоставимо со средним образцом — это 7 или 8; сопоставимо с высшим образцом — 10 или 11; явно сильнее высшего образца — 12.
- Каждое суждение требует доказательств. По каждому аспекту экзаменатор должен процитировать фразы из эссе, подтверждающие оценку, прежде чем поставить её. Цитаты, которых нет в эссе, отбрасываются.
- Пропущенные пункты ограничивают оценку. Если экзаменатор сообщает, что обязательный пункт пропущен, оценка за выполнение задания удерживается на 8 и ниже, чтобы число и обратная связь согласовывались.
- Четыре аспекта становятся одной оценкой. Итоговая оценка — среднее четырёх, после применения ограничений слоя правил.
- Обратная связь строится на тех же доказательствах. Исправления, образцовый ответ нужного объёма, пропущенные пункты по имени и ограничивающий фактор по каждому аспекту — всё процитировано из текста самого автора. В разделе ниже перечислено, что изменилось.
Мы также протестировали перевод движка на дизайн с двумя оценщиками, голосованием и согласованием, который использует наш оценщик устной речи. Письму это не помогло: официальные уровни письма расположены на шкале от 0 до 12 ближе друг к другу, чем уровни устной речи, и принуждение экзаменатора выбирать между образцами без промежуточного варианта поднимало эссе среднего уровня до 9. Движок письма сохраняет тот дизайн, который верно оценивает середину.
Что нового в обратной связи по письму
Оценка — лишь половина того, что вы получаете в ответ. Слой обратной связи по письму был переработан вместе с оценщиком, и всё в нём привязано к вашему собственному тексту. Вот что изменилось.
- Исправления, которые можно найти в вашем эссе. Каждое исправление грамматики, орфографии и словарного запаса цитирует точные слова из вашего ответа, чтобы приложение могло подсветить их там, где вы их написали. Всё, что проверяющий не может найти в вашем эссе слово в слово, удаляется до того, как вы это увидите.
- Образцовый ответ, построенный из вашего ответа. Вы получаете переписанную версию вашего собственного ответа, которая сохраняет ваши идеи, раскрывает каждый обязательный пункт и укладывается в 150–200 слов, требуемых заданием. Если первая переработка не попадает в этот объём, она выполняется заново один раз, прежде чем показать её вам.
- Пропущенный обязательный пункт, названный по имени. Для задания с письмом обратная связь перечисляет пункты из условия, которые ваш ответ не раскрыл. Пропущенный пункт также ограничивает оценку за выполнение задания до 8 и ниже, поэтому число и обратная связь никогда не противоречат друг другу.
- Один ограничивающий фактор на каждый аспект. Для каждого из четырёх аспектов обратная связь называет конкретно то единственное, что сдерживает эту оценку, либо прямо говорит, что ничего не сдерживает, и что именно её вытягивает. Вывод о том, что у аспекта нет проблем, — это полноценный ответ, а не пробел.
- Критика на своём месте. Слабый тон — это проблема выполнения задания, размытый выбор слова — проблема словарного запаса, слишком длинное слитное предложение — проблема читаемости. Каждое замечание относится к тому аспекту, к которому оно принадлежит, а не сваливается в общий итог.
- Переработка на уровне предложений. Конкретные предложения из вашего эссе возвращаются с улучшенной версией и одной строкой о том, почему она лучше, — чтобы вы увидели изменение, а не читали о нём.
- Ваш самый сильный и самый слабый аспект рядом. Обратная связь показывает, какой из четырёх аспектов вытягивает вашу оценку, а какой её сдерживает, — чтобы вы знали, что тренировать дальше, не расшифровывая четыре числа.
Каждая цитата в обратной связи сверяется с вашим эссе перед показом. Если проверяющий не может найти эти слова, строка удаляется. Именно поэтому обратная связь никогда не просит вас исправить то, чего вы не писали.
Что делать с оценкой
Оценка, которой можно доверять, меняет то, как вы практикуетесь. С чат-ботом вы никогда не уверены, сдвиг с 8 на 9 — это вы или модель, поэтому каждую оценку приходится сверять с ощущением. Со стабильным, точным оценщиком оценка и есть обратная связь.
- Напишите одно и то же задание дважды. Отправьте, прочитайте пропущенные пункты и ограничивающий фактор по каждому аспекту, перепишите с образцовым ответом рядом и отправьте снова. Изменение на балл или больше между двумя попытками — это изменение в вашем письме, потому что движок ставит одному и тому же эссе одну и ту же оценку.
- Следите за самым слабым аспектом, а не за итогом. Итоговая оценка — среднее четырёх. У двух кандидатов с 8 могут быть совершенно разные проблемы. Обратная связь называет аспект, который вас сдерживает, и именно над ним нужно работать.
- Относитесь к 9 как к почти попаданию. Оба промаха движка на сильных эссе были девятками. 9 от движка означает, что до 10 не хватает одной развёрнутой причины или одного точного слова.
- Чередуйте задания. Большинство кандидатов практикуют то задание, которое им нравится. Движок оценивает письма и ответы на опрос по разным образцам и разным правилам, поэтому сильная оценка за письмо ничего не говорит о вашем ответе на опрос.
Безлимитная практика за CA$25 в месяц
Точность полезна только если её можно позволить себе использовать каждый день. Оценка за письмо, которой можно доверять, наиболее ценна на вашем тридцатом эссе, а не на третьем, потому что именно тогда она начинает показывать, работает ли изменение в том, как вы пишете. Поэтому цена на движок установлена так, чтобы его использовали без подсчёта.
Каждый тариф Prepamigo включает безлимитное оценивание, безлимитные попытки и полный банк вопросов: 80 полных практических наборов и более 2 000 практических заданий по Writing, Speaking, Reading и Listening, написанных в соответствии с типами заданий, таймингом и форматом теста CELPIP General. Вы пишете, отправляете, и примерно через минуту у вас есть оценка, исправления и образцовый ответ.
Prepamigo
CA$25/ месяц
CA$24.98 при помесячной оплате · CA$8.25 в месяц по годовому тарифу (CA$98.98 в год) · с учётом налога · отмена в любое время
- Безлимитное оценивание письма и устной речи, без дневного, сессионного или недельного лимита.
- 80 практических наборов и 2 000+ заданий по всем четырём разделам, созданных по формату реального теста, так что вам никогда не придётся писать собственные формулировки.
- Написал и отправил. Оценивание, исправления, проверка пропущенных пунктов и образцовый ответ берутся на себя.
- Обратная связь вашими словами, где каждая цитата сверена с тем, что вы действительно написали.
Claude Max, для сравнения
US$100/ месяц
около CA$138 без налога · тариф 20x за US$200 в месяц · Pro US$20 с гораздо более жёсткими лимитами
- Даже Max с лимитом. Скользящее пятичасовое окно использования и недельный лимит; при достижении любого из них нужно ждать.
- Нет банка вопросов. Вы приносите свои задания, сами решаете, похожи ли они на реальный тест, и сами следите за тем, что уже практиковали.
- Нет проверки обязательных пунктов, нет образцового ответа. Вы получаете число и абзац.
- Простой запрос, а не калиброванный оценщик. При простом запросе Claude Opus 5 совпадал с верифицированными оценками в 61% случаев, а Claude Sonnet 5 — в 56%, против 86% у движка.
Цены тарифов Claude и условия использования указаны так, как опубликовано на claude.com в сентябре 2026 года, и могут измениться. CELPIP — торговая марка своего владельца; Prepamigo — независимая платформа для практики и не связана с создателем теста, не одобрена и не аффилирована с ним. Практические задания Prepamigo — оригинальные материалы, написанные в соответствии с публичным форматом теста.
Доступность
Prepamigo Writing Scoring Engine уже доступен всем пользователям Prepamigo по обоим письменным заданиям. Ничего включать не нужно. Каждое письмо и каждый ответ на опрос оцениваются им, и каждая оценка сопровождается обратной связью, составленной на основе текста самого автора.
Для прямых сравнений читайте Prepamigo против Claude для письма и Prepamigo против ChatGPT для письма. Об устной части читайте Scoring Engine 2.0 для Speaking. Или напишите ответ и посмотрите, как работает движок. Читайте эту статью на английском: Читать это руководство на английском.
