Оценивание

Представляем Prepamigo Scoring Engine 2.0 для Speaking

6 сентября 2026 г.

Prepamigo Scoring Engine 2.0 в сравнении с передовыми моделями как оценщиками

Доля устных ответов, чья оценка совпала с независимо верифицированной оценкой. 48 ответов, которые системы никогда не видели, равномерно распределённых между низкими, средними и высокими оценками. Каждая модель получала расшифровку и её просили, простыми словами, оценить её по шкале CELPIP; среднее по трём прогонам.

81%

Prepamigo Scoring Engine 2.0Prepamigo

62%

Claude Opus 5Anthropic

58%

GeminiGoogle

45%

Claude Sonnet 5Anthropic

45%

GPT-4o miniOpenAI

37%

GPT 5.5OpenAI

35%

GPT 5.6 solOpenAI

31%

GPT 5.6 lunaOpenAI

Prepamigo против лучших тарифов чат-ботов

Цены в канадских долларах. Тарифы Prepamigo указаны с учётом налога. Claude Max (от US$100) и ChatGPT Pro (US$200) пересчитаны по курсу 1.38, без учёта налога. Точность — доля отложенных ответов, получивших верифицированную оценку, когда указанной модели просто, без специальных инструкций, предлагали оценить ответ; среднее по трём прогонам.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Цена в месяц
CA$24.98 (с налогом)
CA$138+ (без налога)
CA$276 (без налога)
Оценка ответов
Без лимита
С лимитом
С лимитом
Готовый банк вопросов
Есть
Нет
Нет
Практические наборы
80
Нет
Нет
Практических заданий
2,000+
Нет
Нет
Формат CELPIP
Есть
Нет
Нет
Точность
81%
62%
35%
Ответы высшего уровня
71%
50%
25%

Наш самый точный оценщик устной речи на сегодня. На ответах, которые он никогда не видел, Prepamigo Scoring Engine 2.0 совпал с верифицированными оценками в 81% случаев — опережая все передовые модели, которые мы протестировали на той же задаче, и заметно превосходя Engine 1.0, оценщик, который он заменяет.

Сегодня мы выпускаем Prepamigo Scoring Engine 2.0 для Speaking — систему, которая оценивает каждый устный практический ответ на Prepamigo. Engine 2.0 — это полный редизайн того, как мы оцениваем. Вместо одного прохода оценивания он использует два независимых оценщика, которые напрямую сравнивают каждый ответ с калиброванными примерами, голосуют несколько раз и согласуют свои ответы, прежде чем показать оценку.

Результат — оценщик, который намного точнее любой передовой модели, используемой так, как её использовал бы студент. На отложенном наборе реальных устных ответов с независимо верифицированными оценками Engine 2.0 попадал в верную оценку в 81% случаев. При простом запросе на оценку тех же расшифровок сильнейшая из моделей, Claude Opus 5, достигла 62%. Gemini достиг 58%. Claude Sonnet 5 и GPT-4o mini достигли 45%, GPT 5.5 — 37%, GPT 5.6 sol — 35%, а GPT 5.6 luna — 31%. Когда мы затем дали каждой модели собственную процедуру Engine 2.0 с реальными калибровочными примерами для каждого задания, лучшая из них поднялась до 77% и всё равно осталась позади.

Точность важнее всего именно там, где её труднее всего достичь. Engine 2.0 распознаёт ответ высшего уровня в 71% случаев. При простом запросе ни одна другая модель не распознала более 56%, а модели GPT распознали от 13% до 27%. Engine 2.0 также противостоит самой распространённой проблеме автоматизированных оценщиков: оценкам, которые смещаются вниз и к середине шкалы независимо от того, насколько силён или слаб ответ на самом деле. Это смещение было слабостью, которую мы чаще всего наблюдали у Engine 1.0.

Engine 2.0 быстрее, стабильнее и выдаёт обратную связь, цитирующую собственные слова студента. Он доступен уже сегодня для каждого пользователя Prepamigo. Эта страница объясняет, что он делает, как мы его измеряли и где всё ещё находятся его ограничения.

Точность относительно верифицированных оценок

Вопрос, который нас интересует, прост. Когда студент записывает ответ, совпадает ли оценка на экране с той, которую поставил бы надёжный оценщик? Чтобы ответить на него, мы собрали тестовый набор реальных устных ответов по всем восьми типам заданий speaking, каждый с независимо верифицированной оценкой, и разделили набор поровну между низкими, средними и высокими оценками, чтобы ни один уровень не доминировал в результате.

Сравнение использует 48 из этих ответов, отложенных с самого начала. Никто из команды не использовал их при создании или настройке Engine 2.0. Каждый ответ был расшифрован слово в слово. Затем каждой модели сообщали, что она опытный экзаменатор CELPIP, давали формулировку задания и расшифровку и просили оценить ответ по шкале от 0 до 12, три раза, в разные дни. Мы усреднили три прогона и посчитали, как часто оценка совпадала с уровнем верифицированной оценки.

51%

меньше ошибок, чем у Claude Opus 5

19 неверных оценок на 100 ответов против 38.

71%

меньше ошибок, чем у GPT 5.6 sol

19 неверных оценок на 100 против 65.

71%

ответов высшего уровня распознано

Лучшая из других моделей распознаёт 56%; GPT 5.6 sol распознаёт 25%.

В этих цифрах выделяются три момента. Во-первых, разрыв не мал. Девятнадцать пунктов против сильнейшей передовой модели и сорок шесть против модели, стоящей за платными тарифами ChatGPT, на тесте из 48 ответов — это разница между девятью и двадцатью двумя дополнительными верными оценками. Во-вторых, разрыв не является артефактом дружественного теста. 48 ответов были выбраны до того, как дизайн Engine 2.0 был окончательно утверждён, и их никогда не трогали во время разработки. В-третьих, это сравнение — то, что важно студенту: оно измеряет, что вы получаете, когда вставляете расшифровку в чат-бота и просите оценку, а именно так почти все используют эти модели.

Пару слов о том, что здесь означает «верно». Верифицированные оценки на этой шкале приходят уровнями, а не отдельными баллами, поэтому мы считаем оценку верной, если она попадает внутрь верифицированного уровня. Например, ответ, верифицированный на высшем уровне, оценён верно, если движок ставит ему 9, 10 или 11. При более строгом подходе, принимающем только 10 и выше, каждая система теряет несколько пунктов, а порядок в рейтинге не меняется.

СистемаПростой запросПри нашей полной процедуре
Prepamigo Scoring Engine 2.081.3%
Claude Opus 561.8%77.1%
Gemini58.3%70.8%
Claude Sonnet 545.1%68.8%
GPT-4o mini45.1%50.0%
GPT 5.536.8%68.8%
GPT 5.6 sol35.4%70.8%
GPT 5.6 luna30.6%62.5%

Результаты на каждом уровне оценки

Средняя цифра точности может скрывать очень многое. Оценщик, который прекрасно справляется со слабыми ответами и безнадёжен с сильными, может показать приемлемый результат, при этом подводя студентов, которым точный ответ нужен больше всего. Поэтому мы отдельно приводим точность для каждого из трёх уровней тестового набора: низкие оценки 4 или 5, средние оценки 7 или 8 и высокие оценки 10 и выше.

Большинство оценщиков — людей или машин — смещаются к середине. Сильный ответ получает 8 вместо 10. Слабый получает 6 вместо 5. Не имея ничего для сравнения, передовые модели добавляют вторую привычку: они смещаются вниз, так что слабый ответ часто получает 3, а сильный — 7. Engine 2.0 был создан специально для того, чтобы противостоять обоим смещениям, и результаты показывают это нагляднее всего на верхнем краю шкалы.

Низкие оценки · верифицированная оценка 4 или 5

16 отложенных ответов на систему, простой запрос, среднее по трём прогонам.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

Средние оценки · верифицированная оценка 7 или 8

16 отложенных ответов на систему, простой запрос, среднее по трём прогонам.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

Высокие оценки · верифицированная оценка 10 и выше

16 отложенных ответов на систему, простой запрос, среднее по трём прогонам. Почти каждый промах — оценка 7 или 8.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

Для тех, кто уже силён, это и есть определяющая разница. При простом запросе ни одна другая модель не распознаёт более 56% ответов высшего уровня; GPT 5.6 sol распознаёт один из четырёх, а GPT 5.6 luna — один из восьми. Engine 2.0 распознаёт 71%.

На низком уровне лидирует Engine 2.0 с 88%, Claude Opus 5 — с 77%, а GPT-4o mini — с 75%. Все остальные модели показывают около половины, а Claude Sonnet 5 — 44%. Промах почти всегда — оценка 3: модель видит слабый ответ и оценивает его ниже уровня, а не в нём. Приличная цифра GPT-4o mini здесь — первый признак его проблемы, которая в том, что он оценивает почти всё низко; на верхнем краю шкалы он распознаёт один ответ из шести.

На среднем уровне лидирует Engine 2.0 с 85%. Gemini и Claude Sonnet 5 показывают 63%, Claude Opus 5 — 58%, а затем обрыв: GPT-4o mini — 44%, а три более крупные модели GPT — от 27% до 29%. Ответы среднего уровня содержат смесь сильных и слабых сторон, которую нужно взвешивать, а не просто замечать, и, не имея ничего для сравнения, модели GPT замечают слабости и ставят 5 или 6.

На высшем уровне разрыв самый большой. Engine 2.0 верно определяет 71% ответов высшего уровня. Gemini определяет 56%, а Opus 5 — ровно половину. Пять из семи других моделей ставят 7 или 8 хотя бы семи из каждых десяти ответов, заслуживающих 10. Это чистейшая форма проблемы смещения к середине. Ответ высшего уровня не безупречен; в нём есть случайные оговорки, самоповтор, простое предложение среди сложных — и оценщик, измеряющий его относительно воображаемого идеального ответа, снимает баллы за каждый из них. Engine 2.0 калибруется по примерам, показывающим, как звучит реальный ответ высшего уровня, включая оговорки, и явно спроектирован сравнивать с этими примерами, а не с идеалом.

А что если дать им нашу полную процедуру?

Цифры простого запроса — не вердикт об уме этих моделей. Это вердикт о том, что происходит, когда модель просят назвать число, не давая ничего для сравнения. Поэтому мы провели второй тест, дав каждой модели именно то, что получают собственные оценщики Engine 2.0: расшифровку, задание, два реальных калибровочных примера на каждом уровне для этого конкретного задания и инструкцию назвать ближайший пример для каждого из четырёх измерений оценки, а не назвать число. Каждая модель также получила короткую калибровочную заметку, настроенную под её собственные особенности.

При нашей полной процедуре: доля ответов, оценённых на верифицированном уровне

Те же 48 отложенных ответов. Одни и те же расшифровки, инструкции и калибровочные примеры для каждой системы; каждая модель оценивала каждый ответ один раз.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

Каждая модель улучшается, некоторые — значительно. GPT 5.6 sol удваивает результат — с 35% до 71%. Opus 5 поднимается с 62% до 77%. GPT-4o mini почти не сдвигается — с 45% до 50%, потому что оценивает всё низко независимо от того, что ей показывают. И каждая модель всё равно заканчивает позади Engine 2.0. На верхнем краю шкалы разрыв сохраняется: Opus 5, GPT 5.6 sol, Gemini и GPT 5.5 останавливаются на 63% ответов высшего уровня, Sonnet 5 — на 38%, GPT-4o mini — на нуле, против 71% у Engine 2.0.

Этот второй тест показывает, где на самом деле находится ценность Engine 2.0. Это не более умная модель — он использует модели из этого же списка. Это реальные примеры того, как звучит каждый уровень на каждом конкретном задании, вопрос, заставляющий модель сравнивать, а не угадывать, и затем три дополнительные вещи, которые не может дать один проход: два независимых оценщика от разных провайдеров, три голоса от каждого с сохранением среднего голоса, и правило согласования, которое берёт более высокую оценку, когда два оценщика сильно расходятся, потому что анализ показал: на сильных ответах более низкий вердикт почти всегда был неверным.

Стабильность и постоянство

Оценщику, которому можно доверять, нужна стабильность. Если одна и та же запись может получить 8 сегодня и 10 завтра, ни одно из этих чисел не значит почти ничего, и студент не может понять, работает ли его практика. Поэтому наряду с точностью мы измеряем, даёт ли Engine 2.0 одинаковый ответ, когда его спрашивают об одном и том же дважды.

Мы запускали Engine 2.0 на 48 отложенных ответах три отдельных раза, в разные дни, ничего не меняя между запусками. Он показал 81,3% на каждом прогоне. Не приблизительно 81% — те же 39 верных ответов из 48 каждый раз, плюс-минус один. Если смотреть на отдельные ответы, а не на агрегированный показатель, 87,5% получили идентичную оценку во всех трёх прогонах, и лишь 4,2% когда-либо сдвигались на два балла или больше между прогонами. Это те немногие ответы, что находятся ровно на границе между двумя уровнями, где небольшое различие в суждении законно склоняет оценку в ту или другую сторону.

Тест с простым запросом на передовых моделях сдвигался между прогонами намного сильнее. GPT 5.6 sol набрал 31%, 40% и 35% в трёх прогонах; Opus 5 набрал 62%, 65% и 58%. Попросите чат-бота оценить одну и ту же расшифровку в два разных дня, и довольно часто вы получите две разные оценки.

Стабильность возникает из двух проектных решений. Каждый оценщик в Engine 2.0 голосует три раза по каждому ответу, и сохраняется средний голос, что убирает случайный выброс, который дал бы один проход. А вердикты двух оценщиков согласуются по фиксированному правилу, а не другой моделью, поэтому одна и та же пара вердиктов всегда даёт одну и ту же итоговую оценку. Оба решения были проверены напрямую: с одним голосом вместо трёх согласие между прогонами упало с 87,5% до 77,1%, а доля ответов, сдвигающихся на два балла или больше, увеличилась более чем вдвое.

Как Engine 2.0 оценивает ответ

Engine 2.0 — это не одна модель. Это процедура, и именно процедура определяет разницу. Вот что происходит за те примерно десять секунд между тем, как студент нажимает «стоп», и появлением оценки на экране.

  1. Запись расшифровывается слово в слово. Сохраняется каждое слово-паразит, каждый самоповтор, каждое самоисправление. Это оказалось критически важным. Когда мы протестировали «очищенную» расшифровку без пауз и хезитаций, точность упала на пятнадцать пунктов, потому что эти хезитации — часть доказательств, нужных оценщику, чтобы понять, как звучит ответ.
  2. Расшифровку читают два независимых оценщика. Они построены на разных базовых моделях от разных провайдеров, поэтому у них разные слепые зоны. Каждый оценщик получает формулировку задания, расшифровку и небольшой набор калибровочных примеров для этого конкретного задания: реальные ответы низкого, среднего и высокого уровня, по два на уровень, чтобы каждый уровень был показан как диапазон, а не одна точка.
  3. Каждый оценщик сравнивает, а не оценивает числом. Это центральное изменение по сравнению с Engine 1.0. Вместо того чтобы просить число, каждого оценщика для каждого из четырёх измерений ответа спрашивают, какому калибровочному примеру он больше всего напоминает. Варианта «где-то посередине» не существует. Необходимость выбрать ближайший пример — то, что останавливает смещение к середине. Затем оценка выводится из выбранного уровня по фиксированному правилу, а не моделью.
  4. Каждый оценщик голосует три раза. Средний голос по каждому измерению сохраняется. Это убирает случайный неудачный ответ без усреднения настоящего суждения.
  5. Два вердикта согласуются. Если оценщики согласны или отличаются на один балл, итоговая оценка — их среднее. Если они отличаются на два балла или больше, используется более высокая оценка. Это правило не про щедрость — это калибровка. Когда мы проанализировали каждый случай сильного разногласия между оценщиками, более низкий вердикт почти всегда оказывался неверным, потому что разногласие почти всегда возникало на ответе высшего уровня, к которому один из оценщиков был слишком осторожен.
  6. Применяются защитные механизмы. Короткий набор фиксированных правил обрабатывает случаи, о которых оценщику не нужно гадать: молчаливый ответ, ответ из нескольких слов, ответ на другом языке или полностью не относящийся к теме получает нижнюю пороговую оценку независимо от того, что вернули оценщики. При тестировании молчание получало 3, ответ из нескольких слов — 4, а ответ не по теме или не на английском — 5, без единого сбоя на всём наборе.

Стоит особо выделить два свойства итогового дизайна. Engine 2.0 оценивает только по расшифровке, поэтому после транскрипции ему не нужно аудио, и он не зависит от аудиомодели какого-либо одного провайдера. А поскольку два оценщика от разных провайдеров, если один недоступен, другой продолжает работу, а третья модель подстраховывает, чтобы оценка выдавалась всегда.

Что нового в обратной связи

Engine 2.0 включает полностью переработанный слой обратной связи. Он анализирует не только итоговую оценку, но и обоснования обоих экзаменаторов, и был проверен на трёх типах учащихся: тех, кто впервые сталкивается с CELPIP, тех, кто слабо знает английский и ищет «секрет», и тех, у кого есть всего полчаса в день и экзамен уже на следующей неделе. Вот что изменилось.

  • Ваши слова, процитированные вам. Каждый пункт обратной связи ссылается на точную фразу из расшифровки вашего ответа, на которую отреагировали экзаменаторы. Если фраза взята в кавычки, значит, она процитирована буквально: в нашей проверке это подтвердилось для 157 из 158 цитат. Обратная связь никогда не придумывает то, чего вы не говорили.
  • Что исправить первым. Для каждого ответа выделяется одно главное действие: изменение, которое сильнее всего повысит вашу оценку, сформулированное максимально простыми словами. За ним следуют ещё два конкретных шага, а затем — чек-лист из трёх пунктов, который нужно держать в голове перед началом ответа.
  • Советы, подходящие именно этому заданию. Совет, описание сцены и попытка кого-то убедить оцениваются по разным критериям. Теперь обратная связь учитывает, что именно вознаграждается в каждом из восьми типов заданий, и говорит об этом напрямую, а не повторяет одни и те же общие советы для всех заданий.
  • Какой аспект тренировать первым. Обратная связь показывает, какой из четырёх аспектов оценки у вас самый слабый, а какой самый сильный, — чтобы вы знали, где взять следующий балл, а не гадали, что скрывается за цифрой.
  • Что требовалось по заданию, но осталось без ответа. По критерию выполнения задания обратная связь перечисляет конкретные пункты задания, которые вы не раскрыли, либо прямо говорит, что вы раскрыли их все.
  • То, что можно по-настоящему отрепетировать. Каждая рекомендация — это то, что можно проговорить вслух перед следующей попыткой. Никаких советов «говорить чётче» или «уменьшить акцент»: акцент не входит в то, что измеряет восприимчивость речи, и обратная связь никогда не комментирует его.
  • Таймер не виноват. Если ответ обрывается по таймеру уже после того, как задание выполнено, за это обрывание баллы не снижаются, и обратная связь не упрекает вас за это.

Когда независимая модель-судья сравнила новую обратную связь с той, что выдавала наша прежняя система для тех же ответов, не зная, какая из них какая, она предпочла новую обратную связь в 20 из 24 сравнений — как при оценке с позиции экзаменатора, так и с позиции учащегося.

Безлимитная практика за CA$25 в месяц

Точность полезна только если её можно позволить себе использовать каждый день. Оценка устной речи, на которую можно опереться, наиболее ценна на вашем сороковом практическом ответе, а не на четвёртом, потому что именно тогда оценка начинает показывать, действительно ли работает изменение в том, как вы говорите. Поэтому мы установили цену на Engine 2.0 так, чтобы его использовали без подсчёта.

Каждый тариф Prepamigo включает безлимитное оценивание от Engine 2.0, безлимитные попытки и полный банк вопросов: 80 полных практических наборов и более 2 000 практических заданий по Speaking, Writing, Reading и Listening, написанных в соответствии с типами заданий, таймингом и форматом теста CELPIP General. Вы нажимаете запись, получаете оценку и обратную связь на основе доказательств примерно через десять секунд и можете повторять это сколько угодно раз.

Prepamigo

CA$25/ месяц

CA$24.98 при помесячной оплате · CA$8.25 в месяц по годовому тарифу (CA$98.98 в год) · с учётом налога · отмена в любое время

  • Безлимитное оценивание от Scoring Engine 2.0, без дневного, сессионного или недельного лимита.
  • 80 практических наборов и 2 000+ заданий по всем четырём разделам, созданных по формату реального теста, так что вам никогда не придётся писать собственные формулировки.
  • Записал и готово. Транскрипция, оценивание и обратная связь берутся на себя; ничего не нужно вставлять и ничего формулировать.
  • Обратная связь вашими словами, где каждую цитату можно проверить по тому, что вы действительно сказали.

Claude Max, для сравнения

US$100/ месяц

около CA$138 без налога · тариф 20x за US$200 в месяц · Pro US$20 с гораздо более жёсткими лимитами

  • Даже Max с лимитом. Скользящее пятичасовое окно использования и недельный лимит, в пять или двадцать раз больше, чем позволяет Pro; при достижении любого из них нужно ждать.
  • Нет банка вопросов. Вы приносите свои задания, сами решаете, похожи ли они на реальный тест, и сами следите за тем, что уже практиковали.
  • Настройку делаете вы. Запись, транскрипция, вставка расшифровки и формулирование инструкций для оценивания — всё это на вас, каждый раз.
  • Простой запрос, а не калиброванный оценщик. При простом запросе Claude Opus 5 совпадал с верифицированными оценками в 62% случаев, а Claude Sonnet 5 — в 45%, против 81% у Engine 2.0.

Цены тарифов Claude и условия использования указаны так, как опубликовано на claude.com в сентябре 2026 года, и могут измениться. CELPIP — торговая марка своего владельца; Prepamigo — независимая платформа для практики и не связана с создателем теста, не одобрена и не аффилирована с ним. Практические задания Prepamigo — оригинальные материалы, написанные в соответствии с публичным форматом теста.

Доступность

Prepamigo Scoring Engine 2.0 для Speaking уже доступен всем пользователям Prepamigo по каждому типу заданий speaking. Ничего включать не нужно. Каждый новый устный ответ оценивается Engine 2.0, и каждая оценка сопровождается обратной связью, составленной на основе собственных слов студента.

Типичный ответ оценивается примерно за десять секунд, быстрее, чем Engine 1.0. Engine 2.0 также стоит нам меньше на один ответ, чем дизайн, который он заменил, и именно это позволяет запускать два оценщика с тремя голосами каждый для каждого студента без изменения стоимости Prepamigo.

Мы будем публиковать обновления цифр на этой странице по мере завершения описанной выше проверки на реальных данных. Если у вас есть запись, которую, как вы считаете, Engine 2.0 оценил неверно, мы хотим её увидеть: такие случаи — самый быстрый известный нам способ найти следующее улучшение.

Для прямых сравнений читайте Prepamigo против Claude и Prepamigo против ChatGPT. Или запишите ответ и посмотрите, как работает Engine 2.0. Читайте эту статью на английском: Читать это руководство на английском.

Представляем Prepamigo Scoring Engine 2.0 для Speaking | PrepAmigo