Engine 2.0 на 48 отложенных ответах
Доля ответов, оценённых внутри верифицированного уровня. Три отдельных прогона в разные дни каждый раз дали 81,3% в общем.
81%
Точный уровень
Prepamigo против лучших тарифов чат-ботов
Цены в канадских долларах. Тарифы Prepamigo указаны с учётом налога. Claude Max (от US$100) и ChatGPT Pro (US$200) пересчитаны по курсу 1.38, без учёта налога. Точность — доля отложенных ответов, получивших верифицированную оценку, когда указанной модели просто, без специальных инструкций, предлагали оценить ответ; среднее по трём прогонам.
Это правильный вопрос, который нужно задавать о любом инструменте для практики, и большинство инструментов на него не отвечают. Оценка устной речи ценна только если она говорит, что сказал бы настоящий экзаменатор, и единственный способ узнать, так ли это, — измерить. Так что эта статья и есть измерение, изложенное прямо, с частями, которые нас украшают, и с частями, которые нет.
Ответ в одном абзаце: на 48 устных ответах, которые Scoring Engine 2.0 от Prepamigo никогда не видел, каждый с независимо верифицированной оценкой, движок попадал в верифицированный уровень в 81% случаев и в пределах одного балла от него — в 92% случаев. Он выдавал одни и те же 81% в каждом из трёх отдельных прогонов. Он наиболее точен на слабых и средних ответах — 88% и 85%, и наименее точен на ответах высшего уровня — 71%, где его характерная ошибка — ставить 10-балльному ответу 8. При простом запросе на оценку тех же расшифровок лучшая универсальная AI-модель, которую мы протестировали, достигла 62%, а самая слабая — 31%; при нашей полной процедуре оценивания лучшая достигла 77%.
Далее рассказано, как мы получили эти цифры, что они значат на каждом уровне оценки, насколько они стабильны, где возникают ошибки, как оценка сравнивается с альтернативами, которые вы могли бы использовать вместо неё, и как читать собственную оценку с учётом всего этого. Если вам нужен только практический совет, переходите к разделу о чтении своей оценки. Если вы хотите решить, доверять ли числу вообще, читайте всё.
Что здесь означает «точность»
Прежде чем приводить любую цифру — определение. Мы не заявляем, что оценка Prepamigo предсказывает результат вашего теста. Ни один практический инструмент не может это обещать, и любой, кто это обещает, просто гадает. Мы измеряем более узкую и честную вещь: если у устного ответа есть независимо верифицированная оценка, как часто движок выдаёт оценку того же уровня?
Speaking CELPIP оценивается по шкале до 12, и верифицированные оценки в наших референсных данных идут трёмя уровнями: низкий, то есть 4 или 5; средний, то есть 7 или 8; и высокий, то есть 10 и выше. Мы считаем оценку движка верной, если она попадает внутрь верифицированного уровня. Ответ, верифицированный на высшем уровне, оценён верно, если движок ставит ему 9, 10 или 11. При более строгом подходе, принимающем только 10 и выше, каждая цифра на этой странице снижается на несколько пунктов, а каждое сравнение остаётся в том же порядке.
Заголовочные цифры
Что означают эти 81% на практике? Если вы записываете десять ответов на устойчивом уровне, движок поместит около восьми из них в верный уровень и ещё около одного — в пределах одного балла от него. Он не поставит 5 в диапазон 10 и не поставит 10 в диапазон 5; такого не случилось ни разу за 144 оценённых ответа в трёх прогонах. Ошибки, которые он допускает, — это ошибки внимательного экзаменатора на граничном ответе, и следующий раздел показывает, где они концентрируются.
Точность на каждом уровне оценки
Точность по верифицированному уровню
16 отложенных ответов на уровень. Каждый столбец — доля ответов этого уровня, оценённых внутри уровня.
88%
Низкий (4–5)
85%
Средний (7–8)
71%
Высокий (10+)
Ответы низкого уровня: 88%. Слабые ответы легче всего распознать. Они, как правило, короткие, повторяют формулировку задания и оставляют части задания невыполненными. Движок в основном улавливает эти признаки. Когда он ошибается, он ошибается в сторону повышения: во всех случаях ответу ставили 8, а не 4 или 5. Причина почти всегда в том, что ответ звучит уверенно и бегло, но говорит мало; подача даёт ему уровень, которого он не заслужил по содержанию. Мы знаем это, потому что видим, какие измерения оценщики поставили высоко, и это всегда звучание речи.
Ответы среднего уровня: 85%. В каком-то смысле их труднее всего оценивать, потому что они содержат реальную смесь сильных и слабых сторон, которую нужно взвешивать, а не просто замечать. Промахи движка здесь идут в обе стороны. Несколько ответов с заметными хезитациями, но крепкими идеями были снижены до 5 или 6; несколько гладко звучащих ответов были подняты до 10. Этап согласования между двумя оценщиками улавливает большинство таких случаев, поэтому эта цифра настолько высока.
Ответы высшего уровня: 71%. Это самый слабый уровень, и о нём мы говорим больше всего, потому что ошибка настолько стабильна. Когда движок пропускает ответ высшего уровня, он ставит ему 8. Не 7, не 6; 8, во всех случаях, кроме нескольких 9, которые засчитываются как верные. Движок видит сильный ответ и сдерживается на одну отметку.
Это стоит поместить в контекст. Смещение к 8 на сильных ответах — не особенность Prepamigo; это характерная слабость каждого автоматизированного оценщика, который мы тестировали, откалиброван он на людях или нет. У нашего предыдущего движка эта проблема была намного хуже. При простом запросе на оценку тех же ответов лучшая универсальная модель распознала 56% ответов высшего уровня; модель, стоящая за платными тарифами ChatGPT, распознала 25%; и даже при нашей полной процедуре ни одна не превзошла 63%. Семьдесят один процент — лучшая цифра, которую мы достигли, и это всё равно та цифра, которую мы больше всего хотим улучшить.
Проблема оценки 8, с вашей стороны экрана
Взгляд по уровням показывает, как движок справляется с ответом известного уровня. Вы смотрите на это с другой стороны: у вас есть оценка, и вы хотите знать, насколько ей верить. Поэтому вот те же данные, развёрнутые в обратную сторону. Для каждой оценки, которую даёт движок, как часто ответ на самом деле был этого уровня?
- Если движок говорит 4 или 5: ответ был низкого уровня в 93% случаев. Остальные — ответы среднего уровня с сильными хезитациями. Низкая оценка от Engine 2.0 почти всегда верна.
- Если движок говорит 10: ответ был высшего уровня в 92% случаев. 10 от Engine 2.0 — это 10.
- Если движок говорит 8: ответ был среднего уровня в 67% случаев, высшего уровня — в 23% случаев и низкого уровня — в 10% случаев. Оценка 8 — единственная, которую стоит внимательно перечитать.
Проще говоря: 8 от Engine 2.0 означает «средний, вероятно, но возможно лучше». Примерно один ответ из четырёх, получивший 8, на самом деле был 10. Если вы получили 8 на ответе, который считали превосходным, не делайте вывод, что вы не готовы. Запишите то же задание снова. Стабильная 10 по трём попыткам — это 10; стабильная 8 по трём попыткам — это 8; смесь означает ответ на границе, и обратная связь подскажет, какое измерение его там удерживает.
Получает ли одна и та же запись одну и ту же оценку?
Точность без стабильности — это удача. Если бы одна и та же запись могла получить 8 сегодня и 10 завтра, цифра 81% была бы средним по шуму, и вы не могли бы использовать оценку, чтобы что-то отследить. Поэтому мы напрямую проверили повторяемость.
48 отложенных ответов оценивались три отдельных раза, в разные дни, ничего не меняя между запусками. Общая цифра была 81,3% на каждом прогоне. На уровне отдельных ответов 87,5% получили идентичную оценку все три раза, и лишь 4,2% когда-либо сдвигались на два балла или больше. Это те немногие ответы, что находятся ровно на границе между двумя уровнями, где небольшое различие в суждении законно склоняет оценку в ту или другую сторону.
Стабильность возникает из конкретного проектного решения. Каждый из двух оценщиков движка голосует три раза по каждому ответу, и сохраняется средний голос. Когда мы протестировали ту же конфигурацию с одним голосом вместо трёх, доля идентичных оценок между прогонами упала с 87,5% до 77%, а доля ответов, сдвигающихся на два балла или больше, увеличилась более чем вдвое. Голосование не изменило цифру точности. Оно изменило, значит ли эта цифра точности хоть что-нибудь.
Для вас стабильность означает, что изменение вашей оценки — это изменение вашей речи. Если вы записываете один и тот же тип задания три раза за неделю, и оценка меняется с 8 на 10, это не удачный день оценщика. Это вы.
Как это сравнивается с тем, что вы могли бы использовать вместо этого
Цифра точности значит больше, когда есть с чем её сравнить. Поэтому мы прогнали те же 48 отложенных ответов через универсальные AI-модели, которыми люди реально оценивают свою практику, так, как это сделал бы человек: мы дали каждой модели буквальную расшифровку и задание, сообщили, что она опытный экзаменатор CELPIP, и попросили оценку от 0 до 12. Три прогона на каждую, усреднённые.
Доля ответов, оценённых внутри верифицированного уровня
Те же 48 отложенных ответов. Каждой модели, простыми словами, предлагали оценить расшифровку; среднее по трём прогонам. Engine 2.0 работал в своей обычной production-конфигурации.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Engine 2.0 опережает каждую модель на 19–51 пункт. При простом запросе каждая универсальная модель оценивает жёстко: промах на слабом ответе — обычно 3, промах на сильном — 7 или 8. Claude Opus 5 и Gemini — единственные две выше половины. Три более крупные модели GPT показывают от 31% до 37% и распознают ответ высшего уровня от 13% до 27% случаев.
Затем мы дали каждой модели нашу полную процедуру: те же калибровочные примеры для конкретного задания, то же принудительное сравнение и короткую калибровочную заметку, настроенную под её особенности. Это лучший результат, который могла достичь каждая модель в наших руках, и его не может воспроизвести студент без этих примеров. Opus 5 поднялся до 77%, GPT 5.6 sol и Gemini — до 71%, GPT 5.5 и Sonnet 5 — до 69%, luna — до 63%, а GPT-4o mini — до 50%. Каждая из них всё равно закончила позади Engine 2.0, и ни одна не распознала более 63% ответов высшего уровня.
Что нового в обратной связи
Engine 2.0 включает полностью переработанный слой обратной связи. Он анализирует не только итоговую оценку, но и обоснования обоих экзаменаторов, и был проверен на трёх типах учащихся: тех, кто впервые сталкивается с CELPIP, тех, кто слабо знает английский и ищет «секрет», и тех, у кого есть всего полчаса в день и экзамен уже на следующей неделе. Вот что изменилось.
- Ваши слова, процитированные вам. Каждый пункт обратной связи ссылается на точную фразу из расшифровки вашего ответа, на которую отреагировали экзаменаторы. Если фраза взята в кавычки, значит, она процитирована буквально: в нашей проверке это подтвердилось для 157 из 158 цитат. Обратная связь никогда не придумывает то, чего вы не говорили.
- Что исправить первым. Для каждого ответа выделяется одно главное действие: изменение, которое сильнее всего повысит вашу оценку, сформулированное максимально простыми словами. За ним следуют ещё два конкретных шага, а затем — чек-лист из трёх пунктов, который нужно держать в голове перед началом ответа.
- Советы, подходящие именно этому заданию. Совет, описание сцены и попытка кого-то убедить оцениваются по разным критериям. Теперь обратная связь учитывает, что именно вознаграждается в каждом из восьми типов заданий, и говорит об этом напрямую, а не повторяет одни и те же общие советы для всех заданий.
- Какой аспект тренировать первым. Обратная связь показывает, какой из четырёх аспектов оценки у вас самый слабый, а какой самый сильный, — чтобы вы знали, где взять следующий балл, а не гадали, что скрывается за цифрой.
- Что требовалось по заданию, но осталось без ответа. По критерию выполнения задания обратная связь перечисляет конкретные пункты задания, которые вы не раскрыли, либо прямо говорит, что вы раскрыли их все.
- То, что можно по-настоящему отрепетировать. Каждая рекомендация — это то, что можно проговорить вслух перед следующей попыткой. Никаких советов «говорить чётче» или «уменьшить акцент»: акцент не входит в то, что измеряет восприимчивость речи, и обратная связь никогда не комментирует его.
- Таймер не виноват. Если ответ обрывается по таймеру уже после того, как задание выполнено, за это обрывание баллы не снижаются, и обратная связь не упрекает вас за это.
Когда независимая модель-судья сравнила новую обратную связь с той, что выдавала наша прежняя система для тех же ответов, не зная, какая из них какая, она предпочла новую обратную связь в 20 из 24 сравнений — как при оценке с позиции экзаменатора, так и с позиции учащегося.
Как читать свою оценку
- 4 или 5 почти наверняка верны. Движок определяет слабые ответы в 88% случаев, а когда он называет 4 или 5, он прав в 93% случаев. Читайте обратную связь, чтобы понять, какое измерение самое низкое, и работайте над ним.
- 10 — это 10. Когда движок называет 10, ответ был высшего уровня в 92% случаев. Вы готовы по этому типу задания. Переходите к тем, которые вы избегаете.
- 8 — это вопрос. Две трети времени это означает средний уровень. Один раз из четырёх — высокий. Запишите то же задание снова и посмотрите на закономерность по попыткам.
- Доверяйте изменениям больше, чем уровням. Поскольку оценка стабильна, изменение по попыткам — это изменение вашей речи. Повторение того же типа задания — самый быстрый способ узнать, работает ли новая привычка.
- Читайте цитаты. Фразы, процитированные в вашей обратной связи, — это то, на что отреагировали оценщики. Именно эти конкретные слова стоит менять.
Часто задаваемые вопросы
Насколько точна оценка speaking от Prepamigo? На 48 незнакомых ответах с верифицированными оценками: 81% на точном уровне, 92% в пределах одного балла, одинаково во всех трёх прогонах. По уровням: 88% низкий, 85% средний, 71% высокий.
Совпадает ли она с моей настоящей оценкой? Ни один практический инструмент не может это обещать. Мы измеряем, как часто движок совпадает с верифицированной оценкой на том же ответе. Читайте свою оценку как уровень с направлением и смотрите на закономерность по попыткам.
Почему я получил 8 на ответе, который считал превосходным? Это крупнейшая оставшаяся ошибка движка: одна 8 из четырёх на самом деле была 10. Запишите то же задание снова. Стабильная 10 по попыткам — это 10.
Получит ли одна и та же запись одну и ту же оценку два раза? 87,5% идентичны в трёх прогонах; только 4,2% сдвинулись на два балла или больше, все на границах уровней.
Чтобы увидеть, как движок работает шаг за шагом, читайте внутри Scoring Engine 2.0. Чтобы увидеть тот же тест на GPT, Claude и Gemini, читайте какой AI точнее оценивает CELPIP speaking. Или запишите ответ и увидьте цифры сами. Читайте эту статью на английском: Читать это руководство на английском.
