Доля ответов, оценённых на верифицированном уровне
48 отложенных устных ответов, по 16 на каждый из трёх уровней. Claude получал расшифровку и его просили, простыми словами, оценить её по шкале CELPIP; среднее по трём прогонам. Engine 2.0 работал в своей обычной production-конфигурации.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
45%
Claude Sonnet 5
Prepamigo против лучших тарифов чат-ботов
Цены в канадских долларах. Тарифы Prepamigo указаны с учётом налога. Claude Max (от US$100) и ChatGPT Pro (US$200) пересчитаны по курсу 1.38, без учёта налога. Точность — доля отложенных ответов, получивших верифицированную оценку, когда указанной модели просто, без специальных инструкций, предлагали оценить ответ; среднее по трём прогонам.
Если вы хоть раз вставляли расшифровку устного ответа в Claude и просили оценить вас как экзаменатор CELPIP, вы уже понимаете привлекательность этого подхода. Он отвечает мгновенно, объясняет своё решение и никогда не устаёт. Вопрос в том, совпадает ли выданное число с тем, что вы получили бы на самом деле. Мы провели проверку так, как это сделал бы студент: та же расшифровка, простой запрос на оценку — и подсчёт результатов.
Короткий ответ: на 48 устных ответах, которые системы никогда не видели, каждый с независимо верифицированной оценкой, Prepamigo Scoring Engine 2.0 попадал в верный уровень в 81% случаев. При простом запросе на оценку тех же расшифровок Claude Opus 5 попадал в верный уровень в 62% случаев, а Claude Sonnet 5 — в 45% случаев. Разрыв наиболее заметен именно там, где это важнее всего для тех, кто стремится к высокой оценке: на ответах высшего уровня Engine 2.0 распознал 71%, Opus 5 — 50%, а Sonnet 5 — 29%.
Затем мы сделали то, что большинство сравнений пропускает. Мы дали Claude нашу собственную процедуру оценивания с реальными калибровочными примерами для каждого задания и принудительным сравнением с ними, чтобы увидеть предельные возможности модели. Opus 5 поднялся до 77%, а Sonnet 5 — до 69%. Обе модели всё равно отстали от Engine 2.0, и обе всё равно хуже всего справлялись с ответами высшего уровня. Остальная часть статьи разбирает оба теста, как выглядят цифры на каждом уровне оценки, почему универсальный помощник смещается к середине шкалы, как выглядит повседневная работа с каждой стороны и сколько стоит каждый вариант, если вы намерены готовиться серьёзно.
Простой тест: что реально получает студент
Восемьдесят один процент против шестидесяти двух и сорока пяти. В тесте из 48 ответов разница между Engine 2.0 и Opus 5 — это девять дополнительных верных оценок, а разница между Engine 2.0 и Sonnet 5 — семнадцать. Иначе говоря, Engine 2.0 совершает на 51% меньше ошибок оценивания, чем Opus 5, и на 66% меньше, чем Sonnet 5.
Три отдельных прогона простого теста дали Opus 5 62%, 65% и 58%, а Sonnet 5 — 44%, 46% и 46%. Такой разброс между прогонами — сам по себе результат: попросите Claude оценить одну и ту же расшифровку в два разных дня, и довольно часто вы получите две разные оценки. Engine 2.0 показал 81,3% в каждом из трёх прогонов.
Где разрыв растёт: уровень за уровнем
Большинство оценщиков — и людей, и машин — смещаются к середине шкалы. Сильный ответ превращается в 8 вместо 10, слабый — в 6 вместо 5. Это смещение незаметно в среднем показателе и становится очевидным, как только результаты разбивают по уровням. При простом запросе Claude добавляет вторую привычку: он смещается вниз, так что даже слабые ответы часто оцениваются ниже своего уровня.
Ответы низкого уровня (верифицированная оценка 4 или 5)
16 отложенных ответов, простой запрос, среднее по трём прогонам. Промахи Sonnet 5 здесь — в основном оценка 3.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
44%
Claude Sonnet 5
На слабых ответах лидирует Engine 2.0 с 88%, Opus 5 идёт следом с 77%, а Sonnet 5 падает до 44%. Это лёгкий край шкалы, и Opus 5 справляется с ним неплохо. Sonnet 5 — нет: он ставит ответу с оценкой 4 или 5 оценку 3 чаще, чем нет, а это неверный уровень, хотя направление ошибки понятно. Студент этого уровня, использующий Sonnet 5 для оценки, чаще всего услышит, что он слабее, чем на самом деле.
Ответы среднего уровня (верифицированная оценка 7 или 8)
16 отложенных ответов, простой запрос, среднее по трём прогонам. Промахи — почти всегда оценка 6.
85%
Prepamigo Engine 2.0
63%
Claude Sonnet 5
58%
Claude Opus 5
В середине Engine 2.0 показывает 85%, а обе модели Claude — 63% и 58%. Ответы среднего уровня содержат смесь сильных и слабых сторон, которую нужно взвешивать, а не просто замечать, и без калибровочных примеров для сравнения обе модели Claude склонны замечать слабости и ставить 6. Спикер уровня 7 или 8 услышит, что он на уровне 6, примерно четыре раза из десяти.
Ответы высшего уровня (верифицированная оценка 10 и выше)
16 отложенных ответов, простой запрос, среднее по трём прогонам. Почти каждый промах — оценка 7 или 8.
71%
Prepamigo Engine 2.0
50%
Claude Opus 5
29%
Claude Sonnet 5
На верхнем уровне Engine 2.0 распознаёт 71% ответов высшего уровня. Opus 5 распознаёт половину. Sonnet 5 распознаёт 29%, а это значит, что он ставит 7 или 8 семи из каждых десяти ответов, заслуживающих 10.
Подумайте, что это значит на практике. Допустим, ваш уровень устной речи сегодня действительно 10. Вы записываете восемь ответов, расшифровываете их, вставляете в Claude Sonnet 5 и просите оценку, а он говорит, что шесть из них — это 7 и 8. Вы делаете вывод, что не готовы. Вы тратите ещё три недели на тренировки. А вы были готовы всё это время. Это не гипотетический сценарий — это самая частая отдельная ошибка во всём нашем тесте, и она сильнее всего бьёт по тем кандидатам, которые больше всего трудились.
А что если дать Claude нашу полную процедуру?
Заманчиво прочитать цифры простого теста как признак того, что Claude — слабая модель. Это не так. Opus 5 — с большим отрывом самый сильный универсальный оценщик, который мы тестировали. Проблема не в интеллекте. Проблема в том, что модель, у которой просят число и не дают ничего для сравнения, угадывает, а угадывая, она угадывает низко и к середине.
Поэтому мы провели второй тест. Claude получил тот же пакет, что и собственные оценщики Engine 2.0: расшифровку, задание, два реальных калибровочных примера на каждом уровне для этого конкретного задания и инструкцию назвать ближайший пример для каждого из четырёх измерений оценки. Каждая модель также получила короткую калибровочную заметку, настроенную под её особенности.
При нашей полной процедуре: доля ответов, оценённых на верифицированном уровне
Те же 48 отложенных ответов. Каждая модель Claude оценивала каждый ответ один раз с теми же расшифровками, инструкциями и калибровочными примерами, что и собственные оценщики Engine 2.0.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
69%
Claude Sonnet 5
Калибровочные примеры дают огромную разницу. Opus 5 поднимается с 62% до 77%; Sonnet 5 — с 45% до 69%. Точность на низком уровне у обеих моделей достигает 88% — столько же, сколько у Engine 2.0. Точность на среднем уровне достигает 81% у обеих. Это стоит отметить особо, потому что это показывает, где на самом деле находится ценность специализированного оценщика: не в более умной модели, а в реальных примерах того, как звучит каждый уровень на каждом конкретном задании, и в вопросе, который заставляет модель сравнивать, а не угадывать.
Даже так обе модели отстают на верхнем крае шкалы. При полной процедуре Opus 5 распознаёт 63% ответов высшего уровня, а Sonnet 5 — 38%, против 71% у Engine 2.0. Одна модель, делающая один проход, всё равно сдерживается перед сильным ответом с небольшой шероховатостью. Engine 2.0 закрывает оставшийся разрыв тремя дополнительными механизмами: два независимых оценщика от разных провайдеров, три голоса от каждого с сохранением среднего голоса, и правило согласования, которое берёт более высокую оценку, когда два оценщика сильно расходятся, потому что анализ показал: на сильных ответах более низкий вердикт почти всегда был неверным.
Мы также попробовали очевидный обходной путь: оставить простой запрос и добавить инструкции вроде «не смещайся к середине» или «ответ уровня 9 не обязан быть безупречным». Они не дали измеримого изменения. Модель соглашается с инструкцией и затем всё равно делает то, что собиралась делать. Работает изменение самого вопроса и предоставление модели чего-то реального для сравнения.
Разрыв в рабочем процессе: записал и готово — или делай всё сам
Цифры точности предполагают, что оценивание вообще происходит. С Claude между нажатием «стоп» на записи и получением оценки скрывается неожиданно много работы.
Во-первых, нужна расшифровка. Чат Claude не оценивает аудиозаписи, поэтому нужно получить текст. Это означает либо набрать вручную то, что вы сказали (что меняет ответ), либо пропустить запись через инструмент транскрипции. И вот деталь, которая обошлась нам дорого по точности, прежде чем мы это поняли: расшифровка должна быть буквальной. Каждое слово-паразит, каждый самоповтор, каждое самоисправление должны остаться. Когда мы протестировали «очищенную» расшифровку без пауз и хезитаций, точность упала на пятнадцать пунктов, потому что именно эти хезитации — доказательства, нужные оценщику, чтобы понять, как звучит ответ. Большинство потребительских инструментов транскрипции очищают текст по умолчанию.
Во-вторых, нужно задание. У Claude нет банка формулировок в стиле CELPIP с правильным таймингом и форматом. Вы либо пишете своё задание, гадая, что спрашивает настоящий тест, либо находите его в другом месте и вставляете вместе с расшифровкой.
В-третьих, если вы хотите результат лучше, чем в простом тесте, нужны калибровочные примеры: реальные ответы каждого уровня для того же типа задания, с верифицированными уровнями. Именно этот ввод поднял Opus 5 с 62% до 77% в нашем тесте, и именно его студент не может создать дома.
В-четвёртых, всё это нужно повторить для следующего ответа. И для того, что после него.
В Prepamigo вы выбираете задание из банка, запускается таймер, вы говорите, и примерно через десять секунд после того, как вы остановились, на экране появляются оценка и обратная связь. Расшифровка по умолчанию буквальная, калибровочные примеры прикреплены к заданию автоматически, и нет ничего, что нужно было бы вставлять или формулировать самому. Одиннадцатый ответ за вечер стоит вам столько же усилий, сколько первый.
Стабильность: один и тот же ответ — одна и та же оценка
Оценка, которую нельзя воспроизвести, — это не измерение. Если одна и та же запись получает 8 в понедельник и 10 во вторник, вы не узнали ничего о своей речи, но кое-что узнали о настроении оценщика. Поэтому мы также проверили, даёт ли каждая система одинаковый ответ два раза.
Engine 2.0 запускался на 48 отложенных ответах три отдельных раза. Он показал 81,3% на каждом прогоне. Если смотреть не на агрегированный показатель, а на отдельные ответы, 87,5% получили идентичную оценку во всех трёх прогонах, и лишь 4,2% когда-либо сдвигались на два балла или больше. Это те немногие ответы, что находятся ровно на границе между двумя уровнями, где небольшое различие в суждении законно склоняет оценку в ту или другую сторону.
Простой тест на Claude сдвигался на несколько пунктов между прогонами на агрегированном уровне и ещё больше — на уровне отдельных ответов. Этот разрыв в стабильности — не случайность используемых моделей. Он возникает из-за голосования. Каждый оценщик в Engine 2.0 голосует три раза по каждому ответу, и сохраняется средний голос, что убирает случайный выброс, который даёт один проход. Когда мы протестировали ту же конфигурацию с одним голосом вместо трёх, согласие между прогонами упало с 87,5% до 77,1%. Один разговор с Claude — это один голос.
Обратная связь, на которую можно опереться
Оценка говорит, где вы находитесь. Обратная связь говорит, что делать дальше, и это область, где Claude действительно хорош. Он пишет ясно, терпеливо, и если вы спросите, почему он поставил конкретную оценку, он объяснит настолько подробно, насколько вы хотите. Для кандидата, который хочет обсудить ответ, это ценно.
Риск тот же, что и с оценкой: убедительное объяснение — не то же самое, что точный диагноз. Модель, поставившая 10-балльному ответу 7, убедительно объяснит, почему это 7. Она найдёт, на что указать. А поскольку Claude не обязан было опираться на доказательства перед выставлением оценки, объяснение пишется постфактум, чтобы обосновать уже выбранное число.
Engine 2.0 работает в обратном порядке. Поскольку каждый оценщик обязан указывать доказательства для каждого измерения, которое он оценивает, слой обратной связи получает эти доказательства напрямую: точные фразы из вашей расшифровки, подтвердившие вердикт по содержанию, словарному запасу, звучанию речи и выполнению задания. Обратная связь пишется на основе этих доказательств и цитирует ваши собственные слова. В нашей проверке 158 цитат по выборке отзывов 157 совпали буквально с расшифровкой. Когда мы попросили независимую судящую модель сравнить обратную связь Engine 2.0 с обратной связью нашей предыдущей системы, не зная, какая из них какая, она предпочла Engine 2.0 в 20 из 24 сравнений — и когда судила как экзаменатор, и когда судила как студент.
Мы также проверили, попадает ли критика в правильное место. Мы взяли сильные ответы и намеренно испортили один аспект каждого: вставили грамматические ошибки и слова-паразиты, заменили точные слова на расплывчатые, убрали поддерживающие детали или удалили основное действие, требуемое заданием. В трёх из четырёх случаев именно то измерение, которое мы испортили, потеряло больше всего баллов. Это тот вид проверки, который чат-боту нелегко пройти, потому что у него нет фиксированных измерений, по которым его можно проверить.
Сколько стоит практиковаться каждый день
Оценка устной речи наиболее полезна на вашем сороковом ответе, а не на четвёртом. Именно тогда она начинает показывать, действительно ли работает изменение в том, как вы говорите. Поэтому практический вопрос не в том, сколько стоит каждый инструмент, а в том, сколько стоит использовать его в больших объёмах.
Claude Pro стоит US$20 в месяц, около CA$28, или US$17 в месяц при годовой оплате, как опубликовано на claude.com в сентябре 2026 года. Тариф включает скользящее пятичасовое окно использования и недельный лимит; когда вы упираетесь в любой из них, приходится ждать. Длинные расшифровки с прикреплёнными калибровочными примерами — это ровно тот тип сообщения, который сильно расходует этот лимит. Тарифы Max, от US$100 в месяц, около CA$138 без налога, существенно повышают лимиты, но не убирают их. Ни один из тарифов не включает банк вопросов, таймер, транскрипцию, калибровочные примеры или что-либо специфичное для CELPIP.
Prepamigo стоит CA$24.98 в месяц, или CA$8.25 в месяц по годовому тарифу — это CA$98.98 в год, с учётом налога, и отменить можно в любой момент. Каждый тариф включает безлимитное оценивание от Engine 2.0 без дневного, сессионного или недельного лимита, безлимитные попытки и полный банк вопросов: 80 полных практических наборов и более 2 000 практических заданий по Speaking, Writing, Reading и Listening, написанных в соответствии с типами заданий, таймингом и форматом теста CELPIP General.
Проще говоря: за меньшую цену, чем Claude Pro, вы получаете оценщика, который намного точнее на самых важных ответах, никогда не просит вас ждать и уже включает вопросы и калибровочные примеры.
Когда Claude — лучший инструмент
Это не статья о том, что во время подготовки к CELPIP никогда не стоит открывать Claude. Есть несколько вещей, с которыми он справляется лучше специализированного оценщика, и серьёзный кандидат вполне может использовать оба инструмента.
- Обсуждение ответа. Если вы хотите понять, почему конкретный аргумент был слабым, или придумать три лучших варианта, разговор — подходящий формат. Engine 2.0 даёт вердикт и доказательства; он не ведёт беседу.
- Помощь со словарём и формулировками. Спросить у Claude пять более естественных способов сказать что-либо — быстро и полезно, и его предложения обычно хороши.
- Практика письма. Письменные ответы не требуют расшифровки, поэтому разрыв в рабочем процессе намного меньше. Точность Claude в письменной части не входила в этот тест, и мы не делаем здесь никаких заявлений о ней.
- Всё, что вне теста. Вопросы об иммиграционных документах, расписание подготовки, объяснение грамматики: Claude — универсальный помощник, а Prepamigo — нет.
Судя по этим данным, Claude не должен быть тем, что говорит вам, готовы вы или нет. Для этого нужен оценщик, созданный именно для этой задачи, проверенный на невиданных ответах и измеренный по уровням.
Что нового в обратной связи
Engine 2.0 включает полностью переработанный слой обратной связи. Он анализирует не только итоговую оценку, но и обоснования обоих экзаменаторов, и был проверен на трёх типах учащихся: тех, кто впервые сталкивается с CELPIP, тех, кто слабо знает английский и ищет «секрет», и тех, у кого есть всего полчаса в день и экзамен уже на следующей неделе. Вот что изменилось.
- Ваши слова, процитированные вам. Каждый пункт обратной связи ссылается на точную фразу из расшифровки вашего ответа, на которую отреагировали экзаменаторы. Если фраза взята в кавычки, значит, она процитирована буквально: в нашей проверке это подтвердилось для 157 из 158 цитат. Обратная связь никогда не придумывает то, чего вы не говорили.
- Что исправить первым. Для каждого ответа выделяется одно главное действие: изменение, которое сильнее всего повысит вашу оценку, сформулированное максимально простыми словами. За ним следуют ещё два конкретных шага, а затем — чек-лист из трёх пунктов, который нужно держать в голове перед началом ответа.
- Советы, подходящие именно этому заданию. Совет, описание сцены и попытка кого-то убедить оцениваются по разным критериям. Теперь обратная связь учитывает, что именно вознаграждается в каждом из восьми типов заданий, и говорит об этом напрямую, а не повторяет одни и те же общие советы для всех заданий.
- Какой аспект тренировать первым. Обратная связь показывает, какой из четырёх аспектов оценки у вас самый слабый, а какой самый сильный, — чтобы вы знали, где взять следующий балл, а не гадали, что скрывается за цифрой.
- Что требовалось по заданию, но осталось без ответа. По критерию выполнения задания обратная связь перечисляет конкретные пункты задания, которые вы не раскрыли, либо прямо говорит, что вы раскрыли их все.
- То, что можно по-настоящему отрепетировать. Каждая рекомендация — это то, что можно проговорить вслух перед следующей попыткой. Никаких советов «говорить чётче» или «уменьшить акцент»: акцент не входит в то, что измеряет восприимчивость речи, и обратная связь никогда не комментирует его.
- Таймер не виноват. Если ответ обрывается по таймеру уже после того, как задание выполнено, за это обрывание баллы не снижаются, и обратная связь не упрекает вас за это.
Когда независимая модель-судья сравнила новую обратную связь с той, что выдавала наша прежняя система для тех же ответов, не зная, какая из них какая, она предпочла новую обратную связь в 20 из 24 сравнений — как при оценке с позиции экзаменатора, так и с позиции учащегося.
Часто задаваемые вопросы
Может ли Claude оценивать мою устную практику CELPIP? Он выдаст вам число. При простом запросе на 48 незнакомых ответах с верифицированными оценками Claude Opus 5 попадал в верный уровень в 62% случаев, а Claude Sonnet 5 — в 45% случаев, против 81% у Prepamigo Scoring Engine 2.0. На ответах высшего уровня Sonnet 5 был прав в 29% случаев.
Точнее ли Prepamigo, чем Claude? Да: 81% против 62% и 45% при простом запросе. При нашей полной процедуре с калибровочными примерами Opus 5 достиг 77%, а Sonnet 5 — 69%, всё равно отставая, и всё равно слабее всего на верхнем крае шкалы.
Сколько стоит каждый вариант? Claude Max стоит от US$100 в месяц, около CA$138 без налога, с лимитами использования; Claude Pro стоит US$20 с более жёсткими лимитами. Prepamigo стоит CA$24.98 в месяц с учётом налога, или CA$8.25 в месяц по годовому тарифу, с безлимитным оцениванием и 80 практическими наборами.
Почему Claude постоянно ставит моим сильным ответам 7 или 8? Модель, которую просят назвать число, не имея ничего для сравнения, смещается вниз и к середине, а ответ высшего уровня никогда не бывает безупречным. При простом запросе Sonnet 5 ставил ответу высшего уровня 9 баллов и выше лишь в 29% случаев.
Чтобы увидеть, как на самом деле работает оценивание, читайте внутри Scoring Engine 2.0. Чтобы увидеть полную таблицу лидеров, включая GPT и Gemini, читайте какой AI точнее оценивает CELPIP speaking. Или пропустите чтение и запишите ответ. Читайте эту статью на английском: Читать это руководство на английском.
