Доля ответов, оценённых на верифицированном уровне
48 отложенных устных ответов, по 16 на каждый уровень. Каждая модель GPT получала расшифровку и её просили, простыми словами, оценить её по шкале CELPIP; среднее по трём прогонам. Engine 2.0 работал в своей обычной production-конфигурации.
81%
Prepamigo Engine 2.0
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Prepamigo против лучших тарифов чат-ботов
Цены в канадских долларах. Тарифы Prepamigo указаны с учётом налога. Claude Max (от US$100) и ChatGPT Pro (US$200) пересчитаны по курсу 1.38, без учёта налога. Точность — доля отложенных ответов, получивших верифицированную оценку, когда указанной модели просто, без специальных инструкций, предлагали оценить ответ; среднее по трём прогонам.
ChatGPT, вероятно, самый распространённый инструмент, которым кандидаты CELPIP оценивают свою устную практику самостоятельно. Он есть в телефоне у каждого, отвечает за секунды и с готовностью скажет, на каком уровне был ваш ответ. Вопрос, на который отвечает эта статья, — совпадает ли названный уровень с тем, что вы получили бы на самом деле. Мы провели тест так, как это делает студент: вставить расшифровку, попросить оценку — и посчитать.
Короткий ответ: на 48 устных ответах, которые ни одна из систем не видела, каждый с независимо верифицированной оценкой, Prepamigo Scoring Engine 2.0 попадал в верный уровень в 81% случаев. При простом запросе GPT 5.6 sol, модель, стоящая за платными тарифами ChatGPT, попадала в верный уровень в 35% случаев. GPT 5.5 показал 37%, GPT 5.6 luna — 31%, а GPT-4o mini — 45% — цифра, которая выглядит лучше, чем есть на самом деле, потому что эта модель оценивает почти всё низко и поэтому случайно угадывает слабые ответы.
Затем мы сделали то, что большинство сравнений пропускает. Мы дали каждой модели GPT нашу собственную процедуру оценивания с реальными калибровочными примерами для каждого задания и принудительным сравнением с ними, чтобы увидеть предельные возможности каждой модели. GPT 5.6 sol поднялся до 71%, GPT 5.5 — до 69%, luna — до 63%, а GPT-4o mini — до 50%. Все четыре модели всё равно отстали от Engine 2.0, и все четыре всё равно хуже всего справлялись с ответами высшего уровня. Остальная часть статьи разбирает оба теста, результаты на каждом уровне оценки, почему универсальный помощник смещается к середине шкалы, как выглядит повседневная работа с каждой стороны и сколько стоит каждый вариант, если вы намерены готовиться серьёзно.
Простой тест: что реально получает студент
Восемьдесят один процент против тридцати пяти. В тесте из 48 ответов это двадцать две дополнительные верные оценки у Engine 2.0 по сравнению с GPT 5.6 sol. Иначе говоря, Engine 2.0 совершает на 71% меньше ошибок оценивания, чем GPT 5.6 sol, на 70% меньше, чем GPT 5.5, на 73% меньше, чем GPT 5.6 luna, и на 66% меньше, чем GPT-4o mini.
Три отдельных прогона простого теста дали GPT 5.6 sol 31%, 40% и 35%, а GPT 5.5 — 35%, 42% и 33%. Такой разброс между прогонами — сам по себе результат: попросите ChatGPT оценить одну и ту же расшифровку в два разных дня, и довольно часто вы получите две разные оценки. Engine 2.0 показал 81,3% в каждом из трёх прогонов.
Где разрыв растёт: уровень за уровнем
Общая цифра скрывает, где именно возникают ошибки. Оценщик, который прекрасно справляется со слабыми ответами и безнадёжен с сильными, годится для начинающего и активно вредит тому, кто стремится к 10. Поэтому вот результаты простого теста, разбитые по верифицированному уровню.
Ответы низкого уровня (верифицированная оценка 4 или 5)
16 отложенных ответов, простой запрос, среднее по трём прогонам. Большинство промахов — оценка 3.
88%
Prepamigo Engine 2.0
75%
GPT-4o mini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
На слабых ответах лидирует Engine 2.0 с 88%. GPT-4o mini идёт следом с 75% — единственный случай, где его привычка занижать оценки работает в его пользу. Три более крупные модели GPT показывают от 52% до 54%: примерно в половине случаев они ставят ответу с оценкой 4 или 5 оценку 3, а это неверный уровень, хотя направление ошибки понятно. Начинающий, использующий ChatGPT для оценки, примерно в половине случаев услышит, что он слабее, чем на самом деле.
Ответы среднего уровня (верифицированная оценка 7 или 8)
16 отложенных ответов, простой запрос, среднее по трём прогонам. Промахи — почти всегда оценка 5 или 6.
85%
Prepamigo Engine 2.0
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
Средний уровень — это то место, где модели GPT с простым запросом разваливаются. Engine 2.0 показывает 85%; GPT-4o mini — 44%; GPT 5.5, GPT 5.6 sol и luna — от 27% до 29%. Ответы среднего уровня содержат реальную смесь сильных и слабых сторон, которую нужно взвешивать, и без калибровочных примеров для сравнения модели GPT замечают слабости и ставят 5 или 6. Спикер уровня 7 или 8, спрашивающий у GPT 5.6 sol оценку, услышит верный уровень менее трёх раз из десяти.
Ответы высшего уровня (верифицированная оценка 10 и выше)
16 отложенных ответов, простой запрос, среднее по трём прогонам. Почти каждый промах — оценка 7 или 8.
71%
Prepamigo Engine 2.0
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
На верхнем уровне Engine 2.0 распознаёт 71% ответов высшего уровня. GPT 5.5 распознаёт 27%, GPT 5.6 sol — 25%, GPT-4o mini — 17%, а GPT 5.6 luna — 13%. Каждая модель GPT ставит 7 или 8 хотя бы семи из каждых десяти ответов, заслуживающих 10.
Подумайте, что это значит для сильного кандидата. Вы записываете восемь ответов, расшифровываете их, вставляете в ChatGPT и просите оценку, а он говорит, что шесть из них — это 7 и 8. Вы делаете вывод, что вы крепкий спикер среднего уровня, которому есть над чем работать. А вы были на уровне 10 всё это время. Это не гипотетический сценарий. Это то, что каждая модель GPT сделала с большинством ответов высшего уровня в нашем тесте.
А что если дать ChatGPT нашу полную процедуру?
Заманчиво прочитать цифры простого теста как признак того, что семейство GPT слабое. Это не так. Проблема не в интеллекте. Проблема в том, что модель, у которой просят число и не дают ничего для сравнения, угадывает, а угадывая, она угадывает низко и к середине.
Поэтому мы провели второй тест. Каждая модель GPT получила тот же пакет, что и собственные оценщики Engine 2.0: расшифровку, задание, два реальных калибровочных примера на каждом уровне для этого конкретного задания и инструкцию назвать ближайший пример для каждого из четырёх измерений оценки. Каждая модель также получила короткую калибровочную заметку, настроенную под её особенности.
При нашей полной процедуре: доля ответов, оценённых на верифицированном уровне
Те же 48 отложенных ответов. Каждая модель GPT оценивала каждый ответ один раз с теми же расшифровками, инструкциями и калибровочными примерами, что и собственные оценщики Engine 2.0.
81%
Prepamigo Engine 2.0
71%
GPT 5.6 sol
69%
GPT 5.5
63%
GPT 5.6 luna
50%
GPT-4o mini
Калибровочные примеры дают колоссальную разницу. GPT 5.6 sol удваивает результат — с 35% до 71%. GPT 5.5 растёт с 37% до 69%, luna — с 31% до 63%. GPT-4o mini почти не сдвигается — с 45% до 50%, потому что продолжает оценивать всё низко независимо от того, что ей показывают; при полной процедуре она вообще не распознала ни одного ответа высшего уровня. Это показывает, где на самом деле находится ценность специализированного оценщика: не в более умной модели, а в реальных примерах того, как звучит каждый уровень на каждом конкретном задании, и в вопросе, который заставляет модель сравнивать, а не угадывать.
Даже так каждая модель GPT отстаёт. При полной процедуре GPT 5.6 sol отстаёт от Engine 2.0 на десять пунктов в целом, на десять пунктов в среднем уровне (75% против 85%) и на восемь пунктов на верхнем уровне (63% против 71%). Его оставшаяся привычка — переоценивать гладкость: уверенная 8 с плавной подачей продвигается до 9 или 10. GPT 5.6 luna делает наоборот, стягивая средние ответы к 5, и заканчивает средний уровень на 44%. Одна модель, делающая один проход, всё равно имеет характерное смещение, и Engine 2.0 закрывает оставшийся разрыв двумя независимыми оценщиками от разных провайдеров, тремя голосами от каждого с сохранением среднего, и правилом согласования, которое берёт более высокую оценку, когда два оценщика сильно расходятся.
Мы также попробовали очевидный обходной путь: оставить простой запрос и добавить инструкции вроде «не смещайся к середине» или «ответ уровня 9 не обязан быть безупречным». Они не дали измеримого изменения. Работает изменение самого вопроса и предоставление модели чего-то реального для сравнения.
Разрыв в рабочем процессе: записал и готово — или делай всё сам
Цифры точности предполагают, что оценивание вообще происходит. С ChatGPT между нажатием «стоп» на записи и получением оценки скрывается неожиданно много работы, и часть этой работы меняет саму оценку.
Во-первых, нужна расшифровка. Голосовой режим ChatGPT — это разговор, а не оценщик; чтобы оценить записанный ответ, нужен текст. Это означает либо набрать вручную то, что вы сказали (что меняет ответ), либо пропустить запись через инструмент транскрипции. И расшифровка должна быть буквальной. Каждое слово-паразит, каждый самоповтор, каждое самоисправление должны остаться. Когда мы протестировали «очищенную» расшифровку без пауз и хезитаций, точность упала на пятнадцать пунктов, потому что именно эти хезитации — доказательства, нужные оценщику, чтобы понять, как звучит ответ. Большинство потребительских инструментов транскрипции, включая встроенные в большинство телефонов, очищают текст по умолчанию.
Во-вторых, нужно задание. ChatGPT может придумать формулировку в стиле CELPIP по запросу, но он гадает насчёт формата, тайминга и типа сценария, используемого в реальном тесте. Вы не будете знать, похоже ли написанное задание на то, что вам предстоит.
В-третьих, если вы хотите результат лучше, чем в простом тесте, нужны калибровочные примеры: реальные ответы каждого уровня для того же типа задания, с верифицированными уровнями. Именно этот ввод удвоил точность GPT 5.6 sol в нашем тесте, и именно его студент не может создать дома.
В-четвёртых, всё это нужно повторить для следующего ответа, и каждый ответ расходует ваш лимит сообщений.
В Prepamigo вы выбираете задание из банка, запускается таймер, вы говорите, и примерно через десять секунд после того, как вы остановились, на экране появляются оценка и обратная связь. Расшифровка по умолчанию буквальная, калибровочные примеры прикреплены к заданию автоматически, и нет ничего, что нужно было бы вставлять или формулировать самому. Одиннадцатый ответ за вечер стоит вам столько же усилий, сколько первый.
Стабильность: один и тот же ответ — одна и та же оценка
Оценка, которую нельзя воспроизвести, — это не измерение. Если одна и та же запись получает 8 в понедельник и 10 во вторник, вы не узнали ничего о своей речи. Поэтому мы также проверили повторяемость.
Engine 2.0 запускался на 48 отложенных ответах три отдельных раза в разные дни. Он показывал 81,3% каждый раз. Если смотреть на отдельные ответы, 87,5% получили идентичную оценку во всех трёх прогонах, и лишь 4,2% когда-либо сдвигались на два балла или больше — все они на границе между двумя уровнями.
Простой тест на GPT 5.6 sol сдвинулся на девять пунктов между лучшим и худшим прогоном. Этот разрыв в стабильности возникает из-за голосования. Каждый оценщик в Engine 2.0 голосует три раза по каждому ответу, и сохраняется средний голос. Когда мы протестировали ту же конфигурацию с одним голосом вместо трёх, доля идентичных оценок между прогонами упала с 87,5% до 77%, а доля ответов, сдвигающихся на два балла или больше, увеличилась более чем вдвое. Один разговор с ChatGPT — это один голос. Мы также проверили, делает ли фиксированное случайное зерно через API модели GPT более повторяемыми. Не сделало; на GPT 5.6 luna повторяемость даже снизилась.
Обратная связь, на которую можно опереться
ChatGPT хорошо объясняет. Если спросить, почему он поставил такую оценку, он расскажет подробно, на понятном языке, и предложит улучшения. Для кандидата, который хочет обсудить ответ, это по-настоящему ценно.
Риск в том, что убедительное объяснение — не то же самое, что точный диагноз. Модель, поставившая 10-балльному ответу 7, убедительно объяснит, почему это 7. Она найдёт, на что указать. А поскольку она не обязана было опираться на доказательства перед выставлением оценки, объяснение пишется постфактум, чтобы обосновать уже выбранное число.
Engine 2.0 работает в обратном порядке. Каждый оценщик обязан указывать доказательства для каждого измерения, прежде чем назвать уровень, и обратная связь пишется на основе этих доказательств. Она цитирует ваши собственные слова: в проверке 158 цитат по выборке отзывов 157 совпали буквально с расшифровкой. Когда независимая судящая модель сравнила обратную связь Engine 2.0 с обратной связью нашей предыдущей системы на тех же ответах, не зная, какая из них какая, она предпочла Engine 2.0 в 20 из 24 сравнений — и когда судила как экзаменатор, и когда судила как студент.
Мы также проверили, попадает ли критика в правильное место, взяв сильные ответы и намеренно испортив по одному измерению в каждом. В трёх из четырёх случаев именно испорченное измерение теряло больше всего баллов. Это тот вид проверки, который чат-боту нелегко пройти, потому что у него нет фиксированных измерений, по которым его можно проверить.
Сколько стоит практиковаться каждый день
Оценка устной речи наиболее полезна на вашем сороковом ответе, а не на четвёртом. Именно тогда она начинает показывать, действительно ли работает изменение в том, как вы говорите. Поэтому практический вопрос в том, сколько стоит использовать каждый инструмент в больших объёмах.
ChatGPT Plus стоит US$20 в месяц, около CA$28, с помесячной оплатой, как опубликовано в сентябре 2026 года. Тариф даёт доступ к семейству GPT 5.6 с лимитом сообщений на скользящее окно; длинные расшифровки с прикреплёнными калибровочными примерами — это ровно тот тип сообщения, который сильно расходует этот лимит, а когда вы в него упираетесь, приходится ждать или переходить на меньшую модель. ChatGPT Pro, за US$200 в месяц, около CA$276 без налога, существенно повышает лимиты. Бесплатный тариф направляет значительную часть трафика на меньшие модели, а в нашем тесте самая маленькая из них распознала почти ни одного ответа высшего уровня. Ни один из тарифов не включает банк вопросов, таймер, буквальную транскрипцию, калибровочные примеры или что-либо специфичное для CELPIP.
Prepamigo стоит CA$24.98 в месяц, или CA$8.25 в месяц по годовому тарифу — это CA$98.98 в год, с учётом налога, и отменить можно в любой момент. Каждый тариф включает безлимитное оценивание от Engine 2.0 без дневного, сессионного или недельного лимита, безлимитные попытки и полный банк вопросов: 80 полных практических наборов и более 2 000 практических заданий по Speaking, Writing, Reading и Listening, написанных в соответствии с типами заданий, таймингом и форматом теста CELPIP General.
Проще говоря: за меньшую цену, чем ChatGPT Plus, вы получаете оценщика, который более чем в два раза точнее при простом сравнении, никогда не просит вас ждать и уже включает вопросы и калибровочные примеры.
Когда ChatGPT — лучший инструмент
Это не аргумент за то, что во время подготовки к CELPIP никогда не стоит открывать ChatGPT. Серьёзный кандидат вполне может использовать оба инструмента.
- Обсуждение ответа. Если вы хотите понять, почему аргумент был слабым, или придумать три лучших варианта, разговор — подходящий формат. Engine 2.0 даёт вердикт и доказательства; он не ведёт беседу.
- Словарь и формулировки. Спросить пять более естественных способов сказать что-либо — быстро и полезно.
- Разговор с тем, что отвечает. Голосовой режим ChatGPT — разумный способ привыкнуть говорить по-английски вслух. Это не оценщик, но это компания.
- Практика письма. Письменные ответы не требуют расшифровки, поэтому разрыв в рабочем процессе меньше. Точность GPT в письменной части не входила в этот тест, и мы не делаем никаких заявлений о ней.
- Всё, что вне теста. ChatGPT — универсальный помощник, а Prepamigo — нет.
Судя по этим данным, ChatGPT не должен быть тем, что говорит вам, готовы вы или нет. Для этого нужен оценщик, созданный именно для этой задачи, проверенный на невиданных ответах и измеренный по уровням.
Что нового в обратной связи
Engine 2.0 включает полностью переработанный слой обратной связи. Он анализирует не только итоговую оценку, но и обоснования обоих экзаменаторов, и был проверен на трёх типах учащихся: тех, кто впервые сталкивается с CELPIP, тех, кто слабо знает английский и ищет «секрет», и тех, у кого есть всего полчаса в день и экзамен уже на следующей неделе. Вот что изменилось.
- Ваши слова, процитированные вам. Каждый пункт обратной связи ссылается на точную фразу из расшифровки вашего ответа, на которую отреагировали экзаменаторы. Если фраза взята в кавычки, значит, она процитирована буквально: в нашей проверке это подтвердилось для 157 из 158 цитат. Обратная связь никогда не придумывает то, чего вы не говорили.
- Что исправить первым. Для каждого ответа выделяется одно главное действие: изменение, которое сильнее всего повысит вашу оценку, сформулированное максимально простыми словами. За ним следуют ещё два конкретных шага, а затем — чек-лист из трёх пунктов, который нужно держать в голове перед началом ответа.
- Советы, подходящие именно этому заданию. Совет, описание сцены и попытка кого-то убедить оцениваются по разным критериям. Теперь обратная связь учитывает, что именно вознаграждается в каждом из восьми типов заданий, и говорит об этом напрямую, а не повторяет одни и те же общие советы для всех заданий.
- Какой аспект тренировать первым. Обратная связь показывает, какой из четырёх аспектов оценки у вас самый слабый, а какой самый сильный, — чтобы вы знали, где взять следующий балл, а не гадали, что скрывается за цифрой.
- Что требовалось по заданию, но осталось без ответа. По критерию выполнения задания обратная связь перечисляет конкретные пункты задания, которые вы не раскрыли, либо прямо говорит, что вы раскрыли их все.
- То, что можно по-настоящему отрепетировать. Каждая рекомендация — это то, что можно проговорить вслух перед следующей попыткой. Никаких советов «говорить чётче» или «уменьшить акцент»: акцент не входит в то, что измеряет восприимчивость речи, и обратная связь никогда не комментирует его.
- Таймер не виноват. Если ответ обрывается по таймеру уже после того, как задание выполнено, за это обрывание баллы не снижаются, и обратная связь не упрекает вас за это.
Когда независимая модель-судья сравнила новую обратную связь с той, что выдавала наша прежняя система для тех же ответов, не зная, какая из них какая, она предпочла новую обратную связь в 20 из 24 сравнений — как при оценке с позиции экзаменатора, так и с позиции учащегося.
Часто задаваемые вопросы
Может ли ChatGPT оценивать мою устную практику CELPIP? Он выдаст вам число. При простом запросе на 48 незнакомых ответах с верифицированными оценками GPT 5.6 sol был прав в 35% случаев, GPT 5.5 — в 37%, luna — в 31%, GPT-4o mini — в 45%, против 81% у Engine 2.0. На ответах высшего уровня GPT 5.6 sol был прав в 25% случаев.
Точнее ли Prepamigo, чем ChatGPT? 81% против 35% у GPT 5.6 sol при простом запросе. При нашей полной процедуре с калибровочными примерами GPT 5.6 sol достиг 71%, всё равно отставая на десять пунктов.
Сколько стоит каждый вариант? ChatGPT Pro стоит US$200 в месяц, около CA$276 без налога; Plus стоит US$20 с лимитами сообщений. Prepamigo стоит CA$24.98 в месяц с учётом налога, или CA$8.25 в месяц по годовому тарифу, с безлимитным оцениванием и 80 практическими наборами.
Какую модель GPT использовать, если я всё же пользуюсь ChatGPT? При простом запросе ни одна не показывает хороший результат. С калибровочными примерами — GPT 5.6 sol. Никогда GPT-4o mini, если вы близки к уровню 10.
Для такого же сравнения с Claude читайте Prepamigo против Claude. Для полной таблицы лидеров из восьми систем читайте какой AI точнее оценивает CELPIP speaking. Или пропустите расшифровку и запишите ответ. Читайте эту статью на английском: Читать это руководство на английском.
