Доля ответов, оценённых на верифицированном уровне
48 отложенных ответов, по 16 на уровень. Каждая модель получала расшифровку и её просили, простыми словами, оценить её по шкале CELPIP; среднее по трём прогонам. Engine 2.0 работал в своей обычной production-конфигурации.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Prepamigo против лучших тарифов чат-ботов
Цены в канадских долларах. Тарифы Prepamigo указаны с учётом налога. Claude Max (от US$100) и ChatGPT Pro (US$200) пересчитаны по курсу 1.38, без учёта налога. Точность — доля отложенных ответов, получивших верифицированную оценку, когда указанной модели просто, без специальных инструкций, предлагали оценить ответ; среднее по трём прогонам.
Немало кандидатов CELPIP сейчас оценивают собственную устную практику с помощью AI-чат-бота. Записать ответ, расшифровать его, вставить и попросить оценку. Это быстро и бесплатно или почти бесплатно, а объяснения звучат авторитетно. Никто не говорит вам, как часто это число верно, какой модели доверять и меняет ли ответ способ, которым вы спрашиваете. Мы хотели это узнать, поэтому построили тест и запустили его на восьми системах, двумя способами.
Первый способ — график выше: вставить расшифровку, попросить оценку, так, как это делает студент. Среди универсальных моделей Claude Opus 5 был самым точным с 62%, за ним следовал Gemini с 58%, а всё остальное было ниже половины: Claude Sonnet 5 и GPT-4o mini с 45%, GPT 5.5 с 37%, GPT 5.6 sol с 35%, GPT 5.6 luna с 31%. Специализированная система, Prepamigo Scoring Engine 2.0, достигла 81% на тех же ответах.
Второй способ — тот, который мы считаем самым информативным: мы дали каждой модели нашу собственную процедуру оценивания с реальными калибровочными примерами и принудительным сравнением, чтобы увидеть предельные возможности каждой. Каждая модель улучшилась, некоторые значительно, и каждая всё равно закончила позади Engine 2.0. Стоит честно сказать: Prepamigo — наш собственный продукт. Мы старались сделать оба теста честными для всех остальных, и там, где какая-то модель обошла нас на конкретном уровне, мы это говорим.
Таблица лидеров при простом запросе
На графике в начале статьи видны три уровня. Engine 2.0 с 81% стоит отдельно. Claude Opus 5 с 62% и Gemini с 58% образуют второй уровень: пригодный к использованию, если вы готовы ошибаться два раза из пяти. Всё остальное ниже 50%, то есть хуже, чем подброшенная монета между тремя уровнями, если бы вы вообще ничего не знали об ответе.
Это определяющая черта простого теста: каждая универсальная модель оценивает жёстко. Средняя оценка, которую они ставили верифицированному ответу высшего уровня, была от 7,2 (luna) до 8,6 (Opus 5). Средняя оценка, которую они ставили верифицированному ответу низкого уровня, была от 3,7 до 4,3, ниже уровня для всех, кроме Opus 5 и Gemini. Не имея примеров того, как звучит каждый уровень, модели сравнивают ответ с воображаемым идеальным и снимают баллы.
Результаты на каждом уровне оценки
Общая цифра скрывает, где именно возникают ошибки, а от того, где они возникают, зависит, полезен ли оценщик именно вам. Вот результаты простого теста по уровням.
Ответы низкого уровня (верифицированная оценка 4 или 5)
16 отложенных ответов на систему, простой запрос, среднее по трём прогонам.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
75%
GPT-4o mini
56%
Gemini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
44%
Claude Sonnet 5
Слабые ответы должны быть лёгким краем шкалы, а при простом запросе это не так. Engine 2.0 показывает 88%, Opus 5 — 77%, GPT-4o mini — 75%. Всё остальное около половины, а Sonnet 5 — 44%. Промах почти всегда — оценка 3: модель видит слабый ответ и оценивает его ниже уровня, а не в нём. Приличная цифра GPT-4o mini здесь — первый признак его проблемы, которая в том, что он оценивает почти всё низко.
Ответы среднего уровня (верифицированная оценка 7 или 8)
16 отложенных ответов на систему, простой запрос, среднее по трём прогонам.
85%
Prepamigo Engine 2.0
63%
Gemini
63%
Claude Sonnet 5
58%
Claude Opus 5
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
Средний уровень разделяет поле участников. Engine 2.0 показывает 85%. Gemini и Sonnet 5 — 63%, Opus 5 — 58%. Затем обрыв: GPT-4o mini — 44%, а три более крупные модели GPT — от 27% до 29%. Ответы среднего уровня содержат реальную смесь сильных и слабых сторон, которую нужно взвешивать, и, не имея ничего для сравнения, модели GPT замечают слабости и ставят 5 или 6. Спикер уровня 7 или 8, спрашивающий у GPT 5.6 sol оценку, услышит верный уровень менее трёх раз из десяти.
Ответы высшего уровня (верифицированная оценка 10 и выше)
16 отложенных ответов на систему, простой запрос, среднее по трём прогонам. Почти каждый промах — оценка 7 или 8.
71%
Prepamigo Engine 2.0
56%
Gemini
50%
Claude Opus 5
29%
Claude Sonnet 5
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
Высший уровень — то место, где различия важнее всего и где простой запрос наносит больше всего вреда. Engine 2.0 распознаёт 71% ответов высшего уровня. Gemini распознаёт 56%, а Opus 5 — ровно половину. Затем Sonnet 5 с 29%, GPT 5.5 с 27%, GPT 5.6 sol с 25%, GPT-4o mini с 17% и GPT 5.6 luna с 13%. Пять из семи универсальных моделей ставят 7 или 8 хотя бы семи из каждых десяти ответов, заслуживающих 10.
Если вы сильный кандидат, оценивающий себя чат-ботом, это цифра, которую стоит запомнить. Шанс, что простой запрос к GPT 5.6 sol скажет вам, что 10 — это 10, составляет один к четырём.
Вторая таблица лидеров: при нашей полной процедуре
Цифры простого теста — не вердикт об уме этих моделей. Это вердикт о том, что происходит, когда модель просят назвать число, не давая ничего для сравнения. Поэтому мы провели второй тест, дав каждой модели калибровочные примеры и принудительное сравнение, которые используют собственные оценщики Engine 2.0.
При нашей полной процедуре: доля ответов, оценённых на верифицированном уровне
Те же 48 отложенных ответов. Одни и те же расшифровки, инструкции и калибровочные примеры для каждой системы; каждая модель оценивала каждый ответ один раз. Gemini также получил аудио.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
71%
GPT 5.6 sol
71%
Gemini
69%
GPT 5.5
69%
Claude Sonnet 5
63%
GPT 5.6 luna
50%
GPT-4o mini
Каждая модель улучшается. Opus 5 идёт с 62% до 77%. GPT 5.6 sol удваивает результат — с 35% до 71%. GPT 5.5 растёт с 37% до 69%, Sonnet 5 — с 45% до 69%, luna — с 31% до 63%, Gemini — с 58% до 71%. GPT-4o mini почти не сдвигается — с 45% до 50%, потому что оценивает всё низко независимо от того, что ей показывают.
Порядок также меняется. При простом запросе модели Claude были далеко впереди моделей GPT. При полной процедуре GPT 5.6 sol обходит Sonnet 5 и сравнивается с Gemini, и четыре модели собираются в диапазоне 69–71%, статистически неразличимые на этой выборке. Opus 5 остаётся на вершине среди универсальных моделей с 77%, на четыре пункта позади Engine 2.0.
На уровне отдельных показателей полная процедура поднимает точность на низком уровне до 88% у четырёх моделей — столько же, сколько у Engine 2.0, а точность на среднем уровне до 81% у обеих моделей Claude. Высший уровень — то место, где разрыв сохраняется: Opus 5, GPT 5.6 sol, Gemini и GPT 5.5 все останавливаются на 63%, Sonnet 5 — на 38%, а GPT-4o mini — на нуле, против 71% у Engine 2.0. Одна модель, делающая один проход, всё равно сдерживается перед сильным ответом с небольшой шероховатостью. Engine 2.0 закрывает этот оставшийся разрыв двумя независимыми оценщиками от разных провайдеров, тремя голосами от каждого с сохранением среднего голоса и правилом согласования, которое берёт более высокую оценку, когда два оценщика сильно расходятся, потому что анализ показал: на сильных ответах более низкий вердикт почти всегда был неверным.
Почему модели смещаются вниз и к середине
Паттерн настолько стабилен среди моделей от трёх разных компаний, что не может быть особенностью какой-то одной из них. Это свойство самой задачи.
Когда модель просят разместить ответ на шкале, она при неуверенности смещается к центру, потому что центр — место, где неверный ответ стоит меньше всего. А когда у неё нет примеров того, как звучит уровень на самом деле, она сравнивает ответ с воображаемым идеальным и снимает баллы за каждую оговорку. Ответ высшего уровня никогда не безупречен. В нём есть самоповтор, простое предложение среди сложных, хезитация перед трудным словом. Измеренные относительно идеала, эти недочёты стоят отметку или две, и 10 превращается в 8 или 7.
Инструкции этого не исправляют. Мы пробовали прямо говорить моделям, что уровень 9 не требует безошибочного ответа, что недооценка сильного ответа настолько же серьёзна, как переоценка слабого. Каждую инструкцию принимали и затем игнорировали на практике. Когда мы дали модели именно тот калибровочный пример, о котором ей сказали, что он представляет ответ высшего уровня, и попросили его оценить, она поставила ему 8.
Что действительно помогает — это изменение вопроса с «какое число?» на «какой пример?» и предоставление реальных примеров. Это и есть разница между двумя таблицами лидеров. Даже тогда один проход всё равно немного смещается, потому что калибровочные примеры не идеальны, а одно их прочтение — это одно прочтение. Два оценщика, три голоса и правило согласования закрывают остальное.
Заметки о каждой модели
- Claude Opus 5. Лучший универсальный оценщик в обоих тестах: 62% при простом запросе (62%, 65% и 58% в трёх прогонах) и 77% при полной процедуре. Его слабость при простом запросе — средний уровень, где он ставит 6; его слабость при полной процедуре — высший уровень, где он останавливается на 63%. Это также самая дорогая модель здесь, с большим отрывом.
- Gemini. Второй в простом тесте с 58%, одинаково во всех трёх прогонах, и самый равномерный по уровням, с 56%, 63% и 56%. При полной процедуре и с аудиозаписью достиг 71%, на одном уровне с GPT 5.6 sol, который работал только с текстом. Прослушивание записи не помогло сверх того, что даёт буквальная расшифровка.
- Claude Sonnet 5. 45% при простом запросе, с необычным профилем: неплохо в среднем уровне — 63%, слабо на слабых ответах — 44%, потому что ставит им 3, и слабо на высшем уровне — 29%. При полной процедуре поднимается до 69%, но остаётся на 38% на ответах высшего уровня. Если Sonnet 5 постоянно ставит вам 8, не верьте этому.
- GPT-4o mini. 45% при простом запросе, 50% при полной процедуре, и в обоих случаях цифра льстит модели. Она оценивает почти всё низко: 75% на слабых ответах, 17%, а затем 0% на ответах высшего уровня. Что бы вы ни делали, не оценивайте свою речь этой моделью.
- GPT 5.5. 37% при простом запросе (35%, 42%, 33%), 69% при полной процедуре. Его средний уровень при простом запросе — 29%. Он был текстовым оценщиком в более ранней версии нашего собственного конвейера и был заменён именно из-за слабости в этом уровне.
- GPT 5.6 sol. 35% при простом запросе (31%, 40%, 35%) — самый большой разброс между прогонами среди всех моделей, и 71% при полной процедуре — самое большое улучшение среди всех моделей. Способный оценщик, когда ему показывают примеры, и слабый, когда не показывают. Его привычка при полной процедуре — переоценивать гладкость в среднем уровне.
- GPT 5.6 luna. Последняя в обоих тестах: 31% при простом запросе и 63% при полной процедуре. Она стягивает средние ответы к 5 и распознала 13% ответов высшего уровня при простом запросе. Достаточно дешёвая, чтобы быть полезной как второе мнение внутри системы с двумя оценщиками; недостаточно точная, чтобы использовать её одну.
Что добавляет специализированная система
Engine 2.0 — не более совершенная модель. Он использует модели из этой же таблицы лидеров. Что он добавляет — это процедура, и каждая часть этой процедуры была выбрана на основе измерения.
- Буквальная транскрипция автоматически. Сохраняется каждое слово-паразит и самоповтор, потому что их удаление снизило точность на пятнадцать пунктов в тестах. Вам не нужно искать инструмент транскрипции, который это делает; большинство потребительских инструментов очищают текст по умолчанию.
- Калибровочные примеры, прикреплённые к каждому заданию. Два реальных ответа на уровень для каждого из восьми типов заданий, уже готовые. Это единственный ввод, удвоивший точность GPT 5.6 sol, и его нельзя создать дома.
- Сравнение, а не число. Каждый оценщик называет ближайший пример по каждому из четырёх измерений; оценка выводится по правилу. Именно это останавливает смещение.
- Два оценщика от двух провайдеров. У разных моделей разные слепые зоны. Два из них, согласованные фиксированным правилом, превосходят каждый по отдельности.
- Три голоса от каждого, сохраняется средний. Это не повысило точность, но подняло стабильность между прогонами с 77% до 87,5%. Один ответ чат-бота — это один голос.
- Согласование, берущее более высокую оценку при сильном разногласии. Потому что более низкий вердикт почти всегда был неверным на сильных ответах. Простое усреднение падало до середины шестидесятых в тестах.
- Защитные механизмы. Молчание, ответы из нескольких слов, ответы не по теме и не на английском получают нижнюю пороговую оценку по правилу, а не по догадке модели.
Результат — 81% в общем и 71% на высшем уровне, одинаково в трёх отдельных прогонах, примерно за десять секунд на ответ, без необходимости что-либо вставлять.
Если вы всё же собираетесь использовать чат-бота
Некоторые читатели продолжат оценивать себя с помощью чат-бота, и это разумный выбор для кандидата с ограниченным бюджетом или для того, кто хочет обсуждать свои ответы. Эти шаги — разница между двумя таблицами лидеров, и они приблизят вас ко второй, а не к первой.
- Используйте буквальную расшифровку. Сохраняйте слова-паразиты, самоповторы и самоисправления. Если ваш инструмент транскрипции их вычищает, оценщик оценивает ответ лучше, чем вы дали на самом деле.
- Дайте ей примеры, а не рубрику. Один-два реальных ответа каждого уровня для того же типа задания, с указанными уровнями, дают больше, чем любое описание того, как выглядит уровень 9. Если у вас нет верифицированных примеров, это шаг, который нельзя воспроизвести дома, и это тот шаг, который важнее всего.
- Спрашивайте, какой пример, а не какое число. Для каждого из четырёх измерений просите модель назвать ближайший пример и запретите «где-то между». Выводите оценку сами из уровней, которые она назвала.
- Спрашивайте больше одного раза. Оценивайте один и тот же ответ два-три раза в новых разговорах и сохраняйте средний ответ. GPT 5.6 sol колебался на девять пунктов между прогонами в простом тесте.
- Выбирайте модель с хорошим результатом на высшем уровне. Opus 5 или Gemini при простом запросе; Opus 5 или GPT 5.6 sol, если у вас есть примеры. Никогда GPT-4o mini, если вы близки к уровню 10.
- Не доверяйте оценке 7 или 8. На любой универсальной модели 7 или 8 на ответе, который вы считали превосходным, скорее промах, чем вердикт.
Какой модели доверять, в зависимости от вашего уровня
Правильное чтение этих таблиц лидеров зависит от вашего текущего уровня, потому что модели ошибаются в разных местах.
- Если вы сегодня на уровне 4 или 5, Opus 5 при простом запросе скажет вам об этом примерно три раза из четырёх; большинство других моделей примерно в половине случаев назовут вас 3. Ваша проблема не столько в оценщике; она в обратной связи, а для неё нужно что-то, цитирующее ваши слова, а не пересказывающее их.
- Если вы на уровне 7 или 8, избегайте моделей GPT при простом запросе — они назовут вас 5 или 6 семь раз из десяти. Gemini и Sonnet 5 — самые надёжные оценщики при простом запросе в среднем уровне, с 63%. Engine 2.0 — 85%.
- Если вы на уровне 10 и выше, здесь выбор важнее всего. При простом запросе ни одна универсальная модель не распознает 10 более чем в 56% случаев, а модели GPT сделают это от 13% до 27% случаев. Engine 2.0 распознаёт семь из десяти и, что важнее, даёт один и тот же ответ каждый раз, когда вы спрашиваете.
Паттерн на всех трёх уровнях один и тот же, о котором говорит вся статья. Модели не глупы; они осторожны, а осторожность без всего для сравнения означает низкое число. Чем дальше вы от середины, тем больше вам стоит осторожность оценщика, и тем важнее, что оценщик был создан, чтобы противостоять ей.
Что нового в обратной связи
Engine 2.0 включает полностью переработанный слой обратной связи. Он анализирует не только итоговую оценку, но и обоснования обоих экзаменаторов, и был проверен на трёх типах учащихся: тех, кто впервые сталкивается с CELPIP, тех, кто слабо знает английский и ищет «секрет», и тех, у кого есть всего полчаса в день и экзамен уже на следующей неделе. Вот что изменилось.
- Ваши слова, процитированные вам. Каждый пункт обратной связи ссылается на точную фразу из расшифровки вашего ответа, на которую отреагировали экзаменаторы. Если фраза взята в кавычки, значит, она процитирована буквально: в нашей проверке это подтвердилось для 157 из 158 цитат. Обратная связь никогда не придумывает то, чего вы не говорили.
- Что исправить первым. Для каждого ответа выделяется одно главное действие: изменение, которое сильнее всего повысит вашу оценку, сформулированное максимально простыми словами. За ним следуют ещё два конкретных шага, а затем — чек-лист из трёх пунктов, который нужно держать в голове перед началом ответа.
- Советы, подходящие именно этому заданию. Совет, описание сцены и попытка кого-то убедить оцениваются по разным критериям. Теперь обратная связь учитывает, что именно вознаграждается в каждом из восьми типов заданий, и говорит об этом напрямую, а не повторяет одни и те же общие советы для всех заданий.
- Какой аспект тренировать первым. Обратная связь показывает, какой из четырёх аспектов оценки у вас самый слабый, а какой самый сильный, — чтобы вы знали, где взять следующий балл, а не гадали, что скрывается за цифрой.
- Что требовалось по заданию, но осталось без ответа. По критерию выполнения задания обратная связь перечисляет конкретные пункты задания, которые вы не раскрыли, либо прямо говорит, что вы раскрыли их все.
- То, что можно по-настоящему отрепетировать. Каждая рекомендация — это то, что можно проговорить вслух перед следующей попыткой. Никаких советов «говорить чётче» или «уменьшить акцент»: акцент не входит в то, что измеряет восприимчивость речи, и обратная связь никогда не комментирует его.
- Таймер не виноват. Если ответ обрывается по таймеру уже после того, как задание выполнено, за это обрывание баллы не снижаются, и обратная связь не упрекает вас за это.
Когда независимая модель-судья сравнила новую обратную связь с той, что выдавала наша прежняя система для тех же ответов, не зная, какая из них какая, она предпочла новую обратную связь в 20 из 24 сравнений — как при оценке с позиции экзаменатора, так и с позиции учащегося.
Часто задаваемые вопросы
Какая AI-модель точнее всего оценивает CELPIP speaking? При простом запросе: Claude Opus 5 с 62%, Gemini с 58%, Claude Sonnet 5 и GPT-4o mini с 45%, GPT 5.5 с 37%, GPT 5.6 sol с 35%, GPT 5.6 luna с 31%. Prepamigo Scoring Engine 2.0 достигла 81% на тех же ответах.
ChatGPT или Claude? Claude, однозначно, при простом запросе: 62% и 45% против 35% и 37%. При нашей полной процедуре разрыв сокращается до 77% у Opus 5 против 71% у GPT 5.6 sol.
Почему они все ставят моим сильным ответам 7 или 8? Модели, у которых нет ничего для сравнения, угадывают низко и к середине, а сильный ответ всегда содержит мелкие недочёты. При простом запросе ни одна универсальная модель не распознала более 56% ответов высшего уровня.
Как получить лучшую оценку от чат-бота? Буквальная расшифровка, примеры ответов каждого уровня, вопрос «какой пример», а не «какое число», спросить более одного раза и сохранить средний ответ. Эта процедура удвоила результат GPT 5.6 sol с 35% до 71% в нашем тесте.
Для более близкого взгляда на два прямых сравнения читайте Prepamigo против Claude и Prepamigo против ChatGPT. Чтобы узнать, как работает процедура шаг за шагом, читайте внутри Scoring Engine 2.0. Или запишите ответ и пропустите расшифровку. Читайте эту статью на английском: Читать это руководство на английском.
