Pontuação

Apresentando o Prepamigo Scoring Engine 2.0 para Speaking

6 de setembro de 2026

Prepamigo Scoring Engine 2.0 vs. modelos de ponta como corretores

Porcentagem de respostas de speaking em que a nota coincidiu com a nota verificada de forma independente. 48 respostas que os sistemas nunca tinham visto, distribuídas igualmente entre notas baixas, médias e altas. Cada modelo recebeu a transcrição e foi solicitado, em linguagem simples, a pontuá-la na escala do CELPIP; média de três execuções.

81%

Prepamigo Scoring Engine 2.0Prepamigo

62%

Claude Opus 5Anthropic

58%

GeminiGoogle

45%

Claude Sonnet 5Anthropic

45%

GPT-4o miniOpenAI

37%

GPT 5.5OpenAI

35%

GPT 5.6 solOpenAI

31%

GPT 5.6 lunaOpenAI

Prepamigo comparado aos planos de chatbot mais populares

Em dólares canadenses. Os preços da Prepamigo já incluem impostos. Claude Max (a partir de US$100) e ChatGPT Pro (US$200) foram convertidos à taxa de 1,38, antes de impostos. A precisão é a porcentagem de respostas do conjunto de teste pontuadas no nível verificado quando o modelo indicado é solicitado, em linguagem simples, a pontuar a resposta; média de três execuções.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Preço mensal
CA$24.98 (c/ imposto)
CA$138+ (s/ imposto)
CA$276 (s/ imposto)
Pontuação
Ilimitada
Limitada
Limitada
Banco de questões pronto
Sim
Não
Não
Conjuntos de prática
80
Nenhum
Nenhum
Tarefas de prática
2,000+
Nenhuma
Nenhuma
Formato CELPIP
Sim
Não
Não
Precisão
81%
62%
35%
Respostas de nível alto
71%
50%
25%

Nosso corretor de speaking mais preciso até agora. Em respostas que nunca tinha visto, o Prepamigo Scoring Engine 2.0 acertou as notas verificadas 81% das vezes, na frente de todo modelo de ponta que testamos na mesma função, e um salto claro em relação ao Engine 1.0, o corretor que ele substitui.

Hoje estamos lançando o Prepamigo Scoring Engine 2.0 para Speaking, o sistema que avalia toda resposta de prática falada na Prepamigo. O Engine 2.0 é um redesenho completo de como pontuamos. No lugar de uma única passagem de correção, ele usa dois corretores independentes que comparam cada resposta diretamente com exemplos calibrados, votam várias vezes e reconciliam suas respostas antes de a nota aparecer.

O resultado é um corretor muito mais preciso do que qualquer modelo de ponta usado do jeito que um estudante usaria. Em um conjunto reservado de respostas orais reais com notas verificadas de forma independente, o Engine 2.0 acertou a nota correta 81% das vezes. Quando pedido em linguagem simples para pontuar as mesmas transcrições, o mais forte deles, a Claude Opus 5, chegou a 62%. O Gemini chegou a 58%. A Claude Sonnet 5 e a GPT-4o mini chegaram a 45%, a GPT 5.5 a 37%, a GPT 5.6 sol a 35%, e a GPT 5.6 luna a 31%. Quando demos a cada modelo o próprio procedimento do Engine 2.0, com exemplos reais de calibração para cada tarefa, o melhor deles subiu para 77% e ainda ficou atrás.

A precisão importa mais justamente onde é mais difícil alcançá-la. O Engine 2.0 reconhece uma resposta de nível alto 71% das vezes. Quando pedido de forma simples, nenhum outro modelo reconheceu mais de 56%, e os modelos da GPT reconheceram entre 13% e 27%. O Engine 2.0 também resiste à falha mais comum dos corretores automatizados: notas que tendem para baixo e para o meio da escala, independentemente de a resposta ser forte ou fraca. Essa tendência era a fraqueza que víamos com mais frequência no Engine 1.0.

O Engine 2.0 é mais rápido, mais consistente, e produz feedback que cita as próprias palavras do estudante. Ele está no ar hoje para todo usuário da Prepamigo. Esta página explica o que ele faz, como medimos, e onde ainda estão seus limites.

Precisão contra notas verificadas

A pergunta que nos importa é simples. Quando um estudante grava uma resposta, a nota na tela corresponde à nota que um corretor de confiança teria dado? Para responder, construímos um conjunto de teste com respostas orais reais nos oito tipos de tarefa de speaking, cada uma com uma nota verificada de forma independente, e dividimos o conjunto igualmente entre notas baixas, médias e altas, para que nenhum nível pudesse dominar o resultado.

A comparação usa 48 dessas respostas, reservadas desde o início. Ninguém da equipe as usou ao construir ou ajustar o Engine 2.0. Cada resposta foi transcrita palavra por palavra. Cada modelo então recebeu a informação de que era um examinador experiente do CELPIP, o enunciado da tarefa e a transcrição, e foi pedido a pontuar a resposta de 0 a 12, três vezes, em dias diferentes. Tiramos a média das três execuções e contamos com que frequência a nota coincidiu com o nível da nota verificada.

51%

menos erros do que a Claude Opus 5

19 notas erradas em cada 100 respostas, contra 38.

71%

menos erros do que a GPT 5.6 sol

19 notas erradas em cada 100, contra 65.

71%

das respostas de nível alto reconhecidas

O melhor dos outros modelos reconhece 56%; a GPT 5.6 sol reconhece 25%.

Três coisas se destacam nesses números. Primeiro, a diferença não é pequena. Dezenove pontos contra o modelo de ponta mais forte e quarenta e seis contra o modelo por trás dos planos pagos do ChatGPT, em um teste de 48 respostas, é a diferença entre nove e vinte e duas notas corretas extras. Segundo, a diferença não é fruto de um teste amigável. As 48 respostas foram escolhidas antes de o design do Engine 2.0 estar finalizado e nunca foram tocadas durante o desenvolvimento. Terceiro, a comparação é a que importa para um estudante: ela mede o que você recebe quando cola uma transcrição em um chatbot e pede, que é como quase todo mundo usa esses modelos.

Uma palavra sobre o que “correto” significa aqui. Notas verificadas nesta escala vêm em níveis, e não em pontos únicos, então contamos uma nota como correta quando ela cai dentro do nível verificado. Uma resposta verificada no nível alto, por exemplo, é pontuada corretamente se o motor der a ela um 9, 10 ou 11. Sob uma leitura mais estrita que só aceita 10 ou mais, todo sistema perde alguns pontos e o ranking não muda.

SistemaPedido simplesCom nosso procedimento completo
Prepamigo Scoring Engine 2.081.3%
Claude Opus 561.8%77.1%
Gemini58.3%70.8%
Claude Sonnet 545.1%68.8%
GPT-4o mini45.1%50.0%
GPT 5.536.8%68.8%
GPT 5.6 sol35.4%70.8%
GPT 5.6 luna30.6%62.5%

Desempenho em cada nível de nota

Um número de precisão médio pode esconder muita coisa. Um corretor excelente em respostas fracas e péssimo em respostas fortes pode apresentar um número respeitável enquanto falha justamente com os estudantes que mais precisam de uma resposta precisa. Então relatamos a precisão separadamente para cada um dos três níveis no conjunto de teste: notas baixas de 4 ou 5, notas médias de 7 ou 8, e notas altas de 10 ou mais.

A maioria dos corretores, humanos ou de máquina, tende para o meio. Uma resposta forte recebe um 8 em vez de um 10. Uma fraca recebe um 6 em vez de um 5. Sem nada para comparar, os modelos de ponta somam um segundo hábito: tendem para baixo, de modo que uma resposta fraca costuma ser pontuada com um 3 e uma forte com um 7. O Engine 2.0 foi construído especificamente para resistir a essas duas tendências, e os resultados mostram isso com mais clareza no topo da escala.

Notas baixas · nota verificada de 4 ou 5

16 respostas reservadas por sistema, pedido simples, média de três execuções.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

Notas médias · nota verificada de 7 ou 8

16 respostas reservadas por sistema, pedido simples, média de três execuções.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

Notas altas · nota verificada de 10 ou mais

16 respostas reservadas por sistema, pedido simples, média de três execuções. Quase todo erro é um 7 ou 8.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

Para estudantes que já são fortes, essa é a diferença que importa. Quando pedido de forma simples, nenhum dos outros modelos reconhece mais de 56% das respostas de nível alto; a GPT 5.6 sol reconhece uma em cada quatro, e a GPT 5.6 luna, uma em cada oito. O Engine 2.0 reconhece 71%.

No nível baixo, o Engine 2.0 lidera com 88%, com a Claude Opus 5 em 77% e a GPT-4o mini em 75%. Todo outro modelo fica em torno da metade, e a Claude Sonnet 5 está em 44%. O erro é quase sempre um 3: o modelo vê uma resposta fraca e a pontua abaixo do nível em vez de dentro dele. O número respeitável da GPT-4o mini aqui é o primeiro sinal do seu problema, que é pontuar quase tudo para baixo; no topo da escala, ela reconhece uma resposta em cada seis.

No nível médio, o Engine 2.0 lidera com 85%. O Gemini e a Claude Sonnet 5 estão em 63%, a Claude Opus 5 em 58%, e depois um precipício: a GPT-4o mini em 44% e os três modelos maiores da GPT entre 27% e 29%. Respostas de nível médio contêm uma mistura de forças e fraquezas que precisa ser pesada em vez de simplesmente notada, e sem nada para comparar, os modelos da GPT veem as fraquezas e dão um 5 ou 6.

No nível alto, a diferença é maior. O Engine 2.0 identifica corretamente 71% das respostas de nível alto. O Gemini identifica 56% e a Opus 5, exatamente a metade. Cinco dos outros sete modelos dão um 7 ou 8 a pelo menos sete de cada dez respostas que mereciam um 10. Este é o problema da tendência ao meio em sua forma mais pura. Uma resposta de nível alto não é perfeita; ela contém o deslize ocasional, uma retomada, uma frase simples entre as complexas, e um corretor que a mede contra uma resposta perfeita imaginária desconta por cada uma. O Engine 2.0 é calibrado contra exemplos que mostram como uma resposta real de nível alto se parece, deslizes inclusos, e é explicitamente projetado para comparar contra esses exemplos em vez de contra a perfeição.

E se você der a eles o nosso procedimento completo?

Os números do pedido simples não são um veredito sobre o quão inteligentes esses modelos são. São um veredito sobre o que acontece quando um modelo é pedido para dar um número sem nada para comparar. Então rodamos um segundo teste, dando a cada modelo exatamente o que os corretores do próprio Engine 2.0 recebem: a transcrição, a tarefa, dois exemplos reais de calibração em cada nível para aquela tarefa específica, e uma instrução para nomear o exemplo mais próximo em cada uma das quatro dimensões, em vez de produzir um número. Cada modelo também recebeu uma breve nota de calibração ajustada às suas próprias tendências.

Com o nosso procedimento completo: porcentagem de respostas pontuadas no nível verificado

Mesmas 48 respostas reservadas. Mesmas transcrições, instruções e exemplos de calibração para todo sistema; cada modelo avaliou cada resposta uma vez.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

Todo modelo melhora, alguns drasticamente. A GPT 5.6 sol dobra, de 35% para 71%. A Opus 5 sobe de 62% para 77%. A GPT-4o mini quase não se move, de 45% para 50%, porque pontua tudo para baixo independentemente do que é mostrado a ela. E todo modelo ainda termina atrás do Engine 2.0. No topo da escala a diferença persiste: a Opus 5, a GPT 5.6 sol, o Gemini e a GPT 5.5 todos ficam em 63% das respostas de nível alto, a Sonnet 5 em 38%, a GPT-4o mini em zero, contra 71% do Engine 2.0.

Este segundo teste mostra onde realmente está o valor do Engine 2.0. Não é um modelo mais inteligente; ele usa modelos desta mesma lista. É exemplos reais de como cada nível soa em cada tarefa específica, uma pergunta que força o modelo a comparar em vez de chutar, e depois mais três coisas que uma única passagem não consegue oferecer: dois corretores independentes de provedores diferentes, três votos de cada um mantendo o voto do meio, e uma regra de reconciliação que adota a nota mais alta quando os dois corretores discordam fortemente, porque a análise mostrou que o veredito mais baixo quase sempre era o errado em respostas fortes.

Consistência e estabilidade

Um corretor em que se pode confiar precisa ser consistente. Se a mesma gravação pode receber um 8 hoje e um 10 amanhã, nenhum dos dois números significa muita coisa, e um estudante não consegue saber se sua prática está funcionando. Então, além da precisão, medimos se o Engine 2.0 dá a mesma resposta quando a mesma pergunta é feita duas vezes.

Rodamos o Engine 2.0 sobre as 48 respostas reservadas três vezes separadas, em dias diferentes, sem nada mudar entre elas. Ele pontuou 81.3% em cada execução. Não aproximadamente 81%: as mesmas 39 respostas corretas em 48, com uma margem de uma para mais ou menos, todas as vezes. Quando olhamos para respostas individuais em vez do agregado, 87.5% receberam uma nota idêntica nas três execuções, e apenas 4.2% chegaram a se mover por dois pontos ou mais entre execuções. Essas poucas são respostas que ficam exatamente na fronteira entre dois níveis, onde uma pequena diferença de julgamento legitimamente pode inclinar a nota para um lado ou para o outro.

O teste do pedido simples nos modelos de ponta se moveu muito mais entre execuções. A GPT 5.6 sol pontuou 31%, 40% e 35% em suas três execuções; a Opus 5 pontuou 62%, 65% e 58%. Peça a um chatbot para avaliar a mesma transcrição em dois dias diferentes e, com uma frequência considerável, você vai receber duas notas diferentes.

A consistência vem de duas decisões de design. Cada um dos dois corretores do Engine 2.0 vota três vezes em cada resposta e o voto do meio é mantido, o que remove o eventual valor fora da curva que uma única passagem produziria. E os veredictos dos dois corretores são reconciliados por uma regra fixa em vez de por outro modelo, então o mesmo par de veredictos sempre produz a mesma nota final. As duas decisões foram testadas diretamente: com um único voto em vez de três, a concordância entre execuções caiu de 87.5% para 77.1%, e a porcentagem de respostas que saltam dois pontos ou mais mais do que dobrou.

Como o Engine 2.0 avalia uma resposta

O Engine 2.0 não é um único modelo. É um procedimento, e o procedimento é o que faz a diferença. Aqui está o que acontece nos cerca de dez segundos entre o estudante apertar o botão de parar e uma nota aparecer na tela.

  1. A gravação é transcrita palavra por palavra. Toda hesitação, toda retomada, toda autocorreção é mantida. Isso se mostrou essencial. Quando testamos uma transcrição “higienizada”, com as hesitações removidas, a precisão caiu quinze pontos, porque as hesitações fazem parte da evidência que um corretor precisa para julgar como uma resposta soa.
  2. Dois corretores independentes leem a transcrição. Eles são construídos sobre modelos subjacentes diferentes de provedores diferentes, então não compartilham os mesmos pontos cegos. Cada corretor recebe o enunciado da tarefa, a transcrição, e um pequeno conjunto de exemplos de calibração para aquela tarefa exata: respostas reais nos níveis baixo, médio e alto, duas por nível, de modo que cada nível é mostrado como uma faixa em vez de um ponto único.
  3. Cada corretor compara em vez de pontuar. Esta é a mudança central em relação ao Engine 1.0. Em vez de ser pedido a dar um número, cada corretor é perguntado, para cada uma das quatro dimensões da resposta, com qual exemplo de calibração ela mais se parece. Não existe a opção “algo entre os dois”. Ter que se comprometer com o exemplo mais próximo é o que impede a tendência ao meio. A nota é então derivada do nível escolhido por uma regra fixa, e não pelo modelo.
  4. Cada corretor vota três vezes. O voto do meio em cada dimensão é mantido. Isso remove a resposta ocasional de um dia ruim sem tirar a média do julgamento genuíno.
  5. Os dois veredictos são reconciliados. Se os corretores concordam ou diferem por um único ponto, a nota final é a média deles. Se diferem por dois pontos ou mais, usa-se a nota mais alta. Essa regra não é generosidade; é calibração. Quando analisamos todos os casos em que os dois corretores discordaram fortemente, o veredito mais baixo quase sempre era o errado, porque a discordância quase sempre surgia em uma resposta de nível alto sobre a qual um dos corretores tinha sido cauteloso demais.
  6. Salvaguardas são aplicadas. Um pequeno conjunto de regras fixas trata casos sobre os quais nenhum corretor deveria precisar chutar: uma resposta que é silenciosa, tem poucas palavras, está em outro idioma, ou é totalmente fora do tema recebe uma nota mínima independentemente do que os corretores retornarem. Em testes, o silêncio recebeu um 3, uma resposta de poucas palavras um 4, e uma resposta fora do tema ou não em inglês um 5, sem falhas em todo o conjunto.

Duas propriedades do design final merecem destaque. O Engine 2.0 avalia a partir apenas da transcrição, então não precisa do áudio depois da transcrição e não depende do modelo de áudio de nenhum provedor específico. E como os dois corretores são de provedores diferentes, se um deles estiver indisponível, o outro continua, com um terceiro modelo entrando no lugar para que uma nota sempre seja produzida.

O que há de novo no seu feedback

O Engine 2.0 vem com uma camada de feedback totalmente reconstruída. Ela lê as evidências dos dois avaliadores, não apenas a nota, e foi testada com três tipos de aluno: alguém enfrentando o CELPIP pela primeira vez, alguém com inglês fraco em busca do truque, e alguém com meia hora por dia e uma prova na semana seguinte. Veja o que mudou.

  • Suas próprias palavras, citadas de volta. Cada ponto do feedback cita a frase exata da sua transcrição que motivou a reação dos avaliadores. Se uma frase está entre aspas, ela foi copiada literalmente; em nossa auditoria, 157 de 158 citações eram. O feedback nunca inventa algo que você não disse.
  • Uma coisa para corrigir primeiro. Cada resposta recebe uma única ação prioritária: a mudança que mais elevaria sua nota, escrita nas palavras mais simples da página. Depois vêm mais duas ações concretas e, por fim, uma lista de três itens para repassar mentalmente antes de começar a falar.
  • Conselhos que combinam com a tarefa. Dar um conselho, descrever uma cena e convencer alguém são avaliados por critérios diferentes. Agora o feedback sabe o que cada um dos oito tipos de tarefa recompensa e fala diretamente sobre isso, em vez de repetir as mesmas dicas genéricas em todas as tarefas.
  • Qual dimensão praticar primeiro. O feedback informa qual das quatro dimensões é sua mais fraca e qual é sua mais forte, para que você saiba onde está o próximo ponto, sem escondê-lo atrás de um número.
  • O que a tarefa pedia e você deixou passar. Para o cumprimento da tarefa, o feedback lista as partes específicas do enunciado que você não cobriu, ou diz claramente que você cobriu todas elas.
  • Coisas que você pode realmente ensaiar. Cada dica de como fazer é algo que você pode dizer em voz alta antes da próxima tentativa. Nenhum conselho para falar com mais clareza ou reduzir seu sotaque: sotaque não é o que a inteligibilidade mede, e o feedback nunca comenta sobre isso.
  • Sem culpar o cronômetro. Uma resposta interrompida pelo relógio depois de já ter cumprido a tarefa não é penalizada pela interrupção, e o feedback não o repreende por isso.

Quando um modelo avaliador independente comparou este feedback com o que nosso sistema anterior produzia para as mesmas respostas, sem saber qual era qual, ele preferiu o novo feedback em 20 de 24 comparações, tanto julgando como um examinador quanto julgando como um aluno julgaria.

Prática ilimitada por CA$25 por mês

A precisão só é útil se você puder se dar ao luxo de usá-la todos os dias. Uma nota de speaking confiável é mais valiosa na sua quadragésima resposta de prática, não na quarta, porque é nesse ponto que a nota começa a dizer se uma mudança no jeito que você fala está realmente funcionando. Então precificamos o Engine 2.0 para ser usado sem contar.

Todo plano da Prepamigo inclui pontuação ilimitada pelo Engine 2.0, tentativas ilimitadas, e o banco de questões completo: 80 conjuntos de prática completos e mais de 2,000 tarefas de prática em Speaking, Writing, Reading e Listening, escritas para seguir os tipos de tarefa, o tempo e o formato do teste CELPIP General. Você aperta gravar, recebe uma nota e feedback baseado em evidências em cerca de dez segundos, e pode fazer de novo quantas vezes quiser.

Prepamigo

CA$25/ mês

CA$24.98 por mês · CA$8.25 por mês no plano anual (CA$98.98 por ano) · impostos inclusos · cancele quando quiser

  • Pontuação ilimitada pelo Scoring Engine 2.0, sem limite diário, por sessão ou semanal.
  • 80 conjuntos de prática e mais de 2,000 tarefas em todas as quatro seções, modeladas no formato real do teste, então você nunca precisa escrever seus próprios enunciados.
  • Grave e siga. Transcrição, correção e feedback são feitos para você; não há nada para colar e nada para pedir.
  • Feedback nas suas próprias palavras, com toda citação rastreável ao que você realmente disse.

Claude Max, para comparação

US$100/ mês

cerca de CA$138 antes de impostos · nível 20x US$200 por mês · Pro US$20 com limites muito mais apertados

  • Até o Max tem limite. Uma janela de uso rotativa de cinco horas e um limite semanal, cinco ou vinte vezes o que o Pro permite; quando você atinge um dos dois, espera.
  • Sem banco de questões. Você traz suas próprias tarefas, decide por conta própria se elas se parecem com o teste real, e mantém o controle do que já praticou.
  • Você faz a preparação. Gravar, transcrever, colar a transcrição e escrever as instruções de correção ficam todos por sua conta, todas as vezes.
  • Um pedido simples, não um corretor calibrado. Quando pedida de forma simples, a Claude Opus 5 acertou as notas verificadas 62% das vezes e a Claude Sonnet 5, 45%, contra 81% do Engine 2.0.

Os preços e termos de uso dos planos da Claude são os publicados no claude.com em setembro de 2026 e podem mudar. CELPIP é uma marca registrada do seu proprietário; a Prepamigo é uma plataforma de prática independente e não é afiliada, endossada ou conectada ao criador do teste. As tarefas de prática da Prepamigo são material original escrito para seguir o formato público do teste.

Disponibilidade

O Prepamigo Scoring Engine 2.0 para Speaking está no ar agora para todos os usuários da Prepamigo em todo tipo de tarefa de speaking. Não há nada para ativar. Toda nova resposta de speaking é avaliada pelo Engine 2.0, e toda nota vem com feedback tirado das próprias palavras do estudante.

Uma resposta típica é avaliada em cerca de dez segundos, mais rápido do que o Engine 1.0. O Engine 2.0 também nos custa menos por resposta do que o design que ele substituiu, o que é o que nos permite rodar dois corretores com três votos cada para todo estudante sem mudar quanto a Prepamigo custa.

Vamos publicar atualizações dos números nesta página conforme a validação no mundo real descrita acima se conclui. Se você tem uma gravação que acredita que o Engine 2.0 pontuou errado, queremos ver: esses casos são o jeito mais rápido que conhecemos de encontrar a próxima melhoria.

Para as comparações direta a direta, leia Prepamigo vs Claude e Prepamigo vs ChatGPT. Ou grave uma resposta e veja o Engine 2.0 em ação. Leia também a versão original em Ler este guia em inglês.

Apresentando o Prepamigo Scoring Engine 2.0 para Speaking | PrepAmigo