Pontuação

A pontuação de Speaking do CELPIP da Prepamigo é precisa? Os números, com honestidade

6 de setembro de 2026

Engine 2.0 em 48 respostas reservadas

Porcentagem de respostas pontuadas dentro da faixa verificada. Três execuções separadas em dias diferentes produziram, cada uma, 81.3% no geral.

81%

Nível exato

Prepamigo comparado aos planos de chatbot mais populares

Em dólares canadenses. Os preços da Prepamigo já incluem impostos. Claude Max (a partir de US$100) e ChatGPT Pro (US$200) foram convertidos à taxa de 1,38, antes de impostos. A precisão é a porcentagem de respostas do conjunto de teste pontuadas no nível verificado quando o modelo indicado é solicitado, em linguagem simples, a pontuar a resposta; média de três execuções.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Preço mensal
CA$24.98 (c/ imposto)
CA$138+ (s/ imposto)
CA$276 (s/ imposto)
Pontuação
Ilimitada
Limitada
Limitada
Banco de questões pronto
Sim
Não
Não
Conjuntos de prática
80
Nenhum
Nenhum
Tarefas de prática
2,000+
Nenhuma
Nenhuma
Formato CELPIP
Sim
Não
Não
Precisão
81%
62%
35%
Respostas de nível alto
71%
50%
25%

É a pergunta certa a se fazer sobre qualquer ferramenta de prática, e a maioria das ferramentas não a responde. Uma nota de speaking só vale alguma coisa se disser o que um corretor real diria, e a única forma de saber se ela diz é medir. Então este artigo é a medição, apresentada de forma clara, com as partes que nos favorecem e as que não favorecem.

A resposta em um parágrafo: em 48 respostas de speaking que o Scoring Engine 2.0 da Prepamigo nunca tinha visto, cada uma com uma nota verificada de forma independente, o motor acertou o nível verificado 81% das vezes e ficou a um ponto dele 92% das vezes. Ele produziu os mesmos 81% em cada uma de três execuções separadas. É mais preciso em respostas fracas e de nível médio, com 88% e 85%, e menos preciso em respostas de nível alto, com 71%, onde seu erro característico é dar um 8 a um 10. Quando pedido em linguagem simples para pontuar as mesmas transcrições, o melhor modelo de ia genérico que testamos chegou a 62%, e o mais fraco chegou a 31%; com o nosso procedimento de correção completo, o melhor chegou a 77%.

O que vem a seguir é como chegamos a esses números, o que eles significam em cada nível de nota, o quão estáveis são, onde os erros caem, como a nota se compara com as alternativas que você talvez esteja usando, e como ler a sua própria nota à luz de tudo isso. Se você só quer o conselho prático, vá direto para a seção sobre como ler sua nota. Se quer decidir se deve confiar no número de alguma forma, leia tudo.

O que “preciso” significa aqui

Antes de qualquer número, a definição. Não estamos afirmando que uma nota da Prepamigo prevê seu resultado no teste. Nenhuma ferramenta de prática pode prometer isso, e quem promete está chutando. O que medimos é mais estreito e mais honesto: dada uma resposta falada cuja nota foi verificada de forma independente, com que frequência o motor produz uma nota no mesmo nível?

O speaking do CELPIP é relatado em uma escala que vai até 12, e as notas verificadas nos nossos dados de referência vêm em três faixas: baixa, ou seja, 4 ou 5; média, ou seja, 7 ou 8; e alta, ou seja, 10 ou mais. Contamos o motor como correto quando sua nota cai dentro da faixa verificada. Uma resposta verificada no nível alto, por exemplo, é pontuada corretamente se o motor der a ela um 9, 10 ou 11. Sob uma leitura mais estrita, que só aceita 10 ou mais, todo número nesta página cai alguns pontos e toda comparação permanece na mesma ordem.

Os números principais

O que 81% significa na prática? Se você grava dez respostas em um nível estável, o motor vai colocar cerca de oito delas na faixa correta e mais uma a um ponto dela. Ele não vai colocar um 5 na faixa 10 nem um 10 na faixa 5; isso não aconteceu nem uma vez em 144 respostas pontuadas ao longo das três execuções. Os erros que ele comete são os erros de um corretor cuidadoso em uma resposta na fronteira, e a próxima seção mostra onde eles se concentram.

Precisão em cada nível de nota

Precisão por faixa verificada

16 respostas reservadas por faixa. Cada barra é a fração das respostas daquela faixa pontuadas dentro da faixa.

88%

Nível baixo (4–5)

85%

Nível médio (7–8)

71%

Nível alto (10+)

Respostas de nível baixo: 88%. Respostas fracas são as mais fáceis de reconhecer. Elas costumam ser curtas, reaproveitar as palavras do enunciado, e deixar partes da tarefa incompletas. O motor capta esses sinais na maioria das vezes. Quando erra, erra para cima: em todos os casos, a resposta foi pontuada como um 8 em vez de um 4 ou 5. A causa é quase sempre uma resposta que soa fluente e confiante, mas diz pouco; a entrega dá a ela um nível que ela não conquistou em conteúdo. Sabemos disso porque podemos ver quais dimensões os corretores colocaram alto, e é sempre a fluência da fala.

Respostas de nível médio: 85%. Essas são as mais difíceis de avaliar em um sentido, porque contêm uma mistura real de forças e fraquezas que precisa ser pesada em vez de simplesmente notada. Os erros do motor aqui vão nas duas direções. Algumas respostas com hesitação visível, mas ideias sólidas, foram puxadas para baixo, para um 5 ou 6; algumas respostas com som polido foram empurradas para cima, para um 10. A etapa de reconciliação entre os dois corretores capta a maioria desses casos, o que é por que esse número é tão alto quanto é.

Respostas de nível alto: 71%. Esta é a faixa mais fraca e a que mais discutimos, porque o erro é muito consistente. Quando o motor erra uma resposta de nível alto, dá a ela um 8. Não um 7, não um 6; um 8, em todos os casos, exceto alguns poucos 9s que contam como correto. O motor vê uma resposta forte e se contém uma casa a menos.

Isso merece contexto. A tendência ao 8 em respostas fortes não é uma peculiaridade da Prepamigo; é a falha característica de todo corretor automatizado que já testamos, calibrado por humanos ou não. O nosso motor anterior tinha isso muito pior. Quando pedido de forma simples para pontuar as mesmas respostas, o melhor modelo genérico reconheceu 56% das respostas de nível alto; o modelo por trás dos planos pagos do ChatGPT reconheceu 25%; e mesmo com o nosso procedimento completo, nenhum deles superou 63%. Setenta e um por cento é o melhor número que já alcançamos, e ainda é o número que mais queremos melhorar.

O problema do 8, do seu lado da tela

A visão por nível diz como o motor se comporta em uma resposta de nível conhecido. Você está olhando do outro lado: você tem uma nota e quer saber o quanto acreditar nela. Então aqui está o mesmo dado invertido. Para cada nota que o motor dá, com que frequência a resposta estava mesmo naquele nível?

  • Se o motor diz 4 ou 5: a resposta estava no nível baixo 93% das vezes. O resto eram respostas de nível médio com muita hesitação. Uma nota baixa do Engine 2.0 quase sempre está certa.
  • Se o motor diz 10: a resposta estava no nível alto 92% das vezes. Um 10 do Engine 2.0 é um 10.
  • Se o motor diz 8: a resposta estava no nível médio 67% das vezes, no nível alto 23% das vezes, e no nível baixo 10% das vezes. Um 8 é a única nota que vale a pena ler com cuidado.

Em termos simples: um 8 do Engine 2.0 significa “médio, provavelmente, mas possivelmente melhor”. Aproximadamente uma resposta em quatro que recebe um 8 era, na verdade, um 10. Se você tirar um 8 em uma resposta que achou excelente, não conclua que não está pronto. Grave a mesma tarefa de novo. Um 10 consistente ao longo de três tentativas é um 10; um 8 consistente ao longo de três tentativas é um 8; uma mistura é uma resposta na fronteira, e o feedback vai dizer qual dimensão a mantém ali.

O hábito mais útil para um candidato forte é tratar um 8 como uma pergunta, e não como um veredito. O feedback cita as frases às quais os corretores reagiram. Se essas frases forem todas sobre hesitação e retomadas, você provavelmente é um 10 em conteúdo e um 9 em entrega, e mais uma tentativa vai mostrar isso.

A mesma gravação recebe a mesma nota?

Precisão sem consistência é sorte. Se a mesma gravação pudesse receber um 8 hoje e um 10 amanhã, o número de 81% seria uma média sobre ruído e você não poderia usar a nota para acompanhar nada. Então também testamos a repetibilidade diretamente.

As 48 respostas reservadas foram pontuadas três vezes separadas, em dias diferentes, sem nada mudar entre elas. O número geral foi 81.3% em cada execução. No nível das respostas individuais, 87.5% receberam a mesma nota idêntica nas três vezes, e apenas 4.2% chegaram a se mover por dois pontos ou mais. Essas poucas são respostas que ficam exatamente na fronteira entre duas faixas, onde uma pequena diferença de julgamento legitimamente pode inclinar a nota para um lado ou para o outro.

A consistência vem de uma decisão de design específica. Cada um dos dois corretores do motor vota três vezes em cada resposta, e o voto do meio é mantido. Quando testamos a mesma configuração com um único voto em vez de três, as notas idênticas entre execuções caíram de 87.5% para 77%, e a porcentagem de respostas que saltam dois pontos ou mais mais do que dobrou. A votação não mudou o número de precisão. Mudou se o número de precisão significa alguma coisa.

Para você, consistência significa que uma mudança na sua nota é uma mudança no seu speaking. Se você gravar o mesmo tipo de tarefa três vezes ao longo de uma semana e a nota subir de 8 para 10, isso não é o corretor tendo um bom dia. É você.

Como isso se compara com o que você talvez use em vez disso

Um número de precisão significa mais quando tem algo para comparar. Então rodamos as mesmas 48 respostas reservadas pelos modelos de ia genéricos que as pessoas realmente usam para avaliar sua prática, do jeito que uma pessoa faria: demos a cada modelo a transcrição literal e a tarefa, dissemos que ele era um examinador experiente do CELPIP, e pedimos uma nota de 0 a 12. Três execuções cada, com a média tirada.

Porcentagem de respostas pontuadas dentro da faixa verificada

Mesmas 48 respostas reservadas. Cada modelo foi solicitado, em linguagem simples, a pontuar a transcrição; média de três execuções. O Engine 2.0 rodou na sua configuração normal de produção.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

O Engine 2.0 fica na frente de todo modelo por uma diferença de dezenove a cinquenta e um pontos. Quando pedido de forma simples, todo modelo genérico pontua com dureza: o erro em uma resposta fraca costuma ser um 3, o erro em uma forte, um 7 ou 8. A Claude Opus 5 e o Gemini são os únicos dois acima da metade. Os três modelos maiores da GPT ficam entre 31% e 37%, e reconhecem uma resposta de nível alto entre 13% e 27% das vezes.

Depois demos a cada modelo o nosso procedimento completo: os mesmos exemplos de calibração para a tarefa exata, a mesma comparação forçada, e uma breve nota de calibração ajustada às suas próprias tendências. É o melhor que cada modelo conseguiu alcançar em nossas mãos, e não é algo que um estudante consiga reproduzir sem os exemplos. A Opus 5 subiu para 77%, a GPT 5.6 sol e o Gemini para 71%, a GPT 5.5 e a Sonnet 5 para 69%, a luna para 63% e a GPT-4o mini para 50%. Cada um deles ainda terminou atrás do Engine 2.0, e nenhum reconheceu mais de 63% das respostas de nível alto.

O que há de novo no seu feedback

O Engine 2.0 vem com uma camada de feedback totalmente reconstruída. Ela lê as evidências dos dois avaliadores, não apenas a nota, e foi testada com três tipos de aluno: alguém enfrentando o CELPIP pela primeira vez, alguém com inglês fraco em busca do truque, e alguém com meia hora por dia e uma prova na semana seguinte. Veja o que mudou.

  • Suas próprias palavras, citadas de volta. Cada ponto do feedback cita a frase exata da sua transcrição que motivou a reação dos avaliadores. Se uma frase está entre aspas, ela foi copiada literalmente; em nossa auditoria, 157 de 158 citações eram. O feedback nunca inventa algo que você não disse.
  • Uma coisa para corrigir primeiro. Cada resposta recebe uma única ação prioritária: a mudança que mais elevaria sua nota, escrita nas palavras mais simples da página. Depois vêm mais duas ações concretas e, por fim, uma lista de três itens para repassar mentalmente antes de começar a falar.
  • Conselhos que combinam com a tarefa. Dar um conselho, descrever uma cena e convencer alguém são avaliados por critérios diferentes. Agora o feedback sabe o que cada um dos oito tipos de tarefa recompensa e fala diretamente sobre isso, em vez de repetir as mesmas dicas genéricas em todas as tarefas.
  • Qual dimensão praticar primeiro. O feedback informa qual das quatro dimensões é sua mais fraca e qual é sua mais forte, para que você saiba onde está o próximo ponto, sem escondê-lo atrás de um número.
  • O que a tarefa pedia e você deixou passar. Para o cumprimento da tarefa, o feedback lista as partes específicas do enunciado que você não cobriu, ou diz claramente que você cobriu todas elas.
  • Coisas que você pode realmente ensaiar. Cada dica de como fazer é algo que você pode dizer em voz alta antes da próxima tentativa. Nenhum conselho para falar com mais clareza ou reduzir seu sotaque: sotaque não é o que a inteligibilidade mede, e o feedback nunca comenta sobre isso.
  • Sem culpar o cronômetro. Uma resposta interrompida pelo relógio depois de já ter cumprido a tarefa não é penalizada pela interrupção, e o feedback não o repreende por isso.

Quando um modelo avaliador independente comparou este feedback com o que nosso sistema anterior produzia para as mesmas respostas, sem saber qual era qual, ele preferiu o novo feedback em 20 de 24 comparações, tanto julgando como um examinador quanto julgando como um aluno julgaria.

Como ler a sua nota

  1. Um 4 ou 5 quase certamente está certo. O motor identifica respostas fracas 88% das vezes, e quando diz 4 ou 5, está certo 93% das vezes. Leia o feedback para ver qual dimensão está mais baixa e trabalhe nela.
  2. Um 10 é um 10. Quando o motor diz 10, a resposta estava no nível alto 92% das vezes. Você está pronto naquele tipo de tarefa. Passe para os que você evita.
  3. Um 8 é uma pergunta. Duas em cada três vezes significa médio. Uma em cada quatro significa alto. Grave a mesma tarefa de novo e observe o padrão ao longo das tentativas.
  4. A confiança está nas mudanças, mais do que nos níveis. Como a nota é estável, uma mudança ao longo das tentativas é uma mudança no seu speaking. Repetir o mesmo tipo de tarefa é o jeito mais rápido de descobrir se um novo hábito está funcionando.
  5. Leia as citações. As frases citadas no seu feedback são aquelas às quais os corretores reagiram. São as palavras específicas a mudar.

Perguntas frequentes

Quão precisa é a nota de speaking da Prepamigo? Em 48 respostas inéditas com notas verificadas: 81% na faixa exata, 92% a um ponto de distância, idêntico em três execuções. Por faixa: 88% baixo, 85% médio, 71% alto.

É a mesma coisa que minha nota real? Nenhuma ferramenta de prática pode prometer isso. O que medimos é com que frequência o motor concorda com uma nota verificada na mesma resposta. Leia sua nota como um nível com uma direção, e observe o padrão ao longo das tentativas.

Por que recebi um 8 em uma resposta que achei excelente? Esse é o maior erro remanescente do motor: um 8 em quatro era, na verdade, um 10. Grave a mesma tarefa de novo. Um 10 consistente ao longo das tentativas é um 10.

A mesma gravação vai receber a mesma nota duas vezes? 87.5% idêntico em três execuções; apenas 4.2% se moveu por dois pontos ou mais, todos na fronteira entre faixas.

Para ver como o motor funciona passo a passo, leia por dentro do Scoring Engine 2.0. Para ver o mesmo teste rodado com GPT, Claude e Gemini, leia qual ia pontua o speaking do CELPIP com mais precisão. Ou grave uma resposta e veja os números por si mesmo. Leia também a versão original em Ler este guia em inglês.

A pontuação de Speaking do CELPIP da Prepamigo é precisa? Os números, com honestidade | PrepAmigo