Pontuação

Qual IA pontua o Speaking do CELPIP com mais precisão? Testamos oito

5 de setembro de 2026

Porcentagem de respostas pontuadas no nível verificado

48 respostas reservadas, 16 por faixa. Cada modelo recebeu a transcrição e foi solicitado, em linguagem simples, a pontuá-la na escala do CELPIP; média de três execuções. O Engine 2.0 rodou na sua configuração normal de produção.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo comparado aos planos de chatbot mais populares

Em dólares canadenses. Os preços da Prepamigo já incluem impostos. Claude Max (a partir de US$100) e ChatGPT Pro (US$200) foram convertidos à taxa de 1,38, antes de impostos. A precisão é a porcentagem de respostas do conjunto de teste pontuadas no nível verificado quando o modelo indicado é solicitado, em linguagem simples, a pontuar a resposta; média de três execuções.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Preço mensal
CA$24.98 (c/ imposto)
CA$138+ (s/ imposto)
CA$276 (s/ imposto)
Pontuação
Ilimitada
Limitada
Limitada
Banco de questões pronto
Sim
Não
Não
Conjuntos de prática
80
Nenhum
Nenhum
Tarefas de prática
2,000+
Nenhuma
Nenhuma
Formato CELPIP
Sim
Não
Não
Precisão
81%
62%
35%
Respostas de nível alto
71%
50%
25%

Muitos candidatos do CELPIP hoje avaliam a própria prática de speaking com um chatbot de ia. Grava uma resposta, transcreve, cola, pede uma nota. É rápido e grátis ou quase grátis, e as explicações parecem cheias de autoridade. O que ninguém te diz é com que frequência o número está certo, ou em qual modelo confiar, ou se o jeito que você pergunta muda a resposta. Queríamos saber, então construímos o teste e o rodamos em oito sistemas, de duas formas.

A primeira forma é o gráfico acima: colar a transcrição, pedir uma nota, do jeito que um estudante faz. Entre os modelos genéricos, a Claude Opus 5 foi a mais precisa, com 62%, o Gemini veio depois, com 58%, e tudo o mais ficou abaixo da metade: Claude Sonnet 5 e GPT-4o mini com 45%, GPT 5.5 com 37%, GPT 5.6 sol com 35%, GPT 5.6 luna com 31%. Um sistema feito sob medida, o Prepamigo Scoring Engine 2.0, chegou a 81% nas mesmas respostas.

A segunda forma é a que achamos mais instrutiva: demos a cada modelo o nosso próprio procedimento de correção, com exemplos reais de calibração e uma comparação forçada, para ver o quanto cada um poderia, na melhor das hipóteses, chegar. Todo modelo melhorou, alguns drasticamente, e todo modelo ainda terminou atrás do Engine 2.0. Devemos ser transparentes: a Prepamigo é o nosso produto. Tentamos deixar os dois testes justos para todos os outros, e onde um modelo nos venceu em um nível específico, dizemos isso.

O ranking com pedido simples

Três camadas são visíveis no gráfico no topo. O Engine 2.0, com 81%, está isolado. A Claude Opus 5, com 62%, e o Gemini, com 58%, formam uma segunda camada: utilizáveis, se você aceitar errar duas vezes em cinco. Tudo o mais está abaixo de 50%, ou seja, pior do que um sorteio entre as três faixas seria se você não soubesse nada sobre a resposta.

Essa é a característica que define o teste simples: todo modelo genérico pontua com dureza. A nota média que deram a uma resposta de nível alto verificada variou de 7,2 (luna) a 8,6 (Opus 5). A nota média que deram a uma resposta de nível baixo verificada variou de 3,7 a 4,3, abaixo da faixa para todas, exceto a Opus 5 e o Gemini. Sem exemplos do que cada nível realmente soa, os modelos comparam a resposta com uma perfeita imaginária e descontam.

Resultados em cada nível de nota

Um número geral esconde onde os erros caem, e onde eles caem é o que determina se um corretor é útil para você. Aqui estão os resultados do teste simples por faixa.

Respostas de nível baixo (verificado 4 ou 5)

16 respostas reservadas por sistema, pedido simples, média de três execuções.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

Respostas fracas deveriam ser o lado fácil da escala, e com um pedido simples não são. O Engine 2.0 está em 88%, a Opus 5, em 77%, a GPT-4o mini, em 75%. Tudo o mais fica em torno da metade, e a Sonnet 5 está em 44%. O erro é quase sempre um 3: o modelo vê uma resposta fraca e a pontua abaixo da faixa em vez de dentro dela. O número respeitável da GPT-4o mini aqui é o primeiro sinal do seu problema, que é pontuar quase tudo para baixo.

Respostas de nível médio (verificado 7 ou 8)

16 respostas reservadas por sistema, pedido simples, média de três execuções.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

A faixa média separa o campo. O Engine 2.0 está em 85%. O Gemini e a Sonnet 5 estão em 63%, a Opus 5, em 58%. Depois um precipício: a GPT-4o mini em 44% e os três modelos maiores da GPT entre 27% e 29%. Respostas de nível médio contêm uma mistura real de forças e fraquezas que precisa ser pesada, e sem nada para comparar, os modelos da GPT veem as fraquezas e dão um 5 ou 6. Um falante de nível 7 ou 8 que pede uma nota à GPT 5.6 sol vai ouvir a faixa certa em menos de três vezes em dez.

Respostas de nível alto (verificado 10 ou mais)

16 respostas reservadas por sistema, pedido simples, média de três execuções. Quase todo erro é um 7 ou 8.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

A faixa alta é onde as diferenças mais importam, e onde o pedido simples causa mais dano. O Engine 2.0 reconhece 71% das respostas de nível alto. O Gemini reconhece 56% e a Opus 5, exatamente a metade. Depois a Sonnet 5, com 29%, a GPT 5.5, com 27%, a GPT 5.6 sol, com 25%, a GPT-4o mini, com 17%, e a GPT 5.6 luna, com 13%. Cinco dos sete modelos genéricos dão um 7 ou 8 a pelo menos sete de cada dez respostas que mereciam um 10.

Se você é um candidato forte se avaliando com um chatbot, este é o número para lembrar. A chance de um pedido simples à GPT 5.6 sol te dizer que um 10 é um 10 é de uma em quatro.

O segundo ranking: com o nosso procedimento completo

Os números do teste simples não são um veredito sobre o quão inteligentes esses modelos são. São um veredito sobre o que acontece quando um modelo é pedido a dar um número sem nada para comparar. Então rodamos o segundo teste, dando a cada modelo os exemplos de calibração e a comparação forçada que os corretores do próprio Engine 2.0 usam.

Com o nosso procedimento completo: porcentagem de respostas pontuadas no nível verificado

Mesmas 48 respostas reservadas. Mesmas transcrições, instruções e exemplos de calibração para todo sistema; cada modelo avaliou cada resposta uma vez. O Gemini também recebeu o áudio.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

Todo modelo melhora. A Opus 5 vai de 62% para 77%. A GPT 5.6 sol dobra, de 35% para 71%. A GPT 5.5 vai de 37% para 69%, a Sonnet 5, de 45% para 69%, a luna, de 31% para 63%, o Gemini, de 58% para 71%. A GPT-4o mini quase não se move, de 45% para 50%, porque pontua tudo para baixo independentemente do que é mostrado a ela.

A ordem também muda. Com um pedido simples, os modelos da Claude estavam bem na frente dos modelos da GPT. Com o procedimento completo, a GPT 5.6 sol supera a Sonnet 5 e empata com o Gemini, e quatro modelos se agrupam entre 69% e 71%, estatisticamente indistinguíveis nessa amostra. A Opus 5 se mantém no topo do campo genérico com 77%, quatro pontos atrás do Engine 2.0.

Na visão por nível, o procedimento completo eleva a precisão na faixa baixa para 88% em quatro modelos, o mesmo do Engine 2.0, e a precisão na faixa média para 81% nos dois modelos da Claude. A faixa alta é onde a diferença persiste: a Opus 5, a GPT 5.6 sol, o Gemini e a GPT 5.5 todos ficam em 63%, a Sonnet 5 em 38%, e a GPT-4o mini em zero, contra 71% do Engine 2.0. Um único modelo fazendo uma única passagem ainda hesita diante de uma resposta forte com um deslize. O Engine 2.0 fecha essa diferença restante com dois corretores independentes de provedores diferentes, três votos de cada um mantendo o voto do meio, e uma regra de reconciliação que adota a nota mais alta quando os dois corretores discordam fortemente, porque a análise mostrou que o veredito mais baixo quase sempre era o errado em respostas fortes.

O resumo honesto dos dois rankings é este: o procedimento importa mais do que o modelo. A mesma GPT 5.6 sol foi de 35% para 71% sem mudar um único peso, apenas ao ser mostrada como cada nível soa e perguntada a qual exemplo a resposta se parecia.

Por que os modelos tendem para baixo e para o meio

O padrão é tão consistente entre modelos de três empresas diferentes que não pode ser uma peculiaridade de nenhuma delas. É uma propriedade da tarefa.

Quando um modelo é pedido a posicionar uma resposta em uma escala, ele se protege para o centro quando está inseguro, porque o centro é onde uma resposta errada custa menos. E quando não tem exemplos do que um nível realmente soa, ele compara a resposta com uma perfeita imaginária e desconta por cada deslize. Uma resposta de nível alto nunca é perfeita. Ela contém uma retomada, uma frase simples entre as complexas, uma hesitação antes de uma palavra difícil. Medidos contra a perfeição, esses deslizes custam uma ou duas casas, e um 10 se torna um 8 ou um 7.

Instruções não corrigem isso. Tentamos dizer explicitamente aos modelos que um nível 9 não exige uma resposta sem erros, que subestimar uma resposta forte é tão grave quanto sobrestimar uma fraca. Cada instrução foi aceita e depois ignorada na prática. Quando demos a um modelo o próprio exemplo de calibração que ele havia sido informado representar um nível alto e pedimos que o pontuasse, ele deu um 8.

O que corrige isso, na maior parte, é mudar a pergunta de “qual número?” para “qual exemplo?” e fornecer exemplos reais. Essa é a diferença entre os dois rankings. Mesmo assim, uma única passagem ainda tende um pouco, porque os exemplos de calibração não são perfeitos e uma leitura deles é apenas uma leitura. Dois corretores, três votos e uma regra de reconciliação são o que fecham o resto.

Notas sobre cada modelo

  • Claude Opus 5. O melhor corretor genérico nos dois testes: 62% simples (62%, 65% e 58% ao longo de três execuções) e 77% com o procedimento completo. Sua fraqueza no pedido simples é a faixa média, onde dá 6s; sua fraqueza no procedimento completo é a faixa alta, onde para em 63%. É também, de longe, o modelo mais caro aqui.
  • Gemini. Segundo no teste simples, com 58%, idêntico nas três execuções, e o mais uniforme entre as faixas, com 56%, 63% e 56%. Com o procedimento completo e a gravação de áudio, chegou a 71%, no mesmo nível da GPT 5.6 sol, que trabalhou só a partir de texto. Ouvir a gravação não ajudou além do que uma transcrição literal já oferece.
  • Claude Sonnet 5. 45% simples, com um perfil peculiar: razoável na faixa média, com 63%, fraca em respostas fracas, com 44%, porque as pontua com um 3, e fraca no topo, com 29%. Com o procedimento completo sobe para 69%, mas fica em 38% nas respostas de nível alto. Se a Sonnet 5 continuar te dando 8s, não acredite.
  • GPT-4o mini. 45% simples, 50% com o procedimento completo, e nos dois casos o número a favorece. Ela pontua quase tudo para baixo: 75% em respostas fracas, 17% e depois 0% em respostas de nível alto. Faça o que fizer, não avalie seu speaking com esse modelo.
  • GPT 5.5. 37% simples (35%, 42%, 33%), 69% com o procedimento completo. Sua faixa média com pedido simples é 29%. Foi o corretor de texto em uma versão anterior do nosso próprio pipeline e foi substituído por fraqueza justamente nessa faixa.
  • GPT 5.6 sol. 35% simples (31%, 40%, 35%), a maior variação entre execuções de qualquer modelo, e 71% com o procedimento completo, a maior melhora de qualquer modelo. Um corretor capaz quando mostrado exemplos, e um fraco quando não. Seu hábito no procedimento completo é recompensar demais a fluência na faixa média.
  • GPT 5.6 luna. Último nos dois testes: 31% simples e 63% com o procedimento completo. Puxa respostas médias para baixo, em direção ao 5, e reconheceu 13% das respostas de nível alto de forma simples. Barata o suficiente para ser útil como uma segunda opinião dentro de um sistema de dois corretores; não precisa o suficiente para usar sozinha.

O que um sistema feito sob medida acrescenta

O Engine 2.0 não é um modelo melhor. Ele usa modelos deste mesmo ranking. O que ele acrescenta é procedimento, e cada peça desse procedimento foi escolhida por medição.

  1. Transcrição literal, automaticamente. Toda hesitação e retomada mantida, porque removê-las cortou a precisão em quinze pontos nos testes. Você não precisa achar uma ferramenta de transcrição que faça isso; a maioria das ferramentas para consumidores higieniza por padrão.
  2. Exemplos de calibração anexados a toda tarefa. Duas respostas reais por nível para cada um dos oito tipos de tarefa, já prontas. Essa é a única entrada que dobrou a precisão da GPT 5.6 sol, e a que você não consegue produzir em casa.
  3. Uma comparação, não um número. Cada corretor nomeia o exemplo mais próximo em cada uma das quatro dimensões; a nota segue por regra. Isso é o que impede a tendência ao meio.
  4. Dois corretores de dois provedores. Modelos diferentes têm pontos cegos diferentes. Dois deles, reconciliados por uma regra fixa, vencem qualquer um sozinho.
  5. Três votos cada, o do meio mantido. Isso não aumentou a precisão, mas levou a consistência entre execuções de 77% para 87.5%. Uma única resposta de chatbot é um único voto.
  6. Reconciliação que adota a nota mais alta em caso de forte discordância. Porque o veredito mais baixo quase sempre era o errado em respostas fortes. Uma média simples caiu para os sessenta e poucos por cento nos testes.
  7. Salvaguardas. Respostas silenciosas, de poucas palavras, fora do tema e não em inglês recebem notas mínimas por regra, e não pelo chute de um modelo.

O resultado é 81% no geral e 71% no topo, idêntico em três execuções separadas, em cerca de dez segundos por resposta, sem nada para colar.

Se você vai usar um chatbot de qualquer forma

Alguns leitores vão continuar se avaliando com um chatbot, e essa é uma escolha razoável para um candidato com orçamento apertado ou que quer discutir suas respostas. Estes passos são a diferença entre os dois rankings, e vão te aproximar mais do segundo do que do primeiro.

  1. Use uma transcrição literal. Mantenha suas hesitações, retomadas e autocorreções. Se sua ferramenta de transcrição as remove, o corretor está avaliando uma resposta melhor do que a que você deu.
  2. Dê exemplos, não uma rubrica. Uma ou duas respostas reais em cada nível para o mesmo tipo de tarefa, com os níveis identificados, fazem mais do que qualquer descrição de como é um nível 9. Se você não tem exemplos verificados, este é o passo que você não consegue reproduzir em casa, e é o que mais importa.
  3. Pergunte qual exemplo, não qual número. Para cada uma das quatro dimensões, peça ao modelo para nomear o exemplo mais próximo e proíba “algo entre os dois”. Derive a nota você mesmo a partir dos níveis que ele nomeia.
  4. Pergunte mais de uma vez. Pontue a mesma resposta duas ou três vezes em conversas novas e mantenha a resposta do meio. A GPT 5.6 sol variou nove pontos entre execuções no teste simples.
  5. Escolha um modelo com bom histórico na faixa alta. Opus 5 ou Gemini se você está pedindo de forma simples; Opus 5 ou GPT 5.6 sol se você tem exemplos. Nunca a GPT-4o mini, se você estiver perto de um 10.
  6. Desconfie de um 7 ou 8. Em todo modelo genérico, um 7 ou 8 em uma resposta que você achou excelente tem mais chance de ser um erro do que um veredito.

Em qual modelo confiar, dependendo de onde você está

A leitura correta desses rankings depende do seu nível atual, porque os modelos falham em lugares diferentes.

  • Se você está em um 4 ou 5 hoje, a Opus 5 pedida de forma simples vai te dizer isso cerca de três vezes em quatro; a maioria dos outros modelos vai te chamar de 3 cerca da metade das vezes. Seu problema não é realmente o corretor; é o feedback, e para isso você quer algo que cite suas palavras de volta em vez de resumir.
  • Se você está em um 7 ou 8, evite os modelos da GPT com um pedido simples, que vão te chamar de 5 ou 6 sete vezes em dez. Gemini e Sonnet 5 são os corretores mais confiáveis com pedido simples na faixa média, com 63%. O Engine 2.0 está em 85%.
  • Se você está em um 10 ou mais, é aqui que a escolha mais importa. Quando pedido de forma simples, nenhum modelo genérico vai reconhecer um 10 mais de 56% das vezes, e os modelos da GPT vão fazer isso entre 13% e 27% das vezes. O Engine 2.0 reconhece sete em cada dez e, mais importante, dá a mesma resposta toda vez que você pergunta.

O padrão nas três faixas é o mesmo que o artigo todo tem descrito. Os modelos não são burros; são cautelosos, e cautela sem nada para comparar significa um número baixo. Quanto mais longe você estiver do meio, mais a cautela de um corretor te custa, e mais importa que o corretor tenha sido construído para resistir a ela.

O que há de novo no seu feedback

O Engine 2.0 vem com uma camada de feedback totalmente reconstruída. Ela lê as evidências dos dois avaliadores, não apenas a nota, e foi testada com três tipos de aluno: alguém enfrentando o CELPIP pela primeira vez, alguém com inglês fraco em busca do truque, e alguém com meia hora por dia e uma prova na semana seguinte. Veja o que mudou.

  • Suas próprias palavras, citadas de volta. Cada ponto do feedback cita a frase exata da sua transcrição que motivou a reação dos avaliadores. Se uma frase está entre aspas, ela foi copiada literalmente; em nossa auditoria, 157 de 158 citações eram. O feedback nunca inventa algo que você não disse.
  • Uma coisa para corrigir primeiro. Cada resposta recebe uma única ação prioritária: a mudança que mais elevaria sua nota, escrita nas palavras mais simples da página. Depois vêm mais duas ações concretas e, por fim, uma lista de três itens para repassar mentalmente antes de começar a falar.
  • Conselhos que combinam com a tarefa. Dar um conselho, descrever uma cena e convencer alguém são avaliados por critérios diferentes. Agora o feedback sabe o que cada um dos oito tipos de tarefa recompensa e fala diretamente sobre isso, em vez de repetir as mesmas dicas genéricas em todas as tarefas.
  • Qual dimensão praticar primeiro. O feedback informa qual das quatro dimensões é sua mais fraca e qual é sua mais forte, para que você saiba onde está o próximo ponto, sem escondê-lo atrás de um número.
  • O que a tarefa pedia e você deixou passar. Para o cumprimento da tarefa, o feedback lista as partes específicas do enunciado que você não cobriu, ou diz claramente que você cobriu todas elas.
  • Coisas que você pode realmente ensaiar. Cada dica de como fazer é algo que você pode dizer em voz alta antes da próxima tentativa. Nenhum conselho para falar com mais clareza ou reduzir seu sotaque: sotaque não é o que a inteligibilidade mede, e o feedback nunca comenta sobre isso.
  • Sem culpar o cronômetro. Uma resposta interrompida pelo relógio depois de já ter cumprido a tarefa não é penalizada pela interrupção, e o feedback não o repreende por isso.

Quando um modelo avaliador independente comparou este feedback com o que nosso sistema anterior produzia para as mesmas respostas, sem saber qual era qual, ele preferiu o novo feedback em 20 de 24 comparações, tanto julgando como um examinador quanto julgando como um aluno julgaria.

Perguntas frequentes

Qual modelo de ia é mais preciso ao pontuar o speaking do CELPIP? Quando pedido de forma simples: Claude Opus 5 com 62%, Gemini com 58%, Claude Sonnet 5 e GPT-4o mini com 45%, GPT 5.5 com 37%, GPT 5.6 sol com 35%, GPT 5.6 luna com 31%. O Prepamigo Scoring Engine 2.0 chegou a 81% nas mesmas respostas.

ChatGPT ou Claude? Claude, claramente, quando pedidas de forma simples: 62% e 45% contra 35% e 37%. Com o nosso procedimento completo, a diferença encurta para 77% da Opus 5 contra 71% da GPT 5.6 sol.

Por que todos dão um 7 ou 8 nas minhas respostas fortes? Modelos sem nada para comparar chutam para baixo e para o meio, e uma resposta forte sempre tem pequenos deslizes. Quando pedido de forma simples, nenhum modelo genérico reconheceu mais de 56% das respostas de nível alto.

Como consigo uma nota melhor de um chatbot? Transcrição literal, respostas de exemplo em cada nível, perguntar qual exemplo em vez de qual número, perguntar mais de uma vez e manter a resposta do meio. Esse procedimento dobrou a GPT 5.6 sol, de 35% para 71%, no nosso teste.

Para um olhar mais de perto sobre os dois confrontos diretos, leia Prepamigo vs Claude e Prepamigo vs ChatGPT. Para ver como o procedimento funciona passo a passo, leia por dentro do Scoring Engine 2.0. Ou grave uma resposta e pule a transcrição. Leia também a versão original em Ler este guia em inglês.

Qual IA pontua o Speaking do CELPIP com mais precisão? Testamos oito | PrepAmigo