Porcentagem de respostas pontuadas no nível verificado
48 respostas de speaking reservadas para o teste, 16 por faixa. Cada modelo da GPT recebeu a transcrição e foi solicitado, em linguagem simples, a pontuá-la na escala do CELPIP; média de três execuções. O Engine 2.0 rodou na sua configuração normal de produção.
81%
Prepamigo Engine 2.0
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Prepamigo comparado aos planos de chatbot mais populares
Em dólares canadenses. Os preços da Prepamigo já incluem impostos. Claude Max (a partir de US$100) e ChatGPT Pro (US$200) foram convertidos à taxa de 1,38, antes de impostos. A precisão é a porcentagem de respostas do conjunto de teste pontuadas no nível verificado quando o modelo indicado é solicitado, em linguagem simples, a pontuar a resposta; média de três execuções.
O ChatGPT é provavelmente a ferramenta mais comum que candidatos do CELPIP usam para avaliar sua própria prática de speaking. Está no celular de todo mundo, responde em segundos e diz de bom grado qual nível a sua resposta teve. A pergunta que este artigo responde é se o nível que ele te diz é o nível que você realmente teria. Rodamos o teste do jeito que um estudante faria: colar a transcrição, pedir uma nota, e contar.
A resposta curta: em 48 respostas de speaking que nenhum dos sistemas tinha visto, cada uma com uma nota verificada de forma independente, o Prepamigo Scoring Engine 2.0 acertou o nível correto 81% das vezes. Quando pedida em linguagem simples, a GPT 5.6 sol, o modelo por trás dos planos pagos do ChatGPT, acertou o nível correto 35% das vezes. A GPT 5.5 conseguiu 37%, a GPT 5.6 luna, 31%, e a GPT-4o mini, 45%, um número que parece melhor do que realmente é, porque esse modelo pontua quase tudo para baixo e por isso acaba acertando as respostas fracas.
Depois fizemos algo que a maioria das comparações não faz. Demos a cada modelo da GPT o nosso próprio procedimento de correção, com exemplos reais de calibração para cada tarefa e uma comparação forçada contra eles, para ver o quanto cada um poderia, na melhor das hipóteses, chegar. A GPT 5.6 sol subiu para 71%, a GPT 5.5 para 69%, a luna para 63% e a GPT-4o mini para 50%. As quatro ainda ficaram atrás do Engine 2.0, e as quatro ainda tiveram mais dificuldade justamente nas respostas de nível alto. O restante deste artigo percorre os dois testes, os resultados em cada nível de nota, por que um assistente genérico tende para o meio da escala, como é o fluxo de trabalho diário de cada lado, e quanto custa cada opção para quem pretende praticar de verdade.
O teste simples: o que um estudante realmente recebe
Oitenta e um por cento contra trinta e cinco. Em um teste de 48 respostas, isso são vinte e duas notas corretas extras para o Engine 2.0 sobre a GPT 5.6 sol. Em outras palavras, o Engine 2.0 comete 71% menos erros de pontuação do que a GPT 5.6 sol, 70% menos do que a GPT 5.5, 73% menos do que a GPT 5.6 luna e 66% menos do que a GPT-4o mini.
Três execuções separadas do teste simples deram à GPT 5.6 sol 31%, 40% e 35%, e à GPT 5.5 35%, 42% e 33%. Essa variação entre execuções já é, por si só, uma descoberta: peça ao ChatGPT para avaliar a mesma transcrição em dois dias diferentes e, com uma frequência considerável, você vai receber duas notas diferentes. O Engine 2.0 pontuou 81.3% em cada uma das três execuções.
Onde a diferença se abre: nível de nota por nível de nota
Um número geral esconde onde os erros caem. Um corretor excelente em respostas fracas e péssimo em respostas fortes é ótimo para um principiante e ativamente prejudicial para quem busca um 10. Então aqui estão os resultados do teste simples divididos por faixa verificada.
Respostas de nível baixo (nota verificada 4 ou 5)
16 respostas reservadas, pedido simples, média de três execuções. A maioria dos erros é uma nota 3.
88%
Prepamigo Engine 2.0
75%
GPT-4o mini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
Em respostas fracas, o Engine 2.0 lidera com 88%. A GPT-4o mini vem depois com 75%, o único lugar onde seu hábito de pontuar para baixo joga a seu favor. Os três modelos maiores da GPT estão entre 52% e 54%: mais ou menos na metade das vezes eles dão 3 a uma resposta de 4 ou 5, o que é a faixa errada mesmo que a direção seja compreensível. Um principiante que usa o ChatGPT para se avaliar vai ouvir, quase na metade das vezes, que está pior do que realmente está.
Respostas de nível médio (nota verificada 7 ou 8)
16 respostas reservadas, pedido simples, média de três execuções. Os erros são quase todos um 5 ou 6.
85%
Prepamigo Engine 2.0
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
A faixa média é onde os modelos da GPT com pedido simples se desmontam. O Engine 2.0 está em 85%; a GPT-4o mini, em 44%; a GPT 5.5, a GPT 5.6 sol e a luna, entre 27% e 29%. Respostas de nível médio contêm uma mistura real de forças e fraquezas que precisa ser pesada, e sem exemplos de calibração para comparar, os modelos da GPT veem as fraquezas e dão um 5 ou 6. Um falante de nível 7 ou 8 que pede uma nota à GPT 5.6 sol vai ouvir a faixa certa em menos de três vezes em dez.
Respostas de nível alto (nota verificada 10 ou mais)
16 respostas reservadas, pedido simples, média de três execuções. Quase todo erro é um 7 ou 8.
71%
Prepamigo Engine 2.0
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
No topo, o Engine 2.0 reconhece 71% das respostas de nível alto. A GPT 5.5 reconhece 27%, a GPT 5.6 sol, 25%, a GPT-4o mini, 17%, e a GPT 5.6 luna, 13%. Todo modelo da GPT dá um 7 ou 8 a pelo menos sete de cada dez respostas que mereciam um 10.
Pense no que isso significa para um candidato forte. Você grava oito respostas, transcreve, cola no ChatGPT e pede uma nota, e ele te diz que seis delas são 7s e 8s. Você conclui que é um falante sólido de nível médio com trabalho a fazer. Você estava em um nível 10 o tempo todo. Isso não é hipotético. É o que todo modelo da GPT fez na maioria das respostas de nível alto do nosso teste.
E se você der ao ChatGPT o nosso procedimento completo?
É tentador ler os números do teste simples como se a GPT fosse uma família fraca de modelos. Não é o caso. O problema não é inteligência. É que um modelo, quando pedido para dar um número, sem nada para comparar, chuta, e quando chuta, chuta para baixo e para o meio.
Então rodamos o segundo teste. Cada modelo da GPT recebeu o mesmo pacote que os corretores do Engine 2.0 recebem: a transcrição, a tarefa, dois exemplos reais de calibração em cada nível para aquela tarefa exata, e uma instrução para nomear o exemplo mais próximo em cada uma das quatro dimensões, em vez de produzir um número. Cada modelo também recebeu uma breve nota de calibração ajustada às suas próprias tendências.
Com o nosso procedimento completo: porcentagem de respostas pontuadas no nível verificado
Mesmas 48 respostas reservadas. Cada modelo da GPT avaliou cada resposta uma vez, com as mesmas transcrições, instruções e exemplos de calibração dos próprios corretores do Engine 2.0.
81%
Prepamigo Engine 2.0
71%
GPT 5.6 sol
69%
GPT 5.5
63%
GPT 5.6 luna
50%
GPT-4o mini
Os exemplos de calibração fazem uma diferença enorme. A GPT 5.6 sol dobra, de 35% para 71%. A GPT 5.5 vai de 37% para 69%, a luna de 31% para 63%. A GPT-4o mini quase não se move, de 45% para 50%, porque continua pontuando tudo para baixo independentemente do que é mostrado a ela; com o procedimento completo, ela ainda não reconheceu nenhuma resposta de nível alto. Isso mostra onde realmente está o valor de um corretor feito sob medida: não em um modelo mais inteligente, mas em exemplos reais de como cada nível soa em cada tarefa específica, e em uma pergunta que força o modelo a comparar em vez de chutar.
Mesmo assim, todo modelo da GPT continua atrás. Com o procedimento completo, a GPT 5.6 sol fica dez pontos atrás do Engine 2.0 no geral, dez pontos atrás na faixa média (75% contra 85%), e oito pontos atrás no topo (63% contra 71%). Seu hábito remanescente é recompensar demais a fluência: uma resposta 8 competente com uma entrega suave é empurrada para 9 ou 10. A GPT 5.6 luna faz o contrário, puxando respostas médias para baixo em direção ao 5, e termina a faixa média em 44%. Um único modelo fazendo uma única passagem ainda tem um viés característico, e o Engine 2.0 fecha a diferença restante com dois corretores independentes de provedores diferentes, três votos de cada um mantendo o voto do meio, e uma regra de reconciliação que adota a nota mais alta quando os dois corretores discordam fortemente.
Também tentamos o atalho óbvio: manter o pedido simples e adicionar instruções como “não tenda para o meio” ou “uma resposta de nível 9 não precisa ser perfeita”. Elas não produziram nenhuma mudança mensurável. O que funciona é mudar a pergunta, e dar ao modelo algo real para comparar.
A diferença no fluxo de trabalho: gravar e seguir, ou fazer tudo você mesmo
Os números de precisão pressupõem que a correção realmente aconteça. Com o ChatGPT, uma quantidade surpreendente de trabalho fica entre apertar o botão de parar na sua gravação e ler uma nota, e parte desse trabalho muda a nota.
Primeiro, você precisa de uma transcrição. O modo de voz do ChatGPT é uma conversa, não um corretor; para avaliar uma resposta gravada você precisa de texto. Isso significa digitar o que você disse, o que muda a resposta, ou passar a gravação por uma ferramenta de transcrição. E a transcrição precisa ser literal. Toda hesitação, toda retomada, toda autocorreção precisa ficar. Quando testamos uma transcrição “higienizada”, com as hesitações removidas, a precisão caiu quinze pontos, porque essas hesitações são exatamente a evidência de que um corretor precisa para julgar como uma resposta soa. A maioria das ferramentas de transcrição para consumidores, inclusive a que vem integrada na maioria dos celulares, higieniza por padrão.
Segundo, você precisa da tarefa. O ChatGPT pode inventar um enunciado no estilo CELPIP se você pedir, mas ele está chutando o formato, o tempo e o tipo de cenário que o teste real usa. Você não vai saber se o enunciado que ele escreveu se parece com o que você vai enfrentar.
Terceiro, se você quiser algo melhor do que os números do teste simples, precisa de exemplos de calibração: respostas reais em cada nível para o mesmo tipo de tarefa, com níveis verificados. Foi essa entrada que dobrou a precisão da GPT 5.6 sol no nosso teste, e é aquela que um estudante não consegue produzir em casa.
Quarto, você faz tudo isso de novo para a próxima resposta, e cada uma delas conta contra a sua cota de mensagens.
Na Prepamigo, você escolhe uma tarefa do banco, o cronômetro roda, você fala, e cerca de dez segundos depois de parar, a nota e o feedback já estão na tela. A transcrição é literal por design, os exemplos de calibração são anexados à tarefa automaticamente, e não há nada para colar e nada para pedir. A décima primeira resposta da noite custa o mesmo esforço que a primeira.
Consistência: a mesma resposta, a mesma nota
Uma nota que você não consegue reproduzir não é uma medida. Se a mesma gravação recebe um 8 na segunda e um 10 na terça, você não aprendeu nada sobre o seu speaking. Então também testamos a repetibilidade.
O Engine 2.0 foi rodado sobre as 48 respostas reservadas três vezes separadas em dias diferentes. Ele pontuou 81.3% todas as vezes. Olhando para as respostas individuais, 87.5% receberam a mesma nota idêntica nas três execuções, e apenas 4.2% chegaram a se mover por dois pontos ou mais, todas respostas na fronteira entre duas faixas.
O teste simples na GPT 5.6 sol se moveu nove pontos entre sua melhor e sua pior execução. Essa diferença de estabilidade vem da votação. Cada corretor do Engine 2.0 vota três vezes em cada resposta e o voto do meio é mantido. Quando testamos a mesma configuração com um único voto em vez de três, as notas idênticas entre execuções caíram de 87.5% para 77%, e a porcentagem de respostas que saltam dois pontos ou mais mais do que dobrou. Uma única conversa com o ChatGPT é um único voto. Também verificamos se fixar uma semente aleatória fixa pela API tornava os modelos da GPT mais repetíveis. Não tornou; na GPT 5.6 luna, a repetibilidade na verdade caiu.
Feedback que você pode usar
O ChatGPT é bom em explicar. Se você perguntar por que ele deu uma nota, ele vai te contar detalhadamente, em inglês claro, e vai sugerir melhorias. Para um candidato que quer discutir uma resposta, isso tem valor genuíno.
O risco é que uma explicação fluente não é a mesma coisa que um diagnóstico correto. Um modelo que pontuou um 10 como 7 vai explicar, de forma convincente, por que é um 7. Ele vai encontrar algo para apontar. E como não precisou se comprometer com evidências antes de pontuar, a explicação é escrita depois do fato, para justificar um número que ele já escolheu.
O Engine 2.0 funciona ao contrário. Cada corretor precisa apontar evidências para cada dimensão antes de nomear um nível, e o feedback é escrito a partir dessa evidência. Ele cita suas próprias palavras: em uma auditoria de 158 citações em uma amostra de feedback, 157 apareceram literalmente na transcrição. Quando um modelo julgador independente comparou o feedback do Engine 2.0 com o feedback do nosso sistema anterior nas mesmas respostas, sem saber qual era qual, ele preferiu o Engine 2.0 em 20 de 24 comparações, tanto julgando como um examinador julgaria quanto julgando como um estudante julgaria.
Também verificamos se o feedback aponta a crítica no lugar certo, pegando respostas fortes e deliberadamente danificando uma dimensão por vez. Em três dos quatro casos, a dimensão danificada foi a que teve a maior queda de nota. É uma verificação que um chatbot não consegue passar com facilidade, porque ele não tem dimensões fixas contra as quais ser checado.
Quanto custa praticar todos os dias
Uma nota de speaking é mais útil na sua quadragésima resposta, não na quarta. É nesse ponto que ela começa a dizer se uma mudança no jeito que você fala está realmente funcionando. Então a pergunta prática é quanto custa usar cada ferramenta em volume.
O ChatGPT Plus custa US$20 por mês, cerca de CA$28, cobrados mensalmente, conforme publicado em setembro de 2026. Ele te dá a família GPT 5.6 com um limite de mensagens por janela rotativa; transcrições longas com exemplos de calibração anexados são exatamente o tipo de mensagem que consome bastante dessa cota, e depois que você a atinge, você espera ou cai para um modelo menor. O ChatGPT Pro, a US$200 por mês, cerca de CA$276 antes de impostos, eleva bastante os limites. O plano gratuito direciona boa parte do seu tráfego para modelos menores, e neste teste o menor deles quase não reconheceu nenhuma resposta de nível alto. Nenhum dos planos inclui um banco de questões, um cronômetro, transcrição literal, exemplos de calibração, ou qualquer coisa específica do CELPIP.
A Prepamigo custa CA$24.98 por mês, ou CA$8.25 por mês no plano anual, o que dá CA$98.98 no ano, com impostos inclusos, e você pode cancelar quando quiser. Todo plano inclui pontuação ilimitada pelo Engine 2.0, sem limite diário, por sessão ou semanal, tentativas ilimitadas, e o banco de questões completo: 80 conjuntos de prática completos e mais de 2,000 tarefas de prática em Speaking, Writing, Reading e Listening, escritas para seguir os tipos de tarefa, o tempo e o formato do teste CELPIP General.
Em termos simples: por menos do que o preço do ChatGPT Plus, você tem um corretor mais de duas vezes mais preciso em uma comparação simples, que nunca te pede para esperar, e que já vem com as questões e os exemplos de calibração prontos.
Quando o ChatGPT é a ferramenta melhor
Este não é um argumento para nunca abrir o ChatGPT enquanto você se prepara para o CELPIP. Um candidato a sério pode muito bem usar os dois.
- Discutir uma resposta. Se você quer entender por que um argumento foi fraco ou pensar em três razões melhores, uma conversa é o formato certo. O Engine 2.0 te dá um veredito e evidências; ele não conversa.
- Vocabulário e formas de dizer algo. Pedir cinco jeitos mais naturais de dizer algo é rápido e útil.
- Falar com algo que responde de volta. O modo de voz do ChatGPT é um jeito razoável de se sentir mais confortável falando inglês em voz alta. Não é um corretor, mas é companhia.
- Prática de writing. Respostas escritas não precisam de transcrição, então a diferença no fluxo de trabalho é menor. A precisão da GPT em writing não fez parte deste teste e não fazemos nenhuma afirmação sobre ela.
- Qualquer coisa fora do teste. O ChatGPT é uma assistente geral e a Prepamigo não é.
O que o ChatGPT não deveria ser, com base nas evidências aqui, é a coisa que te diz se você está pronto. Para isso você quer um corretor construído para essa função, testado em respostas que nunca tinha visto, e medido nível por nível.
O que há de novo no seu feedback
O Engine 2.0 vem com uma camada de feedback totalmente reconstruída. Ela lê as evidências dos dois avaliadores, não apenas a nota, e foi testada com três tipos de aluno: alguém enfrentando o CELPIP pela primeira vez, alguém com inglês fraco em busca do truque, e alguém com meia hora por dia e uma prova na semana seguinte. Veja o que mudou.
- Suas próprias palavras, citadas de volta. Cada ponto do feedback cita a frase exata da sua transcrição que motivou a reação dos avaliadores. Se uma frase está entre aspas, ela foi copiada literalmente; em nossa auditoria, 157 de 158 citações eram. O feedback nunca inventa algo que você não disse.
- Uma coisa para corrigir primeiro. Cada resposta recebe uma única ação prioritária: a mudança que mais elevaria sua nota, escrita nas palavras mais simples da página. Depois vêm mais duas ações concretas e, por fim, uma lista de três itens para repassar mentalmente antes de começar a falar.
- Conselhos que combinam com a tarefa. Dar um conselho, descrever uma cena e convencer alguém são avaliados por critérios diferentes. Agora o feedback sabe o que cada um dos oito tipos de tarefa recompensa e fala diretamente sobre isso, em vez de repetir as mesmas dicas genéricas em todas as tarefas.
- Qual dimensão praticar primeiro. O feedback informa qual das quatro dimensões é sua mais fraca e qual é sua mais forte, para que você saiba onde está o próximo ponto, sem escondê-lo atrás de um número.
- O que a tarefa pedia e você deixou passar. Para o cumprimento da tarefa, o feedback lista as partes específicas do enunciado que você não cobriu, ou diz claramente que você cobriu todas elas.
- Coisas que você pode realmente ensaiar. Cada dica de como fazer é algo que você pode dizer em voz alta antes da próxima tentativa. Nenhum conselho para falar com mais clareza ou reduzir seu sotaque: sotaque não é o que a inteligibilidade mede, e o feedback nunca comenta sobre isso.
- Sem culpar o cronômetro. Uma resposta interrompida pelo relógio depois de já ter cumprido a tarefa não é penalizada pela interrupção, e o feedback não o repreende por isso.
Quando um modelo avaliador independente comparou este feedback com o que nosso sistema anterior produzia para as mesmas respostas, sem saber qual era qual, ele preferiu o novo feedback em 20 de 24 comparações, tanto julgando como um examinador quanto julgando como um aluno julgaria.
Perguntas frequentes
O ChatGPT consegue pontuar meu speaking do CELPIP? Ele vai te dar um número. Quando pedida de forma simples em 48 respostas inéditas com notas verificadas, a GPT 5.6 sol acertou 35% das vezes, a GPT 5.5, 37%, a luna, 31%, a GPT-4o mini, 45%, contra 81% do Engine 2.0. Em respostas de nível alto, a GPT 5.6 sol acertou 25% das vezes.
A Prepamigo é mais precisa que o ChatGPT? 81% contra 35% da GPT 5.6 sol com um pedido simples. Com o nosso procedimento completo e exemplos de calibração, a GPT 5.6 sol chegou a 71%, ainda dez pontos atrás.
Quanto custa cada um? O ChatGPT Pro custa US$200 por mês, cerca de CA$276 antes de impostos; o Plus custa US$20 com limites de mensagens. A Prepamigo custa CA$24.98 por mês com impostos inclusos, ou CA$8.25 por mês no plano anual, com pontuação ilimitada e 80 conjuntos de prática.
Qual modelo da GPT devo usar, se eu usar o ChatGPT? Com um pedido simples, nenhum deles se sai bem. Com exemplos de calibração, a GPT 5.6 sol. Nunca a GPT-4o mini se você estiver perto de um 10.
Para a mesma comparação com a Claude, leia Prepamigo vs Claude. Para o ranking completo de oito sistemas, leia qual ia pontua o speaking do CELPIP com mais precisão. Ou pule a transcrição e grave uma resposta. Leia também a versão original em Ler este guia em inglês.
