Prepamigo Writing Scoring Engine vs. modelos de ponta como corretores
Porcentagem de respostas de writing do CELPIP em que a nota coincidiu com a nota verificada de forma independente. 36 redações oficiais, distribuídas igualmente entre os níveis fraco, médio e forte e entre as duas tarefas de writing. Cada modelo recebeu a tarefa e a redação e foi solicitado, em linguagem simples, a pontuá-la na escala do CELPIP.
86%
Prepamigo Writing Scoring EnginePrepamigo
78%
GPT 5.6 solOpenAI
69%
GPT 5.6 lunaOpenAI
61%
GeminiGoogle
61%
Claude Opus 5Anthropic
58%
GPT-4o miniOpenAI
56%
Claude Sonnet 5Anthropic
Prepamigo comparado aos planos de chatbot mais populares
Em dólares canadenses. Os preços da Prepamigo já incluem impostos. Claude Max (a partir de US$100) e ChatGPT Pro (US$200) foram convertidos à taxa de 1,38, antes de impostos. A precisão é a porcentagem de 36 redações oficiais pontuadas no nível verificado quando o modelo indicado é solicitado, em linguagem simples, a pontuar a redação; execução única.
O corretor de writing da Prepamigo acertou as notas verificadas em 86% das redações oficiais do CELPIP, na frente de todo modelo de ponta que recebeu a mesma função, e no nível médio, onde está a maioria dos candidatos, pontuou todas as redações corretamente.
Esta página apresenta o Prepamigo Writing Scoring Engine, o sistema que avalia todo e-mail e toda resposta de pesquisa de opinião escritos na Prepamigo. Ele não é um modelo genérico ao qual se pede para corrigir. É um corretor construído para uma única função: colocar uma resposta de writing do CELPIP no nível em que um examinador treinado a colocaria, e explicar essa colocação com as próprias palavras de quem escreveu.
O resultado é um corretor mais preciso do que qualquer modelo de ponta usado do jeito que um estudante usaria. Em 36 respostas oficiais de writing do CELPIP com notas verificadas de forma independente, o motor acertou o nível correto 86% das vezes. Quando pedida em linguagem simples para pontuar as mesmas redações, a GPT 5.6 sol chegou a 78%. A GPT 5.6 luna chegou a 69%, o Gemini e a Claude Opus 5 a 61%, a GPT-4o mini a 58%, e a Claude Sonnet 5 a 56%.
A precisão importa mais justamente onde os candidatos realmente estão. Um 7 ou 8 é a nota real de writing mais comum, e é a nota que decide se uma meta foi atingida. O motor colocou todas as doze redações de nível médio dentro dessa faixa. O melhor modelo de ponta colocou nove; a Claude Opus 5 colocou três. Esta página explica como o motor corrige, como ele se compara, o que há de novo no feedback que acompanha cada nota, e quanto custa praticar sem ficar contando.
Precisão contra notas verificadas
A pergunta que nos importa é simples. Quando um estudante envia uma redação, a nota na tela corresponde à nota que um examinador treinado teria dado? Para responder, usamos um conjunto de respostas oficiais de writing do CELPIP, cada uma com uma nota verificada de forma independente, cobrindo as duas tarefas de writing e dividido igualmente entre os níveis fraco, médio e forte: doze redações por nível, 36 no total. As seis redações de exemplo que o motor usa para calibração não estão entre elas.
Todo sistema viu a mesma tarefa, incluindo os pontos obrigatórios da tarefa de e-mail e as opções da tarefa de pesquisa de opinião, e a mesma redação. Cada modelo de ponta recebeu a informação de que era um examinador experiente de writing do CELPIP e foi pedido a dar uma única nota de 0 a 12. O motor rodou como roda em produção. Uma nota é correta quando cai dentro do nível verificado: 4 ou 5 para uma redação fraca, 7 ou 8 para uma de nível médio, 10 a 12 para uma forte.
37%
menos erros do que a GPT 5.6 sol
5 notas erradas em 36, contra 8.
64%
menos erros do que a Claude Opus 5
5 notas erradas em 36, contra 14.
100%
das redações de nível médio pontuadas corretamente
O melhor dos outros modelos: 75%. Claude Opus 5: 25%.
Três coisas se destacam. Primeiro, a vantagem sobre o melhor modelo de ponta é de oito pontos, o que em 36 redações significa três notas corretas a mais, e ela se manteve em toda execução repetida. Segundo, a vantagem sobre os modelos da Claude é de 25 a 30 pontos, e está concentrada no meio da escala, onde um modelo genérico lê uma redação limpa e genérica como se fosse forte. Terceiro, a comparação é a que importa para um estudante: ela mede o que você recebe quando cola uma redação em um chatbot e pede, que é como quase todo mundo usa esses modelos.
| Sistema | Todas as redações | Fracas | Médias | Fortes |
|---|---|---|---|---|
| Prepamigo Writing Scoring Engine | 86% | 75% | 100% | 83% |
| GPT 5.6 sol | 78% | 83% | 75% | 75% |
| GPT 5.6 luna | 69% | 83% | 58% | 67% |
| Gemini | 61% | 58% | 42% | 83% |
| Claude Opus 5 | 61% | 67% | 25% | 92% |
| GPT-4o mini | 58% | 83% | 67% | 25% |
| Claude Sonnet 5 | 56% | 50% | 33% | 83% |
Porcentagem de redações pontuadas dentro do nível verificado, execução única. Doze redações por nível, então uma redação vale cerca de oito pontos na visão por nível e três pontos no total.
Desempenho em cada nível
Uma média esconde onde os erros caem. No writing, para um modelo genérico, eles caem em dois lugares: no meio, onde uma redação limpa mas genérica é lida como forte, e no topo, onde uma redação forte com um deslize é segurada em um 9.
Redações fracas · nota verificada 4 ou 5
12 redações oficiais por sistema.
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
Prepamigo Writing Engine
67%
Claude Opus 5
58%
Gemini
50%
Claude Sonnet 5
Redações de nível médio · nota verificada 7 ou 8
12 redações oficiais por sistema. O nível em que está a maioria dos candidatos.
100%
Prepamigo Writing Engine
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
42%
Gemini
33%
Claude Sonnet 5
25%
Claude Opus 5
Redações fortes · nota verificada 10 ou mais
12 redações oficiais por sistema. Quase todo erro é um 9.
92%
Claude Opus 5
83%
Prepamigo Writing Engine
83%
Gemini
83%
Claude Sonnet 5
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
Em redações fracas, os modelos da GPT estão em 83% e o motor em 75%. Os três erros do motor foram todos um degrau acima, para um 6 ou 7, em redações curtas mas arrumadas; os erros dos modelos da Claude foram na outra direção, dando 3 a redações rasas. Um texto fraco é o lado fácil da escala para qualquer um, e este é o único nível em que um chatbot consegue igualar ou superar o motor.
No meio, o motor está sozinho com 100%. A GPT 5.6 sol puxou três de doze redações para baixo, a um 6. A Claude Opus 5 empurrou sete de doze para cima, a um 9 ou 10. O Gemini empurrou cinco para cima. Uma redação de nível médio cobre a tarefa, é organizada e também é genérica; um modelo sem nada com que comparar a lê por impressão, e a impressão varia de modelo para modelo. O motor a lê contra um 7 real, já corrigido.
No topo, a Claude Opus 5 é o melhor corretor do teste, com onze de doze redações fortes reconhecidas contra dez do motor. A Claude é generosa, o que é certo em redações fortes e errado em todo o resto. A GPT-4o mini deu 9 a nove das doze: ela não distribui 10.
Consistência e estabilidade
Um corretor em que se pode confiar precisa dar a mesma resposta duas vezes. Depois da execução principal, pontuamos todas as 36 redações mais duas vezes, em dias diferentes. O motor pontuou 86%, 89% e 86%, com as mesmas doze redações de nível médio dentro da faixa todas as vezes e nenhuma redação se movendo mais de um ponto entre as execuções. A GPT 5.6 sol pontuou 78%, 83% e 81% nos mesmos três dias.
O motor roda o modelo de pontuação com o raciocínio desligado e em uma temperatura fixa, e é isso que torna o número reproduzível. Uma única resposta de chatbot carrega alguns pontos de sorte em qualquer direção; uma nota que é estável entre os dias é uma nota com a qual você pode planejar.
Duas tarefas, dois tipos de erro
O writing do CELPIP tem duas tarefas, e elas falham de jeitos diferentes. A tarefa de e-mail te dá uma situação e três ou quatro pontos que você precisa cobrir. A tarefa de pesquisa de opinião te dá duas opções e pede que você escolha uma e a defenda. Um corretor que trata as duas do mesmo jeito vai errar nas duas.
Na tarefa de e-mail, o motor acertou 89% das redações. Os erros que mais custam aos candidatos aqui não são de gramática; são um ponto não coberto, um tom que não combina com o leitor, ou uma abertura e um fechamento que não estão lá. A camada de regras verifica cada um desses itens antes de o corretor dar uma opinião, e um ponto não coberto mantém o cumprimento da tarefa em 8 ou menos, por mais polido que seja o inglês. Um chatbot, ao receber um pedido de nota em linguagem simples, não sabe quais pontos eram obrigatórios a menos que você os cole, e mesmo assim raramente os verifica um por um.
Na tarefa de pesquisa de opinião, o motor acertou 83% das redações. A tarefa de pesquisa recompensa uma posição clara e duas razões desenvolvidas, e pune uma resposta que fica em cima do muro. O motor lê a posição primeiro: uma resposta que nunca se compromete não pode pontuar acima do meio em cumprimento da tarefa. Chatbots tendem a recompensar uma resposta equilibrada, o que, em uma resposta de pesquisa de opinião, é um erro.
O sentido de um corretor que conhece a tarefa é que a nota reflete aquilo a que um examinador reagiria naquela tarefa, não uma impressão geral do inglês. Um e-mail de nível médio geralmente é de nível médio por causa de um terceiro ponto raso; uma resposta de pesquisa de nível médio geralmente é de nível médio porque uma razão é afirmada e não desenvolvida. O motor te diz qual dos dois, pelo nome.
Onde o motor não é o melhor
O motor lidera no geral e no meio. Ele não é o líder nas duas pontas, e é mais justo dizer isso do que escondê-lo em uma média.
Em redações fracas, os três modelos da GPT pontuaram 83% cada contra 75% do motor. Os erros do motor foram todos um degrau acima, em redações curtas e arrumadas que não desenvolveram nada. Um modelo da GPT, que lê um texto genérico como fraco, acerta essas. Se você está no nível fraco e só quer a confirmação disso, a GPT 5.6 sol vai te dar essa confirmação um pouco mais vezes. Ela também vai, três vezes em doze, dizer a quem escreve no nível médio que é um 6.
Em redações fortes, a Claude Opus 5 pontuou 92% contra 83% do motor. A Claude lê um texto polido com generosidade, o que em uma redação forte é correto. A mesma generosidade deu 9 ou 10 a sete de doze redações de nível médio. Se você já escreve no nível forte, a Claude Opus 5 vai confirmar isso um pouco mais vezes do que o motor. Se você não escreve, ela é o modelo com mais chance de dizer que você escreve.
O motor é o único corretor do teste que fica a menos de dez pontos do líder em todos os níveis, e o único com 100% no meio. Esse é o perfil de que um candidato precisa: um corretor que não é brilhante em um nível e errado em outro, mas certo em quase todo lugar e certo onde está a maioria dos candidatos.
Como o motor corrige uma resposta
Veja o que acontece no minuto, mais ou menos, entre apertar enviar e ler uma nota.
- A camada de regras lê a redação primeiro. Antes de qualquer modelo vê-la, o motor conta as palavras, verifica se o e-mail tem uma saudação e uma despedida, verifica se a resposta de pesquisa faz uma escolha clara, e confere a redação contra os pontos obrigatórios do enunciado. Essas verificações se tornam limites rígidos que o corretor não pode ignorar: uma resposta de pesquisa que nunca escolhe um lado, ou um e-mail que parece uma resposta de pesquisa, não pode pontuar acima do meio da escala em cumprimento da tarefa.
- A redação é comparada com exemplos reais já corrigidos. O corretor vê três respostas reais do CELPIP para o mesmo tipo de tarefa, uma no nível fraco, uma no meio, uma no topo, todas com seus deslizes reais, e posiciona a redação em relação a elas em cada uma das quatro dimensões: conteúdo e coerência, vocabulário, legibilidade, cumprimento da tarefa. Comparável ao exemplo do meio é um 7 ou 8; comparável ao exemplo do topo é um 10 ou 11; claramente mais forte que o exemplo do topo é um 12.
- Todo julgamento precisa de evidência. Para cada dimensão, o corretor precisa citar as frases da redação que sustentam a nota antes de dar a nota. Citações que não podem ser encontradas na redação são descartadas.
- Pontos não cobertos limitam a nota. Se o corretor informa que um ponto obrigatório está faltando, a nota de cumprimento da tarefa é mantida em 8 ou menos, para que o número e o feedback concordem.
- As quatro dimensões viram uma nota. A nota geral é a média das quatro, depois de aplicados os limites da camada de regras.
- O feedback é construído a partir da mesma evidência. Correções, uma resposta modelo no tamanho certo, os pontos não cobertos pelo nome e um fator limitante por dimensão, tudo citado do texto de quem escreveu. A seção abaixo lista o que mudou.
Também testamos levar o motor para o design de dois corretores, com votação e reconciliação, que o nosso corretor de speaking usa. Não ajudou no writing: os níveis oficiais de writing ficam mais próximos uns dos outros na escala de 0 a 12 do que os níveis de speaking, e forçar um corretor a escolher entre exemplos sem uma opção intermediária empurrou redações de nível médio para um 9. O motor de writing mantém o design que pontua o meio corretamente.
O que há de novo no feedback do seu writing
A nota é só metade do que você recebe de volta. A camada de feedback do writing foi reconstruída junto com o corretor, e tudo nela está ancorado no seu próprio texto. Veja o que mudou.
- Correções que você encontra na sua própria redação. Cada correção de gramática, ortografia e vocabulário cita as palavras exatas da sua resposta, para que o app possa destacá-las onde você as escreveu. Qualquer coisa que o verificador não consiga encontrar palavra por palavra na sua redação é descartada antes de você ver.
- Uma resposta modelo, construída a partir da sua resposta. Você recebe uma versão reescrita da sua própria resposta que mantém as suas ideias, cobre todos os pontos obrigatórios e fica dentro das 150 a 200 palavras que a tarefa pede. Se a primeira reescrita não atingir esse tamanho, ela é refeita uma vez antes de ser mostrada.
- O ponto obrigatório que você deixou passar, pelo nome. Na tarefa de e-mail, o feedback lista os itens do enunciado que a sua resposta não cobriu. Um ponto esquecido também segura a nota de cumprimento da tarefa em 8 ou menos, então o número e o feedback nunca se contradizem.
- Um fator limitante por dimensão. Para cada uma das quatro dimensões, o feedback nomeia a única coisa que está segurando aquela nota, em termos concretos, ou diz claramente que nada está segurando e o que a sustenta. Concluir que uma dimensão não tem problema é uma resposta de verdade, não uma lacuna.
- Crítica no lugar certo. Um tom fraco é um problema de cumprimento da tarefa, uma escolha de palavra vaga é um problema de vocabulário, uma frase sem pontuação é um problema de legibilidade. Cada ponto é arquivado na dimensão a que pertence, em vez de ser jogado no resumo geral.
- Reescritas frase por frase. Frases específicas da sua redação voltam com uma versão melhorada e uma linha explicando por que ela é melhor, para que você veja a mudança em vez de apenas ler sobre ela.
- Sua dimensão mais forte e a mais fraca, lado a lado. O feedback informa qual das quatro dimensões está sustentando sua nota e qual está segurando, para que você saiba o que praticar em seguida sem precisar decifrar quatro números.
Cada citação no feedback é conferida com a sua redação antes de ser exibida. Se o verificador não encontrar as palavras, a linha é removida. É por isso que o feedback nunca manda você corrigir algo que você não escreveu.
O que fazer com a nota
Uma nota em que você pode confiar muda o jeito de praticar. Com um chatbot, você nunca tem certeza se uma mudança de 8 para 9 foi você ou o modelo, então toda nota precisa ser conferida contra uma sensação. Com um corretor estável e preciso, a nota é o feedback.
- Escreva a mesma tarefa duas vezes. Envie, leia os pontos não cobertos e o fator limitante de cada dimensão, reescreva com a resposta modelo ao lado, e envie de novo. Uma mudança de um ponto ou mais entre as duas é uma mudança na sua escrita, porque o motor dá à mesma redação a mesma nota.
- Acompanhe a dimensão mais fraca, não o total. A nota geral é uma média de quatro. Dois candidatos com 8 podem ter problemas completamente diferentes. O feedback nomeia a dimensão que está te segurando, e é nela que você deve trabalhar.
- Trate um 9 como um quase. Os dois erros do motor em redações fortes foram um 9. Um 9 do motor significa que faltou uma razão desenvolvida ou uma escolha precisa de palavra para chegar ao 10.
- Alterne as tarefas. A maioria dos candidatos pratica a tarefa de que gosta. O motor pontua e-mails e respostas de pesquisa contra exemplos diferentes e regras diferentes, então uma nota forte no e-mail não diz nada sobre a sua resposta de pesquisa.
Prática ilimitada por CA$25 por mês
A precisão só é útil se você puder pagar para usá-la todos os dias. Uma nota de writing em que você confia vale mais na sua trigésima redação, não na terceira, porque é aí que ela começa a dizer se uma mudança no jeito que você escreve está funcionando. Por isso o motor tem um preço para ser usado sem ficar contando.
Todo plano da Prepamigo inclui pontuação ilimitada, tentativas ilimitadas e o banco de questões completo: 80 conjuntos de prática completos e mais de 2,000 tarefas de prática em Writing, Speaking, Reading e Listening, escritas para seguir os tipos de tarefa, o tempo e o formato do teste CELPIP General. Você escreve, envia, e cerca de um minuto depois tem a nota, as correções e uma resposta modelo.
Prepamigo
CA$25/ mês
CA$24.98 mês a mês · CA$8.25 por mês no plano anual (CA$98.98 por ano) · impostos inclusos · cancele quando quiser
- Pontuação ilimitada para writing e speaking, sem limite diário, por sessão ou semanal.
- 80 conjuntos de prática e mais de 2,000 tarefas nas quatro seções, modelados no formato do teste real, para que você nunca precise escrever seus próprios enunciados.
- Escreva e envie. A pontuação, as correções, a verificação dos pontos obrigatórios e a resposta modelo são feitas para você.
- Feedback com suas próprias palavras, com cada citação conferida contra o que você realmente escreveu.
Claude Max, para comparação
US$100/ mês
cerca de CA$138 antes de impostos · nível 20x por US$200 por mês · Pro por US$20 com limites bem mais apertados
- Até o Max tem limite. Uma janela de uso rotativa de cinco horas e um limite semanal; quando você atinge um dos dois, você espera.
- Sem banco de questões. Você traz suas próprias tarefas, decide por conta própria se elas se parecem com o teste real, e controla o que já praticou.
- Sem verificação de pontos obrigatórios, sem resposta modelo. Você recebe um número e um parágrafo.
- Um pedido simples, não um corretor calibrado. Quando pedida em linguagem simples, a Claude Opus 5 acertou as notas verificadas 61% das vezes e a Claude Sonnet 5, 56%, contra 86% do motor.
Os preços e as condições de uso dos planos da Claude são os publicados no claude.com em setembro de 2026 e podem mudar. CELPIP é uma marca registrada de seu proprietário; a Prepamigo é uma plataforma de prática independente e não é afiliada, endossada ou ligada ao criador do teste. As tarefas de prática da Prepamigo são material original escrito para seguir o formato público do teste.
Disponibilidade
O Prepamigo Writing Scoring Engine já está no ar para todos os usuários da Prepamigo nas duas tarefas de writing. Não há nada para ativar. Todo e-mail e toda resposta de pesquisa de opinião é pontuada por ele, e toda nota vem com feedback extraído do texto de quem escreveu.
Para as comparações diretas, leia Prepamigo vs Claude para writing e Prepamigo vs ChatGPT para writing. Para o lado do speaking, leia Scoring Engine 2.0 para Speaking. Ou Escrever uma resposta e veja o motor funcionando. Leia também a versão original em Ler este guia em inglês.
