Porcentagem de redações pontuadas no nível verificado
36 respostas oficiais de writing do CELPIP, 12 em cada um dos três níveis, nas duas tarefas de writing. A Claude recebeu a tarefa e a redação e foi solicitada, em linguagem simples, a pontuá-la na escala do CELPIP. O corretor de writing da Prepamigo rodou como roda em produção.
86%
Corretor de writing da Prepamigo
61%
Claude Opus 5
56%
Claude Sonnet 5
Prepamigo comparado aos planos de chatbot mais populares
Em dólares canadenses. Os preços da Prepamigo já incluem impostos. Claude Max (a partir de US$100) e ChatGPT Pro (US$200) foram convertidos à taxa de 1,38, antes de impostos. A precisão é a porcentagem de 36 redações oficiais pontuadas no nível verificado quando o modelo indicado é solicitado, em linguagem simples, a pontuar a redação; execução única.
O writing é a habilidade em que um chatbot parece mais convincente como corretor. Não há gravação para transcrever, nem sotaque com que se preocupar, só texto entrando e um número saindo, com um parágrafo de explicação confiante. Então testamos o número. Demos à Claude as mesmas 36 respostas oficiais de writing do CELPIP com que o nosso próprio corretor é medido, doze em cada nível, e pedimos para ela pontuá-las do jeito que um estudante pediria.
A resposta curta: o corretor de writing da Prepamigo acertou o nível verificado 86% das vezes. A Claude Opus 5 acertou 61% das vezes e a Claude Sonnet 5, 56% das vezes. A diferença não é distribuída de forma uniforme. Em redações fracas e em redações fortes a Claude é respeitável, e no topo a Opus 5 é, na verdade, melhor do que nós. Em redações de nível médio, os 7s e 8s que a maioria dos candidatos realmente escreve, a Opus 5 acertou uma vez a cada quatro e a Sonnet 5, uma vez a cada três. A Prepamigo acertou todas as doze.
O restante deste artigo percorre esses resultados nível por nível, explica por que um modelo genérico perde o meio da escala, avalia o que vale o feedback de cada lado, e compara quanto custa praticar writing a sério com cada um. Tentamos ser justos com a Claude o tempo todo, inclusive no único ponto em que ela nos venceu.
O teste simples: o que um estudante realmente recebe
Oitenta e seis por cento contra sessenta e um e cinquenta e seis. Em 36 redações, isso são nove notas corretas a mais do que a Opus 5 e onze a mais do que a Sonnet 5. Em outras palavras, a Prepamigo comete 64% menos erros de pontuação do que a Opus 5 e 69% menos do que a Sonnet 5 nas mesmas redações.
O que a Claude recebeu importa, então aqui está. Cada modelo foi informado de que era um examinador experiente de writing do CELPIP, recebeu a tarefa exatamente como o candidato a viu, incluindo os pontos obrigatórios da tarefa de e-mail e as opções da tarefa de pesquisa, e recebeu a redação. Foi pedida uma única nota de 0 a 12. Esse é o pedido inteiro. É o que você digitaria numa janela de chat, e é um teste mais justo do que um simples “corrija isto” porque o modelo pelo menos sabe o que a tarefa pedia.
O corretor da Prepamigo recebeu a mesma tarefa e a mesma redação. Ele também tinha o que sempre tem em produção: redações reais já corrigidas daquela tarefa em cada nível para comparar, e uma camada de regras que confere as coisas que um avaliador confere primeiro, como se todos os pontos obrigatórios estão presentes, se uma resposta de pesquisa realmente escolhe um lado, se um e-mail tem saudação e despedida, e qual é o tamanho da resposta.
Onde a diferença se abre: nível por nível
Um número geral esconde onde os erros caem, e no writing os erros caem em um único lugar. Aqui estão os mesmos resultados divididos por nível verificado: redações fracas com nota 4 ou 5, redações médias com nota 7 ou 8, e redações fortes com nota 10 ou mais.
Redações fracas (nota verificada 4 ou 5)
12 redações oficiais. Os erros da Claude aqui são, em sua maioria, um 3, um nível abaixo.
75%
Corretor de writing da Prepamigo
67%
Claude Opus 5
50%
Claude Sonnet 5
Em redações fracas, a Prepamigo está em 75%, a Opus 5 em 67%, a Sonnet 5 em 50%. Os três erros da Prepamigo foram todos um degrau para cima, para um 6 ou 7, em redações que eram curtas mas arrumadas. Os erros da Claude vão na direção contrária: a Sonnet 5 deu 3 a quatro das doze redações fracas, e a Opus 5 deu 3 a duas delas. Um 3 nessa escala é uma resposta que mal se envolve com a tarefa. Essas redações se envolvem com ela; elas só são rasas. A Claude, sem nenhum exemplo de como é um 4, lê raso como reprovação.
Redações médias (nota verificada 7 ou 8)
12 redações oficiais. Este é o nível em que a maioria dos candidatos está, e o nível em que a Claude falha.
100%
Corretor de writing da Prepamigo
33%
Claude Sonnet 5
25%
Claude Opus 5
O meio é a história inteira. A Prepamigo pontuou todas as doze redações de nível médio dentro da faixa de 7 a 8. A Opus 5 acertou três delas; a Sonnet 5 acertou quatro. Os erros da Opus 5 foram quase todos para cima: ela deu 9 a seis das doze e 10 a uma. A Sonnet 5 se dividiu nas duas direções, com quatro redações empurradas para baixo, para um 6, e quatro empurradas para cima, para um 9 ou 10.
Pense no que isso significa para o candidato que escreveu uma dessas redações. Um 7 ou 8 é a nota real mais comum no teste, e é a nota que decide se você alcançou a sua meta de imigração ou não. Pergunte à Opus 5, e mais da metade das vezes ela vai dizer que você é um 9 ou um 10, pronto para parar de praticar. Você não está. Pergunte à Sonnet 5, e uma vez a cada três ela vai dizer que você caiu para um 6. Você não caiu. Nenhuma das duas respostas ajuda você a decidir o que fazer a seguir.
Redações fortes (nota verificada 10 ou mais)
12 redações oficiais. O único nível em que a Claude Opus 5 vence a Prepamigo.
92%
Claude Opus 5
83%
Corretor de writing da Prepamigo
83%
Claude Sonnet 5
No topo, a Opus 5 é o melhor corretor deste teste: onze de doze redações fortes reconhecidas. A Prepamigo e a Sonnet 5 reconheceram dez cada. Os dois erros da Prepamigo foram ambos um 9, um degrau abaixo; os da Sonnet 5 foram um 9 e um 7. Relatamos isso porque é verdade, e porque explica o padrão geral: a Claude é generosa. Ela distribui 9s, 10s e 11s com facilidade, o que por acaso está certo em redações fortes e errado em todo o resto.
Por que um chatbot perde o meio da escala
Uma redação de nível médio do CELPIP é uma coisa específica. Ela cobre a tarefa, é organizada, tem poucos erros que atrapalhem a compreensão, e também é genérica: as razões são afirmadas em vez de desenvolvidas, o vocabulário é seguro, as frases têm todas o mesmo formato. Um avaliador que já viu centenas dessas sabe exatamente onde ela se encaixa. Um modelo genérico não viu centenas dessas rotuladas como 7. Ele viu um texto limpo, organizado e majoritariamente correto, e vai atrás de um número alto.
Essa é a diferença inteira. O corretor da Prepamigo não julga uma redação contra uma ideia de boa escrita. Ele a julga contra redações reais já corrigidas da mesma tarefa: uma no nível fraco, uma no meio, uma no topo, todas respostas reais com deslizes reais. Uma redação limpa mas genérica cai ao lado do exemplo do meio porque é com ele que ela mais se parece. Uma redação rasa cai ao lado do exemplo fraco em vez de abaixo dele, porque o exemplo fraco também é raso e ainda assim é um 4.
Por cima da comparação há uma camada de regras que cuida das coisas que um modelo conta mal. O e-mail cobriu os três pontos obrigatórios, ou só dois? A resposta de pesquisa realmente escolheu uma opção, ou ficou em cima do muro? Há saudação e despedida? A resposta tem 180 palavras ou 60? Um ponto obrigatório esquecido segura a nota de cumprimento da tarefa em 8 ou menos, por melhor que seja o inglês, porque é assim que o teste funciona. A Claude, quando pedida de forma simples, não tem esse piso nem esse teto; ela decide tudo por impressão.
Testamos se explicar os níveis para a Claude resolveria isso. Não resolve, sozinho. Dar uma rubrica a um modelo produz o mesmo desvio. O que move o número é dar a ele os exemplos reais já corrigidos e uma camada de regras, o que é outra forma de dizer: construir um corretor.
A diferença no fluxo de trabalho: o que você precisa trazer
O writing é a habilidade em que a Claude é mais fácil de usar como corretor, e vale ser honesto quanto a isso. Você cola a redação, recebe uma nota em segundos, e se quiser que ela se explique, ela explica, em detalhes. Não há etapa de transcrição, nem áudio, nem configuração. Para uma segunda opinião rápida, ela é genuinamente conveniente.
O que você não recebe é a tarefa. A Claude não tem um banco de enunciados de e-mail e de pesquisa no estilo CELPIP com os pontos obrigatórios, as opções e a contagem de palavras corretos, então ou você escreve o seu próprio enunciado e torce para que ele se pareça com o teste, ou pratica com o que conseguir encontrar. Você não recebe uma verificação de pontos obrigatórios, porque a Claude não sabe quais pontos o teste real listaria. Você não recebe uma resposta modelo reescrita a partir da sua própria redação no tamanho certo. E você não recebe um número calibrado contra redações reais já corrigidas, que é o motivo pelo qual o meio da escala dá errado.
Na Prepamigo, você abre uma tarefa do banco, o cronômetro roda, você escreve, e cerca de um minuto depois de enviar você tem quatro notas por dimensão, uma nota geral, uma lista de tudo o que deixou passar, correções citadas do seu próprio texto, e uma resposta modelo reescrita. A quadragésima redação do mês custa o mesmo esforço que a primeira.
A mesma redação, a mesma nota
Uma nota que você não consegue reproduzir não é uma medida. Se a mesma redação recebe um 8 hoje e um 10 amanhã, você não aprendeu nada sobre o seu writing. Então, depois da execução principal, pontuamos todas as 36 redações mais duas vezes, em dias diferentes. O corretor de writing da Prepamigo pontuou 86%, 89% e 86% nas três execuções, com as mesmas doze redações de nível médio dentro da faixa todas as vezes.
As execuções da Claude também se moveram, mas o formato dos seus erros não: em todas as execuções, a maioria das redações de nível médio voltou como um 9 da Opus 5, e as redações fracas continuaram acumulando 3s da Sonnet 5. Essa consistência é a descoberta útil. O problema não é que a Claude é ruidosa. É que a Claude está confiantemente descalibrada na mesma direção todas as vezes, o que é mais difícil de perceber.
Feedback: uma boa explicação para o número errado
A Claude escreve um feedback excelente. É claro, paciente e específico, e se você pedir para ela explicar por que uma redação é um 9, ela vai produzir um parágrafo convincente. O problema é que o parágrafo é escrito para justificar um número que ela já escolheu, e quando o número está errado, a explicação está errada junto. Uma redação que na verdade é um 7 é elogiada por qualidades que não tem, e o candidato sai tranquilizado.
O feedback da Prepamigo funciona pelo lado oposto. Cada correção cita as palavras exatas da sua redação, e qualquer coisa que o verificador não consiga encontrar no seu texto é descartada antes de você ver. Um ponto obrigatório esquecido é nomeado. Cada dimensão recebe um fator limitante, ou uma declaração clara de que nada a está segurando. E você recebe uma resposta modelo reescrita a partir da sua própria resposta no tamanho que a tarefa pede, para que possa ver a diferença em vez de ler sobre ela. A seção abaixo lista o que mudou na camada de feedback.
O que há de novo no feedback do seu writing
A nota é só metade do que você recebe de volta. A camada de feedback do writing foi reconstruída junto com o corretor, e tudo nela está ancorado no seu próprio texto. Veja o que mudou.
- Correções que você encontra na sua própria redação. Cada correção de gramática, ortografia e vocabulário cita as palavras exatas da sua resposta, para que o app possa destacá-las onde você as escreveu. Qualquer coisa que o verificador não consiga encontrar palavra por palavra na sua redação é descartada antes de você ver.
- Uma resposta modelo, construída a partir da sua resposta. Você recebe uma versão reescrita da sua própria resposta que mantém as suas ideias, cobre todos os pontos obrigatórios e fica dentro das 150 a 200 palavras que a tarefa pede. Se a primeira reescrita não atingir esse tamanho, ela é refeita uma vez antes de ser mostrada.
- O ponto obrigatório que você deixou passar, pelo nome. Na tarefa de e-mail, o feedback lista os itens do enunciado que a sua resposta não cobriu. Um ponto esquecido também segura a nota de cumprimento da tarefa em 8 ou menos, então o número e o feedback nunca se contradizem.
- Um fator limitante por dimensão. Para cada uma das quatro dimensões, o feedback nomeia a única coisa que está segurando aquela nota, em termos concretos, ou diz claramente que nada está segurando e o que a sustenta. Concluir que uma dimensão não tem problema é uma resposta de verdade, não uma lacuna.
- Crítica no lugar certo. Um tom fraco é um problema de cumprimento da tarefa, uma escolha de palavra vaga é um problema de vocabulário, uma frase sem pontuação é um problema de legibilidade. Cada ponto é arquivado na dimensão a que pertence, em vez de ser jogado no resumo geral.
- Reescritas frase por frase. Frases específicas da sua redação voltam com uma versão melhorada e uma linha explicando por que ela é melhor, para que você veja a mudança em vez de apenas ler sobre ela.
- Sua dimensão mais forte e a mais fraca, lado a lado. O feedback informa qual das quatro dimensões está sustentando sua nota e qual está segurando, para que você saiba o que praticar em seguida sem precisar decifrar quatro números.
Cada citação no feedback é conferida com a sua redação antes de ser exibida. Se o verificador não encontrar as palavras, a linha é removida. É por isso que o feedback nunca manda você corrigir algo que você não escreveu.
Quanto custa praticar todos os dias
Uma nota de writing é mais útil na sua trigésima redação, não na terceira. É nesse ponto que ela começa a dizer se uma mudança no jeito que você escreve está funcionando. Então a pergunta prática é quanto cada opção custa para usar em volume.
A Claude Pro custa US$20 por mês, cerca de CA$28, ou US$17 por mês na cobrança anual, conforme publicado no claude.com em setembro de 2026, com uma janela de uso rotativa de cinco horas e um limite semanal. Os planos Max, a partir de US$100 por mês, cerca de CA$138 antes de impostos, elevam esses limites, mas não os eliminam. Nenhum dos planos inclui um banco de tarefas, um cronômetro, uma verificação de pontos obrigatórios, uma resposta modelo, ou uma nota calibrada contra redações reais já corrigidas.
A Prepamigo custa CA$24.98 por mês, ou CA$8.25 por mês no plano anual, o que dá CA$98.98 no ano, com impostos inclusos, e você pode cancelar quando quiser. Todo plano inclui pontuação ilimitada, sem limite diário, por sessão ou semanal, tentativas ilimitadas, e o banco de questões completo: 80 conjuntos de prática completos e mais de 2,000 tarefas de prática em Writing, Speaking, Reading e Listening, escritas para seguir os tipos de tarefa, o tempo e o formato do teste CELPIP General.
Quando a Claude é a ferramenta melhor
- Polir uma redação forte. Se você já está em um 10 e quer saber o que um 11 ou 12 exigiria, a Opus 5 reconhece a escrita forte com confiabilidade e explica bem. É o único nível em que ela nos venceu.
- Reescrever uma frase de cinco jeitos. Pedir alternativas para uma frase desajeitada é rápido e as sugestões são boas.
- Discutir uma resposta. Se você quer debater por que um argumento é fraco, uma conversa é o formato certo. A Prepamigo te dá um veredito e evidências; ela não conversa.
- Qualquer coisa fora do teste. A Claude é uma assistente geral e a Prepamigo não é.
O que a Claude não deveria ser, com base nessas evidências, é a coisa que diz a quem escreve no nível 7 ou 8 onde está. Isso é a maioria dos candidatos, e é exatamente onde a Claude erra três vezes a cada quatro.
Perguntas frequentes
A Claude consegue pontuar meu writing do CELPIP? Ela vai te dar um número. Em 36 respostas oficiais com notas verificadas, a Claude Opus 5 acertou 61% das vezes e a Claude Sonnet 5, 56%, contra 86% da Prepamigo. Em redações de nível médio: 25% e 33% contra 100%.
A Prepamigo é mais precisa que a Claude no writing? No geral, sim, por 25 a 30 pontos. Em redações fortes a Opus 5 é melhor, 92% contra 83%. Em redações de nível médio, onde está a maioria dos candidatos, a diferença é de 100% contra 25%.
Por que a Claude dá 9 para a minha redação mediana? Sem nada para comparar, uma redação limpa, organizada e genérica parece forte. A Opus 5 deu 9 ou 10 a sete das doze redações verificadas como 7 ou 8. A Prepamigo compara cada redação com exemplos reais já corrigidos da mesma tarefa.
Quanto custa cada uma? A Claude Max custa a partir de US$100 por mês, cerca de CA$138 antes de impostos; a Pro custa US$20 com limites mais apertados. A Prepamigo custa CA$24.98 por mês com impostos inclusos, ou CA$8.25 por mês no plano anual, com pontuação ilimitada e 80 conjuntos de prática.
Para a mesma comparação contra o ChatGPT, leia Prepamigo vs ChatGPT no writing. Para ver como o corretor de writing funciona, leia por dentro do corretor de writing da Prepamigo. Ou escreva uma resposta e veja a nota. Leia também a versão original em Ler este guia em inglês.
