Pontuação

Qual IA pontua o writing do CELPIP com mais precisão? Testamos sete

8 de setembro de 2026

Porcentagem de redações pontuadas no nível verificado

36 respostas oficiais de writing do CELPIP, 12 por nível, nas duas tarefas de writing. Cada modelo recebeu a tarefa e a redação e foi solicitado, em linguagem simples, a pontuá-la na escala do CELPIP. O corretor de writing da Prepamigo rodou na sua configuração normal de produção.

86%

Corretor de writing da Prepamigo

78%

GPT 5.6 sol

69%

GPT 5.6 luna

61%

Gemini

61%

Claude Opus 5

58%

GPT-4o mini

56%

Claude Sonnet 5

Prepamigo comparado aos planos de chatbot mais populares

Em dólares canadenses. Os preços da Prepamigo já incluem impostos. Claude Max (a partir de US$100) e ChatGPT Pro (US$200) foram convertidos à taxa de 1,38, antes de impostos. A precisão é a porcentagem de 36 redações oficiais pontuadas no nível verificado quando o modelo indicado é solicitado, em linguagem simples, a pontuar a redação; execução única.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Preço mensal
CA$24.98 (c/ imposto)
CA$138+ (s/ imposto)
CA$276 (s/ imposto)
Pontuação
Ilimitada
Limitada
Limitada
Banco de questões pronto
Sim
Não
Não
Conjuntos de prática
80
Nenhum
Nenhum
Tarefas de prática
2,000+
Nenhuma
Nenhuma
Formato CELPIP
Sim
Não
Não
Precisão
86%
61%
78%
Redações de nível médio
100%
25%
75%

Muitos candidatos do CELPIP checam a própria escrita com um chatbot de IA. Cola o e-mail, pede uma nota, lê o parágrafo. Para o writing é fácil: sem gravação, sem transcrição. O que ninguém te conta é com que frequência o número está certo, ou em qual modelo confiar, ou quais erros cada um comete. Queríamos saber, então demos a seis chatbots e ao nosso próprio corretor as mesmas 36 redações oficiais com notas verificadas e contamos.

A versão em uma frase: a GPT 5.6 sol é o chatbot mais preciso para o writing do CELPIP, com 78%, os modelos da Claude são os menos precisos, com 61% e 56%, porque inflam redações de nível médio, e um corretor especializado, o da Prepamigo, chegou a 86% nas mesmas redações e acertou todas as redações de nível médio. Devemos ser transparentes: a Prepamigo é o nosso produto. Onde um chatbot nos venceu em um nível específico, dizemos isso; dois deles venceram.

O ranking

Três faixas são visíveis no gráfico acima. A Prepamigo, com 86%, está sozinha. A GPT 5.6 sol, com 78%, e a GPT 5.6 luna, com 69%, formam uma segunda faixa: utilizáveis, com hábitos conhecidos. Todo o resto está em torno de 60%, o que, para uma escala de três faixas, não é muito melhor do que um palpite bem informado.

O padrão é diferente do speaking, onde os modelos da Claude foram bem e os modelos da GPT foram mal. No writing é o inverso. Os modelos da GPT são ligeiramente severos: puxam um 7 genérico para um 6 e seguram uma redação forte com um deslize em um 9. Os modelos da Claude são generosos: empurram um 7 genérico para um 9 ou 10 e dão 3 a redações fracas e rasas. O Gemini se comporta como a Claude no meio. A GPT-4o mini trata o 9 como teto.

Resultados em cada nível

Redações fracas (nota verificada 4 ou 5)

12 redações oficiais por sistema.

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

Corretor de writing da Prepamigo

67%

Claude Opus 5

58%

Gemini

50%

Claude Sonnet 5

Redações fracas são o lado fácil da escala, e os três modelos da GPT empatam em 83%, à frente da Prepamigo com 75%. Os três erros da Prepamigo foram todos um degrau acima, para um 6 ou 7, em redações curtas mas arrumadas. Os modelos da Claude erram na outra direção: a Sonnet 5 deu 3 a quatro de doze redações fracas, um nível abaixo, e a Opus 5 deu 3 a duas delas. Uma redação rasa que ainda cumpre a tarefa é um 4, não um 3, e um modelo sem um exemplo de 4 não consegue ver a diferença.

Redações de nível médio (nota verificada 7 ou 8)

12 redações oficiais por sistema. O nível em que está a maioria dos candidatos.

100%

Corretor de writing da Prepamigo

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

42%

Gemini

33%

Claude Sonnet 5

25%

Claude Opus 5

A faixa do meio separa o grupo. A Prepamigo acertou todas as doze. A GPT 5.6 sol acertou nove, puxando três para um 6. A GPT-4o mini acertou oito e empurrou quatro para um 9. A luna acertou sete, na maioria puxando para baixo. O Gemini acertou cinco e empurrou seis para um 9 ou 10. A Claude Sonnet 5 acertou quatro, com os erros divididos entre 6 e 9. A Claude Opus 5 acertou três e deu 9 ou 10 a sete das doze.

Se você escreve no nível 7 ou 8, e a maioria dos candidatos escreve, este é o gráfico para lembrar. Pergunte à Claude Opus 5 e, mais da metade das vezes, ela vai dizer que você já está pronto. Pergunte ao Gemini e, metade das vezes, ele vai dizer o mesmo. Pergunte à GPT 5.6 sol e, uma vez em quatro, ela vai dizer que você caiu para um 6.

Redações fortes (nota verificada 10 ou mais)

12 redações oficiais por sistema. Quase todo erro é um 9.

92%

Claude Opus 5

83%

Corretor de writing da Prepamigo

83%

Gemini

83%

Claude Sonnet 5

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

No topo, a Claude Opus 5 é o melhor corretor do teste, com onze de doze redações fortes reconhecidas; ela deu 11 a cinco delas. A Prepamigo, o Gemini e a Sonnet 5 reconheceram dez cada. A GPT 5.6 sol reconheceu nove e a luna oito, segurando o resto em um 9. A GPT-4o mini reconheceu três e deu 9 a nove: ela não distribui 10. A generosidade da Claude está certa aqui e errada em todo o resto; a severidade dos modelos da GPT está errada aqui e mais ou menos certa no resto.

Seja qual for o chatbot que você usa, um 9 em uma redação que você achou forte tem mais chance de ser um 10 segurado do que um 9 de verdade, a menos que tenha vindo de um modelo da Claude, caso em que um 9 tem mais chance de ser um 7 ou 8 que foi promovido. A direção do erro depende do modelo.

Por que os modelos discordam sobre o meio

Uma redação de nível médio do CELPIP é uma coisa específica: cobre a tarefa, é organizada, tem poucos erros que atrapalhem a compreensão, e é genérica, com razões afirmadas em vez de desenvolvidas e um vocabulário seguro em vez de preciso. Um examinador treinado já viu centenas dessas e sabe onde elas ficam. Um modelo genérico viu um texto arrumado, organizado e quase todo correto e precisa decidir por impressão. A impressão da Claude é que arrumado significa forte. A impressão da GPT é que genérico significa fraco. As duas estão erradas sobre um 7, em direções opostas.

O corretor da Prepamigo não julga por impressão. Ele compara a redação com respostas reais já corrigidas para o mesmo tipo de tarefa em cada nível, todas redações reais com deslizes reais, e a posiciona ao lado daquela com que mais se parece em cada uma das quatro dimensões. Uma redação limpa mas genérica cai ao lado do exemplo do meio, porque é isso que ela é. Por cima da comparação fica uma camada de regras para as coisas que um modelo conta mal: se todo ponto obrigatório foi coberto, se uma resposta de pesquisa escolhe um lado, se o e-mail tem uma saudação e uma despedida, e qual é a extensão. Um ponto obrigatório não coberto mantém o cumprimento da tarefa em 8 ou menos, independentemente do inglês, porque é assim que o teste funciona.

Também tentamos dar ao corretor de writing o design de dois corretores, com votação e reconciliação, que o nosso corretor de speaking usa. Isso piorou o writing, porque os níveis oficiais de writing ficam apenas dois pontos distantes na escala de 0 a 12 e uma escolha forçada entre exemplos empurrou redações de nível médio para um 9. O writing mantém o design que acerta o meio.

Por que o ranking é o inverso do speaking

Se você leu a nossa comparação de speaking, o ranking de writing vai parecer de cabeça para baixo. Em transcrições de speaking, a Claude Opus 5 foi o melhor chatbot, com 62%, e a GPT 5.6 sol o pior dos modelos grandes, com 35%. No writing, é a GPT 5.6 sol com 78% e os modelos da Claude no fim da lista.

A razão é aquilo com que cada modelo é generoso. Uma transcrição de speaking do CELPIP é inglês falado posto no papel: fragmentos, repetições, autocorreções. A GPT lê isso como quebrado e pontua com severidade, o que em uma transcrição é errado; a Claude lê através disso até as ideias. Uma redação do CELPIP é o oposto: é editada, organizada, arrumada na superfície, e muitas vezes genérica por baixo. A Claude lê a arrumação como força e infla o meio; a GPT lê o conteúdo genérico como fraqueza e acerta mais ou menos, ou fica um ponto abaixo.

A lição prática é que não existe um único chatbot melhor para o CELPIP. O modelo que corrige bem o seu speaking é o que vai lisonjear a sua escrita, e vice-versa. Um corretor especializado contorna a questão comparando com exemplos corrigidos do tipo certo para cada tarefa. O motor de speaking e o motor de writing da Prepamigo são sistemas separados, com designs diferentes, porque as duas tarefas falham de jeitos diferentes.

O parágrafo que vem com o número

Todo chatbot devolve um parágrafo de feedback junto com a nota, e o parágrafo costuma ser mais confiante do que o número merece. Três coisas para checar antes de agir com base nele.

  • Ele cita você? Uma correção que não aponta para as suas palavras exatas é uma regra geral, não feedback sobre a sua redação. A maioria dos conselhos de chatbot é do tipo que se aplica a qualquer redação: varie a estrutura das frases, use um vocabulário mais preciso, desenvolva as suas razões. Verdade, e nada acionável.
  • Ele nomeia o ponto que falta? Se você colou a tarefa, uma boa resposta diz qual ponto obrigatório você não cobriu. Se não colou, o chatbot não tem como saber, e vai elogiar a cobertura mesmo assim.
  • A crítica combina com a nota? Um parágrafo de chatbot muitas vezes lista três ou quatro problemas e depois dá um 10, ou elogia a redação e dá um 6. Quando as palavras e o número discordam, nenhum dos dois é confiável.

O feedback da Prepamigo é construído ao contrário: o corretor precisa citar as frases que sustentam a nota de cada dimensão antes de dar a nota, e uma citação que não pode ser encontrada na sua redação é descartada. Os pontos não cobertos são listados pelo nome, e um ponto não coberto limita a nota de cumprimento da tarefa, então as palavras e o número não podem discordar. A seção abaixo lista o que há nele.

Notas sobre cada modelo

  • GPT 5.6 sol. O melhor chatbot para writing, com 78%, e o que usar se você usa um. Ligeiramente severa: três redações de nível médio puxadas para um 6, três redações fortes seguradas em um 9. Em redações fracas, é melhor que a Prepamigo, 83% contra 75%.
  • GPT 5.6 luna. 69%. Mesmo formato da sol, mas mais severa no meio, onde acertou sete de doze. Boa em redações fracas.
  • Gemini. 61%. Razoável nos extremos, fraco no meio, com 42%, onde empurrou seis de doze redações para um 9 ou 10.
  • Claude Opus 5. 61% no geral, mas o melhor corretor do teste em redações fortes, com 92%. No meio é a pior, com 25%, dando 9 ou 10 a sete de doze. Se a sua escrita já é forte, a Opus 5 vai confirmar; se é mediana, a Opus 5 vai dizer que é forte.
  • GPT-4o mini. 58%. Trata o 9 como o topo da escala: nove de doze redações fortes receberam um 9. Não a use para corrigir writing se você está perto de um 10.
  • Claude Sonnet 5. 56%, a menos precisa. Deu 3 a quatro redações fracas e dividiu a faixa do meio entre 6 e 9.

Se você vai usar um chatbot de qualquer jeito

  1. Use a GPT 5.6 sol. Não um modelo da Claude para qualquer coisa abaixo de uma redação forte, e não um modelo pequeno para qualquer coisa acima de uma fraca.
  2. Cole a tarefa inteira. Os pontos obrigatórios da tarefa de e-mail e as opções da tarefa de pesquisa de opinião mudam a nota. Um modelo que não conhece os pontos não pode dizer que falta um.
  3. Peça para ele verificar os pontos primeiro. Peça um sim ou não para cada ponto obrigatório, e depois a nota. Isso é a camada de regras, feita à mão.
  4. Pergunte duas vezes, fique com a resposta mais baixa. A GPT 5.6 sol pontuou 78%, 83% e 81% em três execuções das mesmas redações; uma única resposta carrega alguns pontos de sorte.
  5. Leia um 9 e um 6 com desconfiança. De um modelo da GPT, um 9 muitas vezes é um 10 segurado e um 6 muitas vezes é um 7 puxado para baixo. De um modelo da Claude, um 9 muitas vezes é um 7 promovido.

A única entrada que você não consegue fornecer por conta própria é uma redação verificada e já corrigida para a mesma tarefa em cada nível, que é com o que um corretor especializado compara. Isso, e a verificação dos pontos obrigatórios, é a diferença entre 78% e 86%.

O que há de novo no feedback do seu writing

A nota é só metade do que você recebe de volta. A camada de feedback do writing foi reconstruída junto com o corretor, e tudo nela está ancorado no seu próprio texto. Veja o que mudou.

  • Correções que você encontra na sua própria redação. Cada correção de gramática, ortografia e vocabulário cita as palavras exatas da sua resposta, para que o app possa destacá-las onde você as escreveu. Qualquer coisa que o verificador não consiga encontrar palavra por palavra na sua redação é descartada antes de você ver.
  • Uma resposta modelo, construída a partir da sua resposta. Você recebe uma versão reescrita da sua própria resposta que mantém as suas ideias, cobre todos os pontos obrigatórios e fica dentro das 150 a 200 palavras que a tarefa pede. Se a primeira reescrita não atingir esse tamanho, ela é refeita uma vez antes de ser mostrada.
  • O ponto obrigatório que você deixou passar, pelo nome. Na tarefa de e-mail, o feedback lista os itens do enunciado que a sua resposta não cobriu. Um ponto esquecido também segura a nota de cumprimento da tarefa em 8 ou menos, então o número e o feedback nunca se contradizem.
  • Um fator limitante por dimensão. Para cada uma das quatro dimensões, o feedback nomeia a única coisa que está segurando aquela nota, em termos concretos, ou diz claramente que nada está segurando e o que a sustenta. Concluir que uma dimensão não tem problema é uma resposta de verdade, não uma lacuna.
  • Crítica no lugar certo. Um tom fraco é um problema de cumprimento da tarefa, uma escolha de palavra vaga é um problema de vocabulário, uma frase sem pontuação é um problema de legibilidade. Cada ponto é arquivado na dimensão a que pertence, em vez de ser jogado no resumo geral.
  • Reescritas frase por frase. Frases específicas da sua redação voltam com uma versão melhorada e uma linha explicando por que ela é melhor, para que você veja a mudança em vez de apenas ler sobre ela.
  • Sua dimensão mais forte e a mais fraca, lado a lado. O feedback informa qual das quatro dimensões está sustentando sua nota e qual está segurando, para que você saiba o que praticar em seguida sem precisar decifrar quatro números.

Cada citação no feedback é conferida com a sua redação antes de ser exibida. Se o verificador não encontrar as palavras, a linha é removida. É por isso que o feedback nunca manda você corrigir algo que você não escreveu.

Perguntas frequentes

Qual IA é a mais precisa para pontuar o writing do CELPIP? Entre os chatbots, a GPT 5.6 sol com 78%, depois a luna com 69%, o Gemini e a Claude Opus 5 com 61%, a GPT-4o mini com 58%, a Claude Sonnet 5 com 56%. O corretor de writing da Prepamigo chegou a 86% nas mesmas redações.

ChatGPT ou Claude para writing? O ChatGPT, claramente: 78% contra 61% e 56%. Os modelos da Claude inflam redações de nível médio para um 9 ou 10. A Opus 5 é a melhor de todos em redações fortes.

Por que eles dão 9 à minha redação mediana? Arrumado e organizado parece forte para um modelo sem nada com que comparar. A Prepamigo compara com exemplos reais já corrigidos para a mesma tarefa.

Como consigo uma nota melhor de um chatbot? Use a GPT 5.6 sol, cole a tarefa completa, peça para verificar cada ponto obrigatório primeiro, pergunte duas vezes, e leia os 9 e os 6 com desconfiança.

Para as duas comparações diretas, leia Prepamigo vs Claude para writing e Prepamigo vs ChatGPT para writing. Para ver como o corretor funciona, leia por dentro do corretor de writing da Prepamigo. Ou Escrever uma resposta e pule as adivinhações. Leia também a versão original em Ler este guia em inglês.

Qual IA pontua o writing do CELPIP com mais precisão? Testamos sete | PrepAmigo