Pontuação

A pontuação de writing do CELPIP da Prepamigo é precisa? Os números, com honestidade

8 de setembro de 2026

Corretor de writing da Prepamigo em 36 redações oficiais

Porcentagem de redações pontuadas dentro do nível verificado, no geral e por nível. Doze redações por nível, nas duas tarefas de writing; as seis redações de exemplo que o corretor usa para calibração foram excluídas.

86%

Geral

75%

Fracas (4–5)

100%

Médias (7–8)

83%

Fortes (10+)

Prepamigo comparado aos planos de chatbot mais populares

Em dólares canadenses. Os preços da Prepamigo já incluem impostos. Claude Max (a partir de US$100) e ChatGPT Pro (US$200) foram convertidos à taxa de 1,38, antes de impostos. A precisão é a porcentagem de 36 redações oficiais pontuadas no nível verificado quando o modelo indicado é solicitado, em linguagem simples, a pontuar a redação; execução única.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Preço mensal
CA$24.98 (c/ imposto)
CA$138+ (s/ imposto)
CA$276 (s/ imposto)
Pontuação
Ilimitada
Limitada
Limitada
Banco de questões pronto
Sim
Não
Não
Conjuntos de prática
80
Nenhum
Nenhum
Tarefas de prática
2,000+
Nenhuma
Nenhuma
Formato CELPIP
Sim
Não
Não
Precisão
86%
61%
78%
Redações de nível médio
100%
25%
75%

É a pergunta certa a se fazer sobre qualquer ferramenta de prática, e a maioria das ferramentas não a responde. Uma nota de writing só vale alguma coisa se ela te diz o que um examinador de verdade diria, e o único jeito de saber se ela diz é medir. Então este artigo é a medição, exposta com clareza, com as partes que nos favorecem e as partes que não.

A resposta em um parágrafo: em 36 respostas oficiais de writing do CELPIP, cada uma com uma nota verificada de forma independente, o corretor de writing da Prepamigo acertou o nível verificado 86% das vezes. Ele acertou todas as redações de nível médio, 75% das redações fracas e 83% das fortes. Produziu o mesmo resultado, com uma redação a mais ou a menos, em três execuções separadas. Quando pedido em linguagem simples para pontuar as mesmas redações, o melhor modelo de ponta, a GPT 5.6 sol, chegou a 78%; os modelos da Claude chegaram a 61% e 56%.

O que vem a seguir é o que os números significam em cada nível, onde os erros caem e em que direção, quão estável é a nota, como ela se compara com os chatbots que você talvez esteja usando no lugar, o que há de novo no feedback, e como ler a sua própria nota à luz de tudo isso.

O que “preciso” significa aqui

Não estamos afirmando que uma nota da Prepamigo prevê o seu resultado no teste. Nenhuma ferramenta de prática pode prometer isso. O que medimos é mais estreito e mais honesto: dada uma redação cuja nota foi verificada de forma independente, com que frequência o corretor produz uma nota no mesmo nível?

O writing do CELPIP é reportado em uma escala que vai até 12, e as notas verificadas nos nossos dados de referência vêm em três faixas: fraca, ou seja, 4 ou 5; média, ou seja, 7 ou 8; e forte, ou seja, 10 ou mais. Contamos o corretor como correto quando a nota dele cai dentro da faixa verificada. Uma redação forte que recebe 10, 11 ou 12 está correta; se recebe 9, é um erro, mesmo sendo um erro por pouco.

Precisão em cada nível

Redações fracas: 75%. Nove de doze dentro da faixa. Os três erros foram todos um degrau acima: duas redações receberam 6 e uma recebeu 7. Cada uma era curta e rasa, mas arrumada, com poucos erros, e essa arrumação comprou um ponto que o conteúdo não tinha merecido. Esse é o erro característico do corretor na parte baixa da escala, e é um erro generoso: a quem escreve fraco se diz que está um pouco melhor do que está, nunca pior.

Redações de nível médio: 100%. Doze de doze dentro da faixa de 7 a 8, nas três execuções. Este é o nível em que está a maioria dos candidatos e o nível que decide a maioria das metas de imigração, e é onde o corretor é mais forte. É também onde todo chatbot que testamos é mais fraco, por razões que a seção de comparação explica.

Redações fortes: 83%. Dez de doze. Os dois erros foram um 9, um degrau abaixo. Uma redação forte do CELPIP não é impecável, e o corretor de vez em quando lê um deslize a mais. Nenhum dos dois erros foi um 7 ou 8; a uma redação forte nunca se diz que ela é mediana.

Por tarefa, o corretor acertou 89% das respostas de e-mail e 83% das respostas de pesquisa de opinião. Respostas de pesquisa são mais difíceis de posicionar porque a tarefa recompensa uma posição clara e razões desenvolvidas, e uma resposta que fica em cima do muro entre as opções é penalizada por regra.

Para que lado vão os erros

Um corretor que erra 14% das vezes pode errar de um jeito inofensivo ou de um jeito prejudicial. Prejudicial é dizer a um candidato que precisa de 8 que ele já tem, quando não tem. Inofensivo é dizer que ele está um ponto abaixo quando não está; isso custa uma semana de prática e nada mais.

Dos cinco erros do corretor em 36 redações, três foram redações fracas pontuadas com 6 ou 7 e dois foram redações fortes pontuadas com 9. Nenhuma redação de nível médio recebeu nota alta, e nenhuma redação fraca recebeu nota forte. Na prática: se o corretor diz que você chegou ao nível médio, você chegou, ou está um ponto abaixo. Se ele diz que você chegou ao nível forte, você chegou. O único lugar em que ele é lisonjeiro é na parte de baixo, onde uma redação curta e arrumada pode ganhar um ponto que não mereceu.

Compare isso com os chatbots nas mesmas redações. A Claude Opus 5 chamou sete redações de nível médio de 9 ou 10, que é a direção prejudicial para os candidatos que ela mais afeta. A GPT 5.6 sol chamou três redações de nível médio de 6, que é a direção inofensiva, e segurou três redações fortes em um 9. O número de precisão de um corretor te diz com que frequência ele erra; a direção te diz o que isso te custa quando ele erra.

E-mail versus pesquisa de opinião

As 36 redações foram divididas entre as duas tarefas de writing, e o corretor se saiu um pouco melhor na tarefa de e-mail, com 89%, do que na resposta de pesquisa de opinião, com 83%. Isso é um erro a mais do lado da pesquisa, e na direção que você esperaria.

Respostas de e-mail são pontuadas em grande parte pela cobertura: os pontos obrigatórios foram tratados, o tom é adequado ao leitor, há uma saudação e uma despedida. Essas são coisas que o corretor verifica por regra antes de qualquer julgamento ser feito, então um e-mail que as tem é posicionado com confiança. Respostas de pesquisa são pontuadas pela qualidade de um argumento: uma posição clara e razões desenvolvidas em vez de apenas listadas. Desenvolvimento é um julgamento, e julgamento é onde um corretor, humano ou não, tem margem para divergir em um ponto.

Para você, isso significa que uma nota de pesquisa é ligeiramente mais frouxa do que uma nota de e-mail. Se você está pairando na beira da sua meta nas respostas de pesquisa, escreva duas em vez de uma antes de decidir onde está.

Do seu lado da tela

A visão por nível te diz como o corretor se sai em uma redação de nível conhecido. Você está olhando pelo outro lado: tem uma nota e quer saber o quanto acreditar nela.

  • Se ele diz 4 ou 5: a redação estava no nível fraco nove vezes em nove. Uma nota baixa do corretor está certa.
  • Se ele diz 7 ou 8: a redação estava no nível médio doze vezes em quinze; as outras três eram redações fracas pontuadas um degrau acima. Um 7 ou 8 significa médio, e possivelmente um pouco abaixo.
  • Se ele diz 10 ou mais: a redação estava no nível forte dez vezes em dez. Um 10 do corretor é um 10.
  • Se ele diz 9: os dois 9 do teste eram redações verificadas como fortes. O 9 é a nota para ler com cuidado: significa perto do topo, e que faltou uma razão desenvolvida ou uma escolha precisa de palavra.
Se você recebe um 9 em uma redação que achou excelente, não conclua que estagnou. Abra a resposta modelo ao lado da sua redação, encontre o único lugar em que ela desenvolve uma razão que você apenas afirmou, reescreva, e pontue de novo.

A mesma redação recebe a mesma nota?

Precisão sem consistência é sorte. Então pontuamos todas as 36 redações três vezes, em dias diferentes, sem mudar nada no meio. O corretor devolveu 86%, 89% e 86%. As mesmas doze redações de nível médio ficaram dentro da faixa todas as vezes, e nenhuma redação se moveu mais de um ponto entre as execuções.

A consistência vem do jeito que o modelo de pontuação é executado: raciocínio desligado, uma temperatura fixa, e uma comparação contra exemplos fixos já corrigidos em vez de um julgamento livre. Para você, significa que uma mudança na sua nota é uma mudança na sua escrita. Se você reescreve uma redação e ela vai de 8 para 10, não é o corretor tendo um bom dia.

Como isso se compara com o que você talvez use no lugar

Um número de precisão significa mais quando há algo com que compará-lo. Então demos as mesmas 36 redações aos chatbots que as pessoas realmente usam para checar a própria escrita, do jeito que uma pessoa faria: a tarefa, a redação, e um pedido simples de uma nota de 0 a 12.

Porcentagem de redações pontuadas dentro do nível verificado

Mesmas 36 redações oficiais. Cada modelo foi solicitado, em linguagem simples, a pontuar a redação; a Prepamigo rodou na sua configuração normal de produção.

86%

Corretor de writing da Prepamigo

78%

GPT 5.6 sol

69%

GPT 5.6 luna

61%

Gemini

61%

Claude Opus 5

58%

GPT-4o mini

56%

Claude Sonnet 5

O corretor lidera o melhor chatbot por oito pontos e os modelos da Claude por 25 a 30. O formato dos erros é o que importa. Em redações de nível médio, a Prepamigo está em 100%, a GPT 5.6 sol em 75%, o Gemini em 42%, a Claude Sonnet 5 em 33% e a Claude Opus 5 em 25%: um chatbot sem nada com que comparar lê um 7 limpo e genérico como um 9, ou um 7 genérico com alguns erros como um 6. Em redações fortes, a Claude Opus 5 é na verdade o melhor corretor do teste, com 92% contra 83% da Prepamigo; ela é generosa, o que é certo no topo e errado em todo o resto. A GPT-4o mini deu 9 a nove de doze redações fortes.

O que o corretor tem e os chatbots não têm são redações reais já corrigidas para a mesma tarefa em cada nível para comparar, e uma camada de regras que verifica pontos obrigatórios, a posição na pesquisa, saudação e despedida, e extensão antes de qualquer modelo dar uma opinião. Essa é a diferença entre 86% e 78%, e ela está quase toda no meio da escala.

O que há de novo no feedback do seu writing

A nota é só metade do que você recebe de volta. A camada de feedback do writing foi reconstruída junto com o corretor, e tudo nela está ancorado no seu próprio texto. Veja o que mudou.

  • Correções que você encontra na sua própria redação. Cada correção de gramática, ortografia e vocabulário cita as palavras exatas da sua resposta, para que o app possa destacá-las onde você as escreveu. Qualquer coisa que o verificador não consiga encontrar palavra por palavra na sua redação é descartada antes de você ver.
  • Uma resposta modelo, construída a partir da sua resposta. Você recebe uma versão reescrita da sua própria resposta que mantém as suas ideias, cobre todos os pontos obrigatórios e fica dentro das 150 a 200 palavras que a tarefa pede. Se a primeira reescrita não atingir esse tamanho, ela é refeita uma vez antes de ser mostrada.
  • O ponto obrigatório que você deixou passar, pelo nome. Na tarefa de e-mail, o feedback lista os itens do enunciado que a sua resposta não cobriu. Um ponto esquecido também segura a nota de cumprimento da tarefa em 8 ou menos, então o número e o feedback nunca se contradizem.
  • Um fator limitante por dimensão. Para cada uma das quatro dimensões, o feedback nomeia a única coisa que está segurando aquela nota, em termos concretos, ou diz claramente que nada está segurando e o que a sustenta. Concluir que uma dimensão não tem problema é uma resposta de verdade, não uma lacuna.
  • Crítica no lugar certo. Um tom fraco é um problema de cumprimento da tarefa, uma escolha de palavra vaga é um problema de vocabulário, uma frase sem pontuação é um problema de legibilidade. Cada ponto é arquivado na dimensão a que pertence, em vez de ser jogado no resumo geral.
  • Reescritas frase por frase. Frases específicas da sua redação voltam com uma versão melhorada e uma linha explicando por que ela é melhor, para que você veja a mudança em vez de apenas ler sobre ela.
  • Sua dimensão mais forte e a mais fraca, lado a lado. O feedback informa qual das quatro dimensões está sustentando sua nota e qual está segurando, para que você saiba o que praticar em seguida sem precisar decifrar quatro números.

Cada citação no feedback é conferida com a sua redação antes de ser exibida. Se o verificador não encontrar as palavras, a linha é removida. É por isso que o feedback nunca manda você corrigir algo que você não escreveu.

Como ler a sua nota

  1. Um 4 ou 5 está certo. Leia as correções; elas são citadas do seu próprio texto. Depois leia os pontos não cobertos e a resposta modelo, e escreva a mesma tarefa de novo.
  2. Um 7 ou 8 é médio, possivelmente um pouco abaixo. Olhe o fator limitante de cada dimensão. O que nomeia um problema concreto é aquele em que trabalhar.
  3. Um 9 está perto. Compare a sua redação com a resposta modelo parágrafo por parágrafo. A diferença geralmente é uma razão não desenvolvida ou uma escolha genérica de palavra.
  4. Um 10 ou mais é um 10. Você está pronto nesse tipo de tarefa. Passe para o que você evita.
  5. Confie mais nas mudanças do que nos níveis. Como a nota é estável, uma mudança entre tentativas na mesma tarefa é uma mudança na sua escrita.

Uma rotina de prática que usa o número

O sentido de uma nota precisa e estável é que você pode parar de duvidar dela e começar a usá-la. Esta é a rotina que sugerimos, construída em torno do que os números desta página dizem que a nota pode e não pode te dizer.

  1. Escreva um e-mail e uma resposta de pesquisa de opinião, a frio. Não olhe a resposta modelo antes. Envie os dois. As duas notas juntas são o seu nível de partida; se elas diferem em mais de um ponto, a mais baixa é a tarefa a praticar.
  2. Leia os pontos não cobertos e o fator limitante antes das correções. Correções consertam frases; pontos não cobertos e fatores limitantes consertam notas. Um ponto obrigatório faltando vale mais do que todas as vírgulas.
  3. Reescreva a mesma resposta com a resposta modelo aberta. Mantenha as suas ideias, pegue emprestada a estrutura dela. Envie de novo. Como o corretor dá à mesma redação a mesma nota, a diferença entre os dois envios é inteiramente a sua reescrita.
  4. Passe para uma tarefa nova quando a reescrita se mantiver. Um único 10 em uma reescrita ainda não é um nível. Dois 10 em duas tarefas diferentes são.
  5. Leia um 9 como um quase e um 6 como um 6 de verdade. O corretor não puxa redações de nível médio para baixo. Se ele diz 6, a redação é rasa, e o fator limitante vai dizer onde.

Perguntas frequentes

Qual é a precisão da nota de writing da Prepamigo? 86% no nível exato em 36 redações oficiais: 75% nas fracas, 100% nas médias, 83% nas fortes. O mesmo resultado, com uma redação a mais ou a menos, em três execuções.

É igual à minha nota real? Nenhuma ferramenta de prática pode prometer isso. O que medimos é com que frequência o corretor concorda com uma nota verificada na mesma redação.

Por que recebi um 9 em uma redação forte? Esse é o erro mais comum do corretor no topo: duas de doze redações fortes receberam um 9. Reescreva com a resposta modelo ao lado e pontue de novo.

É melhor que o ChatGPT ou a Claude? 86% contra 78% da GPT 5.6 sol e 61% e 56% dos modelos da Claude. Em redações de nível médio, 100% contra 75% do melhor deles.

Para ver como o corretor funciona, leia por dentro do corretor de writing da Prepamigo. Para ver o mesmo teste nos seis chatbots, leia qual IA pontua o writing do CELPIP com mais precisão. Ou Escrever uma resposta e veja os números por conta própria. Leia também a versão original em Ler este guia em inglês.

A pontuação de writing do CELPIP da Prepamigo é precisa? Os números, com honestidade | PrepAmigo