Corretor de writing da Prepamigo em 36 redações oficiais
Porcentagem de redações pontuadas dentro do nível verificado, no geral e por nível. Doze redações por nível, nas duas tarefas de writing; as seis redações de exemplo que o corretor usa para calibração foram excluídas.
86%
Geral
75%
Fracas (4–5)
100%
Médias (7–8)
83%
Fortes (10+)
Prepamigo comparado aos planos de chatbot mais populares
Em dólares canadenses. Os preços da Prepamigo já incluem impostos. Claude Max (a partir de US$100) e ChatGPT Pro (US$200) foram convertidos à taxa de 1,38, antes de impostos. A precisão é a porcentagem de 36 redações oficiais pontuadas no nível verificado quando o modelo indicado é solicitado, em linguagem simples, a pontuar a redação; execução única.
É a pergunta certa a se fazer sobre qualquer ferramenta de prática, e a maioria das ferramentas não a responde. Uma nota de writing só vale alguma coisa se ela te diz o que um examinador de verdade diria, e o único jeito de saber se ela diz é medir. Então este artigo é a medição, exposta com clareza, com as partes que nos favorecem e as partes que não.
A resposta em um parágrafo: em 36 respostas oficiais de writing do CELPIP, cada uma com uma nota verificada de forma independente, o corretor de writing da Prepamigo acertou o nível verificado 86% das vezes. Ele acertou todas as redações de nível médio, 75% das redações fracas e 83% das fortes. Produziu o mesmo resultado, com uma redação a mais ou a menos, em três execuções separadas. Quando pedido em linguagem simples para pontuar as mesmas redações, o melhor modelo de ponta, a GPT 5.6 sol, chegou a 78%; os modelos da Claude chegaram a 61% e 56%.
O que vem a seguir é o que os números significam em cada nível, onde os erros caem e em que direção, quão estável é a nota, como ela se compara com os chatbots que você talvez esteja usando no lugar, o que há de novo no feedback, e como ler a sua própria nota à luz de tudo isso.
O que “preciso” significa aqui
Não estamos afirmando que uma nota da Prepamigo prevê o seu resultado no teste. Nenhuma ferramenta de prática pode prometer isso. O que medimos é mais estreito e mais honesto: dada uma redação cuja nota foi verificada de forma independente, com que frequência o corretor produz uma nota no mesmo nível?
O writing do CELPIP é reportado em uma escala que vai até 12, e as notas verificadas nos nossos dados de referência vêm em três faixas: fraca, ou seja, 4 ou 5; média, ou seja, 7 ou 8; e forte, ou seja, 10 ou mais. Contamos o corretor como correto quando a nota dele cai dentro da faixa verificada. Uma redação forte que recebe 10, 11 ou 12 está correta; se recebe 9, é um erro, mesmo sendo um erro por pouco.
Precisão em cada nível
Redações fracas: 75%. Nove de doze dentro da faixa. Os três erros foram todos um degrau acima: duas redações receberam 6 e uma recebeu 7. Cada uma era curta e rasa, mas arrumada, com poucos erros, e essa arrumação comprou um ponto que o conteúdo não tinha merecido. Esse é o erro característico do corretor na parte baixa da escala, e é um erro generoso: a quem escreve fraco se diz que está um pouco melhor do que está, nunca pior.
Redações de nível médio: 100%. Doze de doze dentro da faixa de 7 a 8, nas três execuções. Este é o nível em que está a maioria dos candidatos e o nível que decide a maioria das metas de imigração, e é onde o corretor é mais forte. É também onde todo chatbot que testamos é mais fraco, por razões que a seção de comparação explica.
Redações fortes: 83%. Dez de doze. Os dois erros foram um 9, um degrau abaixo. Uma redação forte do CELPIP não é impecável, e o corretor de vez em quando lê um deslize a mais. Nenhum dos dois erros foi um 7 ou 8; a uma redação forte nunca se diz que ela é mediana.
Por tarefa, o corretor acertou 89% das respostas de e-mail e 83% das respostas de pesquisa de opinião. Respostas de pesquisa são mais difíceis de posicionar porque a tarefa recompensa uma posição clara e razões desenvolvidas, e uma resposta que fica em cima do muro entre as opções é penalizada por regra.
Para que lado vão os erros
Um corretor que erra 14% das vezes pode errar de um jeito inofensivo ou de um jeito prejudicial. Prejudicial é dizer a um candidato que precisa de 8 que ele já tem, quando não tem. Inofensivo é dizer que ele está um ponto abaixo quando não está; isso custa uma semana de prática e nada mais.
Dos cinco erros do corretor em 36 redações, três foram redações fracas pontuadas com 6 ou 7 e dois foram redações fortes pontuadas com 9. Nenhuma redação de nível médio recebeu nota alta, e nenhuma redação fraca recebeu nota forte. Na prática: se o corretor diz que você chegou ao nível médio, você chegou, ou está um ponto abaixo. Se ele diz que você chegou ao nível forte, você chegou. O único lugar em que ele é lisonjeiro é na parte de baixo, onde uma redação curta e arrumada pode ganhar um ponto que não mereceu.
Compare isso com os chatbots nas mesmas redações. A Claude Opus 5 chamou sete redações de nível médio de 9 ou 10, que é a direção prejudicial para os candidatos que ela mais afeta. A GPT 5.6 sol chamou três redações de nível médio de 6, que é a direção inofensiva, e segurou três redações fortes em um 9. O número de precisão de um corretor te diz com que frequência ele erra; a direção te diz o que isso te custa quando ele erra.
E-mail versus pesquisa de opinião
As 36 redações foram divididas entre as duas tarefas de writing, e o corretor se saiu um pouco melhor na tarefa de e-mail, com 89%, do que na resposta de pesquisa de opinião, com 83%. Isso é um erro a mais do lado da pesquisa, e na direção que você esperaria.
Respostas de e-mail são pontuadas em grande parte pela cobertura: os pontos obrigatórios foram tratados, o tom é adequado ao leitor, há uma saudação e uma despedida. Essas são coisas que o corretor verifica por regra antes de qualquer julgamento ser feito, então um e-mail que as tem é posicionado com confiança. Respostas de pesquisa são pontuadas pela qualidade de um argumento: uma posição clara e razões desenvolvidas em vez de apenas listadas. Desenvolvimento é um julgamento, e julgamento é onde um corretor, humano ou não, tem margem para divergir em um ponto.
Para você, isso significa que uma nota de pesquisa é ligeiramente mais frouxa do que uma nota de e-mail. Se você está pairando na beira da sua meta nas respostas de pesquisa, escreva duas em vez de uma antes de decidir onde está.
Do seu lado da tela
A visão por nível te diz como o corretor se sai em uma redação de nível conhecido. Você está olhando pelo outro lado: tem uma nota e quer saber o quanto acreditar nela.
- Se ele diz 4 ou 5: a redação estava no nível fraco nove vezes em nove. Uma nota baixa do corretor está certa.
- Se ele diz 7 ou 8: a redação estava no nível médio doze vezes em quinze; as outras três eram redações fracas pontuadas um degrau acima. Um 7 ou 8 significa médio, e possivelmente um pouco abaixo.
- Se ele diz 10 ou mais: a redação estava no nível forte dez vezes em dez. Um 10 do corretor é um 10.
- Se ele diz 9: os dois 9 do teste eram redações verificadas como fortes. O 9 é a nota para ler com cuidado: significa perto do topo, e que faltou uma razão desenvolvida ou uma escolha precisa de palavra.
A mesma redação recebe a mesma nota?
Precisão sem consistência é sorte. Então pontuamos todas as 36 redações três vezes, em dias diferentes, sem mudar nada no meio. O corretor devolveu 86%, 89% e 86%. As mesmas doze redações de nível médio ficaram dentro da faixa todas as vezes, e nenhuma redação se moveu mais de um ponto entre as execuções.
A consistência vem do jeito que o modelo de pontuação é executado: raciocínio desligado, uma temperatura fixa, e uma comparação contra exemplos fixos já corrigidos em vez de um julgamento livre. Para você, significa que uma mudança na sua nota é uma mudança na sua escrita. Se você reescreve uma redação e ela vai de 8 para 10, não é o corretor tendo um bom dia.
Como isso se compara com o que você talvez use no lugar
Um número de precisão significa mais quando há algo com que compará-lo. Então demos as mesmas 36 redações aos chatbots que as pessoas realmente usam para checar a própria escrita, do jeito que uma pessoa faria: a tarefa, a redação, e um pedido simples de uma nota de 0 a 12.
Porcentagem de redações pontuadas dentro do nível verificado
Mesmas 36 redações oficiais. Cada modelo foi solicitado, em linguagem simples, a pontuar a redação; a Prepamigo rodou na sua configuração normal de produção.
86%
Corretor de writing da Prepamigo
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
O corretor lidera o melhor chatbot por oito pontos e os modelos da Claude por 25 a 30. O formato dos erros é o que importa. Em redações de nível médio, a Prepamigo está em 100%, a GPT 5.6 sol em 75%, o Gemini em 42%, a Claude Sonnet 5 em 33% e a Claude Opus 5 em 25%: um chatbot sem nada com que comparar lê um 7 limpo e genérico como um 9, ou um 7 genérico com alguns erros como um 6. Em redações fortes, a Claude Opus 5 é na verdade o melhor corretor do teste, com 92% contra 83% da Prepamigo; ela é generosa, o que é certo no topo e errado em todo o resto. A GPT-4o mini deu 9 a nove de doze redações fortes.
O que o corretor tem e os chatbots não têm são redações reais já corrigidas para a mesma tarefa em cada nível para comparar, e uma camada de regras que verifica pontos obrigatórios, a posição na pesquisa, saudação e despedida, e extensão antes de qualquer modelo dar uma opinião. Essa é a diferença entre 86% e 78%, e ela está quase toda no meio da escala.
O que há de novo no feedback do seu writing
A nota é só metade do que você recebe de volta. A camada de feedback do writing foi reconstruída junto com o corretor, e tudo nela está ancorado no seu próprio texto. Veja o que mudou.
- Correções que você encontra na sua própria redação. Cada correção de gramática, ortografia e vocabulário cita as palavras exatas da sua resposta, para que o app possa destacá-las onde você as escreveu. Qualquer coisa que o verificador não consiga encontrar palavra por palavra na sua redação é descartada antes de você ver.
- Uma resposta modelo, construída a partir da sua resposta. Você recebe uma versão reescrita da sua própria resposta que mantém as suas ideias, cobre todos os pontos obrigatórios e fica dentro das 150 a 200 palavras que a tarefa pede. Se a primeira reescrita não atingir esse tamanho, ela é refeita uma vez antes de ser mostrada.
- O ponto obrigatório que você deixou passar, pelo nome. Na tarefa de e-mail, o feedback lista os itens do enunciado que a sua resposta não cobriu. Um ponto esquecido também segura a nota de cumprimento da tarefa em 8 ou menos, então o número e o feedback nunca se contradizem.
- Um fator limitante por dimensão. Para cada uma das quatro dimensões, o feedback nomeia a única coisa que está segurando aquela nota, em termos concretos, ou diz claramente que nada está segurando e o que a sustenta. Concluir que uma dimensão não tem problema é uma resposta de verdade, não uma lacuna.
- Crítica no lugar certo. Um tom fraco é um problema de cumprimento da tarefa, uma escolha de palavra vaga é um problema de vocabulário, uma frase sem pontuação é um problema de legibilidade. Cada ponto é arquivado na dimensão a que pertence, em vez de ser jogado no resumo geral.
- Reescritas frase por frase. Frases específicas da sua redação voltam com uma versão melhorada e uma linha explicando por que ela é melhor, para que você veja a mudança em vez de apenas ler sobre ela.
- Sua dimensão mais forte e a mais fraca, lado a lado. O feedback informa qual das quatro dimensões está sustentando sua nota e qual está segurando, para que você saiba o que praticar em seguida sem precisar decifrar quatro números.
Cada citação no feedback é conferida com a sua redação antes de ser exibida. Se o verificador não encontrar as palavras, a linha é removida. É por isso que o feedback nunca manda você corrigir algo que você não escreveu.
Como ler a sua nota
- Um 4 ou 5 está certo. Leia as correções; elas são citadas do seu próprio texto. Depois leia os pontos não cobertos e a resposta modelo, e escreva a mesma tarefa de novo.
- Um 7 ou 8 é médio, possivelmente um pouco abaixo. Olhe o fator limitante de cada dimensão. O que nomeia um problema concreto é aquele em que trabalhar.
- Um 9 está perto. Compare a sua redação com a resposta modelo parágrafo por parágrafo. A diferença geralmente é uma razão não desenvolvida ou uma escolha genérica de palavra.
- Um 10 ou mais é um 10. Você está pronto nesse tipo de tarefa. Passe para o que você evita.
- Confie mais nas mudanças do que nos níveis. Como a nota é estável, uma mudança entre tentativas na mesma tarefa é uma mudança na sua escrita.
Uma rotina de prática que usa o número
O sentido de uma nota precisa e estável é que você pode parar de duvidar dela e começar a usá-la. Esta é a rotina que sugerimos, construída em torno do que os números desta página dizem que a nota pode e não pode te dizer.
- Escreva um e-mail e uma resposta de pesquisa de opinião, a frio. Não olhe a resposta modelo antes. Envie os dois. As duas notas juntas são o seu nível de partida; se elas diferem em mais de um ponto, a mais baixa é a tarefa a praticar.
- Leia os pontos não cobertos e o fator limitante antes das correções. Correções consertam frases; pontos não cobertos e fatores limitantes consertam notas. Um ponto obrigatório faltando vale mais do que todas as vírgulas.
- Reescreva a mesma resposta com a resposta modelo aberta. Mantenha as suas ideias, pegue emprestada a estrutura dela. Envie de novo. Como o corretor dá à mesma redação a mesma nota, a diferença entre os dois envios é inteiramente a sua reescrita.
- Passe para uma tarefa nova quando a reescrita se mantiver. Um único 10 em uma reescrita ainda não é um nível. Dois 10 em duas tarefas diferentes são.
- Leia um 9 como um quase e um 6 como um 6 de verdade. O corretor não puxa redações de nível médio para baixo. Se ele diz 6, a redação é rasa, e o fator limitante vai dizer onde.
Perguntas frequentes
Qual é a precisão da nota de writing da Prepamigo? 86% no nível exato em 36 redações oficiais: 75% nas fracas, 100% nas médias, 83% nas fortes. O mesmo resultado, com uma redação a mais ou a menos, em três execuções.
É igual à minha nota real? Nenhuma ferramenta de prática pode prometer isso. O que medimos é com que frequência o corretor concorda com uma nota verificada na mesma redação.
Por que recebi um 9 em uma redação forte? Esse é o erro mais comum do corretor no topo: duas de doze redações fortes receberam um 9. Reescreva com a resposta modelo ao lado e pontue de novo.
É melhor que o ChatGPT ou a Claude? 86% contra 78% da GPT 5.6 sol e 61% e 56% dos modelos da Claude. Em redações de nível médio, 100% contra 75% do melhor deles.
Para ver como o corretor funciona, leia por dentro do corretor de writing da Prepamigo. Para ver o mesmo teste nos seis chatbots, leia qual IA pontua o writing do CELPIP com mais precisão. Ou Escrever uma resposta e veja os números por conta própria. Leia também a versão original em Ler este guia em inglês.
