Porcentagem de redações pontuadas no nível verificado
36 respostas oficiais de writing do CELPIP, 12 em cada um dos três níveis, nas duas tarefas de writing. Cada modelo GPT recebeu a tarefa e a redação e foi solicitado, em linguagem simples, a pontuá-la na escala do CELPIP. O corretor de writing da Prepamigo rodou como roda em produção.
86%
Corretor de writing da Prepamigo
78%
GPT 5.6 sol
69%
GPT 5.6 luna
58%
GPT-4o mini
Prepamigo comparado aos planos de chatbot mais populares
Em dólares canadenses. Os preços da Prepamigo já incluem impostos. Claude Max (a partir de US$100) e ChatGPT Pro (US$200) foram convertidos à taxa de 1,38, antes de impostos. A precisão é a porcentagem de 36 redações oficiais pontuadas no nível verificado quando o modelo indicado é solicitado, em linguagem simples, a pontuar a redação; execução única.
O ChatGPT é provavelmente a ferramenta mais comum que candidatos do CELPIP usam para conferir o seu writing. Cole o e-mail, peça uma nota, receba um número e um parágrafo. É rápido, está no seu celular, e no writing não há etapa de transcrição no caminho. Então testamos o número. Demos a três modelos GPT as mesmas 36 respostas oficiais de writing do CELPIP com que o nosso próprio corretor é medido, doze em cada nível, e pedimos para eles pontuarem as redações do jeito que um estudante pediria.
A resposta curta: o corretor de writing da Prepamigo acertou o nível verificado 86% das vezes. A GPT 5.6 sol, o modelo por trás dos planos pagos do ChatGPT, acertou 78% das vezes. A GPT 5.6 luna conseguiu 69% e a GPT-4o mini, 58%. Oito pontos é uma diferença real, e ela vem de dois lugares: o meio da escala, onde a Prepamigo pontuou todas as doze redações corretamente e a GPT 5.6 sol pontuou nove, e o topo, onde a GPT 5.6 sol segurou um quarto das redações fortes em um 9.
Devemos dizer desde já que a GPT 5.6 sol é o melhor corretor genérico de writing que já testamos, bem à frente de qualquer modelo da Claude nas mesmas redações. O restante deste artigo percorre os resultados nível por nível, explica de onde vêm os oito pontos, avalia o feedback de cada lado, e compara quanto custa praticar writing a sério com cada um.
O teste simples: o que um estudante realmente recebe
Oitenta e seis por cento contra setenta e oito. Em 36 redações, isso são três notas corretas a mais para a Prepamigo do que para a GPT 5.6 sol, seis a mais do que a GPT 5.6 luna, e dez a mais do que a GPT-4o mini. Em outras palavras, a Prepamigo comete 37% menos erros de pontuação do que a GPT 5.6 sol, 55% menos do que a luna e 67% menos do que a GPT-4o mini.
O que os modelos GPT receberam importa. Cada um foi informado de que era um examinador experiente de writing do CELPIP, recebeu a tarefa exatamente como o candidato a viu, incluindo os pontos obrigatórios da tarefa de e-mail e as opções da tarefa de pesquisa, e recebeu a redação. Foi pedida uma única nota de 0 a 12. É o que você digitaria no ChatGPT, e é um teste mais justo do que um simples “corrija isto” porque o modelo pelo menos sabe o que a tarefa pedia.
O corretor da Prepamigo recebeu a mesma tarefa e a mesma redação, mais o que sempre tem em produção: redações reais já corrigidas daquela tarefa em cada nível para comparar, e uma camada de regras que confere as coisas que um avaliador confere primeiro, como se todos os pontos obrigatórios foram cobertos, se uma resposta de pesquisa realmente escolhe um lado, se um e-mail tem saudação e despedida, e se a resposta chega perto do tamanho que a tarefa pede.
De onde vêm os oito pontos: nível por nível
Redações fracas (nota verificada 4 ou 5)
12 redações oficiais. O único nível em que os modelos GPT ficam ligeiramente à frente.
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
Corretor de writing da Prepamigo
Em redações fracas, os três modelos GPT estão em 83% e a Prepamigo está em 75%. Este é o único nível em que o ChatGPT está à frente, e relatamos como tal. Os três erros da Prepamigo foram todos um degrau para cima, para um 6 ou 7, em redações que eram curtas mas arrumadas. Os dois erros da GPT 5.6 sol foram ambos um 6. Redações fracas são o lado fácil da escala para um chatbot: um texto curto, genérico e cheio de erros parece fraco para qualquer um.
Redações médias (nota verificada 7 ou 8)
12 redações oficiais. O nível em que a maioria dos candidatos está.
100%
Corretor de writing da Prepamigo
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
No meio, a Prepamigo pontuou todas as doze redações dentro da faixa de 7 a 8. A GPT 5.6 sol pontuou nove; seus três erros foram todos um 6, um degrau abaixo. A GPT 5.6 luna pontuou sete, puxando três redações para baixo, para um 6, uma para um 5 e uma para cima, para um 9. A GPT-4o mini pontuou oito e empurrou as outras quatro para cima, para um 9.
Um 7 ou 8 é a nota real mais comum no teste, e é a nota que decide se um candidato alcançou a sua meta. A GPT 5.6 sol vai dizer a um desses candidatos a cada quatro que ele caiu para um 6. A luna vai dizer isso a quatro em dez. Nenhum dos dois é um desastre do jeito que os resultados da Claude na faixa do meio são, mas é a diferença entre uma nota de prática com que você pode planejar e uma que você precisa colocar em dúvida.
Redações fortes (nota verificada 10 ou mais)
12 redações oficiais. Os erros aqui são um 9: a redação era forte e o corretor segurou.
83%
Corretor de writing da Prepamigo
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
No topo, a Prepamigo reconheceu dez de doze redações fortes, a GPT 5.6 sol nove, a luna oito, e a GPT-4o mini três. Todos os erros, menos um, foram um 9. A GPT-4o mini deu 9 a nove das doze redações fortes: ela simplesmente não dá um 10. Se o seu writing é forte e você o confere com a versão gratuita do ChatGPT, que ainda direciona muito tráfego para modelos pequenos, vão te dizer que você é um 9 quase todas as vezes.
Por que um chatbot escorrega no meio e no topo
Uma redação de nível médio do CELPIP cobre a tarefa, é organizada, e também é genérica: razões afirmadas em vez de desenvolvidas, vocabulário seguro, frases de um único formato. Uma redação forte não é impecável; ela tem um deslize ou dois, e uma frase simples entre as desenvolvidas. Um modelo sem exemplos corrigidos para comparar precisa decidir por impressão. A impressão da GPT 5.6 sol é um pouco severa: o 7 genérico parece um 6, o 10 forte com um deslize parece um 9. A luna é ainda mais severa. A GPT-4o mini trata o 9 como teto.
O corretor da Prepamigo não julga uma redação contra uma ideia de boa escrita. Ele a compara com redações reais já corrigidas da mesma tarefa, uma em cada nível, todas respostas reais com deslizes reais. Uma redação genérica mas completa cai ao lado do exemplo do meio porque é com ele que se parece. Uma redação forte com uma frase desajeitada cai ao lado do exemplo forte, que também tem uma. Por cima dessa comparação há uma camada de regras para as coisas que um modelo conta mal: se todos os pontos obrigatórios estão presentes, se a resposta de pesquisa escolheu um lado, se o e-mail tem saudação e despedida, e qual é o tamanho. Um ponto obrigatório esquecido segura o cumprimento da tarefa em 8 ou menos, independentemente do inglês, porque é assim que o teste funciona.
A diferença no fluxo de trabalho: o que você precisa trazer
No writing, o ChatGPT é fácil de usar como corretor, e não vamos fingir o contrário. Cole a redação, receba um número, peça uma explicação. Sem gravação, sem transcrição. Para uma segunda opinião rápida sobre uma única redação, ele é conveniente e, com a GPT 5.6 sol, razoavelmente preciso.
O que você não recebe é a tarefa. O ChatGPT pode inventar um enunciado no estilo CELPIP se você pedir, mas ele está chutando os pontos obrigatórios, as opções da pesquisa e a contagem de palavras que o teste real usa. Você não recebe uma verificação de pontos obrigatórios, porque ele não sabe quais pontos o teste real listaria. Você não recebe uma resposta modelo reescrita a partir da sua própria redação no tamanho certo. E cada redação que você cola conta contra a sua cota de mensagens.
Na Prepamigo, você abre uma tarefa do banco, o cronômetro roda, você escreve, e cerca de um minuto depois de enviar você tem quatro notas por dimensão, uma nota geral, uma lista de tudo o que deixou passar, correções citadas do seu próprio texto, e uma resposta modelo reescrita. A quadragésima redação do mês custa o mesmo esforço que a primeira.
A mesma redação, a mesma nota
Depois da execução principal, pontuamos todas as 36 redações mais duas vezes, em dias diferentes. O corretor de writing da Prepamigo pontuou 86%, 89% e 86% nas três execuções, com as mesmas doze redações de nível médio dentro da faixa todas as vezes. A GPT 5.6 sol pontuou 78%, 83% e 81%: melhor na segunda e na terceira execução, e um lembrete de que uma única resposta de chatbot carrega alguns pontos de sorte em qualquer direção. Se você for corrigir com o ChatGPT, pergunte duas vezes e fique com a resposta mais baixa.
Feedback: explicação versus evidência
O ChatGPT explica bem. Pergunte por que uma redação é um 6 e ele vai te contar, em inglês claro, com sugestões. O porém é que a explicação é escrita para justificar um número já escolhido, então quando o número está um degrau abaixo, a explicação encontra defeitos para combinar. Um candidato que na verdade estava em um 7 lê uma página sobre fraquezas que não foram decisivas.
O feedback da Prepamigo funciona a partir do texto. Cada correção cita as palavras exatas da sua redação, e qualquer coisa que o verificador não consiga encontrar no seu texto é descartada antes de você ver. Um ponto obrigatório esquecido é nomeado. Cada dimensão recebe um fator limitante, ou uma declaração clara de que nada a está segurando. E você recebe uma resposta modelo reescrita a partir da sua própria resposta no tamanho que a tarefa pede. A seção abaixo lista o que mudou.
O que há de novo no feedback do seu writing
A nota é só metade do que você recebe de volta. A camada de feedback do writing foi reconstruída junto com o corretor, e tudo nela está ancorado no seu próprio texto. Veja o que mudou.
- Correções que você encontra na sua própria redação. Cada correção de gramática, ortografia e vocabulário cita as palavras exatas da sua resposta, para que o app possa destacá-las onde você as escreveu. Qualquer coisa que o verificador não consiga encontrar palavra por palavra na sua redação é descartada antes de você ver.
- Uma resposta modelo, construída a partir da sua resposta. Você recebe uma versão reescrita da sua própria resposta que mantém as suas ideias, cobre todos os pontos obrigatórios e fica dentro das 150 a 200 palavras que a tarefa pede. Se a primeira reescrita não atingir esse tamanho, ela é refeita uma vez antes de ser mostrada.
- O ponto obrigatório que você deixou passar, pelo nome. Na tarefa de e-mail, o feedback lista os itens do enunciado que a sua resposta não cobriu. Um ponto esquecido também segura a nota de cumprimento da tarefa em 8 ou menos, então o número e o feedback nunca se contradizem.
- Um fator limitante por dimensão. Para cada uma das quatro dimensões, o feedback nomeia a única coisa que está segurando aquela nota, em termos concretos, ou diz claramente que nada está segurando e o que a sustenta. Concluir que uma dimensão não tem problema é uma resposta de verdade, não uma lacuna.
- Crítica no lugar certo. Um tom fraco é um problema de cumprimento da tarefa, uma escolha de palavra vaga é um problema de vocabulário, uma frase sem pontuação é um problema de legibilidade. Cada ponto é arquivado na dimensão a que pertence, em vez de ser jogado no resumo geral.
- Reescritas frase por frase. Frases específicas da sua redação voltam com uma versão melhorada e uma linha explicando por que ela é melhor, para que você veja a mudança em vez de apenas ler sobre ela.
- Sua dimensão mais forte e a mais fraca, lado a lado. O feedback informa qual das quatro dimensões está sustentando sua nota e qual está segurando, para que você saiba o que praticar em seguida sem precisar decifrar quatro números.
Cada citação no feedback é conferida com a sua redação antes de ser exibida. Se o verificador não encontrar as palavras, a linha é removida. É por isso que o feedback nunca manda você corrigir algo que você não escreveu.
Quanto custa praticar todos os dias
O ChatGPT Plus custa US$20 por mês, cerca de CA$28, cobrados mensalmente, conforme publicado em setembro de 2026, com um limite de mensagens por janela rotativa; o ChatGPT Pro, a US$200 por mês, cerca de CA$276 antes de impostos, eleva esse limite. A versão gratuita direciona boa parte do seu tráfego para modelos menores, e neste teste o menor deles reconheceu três redações fortes em doze. Nenhum dos planos inclui um banco de tarefas, um cronômetro, uma verificação de pontos obrigatórios, uma resposta modelo, ou uma nota calibrada contra redações reais já corrigidas.
A Prepamigo custa CA$24.98 por mês, ou CA$8.25 por mês no plano anual, o que dá CA$98.98 no ano, com impostos inclusos, e você pode cancelar quando quiser. Todo plano inclui pontuação ilimitada, sem limite diário, por sessão ou semanal, tentativas ilimitadas, e o banco de questões completo: 80 conjuntos de prática completos e mais de 2,000 tarefas de prática em Writing, Speaking, Reading e Listening, escritas para seguir os tipos de tarefa, o tempo e o formato do teste CELPIP General.
Quando o ChatGPT é a ferramenta melhor
- Uma segunda opinião rápida sobre uma redação. A GPT 5.6 sol é um corretor decente e leva dez segundos. Se você já tem a tarefa e só quer outro ponto de vista, ela serve.
- Reescrever uma frase de cinco jeitos. Pedir alternativas para uma frase desajeitada é rápido e as sugestões são boas.
- Discutir uma resposta. Se você quer debater por que um argumento é fraco, uma conversa é o formato certo. A Prepamigo te dá um veredito e evidências; ela não conversa.
- Qualquer coisa fora do teste. O ChatGPT é um assistente geral e a Prepamigo não é.
O que ele não deveria ser é a única coisa que diz a quem escreve no nível 7 ou 8 onde está, ou a coisa que diz a quem escreve bem que é um 9. Esses são os dois lugares em que ele erra com mais frequência.
Perguntas frequentes
O ChatGPT consegue pontuar meu writing do CELPIP? Sim, e melhor do que a maioria dos chatbots: a GPT 5.6 sol acertou 78% das vezes em 36 respostas oficiais, a luna 69%, a GPT-4o mini 58%, contra 86% da Prepamigo.
A Prepamigo é mais precisa que o ChatGPT no writing? Por oito pontos em relação ao melhor modelo GPT. Redações de nível médio, 100% contra 75%; redações fortes, 83% contra 75%; redações fracas, 75% contra 83%.
Qual modelo GPT devo usar? A GPT 5.6 sol. Não a GPT-4o mini, que deu 9 a nove de doze redações fortes.
Quanto custa cada um? O ChatGPT Pro custa US$200 por mês, cerca de CA$276 antes de impostos; o Plus custa US$20 com limites de mensagens. A Prepamigo custa CA$24.98 por mês com impostos inclusos, ou CA$8.25 por mês no plano anual, com pontuação ilimitada e 80 conjuntos de prática.
Para a mesma comparação contra a Claude, leia Prepamigo vs Claude no writing. Para ver como o corretor de writing funciona, leia por dentro do corretor de writing da Prepamigo. Ou escreva uma resposta e veja a nota. Leia também a versão original em Ler este guia em inglês.
