Puntuación

¿Qué IA califica el writing de CELPIP con más precisión? Probamos siete

8 de septiembre de 2026

Porcentaje de ensayos calificados al nivel verificado

36 respuestas oficiales de writing de CELPIP, 12 por nivel, las dos tareas de writing. A cada modelo se le dio la tarea y el ensayo y se le pidió, en lenguaje simple, que lo calificara en la escala de CELPIP. El calificador de writing de Prepamigo se ejecutó en su configuración normal de producción.

86%

Prepamigo Writing Scorer

78%

GPT 5.6 sol

69%

GPT 5.6 luna

61%

Gemini

61%

Claude Opus 5

58%

GPT-4o mini

56%

Claude Sonnet 5

Prepamigo frente a los planes de chatbot más populares

Dólares canadienses. Los precios de Prepamigo incluyen impuestos. Claude Max (desde US$100) y ChatGPT Pro (US$200) están convertidos a 1.38, antes de impuestos. La precisión es el porcentaje de 36 ensayos oficiales calificados al nivel verificado cuando se le pide al modelo indicado, en lenguaje simple, que califique el ensayo; una sola corrida.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Precio mensual
CA$24.98 (imp. inc.)
CA$138+ (más imp.)
CA$276 (más imp.)
Calificación
Ilimitada
Limitada
Limitada
Banco de preguntas
No
No
Sets de práctica
80
Ninguno
Ninguno
Tareas de práctica
2,000+
Ninguna
Ninguna
Formato CELPIP
No
No
Precisión
86%
61%
78%
Ensayos de nivel medio
100%
25%
75%

Muchos candidatos de CELPIP revisan su escritura con un chatbot de IA. Pegas el email, pides una puntuación, lees el párrafo. Para writing es fácil: sin grabación, sin transcripción. Lo que nadie te dice es con qué frecuencia el número es correcto, ni en qué modelo confiar, ni qué errores comete cada uno. Nosotros queríamos saberlo, así que le dimos a seis chatbots y a nuestro propio calificador los mismos 36 ensayos oficiales con puntuaciones verificadas y contamos.

La versión en una oración: GPT 5.6 sol es el chatbot más preciso para el writing de CELPIP con 78%, los modelos de Claude son los menos precisos con 61% y 56% porque inflan los ensayos de nivel medio, y un calificador diseñado a propósito, el de Prepamigo, alcanzó 86% en los mismos ensayos y acertó todos los ensayos de nivel medio. Debemos ser transparentes en que Prepamigo es nuestro producto. Donde un chatbot nos superó en un nivel en particular, lo decimos; dos de ellos lo hicieron.

La clasificación

Se pueden ver tres niveles en el gráfico de arriba. Prepamigo con 86% está solo en su categoría. GPT 5.6 sol con 78% y GPT 5.6 luna con 69% forman un segundo nivel: usable, con hábitos conocidos. Todo lo demás está en 60% o cerca, lo cual en una escala de tres bandas no es mucho mejor que una suposición informada.

El patrón es distinto al de speaking, donde a los modelos de Claude les fue bien y a los modelos GPT les fue mal. En writing es al revés. Los modelos GPT son ligeramente severos: bajan un 7 genérico a un 6 y dejan un ensayo fuerte con un desliz en un 9. Los modelos de Claude son generosos: suben un 7 genérico a un 9 o 10 y califican los ensayos débiles escasos con un 3. Gemini se comporta como Claude en la mitad. GPT-4o mini trata el 9 como el techo.

Resultados en cada nivel

Ensayos débiles (verificado 4 o 5)

12 ensayos oficiales por sistema.

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

Prepamigo Writing Scorer

67%

Claude Opus 5

58%

Gemini

50%

Claude Sonnet 5

Los ensayos débiles son el extremo fácil de la escala, y los tres modelos GPT empatan en 83%, por delante de Prepamigo con 75%. Los tres errores de Prepamigo se fueron un escalón alto, a un 6 o 7, en ensayos cortos pero prolijos. Los modelos de Claude fallan en la otra dirección: Sonnet 5 calificó cuatro de doce ensayos débiles con un 3, un nivel por debajo, y Opus 5 calificó dos de ellos con un 3. Un ensayo escaso que aun así cumple la tarea es un 4, no un 3, y un modelo sin un ejemplo de un 4 no puede notar la diferencia.

Ensayos medios (verificado 7 u 8)

12 ensayos oficiales por sistema. El nivel en el que está la mayoría de los candidatos.

100%

Prepamigo Writing Scorer

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

42%

Gemini

33%

Claude Sonnet 5

25%

Claude Opus 5

La banda media separa al grupo. Prepamigo acertó los doce. GPT 5.6 sol acertó nueve, bajando tres a un 6. GPT-4o mini acertó ocho y subió cuatro a un 9. Luna acertó siete, sobre todo bajando. Gemini acertó cinco y subió seis a un 9 o 10. Claude Sonnet 5 acertó cuatro, repartido entre 6 y 9. Claude Opus 5 acertó tres y le dio un 9 o 10 a siete de los doce.

Si escribes en un 7 u 8, y la mayoría de los candidatos lo hace, este es el gráfico que debes recordar. Pregúntale a Claude Opus 5 y más de la mitad de las veces te dirá que ya terminaste. Pregúntale a Gemini y la mitad de las veces dirá lo mismo. Pregúntale a GPT 5.6 sol y una de cada cuatro veces te dirá que bajaste a un 6.

Ensayos fuertes (verificado 10 o más)

12 ensayos oficiales por sistema. Casi todos los errores son un 9.

92%

Claude Opus 5

83%

Prepamigo Writing Scorer

83%

Gemini

83%

Claude Sonnet 5

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

En la parte alta, Claude Opus 5 es el mejor calificador de la prueba con once de doce ensayos fuertes reconocidos; a cinco de ellos les dio un 11. Prepamigo, Gemini y Sonnet 5 reconocieron diez cada uno. GPT 5.6 sol reconoció nueve y luna ocho, dejando el resto en un 9. GPT-4o mini reconoció tres y le dio un 9 a nueve: no reparte 10. La generosidad de Claude es correcta aquí e incorrecta en todo lo demás; la severidad de los modelos GPT es incorrecta aquí y más o menos correcta en el resto.

Sea cual sea el chatbot que uses, un 9 en un ensayo que creías fuerte tiene más probabilidades de ser un 10 retenido que un 9 verdadero, a menos que venga de un modelo de Claude, en cuyo caso un 9 tiene más probabilidades de ser un 7 u 8 ascendido. La dirección del error depende del modelo.

Por qué los modelos no se ponen de acuerdo sobre la mitad

Un ensayo de CELPIP de nivel medio es algo específico: cubre la tarea, está organizado, tiene pocos errores que bloqueen la comprensión, y es genérico, con razones afirmadas en lugar de desarrolladas y un vocabulario seguro en lugar de preciso. Un calificador entrenado ha visto cientos de estos y sabe dónde van. Un modelo de propósito general ha visto un texto prolijo, organizado y casi todo correcto, y tiene que decidir por impresión. La impresión de Claude es que prolijo significa fuerte. La impresión de GPT es que genérico significa débil. Ambos se equivocan sobre un 7, en direcciones opuestas.

El calificador de Prepamigo no juzga por impresión. Compara el ensayo con respuestas reales ya calificadas al mismo tipo de tarea en cada nivel, todas ensayos reales con deslices reales, y lo ubica junto al que más se le parece en cada una de las cuatro dimensiones. Un ensayo limpio pero genérico cae junto al ejemplo medio, porque eso es lo que es. Encima de la comparación hay una capa de reglas para las cosas que a un modelo se le dan mal contar: si se cubren todos los puntos requeridos, si una respuesta de encuesta toma partido, si el email tiene un saludo y una despedida, y cuánto mide. Un punto requerido omitido mantiene el cumplimiento de la tarea en 8 o menos sin importar el inglés, porque así funciona el examen.

También probamos darle al calificador de writing el diseño de dos calificadores con votación y reconciliación que usa nuestro calificador de speaking. Empeoró el writing, porque los niveles oficiales de writing están a solo dos puntos de distancia en la escala de 0 a 12 y una elección forzada entre ejemplos empujó los ensayos medios a un 9. Writing conserva el diseño que acierta la mitad.

Por qué la clasificación es la inversa de speaking

Si has leído nuestra comparación de speaking, la clasificación de writing te parecerá al revés. En transcripciones de speaking, Claude Opus 5 fue el mejor chatbot con 62% y GPT 5.6 sol el peor de los modelos grandes con 35%. En writing es GPT 5.6 sol con 78% y los modelos de Claude al final.

La razón es con qué es generoso cada modelo. Una transcripción de speaking de CELPIP es inglés hablado puesto por escrito: fragmentos, repeticiones, autocorrecciones. GPT lo lee como roto y lo califica con dureza, lo cual en una transcripción es incorrecto; Claude lo atraviesa hasta llegar a las ideas. Un ensayo de CELPIP es lo contrario: está editado, organizado, prolijo en la superficie, y a menudo genérico por debajo. Claude lee la prolijidad como fortaleza e infla la mitad; GPT lee el contenido genérico como debilidad y acierta más o menos, o se queda un punto bajo.

La lección práctica es que no hay un único mejor chatbot para CELPIP. El modelo que califica bien tu speaking es el que halagará tu writing, y al revés. Un calificador diseñado a propósito esquiva la pregunta comparando contra ejemplos calificados del tipo correcto para cada tarea. El motor de speaking y el motor de writing de Prepamigo son sistemas separados con diseños distintos, porque las dos tareas fallan de forma distinta.

El párrafo que acompaña al número

Todos los chatbots devuelven un párrafo de retroalimentación con su puntuación, y el párrafo suele sonar más seguro de lo que el número merece. Tres cosas que revisar antes de actuar en base a él.

  • ¿Te cita? Una corrección que no señala tus palabras exactas es una regla general, no retroalimentación sobre tu ensayo. La mayoría de los consejos de los chatbots son del tipo que aplica a cualquier ensayo: varía la estructura de tus oraciones, usa un vocabulario más preciso, desarrolla tus razones. Cierto, y nada accionable.
  • ¿Nombra el punto que falta? Si pegaste la tarea, una buena respuesta te dice qué punto requerido no cubriste. Si no la pegaste, el chatbot no puede saberlo, y elogiará la cobertura de todos modos.
  • ¿La crítica coincide con la puntuación? Un párrafo de chatbot a menudo enumera tres o cuatro problemas y luego da un 10, o elogia el ensayo y da un 6. Cuando las palabras y el número no coinciden, ninguno de los dos es confiable.

La retroalimentación de Prepamigo se construye al revés: el calificador debe citar las frases que sustentan la puntuación de cada dimensión antes de darla, y una cita que no se encuentra en tu ensayo se descarta. Los puntos omitidos se enumeran por su nombre, y un punto omitido limita la puntuación de cumplimiento de la tarea, así que las palabras y el número no pueden contradecirse. La sección de abajo enumera lo que contiene.

Notas sobre cada modelo

  • GPT 5.6 sol. El mejor chatbot para writing con 78%, y el que hay que usar si usas uno. Ligeramente severo: tres ensayos medios bajados a un 6, tres ensayos fuertes dejados en un 9. En ensayos débiles es mejor que Prepamigo, 83% frente a 75%.
  • GPT 5.6 luna. 69%. Misma forma que sol pero más severo en la mitad, donde acertó siete de doce. Bueno en ensayos débiles.
  • Gemini. 61%. Bien en los extremos, pobre en la mitad con 42%, donde subió seis de doce ensayos a un 9 o 10.
  • Claude Opus 5. 61% en general pero el mejor calificador de la prueba en ensayos fuertes con 92%. En la mitad es el peor con 25%, dándole un 9 o 10 a siete de doce. Si tu escritura ya es fuerte, Opus 5 te lo confirmará; si es promedio, Opus 5 te dirá que es fuerte.
  • GPT-4o mini. 58%. Trata el 9 como el tope de la escala: nueve de doce ensayos fuertes recibieron un 9. No lo uses para calificar writing si estás cerca de un 10.
  • Claude Sonnet 5. 56%, el menos preciso. Calificó cuatro ensayos débiles con un 3 y repartió la banda media entre 6 y 9.

Si de todos modos vas a usar un chatbot

  1. Usa GPT 5.6 sol. No un modelo de Claude para nada por debajo de un ensayo fuerte, y no un modelo pequeño para nada por encima de uno débil.
  2. Pega la tarea completa. Los puntos requeridos de la tarea de email y las opciones de la tarea de encuesta cambian la puntuación. Un modelo que no conoce los puntos no puede decirte que falta uno.
  3. Pídele que revise los puntos primero. Pide un sí o no para cada punto requerido, y luego la puntuación. Esta es la capa de reglas, hecha a mano.
  4. Pregunta dos veces, quédate con la respuesta más baja. GPT 5.6 sol obtuvo 78%, 83% y 81% en tres corridas de los mismos ensayos; una sola respuesta lleva unos cuantos puntos de suerte.
  5. Lee un 9 y un 6 con sospecha. De un modelo GPT, un 9 suele ser un 10 retenido y un 6 suele ser un 7 bajado. De un modelo de Claude, un 9 suele ser un 7 ascendido.

El único insumo que no puedes conseguir por tu cuenta es un ensayo verificado ya calificado para la misma tarea en cada nivel, que es contra lo que compara un calificador diseñado a propósito. Eso, y la revisión de puntos requeridos, es la diferencia entre 78% y 86%.

Qué hay de nuevo en tu retroalimentación de writing

El puntaje es solo la mitad de lo que recibes. La capa de retroalimentación de writing se reconstruyó junto con el calificador, y todo lo que contiene está anclado a tu propio texto. Esto es lo que cambió.

  • Correcciones que puedes encontrar en tu propio ensayo. Cada corrección de gramática, ortografía y vocabulario cita las palabras exactas de tu respuesta, para que la app pueda resaltarlas donde las escribiste. Todo lo que el verificador no encuentre palabra por palabra en tu ensayo se descarta antes de que lo veas.
  • Una respuesta modelo, construida a partir de tu respuesta. Recibes una versión reescrita de tu propia respuesta que conserva tus ideas, cubre todos los puntos requeridos y queda dentro de las 150 a 200 palabras que pide la tarea. Si la primera reescritura no alcanza esa extensión, se rehace una vez antes de mostrarse.
  • El punto requerido que omitiste, con nombre. En la tarea de correo electrónico, la retroalimentación enumera los puntos del enunciado que tu respuesta no cubrió. Un punto omitido también mantiene el puntaje de cumplimiento de la tarea en 8 o menos, así que el número y la retroalimentación nunca se contradicen.
  • Un factor limitante por dimensión. Para cada una de las cuatro dimensiones, la retroalimentación nombra la única cosa que frena ese puntaje, en términos concretos, o dice claramente que nada lo frena y qué lo sostiene. Decidir que una dimensión no tiene problemas es una respuesta real, no un vacío.
  • La crítica en el lugar correcto. Un tono débil es un problema de cumplimiento de la tarea, una palabra vaga es un problema de vocabulario, una oración interminable es un problema de legibilidad. Cada punto se archiva bajo la dimensión que le corresponde en lugar de amontonarse en el resumen general.
  • Reescrituras a nivel de oración. Oraciones específicas de tu ensayo vuelven con una versión mejorada y una línea sobre por qué es mejor, para que veas el cambio en lugar de leer sobre él.
  • Tu dimensión más fuerte y la más débil, lado a lado. La retroalimentación te dice cuál de las cuatro dimensiones sostiene tu puntaje y cuál lo frena, para que sepas qué practicar a continuación sin descifrar cuatro números.

Cada cita en la retroalimentación se verifica contra tu ensayo antes de mostrarse. Si el verificador no encuentra las palabras, la línea se elimina. Por eso la retroalimentación nunca te pide corregir algo que no escribiste.

Preguntas frecuentes

¿Qué IA es la más precisa al calificar CELPIP writing? Entre los chatbots, GPT 5.6 sol con 78%, luego luna 69%, Gemini y Claude Opus 5 61%, GPT-4o mini 58%, Claude Sonnet 5 56%. El calificador de writing de Prepamigo alcanzó 86% en los mismos ensayos.

¿ChatGPT o Claude para writing? ChatGPT, claramente: 78% frente a 61% y 56%. Los modelos de Claude inflan los ensayos de nivel medio a un 9 o 10. Opus 5 es el mejor de todos en ensayos fuertes.

¿Por qué le dan a mi ensayo promedio un 9? Prolijo y organizado se lee como fuerte para un modelo sin nada con qué comparar. Prepamigo compara con ejemplos reales ya calificados para la misma tarea.

¿Cómo obtengo una mejor puntuación de un chatbot? Usa GPT 5.6 sol, pega la tarea completa, pídele que revise cada punto requerido primero, pregunta dos veces, y lee los 9 y los 6 con sospecha.

Para las dos comparaciones directas, lee Prepamigo vs Claude para writing y Prepamigo vs ChatGPT para writing. Para ver cómo funciona el calificador, lee por dentro del calificador de writing de Prepamigo. O Escribir una respuesta y sáltate las conjeturas. Leer esta guía en inglés.

¿Qué IA califica el writing de CELPIP con más precisión? Probamos siete | PrepAmigo