Porcentaje de ensayos calificados al nivel verificado
36 respuestas oficiales de CELPIP writing, 12 en cada uno de tres niveles, en ambas tareas de writing. A cada modelo GPT se le dio la tarea y el ensayo y se le pidió, en lenguaje simple, que lo calificara en la escala de CELPIP. El calificador de writing de Prepamigo se ejecutó tal como lo hace en producción.
86%
Calificador de writing de Prepamigo
78%
GPT 5.6 sol
69%
GPT 5.6 luna
58%
GPT-4o mini
Prepamigo frente a los planes de chatbot más populares
Dólares canadienses. Los precios de Prepamigo incluyen impuestos. Claude Max (desde US$100) y ChatGPT Pro (US$200) están convertidos a 1.38, antes de impuestos. La precisión es el porcentaje de 36 ensayos oficiales calificados al nivel verificado cuando se le pide al modelo indicado, en lenguaje simple, que califique el ensayo; una sola corrida.
ChatGPT es probablemente la herramienta más común que usan los candidatos de CELPIP para revisar su writing. Pegas el correo, pides una puntuación, recibes un número y un párrafo. Es rápido, está en tu teléfono, y para writing no hay ningún paso de transcripción en medio. Así que pusimos a prueba el número. Le dimos a tres modelos GPT las mismas 36 respuestas oficiales de CELPIP writing con las que se mide nuestro propio calificador, doce en cada nivel, y les pedimos que calificaran los ensayos tal como se lo pediría un estudiante.
La respuesta corta: el calificador de writing de Prepamigo acertó el nivel verificado el 86% de las veces. GPT 5.6 sol, el modelo detrás de los planes de pago de ChatGPT, lo acertó el 78% de las veces. GPT 5.6 luna logró 69% y GPT-4o mini 58%. Ocho puntos es una brecha real, y viene de dos lugares: la mitad de la escala, donde Prepamigo calificó correctamente los doce ensayos y GPT 5.6 sol calificó nueve, y la parte alta, donde GPT 5.6 sol retuvo a una cuarta parte de los ensayos fuertes en un 9.
Debemos decir desde el principio que GPT 5.6 sol es el mejor calificador de writing de propósito general que hemos probado, muy por delante de cualquier modelo de Claude en los mismos ensayos. El resto de este artículo recorre los resultados nivel por nivel, explica de dónde salen los ocho puntos, examina la retroalimentación de cada lado y compara lo que cuesta practicar writing en serio con cada uno.
La prueba simple: lo que realmente obtiene un estudiante
Ochenta y seis por ciento frente a setenta y ocho. En 36 ensayos, eso son tres puntuaciones correctas más para Prepamigo que para GPT 5.6 sol, seis más que GPT 5.6 luna y diez más que GPT-4o mini. Dicho de otra forma, Prepamigo comete un 37% menos de errores de calificación que GPT 5.6 sol, un 55% menos que luna y un 67% menos que GPT-4o mini.
Lo que se les dio a los modelos GPT importa. A cada uno se le dijo que era un examinador experimentado de CELPIP writing, se le dio la tarea exactamente como la vio el candidato, incluidos los puntos requeridos de la tarea de correo electrónico y las opciones de la tarea de encuesta, y se le dio el ensayo. Se le pidió una sola puntuación de 0 a 12. Eso es lo que escribirías en ChatGPT, y es una prueba más justa que un simple “califica esto” porque el modelo al menos sabe qué pedía la tarea.
El calificador de Prepamigo recibió la misma tarea y el mismo ensayo, más lo que siempre tiene en producción: ensayos de muestra reales calificados para esa tarea en cada nivel con los que comparar, y una capa de reglas que revisa lo que un evaluador revisa primero, como si están cubiertos todos los puntos requeridos, si una respuesta de encuesta realmente toma partido, si un correo tiene saludo y despedida, y si la respuesta se acerca siquiera a la extensión que pide la tarea.
De dónde salen los ocho puntos: nivel por nivel
Ensayos débiles (puntuación verificada de 4 o 5)
12 ensayos oficiales. El único nivel donde los modelos GPT se adelantan.
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
Calificador de writing de Prepamigo
En los ensayos débiles, los tres modelos GPT están en 83% y Prepamigo en 75%. Este es el único nivel donde ChatGPT va adelante, y lo reportamos como tal. Los tres errores de Prepamigo fueron todos un escalón demasiado alto, a un 6 o 7, en ensayos que eran cortos pero ordenados. Los dos errores de GPT 5.6 sol fueron ambos un 6. Los ensayos débiles son el extremo fácil de la escala para un chatbot: un texto corto, genérico y con errores le parece débil a cualquiera.
Ensayos medios (puntuación verificada de 7 u 8)
12 ensayos oficiales. El nivel en el que está la mayoría de los candidatos.
100%
Calificador de writing de Prepamigo
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
En el nivel medio, Prepamigo calificó los doce ensayos dentro de la banda de 7 a 8. GPT 5.6 sol acertó nueve; sus tres errores fueron todos un 6, un escalón por debajo. GPT 5.6 luna acertó siete, bajando tres ensayos a un 6, uno a un 5 y subiendo uno a un 9. GPT-4o mini acertó ocho y empujó los otros cuatro hacia arriba a un 9.
Un 7 u 8 es la puntuación real más común en el examen, y es la puntuación que decide si un candidato ha alcanzado su objetivo. GPT 5.6 sol le dirá a uno de cada cuatro de esos candidatos que ha bajado a un 6. Luna se lo dirá a cuatro de cada diez. Ninguno es un desastre como lo son los resultados de Claude en la banda media, pero es la diferencia entre una puntuación de práctica con la que puedes planificar y una que tienes que poner en duda.
Ensayos fuertes (puntuación verificada de 10 o más)
12 ensayos oficiales. Los errores aquí son un 9: el ensayo era fuerte y el calificador se contuvo.
83%
Calificador de writing de Prepamigo
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
En la parte alta, Prepamigo reconoció diez de los doce ensayos fuertes, GPT 5.6 sol nueve, luna ocho y GPT-4o mini tres. Todos los errores menos uno fueron un 9. GPT-4o mini le dio un 9 a nueve de los doce ensayos fuertes: simplemente no reparte un 10. Si tu writing es fuerte y lo revisas con el nivel gratuito de ChatGPT, que todavía dirige mucho tráfico a modelos pequeños, te dirán que eres un 9 casi cada vez.
Por qué un chatbot resbala en el nivel medio y en la parte alta
Un ensayo de CELPIP de nivel medio cubre la tarea, está organizado, y también es genérico: razones afirmadas en lugar de desarrolladas, vocabulario seguro, oraciones de una sola forma. Uno fuerte no es impecable; tiene uno o dos deslices, y una oración simple entre las desarrolladas. Un modelo sin ejemplos calificados con los que comparar tiene que decidir por impresión. La impresión de GPT 5.6 sol es un poco severa: el 7 genérico se lee como un 6, el 10 con un desliz se lee como un 9. Luna es más severo todavía. GPT-4o mini trata el 9 como el techo.
El calificador de Prepamigo no juzga un ensayo contra una idea de lo que es escribir bien. Lo compara con ensayos reales calificados para la misma tarea, uno en cada nivel, todos respuestas reales con deslices reales. Un ensayo genérico pero completo queda junto a la muestra media porque es a lo que se parece. Un ensayo fuerte con una oración torpe queda junto a la muestra fuerte, que también tiene una. Sobre esa comparación hay una capa de reglas para lo que un modelo cuenta mal: si están todos los puntos requeridos, si una respuesta de encuesta tomó partido, si el correo tiene saludo y despedida, y qué tan largo es. Un punto requerido omitido mantiene el cumplimiento de la tarea en 8 o menos sin importar el inglés, porque así funciona el examen.
La brecha de flujo de trabajo: lo que tienes que aportar
Para writing, ChatGPT es fácil de usar como calificador, y no vamos a fingir lo contrario. Pegas el ensayo, obtienes un número, pides una explicación. Sin grabación, sin transcripción. Para una segunda opinión rápida sobre un solo ensayo es cómodo y, con GPT 5.6 sol, razonablemente preciso.
Lo que no obtienes es la tarea. ChatGPT puede inventar un enunciado al estilo CELPIP si se lo pides, pero está adivinando los puntos requeridos, las opciones de la encuesta y el conteo de palabras que usa el examen real. No obtienes una revisión de puntos requeridos, porque no sabe qué puntos listaría el examen real. No obtienes una respuesta modelo reescrita a partir de tu propio ensayo con la extensión correcta. Y cada ensayo que pegas cuenta contra tu cuota de mensajes.
En Prepamigo, abres una tarea del banco, el temporizador corre, escribes, y aproximadamente un minuto después de enviar tienes cuatro puntuaciones por dimensión, una puntuación general, una lista de todo lo que omitiste, correcciones citadas de tu propio texto y una respuesta modelo reescrita. El cuadragésimo ensayo del mes te cuesta el mismo esfuerzo que el primero.
El mismo ensayo, la misma puntuación
Después de la corrida principal calificamos los 36 ensayos dos veces más en días distintos. El calificador de writing de Prepamigo obtuvo 86%, 89% y 86% en las tres corridas, con los mismos doce ensayos de nivel medio dentro de la banda cada vez. GPT 5.6 sol obtuvo 78%, 83% y 81%: mejor en su segunda y tercera corrida, y un recordatorio de que una sola respuesta de un chatbot lleva unos cuantos puntos de suerte en cualquier dirección. Si calificas con ChatGPT, pregunta dos veces y quédate con la respuesta más baja.
Retroalimentación: explicación frente a evidencia
ChatGPT explica bien. Pregunta por qué un ensayo es un 6 y te lo dirá, en un inglés claro, con sugerencias. El truco es que la explicación se escribe para justificar un número ya elegido, así que cuando el número está un escalón por debajo, la explicación encuentra fallos a la medida. Un candidato que en realidad estaba en un 7 lee una página sobre debilidades que no eran decisivas.
La retroalimentación de Prepamigo funciona a partir del texto. Cada corrección cita las palabras exactas de tu ensayo, y todo lo que el verificador no encuentre en tu texto se descarta antes de que lo veas. Un punto requerido omitido se nombra. Cada dimensión recibe un factor limitante, o una declaración clara de que nada la frena. Y recibes una respuesta modelo reescrita a partir de tu propia respuesta con la extensión que pide la tarea. La sección siguiente enumera lo que cambió.
Qué hay de nuevo en tu retroalimentación de writing
El puntaje es solo la mitad de lo que recibes. La capa de retroalimentación de writing se reconstruyó junto con el calificador, y todo lo que contiene está anclado a tu propio texto. Esto es lo que cambió.
- Correcciones que puedes encontrar en tu propio ensayo. Cada corrección de gramática, ortografía y vocabulario cita las palabras exactas de tu respuesta, para que la app pueda resaltarlas donde las escribiste. Todo lo que el verificador no encuentre palabra por palabra en tu ensayo se descarta antes de que lo veas.
- Una respuesta modelo, construida a partir de tu respuesta. Recibes una versión reescrita de tu propia respuesta que conserva tus ideas, cubre todos los puntos requeridos y queda dentro de las 150 a 200 palabras que pide la tarea. Si la primera reescritura no alcanza esa extensión, se rehace una vez antes de mostrarse.
- El punto requerido que omitiste, con nombre. En la tarea de correo electrónico, la retroalimentación enumera los puntos del enunciado que tu respuesta no cubrió. Un punto omitido también mantiene el puntaje de cumplimiento de la tarea en 8 o menos, así que el número y la retroalimentación nunca se contradicen.
- Un factor limitante por dimensión. Para cada una de las cuatro dimensiones, la retroalimentación nombra la única cosa que frena ese puntaje, en términos concretos, o dice claramente que nada lo frena y qué lo sostiene. Decidir que una dimensión no tiene problemas es una respuesta real, no un vacío.
- La crítica en el lugar correcto. Un tono débil es un problema de cumplimiento de la tarea, una palabra vaga es un problema de vocabulario, una oración interminable es un problema de legibilidad. Cada punto se archiva bajo la dimensión que le corresponde en lugar de amontonarse en el resumen general.
- Reescrituras a nivel de oración. Oraciones específicas de tu ensayo vuelven con una versión mejorada y una línea sobre por qué es mejor, para que veas el cambio en lugar de leer sobre él.
- Tu dimensión más fuerte y la más débil, lado a lado. La retroalimentación te dice cuál de las cuatro dimensiones sostiene tu puntaje y cuál lo frena, para que sepas qué practicar a continuación sin descifrar cuatro números.
Cada cita en la retroalimentación se verifica contra tu ensayo antes de mostrarse. Si el verificador no encuentra las palabras, la línea se elimina. Por eso la retroalimentación nunca te pide corregir algo que no escribiste.
Cuánto cuesta practicar todos los días
ChatGPT Plus cuesta US$20 al mes, unos CA$28, con facturación mensual, según lo publicado en septiembre de 2026, con un límite de mensajes por ventana móvil; ChatGPT Pro, a US$200 al mes, unos CA$276 antes de impuestos, eleva ese límite. El nivel gratuito dirige gran parte de su tráfico a modelos más pequeños, y en esta prueba el más pequeño de ellos reconoció tres ensayos fuertes de doce. Ninguno de los planes incluye un banco de tareas, un temporizador, una revisión de puntos requeridos, una respuesta modelo, ni una puntuación calibrada contra ensayos reales calificados.
Prepamigo cuesta CA$24.98 al mes, o CA$8.25 al mes en el plan anual, que es CA$98.98 al año, con impuestos incluidos, y puedes cancelar en cualquier momento. Todos los planes incluyen calificación ilimitada sin límite diario, por sesión ni semanal, intentos ilimitados, y el banco de preguntas completo: 80 sets de práctica completos y más de 2,000 tareas de práctica en Writing, Speaking, Reading y Listening, escritas para seguir los tipos de tarea, los tiempos y el formato del examen CELPIP General.
Cuándo ChatGPT es la mejor herramienta
- Una segunda opinión rápida sobre un ensayo. GPT 5.6 sol es un calificador decente y tarda diez segundos. Si ya tienes la tarea y solo quieres otro punto de vista, está bien.
- Reescribir una oración de cinco formas. Pedir alternativas para una oración torpe es rápido y las sugerencias son buenas.
- Conversarlo. Si quieres discutir por qué una razón es débil, una conversación es la forma adecuada. Prepamigo te da un veredicto y evidencia; no conversa.
- Cualquier cosa fuera del examen. ChatGPT es un asistente general y Prepamigo no lo es.
Lo que no debería ser es lo único que le dice a quien escribe a nivel 7 u 8 dónde está, ni lo que le dice a quien escribe fuerte que es un 9. Esos son los dos lugares donde más se equivoca.
Preguntas frecuentes
¿Puede ChatGPT calificar mi CELPIP writing? Sí, y mejor que la mayoría de los chatbots: GPT 5.6 sol acertó el 78% de las veces en 36 respuestas oficiales, luna el 69%, GPT-4o mini el 58%, frente al 86% de Prepamigo.
¿Es Prepamigo más preciso que ChatGPT para writing? Por ocho puntos frente al mejor modelo GPT. Ensayos de nivel medio 100% frente a 75%; ensayos fuertes 83% frente a 75%; ensayos débiles 75% frente a 83%.
¿Qué modelo GPT debería usar? GPT 5.6 sol. No GPT-4o mini, que le dio un 9 a nueve de doce ensayos fuertes.
¿Cuánto cuesta cada uno? ChatGPT Pro cuesta US$200 al mes, unos CA$276 antes de impuestos; Plus cuesta US$20 con límites de mensajes. Prepamigo cuesta CA$24.98 al mes con impuestos incluidos, o CA$8.25 al mes en el plan anual, con calificación ilimitada y 80 sets de práctica.
Para la misma comparación frente a Claude, lee Prepamigo vs Claude para writing. Para ver cómo funciona el calificador de writing, lee por dentro del calificador de writing de Prepamigo. O Escribir una respuesta y mira la puntuación. Leer esta guía en inglés.
