El calificador de writing de Prepamigo en 36 ensayos oficiales
Porcentaje de ensayos calificados dentro del nivel verificado, en general y por nivel. Doce ensayos por nivel entre las dos tareas de writing; los seis ensayos de ejemplo que el calificador usa para calibración están excluidos.
86%
General
75%
Débil (4–5)
100%
Medio (7–8)
83%
Fuerte (10+)
Prepamigo frente a los planes de chatbot más populares
Dólares canadienses. Los precios de Prepamigo incluyen impuestos. Claude Max (desde US$100) y ChatGPT Pro (US$200) están convertidos a 1.38, antes de impuestos. La precisión es el porcentaje de 36 ensayos oficiales calificados al nivel verificado cuando se le pide al modelo indicado, en lenguaje simple, que califique el ensayo; una sola corrida.
Es la pregunta correcta para hacerle a cualquier herramienta de práctica, y la mayoría de las herramientas no la responden. Una puntuación de writing solo vale algo si te dice lo que diría un calificador real, y la única forma de saber si lo hace es medir. Así que este artículo es la medición, presentada con claridad, con las partes que nos favorecen y las que no.
La respuesta en un párrafo: en 36 respuestas oficiales de writing de CELPIP, cada una con una puntuación verificada de forma independiente, el calificador de writing de Prepamigo acertó el nivel verificado el 86% de las veces. Acertó todos los ensayos de nivel medio, el 75% de los ensayos débiles y el 83% de los fuertes. Produjo el mismo resultado, con un ensayo de diferencia como máximo, en tres corridas separadas. Al pedírsele en lenguaje simple que calificara los mismos ensayos, el mejor modelo de frontera, GPT 5.6 sol, alcanzó 78%; los modelos de Claude alcanzaron 61% y 56%.
Lo que sigue es qué significan los números en cada nivel, dónde caen los errores y en qué dirección, qué tan estable es la puntuación, cómo se compara con los chatbots que podrías estar usando en su lugar, qué hay de nuevo en la retroalimentación, y cómo leer tu propia puntuación a la luz de todo esto.
Qué significa “preciso” aquí
No estamos afirmando que una puntuación de Prepamigo prediga el resultado de tu examen. Ninguna herramienta de práctica puede prometer eso. Lo que medimos es más limitado y más honesto: dado un ensayo cuya puntuación ha sido verificada de forma independiente, ¿con qué frecuencia el calificador produce una puntuación en el mismo nivel?
CELPIP writing se reporta en una escala que llega hasta 12, y las puntuaciones verificadas en nuestros datos de referencia vienen en tres bandas: débil, que significa 4 o 5; media, que significa 7 u 8; y fuerte, que significa 10 o más. Contamos el calificador como correcto cuando su puntuación cae dentro de la banda verificada. Un ensayo fuerte calificado con 10, 11 o 12 es correcto; calificado con 9 es un error, aunque sea un error por poco.
Precisión en cada nivel
Ensayos débiles: 75%. Nueve de doce dentro de la banda. Los tres errores se fueron un escalón demasiado alto: dos ensayos recibieron un 6 y uno un 7. Cada uno era corto y escaso pero prolijo, con pocos errores, y la prolijidad le compró un punto que no se había ganado en contenido. Este es el error característico del calificador en el extremo bajo, y es un error generoso: a alguien que escribe débil se le dice que es un poco mejor de lo que es, nunca peor.
Ensayos medios: 100%. Doce de doce dentro de la banda de 7 a 8, en las tres corridas. Este es el nivel en el que está la mayoría de los candidatos y el nivel que decide la mayoría de las metas de inmigración, y es donde el calificador es más fuerte. También es donde todos los chatbots que probamos son más débiles, por razones que explica la sección de comparación.
Ensayos fuertes: 83%. Diez de doce. Los dos errores fueron un 9, un escalón por debajo. Un ensayo fuerte de CELPIP no es impecable, y el calificador ocasionalmente lee un desliz de más. Ninguno de los dos errores fue un 7 u 8; a un ensayo fuerte nunca se le dice que es promedio.
Por tarea, el calificador acertó en el 89% de las respuestas de email y en el 83% de las respuestas de encuesta. Las respuestas de encuesta son más difíciles de ubicar porque la tarea premia una posición clara y razones desarrolladas, y una respuesta que duda entre las opciones se penaliza por regla.
Hacia dónde van los errores
Un calificador que se equivoca el 14% de las veces puede equivocarse de forma inofensiva o de forma dañina. Dañina es decirle a un candidato que necesita un 8 que ya lo tiene cuando no es así. Inofensiva es decirle que le falta un punto cuando no le falta; eso cuesta una semana de práctica y nada más.
De los cinco errores del calificador en 36 ensayos, tres fueron ensayos débiles calificados con 6 o 7 y dos fueron ensayos fuertes calificados con 9. Ningún ensayo de nivel medio se calificó alto, y ningún ensayo débil se calificó fuerte. En términos prácticos: si el calificador dice que llegaste al nivel medio, llegaste, o estás a un punto. Si dice que llegaste al nivel fuerte, llegaste. El único lugar donde halaga es abajo, donde un ensayo corto y prolijo puede ganar un punto que no se merecía.
Compara eso con los chatbots en los mismos ensayos. Claude Opus 5 llamó 9 o 10 a siete ensayos de nivel medio, que es la dirección dañina para los candidatos a quienes más afecta. GPT 5.6 sol llamó 6 a tres ensayos de nivel medio, que es la dirección inofensiva, y dejó tres ensayos fuertes en un 9. La cifra de precisión de un calificador te dice con qué frecuencia se equivoca; la dirección te dice lo que te cuesta cuando lo hace.
Email frente a encuesta
Los 36 ensayos se dividieron entre las dos tareas de writing, y al calificador le fue un poco mejor en la tarea de email, con 89%, que en la respuesta de encuesta, con 83%. Eso es un error adicional del lado de la encuesta, y va en la dirección que uno esperaría.
Las respuestas de email se califican en gran medida por cobertura: si se abordaron los puntos requeridos, si el tono es adecuado para el lector, si hay un saludo y una despedida. Esas son cosas que el calificador revisa por regla antes de emitir cualquier juicio, así que un email que las tiene se ubica de forma confiable. Las respuestas de encuesta se califican por la calidad de un argumento: una posición clara y razones que se desarrollan en lugar de enumerarse. El desarrollo es un juicio, y el juicio es donde un calificador, humano o no, tiene margen para diferir en un punto.
Para ti, esto significa que una puntuación de encuesta es ligeramente más blanda que una de email. Si estás rondando el borde de tu meta en las respuestas de encuesta, escribe dos en lugar de una antes de decidir dónde estás.
Desde tu lado de la pantalla
La vista por nivel te dice cómo se desempeña el calificador en un ensayo de nivel conocido. Tú lo estás viendo al revés: tienes una puntuación y quieres saber cuánto creerle.
- Si dice 4 o 5: el ensayo estaba en el nivel débil nueve veces de nueve. Una puntuación baja del calificador es correcta.
- Si dice 7 u 8: el ensayo estaba en el nivel medio doce veces de quince; los otros tres eran ensayos débiles calificados un escalón alto. Un 7 u 8 significa medio, y posiblemente un poco más bajo.
- Si dice 10 o más: el ensayo estaba en el nivel fuerte diez veces de diez. Un 10 del calificador es un 10.
- Si dice 9: los dos 9 de la prueba eran ensayos verificados como fuertes. Un 9 es la puntuación que hay que leer con cuidado: significa cerca de la parte alta, y a una razón desarrollada o una elección de palabra precisa de llegar.
¿El mismo ensayo obtiene la misma puntuación?
La precisión sin consistencia es suerte. Así que calificamos los 36 ensayos tres veces en días diferentes sin cambiar nada entre ellas. El calificador devolvió 86%, 89% y 86%. Los mismos doce ensayos de nivel medio estuvieron dentro de la banda cada vez, y ningún ensayo se movió más de un punto entre corridas.
La consistencia viene de cómo se ejecuta el modelo de calificación: razonamiento desactivado, una temperatura fija, y una comparación contra ejemplos calificados fijos en lugar de un juicio libre. Para ti, significa que un cambio en tu puntuación es un cambio en tu escritura. Si reescribes un ensayo y pasa de 8 a 10, eso no es que el calificador haya tenido un buen día.
Cómo se compara esto con lo que podrías usar en su lugar
Un número de precisión significa más si se tiene algo con qué compararlo. Así que le dimos los mismos 36 ensayos a los chatbots que la gente realmente usa para revisar su escritura, tal como lo haría una persona: la tarea, el ensayo, y una solicitud simple de una puntuación de 0 a 12.
Porcentaje de ensayos calificados dentro del nivel verificado
Los mismos 36 ensayos oficiales. A cada modelo se le pidió, en lenguaje simple, que calificara el ensayo; Prepamigo se ejecutó en su configuración normal de producción.
86%
Prepamigo Writing Scorer
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
El calificador lidera al mejor chatbot por ocho puntos y a los modelos de Claude por 25 a 30. La forma de los errores es lo que importa. En los ensayos de nivel medio, Prepamigo está en 100%, GPT 5.6 sol en 75%, Gemini 42%, Claude Sonnet 5 33% y Claude Opus 5 25%: un chatbot sin nada con qué comparar lee un 7 limpio y genérico como un 9, o un 7 genérico con algunos errores como un 6. En los ensayos fuertes, Claude Opus 5 es en realidad el mejor calificador de la prueba con 92% frente al 83% de Prepamigo; es generoso, lo cual es correcto en la parte alta e incorrecto en todo lo demás. GPT-4o mini le dio un 9 a nueve de doce ensayos fuertes.
Lo que el calificador tiene y los chatbots no es ensayos reales ya calificados para la misma tarea en cada nivel con los que comparar, y una capa de reglas que revisa los puntos requeridos, la postura en la encuesta, el saludo y la despedida, y la extensión antes de que cualquier modelo dé una opinión. Esa es la diferencia entre 86% y 78%, y está casi toda en la mitad de la escala.
Qué hay de nuevo en tu retroalimentación de writing
El puntaje es solo la mitad de lo que recibes. La capa de retroalimentación de writing se reconstruyó junto con el calificador, y todo lo que contiene está anclado a tu propio texto. Esto es lo que cambió.
- Correcciones que puedes encontrar en tu propio ensayo. Cada corrección de gramática, ortografía y vocabulario cita las palabras exactas de tu respuesta, para que la app pueda resaltarlas donde las escribiste. Todo lo que el verificador no encuentre palabra por palabra en tu ensayo se descarta antes de que lo veas.
- Una respuesta modelo, construida a partir de tu respuesta. Recibes una versión reescrita de tu propia respuesta que conserva tus ideas, cubre todos los puntos requeridos y queda dentro de las 150 a 200 palabras que pide la tarea. Si la primera reescritura no alcanza esa extensión, se rehace una vez antes de mostrarse.
- El punto requerido que omitiste, con nombre. En la tarea de correo electrónico, la retroalimentación enumera los puntos del enunciado que tu respuesta no cubrió. Un punto omitido también mantiene el puntaje de cumplimiento de la tarea en 8 o menos, así que el número y la retroalimentación nunca se contradicen.
- Un factor limitante por dimensión. Para cada una de las cuatro dimensiones, la retroalimentación nombra la única cosa que frena ese puntaje, en términos concretos, o dice claramente que nada lo frena y qué lo sostiene. Decidir que una dimensión no tiene problemas es una respuesta real, no un vacío.
- La crítica en el lugar correcto. Un tono débil es un problema de cumplimiento de la tarea, una palabra vaga es un problema de vocabulario, una oración interminable es un problema de legibilidad. Cada punto se archiva bajo la dimensión que le corresponde en lugar de amontonarse en el resumen general.
- Reescrituras a nivel de oración. Oraciones específicas de tu ensayo vuelven con una versión mejorada y una línea sobre por qué es mejor, para que veas el cambio en lugar de leer sobre él.
- Tu dimensión más fuerte y la más débil, lado a lado. La retroalimentación te dice cuál de las cuatro dimensiones sostiene tu puntaje y cuál lo frena, para que sepas qué practicar a continuación sin descifrar cuatro números.
Cada cita en la retroalimentación se verifica contra tu ensayo antes de mostrarse. Si el verificador no encuentra las palabras, la línea se elimina. Por eso la retroalimentación nunca te pide corregir algo que no escribiste.
Cómo leer tu puntuación
- Un 4 o 5 es correcto. Lee las correcciones; están citadas de tu propio texto. Luego lee los puntos omitidos y la respuesta modelo, y escribe la misma tarea de nuevo.
- Un 7 u 8 es medio, posiblemente un poco más bajo. Mira el factor limitante de cada dimensión. El que nombra un problema concreto es el que hay que trabajar.
- Un 9 está cerca. Compara tu ensayo con la respuesta modelo párrafo por párrafo. La brecha suele ser una razón sin desarrollar o una elección de palabra genérica.
- Un 10 o más es un 10. Estás listo en ese tipo de tarea. Pasa al que evitas.
- Confía más en los cambios que en los niveles. Como la puntuación es estable, un cambio entre intentos de la misma tarea es un cambio en tu escritura.
Una rutina de práctica que aprovecha el número
La gracia de una puntuación precisa y estable es que puedes dejar de cuestionarla y empezar a usarla. Esta es la rutina que sugerimos, construida alrededor de lo que los números de esta página dicen que la puntuación puede y no puede decirte.
- Escribe un email y una respuesta de encuesta, en frío. No mires la respuesta modelo primero. Envía ambos. Las dos puntuaciones juntas son tu nivel de partida; si difieren en más de un punto, la más baja es la tarea que hay que practicar.
- Lee los puntos omitidos y el factor limitante antes que las correcciones.Las correcciones arreglan oraciones; los puntos omitidos y los factores limitantes arreglan puntuaciones. Un punto requerido que falta vale más que todas las comas.
- Reescribe la misma respuesta con la respuesta modelo abierta. Conserva tus ideas, toma prestada su estructura. Envía de nuevo. Como el calificador le da al mismo ensayo la misma puntuación, la diferencia entre los dos envíos es enteramente tu reescritura.
- Pasa a una tarea nueva cuando la reescritura se sostenga. Un solo 10 en una reescritura todavía no es un nivel. Dos 10 en dos tareas distintas sí lo son.
- Lee un 9 como un casi y un 6 como un 6 real. El calificador no baja los ensayos medios. Si dice 6, el ensayo es escaso, y el factor limitante dirá dónde.
Preguntas frecuentes
¿Qué tan precisa es la puntuación de writing de Prepamigo? 86% en el nivel exacto en 36 ensayos oficiales: 75% débil, 100% medio, 83% fuerte. El mismo resultado, con un ensayo de diferencia como máximo, en tres corridas.
¿Es igual a mi puntuación real? Ninguna herramienta de práctica puede prometer eso. Lo que medimos es con qué frecuencia el calificador coincide con una puntuación verificada en el mismo ensayo.
¿Por qué obtuve un 9 en un ensayo fuerte? Ese es el error más común del calificador en la parte alta: dos de doce ensayos fuertes recibieron un 9. Reescribe con la respuesta modelo al lado y califica de nuevo.
¿Es mejor que ChatGPT o Claude? 86% frente a 78% de GPT 5.6 sol y 61% y 56% de los modelos de Claude. En los ensayos de nivel medio, 100% frente a 75% del mejor de ellos.
Para ver cómo funciona el calificador, lee por dentro del calificador de writing de Prepamigo. Para ver la misma prueba en los seis chatbots, lee qué IA califica el writing de CELPIP con más precisión. O Escribir una respuesta y comprueba los números por ti mismo. Leer esta guía en inglés.
