Puntuación

Presentamos Prepamigo Writing Scoring Engine

8 de septiembre de 2026

Prepamigo Writing Scoring Engine frente a los modelos de frontera como calificadores

Porcentaje de respuestas de writing de CELPIP donde la puntuación coincidió con la puntuación verificada de forma independiente. 36 ensayos oficiales, distribuidos de manera uniforme entre los niveles débil, medio y fuerte y entre las dos tareas de writing. A cada modelo se le dio la tarea y el ensayo y se le pidió, en lenguaje simple, que lo calificara en la escala de CELPIP.

86%

Prepamigo Writing Scoring EnginePrepamigo

78%

GPT 5.6 solOpenAI

69%

GPT 5.6 lunaOpenAI

61%

GeminiGoogle

61%

Claude Opus 5Anthropic

58%

GPT-4o miniOpenAI

56%

Claude Sonnet 5Anthropic

Prepamigo frente a los planes de chatbot más populares

Dólares canadienses. Los precios de Prepamigo incluyen impuestos. Claude Max (desde US$100) y ChatGPT Pro (US$200) están convertidos a 1.38, antes de impuestos. La precisión es el porcentaje de 36 ensayos oficiales calificados al nivel verificado cuando se le pide al modelo indicado, en lenguaje simple, que califique el ensayo; una sola corrida.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Precio mensual
CA$24.98 (imp. inc.)
CA$138+ (más imp.)
CA$276 (más imp.)
Calificación
Ilimitada
Limitada
Limitada
Banco de preguntas
No
No
Sets de práctica
80
Ninguno
Ninguno
Tareas de práctica
2,000+
Ninguna
Ninguna
Formato CELPIP
No
No
Precisión
86%
61%
78%
Ensayos de nivel medio
100%
25%
75%

El calificador de writing de Prepamigo coincidió con las puntuaciones verificadas en el 86% de los ensayos oficiales de CELPIP, por delante de todos los modelos de frontera a los que se les dio la misma tarea, y en el nivel medio, donde está la mayoría de los candidatos, calificó correctamente todos los ensayos.

Esta página presenta Prepamigo Writing Scoring Engine, el sistema que califica cada email y cada respuesta de encuesta escritos en Prepamigo. No es un modelo de propósito general al que se le pide calificar. Es un calificador construido para una sola tarea: ubicar una respuesta de writing de CELPIP en el nivel donde la ubicaría un calificador entrenado, y explicar esa ubicación con las propias palabras de quien escribe.

El resultado es un calificador más preciso que cualquier modelo de frontera usado como lo usaría un estudiante. En 36 respuestas oficiales de writing de CELPIP con puntuaciones verificadas de forma independiente, el motor acertó el nivel correcto el 86% de las veces. Al pedírsele en lenguaje simple que calificara los mismos ensayos, GPT 5.6 sol alcanzó 78%. GPT 5.6 luna alcanzó 69%, Gemini y Claude Opus 5 61%, GPT-4o mini 58%, y Claude Sonnet 5 56%.

La precisión importa más donde realmente están los candidatos. Un 7 u 8 es la puntuación real de writing más común, y es la puntuación que decide si se alcanzó una meta. El motor ubicó los doce ensayos de nivel medio dentro de esa banda. El mejor modelo de frontera ubicó nueve; Claude Opus 5 ubicó tres. Esta página explica cómo califica el motor, cómo se compara, qué hay de nuevo en la retroalimentación que acompaña cada puntuación, y cuánto cuesta practicar sin contar.

Precisión frente a puntuaciones verificadas

La pregunta que nos importa es simple. Cuando un estudiante envía un ensayo, ¿la puntuación en la pantalla coincide con la que habría dado un calificador entrenado? Para responderla usamos un conjunto de respuestas oficiales de writing de CELPIP, cada una con una puntuación verificada de forma independiente, que cubre las dos tareas de writing y está dividido de manera uniforme entre los niveles débil, medio y fuerte: doce ensayos por nivel, 36 en total. Los seis ensayos de ejemplo que el motor usa para calibración no están entre ellos.

Todos los sistemas vieron la misma tarea, incluidos los puntos requeridos de la tarea de email y las opciones de la tarea de encuesta, y el mismo ensayo. A cada modelo de frontera se le dijo que era un examinador experimentado de writing de CELPIP y se le pidió una sola puntuación de 0 a 12. El motor se ejecutó como lo hace en producción. Una puntuación es correcta cuando cae dentro del nivel verificado: 4 o 5 para un ensayo débil, 7 u 8 para uno medio, 10 a 12 para uno fuerte.

37%

menos errores que GPT 5.6 sol

5 puntuaciones equivocadas de 36, frente a 8.

64%

menos errores que Claude Opus 5

5 puntuaciones equivocadas de 36, frente a 14.

100%

de los ensayos de nivel medio calificados correctamente

El mejor de los otros modelos: 75%. Claude Opus 5: 25%.

Tres cosas destacan. Primero, la brecha frente al mejor modelo de frontera es de ocho puntos, que en 36 ensayos son tres puntuaciones correctas adicionales, y se mantuvo en cada corrida repetida. Segundo, la brecha frente a los modelos de Claude es de 25 a 30 puntos, y se concentra en la mitad de la escala, donde un modelo de propósito general lee un ensayo limpio y genérico como uno fuerte. Tercero, la comparación es la que le importa a un estudiante: mide lo que obtienes al pegar un ensayo en un chatbot y preguntar, que es como casi todo el mundo usa estos modelos.

SistemaTodos los ensayosDébilMedioFuerte
Prepamigo Writing Scoring Engine86%75%100%83%
GPT 5.6 sol78%83%75%75%
GPT 5.6 luna69%83%58%67%
Gemini61%58%42%83%
Claude Opus 561%67%25%92%
GPT-4o mini58%83%67%25%
Claude Sonnet 556%50%33%83%

Porcentaje de ensayos calificados dentro del nivel verificado, una sola corrida. Doce ensayos por nivel, así que un ensayo vale unos ocho puntos en la vista por nivel y tres puntos en el total.

Desempeño en cada nivel

Un promedio oculta dónde caen los errores. En writing, para un modelo de propósito general caen en dos lugares: en la mitad, donde un ensayo limpio pero genérico se lee como fuerte, y en la parte alta, donde un ensayo fuerte con un desliz se queda en un 9.

Ensayos débiles · puntuación verificada de 4 o 5

12 ensayos oficiales por sistema.

83%

GPT 5.6 sol

83%

GPT 5.6 luna

83%

GPT-4o mini

75%

Prepamigo Writing Engine

67%

Claude Opus 5

58%

Gemini

50%

Claude Sonnet 5

Ensayos medios · puntuación verificada de 7 u 8

12 ensayos oficiales por sistema. El nivel en el que está la mayoría de los candidatos.

100%

Prepamigo Writing Engine

75%

GPT 5.6 sol

67%

GPT-4o mini

58%

GPT 5.6 luna

42%

Gemini

33%

Claude Sonnet 5

25%

Claude Opus 5

Ensayos fuertes · puntuación verificada de 10 o más

12 ensayos oficiales por sistema. Casi todos los errores son un 9.

92%

Claude Opus 5

83%

Prepamigo Writing Engine

83%

Gemini

83%

Claude Sonnet 5

75%

GPT 5.6 sol

67%

GPT 5.6 luna

25%

GPT-4o mini

Para los candidatos que componen la mayor parte del examen, esta es la diferencia que importa. En los ensayos de nivel medio, el motor acertó doce veces de doce. El mejor modelo de frontera acertó nueve veces; Claude Opus 5 acertó tres veces y llamó 9 o 10 a siete de los doce.

En los ensayos débiles, los modelos GPT están en 83% y el motor en 75%. Los tres errores del motor se fueron un escalón demasiado alto, a un 6 o 7, en ensayos que eran cortos pero prolijos; los errores de los modelos de Claude fueron en la otra dirección, calificando ensayos escasos con un 3. El writing débil es el extremo fácil de la escala para cualquiera, y este es el único nivel donde un chatbot puede igualar o superar al motor.

En la mitad, el motor está solo con 100%. GPT 5.6 sol bajó tres de doce ensayos a un 6. Claude Opus 5 subió siete de doce a un 9 o 10. Gemini subió cinco. Un ensayo de nivel medio cubre la tarea, está organizado y también es genérico; un modelo sin nada con qué comparar lo lee por impresión, y la impresión varía según el modelo. El motor lo lee contra un 7 real ya calificado.

En la parte alta, Claude Opus 5 es el mejor calificador de la prueba, con once de doce ensayos fuertes reconocidos frente a los diez del motor. Claude es generoso, lo cual es correcto en los ensayos fuertes e incorrecto en todo lo demás. GPT-4o mini le dio un 9 a nueve de los doce: no reparte un 10.

Consistencia y estabilidad

Un calificador en el que puedas confiar tiene que dar la misma respuesta dos veces. Después de la corrida principal, calificamos los 36 ensayos dos veces más en días diferentes. El motor obtuvo 86%, 89% y 86%, con los mismos doce ensayos de nivel medio dentro de la banda cada vez y sin que ningún ensayo se moviera más de un punto entre corridas. GPT 5.6 sol obtuvo 78%, 83% y 81% en los mismos tres días.

El motor ejecuta el modelo de calificación con el razonamiento desactivado y a una temperatura fija, que es lo que hace que el número sea repetible. Una sola respuesta de un chatbot lleva unos cuantos puntos de suerte en cualquier dirección; una puntuación que es estable entre días es una puntuación con la que puedes planificar.

Dos tareas, dos tipos de error

El writing de CELPIP tiene dos tareas, y fallan de maneras distintas. La tarea de email te da una situación y tres o cuatro puntos que debes cubrir. La tarea de encuesta te da dos opciones y te pide elegir una y defenderla. Un calificador que las trate igual se equivocará en ambas.

En la tarea de email el motor acertó en el 89% de los ensayos. Los errores que más les cuestan a los candidatos aquí no son de gramática; son un punto omitido, un tono que no corresponde al lector, o un saludo y una despedida que no están. La capa de reglas revisa cada uno de ellos antes de que el calificador dé una opinión, y un punto omitido mantiene el cumplimiento de la tarea en 8 o menos por muy pulido que esté el inglés. Un chatbot al que se le pide una puntuación en lenguaje simple no sabe qué puntos eran requeridos a menos que los pegues, e incluso entonces rara vez los revisa uno por uno.

En la tarea de encuesta el motor acertó en el 83% de los ensayos. La tarea de encuesta premia una posición clara y dos razones desarrolladas, y castiga una respuesta que no se define. El motor lee la postura primero: una respuesta que nunca se compromete no puede obtener más que la mitad en cumplimiento de la tarea. Los chatbots tienden a premiar una respuesta equilibrada, lo cual en una respuesta de encuesta es un error.

La gracia de un calificador que conoce la tarea es que la puntuación refleja aquello a lo que un calificador reaccionaría en esa tarea, no una impresión general del inglés. Un email de nivel medio suele ser un email de nivel medio por un tercer punto escaso; una respuesta de encuesta de nivel medio suele serlo porque una razón se afirma y no se desarrolla. El motor te dice cuál, por su nombre.

Dónde el motor no es el mejor

El motor lidera en general y en la mitad. No es el líder en los dos extremos, y es más justo decirlo que esconderlo en un promedio.

En los ensayos débiles, cada uno de los tres modelos GPT obtuvo 83% frente al 75% del motor. Los errores del motor fueron todos un escalón alto, en ensayos cortos y prolijos que no desarrollaban nada. Un modelo GPT, que lee la escritura genérica como débil, acierta estos. Si estás en el nivel débil y solo quieres que te lo confirmen, GPT 5.6 sol lo hará un poco más a menudo. También, tres veces de doce, le dirá a alguien de nivel medio que es un 6.

En los ensayos fuertes, Claude Opus 5 obtuvo 92% frente al 83% del motor. Claude lee la escritura pulida con generosidad, lo cual en un ensayo fuerte es correcto. La misma generosidad le dio un 9 o 10 a siete de doce ensayos de nivel medio. Si ya escribes en el nivel fuerte, Claude Opus 5 te lo confirmará un poco más a menudo que el motor. Si no, es el modelo con más probabilidades de decirte que sí.

El motor es el único calificador de la prueba que está a menos de diez puntos del líder en todos los niveles, y el único con 100% en la mitad. Ese es el perfil que necesita un candidato: un calificador que no es brillante en un nivel y equivocado en otro, sino correcto casi en todas partes y correcto donde está la mayoría de los candidatos.

Cómo califica el motor una respuesta

Esto es lo que ocurre en el minuto aproximado que pasa entre presionar enviar y leer una puntuación.

  1. La capa de reglas lee el ensayo primero. Antes de que cualquier modelo lo vea, el motor cuenta las palabras, revisa que el email tenga un saludo y una despedida, revisa que la respuesta de encuesta tenga una elección clara, y contrasta el ensayo con los puntos requeridos en el enunciado. Estas revisiones se convierten en límites fijos que el calificador no puede anular: una respuesta de encuesta que nunca toma partido, o un email que se lee como una respuesta de encuesta, no puede obtener más que la mitad de la escala en cumplimiento de la tarea.
  2. El ensayo se compara con ejemplos reales ya calificados. El calificador ve tres respuestas reales de CELPIP al mismo tipo de tarea, una en el nivel débil, una en el medio, una en la parte alta, todas con sus deslices reales, y ubica el ensayo en relación con ellas en cada una de las cuatro dimensiones: contenido y coherencia, vocabulario, legibilidad, cumplimiento de la tarea. Comparable al ejemplo medio es un 7 u 8; comparable al ejemplo alto es un 10 u 11; claramente más fuerte que el ejemplo alto es un 12.
  3. Cada juicio necesita evidencia. Para cada dimensión, el calificador debe citar las frases del ensayo que sustentan la puntuación antes de darla. Las citas que no se encuentran en el ensayo se descartan.
  4. Los puntos omitidos limitan la puntuación. Si el calificador reporta que falta un punto requerido, la puntuación de cumplimiento de la tarea se mantiene en 8 o menos, para que el número y la retroalimentación coincidan.
  5. Las cuatro dimensiones se convierten en una puntuación. La puntuación general es el promedio de las cuatro, después de aplicar los límites de la capa de reglas.
  6. La retroalimentación se construye con la misma evidencia. Correcciones, una respuesta modelo con la extensión adecuada, los puntos omitidos por su nombre y un factor limitante por dimensión, todo citado del propio texto de quien escribe. La sección de abajo enumera lo que cambió.

También probamos llevar el motor al diseño de dos calificadores con votación y reconciliación que usa nuestro calificador de speaking. No ayudó en writing: los niveles oficiales de writing están más juntos en la escala de 0 a 12 que los de speaking, y obligar a un calificador a elegir entre ejemplos sin una opción intermedia empujó los ensayos de nivel medio a un 9. El motor de writing conserva el diseño que califica la mitad correctamente.

Qué hay de nuevo en tu retroalimentación de writing

El puntaje es solo la mitad de lo que recibes. La capa de retroalimentación de writing se reconstruyó junto con el calificador, y todo lo que contiene está anclado a tu propio texto. Esto es lo que cambió.

  • Correcciones que puedes encontrar en tu propio ensayo. Cada corrección de gramática, ortografía y vocabulario cita las palabras exactas de tu respuesta, para que la app pueda resaltarlas donde las escribiste. Todo lo que el verificador no encuentre palabra por palabra en tu ensayo se descarta antes de que lo veas.
  • Una respuesta modelo, construida a partir de tu respuesta. Recibes una versión reescrita de tu propia respuesta que conserva tus ideas, cubre todos los puntos requeridos y queda dentro de las 150 a 200 palabras que pide la tarea. Si la primera reescritura no alcanza esa extensión, se rehace una vez antes de mostrarse.
  • El punto requerido que omitiste, con nombre. En la tarea de correo electrónico, la retroalimentación enumera los puntos del enunciado que tu respuesta no cubrió. Un punto omitido también mantiene el puntaje de cumplimiento de la tarea en 8 o menos, así que el número y la retroalimentación nunca se contradicen.
  • Un factor limitante por dimensión. Para cada una de las cuatro dimensiones, la retroalimentación nombra la única cosa que frena ese puntaje, en términos concretos, o dice claramente que nada lo frena y qué lo sostiene. Decidir que una dimensión no tiene problemas es una respuesta real, no un vacío.
  • La crítica en el lugar correcto. Un tono débil es un problema de cumplimiento de la tarea, una palabra vaga es un problema de vocabulario, una oración interminable es un problema de legibilidad. Cada punto se archiva bajo la dimensión que le corresponde en lugar de amontonarse en el resumen general.
  • Reescrituras a nivel de oración. Oraciones específicas de tu ensayo vuelven con una versión mejorada y una línea sobre por qué es mejor, para que veas el cambio en lugar de leer sobre él.
  • Tu dimensión más fuerte y la más débil, lado a lado. La retroalimentación te dice cuál de las cuatro dimensiones sostiene tu puntaje y cuál lo frena, para que sepas qué practicar a continuación sin descifrar cuatro números.

Cada cita en la retroalimentación se verifica contra tu ensayo antes de mostrarse. Si el verificador no encuentra las palabras, la línea se elimina. Por eso la retroalimentación nunca te pide corregir algo que no escribiste.

Qué hacer con la puntuación

Una puntuación en la que puedes confiar cambia tu forma de practicar. Con un chatbot, nunca estás seguro de si un paso de 8 a 9 eres tú o el modelo, así que cada puntuación tiene que contrastarse con una sensación. Con un calificador estable y preciso, la puntuación es la retroalimentación.

  • Escribe la misma tarea dos veces. Envía, lee los puntos omitidos y el factor limitante de cada dimensión, reescribe con la respuesta modelo al lado, y envía de nuevo. Un cambio de un punto o más entre las dos es un cambio en tu escritura, porque el motor le da al mismo ensayo la misma puntuación.
  • Sigue la dimensión más débil, no el total. La puntuación general es un promedio de cuatro. Dos candidatos con un 8 pueden tener problemas completamente distintos. La retroalimentación nombra la dimensión que te frena, y esa es la que hay que trabajar.
  • Trata un 9 como un casi. Los dos errores del motor en ensayos fuertes fueron un 9. Un 9 del motor significa que falta una razón desarrollada o una elección de palabra precisa para llegar al 10.
  • Alterna las tareas. La mayoría de los candidatos practica la tarea que les gusta. El motor califica los emails y las respuestas de encuesta contra ejemplos distintos y reglas distintas, así que una puntuación alta en email no dice nada sobre tu respuesta de encuesta.

Práctica ilimitada por CA$25 al mes

La precisión solo es útil si puedes darte el lujo de usarla todos los días. Una puntuación de writing en la que puedas confiar es más valiosa en tu trigésimo ensayo, no en el tercero, porque ahí es cuando empieza a decirte si un cambio en tu forma de escribir está funcionando. Por eso el motor tiene un precio pensado para usarse sin contar.

Todos los planes de Prepamigo incluyen calificación ilimitada, intentos ilimitados, y el banco de preguntas completo: 80 sets de práctica completos y más de 2,000 tareas de práctica en Writing, Speaking, Reading y Listening, escritas para seguir los tipos de tarea, los tiempos y el formato del examen CELPIP General. Escribes, envías, y aproximadamente un minuto después tienes la puntuación, las correcciones y una respuesta modelo.

Prepamigo

CA$25/ mes

CA$24.98 mes a mes · CA$8.25 al mes en el plan anual (CA$98.98 al año) · impuestos incluidos · cancela en cualquier momento

  • Calificación ilimitada de writing y speaking, sin límite diario, por sesión ni semanal.
  • 80 sets de práctica y más de 2,000 tareas en las cuatro secciones, modeladas según el formato real del examen, para que nunca tengas que escribir tus propias indicaciones.
  • Escribe y envía. La calificación, las correcciones, la revisión de puntos omitidos y la respuesta modelo se manejan por ti.
  • Retroalimentación con tus propias palabras, con cada cita verificada contra lo que realmente escribiste.

Claude Max, para comparar

US$100/ mes

unos CA$138 antes de impuestos · el nivel 20x cuesta US$200 al mes · Pro cuesta US$20 con límites mucho más estrictos

  • Incluso Max tiene límites. Una ventana de uso móvil de cinco horas y un límite semanal; cuando alcanzas cualquiera de los dos, esperas.
  • Sin banco de preguntas. Traes tus propias tareas, decides por ti mismo si se parecen al examen real, y llevas el control de lo que ya has practicado.
  • Sin revisión de puntos requeridos, sin respuesta modelo. Obtienes un número y un párrafo.
  • Una solicitud simple, no un calificador calibrado. Al preguntársele en lenguaje simple, Claude Opus 5 coincidió con las puntuaciones verificadas el 61% de las veces y Claude Sonnet 5 el 56%, frente al 86% del motor.

Los precios y términos de uso de los planes de Claude son los publicados en claude.com en septiembre de 2026 y pueden cambiar. CELPIP es una marca registrada de su propietario; Prepamigo es una plataforma de práctica independiente y no está afiliada, respaldada ni conectada con el creador del examen. Las tareas de práctica de Prepamigo son material original escrito para seguir el formato público del examen.

Disponibilidad

Prepamigo Writing Scoring Engine está disponible ahora para todos los usuarios de Prepamigo en las dos tareas de writing. No hay nada que activar. Cada email y cada respuesta de encuesta es calificado por él, y cada puntuación viene con retroalimentación extraída del propio texto de quien escribe.

Para las comparaciones directas, lee Prepamigo vs Claude para writing y Prepamigo vs ChatGPT para writing. Para el lado de speaking, lee Scoring Engine 2.0 para Speaking. O Escribir una respuesta y observa cómo funciona el motor. Leer esta guía en inglés.

Presentamos Prepamigo Writing Scoring Engine | PrepAmigo