Porcentaje de ensayos calificados al nivel verificado
36 respuestas oficiales de CELPIP writing, 12 en cada uno de tres niveles, en ambas tareas de writing. A Claude se le dio la tarea y el ensayo y se le pidió, en lenguaje simple, que lo calificara en la escala de CELPIP. El calificador de writing de Prepamigo se ejecutó tal como lo hace en producción.
86%
Calificador de writing de Prepamigo
61%
Claude Opus 5
56%
Claude Sonnet 5
Prepamigo frente a los planes de chatbot más populares
Dólares canadienses. Los precios de Prepamigo incluyen impuestos. Claude Max (desde US$100) y ChatGPT Pro (US$200) están convertidos a 1.38, antes de impuestos. La precisión es el porcentaje de 36 ensayos oficiales calificados al nivel verificado cuando se le pide al modelo indicado, en lenguaje simple, que califique el ensayo; una sola corrida.
Writing es la habilidad donde un chatbot resulta más convincente como calificador. No hay grabación que transcribir, ni acento del que preocuparse; solo entra texto y sale un número, con un párrafo de explicación segura. Así que pusimos a prueba el número. Le dimos a Claude las mismas 36 respuestas oficiales de CELPIP writing con las que se mide nuestro propio calificador, doce en cada nivel, y le pedimos que las calificara tal como se lo pediría un estudiante.
La respuesta corta: el calificador de writing de Prepamigo acertó el nivel verificado el 86% de las veces. Claude Opus 5 lo acertó el 61% de las veces y Claude Sonnet 5 el 56% de las veces. La brecha no está repartida de forma pareja. En los ensayos débiles y en los fuertes Claude es respetable, y en la parte alta Opus 5 es de hecho mejor que nosotros. En los ensayos de nivel medio, los 7 y 8 que realmente escribe la mayoría de los candidatos, Opus 5 acertó una vez de cada cuatro y Sonnet 5 una de cada tres. Prepamigo acertó los doce.
El resto de este artículo recorre esos resultados nivel por nivel, explica por qué un modelo de propósito general pierde la mitad de la escala, examina lo que vale la retroalimentación de cada lado, y compara lo que cuesta practicar writing en serio con cada uno. Hemos intentado ser justos con Claude en todo momento, incluido el único lugar donde nos ganó.
La prueba simple: lo que realmente obtiene un estudiante
Ochenta y seis por ciento frente a sesenta y uno y cincuenta y seis. En 36 ensayos, eso son nueve puntuaciones correctas más que Opus 5 y once más que Sonnet 5. Dicho de otra forma, Prepamigo comete un 64% menos de errores de calificación que Opus 5 y un 69% menos que Sonnet 5 en los mismos ensayos.
Lo que se le dio a Claude importa, así que aquí está. A cada modelo se le dijo que era un examinador experimentado de CELPIP writing, se le dio la tarea exactamente como la vio el candidato, incluidos los puntos requeridos de la tarea de correo electrónico y las opciones de la tarea de encuesta, y se le dio el ensayo. Se le pidió una sola puntuación de 0 a 12. Esa es toda la instrucción. Es lo que escribirías en una ventana de chat, y es una prueba más justa que un simple “califica esto” porque el modelo al menos sabe qué pedía la tarea.
El calificador de Prepamigo recibió la misma tarea y el mismo ensayo. También tenía lo que siempre tiene en producción: ensayos de muestra reales calificados para esa tarea en cada nivel con los que comparar, y una capa de reglas que revisa lo que un evaluador revisa primero, como si están todos los puntos requeridos, si una respuesta de encuesta realmente toma partido, si un correo tiene saludo y despedida, y qué tan larga es la respuesta.
Dónde se abre la brecha: nivel por nivel
Una cifra global esconde dónde caen los errores, y en writing los errores caen en un solo lugar. Aquí están los mismos resultados divididos por nivel verificado: ensayos débiles con puntuación de 4 o 5, ensayos medios con puntuación de 7 u 8, y ensayos fuertes con puntuación de 10 o más.
Ensayos débiles (puntuación verificada de 4 o 5)
12 ensayos oficiales. Los errores de Claude aquí son en su mayoría un 3, un nivel por debajo.
75%
Calificador de writing de Prepamigo
67%
Claude Opus 5
50%
Claude Sonnet 5
En los ensayos débiles, Prepamigo está en 75%, Opus 5 en 67%, Sonnet 5 en 50%. Los tres errores de Prepamigo fueron todos un escalón demasiado alto, a un 6 o 7, en ensayos que eran cortos pero ordenados. Los errores de Claude van en la otra dirección: Sonnet 5 calificó con un 3 a cuatro de los doce ensayos débiles, y Opus 5 calificó con un 3 a dos de ellos. Un 3 en esta escala es una respuesta que apenas aborda la tarea. Estos ensayos sí la abordan; solo son escasos. Claude, sin ningún ejemplo de cómo se ve un 4, lee lo escaso como reprobado.
Ensayos medios (puntuación verificada de 7 u 8)
12 ensayos oficiales. Este es el nivel en el que está la mayoría de los candidatos, y el nivel donde Claude falla.
100%
Calificador de writing de Prepamigo
33%
Claude Sonnet 5
25%
Claude Opus 5
El nivel medio es toda la historia. Prepamigo calificó los doce ensayos de nivel medio dentro de la banda de 7 a 8. Opus 5 acertó tres de ellos; Sonnet 5 acertó cuatro. Los errores de Opus 5 fueron casi todos hacia arriba: le dio un 9 a seis de los doce y un 10 a uno. Sonnet 5 se repartió en ambas direcciones, con cuatro ensayos empujados hacia abajo a un 6 y cuatro empujados hacia arriba a un 9 o 10.
Piensa en lo que eso significa para el candidato que escribió uno de esos ensayos. Un 7 u 8 es la puntuación real más común en el examen, y es la puntuación que decide si has alcanzado tu objetivo de inmigración o no. Pregúntale a Opus 5, y más de la mitad de las veces te dirá que eres un 9 o un 10, listo para dejar de practicar. No lo estás. Pregúntale a Sonnet 5, y una vez de cada tres te dirá que has bajado a un 6. No has bajado. Ninguna de las dos respuestas te ayuda a decidir qué hacer a continuación.
Ensayos fuertes (puntuación verificada de 10 o más)
12 ensayos oficiales. El único nivel donde Claude Opus 5 supera a Prepamigo.
92%
Claude Opus 5
83%
Calificador de writing de Prepamigo
83%
Claude Sonnet 5
En la parte alta, Opus 5 es el mejor calificador de esta prueba: reconoció once de los doce ensayos fuertes. Prepamigo y Sonnet 5 reconocieron diez cada uno. Los dos errores de Prepamigo fueron ambos un 9, un escalón por debajo; los de Sonnet 5 fueron un 9 y un 7. Lo reportamos porque es cierto, y porque explica el patrón general: Claude es generoso. Reparte 9s, 10s y 11s con facilidad, lo que resulta acertado en los ensayos fuertes y equivocado en todo lo demás.
Por qué un chatbot pierde la mitad de la escala
Un ensayo de CELPIP de nivel medio es algo muy concreto. Cubre la tarea, está organizado, tiene pocos errores que bloqueen la comprensión, y también es genérico: las razones se afirman en lugar de desarrollarse, el vocabulario es seguro, las oraciones tienen todas la misma forma. Un evaluador que ha visto cientos de estos sabe exactamente dónde se ubica. Un modelo de propósito general no ha visto cientos de estos etiquetados como 7. Ha visto un texto limpio, organizado y mayormente correcto, y se inclina por un número alto.
Esa es toda la diferencia. El calificador de Prepamigo no juzga un ensayo contra una idea de lo que es escribir bien. Lo juzga contra ensayos reales calificados para la misma tarea: uno en el nivel débil, uno en el medio, uno en la parte alta, todos respuestas reales con deslices reales. Un ensayo limpio pero genérico queda junto a la muestra media porque es a lo que más se parece. Un ensayo escaso queda junto a la muestra débil en lugar de por debajo, porque la muestra débil también es escasa y sigue siendo un 4.
Sobre la comparación hay una capa de reglas que se encarga de lo que un modelo cuenta mal. ¿El correo cubrió los tres puntos requeridos, o solo dos? ¿La respuesta de encuesta realmente eligió una opción, o dudó entre ellas? ¿Hay un saludo y una despedida? ¿La respuesta tiene 180 palabras o 60? Un punto requerido omitido mantiene la puntuación de cumplimiento de la tarea en 8 o menos sin importar qué tan bueno sea el inglés, porque así funciona el examen. Claude, al preguntársele de forma simple, no tiene ese piso ni ese techo; decide todo por impresión.
Probamos si explicarle los niveles a Claude arreglaría esto. Por sí solo, no. Darle una rúbrica a un modelo produce la misma desviación. Lo que mueve el número es darle las muestras reales calificadas y una capa de reglas, que es otra forma de decir: construir un calificador.
La brecha de flujo de trabajo: lo que tienes que aportar
Writing es la habilidad donde Claude es más fácil de usar como calificador, y vale la pena ser honesto al respecto. Pegas el ensayo, obtienes una puntuación en segundos, y si quieres que se explique lo hará, con detalle. No hay paso de transcripción, ni audio, ni configuración. Para una segunda opinión rápida es genuinamente cómodo.
Lo que no obtienes es la tarea. Claude no tiene un banco de enunciados de correo y encuesta al estilo CELPIP con los puntos requeridos, las opciones y el conteo de palabras correctos, así que o escribes tu propio enunciado y esperas que se parezca al examen, o practicas con lo que encuentres. No obtienes una revisión de puntos requeridos, porque Claude no sabe qué puntos listaría el examen real. No obtienes una respuesta modelo reescrita a partir de tu propio ensayo con la extensión correcta. Y no obtienes un número calibrado contra ensayos reales calificados, que es por lo que la mitad de la escala sale mal.
En Prepamigo, abres una tarea del banco, el temporizador corre, escribes, y aproximadamente un minuto después de enviar tienes cuatro puntuaciones por dimensión, una puntuación general, una lista de todo lo que omitiste, correcciones citadas de tu propio texto y una respuesta modelo reescrita. El cuadragésimo ensayo del mes te cuesta el mismo esfuerzo que el primero.
El mismo ensayo, la misma puntuación
Una puntuación que no puedes reproducir no es una medición. Si el mismo ensayo obtiene un 8 hoy y un 10 mañana, no has aprendido nada sobre tu writing. Así que después de la corrida principal calificamos los 36 ensayos dos veces más en días distintos. El calificador de writing de Prepamigo obtuvo 86%, 89% y 86% en las tres corridas, con los mismos doce ensayos de nivel medio dentro de la banda cada vez.
Las corridas de Claude también se movieron, pero la forma de sus errores no: en cada corrida, la mayoría de los ensayos de nivel medio volvieron como un 9 de Opus 5, y los ensayos débiles siguieron acumulando 3s de Sonnet 5. Esa consistencia es el hallazgo útil. El problema no es que Claude sea ruidoso. Es que Claude está confiadamente mal calibrado en la misma dirección cada vez, lo cual es más difícil de notar.
Retroalimentación: una buena explicación del número equivocado
Claude escribe una prosa de retroalimentación excelente. Es clara, paciente y específica, y si le pides que explique por qué un ensayo es un 9 producirá un párrafo convincente. El problema es que el párrafo se escribe para justificar un número que ya eligió, y cuando el número está equivocado la explicación lo está también. Un ensayo que en realidad es un 7 recibe elogios por cualidades que no tiene, y el candidato se va tranquilizado.
La retroalimentación de Prepamigo funciona desde el otro extremo. Cada corrección cita las palabras exactas de tu ensayo, y todo lo que el verificador no encuentre en tu texto se descarta antes de que lo veas. Un punto requerido omitido se nombra. Cada dimensión recibe un factor limitante, o una declaración clara de que nada la frena. Y recibes una respuesta modelo reescrita a partir de tu propia respuesta con la extensión que pide la tarea, para que veas la brecha en lugar de leer sobre ella. La sección siguiente enumera lo que cambió en la capa de retroalimentación.
Qué hay de nuevo en tu retroalimentación de writing
El puntaje es solo la mitad de lo que recibes. La capa de retroalimentación de writing se reconstruyó junto con el calificador, y todo lo que contiene está anclado a tu propio texto. Esto es lo que cambió.
- Correcciones que puedes encontrar en tu propio ensayo. Cada corrección de gramática, ortografía y vocabulario cita las palabras exactas de tu respuesta, para que la app pueda resaltarlas donde las escribiste. Todo lo que el verificador no encuentre palabra por palabra en tu ensayo se descarta antes de que lo veas.
- Una respuesta modelo, construida a partir de tu respuesta. Recibes una versión reescrita de tu propia respuesta que conserva tus ideas, cubre todos los puntos requeridos y queda dentro de las 150 a 200 palabras que pide la tarea. Si la primera reescritura no alcanza esa extensión, se rehace una vez antes de mostrarse.
- El punto requerido que omitiste, con nombre. En la tarea de correo electrónico, la retroalimentación enumera los puntos del enunciado que tu respuesta no cubrió. Un punto omitido también mantiene el puntaje de cumplimiento de la tarea en 8 o menos, así que el número y la retroalimentación nunca se contradicen.
- Un factor limitante por dimensión. Para cada una de las cuatro dimensiones, la retroalimentación nombra la única cosa que frena ese puntaje, en términos concretos, o dice claramente que nada lo frena y qué lo sostiene. Decidir que una dimensión no tiene problemas es una respuesta real, no un vacío.
- La crítica en el lugar correcto. Un tono débil es un problema de cumplimiento de la tarea, una palabra vaga es un problema de vocabulario, una oración interminable es un problema de legibilidad. Cada punto se archiva bajo la dimensión que le corresponde en lugar de amontonarse en el resumen general.
- Reescrituras a nivel de oración. Oraciones específicas de tu ensayo vuelven con una versión mejorada y una línea sobre por qué es mejor, para que veas el cambio en lugar de leer sobre él.
- Tu dimensión más fuerte y la más débil, lado a lado. La retroalimentación te dice cuál de las cuatro dimensiones sostiene tu puntaje y cuál lo frena, para que sepas qué practicar a continuación sin descifrar cuatro números.
Cada cita en la retroalimentación se verifica contra tu ensayo antes de mostrarse. Si el verificador no encuentra las palabras, la línea se elimina. Por eso la retroalimentación nunca te pide corregir algo que no escribiste.
Cuánto cuesta practicar todos los días
Una puntuación de writing es más útil en tu trigésimo ensayo, no en el tercero. Ahí es cuando empieza a decirte si un cambio en tu forma de escribir está funcionando. Así que la pregunta práctica es cuánto cuesta usar cada opción en volumen.
Claude Pro cuesta US$20 al mes, unos CA$28, o US$17 al mes con facturación anual, según lo publicado en claude.com en septiembre de 2026, con una ventana de uso móvil de cinco horas y un límite semanal. Los planes Max, desde US$100 al mes, unos CA$138 antes de impuestos, elevan esos límites pero no los eliminan. Ninguno de los planes incluye un banco de tareas, un temporizador, una revisión de puntos requeridos, una respuesta modelo, ni una puntuación calibrada contra ensayos reales calificados.
Prepamigo cuesta CA$24.98 al mes, o CA$8.25 al mes en el plan anual, que es CA$98.98 al año, con impuestos incluidos, y puedes cancelar en cualquier momento. Todos los planes incluyen calificación ilimitada sin límite diario, por sesión ni semanal, intentos ilimitados, y el banco de preguntas completo: 80 sets de práctica completos y más de 2,000 tareas de práctica en Writing, Speaking, Reading y Listening, escritas para seguir los tipos de tarea, los tiempos y el formato del examen CELPIP General.
Cuándo Claude es la mejor herramienta
- Pulir un ensayo fuerte. Si ya estás en un 10 y quieres saber qué necesitaría un 11 o un 12, Opus 5 reconoce la escritura fuerte con fiabilidad y la explica bien. Ese es el único nivel donde nos ganó.
- Reescribir una oración de cinco formas. Pedir alternativas para una oración torpe es rápido y las sugerencias son buenas.
- Conversarlo. Si quieres discutir por qué una razón es débil, una conversación es la forma adecuada. Prepamigo te da un veredicto y evidencia; no conversa.
- Cualquier cosa fuera del examen. Claude es un asistente general y Prepamigo no lo es.
Lo que Claude no debería ser, según esta evidencia, es lo que le dice a quien escribe a nivel 7 u 8 dónde está. Esa es la mayoría de los candidatos, y es exactamente donde Claude se equivoca tres veces de cada cuatro.
Preguntas frecuentes
¿Puede Claude calificar mi CELPIP writing? Te dará un número. En 36 respuestas oficiales con puntuaciones verificadas, Claude Opus 5 acertó el 61% de las veces y Claude Sonnet 5 el 56%, frente al 86% de Prepamigo. En los ensayos de nivel medio: 25% y 33% frente a 100%.
¿Es Prepamigo más preciso que Claude para writing? En general, sí, por 25 a 30 puntos. En los ensayos fuertes Opus 5 es mejor, 92% frente a 83%. En los ensayos de nivel medio, donde está la mayoría de los candidatos, la brecha es de 100% frente a 25%.
¿Por qué Claude le da un 9 a mi ensayo promedio? Sin nada con qué comparar, un ensayo limpio, organizado y genérico se lee como fuerte. Opus 5 le dio un 9 o un 10 a siete de doce ensayos verificados de 7 a 8. Prepamigo compara cada ensayo con muestras reales calificadas de la misma tarea.
¿Cuánto cuesta cada uno? Claude Max comienza en US$100 al mes, unos CA$138 antes de impuestos; Pro cuesta US$20 con límites más estrictos. Prepamigo cuesta CA$24.98 al mes con impuestos incluidos, o CA$8.25 al mes en el plan anual, con calificación ilimitada y 80 sets de práctica.
Para la misma comparación frente a ChatGPT, lee Prepamigo vs ChatGPT para writing. Para ver cómo funciona el calificador de writing, lee por dentro del calificador de writing de Prepamigo. O Escribir una respuesta y mira la puntuación. Leer esta guía en inglés.
