Engine 2.0 en 48 respuestas reservadas
Porcentaje de respuestas calificadas dentro de la banda verificada. Tres corridas separadas en días diferentes produjeron cada una 81.3% en general.
81%
Banda exacta
Prepamigo frente a los planes de chatbot más populares
Dólares canadienses. Los precios de Prepamigo incluyen impuestos. Claude Max (desde US$100) y ChatGPT Pro (US$200) están convertidos a 1.38, antes de impuestos. La precisión es el porcentaje de respuestas del conjunto de prueba calificadas al nivel verificado cuando se le pide al modelo indicado, en lenguaje simple, que califique la respuesta; promedio de tres corridas.
Es la pregunta correcta para hacerle a cualquier herramienta de práctica, y la mayoría de las herramientas no la responden. Una puntuación de speaking solo vale algo si te dice lo que diría un calificador real, y la única forma de saber si lo hace es medir. Así que este artículo es la medición, presentada con claridad, con las partes que nos favorecen y las que no.
La respuesta en un párrafo: en 48 respuestas de speaking que el Scoring Engine 2.0 de Prepamigo nunca había visto, cada una con una puntuación verificada de forma independiente, el motor acertó el nivel verificado el 81% de las veces y a un punto de diferencia el 92% de las veces. Produjo el mismo 81% en cada una de tres corridas separadas. Es más preciso en las respuestas débiles y de nivel medio, con 88% y 85%, y menos preciso en las respuestas de nivel alto, con 71%, donde su error característico es darle un 8 a un 10. Al pedírsele en lenguaje simple que calificara las mismas transcripciones, el mejor modelo de IA de propósito general que probamos alcanzó 62%, y el más débil alcanzó 31%; con nuestro procedimiento completo de calificación, el mejor alcanzó 77%.
Lo que sigue es cómo obtuvimos esos números, qué significan en cada nivel de puntuación, qué tan estables son, dónde caen los errores, cómo se compara la puntuación con las alternativas que podrías estar usando en su lugar, y cómo leer tu propia puntuación a la luz de todo esto. Si solo quieres el consejo práctico, salta a la sección sobre cómo leer tu puntuación. Si quieres decidir si confiar en el número, lee todo el artículo.
Qué significa “preciso” aquí
Antes de cualquier número, la definición. No estamos afirmando que una puntuación de Prepamigo prediga el resultado de tu examen. Ninguna herramienta de práctica puede prometer eso, y quien lo haga está adivinando. Lo que medimos es más limitado y más honesto: dada una respuesta oral cuya puntuación ha sido verificada de forma independiente, ¿con qué frecuencia el motor produce una puntuación en el mismo nivel?
CELPIP speaking se reporta en una escala que llega hasta 12, y las puntuaciones verificadas en nuestros datos de referencia vienen en tres bandas: baja, que significa 4 o 5; media, que significa 7 u 8; y alta, que significa 10 o más. Contamos el motor como correcto cuando su puntuación cae dentro de la banda verificada. Una respuesta verificada en la banda alta se califica correctamente si el motor le da un 9, 10 u 11. Bajo una lectura más estricta que solo acepta 10 en adelante, cada cifra en esta página cae unos pocos puntos y cada comparación se mantiene en el mismo orden.
Las cifras principales
¿Qué significa 81% en la práctica? Si grabas diez respuestas a un nivel constante, el motor colocará unas ocho de ellas en la banda correcta y una más a un punto de ella. No pondrá un 5 en la banda del 10 ni un 10 en la banda del 5; eso no ocurrió ni una sola vez en 144 respuestas calificadas a lo largo de las tres corridas. Los errores que comete son los errores de un calificador cuidadoso en una respuesta límite, y la siguiente sección muestra dónde se concentran.
Precisión en cada nivel de puntuación
Precisión por banda verificada
16 respuestas reservadas por banda. Cada barra es el porcentaje de las respuestas de esa banda calificadas dentro de la banda.
88%
Baja (4–5)
85%
Media (7–8)
71%
Alta (10+)
Respuestas de nivel bajo: 88%. Las respuestas débiles son las más fáciles de reconocer. Suelen ser cortas, reutilizar las palabras del enunciado, y dejar partes de la tarea sin completar. El motor detecta esas señales la mayoría de las veces. Cuando falla, falla hacia arriba: en todos los casos, la respuesta se calificó con un 8 en lugar de un 4 o 5. La causa es casi siempre una respuesta que suena fluida y segura pero dice poco; la entrega le otorga un nivel que no se ha ganado en contenido. Sabemos esto porque podemos ver qué dimensiones calificaron alto los calificadores, y siempre es la fluidez auditiva.
Respuestas de nivel medio: 85%. Estas son las más difíciles de calificar en cierto sentido, porque contienen una mezcla real de fortalezas y debilidades que hay que sopesar en lugar de simplemente detectar. Los errores del motor aquí van en ambas direcciones. Algunas respuestas con vacilación visible pero ideas sólidas se arrastraron hacia abajo a un 5 o 6; algunas respuestas que sonaban pulidas se empujaron hacia arriba a un 10. El paso de reconciliación entre los dos calificadores captura la mayoría de estos casos, que es por lo que esta cifra es tan alta como es.
Respuestas de nivel alto: 71%. Esta es la banda más débil y de la que hablamos más, porque el error es muy consistente. Cuando el motor falla en una respuesta de nivel alto, le da un 8. No un 7, no un 6; un 8, en todos los casos salvo un puñado de 9s que cuentan como correctos. El motor ve una respuesta fuerte y se contiene un nivel.
Esto merece contexto. El desplazamiento hacia el 8 en respuestas fuertes no es una peculiaridad de Prepamigo; es el fallo característico de todo calificador automatizado que hemos probado, calibrado por humanos o no. Nuestro motor anterior lo tenía mucho peor. Al pedírsele de forma simple que calificara las mismas respuestas, el mejor modelo de propósito general reconoció el 56% de las respuestas de nivel alto; el modelo detrás de los planes de pago de ChatGPT reconoció el 25%; e incluso con nuestro procedimiento completo, ninguno superó el 63%. Setenta y uno por ciento es la mejor cifra que hemos logrado, y sigue siendo el número que más queremos mejorar.
El problema del 8, desde tu lado de la pantalla
La vista por nivel te dice cómo se desempeña el motor en una respuesta de nivel conocido. Tú lo estás viendo al revés: tienes una puntuación y quieres saber cuánto creerle. Así que aquí están los mismos datos vistos al revés. Para cada puntuación que da el motor, ¿con qué frecuencia la respuesta estaba realmente en ese nivel?
- Si el motor dice 4 o 5: la respuesta estaba en el nivel bajo el 93% de las veces. El resto eran respuestas de nivel medio con mucha vacilación. Una puntuación baja de Engine 2.0 casi siempre es correcta.
- Si el motor dice 10: la respuesta estaba en el nivel alto el 92% de las veces. Un 10 de Engine 2.0 es un 10.
- Si el motor dice 8: la respuesta estaba en el nivel medio el 67% de las veces, en el nivel alto el 23% de las veces, y en el nivel bajo el 10% de las veces. Un 8 es la única puntuación que vale la pena leer con cuidado.
Dicho claramente: un 8 de Engine 2.0 significa “probablemente medio, pero posiblemente mejor”. Aproximadamente una de cada cuatro respuestas que recibe un 8 era en realidad un 10. Si obtienes un 8 en una respuesta que creías excelente, no concluyas que no estás listo. Grábala de nuevo. Un 10 consistente en tres intentos es un 10; un 8 consistente en tres intentos es un 8; una mezcla es una respuesta en el límite, y la retroalimentación te dirá qué dimensión la mantiene ahí.
¿La misma grabación obtiene la misma puntuación?
La precisión sin consistencia es suerte. Si la misma grabación pudiera obtener un 8 hoy y un 10 mañana, la cifra del 81% sería un promedio sobre ruido y no podrías usar la puntuación para seguir nada. Así que probamos la repetibilidad directamente.
Las 48 respuestas reservadas se calificaron tres veces separadas, en días diferentes, sin cambiar nada entre ellas. La cifra general fue 81.3% en cada corrida. A nivel de respuestas individuales, el 87.5% recibió una puntuación idéntica las tres veces, y solo el 4.2% cambió alguna vez en dos puntos o más. Esas pocas son respuestas que están justo en el límite entre dos bandas, donde una pequeña diferencia de criterio legítimamente inclina la puntuación en un sentido u otro.
La consistencia proviene de una decisión de diseño específica. Cada uno de los dos calificadores del motor vota tres veces en cada respuesta, y se conserva el voto medio. Cuando probamos la misma configuración con un solo voto en lugar de tres, las puntuaciones idénticas entre corridas cayeron de 87.5% a 77%, y el porcentaje de respuestas que saltaban dos puntos o más se más que duplicó. La votación no cambió la cifra de precisión. Cambió si la cifra de precisión significaba algo.
Para ti, la consistencia significa que un cambio en tu puntuación es un cambio en tu speaking. Si grabas el mismo tipo de tarea tres veces en una semana y la puntuación pasa de 8 a 10, eso no es que el calificador haya tenido un buen día. Eres tú.
Cómo se compara esto con lo que podrías usar en su lugar
Un número de precisión significa más si se tiene algo con qué compararlo. Así que pasamos las mismas 48 respuestas reservadas por los modelos de IA de propósito general que la gente realmente usa para calificar su práctica, tal como lo haría una persona: le dimos a cada modelo la transcripción textual y la tarea, le dijimos que era un examinador experimentado de CELPIP, y le pedimos una puntuación de 0 a 12. Tres corridas cada uno, promediadas.
Porcentaje de respuestas calificadas dentro de la banda verificada
Las mismas 48 respuestas reservadas. A cada modelo se le pidió, en lenguaje simple, que calificara la transcripción; promedio de tres corridas. Engine 2.0 se ejecutó en su configuración normal de producción.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Engine 2.0 lidera a todos los modelos por entre diecinueve y cincuenta y un puntos. Al preguntárseles de forma simple, todos los modelos de propósito general califican con dureza: el error en una respuesta débil suele ser un 3, el error en una fuerte un 7 u 8. Claude Opus 5 y Gemini son los únicos dos por encima de la mitad. Los tres modelos GPT más grandes están entre 31% y 37%, y reconocen una respuesta de nivel alto entre 13% y 27% de las veces.
Luego le dimos a cada modelo nuestro procedimiento completo: los mismos ejemplos de calibración para la tarea exacta, la misma comparación forzada, y una breve nota de calibración ajustada a sus propias tendencias. Ese es el mejor resultado que cada modelo pudo lograr en nuestras manos, y no es algo que un estudiante pueda reproducir sin los ejemplos. Opus 5 subió a 77%, GPT 5.6 sol y Gemini a 71%, GPT 5.5 y Sonnet 5 a 69%, luna a 63% y GPT-4o mini a 50%. Todos ellos siguieron quedando por detrás de Engine 2.0, y ninguno reconoció más del 63% de las respuestas de nivel alto.
Qué hay de nuevo en tu retroalimentación
Engine 2.0 llega con una capa de retroalimentación reconstruida. Lee la evidencia de los dos calificadores, no solo el puntaje, y fue probada con tres tipos de estudiante: alguien que se enfrenta al CELPIP por primera vez, alguien con inglés débil que busca el truco, y alguien con media hora al día y un examen la próxima semana. Esto es lo que cambió.
- Tus propias palabras, citadas de vuelta. Cada punto de retroalimentación cita la frase exacta de tu transcripción a la que reaccionaron los calificadores. Si una frase aparece entre comillas, está copiada palabra por palabra; en nuestra auditoría, 157 de 158 citas lo estaban. La retroalimentación nunca inventa algo que no dijiste.
- Una sola cosa que corregir primero. Cada respuesta recibe una acción principal: el único cambio que más elevaría tu puntaje, escrito con las palabras más sencillas posibles. Le siguen dos acciones concretas más, y luego una lista de tres puntos para repasar mentalmente antes de empezar a hablar.
- Consejos según la tarea. Dar un consejo, describir una escena y persuadir a alguien se califican según criterios distintos. La retroalimentación ahora sabe qué premia cada uno de los ocho tipos de tarea y se dirige a eso, en lugar de repetir los mismos consejos genéricos en todas las tareas.
- Qué dimensión practicar primero. La retroalimentación te dice cuál de las cuatro dimensiones es tu punto más débil y cuál el más fuerte, para que sepas dónde está el próximo punto, sin esconderlo detrás de un número.
- Lo que pedía la tarea y no cubriste. En el cumplimiento de la tarea, la retroalimentación enumera las partes específicas del enunciado que no cubriste, o dice claramente que las cubriste todas.
- Cosas que sí puedes ensayar. Cada consejo práctico es algo que puedes decir en voz alta antes de tu próximo intento. Nada de sugerencias para hablar más claro o reducir tu acento: el acento no es lo que mide la inteligibilidad, y la retroalimentación nunca comenta sobre él.
- Sin culpar al reloj. Una respuesta interrumpida por el cronómetro después de haber cumplido la tarea no se penaliza por el corte, y la retroalimentación no te reprende por ello.
Cuando un modelo evaluador independiente comparó esta retroalimentación con la que producía nuestro sistema anterior para las mismas respuestas, sin saber cuál era cuál, prefirió la nueva retroalimentación en 20 de 24 comparaciones, tanto al evaluar como lo haría un examinador como al evaluar como lo haría un estudiante.
Cómo leer tu puntuación
- Un 4 o 5 casi con certeza es correcto. El motor identifica las respuestas débiles el 88% de las veces, y cuando dice 4 o 5 tiene razón el 93% de las veces. Lee la retroalimentación para ver qué dimensión es la más baja y trabaja en esa.
- Un 10 es un 10. Cuando el motor dice 10, la respuesta estaba en el nivel alto el 92% de las veces. Estás listo en ese tipo de tarea. Pasa a los que evitas.
- Un 8 es una pregunta. Dos de cada tres veces significa medio. Una de cada cuatro significa alto. Grábate en la misma tarea de nuevo y observa el patrón a lo largo de los intentos.
- Confía más en los cambios que en los niveles. Como la puntuación es estable, un cambio a lo largo de los intentos es un cambio en tu speaking. Repetir el mismo tipo de tarea es la forma más rápida de saber si un nuevo hábito está funcionando.
- Lee las citas. Las frases citadas en tu retroalimentación son aquellas a las que reaccionaron los calificadores. Son las palabras específicas que debes cambiar.
Preguntas frecuentes
¿Qué tan precisa es la puntuación de speaking de Prepamigo? En 48 respuestas no vistas con puntuaciones verificadas: 81% en la banda exacta, 92% a un punto de diferencia, idéntico en tres corridas. Por banda: 88% baja, 85% media, 71% alta.
¿Es igual a mi puntuación real? Ninguna herramienta de práctica puede prometer eso. Lo que medimos es con qué frecuencia el motor coincide con una puntuación verificada en la misma respuesta. Lee tu puntuación como un nivel con una dirección, y mira el patrón a lo largo de los intentos.
¿Por qué obtuve un 8 en una respuesta que creía excelente? Ese es el mayor error restante del motor: uno de cada cuatro 8s era en realidad un 10. Grábate en la misma tarea de nuevo. Un 10 consistente a lo largo de los intentos es un 10.
¿La misma grabación obtendrá la misma puntuación dos veces? 87.5% idéntico en tres corridas; solo el 4.2% cambió en dos puntos o más, todos en los límites de banda.
Para ver cómo funciona el motor paso a paso, lee por dentro de Scoring Engine 2.0. Para ver la misma prueba ejecutada en GPT, Claude y Gemini, lee qué IA califica el speaking de CELPIP con más precisión. O Grabar una respuesta y comprueba los números por ti mismo. Leer esta guía en inglés.
