Prepamigo Scoring Engine 2.0 frente a los modelos de frontera como calificadores
Porcentaje de respuestas de speaking donde la puntuación coincidió con la puntuación verificada de forma independiente. 48 respuestas que los sistemas nunca habían visto, distribuidas de manera uniforme entre puntuaciones bajas, medias y altas. A cada modelo se le dio la transcripción y se le pidió, en lenguaje simple, que la calificara en la escala de CELPIP; promedio de tres corridas.
81%
Prepamigo Scoring Engine 2.0Prepamigo
62%
Claude Opus 5Anthropic
58%
GeminiGoogle
45%
Claude Sonnet 5Anthropic
45%
GPT-4o miniOpenAI
37%
GPT 5.5OpenAI
35%
GPT 5.6 solOpenAI
31%
GPT 5.6 lunaOpenAI
Prepamigo frente a los planes de chatbot más populares
Dólares canadienses. Los precios de Prepamigo incluyen impuestos. Claude Max (desde US$100) y ChatGPT Pro (US$200) están convertidos a 1.38, antes de impuestos. La precisión es el porcentaje de respuestas del conjunto de prueba calificadas al nivel verificado cuando se le pide al modelo indicado, en lenguaje simple, que califique la respuesta; promedio de tres corridas.
Nuestro calificador de speaking más preciso hasta ahora. En respuestas que nunca había visto, Prepamigo Scoring Engine 2.0 coincidió con las puntuaciones verificadas el 81% de las veces, por delante de todos los modelos de frontera que probamos en la misma tarea, y un salto claro respecto a Engine 1.0, el calificador al que reemplaza.
Hoy lanzamos Prepamigo Scoring Engine 2.0 para Speaking, el sistema que califica cada respuesta de práctica oral en Prepamigo. Engine 2.0 es un rediseño completo de cómo calificamos. En lugar de un solo intento de calificación, usa dos calificadores independientes que comparan cada respuesta directamente contra ejemplos calibrados, votan varias veces, y reconcilian sus respuestas antes de mostrar una puntuación.
El resultado es un calificador mucho más preciso que cualquier modelo de frontera usado como lo usaría un estudiante. En un conjunto reservado de respuestas orales reales con puntuaciones verificadas de forma independiente, Engine 2.0 acertó la puntuación correcta el 81% de las veces. Al pedírsele en lenguaje simple que calificara las mismas transcripciones, el más fuerte de ellos, Claude Opus 5, alcanzó 62%. Gemini alcanzó 58%. Claude Sonnet 5 y GPT-4o mini alcanzaron 45%, GPT 5.5 37%, GPT 5.6 sol 35%, y GPT 5.6 luna 31%. Cuando luego le dimos a cada modelo el propio procedimiento de Engine 2.0, con ejemplos de calibración reales para cada tarea, el mejor de ellos subió a 77% y aun así quedó por detrás.
La precisión importa más donde es más difícil lograrla. Engine 2.0 reconoce una respuesta de nivel alto el 71% de las veces. Al preguntársele de forma simple, ningún otro modelo reconoció más del 56%, y los modelos GPT reconocieron entre 13% y 27%. Engine 2.0 también resiste la falla más común de los calificadores automatizados: puntuaciones que se desplazan bajo y hacia la mitad de la escala sin importar qué tan fuerte o débil sea realmente la respuesta. Ese desplazamiento fue la debilidad que vimos con más frecuencia en Engine 1.0.
Engine 2.0 es más rápido, más consistente, y produce retroalimentación que cita las propias palabras del estudiante. Está disponible hoy para todos los usuarios de Prepamigo. Esta página explica qué hace, cómo lo medimos, y dónde siguen estando sus límites.
Precisión frente a puntuaciones verificadas
La pregunta que nos importa es simple. Cuando un estudiante grava una respuesta, ¿la puntuación en la pantalla coincide con la que habría dado un calificador confiable? Para responderla, construimos un conjunto de prueba de respuestas orales reales que abarcan los ocho tipos de tarea de speaking, cada una con una puntuación verificada de forma independiente, y dividimos el conjunto de manera uniforme entre puntuaciones bajas, medias y altas para que ningún nivel dominara el resultado.
La comparación usa 48 de esas respuestas que se reservaron desde el principio. Nadie del equipo las usó mientras construíamos o ajustábamos Engine 2.0. Cada respuesta fue transcrita palabra por palabra. Luego, a cada modelo se le dijo que era un examinador experimentado de CELPIP, se le dio el enunciado de la tarea y la transcripción, y se le pidió que calificara la respuesta de 0 a 12, tres veces, en días diferentes. Promediamos las tres corridas y contamos con qué frecuencia la puntuación coincidía con el nivel de la puntuación verificada.
51%
menos errores que Claude Opus 5
19 puntuaciones equivocadas por cada 100 respuestas, frente a 38.
71%
menos errores que GPT 5.6 sol
19 puntuaciones equivocadas por cada 100, frente a 65.
71%
de las respuestas de nivel alto reconocidas
El mejor de los otros modelos reconoce 56%; GPT 5.6 sol reconoce 25%.
Tres cosas destacan en estos números. Primero, la brecha no es pequeña. Diecinueve puntos frente al modelo de frontera más fuerte y cuarenta y seis frente al modelo detrás de los planes de pago de ChatGPT, en una prueba de 48 respuestas, es la diferencia entre nueve y veintidós puntuaciones correctas adicionales. Segundo, la brecha no es un artefacto de una prueba favorable. Las 48 respuestas se eligieron antes de que el diseño de Engine 2.0 fuera definitivo y nunca se tocaron durante el desarrollo. Tercero, la comparación es la que le importa a un estudiante: mide lo que se obtiene al pegar una transcripción en un chatbot y preguntar, que es como casi todo el mundo usa estos modelos.
Una nota sobre qué significa “correcto” aquí. Las puntuaciones verificadas en esta escala vienen en niveles y no en puntos individuales, así que contamos una puntuación como correcta cuando cae dentro del nivel verificado. Una respuesta verificada en el nivel alto, por ejemplo, se califica correctamente si el motor le da un 9, 10 u 11. Bajo una lectura más estricta que solo acepta 10 en adelante, todos los sistemas pierden algunos puntos y la clasificación no cambia.
| Sistema | Solicitud simple | Con nuestro procedimiento completo |
|---|---|---|
| Prepamigo Scoring Engine 2.0 | 81.3% | — |
| Claude Opus 5 | 61.8% | 77.1% |
| Gemini | 58.3% | 70.8% |
| Claude Sonnet 5 | 45.1% | 68.8% |
| GPT-4o mini | 45.1% | 50.0% |
| GPT 5.5 | 36.8% | 68.8% |
| GPT 5.6 sol | 35.4% | 70.8% |
| GPT 5.6 luna | 30.6% | 62.5% |
Desempeño en cada nivel de puntuación
Una cifra de precisión promedio puede ocultar mucho. Un calificador que es excelente en respuestas débiles y pésimo en las fuertes podría presentar un número respetable mientras falla a los estudiantes que más necesitan una respuesta precisa. Por eso reportamos la precisión por separado para cada uno de los tres niveles del conjunto de prueba: puntuaciones bajas de 4 o 5, puntuaciones medias de 7 u 8, y puntuaciones altas de 10 o más.
La mayoría de los calificadores, humanos o de máquina, se desplazan hacia la mitad. Una respuesta fuerte recibe un 8 en lugar de un 10. Una débil recibe un 6 en lugar de un 5. Sin nada con qué comparar, los modelos de frontera añaden un segundo hábito: se desplazan hacia abajo, de modo que una respuesta débil a menudo se califica con un 3 y una fuerte con un 7. Engine 2.0 se construyó específicamente para resistir ambos tirones, y los resultados lo muestran con más claridad en la parte alta de la escala.
Puntuaciones bajas · puntuación verificada de 4 o 5
16 respuestas reservadas por sistema, solicitud simple, promedio de tres corridas.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
75%
GPT-4o mini
56%
Gemini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
44%
Claude Sonnet 5
Puntuaciones medias · puntuación verificada de 7 u 8
16 respuestas reservadas por sistema, solicitud simple, promedio de tres corridas.
85%
Prepamigo Engine 2.0
63%
Gemini
63%
Claude Sonnet 5
58%
Claude Opus 5
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
Puntuaciones altas · puntuación verificada de 10 o más
16 respuestas reservadas por sistema, solicitud simple, promedio de tres corridas. Casi todos los errores son un 7 u 8.
71%
Prepamigo Engine 2.0
56%
Gemini
50%
Claude Opus 5
29%
Claude Sonnet 5
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
En el nivel bajo, Engine 2.0 lidera con 88%, con Claude Opus 5 en 77% y GPT-4o mini en 75%. Todos los demás modelos están alrededor de la mitad, y Claude Sonnet 5 está en 44%. El error es casi siempre un 3: el modelo ve una respuesta débil y la califica por debajo del nivel en lugar de dentro de él. La cifra respetable de GPT-4o mini aquí es la primera señal de su problema, que es que califica casi todo bajo; en la parte alta de la escala reconoce una respuesta de cada seis.
En el nivel medio, Engine 2.0 lidera con 85%. Gemini y Claude Sonnet 5 están en 63%, Claude Opus 5 en 58%, y luego un precipicio: GPT-4o mini en 44% y los tres modelos GPT más grandes entre 27% y 29%. Las respuestas de nivel medio contienen una mezcla de fortalezas y debilidades que hay que sopesar en lugar de simplemente detectar, y sin nada con qué comparar, los modelos GPT se fijan en las debilidades y otorgan un 5 o un 6.
En el nivel alto, la brecha es la más amplia. Engine 2.0 identifica correctamente el 71% de las respuestas de nivel alto. Gemini identifica el 56% y Opus 5 exactamente la mitad. Cinco de los otros siete modelos le dan un 7 u 8 a al menos siete de cada diez respuestas que merecen un 10. Este es el problema de desplazamiento hacia la mitad en su forma más pura. Una respuesta de nivel alto no es perfecta; contiene algún desliz ocasional, un reinicio, una oración simple entre las complejas, y un calificador que la mide contra una respuesta perfecta imaginaria descuenta por cada una. Engine 2.0 está calibrado contra ejemplos que muestran cómo se ve realmente una respuesta de nivel alto, deslices incluidos, y está diseñado explícitamente para compararse contra esos ejemplos en lugar de contra la perfección.
¿Qué pasa si les das nuestro procedimiento completo?
Los números de la solicitud simple no son un veredicto sobre qué tan inteligentes son estos modelos. Son un veredicto sobre lo que ocurre cuando a un modelo se le pide un número sin nada con qué comparar. Así que realizamos una segunda prueba, dándole a cada modelo exactamente lo que reciben los propios calificadores de Engine 2.0: la transcripción, la tarea, dos ejemplos de calibración reales en cada nivel para esa tarea específica, y la instrucción de nombrar el ejemplo más cercano para cada una de las cuatro dimensiones en lugar de producir un número. Cada modelo también recibió una breve nota de calibración ajustada a sus propias tendencias.
Con nuestro procedimiento completo: porcentaje de respuestas calificadas al nivel verificado
Las mismas 48 respuestas reservadas. Mismas transcripciones, instrucciones y ejemplos de calibración para cada sistema; cada modelo calificó cada respuesta una vez.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
71%
GPT 5.6 sol
71%
Gemini
69%
GPT 5.5
69%
Claude Sonnet 5
63%
GPT 5.6 luna
50%
GPT-4o mini
Todos los modelos mejoran, algunos drásticamente. GPT 5.6 sol se duplica de 35% a 71%. Opus 5 sube de 62% a 77%. GPT-4o mini casi no se mueve, de 45% a 50%, porque califica todo bajo sin importar lo que se le muestre. Y todos los modelos siguen quedando por detrás de Engine 2.0. En la parte alta de la escala, la brecha persiste: Opus 5, GPT 5.6 sol, Gemini y GPT 5.5 se detienen todos en 63% de las respuestas de nivel alto, Sonnet 5 en 38%, GPT-4o mini en cero, frente al 71% de Engine 2.0.
Esta segunda prueba muestra dónde reside realmente el valor de Engine 2.0. No es un modelo más inteligente; usa modelos de esta misma lista. Son ejemplos reales de cómo suena cada nivel en cada tarea específica, una pregunta que obliga al modelo a comparar en lugar de adivinar, y luego tres cosas más que un solo intento no puede ofrecer: dos calificadores independientes de diferentes proveedores, tres votos de cada uno con el voto medio conservado, y una regla de reconciliación que toma la puntuación más alta cuando los dos calificadores discrepan mucho, porque el análisis mostró que el veredicto más bajo casi siempre era el equivocado en las respuestas fuertes.
Consistencia y estabilidad
Un calificador en el que puedas confiar tiene que ser consistente. Si la misma grabación puede recibir un 8 hoy y un 10 mañana, ninguno de los dos números significa mucho, y un estudiante no puede saber si su práctica está funcionando. Así que, junto con la precisión, medimos si Engine 2.0 da la misma respuesta cuando se le hace la misma pregunta dos veces.
Ejecutamos Engine 2.0 sobre las 48 respuestas reservadas tres veces distintas, en días diferentes, sin cambiar nada entre ellas. Obtuvo 81.3% en cada corrida. No aproximadamente 81%: las mismas 39 respuestas correctas de 48 cada vez, con una diferencia de una como máximo. Cuando observamos las respuestas individuales en lugar del agregado, el 87.5% recibió una puntuación idéntica en las tres corridas, y solo el 4.2% cambió alguna vez en dos puntos o más entre corridas. Esas pocas son respuestas que están justo en el límite entre dos niveles, donde una pequeña diferencia de criterio legítimamente inclina la puntuación en un sentido u otro.
La prueba de solicitud simple en los modelos de frontera se movió mucho más entre corridas. GPT 5.6 sol obtuvo 31%, 40% y 35% en sus tres corridas; Opus 5 obtuvo 62%, 65% y 58%. Pídele a un chatbot que califique la misma transcripción en dos días distintos y, con bastante frecuencia, obtendrás dos puntuaciones diferentes.
La consistencia proviene de dos decisiones de diseño. Cada calificador de Engine 2.0 vota tres veces en cada respuesta y se conserva el voto medio, lo que elimina el valor atípico ocasional que produciría un solo intento. Y los veredictos de los dos calificadores se reconcilian mediante una regla fija en lugar de otro modelo, así que el mismo par de veredictos siempre produce la misma puntuación final. Ambas decisiones se probaron directamente: con un solo voto en lugar de tres, la coincidencia entre corridas cayó de 87.5% a 77.1%, y el porcentaje de respuestas que saltaban dos puntos o más se más que duplicó.
Cómo califica Engine 2.0 una respuesta
Engine 2.0 no es un solo modelo. Es un procedimiento, y el procedimiento es lo que marca la diferencia. Esto es lo que ocurre en los aproximadamente diez segundos entre que un estudiante presiona detener y una puntuación aparece en la pantalla.
- La grabación se transcribe palabra por palabra. Se conservan cada muletilla, cada reinicio, cada autocorrección. Esto resultó ser esencial. Cuando probamos una transcripción “limpia” con las vacilaciones eliminadas, la precisión cayó quince puntos, porque las vacilaciones son parte de la evidencia que un calificador necesita para juzgar cómo suena una respuesta.
- Dos calificadores independientes leen la transcripción. Están construidos sobre modelos subyacentes diferentes de proveedores diferentes, así que no comparten los mismos puntos ciegos. Cada calificador recibe el enunciado de la tarea, la transcripción, y un pequeño conjunto de ejemplos de calibración para esa tarea exacta: respuestas reales en el nivel bajo, medio y alto, dos por nivel, de modo que cada nivel se muestra como un rango en lugar de un solo punto.
- Cada calificador compara en lugar de puntuar. Este es el cambio central respecto a Engine 1.0. En lugar de que se le pida un número, a cada calificador se le pregunta, para cada una de las cuatro dimensiones de la respuesta, a qué ejemplo de calibración se parece más. No existe la opción de “algo intermedio”. Tener que comprometerse con el ejemplo más cercano es lo que detiene el desplazamiento hacia la mitad. La puntuación se deriva entonces del nivel elegido mediante una regla fija, no por el modelo.
- Cada calificador vota tres veces. Se conserva el voto medio en cada dimensión. Esto elimina la respuesta ocasional de un mal día sin promediar y perder el criterio genuino.
- Los dos veredictos se reconcilian. Si los calificadores coinciden o difieren por un solo punto, la puntuación final es su promedio. Si difieren por dos o más, se usa la puntuación más alta. Esa regla no es generosidad; es calibración. Cuando analizamos cada caso en que los dos calificadores discreparon mucho, el veredicto más bajo casi siempre era el equivocado, porque la discrepancia casi siempre surgía en una respuesta de nivel alto sobre la cual uno de los calificadores había sido demasiado cauteloso.
- Se aplican salvaguardas. Un breve conjunto de reglas fijas maneja casos sobre los que ningún calificador debería tener que adivinar: una respuesta silenciosa, de pocas palabras, en otro idioma, o completamente fuera de tema recibe una puntuación mínima sin importar lo que devuelvan los calificadores. En las pruebas, el silencio obtuvo un 3, una respuesta de pocas palabras un 4, y una respuesta fuera de tema o que no estuviera en inglés un 5, sin fallas en todo el conjunto.
Dos propiedades del diseño final merecen destacarse. Engine 2.0 califica solo a partir de la transcripción, así que no necesita el audio después de la transcripción y no depende del modelo de audio de ningún proveedor en particular. Y como los dos calificadores son de proveedores diferentes, si uno no está disponible el otro continúa, con un tercer modelo de respaldo para que siempre se produzca una puntuación.
Qué hay de nuevo en tu retroalimentación
Engine 2.0 llega con una capa de retroalimentación reconstruida. Lee la evidencia de los dos calificadores, no solo el puntaje, y fue probada con tres tipos de estudiante: alguien que se enfrenta al CELPIP por primera vez, alguien con inglés débil que busca el truco, y alguien con media hora al día y un examen la próxima semana. Esto es lo que cambió.
- Tus propias palabras, citadas de vuelta. Cada punto de retroalimentación cita la frase exacta de tu transcripción a la que reaccionaron los calificadores. Si una frase aparece entre comillas, está copiada palabra por palabra; en nuestra auditoría, 157 de 158 citas lo estaban. La retroalimentación nunca inventa algo que no dijiste.
- Una sola cosa que corregir primero. Cada respuesta recibe una acción principal: el único cambio que más elevaría tu puntaje, escrito con las palabras más sencillas posibles. Le siguen dos acciones concretas más, y luego una lista de tres puntos para repasar mentalmente antes de empezar a hablar.
- Consejos según la tarea. Dar un consejo, describir una escena y persuadir a alguien se califican según criterios distintos. La retroalimentación ahora sabe qué premia cada uno de los ocho tipos de tarea y se dirige a eso, en lugar de repetir los mismos consejos genéricos en todas las tareas.
- Qué dimensión practicar primero. La retroalimentación te dice cuál de las cuatro dimensiones es tu punto más débil y cuál el más fuerte, para que sepas dónde está el próximo punto, sin esconderlo detrás de un número.
- Lo que pedía la tarea y no cubriste. En el cumplimiento de la tarea, la retroalimentación enumera las partes específicas del enunciado que no cubriste, o dice claramente que las cubriste todas.
- Cosas que sí puedes ensayar. Cada consejo práctico es algo que puedes decir en voz alta antes de tu próximo intento. Nada de sugerencias para hablar más claro o reducir tu acento: el acento no es lo que mide la inteligibilidad, y la retroalimentación nunca comenta sobre él.
- Sin culpar al reloj. Una respuesta interrumpida por el cronómetro después de haber cumplido la tarea no se penaliza por el corte, y la retroalimentación no te reprende por ello.
Cuando un modelo evaluador independiente comparó esta retroalimentación con la que producía nuestro sistema anterior para las mismas respuestas, sin saber cuál era cuál, prefirió la nueva retroalimentación en 20 de 24 comparaciones, tanto al evaluar como lo haría un examinador como al evaluar como lo haría un estudiante.
Práctica ilimitada por CA$25 al mes
La precisión solo es útil si puedes darte el lujo de usarla todos los días. Una puntuación de speaking en la que puedas confiar es más valiosa en tu cuadragésima respuesta de práctica, no en la cuarta, porque ahí es cuando la puntuación empieza a decirte si un cambio en tu forma de hablar realmente está funcionando. Por eso fijamos el precio de Engine 2.0 para que se use sin contar.
Todos los planes de Prepamigo incluyen calificación ilimitada por Engine 2.0, intentos ilimitados, y el banco de preguntas completo: 80 sets de práctica completos y más de 2,000 tareas de práctica en Speaking, Writing, Reading y Listening, escritas para seguir los tipos de tarea, los tiempos y el formato del examen CELPIP General. Presionas grabar, obtienes una puntuación y retroalimentación basada en evidencia en unos diez segundos, y puedes repetirlo tantas veces como quieras.
Prepamigo
CA$25/ mes
CA$24.98 mes a mes · CA$8.25 al mes en el plan anual (CA$98.98 al año) · impuestos incluidos · cancela en cualquier momento
- Calificación ilimitada por Scoring Engine 2.0, sin límite diario, por sesión ni semanal.
- 80 sets de práctica y más de 2,000 tareas en las cuatro secciones, modeladas según el formato real del examen, para que nunca tengas que escribir tus propias indicaciones.
- Grabar y listo. La transcripción, la calificación y la retroalimentación se manejan por ti; no hay nada que pegar ni nada que indicar.
- Retroalimentación con tus propias palabras, con cada cita rastreable a lo que realmente dijiste.
Claude Max, para comparar
US$100/ mes
unos CA$138 antes de impuestos · el nivel 20x cuesta US$200 al mes · Pro cuesta US$20 con límites mucho más estrictos
- Incluso Max tiene límites. Una ventana de uso móvil de cinco horas y un límite semanal, cinco o veinte veces lo que permite Pro; cuando alcanzas cualquiera de los dos, esperas.
- Sin banco de preguntas. Traes tus propias tareas, decides por ti mismo si se parecen a la prueba real, y llevas el control de lo que ya has practicado.
- Tú haces la preparación. Grabar, transcribir, pegar la transcripción y escribir las instrucciones de calificación dependen de ti, cada vez.
- Una solicitud simple, no un calificador calibrado. Al preguntársele en lenguaje simple, Claude Opus 5 coincidió con las puntuaciones verificadas el 62% de las veces y Claude Sonnet 5 el 45%, frente al 81% de Engine 2.0.
Los precios y términos de uso de los planes de Claude son los publicados en claude.com en septiembre de 2026 y pueden cambiar. CELPIP es una marca registrada de su propietario; Prepamigo es una plataforma de práctica independiente y no está afiliada, respaldada ni conectada con el creador del examen. Las tareas de práctica de Prepamigo son material original escrito para seguir el formato público del examen.
Disponibilidad
Prepamigo Scoring Engine 2.0 para Speaking está disponible ahora para todos los usuarios de Prepamigo en todos los tipos de tarea de speaking. No hay nada que activar. Cada nueva respuesta de speaking es calificada por Engine 2.0, y cada puntuación viene con retroalimentación extraída de las propias palabras del estudiante.
Una respuesta típica se califica en unos diez segundos, más rápido que Engine 1.0. Engine 2.0 también nos cuesta menos ejecutar por respuesta que el diseño al que reemplaza, lo que es lo que nos permite ejecutar dos calificadores con tres votos cada uno para cada estudiante sin cambiar lo que cuesta Prepamigo.
Publicaremos actualizaciones de las cifras de esta página conforme se complete la validación en el mundo real descrita arriba. Si tienes una grabación que crees que Engine 2.0 calificó de forma incorrecta, queremos verla: esos casos son la forma más rápida que conocemos para encontrar la siguiente mejora.
Para las comparaciones directas, lee Prepamigo vs Claude y Prepamigo vs ChatGPT. O Grabar una respuesta y observa cómo funciona Engine 2.0. Leer esta guía en inglés.
