Puntuación

¿Qué IA califica el speaking de CELPIP con más precisión? Probamos ocho

5 de septiembre de 2026

Porcentaje de respuestas calificadas al nivel verificado

48 respuestas reservadas, 16 por banda. A cada modelo se le dio la transcripción y se le pidió, en lenguaje simple, que la calificara en la escala de CELPIP; promedio de tres corridas. Engine 2.0 se ejecutó en su configuración normal de producción.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo frente a los planes de chatbot más populares

Dólares canadienses. Los precios de Prepamigo incluyen impuestos. Claude Max (desde US$100) y ChatGPT Pro (US$200) están convertidos a 1.38, antes de impuestos. La precisión es el porcentaje de respuestas del conjunto de prueba calificadas al nivel verificado cuando se le pide al modelo indicado, en lenguaje simple, que califique la respuesta; promedio de tres corridas.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Precio mensual
CA$24.98 (imp. inc.)
CA$138+ (más imp.)
CA$276 (más imp.)
Calificación
Ilimitada
Limitada
Limitada
Banco de preguntas
No
No
Sets de práctica
80
Ninguno
Ninguno
Tareas de práctica
2,000+
Ninguna
Ninguna
Formato CELPIP
No
No
Precisión
81%
62%
35%
Respuestas de nivel alto
71%
50%
25%

Muchos candidatos de CELPIP ahora califican su propia práctica de speaking con un chatbot de IA. Grabas una respuesta, la transcribes, la pegas, pides una puntuación. Es rápido y gratis o casi gratis, y las explicaciones suenan autorizadas. Lo que nadie te dice es con qué frecuencia el número es correcto, ni qué modelo confiar, ni si la forma en que preguntas cambia la respuesta. Nosotros queríamos saberlo, así que construimos la prueba y la ejecutamos en ocho sistemas, de dos formas.

La primera forma es el gráfico de arriba: pegar la transcripción, pedir una puntuación, como lo haría un estudiante. Entre los modelos de propósito general, Claude Opus 5 fue el más preciso con 62%, Gemini le siguió con 58%, y todo lo demás estuvo por debajo de la mitad: Claude Sonnet 5 y GPT-4o mini con 45%, GPT 5.5 con 37%, GPT 5.6 sol con 35%, GPT 5.6 luna con 31%. Un sistema diseñado a propósito, Prepamigo Scoring Engine 2.0, alcanzó 81% en las mismas respuestas.

La segunda forma es la que creemos más instructiva: le dimos a cada modelo nuestro propio procedimiento de calificación, con ejemplos de calibración reales y una comparación forzada, para ver qué tan bueno podía llegar a ser cada uno. Todos los modelos mejoraron, algunos drásticamente, y todos los modelos siguieron quedando por detrás de Engine 2.0. Debemos ser transparentes en que Prepamigo es nuestro producto. Hemos intentado hacer que ambas pruebas sean justas para todos los demás, y donde un modelo nos superó en un nivel en particular, lo decimos.

La clasificación con instrucción simple

Se pueden ver tres niveles en el gráfico de arriba. Engine 2.0 con 81% está solo en su categoría. Claude Opus 5 con 62% y Gemini con 58% forman un segundo nivel: usable, si aceptas equivocarte dos de cada cinco veces. Todo lo demás está por debajo del 50%, es decir, peor de lo que sería un volado entre las tres bandas si no supieras nada sobre la respuesta.

Esa es la característica que define la prueba simple: todos los modelos de propósito general califican con dureza. La puntuación promedio que le dieron a una respuesta de nivel alto verificada varió de 7.2 (luna) a 8.6 (Opus 5). La que le dieron a una respuesta de nivel bajo verificada varió de 3.7 a 4.3, por debajo de la banda para todos excepto Opus 5 y Gemini. Sin ejemplos de cómo suena realmente cada nivel, los modelos comparan la respuesta contra una perfecta imaginaria y descuentan.

Resultados en cada nivel de puntuación

Una cifra general oculta dónde caen los errores, y dónde caen es lo que determina si un calificador te resulta útil. Aquí están los resultados de la prueba simple por banda.

Respuestas de nivel bajo (verificado 4 o 5)

16 respuestas reservadas por sistema, instrucción simple, promedio de tres corridas.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

Las respuestas débiles deberían ser el extremo fácil de la escala, y con una instrucción simple no lo son. Engine 2.0 está en 88%, Opus 5 en 77%, GPT-4o mini en 75%. Todo lo demás está alrededor de la mitad, y Sonnet 5 está en 44%. El error es casi siempre un 3: el modelo ve una respuesta débil y la califica por debajo de la banda en lugar de dentro de ella. La cifra respetable de GPT-4o mini aquí es la primera señal de su problema, que es que califica casi todo bajo.

Respuestas de nivel medio (verificado 7 u 8)

16 respuestas reservadas por sistema, instrucción simple, promedio de tres corridas.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

La banda media separa al grupo. Engine 2.0 está en 85%. Gemini y Sonnet 5 están en 63%, Opus 5 en 58%. Luego un precipicio: GPT-4o mini en 44% y los tres modelos GPT más grandes entre 27% y 29%. Las respuestas de nivel medio contienen una mezcla real de fortalezas y debilidades que hay que sopesar, y sin nada con qué comparar, los modelos GPT se fijan en las debilidades y otorgan un 5 o un 6. Un hablante de nivel 7 u 8 que le pida una puntuación a GPT 5.6 sol escuchará la banda correcta menos de tres veces de cada diez.

Respuestas de nivel alto (verificado 10 o más)

16 respuestas reservadas por sistema, instrucción simple, promedio de tres corridas. Casi todos los errores son un 7 u 8.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

La banda alta es donde más importan las diferencias, y donde la instrucción simple causa más daño. Engine 2.0 reconoce el 71% de las respuestas de nivel alto. Gemini reconoce el 56% y Opus 5 exactamente la mitad. Luego Sonnet 5 con 29%, GPT 5.5 con 27%, GPT 5.6 sol con 25%, GPT-4o mini con 17% y GPT 5.6 luna con 13%. Cinco de los siete modelos de propósito general le dan un 7 u 8 a al menos siete de cada diez respuestas que merecen un 10.

Si eres un candidato fuerte calificándote con un chatbot, este es el número que debes recordar. La probabilidad de que una solicitud simple a GPT 5.6 sol te diga que un 10 es un 10 es de una en cuatro.

La segunda clasificación: con nuestro procedimiento completo

Los números de la prueba simple no son un veredicto sobre qué tan inteligentes son estos modelos. Son un veredicto sobre lo que ocurre cuando a un modelo se le pide un número sin nada con qué comparar. Así que realizamos la segunda prueba, dándole a cada modelo los ejemplos de calibración y la comparación forzada que usan los propios calificadores de Engine 2.0.

Con nuestro procedimiento completo: porcentaje de respuestas calificadas al nivel verificado

Las mismas 48 respuestas reservadas. Mismas transcripciones, instrucciones y ejemplos de calibración para cada sistema; cada modelo calificó cada respuesta una vez. Gemini también recibió el audio.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

Todos los modelos mejoran. Opus 5 pasa de 62% a 77%. GPT 5.6 sol se duplica, de 35% a 71%. GPT 5.5 pasa de 37% a 69%, Sonnet 5 de 45% a 69%, luna de 31% a 63%, Gemini de 58% a 71%. GPT-4o mini casi no se mueve, de 45% a 50%, porque califica todo bajo sin importar lo que se le muestre.

El orden también cambia. Con una instrucción simple, los modelos de Claude estaban muy por delante de los modelos GPT. Con el procedimiento completo, GPT 5.6 sol supera a Sonnet 5 y empata con Gemini, y cuatro modelos se agrupan entre 69% y 71%, estadísticamente indistinguibles en esta muestra. Opus 5 se mantiene en la cima del campo de propósito general con 77%, cuatro puntos por detrás de Engine 2.0.

A nivel de banda, el procedimiento completo eleva la precisión en la banda baja a 88% para cuatro modelos, lo mismo que Engine 2.0, y la precisión en la banda media a 81% para los dos modelos de Claude. La banda alta es donde persiste la brecha: Opus 5, GPT 5.6 sol, Gemini y GPT 5.5 se detienen todos en 63%, Sonnet 5 en 38%, y GPT-4o mini en cero, frente al 71% de Engine 2.0. Un solo modelo que hace un solo intento sigue conteniéndose ante una respuesta fuerte que tiene algún desliz. Engine 2.0 cierra esa brecha restante con dos calificadores independientes de diferentes proveedores, tres votos de cada uno con el voto medio conservado, y una regla de reconciliación que toma la puntuación más alta cuando los dos calificadores discrepan mucho, porque el análisis mostró que el veredicto más bajo casi siempre era el equivocado en las respuestas fuertes.

El resumen honesto de ambas clasificaciones es este: el procedimiento importa más que el modelo. El mismo GPT 5.6 sol pasó de 35% a 71% sin cambiar un solo peso, solo con mostrarle cómo suena cada nivel y preguntarle a qué ejemplo se parece la respuesta.

Por qué los modelos se desplazan bajo y hacia la mitad

El patrón es tan consistente entre modelos de tres empresas distintas que no puede ser una peculiaridad de ninguno de ellos. Es una propiedad de la tarea.

Cuando a un modelo se le pide ubicar una respuesta en una escala, se cubre hacia el centro cuando no está seguro, porque el centro es donde una respuesta equivocada cuesta menos. Y cuando no tiene ejemplos de cómo suena realmente un nivel, compara la respuesta contra una perfecta imaginaria y descuenta por cada desliz. Una respuesta de nivel alto nunca es perfecta. Contiene un reinicio, una oración simple entre las complejas, una vacilación antes de una palabra difícil. Medidos contra la perfección, esos deslices cuestan un nivel o dos, y un 10 se convierte en un 8 o un 7.

Las instrucciones no arreglan esto. Intentamos decirles explícitamente a los modelos que un nivel 9 no requiere una respuesta sin errores, que subcalificar una respuesta fuerte es tan grave como sobrecalificar una débil. Cada instrucción se aceptaba y luego se ignoraba en la práctica. Cuando le dimos a un modelo el mismo ejemplo de calibración que se le había dicho que representaba una respuesta de nivel alto y le pedimos que la calificara, le dio un 8.

Lo que sí lo arregla, en su mayor parte, es cambiar la pregunta de “¿qué número?” a “¿qué ejemplo?” y proporcionar ejemplos reales. Esa es la diferencia entre las dos clasificaciones. Aun así, un solo intento sigue desplazándose un poco, porque los ejemplos de calibración no son perfectos y una lectura de ellos es solo una lectura. Dos calificadores, tres votos y una regla de reconciliación son lo que cierra el resto.

Notas sobre cada modelo

  • Claude Opus 5. El mejor calificador de propósito general en ambas pruebas: 62% simple (62%, 65% y 58% en tres corridas) y 77% con el procedimiento completo. Su debilidad con instrucción simple es la banda media, donde reparte 6s; su debilidad con el procedimiento completo es la banda alta, donde se detiene en 63%. También es, por un margen amplio, el modelo más caro aquí.
  • Gemini. Segundo en la prueba simple con 58%, idéntico en las tres corridas, y el más equilibrado entre bandas, con 56%, 63% y 56%. Con el procedimiento completo y la grabación de audio alcanzó 71%, a la par de GPT 5.6 sol, que trabajó solo con texto. Escuchar la grabación no lo ayudó más allá de lo que ya proporciona una transcripción textual.
  • Claude Sonnet 5. 45% simple, con un perfil peculiar: razonable en la banda media con 63%, pobre en respuestas débiles con 44% porque las califica con un 3, y pobre en la parte alta con 29%. Con el procedimiento completo sube a 69% pero se queda en 38% en respuestas de nivel alto. Si Sonnet 5 sigue dándote 8s, no le creas.
  • GPT-4o mini. 45% simple, 50% con el procedimiento completo, y en ambos casos el número lo favorece más de lo que merece. Califica casi todo bajo: 75% en respuestas débiles, 17% y luego 0% en las de nivel alto. Hagas lo que hagas, no califiques tu speaking con este modelo.
  • GPT 5.5. 37% simple (35%, 42%, 33%), 69% con el procedimiento completo. Su banda media con instrucción simple es 29%. Fue el calificador de texto en una versión anterior de nuestro propio proceso y se reemplazó por su debilidad exactamente en esa banda.
  • GPT 5.6 sol. 35% simple (31%, 40%, 35%), la mayor variación entre corridas de cualquier modelo, y 71% con el procedimiento completo, la mayor mejora de cualquier modelo. Un calificador capaz cuando se le muestran ejemplos, y uno pobre cuando no. Su hábito con el procedimiento completo es recompensar en exceso la fluidez en la banda media.
  • GPT 5.6 luna. Último en ambas pruebas: 31% simple y 63% con el procedimiento completo. Arrastra las respuestas medias hacia el 5 y reconoció el 13% de las respuestas de nivel alto con instrucción simple. Suficientemente económico para ser útil como segunda opinión dentro de un sistema de dos calificadores; no suficientemente preciso para usarlo solo.

Qué añade un sistema diseñado a propósito

Engine 2.0 no es un modelo mejor. Usa modelos de esta misma clasificación. Lo que añade es procedimiento, y cada pieza de ese procedimiento se eligió mediante medición.

  1. Transcripción textual, automáticamente. Se conservan cada muletilla y cada reinicio, porque eliminarlos redujo la precisión en quince puntos durante las pruebas. No tienes que buscar una herramienta de transcripción que haga esto; la mayoría de las herramientas para consumidores limpian por defecto.
  2. Ejemplos de calibración adjuntos a cada tarea. Dos respuestas reales por nivel para cada uno de los ocho tipos de tarea, ya listas. Este es el único insumo que duplicó la precisión de GPT 5.6 sol, y el que no puedes producir en casa.
  3. Una comparación, no un número. Cada calificador nombra el ejemplo más cercano en cada una de las cuatro dimensiones; la puntuación se deriva mediante una regla. Esto es lo que detiene el desplazamiento.
  4. Dos calificadores de dos proveedores. Modelos diferentes tienen puntos ciegos diferentes. Dos de ellos, reconciliados mediante una regla fija, superan a cualquiera solo.
  5. Tres votos cada uno, se conserva el medio. Esto no elevó la precisión, pero llevó la consistencia entre corridas de 77% a 87.5%. Una sola respuesta de un chatbot es un solo voto.
  6. Reconciliación que toma la puntuación más alta ante una discrepancia fuerte.Porque el veredicto más bajo casi siempre era el equivocado en las respuestas fuertes. Un promedio simple cayó a mediados de los sesenta en las pruebas.
  7. Salvaguardas. El silencio, las respuestas de pocas palabras, fuera de tema y que no están en inglés reciben puntuaciones mínimas por regla en lugar de por la conjetura de un modelo.

El resultado es 81% en general y 71% en la parte alta, idéntico en tres corridas separadas, en unos diez segundos por respuesta sin nada que pegar.

Si de todos modos vas a usar un chatbot

Algunos lectores seguirán calificándose con un chatbot, y eso es una decisión razonable para un candidato con un presupuesto ajustado o que quiere conversar sobre sus respuestas. Estos pasos son la diferencia entre las dos clasificaciones, y te acercarán más a la segunda que a la primera.

  1. Usa una transcripción textual. Conserva tus muletillas, reinicios y autocorrecciones. Si tu herramienta de transcripción los elimina, el calificador estará calificando una respuesta mejor que la que diste.
  2. Dale ejemplos, no una rúbrica. Una o dos respuestas reales de cada nivel para el mismo tipo de tarea, con sus niveles etiquetados, hacen más que cualquier descripción de cómo se ve un nivel 9. Si no tienes ejemplos verificados, este es el paso que no puedes replicar en casa, y es el que más importa.
  3. Pregunta qué ejemplo, no qué número. Para cada una de las cuatro dimensiones, pídele al modelo que nombre el ejemplo más cercano y prohíbe “algo intermedio”. Deriva tú mismo la puntuación a partir de los niveles que nombre.
  4. Pregunta más de una vez. Califica la misma respuesta dos o tres veces en conversaciones nuevas y conserva la respuesta media. GPT 5.6 sol varió nueve puntos entre corridas en la prueba simple.
  5. Elige un modelo con buen historial en la banda alta. Opus 5 o Gemini si preguntas de forma simple; Opus 5 o GPT 5.6 sol si tienes ejemplos. Nunca GPT-4o mini, jamás, si estás cerca de un 10.
  6. Desconfía de un 7 u 8. En todos los modelos de propósito general, un 7 u 8 en una respuesta que creías excelente tiene más probabilidades de ser un error que un veredicto.

En qué modelo confiar, según dónde estés

La lectura correcta de estas clasificaciones depende de tu nivel actual, porque los modelos fallan en lugares distintos.

  • Si hoy estás en un 4 o 5, Opus 5, al preguntársele de forma simple, te lo dirá aproximadamente tres de cada cuatro veces; la mayoría de los otros modelos te llamarán un 3 aproximadamente la mitad de las veces. Tu problema no es realmente el calificador; es la retroalimentación, y para eso quieres algo que te cite tus propias palabras en lugar de resumir.
  • Si estás en un 7 u 8, evita los modelos GPT con una instrucción simple, que te llamarán un 5 o 6 siete de cada diez veces. Gemini y Sonnet 5 son los calificadores de instrucción simple más confiables en la banda media con 63%. Engine 2.0 está en 85%.
  • Si estás en un 10 o más, aquí es donde más importa la elección. Al preguntársele de forma simple, ningún modelo de propósito general reconocerá un 10 más del 56% de las veces, y los modelos GPT lo harán entre 13% y 27% de las veces. Engine 2.0 reconoce siete de cada diez y, más importante aún, da la misma respuesta cada vez que preguntas.

El patrón en las tres bandas es el mismo que ha estado describiendo todo el artículo. Los modelos no son tontos; son cautelosos, y la cautela sin nada con qué comparar significa un número bajo. Cuanto más lejos estés de la mitad, más te cuesta la cautela de un calificador, y más importa que el calificador se haya construido para resistirla.

Qué hay de nuevo en tu retroalimentación

Engine 2.0 llega con una capa de retroalimentación reconstruida. Lee la evidencia de los dos calificadores, no solo el puntaje, y fue probada con tres tipos de estudiante: alguien que se enfrenta al CELPIP por primera vez, alguien con inglés débil que busca el truco, y alguien con media hora al día y un examen la próxima semana. Esto es lo que cambió.

  • Tus propias palabras, citadas de vuelta. Cada punto de retroalimentación cita la frase exacta de tu transcripción a la que reaccionaron los calificadores. Si una frase aparece entre comillas, está copiada palabra por palabra; en nuestra auditoría, 157 de 158 citas lo estaban. La retroalimentación nunca inventa algo que no dijiste.
  • Una sola cosa que corregir primero. Cada respuesta recibe una acción principal: el único cambio que más elevaría tu puntaje, escrito con las palabras más sencillas posibles. Le siguen dos acciones concretas más, y luego una lista de tres puntos para repasar mentalmente antes de empezar a hablar.
  • Consejos según la tarea. Dar un consejo, describir una escena y persuadir a alguien se califican según criterios distintos. La retroalimentación ahora sabe qué premia cada uno de los ocho tipos de tarea y se dirige a eso, en lugar de repetir los mismos consejos genéricos en todas las tareas.
  • Qué dimensión practicar primero. La retroalimentación te dice cuál de las cuatro dimensiones es tu punto más débil y cuál el más fuerte, para que sepas dónde está el próximo punto, sin esconderlo detrás de un número.
  • Lo que pedía la tarea y no cubriste. En el cumplimiento de la tarea, la retroalimentación enumera las partes específicas del enunciado que no cubriste, o dice claramente que las cubriste todas.
  • Cosas que sí puedes ensayar. Cada consejo práctico es algo que puedes decir en voz alta antes de tu próximo intento. Nada de sugerencias para hablar más claro o reducir tu acento: el acento no es lo que mide la inteligibilidad, y la retroalimentación nunca comenta sobre él.
  • Sin culpar al reloj. Una respuesta interrumpida por el cronómetro después de haber cumplido la tarea no se penaliza por el corte, y la retroalimentación no te reprende por ello.

Cuando un modelo evaluador independiente comparó esta retroalimentación con la que producía nuestro sistema anterior para las mismas respuestas, sin saber cuál era cuál, prefirió la nueva retroalimentación en 20 de 24 comparaciones, tanto al evaluar como lo haría un examinador como al evaluar como lo haría un estudiante.

Preguntas frecuentes

¿Qué modelo de IA es el más preciso al calificar CELPIP speaking? Al preguntárseles de forma simple: Claude Opus 5 con 62%, Gemini 58%, Claude Sonnet 5 y GPT-4o mini 45%, GPT 5.5 37%, GPT 5.6 sol 35%, GPT 5.6 luna 31%. Prepamigo Scoring Engine 2.0 alcanzó 81% en las mismas respuestas.

¿ChatGPT o Claude? Claude, claramente, al preguntárseles de forma simple: 62% y 45% frente a 35% y 37%. Con nuestro procedimiento completo la brecha se reduce a 77% para Opus 5 frente a 71% para GPT 5.6 sol.

¿Por qué todos le dan a mis respuestas fuertes un 7 u 8? Los modelos sin nada con qué comparar adivinan bajo y hacia la mitad, y una respuesta fuerte siempre tiene pequeños deslices. Al preguntárseles de forma simple, ningún modelo de propósito general reconoció más del 56% de las respuestas de nivel alto.

¿Cómo obtengo una mejor puntuación de un chatbot? Transcripción textual, respuestas de ejemplo en cada nivel, pregunta qué ejemplo en lugar de qué número, pregunta más de una vez y conserva la respuesta media. Ese procedimiento duplicó GPT 5.6 sol de 35% a 71% en nuestra prueba.

Para una mirada más de cerca a las dos comparaciones directas, lee Prepamigo vs Claude y Prepamigo vs ChatGPT. Para ver cómo funciona el procedimiento paso a paso, lee por dentro de Scoring Engine 2.0. O Grabar una respuesta y sáltate la transcripción. Leer esta guía en inglés.

¿Qué IA califica el speaking de CELPIP con más precisión? Probamos ocho | PrepAmigo