Producto

Prepamigo vs Claude para CELPIP Speaking: ¿Cuál te da la puntuación correcta?

7 de septiembre de 2026

Porcentaje de respuestas calificadas al nivel verificado

48 respuestas de speaking reservadas para la prueba, 16 en cada uno de tres niveles. A Claude se le dio la transcripción y se le pidió, en lenguaje simple, que la calificara en la escala de CELPIP; promedio de tres corridas. Engine 2.0 se ejecutó en su configuración normal de producción.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

45%

Claude Sonnet 5

Prepamigo frente a los planes de chatbot más populares

Dólares canadienses. Los precios de Prepamigo incluyen impuestos. Claude Max (desde US$100) y ChatGPT Pro (US$200) están convertidos a 1.38, antes de impuestos. La precisión es el porcentaje de respuestas del conjunto de prueba calificadas al nivel verificado cuando se le pide al modelo indicado, en lenguaje simple, que califique la respuesta; promedio de tres corridas.

Prepamigo
Claude MaxOpus 5
Precio mensual
CA$24.98 (imp. inc.)
CA$138+ (más imp.)
Calificación
Ilimitada
Limitada
Banco de preguntas
No
Sets de práctica
80
Ninguno
Tareas de práctica
2,000+
Ninguna
Formato CELPIP
No
Precisión
81%
62%
Respuestas de nivel alto
71%
50%

Si alguna vez has pegado una transcripción de speaking en Claude y le has pedido que te califique como lo haría un examinador de CELPIP, ya conoces el atractivo. Responde al instante, se explica a sí mismo y nunca se cansa. La pregunta es si el número que te da es el número que realmente obtendrías. Hicimos esa prueba tal como la haría un estudiante: la misma transcripción, una solicitud simple de puntuación, y luego contamos.

La respuesta corta: en 48 respuestas de speaking que los sistemas nunca habían visto, cada una con una puntuación verificada de forma independiente, Prepamigo Scoring Engine 2.0 acertó el nivel correcto el 81% de las veces. Al pedírsele en lenguaje simple que calificara las mismas transcripciones, Claude Opus 5 acertó el nivel correcto el 62% de las veces y Claude Sonnet 5 el 45% de las veces. La brecha es más amplia justo donde más importa para quien busca una puntuación alta: en las respuestas de nivel alto, Engine 2.0 reconoció el 71%, Opus 5 reconoció el 50%, y Sonnet 5 reconoció el 29%.

Luego hicimos algo que la mayoría de las comparaciones omiten. Le dimos a Claude nuestro propio procedimiento de calificación, con ejemplos de calibración reales para cada tarea y una comparación forzada contra ellos, para ver qué tan bueno podía llegar a ser. Opus 5 subió a 77% y Sonnet 5 a 69%. Ambos quedaron por detrás de Engine 2.0, y ambos siguieron teniendo más dificultades con las respuestas de nivel alto. El resto de este artículo recorre ambas pruebas, cómo se ven los números en cada nivel de puntuación, por qué un asistente de propósito general se desplaza hacia la mitad de la escala, cómo es el flujo de trabajo diario en cada lado, y cuánto cuesta cada opción si piensas practicar en serio.

La prueba simple: lo que realmente obtiene un estudiante

Ochenta y uno por ciento frente a sesenta y dos y cuarenta y cinco. En una prueba de 48 respuestas, la diferencia entre Engine 2.0 y Opus 5 es de nueve puntuaciones correctas adicionales, y la diferencia entre Engine 2.0 y Sonnet 5 es de diecisiete. Dicho de otra forma, Engine 2.0 comete un 51% menos de errores de calificación que Opus 5 y un 66% menos que Sonnet 5.

Tres corridas independientes de la prueba simple le dieron a Opus 5 62%, 65% y 58%, y a Sonnet 5 44%, 46% y 46%. Esa variación de varios puntos entre corridas es en sí misma un hallazgo: pídele a Claude que califique la misma transcripción en dos días distintos y, con bastante frecuencia, obtendrás dos puntuaciones diferentes. Engine 2.0 obtuvo 81.3% en cada una de sus tres corridas.

Dónde se abre la brecha: nivel de puntuación por nivel de puntuación

La mayoría de los calificadores, humanos o de máquina, se desplazan hacia la mitad de la escala. Una respuesta fuerte se convierte en un 8 en lugar de un 10; una débil se convierte en un 6 en lugar de un 5. Ese desplazamiento es invisible en un promedio y evidente en el momento en que se dividen los resultados por nivel. Con una instrucción simple, Claude añade un segundo hábito: se desplaza hacia abajo, de modo que incluso las respuestas débiles suelen calificarse por debajo de su nivel.

Respuestas de nivel bajo (puntuación verificada de 4 o 5)

16 respuestas reservadas, instrucción simple, promedio de tres corridas. Los errores de Sonnet 5 aquí son principalmente puntuaciones de 3.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

44%

Claude Sonnet 5

En las respuestas débiles, Engine 2.0 lidera con 88%, Opus 5 le sigue con 77%, y Sonnet 5 cae a 44%. Este es el extremo fácil de la escala, y Opus 5 lo maneja razonablemente bien. Sonnet 5 no: califica una respuesta de 4 o 5 con un 3 más a menudo que no, lo cual es el nivel equivocado aunque la dirección sea comprensible. Un estudiante en este nivel que use Sonnet 5 para calificarse escuchará, la mayoría de las veces, que es peor de lo que realmente es.

Respuestas de nivel medio (puntuación verificada de 7 u 8)

16 respuestas reservadas, instrucción simple, promedio de tres corridas. Casi todos los errores son un 6.

85%

Prepamigo Engine 2.0

63%

Claude Sonnet 5

58%

Claude Opus 5

En el nivel medio, Engine 2.0 está en 85% y los dos modelos de Claude están en 63% y 58%. Las respuestas de nivel medio contienen una mezcla de fortalezas y debilidades que hay que sopesar en lugar de simplemente detectar, y sin ejemplos de calibración con los que comparar, ambos modelos de Claude tienden a fijarse en las debilidades y otorgar un 6. Un hablante de nivel 7 u 8 escuchará que es un 6 aproximadamente cuatro veces de cada diez.

Respuestas de nivel alto (puntuación verificada de 10 o más)

16 respuestas reservadas, instrucción simple, promedio de tres corridas. Casi todos los errores son un 7 u 8.

71%

Prepamigo Engine 2.0

50%

Claude Opus 5

29%

Claude Sonnet 5

En el nivel alto, Engine 2.0 reconoce el 71% de las respuestas de nivel alto. Opus 5 reconoce la mitad. Sonnet 5 reconoce el 29%, lo que significa que le da un 7 u 8 a siete de cada diez respuestas que merecen un 10.

Piensa en lo que eso significa en la práctica. Supón que tu speaking realmente está en un 10 hoy. Grabas ocho respuestas, las transcribes, las pegas en Claude Sonnet 5 y le pides una puntuación, y te dice que seis de ellas son 7s y 8s. Concluyes que no estás listo. Pasas tres semanas más practicando. Estabas listo todo el tiempo. Ese no es un escenario hipotético; es el error individual más común en toda nuestra prueba, y recae con más fuerza sobre los candidatos que más han trabajado.

Si usas Claude para calificarte y sigue dándote 7s y 8s, no le creas automáticamente. En nuestra prueba, una respuesta de nivel alto tenía más probabilidades de recibir un 8 de Sonnet 5 que un 10. Un 8 de Claude es una razón para buscar una segunda opinión, no un veredicto.

¿Qué pasa si le das a Claude nuestro procedimiento completo?

Es tentador leer los números de la prueba simple como que Claude es un modelo débil. No lo es. Opus 5 es, por un margen considerable, el calificador de propósito general más fuerte que hemos probado. El problema no es la inteligencia. Es que un modelo al que se le pide un número, sin nada con qué comparar, adivina, y cuando adivina, lo hace bajo y hacia la mitad.

Así que realizamos la segunda prueba. Claude recibió el mismo paquete que reciben los calificadores de Engine 2.0: la transcripción, la tarea, dos ejemplos de calibración reales en cada nivel para esa tarea exacta, y la instrucción de nombrar el ejemplo más cercano para cada una de las cuatro dimensiones en lugar de producir un número. Cada modelo también recibió una breve nota de calibración ajustada a sus propias tendencias.

Con nuestro procedimiento completo: porcentaje de respuestas calificadas al nivel verificado

Las mismas 48 respuestas reservadas. Cada modelo de Claude calificó cada respuesta una vez con las mismas transcripciones, instrucciones y ejemplos de calibración que los propios calificadores de Engine 2.0.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

69%

Claude Sonnet 5

Los ejemplos de calibración marcan una gran diferencia. Opus 5 sube de 62% a 77%; Sonnet 5 de 45% a 69%. La precisión en el nivel bajo alcanza 88% para ambos, lo mismo que Engine 2.0. La precisión en el nivel medio alcanza 81% para ambos. Vale la pena detenerse en esto, porque muestra dónde reside realmente el valor de un calificador diseñado a propósito: no en un modelo más inteligente, sino en ejemplos reales de cómo suena cada nivel en cada tarea específica, y en una pregunta que obliga al modelo a comparar en lugar de adivinar.

Aun así, ambos modelos quedan por detrás en la parte alta de la escala. Con el procedimiento completo, Opus 5 reconoce el 63% de las respuestas de nivel alto y Sonnet 5 reconoce el 38%, frente al 71% de Engine 2.0. Un solo modelo que hace un solo intento sigue conteniéndose ante una respuesta fuerte que tiene algún desliz. Engine 2.0 cierra la brecha restante con tres cosas más: dos calificadores independientes de diferentes proveedores, tres votos de cada uno con el voto medio conservado, y una regla de reconciliación que toma la puntuación más alta cuando los dos calificadores discrepan mucho, porque el análisis mostró que el veredicto más bajo casi siempre era el equivocado en las respuestas fuertes.

También probamos el atajo obvio: mantener la instrucción simple y añadir indicaciones como “no te desplaces hacia la mitad” o “una respuesta de nivel 9 no tiene que ser perfecta”. No produjeron ningún cambio medible. El modelo está de acuerdo con la instrucción y luego hace lo que iba a hacer de todos modos. Lo que funciona es cambiar la pregunta, y darle algo real con qué comparar.

La brecha de flujo de trabajo: grabar y listo, o hacerlo todo tú mismo

Las cifras de precisión suponen que la calificación realmente ocurre. Con Claude, hay una cantidad sorprendente de trabajo entre presionar detener en tu grabación y leer una puntuación.

Primero, necesitas una transcripción. La interfaz de chat de Claude no califica grabaciones de audio, así que necesitas producir texto. Eso significa o bien escribir lo que dijiste, lo cual lo modifica, o pasar la grabación por una herramienta de transcripción. Y aquí hay un detalle que nos costó mucha precisión antes de entenderlo: la transcripción tiene que ser textual. Cada muletilla, cada reinicio, cada autocorrección tiene que quedarse. Cuando probamos una transcripción “limpia” con las vacilaciones eliminadas, la precisión cayó quince puntos, porque esas vacilaciones son exactamente la evidencia que un calificador necesita para juzgar cómo suena una respuesta. La mayoría de las herramientas de transcripción para consumidores limpian por defecto.

Segundo, necesitas la tarea. Claude no tiene un banco de indicaciones al estilo CELPIP con el tiempo y el formato correctos. O escribes la tuya, lo que significa adivinar lo que pregunta la prueba real, o encuentras una en otro lugar y la pegas junto con la transcripción.

Tercero, si quieres algo mejor que los números de la prueba simple, necesitas ejemplos de calibración: respuestas reales de cada nivel para el mismo tipo de tarea, con niveles verificados. Ese es el insumo que llevó a Opus 5 de 62% a 77% en nuestra prueba, y es el que un estudiante no puede producir en casa.

Cuarto, haces todo eso otra vez para la siguiente respuesta. Y para la siguiente.

En Prepamigo, eliges una tarea del banco, el temporizador corre, hablas, y unos diez segundos después de detenerte, la puntuación y la retroalimentación aparecen en la pantalla. La transcripción es textual por diseño, los ejemplos de calibración están adjuntos a la tarea automáticamente, y no hay nada que pegar ni nada que indicar. La undécima respuesta de la noche te cuesta el mismo esfuerzo que la primera.

Consistencia: la misma respuesta, la misma puntuación

Una puntuación que no puedes reproducir no es una medición. Si la misma grabación obtiene un 8 el lunes y un 10 el martes, no has aprendido nada sobre tu speaking y sí algo sobre el estado de ánimo del calificador. Así que también probamos si cada sistema da la misma respuesta dos veces.

Engine 2.0 se ejecutó sobre las 48 respuestas reservadas tres veces distintas. Obtuvo 81.3% en cada corrida. Al observar las respuestas individuales en lugar del agregado, el 87.5% recibió una puntuación idéntica en las tres corridas, y solo el 4.2% cambió alguna vez en dos puntos o más. Esas pocas son respuestas que están justo en el límite entre dos niveles, donde una pequeña diferencia de criterio legítimamente inclina la puntuación en un sentido u otro.

La prueba simple en Claude se movió varios puntos entre corridas a nivel agregado, y más a nivel de respuestas individuales. Esa brecha de consistencia no es un accidente de los modelos involucrados. Proviene de la votación. Cada calificador de Engine 2.0 vota tres veces en cada respuesta y se conserva el voto medio, lo que elimina el valor atípico ocasional que produce un solo intento. Cuando probamos la misma configuración con un solo voto en lugar de tres, la coincidencia entre corridas cayó de 87.5% a 77.1%. Una sola conversación con Claude es un solo voto.

Retroalimentación que puedes aprovechar

Una puntuación te dice dónde estás. La retroalimentación te dice qué hacer a continuación, y esta es un área donde Claude es genuinamente bueno. Escribe con claridad, es paciente, y si le preguntas por qué dio una puntuación en particular te lo explicará con la extensión que quieras. Para un candidato que quiere conversar sobre una respuesta, eso es valioso.

El riesgo es el mismo que con la puntuación: una explicación fluida no es lo mismo que un diagnóstico preciso. Un modelo que califica un 10 como un 7 explicará, de forma convincente, por qué es un 7. Encontrará algo a lo que señalar. Y como Claude no tuvo que comprometerse con evidencia antes de calificar, la explicación se escribe después de los hechos, para justificar un número que ya eligió.

Engine 2.0 funciona al revés. Como cada calificador tiene que señalar evidencia para cada dimensión que juzga, la capa de retroalimentación recibe esa evidencia directamente: las frases exactas de tu transcripción que respaldaron el veredicto sobre el contenido, el vocabulario, cómo sonaste, y si completaste la tarea. La retroalimentación se escribe a partir de esa evidencia y cita tus propias palabras. En nuestra auditoría de 158 citas en una muestra de retroalimentación, 157 aparecieron textualmente en la transcripción. Cuando le pedimos a un modelo juzgador independiente que comparara la retroalimentación de Engine 2.0 con la que producía nuestro sistema anterior, sin saber cuál era cuál, prefirió Engine 2.0 en 20 de 24 comparaciones, tanto al juzgar como lo haría un examinador como al juzgar como lo haría un estudiante.

También probamos si la retroalimentación ubica la crítica en el lugar correcto. Tomamos respuestas fuertes y dañamos deliberadamente un aspecto de cada una: insertando errores de gramática y muletillas, cambiando palabras precisas por vagas, eliminando detalles de apoyo, o quitando la acción central que pedía la tarea. En tres de los cuatro casos, la dimensión que habíamos dañado fue la que más cayó en puntuación. Ese es el tipo de prueba que un chatbot no puede aprobar fácilmente, porque no tiene dimensiones fijas contra las cuales comprobarse.

Cuánto cuesta practicar todos los días

Una puntuación de speaking es más útil en tu cuadragésima respuesta, no en la cuarta. Ahí es cuando empieza a decirte si un cambio en tu forma de hablar realmente está funcionando. Así que la pregunta práctica no es cuánto cuesta cada herramienta, sino cuánto cuesta usarla en volumen.

Claude Pro cuesta US$20 al mes, unos CA$28, o US$17 al mes con facturación anual, según lo publicado en claude.com en septiembre de 2026. Viene con una ventana de uso móvil de cinco horas y un límite semanal; cuando alcanzas cualquiera de los dos, esperas. Las transcripciones largas con ejemplos de calibración adjuntos son exactamente el tipo de mensaje que consume mucho de esa asignación. Los planes Max, desde US$100 al mes, unos CA$138 antes de impuestos, elevan los límites sustancialmente pero no los eliminan. Ninguno de los planes incluye un banco de preguntas, un temporizador, transcripción, ejemplos de calibración, ni nada específico de CELPIP.

Prepamigo cuesta CA$24.98 al mes, o CA$8.25 al mes en el plan anual, que es CA$98.98 al año, con impuestos incluidos, y puedes cancelar en cualquier momento. Todos los planes incluyen calificación ilimitada por Engine 2.0 sin límite diario, por sesión ni semanal, intentos ilimitados, y el banco de preguntas completo: 80 sets de práctica completos y más de 2,000 tareas de práctica en Speaking, Writing, Reading y Listening, escritas para seguir los tipos de tarea, los tiempos y el formato del examen CELPIP General.

En pocas palabras: por menos del precio de Claude Pro, obtienes un calificador mucho más preciso en las respuestas que más importan, que nunca te hace esperar, y que viene con las preguntas y los ejemplos de calibración ya listos.

Cuándo Claude es la mejor herramienta

Este no es un artículo que argumente que nunca debas abrir Claude mientras te preparas para CELPIP. Hay varias cosas que hace mejor que un motor de calificación especializado, y un candidato serio bien podría usar ambos.

  • Conversar sobre una respuesta. Si quieres entender por qué una razón en particular era débil, o generar tres mejores, una conversación es la forma adecuada. Engine 2.0 te da un veredicto y evidencia; no conversa.
  • Ayuda con vocabulario y frases. Pedirle a Claude cinco formas más naturales de decir algo es rápido y útil, y sus sugerencias suelen ser buenas.
  • Práctica de writing. Las respuestas escritas no necesitan transcripción, así que la brecha de flujo de trabajo es mucho menor. La precisión de Claude en writing no fue parte de esta prueba, y aquí no hacemos ninguna afirmación sobre ella.
  • Cualquier cosa fuera del examen. Preguntas sobre trámites de inmigración, horarios de estudio, explicar un punto de gramática: Claude es un asistente general y Prepamigo no lo es.

Lo que Claude no debería ser, según la evidencia aquí presentada, es lo que te dice si estás listo. Para eso quieres un calificador construido para esa tarea, probado en respuestas que no había visto, y medido nivel por nivel.

Qué hay de nuevo en tu retroalimentación

Engine 2.0 llega con una capa de retroalimentación reconstruida. Lee la evidencia de los dos calificadores, no solo el puntaje, y fue probada con tres tipos de estudiante: alguien que se enfrenta al CELPIP por primera vez, alguien con inglés débil que busca el truco, y alguien con media hora al día y un examen la próxima semana. Esto es lo que cambió.

  • Tus propias palabras, citadas de vuelta. Cada punto de retroalimentación cita la frase exacta de tu transcripción a la que reaccionaron los calificadores. Si una frase aparece entre comillas, está copiada palabra por palabra; en nuestra auditoría, 157 de 158 citas lo estaban. La retroalimentación nunca inventa algo que no dijiste.
  • Una sola cosa que corregir primero. Cada respuesta recibe una acción principal: el único cambio que más elevaría tu puntaje, escrito con las palabras más sencillas posibles. Le siguen dos acciones concretas más, y luego una lista de tres puntos para repasar mentalmente antes de empezar a hablar.
  • Consejos según la tarea. Dar un consejo, describir una escena y persuadir a alguien se califican según criterios distintos. La retroalimentación ahora sabe qué premia cada uno de los ocho tipos de tarea y se dirige a eso, en lugar de repetir los mismos consejos genéricos en todas las tareas.
  • Qué dimensión practicar primero. La retroalimentación te dice cuál de las cuatro dimensiones es tu punto más débil y cuál el más fuerte, para que sepas dónde está el próximo punto, sin esconderlo detrás de un número.
  • Lo que pedía la tarea y no cubriste. En el cumplimiento de la tarea, la retroalimentación enumera las partes específicas del enunciado que no cubriste, o dice claramente que las cubriste todas.
  • Cosas que sí puedes ensayar. Cada consejo práctico es algo que puedes decir en voz alta antes de tu próximo intento. Nada de sugerencias para hablar más claro o reducir tu acento: el acento no es lo que mide la inteligibilidad, y la retroalimentación nunca comenta sobre él.
  • Sin culpar al reloj. Una respuesta interrumpida por el cronómetro después de haber cumplido la tarea no se penaliza por el corte, y la retroalimentación no te reprende por ello.

Cuando un modelo evaluador independiente comparó esta retroalimentación con la que producía nuestro sistema anterior para las mismas respuestas, sin saber cuál era cuál, prefirió la nueva retroalimentación en 20 de 24 comparaciones, tanto al evaluar como lo haría un examinador como al evaluar como lo haría un estudiante.

Preguntas frecuentes

¿Puede Claude calificar mi práctica de CELPIP speaking? Te dará un número. Al preguntársele de forma simple sobre 48 respuestas no vistas con puntuaciones verificadas, Claude Opus 5 acertó el nivel verificado el 62% de las veces y Claude Sonnet 5 el 45% de las veces, frente al 81% de Prepamigo Scoring Engine 2.0. En las respuestas de nivel alto, Sonnet 5 acertó el 29% de las veces.

¿Es Prepamigo más preciso que Claude? Sí: 81% frente a 62% y 45% con una solicitud simple. Con nuestro procedimiento completo y ejemplos de calibración, Opus 5 alcanzó 77% y Sonnet 5 69%, todavía por detrás, y todavía más débiles en la parte alta de la escala.

¿Cuánto cuesta cada uno? Claude Max comienza en US$100 al mes, unos CA$138 antes de impuestos, con límites de uso; Claude Pro cuesta US$20 con límites más estrictos. Prepamigo cuesta CA$24.98 al mes con impuestos incluidos, o CA$8.25 al mes en el plan anual, con calificación ilimitada y 80 sets de práctica.

¿Por qué Claude sigue dándole a mis respuestas fuertes un 7 o un 8? Un modelo al que se le pide un número sin nada con qué comparar se desplaza hacia abajo y hacia la mitad, y una respuesta de nivel alto nunca es perfecta. Al preguntársele de forma simple, Sonnet 5 le dio a una respuesta de nivel alto un 9 o más solo el 29% de las veces.

Para ver cómo funciona realmente la calificación, lee por dentro de Scoring Engine 2.0. Para ver la clasificación completa incluyendo GPT y Gemini, lee qué IA califica el speaking de CELPIP con más precisión. O sáltate la lectura y Grabar una respuesta. Leer esta guía en inglés.

Prepamigo vs Claude para CELPIP Speaking: ¿Cuál te da la puntuación correcta? | PrepAmigo