Producto

Prepamigo vs ChatGPT para CELPIP Speaking: precisión, límites y costo

7 de septiembre de 2026

Porcentaje de respuestas calificadas al nivel verificado

48 respuestas de speaking reservadas, 16 por banda. A cada modelo GPT se le dio la transcripción y se le pidió, en lenguaje simple, que la calificara en la escala de CELPIP; promedio de tres corridas. Engine 2.0 se ejecutó en su configuración normal de producción.

81%

Prepamigo Engine 2.0

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo frente a los planes de chatbot más populares

Dólares canadienses. Los precios de Prepamigo incluyen impuestos. Claude Max (desde US$100) y ChatGPT Pro (US$200) están convertidos a 1.38, antes de impuestos. La precisión es el porcentaje de respuestas del conjunto de prueba calificadas al nivel verificado cuando se le pide al modelo indicado, en lenguaje simple, que califique la respuesta; promedio de tres corridas.

Prepamigo
ChatGPT ProGPT 5.6 sol
Precio mensual
CA$24.98 (imp. inc.)
CA$276 (más imp.)
Calificación
Ilimitada
Limitada
Banco de preguntas
No
Sets de práctica
80
Ninguno
Tareas de práctica
2,000+
Ninguna
Formato CELPIP
No
Precisión
81%
35%
Respuestas de nivel alto
71%
25%

ChatGPT es probablemente la herramienta más común que usan los candidatos de CELPIP para calificar su propia práctica de speaking. Está en el teléfono de todos, responde en segundos, y con gusto te dirá qué nivel tuvo tu respuesta. La pregunta que responde este artículo es si el nivel que te dice es el nivel que realmente obtendrías. Hicimos la prueba tal como lo haría un estudiante: pegar la transcripción, pedir una puntuación, y contar.

La respuesta corta: en 48 respuestas de speaking que ninguno de los sistemas había visto, cada una con una puntuación verificada de forma independiente, Prepamigo Scoring Engine 2.0 acertó el nivel correcto el 81% de las veces. Al preguntársele de forma simple, GPT 5.6 sol, el modelo detrás de los planes de pago de ChatGPT, acertó el nivel correcto el 35% de las veces. GPT 5.5 logró 37%, GPT 5.6 luna 31%, y GPT-4o mini 45%, una cifra que parece mejor de lo que es, porque ese modelo califica casi todo bajo y por eso acierta en las respuestas débiles.

Luego hicimos algo que la mayoría de las comparaciones omiten. Le dimos a cada modelo GPT nuestro propio procedimiento de calificación, con ejemplos de calibración reales para cada tarea y una comparación forzada contra ellos, para ver qué tan bueno podía llegar a ser cada uno. GPT 5.6 sol subió a 71%, GPT 5.5 a 69%, luna a 63% y GPT-4o mini a 50%. Los cuatro quedaron por detrás de Engine 2.0, y los cuatro siguieron teniendo más dificultades con las respuestas de nivel alto. El resto de este artículo recorre ambas pruebas, los resultados en cada nivel de puntuación, por qué un asistente de propósito general se desplaza hacia la mitad de la escala, cómo es el flujo de trabajo diario en cada lado, y cuánto cuesta cada opción si piensas practicar en serio.

La prueba simple: lo que realmente obtiene un estudiante

Ochenta y uno por ciento frente a treinta y cinco. En una prueba de 48 respuestas, eso son veintidós puntuaciones correctas adicionales para Engine 2.0 sobre GPT 5.6 sol. Dicho de otra forma, Engine 2.0 comete un 71% menos de errores de calificación que GPT 5.6 sol, un 70% menos que GPT 5.5, un 73% menos que GPT 5.6 luna y un 66% menos que GPT-4o mini.

Tres corridas independientes de la prueba simple le dieron a GPT 5.6 sol 31%, 40% y 35%, y a GPT 5.5 35%, 42% y 33%. Esa variación entre corridas es en sí misma un hallazgo: pídele a ChatGPT que califique la misma transcripción en dos días distintos y, con bastante frecuencia, obtendrás dos puntuaciones diferentes. Engine 2.0 obtuvo 81.3% en cada una de sus tres corridas.

Dónde se abre la brecha: nivel de puntuación por nivel de puntuación

Una cifra general oculta dónde caen los errores. Un calificador que es excelente en respuestas débiles y pésimo en las fuertes está bien para un principiante y es activamente perjudicial para alguien que busca un 10. Así que aquí están los resultados de la prueba simple divididos por banda verificada.

Respuestas de nivel bajo (puntuación verificada de 4 o 5)

16 respuestas reservadas, instrucción simple, promedio de tres corridas. La mayoría de los errores son una puntuación de 3.

88%

Prepamigo Engine 2.0

75%

GPT-4o mini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

En las respuestas débiles, Engine 2.0 lidera con 88%. GPT-4o mini le sigue con 75%, que es el único lugar donde su hábito de calificar bajo le juega a favor. Los tres modelos GPT más grandes están entre 52% y 54%: aproximadamente la mitad de las veces califican una respuesta de 4 o 5 con un 3, lo cual es la banda equivocada aunque la dirección sea comprensible. Un principiante que use ChatGPT para calificarse escuchará, aproximadamente la mitad de las veces, que es peor de lo que realmente es.

Respuestas de nivel medio (puntuación verificada de 7 u 8)

16 respuestas reservadas, instrucción simple, promedio de tres corridas. Casi todos los errores son un 5 o un 6.

85%

Prepamigo Engine 2.0

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

La banda media es donde los modelos GPT con instrucción simple se desmoronan. Engine 2.0 está en 85%; GPT-4o mini en 44%; GPT 5.5, GPT 5.6 sol y luna entre 27% y 29%. Las respuestas de nivel medio contienen una mezcla real de fortalezas y debilidades que hay que sopesar, y sin ejemplos de calibración con los que comparar, los modelos GPT se fijan en las debilidades y otorgan un 5 o un 6. Un hablante de nivel 7 u 8 que le pida una puntuación a GPT 5.6 sol escuchará la banda correcta menos de tres veces de cada diez.

Respuestas de nivel alto (puntuación verificada de 10 o más)

16 respuestas reservadas, instrucción simple, promedio de tres corridas. Casi todos los errores son un 7 u 8.

71%

Prepamigo Engine 2.0

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

En el nivel alto, Engine 2.0 reconoce el 71% de las respuestas de nivel alto. GPT 5.5 reconoce el 27%, GPT 5.6 sol el 25%, GPT-4o mini el 17%, y GPT 5.6 luna el 13%. Todos los modelos GPT le dan un 7 u 8 a al menos siete de cada diez respuestas que merecen un 10.

Considera lo que eso significa para un candidato fuerte. Grabas ocho respuestas, las transcribes, las pegas en ChatGPT y le pides una puntuación, y te dice que seis de ellas son 7s y 8s. Concluyes que eres un hablante sólido de nivel medio con trabajo por hacer. Estabas en un 10 todo el tiempo. Eso no es hipotético. Es lo que hizo cada modelo GPT en la mayoría de las respuestas de nivel alto de nuestra prueba.

Si usas ChatGPT para calificarte y sigue dándote 7s y 8s, no le creas automáticamente. En nuestra prueba, una respuesta de nivel alto tenía tres veces más probabilidades de recibir un 7 u 8 de GPT 5.6 sol que una puntuación en su propia banda.

¿Qué pasa si le das a ChatGPT nuestro procedimiento completo?

Es tentador leer los números de la prueba simple como que GPT es una familia de modelos débil. No lo es. El problema no es la inteligencia. Es que un modelo al que se le pide un número, sin nada con qué comparar, adivina, y cuando adivina, lo hace bajo y hacia la mitad.

Así que realizamos la segunda prueba. Cada modelo GPT recibió el mismo paquete que reciben los calificadores de Engine 2.0: la transcripción, la tarea, dos ejemplos de calibración reales en cada nivel para esa tarea exacta, y la instrucción de nombrar el ejemplo más cercano para cada una de las cuatro dimensiones en lugar de producir un número. Cada modelo también recibió una breve nota de calibración ajustada a sus propias tendencias.

Con nuestro procedimiento completo: porcentaje de respuestas calificadas al nivel verificado

Las mismas 48 respuestas reservadas. Cada modelo GPT calificó cada respuesta una vez con las mismas transcripciones, instrucciones y ejemplos de calibración que los propios calificadores de Engine 2.0.

81%

Prepamigo Engine 2.0

71%

GPT 5.6 sol

69%

GPT 5.5

63%

GPT 5.6 luna

50%

GPT-4o mini

Los ejemplos de calibración marcan una diferencia enorme. GPT 5.6 sol se duplica, de 35% a 71%. GPT 5.5 pasa de 37% a 69%, luna de 31% a 63%. GPT-4o mini casi no se mueve, de 45% a 50%, porque sigue calificando todo bajo sin importar lo que se le muestre; con el procedimiento completo, no reconoció ninguna respuesta de nivel alto. Esto muestra dónde reside realmente el valor de un calificador diseñado a propósito: no en un modelo más inteligente, sino en ejemplos reales de cómo suena cada nivel en cada tarea específica, y en una pregunta que obliga al modelo a comparar en lugar de adivinar.

Aun así, todos los modelos GPT quedan por detrás. Con el procedimiento completo, GPT 5.6 sol está diez puntos por detrás de Engine 2.0 en general, diez puntos por detrás en la banda media (75% frente a 85%), y ocho puntos por detrás en la parte alta (63% frente a 71%). Su hábito restante es recompensar en exceso la fluidez: un 8 competente con una entrega fluida se empuja hacia un 9 o un 10. GPT 5.6 luna hace lo opuesto, arrastrando las respuestas medias hacia el 5, y termina la banda media en 44%. Un solo modelo que hace un solo intento sigue teniendo un sesgo característico, y Engine 2.0 cierra la brecha restante con dos calificadores independientes de diferentes proveedores, tres votos de cada uno con el voto medio conservado, y una regla de reconciliación que toma la puntuación más alta cuando los dos calificadores discrepan mucho.

También probamos el atajo obvio: mantener la instrucción simple y añadir indicaciones como “no te desplaces hacia la mitad” o “una respuesta de nivel 9 no tiene que ser perfecta”. No produjeron ningún cambio medible. Lo que funciona es cambiar la pregunta, y darle al modelo algo real con qué comparar.

La brecha de flujo de trabajo: grabar y listo, o hacerlo todo tú mismo

Las cifras de precisión suponen que la calificación realmente ocurre. Con ChatGPT, hay una cantidad sorprendente de trabajo entre presionar detener en tu grabación y leer una puntuación, y parte de ese trabajo cambia la puntuación.

Primero, necesitas una transcripción. El modo de voz de ChatGPT es una conversación, no un calificador; para calificar una respuesta grabada necesitas texto. Eso significa o bien escribir lo que dijiste, lo cual lo modifica, o pasar la grabación por una herramienta de transcripción. Y la transcripción tiene que ser textual. Cada muletilla, cada reinicio, cada autocorrección tiene que quedarse. Cuando probamos una transcripción “limpia” con las vacilaciones eliminadas, la precisión cayó quince puntos, porque esas vacilaciones son exactamente la evidencia que un calificador necesita para juzgar cómo suena una respuesta. La mayoría de las herramientas de transcripción para consumidores, incluida la integrada en la mayoría de los teléfonos, limpian por defecto.

Segundo, necesitas la tarea. ChatGPT puede inventar una indicación al estilo CELPIP si se lo pides, pero está adivinando el formato, el tiempo y el tipo de escenario que usa la prueba real. No sabrás si la indicación que escribió se parece a lo que enfrentarás.

Tercero, si quieres algo mejor que los números de la prueba simple, necesitas ejemplos de calibración: respuestas reales de cada nivel para el mismo tipo de tarea, con niveles verificados. Ese es el insumo que duplicó la precisión de GPT 5.6 sol en nuestra prueba, y es el que un estudiante no puede producir en casa.

Cuarto, haces todo eso otra vez para la siguiente respuesta, y cada una cuenta contra tu asignación de mensajes.

En Prepamigo, eliges una tarea del banco, el temporizador corre, hablas, y unos diez segundos después de detenerte, la puntuación y la retroalimentación aparecen en la pantalla. La transcripción es textual por diseño, los ejemplos de calibración están adjuntos a la tarea automáticamente, y no hay nada que pegar ni nada que indicar. La undécima respuesta de la noche te cuesta el mismo esfuerzo que la primera.

Consistencia: la misma respuesta, la misma puntuación

Una puntuación que no puedes reproducir no es una medición. Si la misma grabación obtiene un 8 el lunes y un 10 el martes, no has aprendido nada sobre tu speaking. Así que también probamos la repetibilidad.

Engine 2.0 se ejecutó sobre las 48 respuestas reservadas tres veces distintas en días diferentes. Obtuvo 81.3% cada vez. Al observar las respuestas individuales, el 87.5% recibió una puntuación idéntica en las tres corridas, y solo el 4.2% cambió alguna vez en dos puntos o más, todas ellas respuestas que están en el límite entre dos bandas.

La prueba simple en GPT 5.6 sol se movió nueve puntos entre su mejor y su peor corrida. Esa brecha de estabilidad proviene de la votación. Cada calificador de Engine 2.0 vota tres veces en cada respuesta y se conserva el voto medio. Cuando probamos la misma configuración con un solo voto en lugar de tres, las puntuaciones idénticas entre corridas cayeron de 87.5% a 77%, y el porcentaje de respuestas que saltaban dos puntos o más se más que duplicó. Una sola conversación con ChatGPT es un solo voto. También verificamos si fijar una semilla aleatoria a través de la API hacía que los modelos GPT fueran más repetibles. No fue así; en GPT 5.6 luna, la repetibilidad de hecho cayó.

Retroalimentación que puedes aprovechar

ChatGPT es bueno explicando. Si le preguntas por qué dio una puntuación, te lo dirá extensamente, en inglés claro, y sugerirá mejoras. Para un candidato que quiere conversar sobre una respuesta, eso es genuinamente valioso.

El riesgo es que una explicación fluida no es lo mismo que un diagnóstico preciso. Un modelo que califica un 10 como un 7 explicará, de forma convincente, por qué es un 7. Encontrará algo a lo que señalar. Y como no tuvo que comprometerse con evidencia antes de calificar, la explicación se escribe después de los hechos para justificar un número que ya eligió.

Engine 2.0 funciona al revés. Cada calificador tiene que señalar evidencia para cada dimensión antes de nombrar un nivel, y la retroalimentación se escribe a partir de esa evidencia. Cita tus propias palabras: en una auditoría de 158 citas en una muestra de retroalimentación, 157 aparecieron textualmente en la transcripción. Cuando un modelo juzgador independiente comparó la retroalimentación de Engine 2.0 con la de nuestro sistema anterior sobre las mismas respuestas, a ciegas, prefirió Engine 2.0 en 20 de 24 comparaciones, tanto al juzgar como lo haría un examinador como al juzgar como lo haría un estudiante.

También verificamos que la retroalimentación ubique la crítica en el lugar correcto, tomando respuestas fuertes y dañando deliberadamente una dimensión a la vez. En tres de cuatro casos, la dimensión dañada fue la que más cayó en puntuación. Esa es una prueba que un chatbot no puede aprobar fácilmente, porque no tiene dimensiones fijas contra las cuales comprobarse.

Cuánto cuesta practicar todos los días

Una puntuación de speaking es más útil en tu cuadragésima respuesta, no en la cuarta. Ahí es cuando empieza a decirte si un cambio en tu forma de hablar realmente está funcionando. Así que la pregunta práctica es cuánto cuesta usar cada herramienta en volumen.

ChatGPT Plus cuesta US$20 al mes, unos CA$28, facturado mensualmente, según lo publicado en septiembre de 2026. Te da acceso a la familia GPT 5.6 con un límite de mensajes por ventana móvil; las transcripciones largas con ejemplos de calibración adjuntos son exactamente el tipo de mensaje que consume mucho de esa asignación, y una vez que la alcanzas, esperas o bajas a un modelo más pequeño. ChatGPT Pro, a US$200 al mes, unos CA$276 antes de impuestos, eleva los límites sustancialmente. El nivel gratuito dirige gran parte de su tráfico a modelos más pequeños, y en esta prueba el más pequeño de ellos reconoció casi ninguna respuesta de nivel alto. Ninguno de los planes incluye un banco de preguntas, un temporizador, transcripción textual, ejemplos de calibración, ni nada específico de CELPIP.

Prepamigo cuesta CA$24.98 al mes, o CA$8.25 al mes en el plan anual, que es CA$98.98 al año, con impuestos incluidos, y puedes cancelar en cualquier momento. Todos los planes incluyen calificación ilimitada por Engine 2.0 sin límite diario, por sesión ni semanal, intentos ilimitados, y el banco de preguntas completo: 80 sets de práctica completos y más de 2,000 tareas de práctica en Speaking, Writing, Reading y Listening, escritas para seguir los tipos de tarea, los tiempos y el formato del examen CELPIP General.

En pocas palabras: por menos del precio de ChatGPT Plus, obtienes un calificador más del doble de preciso en una comparación simple, que nunca te hace esperar, y que viene con las preguntas y los ejemplos de calibración ya listos.

Cuándo ChatGPT es la mejor herramienta

Este no es un argumento para nunca abrir ChatGPT mientras te preparas para CELPIP. Un candidato serio bien podría usar ambos.

  • Conversar sobre una respuesta. Si quieres entender por qué una razón era débil o generar tres mejores, una conversación es la forma adecuada. Engine 2.0 te da un veredicto y evidencia; no conversa.
  • Vocabulario y frases. Pedir cinco formas más naturales de decir algo es rápido y útil.
  • Hablarle a algo que te responde. El modo de voz de ChatGPT es una forma razonable de sentirte cómodo hablando inglés en voz alta. No es un calificador, pero es compañía.
  • Práctica de writing. Las respuestas escritas no necesitan transcripción, así que la brecha de flujo de trabajo es menor. La precisión de GPT en writing no fue parte de esta prueba y no hacemos ninguna afirmación sobre ella.
  • Cualquier cosa fuera del examen. ChatGPT es un asistente general y Prepamigo no lo es.

Lo que ChatGPT no debería ser, según la evidencia aquí presentada, es lo que te dice si estás listo. Para eso quieres un calificador construido para esa tarea, probado en respuestas que no había visto, y medido nivel por nivel.

Qué hay de nuevo en tu retroalimentación

Engine 2.0 llega con una capa de retroalimentación reconstruida. Lee la evidencia de los dos calificadores, no solo el puntaje, y fue probada con tres tipos de estudiante: alguien que se enfrenta al CELPIP por primera vez, alguien con inglés débil que busca el truco, y alguien con media hora al día y un examen la próxima semana. Esto es lo que cambió.

  • Tus propias palabras, citadas de vuelta. Cada punto de retroalimentación cita la frase exacta de tu transcripción a la que reaccionaron los calificadores. Si una frase aparece entre comillas, está copiada palabra por palabra; en nuestra auditoría, 157 de 158 citas lo estaban. La retroalimentación nunca inventa algo que no dijiste.
  • Una sola cosa que corregir primero. Cada respuesta recibe una acción principal: el único cambio que más elevaría tu puntaje, escrito con las palabras más sencillas posibles. Le siguen dos acciones concretas más, y luego una lista de tres puntos para repasar mentalmente antes de empezar a hablar.
  • Consejos según la tarea. Dar un consejo, describir una escena y persuadir a alguien se califican según criterios distintos. La retroalimentación ahora sabe qué premia cada uno de los ocho tipos de tarea y se dirige a eso, en lugar de repetir los mismos consejos genéricos en todas las tareas.
  • Qué dimensión practicar primero. La retroalimentación te dice cuál de las cuatro dimensiones es tu punto más débil y cuál el más fuerte, para que sepas dónde está el próximo punto, sin esconderlo detrás de un número.
  • Lo que pedía la tarea y no cubriste. En el cumplimiento de la tarea, la retroalimentación enumera las partes específicas del enunciado que no cubriste, o dice claramente que las cubriste todas.
  • Cosas que sí puedes ensayar. Cada consejo práctico es algo que puedes decir en voz alta antes de tu próximo intento. Nada de sugerencias para hablar más claro o reducir tu acento: el acento no es lo que mide la inteligibilidad, y la retroalimentación nunca comenta sobre él.
  • Sin culpar al reloj. Una respuesta interrumpida por el cronómetro después de haber cumplido la tarea no se penaliza por el corte, y la retroalimentación no te reprende por ello.

Cuando un modelo evaluador independiente comparó esta retroalimentación con la que producía nuestro sistema anterior para las mismas respuestas, sin saber cuál era cuál, prefirió la nueva retroalimentación en 20 de 24 comparaciones, tanto al evaluar como lo haría un examinador como al evaluar como lo haría un estudiante.

Preguntas frecuentes

¿Puede ChatGPT calificar mi práctica de CELPIP speaking? Te dará un número. Al preguntársele de forma simple sobre 48 respuestas no vistas con puntuaciones verificadas, GPT 5.6 sol acertó el 35% de las veces, GPT 5.5 el 37%, luna el 31%, GPT-4o mini el 45%, frente al 81% de Engine 2.0. En las respuestas de nivel alto, GPT 5.6 sol acertó el 25% de las veces.

¿Es Prepamigo más preciso que ChatGPT? 81% frente a 35% de GPT 5.6 sol con una solicitud simple. Con nuestro procedimiento completo y ejemplos de calibración, GPT 5.6 sol alcanzó 71%, todavía diez puntos por detrás.

¿Cuánto cuesta cada uno? ChatGPT Pro cuesta US$200 al mes, unos CA$276 antes de impuestos; Plus cuesta US$20 con límites de mensajes. Prepamigo cuesta CA$24.98 al mes con impuestos incluidos, o CA$8.25 al mes en el plan anual, con calificación ilimitada y 80 sets de práctica.

¿Qué modelo de GPT debería usar si de todos modos uso ChatGPT? Con una instrucción simple, ninguno lo hace bien. Con ejemplos de calibración, GPT 5.6 sol. Nunca GPT-4o mini si estás cerca de un 10.

Para la misma comparación frente a Claude, lee Prepamigo vs Claude. Para la clasificación completa de ocho sistemas, lee qué IA califica el speaking de CELPIP con más precisión. O sáltate la transcripción y Grabar una respuesta. Leer esta guía en inglés.

Prepamigo vs ChatGPT para CELPIP Speaking: precisión, límites y costo | PrepAmigo