Prepamigo Scoring Engine 2.0 ਬਨਾਮ ਫਰੰਟੀਅਰ ਮਾਡਲ ਗ੍ਰੇਡਰਾਂ ਵਜੋਂ
ਸਪੀਕਿੰਗ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਜਿੱਥੇ ਸਕੋਰ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਸੀ। 48 ਜਵਾਬ ਜੋ ਸਿਸਟਮਾਂ ਨੇ ਕਦੇ ਨਹੀਂ ਦੇਖੇ ਸਨ, ਹੇਠਲੇ, ਮੱਧ ਅਤੇ ਟੌਪ ਸਕੋਰਾਂ ਵਿੱਚ ਬਰਾਬਰ ਫੈਲੇ ਹੋਏ। ਹਰ ਮਾਡਲ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਿੱਤੀ ਗਈ ਅਤੇ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਇਸ ਨੂੰ CELPIP ਸਕੇਲ ’ਤੇ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।
81%
Prepamigo Scoring Engine 2.0Prepamigo
62%
Claude Opus 5Anthropic
58%
GeminiGoogle
45%
Claude Sonnet 5Anthropic
45%
GPT-4o miniOpenAI
37%
GPT 5.5OpenAI
35%
GPT 5.6 solOpenAI
31%
GPT 5.6 lunaOpenAI
Prepamigo ਬਨਾਮ ਟੌਪ ਚੈਟਬੋਟ ਪਲਾਨ
ਕੈਨੇਡੀਅਨ ਡਾਲਰ ਵਿੱਚ। Prepamigo ਦੀਆਂ ਕੀਮਤਾਂ ਵਿੱਚ ਟੈਕਸ ਸ਼ਾਮਲ ਹੈ। Claude Max (US$100 ਤੋਂ ਸ਼ੁਰੂ) ਅਤੇ ChatGPT Pro (US$200) ਨੂੰ 1.38 ਦੀ ਦਰ ਨਾਲ ਬਦਲਿਆ ਗਿਆ ਹੈ, ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ। ਸ਼ੁੱਧਤਾ ਉਹਨਾਂ ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤਾ ਗਿਆ ਜਦੋਂ ਦੱਸੇ ਗਏ ਮਾਡਲ ਨੂੰ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਜਵਾਬ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।
ਸਾਡਾ ਹੁਣ ਤੱਕ ਦਾ ਸਭ ਤੋਂ ਸਹੀ ਸਪੀਕਿੰਗ ਗ੍ਰੇਡਰ। ਜਿਹੜੇ ਜਵਾਬ ਇਸ ਨੇ ਕਦੇ ਨਹੀਂ ਦੇਖੇ ਸਨ, ਉਨ੍ਹਾਂ ’ਤੇ Prepamigo Scoring Engine 2.0 ਨੇ 81% ਵਾਰ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰਾਂ ਨਾਲ ਮੇਲ ਖਾਧਾ, ਹਰ ਫਰੰਟੀਅਰ ਮਾਡਲ ਤੋਂ ਅੱਗੇ ਜਿਸ ਦਾ ਅਸੀਂ ਉਸੇ ਕੰਮ ’ਤੇ ਟੈਸਟ ਕੀਤਾ, ਅਤੇ Engine 1.0 ਤੋਂ, ਜਿਸ ਗ੍ਰੇਡਰ ਦੀ ਇਹ ਥਾਂ ਲੈਂਦਾ ਹੈ, ਇੱਕ ਸਪਸ਼ਟ ਕਦਮ ਅੱਗੇ ਹੈ।
ਅੱਜ ਅਸੀਂ ਸਪੀਕਿੰਗ ਲਈ Prepamigo Scoring Engine 2.0 ਜਾਰੀ ਕਰ ਰਹੇ ਹਾਂ, ਉਹ ਸਿਸਟਮ ਜੋ Prepamigo ’ਤੇ ਹਰ ਬੋਲੇ ਹੋਏ ਪ੍ਰੈਕਟਿਸ ਜਵਾਬ ਨੂੰ ਗ੍ਰੇਡ ਕਰਦਾ ਹੈ। Engine 2.0 ਸਾਡੇ ਸਕੋਰ ਕਰਨ ਦੇ ਤਰੀਕੇ ਦਾ ਇੱਕ ਪੂਰਾ ਪੁਨਰ-ਡਿਜ਼ਾਈਨ ਹੈ। ਇੱਕ ਸਿੰਗਲ ਗ੍ਰੇਡਿੰਗ ਪਾਸ ਦੀ ਥਾਂ, ਇਹ ਦੋ ਸੁਤੰਤਰ ਗ੍ਰੇਡਰ ਵਰਤਦਾ ਹੈ ਜੋ ਹਰ ਜਵਾਬ ਦੀ ਸਿੱਧੀ ਤੁਲਨਾ ਕੈਲੀਬ੍ਰੇਟਿਡ ਉਦਾਹਰਣਾਂ ਨਾਲ ਕਰਦੇ ਹਨ, ਕਈ ਵਾਰ ਵੋਟ ਦਿੰਦੇ ਹਨ, ਅਤੇ ਸਕੋਰ ਦਿਖਾਏ ਜਾਣ ਤੋਂ ਪਹਿਲਾਂ ਆਪਣੇ ਜਵਾਬਾਂ ਦਾ ਮੇਲ ਕਰਦੇ ਹਨ।
ਨਤੀਜਾ ਇੱਕ ਅਜਿਹਾ ਗ੍ਰੇਡਰ ਹੈ ਜੋ ਕਿਸੇ ਵੀ ਫਰੰਟੀਅਰ ਮਾਡਲ ਨਾਲੋਂ, ਜਿਸ ਤਰ੍ਹਾਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਇਸ ਨੂੰ ਵਰਤਦਾ, ਬਹੁਤ ਜ਼ਿਆਦਾ ਸਹੀ ਹੈ। ਅਸਲ ਬੋਲੇ ਗਏ ਜਵਾਬਾਂ ਦੇ ਇੱਕ ਹੋਲਡ-ਆਊਟ ਸੈੱਟ ’ਤੇ, ਜਿਨ੍ਹਾਂ ਦੇ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਸਨ, Engine 2.0 ਨੇ 81% ਵਾਰ ਸਹੀ ਸਕੋਰ ’ਤੇ ਪਹੁੰਚ ਕੀਤੀ। ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ ਨੂੰ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਸਕੋਰ ਕਰਨ ਲਈ ਕਹਿਣ ’ਤੇ, ਉਨ੍ਹਾਂ ਵਿੱਚੋਂ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ, Claude Opus 5, 62% ਤੱਕ ਪਹੁੰਚਿਆ। Gemini 58% ਤੱਕ ਪਹੁੰਚਿਆ। Claude Sonnet 5 ਅਤੇ GPT-4o mini 45% ਤੱਕ ਪਹੁੰਚੇ, GPT 5.5 37%, GPT 5.6 sol 35%, ਅਤੇ GPT 5.6 luna 31%। ਜਦੋਂ ਅਸੀਂ ਫਿਰ ਹਰ ਮਾਡਲ ਨੂੰ Engine 2.0 ਦੀ ਆਪਣੀ ਪ੍ਰਕਿਰਿਆ ਦਿੱਤੀ, ਹਰ ਟਾਸਕ ਲਈ ਅਸਲ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਸਮੇਤ, ਤਾਂ ਉਨ੍ਹਾਂ ਵਿੱਚੋਂ ਸਭ ਤੋਂ ਵਧੀਆ 77% ਤੱਕ ਚੜ੍ਹਿਆ ਅਤੇ ਫਿਰ ਵੀ ਪਿੱਛੇ ਰਿਹਾ।
ਸ਼ੁੱਧਤਾ ਸਭ ਤੋਂ ਵੱਧ ਉੱਥੇ ਮਹੱਤਵ ਰੱਖਦੀ ਹੈ ਜਿੱਥੇ ਇਸ ਨੂੰ ਹਾਸਲ ਕਰਨਾ ਸਭ ਤੋਂ ਔਖਾ ਹੁੰਦਾ ਹੈ। Engine 2.0 71% ਵਾਰ ਇੱਕ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਪਛਾਣਦਾ ਹੈ। ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ, ਕਿਸੇ ਹੋਰ ਮਾਡਲ ਨੇ 56% ਤੋਂ ਵੱਧ ਨਹੀਂ ਪਛਾਣਿਆ, ਅਤੇ GPT ਮਾਡਲਾਂ ਨੇ 13% ਅਤੇ 27% ਦੇ ਵਿਚਕਾਰ ਪਛਾਣਿਆ। Engine 2.0 ਆਟੋਮੇਟਿਡ ਗ੍ਰੇਡਰਾਂ ਦੀ ਸਭ ਤੋਂ ਆਮ ਅਸਫਲਤਾ ਦਾ ਵੀ ਵਿਰੋਧ ਕਰਦਾ ਹੈ: ਸਕੋਰ ਜੋ ਘੱਟ ਅਤੇ ਸਕੇਲ ਦੇ ਵਿਚਕਾਰ ਵੱਲ ਖਿਸਕਦੇ ਹਨ ਭਾਵੇਂ ਜਵਾਬ ਅਸਲ ਵਿੱਚ ਕਿੰਨਾ ਵੀ ਮਜ਼ਬੂਤ ਜਾਂ ਕਮਜ਼ੋਰ ਹੋਵੇ। ਇਹ ਖਿਸਕਾਅ ਉਹ ਕਮਜ਼ੋਰੀ ਸੀ ਜੋ ਅਸੀਂ Engine 1.0 ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਧ ਦੇਖੀ।
Engine 2.0 ਤੇਜ਼ ਹੈ, ਵਧੇਰੇ ਇਕਸਾਰ ਹੈ, ਅਤੇ ਅਜਿਹੀ ਫੀਡਬੈਕ ਦਿੰਦਾ ਹੈ ਜੋ ਵਿਦਿਆਰਥੀ ਦੇ ਆਪਣੇ ਸ਼ਬਦਾਂ ਦਾ ਹਵਾਲਾ ਦਿੰਦੀ ਹੈ। ਇਹ ਅੱਜ ਹਰ Prepamigo ਵਰਤੋਂਕਾਰ ਲਈ ਲਾਈਵ ਹੈ। ਇਹ ਪੰਨਾ ਦੱਸਦਾ ਹੈ ਕਿ ਇਹ ਕੀ ਕਰਦਾ ਹੈ, ਅਸੀਂ ਇਸ ਨੂੰ ਕਿਵੇਂ ਮਾਪਿਆ, ਅਤੇ ਇਸ ਦੀਆਂ ਸੀਮਾਵਾਂ ਹੁਣ ਵੀ ਕਿੱਥੇ ਹਨ।
ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰਾਂ ਦੇ ਵਿਰੁੱਧ ਸ਼ੁੱਧਤਾ
ਸਾਡੇ ਲਈ ਮਹੱਤਵਪੂਰਨ ਸਵਾਲ ਸਾਦਾ ਹੈ। ਜਦੋਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਇੱਕ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰਦਾ ਹੈ, ਕੀ ਸਕਰੀਨ ’ਤੇ ਦਿੱਤਾ ਸਕੋਰ ਉਸ ਸਕੋਰ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ ਜੋ ਇੱਕ ਭਰੋਸੇਯੋਗ ਗ੍ਰੇਡਰ ਦਿੰਦਾ? ਇਸ ਦਾ ਜਵਾਬ ਦੇਣ ਲਈ ਅਸੀਂ ਸਾਰੇ ਅੱਠ ਸਪੀਕਿੰਗ ਟਾਸਕ ਕਿਸਮਾਂ ਵਿੱਚ ਅਸਲ ਬੋਲੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਇੱਕ ਟੈਸਟ ਸੈੱਟ ਬਣਾਇਆ, ਹਰੇਕ ਦਾ ਇੱਕ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਸੀ, ਅਤੇ ਅਸੀਂ ਸੈੱਟ ਨੂੰ ਹੇਠਲੇ, ਮੱਧ ਅਤੇ ਟੌਪ ਸਕੋਰਾਂ ਵਿੱਚ ਬਰਾਬਰ ਵੰਡਿਆ ਤਾਂ ਜੋ ਕੋਈ ਵੀ ਇੱਕ ਪੱਧਰ ਨਤੀਜੇ ’ਤੇ ਹਾਵੀ ਨਾ ਹੋ ਸਕੇ।
ਇਹ ਤੁਲਨਾ ਉਨ੍ਹਾਂ ਜਵਾਬਾਂ ਵਿੱਚੋਂ 48 ਦੀ ਵਰਤੋਂ ਕਰਦੀ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਸ਼ੁਰੂ ਤੋਂ ਹੀ ਵੱਖ ਰੱਖਿਆ ਗਿਆ ਸੀ। ਟੀਮ ਵਿੱਚੋਂ ਕਿਸੇ ਨੇ ਵੀ Engine 2.0 ਬਣਾਉਣ ਜਾਂ ਟਿਊਨ ਕਰਨ ਦੌਰਾਨ ਇਹਨਾਂ ਦੀ ਵਰਤੋਂ ਨਹੀਂ ਕੀਤੀ। ਹਰ ਜਵਾਬ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕੀਤਾ ਗਿਆ ਸੀ। ਫਿਰ ਹਰ ਮਾਡਲ ਨੂੰ ਦੱਸਿਆ ਗਿਆ ਕਿ ਇਹ ਇੱਕ ਤਜਰਬੇਕਾਰ CELPIP ਪਰੀਖਿਅਕ ਹੈ, ਟਾਸਕ ਪ੍ਰੌਮਪਟ ਅਤੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਿੱਤੀ ਗਈ, ਅਤੇ ਜਵਾਬ ਨੂੰ 0 ਤੋਂ 12 ਤੱਕ, ਤਿੰਨ ਵਾਰ, ਵੱਖ-ਵੱਖ ਦਿਨਾਂ ’ਤੇ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ। ਅਸੀਂ ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ ਕੱਢੀ ਅਤੇ ਗਿਣਿਆ ਕਿ ਸਕੋਰ ਕਿੰਨੀ ਵਾਰ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਦੇ ਪੱਧਰ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਸੀ।
51%
Claude Opus 5 ਨਾਲੋਂ ਘੱਟ ਗਲਤੀਆਂ
ਪ੍ਰਤੀ 100 ਜਵਾਬਾਂ ’ਤੇ 19 ਗਲਤ ਸਕੋਰ, 38 ਦੇ ਮੁਕਾਬਲੇ।
71%
GPT 5.6 sol ਨਾਲੋਂ ਘੱਟ ਗਲਤੀਆਂ
ਪ੍ਰਤੀ 100 ’ਤੇ 19 ਗਲਤ ਸਕੋਰ, 65 ਦੇ ਮੁਕਾਬਲੇ।
71%
ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਪਛਾਣੇ ਗਏ
ਦੂਜੇ ਮਾਡਲਾਂ ਵਿੱਚੋਂ ਸਭ ਤੋਂ ਵਧੀਆ 56% ਪਛਾਣਦਾ ਹੈ; GPT 5.6 sol 25% ਪਛਾਣਦਾ ਹੈ।
ਇਨ੍ਹਾਂ ਨੰਬਰਾਂ ਵਿੱਚ ਤਿੰਨ ਗੱਲਾਂ ਸਾਹਮਣੇ ਆਉਂਦੀਆਂ ਹਨ। ਪਹਿਲਾਂ, ਫਰਕ ਛੋਟਾ ਨਹੀਂ ਹੈ। 48-ਜਵਾਬ ਦੇ ਟੈਸਟ ’ਤੇ, ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਫਰੰਟੀਅਰ ਮਾਡਲ ਦੇ ਵਿਰੁੱਧ ਉੱਨੀ ਪੁਆਇੰਟ ਅਤੇ ChatGPT ਦੇ ਪੇਡ ਪਲਾਨਾਂ ਪਿੱਛੇ ਦੇ ਮਾਡਲ ਦੇ ਵਿਰੁੱਧ ਛਿਆਲੀ ਪੁਆਇੰਟ, ਨੌਂ ਅਤੇ ਬਾਈ ਵਾਧੂ ਸਹੀ ਸਕੋਰਾਂ ਵਿਚਕਾਰ ਦਾ ਫਰਕ ਹੈ। ਦੂਜਾ, ਇਹ ਫਰਕ ਕਿਸੇ ਸੁਖਾਲੇ ਟੈਸਟ ਦਾ ਨਤੀਜਾ ਨਹੀਂ ਹੈ। 48 ਜਵਾਬ Engine 2.0 ਦਾ ਡਿਜ਼ਾਈਨ ਅੰਤਿਮ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ ਚੁਣੇ ਗਏ ਸਨ ਅਤੇ ਵਿਕਾਸ ਦੌਰਾਨ ਕਦੇ ਵੀ ਛੂਹੇ ਨਹੀਂ ਗਏ। ਤੀਜਾ, ਇਹ ਤੁਲਨਾ ਉਹੀ ਹੈ ਜੋ ਇੱਕ ਵਿਦਿਆਰਥੀ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ: ਇਹ ਮਾਪਦੀ ਹੈ ਕਿ ਜਦੋਂ ਤੁਸੀਂ ਇੱਕ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਨੂੰ ਇੱਕ ਚੈਟਬੋਟ ਵਿੱਚ ਪੇਸਟ ਕਰਦੇ ਹੋ ਅਤੇ ਪੁੱਛਦੇ ਹੋ ਤਾਂ ਤੁਹਾਨੂੰ ਕੀ ਮਿਲਦਾ ਹੈ, ਜੋ ਕਿ ਲਗਭਗ ਹਰ ਕੋਈ ਇਹਨਾਂ ਮਾਡਲਾਂ ਨੂੰ ਵਰਤਣ ਦਾ ਤਰੀਕਾ ਹੈ।
“ਸਹੀ” ਦਾ ਇੱਥੇ ਮਤਲਬ ਕੀ ਹੈ, ਇਸ ਬਾਰੇ ਇੱਕ ਗੱਲ। ਇਸ ਸਕੇਲ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਸਿੰਗਲ ਪੁਆਇੰਟਾਂ ਦੀ ਥਾਂ ਪੱਧਰਾਂ ਵਿੱਚ ਆਉਂਦੇ ਹਨ, ਇਸ ਲਈ ਅਸੀਂ ਇੱਕ ਸਕੋਰ ਨੂੰ ਸਹੀ ਗਿਣਦੇ ਹਾਂ ਜਦੋਂ ਇਹ ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ ਦੇ ਅੰਦਰ ਆਉਂਦਾ ਹੈ। ਉਦਾਹਰਣ ਵਜੋਂ, ਟੌਪ ਪੱਧਰ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਇੱਕ ਜਵਾਬ ਸਹੀ ਸਕੋਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਜੇ ਇੰਜਣ ਇਸ ਨੂੰ 9, 10 ਜਾਂ 11 ਦਿੰਦਾ ਹੈ। ਇੱਕ ਸਖ਼ਤ ਪੜ੍ਹਤ ਦੇ ਅਧੀਨ ਜੋ ਸਿਰਫ਼ 10 ਅਤੇ ਇਸ ਤੋਂ ਵੱਧ ਨੂੰ ਸਵੀਕਾਰ ਕਰਦੀ ਹੈ, ਹਰ ਸਿਸਟਮ ਕੁਝ ਪੁਆਇੰਟ ਗੁਆ ਦਿੰਦਾ ਹੈ ਅਤੇ ਰੈਂਕਿੰਗ ਨਹੀਂ ਬਦਲਦੀ।
| ਸਿਸਟਮ | ਸਾਦੀ ਬੇਨਤੀ | ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦੇ ਨਾਲ |
|---|---|---|
| Prepamigo Scoring Engine 2.0 | 81.3% | — |
| Claude Opus 5 | 61.8% | 77.1% |
| Gemini | 58.3% | 70.8% |
| Claude Sonnet 5 | 45.1% | 68.8% |
| GPT-4o mini | 45.1% | 50.0% |
| GPT 5.5 | 36.8% | 68.8% |
| GPT 5.6 sol | 35.4% | 70.8% |
| GPT 5.6 luna | 30.6% | 62.5% |
ਹਰ ਸਕੋਰ ਪੱਧਰ ’ਤੇ ਪ੍ਰਦਰਸ਼ਨ
ਇੱਕ ਔਸਤ ਸ਼ੁੱਧਤਾ ਅੰਕੜਾ ਬਹੁਤ ਕੁਝ ਲੁਕਾ ਸਕਦਾ ਹੈ। ਇੱਕ ਗ੍ਰੇਡਰ ਜੋ ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ’ਤੇ ਸ਼ਾਨਦਾਰ ਹੈ ਅਤੇ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ’ਤੇ ਨਿਰਾਸ਼ਾਜਨਕ ਹੈ, ਉਹ ਉਨ੍ਹਾਂ ਵਿਦਿਆਰਥੀਆਂ ਨੂੰ ਨਾਕਾਮ ਕਰਦੇ ਹੋਏ ਇੱਕ ਸਤਿਕਾਰਯੋਗ ਨੰਬਰ ਪੋਸਟ ਕਰ ਸਕਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਸਭ ਤੋਂ ਵੱਧ ਸਹੀ ਜਵਾਬ ਦੀ ਲੋੜ ਹੈ। ਇਸ ਲਈ ਅਸੀਂ ਟੈਸਟ ਸੈੱਟ ਦੇ ਤਿੰਨ ਪੱਧਰਾਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ ਵੱਖਰੇ ਤੌਰ ’ਤੇ ਸ਼ੁੱਧਤਾ ਦੀ ਰਿਪੋਰਟ ਕਰਦੇ ਹਾਂ: 4 ਜਾਂ 5 ਦੇ ਹੇਠਲੇ ਸਕੋਰ, 7 ਜਾਂ 8 ਦੇ ਮੱਧ ਸਕੋਰ, ਅਤੇ 10 ਅਤੇ ਇਸ ਤੋਂ ਵੱਧ ਦੇ ਟੌਪ ਸਕੋਰ।
ਜ਼ਿਆਦਾਤਰ ਗ੍ਰੇਡਰ, ਮਨੁੱਖੀ ਜਾਂ ਮਸ਼ੀਨੀ, ਵਿਚਕਾਰ ਵੱਲ ਖਿਸਕਦੇ ਹਨ। ਇੱਕ ਮਜ਼ਬੂਤ ਜਵਾਬ ਨੂੰ 10 ਦੀ ਥਾਂ 8 ਮਿਲਦਾ ਹੈ। ਇੱਕ ਕਮਜ਼ੋਰ ਜਵਾਬ ਨੂੰ 5 ਦੀ ਥਾਂ 6 ਮਿਲਦਾ ਹੈ। ਤੁਲਨਾ ਕਰਨ ਲਈ ਕੁਝ ਵੀ ਨਾ ਹੋਣ ਕਾਰਨ, ਫਰੰਟੀਅਰ ਮਾਡਲ ਇੱਕ ਦੂਜੀ ਆਦਤ ਜੋੜਦੇ ਹਨ: ਉਹ ਹੇਠਾਂ ਵੱਲ ਖਿਸਕਦੇ ਹਨ, ਇਸ ਲਈ ਇੱਕ ਕਮਜ਼ੋਰ ਜਵਾਬ ਨੂੰ ਅਕਸਰ 5 ਦੀ ਥਾਂ 3 ਅਤੇ ਇੱਕ ਮਜ਼ਬੂਤ ਜਵਾਬ ਨੂੰ 7 ਸਕੋਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। Engine 2.0 ਨੂੰ ਖਾਸ ਤੌਰ ’ਤੇ ਦੋਵੇਂ ਖਿੱਚਾਂ ਦਾ ਵਿਰੋਧ ਕਰਨ ਲਈ ਬਣਾਇਆ ਗਿਆ ਸੀ, ਅਤੇ ਨਤੀਜੇ ਇਹ ਸਕੇਲ ਦੇ ਟੌਪ ’ਤੇ ਸਭ ਤੋਂ ਸਪਸ਼ਟ ਦਿਖਾਉਂਦੇ ਹਨ।
ਹੇਠਲੇ ਸਕੋਰ · ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 4 ਜਾਂ 5
ਪ੍ਰਤੀ ਸਿਸਟਮ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦੀ ਬੇਨਤੀ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
75%
GPT-4o mini
56%
Gemini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
44%
Claude Sonnet 5
ਮੱਧ ਸਕੋਰ · ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 7 ਜਾਂ 8
ਪ੍ਰਤੀ ਸਿਸਟਮ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦੀ ਬੇਨਤੀ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।
85%
Prepamigo Engine 2.0
63%
Gemini
63%
Claude Sonnet 5
58%
Claude Opus 5
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
ਟੌਪ ਸਕੋਰ · ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 10 ਜਾਂ ਇਸ ਤੋਂ ਵੱਧ
ਪ੍ਰਤੀ ਸਿਸਟਮ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦੀ ਬੇਨਤੀ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। ਲਗਭਗ ਹਰ ਖੁੰਝਿਆ ਸਕੋਰ 7 ਜਾਂ 8 ਹੈ।
71%
Prepamigo Engine 2.0
56%
Gemini
50%
Claude Opus 5
29%
Claude Sonnet 5
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
ਹੇਠਲੇ ਪੱਧਰ ’ਤੇ, Engine 2.0 88% ’ਤੇ ਅੱਗੇ ਹੈ, Claude Opus 5 77% ’ਤੇ ਅਤੇ GPT-4o mini 75% ’ਤੇ। ਹਰ ਹੋਰ ਮਾਡਲ ਲਗਭਗ ਅੱਧੇ ’ਤੇ ਹੈ, ਅਤੇ Claude Sonnet 5 44% ’ਤੇ ਹੈ। ਖੁੰਝਿਆ ਸਕੋਰ ਲਗਭਗ ਹਮੇਸ਼ਾ 3 ਹੁੰਦਾ ਹੈ: ਮਾਡਲ ਇੱਕ ਕਮਜ਼ੋਰ ਜਵਾਬ ਦੇਖਦਾ ਹੈ ਅਤੇ ਇਸ ਨੂੰ ਪੱਧਰ ਦੇ ਅੰਦਰ ਦੀ ਥਾਂ ਪੱਧਰ ਤੋਂ ਹੇਠਾਂ ਸਕੋਰ ਕਰਦਾ ਹੈ। GPT-4o mini ਦਾ ਇੱਥੇ ਸਤਿਕਾਰਯੋਗ ਅੰਕੜਾ ਇਸ ਦੀ ਸਮੱਸਿਆ ਦਾ ਪਹਿਲਾ ਸੰਕੇਤ ਹੈ, ਜੋ ਇਹ ਹੈ ਕਿ ਇਹ ਲਗਭਗ ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਹੈ; ਸਕੇਲ ਦੇ ਟੌਪ ’ਤੇ ਇਹ ਛੇ ਵਿੱਚੋਂ ਇੱਕ ਜਵਾਬ ਪਛਾਣਦਾ ਹੈ।
ਮੱਧ ਪੱਧਰ ’ਤੇ, Engine 2.0 85% ’ਤੇ ਅੱਗੇ ਹੈ। Gemini ਅਤੇ Claude Sonnet 5 63% ’ਤੇ ਹਨ, Claude Opus 5 58% ’ਤੇ, ਅਤੇ ਫਿਰ ਇੱਕ ਢਲਾਣ: GPT-4o mini 44% ’ਤੇ ਅਤੇ ਤਿੰਨ ਵੱਡੇ GPT ਮਾਡਲ 27% ਤੋਂ 29% ’ਤੇ। ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ਵਿੱਚ ਤਾਕਤਾਂ ਅਤੇ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਇੱਕ ਮਿਸ਼ਰਣ ਹੁੰਦਾ ਹੈ ਜਿਸ ਨੂੰ ਪਛਾਣਨ ਦੀ ਥਾਂ ਤੋਲਣਾ ਪੈਂਦਾ ਹੈ, ਅਤੇ ਤੋਲਣ ਲਈ ਕੁਝ ਵੀ ਨਾ ਹੋਣ ਕਾਰਨ, GPT ਮਾਡਲ ਕਮਜ਼ੋਰੀਆਂ ਦੇਖਦੇ ਹਨ ਅਤੇ 5 ਜਾਂ 6 ਦੇ ਦਿੰਦੇ ਹਨ।
ਟੌਪ ਪੱਧਰ ’ਤੇ, ਫਰਕ ਸਭ ਤੋਂ ਵੱਡਾ ਹੈ। Engine 2.0 71% ਟੌਪ-ਲੈਵਲ ਜਵਾਬਾਂ ਨੂੰ ਸਹੀ ਪਛਾਣਦਾ ਹੈ। Gemini 56% ਪਛਾਣਦਾ ਹੈ ਅਤੇ Opus 5 ਠੀਕ ਅੱਧੇ। ਬਾਕੀ ਸੱਤ ਮਾਡਲਾਂ ਵਿੱਚੋਂ ਪੰਜ ਹਰ ਦਸਾਂ ਵਿੱਚੋਂ ਘੱਟੋ-ਘੱਟ ਸੱਤ ਜਵਾਬਾਂ ਨੂੰ, ਜੋ 10 ਦੇ ਯੋਗ ਹਨ, 7 ਜਾਂ 8 ਦਿੰਦੇ ਹਨ। ਇਹ ਵਿਚਕਾਰ-ਖਿਸਕਾਅ ਦੀ ਸਮੱਸਿਆ ਦਾ ਸਭ ਤੋਂ ਸ਼ੁੱਧ ਰੂਪ ਹੈ। ਇੱਕ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਨਿਰਦੋਸ਼ ਨਹੀਂ ਹੁੰਦਾ; ਇਸ ਵਿੱਚ ਕਦੇ-ਕਦਾਈਂ ਗਲਤੀ, ਇੱਕ ਰੀਸਟਾਰਟ, ਗੁੰਝਲਦਾਰ ਵਾਕਾਂ ਵਿਚਕਾਰ ਇੱਕ ਸਾਦਾ ਵਾਕ ਹੁੰਦਾ ਹੈ, ਅਤੇ ਇੱਕ ਗ੍ਰੇਡਰ ਜੋ ਇਸ ਨੂੰ ਇੱਕ ਕਲਪਿਤ ਨਿਰਦੋਸ਼ ਜਵਾਬ ਦੇ ਵਿਰੁੱਧ ਮਾਪਦਾ ਹੈ, ਹਰ ਇੱਕ ਲਈ ਪੁਆਇੰਟ ਕੱਟਦਾ ਹੈ। Engine 2.0 ਉਹਨਾਂ ਉਦਾਹਰਣਾਂ ਦੇ ਵਿਰੁੱਧ ਕੈਲੀਬ੍ਰੇਟ ਕੀਤਾ ਗਿਆ ਹੈ ਜੋ ਦਿਖਾਉਂਦੀਆਂ ਹਨ ਕਿ ਇੱਕ ਅਸਲ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਕਿਵੇਂ ਦਿਖਦਾ ਹੈ, ਗਲਤੀਆਂ ਸਮੇਤ, ਅਤੇ ਇਸ ਨੂੰ ਸਪਸ਼ਟ ਤੌਰ ’ਤੇ ਨਿਰਦੋਸ਼ਤਾ ਦੀ ਥਾਂ ਉਨ੍ਹਾਂ ਉਦਾਹਰਣਾਂ ਨਾਲ ਤੁਲਨਾ ਕਰਨ ਲਈ ਡਿਜ਼ਾਈਨ ਕੀਤਾ ਗਿਆ ਹੈ।
ਜੇ ਤੁਸੀਂ ਉਹਨਾਂ ਨੂੰ ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦਿਓ ਤਾਂ ਕੀ?
ਸਾਦੀ-ਬੇਨਤੀ ਦੇ ਨੰਬਰ ਇਸ ਗੱਲ ’ਤੇ ਫੈਸਲਾ ਨਹੀਂ ਹਨ ਕਿ ਇਹ ਮਾਡਲ ਕਿੰਨੇ ਸਮਝਦਾਰ ਹਨ। ਇਹ ਇਸ ਗੱਲ ’ਤੇ ਫੈਸਲਾ ਹਨ ਕਿ ਜਦੋਂ ਇੱਕ ਮਾਡਲ ਨੂੰ ਤੁਲਨਾ ਕਰਨ ਲਈ ਕੁਝ ਵੀ ਨਾ ਹੋਣ ’ਤੇ ਇੱਕ ਨੰਬਰ ਲਈ ਪੁੱਛਿਆ ਜਾਂਦਾ ਹੈ ਤਾਂ ਕੀ ਹੁੰਦਾ ਹੈ। ਇਸ ਲਈ ਅਸੀਂ ਇੱਕ ਦੂਜਾ ਟੈਸਟ ਚਲਾਇਆ, ਹਰ ਮਾਡਲ ਨੂੰ ਬਿਲਕੁਲ ਉਹੀ ਦਿੱਤਾ ਜੋ Engine 2.0 ਦੇ ਆਪਣੇ ਗ੍ਰੇਡਰ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ: ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਟਾਸਕ, ਉਸ ਖਾਸ ਟਾਸਕ ਲਈ ਹਰ ਪੱਧਰ ’ਤੇ ਦੋ ਅਸਲ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ, ਅਤੇ ਇੱਕ ਹਦਾਇਤ ਕਿ ਇੱਕ ਨੰਬਰ ਪੈਦਾ ਕਰਨ ਦੀ ਥਾਂ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ ਸਭ ਤੋਂ ਨੇੜਲੀ ਉਦਾਹਰਣ ਦਾ ਨਾਮ ਦੇਵੇ। ਹਰ ਮਾਡਲ ਨੂੰ ਇਸ ਦੇ ਆਪਣੇ ਰੁਝਾਨਾਂ ਮੁਤਾਬਕ ਟਿਊਨ ਕੀਤਾ ਇੱਕ ਛੋਟਾ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਨੋਟ ਵੀ ਮਿਲਿਆ।
ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦੇ ਨਾਲ: ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ ’ਤੇ ਸਕੋਰ ਕੀਤੇ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ
ਉਹੀ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ। ਹਰ ਸਿਸਟਮ ਲਈ ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ, ਹਦਾਇਤਾਂ ਅਤੇ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ; ਹਰ ਮਾਡਲ ਨੇ ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਵਾਰ ਗ੍ਰੇਡ ਕੀਤਾ।
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
71%
GPT 5.6 sol
71%
Gemini
69%
GPT 5.5
69%
Claude Sonnet 5
63%
GPT 5.6 luna
50%
GPT-4o mini
ਹਰ ਮਾਡਲ ਸੁਧਰਦਾ ਹੈ, ਕੁਝ ਨਾਟਕੀ ਢੰਗ ਨਾਲ। GPT 5.6 sol 35% ਤੋਂ 71% ਤੱਕ ਦੁੱਗਣਾ ਹੋ ਜਾਂਦਾ ਹੈ। Opus 5 62% ਤੋਂ 77% ਤੱਕ ਚੜ੍ਹਦਾ ਹੈ। GPT-4o mini ਮੁਸ਼ਕਿਲ ਨਾਲ ਹਿੱਲਦਾ ਹੈ, 45% ਤੋਂ 50% ਤੱਕ, ਕਿਉਂਕਿ ਇਹ ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਹੈ ਭਾਵੇਂ ਇਸ ਨੂੰ ਜੋ ਵੀ ਦਿਖਾਇਆ ਜਾਵੇ। ਅਤੇ ਹਰ ਮਾਡਲ ਫਿਰ ਵੀ Engine 2.0 ਤੋਂ ਪਿੱਛੇ ਰਹਿੰਦਾ ਹੈ। ਸਕੇਲ ਦੇ ਟੌਪ ’ਤੇ ਫਰਕ ਬਣਿਆ ਰਹਿੰਦਾ ਹੈ: Opus 5, GPT 5.6 sol, Gemini ਅਤੇ GPT 5.5 ਸਾਰੇ ਟੌਪ-ਲੈਵਲ ਜਵਾਬਾਂ ਦੇ 63% ’ਤੇ ਰੁਕ ਜਾਂਦੇ ਹਨ, Sonnet 5 38% ’ਤੇ, GPT-4o mini ਜ਼ੀਰੋ ’ਤੇ, Engine 2.0 ਲਈ 71% ਦੇ ਮੁਕਾਬਲੇ।
ਇਹ ਦੂਜਾ ਟੈਸਟ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ Engine 2.0 ਵਿੱਚ ਅਸਲ ਵਿੱਚ ਮੁੱਲ ਕਿੱਥੇ ਹੈ। ਇਹ ਕੋਈ ਵਧੇਰੇ ਸਮਝਦਾਰ ਮਾਡਲ ਨਹੀਂ ਹੈ; ਇਹ ਇਸੇ ਸੂਚੀ ਵਿੱਚੋਂ ਮਾਡਲ ਵਰਤਦਾ ਹੈ। ਇਹ ਹਰ ਖਾਸ ਟਾਸਕ ’ਤੇ ਹਰ ਪੱਧਰ ਕਿਵੇਂ ਸੁਣਦਾ ਹੈ ਦੀਆਂ ਅਸਲ ਉਦਾਹਰਣਾਂ ਹਨ, ਇੱਕ ਸਵਾਲ ਜੋ ਮਾਡਲ ਨੂੰ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਦੀ ਥਾਂ ਤੁਲਨਾ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ, ਅਤੇ ਫਿਰ ਤਿੰਨ ਹੋਰ ਗੱਲਾਂ ਜੋ ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਨਹੀਂ ਦੇ ਸਕਦਾ: ਵੱਖ-ਵੱਖ ਪ੍ਰੋਵਾਈਡਰਾਂ ਤੋਂ ਦੋ ਸੁਤੰਤਰ ਗ੍ਰੇਡਰ, ਹਰੇਕ ਤੋਂ ਤਿੰਨ ਵੋਟਾਂ ਜਿਨ੍ਹਾਂ ਵਿੱਚੋਂ ਮੱਧ ਵੋਟ ਰੱਖੀ ਜਾਂਦੀ ਹੈ, ਅਤੇ ਇੱਕ ਮੇਲ-ਮਿਲਾਪ ਨਿਯਮ ਜੋ ਦੋ ਗ੍ਰੇਡਰਾਂ ਦੇ ਜ਼ੋਰਦਾਰ ਅਸਹਿਮਤ ਹੋਣ ’ਤੇ ਵੱਧ ਸਕੋਰ ਲੈਂਦਾ ਹੈ, ਕਿਉਂਕਿ ਵਿਸ਼ਲੇਸ਼ਣ ਨੇ ਦਿਖਾਇਆ ਕਿ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ’ਤੇ ਹੇਠਲਾ ਫ਼ੈਸਲਾ ਲਗਭਗ ਹਮੇਸ਼ਾ ਗਲਤ ਸੀ।
ਇਕਸਾਰਤਾ ਅਤੇ ਸਥਿਰਤਾ
ਇੱਕ ਗ੍ਰੇਡਰ ਜਿਸ ’ਤੇ ਤੁਸੀਂ ਭਰੋਸਾ ਕਰ ਸਕਦੇ ਹੋ, ਇਕਸਾਰ ਹੋਣਾ ਜ਼ਰੂਰੀ ਹੈ। ਜੇ ਉਹੀ ਰਿਕਾਰਡਿੰਗ ਨੂੰ ਅੱਜ 8 ਅਤੇ ਕੱਲ੍ਹ 10 ਮਿਲ ਸਕਦਾ ਹੈ, ਤਾਂ ਕੋਈ ਵੀ ਨੰਬਰ ਬਹੁਤ ਕੁਝ ਨਹੀਂ ਦਰਸਾਉਂਦਾ, ਅਤੇ ਇੱਕ ਵਿਦਿਆਰਥੀ ਇਹ ਨਹੀਂ ਦੱਸ ਸਕਦਾ ਕਿ ਉਸ ਦੀ ਪ੍ਰੈਕਟਿਸ ਕੰਮ ਕਰ ਰਹੀ ਹੈ ਜਾਂ ਨਹੀਂ। ਇਸ ਲਈ ਸ਼ੁੱਧਤਾ ਦੇ ਨਾਲ, ਅਸੀਂ ਇਹ ਵੀ ਮਾਪਦੇ ਹਾਂ ਕਿ ਕੀ Engine 2.0 ਉਹੀ ਸਵਾਲ ਦੋ ਵਾਰ ਪੁੱਛਣ ’ਤੇ ਉਹੀ ਜਵਾਬ ਦਿੰਦਾ ਹੈ।
ਅਸੀਂ Engine 2.0 ਨੂੰ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ’ਤੇ ਤਿੰਨ ਵੱਖ-ਵੱਖ ਵਾਰ, ਵੱਖ-ਵੱਖ ਦਿਨਾਂ ’ਤੇ, ਵਿਚਕਾਰ ਕੁਝ ਵੀ ਬਦਲੇ ਬਿਨਾਂ ਚਲਾਇਆ। ਇਸ ਨੇ ਹਰ ਰਨ ’ਤੇ 81.3% ਸਕੋਰ ਕੀਤਾ। ਲਗਭਗ 81% ਨਹੀਂ: ਹਰ ਵਾਰ ਉਹੀ 39 ਸਹੀ ਜਵਾਬ 48 ਵਿੱਚੋਂ, ਇੱਕ ਦੇ ਫਰਕ ਨਾਲ। ਜਦੋਂ ਅਸੀਂ ਸਮੁੱਚੇ ਦੀ ਥਾਂ ਵਿਅਕਤੀਗਤ ਜਵਾਬਾਂ ’ਤੇ ਦੇਖਦੇ ਹਾਂ, 87.5% ਨੂੰ ਤਿੰਨੋਂ ਰਨਾਂ ਵਿੱਚ ਇੱਕੋ ਸਕੋਰ ਮਿਲਿਆ, ਅਤੇ ਸਿਰਫ 4.2% ਹੀ ਰਨਾਂ ਵਿਚਕਾਰ ਦੋ ਪੁਆਇੰਟ ਜਾਂ ਵੱਧ ਹਿੱਲੇ। ਇਹ ਥੋੜ੍ਹੇ ਜਵਾਬ ਉਹ ਹਨ ਜੋ ਦੋ ਪੱਧਰਾਂ ਵਿਚਕਾਰ ਦੀ ਸੀਮਾ ’ਤੇ ਬੈਠਦੇ ਹਨ, ਜਿੱਥੇ ਨਿਰਣੇ ਵਿੱਚ ਇੱਕ ਛੋਟਾ ਫਰਕ ਜਾਇਜ਼ ਤੌਰ ’ਤੇ ਸਕੋਰ ਨੂੰ ਇੱਕ ਪਾਸੇ ਜਾਂ ਦੂਜੇ ਪਾਸੇ ਲੈ ਜਾਂਦਾ ਹੈ।
ਫਰੰਟੀਅਰ ਮਾਡਲਾਂ ’ਤੇ ਸਾਦੀ-ਬੇਨਤੀ ਟੈਸਟ ਰਨਾਂ ਵਿਚਕਾਰ ਕਿਤੇ ਵੱਧ ਹਿੱਲਿਆ। GPT 5.6 sol ਨੇ ਆਪਣੀਆਂ ਤਿੰਨ ਰਨਾਂ ’ਤੇ 31%, 40% ਅਤੇ 35% ਸਕੋਰ ਕੀਤਾ; Opus 5 ਨੇ 62%, 65% ਅਤੇ 58% ਸਕੋਰ ਕੀਤਾ। ਇੱਕ ਚੈਟਬੋਟ ਨੂੰ ਦੋ ਵੱਖ-ਵੱਖ ਦਿਨਾਂ ’ਤੇ ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਗ੍ਰੇਡ ਕਰਨ ਲਈ ਕਹੋ ਅਤੇ ਤੁਹਾਨੂੰ, ਕਾਫ਼ੀ ਵਾਰ, ਦੋ ਵੱਖ-ਵੱਖ ਸਕੋਰ ਮਿਲਣਗੇ।
ਇਕਸਾਰਤਾ ਦੋ ਡਿਜ਼ਾਈਨ ਫੈਸਲਿਆਂ ਤੋਂ ਆਉਂਦੀ ਹੈ। Engine 2.0 ਵਿੱਚ ਹਰ ਗ੍ਰੇਡਰ ਹਰ ਜਵਾਬ ’ਤੇ ਤਿੰਨ ਵਾਰ ਵੋਟ ਦਿੰਦਾ ਹੈ ਅਤੇ ਮੱਧ ਵੋਟ ਰੱਖੀ ਜਾਂਦੀ ਹੈ, ਜੋ ਉਸ ਕਦੇ-ਕਦਾਈਂ ਦੇ ਅਪਵਾਦ ਨੂੰ ਹਟਾ ਦਿੰਦੀ ਹੈ ਜੋ ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਪੈਦਾ ਕਰਦਾ। ਅਤੇ ਦੋ ਗ੍ਰੇਡਰਾਂ ਦੇ ਫ਼ੈਸਲਿਆਂ ਦਾ ਮੇਲ ਕਿਸੇ ਹੋਰ ਮਾਡਲ ਦੀ ਥਾਂ ਇੱਕ ਸਥਿਰ ਨਿਯਮ ਦੁਆਰਾ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਇਸ ਲਈ ਫ਼ੈਸਲਿਆਂ ਦਾ ਉਹੀ ਜੋੜਾ ਹਮੇਸ਼ਾ ਉਹੀ ਅੰਤਿਮ ਸਕੋਰ ਪੈਦਾ ਕਰਦਾ ਹੈ। ਦੋਵੇਂ ਫੈਸਲੇ ਸਿੱਧੇ ਟੈਸਟ ਕੀਤੇ ਗਏ: ਤਿੰਨ ਦੀ ਥਾਂ ਇੱਕ ਵੋਟ ਨਾਲ, ਰਨ-ਟੂ-ਰਨ ਸਹਿਮਤੀ 87.5% ਤੋਂ 77.1% ਤੱਕ ਡਿੱਗ ਗਈ, ਅਤੇ ਦੋ ਜਾਂ ਵੱਧ ਪੁਆਇੰਟ ਹਿੱਲਣ ਵਾਲੇ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਦੁੱਗਣੇ ਤੋਂ ਵੱਧ ਹੋ ਗਿਆ।
Engine 2.0 ਇੱਕ ਜਵਾਬ ਨੂੰ ਕਿਵੇਂ ਗ੍ਰੇਡ ਕਰਦਾ ਹੈ
Engine 2.0 ਇੱਕ ਸਿੰਗਲ ਮਾਡਲ ਨਹੀਂ ਹੈ। ਇਹ ਇੱਕ ਪ੍ਰਕਿਰਿਆ ਹੈ, ਅਤੇ ਇਹ ਪ੍ਰਕਿਰਿਆ ਹੀ ਫਰਕ ਪੈਦਾ ਕਰਦੀ ਹੈ। ਇੱਥੇ ਹੈ ਕਿ ਵਿਦਿਆਰਥੀ ਦੇ ਸਟਾਪ ਦਬਾਉਣ ਅਤੇ ਸਕਰੀਨ ’ਤੇ ਸਕੋਰ ਦਿਖਾਈ ਦੇਣ ਦੇ ਵਿਚਕਾਰ ਦੇ ਦਸ ਕੁ ਸਕਿੰਟਾਂ ਵਿੱਚ ਕੀ ਹੁੰਦਾ ਹੈ।
- ਰਿਕਾਰਡਿੰਗ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਹਰ ਫਿਲਰ, ਹਰ ਰੀਸਟਾਰਟ, ਹਰ ਸੈਲਫ-ਕਰੈਕਸ਼ਨ ਰੱਖੀ ਜਾਂਦੀ ਹੈ। ਇਹ ਜ਼ਰੂਰੀ ਸਾਬਤ ਹੋਇਆ। ਜਦੋਂ ਅਸੀਂ ਹਿਚਕਿਚਾਹਟਾਂ ਹਟਾ ਕੇ ਇੱਕ “ਸਾਫ਼” ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਟੈਸਟ ਕੀਤੀ, ਸ਼ੁੱਧਤਾ ਪੰਦਰਾਂ ਪੁਆਇੰਟ ਡਿੱਗ ਗਈ, ਕਿਉਂਕਿ ਹਿਚਕਿਚਾਹਟਾਂ ਉਸ ਸਬੂਤ ਦਾ ਹਿੱਸਾ ਹਨ ਜਿਸ ਦੀ ਇੱਕ ਗ੍ਰੇਡਰ ਨੂੰ ਇਹ ਨਿਰਣਾ ਕਰਨ ਲਈ ਲੋੜ ਹੁੰਦੀ ਹੈ ਕਿ ਜਵਾਬ ਕਿਵੇਂ ਸੁਣਦਾ ਹੈ।
- ਦੋ ਸੁਤੰਤਰ ਗ੍ਰੇਡਰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਪੜ੍ਹਦੇ ਹਨ। ਇਹ ਵੱਖ-ਵੱਖ ਪ੍ਰੋਵਾਈਡਰਾਂ ਦੇ ਵੱਖ-ਵੱਖ ਅੰਡਰਲਾਇੰਗ ਮਾਡਲਾਂ ’ਤੇ ਬਣੇ ਹੋਏ ਹਨ, ਇਸ ਲਈ ਇਹ ਇੱਕੋ ਬਲਾਈਂਡ ਸਪਾਟ ਸਾਂਝੇ ਨਹੀਂ ਕਰਦੇ। ਹਰ ਗ੍ਰੇਡਰ ਨੂੰ ਟਾਸਕ ਪ੍ਰੌਮਪਟ, ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਅਤੇ ਉਸ ਖਾਸ ਟਾਸਕ ਲਈ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਦਾ ਇੱਕ ਛੋਟਾ ਸੈੱਟ ਮਿਲਦਾ ਹੈ: ਹੇਠਲੇ, ਮੱਧ ਅਤੇ ਟੌਪ ਪੱਧਰ ’ਤੇ ਅਸਲ ਜਵਾਬ, ਹਰ ਪੱਧਰ ’ਤੇ ਦੋ, ਤਾਂ ਜੋ ਹਰ ਪੱਧਰ ਇੱਕ ਸਿੰਗਲ ਪੁਆਇੰਟ ਦੀ ਥਾਂ ਇੱਕ ਰੇਂਜ ਵਜੋਂ ਦਿਖਾਇਆ ਜਾਵੇ।
- ਹਰ ਗ੍ਰੇਡਰ ਸਕੋਰ ਕਰਨ ਦੀ ਥਾਂ ਤੁਲਨਾ ਕਰਦਾ ਹੈ। ਇਹ Engine 1.0 ਤੋਂ ਸਭ ਤੋਂ ਵੱਡਾ ਬਦਲਾਅ ਹੈ। ਇੱਕ ਨੰਬਰ ਲਈ ਪੁੱਛੇ ਜਾਣ ਦੀ ਥਾਂ, ਹਰ ਗ੍ਰੇਡਰ ਨੂੰ ਜਵਾਬ ਦੇ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ ਪੁੱਛਿਆ ਜਾਂਦਾ ਹੈ ਕਿ ਇਹ ਕਿਸ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣ ਨਾਲ ਸਭ ਤੋਂ ਵੱਧ ਮਿਲਦਾ ਹੈ। ਇੱਥੇ ਕੋਈ “ਵਿਚਕਾਰ ਕਿਤੇ” ਵਿਕਲਪ ਨਹੀਂ ਹੈ। ਸਭ ਤੋਂ ਨੇੜਲੀ ਉਦਾਹਰਣ ਪ੍ਰਤੀ ਵਚਨਬੱਧ ਹੋਣਾ ਹੀ ਵਿਚਕਾਰ ਵੱਲ ਖਿਸਕਾਅ ਨੂੰ ਰੋਕਦਾ ਹੈ। ਸਕੋਰ ਫਿਰ ਚੁਣੇ ਗਏ ਪੱਧਰ ਤੋਂ ਇੱਕ ਸਥਿਰ ਨਿਯਮ ਦੁਆਰਾ ਕੱਢਿਆ ਜਾਂਦਾ ਹੈ, ਮਾਡਲ ਦੁਆਰਾ ਨਹੀਂ।
- ਹਰ ਗ੍ਰੇਡਰ ਤਿੰਨ ਵਾਰ ਵੋਟ ਦਿੰਦਾ ਹੈ। ਹਰ ਪਹਿਲੂ ’ਤੇ ਮੱਧ ਵੋਟ ਰੱਖੀ ਜਾਂਦੀ ਹੈ। ਇਹ ਅਸਲ ਨਿਰਣੇ ਨੂੰ ਔਸਤ ਕਰ ਕੇ ਗੁਆਏ ਬਿਨਾਂ ਕਦੇ-ਕਦਾਈਂ ਦੇ ਬੁਰੇ-ਦਿਨ ਵਾਲੇ ਜਵਾਬ ਨੂੰ ਹਟਾਉਂਦਾ ਹੈ।
- ਦੋ ਫ਼ੈਸਲਿਆਂ ਦਾ ਮੇਲ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਜੇ ਗ੍ਰੇਡਰ ਸਹਿਮਤ ਹਨ ਜਾਂ ਇੱਕ ਸਿੰਗਲ ਪੁਆਇੰਟ ਨਾਲ ਵੱਖਰੇ ਹਨ, ਤਾਂ ਅੰਤਿਮ ਸਕੋਰ ਉਨ੍ਹਾਂ ਦੀ ਔਸਤ ਹੈ। ਜੇ ਉਹ ਦੋ ਜਾਂ ਵੱਧ ਨਾਲ ਵੱਖਰੇ ਹਨ, ਤਾਂ ਵੱਧ ਸਕੋਰ ਵਰਤਿਆ ਜਾਂਦਾ ਹੈ। ਇਹ ਨਿਯਮ ਖੁੱਲ੍ਹਦਿਲੀ ਨਹੀਂ ਹੈ; ਇਹ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਹੈ। ਜਦੋਂ ਅਸੀਂ ਹਰ ਉਸ ਮਾਮਲੇ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕੀਤਾ ਜਿੱਥੇ ਦੋ ਗ੍ਰੇਡਰ ਜ਼ੋਰਦਾਰ ਅਸਹਿਮਤ ਸਨ, ਹੇਠਲਾ ਫ਼ੈਸਲਾ ਲਗਭਗ ਹਮੇਸ਼ਾ ਗਲਤ ਸੀ, ਕਿਉਂਕਿ ਅਸਹਿਮਤੀ ਲਗਭਗ ਹਮੇਸ਼ਾ ਇੱਕ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ’ਤੇ ਪੈਦਾ ਹੁੰਦੀ ਸੀ ਜਿਸ ਬਾਰੇ ਇੱਕ ਗ੍ਰੇਡਰ ਬਹੁਤ ਸਾਵਧਾਨ ਰਿਹਾ ਸੀ।
- ਸੁਰੱਖਿਆ ਉਪਾਅ ਲਾਗੂ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। ਸਥਿਰ ਨਿਯਮਾਂ ਦਾ ਇੱਕ ਛੋਟਾ ਸੈੱਟ ਉਹਨਾਂ ਮਾਮਲਿਆਂ ਨੂੰ ਸੰਭਾਲਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਬਾਰੇ ਕਿਸੇ ਵੀ ਗ੍ਰੇਡਰ ਨੂੰ ਅੰਦਾਜ਼ਾ ਨਹੀਂ ਲਗਾਉਣਾ ਚਾਹੀਦਾ: ਇੱਕ ਜਵਾਬ ਜੋ ਖ਼ਾਮੋਸ਼ ਹੈ, ਕੁਝ ਸ਼ਬਦਾਂ ਦਾ ਹੈ, ਕਿਸੇ ਹੋਰ ਭਾਸ਼ਾ ਵਿੱਚ ਹੈ, ਜਾਂ ਪੂਰੀ ਤਰ੍ਹਾਂ ਵਿਸ਼ੇ ਤੋਂ ਬਾਹਰ ਹੈ, ਗ੍ਰੇਡਰਾਂ ਦੇ ਵਾਪਸ ਕੀਤੇ ਗਏ ਨਤੀਜੇ ਦੀ ਪਰਵਾਹ ਕੀਤੇ ਬਿਨਾਂ ਇੱਕ ਫ਼ਲੋਰ ਸਕੋਰ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ। ਟੈਸਟਿੰਗ ਵਿੱਚ, ਖ਼ਾਮੋਸ਼ੀ ਨੇ 3 ਸਕੋਰ ਕੀਤਾ, ਕੁਝ ਸ਼ਬਦਾਂ ਦੇ ਜਵਾਬ ਨੇ 4, ਅਤੇ ਵਿਸ਼ੇ ਤੋਂ ਬਾਹਰ ਜਾਂ ਗੈਰ-ਅੰਗਰੇਜ਼ੀ ਜਵਾਬ ਨੇ 5, ਸੈੱਟ ਵਿੱਚ ਕੋਈ ਅਸਫਲਤਾ ਨਹੀਂ।
ਅੰਤਿਮ ਡਿਜ਼ਾਈਨ ਦੀਆਂ ਦੋ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਜ਼ੋਰ ਦੇਣ ਯੋਗ ਹਨ। Engine 2.0 ਸਿਰਫ਼ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਤੋਂ ਗ੍ਰੇਡ ਕਰਦਾ ਹੈ, ਇਸ ਲਈ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਤੋਂ ਬਾਅਦ ਇਸ ਨੂੰ ਆਡੀਓ ਦੀ ਲੋੜ ਨਹੀਂ ਹੁੰਦੀ ਅਤੇ ਇਹ ਕਿਸੇ ਇੱਕ ਪ੍ਰੋਵਾਈਡਰ ਦੇ ਆਡੀਓ ਮਾਡਲ ’ਤੇ ਨਿਰਭਰ ਨਹੀਂ ਕਰਦਾ। ਅਤੇ ਕਿਉਂਕਿ ਦੋ ਗ੍ਰੇਡਰ ਵੱਖ-ਵੱਖ ਪ੍ਰੋਵਾਈਡਰਾਂ ਤੋਂ ਹਨ, ਜੇ ਇੱਕ ਉਪਲਬਧ ਨਹੀਂ ਹੈ ਤਾਂ ਦੂਜਾ ਜਾਰੀ ਰਹਿੰਦਾ ਹੈ, ਇੱਕ ਤੀਜੇ ਮਾਡਲ ਦੇ ਬਦਲੇ ਵਜੋਂ ਖੜ੍ਹੇ ਹੋਣ ਨਾਲ ਤਾਂ ਜੋ ਇੱਕ ਸਕੋਰ ਹਮੇਸ਼ਾ ਪੈਦਾ ਹੋਵੇ।
ਤੁਹਾਡੇ ਫੀਡਬੈਕ ਵਿੱਚ ਕੀ ਨਵਾਂ ਹੈ
Engine 2.0 ਦੇ ਨਾਲ ਇੱਕ ਨਵੀਂ ਬਣਾਈ ਗਈ ਫੀਡਬੈਕ ਲੇਅਰ ਆਉਂਦੀ ਹੈ। ਇਹ ਸਿਰਫ਼ ਸਕੋਰ ਨਹੀਂ ਸਗੋਂ ਦੋਵੇਂ ਗ੍ਰੇਡਰਾਂ ਦੇ ਸਬੂਤ ਨੂੰ ਪੜ੍ਹਦੀ ਹੈ, ਅਤੇ ਇਸ ਨੂੰ ਤਿੰਨ ਤਰ੍ਹਾਂ ਦੇ ਵਿਦਿਆਰਥੀਆਂ 'ਤੇ ਪਰਖਿਆ ਗਿਆ: ਪਹਿਲੀ ਵਾਰ CELPIP ਦੇਣ ਵਾਲਾ ਕੋਈ, ਕਮਜ਼ੋਰ ਅੰਗਰੇਜ਼ੀ ਵਾਲਾ ਕੋਈ ਜੋ ਬਸ ਤਰੀਕਾ ਲੱਭ ਰਿਹਾ ਹੈ, ਅਤੇ ਕੋਈ ਜਿਸ ਕੋਲ ਦਿਨ ਵਿੱਚ ਅੱਧਾ ਘੰਟਾ ਹੈ ਤੇ ਅਗਲੇ ਹਫ਼ਤੇ ਟੈਸਟ ਹੈ। ਇਹ ਹੈ ਜੋ ਬਦਲਿਆ।
- ਤੁਹਾਡੇ ਆਪਣੇ ਸ਼ਬਦ, ਦੁਬਾਰਾ ਦਿਖਾਏ ਗਏ. ਫੀਡਬੈਕ ਦਾ ਹਰ ਨੁਕਤਾ ਤੁਹਾਡੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਾ ਉਹੀ ਵਾਕੰਸ਼ ਦੱਸਦਾ ਹੈ ਜਿਸ 'ਤੇ ਗ੍ਰੇਡਰਾਂ ਨੇ ਪ੍ਰਤੀਕਿਰਿਆ ਦਿੱਤੀ। ਜੇ ਕੋਈ ਵਾਕੰਸ਼ ਕੋਟੇਸ਼ਨ ਨਿਸ਼ਾਨਾਂ ਵਿੱਚ ਹੈ, ਤਾਂ ਇਹ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਕਾਪੀ ਕੀਤਾ ਗਿਆ ਹੈ; ਸਾਡੀ ਪੜਤਾਲ ਵਿੱਚ 158 ਵਿੱਚੋਂ 157 ਕੋਟ ਇਸੇ ਤਰ੍ਹਾਂ ਸਨ। ਫੀਡਬੈਕ ਕਦੇ ਵੀ ਕੋਈ ਅਜਿਹੀ ਗੱਲ ਨਹੀਂ ਬਣਾਉਂਦਾ ਜੋ ਤੁਸੀਂ ਕਹੀ ਹੀ ਨਹੀਂ।
- ਪਹਿਲਾਂ ਠੀਕ ਕਰਨ ਵਾਲੀ ਇੱਕ ਗੱਲ. ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਹੀ ਸਭ ਤੋਂ ਵੱਡੀ ਸਲਾਹ ਮਿਲਦੀ ਹੈ: ਉਹ ਇੱਕ ਤਬਦੀਲੀ ਜੋ ਤੁਹਾਡੇ ਸਕੋਰ ਨੂੰ ਸਭ ਤੋਂ ਵੱਧ ਵਧਾਏਗੀ, ਸਭ ਤੋਂ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਲਿਖੀ ਹੋਈ। ਇਸ ਦੇ ਬਾਅਦ ਦੋ ਹੋਰ ਠੋਸ ਕਦਮ ਆਉਂਦੇ ਹਨ, ਫਿਰ ਬੋਲਣਾ ਸ਼ੁਰੂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਮਨ ਵਿੱਚ ਦੁਹਰਾਉਣ ਲਈ ਤਿੰਨ-ਨੁਕਾਤੀ ਚੈੱਕਲਿਸਟ।
- ਟਾਸਕ ਦੇ ਮੁਤਾਬਕ ਸਲਾਹ. ਸਲਾਹ ਦੇਣਾ, ਕਿਸੇ ਦ੍ਰਿਸ਼ ਦਾ ਵਰਣਨ ਕਰਨਾ ਅਤੇ ਕਿਸੇ ਨੂੰ ਮਨਾਉਣਾ — ਇਹਨਾਂ ਸਭ ਦਾ ਸਕੋਰ ਵੱਖ-ਵੱਖ ਗੱਲਾਂ 'ਤੇ ਹੁੰਦਾ ਹੈ। ਫੀਡਬੈਕ ਨੂੰ ਹੁਣ ਪਤਾ ਹੈ ਕਿ ਅੱਠ ਟਾਸਕ ਕਿਸਮਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ਕਿਸ ਗੱਲ ਦਾ ਇਨਾਮ ਦਿੰਦੀ ਹੈ, ਅਤੇ ਉਸੇ ਮੁਤਾਬਕ ਗੱਲ ਕਰਦਾ ਹੈ, ਸਾਰੇ ਟਾਸਕਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹੀਆਂ ਆਮ ਟਿਪਸ ਦੁਹਰਾਉਣ ਦੀ ਥਾਂ।
- ਪਹਿਲਾਂ ਕਿਸ ਪਹਿਲੂ ਦਾ ਅਭਿਆਸ ਕਰਨਾ ਹੈ. ਫੀਡਬੈਕ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਕਿਹੜਾ ਤੁਹਾਡਾ ਸਭ ਤੋਂ ਕਮਜ਼ੋਰ ਹੈ ਅਤੇ ਕਿਹੜਾ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ, ਤਾਂ ਜੋ ਤੁਹਾਨੂੰ ਪਤਾ ਹੋਵੇ ਕਿ ਅਗਲਾ ਅੰਕ ਕਿੱਥੇ ਹੈ, ਬਿਨਾਂ ਇਸ ਨੂੰ ਕਿਸੇ ਨੰਬਰ ਪਿੱਛੇ ਲੁਕਾਏ।
- ਟਾਸਕ ਨੇ ਕੀ ਮੰਗਿਆ ਅਤੇ ਤੁਸੀਂ ਕੀ ਛੱਡਿਆ. ਟਾਸਕ ਪੂਰਤੀ ਵਿੱਚ, ਫੀਡਬੈਕ ਉਹ ਖਾਸ ਹਿੱਸੇ ਸੂਚੀਬੱਧ ਕਰਦਾ ਹੈ ਜਿਹੜੇ ਪ੍ਰੌਂਪਟ ਦੇ ਤੁਸੀਂ ਕਵਰ ਨਹੀਂ ਕੀਤੇ, ਜਾਂ ਸਾਫ਼ ਕਹਿ ਦਿੰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਉਹ ਸਭ ਕਵਰ ਕਰ ਲਏ ਹਨ।
- ਗੱਲਾਂ ਜਿਹਨਾਂ ਦੀ ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਰਿਹਰਸਲ ਕਰ ਸਕਦੇ ਹੋ. ਹਰ 'ਕਿਵੇਂ ਕਰੀਏ' ਸਲਾਹ ਕੁਝ ਅਜਿਹਾ ਹੈ ਜੋ ਤੁਸੀਂ ਆਪਣੀ ਅਗਲੀ ਕੋਸ਼ਿਸ਼ ਤੋਂ ਪਹਿਲਾਂ ਉੱਚੀ ਆਵਾਜ਼ ਵਿੱਚ ਬੋਲ ਸਕਦੇ ਹੋ। ਵੱਧ ਸਪਸ਼ਟ ਬੋਲਣ ਜਾਂ ਆਪਣਾ ਲਹਿਜਾ ਘਟਾਉਣ ਦੀ ਕੋਈ ਸਲਾਹ ਨਹੀਂ ਦਿੱਤੀ ਜਾਂਦੀ: ਲਹਿਜਾ ਉਹ ਚੀਜ਼ ਨਹੀਂ ਜਿਸ ਨੂੰ ਸੁਣਨਯੋਗਤਾ ਮਾਪਦੀ ਹੈ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ 'ਤੇ ਕਦੇ ਟਿੱਪਣੀ ਨਹੀਂ ਕਰਦਾ।
- ਟਾਈਮਰ ਲਈ ਕੋਈ ਦੋਸ਼ ਨਹੀਂ. ਜੇ ਕੋਈ ਜਵਾਬ ਟਾਸਕ ਪੂਰਾ ਕਰ ਲੈਣ ਤੋਂ ਬਾਅਦ ਸਮੇਂ ਦੀ ਵਜ੍ਹਾ ਨਾਲ ਵਿੱਚੋਂ ਕੱਟਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਸ ਕੱਟ ਦੇ ਲਈ ਸਕੋਰ ਨਹੀਂ ਘਟਾਇਆ ਜਾਂਦਾ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਝਾੜ ਨਹੀਂ ਪਾਉਂਦਾ।
ਜਦੋਂ ਇੱਕ ਸੁਤੰਤਰ ਨਿਰਣਾਇਕ ਮਾਡਲ ਨੇ ਇਸ ਫੀਡਬੈਕ ਦੀ ਤੁਲਨਾ ਉਸ ਨਾਲ ਕੀਤੀ ਜੋ ਸਾਡੇ ਪਿਛਲੇ ਸਿਸਟਮ ਨੇ ਇਹਨਾਂ ਹੀ ਜਵਾਬਾਂ ਲਈ ਦਿੱਤਾ ਸੀ, ਬਿਨਾਂ ਇਹ ਜਾਣੇ ਕਿ ਕਿਹੜਾ ਕਿਹੜਾ ਹੈ, ਇਸ ਨੇ 24 ਵਿੱਚੋਂ 20 ਤੁਲਨਾਵਾਂ ਵਿੱਚ ਨਵੇਂ ਫੀਡਬੈਕ ਨੂੰ ਪਹਿਲ ਦਿੱਤੀ, ਭਾਵੇਂ ਇਹ ਇੱਕ ਪ੍ਰੀਖਿਅਕ ਵਾਂਗ ਨਿਰਣਾ ਕਰ ਰਿਹਾ ਹੋਵੇ ਜਾਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਵਾਂਗ।
CA$25 ਪ੍ਰਤੀ ਮਹੀਨਾ ਵਿੱਚ ਅਸੀਮਿਤ ਪ੍ਰੈਕਟਿਸ
ਸ਼ੁੱਧਤਾ ਤਾਂ ਹੀ ਕੰਮ ਦੀ ਹੈ ਜੇ ਤੁਸੀਂ ਇਸਨੂੰ ਹਰ ਰੋਜ਼ ਵਰਤ ਸਕੋ। ਜਿਸ ਸਪੀਕਿੰਗ ਸਕੋਰ ’ਤੇ ਤੁਸੀਂ ਭਰੋਸਾ ਕਰ ਸਕਦੇ ਹੋ, ਉਹ ਤੁਹਾਡੇ ਚੌਥੇ ਪ੍ਰੈਕਟਿਸ ਜਵਾਬ ’ਤੇ ਨਹੀਂ, ਚਾਲ੍ਹੀਵੇਂ ’ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਕੀਮਤੀ ਹੁੰਦਾ ਹੈ, ਕਿਉਂਕਿ ਉਦੋਂ ਹੀ ਸਕੋਰ ਤੁਹਾਨੂੰ ਦੱਸਣ ਲੱਗਦਾ ਹੈ ਕਿ ਤੁਹਾਡੇ ਬੋਲਣ ਦੇ ਤਰੀਕੇ ਵਿੱਚ ਕੀਤੀ ਤਬਦੀਲੀ ਅਸਲ ਵਿੱਚ ਕੰਮ ਕਰ ਰਹੀ ਹੈ ਜਾਂ ਨਹੀਂ। ਇਸ ਲਈ ਅਸੀਂ Engine 2.0 ਦੀ ਕੀਮਤ ਇਸ ਤਰ੍ਹਾਂ ਰੱਖੀ ਹੈ ਕਿ ਇਸਨੂੰ ਗਿਣੇ ਬਿਨਾਂ ਵਰਤਿਆ ਜਾ ਸਕੇ।
ਹਰ Prepamigo ਪਲਾਨ ਵਿੱਚ Engine 2.0 ਦੁਆਰਾ ਅਸੀਮਿਤ ਸਕੋਰਿੰਗ, ਅਸੀਮਿਤ ਕੋਸ਼ਿਸ਼ਾਂ, ਅਤੇ ਪੂਰਾ ਸਵਾਲ ਬੈਂਕ ਸ਼ਾਮਲ ਹੈ: Speaking, Writing, Reading ਅਤੇ Listening ਵਿੱਚ 80 ਪੂਰੇ ਪ੍ਰੈਕਟਿਸ ਸੈੱਟ ਅਤੇ 2,000 ਤੋਂ ਵੱਧ ਪ੍ਰੈਕਟਿਸ ਟਾਸਕ, ਜੋ CELPIP General ਟੈਸਟ ਦੇ ਟਾਸਕ ਕਿਸਮਾਂ, ਸਮੇਂ ਅਤੇ ਫਾਰਮੈਟ ਮੁਤਾਬਕ ਲਿਖੇ ਗਏ ਹਨ। ਤੁਸੀਂ ਰਿਕਾਰਡ ਦਬਾਉਂਦੇ ਹੋ, ਲਗਭਗ ਦਸ ਸਕਿੰਟਾਂ ਵਿੱਚ ਸਕੋਰ ਅਤੇ ਸਬੂਤ ’ਤੇ ਆਧਾਰਿਤ ਫੀਡਬੈਕ ਮਿਲਦਾ ਹੈ, ਅਤੇ ਤੁਸੀਂ ਜਿੰਨੀ ਵਾਰ ਚਾਹੋ ਇਹ ਦੁਹਰਾ ਸਕਦੇ ਹੋ।
Prepamigo
CA$25/ ਮਹੀਨਾ
ਮਹੀਨਾਵਾਰ CA$24.98 · ਸਾਲਾਨਾ ਪਲਾਨ ’ਤੇ CA$8.25 ਪ੍ਰਤੀ ਮਹੀਨਾ (CA$98.98 ਪ੍ਰਤੀ ਸਾਲ) · ਟੈਕਸ ਸਮੇਤ · ਕਦੇ ਵੀ ਰੱਦ ਕਰੋ
- ਅਸੀਮਿਤ ਸਕੋਰਿੰਗ Scoring Engine 2.0 ਦੁਆਰਾ, ਬਿਨਾਂ ਕਿਸੇ ਰੋਜ਼ਾਨਾ, ਸੈਸ਼ਨ ਜਾਂ ਹਫ਼ਤਾਵਾਰੀ ਹੱਦ ਦੇ।
- 80 ਪ੍ਰੈਕਟਿਸ ਸੈੱਟ ਅਤੇ 2,000+ ਟਾਸਕ ਚਾਰੇ ਸੈਕਸ਼ਨਾਂ ਵਿੱਚ, ਅਸਲ ਟੈਸਟ ਫਾਰਮੈਟ ’ਤੇ ਬਣੇ, ਤਾਂ ਜੋ ਤੁਹਾਨੂੰ ਕਦੇ ਆਪਣੇ ਪ੍ਰੋਂਪਟ ਨਾ ਲਿਖਣੇ ਪੈਣ।
- ਰਿਕਾਰਡ ਕਰੋ ਤੇ ਅੱਗੇ ਵਧੋ। ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ, ਗਰੇਡਿੰਗ ਅਤੇ ਫੀਡਬੈਕ ਤੁਹਾਡੇ ਲਈ ਸੰਭਾਲੇ ਜਾਂਦੇ ਹਨ; ਕੁਝ ਵੀ ਪੇਸਟ ਕਰਨ ਜਾਂ ਪ੍ਰੋਂਪਟ ਕਰਨ ਦੀ ਲੋੜ ਨਹੀਂ।
- ਤੁਹਾਡੇ ਆਪਣੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਫੀਡਬੈਕ, ਜਿਸ ਵਿੱਚ ਹਰ ਹਵਾਲਾ ਉਸ ਨਾਲ ਜੋੜਿਆ ਜਾ ਸਕਦਾ ਹੈ ਜੋ ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਕਿਹਾ ਸੀ।
ਤੁਲਨਾ ਲਈ, Claude Max
US$100/ ਮਹੀਨਾ
ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ ਲਗਭਗ CA$138 · 20x ਟੀਅਰ US$200 ਪ੍ਰਤੀ ਮਹੀਨਾ · Pro US$20 ਕਿਤੇ ਸਖ਼ਤ ਹੱਦਾਂ ਨਾਲ
- Max ਦੀ ਵੀ ਹੱਦ ਹੈ। ਪੰਜ ਘੰਟੇ ਦੀ ਰੋਲਿੰਗ ਵਰਤੋਂ ਵਿੰਡੋ ਅਤੇ ਹਫ਼ਤਾਵਾਰੀ ਹੱਦ, Pro ਨਾਲੋਂ ਪੰਜ ਜਾਂ ਵੀਹ ਗੁਣਾ; ਜਦੋਂ ਤੁਸੀਂ ਕਿਸੇ ਇੱਕ ਨੂੰ ਛੂਹ ਲੈਂਦੇ ਹੋ, ਤੁਸੀਂ ਉਡੀਕ ਕਰਦੇ ਹੋ।
- ਕੋਈ ਸਵਾਲ ਬੈਂਕ ਨਹੀਂ। ਤੁਸੀਂ ਆਪਣੇ ਟਾਸਕ ਖੁਦ ਲਿਆਉਂਦੇ ਹੋ, ਖੁਦ ਫ਼ੈਸਲਾ ਕਰਦੇ ਹੋ ਕਿ ਉਹ ਅਸਲ ਟੈਸਟ ਵਰਗੇ ਹਨ ਜਾਂ ਨਹੀਂ, ਅਤੇ ਖੁਦ ਹਿਸਾਬ ਰੱਖਦੇ ਹੋ ਕਿ ਕੀ ਪਹਿਲਾਂ ਕਰ ਚੁੱਕੇ ਹੋ।
- ਸੈੱਟਅੱਪ ਤੁਸੀਂ ਕਰਦੇ ਹੋ। ਰਿਕਾਰਡ ਕਰਨਾ, ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕਰਨਾ, ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਪੇਸਟ ਕਰਨਾ ਅਤੇ ਗਰੇਡਿੰਗ ਹਦਾਇਤਾਂ ਲਿਖਣਾ, ਹਰ ਵਾਰ, ਸਭ ਤੁਹਾਡੇ ’ਤੇ ਹੈ।
- ਸਾਦੀ ਬੇਨਤੀ, ਕੈਲੀਬਰੇਟ ਕੀਤਾ ਗਰੇਡਰ ਨਹੀਂ। ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਪੁੱਛਣ ’ਤੇ Claude Opus 5 ਨੇ 62% ਵਾਰ ਅਤੇ Claude Sonnet 5 ਨੇ 45% ਵਾਰ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਨਾਲ ਮੇਲ ਖਾਧਾ, Engine 2.0 ਦੇ 81% ਦੇ ਮੁਕਾਬਲੇ।
Claude ਪਲਾਨ ਦੀਆਂ ਕੀਮਤਾਂ ਅਤੇ ਵਰਤੋਂ ਦੀਆਂ ਸ਼ਰਤਾਂ ਸਤੰਬਰ 2026 ਵਿੱਚ claude.com ’ਤੇ ਪ੍ਰਕਾਸ਼ਿਤ ਮੁਤਾਬਕ ਹਨ ਅਤੇ ਬਦਲ ਸਕਦੀਆਂ ਹਨ। CELPIP ਆਪਣੇ ਮਾਲਕ ਦਾ ਟ੍ਰੇਡਮਾਰਕ ਹੈ; Prepamigo ਇੱਕ ਸੁਤੰਤਰ ਪ੍ਰੈਕਟਿਸ ਪਲੇਟਫਾਰਮ ਹੈ ਅਤੇ ਟੈਸਟ ਬਣਾਉਣ ਵਾਲੇ ਨਾਲ ਜੁੜਿਆ, ਪ੍ਰਮਾਣਿਤ ਜਾਂ ਸੰਬੰਧਿਤ ਨਹੀਂ ਹੈ। Prepamigo ਦੇ ਪ੍ਰੈਕਟਿਸ ਟਾਸਕ ਜਨਤਕ ਟੈਸਟ ਫਾਰਮੈਟ ਮੁਤਾਬਕ ਲਿਖੀ ਮੌਲਿਕ ਸਮੱਗਰੀ ਹਨ।
ਉਪਲਬਧਤਾ
Speaking ਲਈ Prepamigo Scoring Engine 2.0 ਹੁਣ ਸਾਰੇ Prepamigo ਵਰਤੋਂਕਾਰਾਂ ਲਈ ਹਰ ਸਪੀਕਿੰਗ ਟਾਸਕ ਕਿਸਮ ’ਤੇ ਲਾਈਵ ਹੈ। ਕੁਝ ਵੀ ਚਾਲੂ ਕਰਨ ਦੀ ਲੋੜ ਨਹੀਂ। ਹਰ ਨਵਾਂ ਸਪੀਕਿੰਗ ਜਵਾਬ Engine 2.0 ਦੁਆਰਾ ਸਕੋਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਹਰ ਸਕੋਰ ਦੇ ਨਾਲ ਵਿਦਿਆਰਥੀ ਦੇ ਆਪਣੇ ਸ਼ਬਦਾਂ ਤੋਂ ਲਿਆ ਫੀਡਬੈਕ ਆਉਂਦਾ ਹੈ।
ਇੱਕ ਆਮ ਜਵਾਬ ਲਗਭਗ ਦਸ ਸਕਿੰਟਾਂ ਵਿੱਚ ਸਕੋਰ ਹੋ ਜਾਂਦਾ ਹੈ, Engine 1.0 ਨਾਲੋਂ ਤੇਜ਼। Engine 2.0 ਨੂੰ ਚਲਾਉਣ ਦੀ ਪ੍ਰਤੀ ਜਵਾਬ ਲਾਗਤ ਵੀ ਸਾਨੂੰ ਪਿਛਲੇ ਡਿਜ਼ਾਈਨ ਨਾਲੋਂ ਘੱਟ ਪੈਂਦੀ ਹੈ, ਜਿਸ ਕਰਕੇ ਅਸੀਂ Prepamigo ਦੀ ਕੀਮਤ ਬਦਲੇ ਬਿਨਾਂ ਹਰ ਵਿਦਿਆਰਥੀ ਲਈ ਦੋ ਗਰੇਡਰ ਅਤੇ ਤਿੰਨ-ਤਿੰਨ ਵੋਟਾਂ ਚਲਾ ਸਕਦੇ ਹਾਂ।
ਉੱਪਰ ਦੱਸੀ ਅਸਲ-ਦੁਨੀਆ ਦੀ ਤਸਦੀਕ ਪੂਰੀ ਹੋਣ ’ਤੇ ਅਸੀਂ ਇਸ ਪੰਨੇ ਦੇ ਅੰਕੜਿਆਂ ਦੇ ਅੱਪਡੇਟ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰਾਂਗੇ। ਜੇ ਤੁਹਾਡੇ ਕੋਲ ਕੋਈ ਰਿਕਾਰਡਿੰਗ ਹੈ ਜਿਸਨੂੰ ਤੁਹਾਡੇ ਖ਼ਿਆਲ ਵਿੱਚ Engine 2.0 ਨੇ ਗ਼ਲਤ ਸਕੋਰ ਦਿੱਤਾ, ਅਸੀਂ ਉਹ ਦੇਖਣਾ ਚਾਹੁੰਦੇ ਹਾਂ: ਅਗਲਾ ਸੁਧਾਰ ਲੱਭਣ ਦਾ ਇਹ ਸਭ ਤੋਂ ਤੇਜ਼ ਤਰੀਕਾ ਹੈ ਜੋ ਸਾਨੂੰ ਪਤਾ ਹੈ।
ਆਹਮੋ-ਸਾਹਮਣੇ ਤੁਲਨਾਵਾਂ ਲਈ ਪੜ੍ਹੋ Prepamigo ਬਨਾਮ Claude ਅਤੇ Prepamigo ਬਨਾਮ ChatGPT। ਇਹ ਗਾਈਡ ਅੰਗਰੇਜ਼ੀ ਵਿੱਚ ਪੜ੍ਹੋ · ਜਵਾਬ ਰਿਕਾਰਡ ਕਰੋ
