ਸਕੋਰਿੰਗ

ਸਪੀਕਿੰਗ ਲਈ Prepamigo Scoring Engine 2.0 ਪੇਸ਼ ਕਰਦੇ ਹਾਂ

6 ਸਤੰਬਰ 2026

Prepamigo Scoring Engine 2.0 ਬਨਾਮ ਫਰੰਟੀਅਰ ਮਾਡਲ ਗ੍ਰੇਡਰਾਂ ਵਜੋਂ

ਸਪੀਕਿੰਗ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਜਿੱਥੇ ਸਕੋਰ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਸੀ। 48 ਜਵਾਬ ਜੋ ਸਿਸਟਮਾਂ ਨੇ ਕਦੇ ਨਹੀਂ ਦੇਖੇ ਸਨ, ਹੇਠਲੇ, ਮੱਧ ਅਤੇ ਟੌਪ ਸਕੋਰਾਂ ਵਿੱਚ ਬਰਾਬਰ ਫੈਲੇ ਹੋਏ। ਹਰ ਮਾਡਲ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਿੱਤੀ ਗਈ ਅਤੇ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਇਸ ਨੂੰ CELPIP ਸਕੇਲ ’ਤੇ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।

81%

Prepamigo Scoring Engine 2.0Prepamigo

62%

Claude Opus 5Anthropic

58%

GeminiGoogle

45%

Claude Sonnet 5Anthropic

45%

GPT-4o miniOpenAI

37%

GPT 5.5OpenAI

35%

GPT 5.6 solOpenAI

31%

GPT 5.6 lunaOpenAI

Prepamigo ਬਨਾਮ ਟੌਪ ਚੈਟਬੋਟ ਪਲਾਨ

ਕੈਨੇਡੀਅਨ ਡਾਲਰ ਵਿੱਚ। Prepamigo ਦੀਆਂ ਕੀਮਤਾਂ ਵਿੱਚ ਟੈਕਸ ਸ਼ਾਮਲ ਹੈ। Claude Max (US$100 ਤੋਂ ਸ਼ੁਰੂ) ਅਤੇ ChatGPT Pro (US$200) ਨੂੰ 1.38 ਦੀ ਦਰ ਨਾਲ ਬਦਲਿਆ ਗਿਆ ਹੈ, ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ। ਸ਼ੁੱਧਤਾ ਉਹਨਾਂ ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤਾ ਗਿਆ ਜਦੋਂ ਦੱਸੇ ਗਏ ਮਾਡਲ ਨੂੰ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਜਵਾਬ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
ਮਹੀਨਾਵਾਰ ਕੀਮਤ
CA$24.98 (ਟੈਕਸ ਸਮੇਤ)
CA$138+ (ਟੈਕਸ ਵਾਧੂ)
CA$276 (ਟੈਕਸ ਵਾਧੂ)
ਸਕੋਰਿੰਗ
ਅਸੀਮਿਤ
ਸੀਮਿਤ
ਸੀਮਿਤ
ਤਿਆਰ ਸਵਾਲ ਬੈਂਕ
ਹਾਂ
ਨਹੀਂ
ਨਹੀਂ
ਪ੍ਰੈਕਟਿਸ ਸੈੱਟ
80
ਕੋਈ ਨਹੀਂ
ਕੋਈ ਨਹੀਂ
ਪ੍ਰੈਕਟਿਸ ਟਾਸਕ
2,000+
ਕੋਈ ਨਹੀਂ
ਕੋਈ ਨਹੀਂ
CELPIP ਫਾਰਮੈਟ
ਹਾਂ
ਨਹੀਂ
ਨਹੀਂ
ਸ਼ੁੱਧਤਾ
81%
62%
35%
ਟੌਪ-ਲੈਵਲ ਜਵਾਬ
71%
50%
25%

ਸਾਡਾ ਹੁਣ ਤੱਕ ਦਾ ਸਭ ਤੋਂ ਸਹੀ ਸਪੀਕਿੰਗ ਗ੍ਰੇਡਰ। ਜਿਹੜੇ ਜਵਾਬ ਇਸ ਨੇ ਕਦੇ ਨਹੀਂ ਦੇਖੇ ਸਨ, ਉਨ੍ਹਾਂ ’ਤੇ Prepamigo Scoring Engine 2.0 ਨੇ 81% ਵਾਰ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰਾਂ ਨਾਲ ਮੇਲ ਖਾਧਾ, ਹਰ ਫਰੰਟੀਅਰ ਮਾਡਲ ਤੋਂ ਅੱਗੇ ਜਿਸ ਦਾ ਅਸੀਂ ਉਸੇ ਕੰਮ ’ਤੇ ਟੈਸਟ ਕੀਤਾ, ਅਤੇ Engine 1.0 ਤੋਂ, ਜਿਸ ਗ੍ਰੇਡਰ ਦੀ ਇਹ ਥਾਂ ਲੈਂਦਾ ਹੈ, ਇੱਕ ਸਪਸ਼ਟ ਕਦਮ ਅੱਗੇ ਹੈ।

ਅੱਜ ਅਸੀਂ ਸਪੀਕਿੰਗ ਲਈ Prepamigo Scoring Engine 2.0 ਜਾਰੀ ਕਰ ਰਹੇ ਹਾਂ, ਉਹ ਸਿਸਟਮ ਜੋ Prepamigo ’ਤੇ ਹਰ ਬੋਲੇ ਹੋਏ ਪ੍ਰੈਕਟਿਸ ਜਵਾਬ ਨੂੰ ਗ੍ਰੇਡ ਕਰਦਾ ਹੈ। Engine 2.0 ਸਾਡੇ ਸਕੋਰ ਕਰਨ ਦੇ ਤਰੀਕੇ ਦਾ ਇੱਕ ਪੂਰਾ ਪੁਨਰ-ਡਿਜ਼ਾਈਨ ਹੈ। ਇੱਕ ਸਿੰਗਲ ਗ੍ਰੇਡਿੰਗ ਪਾਸ ਦੀ ਥਾਂ, ਇਹ ਦੋ ਸੁਤੰਤਰ ਗ੍ਰੇਡਰ ਵਰਤਦਾ ਹੈ ਜੋ ਹਰ ਜਵਾਬ ਦੀ ਸਿੱਧੀ ਤੁਲਨਾ ਕੈਲੀਬ੍ਰੇਟਿਡ ਉਦਾਹਰਣਾਂ ਨਾਲ ਕਰਦੇ ਹਨ, ਕਈ ਵਾਰ ਵੋਟ ਦਿੰਦੇ ਹਨ, ਅਤੇ ਸਕੋਰ ਦਿਖਾਏ ਜਾਣ ਤੋਂ ਪਹਿਲਾਂ ਆਪਣੇ ਜਵਾਬਾਂ ਦਾ ਮੇਲ ਕਰਦੇ ਹਨ।

ਨਤੀਜਾ ਇੱਕ ਅਜਿਹਾ ਗ੍ਰੇਡਰ ਹੈ ਜੋ ਕਿਸੇ ਵੀ ਫਰੰਟੀਅਰ ਮਾਡਲ ਨਾਲੋਂ, ਜਿਸ ਤਰ੍ਹਾਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਇਸ ਨੂੰ ਵਰਤਦਾ, ਬਹੁਤ ਜ਼ਿਆਦਾ ਸਹੀ ਹੈ। ਅਸਲ ਬੋਲੇ ਗਏ ਜਵਾਬਾਂ ਦੇ ਇੱਕ ਹੋਲਡ-ਆਊਟ ਸੈੱਟ ’ਤੇ, ਜਿਨ੍ਹਾਂ ਦੇ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਸਨ, Engine 2.0 ਨੇ 81% ਵਾਰ ਸਹੀ ਸਕੋਰ ’ਤੇ ਪਹੁੰਚ ਕੀਤੀ। ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ ਨੂੰ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਸਕੋਰ ਕਰਨ ਲਈ ਕਹਿਣ ’ਤੇ, ਉਨ੍ਹਾਂ ਵਿੱਚੋਂ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ, Claude Opus 5, 62% ਤੱਕ ਪਹੁੰਚਿਆ। Gemini 58% ਤੱਕ ਪਹੁੰਚਿਆ। Claude Sonnet 5 ਅਤੇ GPT-4o mini 45% ਤੱਕ ਪਹੁੰਚੇ, GPT 5.5 37%, GPT 5.6 sol 35%, ਅਤੇ GPT 5.6 luna 31%। ਜਦੋਂ ਅਸੀਂ ਫਿਰ ਹਰ ਮਾਡਲ ਨੂੰ Engine 2.0 ਦੀ ਆਪਣੀ ਪ੍ਰਕਿਰਿਆ ਦਿੱਤੀ, ਹਰ ਟਾਸਕ ਲਈ ਅਸਲ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਸਮੇਤ, ਤਾਂ ਉਨ੍ਹਾਂ ਵਿੱਚੋਂ ਸਭ ਤੋਂ ਵਧੀਆ 77% ਤੱਕ ਚੜ੍ਹਿਆ ਅਤੇ ਫਿਰ ਵੀ ਪਿੱਛੇ ਰਿਹਾ।

ਸ਼ੁੱਧਤਾ ਸਭ ਤੋਂ ਵੱਧ ਉੱਥੇ ਮਹੱਤਵ ਰੱਖਦੀ ਹੈ ਜਿੱਥੇ ਇਸ ਨੂੰ ਹਾਸਲ ਕਰਨਾ ਸਭ ਤੋਂ ਔਖਾ ਹੁੰਦਾ ਹੈ। Engine 2.0 71% ਵਾਰ ਇੱਕ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਪਛਾਣਦਾ ਹੈ। ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ, ਕਿਸੇ ਹੋਰ ਮਾਡਲ ਨੇ 56% ਤੋਂ ਵੱਧ ਨਹੀਂ ਪਛਾਣਿਆ, ਅਤੇ GPT ਮਾਡਲਾਂ ਨੇ 13% ਅਤੇ 27% ਦੇ ਵਿਚਕਾਰ ਪਛਾਣਿਆ। Engine 2.0 ਆਟੋਮੇਟਿਡ ਗ੍ਰੇਡਰਾਂ ਦੀ ਸਭ ਤੋਂ ਆਮ ਅਸਫਲਤਾ ਦਾ ਵੀ ਵਿਰੋਧ ਕਰਦਾ ਹੈ: ਸਕੋਰ ਜੋ ਘੱਟ ਅਤੇ ਸਕੇਲ ਦੇ ਵਿਚਕਾਰ ਵੱਲ ਖਿਸਕਦੇ ਹਨ ਭਾਵੇਂ ਜਵਾਬ ਅਸਲ ਵਿੱਚ ਕਿੰਨਾ ਵੀ ਮਜ਼ਬੂਤ ਜਾਂ ਕਮਜ਼ੋਰ ਹੋਵੇ। ਇਹ ਖਿਸਕਾਅ ਉਹ ਕਮਜ਼ੋਰੀ ਸੀ ਜੋ ਅਸੀਂ Engine 1.0 ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਧ ਦੇਖੀ।

Engine 2.0 ਤੇਜ਼ ਹੈ, ਵਧੇਰੇ ਇਕਸਾਰ ਹੈ, ਅਤੇ ਅਜਿਹੀ ਫੀਡਬੈਕ ਦਿੰਦਾ ਹੈ ਜੋ ਵਿਦਿਆਰਥੀ ਦੇ ਆਪਣੇ ਸ਼ਬਦਾਂ ਦਾ ਹਵਾਲਾ ਦਿੰਦੀ ਹੈ। ਇਹ ਅੱਜ ਹਰ Prepamigo ਵਰਤੋਂਕਾਰ ਲਈ ਲਾਈਵ ਹੈ। ਇਹ ਪੰਨਾ ਦੱਸਦਾ ਹੈ ਕਿ ਇਹ ਕੀ ਕਰਦਾ ਹੈ, ਅਸੀਂ ਇਸ ਨੂੰ ਕਿਵੇਂ ਮਾਪਿਆ, ਅਤੇ ਇਸ ਦੀਆਂ ਸੀਮਾਵਾਂ ਹੁਣ ਵੀ ਕਿੱਥੇ ਹਨ।

ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰਾਂ ਦੇ ਵਿਰੁੱਧ ਸ਼ੁੱਧਤਾ

ਸਾਡੇ ਲਈ ਮਹੱਤਵਪੂਰਨ ਸਵਾਲ ਸਾਦਾ ਹੈ। ਜਦੋਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਇੱਕ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰਦਾ ਹੈ, ਕੀ ਸਕਰੀਨ ’ਤੇ ਦਿੱਤਾ ਸਕੋਰ ਉਸ ਸਕੋਰ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ ਜੋ ਇੱਕ ਭਰੋਸੇਯੋਗ ਗ੍ਰੇਡਰ ਦਿੰਦਾ? ਇਸ ਦਾ ਜਵਾਬ ਦੇਣ ਲਈ ਅਸੀਂ ਸਾਰੇ ਅੱਠ ਸਪੀਕਿੰਗ ਟਾਸਕ ਕਿਸਮਾਂ ਵਿੱਚ ਅਸਲ ਬੋਲੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਇੱਕ ਟੈਸਟ ਸੈੱਟ ਬਣਾਇਆ, ਹਰੇਕ ਦਾ ਇੱਕ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਸੀ, ਅਤੇ ਅਸੀਂ ਸੈੱਟ ਨੂੰ ਹੇਠਲੇ, ਮੱਧ ਅਤੇ ਟੌਪ ਸਕੋਰਾਂ ਵਿੱਚ ਬਰਾਬਰ ਵੰਡਿਆ ਤਾਂ ਜੋ ਕੋਈ ਵੀ ਇੱਕ ਪੱਧਰ ਨਤੀਜੇ ’ਤੇ ਹਾਵੀ ਨਾ ਹੋ ਸਕੇ।

ਇਹ ਤੁਲਨਾ ਉਨ੍ਹਾਂ ਜਵਾਬਾਂ ਵਿੱਚੋਂ 48 ਦੀ ਵਰਤੋਂ ਕਰਦੀ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਸ਼ੁਰੂ ਤੋਂ ਹੀ ਵੱਖ ਰੱਖਿਆ ਗਿਆ ਸੀ। ਟੀਮ ਵਿੱਚੋਂ ਕਿਸੇ ਨੇ ਵੀ Engine 2.0 ਬਣਾਉਣ ਜਾਂ ਟਿਊਨ ਕਰਨ ਦੌਰਾਨ ਇਹਨਾਂ ਦੀ ਵਰਤੋਂ ਨਹੀਂ ਕੀਤੀ। ਹਰ ਜਵਾਬ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕੀਤਾ ਗਿਆ ਸੀ। ਫਿਰ ਹਰ ਮਾਡਲ ਨੂੰ ਦੱਸਿਆ ਗਿਆ ਕਿ ਇਹ ਇੱਕ ਤਜਰਬੇਕਾਰ CELPIP ਪਰੀਖਿਅਕ ਹੈ, ਟਾਸਕ ਪ੍ਰੌਮਪਟ ਅਤੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਿੱਤੀ ਗਈ, ਅਤੇ ਜਵਾਬ ਨੂੰ 0 ਤੋਂ 12 ਤੱਕ, ਤਿੰਨ ਵਾਰ, ਵੱਖ-ਵੱਖ ਦਿਨਾਂ ’ਤੇ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ। ਅਸੀਂ ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ ਕੱਢੀ ਅਤੇ ਗਿਣਿਆ ਕਿ ਸਕੋਰ ਕਿੰਨੀ ਵਾਰ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਦੇ ਪੱਧਰ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਸੀ।

51%

Claude Opus 5 ਨਾਲੋਂ ਘੱਟ ਗਲਤੀਆਂ

ਪ੍ਰਤੀ 100 ਜਵਾਬਾਂ ’ਤੇ 19 ਗਲਤ ਸਕੋਰ, 38 ਦੇ ਮੁਕਾਬਲੇ।

71%

GPT 5.6 sol ਨਾਲੋਂ ਘੱਟ ਗਲਤੀਆਂ

ਪ੍ਰਤੀ 100 ’ਤੇ 19 ਗਲਤ ਸਕੋਰ, 65 ਦੇ ਮੁਕਾਬਲੇ।

71%

ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਪਛਾਣੇ ਗਏ

ਦੂਜੇ ਮਾਡਲਾਂ ਵਿੱਚੋਂ ਸਭ ਤੋਂ ਵਧੀਆ 56% ਪਛਾਣਦਾ ਹੈ; GPT 5.6 sol 25% ਪਛਾਣਦਾ ਹੈ।

ਇਨ੍ਹਾਂ ਨੰਬਰਾਂ ਵਿੱਚ ਤਿੰਨ ਗੱਲਾਂ ਸਾਹਮਣੇ ਆਉਂਦੀਆਂ ਹਨ। ਪਹਿਲਾਂ, ਫਰਕ ਛੋਟਾ ਨਹੀਂ ਹੈ। 48-ਜਵਾਬ ਦੇ ਟੈਸਟ ’ਤੇ, ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਫਰੰਟੀਅਰ ਮਾਡਲ ਦੇ ਵਿਰੁੱਧ ਉੱਨੀ ਪੁਆਇੰਟ ਅਤੇ ChatGPT ਦੇ ਪੇਡ ਪਲਾਨਾਂ ਪਿੱਛੇ ਦੇ ਮਾਡਲ ਦੇ ਵਿਰੁੱਧ ਛਿਆਲੀ ਪੁਆਇੰਟ, ਨੌਂ ਅਤੇ ਬਾਈ ਵਾਧੂ ਸਹੀ ਸਕੋਰਾਂ ਵਿਚਕਾਰ ਦਾ ਫਰਕ ਹੈ। ਦੂਜਾ, ਇਹ ਫਰਕ ਕਿਸੇ ਸੁਖਾਲੇ ਟੈਸਟ ਦਾ ਨਤੀਜਾ ਨਹੀਂ ਹੈ। 48 ਜਵਾਬ Engine 2.0 ਦਾ ਡਿਜ਼ਾਈਨ ਅੰਤਿਮ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ ਚੁਣੇ ਗਏ ਸਨ ਅਤੇ ਵਿਕਾਸ ਦੌਰਾਨ ਕਦੇ ਵੀ ਛੂਹੇ ਨਹੀਂ ਗਏ। ਤੀਜਾ, ਇਹ ਤੁਲਨਾ ਉਹੀ ਹੈ ਜੋ ਇੱਕ ਵਿਦਿਆਰਥੀ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ: ਇਹ ਮਾਪਦੀ ਹੈ ਕਿ ਜਦੋਂ ਤੁਸੀਂ ਇੱਕ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਨੂੰ ਇੱਕ ਚੈਟਬੋਟ ਵਿੱਚ ਪੇਸਟ ਕਰਦੇ ਹੋ ਅਤੇ ਪੁੱਛਦੇ ਹੋ ਤਾਂ ਤੁਹਾਨੂੰ ਕੀ ਮਿਲਦਾ ਹੈ, ਜੋ ਕਿ ਲਗਭਗ ਹਰ ਕੋਈ ਇਹਨਾਂ ਮਾਡਲਾਂ ਨੂੰ ਵਰਤਣ ਦਾ ਤਰੀਕਾ ਹੈ।

“ਸਹੀ” ਦਾ ਇੱਥੇ ਮਤਲਬ ਕੀ ਹੈ, ਇਸ ਬਾਰੇ ਇੱਕ ਗੱਲ। ਇਸ ਸਕੇਲ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਸਿੰਗਲ ਪੁਆਇੰਟਾਂ ਦੀ ਥਾਂ ਪੱਧਰਾਂ ਵਿੱਚ ਆਉਂਦੇ ਹਨ, ਇਸ ਲਈ ਅਸੀਂ ਇੱਕ ਸਕੋਰ ਨੂੰ ਸਹੀ ਗਿਣਦੇ ਹਾਂ ਜਦੋਂ ਇਹ ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ ਦੇ ਅੰਦਰ ਆਉਂਦਾ ਹੈ। ਉਦਾਹਰਣ ਵਜੋਂ, ਟੌਪ ਪੱਧਰ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਇੱਕ ਜਵਾਬ ਸਹੀ ਸਕੋਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਜੇ ਇੰਜਣ ਇਸ ਨੂੰ 9, 10 ਜਾਂ 11 ਦਿੰਦਾ ਹੈ। ਇੱਕ ਸਖ਼ਤ ਪੜ੍ਹਤ ਦੇ ਅਧੀਨ ਜੋ ਸਿਰਫ਼ 10 ਅਤੇ ਇਸ ਤੋਂ ਵੱਧ ਨੂੰ ਸਵੀਕਾਰ ਕਰਦੀ ਹੈ, ਹਰ ਸਿਸਟਮ ਕੁਝ ਪੁਆਇੰਟ ਗੁਆ ਦਿੰਦਾ ਹੈ ਅਤੇ ਰੈਂਕਿੰਗ ਨਹੀਂ ਬਦਲਦੀ।

ਸਿਸਟਮਸਾਦੀ ਬੇਨਤੀਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦੇ ਨਾਲ
Prepamigo Scoring Engine 2.081.3%
Claude Opus 561.8%77.1%
Gemini58.3%70.8%
Claude Sonnet 545.1%68.8%
GPT-4o mini45.1%50.0%
GPT 5.536.8%68.8%
GPT 5.6 sol35.4%70.8%
GPT 5.6 luna30.6%62.5%

ਹਰ ਸਕੋਰ ਪੱਧਰ ’ਤੇ ਪ੍ਰਦਰਸ਼ਨ

ਇੱਕ ਔਸਤ ਸ਼ੁੱਧਤਾ ਅੰਕੜਾ ਬਹੁਤ ਕੁਝ ਲੁਕਾ ਸਕਦਾ ਹੈ। ਇੱਕ ਗ੍ਰੇਡਰ ਜੋ ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ’ਤੇ ਸ਼ਾਨਦਾਰ ਹੈ ਅਤੇ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ’ਤੇ ਨਿਰਾਸ਼ਾਜਨਕ ਹੈ, ਉਹ ਉਨ੍ਹਾਂ ਵਿਦਿਆਰਥੀਆਂ ਨੂੰ ਨਾਕਾਮ ਕਰਦੇ ਹੋਏ ਇੱਕ ਸਤਿਕਾਰਯੋਗ ਨੰਬਰ ਪੋਸਟ ਕਰ ਸਕਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਸਭ ਤੋਂ ਵੱਧ ਸਹੀ ਜਵਾਬ ਦੀ ਲੋੜ ਹੈ। ਇਸ ਲਈ ਅਸੀਂ ਟੈਸਟ ਸੈੱਟ ਦੇ ਤਿੰਨ ਪੱਧਰਾਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ ਵੱਖਰੇ ਤੌਰ ’ਤੇ ਸ਼ੁੱਧਤਾ ਦੀ ਰਿਪੋਰਟ ਕਰਦੇ ਹਾਂ: 4 ਜਾਂ 5 ਦੇ ਹੇਠਲੇ ਸਕੋਰ, 7 ਜਾਂ 8 ਦੇ ਮੱਧ ਸਕੋਰ, ਅਤੇ 10 ਅਤੇ ਇਸ ਤੋਂ ਵੱਧ ਦੇ ਟੌਪ ਸਕੋਰ।

ਜ਼ਿਆਦਾਤਰ ਗ੍ਰੇਡਰ, ਮਨੁੱਖੀ ਜਾਂ ਮਸ਼ੀਨੀ, ਵਿਚਕਾਰ ਵੱਲ ਖਿਸਕਦੇ ਹਨ। ਇੱਕ ਮਜ਼ਬੂਤ ਜਵਾਬ ਨੂੰ 10 ਦੀ ਥਾਂ 8 ਮਿਲਦਾ ਹੈ। ਇੱਕ ਕਮਜ਼ੋਰ ਜਵਾਬ ਨੂੰ 5 ਦੀ ਥਾਂ 6 ਮਿਲਦਾ ਹੈ। ਤੁਲਨਾ ਕਰਨ ਲਈ ਕੁਝ ਵੀ ਨਾ ਹੋਣ ਕਾਰਨ, ਫਰੰਟੀਅਰ ਮਾਡਲ ਇੱਕ ਦੂਜੀ ਆਦਤ ਜੋੜਦੇ ਹਨ: ਉਹ ਹੇਠਾਂ ਵੱਲ ਖਿਸਕਦੇ ਹਨ, ਇਸ ਲਈ ਇੱਕ ਕਮਜ਼ੋਰ ਜਵਾਬ ਨੂੰ ਅਕਸਰ 5 ਦੀ ਥਾਂ 3 ਅਤੇ ਇੱਕ ਮਜ਼ਬੂਤ ਜਵਾਬ ਨੂੰ 7 ਸਕੋਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। Engine 2.0 ਨੂੰ ਖਾਸ ਤੌਰ ’ਤੇ ਦੋਵੇਂ ਖਿੱਚਾਂ ਦਾ ਵਿਰੋਧ ਕਰਨ ਲਈ ਬਣਾਇਆ ਗਿਆ ਸੀ, ਅਤੇ ਨਤੀਜੇ ਇਹ ਸਕੇਲ ਦੇ ਟੌਪ ’ਤੇ ਸਭ ਤੋਂ ਸਪਸ਼ਟ ਦਿਖਾਉਂਦੇ ਹਨ।

ਹੇਠਲੇ ਸਕੋਰ · ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 4 ਜਾਂ 5

ਪ੍ਰਤੀ ਸਿਸਟਮ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦੀ ਬੇਨਤੀ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

ਮੱਧ ਸਕੋਰ · ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 7 ਜਾਂ 8

ਪ੍ਰਤੀ ਸਿਸਟਮ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦੀ ਬੇਨਤੀ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

ਟੌਪ ਸਕੋਰ · ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 10 ਜਾਂ ਇਸ ਤੋਂ ਵੱਧ

ਪ੍ਰਤੀ ਸਿਸਟਮ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦੀ ਬੇਨਤੀ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। ਲਗਭਗ ਹਰ ਖੁੰਝਿਆ ਸਕੋਰ 7 ਜਾਂ 8 ਹੈ।

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

ਉਹਨਾਂ ਵਿਦਿਆਰਥੀਆਂ ਲਈ ਜੋ ਪਹਿਲਾਂ ਹੀ ਮਜ਼ਬੂਤ ਹਨ, ਇਹ ਉਹ ਫਰਕ ਹੈ ਜੋ ਮਹੱਤਵਪੂਰਨ ਹੈ। ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ, ਕੋਈ ਵੀ ਹੋਰ ਮਾਡਲ 56% ਤੋਂ ਵੱਧ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਨਹੀਂ ਪਛਾਣਦਾ; GPT 5.6 sol ਚਾਰ ਵਿੱਚੋਂ ਇੱਕ ਪਛਾਣਦਾ ਹੈ, ਅਤੇ GPT 5.6 luna ਅੱਠ ਵਿੱਚੋਂ ਇੱਕ। Engine 2.0 71% ਪਛਾਣਦਾ ਹੈ।

ਹੇਠਲੇ ਪੱਧਰ ’ਤੇ, Engine 2.0 88% ’ਤੇ ਅੱਗੇ ਹੈ, Claude Opus 5 77% ’ਤੇ ਅਤੇ GPT-4o mini 75% ’ਤੇ। ਹਰ ਹੋਰ ਮਾਡਲ ਲਗਭਗ ਅੱਧੇ ’ਤੇ ਹੈ, ਅਤੇ Claude Sonnet 5 44% ’ਤੇ ਹੈ। ਖੁੰਝਿਆ ਸਕੋਰ ਲਗਭਗ ਹਮੇਸ਼ਾ 3 ਹੁੰਦਾ ਹੈ: ਮਾਡਲ ਇੱਕ ਕਮਜ਼ੋਰ ਜਵਾਬ ਦੇਖਦਾ ਹੈ ਅਤੇ ਇਸ ਨੂੰ ਪੱਧਰ ਦੇ ਅੰਦਰ ਦੀ ਥਾਂ ਪੱਧਰ ਤੋਂ ਹੇਠਾਂ ਸਕੋਰ ਕਰਦਾ ਹੈ। GPT-4o mini ਦਾ ਇੱਥੇ ਸਤਿਕਾਰਯੋਗ ਅੰਕੜਾ ਇਸ ਦੀ ਸਮੱਸਿਆ ਦਾ ਪਹਿਲਾ ਸੰਕੇਤ ਹੈ, ਜੋ ਇਹ ਹੈ ਕਿ ਇਹ ਲਗਭਗ ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਹੈ; ਸਕੇਲ ਦੇ ਟੌਪ ’ਤੇ ਇਹ ਛੇ ਵਿੱਚੋਂ ਇੱਕ ਜਵਾਬ ਪਛਾਣਦਾ ਹੈ।

ਮੱਧ ਪੱਧਰ ’ਤੇ, Engine 2.0 85% ’ਤੇ ਅੱਗੇ ਹੈ। Gemini ਅਤੇ Claude Sonnet 5 63% ’ਤੇ ਹਨ, Claude Opus 5 58% ’ਤੇ, ਅਤੇ ਫਿਰ ਇੱਕ ਢਲਾਣ: GPT-4o mini 44% ’ਤੇ ਅਤੇ ਤਿੰਨ ਵੱਡੇ GPT ਮਾਡਲ 27% ਤੋਂ 29% ’ਤੇ। ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ਵਿੱਚ ਤਾਕਤਾਂ ਅਤੇ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਇੱਕ ਮਿਸ਼ਰਣ ਹੁੰਦਾ ਹੈ ਜਿਸ ਨੂੰ ਪਛਾਣਨ ਦੀ ਥਾਂ ਤੋਲਣਾ ਪੈਂਦਾ ਹੈ, ਅਤੇ ਤੋਲਣ ਲਈ ਕੁਝ ਵੀ ਨਾ ਹੋਣ ਕਾਰਨ, GPT ਮਾਡਲ ਕਮਜ਼ੋਰੀਆਂ ਦੇਖਦੇ ਹਨ ਅਤੇ 5 ਜਾਂ 6 ਦੇ ਦਿੰਦੇ ਹਨ।

ਟੌਪ ਪੱਧਰ ’ਤੇ, ਫਰਕ ਸਭ ਤੋਂ ਵੱਡਾ ਹੈ। Engine 2.0 71% ਟੌਪ-ਲੈਵਲ ਜਵਾਬਾਂ ਨੂੰ ਸਹੀ ਪਛਾਣਦਾ ਹੈ। Gemini 56% ਪਛਾਣਦਾ ਹੈ ਅਤੇ Opus 5 ਠੀਕ ਅੱਧੇ। ਬਾਕੀ ਸੱਤ ਮਾਡਲਾਂ ਵਿੱਚੋਂ ਪੰਜ ਹਰ ਦਸਾਂ ਵਿੱਚੋਂ ਘੱਟੋ-ਘੱਟ ਸੱਤ ਜਵਾਬਾਂ ਨੂੰ, ਜੋ 10 ਦੇ ਯੋਗ ਹਨ, 7 ਜਾਂ 8 ਦਿੰਦੇ ਹਨ। ਇਹ ਵਿਚਕਾਰ-ਖਿਸਕਾਅ ਦੀ ਸਮੱਸਿਆ ਦਾ ਸਭ ਤੋਂ ਸ਼ੁੱਧ ਰੂਪ ਹੈ। ਇੱਕ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਨਿਰਦੋਸ਼ ਨਹੀਂ ਹੁੰਦਾ; ਇਸ ਵਿੱਚ ਕਦੇ-ਕਦਾਈਂ ਗਲਤੀ, ਇੱਕ ਰੀਸਟਾਰਟ, ਗੁੰਝਲਦਾਰ ਵਾਕਾਂ ਵਿਚਕਾਰ ਇੱਕ ਸਾਦਾ ਵਾਕ ਹੁੰਦਾ ਹੈ, ਅਤੇ ਇੱਕ ਗ੍ਰੇਡਰ ਜੋ ਇਸ ਨੂੰ ਇੱਕ ਕਲਪਿਤ ਨਿਰਦੋਸ਼ ਜਵਾਬ ਦੇ ਵਿਰੁੱਧ ਮਾਪਦਾ ਹੈ, ਹਰ ਇੱਕ ਲਈ ਪੁਆਇੰਟ ਕੱਟਦਾ ਹੈ। Engine 2.0 ਉਹਨਾਂ ਉਦਾਹਰਣਾਂ ਦੇ ਵਿਰੁੱਧ ਕੈਲੀਬ੍ਰੇਟ ਕੀਤਾ ਗਿਆ ਹੈ ਜੋ ਦਿਖਾਉਂਦੀਆਂ ਹਨ ਕਿ ਇੱਕ ਅਸਲ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਕਿਵੇਂ ਦਿਖਦਾ ਹੈ, ਗਲਤੀਆਂ ਸਮੇਤ, ਅਤੇ ਇਸ ਨੂੰ ਸਪਸ਼ਟ ਤੌਰ ’ਤੇ ਨਿਰਦੋਸ਼ਤਾ ਦੀ ਥਾਂ ਉਨ੍ਹਾਂ ਉਦਾਹਰਣਾਂ ਨਾਲ ਤੁਲਨਾ ਕਰਨ ਲਈ ਡਿਜ਼ਾਈਨ ਕੀਤਾ ਗਿਆ ਹੈ।

ਜੇ ਤੁਸੀਂ ਉਹਨਾਂ ਨੂੰ ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦਿਓ ਤਾਂ ਕੀ?

ਸਾਦੀ-ਬੇਨਤੀ ਦੇ ਨੰਬਰ ਇਸ ਗੱਲ ’ਤੇ ਫੈਸਲਾ ਨਹੀਂ ਹਨ ਕਿ ਇਹ ਮਾਡਲ ਕਿੰਨੇ ਸਮਝਦਾਰ ਹਨ। ਇਹ ਇਸ ਗੱਲ ’ਤੇ ਫੈਸਲਾ ਹਨ ਕਿ ਜਦੋਂ ਇੱਕ ਮਾਡਲ ਨੂੰ ਤੁਲਨਾ ਕਰਨ ਲਈ ਕੁਝ ਵੀ ਨਾ ਹੋਣ ’ਤੇ ਇੱਕ ਨੰਬਰ ਲਈ ਪੁੱਛਿਆ ਜਾਂਦਾ ਹੈ ਤਾਂ ਕੀ ਹੁੰਦਾ ਹੈ। ਇਸ ਲਈ ਅਸੀਂ ਇੱਕ ਦੂਜਾ ਟੈਸਟ ਚਲਾਇਆ, ਹਰ ਮਾਡਲ ਨੂੰ ਬਿਲਕੁਲ ਉਹੀ ਦਿੱਤਾ ਜੋ Engine 2.0 ਦੇ ਆਪਣੇ ਗ੍ਰੇਡਰ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ: ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਟਾਸਕ, ਉਸ ਖਾਸ ਟਾਸਕ ਲਈ ਹਰ ਪੱਧਰ ’ਤੇ ਦੋ ਅਸਲ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ, ਅਤੇ ਇੱਕ ਹਦਾਇਤ ਕਿ ਇੱਕ ਨੰਬਰ ਪੈਦਾ ਕਰਨ ਦੀ ਥਾਂ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ ਸਭ ਤੋਂ ਨੇੜਲੀ ਉਦਾਹਰਣ ਦਾ ਨਾਮ ਦੇਵੇ। ਹਰ ਮਾਡਲ ਨੂੰ ਇਸ ਦੇ ਆਪਣੇ ਰੁਝਾਨਾਂ ਮੁਤਾਬਕ ਟਿਊਨ ਕੀਤਾ ਇੱਕ ਛੋਟਾ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਨੋਟ ਵੀ ਮਿਲਿਆ।

ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦੇ ਨਾਲ: ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ ’ਤੇ ਸਕੋਰ ਕੀਤੇ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ

ਉਹੀ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ। ਹਰ ਸਿਸਟਮ ਲਈ ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ, ਹਦਾਇਤਾਂ ਅਤੇ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ; ਹਰ ਮਾਡਲ ਨੇ ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਵਾਰ ਗ੍ਰੇਡ ਕੀਤਾ।

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

ਹਰ ਮਾਡਲ ਸੁਧਰਦਾ ਹੈ, ਕੁਝ ਨਾਟਕੀ ਢੰਗ ਨਾਲ। GPT 5.6 sol 35% ਤੋਂ 71% ਤੱਕ ਦੁੱਗਣਾ ਹੋ ਜਾਂਦਾ ਹੈ। Opus 5 62% ਤੋਂ 77% ਤੱਕ ਚੜ੍ਹਦਾ ਹੈ। GPT-4o mini ਮੁਸ਼ਕਿਲ ਨਾਲ ਹਿੱਲਦਾ ਹੈ, 45% ਤੋਂ 50% ਤੱਕ, ਕਿਉਂਕਿ ਇਹ ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਹੈ ਭਾਵੇਂ ਇਸ ਨੂੰ ਜੋ ਵੀ ਦਿਖਾਇਆ ਜਾਵੇ। ਅਤੇ ਹਰ ਮਾਡਲ ਫਿਰ ਵੀ Engine 2.0 ਤੋਂ ਪਿੱਛੇ ਰਹਿੰਦਾ ਹੈ। ਸਕੇਲ ਦੇ ਟੌਪ ’ਤੇ ਫਰਕ ਬਣਿਆ ਰਹਿੰਦਾ ਹੈ: Opus 5, GPT 5.6 sol, Gemini ਅਤੇ GPT 5.5 ਸਾਰੇ ਟੌਪ-ਲੈਵਲ ਜਵਾਬਾਂ ਦੇ 63% ’ਤੇ ਰੁਕ ਜਾਂਦੇ ਹਨ, Sonnet 5 38% ’ਤੇ, GPT-4o mini ਜ਼ੀਰੋ ’ਤੇ, Engine 2.0 ਲਈ 71% ਦੇ ਮੁਕਾਬਲੇ।

ਇਹ ਦੂਜਾ ਟੈਸਟ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ Engine 2.0 ਵਿੱਚ ਅਸਲ ਵਿੱਚ ਮੁੱਲ ਕਿੱਥੇ ਹੈ। ਇਹ ਕੋਈ ਵਧੇਰੇ ਸਮਝਦਾਰ ਮਾਡਲ ਨਹੀਂ ਹੈ; ਇਹ ਇਸੇ ਸੂਚੀ ਵਿੱਚੋਂ ਮਾਡਲ ਵਰਤਦਾ ਹੈ। ਇਹ ਹਰ ਖਾਸ ਟਾਸਕ ’ਤੇ ਹਰ ਪੱਧਰ ਕਿਵੇਂ ਸੁਣਦਾ ਹੈ ਦੀਆਂ ਅਸਲ ਉਦਾਹਰਣਾਂ ਹਨ, ਇੱਕ ਸਵਾਲ ਜੋ ਮਾਡਲ ਨੂੰ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਦੀ ਥਾਂ ਤੁਲਨਾ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ, ਅਤੇ ਫਿਰ ਤਿੰਨ ਹੋਰ ਗੱਲਾਂ ਜੋ ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਨਹੀਂ ਦੇ ਸਕਦਾ: ਵੱਖ-ਵੱਖ ਪ੍ਰੋਵਾਈਡਰਾਂ ਤੋਂ ਦੋ ਸੁਤੰਤਰ ਗ੍ਰੇਡਰ, ਹਰੇਕ ਤੋਂ ਤਿੰਨ ਵੋਟਾਂ ਜਿਨ੍ਹਾਂ ਵਿੱਚੋਂ ਮੱਧ ਵੋਟ ਰੱਖੀ ਜਾਂਦੀ ਹੈ, ਅਤੇ ਇੱਕ ਮੇਲ-ਮਿਲਾਪ ਨਿਯਮ ਜੋ ਦੋ ਗ੍ਰੇਡਰਾਂ ਦੇ ਜ਼ੋਰਦਾਰ ਅਸਹਿਮਤ ਹੋਣ ’ਤੇ ਵੱਧ ਸਕੋਰ ਲੈਂਦਾ ਹੈ, ਕਿਉਂਕਿ ਵਿਸ਼ਲੇਸ਼ਣ ਨੇ ਦਿਖਾਇਆ ਕਿ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ’ਤੇ ਹੇਠਲਾ ਫ਼ੈਸਲਾ ਲਗਭਗ ਹਮੇਸ਼ਾ ਗਲਤ ਸੀ।

ਇਕਸਾਰਤਾ ਅਤੇ ਸਥਿਰਤਾ

ਇੱਕ ਗ੍ਰੇਡਰ ਜਿਸ ’ਤੇ ਤੁਸੀਂ ਭਰੋਸਾ ਕਰ ਸਕਦੇ ਹੋ, ਇਕਸਾਰ ਹੋਣਾ ਜ਼ਰੂਰੀ ਹੈ। ਜੇ ਉਹੀ ਰਿਕਾਰਡਿੰਗ ਨੂੰ ਅੱਜ 8 ਅਤੇ ਕੱਲ੍ਹ 10 ਮਿਲ ਸਕਦਾ ਹੈ, ਤਾਂ ਕੋਈ ਵੀ ਨੰਬਰ ਬਹੁਤ ਕੁਝ ਨਹੀਂ ਦਰਸਾਉਂਦਾ, ਅਤੇ ਇੱਕ ਵਿਦਿਆਰਥੀ ਇਹ ਨਹੀਂ ਦੱਸ ਸਕਦਾ ਕਿ ਉਸ ਦੀ ਪ੍ਰੈਕਟਿਸ ਕੰਮ ਕਰ ਰਹੀ ਹੈ ਜਾਂ ਨਹੀਂ। ਇਸ ਲਈ ਸ਼ੁੱਧਤਾ ਦੇ ਨਾਲ, ਅਸੀਂ ਇਹ ਵੀ ਮਾਪਦੇ ਹਾਂ ਕਿ ਕੀ Engine 2.0 ਉਹੀ ਸਵਾਲ ਦੋ ਵਾਰ ਪੁੱਛਣ ’ਤੇ ਉਹੀ ਜਵਾਬ ਦਿੰਦਾ ਹੈ।

ਅਸੀਂ Engine 2.0 ਨੂੰ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ’ਤੇ ਤਿੰਨ ਵੱਖ-ਵੱਖ ਵਾਰ, ਵੱਖ-ਵੱਖ ਦਿਨਾਂ ’ਤੇ, ਵਿਚਕਾਰ ਕੁਝ ਵੀ ਬਦਲੇ ਬਿਨਾਂ ਚਲਾਇਆ। ਇਸ ਨੇ ਹਰ ਰਨ ’ਤੇ 81.3% ਸਕੋਰ ਕੀਤਾ। ਲਗਭਗ 81% ਨਹੀਂ: ਹਰ ਵਾਰ ਉਹੀ 39 ਸਹੀ ਜਵਾਬ 48 ਵਿੱਚੋਂ, ਇੱਕ ਦੇ ਫਰਕ ਨਾਲ। ਜਦੋਂ ਅਸੀਂ ਸਮੁੱਚੇ ਦੀ ਥਾਂ ਵਿਅਕਤੀਗਤ ਜਵਾਬਾਂ ’ਤੇ ਦੇਖਦੇ ਹਾਂ, 87.5% ਨੂੰ ਤਿੰਨੋਂ ਰਨਾਂ ਵਿੱਚ ਇੱਕੋ ਸਕੋਰ ਮਿਲਿਆ, ਅਤੇ ਸਿਰਫ 4.2% ਹੀ ਰਨਾਂ ਵਿਚਕਾਰ ਦੋ ਪੁਆਇੰਟ ਜਾਂ ਵੱਧ ਹਿੱਲੇ। ਇਹ ਥੋੜ੍ਹੇ ਜਵਾਬ ਉਹ ਹਨ ਜੋ ਦੋ ਪੱਧਰਾਂ ਵਿਚਕਾਰ ਦੀ ਸੀਮਾ ’ਤੇ ਬੈਠਦੇ ਹਨ, ਜਿੱਥੇ ਨਿਰਣੇ ਵਿੱਚ ਇੱਕ ਛੋਟਾ ਫਰਕ ਜਾਇਜ਼ ਤੌਰ ’ਤੇ ਸਕੋਰ ਨੂੰ ਇੱਕ ਪਾਸੇ ਜਾਂ ਦੂਜੇ ਪਾਸੇ ਲੈ ਜਾਂਦਾ ਹੈ।

ਫਰੰਟੀਅਰ ਮਾਡਲਾਂ ’ਤੇ ਸਾਦੀ-ਬੇਨਤੀ ਟੈਸਟ ਰਨਾਂ ਵਿਚਕਾਰ ਕਿਤੇ ਵੱਧ ਹਿੱਲਿਆ। GPT 5.6 sol ਨੇ ਆਪਣੀਆਂ ਤਿੰਨ ਰਨਾਂ ’ਤੇ 31%, 40% ਅਤੇ 35% ਸਕੋਰ ਕੀਤਾ; Opus 5 ਨੇ 62%, 65% ਅਤੇ 58% ਸਕੋਰ ਕੀਤਾ। ਇੱਕ ਚੈਟਬੋਟ ਨੂੰ ਦੋ ਵੱਖ-ਵੱਖ ਦਿਨਾਂ ’ਤੇ ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਗ੍ਰੇਡ ਕਰਨ ਲਈ ਕਹੋ ਅਤੇ ਤੁਹਾਨੂੰ, ਕਾਫ਼ੀ ਵਾਰ, ਦੋ ਵੱਖ-ਵੱਖ ਸਕੋਰ ਮਿਲਣਗੇ।

ਇਕਸਾਰਤਾ ਦੋ ਡਿਜ਼ਾਈਨ ਫੈਸਲਿਆਂ ਤੋਂ ਆਉਂਦੀ ਹੈ। Engine 2.0 ਵਿੱਚ ਹਰ ਗ੍ਰੇਡਰ ਹਰ ਜਵਾਬ ’ਤੇ ਤਿੰਨ ਵਾਰ ਵੋਟ ਦਿੰਦਾ ਹੈ ਅਤੇ ਮੱਧ ਵੋਟ ਰੱਖੀ ਜਾਂਦੀ ਹੈ, ਜੋ ਉਸ ਕਦੇ-ਕਦਾਈਂ ਦੇ ਅਪਵਾਦ ਨੂੰ ਹਟਾ ਦਿੰਦੀ ਹੈ ਜੋ ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਪੈਦਾ ਕਰਦਾ। ਅਤੇ ਦੋ ਗ੍ਰੇਡਰਾਂ ਦੇ ਫ਼ੈਸਲਿਆਂ ਦਾ ਮੇਲ ਕਿਸੇ ਹੋਰ ਮਾਡਲ ਦੀ ਥਾਂ ਇੱਕ ਸਥਿਰ ਨਿਯਮ ਦੁਆਰਾ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਇਸ ਲਈ ਫ਼ੈਸਲਿਆਂ ਦਾ ਉਹੀ ਜੋੜਾ ਹਮੇਸ਼ਾ ਉਹੀ ਅੰਤਿਮ ਸਕੋਰ ਪੈਦਾ ਕਰਦਾ ਹੈ। ਦੋਵੇਂ ਫੈਸਲੇ ਸਿੱਧੇ ਟੈਸਟ ਕੀਤੇ ਗਏ: ਤਿੰਨ ਦੀ ਥਾਂ ਇੱਕ ਵੋਟ ਨਾਲ, ਰਨ-ਟੂ-ਰਨ ਸਹਿਮਤੀ 87.5% ਤੋਂ 77.1% ਤੱਕ ਡਿੱਗ ਗਈ, ਅਤੇ ਦੋ ਜਾਂ ਵੱਧ ਪੁਆਇੰਟ ਹਿੱਲਣ ਵਾਲੇ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਦੁੱਗਣੇ ਤੋਂ ਵੱਧ ਹੋ ਗਿਆ।

Engine 2.0 ਇੱਕ ਜਵਾਬ ਨੂੰ ਕਿਵੇਂ ਗ੍ਰੇਡ ਕਰਦਾ ਹੈ

Engine 2.0 ਇੱਕ ਸਿੰਗਲ ਮਾਡਲ ਨਹੀਂ ਹੈ। ਇਹ ਇੱਕ ਪ੍ਰਕਿਰਿਆ ਹੈ, ਅਤੇ ਇਹ ਪ੍ਰਕਿਰਿਆ ਹੀ ਫਰਕ ਪੈਦਾ ਕਰਦੀ ਹੈ। ਇੱਥੇ ਹੈ ਕਿ ਵਿਦਿਆਰਥੀ ਦੇ ਸਟਾਪ ਦਬਾਉਣ ਅਤੇ ਸਕਰੀਨ ’ਤੇ ਸਕੋਰ ਦਿਖਾਈ ਦੇਣ ਦੇ ਵਿਚਕਾਰ ਦੇ ਦਸ ਕੁ ਸਕਿੰਟਾਂ ਵਿੱਚ ਕੀ ਹੁੰਦਾ ਹੈ।

  1. ਰਿਕਾਰਡਿੰਗ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਹਰ ਫਿਲਰ, ਹਰ ਰੀਸਟਾਰਟ, ਹਰ ਸੈਲਫ-ਕਰੈਕਸ਼ਨ ਰੱਖੀ ਜਾਂਦੀ ਹੈ। ਇਹ ਜ਼ਰੂਰੀ ਸਾਬਤ ਹੋਇਆ। ਜਦੋਂ ਅਸੀਂ ਹਿਚਕਿਚਾਹਟਾਂ ਹਟਾ ਕੇ ਇੱਕ “ਸਾਫ਼” ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਟੈਸਟ ਕੀਤੀ, ਸ਼ੁੱਧਤਾ ਪੰਦਰਾਂ ਪੁਆਇੰਟ ਡਿੱਗ ਗਈ, ਕਿਉਂਕਿ ਹਿਚਕਿਚਾਹਟਾਂ ਉਸ ਸਬੂਤ ਦਾ ਹਿੱਸਾ ਹਨ ਜਿਸ ਦੀ ਇੱਕ ਗ੍ਰੇਡਰ ਨੂੰ ਇਹ ਨਿਰਣਾ ਕਰਨ ਲਈ ਲੋੜ ਹੁੰਦੀ ਹੈ ਕਿ ਜਵਾਬ ਕਿਵੇਂ ਸੁਣਦਾ ਹੈ।
  2. ਦੋ ਸੁਤੰਤਰ ਗ੍ਰੇਡਰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਪੜ੍ਹਦੇ ਹਨ। ਇਹ ਵੱਖ-ਵੱਖ ਪ੍ਰੋਵਾਈਡਰਾਂ ਦੇ ਵੱਖ-ਵੱਖ ਅੰਡਰਲਾਇੰਗ ਮਾਡਲਾਂ ’ਤੇ ਬਣੇ ਹੋਏ ਹਨ, ਇਸ ਲਈ ਇਹ ਇੱਕੋ ਬਲਾਈਂਡ ਸਪਾਟ ਸਾਂਝੇ ਨਹੀਂ ਕਰਦੇ। ਹਰ ਗ੍ਰੇਡਰ ਨੂੰ ਟਾਸਕ ਪ੍ਰੌਮਪਟ, ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਅਤੇ ਉਸ ਖਾਸ ਟਾਸਕ ਲਈ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਦਾ ਇੱਕ ਛੋਟਾ ਸੈੱਟ ਮਿਲਦਾ ਹੈ: ਹੇਠਲੇ, ਮੱਧ ਅਤੇ ਟੌਪ ਪੱਧਰ ’ਤੇ ਅਸਲ ਜਵਾਬ, ਹਰ ਪੱਧਰ ’ਤੇ ਦੋ, ਤਾਂ ਜੋ ਹਰ ਪੱਧਰ ਇੱਕ ਸਿੰਗਲ ਪੁਆਇੰਟ ਦੀ ਥਾਂ ਇੱਕ ਰੇਂਜ ਵਜੋਂ ਦਿਖਾਇਆ ਜਾਵੇ।
  3. ਹਰ ਗ੍ਰੇਡਰ ਸਕੋਰ ਕਰਨ ਦੀ ਥਾਂ ਤੁਲਨਾ ਕਰਦਾ ਹੈ। ਇਹ Engine 1.0 ਤੋਂ ਸਭ ਤੋਂ ਵੱਡਾ ਬਦਲਾਅ ਹੈ। ਇੱਕ ਨੰਬਰ ਲਈ ਪੁੱਛੇ ਜਾਣ ਦੀ ਥਾਂ, ਹਰ ਗ੍ਰੇਡਰ ਨੂੰ ਜਵਾਬ ਦੇ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ ਪੁੱਛਿਆ ਜਾਂਦਾ ਹੈ ਕਿ ਇਹ ਕਿਸ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣ ਨਾਲ ਸਭ ਤੋਂ ਵੱਧ ਮਿਲਦਾ ਹੈ। ਇੱਥੇ ਕੋਈ “ਵਿਚਕਾਰ ਕਿਤੇ” ਵਿਕਲਪ ਨਹੀਂ ਹੈ। ਸਭ ਤੋਂ ਨੇੜਲੀ ਉਦਾਹਰਣ ਪ੍ਰਤੀ ਵਚਨਬੱਧ ਹੋਣਾ ਹੀ ਵਿਚਕਾਰ ਵੱਲ ਖਿਸਕਾਅ ਨੂੰ ਰੋਕਦਾ ਹੈ। ਸਕੋਰ ਫਿਰ ਚੁਣੇ ਗਏ ਪੱਧਰ ਤੋਂ ਇੱਕ ਸਥਿਰ ਨਿਯਮ ਦੁਆਰਾ ਕੱਢਿਆ ਜਾਂਦਾ ਹੈ, ਮਾਡਲ ਦੁਆਰਾ ਨਹੀਂ।
  4. ਹਰ ਗ੍ਰੇਡਰ ਤਿੰਨ ਵਾਰ ਵੋਟ ਦਿੰਦਾ ਹੈ। ਹਰ ਪਹਿਲੂ ’ਤੇ ਮੱਧ ਵੋਟ ਰੱਖੀ ਜਾਂਦੀ ਹੈ। ਇਹ ਅਸਲ ਨਿਰਣੇ ਨੂੰ ਔਸਤ ਕਰ ਕੇ ਗੁਆਏ ਬਿਨਾਂ ਕਦੇ-ਕਦਾਈਂ ਦੇ ਬੁਰੇ-ਦਿਨ ਵਾਲੇ ਜਵਾਬ ਨੂੰ ਹਟਾਉਂਦਾ ਹੈ।
  5. ਦੋ ਫ਼ੈਸਲਿਆਂ ਦਾ ਮੇਲ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਜੇ ਗ੍ਰੇਡਰ ਸਹਿਮਤ ਹਨ ਜਾਂ ਇੱਕ ਸਿੰਗਲ ਪੁਆਇੰਟ ਨਾਲ ਵੱਖਰੇ ਹਨ, ਤਾਂ ਅੰਤਿਮ ਸਕੋਰ ਉਨ੍ਹਾਂ ਦੀ ਔਸਤ ਹੈ। ਜੇ ਉਹ ਦੋ ਜਾਂ ਵੱਧ ਨਾਲ ਵੱਖਰੇ ਹਨ, ਤਾਂ ਵੱਧ ਸਕੋਰ ਵਰਤਿਆ ਜਾਂਦਾ ਹੈ। ਇਹ ਨਿਯਮ ਖੁੱਲ੍ਹਦਿਲੀ ਨਹੀਂ ਹੈ; ਇਹ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਹੈ। ਜਦੋਂ ਅਸੀਂ ਹਰ ਉਸ ਮਾਮਲੇ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕੀਤਾ ਜਿੱਥੇ ਦੋ ਗ੍ਰੇਡਰ ਜ਼ੋਰਦਾਰ ਅਸਹਿਮਤ ਸਨ, ਹੇਠਲਾ ਫ਼ੈਸਲਾ ਲਗਭਗ ਹਮੇਸ਼ਾ ਗਲਤ ਸੀ, ਕਿਉਂਕਿ ਅਸਹਿਮਤੀ ਲਗਭਗ ਹਮੇਸ਼ਾ ਇੱਕ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ’ਤੇ ਪੈਦਾ ਹੁੰਦੀ ਸੀ ਜਿਸ ਬਾਰੇ ਇੱਕ ਗ੍ਰੇਡਰ ਬਹੁਤ ਸਾਵਧਾਨ ਰਿਹਾ ਸੀ।
  6. ਸੁਰੱਖਿਆ ਉਪਾਅ ਲਾਗੂ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। ਸਥਿਰ ਨਿਯਮਾਂ ਦਾ ਇੱਕ ਛੋਟਾ ਸੈੱਟ ਉਹਨਾਂ ਮਾਮਲਿਆਂ ਨੂੰ ਸੰਭਾਲਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਬਾਰੇ ਕਿਸੇ ਵੀ ਗ੍ਰੇਡਰ ਨੂੰ ਅੰਦਾਜ਼ਾ ਨਹੀਂ ਲਗਾਉਣਾ ਚਾਹੀਦਾ: ਇੱਕ ਜਵਾਬ ਜੋ ਖ਼ਾਮੋਸ਼ ਹੈ, ਕੁਝ ਸ਼ਬਦਾਂ ਦਾ ਹੈ, ਕਿਸੇ ਹੋਰ ਭਾਸ਼ਾ ਵਿੱਚ ਹੈ, ਜਾਂ ਪੂਰੀ ਤਰ੍ਹਾਂ ਵਿਸ਼ੇ ਤੋਂ ਬਾਹਰ ਹੈ, ਗ੍ਰੇਡਰਾਂ ਦੇ ਵਾਪਸ ਕੀਤੇ ਗਏ ਨਤੀਜੇ ਦੀ ਪਰਵਾਹ ਕੀਤੇ ਬਿਨਾਂ ਇੱਕ ਫ਼ਲੋਰ ਸਕੋਰ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ। ਟੈਸਟਿੰਗ ਵਿੱਚ, ਖ਼ਾਮੋਸ਼ੀ ਨੇ 3 ਸਕੋਰ ਕੀਤਾ, ਕੁਝ ਸ਼ਬਦਾਂ ਦੇ ਜਵਾਬ ਨੇ 4, ਅਤੇ ਵਿਸ਼ੇ ਤੋਂ ਬਾਹਰ ਜਾਂ ਗੈਰ-ਅੰਗਰੇਜ਼ੀ ਜਵਾਬ ਨੇ 5, ਸੈੱਟ ਵਿੱਚ ਕੋਈ ਅਸਫਲਤਾ ਨਹੀਂ।

ਅੰਤਿਮ ਡਿਜ਼ਾਈਨ ਦੀਆਂ ਦੋ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਜ਼ੋਰ ਦੇਣ ਯੋਗ ਹਨ। Engine 2.0 ਸਿਰਫ਼ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਤੋਂ ਗ੍ਰੇਡ ਕਰਦਾ ਹੈ, ਇਸ ਲਈ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਤੋਂ ਬਾਅਦ ਇਸ ਨੂੰ ਆਡੀਓ ਦੀ ਲੋੜ ਨਹੀਂ ਹੁੰਦੀ ਅਤੇ ਇਹ ਕਿਸੇ ਇੱਕ ਪ੍ਰੋਵਾਈਡਰ ਦੇ ਆਡੀਓ ਮਾਡਲ ’ਤੇ ਨਿਰਭਰ ਨਹੀਂ ਕਰਦਾ। ਅਤੇ ਕਿਉਂਕਿ ਦੋ ਗ੍ਰੇਡਰ ਵੱਖ-ਵੱਖ ਪ੍ਰੋਵਾਈਡਰਾਂ ਤੋਂ ਹਨ, ਜੇ ਇੱਕ ਉਪਲਬਧ ਨਹੀਂ ਹੈ ਤਾਂ ਦੂਜਾ ਜਾਰੀ ਰਹਿੰਦਾ ਹੈ, ਇੱਕ ਤੀਜੇ ਮਾਡਲ ਦੇ ਬਦਲੇ ਵਜੋਂ ਖੜ੍ਹੇ ਹੋਣ ਨਾਲ ਤਾਂ ਜੋ ਇੱਕ ਸਕੋਰ ਹਮੇਸ਼ਾ ਪੈਦਾ ਹੋਵੇ।

ਤੁਹਾਡੇ ਫੀਡਬੈਕ ਵਿੱਚ ਕੀ ਨਵਾਂ ਹੈ

Engine 2.0 ਦੇ ਨਾਲ ਇੱਕ ਨਵੀਂ ਬਣਾਈ ਗਈ ਫੀਡਬੈਕ ਲੇਅਰ ਆਉਂਦੀ ਹੈ। ਇਹ ਸਿਰਫ਼ ਸਕੋਰ ਨਹੀਂ ਸਗੋਂ ਦੋਵੇਂ ਗ੍ਰੇਡਰਾਂ ਦੇ ਸਬੂਤ ਨੂੰ ਪੜ੍ਹਦੀ ਹੈ, ਅਤੇ ਇਸ ਨੂੰ ਤਿੰਨ ਤਰ੍ਹਾਂ ਦੇ ਵਿਦਿਆਰਥੀਆਂ 'ਤੇ ਪਰਖਿਆ ਗਿਆ: ਪਹਿਲੀ ਵਾਰ CELPIP ਦੇਣ ਵਾਲਾ ਕੋਈ, ਕਮਜ਼ੋਰ ਅੰਗਰੇਜ਼ੀ ਵਾਲਾ ਕੋਈ ਜੋ ਬਸ ਤਰੀਕਾ ਲੱਭ ਰਿਹਾ ਹੈ, ਅਤੇ ਕੋਈ ਜਿਸ ਕੋਲ ਦਿਨ ਵਿੱਚ ਅੱਧਾ ਘੰਟਾ ਹੈ ਤੇ ਅਗਲੇ ਹਫ਼ਤੇ ਟੈਸਟ ਹੈ। ਇਹ ਹੈ ਜੋ ਬਦਲਿਆ।

  • ਤੁਹਾਡੇ ਆਪਣੇ ਸ਼ਬਦ, ਦੁਬਾਰਾ ਦਿਖਾਏ ਗਏ. ਫੀਡਬੈਕ ਦਾ ਹਰ ਨੁਕਤਾ ਤੁਹਾਡੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਾ ਉਹੀ ਵਾਕੰਸ਼ ਦੱਸਦਾ ਹੈ ਜਿਸ 'ਤੇ ਗ੍ਰੇਡਰਾਂ ਨੇ ਪ੍ਰਤੀਕਿਰਿਆ ਦਿੱਤੀ। ਜੇ ਕੋਈ ਵਾਕੰਸ਼ ਕੋਟੇਸ਼ਨ ਨਿਸ਼ਾਨਾਂ ਵਿੱਚ ਹੈ, ਤਾਂ ਇਹ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਕਾਪੀ ਕੀਤਾ ਗਿਆ ਹੈ; ਸਾਡੀ ਪੜਤਾਲ ਵਿੱਚ 158 ਵਿੱਚੋਂ 157 ਕੋਟ ਇਸੇ ਤਰ੍ਹਾਂ ਸਨ। ਫੀਡਬੈਕ ਕਦੇ ਵੀ ਕੋਈ ਅਜਿਹੀ ਗੱਲ ਨਹੀਂ ਬਣਾਉਂਦਾ ਜੋ ਤੁਸੀਂ ਕਹੀ ਹੀ ਨਹੀਂ।
  • ਪਹਿਲਾਂ ਠੀਕ ਕਰਨ ਵਾਲੀ ਇੱਕ ਗੱਲ. ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਹੀ ਸਭ ਤੋਂ ਵੱਡੀ ਸਲਾਹ ਮਿਲਦੀ ਹੈ: ਉਹ ਇੱਕ ਤਬਦੀਲੀ ਜੋ ਤੁਹਾਡੇ ਸਕੋਰ ਨੂੰ ਸਭ ਤੋਂ ਵੱਧ ਵਧਾਏਗੀ, ਸਭ ਤੋਂ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਲਿਖੀ ਹੋਈ। ਇਸ ਦੇ ਬਾਅਦ ਦੋ ਹੋਰ ਠੋਸ ਕਦਮ ਆਉਂਦੇ ਹਨ, ਫਿਰ ਬੋਲਣਾ ਸ਼ੁਰੂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਮਨ ਵਿੱਚ ਦੁਹਰਾਉਣ ਲਈ ਤਿੰਨ-ਨੁਕਾਤੀ ਚੈੱਕਲਿਸਟ।
  • ਟਾਸਕ ਦੇ ਮੁਤਾਬਕ ਸਲਾਹ. ਸਲਾਹ ਦੇਣਾ, ਕਿਸੇ ਦ੍ਰਿਸ਼ ਦਾ ਵਰਣਨ ਕਰਨਾ ਅਤੇ ਕਿਸੇ ਨੂੰ ਮਨਾਉਣਾ — ਇਹਨਾਂ ਸਭ ਦਾ ਸਕੋਰ ਵੱਖ-ਵੱਖ ਗੱਲਾਂ 'ਤੇ ਹੁੰਦਾ ਹੈ। ਫੀਡਬੈਕ ਨੂੰ ਹੁਣ ਪਤਾ ਹੈ ਕਿ ਅੱਠ ਟਾਸਕ ਕਿਸਮਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ਕਿਸ ਗੱਲ ਦਾ ਇਨਾਮ ਦਿੰਦੀ ਹੈ, ਅਤੇ ਉਸੇ ਮੁਤਾਬਕ ਗੱਲ ਕਰਦਾ ਹੈ, ਸਾਰੇ ਟਾਸਕਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹੀਆਂ ਆਮ ਟਿਪਸ ਦੁਹਰਾਉਣ ਦੀ ਥਾਂ।
  • ਪਹਿਲਾਂ ਕਿਸ ਪਹਿਲੂ ਦਾ ਅਭਿਆਸ ਕਰਨਾ ਹੈ. ਫੀਡਬੈਕ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਕਿਹੜਾ ਤੁਹਾਡਾ ਸਭ ਤੋਂ ਕਮਜ਼ੋਰ ਹੈ ਅਤੇ ਕਿਹੜਾ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ, ਤਾਂ ਜੋ ਤੁਹਾਨੂੰ ਪਤਾ ਹੋਵੇ ਕਿ ਅਗਲਾ ਅੰਕ ਕਿੱਥੇ ਹੈ, ਬਿਨਾਂ ਇਸ ਨੂੰ ਕਿਸੇ ਨੰਬਰ ਪਿੱਛੇ ਲੁਕਾਏ।
  • ਟਾਸਕ ਨੇ ਕੀ ਮੰਗਿਆ ਅਤੇ ਤੁਸੀਂ ਕੀ ਛੱਡਿਆ. ਟਾਸਕ ਪੂਰਤੀ ਵਿੱਚ, ਫੀਡਬੈਕ ਉਹ ਖਾਸ ਹਿੱਸੇ ਸੂਚੀਬੱਧ ਕਰਦਾ ਹੈ ਜਿਹੜੇ ਪ੍ਰੌਂਪਟ ਦੇ ਤੁਸੀਂ ਕਵਰ ਨਹੀਂ ਕੀਤੇ, ਜਾਂ ਸਾਫ਼ ਕਹਿ ਦਿੰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਉਹ ਸਭ ਕਵਰ ਕਰ ਲਏ ਹਨ।
  • ਗੱਲਾਂ ਜਿਹਨਾਂ ਦੀ ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਰਿਹਰਸਲ ਕਰ ਸਕਦੇ ਹੋ. ਹਰ 'ਕਿਵੇਂ ਕਰੀਏ' ਸਲਾਹ ਕੁਝ ਅਜਿਹਾ ਹੈ ਜੋ ਤੁਸੀਂ ਆਪਣੀ ਅਗਲੀ ਕੋਸ਼ਿਸ਼ ਤੋਂ ਪਹਿਲਾਂ ਉੱਚੀ ਆਵਾਜ਼ ਵਿੱਚ ਬੋਲ ਸਕਦੇ ਹੋ। ਵੱਧ ਸਪਸ਼ਟ ਬੋਲਣ ਜਾਂ ਆਪਣਾ ਲਹਿਜਾ ਘਟਾਉਣ ਦੀ ਕੋਈ ਸਲਾਹ ਨਹੀਂ ਦਿੱਤੀ ਜਾਂਦੀ: ਲਹਿਜਾ ਉਹ ਚੀਜ਼ ਨਹੀਂ ਜਿਸ ਨੂੰ ਸੁਣਨਯੋਗਤਾ ਮਾਪਦੀ ਹੈ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ 'ਤੇ ਕਦੇ ਟਿੱਪਣੀ ਨਹੀਂ ਕਰਦਾ।
  • ਟਾਈਮਰ ਲਈ ਕੋਈ ਦੋਸ਼ ਨਹੀਂ. ਜੇ ਕੋਈ ਜਵਾਬ ਟਾਸਕ ਪੂਰਾ ਕਰ ਲੈਣ ਤੋਂ ਬਾਅਦ ਸਮੇਂ ਦੀ ਵਜ੍ਹਾ ਨਾਲ ਵਿੱਚੋਂ ਕੱਟਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਸ ਕੱਟ ਦੇ ਲਈ ਸਕੋਰ ਨਹੀਂ ਘਟਾਇਆ ਜਾਂਦਾ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਝਾੜ ਨਹੀਂ ਪਾਉਂਦਾ।

ਜਦੋਂ ਇੱਕ ਸੁਤੰਤਰ ਨਿਰਣਾਇਕ ਮਾਡਲ ਨੇ ਇਸ ਫੀਡਬੈਕ ਦੀ ਤੁਲਨਾ ਉਸ ਨਾਲ ਕੀਤੀ ਜੋ ਸਾਡੇ ਪਿਛਲੇ ਸਿਸਟਮ ਨੇ ਇਹਨਾਂ ਹੀ ਜਵਾਬਾਂ ਲਈ ਦਿੱਤਾ ਸੀ, ਬਿਨਾਂ ਇਹ ਜਾਣੇ ਕਿ ਕਿਹੜਾ ਕਿਹੜਾ ਹੈ, ਇਸ ਨੇ 24 ਵਿੱਚੋਂ 20 ਤੁਲਨਾਵਾਂ ਵਿੱਚ ਨਵੇਂ ਫੀਡਬੈਕ ਨੂੰ ਪਹਿਲ ਦਿੱਤੀ, ਭਾਵੇਂ ਇਹ ਇੱਕ ਪ੍ਰੀਖਿਅਕ ਵਾਂਗ ਨਿਰਣਾ ਕਰ ਰਿਹਾ ਹੋਵੇ ਜਾਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਵਾਂਗ।

CA$25 ਪ੍ਰਤੀ ਮਹੀਨਾ ਵਿੱਚ ਅਸੀਮਿਤ ਪ੍ਰੈਕਟਿਸ

ਸ਼ੁੱਧਤਾ ਤਾਂ ਹੀ ਕੰਮ ਦੀ ਹੈ ਜੇ ਤੁਸੀਂ ਇਸਨੂੰ ਹਰ ਰੋਜ਼ ਵਰਤ ਸਕੋ। ਜਿਸ ਸਪੀਕਿੰਗ ਸਕੋਰ ’ਤੇ ਤੁਸੀਂ ਭਰੋਸਾ ਕਰ ਸਕਦੇ ਹੋ, ਉਹ ਤੁਹਾਡੇ ਚੌਥੇ ਪ੍ਰੈਕਟਿਸ ਜਵਾਬ ’ਤੇ ਨਹੀਂ, ਚਾਲ੍ਹੀਵੇਂ ’ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਕੀਮਤੀ ਹੁੰਦਾ ਹੈ, ਕਿਉਂਕਿ ਉਦੋਂ ਹੀ ਸਕੋਰ ਤੁਹਾਨੂੰ ਦੱਸਣ ਲੱਗਦਾ ਹੈ ਕਿ ਤੁਹਾਡੇ ਬੋਲਣ ਦੇ ਤਰੀਕੇ ਵਿੱਚ ਕੀਤੀ ਤਬਦੀਲੀ ਅਸਲ ਵਿੱਚ ਕੰਮ ਕਰ ਰਹੀ ਹੈ ਜਾਂ ਨਹੀਂ। ਇਸ ਲਈ ਅਸੀਂ Engine 2.0 ਦੀ ਕੀਮਤ ਇਸ ਤਰ੍ਹਾਂ ਰੱਖੀ ਹੈ ਕਿ ਇਸਨੂੰ ਗਿਣੇ ਬਿਨਾਂ ਵਰਤਿਆ ਜਾ ਸਕੇ।

ਹਰ Prepamigo ਪਲਾਨ ਵਿੱਚ Engine 2.0 ਦੁਆਰਾ ਅਸੀਮਿਤ ਸਕੋਰਿੰਗ, ਅਸੀਮਿਤ ਕੋਸ਼ਿਸ਼ਾਂ, ਅਤੇ ਪੂਰਾ ਸਵਾਲ ਬੈਂਕ ਸ਼ਾਮਲ ਹੈ: Speaking, Writing, Reading ਅਤੇ Listening ਵਿੱਚ 80 ਪੂਰੇ ਪ੍ਰੈਕਟਿਸ ਸੈੱਟ ਅਤੇ 2,000 ਤੋਂ ਵੱਧ ਪ੍ਰੈਕਟਿਸ ਟਾਸਕ, ਜੋ CELPIP General ਟੈਸਟ ਦੇ ਟਾਸਕ ਕਿਸਮਾਂ, ਸਮੇਂ ਅਤੇ ਫਾਰਮੈਟ ਮੁਤਾਬਕ ਲਿਖੇ ਗਏ ਹਨ। ਤੁਸੀਂ ਰਿਕਾਰਡ ਦਬਾਉਂਦੇ ਹੋ, ਲਗਭਗ ਦਸ ਸਕਿੰਟਾਂ ਵਿੱਚ ਸਕੋਰ ਅਤੇ ਸਬੂਤ ’ਤੇ ਆਧਾਰਿਤ ਫੀਡਬੈਕ ਮਿਲਦਾ ਹੈ, ਅਤੇ ਤੁਸੀਂ ਜਿੰਨੀ ਵਾਰ ਚਾਹੋ ਇਹ ਦੁਹਰਾ ਸਕਦੇ ਹੋ।

Prepamigo

CA$25/ ਮਹੀਨਾ

ਮਹੀਨਾਵਾਰ CA$24.98 · ਸਾਲਾਨਾ ਪਲਾਨ ’ਤੇ CA$8.25 ਪ੍ਰਤੀ ਮਹੀਨਾ (CA$98.98 ਪ੍ਰਤੀ ਸਾਲ) · ਟੈਕਸ ਸਮੇਤ · ਕਦੇ ਵੀ ਰੱਦ ਕਰੋ

  • ਅਸੀਮਿਤ ਸਕੋਰਿੰਗ Scoring Engine 2.0 ਦੁਆਰਾ, ਬਿਨਾਂ ਕਿਸੇ ਰੋਜ਼ਾਨਾ, ਸੈਸ਼ਨ ਜਾਂ ਹਫ਼ਤਾਵਾਰੀ ਹੱਦ ਦੇ।
  • 80 ਪ੍ਰੈਕਟਿਸ ਸੈੱਟ ਅਤੇ 2,000+ ਟਾਸਕ ਚਾਰੇ ਸੈਕਸ਼ਨਾਂ ਵਿੱਚ, ਅਸਲ ਟੈਸਟ ਫਾਰਮੈਟ ’ਤੇ ਬਣੇ, ਤਾਂ ਜੋ ਤੁਹਾਨੂੰ ਕਦੇ ਆਪਣੇ ਪ੍ਰੋਂਪਟ ਨਾ ਲਿਖਣੇ ਪੈਣ।
  • ਰਿਕਾਰਡ ਕਰੋ ਤੇ ਅੱਗੇ ਵਧੋ। ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ, ਗਰੇਡਿੰਗ ਅਤੇ ਫੀਡਬੈਕ ਤੁਹਾਡੇ ਲਈ ਸੰਭਾਲੇ ਜਾਂਦੇ ਹਨ; ਕੁਝ ਵੀ ਪੇਸਟ ਕਰਨ ਜਾਂ ਪ੍ਰੋਂਪਟ ਕਰਨ ਦੀ ਲੋੜ ਨਹੀਂ।
  • ਤੁਹਾਡੇ ਆਪਣੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਫੀਡਬੈਕ, ਜਿਸ ਵਿੱਚ ਹਰ ਹਵਾਲਾ ਉਸ ਨਾਲ ਜੋੜਿਆ ਜਾ ਸਕਦਾ ਹੈ ਜੋ ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਕਿਹਾ ਸੀ।

ਤੁਲਨਾ ਲਈ, Claude Max

US$100/ ਮਹੀਨਾ

ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ ਲਗਭਗ CA$138 · 20x ਟੀਅਰ US$200 ਪ੍ਰਤੀ ਮਹੀਨਾ · Pro US$20 ਕਿਤੇ ਸਖ਼ਤ ਹੱਦਾਂ ਨਾਲ

  • Max ਦੀ ਵੀ ਹੱਦ ਹੈ। ਪੰਜ ਘੰਟੇ ਦੀ ਰੋਲਿੰਗ ਵਰਤੋਂ ਵਿੰਡੋ ਅਤੇ ਹਫ਼ਤਾਵਾਰੀ ਹੱਦ, Pro ਨਾਲੋਂ ਪੰਜ ਜਾਂ ਵੀਹ ਗੁਣਾ; ਜਦੋਂ ਤੁਸੀਂ ਕਿਸੇ ਇੱਕ ਨੂੰ ਛੂਹ ਲੈਂਦੇ ਹੋ, ਤੁਸੀਂ ਉਡੀਕ ਕਰਦੇ ਹੋ।
  • ਕੋਈ ਸਵਾਲ ਬੈਂਕ ਨਹੀਂ। ਤੁਸੀਂ ਆਪਣੇ ਟਾਸਕ ਖੁਦ ਲਿਆਉਂਦੇ ਹੋ, ਖੁਦ ਫ਼ੈਸਲਾ ਕਰਦੇ ਹੋ ਕਿ ਉਹ ਅਸਲ ਟੈਸਟ ਵਰਗੇ ਹਨ ਜਾਂ ਨਹੀਂ, ਅਤੇ ਖੁਦ ਹਿਸਾਬ ਰੱਖਦੇ ਹੋ ਕਿ ਕੀ ਪਹਿਲਾਂ ਕਰ ਚੁੱਕੇ ਹੋ।
  • ਸੈੱਟਅੱਪ ਤੁਸੀਂ ਕਰਦੇ ਹੋ। ਰਿਕਾਰਡ ਕਰਨਾ, ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕਰਨਾ, ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਪੇਸਟ ਕਰਨਾ ਅਤੇ ਗਰੇਡਿੰਗ ਹਦਾਇਤਾਂ ਲਿਖਣਾ, ਹਰ ਵਾਰ, ਸਭ ਤੁਹਾਡੇ ’ਤੇ ਹੈ।
  • ਸਾਦੀ ਬੇਨਤੀ, ਕੈਲੀਬਰੇਟ ਕੀਤਾ ਗਰੇਡਰ ਨਹੀਂ। ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਪੁੱਛਣ ’ਤੇ Claude Opus 5 ਨੇ 62% ਵਾਰ ਅਤੇ Claude Sonnet 5 ਨੇ 45% ਵਾਰ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਨਾਲ ਮੇਲ ਖਾਧਾ, Engine 2.0 ਦੇ 81% ਦੇ ਮੁਕਾਬਲੇ।

Claude ਪਲਾਨ ਦੀਆਂ ਕੀਮਤਾਂ ਅਤੇ ਵਰਤੋਂ ਦੀਆਂ ਸ਼ਰਤਾਂ ਸਤੰਬਰ 2026 ਵਿੱਚ claude.com ’ਤੇ ਪ੍ਰਕਾਸ਼ਿਤ ਮੁਤਾਬਕ ਹਨ ਅਤੇ ਬਦਲ ਸਕਦੀਆਂ ਹਨ। CELPIP ਆਪਣੇ ਮਾਲਕ ਦਾ ਟ੍ਰੇਡਮਾਰਕ ਹੈ; Prepamigo ਇੱਕ ਸੁਤੰਤਰ ਪ੍ਰੈਕਟਿਸ ਪਲੇਟਫਾਰਮ ਹੈ ਅਤੇ ਟੈਸਟ ਬਣਾਉਣ ਵਾਲੇ ਨਾਲ ਜੁੜਿਆ, ਪ੍ਰਮਾਣਿਤ ਜਾਂ ਸੰਬੰਧਿਤ ਨਹੀਂ ਹੈ। Prepamigo ਦੇ ਪ੍ਰੈਕਟਿਸ ਟਾਸਕ ਜਨਤਕ ਟੈਸਟ ਫਾਰਮੈਟ ਮੁਤਾਬਕ ਲਿਖੀ ਮੌਲਿਕ ਸਮੱਗਰੀ ਹਨ।

ਉਪਲਬਧਤਾ

Speaking ਲਈ Prepamigo Scoring Engine 2.0 ਹੁਣ ਸਾਰੇ Prepamigo ਵਰਤੋਂਕਾਰਾਂ ਲਈ ਹਰ ਸਪੀਕਿੰਗ ਟਾਸਕ ਕਿਸਮ ’ਤੇ ਲਾਈਵ ਹੈ। ਕੁਝ ਵੀ ਚਾਲੂ ਕਰਨ ਦੀ ਲੋੜ ਨਹੀਂ। ਹਰ ਨਵਾਂ ਸਪੀਕਿੰਗ ਜਵਾਬ Engine 2.0 ਦੁਆਰਾ ਸਕੋਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਹਰ ਸਕੋਰ ਦੇ ਨਾਲ ਵਿਦਿਆਰਥੀ ਦੇ ਆਪਣੇ ਸ਼ਬਦਾਂ ਤੋਂ ਲਿਆ ਫੀਡਬੈਕ ਆਉਂਦਾ ਹੈ।

ਇੱਕ ਆਮ ਜਵਾਬ ਲਗਭਗ ਦਸ ਸਕਿੰਟਾਂ ਵਿੱਚ ਸਕੋਰ ਹੋ ਜਾਂਦਾ ਹੈ, Engine 1.0 ਨਾਲੋਂ ਤੇਜ਼। Engine 2.0 ਨੂੰ ਚਲਾਉਣ ਦੀ ਪ੍ਰਤੀ ਜਵਾਬ ਲਾਗਤ ਵੀ ਸਾਨੂੰ ਪਿਛਲੇ ਡਿਜ਼ਾਈਨ ਨਾਲੋਂ ਘੱਟ ਪੈਂਦੀ ਹੈ, ਜਿਸ ਕਰਕੇ ਅਸੀਂ Prepamigo ਦੀ ਕੀਮਤ ਬਦਲੇ ਬਿਨਾਂ ਹਰ ਵਿਦਿਆਰਥੀ ਲਈ ਦੋ ਗਰੇਡਰ ਅਤੇ ਤਿੰਨ-ਤਿੰਨ ਵੋਟਾਂ ਚਲਾ ਸਕਦੇ ਹਾਂ।

ਉੱਪਰ ਦੱਸੀ ਅਸਲ-ਦੁਨੀਆ ਦੀ ਤਸਦੀਕ ਪੂਰੀ ਹੋਣ ’ਤੇ ਅਸੀਂ ਇਸ ਪੰਨੇ ਦੇ ਅੰਕੜਿਆਂ ਦੇ ਅੱਪਡੇਟ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰਾਂਗੇ। ਜੇ ਤੁਹਾਡੇ ਕੋਲ ਕੋਈ ਰਿਕਾਰਡਿੰਗ ਹੈ ਜਿਸਨੂੰ ਤੁਹਾਡੇ ਖ਼ਿਆਲ ਵਿੱਚ Engine 2.0 ਨੇ ਗ਼ਲਤ ਸਕੋਰ ਦਿੱਤਾ, ਅਸੀਂ ਉਹ ਦੇਖਣਾ ਚਾਹੁੰਦੇ ਹਾਂ: ਅਗਲਾ ਸੁਧਾਰ ਲੱਭਣ ਦਾ ਇਹ ਸਭ ਤੋਂ ਤੇਜ਼ ਤਰੀਕਾ ਹੈ ਜੋ ਸਾਨੂੰ ਪਤਾ ਹੈ।

ਆਹਮੋ-ਸਾਹਮਣੇ ਤੁਲਨਾਵਾਂ ਲਈ ਪੜ੍ਹੋ Prepamigo ਬਨਾਮ Claude ਅਤੇ Prepamigo ਬਨਾਮ ChatGPT ਇਹ ਗਾਈਡ ਅੰਗਰੇਜ਼ੀ ਵਿੱਚ ਪੜ੍ਹੋ · ਜਵਾਬ ਰਿਕਾਰਡ ਕਰੋ

ਸਪੀਕਿੰਗ ਲਈ Prepamigo Scoring Engine 2.0 ਪੇਸ਼ ਕਰਦੇ ਹਾਂ | PrepAmigo