ਸਕੋਰਿੰਗ

ਕੀ Prepamigo ਦੀ CELPIP ਸਪੀਕਿੰਗ ਸਕੋਰਿੰਗ ਸਹੀ ਹੈ? ਅੰਕੜੇ, ਇਮਾਨਦਾਰੀ ਨਾਲ

6 ਸਤੰਬਰ 2026

48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ’ਤੇ Engine 2.0

ਤਸਦੀਕਸ਼ੁਦਾ ਬੈਂਡ ਦੇ ਅੰਦਰ ਸਕੋਰ ਕੀਤੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ। ਵੱਖ-ਵੱਖ ਦਿਨਾਂ ’ਤੇ ਹੋਈਆਂ ਤਿੰਨ ਵੱਖਰੀਆਂ ਰਨਾਂ ਵਿੱਚੋਂ ਹਰੇਕ ਨੇ ਸਮੁੱਚੇ ਤੌਰ ’ਤੇ 81.3% ਦਿੱਤਾ।

81%

ਸਹੀ ਬੈਂਡ

Prepamigo ਬਨਾਮ ਟੌਪ ਚੈਟਬੋਟ ਪਲਾਨ

ਕੈਨੇਡੀਅਨ ਡਾਲਰ ਵਿੱਚ। Prepamigo ਦੀਆਂ ਕੀਮਤਾਂ ਵਿੱਚ ਟੈਕਸ ਸ਼ਾਮਲ ਹੈ। Claude Max (US$100 ਤੋਂ ਸ਼ੁਰੂ) ਅਤੇ ChatGPT Pro (US$200) ਨੂੰ 1.38 ਦੀ ਦਰ ਨਾਲ ਬਦਲਿਆ ਗਿਆ ਹੈ, ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ। ਸ਼ੁੱਧਤਾ ਉਹਨਾਂ ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤਾ ਗਿਆ ਜਦੋਂ ਦੱਸੇ ਗਏ ਮਾਡਲ ਨੂੰ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਜਵਾਬ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
ਮਹੀਨਾਵਾਰ ਕੀਮਤ
CA$24.98 (ਟੈਕਸ ਸਮੇਤ)
CA$138+ (ਟੈਕਸ ਵਾਧੂ)
CA$276 (ਟੈਕਸ ਵਾਧੂ)
ਸਕੋਰਿੰਗ
ਅਸੀਮਿਤ
ਸੀਮਿਤ
ਸੀਮਿਤ
ਤਿਆਰ ਸਵਾਲ ਬੈਂਕ
ਹਾਂ
ਨਹੀਂ
ਨਹੀਂ
ਪ੍ਰੈਕਟਿਸ ਸੈੱਟ
80
ਕੋਈ ਨਹੀਂ
ਕੋਈ ਨਹੀਂ
ਪ੍ਰੈਕਟਿਸ ਟਾਸਕ
2,000+
ਕੋਈ ਨਹੀਂ
ਕੋਈ ਨਹੀਂ
CELPIP ਫਾਰਮੈਟ
ਹਾਂ
ਨਹੀਂ
ਨਹੀਂ
ਸ਼ੁੱਧਤਾ
81%
62%
35%
ਟੌਪ-ਲੈਵਲ ਜਵਾਬ
71%
50%
25%

ਇਹ ਕਿਸੇ ਵੀ ਪ੍ਰੈਕਟਿਸ ਟੂਲ ਤੋਂ ਪੁੱਛਣ ਵਾਲਾ ਸਹੀ ਸਵਾਲ ਹੈ, ਅਤੇ ਜ਼ਿਆਦਾਤਰ ਟੂਲ ਇਸ ਦਾ ਜਵਾਬ ਨਹੀਂ ਦਿੰਦੇ। ਇੱਕ ਸਪੀਕਿੰਗ ਸਕੋਰ ਦੀ ਕੀਮਤ ਸਿਰਫ਼ ਤਾਂ ਹੀ ਹੈ ਜੇ ਇਹ ਤੁਹਾਨੂੰ ਦੱਸੇ ਕਿ ਇੱਕ ਅਸਲ ਰੇਟਰ ਕੀ ਕਹੇਗਾ, ਅਤੇ ਇਹ ਜਾਣਨ ਦਾ ਇੱਕੋ ਤਰੀਕਾ ਹੈ ਇਸ ਨੂੰ ਮਾਪਣਾ। ਇਸ ਲਈ ਇਹ ਲੇਖ ਉਹੀ ਮਾਪ ਹੈ, ਸਾਦੇ ਢੰਗ ਨਾਲ ਪੇਸ਼ ਕੀਤਾ ਗਿਆ, ਜਿਸ ਵਿੱਚ ਉਹ ਹਿੱਸੇ ਵੀ ਸ਼ਾਮਲ ਹਨ ਜੋ ਸਾਨੂੰ ਵਧੀਆ ਦਿਖਾਉਂਦੇ ਹਨ ਅਤੇ ਉਹ ਵੀ ਜੋ ਨਹੀਂ ਦਿਖਾਉਂਦੇ।

ਇੱਕ ਪੈਰੇ ਵਿੱਚ ਜਵਾਬ: 48 ਸਪੀਕਿੰਗ ਜਵਾਬਾਂ ’ਤੇ ਜੋ Prepamigo ਦੇ Scoring Engine 2.0 ਨੇ ਕਦੇ ਨਹੀਂ ਦੇਖੇ ਸਨ, ਹਰੇਕ ਦਾ ਇੱਕ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਸੀ, ਇੰਜਣ ਨੇ 81% ਵਾਰ ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ ’ਤੇ ਅਤੇ 92% ਵਾਰ ਇਸ ਦੇ ਇੱਕ ਪੁਆਇੰਟ ਦੇ ਅੰਦਰ ਸਕੋਰ ਦਿੱਤਾ। ਇਸ ਨੇ ਤਿੰਨ ਵੱਖਰੀਆਂ ਰਨਾਂ ਵਿੱਚੋਂ ਹਰੇਕ ’ਤੇ ਇਹੀ 81% ਹਾਸਲ ਕੀਤਾ। ਇਹ ਕਮਜ਼ੋਰ ਅਤੇ ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ’ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਸਹੀ ਹੈ, ਕ੍ਰਮਵਾਰ 88% ਅਤੇ 85% ’ਤੇ, ਅਤੇ ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ’ਤੇ ਸਭ ਤੋਂ ਘੱਟ ਸਹੀ, 71% ’ਤੇ, ਜਿੱਥੇ ਇਸ ਦੀ ਖਾਸ ਗਲਤੀ 10 ਨੂੰ 8 ਦੇਣਾ ਹੈ। ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਸਕੋਰ ਕਰਨ ਲਈ ਕਹਿਣ ’ਤੇ, ਸਾਡੇ ਦੁਆਰਾ ਟੈਸਟ ਕੀਤੇ ਗਏ ਸਭ ਤੋਂ ਵਧੀਆ ਜਨਰਲ-ਪਰਪਸ AI ਮਾਡਲ ਨੇ 62% ਹਾਸਲ ਕੀਤਾ, ਅਤੇ ਸਭ ਤੋਂ ਕਮਜ਼ੋਰ ਨੇ 31%; ਸਾਡੀ ਪੂਰੀ ਗਰੇਡਿੰਗ ਪ੍ਰਕਿਰਿਆ ਦੇ ਨਾਲ, ਸਭ ਤੋਂ ਵਧੀਆ ਮਾਡਲ ਨੇ 77% ਹਾਸਲ ਕੀਤਾ।

ਅੱਗੇ ਇਹ ਹੈ ਕਿ ਅਸੀਂ ਇਹ ਅੰਕੜੇ ਕਿਵੇਂ ਕੱਢੇ, ਹਰ ਸਕੋਰ ਪੱਧਰ ’ਤੇ ਇਨ੍ਹਾਂ ਦਾ ਕੀ ਮਤਲਬ ਹੈ, ਇਹ ਕਿੰਨੇ ਸਥਿਰ ਹਨ, ਗਲਤੀਆਂ ਕਿੱਥੇ ਹੁੰਦੀਆਂ ਹਨ, ਇਹ ਸਕੋਰ ਉਨ੍ਹਾਂ ਵਿਕਲਪਾਂ ਨਾਲ ਕਿਵੇਂ ਤੁਲਨਾ ਕਰਦਾ ਹੈ ਜੋ ਤੁਸੀਂ ਸ਼ਾਇਦ ਇਸ ਦੀ ਥਾਂ ਵਰਤ ਰਹੇ ਹੋ, ਅਤੇ ਇਹ ਸਭ ਧਿਆਨ ਵਿੱਚ ਰੱਖਦੇ ਹੋਏ ਆਪਣਾ ਸਕੋਰ ਕਿਵੇਂ ਪੜ੍ਹਨਾ ਹੈ। ਜੇ ਤੁਹਾਨੂੰ ਸਿਰਫ਼ ਵਿਹਾਰਕ ਸਲਾਹ ਚਾਹੀਦੀ ਹੈ, ਤਾਂ ਸਿੱਧਾ ਆਪਣਾ ਸਕੋਰ ਕਿਵੇਂ ਪੜ੍ਹਨਾ ਹੈ ਵਾਲੇ ਸੈਕਸ਼ਨ ’ਤੇ ਜਾਓ। ਜੇ ਤੁਸੀਂ ਇਹ ਫੈਸਲਾ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹੋ ਕਿ ਇਸ ਨੰਬਰ ’ਤੇ ਭਰੋਸਾ ਕਰਨਾ ਹੈ ਜਾਂ ਨਹੀਂ, ਤਾਂ ਪੂਰਾ ਲੇਖ ਪੜ੍ਹੋ।

ਇੱਥੇ “ਸਹੀ” ਦਾ ਕੀ ਮਤਲਬ ਹੈ

ਕਿਸੇ ਵੀ ਨੰਬਰ ਤੋਂ ਪਹਿਲਾਂ, ਪਰਿਭਾਸ਼ਾ। ਅਸੀਂ ਇਹ ਦਾਅਵਾ ਨਹੀਂ ਕਰ ਰਹੇ ਕਿ Prepamigo ਦਾ ਸਕੋਰ ਤੁਹਾਡੇ ਟੈਸਟ ਦੇ ਨਤੀਜੇ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦਾ ਹੈ। ਕੋਈ ਵੀ ਪ੍ਰੈਕਟਿਸ ਟੂਲ ਇਹ ਵਾਅਦਾ ਨਹੀਂ ਕਰ ਸਕਦਾ, ਅਤੇ ਜੋ ਕੋਈ ਕਰਦਾ ਹੈ ਉਹ ਸਿਰਫ਼ ਅੰਦਾਜ਼ਾ ਲਗਾ ਰਿਹਾ ਹੈ। ਅਸੀਂ ਜੋ ਮਾਪਦੇ ਹਾਂ ਉਹ ਇਸ ਤੋਂ ਕਿਤੇ ਵੱਧ ਸੀਮਿਤ ਅਤੇ ਵੱਧ ਇਮਾਨਦਾਰ ਹੈ: ਇੱਕ ਬੋਲੇ ਗਏ ਜਵਾਬ ਨੂੰ ਦੇਖਦੇ ਹੋਏ ਜਿਸ ਦਾ ਸਕੋਰ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਤਸਦੀਕ ਕੀਤਾ ਗਿਆ ਹੈ, ਇੰਜਣ ਕਿੰਨੀ ਵਾਰ ਉਸੇ ਪੱਧਰ ’ਤੇ ਸਕੋਰ ਦਿੰਦਾ ਹੈ?

CELPIP ਸਪੀਕਿੰਗ 12 ਤੱਕ ਜਾਣ ਵਾਲੇ ਸਕੇਲ ’ਤੇ ਦਰਜ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਅਤੇ ਸਾਡੇ ਰੈਫਰੈਂਸ ਡੇਟਾ ਵਿੱਚ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਤਿੰਨ ਬੈਂਡਾਂ ਵਿੱਚ ਆਉਂਦੇ ਹਨ: ਹੇਠਲਾ, ਭਾਵ 4 ਜਾਂ 5; ਮੱਧ, ਭਾਵ 7 ਜਾਂ 8; ਅਤੇ ਟੌਪ, ਭਾਵ 10 ਅਤੇ ਇਸ ਤੋਂ ਵੱਧ। ਅਸੀਂ ਇੰਜਣ ਨੂੰ ਸਹੀ ਮੰਨਦੇ ਹਾਂ ਜਦੋਂ ਇਸ ਦਾ ਸਕੋਰ ਤਸਦੀਕਸ਼ੁਦਾ ਬੈਂਡ ਦੇ ਅੰਦਰ ਆਉਂਦਾ ਹੈ। ਟੌਪ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਜਵਾਬ ਸਹੀ ਸਕੋਰ ਕੀਤਾ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ ਜੇ ਇੰਜਣ ਇਸ ਨੂੰ 9, 10 ਜਾਂ 11 ਦਿੰਦਾ ਹੈ। ਇੱਕ ਸਖ਼ਤ ਤਰੀਕੇ ਨਾਲ, ਜੋ ਸਿਰਫ਼ 10 ਅਤੇ ਇਸ ਤੋਂ ਵੱਧ ਨੂੰ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ, ਇਸ ਪੰਨੇ ਦੇ ਹਰ ਅੰਕੜੇ ਵਿੱਚ ਕੁਝ ਪੁਆਇੰਟਾਂ ਦੀ ਗਿਰਾਵਟ ਆਉਂਦੀ ਹੈ ਅਤੇ ਹਰ ਤੁਲਨਾ ਉਸੇ ਕ੍ਰਮ ਵਿੱਚ ਬਣੀ ਰਹਿੰਦੀ ਹੈ।

ਮੁੱਖ ਅੰਕੜੇ

ਵਿਹਾਰਕ ਤੌਰ ’ਤੇ 81% ਦਾ ਕੀ ਮਤਲਬ ਹੈ? ਜੇ ਤੁਸੀਂ ਇੱਕ ਸਥਿਰ ਪੱਧਰ ’ਤੇ ਦਸ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰਦੇ ਹੋ, ਤਾਂ ਇੰਜਣ ਉਨ੍ਹਾਂ ਵਿੱਚੋਂ ਲਗਭਗ ਅੱਠ ਨੂੰ ਸਹੀ ਬੈਂਡ ਵਿੱਚ ਰੱਖੇਗਾ ਅਤੇ ਲਗਭਗ ਇੱਕ ਹੋਰ ਨੂੰ ਇਸ ਦੇ ਇੱਕ ਪੁਆਇੰਟ ਦੇ ਅੰਦਰ। ਇਹ 5 ਨੂੰ 10 ਦੇ ਬੈਂਡ ਵਿੱਚ ਜਾਂ 10 ਨੂੰ 5 ਦੇ ਬੈਂਡ ਵਿੱਚ ਨਹੀਂ ਰੱਖੇਗਾ; ਤਿੰਨ ਰਨਾਂ ਵਿੱਚ ਸਕੋਰ ਕੀਤੇ ਗਏ 144 ਜਵਾਬਾਂ ਵਿੱਚੋਂ ਅਜਿਹਾ ਇੱਕ ਵਾਰ ਵੀ ਨਹੀਂ ਹੋਇਆ। ਇਹ ਜੋ ਗਲਤੀਆਂ ਕਰਦਾ ਹੈ ਉਹ ਇੱਕ ਸਾਵਧਾਨ ਰੇਟਰ ਦੀਆਂ ਗਲਤੀਆਂ ਹਨ, ਇੱਕ ਬਾਰਡਰਲਾਈਨ ਜਵਾਬ ’ਤੇ, ਅਤੇ ਅਗਲਾ ਸੈਕਸ਼ਨ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਇਹ ਕਿੱਥੇ ਸਭ ਤੋਂ ਵੱਧ ਕੇਂਦਰਿਤ ਹਨ।

ਹਰ ਸਕੋਰ ਪੱਧਰ ’ਤੇ ਸ਼ੁੱਧਤਾ

ਤਸਦੀਕਸ਼ੁਦਾ ਬੈਂਡ ਅਨੁਸਾਰ ਸ਼ੁੱਧਤਾ

ਹਰ ਬੈਂਡ ’ਤੇ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ। ਹਰ ਬਾਰ ਉਸ ਬੈਂਡ ਦੇ ਜਵਾਬਾਂ ਦਾ ਉਹ ਹਿੱਸਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਉਸੇ ਬੈਂਡ ਦੇ ਅੰਦਰ ਸਕੋਰ ਕੀਤਾ ਗਿਆ।

88%

ਹੇਠਲਾ (4–5)

85%

ਮੱਧ (7–8)

71%

ਟੌਪ (10+)

ਹੇਠਲੇ-ਪੱਧਰ ਦੇ ਜਵਾਬ: 88%। ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ਨੂੰ ਪਛਾਣਨਾ ਸਭ ਤੋਂ ਆਸਾਨ ਹੈ। ਇਹ ਆਮ ਤੌਰ ’ਤੇ ਛੋਟੇ ਹੁੰਦੇ ਹਨ, ਪ੍ਰੌਮਪਟ ਦੇ ਸ਼ਬਦਾਂ ਨੂੰ ਦੁਹਰਾਉਂਦੇ ਹਨ, ਅਤੇ ਟਾਸਕ ਦੇ ਕੁਝ ਹਿੱਸੇ ਅਧੂਰੇ ਛੱਡ ਦਿੰਦੇ ਹਨ। ਇੰਜਣ ਜ਼ਿਆਦਾਤਰ ਸਮੇਂ ਇਨ੍ਹਾਂ ਸੰਕੇਤਾਂ ਨੂੰ ਪਕੜ ਲੈਂਦਾ ਹੈ। ਜਦੋਂ ਇਹ ਖੁੰਝਦਾ ਹੈ, ਤਾਂ ਉੱਪਰ ਵੱਲ ਖੁੰਝਦਾ ਹੈ: ਹਰ ਮਾਮਲੇ ਵਿੱਚ, ਜਵਾਬ ਨੂੰ 4 ਜਾਂ 5 ਦੀ ਥਾਂ 8 ਸਕੋਰ ਕੀਤਾ ਗਿਆ। ਇਸ ਦਾ ਕਾਰਨ ਲਗਭਗ ਹਮੇਸ਼ਾ ਇੱਕ ਅਜਿਹਾ ਜਵਾਬ ਹੁੰਦਾ ਹੈ ਜੋ ਰਵਾਂ ਅਤੇ ਭਰੋਸੇਮੰਦ ਲੱਗਦਾ ਹੈ ਪਰ ਕਹਿੰਦਾ ਬਹੁਤ ਘੱਟ ਹੈ; ਡਿਲਿਵਰੀ ਇਸ ਨੂੰ ਉਹ ਪੱਧਰ ਦੇ ਦਿੰਦੀ ਹੈ ਜੋ ਇਸ ਨੇ ਕੰਟੈਂਟ ’ਤੇ ਨਹੀਂ ਕਮਾਇਆ। ਅਸੀਂ ਇਹ ਜਾਣਦੇ ਹਾਂ ਕਿਉਂਕਿ ਅਸੀਂ ਦੇਖ ਸਕਦੇ ਹਾਂ ਕਿ ਗ੍ਰੇਡਰਾਂ ਨੇ ਕਿਹੜੇ ਪਹਿਲੂ ਨੂੰ ਉੱਚਾ ਰੱਖਿਆ, ਅਤੇ ਇਹ ਹਰ ਵਾਰ ਲਿਸਨਏਬਿਲਿਟੀ ਹੁੰਦੀ ਹੈ।

ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬ: 85%। ਇੱਕ ਮਾਅਨੇ ਵਿੱਚ ਇਨ੍ਹਾਂ ਨੂੰ ਗਰੇਡ ਕਰਨਾ ਸਭ ਤੋਂ ਔਖਾ ਹੈ, ਕਿਉਂਕਿ ਇਨ੍ਹਾਂ ਵਿੱਚ ਖੂਬੀਆਂ ਅਤੇ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਇੱਕ ਅਸਲ ਮਿਸ਼ਰਣ ਹੁੰਦਾ ਹੈ ਜਿਸ ਨੂੰ ਪਛਾਣਨ ਦੀ ਥਾਂ ਤੋਲਣਾ ਪੈਂਦਾ ਹੈ। ਇੱਥੇ ਇੰਜਣ ਦੀਆਂ ਖੁੰਝਾਂ ਦੋਵੇਂ ਦਿਸ਼ਾਵਾਂ ਵਿੱਚ ਜਾਂਦੀਆਂ ਹਨ। ਕੁਝ ਜਵਾਬ ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਸਾਫ਼ ਝਿਜਕ ਸੀ ਪਰ ਵਿਚਾਰ ਠੋਸ ਸਨ, ਉਨ੍ਹਾਂ ਨੂੰ 5 ਜਾਂ 6 ਤੱਕ ਹੇਠਾਂ ਖਿੱਚਿਆ ਗਿਆ; ਕੁਝ ਚਮਕਦਾਰ ਲੱਗਣ ਵਾਲੇ ਜਵਾਬਾਂ ਨੂੰ 10 ਤੱਕ ਉੱਪਰ ਧੱਕਿਆ ਗਿਆ। ਦੋ ਗ੍ਰੇਡਰਾਂ ਵਿਚਕਾਰ ਸੁਲਾਹ ਦਾ ਪੜਾਅ ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਜ਼ਿਆਦਾਤਰ ਨੂੰ ਪਕੜ ਲੈਂਦਾ ਹੈ, ਇਹੀ ਕਾਰਨ ਹੈ ਕਿ ਇਹ ਅੰਕੜਾ ਇੰਨਾ ਉੱਚਾ ਹੈ।

ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬ: 71%। ਇਹ ਸਭ ਤੋਂ ਕਮਜ਼ੋਰ ਬੈਂਡ ਹੈ ਅਤੇ ਉਹ ਜਿਸ ਬਾਰੇ ਅਸੀਂ ਸਭ ਤੋਂ ਵੱਧ ਗੱਲ ਕਰਦੇ ਹਾਂ, ਕਿਉਂਕਿ ਇਹ ਗਲਤੀ ਬਹੁਤ ਇਕਸਾਰ ਹੈ। ਜਦੋਂ ਇੰਜਣ ਕਿਸੇ ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬ ਨੂੰ ਖੁੰਝਦਾ ਹੈ, ਤਾਂ ਇਹ ਇਸ ਨੂੰ 8 ਦਿੰਦਾ ਹੈ। 7 ਨਹੀਂ, 6 ਨਹੀਂ; ਮੁੱਠੀ ਭਰ 9 ਨੂੰ ਛੱਡ ਕੇ ਜੋ ਸਹੀ ਮੰਨੇ ਜਾਂਦੇ ਹਨ, ਹਰ ਵਾਰ 8। ਇੰਜਣ ਇੱਕ ਮਜ਼ਬੂਤ ਜਵਾਬ ਦੇਖਦਾ ਹੈ ਅਤੇ ਇੱਕ ਪੜਾਅ ਪਿੱਛੇ ਰੁਕ ਜਾਂਦਾ ਹੈ।

ਇਸ ਨੂੰ ਪ੍ਰਸੰਗ ਵਿੱਚ ਸਮਝਣਾ ਜ਼ਰੂਰੀ ਹੈ। ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ’ਤੇ 8 ਵੱਲ ਇਹ ਖਿਸਕਾਅ ਕੋਈ Prepamigo ਦੀ ਖਾਸੀਅਤ ਨਹੀਂ ਹੈ; ਇਹ ਹਰ ਉਸ ਆਟੋਮੇਟਿਡ ਗ੍ਰੇਡਰ ਦੀ ਖਾਸ ਕਮਜ਼ੋਰੀ ਹੈ ਜਿਸ ਦਾ ਅਸੀਂ ਟੈਸਟ ਕੀਤਾ ਹੈ, ਭਾਵੇਂ ਉਹ ਮਨੁੱਖੀ-ਕੈਲੀਬ੍ਰੇਟਿਡ ਹੋਵੇ ਜਾਂ ਨਾ। ਸਾਡੇ ਪਿਛਲੇ ਇੰਜਣ ਵਿੱਚ ਇਹ ਸਮੱਸਿਆ ਕਿਤੇ ਵੱਧ ਸੀ। ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਉਹੀ ਜਵਾਬਾਂ ਨੂੰ ਸਕੋਰ ਕਰਨ ਲਈ ਕਹਿਣ ’ਤੇ, ਸਭ ਤੋਂ ਵਧੀਆ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲ ਨੇ 56% ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ਨੂੰ ਪਛਾਣਿਆ; ChatGPT ਦੇ ਪੇਡ ਪਲਾਨਾਂ ਪਿੱਛੇ ਵਾਲੇ ਮਾਡਲ ਨੇ 25% ਪਛਾਣਿਆ; ਅਤੇ ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦੇਣ ’ਤੇ ਵੀ, ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਕੋਈ ਵੀ 63% ਤੋਂ ਵੱਧ ਨਹੀਂ ਗਿਆ। ਇਕਾਹਤਰ ਪ੍ਰਤੀਸ਼ਤ ਉਹ ਸਭ ਤੋਂ ਵਧੀਆ ਅੰਕੜਾ ਹੈ ਜੋ ਅਸੀਂ ਹਾਸਲ ਕੀਤਾ ਹੈ, ਅਤੇ ਇਹ ਹੁਣ ਵੀ ਉਹ ਨੰਬਰ ਹੈ ਜਿਸ ਨੂੰ ਅਸੀਂ ਸਭ ਤੋਂ ਵੱਧ ਸੁਧਾਰਨਾ ਚਾਹੁੰਦੇ ਹਾਂ।

8 ਦੀ ਸਮੱਸਿਆ, ਤੁਹਾਡੀ ਸਕਰੀਨ ਦੇ ਪਾਸੇ ਤੋਂ

ਪੱਧਰ ਵਾਲਾ ਨਜ਼ਰੀਆ ਦੱਸਦਾ ਹੈ ਕਿ ਇੱਕ ਜਾਣੇ-ਪਛਾਣੇ ਪੱਧਰ ਦੇ ਜਵਾਬ ’ਤੇ ਇੰਜਣ ਕਿਵੇਂ ਕਰਦਾ ਹੈ। ਤੁਸੀਂ ਇਸ ਨੂੰ ਉਲਟੇ ਪਾਸੇ ਤੋਂ ਦੇਖ ਰਹੇ ਹੋ: ਤੁਹਾਡੇ ਕੋਲ ਇੱਕ ਸਕੋਰ ਹੈ ਅਤੇ ਤੁਸੀਂ ਜਾਣਨਾ ਚਾਹੁੰਦੇ ਹੋ ਕਿ ਇਸ ’ਤੇ ਕਿੰਨਾ ਭਰੋਸਾ ਕਰਨਾ ਹੈ। ਤਾਂ ਇੱਥੇ ਉਹੀ ਡੇਟਾ ਉਲਟਾ ਕੇ ਦਿਖਾਇਆ ਗਿਆ ਹੈ। ਇੰਜਣ ਜੋ ਵੀ ਸਕੋਰ ਦਿੰਦਾ ਹੈ, ਉਸ ’ਤੇ, ਜਵਾਬ ਅਸਲ ਵਿੱਚ ਉਸ ਪੱਧਰ ’ਤੇ ਕਿੰਨੀ ਵਾਰ ਸੀ?

  • ਜੇ ਇੰਜਣ 4 ਜਾਂ 5 ਕਹਿੰਦਾ ਹੈ: ਜਵਾਬ 93% ਵਾਰ ਹੇਠਲੇ ਪੱਧਰ ’ਤੇ ਸੀ। ਬਾਕੀ ਬਚੇ ਹੋਏ ਭਾਰੀ ਝਿਜਕ ਵਾਲੇ ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬ ਸਨ। Engine 2.0 ਤੋਂ ਮਿਲਿਆ ਘੱਟ ਸਕੋਰ ਲਗਭਗ ਹਮੇਸ਼ਾ ਸਹੀ ਹੁੰਦਾ ਹੈ।
  • ਜੇ ਇੰਜਣ 10 ਕਹਿੰਦਾ ਹੈ: ਜਵਾਬ 92% ਵਾਰ ਟੌਪ ਪੱਧਰ ’ਤੇ ਸੀ। Engine 2.0 ਤੋਂ ਮਿਲਿਆ 10, ਅਸਲ ਵਿੱਚ 10 ਹੁੰਦਾ ਹੈ।
  • ਜੇ ਇੰਜਣ 8 ਕਹਿੰਦਾ ਹੈ: ਜਵਾਬ 67% ਵਾਰ ਮੱਧ ਪੱਧਰ ’ਤੇ ਸੀ, 23% ਵਾਰ ਟੌਪ ਪੱਧਰ ’ਤੇ, ਅਤੇ 10% ਵਾਰ ਹੇਠਲੇ ਪੱਧਰ ’ਤੇ। 8 ਹੀ ਉਹ ਇੱਕੋ ਸਕੋਰ ਹੈ ਜਿਸ ਨੂੰ ਧਿਆਨ ਨਾਲ ਪੜ੍ਹਨਾ ਬਣਦਾ ਹੈ।

ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਕਹੀਏ ਤਾਂ: Engine 2.0 ਤੋਂ ਮਿਲਿਆ 8 ਦਾ ਮਤਲਬ ਹੈ “ਮੱਧ, ਸ਼ਾਇਦ, ਪਰ ਸ਼ਾਇਦ ਬਿਹਤਰ ਵੀ।” 8 ਪਾਉਣ ਵਾਲੇ ਲਗਭਗ ਚਾਰ ਵਿੱਚੋਂ ਇੱਕ ਜਵਾਬ ਅਸਲ ਵਿੱਚ 10 ਹੁੰਦਾ ਹੈ। ਜੇ ਤੁਹਾਨੂੰ ਕਿਸੇ ਅਜਿਹੇ ਜਵਾਬ ’ਤੇ 8 ਮਿਲਦਾ ਹੈ ਜਿਸ ਨੂੰ ਤੁਸੀਂ ਸ਼ਾਨਦਾਰ ਸਮਝਿਆ ਸੀ, ਤਾਂ ਇਹ ਸਿੱਟਾ ਨਾ ਕੱਢੋ ਕਿ ਤੁਸੀਂ ਤਿਆਰ ਨਹੀਂ ਹੋ। ਉਹੀ ਟਾਸਕ ਦੁਬਾਰਾ ਰਿਕਾਰਡ ਕਰੋ। ਤਿੰਨ ਕੋਸ਼ਿਸ਼ਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ 10 ਆਉਣਾ, 10 ਹੀ ਹੈ; ਤਿੰਨ ਕੋਸ਼ਿਸ਼ਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ 8 ਆਉਣਾ, 8 ਹੀ ਹੈ; ਅਤੇ ਮਿਸ਼ਰਣ ਮਿਲਣਾ ਇੱਕ ਬਾਰਡਰਲਾਈਨ ਜਵਾਬ ਦੀ ਨਿਸ਼ਾਨੀ ਹੈ, ਅਤੇ ਫੀਡਬੈਕ ਦੱਸੇਗੀ ਕਿ ਕਿਹੜਾ ਪਹਿਲੂ ਇਸ ਨੂੰ ਉੱਥੇ ਰੋਕ ਰਿਹਾ ਹੈ।

ਇੱਕ ਮਜ਼ਬੂਤ ਉਮੀਦਵਾਰ ਲਈ ਸਭ ਤੋਂ ਲਾਹੇਵੰਦ ਆਦਤ ਇਹ ਹੈ ਕਿ 8 ਨੂੰ ਇੱਕ ਫੈਸਲੇ ਦੀ ਥਾਂ ਇੱਕ ਸਵਾਲ ਵਾਂਗ ਦੇਖੋ। ਫੀਡਬੈਕ ਉਨ੍ਹਾਂ ਸ਼ਬਦਾਂ ਦਾ ਹਵਾਲਾ ਦਿੰਦੀ ਹੈ ਜਿਨ੍ਹਾਂ ’ਤੇ ਗ੍ਰੇਡਰਾਂ ਨੇ ਪ੍ਰਤੀਕਿਰਿਆ ਦਿੱਤੀ। ਜੇ ਉਹ ਸ਼ਬਦ ਸਿਰਫ਼ ਝਿਜਕ ਅਤੇ ਰੀਸਟਾਰਟ ਬਾਰੇ ਹਨ, ਤਾਂ ਤੁਸੀਂ ਸ਼ਾਇਦ ਕੰਟੈਂਟ ’ਤੇ 10 ਅਤੇ ਡਿਲਿਵਰੀ ’ਤੇ 9 ਹੋ, ਅਤੇ ਇੱਕ ਹੋਰ ਟੇਕ ਇਹ ਦਿਖਾ ਦੇਵੇਗੀ।

ਕੀ ਇੱਕੋ ਰਿਕਾਰਡਿੰਗ ਨੂੰ ਇੱਕੋ ਸਕੋਰ ਮਿਲਦਾ ਹੈ?

ਇਕਸਾਰਤਾ ਤੋਂ ਬਿਨਾਂ ਸ਼ੁੱਧਤਾ ਸਿਰਫ਼ ਕਿਸਮਤ ਹੈ। ਜੇ ਇੱਕੋ ਰਿਕਾਰਡਿੰਗ ਨੂੰ ਅੱਜ 8 ਅਤੇ ਕੱਲ੍ਹ 10 ਮਿਲ ਸਕਦਾ ਹੈ, ਤਾਂ 81% ਵਾਲਾ ਅੰਕੜਾ ਸਿਰਫ਼ ਰੌਲੇ ਦਾ ਇੱਕ ਔਸਤ ਹੋਵੇਗਾ ਅਤੇ ਤੁਸੀਂ ਸਕੋਰ ਨਾਲ ਕਿਸੇ ਵੀ ਚੀਜ਼ ਨੂੰ ਟ੍ਰੈਕ ਨਹੀਂ ਕਰ ਸਕੋਗੇ। ਇਸ ਲਈ ਅਸੀਂ ਦੁਹਰਾਓ ਨੂੰ ਸਿੱਧਾ ਟੈਸਟ ਕੀਤਾ।

48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ਨੂੰ ਤਿੰਨ ਵੱਖਰੀਆਂ ਵਾਰ, ਵੱਖ-ਵੱਖ ਦਿਨਾਂ ’ਤੇ, ਵਿਚਕਾਰ ਕੁਝ ਵੀ ਬਦਲੇ ਬਿਨਾਂ ਸਕੋਰ ਕੀਤਾ ਗਿਆ। ਹਰ ਰਨ ’ਤੇ ਸਮੁੱਚਾ ਅੰਕੜਾ 81.3% ਰਿਹਾ। ਵਿਅਕਤੀਗਤ ਜਵਾਬਾਂ ਦੇ ਪੱਧਰ ’ਤੇ, 87.5% ਨੂੰ ਤਿੰਨੋਂ ਵਾਰ ਇੱਕੋ ਜਿਹਾ ਸਕੋਰ ਮਿਲਿਆ, ਅਤੇ ਸਿਰਫ਼ 4.2% ਹੀ ਕਦੇ ਦੋ ਜਾਂ ਵੱਧ ਪੁਆਇੰਟਾਂ ਨਾਲ ਬਦਲੇ। ਇਹ ਕੁਝ ਜਵਾਬ ਬਿਲਕੁਲ ਦੋ ਬੈਂਡਾਂ ਦੀ ਸੀਮਾ ’ਤੇ ਬੈਠੇ ਹੁੰਦੇ ਹਨ, ਜਿੱਥੇ ਨਿਰਣੇ ਵਿੱਚ ਇੱਕ ਛੋਟਾ ਫਰਕ ਵਾਜਬ ਤੌਰ ’ਤੇ ਸਕੋਰ ਨੂੰ ਇੱਕ ਜਾਂ ਦੂਜੇ ਪਾਸੇ ਝੁਕਾ ਦਿੰਦਾ ਹੈ।

ਇਹ ਇਕਸਾਰਤਾ ਇੱਕ ਖਾਸ ਡਿਜ਼ਾਈਨ ਫੈਸਲੇ ਤੋਂ ਆਉਂਦੀ ਹੈ। ਇੰਜਣ ਦੇ ਦੋਵੇਂ ਗ੍ਰੇਡਰਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ਹਰ ਜਵਾਬ ’ਤੇ ਤਿੰਨ ਵਾਰ ਵੋਟ ਕਰਦਾ ਹੈ, ਅਤੇ ਵਿਚਕਾਰਲੀ ਵੋਟ ਰੱਖੀ ਜਾਂਦੀ ਹੈ। ਜਦੋਂ ਅਸੀਂ ਤਿੰਨ ਦੀ ਥਾਂ ਇੱਕ ਹੀ ਵੋਟ ਨਾਲ ਉਹੀ ਸੰਰਚਨਾ ਟੈਸਟ ਕੀਤੀ, ਰਨ-ਦਰ-ਰਨ ਇੱਕੋ ਜਿਹੇ ਸਕੋਰ 87.5% ਤੋਂ ਡਿੱਗ ਕੇ 77% ਹੋ ਗਏ, ਅਤੇ ਦੋ ਜਾਂ ਵੱਧ ਪੁਆਇੰਟਾਂ ਨਾਲ ਬਦਲਣ ਵਾਲੇ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਦੁੱਗਣੇ ਤੋਂ ਵੀ ਵੱਧ ਹੋ ਗਿਆ। ਵੋਟਿੰਗ ਨੇ ਸ਼ੁੱਧਤਾ ਦੇ ਅੰਕੜੇ ਨੂੰ ਨਹੀਂ ਬਦਲਿਆ। ਇਸ ਨੇ ਇਹ ਬਦਲ ਦਿੱਤਾ ਕਿ ਸ਼ੁੱਧਤਾ ਦੇ ਅੰਕੜੇ ਦਾ ਕੋਈ ਮਤਲਬ ਹੈ ਜਾਂ ਨਹੀਂ।

ਤੁਹਾਡੇ ਲਈ, ਇਕਸਾਰਤਾ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਤੁਹਾਡੇ ਸਕੋਰ ਵਿੱਚ ਬਦਲਾਅ ਤੁਹਾਡੀ ਸਪੀਕਿੰਗ ਵਿੱਚ ਬਦਲਾਅ ਹੈ। ਜੇ ਤੁਸੀਂ ਇੱਕ ਹਫ਼ਤੇ ਵਿੱਚ ਇੱਕੋ ਟਾਸਕ ਕਿਸਮ ਤਿੰਨ ਵਾਰ ਰਿਕਾਰਡ ਕਰਦੇ ਹੋ ਅਤੇ ਸਕੋਰ 8 ਤੋਂ 10 ਹੋ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਸ ਦਾ ਮਤਲਬ ਇਹ ਨਹੀਂ ਕਿ ਗ੍ਰੇਡਰ ਦਾ ਦਿਨ ਵਧੀਆ ਸੀ। ਇਹ ਤੁਸੀਂ ਹੋ।

ਇਹ ਉਨ੍ਹਾਂ ਵਿਕਲਪਾਂ ਨਾਲ ਕਿਵੇਂ ਤੁਲਨਾ ਕਰਦਾ ਹੈ ਜੋ ਤੁਸੀਂ ਸ਼ਾਇਦ ਇਸ ਦੀ ਥਾਂ ਵਰਤਦੇ ਹੋ

ਇੱਕ ਸ਼ੁੱਧਤਾ ਦਾ ਅੰਕੜਾ ਕਿਸੇ ਤੁਲਨਾ ਦੇ ਨਾਲ ਵੱਧ ਮਤਲਬ ਰੱਖਦਾ ਹੈ। ਤਾਂ ਅਸੀਂ ਉਹੀ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ਨੂੰ ਉਨ੍ਹਾਂ ਜਨਰਲ-ਪਰਪਸ AI ਮਾਡਲਾਂ ਵਿੱਚੋਂ ਲੰਘਾਇਆ ਜਿਨ੍ਹਾਂ ਨੂੰ ਲੋਕ ਅਸਲ ਵਿੱਚ ਆਪਣੀ ਪ੍ਰੈਕਟਿਸ ਗਰੇਡ ਕਰਨ ਲਈ ਵਰਤਦੇ ਹਨ, ਉਸੇ ਤਰ੍ਹਾਂ ਜਿਵੇਂ ਇੱਕ ਵਿਅਕਤੀ ਕਰਦਾ: ਅਸੀਂ ਹਰ ਮਾਡਲ ਨੂੰ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਅਤੇ ਟਾਸਕ ਦਿੱਤਾ, ਇਸ ਨੂੰ ਦੱਸਿਆ ਕਿ ਇਹ ਇੱਕ ਤਜਰਬੇਕਾਰ CELPIP ਪਰੀਖਿਅਕ ਹੈ, ਅਤੇ 0 ਤੋਂ 12 ਦੇ ਵਿਚਕਾਰ ਸਕੋਰ ਮੰਗਿਆ। ਹਰ ਮਾਡਲ ਦੀਆਂ ਤਿੰਨ ਰਨਾਂ, ਔਸਤ ਕੱਢੀ ਗਈ।

ਤਸਦੀਕਸ਼ੁਦਾ ਬੈਂਡ ਦੇ ਅੰਦਰ ਸਕੋਰ ਕੀਤੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ

ਉਹੀ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ। ਹਰ ਮਾਡਲ ਨੂੰ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। Engine 2.0 ਆਪਣੀ ਆਮ ਪ੍ਰੋਡਕਸ਼ਨ ਸੰਰਚਨਾ ਵਿੱਚ ਚਲਾਇਆ ਗਿਆ।

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Engine 2.0 ਹਰ ਮਾਡਲ ਤੋਂ ਉੱਨੀ ਤੋਂ ਇਕਵੰਜਾ ਪੁਆਇੰਟਾਂ ਵਿਚਕਾਰ ਅੱਗੇ ਹੈ। ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ, ਹਰ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲ ਸਖ਼ਤੀ ਨਾਲ ਗਰੇਡ ਕਰਦਾ ਹੈ: ਕਮਜ਼ੋਰ ਜਵਾਬ ’ਤੇ ਖੁੰਝ ਆਮ ਤੌਰ ’ਤੇ 3 ਹੁੰਦੀ ਹੈ, ਮਜ਼ਬੂਤ ਜਵਾਬ ’ਤੇ ਖੁੰਝ 7 ਜਾਂ 8। Claude Opus 5 ਅਤੇ Gemini ਹੀ ਸਿਰਫ਼ ਦੋ ਮਾਡਲ ਹਨ ਜੋ ਅੱਧੇ ਤੋਂ ਉੱਪਰ ਹਨ। ਤਿੰਨ ਵੱਡੇ GPT ਮਾਡਲ 31% ਤੋਂ 37% ਵਿਚਕਾਰ ਹਨ, ਅਤੇ ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬ ਨੂੰ 13% ਤੋਂ 27% ਵਾਰ ਪਛਾਣਦੇ ਹਨ।

ਫਿਰ ਅਸੀਂ ਹਰ ਮਾਡਲ ਨੂੰ ਆਪਣੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦਿੱਤੀ: ਉਸ ਖਾਸ ਟਾਸਕ ਲਈ ਉਹੀ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ, ਉਹੀ ਜ਼ਬਰੀ ਤੁਲਨਾ, ਅਤੇ ਇਸ ਦੀਆਂ ਆਪਣੀਆਂ ਰੁਝਾਨਾਂ ਮੁਤਾਬਕ ਟਿਊਨ ਕੀਤਾ ਇੱਕ ਛੋਟਾ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਨੋਟ। ਇਹ ਉਹ ਸਭ ਤੋਂ ਵਧੀਆ ਨਤੀਜਾ ਹੈ ਜੋ ਹਰ ਮਾਡਲ ਸਾਡੇ ਹੱਥਾਂ ਵਿੱਚ ਹਾਸਲ ਕਰ ਸਕਿਆ, ਅਤੇ ਇਹ ਕੁਝ ਅਜਿਹਾ ਨਹੀਂ ਹੈ ਜੋ ਕੋਈ ਵਿਦਿਆਰਥੀ ਉਨ੍ਹਾਂ ਉਦਾਹਰਣਾਂ ਤੋਂ ਬਿਨਾਂ ਦੁਹਰਾ ਸਕੇ। Opus 5 ਵਧ ਕੇ 77% ਤੱਕ ਪਹੁੰਚਿਆ, GPT 5.6 sol ਅਤੇ Gemini 71% ਤੱਕ, GPT 5.5 ਅਤੇ Sonnet 5 69% ਤੱਕ, luna 63% ਤੱਕ ਅਤੇ GPT-4o mini 50% ਤੱਕ। ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ਫਿਰ ਵੀ Engine 2.0 ਤੋਂ ਪਿੱਛੇ ਰਿਹਾ, ਅਤੇ ਕਿਸੇ ਨੇ ਵੀ 63% ਤੋਂ ਵੱਧ ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬ ਨਹੀਂ ਪਛਾਣੇ।

ਤੁਹਾਡੇ ਫੀਡਬੈਕ ਵਿੱਚ ਕੀ ਨਵਾਂ ਹੈ

Engine 2.0 ਦੇ ਨਾਲ ਇੱਕ ਨਵੀਂ ਬਣਾਈ ਗਈ ਫੀਡਬੈਕ ਲੇਅਰ ਆਉਂਦੀ ਹੈ। ਇਹ ਸਿਰਫ਼ ਸਕੋਰ ਨਹੀਂ ਸਗੋਂ ਦੋਵੇਂ ਗ੍ਰੇਡਰਾਂ ਦੇ ਸਬੂਤ ਨੂੰ ਪੜ੍ਹਦੀ ਹੈ, ਅਤੇ ਇਸ ਨੂੰ ਤਿੰਨ ਤਰ੍ਹਾਂ ਦੇ ਵਿਦਿਆਰਥੀਆਂ 'ਤੇ ਪਰਖਿਆ ਗਿਆ: ਪਹਿਲੀ ਵਾਰ CELPIP ਦੇਣ ਵਾਲਾ ਕੋਈ, ਕਮਜ਼ੋਰ ਅੰਗਰੇਜ਼ੀ ਵਾਲਾ ਕੋਈ ਜੋ ਬਸ ਤਰੀਕਾ ਲੱਭ ਰਿਹਾ ਹੈ, ਅਤੇ ਕੋਈ ਜਿਸ ਕੋਲ ਦਿਨ ਵਿੱਚ ਅੱਧਾ ਘੰਟਾ ਹੈ ਤੇ ਅਗਲੇ ਹਫ਼ਤੇ ਟੈਸਟ ਹੈ। ਇਹ ਹੈ ਜੋ ਬਦਲਿਆ।

  • ਤੁਹਾਡੇ ਆਪਣੇ ਸ਼ਬਦ, ਦੁਬਾਰਾ ਦਿਖਾਏ ਗਏ. ਫੀਡਬੈਕ ਦਾ ਹਰ ਨੁਕਤਾ ਤੁਹਾਡੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਾ ਉਹੀ ਵਾਕੰਸ਼ ਦੱਸਦਾ ਹੈ ਜਿਸ 'ਤੇ ਗ੍ਰੇਡਰਾਂ ਨੇ ਪ੍ਰਤੀਕਿਰਿਆ ਦਿੱਤੀ। ਜੇ ਕੋਈ ਵਾਕੰਸ਼ ਕੋਟੇਸ਼ਨ ਨਿਸ਼ਾਨਾਂ ਵਿੱਚ ਹੈ, ਤਾਂ ਇਹ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਕਾਪੀ ਕੀਤਾ ਗਿਆ ਹੈ; ਸਾਡੀ ਪੜਤਾਲ ਵਿੱਚ 158 ਵਿੱਚੋਂ 157 ਕੋਟ ਇਸੇ ਤਰ੍ਹਾਂ ਸਨ। ਫੀਡਬੈਕ ਕਦੇ ਵੀ ਕੋਈ ਅਜਿਹੀ ਗੱਲ ਨਹੀਂ ਬਣਾਉਂਦਾ ਜੋ ਤੁਸੀਂ ਕਹੀ ਹੀ ਨਹੀਂ।
  • ਪਹਿਲਾਂ ਠੀਕ ਕਰਨ ਵਾਲੀ ਇੱਕ ਗੱਲ. ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਹੀ ਸਭ ਤੋਂ ਵੱਡੀ ਸਲਾਹ ਮਿਲਦੀ ਹੈ: ਉਹ ਇੱਕ ਤਬਦੀਲੀ ਜੋ ਤੁਹਾਡੇ ਸਕੋਰ ਨੂੰ ਸਭ ਤੋਂ ਵੱਧ ਵਧਾਏਗੀ, ਸਭ ਤੋਂ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਲਿਖੀ ਹੋਈ। ਇਸ ਦੇ ਬਾਅਦ ਦੋ ਹੋਰ ਠੋਸ ਕਦਮ ਆਉਂਦੇ ਹਨ, ਫਿਰ ਬੋਲਣਾ ਸ਼ੁਰੂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਮਨ ਵਿੱਚ ਦੁਹਰਾਉਣ ਲਈ ਤਿੰਨ-ਨੁਕਾਤੀ ਚੈੱਕਲਿਸਟ।
  • ਟਾਸਕ ਦੇ ਮੁਤਾਬਕ ਸਲਾਹ. ਸਲਾਹ ਦੇਣਾ, ਕਿਸੇ ਦ੍ਰਿਸ਼ ਦਾ ਵਰਣਨ ਕਰਨਾ ਅਤੇ ਕਿਸੇ ਨੂੰ ਮਨਾਉਣਾ — ਇਹਨਾਂ ਸਭ ਦਾ ਸਕੋਰ ਵੱਖ-ਵੱਖ ਗੱਲਾਂ 'ਤੇ ਹੁੰਦਾ ਹੈ। ਫੀਡਬੈਕ ਨੂੰ ਹੁਣ ਪਤਾ ਹੈ ਕਿ ਅੱਠ ਟਾਸਕ ਕਿਸਮਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ਕਿਸ ਗੱਲ ਦਾ ਇਨਾਮ ਦਿੰਦੀ ਹੈ, ਅਤੇ ਉਸੇ ਮੁਤਾਬਕ ਗੱਲ ਕਰਦਾ ਹੈ, ਸਾਰੇ ਟਾਸਕਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹੀਆਂ ਆਮ ਟਿਪਸ ਦੁਹਰਾਉਣ ਦੀ ਥਾਂ।
  • ਪਹਿਲਾਂ ਕਿਸ ਪਹਿਲੂ ਦਾ ਅਭਿਆਸ ਕਰਨਾ ਹੈ. ਫੀਡਬੈਕ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਕਿਹੜਾ ਤੁਹਾਡਾ ਸਭ ਤੋਂ ਕਮਜ਼ੋਰ ਹੈ ਅਤੇ ਕਿਹੜਾ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ, ਤਾਂ ਜੋ ਤੁਹਾਨੂੰ ਪਤਾ ਹੋਵੇ ਕਿ ਅਗਲਾ ਅੰਕ ਕਿੱਥੇ ਹੈ, ਬਿਨਾਂ ਇਸ ਨੂੰ ਕਿਸੇ ਨੰਬਰ ਪਿੱਛੇ ਲੁਕਾਏ।
  • ਟਾਸਕ ਨੇ ਕੀ ਮੰਗਿਆ ਅਤੇ ਤੁਸੀਂ ਕੀ ਛੱਡਿਆ. ਟਾਸਕ ਪੂਰਤੀ ਵਿੱਚ, ਫੀਡਬੈਕ ਉਹ ਖਾਸ ਹਿੱਸੇ ਸੂਚੀਬੱਧ ਕਰਦਾ ਹੈ ਜਿਹੜੇ ਪ੍ਰੌਂਪਟ ਦੇ ਤੁਸੀਂ ਕਵਰ ਨਹੀਂ ਕੀਤੇ, ਜਾਂ ਸਾਫ਼ ਕਹਿ ਦਿੰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਉਹ ਸਭ ਕਵਰ ਕਰ ਲਏ ਹਨ।
  • ਗੱਲਾਂ ਜਿਹਨਾਂ ਦੀ ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਰਿਹਰਸਲ ਕਰ ਸਕਦੇ ਹੋ. ਹਰ 'ਕਿਵੇਂ ਕਰੀਏ' ਸਲਾਹ ਕੁਝ ਅਜਿਹਾ ਹੈ ਜੋ ਤੁਸੀਂ ਆਪਣੀ ਅਗਲੀ ਕੋਸ਼ਿਸ਼ ਤੋਂ ਪਹਿਲਾਂ ਉੱਚੀ ਆਵਾਜ਼ ਵਿੱਚ ਬੋਲ ਸਕਦੇ ਹੋ। ਵੱਧ ਸਪਸ਼ਟ ਬੋਲਣ ਜਾਂ ਆਪਣਾ ਲਹਿਜਾ ਘਟਾਉਣ ਦੀ ਕੋਈ ਸਲਾਹ ਨਹੀਂ ਦਿੱਤੀ ਜਾਂਦੀ: ਲਹਿਜਾ ਉਹ ਚੀਜ਼ ਨਹੀਂ ਜਿਸ ਨੂੰ ਸੁਣਨਯੋਗਤਾ ਮਾਪਦੀ ਹੈ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ 'ਤੇ ਕਦੇ ਟਿੱਪਣੀ ਨਹੀਂ ਕਰਦਾ।
  • ਟਾਈਮਰ ਲਈ ਕੋਈ ਦੋਸ਼ ਨਹੀਂ. ਜੇ ਕੋਈ ਜਵਾਬ ਟਾਸਕ ਪੂਰਾ ਕਰ ਲੈਣ ਤੋਂ ਬਾਅਦ ਸਮੇਂ ਦੀ ਵਜ੍ਹਾ ਨਾਲ ਵਿੱਚੋਂ ਕੱਟਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਸ ਕੱਟ ਦੇ ਲਈ ਸਕੋਰ ਨਹੀਂ ਘਟਾਇਆ ਜਾਂਦਾ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਝਾੜ ਨਹੀਂ ਪਾਉਂਦਾ।

ਜਦੋਂ ਇੱਕ ਸੁਤੰਤਰ ਨਿਰਣਾਇਕ ਮਾਡਲ ਨੇ ਇਸ ਫੀਡਬੈਕ ਦੀ ਤੁਲਨਾ ਉਸ ਨਾਲ ਕੀਤੀ ਜੋ ਸਾਡੇ ਪਿਛਲੇ ਸਿਸਟਮ ਨੇ ਇਹਨਾਂ ਹੀ ਜਵਾਬਾਂ ਲਈ ਦਿੱਤਾ ਸੀ, ਬਿਨਾਂ ਇਹ ਜਾਣੇ ਕਿ ਕਿਹੜਾ ਕਿਹੜਾ ਹੈ, ਇਸ ਨੇ 24 ਵਿੱਚੋਂ 20 ਤੁਲਨਾਵਾਂ ਵਿੱਚ ਨਵੇਂ ਫੀਡਬੈਕ ਨੂੰ ਪਹਿਲ ਦਿੱਤੀ, ਭਾਵੇਂ ਇਹ ਇੱਕ ਪ੍ਰੀਖਿਅਕ ਵਾਂਗ ਨਿਰਣਾ ਕਰ ਰਿਹਾ ਹੋਵੇ ਜਾਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਵਾਂਗ।

ਆਪਣਾ ਸਕੋਰ ਕਿਵੇਂ ਪੜ੍ਹਨਾ ਹੈ

  1. 4 ਜਾਂ 5 ਲਗਭਗ ਯਕੀਨੀ ਤੌਰ ’ਤੇ ਸਹੀ ਹੁੰਦਾ ਹੈ। ਇੰਜਣ 88% ਵਾਰ ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ਨੂੰ ਪਛਾਣ ਲੈਂਦਾ ਹੈ, ਅਤੇ ਜਦੋਂ ਇਹ 4 ਜਾਂ 5 ਕਹਿੰਦਾ ਹੈ, ਤਾਂ ਇਹ 93% ਵਾਰ ਸਹੀ ਹੁੰਦਾ ਹੈ। ਫੀਡਬੈਕ ਪੜ੍ਹੋ ਇਹ ਦੇਖਣ ਲਈ ਕਿ ਕਿਹੜਾ ਪਹਿਲੂ ਸਭ ਤੋਂ ਘੱਟ ਹੈ ਅਤੇ ਉਸ ’ਤੇ ਕੰਮ ਕਰੋ।
  2. 10 ਅਸਲ ਵਿੱਚ 10 ਹੁੰਦਾ ਹੈ। ਜਦੋਂ ਇੰਜਣ 10 ਕਹਿੰਦਾ ਹੈ, ਤਾਂ ਜਵਾਬ 92% ਵਾਰ ਟੌਪ ਪੱਧਰ ’ਤੇ ਸੀ। ਤੁਸੀਂ ਉਸ ਟਾਸਕ ਕਿਸਮ ’ਤੇ ਤਿਆਰ ਹੋ। ਉਨ੍ਹਾਂ ਵੱਲ ਵਧੋ ਜਿਨ੍ਹਾਂ ਤੋਂ ਤੁਸੀਂ ਬਚਦੇ ਹੋ।
  3. 8 ਇੱਕ ਸਵਾਲ ਹੈ। ਦੋ-ਤਿਹਾਈ ਵਾਰ ਇਸ ਦਾ ਮਤਲਬ ਮੱਧ ਹੁੰਦਾ ਹੈ। ਚਾਰ ਵਿੱਚੋਂ ਇੱਕ ਵਾਰ ਇਸ ਦਾ ਮਤਲਬ ਟੌਪ ਹੁੰਦਾ ਹੈ। ਉਹੀ ਟਾਸਕ ਦੁਬਾਰਾ ਰਿਕਾਰਡ ਕਰੋ ਅਤੇ ਕੋਸ਼ਿਸ਼ਾਂ ਦੇ ਪੈਟਰਨ ਨੂੰ ਦੇਖੋ।
  4. ਪੱਧਰਾਂ ਨਾਲੋਂ ਬਦਲਾਵਾਂ ’ਤੇ ਵੱਧ ਭਰੋਸਾ ਕਰੋ। ਕਿਉਂਕਿ ਸਕੋਰ ਸਥਿਰ ਹੈ, ਕੋਸ਼ਿਸ਼ਾਂ ਵਿਚਕਾਰ ਬਦਲਾਅ ਤੁਹਾਡੀ ਸਪੀਕਿੰਗ ਵਿੱਚ ਬਦਲਾਅ ਹੈ। ਇੱਕੋ ਟਾਸਕ ਕਿਸਮ ਨੂੰ ਦੁਹਰਾਉਣਾ ਇਹ ਜਾਣਨ ਦਾ ਸਭ ਤੋਂ ਤੇਜ਼ ਤਰੀਕਾ ਹੈ ਕਿ ਕੋਈ ਨਵੀਂ ਆਦਤ ਕੰਮ ਕਰ ਰਹੀ ਹੈ ਜਾਂ ਨਹੀਂ।
  5. ਹਵਾਲੇ ਪੜ੍ਹੋ। ਤੁਹਾਡੀ ਫੀਡਬੈਕ ਵਿੱਚ ਦਿੱਤੇ ਹਵਾਲੇ ਉਹੀ ਹਨ ਜਿਨ੍ਹਾਂ ’ਤੇ ਗ੍ਰੇਡਰਾਂ ਨੇ ਪ੍ਰਤੀਕਿਰਿਆ ਦਿੱਤੀ। ਇਹੀ ਉਹ ਖਾਸ ਸ਼ਬਦ ਹਨ ਜਿਨ੍ਹਾਂ ਨੂੰ ਬਦਲਣਾ ਹੈ।

ਅਕਸਰ ਪੁੱਛੇ ਜਾਂਦੇ ਸਵਾਲ

Prepamigo ਦਾ ਸਪੀਕਿੰਗ ਸਕੋਰ ਕਿੰਨਾ ਸਹੀ ਹੈ? ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰਾਂ ਵਾਲੇ 48 ਅਣਦੇਖੇ ਜਵਾਬਾਂ ’ਤੇ: ਸਹੀ ਪੱਧਰ ’ਤੇ 81%, ਇੱਕ ਪੁਆਇੰਟ ਦੇ ਅੰਦਰ 92%, ਤਿੰਨ ਰਨਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ। ਬੈਂਡ ਅਨੁਸਾਰ: ਹੇਠਲਾ 88%, ਮੱਧ 85%, ਟੌਪ 71%।

ਕੀ ਇਹ ਮੇਰੇ ਅਸਲ ਸਕੋਰ ਦੇ ਬਰਾਬਰ ਹੈ? ਕੋਈ ਵੀ ਪ੍ਰੈਕਟਿਸ ਟੂਲ ਇਹ ਵਾਅਦਾ ਨਹੀਂ ਕਰ ਸਕਦਾ। ਅਸੀਂ ਜੋ ਮਾਪਦੇ ਹਾਂ ਉਹ ਇਹ ਹੈ ਕਿ ਇੰਜਣ ਕਿੰਨੀ ਵਾਰ ਉਸੇ ਜਵਾਬ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਨਾਲ ਸਹਿਮਤ ਹੁੰਦਾ ਹੈ। ਆਪਣੇ ਸਕੋਰ ਨੂੰ ਇੱਕ ਦਿਸ਼ਾ ਵਾਲੇ ਪੱਧਰ ਵਾਂਗ ਪੜ੍ਹੋ, ਅਤੇ ਕੋਸ਼ਿਸ਼ਾਂ ਦੇ ਪੈਟਰਨ ਨੂੰ ਦੇਖੋ।

ਮੈਨੂੰ ਉਸ ਜਵਾਬ ’ਤੇ 8 ਕਿਉਂ ਮਿਲਿਆ ਜਿਸ ਨੂੰ ਮੈਂ ਸ਼ਾਨਦਾਰ ਸਮਝਿਆ ਸੀ? ਇਹ ਇੰਜਣ ਦੀ ਸਭ ਤੋਂ ਵੱਡੀ ਬਾਕੀ ਬਚੀ ਗਲਤੀ ਹੈ: ਚਾਰ ਵਿੱਚੋਂ ਇੱਕ 8 ਅਸਲ ਵਿੱਚ 10 ਹੁੰਦਾ ਹੈ। ਉਹੀ ਟਾਸਕ ਦੁਬਾਰਾ ਰਿਕਾਰਡ ਕਰੋ। ਕੋਸ਼ਿਸ਼ਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ 10 ਆਉਣਾ, 10 ਹੀ ਹੈ।

ਕੀ ਇੱਕੋ ਰਿਕਾਰਡਿੰਗ ਨੂੰ ਦੁਬਾਰਾ ਇੱਕੋ ਸਕੋਰ ਮਿਲੇਗਾ? ਤਿੰਨ ਰਨਾਂ ਵਿੱਚ 87.5% ਇੱਕੋ ਜਿਹਾ; ਸਿਰਫ਼ 4.2% ਦੋ ਜਾਂ ਵੱਧ ਪੁਆਇੰਟਾਂ ਨਾਲ ਬਦਲੇ, ਸਾਰੇ ਬੈਂਡ ਦੀਆਂ ਸੀਮਾਵਾਂ ’ਤੇ।

ਇੰਜਣ ਕਦਮ-ਦਰ-ਕਦਮ ਕਿਵੇਂ ਕੰਮ ਕਰਦਾ ਹੈ ਇਹ ਦੇਖਣ ਲਈ, ਪੜ੍ਹੋ Scoring Engine 2.0 ਦੇ ਅੰਦਰ। GPT, Claude ਅਤੇ Gemini ’ਤੇ ਉਹੀ ਟੈਸਟ ਕਿਵੇਂ ਰਿਹਾ, ਇਹ ਦੇਖਣ ਲਈ, ਪੜ੍ਹੋ ਕਿਹੜਾ AI CELPIP ਸਪੀਕਿੰਗ ਨੂੰ ਸਭ ਤੋਂ ਸਹੀ ਸਕੋਰ ਕਰਦਾ ਹੈ ਜਾਂ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰੋ ਅਤੇ ਖੁਦ ਆਪਣੇ ਲਈ ਅੰਕੜੇ ਦੇਖੋ। ਇਹ ਗਾਈਡ ਅੰਗਰੇਜ਼ੀ ਵਿੱਚ ਪੜ੍ਹੋ

ਕੀ Prepamigo ਦੀ CELPIP ਸਪੀਕਿੰਗ ਸਕੋਰਿੰਗ ਸਹੀ ਹੈ? ਅੰਕੜੇ, ਇਮਾਨਦਾਰੀ ਨਾਲ | PrepAmigo