ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ
48 ਹੋਲਡ-ਆਊਟ ਸਪੀਕਿੰਗ ਜਵਾਬ, ਹਰ ਬੈਂਡ 'ਤੇ 16। ਹਰ GPT ਮਾਡਲ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਿੱਤੀ ਗਈ ਅਤੇ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ CELPIP ਸਕੇਲ 'ਤੇ ਇਸ ਨੂੰ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। Engine 2.0 ਆਪਣੀ ਆਮ ਪ੍ਰੋਡਕਸ਼ਨ ਸੰਰਚਨਾ ਵਿੱਚ ਚਲਾਇਆ ਗਿਆ।
81%
Prepamigo Engine 2.0
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Prepamigo ਬਨਾਮ ਟੌਪ ਚੈਟਬੋਟ ਪਲਾਨ
ਕੈਨੇਡੀਅਨ ਡਾਲਰ ਵਿੱਚ। Prepamigo ਦੀਆਂ ਕੀਮਤਾਂ ਵਿੱਚ ਟੈਕਸ ਸ਼ਾਮਲ ਹੈ। Claude Max (US$100 ਤੋਂ ਸ਼ੁਰੂ) ਅਤੇ ChatGPT Pro (US$200) ਨੂੰ 1.38 ਦੀ ਦਰ ਨਾਲ ਬਦਲਿਆ ਗਿਆ ਹੈ, ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ। ਸ਼ੁੱਧਤਾ ਉਹਨਾਂ ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤਾ ਗਿਆ ਜਦੋਂ ਦੱਸੇ ਗਏ ਮਾਡਲ ਨੂੰ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਜਵਾਬ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।
ChatGPT ਸ਼ਾਇਦ ਸਭ ਤੋਂ ਆਮ ਟੂਲ ਹੈ ਜੋ CELPIP ਉਮੀਦਵਾਰ ਆਪਣੀ ਸਪੀਕਿੰਗ ਪ੍ਰੈਕਟਿਸ ਨੂੰ ਗਰੇਡ ਕਰਨ ਲਈ ਵਰਤਦੇ ਹਨ। ਇਹ ਹਰ ਕਿਸੇ ਦੇ ਫੋਨ ’ਤੇ ਹੈ, ਇਹ ਸਕਿੰਟਾਂ ਵਿੱਚ ਜਵਾਬ ਦਿੰਦਾ ਹੈ, ਅਤੇ ਇਹ ਖੁਸ਼ੀ ਨਾਲ ਦੱਸਦਾ ਹੈ ਕਿ ਤੁਹਾਡਾ ਜਵਾਬ ਕਿਸ ਪੱਧਰ ਦਾ ਸੀ। ਇਸ ਲੇਖ ਦਾ ਜਵਾਬ ਇਹ ਹੈ ਕਿ ਕੀ ਇਹ ਜੋ ਪੱਧਰ ਦੱਸਦਾ ਹੈ, ਉਹੀ ਪੱਧਰ ਤੁਹਾਨੂੰ ਅਸਲ ਵਿੱਚ ਮਿਲੇਗਾ। ਅਸੀਂ ਟੈਸਟ ਉਸੇ ਤਰ੍ਹਾਂ ਚਲਾਇਆ ਜਿਵੇਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਚਲਾਉਂਦਾ: ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਪੇਸਟ ਕਰੋ, ਸਕੋਰ ਮੰਗੋ, ਅਤੇ ਗਿਣੋ।
ਛੋਟਾ ਜਵਾਬ: 48 ਸਪੀਕਿੰਗ ਜਵਾਬਾਂ ’ਤੇ ਜੋ ਕਿਸੇ ਵੀ ਸਿਸਟਮ ਨੇ ਨਹੀਂ ਦੇਖੇ ਸਨ, ਹਰੇਕ ਦਾ ਇੱਕ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਸੀ, Prepamigo Scoring Engine 2.0 ਨੇ 81% ਵਾਰ ਸਹੀ ਪੱਧਰ ’ਤੇ ਸਕੋਰ ਦਿੱਤਾ। ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਪੁੱਛਣ ’ਤੇ, GPT 5.6 sol, ChatGPT ਦੇ ਪੇਡ ਪਲਾਨਾਂ ਪਿੱਛੇ ਦਾ ਮਾਡਲ, ਨੇ 35% ਵਾਰ ਸਹੀ ਪੱਧਰ ’ਤੇ ਸਕੋਰ ਦਿੱਤਾ। GPT 5.5 ਨੇ 37%, GPT 5.6 luna ਨੇ 31%, ਅਤੇ GPT-4o mini ਨੇ 45% ਹਾਸਲ ਕੀਤਾ, ਇੱਕ ਅੰਕੜਾ ਜੋ ਅਸਲ ਨਾਲੋਂ ਬਿਹਤਰ ਦਿਖਦਾ ਹੈ, ਕਿਉਂਕਿ ਇਹ ਮਾਡਲ ਲਗਭਗ ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਹੈ ਅਤੇ ਇਸ ਲਈ ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ਨੂੰ ਸਹੀ ਪਾ ਲੈਂਦਾ ਹੈ।
ਫਿਰ ਅਸੀਂ ਉਹ ਕੀਤਾ ਜੋ ਜ਼ਿਆਦਾਤਰ ਤੁਲਨਾਵਾਂ ਛੱਡ ਦਿੰਦੀਆਂ ਹਨ। ਅਸੀਂ ਹਰ GPT ਮਾਡਲ ਨੂੰ ਆਪਣੀ ਗਰੇਡਿੰਗ ਪ੍ਰਕਿਰਿਆ ਦਿੱਤੀ, ਹਰ ਟਾਸਕ ਲਈ ਅਸਲ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਅਤੇ ਉਨ੍ਹਾਂ ਨਾਲ ਇੱਕ ਜ਼ਬਰੀ ਤੁਲਨਾ ਸਮੇਤ, ਇਹ ਦੇਖਣ ਲਈ ਕਿ ਇਹ ਕਿੰਨਾ ਵਧੀਆ ਹੋ ਸਕਦਾ ਹੈ। GPT 5.6 sol 71% ਤੱਕ, GPT 5.5 69% ਤੱਕ, luna 63% ਤੱਕ ਅਤੇ GPT-4o mini 50% ਤੱਕ ਵਧਿਆ। ਚਾਰੇ ਫਿਰ ਵੀ Engine 2.0 ਤੋਂ ਪਿੱਛੇ ਰਹੇ, ਅਤੇ ਚਾਰੇ ਟੌਪ-ਲੈਵਲ ਜਵਾਬਾਂ ’ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਸੰਘਰਸ਼ ਕਰਦੇ ਰਹੇ। ਇਸ ਲੇਖ ਦਾ ਬਾਕੀ ਹਿੱਸਾ ਦੋਵੇਂ ਟੈਸਟਾਂ, ਹਰ ਸਕੋਰ ਪੱਧਰ ’ਤੇ ਨਤੀਜੇ, ਇੱਕ ਜਨਰਲ-ਪਰਪਸ ਅਸਿਸਟੈਂਟ ਸਕੇਲ ਦੇ ਵਿਚਕਾਰ ਵੱਲ ਕਿਉਂ ਖਿਸਕਦਾ ਹੈ, ਹਰ ਪਾਸੇ ਰੋਜ਼ਾਨਾ ਵਰਕਫਲੋ ਕਿਵੇਂ ਦਿਖਦਾ ਹੈ, ਅਤੇ ਜੇ ਤੁਸੀਂ ਗੰਭੀਰਤਾ ਨਾਲ ਪ੍ਰੈਕਟਿਸ ਕਰਨ ਦਾ ਇਰਾਦਾ ਰੱਖਦੇ ਹੋ ਤਾਂ ਹਰ ਵਿਕਲਪ ਦੀ ਕੀਮਤ ਕਿੰਨੀ ਹੈ, ਇਸ ਬਾਰੇ ਵਿਸਥਾਰ ਵਿੱਚ ਦੱਸਦਾ ਹੈ।
ਸਾਦਾ ਟੈਸਟ: ਇੱਕ ਵਿਦਿਆਰਥੀ ਨੂੰ ਅਸਲ ਵਿੱਚ ਕੀ ਮਿਲਦਾ ਹੈ
ਇਕਾਸੀ ਪ੍ਰਤੀਸ਼ਤ ਬਨਾਮ ਪੈਂਤੀ। 48-ਜਵਾਬ ਟੈਸਟ ਵਿੱਚ, ਇਹ Engine 2.0 ਲਈ GPT 5.6 sol ਨਾਲੋਂ ਬਾਈਸ ਵਾਧੂ ਸਹੀ ਸਕੋਰ ਹਨ। ਦੂਜੇ ਸ਼ਬਦਾਂ ਵਿੱਚ, Engine 2.0 GPT 5.6 sol ਨਾਲੋਂ 71% ਘੱਟ, GPT 5.5 ਨਾਲੋਂ 70% ਘੱਟ, GPT 5.6 luna ਨਾਲੋਂ 73% ਘੱਟ ਅਤੇ GPT-4o mini ਨਾਲੋਂ 66% ਘੱਟ ਸਕੋਰਿੰਗ ਗਲਤੀਆਂ ਕਰਦਾ ਹੈ।
ਸਾਦੇ ਟੈਸਟ ਦੇ ਤਿੰਨ ਵੱਖਰੇ ਰਨਾਂ ਨੇ GPT 5.6 sol ਨੂੰ 31%, 40% ਅਤੇ 35%, ਅਤੇ GPT 5.5 ਨੂੰ 35%, 42% ਅਤੇ 33% ਦਿੱਤਾ। ਰਨਾਂ ਵਿਚਕਾਰ ਇਹ ਫੈਲਾਅ ਆਪਣੇ ਆਪ ਵਿੱਚ ਇੱਕ ਖੋਜ ਹੈ: ChatGPT ਨੂੰ ਦੋ ਵੱਖ-ਵੱਖ ਦਿਨਾਂ ’ਤੇ ਇੱਕੋ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਗਰੇਡ ਕਰਨ ਲਈ ਕਹੋ ਅਤੇ ਤੁਹਾਨੂੰ, ਕਾਫ਼ੀ ਵਾਰ, ਦੋ ਵੱਖਰੇ ਸਕੋਰ ਮਿਲਣਗੇ। Engine 2.0 ਨੇ ਆਪਣੇ ਤਿੰਨੋਂ ਰਨਾਂ ਵਿੱਚ 81.3% ਸਕੋਰ ਕੀਤਾ।
ਫਰਕ ਕਿੱਥੇ ਖੁੱਲ੍ਹਦਾ ਹੈ: ਸਕੋਰ ਪੱਧਰ ਦਰ ਪੱਧਰ
ਇੱਕ ਸਮੁੱਚਾ ਅੰਕੜਾ ਇਹ ਲੁਕਾਉਂਦਾ ਹੈ ਕਿ ਗਲਤੀਆਂ ਕਿੱਥੇ ਹੁੰਦੀਆਂ ਹਨ। ਇੱਕ ਗ੍ਰੇਡਰ ਜੋ ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ’ਤੇ ਸ਼ਾਨਦਾਰ ਹੈ ਅਤੇ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ’ਤੇ ਬੇਕਾਰ ਹੈ, ਇੱਕ ਸ਼ੁਰੂਆਤੀ ਲਈ ਠੀਕ ਹੈ ਅਤੇ 10 ਦੀ ਭਾਲ ਕਰਨ ਵਾਲੇ ਲਈ ਸਰਗਰਮੀ ਨਾਲ ਨੁਕਸਾਨਦਾਇਕ ਹੈ। ਇਸ ਲਈ ਇਹ ਹਨ ਬੈਂਡ ਅਨੁਸਾਰ ਸਾਦੇ-ਟੈਸਟ ਦੇ ਨਤੀਜੇ।
ਹੇਠਲੇ-ਪੱਧਰ ਦੇ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 4 ਜਾਂ 5)
16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। ਜ਼ਿਆਦਾਤਰ ਗਲਤੀਆਂ 3 ਦਾ ਸਕੋਰ ਹਨ।
88%
Prepamigo Engine 2.0
75%
GPT-4o mini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ’ਤੇ, Engine 2.0 88% ’ਤੇ ਅੱਗੇ ਹੈ। GPT-4o mini 75% ’ਤੇ ਪਿੱਛੇ ਹੈ, ਜੋ ਇੱਕੋ ਥਾਂ ਹੈ ਜਿੱਥੇ ਇਸ ਦੀ ਘੱਟ ਸਕੋਰ ਦੇਣ ਦੀ ਆਦਤ ਇਸ ਦੇ ਹੱਕ ਵਿੱਚ ਕੰਮ ਕਰਦੀ ਹੈ। ਤਿੰਨ ਵੱਡੇ GPT ਮਾਡਲ 52% ਤੋਂ 54% ’ਤੇ ਹਨ: ਲਗਭਗ ਅੱਧੇ ਸਮੇਂ ਉਹ 4 ਜਾਂ 5 ਦੇ ਜਵਾਬ ਨੂੰ 3 ਸਕੋਰ ਕਰਦੇ ਹਨ, ਜੋ ਗਲਤ ਬੈਂਡ ਹੈ ਭਾਵੇਂ ਦਿਸ਼ਾ ਸਮਝਣਯੋਗ ਹੈ। ChatGPT ਨਾਲ ਗਰੇਡ ਕਰਨ ਵਾਲੇ ਸ਼ੁਰੂਆਤੀ ਨੂੰ ਲਗਭਗ ਅੱਧੇ ਸਮੇਂ ਦੱਸਿਆ ਜਾਵੇਗਾ ਕਿ ਉਹ ਅਸਲ ਵਿੱਚੋਂ ਵੱਧ ਕਮਜ਼ੋਰ ਹੈ।
ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 7 ਜਾਂ 8)
16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। ਗਲਤੀਆਂ ਲਗਭਗ ਸਾਰੀਆਂ 5 ਜਾਂ 6 ਹਨ।
85%
Prepamigo Engine 2.0
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
ਮੱਧ ਬੈਂਡ ਵਿੱਚ ਸਾਦੇ-ਪ੍ਰੌਮਪਟ ਵਾਲੇ GPT ਮਾਡਲ ਟੁੱਟ ਜਾਂਦੇ ਹਨ। Engine 2.0 85% ’ਤੇ ਹੈ; GPT-4o mini 44% ’ਤੇ; GPT 5.5, GPT 5.6 sol ਅਤੇ luna 27% ਤੋਂ 29% ਦੇ ਵਿਚਕਾਰ। ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ਵਿੱਚ ਖੂਬੀਆਂ ਅਤੇ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਇੱਕ ਅਸਲ ਮਿਸ਼ਰਣ ਹੁੰਦਾ ਹੈ ਜਿਸ ਨੂੰ ਤੋਲਣਾ ਪੈਂਦਾ ਹੈ, ਅਤੇ ਤੁਲਨਾ ਕਰਨ ਲਈ ਕੋਈ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਨਾ ਹੋਣ ਕਰਕੇ, GPT ਮਾਡਲ ਕਮਜ਼ੋਰੀਆਂ ਨੂੰ ਦੇਖਦੇ ਹਨ ਅਤੇ 5 ਜਾਂ 6 ਦੇ ਦਿੰਦੇ ਹਨ। GPT 5.6 sol ਤੋਂ ਸਕੋਰ ਮੰਗਣ ਵਾਲੇ 7 ਜਾਂ 8 ਬੋਲਣ ਵਾਲੇ ਨੂੰ ਦਸਾਂ ਵਿੱਚੋਂ ਤਿੰਨ ਵਾਰ ਤੋਂ ਵੀ ਘੱਟ ਸਹੀ ਬੈਂਡ ਸੁਣਨ ਨੂੰ ਮਿਲੇਗਾ।
ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 10 ਜਾਂ ਵੱਧ)
16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। ਲਗਭਗ ਹਰ ਗਲਤੀ 7 ਜਾਂ 8 ਹੈ।
71%
Prepamigo Engine 2.0
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
ਟੌਪ ’ਤੇ, Engine 2.0 71% ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ਨੂੰ ਪਛਾਣਦਾ ਹੈ। GPT 5.5 27% ਪਛਾਣਦਾ ਹੈ, GPT 5.6 sol 25%, GPT-4o mini 17%, ਅਤੇ GPT 5.6 luna 13%। ਹਰ GPT ਮਾਡਲ ਹਰ ਦਸ ਜਵਾਬਾਂ ਵਿੱਚੋਂ ਘੱਟੋ-ਘੱਟ ਸੱਤ ਨੂੰ ਜੋ 10 ਦੇ ਹੱਕਦਾਰ ਹਨ, 7 ਜਾਂ 8 ਦੇ ਦਿੰਦਾ ਹੈ।
ਇੱਕ ਮਜ਼ਬੂਤ ਉਮੀਦਵਾਰ ਲਈ ਇਸ ਦਾ ਕੀ ਮਤਲਬ ਹੈ ਬਾਰੇ ਸੋਚੋ। ਤੁਸੀਂ ਅੱਠ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰਦੇ ਹੋ, ਉਹਨਾਂ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕਰਦੇ ਹੋ, ਉਹਨਾਂ ਨੂੰ ChatGPT ਵਿੱਚ ਪੇਸਟ ਕਰਦੇ ਹੋ ਅਤੇ ਸਕੋਰ ਮੰਗਦੇ ਹੋ, ਅਤੇ ਇਹ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਛੇ 7 ਅਤੇ 8 ਹਨ। ਤੁਸੀਂ ਸਿੱਟਾ ਕੱਢਦੇ ਹੋ ਕਿ ਤੁਸੀਂ ਇੱਕ ਠੋਸ ਮੱਧ-ਬੈਂਡ ਬੋਲਣ ਵਾਲੇ ਹੋ ਜਿਸ ਨੂੰ ਹੋਰ ਕੰਮ ਕਰਨ ਦੀ ਲੋੜ ਹੈ। ਤੁਸੀਂ ਪੂਰਾ ਸਮਾਂ 10 ’ਤੇ ਸੀ। ਇਹ ਕੋਈ ਕਾਲਪਨਿਕ ਨਹੀਂ ਹੈ। ਇਹ ਉਹੀ ਹੈ ਜੋ ਹਰ GPT ਮਾਡਲ ਨੇ ਸਾਡੇ ਟੈਸਟ ਦੇ ਜ਼ਿਆਦਾਤਰ ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ’ਤੇ ਕੀਤਾ।
ਜੇ ਤੁਸੀਂ ChatGPT ਨੂੰ ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦਿਓ ਤਾਂ ਕੀ ਹੁੰਦਾ ਹੈ?
ਸਾਦੇ-ਟੈਸਟ ਦੇ ਨੰਬਰਾਂ ਨੂੰ ਇਹ ਸਮਝ ਕੇ ਪੜ੍ਹਨਾ ਸੌਖਾ ਹੈ ਕਿ GPT ਮਾਡਲਾਂ ਦਾ ਪਰਿਵਾਰ ਕਮਜ਼ੋਰ ਹੈ। ਇਹ ਸੱਚ ਨਹੀਂ ਹੈ। ਸਮੱਸਿਆ ਬੁੱਧੀ ਦੀ ਨਹੀਂ ਹੈ। ਇਹ ਹੈ ਕਿ ਇੱਕ ਮਾਡਲ ਤੋਂ ਨੰਬਰ ਮੰਗਿਆ ਜਾਂਦਾ ਹੈ, ਬਿਨਾਂ ਕਿਸੇ ਤੁਲਨਾ ਦੇ, ਇਹ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦਾ ਹੈ, ਅਤੇ ਜਦੋਂ ਇਹ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦਾ ਹੈ ਤਾਂ ਇਹ ਘੱਟ ਅਤੇ ਵਿਚਕਾਰ ਵੱਲ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦਾ ਹੈ।
ਇਸ ਲਈ ਅਸੀਂ ਦੂਜਾ ਟੈਸਟ ਚਲਾਇਆ। ਹਰ GPT ਮਾਡਲ ਨੂੰ ਉਹੀ ਪੈਕੇਜ ਮਿਲਿਆ ਜੋ Engine 2.0 ਦੇ ਗ੍ਰੇਡਰ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ: ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਟਾਸਕ, ਉਸ ਖਾਸ ਟਾਸਕ ਲਈ ਹਰ ਪੱਧਰ ’ਤੇ ਦੋ ਅਸਲ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ, ਅਤੇ ਨੰਬਰ ਦੇਣ ਦੀ ਥਾਂ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ ਸਭ ਤੋਂ ਨੇੜਲੀ ਉਦਾਹਰਣ ਦਾ ਨਾਮ ਲੈਣ ਦੀ ਹਦਾਇਤ। ਹਰ ਮਾਡਲ ਨੂੰ ਇਸ ਦੇ ਆਪਣੇ ਰੁਝਾਨਾਂ ਮੁਤਾਬਕ ਇੱਕ ਛੋਟਾ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਨੋਟ ਵੀ ਮਿਲਿਆ।
ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦੇ ਨਾਲ: ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ
ਉਹੀ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ। ਹਰ GPT ਮਾਡਲ ਨੇ Engine 2.0 ਦੇ ਆਪਣੇ ਗ੍ਰੇਡਰਾਂ ਵਾਂਗ ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ, ਹਦਾਇਤਾਂ ਅਤੇ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਨਾਲ ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਵਾਰ ਗਰੇਡ ਕੀਤਾ।
81%
Prepamigo Engine 2.0
71%
GPT 5.6 sol
69%
GPT 5.5
63%
GPT 5.6 luna
50%
GPT-4o mini
ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਬਹੁਤ ਵੱਡਾ ਫਰਕ ਪਾਉਂਦੀਆਂ ਹਨ। GPT 5.6 sol ਦੁੱਗਣਾ ਹੋ ਜਾਂਦਾ ਹੈ, 35% ਤੋਂ 71% ਤੱਕ। GPT 5.5 37% ਤੋਂ 69% ਤੱਕ ਜਾਂਦਾ ਹੈ, luna 31% ਤੋਂ 63% ਤੱਕ। GPT-4o mini ਲਗਭਗ ਹਿੱਲਦਾ ਨਹੀਂ, 45% ਤੋਂ 50% ਤੱਕ, ਕਿਉਂਕਿ ਇਹ ਜੋ ਵੀ ਦਿਖਾਇਆ ਜਾਵੇ ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਰਹਿੰਦਾ ਹੈ; ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ ਵੀ ਇਸ ਨੇ ਕੋਈ ਵੀ ਟੌਪ-ਪੱਧਰ ਦਾ ਜਵਾਬ ਨਹੀਂ ਪਛਾਣਿਆ। ਇਹ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਇੱਕ ਖਾਸ-ਮਕਸਦ ਲਈ ਬਣੇ ਗ੍ਰੇਡਰ ਦੀ ਕੀਮਤ ਅਸਲ ਵਿੱਚ ਕਿੱਥੇ ਹੈ: ਇੱਕ ਹੋਰ ਸਿਆਣੇ ਮਾਡਲ ਵਿੱਚ ਨਹੀਂ, ਸਗੋਂ ਹਰ ਖਾਸ ਟਾਸਕ ’ਤੇ ਹਰ ਪੱਧਰ ਕਿਵੇਂ ਸੁਣਾਈ ਦਿੰਦਾ ਹੈ ਇਸ ਦੀਆਂ ਅਸਲ ਉਦਾਹਰਣਾਂ ਵਿੱਚ, ਅਤੇ ਇੱਕ ਅਜਿਹੇ ਸਵਾਲ ਵਿੱਚ ਜੋ ਮਾਡਲ ਨੂੰ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਦੀ ਥਾਂ ਤੁਲਨਾ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ।
ਫਿਰ ਵੀ, ਹਰ GPT ਮਾਡਲ ਪਿੱਛੇ ਰਹਿੰਦਾ ਹੈ। ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ, GPT 5.6 sol Engine 2.0 ਤੋਂ ਸਮੁੱਚੇ ਤੌਰ ’ਤੇ ਦਸ ਪੁਆਇੰਟ ਪਿੱਛੇ ਹੈ, ਮੱਧ ਬੈਂਡ ਵਿੱਚ ਦਸ ਪੁਆਇੰਟ ਪਿੱਛੇ (75% ਬਨਾਮ 85%), ਅਤੇ ਟੌਪ ’ਤੇ ਅੱਠ ਪੁਆਇੰਟ ਪਿੱਛੇ (63% ਬਨਾਮ 71%)। ਇਸ ਦੀ ਬਾਕੀ ਬਚੀ ਆਦਤ ਹੈ ਪਾਲਿਸ਼ ਨੂੰ ਵੱਧ ਇਨਾਮ ਦੇਣਾ: ਸੁਚੱਜੀ ਸਪੁਰਦਗੀ ਵਾਲਾ ਇੱਕ ਸਮਰੱਥ 8 ਨੂੰ 9 ਜਾਂ 10 ਵੱਲ ਧੱਕਿਆ ਜਾਂਦਾ ਹੈ। GPT 5.6 luna ਇਸ ਦੇ ਉਲਟ ਕਰਦਾ ਹੈ, ਮੱਧ ਜਵਾਬਾਂ ਨੂੰ 5 ਵੱਲ ਖਿੱਚਦਾ ਹੈ, ਅਤੇ ਮੱਧ ਬੈਂਡ ਨੂੰ 44% ’ਤੇ ਖਤਮ ਕਰਦਾ ਹੈ। ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਬਣਾਉਣ ਵਾਲੇ ਇੱਕ ਸਿੰਗਲ ਮਾਡਲ ਦਾ ਅਜੇ ਵੀ ਇੱਕ ਖਾਸ ਪੱਖਪਾਤ ਹੁੰਦਾ ਹੈ, ਅਤੇ Engine 2.0 ਵੱਖ-ਵੱਖ ਪ੍ਰੋਵਾਈਡਰਾਂ ਦੇ ਦੋ ਸੁਤੰਤਰ ਗ੍ਰੇਡਰਾਂ, ਹਰੇਕ ਤੋਂ ਤਿੰਨ ਵੋਟਾਂ ਜਿਸ ਵਿੱਚੋਂ ਵਿਚਕਾਰਲੀ ਵੋਟ ਰੱਖੀ ਜਾਂਦੀ ਹੈ, ਅਤੇ ਇੱਕ ਸੁਲਾਹ-ਨਿਯਮ ਜੋ ਉੱਚਾ ਸਕੋਰ ਲੈਂਦਾ ਹੈ ਜਦੋਂ ਦੋ ਗ੍ਰੇਡਰ ਬਹੁਤ ਵੱਖਰਾ ਅਸਹਿਮਤ ਹੁੰਦੇ ਹਨ, ਨਾਲ ਬਾਕੀ ਬਚੇ ਫਰਕ ਨੂੰ ਬੰਦ ਕਰਦਾ ਹੈ।
ਅਸੀਂ ਸਪੱਸ਼ਟ ਸ਼ਾਰਟਕੱਟ ਵੀ ਅਜ਼ਮਾਇਆ: ਸਾਦਾ ਪ੍ਰੌਮਪਟ ਰੱਖਦੇ ਹੋਏ ਹਦਾਇਤਾਂ ਜੋੜੀਆਂ ਜਿਵੇਂ “ਵਿਚਕਾਰ ਵੱਲ ਨਾ ਖਿਸਕੋ” ਜਾਂ “ਪੱਧਰ 9 ਦੇ ਜਵਾਬ ਦਾ ਨਿਰਦੋਸ਼ ਹੋਣਾ ਜ਼ਰੂਰੀ ਨਹੀਂ ਹੈ।” ਇਨ੍ਹਾਂ ਨੇ ਕੋਈ ਮਾਪਣ ਯੋਗ ਬਦਲਾਅ ਨਹੀਂ ਲਿਆਇਆ। ਜੋ ਕੰਮ ਕਰਦਾ ਹੈ ਉਹ ਹੈ ਸਵਾਲ ਬਦਲਣਾ, ਅਤੇ ਮਾਡਲ ਨੂੰ ਤੁਲਨਾ ਕਰਨ ਲਈ ਕੋਈ ਅਸਲ ਚੀਜ਼ ਦੇਣਾ।
ਵਰਕਫਲੋ ਦਾ ਫਰਕ: ਰਿਕਾਰਡ ਕਰੋ ਅਤੇ ਚੱਲੋ, ਜਾਂ ਸਭ ਕੁਝ ਆਪ ਕਰੋ
ਸ਼ੁੱਧਤਾ ਦੇ ਅੰਕੜੇ ਇਹ ਮੰਨ ਕੇ ਚੱਲਦੇ ਹਨ ਕਿ ਗਰੇਡਿੰਗ ਅਸਲ ਵਿੱਚ ਹੁੰਦੀ ਹੈ। ChatGPT ਨਾਲ, ਤੁਹਾਡੀ ਰਿਕਾਰਡਿੰਗ ਨੂੰ ਰੁਕਣ ਅਤੇ ਸਕੋਰ ਪੜ੍ਹਨ ਵਿਚਕਾਰ ਹੈਰਾਨੀਜਨਕ ਮਾਤਰਾ ਵਿੱਚ ਕੰਮ ਹੁੰਦਾ ਹੈ, ਅਤੇ ਇਸ ਵਿੱਚੋਂ ਕੁਝ ਕੰਮ ਸਕੋਰ ਨੂੰ ਬਦਲ ਦਿੰਦਾ ਹੈ।
ਪਹਿਲਾਂ, ਤੁਹਾਨੂੰ ਇੱਕ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦੀ ਲੋੜ ਹੈ। ChatGPT ਦਾ ਵੌਇਸ ਮੋਡ ਇੱਕ ਗੱਲਬਾਤ ਹੈ, ਗ੍ਰੇਡਰ ਨਹੀਂ; ਇੱਕ ਰਿਕਾਰਡ ਕੀਤੇ ਜਵਾਬ ਨੂੰ ਗਰੇਡ ਕਰਨ ਲਈ ਤੁਹਾਨੂੰ ਟੈਕਸਟ ਦੀ ਲੋੜ ਹੈ। ਅਤੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ। ਹਰ ਫਿਲਰ, ਹਰ ਰੀਸਟਾਰਟ, ਹਰ ਖੁਦ-ਸੁਧਾਰ ਰਹਿਣਾ ਚਾਹੀਦਾ ਹੈ। ਜਦੋਂ ਅਸੀਂ ਝਿਜਕਾਂ ਹਟਾਈ ਗਈ “ਸਾਫ਼ ਕੀਤੀ” ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਟੈਸਟ ਕੀਤੀ, ਸ਼ੁੱਧਤਾ ਪੰਦਰਾਂ ਪੁਆਇੰਟ ਡਿੱਗ ਗਈ, ਕਿਉਂਕਿ ਇਹ ਝਿਜਕਾਂ ਹੀ ਉਹ ਸਬੂਤ ਹਨ ਜੋ ਗ੍ਰੇਡਰ ਨੂੰ ਇਹ ਪਰਖਣ ਲਈ ਲੋੜੀਂਦੇ ਹਨ ਕਿ ਜਵਾਬ ਕਿਵੇਂ ਸੁਣਾਈ ਦਿੰਦਾ ਹੈ। ਜ਼ਿਆਦਾਤਰ ਖਪਤਕਾਰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਟੂਲ, ਜ਼ਿਆਦਾਤਰ ਫੋਨਾਂ ਵਿੱਚ ਬਣੇ ਹੋਏ ਸਮੇਤ, ਮੂਲ ਰੂਪ ਵਿੱਚ ਸਾਫ਼ ਕਰਦੇ ਹਨ।
ਦੂਜਾ, ਤੁਹਾਨੂੰ ਟਾਸਕ ਦੀ ਲੋੜ ਹੈ। ChatGPT ਪੁੱਛਣ ’ਤੇ ਇੱਕ CELPIP-ਸਟਾਈਲ ਪ੍ਰੌਮਪਟ ਬਣਾ ਸਕਦਾ ਹੈ, ਪਰ ਇਹ ਫਾਰਮੈਟ, ਸਮੇਂ ਅਤੇ ਅਸਲ ਟੈਸਟ ਦੁਆਰਾ ਵਰਤੀ ਜਾਣ ਵਾਲੀ ਸਥਿਤੀ ਦੀ ਕਿਸਮ ਬਾਰੇ ਅੰਦਾਜ਼ਾ ਲਗਾ ਰਿਹਾ ਹੁੰਦਾ ਹੈ। ਤੁਹਾਨੂੰ ਪਤਾ ਨਹੀਂ ਹੋਵੇਗਾ ਕਿ ਇਸ ਨੇ ਲਿਖਿਆ ਪ੍ਰੌਮਪਟ ਉਸ ਨਾਲ ਮਿਲਦਾ ਹੈ ਜਿਸ ਦਾ ਤੁਸੀਂ ਸਾਹਮਣਾ ਕਰੋਗੇ।
ਤੀਜਾ, ਜੇ ਤੁਸੀਂ ਸਾਦੇ-ਟੈਸਟ ਦੇ ਨੰਬਰਾਂ ਨਾਲੋਂ ਬਿਹਤਰ ਕੁਝ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਤੁਹਾਨੂੰ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਦੀ ਲੋੜ ਹੈ: ਉਸੇ ਟਾਸਕ ਕਿਸਮ ਲਈ ਹਰ ਪੱਧਰ ਦੇ ਅਸਲ ਜਵਾਬ, ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰਾਂ ਨਾਲ। ਇਹ ਉਹ ਇਨਪੁਟ ਹੈ ਜਿਸ ਨੇ ਸਾਡੇ ਟੈਸਟ ਵਿੱਚ GPT 5.6 sol ਦੀ ਸ਼ੁੱਧਤਾ ਨੂੰ ਦੁੱਗਣਾ ਕੀਤਾ, ਅਤੇ ਇਹ ਉਹ ਹੈ ਜੋ ਇੱਕ ਵਿਦਿਆਰਥੀ ਘਰ ਬੈਠੇ ਪੈਦਾ ਨਹੀਂ ਕਰ ਸਕਦਾ।
ਚੌਥਾ, ਤੁਸੀਂ ਅਗਲੇ ਜਵਾਬ ਲਈ ਇਹ ਸਭ ਦੁਬਾਰਾ ਕਰਦੇ ਹੋ, ਅਤੇ ਹਰ ਇੱਕ ਤੁਹਾਡੇ ਸੁਨੇਹਾ ਭੱਤੇ ’ਤੇ ਗਿਣਿਆ ਜਾਂਦਾ ਹੈ।
Prepamigo ’ਤੇ, ਤੁਸੀਂ ਬੈਂਕ ਵਿੱਚੋਂ ਇੱਕ ਟਾਸਕ ਚੁਣਦੇ ਹੋ, ਟਾਈਮਰ ਚੱਲਦਾ ਹੈ, ਤੁਸੀਂ ਬੋਲਦੇ ਹੋ, ਅਤੇ ਰੁਕਣ ਤੋਂ ਲਗਭਗ ਦਸ ਸਕਿੰਟਾਂ ਬਾਅਦ, ਸਕੋਰ ਅਤੇ ਫੀਡਬੈਕ ਸਕ੍ਰੀਨ ’ਤੇ ਹੁੰਦੇ ਹਨ। ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਡਿਜ਼ਾਈਨ ਦੁਆਰਾ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਹੈ, ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਆਪਣੇ ਆਪ ਟਾਸਕ ਨਾਲ ਜੁੜੀਆਂ ਹੁੰਦੀਆਂ ਹਨ, ਅਤੇ ਪੇਸਟ ਕਰਨ ਜਾਂ ਪ੍ਰੌਮਪਟ ਕਰਨ ਲਈ ਕੁਝ ਵੀ ਨਹੀਂ ਹੈ। ਸ਼ਾਮ ਦਾ ਗਿਆਰਵਾਂ ਜਵਾਬ ਤੁਹਾਨੂੰ ਪਹਿਲੇ ਜਿੰਨੀ ਹੀ ਮਿਹਨਤ ਲੈਂਦਾ ਹੈ।
ਇਕਸਾਰਤਾ: ਉਹੀ ਜਵਾਬ, ਉਹੀ ਸਕੋਰ
ਇੱਕ ਸਕੋਰ ਜਿਸ ਨੂੰ ਤੁਸੀਂ ਦੁਹਰਾ ਨਹੀਂ ਸਕਦੇ ਉਹ ਮਾਪ ਨਹੀਂ ਹੈ। ਜੇ ਉਹੀ ਰਿਕਾਰਡਿੰਗ ਸੋਮਵਾਰ 8 ਅਤੇ ਮੰਗਲਵਾਰ 10 ਮਿਲਦੀ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਆਪਣੀ ਸਪੀਕਿੰਗ ਬਾਰੇ ਕੁਝ ਨਹੀਂ ਸਿੱਖਿਆ। ਇਸ ਲਈ ਅਸੀਂ ਦੁਹਰਾਉਣਯੋਗਤਾ ਵੀ ਟੈਸਟ ਕੀਤੀ।
Engine 2.0 ਨੂੰ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ’ਤੇ ਵੱਖ-ਵੱਖ ਦਿਨਾਂ ’ਤੇ ਤਿੰਨ ਵੱਖਰੀਆਂ ਵਾਰ ਚਲਾਇਆ ਗਿਆ। ਇਸ ਨੇ ਹਰ ਵਾਰ 81.3% ਸਕੋਰ ਕੀਤਾ। ਵਿਅਕਤੀਗਤ ਜਵਾਬਾਂ ਨੂੰ ਦੇਖਦੇ ਹੋਏ, 87.5% ਨੂੰ ਤਿੰਨੋਂ ਰਨਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ ਸਕੋਰ ਮਿਲਿਆ, ਅਤੇ ਸਿਰਫ਼ 4.2% ਕਦੇ ਦੋ ਜਾਂ ਵੱਧ ਪੁਆਇੰਟਾਂ ਨਾਲ ਹਿੱਲੇ, ਸਾਰੇ ਦੋ ਬੈਂਡਾਂ ਵਿਚਕਾਰ ਦੀ ਸੀਮਾ ’ਤੇ ਬੈਠੇ ਜਵਾਬ।
GPT 5.6 sol ’ਤੇ ਸਾਦਾ ਟੈਸਟ ਇਸ ਦੇ ਸਭ ਤੋਂ ਵਧੀਆ ਅਤੇ ਸਭ ਤੋਂ ਖਰਾਬ ਰਨ ਵਿਚਕਾਰ ਨੌਂ ਪੁਆਇੰਟ ਹਿੱਲਿਆ। ਇਹ ਸਥਿਰਤਾ ਦਾ ਫਰਕ ਵੋਟਿੰਗ ਤੋਂ ਆਉਂਦਾ ਹੈ। Engine 2.0 ਵਿੱਚ ਹਰ ਗ੍ਰੇਡਰ ਹਰ ਜਵਾਬ ’ਤੇ ਤਿੰਨ ਵਾਰ ਵੋਟ ਕਰਦਾ ਹੈ ਅਤੇ ਵਿਚਕਾਰਲੀ ਵੋਟ ਰੱਖੀ ਜਾਂਦੀ ਹੈ। ਜਦੋਂ ਅਸੀਂ ਤਿੰਨ ਦੀ ਥਾਂ ਇੱਕ ਵੋਟ ਨਾਲ ਉਹੀ ਸੰਰਚਨਾ ਟੈਸਟ ਕੀਤੀ, ਰਨਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹੇ ਸਕੋਰ 87.5% ਤੋਂ 77% ਤੱਕ ਡਿੱਗ ਗਏ, ਅਤੇ ਦੋ ਜਾਂ ਵੱਧ ਪੁਆਇੰਟ ਉੱਛਲਣ ਵਾਲੇ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਦੁੱਗਣੇ ਤੋਂ ਵੱਧ ਹੋ ਗਿਆ। ਇੱਕ ਸਿੰਗਲ ChatGPT ਗੱਲਬਾਤ ਇੱਕ ਸਿੰਗਲ ਵੋਟ ਹੈ। ਅਸੀਂ ਇਹ ਵੀ ਜਾਂਚਿਆ ਕਿ ਕੀ API ਰਾਹੀਂ ਇੱਕ ਸਥਿਰ ਰੈਂਡਮ ਸੀਡ ਸੈੱਟ ਕਰਨ ਨਾਲ GPT ਮਾਡਲ ਵੱਧ ਦੁਹਰਾਉਣਯੋਗ ਬਣਦੇ ਹਨ। ਇਸ ਨੇ ਨਹੀਂ ਬਣਾਇਆ; GPT 5.6 luna ’ਤੇ, ਦੁਹਰਾਉਣਯੋਗਤਾ ਅਸਲ ਵਿੱਚ ਡਿੱਗ ਗਈ।
ਫੀਡਬੈਕ ਜਿਸ ’ਤੇ ਤੁਸੀਂ ਅਮਲ ਕਰ ਸਕਦੇ ਹੋ
ChatGPT ਇੱਕ ਵਧੀਆ ਵਿਆਖਿਆਕਾਰ ਹੈ। ਜੇ ਤੁਸੀਂ ਪੁੱਛੋ ਕਿ ਇਸ ਨੇ ਸਕੋਰ ਕਿਉਂ ਦਿੱਤਾ, ਇਹ ਤੁਹਾਨੂੰ ਸਾਫ਼ ਅੰਗਰੇਜ਼ੀ ਵਿੱਚ ਲੰਬਾਈ ਨਾਲ ਦੱਸੇਗਾ, ਅਤੇ ਸੁਧਾਰ ਸੁਝਾਏਗਾ। ਜੋ ਉਮੀਦਵਾਰ ਕਿਸੇ ਜਵਾਬ ਬਾਰੇ ਗੱਲ ਕਰਨਾ ਚਾਹੁੰਦਾ ਹੈ, ਉਸ ਲਈ ਇਹ ਸੱਚਮੁੱਚ ਕੀਮਤੀ ਹੈ।
ਜੋਖਮ ਇਹ ਹੈ ਕਿ ਸੁਚੱਜੀ ਵਿਆਖਿਆ ਸਹੀ ਨਿਦਾਨ ਦੇ ਬਰਾਬਰ ਨਹੀਂ ਹੈ। ਜਿਸ ਮਾਡਲ ਨੇ 10 ਨੂੰ 7 ਸਕੋਰ ਕੀਤਾ, ਉਹ ਭਰੋਸੇਯੋਗ ਢੰਗ ਨਾਲ ਸਮਝਾਏਗਾ ਕਿ ਇਹ ਕਿਉਂ 7 ਹੈ। ਅਤੇ ਕਿਉਂਕਿ ਇਸ ਨੂੰ ਸਕੋਰ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਸਬੂਤ ਲਈ ਵਚਨਬੱਧ ਨਹੀਂ ਹੋਣਾ ਪਿਆ, ਵਿਆਖਿਆ ਬਾਅਦ ਵਿੱਚ ਲਿਖੀ ਜਾਂਦੀ ਹੈ, ਪਹਿਲਾਂ ਹੀ ਚੁਣੇ ਗਏ ਨੰਬਰ ਨੂੰ ਸਹੀ ਠਹਿਰਾਉਣ ਲਈ।
Engine 2.0 ਇਸ ਦੇ ਉਲਟ ਕੰਮ ਕਰਦਾ ਹੈ। ਹਰ ਗ੍ਰੇਡਰ ਨੂੰ ਪੱਧਰ ਦਾ ਨਾਮ ਲੈਣ ਤੋਂ ਪਹਿਲਾਂ ਹਰ ਪਹਿਲੂ ਲਈ ਸਬੂਤ ਵੱਲ ਇਸ਼ਾਰਾ ਕਰਨਾ ਪੈਂਦਾ ਹੈ, ਅਤੇ ਫੀਡਬੈਕ ਉਸ ਸਬੂਤ ਤੋਂ ਲਿਖੀ ਜਾਂਦੀ ਹੈ। ਇਹ ਤੁਹਾਡੇ ਆਪਣੇ ਸ਼ਬਦਾਂ ਦਾ ਹਵਾਲਾ ਦਿੰਦੀ ਹੈ: ਫੀਡਬੈਕ ਦੇ ਇੱਕ ਨਮੂਨੇ ਵਿੱਚ 158 ਹਵਾਲਿਆਂ ਦੀ ਜਾਂਚ ਵਿੱਚ, 157 ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਵਿੱਚ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਮੌਜੂਦ ਸਨ। ਜਦੋਂ ਇੱਕ ਸੁਤੰਤਰ ਨਿਰਣਾਇਕ ਮਾਡਲ ਨੇ Engine 2.0 ਦੀ ਫੀਡਬੈਕ ਦੀ ਸਾਡੇ ਪਿਛਲੇ ਸਿਸਟਮ ਦੀ ਫੀਡਬੈਕ ਨਾਲ ਉਹੀ ਜਵਾਬਾਂ ’ਤੇ, ਬਿਨਾਂ ਇਹ ਜਾਣੇ ਕਿ ਕਿਹੜੀ ਕਿਹੜੀ ਹੈ, ਤੁਲਨਾ ਕੀਤੀ, ਇਸ ਨੇ 24 ਵਿੱਚੋਂ 20 ਤੁਲਨਾਵਾਂ ਵਿੱਚ Engine 2.0 ਨੂੰ ਪਸੰਦ ਕੀਤਾ, ਦੋਵੇਂ ਜਦੋਂ ਪਰੀਖਿਅਕ ਵਾਂਗ ਨਿਰਣਾ ਕੀਤਾ ਗਿਆ ਅਤੇ ਜਦੋਂ ਵਿਦਿਆਰਥੀ ਵਾਂਗ।
ਅਸੀਂ ਇਹ ਵੀ ਜਾਂਚਿਆ ਕਿ ਫੀਡਬੈਕ ਆਲੋਚਨਾ ਨੂੰ ਸਹੀ ਥਾਂ ’ਤੇ ਰੱਖਦੀ ਹੈ ਜਾਂ ਨਹੀਂ, ਮਜ਼ਬੂਤ ਜਵਾਬ ਲੈ ਕੇ ਅਤੇ ਇੱਕ ਸਮੇਂ ਇੱਕ ਪਹਿਲੂ ਨੂੰ ਜਾਣ ਬੁੱਝ ਕੇ ਖਰਾਬ ਕਰਕੇ। ਚਾਰ ਵਿੱਚੋਂ ਤਿੰਨ ਮਾਮਲਿਆਂ ਵਿੱਚ, ਖਰਾਬ ਕੀਤਾ ਗਿਆ ਪਹਿਲੂ ਹੀ ਉਹ ਸੀ ਜਿਸ ਦਾ ਸਕੋਰ ਸਭ ਤੋਂ ਵੱਧ ਡਿੱਗਿਆ। ਇਹ ਉਸ ਕਿਸਮ ਦੀ ਜਾਂਚ ਹੈ ਜੋ ਇੱਕ ਚੈਟਬੋਟ ਆਸਾਨੀ ਨਾਲ ਪਾਸ ਨਹੀਂ ਕਰ ਸਕਦਾ, ਕਿਉਂਕਿ ਇਸ ਕੋਲ ਜਾਂਚਣ ਲਈ ਕੋਈ ਸਥਿਰ ਪਹਿਲੂ ਨਹੀਂ ਹਨ।
ਹਰ ਰੋਜ਼ ਅਭਿਆਸ ਕਰਨ ਦੀ ਕੀਮਤ ਕਿੰਨੀ ਹੈ
ਇੱਕ ਸਪੀਕਿੰਗ ਸਕੋਰ ਤੁਹਾਡੇ ਚਾਲੀਵੇਂ ਜਵਾਬ ’ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਲਾਭਦਾਇਕ ਹੁੰਦਾ ਹੈ, ਚੌਥੇ ’ਤੇ ਨਹੀਂ। ਇਸ ਲਈ ਵਿਹਾਰਕ ਸਵਾਲ ਇਹ ਹੈ ਕਿ ਹਰ ਟੂਲ ਨੂੰ ਵੱਡੀ ਮਾਤਰਾ ਵਿੱਚ ਵਰਤਣ ਦੀ ਕੀਮਤ ਕਿੰਨੀ ਹੈ।
ChatGPT Plus US$20 ਪ੍ਰਤੀ ਮਹੀਨਾ ਹੈ, ਲਗਭਗ CA$28, ਮਹੀਨਾਵਾਰ ਬਿਲ ਹੋਇਆ, ਜਿਵੇਂ ਸਤੰਬਰ 2026 ਵਿੱਚ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤਾ ਗਿਆ। ਇਹ ਤੁਹਾਨੂੰ GPT 5.6 ਪਰਿਵਾਰ ਦਿੰਦਾ ਹੈ ਜਿਸ ਵਿੱਚ ਰੋਲਿੰਗ ਵਿੰਡੋ ਪ੍ਰਤੀ ਸੁਨੇਹਾ ਸੀਮਾ ਹੈ; ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਸਮੇਤ ਲੰਬੀਆਂ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ ਬਿਲਕੁਲ ਉਹੀ ਕਿਸਮ ਦਾ ਸੁਨੇਹਾ ਹਨ ਜੋ ਉਸ ਭੱਤੇ ਦਾ ਬਹੁਤ ਹਿੱਸਾ ਵਰਤਦਾ ਹੈ, ਅਤੇ ਇੱਕ ਵਾਰ ਟੱਕਰਨ ’ਤੇ ਤੁਸੀਂ ਉਡੀਕ ਕਰਦੇ ਹੋ ਜਾਂ ਇੱਕ ਛੋਟੇ ਮਾਡਲ ’ਤੇ ਚਲੇ ਜਾਂਦੇ ਹੋ। ChatGPT Pro, US$200 ਪ੍ਰਤੀ ਮਹੀਨਾ ’ਤੇ, ਲਗਭਗ CA$276 ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ, ਸੀਮਾਵਾਂ ਨੂੰ ਕਾਫ਼ੀ ਵਧਾ ਦਿੰਦਾ ਹੈ। ਫ੍ਰੀ ਟੀਅਰ ਆਪਣੇ ਬਹੁਤ ਸਾਰੇ ਟ੍ਰੈਫਿਕ ਨੂੰ ਛੋਟੇ ਮਾਡਲਾਂ ਵੱਲ ਭੇਜਦਾ ਹੈ, ਅਤੇ ਇਸ ਟੈਸਟ ’ਤੇ ਉਨ੍ਹਾਂ ਵਿੱਚੋਂ ਸਭ ਤੋਂ ਛੋਟੇ ਨੇ ਲਗਭਗ ਕੋਈ ਵੀ ਟੌਪ-ਪੱਧਰ ਦਾ ਜਵਾਬ ਨਹੀਂ ਪਛਾਣਿਆ। ਕੋਈ ਵੀ ਪਲਾਨ ਸਵਾਲ ਬੈਂਕ, ਟਾਈਮਰ, ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ, ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ, ਜਾਂ CELPIP ਲਈ ਖਾਸ ਕੋਈ ਵੀ ਚੀਜ਼ ਸ਼ਾਮਲ ਨਹੀਂ ਕਰਦਾ।
Prepamigo CA$24.98 ਪ੍ਰਤੀ ਮਹੀਨਾ ਹੈ, ਜਾਂ ਸਲਾਨਾ ਪਲਾਨ ’ਤੇ CA$8.25 ਪ੍ਰਤੀ ਮਹੀਨਾ, ਜੋ ਸਾਲ ਲਈ CA$98.98 ਬਣਦਾ ਹੈ, ਟੈਕਸ ਸਮੇਤ, ਅਤੇ ਤੁਸੀਂ ਕਿਸੇ ਵੀ ਸਮੇਂ ਰੱਦ ਕਰ ਸਕਦੇ ਹੋ। ਹਰ ਪਲਾਨ ਵਿੱਚ Engine 2.0 ਦੁਆਰਾ ਅਸੀਮਿਤ ਸਕੋਰਿੰਗ ਸ਼ਾਮਲ ਹੈ ਬਿਨਾਂ ਕਿਸੇ ਰੋਜ਼ਾਨਾ, ਸੈਸ਼ਨ ਜਾਂ ਹਫ਼ਤਾਵਾਰੀ ਸੀਮਾ ਦੇ, ਅਸੀਮਿਤ ਕੋਸ਼ਿਸ਼ਾਂ, ਅਤੇ ਪੂਰਾ ਸਵਾਲ ਬੈਂਕ: Speaking, Writing, Reading ਅਤੇ Listening ਵਿੱਚ 80 ਪੂਰੇ ਪ੍ਰੈਕਟਿਸ ਸੈੱਟ ਅਤੇ 2,000 ਤੋਂ ਵੱਧ ਪ੍ਰੈਕਟਿਸ ਟਾਸਕ, ਜੋ CELPIP General ਟੈਸਟ ਦੀਆਂ ਟਾਸਕ ਕਿਸਮਾਂ, ਸਮੇਂ ਅਤੇ ਫਾਰਮੈਟ ਦੀ ਪਾਲਣਾ ਕਰਨ ਲਈ ਲਿਖੇ ਗਏ ਹਨ।
ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ: ChatGPT Plus ਦੀ ਕੀਮਤ ਤੋਂ ਘੱਟ ਵਿੱਚ, ਤੁਹਾਨੂੰ ਇੱਕ ਗ੍ਰੇਡਰ ਮਿਲਦਾ ਹੈ ਜੋ ਸਾਦੀ ਤੁਲਨਾ ’ਤੇ ਦੁੱਗਣੇ ਤੋਂ ਵੱਧ ਸਹੀ ਹੈ, ਜੋ ਤੁਹਾਨੂੰ ਕਦੇ ਉਡੀਕ ਕਰਨ ਨੂੰ ਨਹੀਂ ਕਹਿੰਦਾ, ਅਤੇ ਜਿਸ ਵਿੱਚ ਸਵਾਲ ਅਤੇ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਪਹਿਲਾਂ ਤੋਂ ਹੀ ਮੌਜੂਦ ਹਨ।
ਜਦੋਂ ChatGPT ਬਿਹਤਰ ਟੂਲ ਹੈ
ਇਹ CELPIP ਦੀ ਤਿਆਰੀ ਕਰਦੇ ਹੋਏ ChatGPT ਕਦੇ ਨਾ ਖੋਲ੍ਹਣ ਦੀ ਦਲੀਲ ਨਹੀਂ ਹੈ। ਇੱਕ ਗੰਭੀਰ ਉਮੀਦਵਾਰ ਦੋਵੇਂ ਵਰਤ ਸਕਦਾ ਹੈ।
- ਜਵਾਬ ਬਾਰੇ ਗੱਲ ਕਰਨਾ। ਜੇ ਤੁਸੀਂ ਸਮਝਣਾ ਚਾਹੁੰਦੇ ਹੋ ਕਿ ਕੋਈ ਕਾਰਨ ਕਿਉਂ ਕਮਜ਼ੋਰ ਸੀ ਜਾਂ ਤਿੰਨ ਬਿਹਤਰ ਕਾਰਨਾਂ ਬਾਰੇ ਵਿਚਾਰ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਗੱਲਬਾਤ ਸਹੀ ਢੰਗ ਹੈ। Engine 2.0 ਤੁਹਾਨੂੰ ਫੈਸਲਾ ਅਤੇ ਸਬੂਤ ਦਿੰਦਾ ਹੈ; ਇਹ ਗੱਲਬਾਤ ਨਹੀਂ ਕਰਦਾ।
- ਸ਼ਬਦਾਵਲੀ ਅਤੇ ਵਾਕ-ਰਚਨਾ। ਕੁਝ ਕਹਿਣ ਦੇ ਪੰਜ ਹੋਰ ਕੁਦਰਤੀ ਢੰਗ ਪੁੱਛਣਾ ਤੇਜ਼ ਅਤੇ ਲਾਭਦਾਇਕ ਹੈ।
- ਕਿਸੇ ਅਜਿਹੀ ਚੀਜ਼ ਨਾਲ ਬੋਲਣਾ ਜੋ ਜਵਾਬ ਦਿੰਦੀ ਹੈ। ChatGPT ਦਾ ਵੌਇਸ ਮੋਡ ਉੱਚੀ ਆਵਾਜ਼ ਵਿੱਚ ਅੰਗਰੇਜ਼ੀ ਬੋਲਣ ਵਿੱਚ ਆਰਾਮਦਾਇਕ ਹੋਣ ਦਾ ਇੱਕ ਵਾਜਬ ਢੰਗ ਹੈ। ਇਹ ਗ੍ਰੇਡਰ ਨਹੀਂ ਹੈ, ਪਰ ਇਹ ਸਾਥ ਹੈ।
- ਰਾਈਟਿੰਗ ਪ੍ਰੈਕਟਿਸ। ਲਿਖਤੀ ਜਵਾਬਾਂ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਦੀ ਲੋੜ ਨਹੀਂ ਹੁੰਦੀ, ਇਸ ਲਈ ਵਰਕਫਲੋ ਦਾ ਫਰਕ ਛੋਟਾ ਹੈ। ਰਾਈਟਿੰਗ ’ਤੇ GPT ਦੀ ਸ਼ੁੱਧਤਾ ਇਸ ਟੈਸਟ ਦਾ ਹਿੱਸਾ ਨਹੀਂ ਸੀ।
- ਟੈਸਟ ਤੋਂ ਬਾਹਰ ਕੁਝ ਵੀ। ChatGPT ਇੱਕ ਜਨਰਲ ਅਸਿਸਟੈਂਟ ਹੈ ਅਤੇ Prepamigo ਨਹੀਂ ਹੈ।
ਇੱਥੇ ਦਿੱਤੇ ਸਬੂਤਾਂ ਦੇ ਆਧਾਰ ’ਤੇ, ChatGPT ਨੂੰ ਇਹ ਦੱਸਣ ਵਾਲੀ ਚੀਜ਼ ਨਹੀਂ ਹੋਣਾ ਚਾਹੀਦਾ ਕਿ ਤੁਸੀਂ ਤਿਆਰ ਹੋ ਜਾਂ ਨਹੀਂ। ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਇੱਕ ਗ੍ਰੇਡਰ ਚਾਹੀਦਾ ਹੈ ਜੋ ਇਸ ਕੰਮ ਲਈ ਬਣਾਇਆ ਗਿਆ ਸੀ, ਉਸ ਨੇ ਨਾ ਦੇਖੇ ਹੋਏ ਜਵਾਬਾਂ ’ਤੇ ਟੈਸਟ ਕੀਤਾ ਗਿਆ, ਅਤੇ ਪੱਧਰ-ਦਰ-ਪੱਧਰ ਮਾਪਿਆ ਗਿਆ।
ਤੁਹਾਡੇ ਫੀਡਬੈਕ ਵਿੱਚ ਕੀ ਨਵਾਂ ਹੈ
Engine 2.0 ਦੇ ਨਾਲ ਇੱਕ ਨਵੀਂ ਬਣਾਈ ਗਈ ਫੀਡਬੈਕ ਲੇਅਰ ਆਉਂਦੀ ਹੈ। ਇਹ ਸਿਰਫ਼ ਸਕੋਰ ਨਹੀਂ ਸਗੋਂ ਦੋਵੇਂ ਗ੍ਰੇਡਰਾਂ ਦੇ ਸਬੂਤ ਨੂੰ ਪੜ੍ਹਦੀ ਹੈ, ਅਤੇ ਇਸ ਨੂੰ ਤਿੰਨ ਤਰ੍ਹਾਂ ਦੇ ਵਿਦਿਆਰਥੀਆਂ 'ਤੇ ਪਰਖਿਆ ਗਿਆ: ਪਹਿਲੀ ਵਾਰ CELPIP ਦੇਣ ਵਾਲਾ ਕੋਈ, ਕਮਜ਼ੋਰ ਅੰਗਰੇਜ਼ੀ ਵਾਲਾ ਕੋਈ ਜੋ ਬਸ ਤਰੀਕਾ ਲੱਭ ਰਿਹਾ ਹੈ, ਅਤੇ ਕੋਈ ਜਿਸ ਕੋਲ ਦਿਨ ਵਿੱਚ ਅੱਧਾ ਘੰਟਾ ਹੈ ਤੇ ਅਗਲੇ ਹਫ਼ਤੇ ਟੈਸਟ ਹੈ। ਇਹ ਹੈ ਜੋ ਬਦਲਿਆ।
- ਤੁਹਾਡੇ ਆਪਣੇ ਸ਼ਬਦ, ਦੁਬਾਰਾ ਦਿਖਾਏ ਗਏ. ਫੀਡਬੈਕ ਦਾ ਹਰ ਨੁਕਤਾ ਤੁਹਾਡੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਾ ਉਹੀ ਵਾਕੰਸ਼ ਦੱਸਦਾ ਹੈ ਜਿਸ 'ਤੇ ਗ੍ਰੇਡਰਾਂ ਨੇ ਪ੍ਰਤੀਕਿਰਿਆ ਦਿੱਤੀ। ਜੇ ਕੋਈ ਵਾਕੰਸ਼ ਕੋਟੇਸ਼ਨ ਨਿਸ਼ਾਨਾਂ ਵਿੱਚ ਹੈ, ਤਾਂ ਇਹ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਕਾਪੀ ਕੀਤਾ ਗਿਆ ਹੈ; ਸਾਡੀ ਪੜਤਾਲ ਵਿੱਚ 158 ਵਿੱਚੋਂ 157 ਕੋਟ ਇਸੇ ਤਰ੍ਹਾਂ ਸਨ। ਫੀਡਬੈਕ ਕਦੇ ਵੀ ਕੋਈ ਅਜਿਹੀ ਗੱਲ ਨਹੀਂ ਬਣਾਉਂਦਾ ਜੋ ਤੁਸੀਂ ਕਹੀ ਹੀ ਨਹੀਂ।
- ਪਹਿਲਾਂ ਠੀਕ ਕਰਨ ਵਾਲੀ ਇੱਕ ਗੱਲ. ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਹੀ ਸਭ ਤੋਂ ਵੱਡੀ ਸਲਾਹ ਮਿਲਦੀ ਹੈ: ਉਹ ਇੱਕ ਤਬਦੀਲੀ ਜੋ ਤੁਹਾਡੇ ਸਕੋਰ ਨੂੰ ਸਭ ਤੋਂ ਵੱਧ ਵਧਾਏਗੀ, ਸਭ ਤੋਂ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਲਿਖੀ ਹੋਈ। ਇਸ ਦੇ ਬਾਅਦ ਦੋ ਹੋਰ ਠੋਸ ਕਦਮ ਆਉਂਦੇ ਹਨ, ਫਿਰ ਬੋਲਣਾ ਸ਼ੁਰੂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਮਨ ਵਿੱਚ ਦੁਹਰਾਉਣ ਲਈ ਤਿੰਨ-ਨੁਕਾਤੀ ਚੈੱਕਲਿਸਟ।
- ਟਾਸਕ ਦੇ ਮੁਤਾਬਕ ਸਲਾਹ. ਸਲਾਹ ਦੇਣਾ, ਕਿਸੇ ਦ੍ਰਿਸ਼ ਦਾ ਵਰਣਨ ਕਰਨਾ ਅਤੇ ਕਿਸੇ ਨੂੰ ਮਨਾਉਣਾ — ਇਹਨਾਂ ਸਭ ਦਾ ਸਕੋਰ ਵੱਖ-ਵੱਖ ਗੱਲਾਂ 'ਤੇ ਹੁੰਦਾ ਹੈ। ਫੀਡਬੈਕ ਨੂੰ ਹੁਣ ਪਤਾ ਹੈ ਕਿ ਅੱਠ ਟਾਸਕ ਕਿਸਮਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ਕਿਸ ਗੱਲ ਦਾ ਇਨਾਮ ਦਿੰਦੀ ਹੈ, ਅਤੇ ਉਸੇ ਮੁਤਾਬਕ ਗੱਲ ਕਰਦਾ ਹੈ, ਸਾਰੇ ਟਾਸਕਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹੀਆਂ ਆਮ ਟਿਪਸ ਦੁਹਰਾਉਣ ਦੀ ਥਾਂ।
- ਪਹਿਲਾਂ ਕਿਸ ਪਹਿਲੂ ਦਾ ਅਭਿਆਸ ਕਰਨਾ ਹੈ. ਫੀਡਬੈਕ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਕਿਹੜਾ ਤੁਹਾਡਾ ਸਭ ਤੋਂ ਕਮਜ਼ੋਰ ਹੈ ਅਤੇ ਕਿਹੜਾ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ, ਤਾਂ ਜੋ ਤੁਹਾਨੂੰ ਪਤਾ ਹੋਵੇ ਕਿ ਅਗਲਾ ਅੰਕ ਕਿੱਥੇ ਹੈ, ਬਿਨਾਂ ਇਸ ਨੂੰ ਕਿਸੇ ਨੰਬਰ ਪਿੱਛੇ ਲੁਕਾਏ।
- ਟਾਸਕ ਨੇ ਕੀ ਮੰਗਿਆ ਅਤੇ ਤੁਸੀਂ ਕੀ ਛੱਡਿਆ. ਟਾਸਕ ਪੂਰਤੀ ਵਿੱਚ, ਫੀਡਬੈਕ ਉਹ ਖਾਸ ਹਿੱਸੇ ਸੂਚੀਬੱਧ ਕਰਦਾ ਹੈ ਜਿਹੜੇ ਪ੍ਰੌਂਪਟ ਦੇ ਤੁਸੀਂ ਕਵਰ ਨਹੀਂ ਕੀਤੇ, ਜਾਂ ਸਾਫ਼ ਕਹਿ ਦਿੰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਉਹ ਸਭ ਕਵਰ ਕਰ ਲਏ ਹਨ।
- ਗੱਲਾਂ ਜਿਹਨਾਂ ਦੀ ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਰਿਹਰਸਲ ਕਰ ਸਕਦੇ ਹੋ. ਹਰ 'ਕਿਵੇਂ ਕਰੀਏ' ਸਲਾਹ ਕੁਝ ਅਜਿਹਾ ਹੈ ਜੋ ਤੁਸੀਂ ਆਪਣੀ ਅਗਲੀ ਕੋਸ਼ਿਸ਼ ਤੋਂ ਪਹਿਲਾਂ ਉੱਚੀ ਆਵਾਜ਼ ਵਿੱਚ ਬੋਲ ਸਕਦੇ ਹੋ। ਵੱਧ ਸਪਸ਼ਟ ਬੋਲਣ ਜਾਂ ਆਪਣਾ ਲਹਿਜਾ ਘਟਾਉਣ ਦੀ ਕੋਈ ਸਲਾਹ ਨਹੀਂ ਦਿੱਤੀ ਜਾਂਦੀ: ਲਹਿਜਾ ਉਹ ਚੀਜ਼ ਨਹੀਂ ਜਿਸ ਨੂੰ ਸੁਣਨਯੋਗਤਾ ਮਾਪਦੀ ਹੈ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ 'ਤੇ ਕਦੇ ਟਿੱਪਣੀ ਨਹੀਂ ਕਰਦਾ।
- ਟਾਈਮਰ ਲਈ ਕੋਈ ਦੋਸ਼ ਨਹੀਂ. ਜੇ ਕੋਈ ਜਵਾਬ ਟਾਸਕ ਪੂਰਾ ਕਰ ਲੈਣ ਤੋਂ ਬਾਅਦ ਸਮੇਂ ਦੀ ਵਜ੍ਹਾ ਨਾਲ ਵਿੱਚੋਂ ਕੱਟਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਸ ਕੱਟ ਦੇ ਲਈ ਸਕੋਰ ਨਹੀਂ ਘਟਾਇਆ ਜਾਂਦਾ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਝਾੜ ਨਹੀਂ ਪਾਉਂਦਾ।
ਜਦੋਂ ਇੱਕ ਸੁਤੰਤਰ ਨਿਰਣਾਇਕ ਮਾਡਲ ਨੇ ਇਸ ਫੀਡਬੈਕ ਦੀ ਤੁਲਨਾ ਉਸ ਨਾਲ ਕੀਤੀ ਜੋ ਸਾਡੇ ਪਿਛਲੇ ਸਿਸਟਮ ਨੇ ਇਹਨਾਂ ਹੀ ਜਵਾਬਾਂ ਲਈ ਦਿੱਤਾ ਸੀ, ਬਿਨਾਂ ਇਹ ਜਾਣੇ ਕਿ ਕਿਹੜਾ ਕਿਹੜਾ ਹੈ, ਇਸ ਨੇ 24 ਵਿੱਚੋਂ 20 ਤੁਲਨਾਵਾਂ ਵਿੱਚ ਨਵੇਂ ਫੀਡਬੈਕ ਨੂੰ ਪਹਿਲ ਦਿੱਤੀ, ਭਾਵੇਂ ਇਹ ਇੱਕ ਪ੍ਰੀਖਿਅਕ ਵਾਂਗ ਨਿਰਣਾ ਕਰ ਰਿਹਾ ਹੋਵੇ ਜਾਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਵਾਂਗ।
ਅਕਸਰ ਪੁੱਛੇ ਜਾਂਦੇ ਸਵਾਲ
ਕੀ ChatGPT ਮੇਰੀ CELPIP ਸਪੀਕਿੰਗ ਸਕੋਰ ਕਰ ਸਕਦਾ ਹੈ? ਇਹ ਤੁਹਾਨੂੰ ਇੱਕ ਨੰਬਰ ਦੇਵੇਗਾ। 48 ਅਣਦੇਖੇ, ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰਾਂ ਵਾਲੇ ਜਵਾਬਾਂ ’ਤੇ ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ, GPT 5.6 sol 35% ਵਾਰ, GPT 5.5 37%, luna 31%, GPT-4o mini 45% ਸਹੀ ਸੀ, ਜਦਕਿ Engine 2.0 ਲਈ ਇਹ 81% ਸੀ। ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ’ਤੇ GPT 5.6 sol 25% ਵਾਰ ਸਹੀ ਸੀ।
ਕੀ Prepamigo ChatGPT ਨਾਲੋਂ ਵੱਧ ਸਹੀ ਹੈ? ਸਾਦੀ ਬੇਨਤੀ ਨਾਲ 81% ਬਨਾਮ GPT 5.6 sol ਲਈ 35%। ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਵਾਲੀ ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦੇ ਨਾਲ, GPT 5.6 sol 71% ਤੱਕ ਪਹੁੰਚਿਆ, ਅਜੇ ਵੀ ਦਸ ਪੁਆਇੰਟ ਪਿੱਛੇ।
ਹਰੇਕ ਦੀ ਕੀਮਤ ਕਿੰਨੀ ਹੈ? ChatGPT Pro US$200 ਪ੍ਰਤੀ ਮਹੀਨਾ ਹੈ, ਲਗਭਗ CA$276 ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ; Plus US$20 ਦਾ ਹੈ ਸੁਨੇਹਾ ਸੀਮਾਵਾਂ ਨਾਲ। Prepamigo ਟੈਕਸ ਸਮੇਤ CA$24.98 ਪ੍ਰਤੀ ਮਹੀਨਾ ਹੈ, ਜਾਂ ਸਲਾਨਾ ਪਲਾਨ ’ਤੇ CA$8.25 ਪ੍ਰਤੀ ਮਹੀਨਾ, ਅਸੀਮਿਤ ਸਕੋਰਿੰਗ ਅਤੇ 80 ਪ੍ਰੈਕਟਿਸ ਸੈੱਟਾਂ ਨਾਲ।
ਜੇ ਮੈਂ ChatGPT ਵਰਤਦਾ ਹਾਂ ਤਾਂ ਮੈਨੂੰ ਕਿਹੜਾ GPT ਮਾਡਲ ਵਰਤਣਾ ਚਾਹੀਦਾ ਹੈ? ਸਾਦੇ ਪ੍ਰੌਮਪਟ ਨਾਲ, ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਕੋਈ ਵੀ ਵਧੀਆ ਪ੍ਰਦਰਸ਼ਨ ਨਹੀਂ ਕਰਦਾ। ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਨਾਲ, GPT 5.6 sol। ਜੇ ਤੁਸੀਂ 10 ਦੇ ਨੇੜੇ ਹੋ ਤਾਂ ਕਦੇ ਵੀ GPT-4o mini ਨਹੀਂ।
Claude ਦੇ ਖਿਲਾਫ ਇਹੀ ਤੁਲਨਾ ਲਈ, ਪੜ੍ਹੋ Prepamigo ਬਨਾਮ Claude। ਅੱਠ ਸਿਸਟਮਾਂ ਦੀ ਪੂਰੀ ਲੀਡਰਬੋਰਡ ਲਈ, ਪੜ੍ਹੋ ਕਿਹੜਾ AI CELPIP ਸਪੀਕਿੰਗ ਸਭ ਤੋਂ ਸਹੀ ਸਕੋਰ ਕਰਦਾ ਹੈ। ਜਾਂ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਛੱਡ ਕੇ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰੋ। ਇਹ ਗਾਈਡ ਅੰਗਰੇਜ਼ੀ ਵਿੱਚ ਪੜ੍ਹੋ
