ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ
48 ਹੋਲਡ-ਆਊਟ ਸਪੀਕਿੰਗ ਜਵਾਬ, ਹਰ ਬੈਂਡ 'ਤੇ 16। ਹਰ ਮਾਡਲ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਿੱਤੀ ਗਈ ਅਤੇ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ CELPIP ਸਕੇਲ 'ਤੇ ਇਸ ਨੂੰ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। Engine 2.0 ਆਪਣੀ ਆਮ ਪ੍ਰੋਡਕਸ਼ਨ ਸੰਰਚਨਾ ਵਿੱਚ ਚਲਾਇਆ ਗਿਆ।
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Prepamigo ਬਨਾਮ ਟੌਪ ਚੈਟਬੋਟ ਪਲਾਨ
ਕੈਨੇਡੀਅਨ ਡਾਲਰ ਵਿੱਚ। Prepamigo ਦੀਆਂ ਕੀਮਤਾਂ ਵਿੱਚ ਟੈਕਸ ਸ਼ਾਮਲ ਹੈ। Claude Max (US$100 ਤੋਂ ਸ਼ੁਰੂ) ਅਤੇ ChatGPT Pro (US$200) ਨੂੰ 1.38 ਦੀ ਦਰ ਨਾਲ ਬਦਲਿਆ ਗਿਆ ਹੈ, ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ। ਸ਼ੁੱਧਤਾ ਉਹਨਾਂ ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤਾ ਗਿਆ ਜਦੋਂ ਦੱਸੇ ਗਏ ਮਾਡਲ ਨੂੰ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਜਵਾਬ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।
ਬਹੁਤ ਸਾਰੇ CELPIP ਉਮੀਦਵਾਰ ਹੁਣ ਆਪਣੀ ਸਪੀਕਿੰਗ ਪ੍ਰੈਕਟਿਸ ਨੂੰ ਇੱਕ AI ਚੈਟਬੋਟ ਨਾਲ ਗਰੇਡ ਕਰਦੇ ਹਨ। ਇੱਕ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰੋ, ਇਸ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕਰੋ, ਪੇਸਟ ਕਰੋ, ਸਕੋਰ ਮੰਗੋ। ਇਹ ਤੇਜ਼ ਹੈ ਅਤੇ ਮੁਫ਼ਤ ਜਾਂ ਲਗਭਗ ਮੁਫ਼ਤ ਹੈ, ਅਤੇ ਵਿਆਖਿਆਵਾਂ ਭਰੋਸੇਯੋਗ ਲੱਗਦੀਆਂ ਹਨ। ਕੋਈ ਵੀ ਤੁਹਾਨੂੰ ਇਹ ਨਹੀਂ ਦੱਸਦਾ ਕਿ ਨੰਬਰ ਕਿੰਨੀ ਵਾਰ ਸਹੀ ਹੁੰਦਾ ਹੈ, ਜਾਂ ਕਿਹੜੇ ਮਾਡਲ ’ਤੇ ਭਰੋਸਾ ਕਰਨਾ ਹੈ, ਜਾਂ ਕੀ ਪੁੱਛਣ ਦਾ ਤਰੀਕਾ ਜਵਾਬ ਬਦਲਦਾ ਹੈ। ਅਸੀਂ ਜਾਣਨਾ ਚਾਹੁੰਦੇ ਸੀ, ਇਸ ਲਈ ਅਸੀਂ ਇਹ ਟੈਸਟ ਬਣਾਇਆ ਅਤੇ ਇਸ ਨੂੰ ਅੱਠ ਸਿਸਟਮਾਂ ’ਤੇ, ਦੋ ਤਰੀਕਿਆਂ ਨਾਲ ਚਲਾਇਆ।
ਪਹਿਲਾ ਤਰੀਕਾ ਉੱਪਰ ਦਿੱਤਾ ਚਾਰਟ ਹੈ: ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਪੇਸਟ ਕਰੋ, ਸਕੋਰ ਮੰਗੋ, ਜਿਵੇਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਕਰਦਾ ਹੈ। ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲਾਂ ਵਿੱਚੋਂ, Claude Opus 5 62% ’ਤੇ ਸਭ ਤੋਂ ਸਹੀ ਸੀ, Gemini 58% ’ਤੇ ਇਸ ਤੋਂ ਬਾਅਦ ਰਿਹਾ, ਅਤੇ ਬਾਕੀ ਸਭ ਅੱਧੇ ਤੋਂ ਘੱਟ ਸਨ: Claude Sonnet 5 ਅਤੇ GPT-4o mini 45% ’ਤੇ, GPT 5.5 37% ’ਤੇ, GPT 5.6 sol 35% ’ਤੇ, GPT 5.6 luna 31% ’ਤੇ। ਇੱਕ ਖਾਸ-ਮਕਸਦ ਲਈ ਬਣਾਇਆ ਸਿਸਟਮ, Prepamigo Scoring Engine 2.0, ਉਹੀ ਜਵਾਬਾਂ ’ਤੇ 81% ਤੱਕ ਪਹੁੰਚਿਆ।
ਦੂਜਾ ਤਰੀਕਾ ਉਹ ਹੈ ਜਿਸ ਨੂੰ ਅਸੀਂ ਸਭ ਤੋਂ ਵੱਧ ਜਾਣਕਾਰੀ ਭਰਪੂਰ ਸਮਝਦੇ ਹਾਂ: ਅਸੀਂ ਹਰ ਮਾਡਲ ਨੂੰ ਆਪਣੀ ਗਰੇਡਿੰਗ ਪ੍ਰਕਿਰਿਆ ਦਿੱਤੀ, ਅਸਲ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਅਤੇ ਇੱਕ ਜ਼ਬਰੀ ਤੁਲਨਾ ਸਮੇਤ, ਇਹ ਦੇਖਣ ਲਈ ਕਿ ਹਰੇਕ ਕਿੰਨਾ ਵਧੀਆ ਹੋ ਸਕਦਾ ਹੈ। ਹਰ ਮਾਡਲ ਵਿੱਚ ਸੁਧਾਰ ਹੋਇਆ, ਕੁਝ ਵਿੱਚ ਬਹੁਤ ਜ਼ਿਆਦਾ, ਅਤੇ ਹਰ ਮਾਡਲ ਫਿਰ ਵੀ Engine 2.0 ਤੋਂ ਪਿੱਛੇ ਰਿਹਾ। ਸਾਨੂੰ ਇਹ ਸਾਫ਼ ਕਰ ਦੇਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿ Prepamigo ਸਾਡਾ ਪ੍ਰੋਡਕਟ ਹੈ। ਅਸੀਂ ਦੋਵੇਂ ਟੈਸਟਾਂ ਨੂੰ ਬਾਕੀ ਸਾਰਿਆਂ ਲਈ ਨਿਰਪੱਖ ਬਣਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ ਹੈ, ਅਤੇ ਜਿੱਥੇ ਕੋਈ ਮਾਡਲ ਕਿਸੇ ਖਾਸ ਪੱਧਰ ’ਤੇ ਸਾਡੇ ਤੋਂ ਅੱਗੇ ਨਿਕਲਿਆ, ਅਸੀਂ ਇਹ ਦੱਸਦੇ ਹਾਂ।
ਸਾਦੇ-ਪ੍ਰੌਮਪਟ ਦਾ ਲੀਡਰਬੋਰਡ
ਉੱਪਰ ਦਿੱਤੇ ਚਾਰਟ ਵਿੱਚ ਤਿੰਨ ਪੱਧਰ ਦਿਖਾਈ ਦਿੰਦੇ ਹਨ। Engine 2.0 81% ’ਤੇ ਇਕੱਲਾ ਖੜ੍ਹਾ ਹੈ। Claude Opus 5 62% ’ਤੇ ਅਤੇ Gemini 58% ’ਤੇ ਦੂਜਾ ਪੱਧਰ ਬਣਾਉਂਦੇ ਹਨ: ਵਰਤਣਯੋਗ, ਜੇ ਤੁਸੀਂ ਪੰਜ ਵਿੱਚੋਂ ਦੋ ਵਾਰ ਗਲਤ ਹੋਣਾ ਸਵੀਕਾਰ ਕਰਦੇ ਹੋ। ਬਾਕੀ ਸਭ 50% ਤੋਂ ਹੇਠਾਂ ਹੈ, ਜਿਸ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਜੇ ਤੁਹਾਨੂੰ ਜਵਾਬ ਬਾਰੇ ਕੁਝ ਵੀ ਨਾ ਪਤਾ ਹੁੰਦਾ, ਤਾਂ ਤਿੰਨ ਬੈਂਡਾਂ ਵਿਚਕਾਰ ਸਿੱਕਾ ਸੁੱਟਣ ਨਾਲੋਂ ਵੀ ਬੁਰਾ।
ਇਹੀ ਸਾਦੇ ਟੈਸਟ ਦੀ ਪਰਿਭਾਸ਼ਿਤ ਵਿਸ਼ੇਸ਼ਤਾ ਹੈ: ਹਰ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲ ਸਖ਼ਤੀ ਨਾਲ ਗਰੇਡ ਕਰਦਾ ਹੈ। ਇਨ੍ਹਾਂ ਨੇ ਇੱਕ ਤਸਦੀਕਸ਼ੁਦਾ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਨੂੰ ਦਿੱਤਾ ਗਿਆ ਔਸਤ ਸਕੋਰ 7.2 (luna) ਤੋਂ 8.6 (Opus 5) ਤੱਕ ਸੀ। ਇੱਕ ਤਸਦੀਕਸ਼ੁਦਾ ਹੇਠਲੇ-ਪੱਧਰ ਦੇ ਜਵਾਬ ਨੂੰ ਦਿੱਤਾ ਗਿਆ ਔਸਤ 3.7 ਤੋਂ 4.3 ਤੱਕ ਸੀ, Opus 5 ਅਤੇ Gemini ਤੋਂ ਬਿਨਾਂ ਬਾਕੀ ਸਾਰਿਆਂ ਲਈ ਬੈਂਡ ਤੋਂ ਹੇਠਾਂ। ਹਰ ਪੱਧਰ ਅਸਲ ਵਿੱਚ ਕਿਵੇਂ ਸੁਣਦਾ ਹੈ, ਇਸ ਦੀਆਂ ਕੋਈ ਉਦਾਹਰਣਾਂ ਨਾ ਹੋਣ ਕਰਕੇ, ਮਾਡਲ ਜਵਾਬ ਦੀ ਇੱਕ ਕਲਪਿਤ ਨਿਰਦੋਸ਼ ਜਵਾਬ ਨਾਲ ਤੁਲਨਾ ਕਰਦੇ ਹਨ ਅਤੇ ਅੰਕ ਕੱਟਦੇ ਹਨ।
ਹਰ ਸਕੋਰ ਪੱਧਰ ’ਤੇ ਨਤੀਜੇ
ਇੱਕ ਸਮੁੱਚਾ ਅੰਕੜਾ ਇਹ ਲੁਕਾ ਦਿੰਦਾ ਹੈ ਕਿ ਗਲਤੀਆਂ ਕਿੱਥੇ ਹੁੰਦੀਆਂ ਹਨ, ਅਤੇ ਇਹ ਕਿੱਥੇ ਹੁੰਦੀਆਂ ਹਨ ਇਹੀ ਤੈਅ ਕਰਦਾ ਹੈ ਕਿ ਕੀ ਇੱਕ ਗ੍ਰੇਡਰ ਤੁਹਾਡੇ ਲਈ ਲਾਭਦਾਇਕ ਹੈ। ਇਹ ਹਨ ਬੈਂਡ ਅਨੁਸਾਰ ਸਾਦੇ-ਟੈਸਟ ਦੇ ਨਤੀਜੇ।
ਹੇਠਲੇ-ਪੱਧਰ ਦੇ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ 4 ਜਾਂ 5)
ਹਰ ਸਿਸਟਮ ਲਈ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
75%
GPT-4o mini
56%
Gemini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
44%
Claude Sonnet 5
ਕਮਜ਼ੋਰ ਜਵਾਬ ਸਕੇਲ ਦਾ ਸੌਖਾ ਹਿੱਸਾ ਹੋਣੇ ਚਾਹੀਦੇ ਹਨ, ਅਤੇ ਸਾਦੇ ਪ੍ਰੌਮਪਟ ਨਾਲ ਇਹ ਨਹੀਂ ਹਨ। Engine 2.0 88% ’ਤੇ ਹੈ, Opus 5 77% ’ਤੇ, GPT-4o mini 75% ’ਤੇ। ਬਾਕੀ ਸਭ ਲਗਭਗ ਅੱਧੇ ’ਤੇ ਹੈ, ਅਤੇ Sonnet 5 44% ’ਤੇ ਹੈ। ਗਲਤੀ ਲਗਭਗ ਹਮੇਸ਼ਾ ਇੱਕ 3 ਹੁੰਦੀ ਹੈ: ਮਾਡਲ ਇੱਕ ਕਮਜ਼ੋਰ ਜਵਾਬ ਦੇਖਦਾ ਹੈ ਅਤੇ ਇਸ ਨੂੰ ਬੈਂਡ ਦੇ ਅੰਦਰ ਦੀ ਥਾਂ ਇਸ ਤੋਂ ਹੇਠਾਂ ਸਕੋਰ ਕਰਦਾ ਹੈ। GPT-4o mini ਦਾ ਇਹ ਸਤਿਕਾਰਯੋਗ ਅੰਕੜਾ ਇਸ ਦੀ ਸਮੱਸਿਆ ਦਾ ਪਹਿਲਾ ਸੰਕੇਤ ਹੈ, ਜੋ ਇਹ ਹੈ ਕਿ ਇਹ ਲਗਭਗ ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਹੈ।
ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ 7 ਜਾਂ 8)
ਹਰ ਸਿਸਟਮ ਲਈ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।
85%
Prepamigo Engine 2.0
63%
Gemini
63%
Claude Sonnet 5
58%
Claude Opus 5
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
ਮੱਧ ਬੈਂਡ ਖੇਤਰ ਨੂੰ ਵੱਖ ਕਰਦਾ ਹੈ। Engine 2.0 85% ’ਤੇ ਹੈ। Gemini ਅਤੇ Sonnet 5 63% ’ਤੇ ਹਨ, Opus 5 58% ’ਤੇ। ਫਿਰ ਇੱਕ ਗਿਰਾਵਟ: GPT-4o mini 44% ’ਤੇ ਅਤੇ ਤਿੰਨ ਵੱਡੇ GPT ਮਾਡਲ 27% ਤੋਂ 29% ’ਤੇ। ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ਵਿੱਚ ਤਾਕਤਾਂ ਅਤੇ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਇੱਕ ਅਸਲ ਮਿਸ਼ਰਣ ਹੁੰਦਾ ਹੈ ਜਿਸ ਨੂੰ ਤੋਲਣਾ ਪੈਂਦਾ ਹੈ, ਅਤੇ ਤੋਲਣ ਲਈ ਕੁਝ ਵੀ ਨਾ ਹੋਣ ਕਰਕੇ, GPT ਮਾਡਲ ਕਮਜ਼ੋਰੀਆਂ ਦੇਖਦੇ ਹਨ ਅਤੇ 5 ਜਾਂ 6 ਦੇ ਦਿੰਦੇ ਹਨ। ਇੱਕ 7 ਜਾਂ 8 ਵਾਲਾ ਬੋਲਣ ਵਾਲਾ GPT 5.6 sol ਤੋਂ ਸਕੋਰ ਮੰਗਣ ’ਤੇ ਦਸਾਂ ਵਿੱਚੋਂ ਤਿੰਨ ਵਾਰ ਤੋਂ ਵੀ ਘੱਟ ਸਹੀ ਬੈਂਡ ਸੁਣੇਗਾ।
ਟੌਪ-ਲੈਵਲ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ 10 ਜਾਂ ਵੱਧ)
ਹਰ ਸਿਸਟਮ ਲਈ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। ਲਗਭਗ ਹਰ ਗਲਤੀ ਇੱਕ 7 ਜਾਂ 8 ਹੈ।
71%
Prepamigo Engine 2.0
56%
Gemini
50%
Claude Opus 5
29%
Claude Sonnet 5
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
ਟੌਪ ਬੈਂਡ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ ਫਰਕ ਸਭ ਤੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦੇ ਹਨ, ਅਤੇ ਜਿੱਥੇ ਸਾਦਾ ਪ੍ਰੌਮਪਟ ਸਭ ਤੋਂ ਵੱਧ ਨੁਕਸਾਨ ਕਰਦਾ ਹੈ। Engine 2.0 71% ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਪਛਾਣਦਾ ਹੈ। Gemini 56% ਪਛਾਣਦਾ ਹੈ ਅਤੇ Opus 5 ਠੀਕ ਅੱਧੇ। ਫਿਰ Sonnet 5 29% ’ਤੇ, GPT 5.5 27% ’ਤੇ, GPT 5.6 sol 25% ’ਤੇ, GPT-4o mini 17% ’ਤੇ ਅਤੇ GPT 5.6 luna 13% ’ਤੇ। ਸੱਤ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲਾਂ ਵਿੱਚੋਂ ਪੰਜ ਹਰ ਦਸ ਵਿੱਚੋਂ ਘੱਟੋ-ਘੱਟ ਸੱਤ ਜਵਾਬਾਂ ਨੂੰ, ਜੋ 10 ਦੇ ਹੱਕਦਾਰ ਹਨ, 7 ਜਾਂ 8 ਦੇ ਦਿੰਦੇ ਹਨ।
ਜੇ ਤੁਸੀਂ ਇੱਕ ਮਜ਼ਬੂਤ ਉਮੀਦਵਾਰ ਹੋ ਜੋ ਆਪਣੇ ਆਪ ਨੂੰ ਚੈਟਬੋਟ ਨਾਲ ਗਰੇਡ ਕਰਦਾ ਹੈ, ਤਾਂ ਇਹ ਯਾਦ ਰੱਖਣ ਵਾਲਾ ਅੰਕੜਾ ਹੈ। GPT 5.6 sol ਨੂੰ ਸਾਦੀ ਬੇਨਤੀ ਕਰਨ ’ਤੇ ਇਹ ਤੁਹਾਨੂੰ ਦੱਸੇ ਕਿ ਇੱਕ 10 ਅਸਲ ਵਿੱਚ 10 ਹੈ, ਇਸ ਦੀ ਸੰਭਾਵਨਾ ਚਾਰ ਵਿੱਚੋਂ ਇੱਕ ਹੈ।
ਦੂਜਾ ਲੀਡਰਬੋਰਡ: ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦਿੱਤੇ ਜਾਣ ’ਤੇ
ਸਾਦੇ-ਟੈਸਟ ਦੇ ਅੰਕੜੇ ਇਸ ਗੱਲ ਦਾ ਫੈਸਲਾ ਨਹੀਂ ਹਨ ਕਿ ਇਹ ਮਾਡਲ ਕਿੰਨੇ ਸਮਾਰਟ ਹਨ। ਇਹ ਇਸ ਗੱਲ ਦਾ ਫੈਸਲਾ ਹਨ ਕਿ ਜਦੋਂ ਇੱਕ ਮਾਡਲ ਤੋਂ ਬਿਨਾਂ ਕਿਸੇ ਤੁਲਨਾ ਦੇ ਨੰਬਰ ਮੰਗਿਆ ਜਾਂਦਾ ਹੈ ਤਾਂ ਕੀ ਹੁੰਦਾ ਹੈ। ਇਸ ਲਈ ਅਸੀਂ ਦੂਜਾ ਟੈਸਟ ਚਲਾਇਆ, ਹਰ ਮਾਡਲ ਨੂੰ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਅਤੇ ਉਹ ਜ਼ਬਰੀ ਤੁਲਨਾ ਦਿੱਤੀ ਜੋ Engine 2.0 ਦੇ ਆਪਣੇ ਗ੍ਰੇਡਰ ਵਰਤਦੇ ਹਨ।
ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦਿੱਤੇ ਜਾਣ 'ਤੇ: ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ
ਉਹੀ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ। ਹਰ ਸਿਸਟਮ ਲਈ ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਹਦਾਇਤਾਂ ਅਤੇ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ; ਹਰ ਮਾਡਲ ਨੇ ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਵਾਰ ਗਰੇਡ ਕੀਤਾ। Gemini ਨੂੰ ਆਡੀਓ ਵੀ ਦਿੱਤੀ ਗਈ।
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
71%
GPT 5.6 sol
71%
Gemini
69%
GPT 5.5
69%
Claude Sonnet 5
63%
GPT 5.6 luna
50%
GPT-4o mini
ਹਰ ਮਾਡਲ ਵਿੱਚ ਸੁਧਾਰ ਹੁੰਦਾ ਹੈ। Opus 5 62% ਤੋਂ 77% ਤੱਕ ਜਾਂਦਾ ਹੈ। GPT 5.6 sol ਦੁੱਗਣਾ ਹੋ ਜਾਂਦਾ ਹੈ, 35% ਤੋਂ 71% ਤੱਕ। GPT 5.5 37% ਤੋਂ 69% ਤੱਕ ਜਾਂਦਾ ਹੈ, Sonnet 5 45% ਤੋਂ 69% ਤੱਕ, luna 31% ਤੋਂ 63% ਤੱਕ, Gemini 58% ਤੋਂ 71% ਤੱਕ। GPT-4o mini ਮੁਸ਼ਕਿਲ ਨਾਲ ਹਿੱਲਦਾ ਹੈ, 45% ਤੋਂ 50% ਤੱਕ, ਕਿਉਂਕਿ ਇਹ ਜੋ ਵੀ ਦਿਖਾਇਆ ਜਾਵੇ, ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਹੈ।
ਕ੍ਰਮ ਵੀ ਬਦਲ ਜਾਂਦਾ ਹੈ। ਸਾਦੇ ਪ੍ਰੌਮਪਟ ਨਾਲ, Claude ਮਾਡਲ GPT ਮਾਡਲਾਂ ਤੋਂ ਬਹੁਤ ਅੱਗੇ ਸਨ। ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ, GPT 5.6 sol Sonnet 5 ਤੋਂ ਅੱਗੇ ਨਿਕਲ ਜਾਂਦਾ ਹੈ ਅਤੇ Gemini ਨਾਲ ਬਰਾਬਰ ਹੋ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਚਾਰ ਮਾਡਲ 69% ਅਤੇ 71% ਦੇ ਵਿਚਕਾਰ ਇਕੱਠੇ ਹੋ ਜਾਂਦੇ ਹਨ, ਜੋ ਇਸ ਸੈਂਪਲ ’ਤੇ ਅੰਕੜਾਤਮਕ ਤੌਰ ’ਤੇ ਵੱਖ ਨਹੀਂ ਕੀਤੇ ਜਾ ਸਕਦੇ। Opus 5 77% ’ਤੇ ਜਨਰਲ-ਪਰਪਸ ਖੇਤਰ ਦੇ ਸਿਖਰ ’ਤੇ ਰਹਿੰਦਾ ਹੈ, Engine 2.0 ਤੋਂ ਚਾਰ ਪੁਆਇੰਟ ਪਿੱਛੇ।
ਪੱਧਰ-ਦਰ-ਪੱਧਰ ਦੇਖਣ ’ਤੇ, ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਚਾਰ ਮਾਡਲਾਂ ਲਈ ਹੇਠਲੇ-ਬੈਂਡ ਦੀ ਸ਼ੁੱਧਤਾ ਨੂੰ 88% ਤੱਕ ਵਧਾ ਦਿੰਦੀ ਹੈ, Engine 2.0 ਜਿੰਨੀ, ਅਤੇ ਦੋ Claude ਮਾਡਲਾਂ ਲਈ ਮੱਧ-ਬੈਂਡ ਦੀ ਸ਼ੁੱਧਤਾ ਨੂੰ 81% ਤੱਕ। ਟੌਪ ਬੈਂਡ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ ਫਰਕ ਬਣਿਆ ਰਹਿੰਦਾ ਹੈ: Opus 5, GPT 5.6 sol, Gemini ਅਤੇ GPT 5.5 ਸਾਰੇ 63% ’ਤੇ ਰੁਕ ਜਾਂਦੇ ਹਨ, Sonnet 5 38% ’ਤੇ, ਅਤੇ GPT-4o mini ਜ਼ੀਰੋ ’ਤੇ, Engine 2.0 ਦੇ 71% ਦੇ ਮੁਕਾਬਲੇ। ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਕਰਨ ਵਾਲਾ ਇੱਕ ਸਿੰਗਲ ਮਾਡਲ ਫਿਰ ਵੀ ਇੱਕ ਗਲਤੀ ਵਾਲੇ ਮਜ਼ਬੂਤ ਜਵਾਬ ’ਤੇ ਰੁਕ ਜਾਂਦਾ ਹੈ। Engine 2.0 ਇਸ ਬਾਕੀ ਬਚੇ ਫਰਕ ਨੂੰ ਵੱਖ-ਵੱਖ ਪ੍ਰੋਵਾਈਡਰਾਂ ਦੇ ਦੋ ਸੁਤੰਤਰ ਗ੍ਰੇਡਰਾਂ ਨਾਲ, ਹਰੇਕ ਤੋਂ ਤਿੰਨ ਵੋਟਾਂ ਜਿਨ੍ਹਾਂ ਵਿੱਚੋਂ ਵਿਚਕਾਰਲੀ ਰੱਖੀ ਜਾਂਦੀ ਹੈ, ਅਤੇ ਇੱਕ ਸੁਲ੍ਹਾ ਨਿਯਮ ਨਾਲ ਬੰਦ ਕਰਦਾ ਹੈ ਜੋ ਦੋ ਗ੍ਰੇਡਰਾਂ ਦੇ ਸਖ਼ਤ ਅਸਹਿਮਤ ਹੋਣ ’ਤੇ ਵੱਧ ਸਕੋਰ ਲੈਂਦਾ ਹੈ, ਕਿਉਂਕਿ ਵਿਸ਼ਲੇਸ਼ਣ ਨੇ ਦਿਖਾਇਆ ਕਿ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ’ਤੇ ਹੇਠਲਾ ਫੈਸਲਾ ਲਗਭਗ ਹਮੇਸ਼ਾ ਗਲਤ ਹੁੰਦਾ ਸੀ।
ਮਾਡਲ ਘੱਟ ਅਤੇ ਵਿਚਕਾਰ ਵੱਲ ਕਿਉਂ ਖਿਸਕਦੇ ਹਨ
ਇਹ ਪੈਟਰਨ ਤਿੰਨ ਵੱਖ-ਵੱਖ ਕੰਪਨੀਆਂ ਦੇ ਮਾਡਲਾਂ ਵਿੱਚ ਇੰਨਾ ਇਕਸਾਰ ਹੈ ਕਿ ਇਹ ਕਿਸੇ ਇੱਕ ਦੀ ਖਾਸੀਅਤ ਨਹੀਂ ਹੋ ਸਕਦਾ। ਇਹ ਟਾਸਕ ਦੀ ਹੀ ਇੱਕ ਵਿਸ਼ੇਸ਼ਤਾ ਹੈ।
ਜਦੋਂ ਇੱਕ ਮਾਡਲ ਨੂੰ ਇੱਕ ਜਵਾਬ ਨੂੰ ਸਕੇਲ ’ਤੇ ਰੱਖਣ ਲਈ ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਜਦੋਂ ਇਹ ਯਕੀਨੀ ਨਹੀਂ ਹੁੰਦਾ ਤਾਂ ਇਹ ਕੇਂਦਰ ਵੱਲ ਝੁਕਦਾ ਹੈ, ਕਿਉਂਕਿ ਕੇਂਦਰ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ ਇੱਕ ਗਲਤ ਜਵਾਬ ਦੀ ਸਭ ਤੋਂ ਘੱਟ ਕੀਮਤ ਪੈਂਦੀ ਹੈ। ਅਤੇ ਜਦੋਂ ਇਸ ਕੋਲ ਇਹ ਦੇਖਣ ਲਈ ਕੋਈ ਉਦਾਹਰਣ ਨਹੀਂ ਹੁੰਦੀ ਕਿ ਇੱਕ ਪੱਧਰ ਅਸਲ ਵਿੱਚ ਕਿਵੇਂ ਸੁਣਦਾ ਹੈ, ਤਾਂ ਇਹ ਜਵਾਬ ਦੀ ਇੱਕ ਕਲਪਿਤ ਨਿਰਦੋਸ਼ ਜਵਾਬ ਨਾਲ ਤੁਲਨਾ ਕਰਦਾ ਹੈ ਅਤੇ ਹਰ ਗਲਤੀ ਲਈ ਅੰਕ ਕੱਟਦਾ ਹੈ। ਇੱਕ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਕਦੇ ਵੀ ਪੂਰੀ ਤਰ੍ਹਾਂ ਨਿਰਦੋਸ਼ ਨਹੀਂ ਹੁੰਦਾ। ਇਸ ਵਿੱਚ ਇੱਕ ਰੀਸਟਾਰਟ, ਗੁੰਝਲਦਾਰ ਵਾਕਾਂ ਵਿਚਕਾਰ ਇੱਕ ਸਾਦਾ ਵਾਕ, ਇੱਕ ਔਖੇ ਸ਼ਬਦ ਤੋਂ ਪਹਿਲਾਂ ਇੱਕ ਝਿਜਕ ਹੁੰਦੀ ਹੈ। ਨਿਰਦੋਸ਼ਤਾ ਦੇ ਮੁਕਾਬਲੇ ਮਾਪਣ ’ਤੇ, ਇਹ ਗਲਤੀਆਂ ਇੱਕ ਜਾਂ ਦੋ ਅੰਕ ਖਾ ਲੈਂਦੀਆਂ ਹਨ, ਅਤੇ ਇੱਕ 10, 8 ਜਾਂ 7 ਬਣ ਜਾਂਦਾ ਹੈ।
ਹਦਾਇਤਾਂ ਇਸ ਨੂੰ ਠੀਕ ਨਹੀਂ ਕਰਦੀਆਂ। ਅਸੀਂ ਮਾਡਲਾਂ ਨੂੰ ਸਪੱਸ਼ਟ ਤੌਰ ’ਤੇ ਦੱਸਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ ਕਿ ਇੱਕ ਪੱਧਰ 9 ਨੂੰ ਗਲਤੀ-ਰਹਿਤ ਜਵਾਬ ਦੀ ਲੋੜ ਨਹੀਂ, ਕਿ ਇੱਕ ਮਜ਼ਬੂਤ ਜਵਾਬ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਨਾ ਇੱਕ ਕਮਜ਼ੋਰ ਜਵਾਬ ਨੂੰ ਵੱਧ ਸਕੋਰ ਕਰਨ ਜਿੰਨਾ ਹੀ ਗੰਭੀਰ ਹੈ। ਹਰ ਹਦਾਇਤ ਸਵੀਕਾਰ ਕੀਤੀ ਗਈ ਅਤੇ ਫਿਰ ਅਮਲ ਵਿੱਚ ਨਜ਼ਰਅੰਦਾਜ਼ ਕੀਤੀ ਗਈ। ਜਦੋਂ ਅਸੀਂ ਇੱਕ ਮਾਡਲ ਨੂੰ ਉਹੀ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣ ਦਿੱਤੀ ਜਿਸ ਨੂੰ ਇਹ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਦੱਸਿਆ ਗਿਆ ਸੀ ਅਤੇ ਇਸ ਨੂੰ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ, ਤਾਂ ਇਸ ਨੇ ਇਸ ਨੂੰ 8 ਦਿੱਤਾ।
ਜੋ ਇਸ ਨੂੰ ਜ਼ਿਆਦਾਤਰ ਠੀਕ ਕਰਦਾ ਹੈ, ਉਹ ਹੈ ਸਵਾਲ ਨੂੰ “ਕਿਹੜਾ ਨੰਬਰ?” ਤੋਂ “ਕਿਹੜੀ ਉਦਾਹਰਣ?” ਵਿੱਚ ਬਦਲਣਾ ਅਤੇ ਅਸਲ ਉਦਾਹਰਣਾਂ ਦੇਣਾ। ਇਹੀ ਦੋਵੇਂ ਲੀਡਰਬੋਰਡਾਂ ਵਿਚਕਾਰ ਫਰਕ ਹੈ। ਫਿਰ ਵੀ, ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਥੋੜ੍ਹਾ ਖਿਸਕਦਾ ਰਹਿੰਦਾ ਹੈ, ਕਿਉਂਕਿ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਨਿਰਦੋਸ਼ ਨਹੀਂ ਹੁੰਦੀਆਂ ਅਤੇ ਇਨ੍ਹਾਂ ਦੀ ਇੱਕ ਰੀਡਿੰਗ ਸਿਰਫ਼ ਇੱਕ ਰੀਡਿੰਗ ਹੁੰਦੀ ਹੈ। ਦੋ ਗ੍ਰੇਡਰ, ਤਿੰਨ ਵੋਟਾਂ ਅਤੇ ਇੱਕ ਸੁਲ੍ਹਾ ਨਿਯਮ ਬਾਕੀ ਬਚੇ ਫਰਕ ਨੂੰ ਬੰਦ ਕਰਦੇ ਹਨ।
ਹਰ ਮਾਡਲ ’ਤੇ ਨੋਟਸ
- Claude Opus 5. ਦੋਵੇਂ ਟੈਸਟਾਂ ’ਤੇ ਸਭ ਤੋਂ ਵਧੀਆ ਜਨਰਲ-ਪਰਪਸ ਗ੍ਰੇਡਰ: ਸਾਦੇ ਤੌਰ ’ਤੇ 62% (ਤਿੰਨ ਰਨਾਂ ਵਿੱਚ 62%, 65% ਅਤੇ 58%) ਅਤੇ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ 77%। ਇਸ ਦੀ ਸਾਦੇ-ਪ੍ਰੌਮਪਟ ਕਮਜ਼ੋਰੀ ਮੱਧ ਬੈਂਡ ਹੈ, ਜਿੱਥੇ ਇਹ 6 ਦੇ ਦਿੰਦਾ ਹੈ; ਇਸ ਦੀ ਪੂਰੀ-ਪ੍ਰਕਿਰਿਆ ਕਮਜ਼ੋਰੀ ਟੌਪ ਬੈਂਡ ਹੈ, ਜਿੱਥੇ ਇਹ 63% ’ਤੇ ਰੁਕ ਜਾਂਦਾ ਹੈ। ਇਹ ਇੱਥੇ ਸਭ ਤੋਂ ਮਹਿੰਗਾ ਮਾਡਲ ਵੀ ਹੈ, ਵੱਡੇ ਫਰਕ ਨਾਲ।
- Gemini. ਸਾਦੇ ਟੈਸਟ ’ਤੇ 58% ਨਾਲ ਦੂਜੇ ਸਥਾਨ ’ਤੇ, ਸਾਰੀਆਂ ਤਿੰਨ ਰਨਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ, ਅਤੇ ਬੈਂਡਾਂ ਵਿੱਚ ਸਭ ਤੋਂ ਸਮਾਨ, 56%, 63% ਅਤੇ 56% ਨਾਲ। ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਅਤੇ ਆਡੀਓ ਰਿਕਾਰਡਿੰਗ ਨਾਲ ਇਹ 71% ਤੱਕ ਪਹੁੰਚਿਆ, GPT 5.6 sol ਦੇ ਬਰਾਬਰ, ਜਿਸ ਨੇ ਸਿਰਫ਼ ਟੈਕਸਟ ਤੋਂ ਕੰਮ ਕੀਤਾ। ਰਿਕਾਰਡਿੰਗ ਸੁਣਨ ਨਾਲ ਇਸ ਨੂੰ ਉਸ ਤੋਂ ਵੱਧ ਕੋਈ ਮਦਦ ਨਹੀਂ ਮਿਲੀ ਜੋ ਇੱਕ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਿੰਦੀ ਹੈ।
- Claude Sonnet 5. ਸਾਦੇ ਤੌਰ ’ਤੇ 45%, ਇੱਕ ਅਜੀਬ ਪ੍ਰੋਫਾਈਲ ਨਾਲ: ਮੱਧ ਬੈਂਡ ਵਿੱਚ 63% ’ਤੇ ਵਾਜਬ, ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ’ਤੇ 44% ’ਤੇ ਖ਼ਰਾਬ ਕਿਉਂਕਿ ਇਹ ਇਨ੍ਹਾਂ ਨੂੰ 3 ਦਿੰਦਾ ਹੈ, ਅਤੇ ਟੌਪ ’ਤੇ 29% ’ਤੇ ਖ਼ਰਾਬ। ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ ਇਹ 69% ਤੱਕ ਚੜ੍ਹਦਾ ਹੈ ਪਰ ਟੌਪ-ਲੈਵਲ ਜਵਾਬਾਂ ’ਤੇ 38% ’ਤੇ ਰਹਿੰਦਾ ਹੈ। ਜੇ Sonnet 5 ਤੁਹਾਨੂੰ 8 ਦਿੰਦਾ ਰਹਿੰਦਾ ਹੈ, ਤਾਂ ਇਸ ’ਤੇ ਭਰੋਸਾ ਨਾ ਕਰੋ।
- GPT-4o mini. ਸਾਦੇ ਤੌਰ ’ਤੇ 45%, ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ 50%, ਅਤੇ ਦੋਵਾਂ ਹਾਲਤਾਂ ਵਿੱਚ ਇਹ ਨੰਬਰ ਇਸ ਨੂੰ ਵਧੀਆ ਦਿਖਾਉਂਦਾ ਹੈ। ਇਹ ਲਗਭਗ ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਹੈ: ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ’ਤੇ 75%, ਟੌਪ-ਲੈਵਲ ਵਾਲਿਆਂ ’ਤੇ 17% ਅਤੇ ਫਿਰ 0%। ਜੋ ਵੀ ਕਰੋ, ਆਪਣੀ ਸਪੀਕਿੰਗ ਇਸ ਮਾਡਲ ਨਾਲ ਗਰੇਡ ਨਾ ਕਰੋ।
- GPT 5.5. ਸਾਦੇ ਤੌਰ ’ਤੇ 37% (35%, 42%, 33%), ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ 69%। ਇਸ ਦਾ ਸਾਦਾ-ਪ੍ਰੌਮਪਟ ਮੱਧ ਬੈਂਡ 29% ਹੈ। ਇਹ ਸਾਡੀ ਆਪਣੀ ਪਾਈਪਲਾਈਨ ਦੇ ਪਹਿਲੇ ਵਰਜਨ ਵਿੱਚ ਟੈਕਸਟ ਗ੍ਰੇਡਰ ਸੀ ਅਤੇ ਇਸੇ ਬੈਂਡ ਵਿੱਚ ਕਮਜ਼ੋਰੀ ਕਾਰਨ ਬਦਲ ਦਿੱਤਾ ਗਿਆ ਸੀ।
- GPT 5.6 sol. ਸਾਦੇ ਤੌਰ ’ਤੇ 35% (31%, 40%, 35%), ਕਿਸੇ ਵੀ ਮਾਡਲ ਦਾ ਸਭ ਤੋਂ ਵੱਡਾ ਰਨ-ਦਰ-ਰਨ ਬਦਲਾਅ, ਅਤੇ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ 71%, ਕਿਸੇ ਵੀ ਮਾਡਲ ਦਾ ਸਭ ਤੋਂ ਵੱਡਾ ਸੁਧਾਰ। ਉਦਾਹਰਣਾਂ ਦਿਖਾਏ ਜਾਣ ’ਤੇ ਇੱਕ ਸਮਰੱਥ ਗ੍ਰੇਡਰ, ਅਤੇ ਨਾ ਦਿਖਾਏ ਜਾਣ ’ਤੇ ਇੱਕ ਖ਼ਰਾਬ ਗ੍ਰੇਡਰ। ਇਸ ਦੀ ਪੂਰੀ-ਪ੍ਰਕਿਰਿਆ ਵਾਲੀ ਆਦਤ ਮੱਧ ਬੈਂਡ ਵਿੱਚ ਨਿਪੁੰਨਤਾ ਨੂੰ ਵੱਧ ਇਨਾਮ ਦੇਣਾ ਹੈ।
- GPT 5.6 luna. ਦੋਵੇਂ ਟੈਸਟਾਂ ’ਤੇ ਸਭ ਤੋਂ ਪਿੱਛੇ: ਸਾਦੇ ਤੌਰ ’ਤੇ 31% ਅਤੇ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ 63%। ਇਹ ਮੱਧ ਜਵਾਬਾਂ ਨੂੰ 5 ਵੱਲ ਖਿੱਚਦਾ ਹੈ ਅਤੇ ਸਾਦੇ ਤੌਰ ’ਤੇ ਸਿਰਫ਼ 13% ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਪਛਾਣੇ। ਇੱਕ ਦੋ-ਗ੍ਰੇਡਰ ਸਿਸਟਮ ਦੇ ਅੰਦਰ ਦੂਜੀ ਰਾਏ ਵਜੋਂ ਲਾਭਦਾਇਕ ਹੋਣ ਲਈ ਕਾਫ਼ੀ ਸਸਤਾ; ਇਕੱਲੇ ਵਰਤਣ ਲਈ ਕਾਫ਼ੀ ਸਹੀ ਨਹੀਂ।
ਇੱਕ ਖਾਸ-ਮਕਸਦ ਲਈ ਬਣਾਇਆ ਸਿਸਟਮ ਕੀ ਜੋੜਦਾ ਹੈ
Engine 2.0 ਕੋਈ ਬਿਹਤਰ ਮਾਡਲ ਨਹੀਂ ਹੈ। ਇਹ ਇਸੇ ਲੀਡਰਬੋਰਡ ਦੇ ਮਾਡਲ ਵਰਤਦਾ ਹੈ। ਇਹ ਜੋ ਜੋੜਦਾ ਹੈ ਉਹ ਪ੍ਰਕਿਰਿਆ ਹੈ, ਅਤੇ ਇਸ ਪ੍ਰਕਿਰਿਆ ਦਾ ਹਰ ਹਿੱਸਾ ਮਾਪ ਦੁਆਰਾ ਚੁਣਿਆ ਗਿਆ ਸੀ।
- ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ, ਆਟੋਮੈਟਿਕ ਤੌਰ ’ਤੇ। ਹਰ ਫਿਲਰ ਅਤੇ ਰੀਸਟਾਰਟ ਰੱਖਿਆ ਜਾਂਦਾ ਹੈ, ਕਿਉਂਕਿ ਇਨ੍ਹਾਂ ਨੂੰ ਹਟਾਉਣ ਨਾਲ ਟੈਸਟਿੰਗ ਵਿੱਚ ਸ਼ੁੱਧਤਾ ਪੰਦਰਾਂ ਪੁਆਇੰਟ ਘੱਟ ਗਈ। ਤੁਹਾਨੂੰ ਅਜਿਹਾ ਕਰਨ ਵਾਲਾ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਟੂਲ ਲੱਭਣ ਦੀ ਲੋੜ ਨਹੀਂ; ਜ਼ਿਆਦਾਤਰ ਖਪਤਕਾਰ ਟੂਲ ਡਿਫਾਲਟ ਤੌਰ ’ਤੇ ਇਨ੍ਹਾਂ ਨੂੰ ਸਾਫ਼ ਕਰ ਦਿੰਦੇ ਹਨ।
- ਹਰ ਟਾਸਕ ਨਾਲ ਜੁੜੀਆਂ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ। ਅੱਠ ਟਾਸਕ ਕਿਸਮਾਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ ਹਰ ਪੱਧਰ ’ਤੇ ਦੋ ਅਸਲ ਜਵਾਬ, ਪਹਿਲਾਂ ਹੀ ਥਾਂ ’ਤੇ। ਇਹ ਉਹ ਇੱਕਲਾ ਇਨਪੁਟ ਹੈ ਜਿਸ ਨੇ GPT 5.6 sol ਦੀ ਸ਼ੁੱਧਤਾ ਦੁੱਗਣੀ ਕੀਤੀ, ਅਤੇ ਉਹ ਜੋ ਤੁਸੀਂ ਘਰ ਬੈਠੇ ਤਿਆਰ ਨਹੀਂ ਕਰ ਸਕਦੇ।
- ਇੱਕ ਤੁਲਨਾ, ਨੰਬਰ ਨਹੀਂ। ਹਰ ਗ੍ਰੇਡਰ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਹਰੇਕ ’ਤੇ ਸਭ ਤੋਂ ਨੇੜਲੀ ਉਦਾਹਰਣ ਦਾ ਨਾਮ ਦਿੰਦਾ ਹੈ; ਸਕੋਰ ਇੱਕ ਨਿਯਮ ਦੁਆਰਾ ਇਸ ਦੇ ਪਿੱਛੇ ਆਉਂਦਾ ਹੈ। ਇਹੀ ਖਿਸਕਣ ਨੂੰ ਰੋਕਦਾ ਹੈ।
- ਦੋ ਪ੍ਰੋਵਾਈਡਰਾਂ ਤੋਂ ਦੋ ਗ੍ਰੇਡਰ। ਵੱਖ-ਵੱਖ ਮਾਡਲਾਂ ਦੇ ਵੱਖ-ਵੱਖ ਬਲਾਈਂਡ ਸਪੌਟ ਹੁੰਦੇ ਹਨ। ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਦੋ, ਇੱਕ ਤੈਅ ਨਿਯਮ ਨਾਲ ਮੇਲ ਖਾਂਦੇ, ਕਿਸੇ ਵੀ ਇਕੱਲੇ ਨਾਲੋਂ ਵਧੀਆ ਹਨ।
- ਹਰੇਕ ਤੋਂ ਤਿੰਨ ਵੋਟਾਂ, ਵਿਚਕਾਰਲੀ ਰੱਖੀ ਜਾਂਦੀ ਹੈ। ਇਸ ਨਾਲ ਸ਼ੁੱਧਤਾ ਨਹੀਂ ਵਧੀ, ਪਰ ਇਸ ਨੇ ਰਨ-ਦਰ-ਰਨ ਇਕਸਾਰਤਾ ਨੂੰ 77% ਤੋਂ 87.5% ਤੱਕ ਲੈ ਗਿਆ। ਇੱਕ ਸਿੰਗਲ ਚੈਟਬੋਟ ਜਵਾਬ ਇੱਕ ਸਿੰਗਲ ਵੋਟ ਹੁੰਦਾ ਹੈ।
- ਸੁਲ੍ਹਾ ਜੋ ਸਖ਼ਤ ਅਸਹਿਮਤੀ ’ਤੇ ਵੱਧ ਸਕੋਰ ਲੈਂਦੀ ਹੈ। ਕਿਉਂਕਿ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ’ਤੇ ਹੇਠਲਾ ਫੈਸਲਾ ਲਗਭਗ ਹਮੇਸ਼ਾ ਗਲਤ ਹੁੰਦਾ ਸੀ। ਟੈਸਟਿੰਗ ਵਿੱਚ ਇੱਕ ਸਾਦੀ ਔਸਤ ਮੱਧ-ਸੱਠਵਿਆਂ ਤੱਕ ਡਿੱਗ ਗਈ।
- ਸੁਰੱਖਿਆ ਉਪਾਅ। ਖਾਮੋਸ਼ੀ, ਕੁਝ ਸ਼ਬਦ, ਵਿਸ਼ੇ ਤੋਂ ਬਾਹਰ ਅਤੇ ਗੈਰ-ਅੰਗਰੇਜ਼ੀ ਜਵਾਬਾਂ ਨੂੰ ਮਾਡਲ ਦੇ ਅੰਦਾਜ਼ੇ ਦੀ ਥਾਂ ਨਿਯਮ ਦੁਆਰਾ ਫਲੋਰ ਸਕੋਰ ਮਿਲਦੇ ਹਨ।
ਨਤੀਜਾ ਹੈ ਸਮੁੱਚੇ ਤੌਰ ’ਤੇ 81% ਅਤੇ ਟੌਪ ’ਤੇ 71%, ਤਿੰਨ ਵੱਖਰੀਆਂ ਰਨਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ, ਹਰ ਜਵਾਬ ’ਤੇ ਲਗਭਗ ਦਸ ਸਕਿੰਟਾਂ ਵਿੱਚ, ਬਿਨਾਂ ਕੁਝ ਪੇਸਟ ਕੀਤੇ।
ਜੇ ਤੁਸੀਂ ਫਿਰ ਵੀ ਚੈਟਬੋਟ ਵਰਤਣ ਜਾ ਰਹੇ ਹੋ
ਕੁਝ ਪਾਠਕ ਚੈਟਬੋਟ ਨਾਲ ਗਰੇਡ ਕਰਦੇ ਰਹਿਣਗੇ, ਅਤੇ ਇਹ ਇੱਕ ਸੀਮਿਤ ਬਜਟ ਵਾਲੇ ਉਮੀਦਵਾਰ ਲਈ ਜਾਂ ਉਹ ਜੋ ਆਪਣੇ ਜਵਾਬਾਂ ’ਤੇ ਗੱਲ ਕਰਨਾ ਚਾਹੁੰਦਾ ਹੈ, ਲਈ ਇੱਕ ਵਾਜਬ ਚੋਣ ਹੈ। ਇਹ ਕਦਮ ਦੋਵੇਂ ਲੀਡਰਬੋਰਡਾਂ ਵਿਚਕਾਰਲਾ ਫਰਕ ਹਨ, ਅਤੇ ਇਹ ਤੁਹਾਨੂੰ ਪਹਿਲੇ ਨਾਲੋਂ ਦੂਜੇ ਦੇ ਵੱਧ ਨੇੜੇ ਲੈ ਜਾਣਗੇ।
- ਇੱਕ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਵਰਤੋ। ਆਪਣੇ ਫਿਲਰ, ਰੀਸਟਾਰਟ ਅਤੇ ਖੁਦ-ਸੁਧਾਰ ਰੱਖੋ। ਜੇ ਤੁਹਾਡਾ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਟੂਲ ਇਨ੍ਹਾਂ ਨੂੰ ਸਾਫ਼ ਕਰ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਗ੍ਰੇਡਰ ਤੁਹਾਡੇ ਦਿੱਤੇ ਜਵਾਬ ਨਾਲੋਂ ਬਿਹਤਰ ਜਵਾਬ ਗਰੇਡ ਕਰ ਰਿਹਾ ਹੈ।
- ਇਸ ਨੂੰ ਉਦਾਹਰਣਾਂ ਦਿਓ, ਰੂਬ੍ਰਿਕ ਨਹੀਂ। ਉਸੇ ਟਾਸਕ ਕਿਸਮ ਲਈ ਹਰ ਪੱਧਰ ’ਤੇ ਇੱਕ ਜਾਂ ਦੋ ਅਸਲ ਜਵਾਬ, ਉਨ੍ਹਾਂ ਦੇ ਪੱਧਰ ਲੇਬਲ ਕੀਤੇ ਹੋਏ, ਇੱਕ ਪੱਧਰ 9 ਕਿਵੇਂ ਦਿਖਦਾ ਹੈ ਦੀ ਕਿਸੇ ਵੀ ਵਿਆਖਿਆ ਨਾਲੋਂ ਵੱਧ ਕਰਦੇ ਹਨ। ਜੇ ਤੁਹਾਡੇ ਕੋਲ ਤਸਦੀਕਸ਼ੁਦਾ ਉਦਾਹਰਣਾਂ ਨਹੀਂ ਹਨ, ਤਾਂ ਇਹ ਉਹ ਕਦਮ ਹੈ ਜੋ ਤੁਸੀਂ ਘਰ ਬੈਠੇ ਦੁਹਰਾ ਨਹੀਂ ਸਕਦੇ, ਅਤੇ ਇਹ ਸਭ ਤੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੈ।
- ਕਿਹੜੀ ਉਦਾਹਰਣ ਪੁੱਛੋ, ਕਿਹੜਾ ਨੰਬਰ ਨਹੀਂ। ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ, ਮਾਡਲ ਨੂੰ ਸਭ ਤੋਂ ਨੇੜਲੀ ਉਦਾਹਰਣ ਦਾ ਨਾਮ ਦੇਣ ਲਈ ਕਹੋ ਅਤੇ “ਵਿਚਕਾਰ” ਦੀ ਮਨਾਹੀ ਕਰੋ। ਇਹ ਜੋ ਪੱਧਰ ਦੱਸਦਾ ਹੈ ਉਨ੍ਹਾਂ ਤੋਂ ਖੁਦ ਸਕੋਰ ਕੱਢੋ।
- ਇੱਕ ਤੋਂ ਵੱਧ ਵਾਰ ਪੁੱਛੋ। ਉਹੀ ਜਵਾਬ ਨਵੀਆਂ ਗੱਲਾਂਬਾਤਾਂ ਵਿੱਚ ਦੋ ਜਾਂ ਤਿੰਨ ਵਾਰ ਸਕੋਰ ਕਰੋ ਅਤੇ ਵਿਚਕਾਰਲਾ ਜਵਾਬ ਰੱਖੋ। GPT 5.6 sol ਸਾਦੇ ਟੈਸਟ ’ਤੇ ਰਨਾਂ ਵਿਚਕਾਰ ਨੌਂ ਪੁਆਇੰਟ ਹਿੱਲਿਆ।
- ਟੌਪ-ਬੈਂਡ ਰਿਕਾਰਡ ਵਾਲਾ ਮਾਡਲ ਚੁਣੋ। ਜੇ ਤੁਸੀਂ ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛ ਰਹੇ ਹੋ ਤਾਂ Opus 5 ਜਾਂ Gemini; ਜੇ ਤੁਹਾਡੇ ਕੋਲ ਉਦਾਹਰਣਾਂ ਹਨ ਤਾਂ Opus 5 ਜਾਂ GPT 5.6 sol। ਜੇ ਤੁਸੀਂ 10 ਦੇ ਨੇੜੇ ਕਿਤੇ ਵੀ ਹੋ ਤਾਂ ਕਦੇ ਵੀ GPT-4o mini ਨਹੀਂ।
- 7 ਜਾਂ 8 ’ਤੇ ਸ਼ੱਕ ਕਰੋ। ਹਰ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲ ’ਤੇ, ਇੱਕ ਜਵਾਬ ’ਤੇ ਜਿਸ ਨੂੰ ਤੁਸੀਂ ਸ਼ਾਨਦਾਰ ਸਮਝਿਆ ਸੀ, 7 ਜਾਂ 8 ਮਿਲਣਾ ਇੱਕ ਫੈਸਲੇ ਨਾਲੋਂ ਇੱਕ ਗਲਤੀ ਹੋਣ ਦੀ ਵੱਧ ਸੰਭਾਵਨਾ ਹੈ।
ਤੁਸੀਂ ਕਿੱਥੇ ਹੋ ਦੇ ਆਧਾਰ ’ਤੇ ਕਿਹੜੇ ਮਾਡਲ ’ਤੇ ਭਰੋਸਾ ਕਰੋ
ਇਨ੍ਹਾਂ ਲੀਡਰਬੋਰਡਾਂ ਦੀ ਸਹੀ ਰੀਡਿੰਗ ਤੁਹਾਡੇ ਮੌਜੂਦਾ ਪੱਧਰ ’ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ, ਕਿਉਂਕਿ ਮਾਡਲ ਵੱਖ-ਵੱਖ ਥਾਵਾਂ ’ਤੇ ਅਸਫਲ ਹੁੰਦੇ ਹਨ।
- ਜੇ ਤੁਸੀਂ ਅੱਜ 4 ਜਾਂ 5 ’ਤੇ ਹੋ, ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਿਆ Opus 5 ਤੁਹਾਨੂੰ ਚਾਰ ਵਿੱਚੋਂ ਲਗਭਗ ਤਿੰਨ ਵਾਰ ਇਹ ਦੱਸੇਗਾ; ਬਾਕੀ ਜ਼ਿਆਦਾਤਰ ਮਾਡਲ ਤੁਹਾਨੂੰ ਲਗਭਗ ਅੱਧੇ ਵਾਰ 3 ਕਹਿਣਗੇ। ਤੁਹਾਡੀ ਸਮੱਸਿਆ ਅਸਲ ਵਿੱਚ ਗ੍ਰੇਡਰ ਨਹੀਂ ਹੈ; ਇਹ ਫੀਡਬੈਕ ਹੈ, ਅਤੇ ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਅਜਿਹੀ ਚੀਜ਼ ਚਾਹੀਦੀ ਹੈ ਜੋ ਸੰਖੇਪ ਕਰਨ ਦੀ ਥਾਂ ਤੁਹਾਡੇ ਸ਼ਬਦ ਤੁਹਾਨੂੰ ਵਾਪਸ ਦੁਹਰਾਏ।
- ਜੇ ਤੁਸੀਂ 7 ਜਾਂ 8 ’ਤੇ ਹੋ, ਸਾਦੇ ਪ੍ਰੌਮਪਟ ਵਾਲੇ GPT ਮਾਡਲਾਂ ਤੋਂ ਬਚੋ, ਜੋ ਦਸਾਂ ਵਿੱਚੋਂ ਸੱਤ ਵਾਰ ਤੁਹਾਨੂੰ 5 ਜਾਂ 6 ਕਹਿਣਗੇ। Gemini ਅਤੇ Sonnet 5 ਮੱਧ ਬੈਂਡ ਵਿੱਚ 63% ’ਤੇ ਸਭ ਤੋਂ ਭਰੋਸੇਮੰਦ ਸਾਦੇ-ਪ੍ਰੌਮਪਟ ਗ੍ਰੇਡਰ ਹਨ। Engine 2.0 85% ’ਤੇ ਹੈ।
- ਜੇ ਤੁਸੀਂ 10 ਜਾਂ ਵੱਧ ’ਤੇ ਹੋ, ਇਹੀ ਥਾਂ ਹੈ ਜਿੱਥੇ ਚੋਣ ਸਭ ਤੋਂ ਵੱਧ ਮਹੱਤਵ ਰੱਖਦੀ ਹੈ। ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ, ਕੋਈ ਵੀ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲ 56% ਤੋਂ ਵੱਧ ਵਾਰ 10 ਨੂੰ ਨਹੀਂ ਪਛਾਣੇਗਾ, ਅਤੇ GPT ਮਾਡਲ 13% ਤੋਂ 27% ਵਾਰ ਦੇ ਵਿਚਕਾਰ ਇਹ ਕਰਨਗੇ। Engine 2.0 ਦਸਾਂ ਵਿੱਚੋਂ ਸੱਤ ਪਛਾਣਦਾ ਹੈ ਅਤੇ, ਇਸ ਤੋਂ ਵੀ ਵੱਧ ਮਹੱਤਵਪੂਰਨ, ਹਰ ਵਾਰ ਪੁੱਛਣ ’ਤੇ ਇੱਕੋ ਜਿਹਾ ਜਵਾਬ ਦਿੰਦਾ ਹੈ।
ਤਿੰਨੇ ਬੈਂਡਾਂ ਵਿੱਚ ਇਹੀ ਪੈਟਰਨ ਹੈ ਜਿਸ ਦਾ ਇਹ ਪੂਰਾ ਲੇਖ ਵਰਣਨ ਕਰ ਰਿਹਾ ਹੈ। ਮਾਡਲ ਬੇਵਕੂਫ਼ ਨਹੀਂ ਹਨ; ਇਹ ਸਾਵਧਾਨ ਹਨ, ਅਤੇ ਬਿਨਾਂ ਕਿਸੇ ਤੁਲਨਾ ਦੇ ਸਾਵਧਾਨੀ ਦਾ ਮਤਲਬ ਹੈ ਇੱਕ ਘੱਟ ਨੰਬਰ। ਤੁਸੀਂ ਵਿਚਕਾਰ ਤੋਂ ਜਿੰਨੇ ਦੂਰ ਹੋ, ਇੱਕ ਗ੍ਰੇਡਰ ਦੀ ਸਾਵਧਾਨੀ ਤੁਹਾਨੂੰ ਓਨੀ ਹੀ ਵੱਧ ਕੀਮਤ ਪਵਾਉਂਦੀ ਹੈ, ਅਤੇ ਇਹ ਓਨਾ ਹੀ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ ਕਿ ਗ੍ਰੇਡਰ ਇਸ ਦਾ ਵਿਰੋਧ ਕਰਨ ਲਈ ਬਣਾਇਆ ਗਿਆ ਸੀ।
ਤੁਹਾਡੇ ਫੀਡਬੈਕ ਵਿੱਚ ਕੀ ਨਵਾਂ ਹੈ
Engine 2.0 ਦੇ ਨਾਲ ਇੱਕ ਨਵੀਂ ਬਣਾਈ ਗਈ ਫੀਡਬੈਕ ਲੇਅਰ ਆਉਂਦੀ ਹੈ। ਇਹ ਸਿਰਫ਼ ਸਕੋਰ ਨਹੀਂ ਸਗੋਂ ਦੋਵੇਂ ਗ੍ਰੇਡਰਾਂ ਦੇ ਸਬੂਤ ਨੂੰ ਪੜ੍ਹਦੀ ਹੈ, ਅਤੇ ਇਸ ਨੂੰ ਤਿੰਨ ਤਰ੍ਹਾਂ ਦੇ ਵਿਦਿਆਰਥੀਆਂ 'ਤੇ ਪਰਖਿਆ ਗਿਆ: ਪਹਿਲੀ ਵਾਰ CELPIP ਦੇਣ ਵਾਲਾ ਕੋਈ, ਕਮਜ਼ੋਰ ਅੰਗਰੇਜ਼ੀ ਵਾਲਾ ਕੋਈ ਜੋ ਬਸ ਤਰੀਕਾ ਲੱਭ ਰਿਹਾ ਹੈ, ਅਤੇ ਕੋਈ ਜਿਸ ਕੋਲ ਦਿਨ ਵਿੱਚ ਅੱਧਾ ਘੰਟਾ ਹੈ ਤੇ ਅਗਲੇ ਹਫ਼ਤੇ ਟੈਸਟ ਹੈ। ਇਹ ਹੈ ਜੋ ਬਦਲਿਆ।
- ਤੁਹਾਡੇ ਆਪਣੇ ਸ਼ਬਦ, ਦੁਬਾਰਾ ਦਿਖਾਏ ਗਏ. ਫੀਡਬੈਕ ਦਾ ਹਰ ਨੁਕਤਾ ਤੁਹਾਡੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਾ ਉਹੀ ਵਾਕੰਸ਼ ਦੱਸਦਾ ਹੈ ਜਿਸ 'ਤੇ ਗ੍ਰੇਡਰਾਂ ਨੇ ਪ੍ਰਤੀਕਿਰਿਆ ਦਿੱਤੀ। ਜੇ ਕੋਈ ਵਾਕੰਸ਼ ਕੋਟੇਸ਼ਨ ਨਿਸ਼ਾਨਾਂ ਵਿੱਚ ਹੈ, ਤਾਂ ਇਹ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਕਾਪੀ ਕੀਤਾ ਗਿਆ ਹੈ; ਸਾਡੀ ਪੜਤਾਲ ਵਿੱਚ 158 ਵਿੱਚੋਂ 157 ਕੋਟ ਇਸੇ ਤਰ੍ਹਾਂ ਸਨ। ਫੀਡਬੈਕ ਕਦੇ ਵੀ ਕੋਈ ਅਜਿਹੀ ਗੱਲ ਨਹੀਂ ਬਣਾਉਂਦਾ ਜੋ ਤੁਸੀਂ ਕਹੀ ਹੀ ਨਹੀਂ।
- ਪਹਿਲਾਂ ਠੀਕ ਕਰਨ ਵਾਲੀ ਇੱਕ ਗੱਲ. ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਹੀ ਸਭ ਤੋਂ ਵੱਡੀ ਸਲਾਹ ਮਿਲਦੀ ਹੈ: ਉਹ ਇੱਕ ਤਬਦੀਲੀ ਜੋ ਤੁਹਾਡੇ ਸਕੋਰ ਨੂੰ ਸਭ ਤੋਂ ਵੱਧ ਵਧਾਏਗੀ, ਸਭ ਤੋਂ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਲਿਖੀ ਹੋਈ। ਇਸ ਦੇ ਬਾਅਦ ਦੋ ਹੋਰ ਠੋਸ ਕਦਮ ਆਉਂਦੇ ਹਨ, ਫਿਰ ਬੋਲਣਾ ਸ਼ੁਰੂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਮਨ ਵਿੱਚ ਦੁਹਰਾਉਣ ਲਈ ਤਿੰਨ-ਨੁਕਾਤੀ ਚੈੱਕਲਿਸਟ।
- ਟਾਸਕ ਦੇ ਮੁਤਾਬਕ ਸਲਾਹ. ਸਲਾਹ ਦੇਣਾ, ਕਿਸੇ ਦ੍ਰਿਸ਼ ਦਾ ਵਰਣਨ ਕਰਨਾ ਅਤੇ ਕਿਸੇ ਨੂੰ ਮਨਾਉਣਾ — ਇਹਨਾਂ ਸਭ ਦਾ ਸਕੋਰ ਵੱਖ-ਵੱਖ ਗੱਲਾਂ 'ਤੇ ਹੁੰਦਾ ਹੈ। ਫੀਡਬੈਕ ਨੂੰ ਹੁਣ ਪਤਾ ਹੈ ਕਿ ਅੱਠ ਟਾਸਕ ਕਿਸਮਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ਕਿਸ ਗੱਲ ਦਾ ਇਨਾਮ ਦਿੰਦੀ ਹੈ, ਅਤੇ ਉਸੇ ਮੁਤਾਬਕ ਗੱਲ ਕਰਦਾ ਹੈ, ਸਾਰੇ ਟਾਸਕਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹੀਆਂ ਆਮ ਟਿਪਸ ਦੁਹਰਾਉਣ ਦੀ ਥਾਂ।
- ਪਹਿਲਾਂ ਕਿਸ ਪਹਿਲੂ ਦਾ ਅਭਿਆਸ ਕਰਨਾ ਹੈ. ਫੀਡਬੈਕ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਕਿਹੜਾ ਤੁਹਾਡਾ ਸਭ ਤੋਂ ਕਮਜ਼ੋਰ ਹੈ ਅਤੇ ਕਿਹੜਾ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ, ਤਾਂ ਜੋ ਤੁਹਾਨੂੰ ਪਤਾ ਹੋਵੇ ਕਿ ਅਗਲਾ ਅੰਕ ਕਿੱਥੇ ਹੈ, ਬਿਨਾਂ ਇਸ ਨੂੰ ਕਿਸੇ ਨੰਬਰ ਪਿੱਛੇ ਲੁਕਾਏ।
- ਟਾਸਕ ਨੇ ਕੀ ਮੰਗਿਆ ਅਤੇ ਤੁਸੀਂ ਕੀ ਛੱਡਿਆ. ਟਾਸਕ ਪੂਰਤੀ ਵਿੱਚ, ਫੀਡਬੈਕ ਉਹ ਖਾਸ ਹਿੱਸੇ ਸੂਚੀਬੱਧ ਕਰਦਾ ਹੈ ਜਿਹੜੇ ਪ੍ਰੌਂਪਟ ਦੇ ਤੁਸੀਂ ਕਵਰ ਨਹੀਂ ਕੀਤੇ, ਜਾਂ ਸਾਫ਼ ਕਹਿ ਦਿੰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਉਹ ਸਭ ਕਵਰ ਕਰ ਲਏ ਹਨ।
- ਗੱਲਾਂ ਜਿਹਨਾਂ ਦੀ ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਰਿਹਰਸਲ ਕਰ ਸਕਦੇ ਹੋ. ਹਰ 'ਕਿਵੇਂ ਕਰੀਏ' ਸਲਾਹ ਕੁਝ ਅਜਿਹਾ ਹੈ ਜੋ ਤੁਸੀਂ ਆਪਣੀ ਅਗਲੀ ਕੋਸ਼ਿਸ਼ ਤੋਂ ਪਹਿਲਾਂ ਉੱਚੀ ਆਵਾਜ਼ ਵਿੱਚ ਬੋਲ ਸਕਦੇ ਹੋ। ਵੱਧ ਸਪਸ਼ਟ ਬੋਲਣ ਜਾਂ ਆਪਣਾ ਲਹਿਜਾ ਘਟਾਉਣ ਦੀ ਕੋਈ ਸਲਾਹ ਨਹੀਂ ਦਿੱਤੀ ਜਾਂਦੀ: ਲਹਿਜਾ ਉਹ ਚੀਜ਼ ਨਹੀਂ ਜਿਸ ਨੂੰ ਸੁਣਨਯੋਗਤਾ ਮਾਪਦੀ ਹੈ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ 'ਤੇ ਕਦੇ ਟਿੱਪਣੀ ਨਹੀਂ ਕਰਦਾ।
- ਟਾਈਮਰ ਲਈ ਕੋਈ ਦੋਸ਼ ਨਹੀਂ. ਜੇ ਕੋਈ ਜਵਾਬ ਟਾਸਕ ਪੂਰਾ ਕਰ ਲੈਣ ਤੋਂ ਬਾਅਦ ਸਮੇਂ ਦੀ ਵਜ੍ਹਾ ਨਾਲ ਵਿੱਚੋਂ ਕੱਟਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਸ ਕੱਟ ਦੇ ਲਈ ਸਕੋਰ ਨਹੀਂ ਘਟਾਇਆ ਜਾਂਦਾ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਝਾੜ ਨਹੀਂ ਪਾਉਂਦਾ।
ਜਦੋਂ ਇੱਕ ਸੁਤੰਤਰ ਨਿਰਣਾਇਕ ਮਾਡਲ ਨੇ ਇਸ ਫੀਡਬੈਕ ਦੀ ਤੁਲਨਾ ਉਸ ਨਾਲ ਕੀਤੀ ਜੋ ਸਾਡੇ ਪਿਛਲੇ ਸਿਸਟਮ ਨੇ ਇਹਨਾਂ ਹੀ ਜਵਾਬਾਂ ਲਈ ਦਿੱਤਾ ਸੀ, ਬਿਨਾਂ ਇਹ ਜਾਣੇ ਕਿ ਕਿਹੜਾ ਕਿਹੜਾ ਹੈ, ਇਸ ਨੇ 24 ਵਿੱਚੋਂ 20 ਤੁਲਨਾਵਾਂ ਵਿੱਚ ਨਵੇਂ ਫੀਡਬੈਕ ਨੂੰ ਪਹਿਲ ਦਿੱਤੀ, ਭਾਵੇਂ ਇਹ ਇੱਕ ਪ੍ਰੀਖਿਅਕ ਵਾਂਗ ਨਿਰਣਾ ਕਰ ਰਿਹਾ ਹੋਵੇ ਜਾਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਵਾਂਗ।
ਅਕਸਰ ਪੁੱਛੇ ਜਾਂਦੇ ਸਵਾਲ
ਕਿਹੜਾ AI ਮਾਡਲ CELPIP ਸਪੀਕਿੰਗ ਸਕੋਰ ਕਰਨ ਵਿੱਚ ਸਭ ਤੋਂ ਸਹੀ ਹੈ? ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ: Claude Opus 5 62% ’ਤੇ, Gemini 58%, Claude Sonnet 5 ਅਤੇ GPT-4o mini 45%, GPT 5.5 37%, GPT 5.6 sol 35%, GPT 5.6 luna 31%। Prepamigo Scoring Engine 2.0 ਉਹੀ ਜਵਾਬਾਂ ’ਤੇ 81% ਤੱਕ ਪਹੁੰਚਿਆ।
ChatGPT ਜਾਂ Claude? Claude, ਸਪੱਸ਼ਟ ਤੌਰ ’ਤੇ, ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ: 62% ਅਤੇ 45% ਬਨਾਮ 35% ਅਤੇ 37%। ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ ਫਰਕ Opus 5 ਲਈ 77% ਅਤੇ GPT 5.6 sol ਲਈ 71% ਤੱਕ ਘੱਟ ਜਾਂਦਾ ਹੈ।
ਇਹ ਸਾਰੇ ਮੇਰੇ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ਨੂੰ 7 ਜਾਂ 8 ਕਿਉਂ ਦਿੰਦੇ ਹਨ? ਬਿਨਾਂ ਕਿਸੇ ਤੁਲਨਾ ਦੇ ਮਾਡਲ ਘੱਟ ਅਤੇ ਵਿਚਕਾਰ ਵੱਲ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦੇ ਹਨ, ਅਤੇ ਇੱਕ ਮਜ਼ਬੂਤ ਜਵਾਬ ਵਿੱਚ ਹਮੇਸ਼ਾ ਛੋਟੀਆਂ ਗਲਤੀਆਂ ਹੁੰਦੀਆਂ ਹਨ। ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ, ਕਿਸੇ ਵੀ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲ ਨੇ 56% ਤੋਂ ਵੱਧ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਨਹੀਂ ਪਛਾਣੇ।
ਮੈਂ ਚੈਟਬੋਟ ਤੋਂ ਬਿਹਤਰ ਸਕੋਰ ਕਿਵੇਂ ਪ੍ਰਾਪਤ ਕਰਾਂ? ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਹਰ ਪੱਧਰ ’ਤੇ ਉਦਾਹਰਣ ਜਵਾਬ, ਕਿਹੜਾ ਨੰਬਰ ਦੀ ਥਾਂ ਕਿਹੜੀ ਉਦਾਹਰਣ ਪੁੱਛੋ, ਇੱਕ ਤੋਂ ਵੱਧ ਵਾਰ ਪੁੱਛੋ ਅਤੇ ਵਿਚਕਾਰਲਾ ਜਵਾਬ ਰੱਖੋ। ਇਸ ਪ੍ਰਕਿਰਿਆ ਨੇ ਸਾਡੇ ਟੈਸਟ ਵਿੱਚ GPT 5.6 sol ਨੂੰ 35% ਤੋਂ 71% ਤੱਕ ਦੁੱਗਣਾ ਕਰ ਦਿੱਤਾ।
ਦੋਵੇਂ ਸਿੱਧੀ ਤੁਲਨਾਵਾਂ ’ਤੇ ਨੇੜਿਓਂ ਨਜ਼ਰ ਲਈ, ਪੜ੍ਹੋ Prepamigo ਬਨਾਮ Claude ਅਤੇ Prepamigo ਬਨਾਮ ChatGPT। ਇਹ ਦੇਖਣ ਲਈ ਕਿ ਪ੍ਰਕਿਰਿਆ ਕਦਮ-ਦਰ-ਕਦਮ ਕਿਵੇਂ ਕੰਮ ਕਰਦੀ ਹੈ, ਪੜ੍ਹੋ Scoring Engine 2.0 ਦੇ ਅੰਦਰ। ਜਾਂ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰੋ ਅਤੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਛੱਡ ਦਿਓ। ਇਹ ਗਾਈਡ ਅੰਗਰੇਜ਼ੀ ਵਿੱਚ ਪੜ੍ਹੋ
