ਸਕੋਰਿੰਗ

ਕਿਹੜਾ AI CELPIP ਸਪੀਕਿੰਗ ਸਭ ਤੋਂ ਸਹੀ ਸਕੋਰ ਕਰਦਾ ਹੈ? ਅਸੀਂ ਅੱਠ ਦੀ ਜਾਂਚ ਕੀਤੀ

5 ਸਤੰਬਰ 2026

ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ

48 ਹੋਲਡ-ਆਊਟ ਸਪੀਕਿੰਗ ਜਵਾਬ, ਹਰ ਬੈਂਡ 'ਤੇ 16। ਹਰ ਮਾਡਲ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਿੱਤੀ ਗਈ ਅਤੇ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ CELPIP ਸਕੇਲ 'ਤੇ ਇਸ ਨੂੰ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। Engine 2.0 ਆਪਣੀ ਆਮ ਪ੍ਰੋਡਕਸ਼ਨ ਸੰਰਚਨਾ ਵਿੱਚ ਚਲਾਇਆ ਗਿਆ।

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo ਬਨਾਮ ਟੌਪ ਚੈਟਬੋਟ ਪਲਾਨ

ਕੈਨੇਡੀਅਨ ਡਾਲਰ ਵਿੱਚ। Prepamigo ਦੀਆਂ ਕੀਮਤਾਂ ਵਿੱਚ ਟੈਕਸ ਸ਼ਾਮਲ ਹੈ। Claude Max (US$100 ਤੋਂ ਸ਼ੁਰੂ) ਅਤੇ ChatGPT Pro (US$200) ਨੂੰ 1.38 ਦੀ ਦਰ ਨਾਲ ਬਦਲਿਆ ਗਿਆ ਹੈ, ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ। ਸ਼ੁੱਧਤਾ ਉਹਨਾਂ ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤਾ ਗਿਆ ਜਦੋਂ ਦੱਸੇ ਗਏ ਮਾਡਲ ਨੂੰ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਜਵਾਬ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
ਮਹੀਨਾਵਾਰ ਕੀਮਤ
CA$24.98 (ਟੈਕਸ ਸਮੇਤ)
CA$138+ (ਟੈਕਸ ਵਾਧੂ)
CA$276 (ਟੈਕਸ ਵਾਧੂ)
ਸਕੋਰਿੰਗ
ਅਸੀਮਿਤ
ਸੀਮਿਤ
ਸੀਮਿਤ
ਤਿਆਰ ਸਵਾਲ ਬੈਂਕ
ਹਾਂ
ਨਹੀਂ
ਨਹੀਂ
ਪ੍ਰੈਕਟਿਸ ਸੈੱਟ
80
ਕੋਈ ਨਹੀਂ
ਕੋਈ ਨਹੀਂ
ਪ੍ਰੈਕਟਿਸ ਟਾਸਕ
2,000+
ਕੋਈ ਨਹੀਂ
ਕੋਈ ਨਹੀਂ
CELPIP ਫਾਰਮੈਟ
ਹਾਂ
ਨਹੀਂ
ਨਹੀਂ
ਸ਼ੁੱਧਤਾ
81%
62%
35%
ਟੌਪ-ਲੈਵਲ ਜਵਾਬ
71%
50%
25%

ਬਹੁਤ ਸਾਰੇ CELPIP ਉਮੀਦਵਾਰ ਹੁਣ ਆਪਣੀ ਸਪੀਕਿੰਗ ਪ੍ਰੈਕਟਿਸ ਨੂੰ ਇੱਕ AI ਚੈਟਬੋਟ ਨਾਲ ਗਰੇਡ ਕਰਦੇ ਹਨ। ਇੱਕ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰੋ, ਇਸ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕਰੋ, ਪੇਸਟ ਕਰੋ, ਸਕੋਰ ਮੰਗੋ। ਇਹ ਤੇਜ਼ ਹੈ ਅਤੇ ਮੁਫ਼ਤ ਜਾਂ ਲਗਭਗ ਮੁਫ਼ਤ ਹੈ, ਅਤੇ ਵਿਆਖਿਆਵਾਂ ਭਰੋਸੇਯੋਗ ਲੱਗਦੀਆਂ ਹਨ। ਕੋਈ ਵੀ ਤੁਹਾਨੂੰ ਇਹ ਨਹੀਂ ਦੱਸਦਾ ਕਿ ਨੰਬਰ ਕਿੰਨੀ ਵਾਰ ਸਹੀ ਹੁੰਦਾ ਹੈ, ਜਾਂ ਕਿਹੜੇ ਮਾਡਲ ’ਤੇ ਭਰੋਸਾ ਕਰਨਾ ਹੈ, ਜਾਂ ਕੀ ਪੁੱਛਣ ਦਾ ਤਰੀਕਾ ਜਵਾਬ ਬਦਲਦਾ ਹੈ। ਅਸੀਂ ਜਾਣਨਾ ਚਾਹੁੰਦੇ ਸੀ, ਇਸ ਲਈ ਅਸੀਂ ਇਹ ਟੈਸਟ ਬਣਾਇਆ ਅਤੇ ਇਸ ਨੂੰ ਅੱਠ ਸਿਸਟਮਾਂ ’ਤੇ, ਦੋ ਤਰੀਕਿਆਂ ਨਾਲ ਚਲਾਇਆ।

ਪਹਿਲਾ ਤਰੀਕਾ ਉੱਪਰ ਦਿੱਤਾ ਚਾਰਟ ਹੈ: ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਪੇਸਟ ਕਰੋ, ਸਕੋਰ ਮੰਗੋ, ਜਿਵੇਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਕਰਦਾ ਹੈ। ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲਾਂ ਵਿੱਚੋਂ, Claude Opus 5 62% ’ਤੇ ਸਭ ਤੋਂ ਸਹੀ ਸੀ, Gemini 58% ’ਤੇ ਇਸ ਤੋਂ ਬਾਅਦ ਰਿਹਾ, ਅਤੇ ਬਾਕੀ ਸਭ ਅੱਧੇ ਤੋਂ ਘੱਟ ਸਨ: Claude Sonnet 5 ਅਤੇ GPT-4o mini 45% ’ਤੇ, GPT 5.5 37% ’ਤੇ, GPT 5.6 sol 35% ’ਤੇ, GPT 5.6 luna 31% ’ਤੇ। ਇੱਕ ਖਾਸ-ਮਕਸਦ ਲਈ ਬਣਾਇਆ ਸਿਸਟਮ, Prepamigo Scoring Engine 2.0, ਉਹੀ ਜਵਾਬਾਂ ’ਤੇ 81% ਤੱਕ ਪਹੁੰਚਿਆ।

ਦੂਜਾ ਤਰੀਕਾ ਉਹ ਹੈ ਜਿਸ ਨੂੰ ਅਸੀਂ ਸਭ ਤੋਂ ਵੱਧ ਜਾਣਕਾਰੀ ਭਰਪੂਰ ਸਮਝਦੇ ਹਾਂ: ਅਸੀਂ ਹਰ ਮਾਡਲ ਨੂੰ ਆਪਣੀ ਗਰੇਡਿੰਗ ਪ੍ਰਕਿਰਿਆ ਦਿੱਤੀ, ਅਸਲ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਅਤੇ ਇੱਕ ਜ਼ਬਰੀ ਤੁਲਨਾ ਸਮੇਤ, ਇਹ ਦੇਖਣ ਲਈ ਕਿ ਹਰੇਕ ਕਿੰਨਾ ਵਧੀਆ ਹੋ ਸਕਦਾ ਹੈ। ਹਰ ਮਾਡਲ ਵਿੱਚ ਸੁਧਾਰ ਹੋਇਆ, ਕੁਝ ਵਿੱਚ ਬਹੁਤ ਜ਼ਿਆਦਾ, ਅਤੇ ਹਰ ਮਾਡਲ ਫਿਰ ਵੀ Engine 2.0 ਤੋਂ ਪਿੱਛੇ ਰਿਹਾ। ਸਾਨੂੰ ਇਹ ਸਾਫ਼ ਕਰ ਦੇਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿ Prepamigo ਸਾਡਾ ਪ੍ਰੋਡਕਟ ਹੈ। ਅਸੀਂ ਦੋਵੇਂ ਟੈਸਟਾਂ ਨੂੰ ਬਾਕੀ ਸਾਰਿਆਂ ਲਈ ਨਿਰਪੱਖ ਬਣਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ ਹੈ, ਅਤੇ ਜਿੱਥੇ ਕੋਈ ਮਾਡਲ ਕਿਸੇ ਖਾਸ ਪੱਧਰ ’ਤੇ ਸਾਡੇ ਤੋਂ ਅੱਗੇ ਨਿਕਲਿਆ, ਅਸੀਂ ਇਹ ਦੱਸਦੇ ਹਾਂ।

ਸਾਦੇ-ਪ੍ਰੌਮਪਟ ਦਾ ਲੀਡਰਬੋਰਡ

ਉੱਪਰ ਦਿੱਤੇ ਚਾਰਟ ਵਿੱਚ ਤਿੰਨ ਪੱਧਰ ਦਿਖਾਈ ਦਿੰਦੇ ਹਨ। Engine 2.0 81% ’ਤੇ ਇਕੱਲਾ ਖੜ੍ਹਾ ਹੈ। Claude Opus 5 62% ’ਤੇ ਅਤੇ Gemini 58% ’ਤੇ ਦੂਜਾ ਪੱਧਰ ਬਣਾਉਂਦੇ ਹਨ: ਵਰਤਣਯੋਗ, ਜੇ ਤੁਸੀਂ ਪੰਜ ਵਿੱਚੋਂ ਦੋ ਵਾਰ ਗਲਤ ਹੋਣਾ ਸਵੀਕਾਰ ਕਰਦੇ ਹੋ। ਬਾਕੀ ਸਭ 50% ਤੋਂ ਹੇਠਾਂ ਹੈ, ਜਿਸ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਜੇ ਤੁਹਾਨੂੰ ਜਵਾਬ ਬਾਰੇ ਕੁਝ ਵੀ ਨਾ ਪਤਾ ਹੁੰਦਾ, ਤਾਂ ਤਿੰਨ ਬੈਂਡਾਂ ਵਿਚਕਾਰ ਸਿੱਕਾ ਸੁੱਟਣ ਨਾਲੋਂ ਵੀ ਬੁਰਾ।

ਇਹੀ ਸਾਦੇ ਟੈਸਟ ਦੀ ਪਰਿਭਾਸ਼ਿਤ ਵਿਸ਼ੇਸ਼ਤਾ ਹੈ: ਹਰ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲ ਸਖ਼ਤੀ ਨਾਲ ਗਰੇਡ ਕਰਦਾ ਹੈ। ਇਨ੍ਹਾਂ ਨੇ ਇੱਕ ਤਸਦੀਕਸ਼ੁਦਾ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਨੂੰ ਦਿੱਤਾ ਗਿਆ ਔਸਤ ਸਕੋਰ 7.2 (luna) ਤੋਂ 8.6 (Opus 5) ਤੱਕ ਸੀ। ਇੱਕ ਤਸਦੀਕਸ਼ੁਦਾ ਹੇਠਲੇ-ਪੱਧਰ ਦੇ ਜਵਾਬ ਨੂੰ ਦਿੱਤਾ ਗਿਆ ਔਸਤ 3.7 ਤੋਂ 4.3 ਤੱਕ ਸੀ, Opus 5 ਅਤੇ Gemini ਤੋਂ ਬਿਨਾਂ ਬਾਕੀ ਸਾਰਿਆਂ ਲਈ ਬੈਂਡ ਤੋਂ ਹੇਠਾਂ। ਹਰ ਪੱਧਰ ਅਸਲ ਵਿੱਚ ਕਿਵੇਂ ਸੁਣਦਾ ਹੈ, ਇਸ ਦੀਆਂ ਕੋਈ ਉਦਾਹਰਣਾਂ ਨਾ ਹੋਣ ਕਰਕੇ, ਮਾਡਲ ਜਵਾਬ ਦੀ ਇੱਕ ਕਲਪਿਤ ਨਿਰਦੋਸ਼ ਜਵਾਬ ਨਾਲ ਤੁਲਨਾ ਕਰਦੇ ਹਨ ਅਤੇ ਅੰਕ ਕੱਟਦੇ ਹਨ।

ਹਰ ਸਕੋਰ ਪੱਧਰ ’ਤੇ ਨਤੀਜੇ

ਇੱਕ ਸਮੁੱਚਾ ਅੰਕੜਾ ਇਹ ਲੁਕਾ ਦਿੰਦਾ ਹੈ ਕਿ ਗਲਤੀਆਂ ਕਿੱਥੇ ਹੁੰਦੀਆਂ ਹਨ, ਅਤੇ ਇਹ ਕਿੱਥੇ ਹੁੰਦੀਆਂ ਹਨ ਇਹੀ ਤੈਅ ਕਰਦਾ ਹੈ ਕਿ ਕੀ ਇੱਕ ਗ੍ਰੇਡਰ ਤੁਹਾਡੇ ਲਈ ਲਾਭਦਾਇਕ ਹੈ। ਇਹ ਹਨ ਬੈਂਡ ਅਨੁਸਾਰ ਸਾਦੇ-ਟੈਸਟ ਦੇ ਨਤੀਜੇ।

ਹੇਠਲੇ-ਪੱਧਰ ਦੇ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ 4 ਜਾਂ 5)

ਹਰ ਸਿਸਟਮ ਲਈ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

ਕਮਜ਼ੋਰ ਜਵਾਬ ਸਕੇਲ ਦਾ ਸੌਖਾ ਹਿੱਸਾ ਹੋਣੇ ਚਾਹੀਦੇ ਹਨ, ਅਤੇ ਸਾਦੇ ਪ੍ਰੌਮਪਟ ਨਾਲ ਇਹ ਨਹੀਂ ਹਨ। Engine 2.0 88% ’ਤੇ ਹੈ, Opus 5 77% ’ਤੇ, GPT-4o mini 75% ’ਤੇ। ਬਾਕੀ ਸਭ ਲਗਭਗ ਅੱਧੇ ’ਤੇ ਹੈ, ਅਤੇ Sonnet 5 44% ’ਤੇ ਹੈ। ਗਲਤੀ ਲਗਭਗ ਹਮੇਸ਼ਾ ਇੱਕ 3 ਹੁੰਦੀ ਹੈ: ਮਾਡਲ ਇੱਕ ਕਮਜ਼ੋਰ ਜਵਾਬ ਦੇਖਦਾ ਹੈ ਅਤੇ ਇਸ ਨੂੰ ਬੈਂਡ ਦੇ ਅੰਦਰ ਦੀ ਥਾਂ ਇਸ ਤੋਂ ਹੇਠਾਂ ਸਕੋਰ ਕਰਦਾ ਹੈ। GPT-4o mini ਦਾ ਇਹ ਸਤਿਕਾਰਯੋਗ ਅੰਕੜਾ ਇਸ ਦੀ ਸਮੱਸਿਆ ਦਾ ਪਹਿਲਾ ਸੰਕੇਤ ਹੈ, ਜੋ ਇਹ ਹੈ ਕਿ ਇਹ ਲਗਭਗ ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਹੈ।

ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ 7 ਜਾਂ 8)

ਹਰ ਸਿਸਟਮ ਲਈ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

ਮੱਧ ਬੈਂਡ ਖੇਤਰ ਨੂੰ ਵੱਖ ਕਰਦਾ ਹੈ। Engine 2.0 85% ’ਤੇ ਹੈ। Gemini ਅਤੇ Sonnet 5 63% ’ਤੇ ਹਨ, Opus 5 58% ’ਤੇ। ਫਿਰ ਇੱਕ ਗਿਰਾਵਟ: GPT-4o mini 44% ’ਤੇ ਅਤੇ ਤਿੰਨ ਵੱਡੇ GPT ਮਾਡਲ 27% ਤੋਂ 29% ’ਤੇ। ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ਵਿੱਚ ਤਾਕਤਾਂ ਅਤੇ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਇੱਕ ਅਸਲ ਮਿਸ਼ਰਣ ਹੁੰਦਾ ਹੈ ਜਿਸ ਨੂੰ ਤੋਲਣਾ ਪੈਂਦਾ ਹੈ, ਅਤੇ ਤੋਲਣ ਲਈ ਕੁਝ ਵੀ ਨਾ ਹੋਣ ਕਰਕੇ, GPT ਮਾਡਲ ਕਮਜ਼ੋਰੀਆਂ ਦੇਖਦੇ ਹਨ ਅਤੇ 5 ਜਾਂ 6 ਦੇ ਦਿੰਦੇ ਹਨ। ਇੱਕ 7 ਜਾਂ 8 ਵਾਲਾ ਬੋਲਣ ਵਾਲਾ GPT 5.6 sol ਤੋਂ ਸਕੋਰ ਮੰਗਣ ’ਤੇ ਦਸਾਂ ਵਿੱਚੋਂ ਤਿੰਨ ਵਾਰ ਤੋਂ ਵੀ ਘੱਟ ਸਹੀ ਬੈਂਡ ਸੁਣੇਗਾ।

ਟੌਪ-ਲੈਵਲ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ 10 ਜਾਂ ਵੱਧ)

ਹਰ ਸਿਸਟਮ ਲਈ 16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। ਲਗਭਗ ਹਰ ਗਲਤੀ ਇੱਕ 7 ਜਾਂ 8 ਹੈ।

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

ਟੌਪ ਬੈਂਡ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ ਫਰਕ ਸਭ ਤੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦੇ ਹਨ, ਅਤੇ ਜਿੱਥੇ ਸਾਦਾ ਪ੍ਰੌਮਪਟ ਸਭ ਤੋਂ ਵੱਧ ਨੁਕਸਾਨ ਕਰਦਾ ਹੈ। Engine 2.0 71% ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਪਛਾਣਦਾ ਹੈ। Gemini 56% ਪਛਾਣਦਾ ਹੈ ਅਤੇ Opus 5 ਠੀਕ ਅੱਧੇ। ਫਿਰ Sonnet 5 29% ’ਤੇ, GPT 5.5 27% ’ਤੇ, GPT 5.6 sol 25% ’ਤੇ, GPT-4o mini 17% ’ਤੇ ਅਤੇ GPT 5.6 luna 13% ’ਤੇ। ਸੱਤ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲਾਂ ਵਿੱਚੋਂ ਪੰਜ ਹਰ ਦਸ ਵਿੱਚੋਂ ਘੱਟੋ-ਘੱਟ ਸੱਤ ਜਵਾਬਾਂ ਨੂੰ, ਜੋ 10 ਦੇ ਹੱਕਦਾਰ ਹਨ, 7 ਜਾਂ 8 ਦੇ ਦਿੰਦੇ ਹਨ।

ਜੇ ਤੁਸੀਂ ਇੱਕ ਮਜ਼ਬੂਤ ਉਮੀਦਵਾਰ ਹੋ ਜੋ ਆਪਣੇ ਆਪ ਨੂੰ ਚੈਟਬੋਟ ਨਾਲ ਗਰੇਡ ਕਰਦਾ ਹੈ, ਤਾਂ ਇਹ ਯਾਦ ਰੱਖਣ ਵਾਲਾ ਅੰਕੜਾ ਹੈ। GPT 5.6 sol ਨੂੰ ਸਾਦੀ ਬੇਨਤੀ ਕਰਨ ’ਤੇ ਇਹ ਤੁਹਾਨੂੰ ਦੱਸੇ ਕਿ ਇੱਕ 10 ਅਸਲ ਵਿੱਚ 10 ਹੈ, ਇਸ ਦੀ ਸੰਭਾਵਨਾ ਚਾਰ ਵਿੱਚੋਂ ਇੱਕ ਹੈ।

ਦੂਜਾ ਲੀਡਰਬੋਰਡ: ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦਿੱਤੇ ਜਾਣ ’ਤੇ

ਸਾਦੇ-ਟੈਸਟ ਦੇ ਅੰਕੜੇ ਇਸ ਗੱਲ ਦਾ ਫੈਸਲਾ ਨਹੀਂ ਹਨ ਕਿ ਇਹ ਮਾਡਲ ਕਿੰਨੇ ਸਮਾਰਟ ਹਨ। ਇਹ ਇਸ ਗੱਲ ਦਾ ਫੈਸਲਾ ਹਨ ਕਿ ਜਦੋਂ ਇੱਕ ਮਾਡਲ ਤੋਂ ਬਿਨਾਂ ਕਿਸੇ ਤੁਲਨਾ ਦੇ ਨੰਬਰ ਮੰਗਿਆ ਜਾਂਦਾ ਹੈ ਤਾਂ ਕੀ ਹੁੰਦਾ ਹੈ। ਇਸ ਲਈ ਅਸੀਂ ਦੂਜਾ ਟੈਸਟ ਚਲਾਇਆ, ਹਰ ਮਾਡਲ ਨੂੰ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਅਤੇ ਉਹ ਜ਼ਬਰੀ ਤੁਲਨਾ ਦਿੱਤੀ ਜੋ Engine 2.0 ਦੇ ਆਪਣੇ ਗ੍ਰੇਡਰ ਵਰਤਦੇ ਹਨ।

ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦਿੱਤੇ ਜਾਣ 'ਤੇ: ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ

ਉਹੀ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ। ਹਰ ਸਿਸਟਮ ਲਈ ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਹਦਾਇਤਾਂ ਅਤੇ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ; ਹਰ ਮਾਡਲ ਨੇ ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਵਾਰ ਗਰੇਡ ਕੀਤਾ। Gemini ਨੂੰ ਆਡੀਓ ਵੀ ਦਿੱਤੀ ਗਈ।

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

ਹਰ ਮਾਡਲ ਵਿੱਚ ਸੁਧਾਰ ਹੁੰਦਾ ਹੈ। Opus 5 62% ਤੋਂ 77% ਤੱਕ ਜਾਂਦਾ ਹੈ। GPT 5.6 sol ਦੁੱਗਣਾ ਹੋ ਜਾਂਦਾ ਹੈ, 35% ਤੋਂ 71% ਤੱਕ। GPT 5.5 37% ਤੋਂ 69% ਤੱਕ ਜਾਂਦਾ ਹੈ, Sonnet 5 45% ਤੋਂ 69% ਤੱਕ, luna 31% ਤੋਂ 63% ਤੱਕ, Gemini 58% ਤੋਂ 71% ਤੱਕ। GPT-4o mini ਮੁਸ਼ਕਿਲ ਨਾਲ ਹਿੱਲਦਾ ਹੈ, 45% ਤੋਂ 50% ਤੱਕ, ਕਿਉਂਕਿ ਇਹ ਜੋ ਵੀ ਦਿਖਾਇਆ ਜਾਵੇ, ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਹੈ।

ਕ੍ਰਮ ਵੀ ਬਦਲ ਜਾਂਦਾ ਹੈ। ਸਾਦੇ ਪ੍ਰੌਮਪਟ ਨਾਲ, Claude ਮਾਡਲ GPT ਮਾਡਲਾਂ ਤੋਂ ਬਹੁਤ ਅੱਗੇ ਸਨ। ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ, GPT 5.6 sol Sonnet 5 ਤੋਂ ਅੱਗੇ ਨਿਕਲ ਜਾਂਦਾ ਹੈ ਅਤੇ Gemini ਨਾਲ ਬਰਾਬਰ ਹੋ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਚਾਰ ਮਾਡਲ 69% ਅਤੇ 71% ਦੇ ਵਿਚਕਾਰ ਇਕੱਠੇ ਹੋ ਜਾਂਦੇ ਹਨ, ਜੋ ਇਸ ਸੈਂਪਲ ’ਤੇ ਅੰਕੜਾਤਮਕ ਤੌਰ ’ਤੇ ਵੱਖ ਨਹੀਂ ਕੀਤੇ ਜਾ ਸਕਦੇ। Opus 5 77% ’ਤੇ ਜਨਰਲ-ਪਰਪਸ ਖੇਤਰ ਦੇ ਸਿਖਰ ’ਤੇ ਰਹਿੰਦਾ ਹੈ, Engine 2.0 ਤੋਂ ਚਾਰ ਪੁਆਇੰਟ ਪਿੱਛੇ।

ਪੱਧਰ-ਦਰ-ਪੱਧਰ ਦੇਖਣ ’ਤੇ, ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਚਾਰ ਮਾਡਲਾਂ ਲਈ ਹੇਠਲੇ-ਬੈਂਡ ਦੀ ਸ਼ੁੱਧਤਾ ਨੂੰ 88% ਤੱਕ ਵਧਾ ਦਿੰਦੀ ਹੈ, Engine 2.0 ਜਿੰਨੀ, ਅਤੇ ਦੋ Claude ਮਾਡਲਾਂ ਲਈ ਮੱਧ-ਬੈਂਡ ਦੀ ਸ਼ੁੱਧਤਾ ਨੂੰ 81% ਤੱਕ। ਟੌਪ ਬੈਂਡ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ ਫਰਕ ਬਣਿਆ ਰਹਿੰਦਾ ਹੈ: Opus 5, GPT 5.6 sol, Gemini ਅਤੇ GPT 5.5 ਸਾਰੇ 63% ’ਤੇ ਰੁਕ ਜਾਂਦੇ ਹਨ, Sonnet 5 38% ’ਤੇ, ਅਤੇ GPT-4o mini ਜ਼ੀਰੋ ’ਤੇ, Engine 2.0 ਦੇ 71% ਦੇ ਮੁਕਾਬਲੇ। ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਕਰਨ ਵਾਲਾ ਇੱਕ ਸਿੰਗਲ ਮਾਡਲ ਫਿਰ ਵੀ ਇੱਕ ਗਲਤੀ ਵਾਲੇ ਮਜ਼ਬੂਤ ਜਵਾਬ ’ਤੇ ਰੁਕ ਜਾਂਦਾ ਹੈ। Engine 2.0 ਇਸ ਬਾਕੀ ਬਚੇ ਫਰਕ ਨੂੰ ਵੱਖ-ਵੱਖ ਪ੍ਰੋਵਾਈਡਰਾਂ ਦੇ ਦੋ ਸੁਤੰਤਰ ਗ੍ਰੇਡਰਾਂ ਨਾਲ, ਹਰੇਕ ਤੋਂ ਤਿੰਨ ਵੋਟਾਂ ਜਿਨ੍ਹਾਂ ਵਿੱਚੋਂ ਵਿਚਕਾਰਲੀ ਰੱਖੀ ਜਾਂਦੀ ਹੈ, ਅਤੇ ਇੱਕ ਸੁਲ੍ਹਾ ਨਿਯਮ ਨਾਲ ਬੰਦ ਕਰਦਾ ਹੈ ਜੋ ਦੋ ਗ੍ਰੇਡਰਾਂ ਦੇ ਸਖ਼ਤ ਅਸਹਿਮਤ ਹੋਣ ’ਤੇ ਵੱਧ ਸਕੋਰ ਲੈਂਦਾ ਹੈ, ਕਿਉਂਕਿ ਵਿਸ਼ਲੇਸ਼ਣ ਨੇ ਦਿਖਾਇਆ ਕਿ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ’ਤੇ ਹੇਠਲਾ ਫੈਸਲਾ ਲਗਭਗ ਹਮੇਸ਼ਾ ਗਲਤ ਹੁੰਦਾ ਸੀ।

ਦੋਵੇਂ ਲੀਡਰਬੋਰਡਾਂ ਦਾ ਇਮਾਨਦਾਰ ਸਾਰ ਇਹ ਹੈ: ਪ੍ਰਕਿਰਿਆ ਮਾਡਲ ਨਾਲੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੈ। ਉਹੀ GPT 5.6 sol ਬਿਨਾਂ ਇੱਕ ਵੀ ਵੇਟ ਬਦਲੇ 35% ਤੋਂ 71% ਤੱਕ ਗਿਆ, ਸਿਰਫ਼ ਇਹ ਦਿਖਾ ਕੇ ਕਿ ਹਰ ਪੱਧਰ ਕਿਵੇਂ ਸੁਣਦਾ ਹੈ ਅਤੇ ਇਹ ਪੁੱਛ ਕੇ ਕਿ ਜਵਾਬ ਕਿਸ ਉਦਾਹਰਣ ਵਰਗਾ ਲੱਗਦਾ ਹੈ।

ਮਾਡਲ ਘੱਟ ਅਤੇ ਵਿਚਕਾਰ ਵੱਲ ਕਿਉਂ ਖਿਸਕਦੇ ਹਨ

ਇਹ ਪੈਟਰਨ ਤਿੰਨ ਵੱਖ-ਵੱਖ ਕੰਪਨੀਆਂ ਦੇ ਮਾਡਲਾਂ ਵਿੱਚ ਇੰਨਾ ਇਕਸਾਰ ਹੈ ਕਿ ਇਹ ਕਿਸੇ ਇੱਕ ਦੀ ਖਾਸੀਅਤ ਨਹੀਂ ਹੋ ਸਕਦਾ। ਇਹ ਟਾਸਕ ਦੀ ਹੀ ਇੱਕ ਵਿਸ਼ੇਸ਼ਤਾ ਹੈ।

ਜਦੋਂ ਇੱਕ ਮਾਡਲ ਨੂੰ ਇੱਕ ਜਵਾਬ ਨੂੰ ਸਕੇਲ ’ਤੇ ਰੱਖਣ ਲਈ ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਜਦੋਂ ਇਹ ਯਕੀਨੀ ਨਹੀਂ ਹੁੰਦਾ ਤਾਂ ਇਹ ਕੇਂਦਰ ਵੱਲ ਝੁਕਦਾ ਹੈ, ਕਿਉਂਕਿ ਕੇਂਦਰ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ ਇੱਕ ਗਲਤ ਜਵਾਬ ਦੀ ਸਭ ਤੋਂ ਘੱਟ ਕੀਮਤ ਪੈਂਦੀ ਹੈ। ਅਤੇ ਜਦੋਂ ਇਸ ਕੋਲ ਇਹ ਦੇਖਣ ਲਈ ਕੋਈ ਉਦਾਹਰਣ ਨਹੀਂ ਹੁੰਦੀ ਕਿ ਇੱਕ ਪੱਧਰ ਅਸਲ ਵਿੱਚ ਕਿਵੇਂ ਸੁਣਦਾ ਹੈ, ਤਾਂ ਇਹ ਜਵਾਬ ਦੀ ਇੱਕ ਕਲਪਿਤ ਨਿਰਦੋਸ਼ ਜਵਾਬ ਨਾਲ ਤੁਲਨਾ ਕਰਦਾ ਹੈ ਅਤੇ ਹਰ ਗਲਤੀ ਲਈ ਅੰਕ ਕੱਟਦਾ ਹੈ। ਇੱਕ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਕਦੇ ਵੀ ਪੂਰੀ ਤਰ੍ਹਾਂ ਨਿਰਦੋਸ਼ ਨਹੀਂ ਹੁੰਦਾ। ਇਸ ਵਿੱਚ ਇੱਕ ਰੀਸਟਾਰਟ, ਗੁੰਝਲਦਾਰ ਵਾਕਾਂ ਵਿਚਕਾਰ ਇੱਕ ਸਾਦਾ ਵਾਕ, ਇੱਕ ਔਖੇ ਸ਼ਬਦ ਤੋਂ ਪਹਿਲਾਂ ਇੱਕ ਝਿਜਕ ਹੁੰਦੀ ਹੈ। ਨਿਰਦੋਸ਼ਤਾ ਦੇ ਮੁਕਾਬਲੇ ਮਾਪਣ ’ਤੇ, ਇਹ ਗਲਤੀਆਂ ਇੱਕ ਜਾਂ ਦੋ ਅੰਕ ਖਾ ਲੈਂਦੀਆਂ ਹਨ, ਅਤੇ ਇੱਕ 10, 8 ਜਾਂ 7 ਬਣ ਜਾਂਦਾ ਹੈ।

ਹਦਾਇਤਾਂ ਇਸ ਨੂੰ ਠੀਕ ਨਹੀਂ ਕਰਦੀਆਂ। ਅਸੀਂ ਮਾਡਲਾਂ ਨੂੰ ਸਪੱਸ਼ਟ ਤੌਰ ’ਤੇ ਦੱਸਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ ਕਿ ਇੱਕ ਪੱਧਰ 9 ਨੂੰ ਗਲਤੀ-ਰਹਿਤ ਜਵਾਬ ਦੀ ਲੋੜ ਨਹੀਂ, ਕਿ ਇੱਕ ਮਜ਼ਬੂਤ ਜਵਾਬ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਨਾ ਇੱਕ ਕਮਜ਼ੋਰ ਜਵਾਬ ਨੂੰ ਵੱਧ ਸਕੋਰ ਕਰਨ ਜਿੰਨਾ ਹੀ ਗੰਭੀਰ ਹੈ। ਹਰ ਹਦਾਇਤ ਸਵੀਕਾਰ ਕੀਤੀ ਗਈ ਅਤੇ ਫਿਰ ਅਮਲ ਵਿੱਚ ਨਜ਼ਰਅੰਦਾਜ਼ ਕੀਤੀ ਗਈ। ਜਦੋਂ ਅਸੀਂ ਇੱਕ ਮਾਡਲ ਨੂੰ ਉਹੀ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣ ਦਿੱਤੀ ਜਿਸ ਨੂੰ ਇਹ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਦੱਸਿਆ ਗਿਆ ਸੀ ਅਤੇ ਇਸ ਨੂੰ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ, ਤਾਂ ਇਸ ਨੇ ਇਸ ਨੂੰ 8 ਦਿੱਤਾ।

ਜੋ ਇਸ ਨੂੰ ਜ਼ਿਆਦਾਤਰ ਠੀਕ ਕਰਦਾ ਹੈ, ਉਹ ਹੈ ਸਵਾਲ ਨੂੰ “ਕਿਹੜਾ ਨੰਬਰ?” ਤੋਂ “ਕਿਹੜੀ ਉਦਾਹਰਣ?” ਵਿੱਚ ਬਦਲਣਾ ਅਤੇ ਅਸਲ ਉਦਾਹਰਣਾਂ ਦੇਣਾ। ਇਹੀ ਦੋਵੇਂ ਲੀਡਰਬੋਰਡਾਂ ਵਿਚਕਾਰ ਫਰਕ ਹੈ। ਫਿਰ ਵੀ, ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਥੋੜ੍ਹਾ ਖਿਸਕਦਾ ਰਹਿੰਦਾ ਹੈ, ਕਿਉਂਕਿ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਨਿਰਦੋਸ਼ ਨਹੀਂ ਹੁੰਦੀਆਂ ਅਤੇ ਇਨ੍ਹਾਂ ਦੀ ਇੱਕ ਰੀਡਿੰਗ ਸਿਰਫ਼ ਇੱਕ ਰੀਡਿੰਗ ਹੁੰਦੀ ਹੈ। ਦੋ ਗ੍ਰੇਡਰ, ਤਿੰਨ ਵੋਟਾਂ ਅਤੇ ਇੱਕ ਸੁਲ੍ਹਾ ਨਿਯਮ ਬਾਕੀ ਬਚੇ ਫਰਕ ਨੂੰ ਬੰਦ ਕਰਦੇ ਹਨ।

ਹਰ ਮਾਡਲ ’ਤੇ ਨੋਟਸ

  • Claude Opus 5. ਦੋਵੇਂ ਟੈਸਟਾਂ ’ਤੇ ਸਭ ਤੋਂ ਵਧੀਆ ਜਨਰਲ-ਪਰਪਸ ਗ੍ਰੇਡਰ: ਸਾਦੇ ਤੌਰ ’ਤੇ 62% (ਤਿੰਨ ਰਨਾਂ ਵਿੱਚ 62%, 65% ਅਤੇ 58%) ਅਤੇ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ 77%। ਇਸ ਦੀ ਸਾਦੇ-ਪ੍ਰੌਮਪਟ ਕਮਜ਼ੋਰੀ ਮੱਧ ਬੈਂਡ ਹੈ, ਜਿੱਥੇ ਇਹ 6 ਦੇ ਦਿੰਦਾ ਹੈ; ਇਸ ਦੀ ਪੂਰੀ-ਪ੍ਰਕਿਰਿਆ ਕਮਜ਼ੋਰੀ ਟੌਪ ਬੈਂਡ ਹੈ, ਜਿੱਥੇ ਇਹ 63% ’ਤੇ ਰੁਕ ਜਾਂਦਾ ਹੈ। ਇਹ ਇੱਥੇ ਸਭ ਤੋਂ ਮਹਿੰਗਾ ਮਾਡਲ ਵੀ ਹੈ, ਵੱਡੇ ਫਰਕ ਨਾਲ।
  • Gemini. ਸਾਦੇ ਟੈਸਟ ’ਤੇ 58% ਨਾਲ ਦੂਜੇ ਸਥਾਨ ’ਤੇ, ਸਾਰੀਆਂ ਤਿੰਨ ਰਨਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ, ਅਤੇ ਬੈਂਡਾਂ ਵਿੱਚ ਸਭ ਤੋਂ ਸਮਾਨ, 56%, 63% ਅਤੇ 56% ਨਾਲ। ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਅਤੇ ਆਡੀਓ ਰਿਕਾਰਡਿੰਗ ਨਾਲ ਇਹ 71% ਤੱਕ ਪਹੁੰਚਿਆ, GPT 5.6 sol ਦੇ ਬਰਾਬਰ, ਜਿਸ ਨੇ ਸਿਰਫ਼ ਟੈਕਸਟ ਤੋਂ ਕੰਮ ਕੀਤਾ। ਰਿਕਾਰਡਿੰਗ ਸੁਣਨ ਨਾਲ ਇਸ ਨੂੰ ਉਸ ਤੋਂ ਵੱਧ ਕੋਈ ਮਦਦ ਨਹੀਂ ਮਿਲੀ ਜੋ ਇੱਕ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਿੰਦੀ ਹੈ।
  • Claude Sonnet 5. ਸਾਦੇ ਤੌਰ ’ਤੇ 45%, ਇੱਕ ਅਜੀਬ ਪ੍ਰੋਫਾਈਲ ਨਾਲ: ਮੱਧ ਬੈਂਡ ਵਿੱਚ 63% ’ਤੇ ਵਾਜਬ, ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ’ਤੇ 44% ’ਤੇ ਖ਼ਰਾਬ ਕਿਉਂਕਿ ਇਹ ਇਨ੍ਹਾਂ ਨੂੰ 3 ਦਿੰਦਾ ਹੈ, ਅਤੇ ਟੌਪ ’ਤੇ 29% ’ਤੇ ਖ਼ਰਾਬ। ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ ਇਹ 69% ਤੱਕ ਚੜ੍ਹਦਾ ਹੈ ਪਰ ਟੌਪ-ਲੈਵਲ ਜਵਾਬਾਂ ’ਤੇ 38% ’ਤੇ ਰਹਿੰਦਾ ਹੈ। ਜੇ Sonnet 5 ਤੁਹਾਨੂੰ 8 ਦਿੰਦਾ ਰਹਿੰਦਾ ਹੈ, ਤਾਂ ਇਸ ’ਤੇ ਭਰੋਸਾ ਨਾ ਕਰੋ।
  • GPT-4o mini. ਸਾਦੇ ਤੌਰ ’ਤੇ 45%, ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ 50%, ਅਤੇ ਦੋਵਾਂ ਹਾਲਤਾਂ ਵਿੱਚ ਇਹ ਨੰਬਰ ਇਸ ਨੂੰ ਵਧੀਆ ਦਿਖਾਉਂਦਾ ਹੈ। ਇਹ ਲਗਭਗ ਹਰ ਚੀਜ਼ ਨੂੰ ਘੱਟ ਸਕੋਰ ਕਰਦਾ ਹੈ: ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ’ਤੇ 75%, ਟੌਪ-ਲੈਵਲ ਵਾਲਿਆਂ ’ਤੇ 17% ਅਤੇ ਫਿਰ 0%। ਜੋ ਵੀ ਕਰੋ, ਆਪਣੀ ਸਪੀਕਿੰਗ ਇਸ ਮਾਡਲ ਨਾਲ ਗਰੇਡ ਨਾ ਕਰੋ।
  • GPT 5.5. ਸਾਦੇ ਤੌਰ ’ਤੇ 37% (35%, 42%, 33%), ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ 69%। ਇਸ ਦਾ ਸਾਦਾ-ਪ੍ਰੌਮਪਟ ਮੱਧ ਬੈਂਡ 29% ਹੈ। ਇਹ ਸਾਡੀ ਆਪਣੀ ਪਾਈਪਲਾਈਨ ਦੇ ਪਹਿਲੇ ਵਰਜਨ ਵਿੱਚ ਟੈਕਸਟ ਗ੍ਰੇਡਰ ਸੀ ਅਤੇ ਇਸੇ ਬੈਂਡ ਵਿੱਚ ਕਮਜ਼ੋਰੀ ਕਾਰਨ ਬਦਲ ਦਿੱਤਾ ਗਿਆ ਸੀ।
  • GPT 5.6 sol. ਸਾਦੇ ਤੌਰ ’ਤੇ 35% (31%, 40%, 35%), ਕਿਸੇ ਵੀ ਮਾਡਲ ਦਾ ਸਭ ਤੋਂ ਵੱਡਾ ਰਨ-ਦਰ-ਰਨ ਬਦਲਾਅ, ਅਤੇ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ 71%, ਕਿਸੇ ਵੀ ਮਾਡਲ ਦਾ ਸਭ ਤੋਂ ਵੱਡਾ ਸੁਧਾਰ। ਉਦਾਹਰਣਾਂ ਦਿਖਾਏ ਜਾਣ ’ਤੇ ਇੱਕ ਸਮਰੱਥ ਗ੍ਰੇਡਰ, ਅਤੇ ਨਾ ਦਿਖਾਏ ਜਾਣ ’ਤੇ ਇੱਕ ਖ਼ਰਾਬ ਗ੍ਰੇਡਰ। ਇਸ ਦੀ ਪੂਰੀ-ਪ੍ਰਕਿਰਿਆ ਵਾਲੀ ਆਦਤ ਮੱਧ ਬੈਂਡ ਵਿੱਚ ਨਿਪੁੰਨਤਾ ਨੂੰ ਵੱਧ ਇਨਾਮ ਦੇਣਾ ਹੈ।
  • GPT 5.6 luna. ਦੋਵੇਂ ਟੈਸਟਾਂ ’ਤੇ ਸਭ ਤੋਂ ਪਿੱਛੇ: ਸਾਦੇ ਤੌਰ ’ਤੇ 31% ਅਤੇ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ 63%। ਇਹ ਮੱਧ ਜਵਾਬਾਂ ਨੂੰ 5 ਵੱਲ ਖਿੱਚਦਾ ਹੈ ਅਤੇ ਸਾਦੇ ਤੌਰ ’ਤੇ ਸਿਰਫ਼ 13% ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਪਛਾਣੇ। ਇੱਕ ਦੋ-ਗ੍ਰੇਡਰ ਸਿਸਟਮ ਦੇ ਅੰਦਰ ਦੂਜੀ ਰਾਏ ਵਜੋਂ ਲਾਭਦਾਇਕ ਹੋਣ ਲਈ ਕਾਫ਼ੀ ਸਸਤਾ; ਇਕੱਲੇ ਵਰਤਣ ਲਈ ਕਾਫ਼ੀ ਸਹੀ ਨਹੀਂ।

ਇੱਕ ਖਾਸ-ਮਕਸਦ ਲਈ ਬਣਾਇਆ ਸਿਸਟਮ ਕੀ ਜੋੜਦਾ ਹੈ

Engine 2.0 ਕੋਈ ਬਿਹਤਰ ਮਾਡਲ ਨਹੀਂ ਹੈ। ਇਹ ਇਸੇ ਲੀਡਰਬੋਰਡ ਦੇ ਮਾਡਲ ਵਰਤਦਾ ਹੈ। ਇਹ ਜੋ ਜੋੜਦਾ ਹੈ ਉਹ ਪ੍ਰਕਿਰਿਆ ਹੈ, ਅਤੇ ਇਸ ਪ੍ਰਕਿਰਿਆ ਦਾ ਹਰ ਹਿੱਸਾ ਮਾਪ ਦੁਆਰਾ ਚੁਣਿਆ ਗਿਆ ਸੀ।

  1. ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ, ਆਟੋਮੈਟਿਕ ਤੌਰ ’ਤੇ। ਹਰ ਫਿਲਰ ਅਤੇ ਰੀਸਟਾਰਟ ਰੱਖਿਆ ਜਾਂਦਾ ਹੈ, ਕਿਉਂਕਿ ਇਨ੍ਹਾਂ ਨੂੰ ਹਟਾਉਣ ਨਾਲ ਟੈਸਟਿੰਗ ਵਿੱਚ ਸ਼ੁੱਧਤਾ ਪੰਦਰਾਂ ਪੁਆਇੰਟ ਘੱਟ ਗਈ। ਤੁਹਾਨੂੰ ਅਜਿਹਾ ਕਰਨ ਵਾਲਾ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਟੂਲ ਲੱਭਣ ਦੀ ਲੋੜ ਨਹੀਂ; ਜ਼ਿਆਦਾਤਰ ਖਪਤਕਾਰ ਟੂਲ ਡਿਫਾਲਟ ਤੌਰ ’ਤੇ ਇਨ੍ਹਾਂ ਨੂੰ ਸਾਫ਼ ਕਰ ਦਿੰਦੇ ਹਨ।
  2. ਹਰ ਟਾਸਕ ਨਾਲ ਜੁੜੀਆਂ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ। ਅੱਠ ਟਾਸਕ ਕਿਸਮਾਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ ਹਰ ਪੱਧਰ ’ਤੇ ਦੋ ਅਸਲ ਜਵਾਬ, ਪਹਿਲਾਂ ਹੀ ਥਾਂ ’ਤੇ। ਇਹ ਉਹ ਇੱਕਲਾ ਇਨਪੁਟ ਹੈ ਜਿਸ ਨੇ GPT 5.6 sol ਦੀ ਸ਼ੁੱਧਤਾ ਦੁੱਗਣੀ ਕੀਤੀ, ਅਤੇ ਉਹ ਜੋ ਤੁਸੀਂ ਘਰ ਬੈਠੇ ਤਿਆਰ ਨਹੀਂ ਕਰ ਸਕਦੇ।
  3. ਇੱਕ ਤੁਲਨਾ, ਨੰਬਰ ਨਹੀਂ। ਹਰ ਗ੍ਰੇਡਰ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਹਰੇਕ ’ਤੇ ਸਭ ਤੋਂ ਨੇੜਲੀ ਉਦਾਹਰਣ ਦਾ ਨਾਮ ਦਿੰਦਾ ਹੈ; ਸਕੋਰ ਇੱਕ ਨਿਯਮ ਦੁਆਰਾ ਇਸ ਦੇ ਪਿੱਛੇ ਆਉਂਦਾ ਹੈ। ਇਹੀ ਖਿਸਕਣ ਨੂੰ ਰੋਕਦਾ ਹੈ।
  4. ਦੋ ਪ੍ਰੋਵਾਈਡਰਾਂ ਤੋਂ ਦੋ ਗ੍ਰੇਡਰ। ਵੱਖ-ਵੱਖ ਮਾਡਲਾਂ ਦੇ ਵੱਖ-ਵੱਖ ਬਲਾਈਂਡ ਸਪੌਟ ਹੁੰਦੇ ਹਨ। ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਦੋ, ਇੱਕ ਤੈਅ ਨਿਯਮ ਨਾਲ ਮੇਲ ਖਾਂਦੇ, ਕਿਸੇ ਵੀ ਇਕੱਲੇ ਨਾਲੋਂ ਵਧੀਆ ਹਨ।
  5. ਹਰੇਕ ਤੋਂ ਤਿੰਨ ਵੋਟਾਂ, ਵਿਚਕਾਰਲੀ ਰੱਖੀ ਜਾਂਦੀ ਹੈ। ਇਸ ਨਾਲ ਸ਼ੁੱਧਤਾ ਨਹੀਂ ਵਧੀ, ਪਰ ਇਸ ਨੇ ਰਨ-ਦਰ-ਰਨ ਇਕਸਾਰਤਾ ਨੂੰ 77% ਤੋਂ 87.5% ਤੱਕ ਲੈ ਗਿਆ। ਇੱਕ ਸਿੰਗਲ ਚੈਟਬੋਟ ਜਵਾਬ ਇੱਕ ਸਿੰਗਲ ਵੋਟ ਹੁੰਦਾ ਹੈ।
  6. ਸੁਲ੍ਹਾ ਜੋ ਸਖ਼ਤ ਅਸਹਿਮਤੀ ’ਤੇ ਵੱਧ ਸਕੋਰ ਲੈਂਦੀ ਹੈ। ਕਿਉਂਕਿ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ’ਤੇ ਹੇਠਲਾ ਫੈਸਲਾ ਲਗਭਗ ਹਮੇਸ਼ਾ ਗਲਤ ਹੁੰਦਾ ਸੀ। ਟੈਸਟਿੰਗ ਵਿੱਚ ਇੱਕ ਸਾਦੀ ਔਸਤ ਮੱਧ-ਸੱਠਵਿਆਂ ਤੱਕ ਡਿੱਗ ਗਈ।
  7. ਸੁਰੱਖਿਆ ਉਪਾਅ। ਖਾਮੋਸ਼ੀ, ਕੁਝ ਸ਼ਬਦ, ਵਿਸ਼ੇ ਤੋਂ ਬਾਹਰ ਅਤੇ ਗੈਰ-ਅੰਗਰੇਜ਼ੀ ਜਵਾਬਾਂ ਨੂੰ ਮਾਡਲ ਦੇ ਅੰਦਾਜ਼ੇ ਦੀ ਥਾਂ ਨਿਯਮ ਦੁਆਰਾ ਫਲੋਰ ਸਕੋਰ ਮਿਲਦੇ ਹਨ।

ਨਤੀਜਾ ਹੈ ਸਮੁੱਚੇ ਤੌਰ ’ਤੇ 81% ਅਤੇ ਟੌਪ ’ਤੇ 71%, ਤਿੰਨ ਵੱਖਰੀਆਂ ਰਨਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ, ਹਰ ਜਵਾਬ ’ਤੇ ਲਗਭਗ ਦਸ ਸਕਿੰਟਾਂ ਵਿੱਚ, ਬਿਨਾਂ ਕੁਝ ਪੇਸਟ ਕੀਤੇ।

ਜੇ ਤੁਸੀਂ ਫਿਰ ਵੀ ਚੈਟਬੋਟ ਵਰਤਣ ਜਾ ਰਹੇ ਹੋ

ਕੁਝ ਪਾਠਕ ਚੈਟਬੋਟ ਨਾਲ ਗਰੇਡ ਕਰਦੇ ਰਹਿਣਗੇ, ਅਤੇ ਇਹ ਇੱਕ ਸੀਮਿਤ ਬਜਟ ਵਾਲੇ ਉਮੀਦਵਾਰ ਲਈ ਜਾਂ ਉਹ ਜੋ ਆਪਣੇ ਜਵਾਬਾਂ ’ਤੇ ਗੱਲ ਕਰਨਾ ਚਾਹੁੰਦਾ ਹੈ, ਲਈ ਇੱਕ ਵਾਜਬ ਚੋਣ ਹੈ। ਇਹ ਕਦਮ ਦੋਵੇਂ ਲੀਡਰਬੋਰਡਾਂ ਵਿਚਕਾਰਲਾ ਫਰਕ ਹਨ, ਅਤੇ ਇਹ ਤੁਹਾਨੂੰ ਪਹਿਲੇ ਨਾਲੋਂ ਦੂਜੇ ਦੇ ਵੱਧ ਨੇੜੇ ਲੈ ਜਾਣਗੇ।

  1. ਇੱਕ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਵਰਤੋ। ਆਪਣੇ ਫਿਲਰ, ਰੀਸਟਾਰਟ ਅਤੇ ਖੁਦ-ਸੁਧਾਰ ਰੱਖੋ। ਜੇ ਤੁਹਾਡਾ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਟੂਲ ਇਨ੍ਹਾਂ ਨੂੰ ਸਾਫ਼ ਕਰ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਗ੍ਰੇਡਰ ਤੁਹਾਡੇ ਦਿੱਤੇ ਜਵਾਬ ਨਾਲੋਂ ਬਿਹਤਰ ਜਵਾਬ ਗਰੇਡ ਕਰ ਰਿਹਾ ਹੈ।
  2. ਇਸ ਨੂੰ ਉਦਾਹਰਣਾਂ ਦਿਓ, ਰੂਬ੍ਰਿਕ ਨਹੀਂ। ਉਸੇ ਟਾਸਕ ਕਿਸਮ ਲਈ ਹਰ ਪੱਧਰ ’ਤੇ ਇੱਕ ਜਾਂ ਦੋ ਅਸਲ ਜਵਾਬ, ਉਨ੍ਹਾਂ ਦੇ ਪੱਧਰ ਲੇਬਲ ਕੀਤੇ ਹੋਏ, ਇੱਕ ਪੱਧਰ 9 ਕਿਵੇਂ ਦਿਖਦਾ ਹੈ ਦੀ ਕਿਸੇ ਵੀ ਵਿਆਖਿਆ ਨਾਲੋਂ ਵੱਧ ਕਰਦੇ ਹਨ। ਜੇ ਤੁਹਾਡੇ ਕੋਲ ਤਸਦੀਕਸ਼ੁਦਾ ਉਦਾਹਰਣਾਂ ਨਹੀਂ ਹਨ, ਤਾਂ ਇਹ ਉਹ ਕਦਮ ਹੈ ਜੋ ਤੁਸੀਂ ਘਰ ਬੈਠੇ ਦੁਹਰਾ ਨਹੀਂ ਸਕਦੇ, ਅਤੇ ਇਹ ਸਭ ਤੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੈ।
  3. ਕਿਹੜੀ ਉਦਾਹਰਣ ਪੁੱਛੋ, ਕਿਹੜਾ ਨੰਬਰ ਨਹੀਂ। ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ, ਮਾਡਲ ਨੂੰ ਸਭ ਤੋਂ ਨੇੜਲੀ ਉਦਾਹਰਣ ਦਾ ਨਾਮ ਦੇਣ ਲਈ ਕਹੋ ਅਤੇ “ਵਿਚਕਾਰ” ਦੀ ਮਨਾਹੀ ਕਰੋ। ਇਹ ਜੋ ਪੱਧਰ ਦੱਸਦਾ ਹੈ ਉਨ੍ਹਾਂ ਤੋਂ ਖੁਦ ਸਕੋਰ ਕੱਢੋ।
  4. ਇੱਕ ਤੋਂ ਵੱਧ ਵਾਰ ਪੁੱਛੋ। ਉਹੀ ਜਵਾਬ ਨਵੀਆਂ ਗੱਲਾਂਬਾਤਾਂ ਵਿੱਚ ਦੋ ਜਾਂ ਤਿੰਨ ਵਾਰ ਸਕੋਰ ਕਰੋ ਅਤੇ ਵਿਚਕਾਰਲਾ ਜਵਾਬ ਰੱਖੋ। GPT 5.6 sol ਸਾਦੇ ਟੈਸਟ ’ਤੇ ਰਨਾਂ ਵਿਚਕਾਰ ਨੌਂ ਪੁਆਇੰਟ ਹਿੱਲਿਆ।
  5. ਟੌਪ-ਬੈਂਡ ਰਿਕਾਰਡ ਵਾਲਾ ਮਾਡਲ ਚੁਣੋ। ਜੇ ਤੁਸੀਂ ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛ ਰਹੇ ਹੋ ਤਾਂ Opus 5 ਜਾਂ Gemini; ਜੇ ਤੁਹਾਡੇ ਕੋਲ ਉਦਾਹਰਣਾਂ ਹਨ ਤਾਂ Opus 5 ਜਾਂ GPT 5.6 sol। ਜੇ ਤੁਸੀਂ 10 ਦੇ ਨੇੜੇ ਕਿਤੇ ਵੀ ਹੋ ਤਾਂ ਕਦੇ ਵੀ GPT-4o mini ਨਹੀਂ।
  6. 7 ਜਾਂ 8 ’ਤੇ ਸ਼ੱਕ ਕਰੋ। ਹਰ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲ ’ਤੇ, ਇੱਕ ਜਵਾਬ ’ਤੇ ਜਿਸ ਨੂੰ ਤੁਸੀਂ ਸ਼ਾਨਦਾਰ ਸਮਝਿਆ ਸੀ, 7 ਜਾਂ 8 ਮਿਲਣਾ ਇੱਕ ਫੈਸਲੇ ਨਾਲੋਂ ਇੱਕ ਗਲਤੀ ਹੋਣ ਦੀ ਵੱਧ ਸੰਭਾਵਨਾ ਹੈ।

ਤੁਸੀਂ ਕਿੱਥੇ ਹੋ ਦੇ ਆਧਾਰ ’ਤੇ ਕਿਹੜੇ ਮਾਡਲ ’ਤੇ ਭਰੋਸਾ ਕਰੋ

ਇਨ੍ਹਾਂ ਲੀਡਰਬੋਰਡਾਂ ਦੀ ਸਹੀ ਰੀਡਿੰਗ ਤੁਹਾਡੇ ਮੌਜੂਦਾ ਪੱਧਰ ’ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ, ਕਿਉਂਕਿ ਮਾਡਲ ਵੱਖ-ਵੱਖ ਥਾਵਾਂ ’ਤੇ ਅਸਫਲ ਹੁੰਦੇ ਹਨ।

  • ਜੇ ਤੁਸੀਂ ਅੱਜ 4 ਜਾਂ 5 ’ਤੇ ਹੋ, ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਿਆ Opus 5 ਤੁਹਾਨੂੰ ਚਾਰ ਵਿੱਚੋਂ ਲਗਭਗ ਤਿੰਨ ਵਾਰ ਇਹ ਦੱਸੇਗਾ; ਬਾਕੀ ਜ਼ਿਆਦਾਤਰ ਮਾਡਲ ਤੁਹਾਨੂੰ ਲਗਭਗ ਅੱਧੇ ਵਾਰ 3 ਕਹਿਣਗੇ। ਤੁਹਾਡੀ ਸਮੱਸਿਆ ਅਸਲ ਵਿੱਚ ਗ੍ਰੇਡਰ ਨਹੀਂ ਹੈ; ਇਹ ਫੀਡਬੈਕ ਹੈ, ਅਤੇ ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਅਜਿਹੀ ਚੀਜ਼ ਚਾਹੀਦੀ ਹੈ ਜੋ ਸੰਖੇਪ ਕਰਨ ਦੀ ਥਾਂ ਤੁਹਾਡੇ ਸ਼ਬਦ ਤੁਹਾਨੂੰ ਵਾਪਸ ਦੁਹਰਾਏ।
  • ਜੇ ਤੁਸੀਂ 7 ਜਾਂ 8 ’ਤੇ ਹੋ, ਸਾਦੇ ਪ੍ਰੌਮਪਟ ਵਾਲੇ GPT ਮਾਡਲਾਂ ਤੋਂ ਬਚੋ, ਜੋ ਦਸਾਂ ਵਿੱਚੋਂ ਸੱਤ ਵਾਰ ਤੁਹਾਨੂੰ 5 ਜਾਂ 6 ਕਹਿਣਗੇ। Gemini ਅਤੇ Sonnet 5 ਮੱਧ ਬੈਂਡ ਵਿੱਚ 63% ’ਤੇ ਸਭ ਤੋਂ ਭਰੋਸੇਮੰਦ ਸਾਦੇ-ਪ੍ਰੌਮਪਟ ਗ੍ਰੇਡਰ ਹਨ। Engine 2.0 85% ’ਤੇ ਹੈ।
  • ਜੇ ਤੁਸੀਂ 10 ਜਾਂ ਵੱਧ ’ਤੇ ਹੋ, ਇਹੀ ਥਾਂ ਹੈ ਜਿੱਥੇ ਚੋਣ ਸਭ ਤੋਂ ਵੱਧ ਮਹੱਤਵ ਰੱਖਦੀ ਹੈ। ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ, ਕੋਈ ਵੀ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲ 56% ਤੋਂ ਵੱਧ ਵਾਰ 10 ਨੂੰ ਨਹੀਂ ਪਛਾਣੇਗਾ, ਅਤੇ GPT ਮਾਡਲ 13% ਤੋਂ 27% ਵਾਰ ਦੇ ਵਿਚਕਾਰ ਇਹ ਕਰਨਗੇ। Engine 2.0 ਦਸਾਂ ਵਿੱਚੋਂ ਸੱਤ ਪਛਾਣਦਾ ਹੈ ਅਤੇ, ਇਸ ਤੋਂ ਵੀ ਵੱਧ ਮਹੱਤਵਪੂਰਨ, ਹਰ ਵਾਰ ਪੁੱਛਣ ’ਤੇ ਇੱਕੋ ਜਿਹਾ ਜਵਾਬ ਦਿੰਦਾ ਹੈ।

ਤਿੰਨੇ ਬੈਂਡਾਂ ਵਿੱਚ ਇਹੀ ਪੈਟਰਨ ਹੈ ਜਿਸ ਦਾ ਇਹ ਪੂਰਾ ਲੇਖ ਵਰਣਨ ਕਰ ਰਿਹਾ ਹੈ। ਮਾਡਲ ਬੇਵਕੂਫ਼ ਨਹੀਂ ਹਨ; ਇਹ ਸਾਵਧਾਨ ਹਨ, ਅਤੇ ਬਿਨਾਂ ਕਿਸੇ ਤੁਲਨਾ ਦੇ ਸਾਵਧਾਨੀ ਦਾ ਮਤਲਬ ਹੈ ਇੱਕ ਘੱਟ ਨੰਬਰ। ਤੁਸੀਂ ਵਿਚਕਾਰ ਤੋਂ ਜਿੰਨੇ ਦੂਰ ਹੋ, ਇੱਕ ਗ੍ਰੇਡਰ ਦੀ ਸਾਵਧਾਨੀ ਤੁਹਾਨੂੰ ਓਨੀ ਹੀ ਵੱਧ ਕੀਮਤ ਪਵਾਉਂਦੀ ਹੈ, ਅਤੇ ਇਹ ਓਨਾ ਹੀ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ ਕਿ ਗ੍ਰੇਡਰ ਇਸ ਦਾ ਵਿਰੋਧ ਕਰਨ ਲਈ ਬਣਾਇਆ ਗਿਆ ਸੀ।

ਤੁਹਾਡੇ ਫੀਡਬੈਕ ਵਿੱਚ ਕੀ ਨਵਾਂ ਹੈ

Engine 2.0 ਦੇ ਨਾਲ ਇੱਕ ਨਵੀਂ ਬਣਾਈ ਗਈ ਫੀਡਬੈਕ ਲੇਅਰ ਆਉਂਦੀ ਹੈ। ਇਹ ਸਿਰਫ਼ ਸਕੋਰ ਨਹੀਂ ਸਗੋਂ ਦੋਵੇਂ ਗ੍ਰੇਡਰਾਂ ਦੇ ਸਬੂਤ ਨੂੰ ਪੜ੍ਹਦੀ ਹੈ, ਅਤੇ ਇਸ ਨੂੰ ਤਿੰਨ ਤਰ੍ਹਾਂ ਦੇ ਵਿਦਿਆਰਥੀਆਂ 'ਤੇ ਪਰਖਿਆ ਗਿਆ: ਪਹਿਲੀ ਵਾਰ CELPIP ਦੇਣ ਵਾਲਾ ਕੋਈ, ਕਮਜ਼ੋਰ ਅੰਗਰੇਜ਼ੀ ਵਾਲਾ ਕੋਈ ਜੋ ਬਸ ਤਰੀਕਾ ਲੱਭ ਰਿਹਾ ਹੈ, ਅਤੇ ਕੋਈ ਜਿਸ ਕੋਲ ਦਿਨ ਵਿੱਚ ਅੱਧਾ ਘੰਟਾ ਹੈ ਤੇ ਅਗਲੇ ਹਫ਼ਤੇ ਟੈਸਟ ਹੈ। ਇਹ ਹੈ ਜੋ ਬਦਲਿਆ।

  • ਤੁਹਾਡੇ ਆਪਣੇ ਸ਼ਬਦ, ਦੁਬਾਰਾ ਦਿਖਾਏ ਗਏ. ਫੀਡਬੈਕ ਦਾ ਹਰ ਨੁਕਤਾ ਤੁਹਾਡੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਾ ਉਹੀ ਵਾਕੰਸ਼ ਦੱਸਦਾ ਹੈ ਜਿਸ 'ਤੇ ਗ੍ਰੇਡਰਾਂ ਨੇ ਪ੍ਰਤੀਕਿਰਿਆ ਦਿੱਤੀ। ਜੇ ਕੋਈ ਵਾਕੰਸ਼ ਕੋਟੇਸ਼ਨ ਨਿਸ਼ਾਨਾਂ ਵਿੱਚ ਹੈ, ਤਾਂ ਇਹ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਕਾਪੀ ਕੀਤਾ ਗਿਆ ਹੈ; ਸਾਡੀ ਪੜਤਾਲ ਵਿੱਚ 158 ਵਿੱਚੋਂ 157 ਕੋਟ ਇਸੇ ਤਰ੍ਹਾਂ ਸਨ। ਫੀਡਬੈਕ ਕਦੇ ਵੀ ਕੋਈ ਅਜਿਹੀ ਗੱਲ ਨਹੀਂ ਬਣਾਉਂਦਾ ਜੋ ਤੁਸੀਂ ਕਹੀ ਹੀ ਨਹੀਂ।
  • ਪਹਿਲਾਂ ਠੀਕ ਕਰਨ ਵਾਲੀ ਇੱਕ ਗੱਲ. ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਹੀ ਸਭ ਤੋਂ ਵੱਡੀ ਸਲਾਹ ਮਿਲਦੀ ਹੈ: ਉਹ ਇੱਕ ਤਬਦੀਲੀ ਜੋ ਤੁਹਾਡੇ ਸਕੋਰ ਨੂੰ ਸਭ ਤੋਂ ਵੱਧ ਵਧਾਏਗੀ, ਸਭ ਤੋਂ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਲਿਖੀ ਹੋਈ। ਇਸ ਦੇ ਬਾਅਦ ਦੋ ਹੋਰ ਠੋਸ ਕਦਮ ਆਉਂਦੇ ਹਨ, ਫਿਰ ਬੋਲਣਾ ਸ਼ੁਰੂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਮਨ ਵਿੱਚ ਦੁਹਰਾਉਣ ਲਈ ਤਿੰਨ-ਨੁਕਾਤੀ ਚੈੱਕਲਿਸਟ।
  • ਟਾਸਕ ਦੇ ਮੁਤਾਬਕ ਸਲਾਹ. ਸਲਾਹ ਦੇਣਾ, ਕਿਸੇ ਦ੍ਰਿਸ਼ ਦਾ ਵਰਣਨ ਕਰਨਾ ਅਤੇ ਕਿਸੇ ਨੂੰ ਮਨਾਉਣਾ — ਇਹਨਾਂ ਸਭ ਦਾ ਸਕੋਰ ਵੱਖ-ਵੱਖ ਗੱਲਾਂ 'ਤੇ ਹੁੰਦਾ ਹੈ। ਫੀਡਬੈਕ ਨੂੰ ਹੁਣ ਪਤਾ ਹੈ ਕਿ ਅੱਠ ਟਾਸਕ ਕਿਸਮਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ਕਿਸ ਗੱਲ ਦਾ ਇਨਾਮ ਦਿੰਦੀ ਹੈ, ਅਤੇ ਉਸੇ ਮੁਤਾਬਕ ਗੱਲ ਕਰਦਾ ਹੈ, ਸਾਰੇ ਟਾਸਕਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹੀਆਂ ਆਮ ਟਿਪਸ ਦੁਹਰਾਉਣ ਦੀ ਥਾਂ।
  • ਪਹਿਲਾਂ ਕਿਸ ਪਹਿਲੂ ਦਾ ਅਭਿਆਸ ਕਰਨਾ ਹੈ. ਫੀਡਬੈਕ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਕਿਹੜਾ ਤੁਹਾਡਾ ਸਭ ਤੋਂ ਕਮਜ਼ੋਰ ਹੈ ਅਤੇ ਕਿਹੜਾ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ, ਤਾਂ ਜੋ ਤੁਹਾਨੂੰ ਪਤਾ ਹੋਵੇ ਕਿ ਅਗਲਾ ਅੰਕ ਕਿੱਥੇ ਹੈ, ਬਿਨਾਂ ਇਸ ਨੂੰ ਕਿਸੇ ਨੰਬਰ ਪਿੱਛੇ ਲੁਕਾਏ।
  • ਟਾਸਕ ਨੇ ਕੀ ਮੰਗਿਆ ਅਤੇ ਤੁਸੀਂ ਕੀ ਛੱਡਿਆ. ਟਾਸਕ ਪੂਰਤੀ ਵਿੱਚ, ਫੀਡਬੈਕ ਉਹ ਖਾਸ ਹਿੱਸੇ ਸੂਚੀਬੱਧ ਕਰਦਾ ਹੈ ਜਿਹੜੇ ਪ੍ਰੌਂਪਟ ਦੇ ਤੁਸੀਂ ਕਵਰ ਨਹੀਂ ਕੀਤੇ, ਜਾਂ ਸਾਫ਼ ਕਹਿ ਦਿੰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਉਹ ਸਭ ਕਵਰ ਕਰ ਲਏ ਹਨ।
  • ਗੱਲਾਂ ਜਿਹਨਾਂ ਦੀ ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਰਿਹਰਸਲ ਕਰ ਸਕਦੇ ਹੋ. ਹਰ 'ਕਿਵੇਂ ਕਰੀਏ' ਸਲਾਹ ਕੁਝ ਅਜਿਹਾ ਹੈ ਜੋ ਤੁਸੀਂ ਆਪਣੀ ਅਗਲੀ ਕੋਸ਼ਿਸ਼ ਤੋਂ ਪਹਿਲਾਂ ਉੱਚੀ ਆਵਾਜ਼ ਵਿੱਚ ਬੋਲ ਸਕਦੇ ਹੋ। ਵੱਧ ਸਪਸ਼ਟ ਬੋਲਣ ਜਾਂ ਆਪਣਾ ਲਹਿਜਾ ਘਟਾਉਣ ਦੀ ਕੋਈ ਸਲਾਹ ਨਹੀਂ ਦਿੱਤੀ ਜਾਂਦੀ: ਲਹਿਜਾ ਉਹ ਚੀਜ਼ ਨਹੀਂ ਜਿਸ ਨੂੰ ਸੁਣਨਯੋਗਤਾ ਮਾਪਦੀ ਹੈ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ 'ਤੇ ਕਦੇ ਟਿੱਪਣੀ ਨਹੀਂ ਕਰਦਾ।
  • ਟਾਈਮਰ ਲਈ ਕੋਈ ਦੋਸ਼ ਨਹੀਂ. ਜੇ ਕੋਈ ਜਵਾਬ ਟਾਸਕ ਪੂਰਾ ਕਰ ਲੈਣ ਤੋਂ ਬਾਅਦ ਸਮੇਂ ਦੀ ਵਜ੍ਹਾ ਨਾਲ ਵਿੱਚੋਂ ਕੱਟਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਸ ਕੱਟ ਦੇ ਲਈ ਸਕੋਰ ਨਹੀਂ ਘਟਾਇਆ ਜਾਂਦਾ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਝਾੜ ਨਹੀਂ ਪਾਉਂਦਾ।

ਜਦੋਂ ਇੱਕ ਸੁਤੰਤਰ ਨਿਰਣਾਇਕ ਮਾਡਲ ਨੇ ਇਸ ਫੀਡਬੈਕ ਦੀ ਤੁਲਨਾ ਉਸ ਨਾਲ ਕੀਤੀ ਜੋ ਸਾਡੇ ਪਿਛਲੇ ਸਿਸਟਮ ਨੇ ਇਹਨਾਂ ਹੀ ਜਵਾਬਾਂ ਲਈ ਦਿੱਤਾ ਸੀ, ਬਿਨਾਂ ਇਹ ਜਾਣੇ ਕਿ ਕਿਹੜਾ ਕਿਹੜਾ ਹੈ, ਇਸ ਨੇ 24 ਵਿੱਚੋਂ 20 ਤੁਲਨਾਵਾਂ ਵਿੱਚ ਨਵੇਂ ਫੀਡਬੈਕ ਨੂੰ ਪਹਿਲ ਦਿੱਤੀ, ਭਾਵੇਂ ਇਹ ਇੱਕ ਪ੍ਰੀਖਿਅਕ ਵਾਂਗ ਨਿਰਣਾ ਕਰ ਰਿਹਾ ਹੋਵੇ ਜਾਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਵਾਂਗ।

ਅਕਸਰ ਪੁੱਛੇ ਜਾਂਦੇ ਸਵਾਲ

ਕਿਹੜਾ AI ਮਾਡਲ CELPIP ਸਪੀਕਿੰਗ ਸਕੋਰ ਕਰਨ ਵਿੱਚ ਸਭ ਤੋਂ ਸਹੀ ਹੈ? ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ: Claude Opus 5 62% ’ਤੇ, Gemini 58%, Claude Sonnet 5 ਅਤੇ GPT-4o mini 45%, GPT 5.5 37%, GPT 5.6 sol 35%, GPT 5.6 luna 31%। Prepamigo Scoring Engine 2.0 ਉਹੀ ਜਵਾਬਾਂ ’ਤੇ 81% ਤੱਕ ਪਹੁੰਚਿਆ।

ChatGPT ਜਾਂ Claude? Claude, ਸਪੱਸ਼ਟ ਤੌਰ ’ਤੇ, ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ: 62% ਅਤੇ 45% ਬਨਾਮ 35% ਅਤੇ 37%। ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ ਫਰਕ Opus 5 ਲਈ 77% ਅਤੇ GPT 5.6 sol ਲਈ 71% ਤੱਕ ਘੱਟ ਜਾਂਦਾ ਹੈ।

ਇਹ ਸਾਰੇ ਮੇਰੇ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ਨੂੰ 7 ਜਾਂ 8 ਕਿਉਂ ਦਿੰਦੇ ਹਨ? ਬਿਨਾਂ ਕਿਸੇ ਤੁਲਨਾ ਦੇ ਮਾਡਲ ਘੱਟ ਅਤੇ ਵਿਚਕਾਰ ਵੱਲ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦੇ ਹਨ, ਅਤੇ ਇੱਕ ਮਜ਼ਬੂਤ ਜਵਾਬ ਵਿੱਚ ਹਮੇਸ਼ਾ ਛੋਟੀਆਂ ਗਲਤੀਆਂ ਹੁੰਦੀਆਂ ਹਨ। ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ, ਕਿਸੇ ਵੀ ਜਨਰਲ-ਪਰਪਸ ਮਾਡਲ ਨੇ 56% ਤੋਂ ਵੱਧ ਟੌਪ-ਲੈਵਲ ਜਵਾਬ ਨਹੀਂ ਪਛਾਣੇ।

ਮੈਂ ਚੈਟਬੋਟ ਤੋਂ ਬਿਹਤਰ ਸਕੋਰ ਕਿਵੇਂ ਪ੍ਰਾਪਤ ਕਰਾਂ? ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਹਰ ਪੱਧਰ ’ਤੇ ਉਦਾਹਰਣ ਜਵਾਬ, ਕਿਹੜਾ ਨੰਬਰ ਦੀ ਥਾਂ ਕਿਹੜੀ ਉਦਾਹਰਣ ਪੁੱਛੋ, ਇੱਕ ਤੋਂ ਵੱਧ ਵਾਰ ਪੁੱਛੋ ਅਤੇ ਵਿਚਕਾਰਲਾ ਜਵਾਬ ਰੱਖੋ। ਇਸ ਪ੍ਰਕਿਰਿਆ ਨੇ ਸਾਡੇ ਟੈਸਟ ਵਿੱਚ GPT 5.6 sol ਨੂੰ 35% ਤੋਂ 71% ਤੱਕ ਦੁੱਗਣਾ ਕਰ ਦਿੱਤਾ।

ਦੋਵੇਂ ਸਿੱਧੀ ਤੁਲਨਾਵਾਂ ’ਤੇ ਨੇੜਿਓਂ ਨਜ਼ਰ ਲਈ, ਪੜ੍ਹੋ Prepamigo ਬਨਾਮ Claude ਅਤੇ Prepamigo ਬਨਾਮ ChatGPT। ਇਹ ਦੇਖਣ ਲਈ ਕਿ ਪ੍ਰਕਿਰਿਆ ਕਦਮ-ਦਰ-ਕਦਮ ਕਿਵੇਂ ਕੰਮ ਕਰਦੀ ਹੈ, ਪੜ੍ਹੋ Scoring Engine 2.0 ਦੇ ਅੰਦਰ। ਜਾਂ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰੋ ਅਤੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਛੱਡ ਦਿਓ। ਇਹ ਗਾਈਡ ਅੰਗਰੇਜ਼ੀ ਵਿੱਚ ਪੜ੍ਹੋ

ਕਿਹੜਾ AI CELPIP ਸਪੀਕਿੰਗ ਸਭ ਤੋਂ ਸਹੀ ਸਕੋਰ ਕਰਦਾ ਹੈ? ਅਸੀਂ ਅੱਠ ਦੀ ਜਾਂਚ ਕੀਤੀ | PrepAmigo