ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ
48 ਹੋਲਡ-ਆਊਟ ਸਪੀਕਿੰਗ ਜਵਾਬ, ਤਿੰਨ ਪੱਧਰਾਂ ਵਿੱਚੋਂ ਹਰੇਕ 'ਤੇ 16। Claude ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਿੱਤੀ ਗਈ ਅਤੇ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ CELPIP ਸਕੇਲ 'ਤੇ ਇਸ ਨੂੰ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। Engine 2.0 ਆਪਣੀ ਆਮ ਪ੍ਰੋਡਕਸ਼ਨ ਸੰਰਚਨਾ ਵਿੱਚ ਚਲਾਇਆ ਗਿਆ।
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
45%
Claude Sonnet 5
Prepamigo ਬਨਾਮ ਟੌਪ ਚੈਟਬੋਟ ਪਲਾਨ
ਕੈਨੇਡੀਅਨ ਡਾਲਰ ਵਿੱਚ। Prepamigo ਦੀਆਂ ਕੀਮਤਾਂ ਵਿੱਚ ਟੈਕਸ ਸ਼ਾਮਲ ਹੈ। Claude Max (US$100 ਤੋਂ ਸ਼ੁਰੂ) ਅਤੇ ChatGPT Pro (US$200) ਨੂੰ 1.38 ਦੀ ਦਰ ਨਾਲ ਬਦਲਿਆ ਗਿਆ ਹੈ, ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ। ਸ਼ੁੱਧਤਾ ਉਹਨਾਂ ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤਾ ਗਿਆ ਜਦੋਂ ਦੱਸੇ ਗਏ ਮਾਡਲ ਨੂੰ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਜਵਾਬ ਸਕੋਰ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ; ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ।
ਜੇ ਤੁਸੀਂ ਕਦੇ ਵੀ ਕੋਈ ਸਪੀਕਿੰਗ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ Claude ਵਿੱਚ ਪੇਸਟ ਕੀਤੀ ਹੈ ਅਤੇ ਇਸ ਨੂੰ CELPIP ਰੇਟਰ ਵਾਂਗ ਗਰੇਡ ਕਰਨ ਲਈ ਕਿਹਾ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਪਹਿਲਾਂ ਹੀ ਇਸ ਦੀ ਖਿੱਚ ਜਾਣਦੇ ਹੋ। ਇਹ ਤੁਰੰਤ ਜਵਾਬ ਦਿੰਦਾ ਹੈ, ਇਹ ਆਪਣੇ ਆਪ ਨੂੰ ਸਮਝਾਉਂਦਾ ਹੈ, ਅਤੇ ਇਹ ਕਦੇ ਥੱਕਦਾ ਨਹੀਂ। ਸਵਾਲ ਇਹ ਹੈ ਕਿ ਕੀ ਇਹ ਜੋ ਨੰਬਰ ਦਿੰਦਾ ਹੈ, ਉਹੀ ਨੰਬਰ ਤੁਹਾਨੂੰ ਅਸਲ ਵਿੱਚ ਮਿਲੇਗਾ। ਅਸੀਂ ਇਹ ਟੈਸਟ ਉਸੇ ਤਰ੍ਹਾਂ ਚਲਾਇਆ ਜਿਵੇਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਚਲਾਉਂਦਾ: ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਸਕੋਰ ਲਈ ਇੱਕ ਸਾਦੀ ਬੇਨਤੀ, ਅਤੇ ਫਿਰ ਅਸੀਂ ਗਿਣਿਆ।
ਛੋਟਾ ਜਵਾਬ: 48 ਸਪੀਕਿੰਗ ਜਵਾਬਾਂ ’ਤੇ ਜੋ ਸਿਸਟਮਾਂ ਨੇ ਕਦੇ ਨਹੀਂ ਦੇਖੇ ਸਨ, ਹਰੇਕ ਦਾ ਇੱਕ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ ਸੀ, Prepamigo Scoring Engine 2.0 ਨੇ 81% ਵਾਰ ਸਹੀ ਪੱਧਰ ’ਤੇ ਸਕੋਰ ਦਿੱਤਾ। ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ ਨੂੰ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਸਕੋਰ ਕਰਨ ਲਈ ਕਹਿਣ ’ਤੇ, Claude Opus 5 ਨੇ 62% ਵਾਰ ਅਤੇ Claude Sonnet 5 ਨੇ 45% ਵਾਰ ਸਹੀ ਪੱਧਰ ’ਤੇ ਸਕੋਰ ਦਿੱਤਾ। ਇਹ ਫਰਕ ਉੱਥੇ ਸਭ ਤੋਂ ਵੱਡਾ ਹੈ ਜਿੱਥੇ ਇਹ ਉੱਚ ਸਕੋਰ ਦੀ ਭਾਲ ਕਰਨ ਵਾਲੇ ਕਿਸੇ ਵੀ ਵਿਅਕਤੀ ਲਈ ਸਭ ਤੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੈ: ਟੌਪ-ਲੈਵਲ ਜਵਾਬਾਂ ’ਤੇ, Engine 2.0 ਨੇ 71% ਪਛਾਣੇ, Opus 5 ਨੇ 50% ਪਛਾਣੇ, ਅਤੇ Sonnet 5 ਨੇ 29% ਪਛਾਣੇ।
ਫਿਰ ਅਸੀਂ ਉਹ ਕੀਤਾ ਜੋ ਜ਼ਿਆਦਾਤਰ ਤੁਲਨਾਵਾਂ ਛੱਡ ਦਿੰਦੀਆਂ ਹਨ। ਅਸੀਂ Claude ਨੂੰ ਆਪਣੀ ਗਰੇਡਿੰਗ ਪ੍ਰਕਿਰਿਆ ਦਿੱਤੀ, ਹਰ ਟਾਸਕ ਲਈ ਅਸਲ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਅਤੇ ਉਨ੍ਹਾਂ ਨਾਲ ਇੱਕ ਜ਼ਬਰੀ ਤੁਲਨਾ ਸਮੇਤ, ਇਹ ਦੇਖਣ ਲਈ ਕਿ ਇਹ ਕਿੰਨਾ ਵਧੀਆ ਹੋ ਸਕਦਾ ਹੈ। Opus 5 ਵਧ ਕੇ 77% ਅਤੇ Sonnet 5 69% ’ਤੇ ਪਹੁੰਚ ਗਿਆ। ਦੋਵੇਂ ਫਿਰ ਵੀ Engine 2.0 ਤੋਂ ਪਿੱਛੇ ਰਹੇ, ਅਤੇ ਦੋਵੇਂ ਟੌਪ-ਲੈਵਲ ਜਵਾਬਾਂ ’ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਸੰਘਰਸ਼ ਕਰਦੇ ਰਹੇ। ਇਸ ਲੇਖ ਦਾ ਬਾਕੀ ਹਿੱਸਾ ਦੋਵੇਂ ਟੈਸਟਾਂ, ਹਰ ਸਕੋਰ ਪੱਧਰ ’ਤੇ ਨੰਬਰ ਕਿਵੇਂ ਦਿਖਦੇ ਹਨ, ਇੱਕ ਜਨਰਲ-ਪਰਪਸ ਅਸਿਸਟੈਂਟ ਸਕੇਲ ਦੇ ਵਿਚਕਾਰ ਵੱਲ ਕਿਉਂ ਖਿਸਕਦਾ ਹੈ, ਹਰ ਪਾਸੇ ਰੋਜ਼ਾਨਾ ਵਰਕਫਲੋ ਕਿਵੇਂ ਦਿਖਦਾ ਹੈ, ਅਤੇ ਜੇ ਤੁਸੀਂ ਗੰਭੀਰਤਾ ਨਾਲ ਪ੍ਰੈਕਟਿਸ ਕਰਨ ਦਾ ਇਰਾਦਾ ਰੱਖਦੇ ਹੋ ਤਾਂ ਹਰ ਵਿਕਲਪ ਦੀ ਕੀਮਤ ਕਿੰਨੀ ਹੈ, ਇਸ ਬਾਰੇ ਵਿਸਥਾਰ ਵਿੱਚ ਦੱਸਦਾ ਹੈ।
ਸਾਦਾ ਟੈਸਟ: ਇੱਕ ਵਿਦਿਆਰਥੀ ਨੂੰ ਅਸਲ ਵਿੱਚ ਕੀ ਮਿਲਦਾ ਹੈ
ਇਕਾਸੀ ਪ੍ਰਤੀਸ਼ਤ ਬਨਾਮ ਬਾਸਠ ਅਤੇ ਪੰਤਾਲੀ। 48-ਜਵਾਬ ਟੈਸਟ ਵਿੱਚ, Engine 2.0 ਅਤੇ Opus 5 ਵਿਚਕਾਰ ਫਰਕ ਨੌਂ ਵਾਧੂ ਸਹੀ ਸਕੋਰਾਂ ਦਾ ਹੈ, ਅਤੇ Engine 2.0 ਅਤੇ Sonnet 5 ਵਿਚਕਾਰ ਫਰਕ ਸਤਾਰਾਂ ਦਾ ਹੈ। ਦੂਜੇ ਸ਼ਬਦਾਂ ਵਿੱਚ, Engine 2.0 Opus 5 ਨਾਲੋਂ 51% ਘੱਟ ਅਤੇ Sonnet 5 ਨਾਲੋਂ 66% ਘੱਟ ਸਕੋਰਿੰਗ ਗਲਤੀਆਂ ਕਰਦਾ ਹੈ।
ਸਾਦੇ ਟੈਸਟ ਦੇ ਤਿੰਨ ਵੱਖਰੇ ਰਨਾਂ ਨੇ Opus 5 ਨੂੰ 62%, 65% ਅਤੇ 58%, ਅਤੇ Sonnet 5 ਨੂੰ 44%, 46% ਅਤੇ 46% ਦਿੱਤਾ। ਰਨਾਂ ਵਿਚਕਾਰ ਕਈ ਪੁਆਇੰਟਾਂ ਦਾ ਇਹ ਫੈਲਾਅ ਆਪਣੇ ਆਪ ਵਿੱਚ ਇੱਕ ਖੋਜ ਹੈ: Claude ਨੂੰ ਦੋ ਵੱਖ-ਵੱਖ ਦਿਨਾਂ ’ਤੇ ਇੱਕੋ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਗਰੇਡ ਕਰਨ ਲਈ ਕਹੋ ਅਤੇ ਤੁਹਾਨੂੰ, ਕਾਫ਼ੀ ਵਾਰ, ਦੋ ਵੱਖਰੇ ਸਕੋਰ ਮਿਲਣਗੇ। Engine 2.0 ਨੇ ਆਪਣੇ ਤਿੰਨੋਂ ਰਨਾਂ ਵਿੱਚ 81.3% ਸਕੋਰ ਕੀਤਾ।
ਫਰਕ ਕਿੱਥੇ ਖੁੱਲ੍ਹਦਾ ਹੈ: ਸਕੋਰ ਪੱਧਰ ਦਰ ਪੱਧਰ
ਜ਼ਿਆਦਾਤਰ ਗ੍ਰੇਡਰ, ਮਨੁੱਖੀ ਅਤੇ ਮਸ਼ੀਨੀ ਦੋਵੇਂ, ਸਕੇਲ ਦੇ ਵਿਚਕਾਰ ਵੱਲ ਖਿਸਕਦੇ ਹਨ। ਇੱਕ ਮਜ਼ਬੂਤ ਜਵਾਬ 10 ਦੀ ਥਾਂ 8 ਬਣ ਜਾਂਦਾ ਹੈ; ਇੱਕ ਕਮਜ਼ੋਰ ਜਵਾਬ 5 ਦੀ ਥਾਂ 6 ਬਣ ਜਾਂਦਾ ਹੈ। ਇਹ ਖਿਸਕਾਅ ਔਸਤ ਵਿੱਚ ਲੁਕਿਆ ਰਹਿੰਦਾ ਹੈ ਅਤੇ ਜਦੋਂ ਤੁਸੀਂ ਨਤੀਜਿਆਂ ਨੂੰ ਪੱਧਰ ਅਨੁਸਾਰ ਵੰਡਦੇ ਹੋ ਤਾਂ ਸਾਫ਼ ਨਜ਼ਰ ਆਉਂਦਾ ਹੈ। ਇੱਕ ਸਾਦੇ ਪ੍ਰੌਮਪਟ ਨਾਲ, Claude ਇੱਕ ਦੂਜੀ ਆਦਤ ਵੀ ਜੋੜਦਾ ਹੈ: ਇਹ ਹੇਠਾਂ ਵੱਲ ਖਿਸਕਦਾ ਹੈ, ਇਸ ਲਈ ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ਨੂੰ ਵੀ ਅਕਸਰ ਉਹਨਾਂ ਦੇ ਪੱਧਰ ਤੋਂ ਹੇਠਾਂ ਸਕੋਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ।
ਹੇਠਲੇ-ਪੱਧਰ ਦੇ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 4 ਜਾਂ 5)
16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। ਇੱਥੇ Sonnet 5 ਦੀਆਂ ਗਲਤੀਆਂ ਜ਼ਿਆਦਾਤਰ 3 ਦੇ ਸਕੋਰ ਹਨ।
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
44%
Claude Sonnet 5
ਕਮਜ਼ੋਰ ਜਵਾਬਾਂ ’ਤੇ, Engine 2.0 88% ’ਤੇ ਅੱਗੇ ਹੈ, Opus 5 77% ’ਤੇ ਪਿੱਛੇ ਹੈ, ਅਤੇ Sonnet 5 44% ’ਤੇ ਡਿੱਗ ਜਾਂਦਾ ਹੈ। ਇਹ ਸਕੇਲ ਦਾ ਆਸਾਨ ਸਿਰਾ ਹੈ, ਅਤੇ Opus 5 ਇਸ ਨੂੰ ਵਾਜਬ ਢੰਗ ਨਾਲ ਸੰਭਾਲਦਾ ਹੈ। Sonnet 5 ਨਹੀਂ: ਇਹ ਜ਼ਿਆਦਾਤਰ ਸਮੇਂ 4 ਜਾਂ 5 ਦੇ ਜਵਾਬ ਨੂੰ 3 ਸਕੋਰ ਕਰਦਾ ਹੈ, ਜੋ ਗਲਤ ਪੱਧਰ ਹੈ ਭਾਵੇਂ ਦਿਸ਼ਾ ਸਮਝਣਯੋਗ ਹੈ। ਇਸ ਪੱਧਰ ਦਾ ਵਿਦਿਆਰਥੀ ਜੋ Sonnet 5 ਨਾਲ ਗਰੇਡ ਕਰਦਾ ਹੈ, ਉਸ ਨੂੰ ਜ਼ਿਆਦਾਤਰ ਸਮੇਂ ਦੱਸਿਆ ਜਾਵੇਗਾ ਕਿ ਉਹ ਅਸਲ ਵਿੱਚੋਂ ਵੱਧ ਕਮਜ਼ੋਰ ਹੈ।
ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 7 ਜਾਂ 8)
16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। ਗਲਤੀਆਂ ਲਗਭਗ ਸਾਰੀਆਂ 6 ਹਨ।
85%
Prepamigo Engine 2.0
63%
Claude Sonnet 5
58%
Claude Opus 5
ਮੱਧ ਵਿੱਚ, Engine 2.0 85% ’ਤੇ ਹੈ ਅਤੇ ਦੋਵੇਂ Claude ਮਾਡਲ 63% ਅਤੇ 58% ’ਤੇ ਹਨ। ਮੱਧ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ਵਿੱਚ ਖੂਬੀਆਂ ਅਤੇ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਮਿਸ਼ਰਣ ਹੁੰਦਾ ਹੈ ਜਿਸ ਨੂੰ ਪਹਿਚਾਨਣ ਦੀ ਥਾਂ ਤੁਲਨਾ ਕਰਕੇ ਤੋਲਣਾ ਪੈਂਦਾ ਹੈ, ਅਤੇ ਤੁਲਨਾ ਕਰਨ ਲਈ ਕੋਈ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਨਾ ਹੋਣ ਕਰਕੇ, ਦੋਵੇਂ Claude ਮਾਡਲ ਕਮਜ਼ੋਰੀਆਂ ਨੂੰ ਦੇਖਦੇ ਹਨ ਅਤੇ 6 ਦੇ ਦਿੰਦੇ ਹਨ। ਇੱਕ 7 ਜਾਂ 8 ਬੋਲਣ ਵਾਲੇ ਨੂੰ ਲਗਭਗ ਦਸਾਂ ਵਿੱਚੋਂ ਚਾਰ ਵਾਰ ਸੁਣਨ ਨੂੰ ਮਿਲੇਗਾ ਕਿ ਉਹ 6 ਹਨ।
ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬ (ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰ 10 ਜਾਂ ਵੱਧ)
16 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ, ਸਾਦਾ ਪ੍ਰੌਮਪਟ, ਤਿੰਨ ਰਨਾਂ ਦੀ ਔਸਤ। ਲਗਭਗ ਹਰ ਗਲਤੀ 7 ਜਾਂ 8 ਹੈ।
71%
Prepamigo Engine 2.0
50%
Claude Opus 5
29%
Claude Sonnet 5
ਟੌਪ ’ਤੇ, Engine 2.0 71% ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ਨੂੰ ਪਛਾਣਦਾ ਹੈ। Opus 5 ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਅੱਧੇ ਪਛਾਣਦਾ ਹੈ। Sonnet 5 29% ਪਛਾਣਦਾ ਹੈ, ਜਿਸ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇਹ ਹਰ ਦਸ ਜਵਾਬਾਂ ਵਿੱਚੋਂ ਸੱਤ ਨੂੰ ਜੋ 10 ਦੇ ਹੱਕਦਾਰ ਹਨ, 7 ਜਾਂ 8 ਦੇ ਦਿੰਦਾ ਹੈ।
ਸੋਚੋ ਇਸ ਦਾ ਵਿਹਾਰਕ ਤੌਰ ’ਤੇ ਕੀ ਮਤਲਬ ਹੈ। ਮੰਨ ਲਓ ਤੁਹਾਡੀ ਸਪੀਕਿੰਗ ਅੱਜ ਅਸਲ ਵਿੱਚ 10 ’ਤੇ ਹੈ। ਤੁਸੀਂ ਅੱਠ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰਦੇ ਹੋ, ਉਹਨਾਂ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕਰਦੇ ਹੋ, ਉਹਨਾਂ ਨੂੰ Claude Sonnet 5 ਵਿੱਚ ਪੇਸਟ ਕਰਦੇ ਹੋ ਅਤੇ ਸਕੋਰ ਮੰਗਦੇ ਹੋ, ਅਤੇ ਇਹ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਛੇ 7 ਅਤੇ 8 ਹਨ। ਤੁਸੀਂ ਸਿੱਟਾ ਕੱਢਦੇ ਹੋ ਕਿ ਤੁਸੀਂ ਤਿਆਰ ਨਹੀਂ ਹੋ। ਤੁਸੀਂ ਤਿੰਨ ਹੋਰ ਹਫ਼ਤੇ ਅਭਿਆਸ ਕਰਦੇ ਹੋ। ਤੁਸੀਂ ਪੂਰਾ ਸਮਾਂ ਤਿਆਰ ਸੀ। ਇਹ ਕੋਈ ਕਾਲਪਨਿਕ ਅਸਫਲਤਾ ਨਹੀਂ ਹੈ; ਇਹ ਸਾਡੇ ਪੂਰੇ ਟੈਸਟ ਵਿੱਚ ਸਭ ਤੋਂ ਆਮ ਇੱਕ ਗਲਤੀ ਹੈ, ਅਤੇ ਇਹ ਉਨ੍ਹਾਂ ਉਮੀਦਵਾਰਾਂ ’ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਭਾਰੀ ਪੈਂਦੀ ਹੈ ਜਿਨ੍ਹਾਂ ਨੇ ਸਭ ਤੋਂ ਵੱਧ ਮਿਹਨਤ ਕੀਤੀ ਹੈ।
ਜੇ ਤੁਸੀਂ Claude ਨੂੰ ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦਿਓ ਤਾਂ ਕੀ ਹੁੰਦਾ ਹੈ?
ਸਾਦੇ-ਟੈਸਟ ਦੇ ਨੰਬਰਾਂ ਨੂੰ ਇਹ ਸਮਝ ਕੇ ਪੜ੍ਹਨਾ ਸੌਖਾ ਹੈ ਕਿ Claude ਇੱਕ ਕਮਜ਼ੋਰ ਮਾਡਲ ਹੈ। ਇਹ ਸੱਚ ਨਹੀਂ ਹੈ। Opus 5, ਕਾਫ਼ੀ ਫਰਕ ਨਾਲ, ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਜਨਰਲ-ਪਰਪਸ ਗ੍ਰੇਡਰ ਹੈ ਜਿਸ ਦਾ ਅਸੀਂ ਟੈਸਟ ਕੀਤਾ ਹੈ। ਸਮੱਸਿਆ ਬੁੱਧੀ ਦੀ ਨਹੀਂ ਹੈ। ਇਹ ਹੈ ਕਿ ਇੱਕ ਮਾਡਲ ਤੋਂ ਨੰਬਰ ਮੰਗਿਆ ਜਾਂਦਾ ਹੈ, ਬਿਨਾਂ ਕਿਸੇ ਤੁਲਨਾ ਦੇ, ਇਹ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦਾ ਹੈ, ਅਤੇ ਜਦੋਂ ਇਹ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦਾ ਹੈ ਤਾਂ ਇਹ ਘੱਟ ਅਤੇ ਵਿਚਕਾਰ ਵੱਲ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦਾ ਹੈ।
ਇਸ ਲਈ ਅਸੀਂ ਦੂਜਾ ਟੈਸਟ ਚਲਾਇਆ। Claude ਨੂੰ ਉਹੀ ਪੈਕੇਜ ਮਿਲਿਆ ਜੋ Engine 2.0 ਦੇ ਗ੍ਰੇਡਰ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ: ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ, ਟਾਸਕ, ਉਸ ਖਾਸ ਟਾਸਕ ਲਈ ਹਰ ਪੱਧਰ ’ਤੇ ਦੋ ਅਸਲ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ, ਅਤੇ ਨੰਬਰ ਦੇਣ ਦੀ ਥਾਂ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਹਰੇਕ ਲਈ ਸਭ ਤੋਂ ਨੇੜਲੀ ਉਦਾਹਰਣ ਦਾ ਨਾਮ ਲੈਣ ਦੀ ਹਦਾਇਤ। ਹਰ ਮਾਡਲ ਨੂੰ ਇਸ ਦੇ ਆਪਣੇ ਰੁਝਾਨਾਂ ਮੁਤਾਬਕ ਇੱਕ ਛੋਟਾ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਨੋਟ ਵੀ ਮਿਲਿਆ।
ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦੇ ਨਾਲ: ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ 'ਤੇ ਸਕੋਰ ਕੀਤੇ ਗਏ ਜਵਾਬਾਂ ਦਾ ਹਿੱਸਾ
ਉਹੀ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬ। ਹਰ Claude ਮਾਡਲ ਨੇ Engine 2.0 ਦੇ ਆਪਣੇ ਗ੍ਰੇਡਰਾਂ ਵਾਂਗ ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ, ਹਦਾਇਤਾਂ ਅਤੇ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਨਾਲ ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਵਾਰ ਗਰੇਡ ਕੀਤਾ।
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
69%
Claude Sonnet 5
ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਵੱਡਾ ਫਰਕ ਪਾਉਂਦੀਆਂ ਹਨ। Opus 5 62% ਤੋਂ 77% ਤੱਕ ਵਧਦਾ ਹੈ; Sonnet 5 45% ਤੋਂ 69% ਤੱਕ। ਦੋਵਾਂ ਲਈ ਹੇਠਲੇ-ਪੱਧਰ ਦੀ ਸ਼ੁੱਧਤਾ 88% ਤੱਕ ਪਹੁੰਚਦੀ ਹੈ, Engine 2.0 ਜਿੰਨੀ। ਮੱਧ-ਪੱਧਰ ਦੀ ਸ਼ੁੱਧਤਾ ਦੋਵਾਂ ਲਈ 81% ਤੱਕ ਪਹੁੰਚਦੀ ਹੈ। ਇਹ ਧਿਆਨ ਦੇਣ ਯੋਗ ਹੈ, ਕਿਉਂਕਿ ਇਹ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਇੱਕ ਖਾਸ-ਮਕਸਦ ਲਈ ਬਣੇ ਗ੍ਰੇਡਰ ਦੀ ਕੀਮਤ ਅਸਲ ਵਿੱਚ ਕਿੱਥੇ ਹੈ: ਇੱਕ ਹੋਰ ਸਿਆਣੇ ਮਾਡਲ ਵਿੱਚ ਨਹੀਂ, ਸਗੋਂ ਹਰ ਖਾਸ ਟਾਸਕ ’ਤੇ ਹਰ ਪੱਧਰ ਕਿਵੇਂ ਸੁਣਾਈ ਦਿੰਦਾ ਹੈ ਇਸ ਦੀਆਂ ਅਸਲ ਉਦਾਹਰਣਾਂ ਵਿੱਚ, ਅਤੇ ਇੱਕ ਅਜਿਹੇ ਸਵਾਲ ਵਿੱਚ ਜੋ ਮਾਡਲ ਨੂੰ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਦੀ ਥਾਂ ਤੁਲਨਾ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ।
ਫਿਰ ਵੀ, ਦੋਵੇਂ ਮਾਡਲ ਸਕੇਲ ਦੇ ਟੌਪ ’ਤੇ ਪਿੱਛੇ ਰਹਿੰਦੇ ਹਨ। ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਨਾਲ, Opus 5 63% ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ਨੂੰ ਪਛਾਣਦਾ ਹੈ ਅਤੇ Sonnet 5 38% ਪਛਾਣਦਾ ਹੈ, ਜਦਕਿ Engine 2.0 ਲਈ ਇਹ 71% ਹੈ। ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਬਣਾਉਣ ਵਾਲਾ ਇੱਕ ਸਿੰਗਲ ਮਾਡਲ ਅਜੇ ਵੀ ਕਿਸੇ ਛੋਟੀ ਗਲਤੀ ਵਾਲੇ ਮਜ਼ਬੂਤ ਜਵਾਬ ’ਤੇ ਰੁਕ ਜਾਂਦਾ ਹੈ। Engine 2.0 ਬਾਕੀ ਬਚੇ ਫਰਕ ਨੂੰ ਤਿੰਨ ਹੋਰ ਚੀਜ਼ਾਂ ਨਾਲ ਬੰਦ ਕਰਦਾ ਹੈ: ਵੱਖ-ਵੱਖ ਪ੍ਰੋਵਾਈਡਰਾਂ ਦੇ ਦੋ ਸੁਤੰਤਰ ਗ੍ਰੇਡਰ, ਹਰੇਕ ਤੋਂ ਤਿੰਨ ਵੋਟਾਂ ਜਿਸ ਵਿੱਚੋਂ ਵਿਚਕਾਰਲੀ ਵੋਟ ਰੱਖੀ ਜਾਂਦੀ ਹੈ, ਅਤੇ ਇੱਕ ਸੁਲਾਹ-ਨਿਯਮ ਜੋ ਉੱਚਾ ਸਕੋਰ ਲੈਂਦਾ ਹੈ ਜਦੋਂ ਦੋ ਗ੍ਰੇਡਰ ਬਹੁਤ ਵੱਖਰਾ ਅਸਹਿਮਤ ਹੁੰਦੇ ਹਨ, ਕਿਉਂਕਿ ਵਿਸ਼ਲੇਸ਼ਣ ਨੇ ਦਿਖਾਇਆ ਕਿ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ’ਤੇ ਹੇਠਲਾ ਫੈਸਲਾ ਲਗਭਗ ਹਮੇਸ਼ਾ ਗਲਤ ਹੁੰਦਾ ਸੀ।
ਅਸੀਂ ਸਪੱਸ਼ਟ ਸ਼ਾਰਟਕੱਟ ਵੀ ਅਜ਼ਮਾਇਆ: ਸਾਦਾ ਪ੍ਰੌਮਪਟ ਰੱਖਦੇ ਹੋਏ ਹਦਾਇਤਾਂ ਜੋੜੀਆਂ ਜਿਵੇਂ “ਵਿਚਕਾਰ ਵੱਲ ਨਾ ਖਿਸਕੋ” ਜਾਂ “ਪੱਧਰ 9 ਦੇ ਜਵਾਬ ਦਾ ਨਿਰਦੋਸ਼ ਹੋਣਾ ਜ਼ਰੂਰੀ ਨਹੀਂ ਹੈ।” ਇਨ੍ਹਾਂ ਨੇ ਕੋਈ ਮਾਪਣ ਯੋਗ ਬਦਲਾਅ ਨਹੀਂ ਲਿਆਇਆ। ਮਾਡਲ ਹਦਾਇਤ ਨਾਲ ਸਹਿਮਤ ਹੁੰਦਾ ਹੈ ਅਤੇ ਫਿਰ ਉਹੀ ਕਰਦਾ ਹੈ ਜੋ ਇਹ ਪਹਿਲਾਂ ਹੀ ਕਰਨ ਜਾ ਰਿਹਾ ਸੀ। ਜੋ ਕੰਮ ਕਰਦਾ ਹੈ ਉਹ ਹੈ ਸਵਾਲ ਬਦਲਣਾ, ਅਤੇ ਇਸ ਨੂੰ ਤੁਲਨਾ ਕਰਨ ਲਈ ਕੋਈ ਅਸਲ ਚੀਜ਼ ਦੇਣਾ।
ਵਰਕਫਲੋ ਦਾ ਫਰਕ: ਰਿਕਾਰਡ ਕਰੋ ਅਤੇ ਚੱਲੋ, ਜਾਂ ਸਭ ਕੁਝ ਆਪ ਕਰੋ
ਸ਼ੁੱਧਤਾ ਦੇ ਅੰਕੜੇ ਇਹ ਮੰਨ ਕੇ ਚੱਲਦੇ ਹਨ ਕਿ ਗਰੇਡਿੰਗ ਅਸਲ ਵਿੱਚ ਹੁੰਦੀ ਹੈ। Claude ਨਾਲ, ਤੁਹਾਡੀ ਰਿਕਾਰਡਿੰਗ ਨੂੰ ਰੁਕਣ ਅਤੇ ਸਕੋਰ ਪੜ੍ਹਨ ਵਿਚਕਾਰ ਹੈਰਾਨੀਜਨਕ ਮਾਤਰਾ ਵਿੱਚ ਕੰਮ ਹੁੰਦਾ ਹੈ।
ਪਹਿਲਾਂ, ਤੁਹਾਨੂੰ ਇੱਕ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦੀ ਲੋੜ ਹੈ। Claude ਦਾ ਚੈਟ ਇੰਟਰਫੇਸ ਆਡੀਓ ਰਿਕਾਰਡਿੰਗਾਂ ਨੂੰ ਗਰੇਡ ਨਹੀਂ ਕਰਦਾ, ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਟੈਕਸਟ ਬਣਾਉਣਾ ਪਵੇਗਾ। ਇਸ ਦਾ ਮਤਲਬ ਹੈ ਜਾਂ ਤਾਂ ਤੁਸੀਂ ਜੋ ਕਿਹਾ ਸੀ ਉਹ ਟਾਈਪ ਕਰਨਾ, ਜੋ ਇਸ ਨੂੰ ਬਦਲ ਦਿੰਦਾ ਹੈ, ਜਾਂ ਰਿਕਾਰਡਿੰਗ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਟੂਲ ਵਿੱਚੋਂ ਲੰਘਾਉਣਾ। ਅਤੇ ਇਹ ਹੈ ਇੱਕ ਵੇਰਵਾ ਜਿਸ ਨੇ ਸਮਝਣ ਤੋਂ ਪਹਿਲਾਂ ਸਾਨੂੰ ਬਹੁਤ ਸ਼ੁੱਧਤਾ ਦੀ ਕੀਮਤ ਦਿੱਤੀ: ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ। ਹਰ ਫਿਲਰ, ਹਰ ਰੀਸਟਾਰਟ, ਹਰ ਖੁਦ-ਸੁਧਾਰ ਰਹਿਣਾ ਚਾਹੀਦਾ ਹੈ। ਜਦੋਂ ਅਸੀਂ ਝਿਜਕਾਂ ਹਟਾਈ ਗਈ “ਸਾਫ਼ ਕੀਤੀ” ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਟੈਸਟ ਕੀਤੀ, ਸ਼ੁੱਧਤਾ ਪੰਦਰਾਂ ਪੁਆਇੰਟ ਡਿੱਗ ਗਈ, ਕਿਉਂਕਿ ਇਹ ਝਿਜਕਾਂ ਹੀ ਉਹ ਸਬੂਤ ਹਨ ਜੋ ਗ੍ਰੇਡਰ ਨੂੰ ਇਹ ਪਰਖਣ ਲਈ ਲੋੜੀਂਦੇ ਹਨ ਕਿ ਜਵਾਬ ਕਿਵੇਂ ਸੁਣਾਈ ਦਿੰਦਾ ਹੈ। ਜ਼ਿਆਦਾਤਰ ਖਪਤਕਾਰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਟੂਲ ਮੂਲ ਰੂਪ ਵਿੱਚ ਸਾਫ਼ ਕਰਦੇ ਹਨ।
ਦੂਜਾ, ਤੁਹਾਨੂੰ ਟਾਸਕ ਦੀ ਲੋੜ ਹੈ। Claude ਕੋਲ ਸਹੀ ਸਮੇਂ ਅਤੇ ਫਾਰਮੈਟ ਵਾਲੇ CELPIP-ਸਟਾਈਲ ਪ੍ਰੌਮਪਟਾਂ ਦਾ ਬੈਂਕ ਨਹੀਂ ਹੈ। ਤੁਹਾਨੂੰ ਜਾਂ ਤਾਂ ਆਪਣਾ ਖੁਦ ਲਿਖਣਾ ਪਵੇਗਾ, ਜਿਸ ਦਾ ਮਤਲਬ ਹੈ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣਾ ਕਿ ਅਸਲ ਟੈਸਟ ਕੀ ਪੁੱਛਦਾ ਹੈ, ਜਾਂ ਕਿਤੇ ਹੋਰ ਲੱਭ ਕੇ ਇਸ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦੇ ਨਾਲ ਪੇਸਟ ਕਰਨਾ ਪਵੇਗਾ।
ਤੀਜਾ, ਜੇ ਤੁਸੀਂ ਸਾਦੇ-ਟੈਸਟ ਦੇ ਨੰਬਰਾਂ ਨਾਲੋਂ ਬਿਹਤਰ ਕੁਝ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਤੁਹਾਨੂੰ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਦੀ ਲੋੜ ਹੈ: ਉਸੇ ਟਾਸਕ ਕਿਸਮ ਲਈ ਹਰ ਪੱਧਰ ਦੇ ਅਸਲ ਜਵਾਬ, ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰਾਂ ਨਾਲ। ਇਹ ਉਹ ਇਨਪੁਟ ਹੈ ਜਿਸ ਨੇ ਸਾਡੇ ਟੈਸਟ ਵਿੱਚ Opus 5 ਨੂੰ 62% ਤੋਂ 77% ਤੱਕ ਲੈ ਗਿਆ, ਅਤੇ ਇਹ ਉਹ ਹੈ ਜੋ ਇੱਕ ਵਿਦਿਆਰਥੀ ਘਰ ਬੈਠੇ ਪੈਦਾ ਨਹੀਂ ਕਰ ਸਕਦਾ।
ਚੌਥਾ, ਤੁਸੀਂ ਅਗਲੇ ਜਵਾਬ ਲਈ ਇਹ ਸਭ ਦੁਬਾਰਾ ਕਰਦੇ ਹੋ। ਅਤੇ ਉਸ ਤੋਂ ਬਾਅਦ ਵਾਲੇ ਲਈ।
Prepamigo ’ਤੇ, ਤੁਸੀਂ ਬੈਂਕ ਵਿੱਚੋਂ ਇੱਕ ਟਾਸਕ ਚੁਣਦੇ ਹੋ, ਟਾਈਮਰ ਚੱਲਦਾ ਹੈ, ਤੁਸੀਂ ਬੋਲਦੇ ਹੋ, ਅਤੇ ਰੁਕਣ ਤੋਂ ਲਗਭਗ ਦਸ ਸਕਿੰਟਾਂ ਬਾਅਦ, ਸਕੋਰ ਅਤੇ ਫੀਡਬੈਕ ਸਕ੍ਰੀਨ ’ਤੇ ਹੁੰਦੇ ਹਨ। ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਡਿਜ਼ਾਈਨ ਦੁਆਰਾ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਹੈ, ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਆਪਣੇ ਆਪ ਟਾਸਕ ਨਾਲ ਜੁੜੀਆਂ ਹੁੰਦੀਆਂ ਹਨ, ਅਤੇ ਪੇਸਟ ਕਰਨ ਜਾਂ ਪ੍ਰੌਮਪਟ ਕਰਨ ਲਈ ਕੁਝ ਵੀ ਨਹੀਂ ਹੈ। ਸ਼ਾਮ ਦਾ ਗਿਆਰਵਾਂ ਜਵਾਬ ਤੁਹਾਨੂੰ ਪਹਿਲੇ ਜਿੰਨੀ ਹੀ ਮਿਹਨਤ ਲੈਂਦਾ ਹੈ।
ਇਕਸਾਰਤਾ: ਉਹੀ ਜਵਾਬ, ਉਹੀ ਸਕੋਰ
ਇੱਕ ਸਕੋਰ ਜਿਸ ਨੂੰ ਤੁਸੀਂ ਦੁਹਰਾ ਨਹੀਂ ਸਕਦੇ ਉਹ ਮਾਪ ਨਹੀਂ ਹੈ। ਜੇ ਉਹੀ ਰਿਕਾਰਡਿੰਗ ਸੋਮਵਾਰ 8 ਅਤੇ ਮੰਗਲਵਾਰ 10 ਮਿਲਦੀ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਆਪਣੀ ਸਪੀਕਿੰਗ ਬਾਰੇ ਕੁਝ ਨਹੀਂ ਸਿੱਖਿਆ ਅਤੇ ਗ੍ਰੇਡਰ ਦੇ ਮੂਡ ਬਾਰੇ ਕੁਝ ਸਿੱਖਿਆ। ਇਸ ਲਈ ਅਸੀਂ ਇਹ ਵੀ ਟੈਸਟ ਕੀਤਾ ਕਿ ਕੀ ਹਰ ਸਿਸਟਮ ਦੋ ਵਾਰ ਉਹੀ ਜਵਾਬ ਦਿੰਦਾ ਹੈ।
Engine 2.0 ਨੂੰ 48 ਹੋਲਡ-ਆਊਟ ਜਵਾਬਾਂ ’ਤੇ ਤਿੰਨ ਵੱਖਰੀਆਂ ਵਾਰ ਚਲਾਇਆ ਗਿਆ। ਇਸ ਨੇ ਹਰ ਰਨ ’ਤੇ 81.3% ਸਕੋਰ ਕੀਤਾ। ਸਮੁੱਚੇ ਦੀ ਥਾਂ ਵਿਅਕਤੀਗਤ ਜਵਾਬਾਂ ਨੂੰ ਦੇਖਦੇ ਹੋਏ, 87.5% ਨੂੰ ਤਿੰਨੋਂ ਰਨਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ ਸਕੋਰ ਮਿਲਿਆ, ਅਤੇ ਸਿਰਫ਼ 4.2% ਕਦੇ ਦੋ ਜਾਂ ਵੱਧ ਪੁਆਇੰਟਾਂ ਨਾਲ ਹਿੱਲੇ। ਇਹ ਕੁਝ ਜਵਾਬ ਹਨ ਜੋ ਦੋ ਪੱਧਰਾਂ ਵਿਚਕਾਰ ਦੀ ਸੀਮਾ ’ਤੇ ਬੈਠੇ ਹੁੰਦੇ ਹਨ, ਜਿੱਥੇ ਨਿਰਣੇ ਵਿੱਚ ਇੱਕ ਛੋਟਾ ਫਰਕ ਸੱਚਮੁੱਚ ਸਕੋਰ ਨੂੰ ਇੱਕ ਜਾਂ ਦੂਜੇ ਪਾਸੇ ਲੈ ਜਾਂਦਾ ਹੈ।
Claude ’ਤੇ ਸਾਦੇ ਟੈਸਟ ਨੇ ਸਮੁੱਚੇ ਪੱਧਰ ’ਤੇ ਰਨਾਂ ਵਿਚਕਾਰ ਕਈ ਪੁਆਇੰਟ ਹਿਲਾਏ, ਅਤੇ ਵਿਅਕਤੀਗਤ ਜਵਾਬਾਂ ਦੇ ਪੱਧਰ ’ਤੇ ਹੋਰ ਵੀ। ਇਹ ਇਕਸਾਰਤਾ ਦਾ ਫਰਕ ਸ਼ਾਮਲ ਮਾਡਲਾਂ ਦਾ ਕੋਈ ਹਾਦਸਾ ਨਹੀਂ ਹੈ। ਇਹ ਵੋਟਿੰਗ ਤੋਂ ਆਉਂਦਾ ਹੈ। Engine 2.0 ਵਿੱਚ ਹਰ ਗ੍ਰੇਡਰ ਹਰ ਜਵਾਬ ’ਤੇ ਤਿੰਨ ਵਾਰ ਵੋਟ ਕਰਦਾ ਹੈ ਅਤੇ ਵਿਚਕਾਰਲੀ ਵੋਟ ਰੱਖੀ ਜਾਂਦੀ ਹੈ, ਜੋ ਉਸ ਕਦੇ-ਕਦਾਈਂ ਆਊਟਲਾਈਅਰ ਨੂੰ ਹਟਾਉਂਦਾ ਹੈ ਜੋ ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਪੈਦਾ ਕਰਦਾ ਹੈ। ਜਦੋਂ ਅਸੀਂ ਤਿੰਨ ਦੀ ਥਾਂ ਇੱਕ ਵੋਟ ਨਾਲ ਉਹੀ ਸੰਰਚਨਾ ਟੈਸਟ ਕੀਤੀ, ਰਨ-ਤੋਂ-ਰਨ ਸਹਿਮਤੀ 87.5% ਤੋਂ 77.1% ਤੱਕ ਡਿੱਗ ਗਈ। ਇੱਕ ਸਿੰਗਲ Claude ਗੱਲਬਾਤ ਇੱਕ ਸਿੰਗਲ ਵੋਟ ਹੈ।
ਫੀਡਬੈਕ ਜਿਸ ’ਤੇ ਤੁਸੀਂ ਅਮਲ ਕਰ ਸਕਦੇ ਹੋ
ਇੱਕ ਸਕੋਰ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਕਿੱਥੇ ਹੋ। ਫੀਡਬੈਕ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਅੱਗੇ ਕੀ ਕਰਨਾ ਹੈ, ਅਤੇ ਇਹ ਇੱਕ ਅਜਿਹਾ ਖੇਤਰ ਹੈ ਜਿੱਥੇ Claude ਸੱਚਮੁੱਚ ਵਧੀਆ ਹੈ। ਇਹ ਸਾਫ਼ ਲਿਖਦਾ ਹੈ, ਇਹ ਧੀਰਜਵਾਨ ਹੈ, ਅਤੇ ਜੇ ਤੁਸੀਂ ਪੁੱਛੋ ਕਿ ਇਸ ਨੇ ਖਾਸ ਸਕੋਰ ਕਿਉਂ ਦਿੱਤਾ ਤਾਂ ਇਹ ਜਿੰਨੀ ਲੰਬਾਈ ਤੁਸੀਂ ਚਾਹੋ ਸਮਝਾਏਗਾ। ਜੋ ਉਮੀਦਵਾਰ ਕਿਸੇ ਜਵਾਬ ਬਾਰੇ ਗੱਲ ਕਰਨਾ ਚਾਹੁੰਦਾ ਹੈ, ਉਸ ਲਈ ਇਹ ਕੀਮਤੀ ਹੈ।
ਜੋਖਮ ਸਕੋਰ ਵਾਲਾ ਹੀ ਹੈ: ਸੁਚੱਜੀ ਵਿਆਖਿਆ ਸਹੀ ਨਿਦਾਨ ਦੇ ਬਰਾਬਰ ਨਹੀਂ ਹੈ। ਜਿਸ ਮਾਡਲ ਨੇ 10 ਨੂੰ 7 ਸਕੋਰ ਕੀਤਾ, ਉਹ ਭਰੋਸੇਯੋਗ ਢੰਗ ਨਾਲ ਸਮਝਾਏਗਾ ਕਿ ਇਹ ਕਿਉਂ 7 ਹੈ। ਇਹ ਵੱਲ ਇਸ਼ਾਰਾ ਕਰਨ ਲਈ ਕੁਝ ਲੱਭ ਲਵੇਗਾ। ਅਤੇ ਕਿਉਂਕਿ Claude ਨੂੰ ਸਕੋਰ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਸਬੂਤ ਲਈ ਵਚਨਬੱਧ ਨਹੀਂ ਹੋਣਾ ਪਿਆ, ਵਿਆਖਿਆ ਬਾਅਦ ਵਿੱਚ ਲਿਖੀ ਜਾਂਦੀ ਹੈ, ਪਹਿਲਾਂ ਹੀ ਚੁਣੇ ਗਏ ਨੰਬਰ ਨੂੰ ਸਹੀ ਠਹਿਰਾਉਣ ਲਈ।
Engine 2.0 ਇਸ ਦੇ ਉਲਟ ਕੰਮ ਕਰਦਾ ਹੈ। ਕਿਉਂਕਿ ਹਰ ਗ੍ਰੇਡਰ ਨੂੰ ਜਿਸ ਵੀ ਪਹਿਲੂ ਦਾ ਨਿਰਣਾ ਕਰਦਾ ਹੈ ਉਸ ਲਈ ਸਬੂਤ ਵੱਲ ਇਸ਼ਾਰਾ ਕਰਨਾ ਪੈਂਦਾ ਹੈ, ਫੀਡਬੈਕ ਲੇਅਰ ਸਿੱਧਾ ਉਹ ਸਬੂਤ ਪ੍ਰਾਪਤ ਕਰਦੀ ਹੈ: ਤੁਹਾਡੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦੇ ਉਹੀ ਸ਼ਬਦ ਜਿਨ੍ਹਾਂ ਨੇ ਸਮੱਗਰੀ, ਸ਼ਬਦਾਵਲੀ, ਤੁਸੀਂ ਕਿਵੇਂ ਸੁਣਾਈ ਦਿੰਦੇ ਹੋ, ਅਤੇ ਕੀ ਤੁਸੀਂ ਟਾਸਕ ਪੂਰਾ ਕੀਤਾ, ਇਸ ਬਾਰੇ ਫੈਸਲੇ ਦਾ ਸਮਰਥਨ ਕੀਤਾ। ਫੀਡਬੈਕ ਉਸ ਸਬੂਤ ਤੋਂ ਲਿਖੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਤੁਹਾਡੇ ਆਪਣੇ ਸ਼ਬਦਾਂ ਦਾ ਹਵਾਲਾ ਦਿੰਦੀ ਹੈ। ਫੀਡਬੈਕ ਦੇ ਇੱਕ ਨਮੂਨੇ ਵਿੱਚ 158 ਹਵਾਲਿਆਂ ਦੀ ਸਾਡੀ ਜਾਂਚ ਵਿੱਚ, 157 ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਵਿੱਚ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਮੌਜੂਦ ਸਨ। ਜਦੋਂ ਅਸੀਂ ਇੱਕ ਸੁਤੰਤਰ ਨਿਰਣਾਇਕ ਮਾਡਲ ਨੂੰ Engine 2.0 ਦੀ ਫੀਡਬੈਕ ਦੀ ਸਾਡੇ ਪਿਛਲੇ ਸਿਸਟਮ ਦੀ ਫੀਡਬੈਕ ਨਾਲ ਤੁਲਨਾ ਕਰਨ ਲਈ ਕਿਹਾ, ਬਿਨਾਂ ਇਹ ਜਾਣੇ ਕਿ ਕਿਹੜੀ ਕਿਹੜੀ ਹੈ, ਇਸ ਨੇ 24 ਵਿੱਚੋਂ 20 ਤੁਲਨਾਵਾਂ ਵਿੱਚ Engine 2.0 ਨੂੰ ਪਸੰਦ ਕੀਤਾ, ਦੋਵੇਂ ਜਦੋਂ ਪਰੀਖਿਅਕ ਵਾਂਗ ਨਿਰਣਾ ਕੀਤਾ ਗਿਆ ਅਤੇ ਜਦੋਂ ਵਿਦਿਆਰਥੀ ਵਾਂਗ।
ਅਸੀਂ ਇਹ ਵੀ ਟੈਸਟ ਕੀਤਾ ਕਿ ਕੀ ਫੀਡਬੈਕ ਆਲੋਚਨਾ ਨੂੰ ਸਹੀ ਥਾਂ ’ਤੇ ਰੱਖਦੀ ਹੈ। ਅਸੀਂ ਮਜ਼ਬੂਤ ਜਵਾਬ ਲਏ ਅਤੇ ਹਰ ਇੱਕ ਦੇ ਇੱਕ ਪਹਿਲੂ ਨੂੰ ਜਾਣ ਬੁੱਝ ਕੇ ਖਰਾਬ ਕੀਤਾ: ਵਿਆਕਰਣ ਦੀਆਂ ਗਲਤੀਆਂ ਅਤੇ ਫਿਲਰ ਪਾ ਕੇ, ਸਟੀਕ ਸ਼ਬਦਾਂ ਦੀ ਥਾਂ ਧੁੰਦਲੇ ਸ਼ਬਦ ਪਾ ਕੇ, ਸਹਾਇਕ ਵੇਰਵਾ ਹਟਾ ਕੇ, ਜਾਂ ਟਾਸਕ ਦੀ ਲੋੜੀਂਦੀ ਮੁੱਖ ਕਾਰਵਾਈ ਹਟਾ ਕੇ। ਚਾਰ ਵਿੱਚੋਂ ਤਿੰਨ ਮਾਮਲਿਆਂ ਵਿੱਚ, ਜਿਸ ਪਹਿਲੂ ਨੂੰ ਅਸੀਂ ਖਰਾਬ ਕੀਤਾ ਸੀ ਉਹੀ ਸੀ ਜਿਸ ਦਾ ਸਕੋਰ ਸਭ ਤੋਂ ਵੱਧ ਡਿੱਗਿਆ। ਇਹ ਉਸ ਕਿਸਮ ਦੀ ਜਾਂਚ ਹੈ ਜੋ ਇੱਕ ਚੈਟਬੋਟ ਆਸਾਨੀ ਨਾਲ ਪਾਸ ਨਹੀਂ ਕਰ ਸਕਦਾ, ਕਿਉਂਕਿ ਇਸ ਕੋਲ ਜਾਂਚਣ ਲਈ ਕੋਈ ਸਥਿਰ ਪਹਿਲੂ ਨਹੀਂ ਹਨ।
ਹਰ ਰੋਜ਼ ਅਭਿਆਸ ਕਰਨ ਦੀ ਕੀਮਤ ਕਿੰਨੀ ਹੈ
ਇੱਕ ਸਪੀਕਿੰਗ ਸਕੋਰ ਤੁਹਾਡੇ ਚਾਲੀਵੇਂ ਜਵਾਬ ’ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਲਾਭਦਾਇਕ ਹੁੰਦਾ ਹੈ, ਚੌਥੇ ’ਤੇ ਨਹੀਂ। ਇਹ ਉਦੋਂ ਹੁੰਦਾ ਹੈ ਜਦੋਂ ਇਹ ਤੁਹਾਨੂੰ ਦੱਸਣਾ ਸ਼ੁਰੂ ਕਰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਕਿਵੇਂ ਬੋਲਦੇ ਹੋ ਵਿੱਚ ਬਦਲਾਅ ਅਸਲ ਵਿੱਚ ਕੰਮ ਕਰ ਰਿਹਾ ਹੈ ਜਾਂ ਨਹੀਂ। ਇਸ ਲਈ ਵਿਹਾਰਕ ਸਵਾਲ ਇਹ ਨਹੀਂ ਹੈ ਕਿ ਹਰ ਟੂਲ ਦੀ ਕੀਮਤ ਕਿੰਨੀ ਹੈ, ਸਗੋਂ ਇਹ ਹੈ ਕਿ ਇਸ ਨੂੰ ਵੱਡੀ ਮਾਤਰਾ ਵਿੱਚ ਵਰਤਣ ਦੀ ਕੀਮਤ ਕਿੰਨੀ ਹੈ।
Claude Pro US$20 ਪ੍ਰਤੀ ਮਹੀਨਾ ਹੈ, ਲਗਭਗ CA$28, ਜਾਂ ਸਲਾਨਾ ਬਿਲਿੰਗ ’ਤੇ US$17 ਪ੍ਰਤੀ ਮਹੀਨਾ, ਜਿਵੇਂ ਸਤੰਬਰ 2026 ਵਿੱਚ claude.com ’ਤੇ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤਾ ਗਿਆ। ਇਸ ਵਿੱਚ ਇੱਕ ਰੋਲਿੰਗ ਪੰਜ-ਘੰਟੇ ਦੀ ਵਰਤੋਂ ਵਿੰਡੋ ਅਤੇ ਇੱਕ ਹਫ਼ਤਾਵਾਰੀ ਸੀਮਾ ਹੈ; ਜਦੋਂ ਤੁਸੀਂ ਕਿਸੇ ਇੱਕ ਨੂੰ ਟੱਕਰਦੇ ਹੋ, ਤੁਸੀਂ ਉਡੀਕ ਕਰਦੇ ਹੋ। ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਸਮੇਤ ਲੰਬੀਆਂ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟਾਂ ਬਿਲਕੁਲ ਉਹੀ ਕਿਸਮ ਦਾ ਸੁਨੇਹਾ ਹਨ ਜੋ ਉਸ ਭੱਤੇ ਦਾ ਬਹੁਤ ਹਿੱਸਾ ਵਰਤਦਾ ਹੈ। Max ਪਲਾਨ, US$100 ਪ੍ਰਤੀ ਮਹੀਨਾ ਤੋਂ ਸ਼ੁਰੂ, ਲਗਭਗ CA$138 ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ, ਸੀਮਾਵਾਂ ਨੂੰ ਕਾਫ਼ੀ ਵਧਾ ਦਿੰਦੇ ਹਨ ਪਰ ਇਨ੍ਹਾਂ ਨੂੰ ਹਟਾਉਂਦੇ ਨਹੀਂ। ਕੋਈ ਵੀ ਪਲਾਨ ਸਵਾਲ ਬੈਂਕ, ਟਾਈਮਰ, ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ, ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ, ਜਾਂ CELPIP ਲਈ ਖਾਸ ਕੋਈ ਵੀ ਚੀਜ਼ ਸ਼ਾਮਲ ਨਹੀਂ ਕਰਦਾ।
Prepamigo CA$24.98 ਪ੍ਰਤੀ ਮਹੀਨਾ ਹੈ, ਜਾਂ ਸਲਾਨਾ ਪਲਾਨ ’ਤੇ CA$8.25 ਪ੍ਰਤੀ ਮਹੀਨਾ, ਜੋ ਸਾਲ ਲਈ CA$98.98 ਬਣਦਾ ਹੈ, ਟੈਕਸ ਸਮੇਤ, ਅਤੇ ਤੁਸੀਂ ਕਿਸੇ ਵੀ ਸਮੇਂ ਰੱਦ ਕਰ ਸਕਦੇ ਹੋ। ਹਰ ਪਲਾਨ ਵਿੱਚ Engine 2.0 ਦੁਆਰਾ ਅਸੀਮਿਤ ਸਕੋਰਿੰਗ ਸ਼ਾਮਲ ਹੈ ਬਿਨਾਂ ਕਿਸੇ ਰੋਜ਼ਾਨਾ, ਸੈਸ਼ਨ ਜਾਂ ਹਫ਼ਤਾਵਾਰੀ ਸੀਮਾ ਦੇ, ਅਸੀਮਿਤ ਕੋਸ਼ਿਸ਼ਾਂ, ਅਤੇ ਪੂਰਾ ਸਵਾਲ ਬੈਂਕ: Speaking, Writing, Reading ਅਤੇ Listening ਵਿੱਚ 80 ਪੂਰੇ ਪ੍ਰੈਕਟਿਸ ਸੈੱਟ ਅਤੇ 2,000 ਤੋਂ ਵੱਧ ਪ੍ਰੈਕਟਿਸ ਟਾਸਕ, ਜੋ CELPIP General ਟੈਸਟ ਦੀਆਂ ਟਾਸਕ ਕਿਸਮਾਂ, ਸਮੇਂ ਅਤੇ ਫਾਰਮੈਟ ਦੀ ਪਾਲਣਾ ਕਰਨ ਲਈ ਲਿਖੇ ਗਏ ਹਨ।
ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ: Claude Pro ਦੀ ਕੀਮਤ ਤੋਂ ਘੱਟ ਵਿੱਚ, ਤੁਹਾਨੂੰ ਇੱਕ ਗ੍ਰੇਡਰ ਮਿਲਦਾ ਹੈ ਜੋ ਸਭ ਤੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਜਵਾਬਾਂ ’ਤੇ ਬਹੁਤ ਵੱਧ ਸਹੀ ਹੈ, ਜੋ ਤੁਹਾਨੂੰ ਕਦੇ ਉਡੀਕ ਕਰਨ ਨੂੰ ਨਹੀਂ ਕਹਿੰਦਾ, ਅਤੇ ਜਿਸ ਵਿੱਚ ਸਵਾਲ ਅਤੇ ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਪਹਿਲਾਂ ਤੋਂ ਹੀ ਮੌਜੂਦ ਹਨ।
ਜਦੋਂ Claude ਬਿਹਤਰ ਟੂਲ ਹੈ
ਇਹ ਲੇਖ ਇਹ ਦਲੀਲ ਨਹੀਂ ਦਿੰਦਾ ਕਿ ਤੁਹਾਨੂੰ CELPIP ਦੀ ਤਿਆਰੀ ਕਰਦੇ ਹੋਏ Claude ਕਦੇ ਨਹੀਂ ਖੋਲ੍ਹਣਾ ਚਾਹੀਦਾ। ਕਈ ਚੀਜ਼ਾਂ ਹਨ ਜੋ ਇਹ ਇੱਕ ਵਿਸ਼ੇਸ਼ ਸਕੋਰਿੰਗ ਇੰਜਣ ਨਾਲੋਂ ਬਿਹਤਰ ਕਰਦਾ ਹੈ, ਅਤੇ ਇੱਕ ਗੰਭੀਰ ਉਮੀਦਵਾਰ ਦੋਵੇਂ ਵਰਤ ਸਕਦਾ ਹੈ।
- ਜਵਾਬ ਬਾਰੇ ਗੱਲ ਕਰਨਾ। ਜੇ ਤੁਸੀਂ ਸਮਝਣਾ ਚਾਹੁੰਦੇ ਹੋ ਕਿ ਕੋਈ ਖਾਸ ਕਾਰਨ ਕਿਉਂ ਕਮਜ਼ੋਰ ਸੀ, ਜਾਂ ਤਿੰਨ ਬਿਹਤਰ ਕਾਰਨਾਂ ਬਾਰੇ ਵਿਚਾਰ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਗੱਲਬਾਤ ਸਹੀ ਢੰਗ ਹੈ। Engine 2.0 ਤੁਹਾਨੂੰ ਫੈਸਲਾ ਅਤੇ ਸਬੂਤ ਦਿੰਦਾ ਹੈ; ਇਹ ਗੱਲਬਾਤ ਨਹੀਂ ਕਰਦਾ।
- ਸ਼ਬਦਾਵਲੀ ਅਤੇ ਵਾਕ-ਰਚਨਾ ਵਿੱਚ ਮਦਦ। Claude ਤੋਂ ਕੁਝ ਕਹਿਣ ਦੇ ਪੰਜ ਹੋਰ ਕੁਦਰਤੀ ਢੰਗ ਪੁੱਛਣਾ ਤੇਜ਼ ਅਤੇ ਲਾਭਦਾਇਕ ਹੈ, ਅਤੇ ਇਸ ਦੇ ਸੁਝਾਅ ਆਮ ਤੌਰ ’ਤੇ ਵਧੀਆ ਹੁੰਦੇ ਹਨ।
- ਰਾਈਟਿੰਗ ਪ੍ਰੈਕਟਿਸ। ਲਿਖਤੀ ਜਵਾਬਾਂ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਦੀ ਲੋੜ ਨਹੀਂ ਹੁੰਦੀ, ਇਸ ਲਈ ਵਰਕਫਲੋ ਦਾ ਫਰਕ ਬਹੁਤ ਛੋਟਾ ਹੈ। ਰਾਈਟਿੰਗ ’ਤੇ Claude ਦੀ ਸ਼ੁੱਧਤਾ ਇਸ ਟੈਸਟ ਦਾ ਹਿੱਸਾ ਨਹੀਂ ਸੀ, ਅਤੇ ਅਸੀਂ ਇਸ ਬਾਰੇ ਇੱਥੇ ਕੋਈ ਦਾਅਵਾ ਨਹੀਂ ਕਰਦੇ।
- ਟੈਸਟ ਤੋਂ ਬਾਹਰ ਕੁਝ ਵੀ। ਇਮੀਗ੍ਰੇਸ਼ਨ ਕਾਗਜ਼ੀ ਕੰਮ ਦੇ ਸਵਾਲ, ਸਟੱਡੀ ਸ਼ੈਡਿਊਲ, ਵਿਆਕਰਣ ਦੇ ਨੁਕਤੇ ਸਮਝਾਉਣਾ: Claude ਇੱਕ ਜਨਰਲ ਅਸਿਸਟੈਂਟ ਹੈ ਅਤੇ Prepamigo ਨਹੀਂ ਹੈ।
ਇੱਥੇ ਦਿੱਤੇ ਸਬੂਤਾਂ ਦੇ ਆਧਾਰ ’ਤੇ, Claude ਨੂੰ ਇਹ ਦੱਸਣ ਵਾਲੀ ਚੀਜ਼ ਨਹੀਂ ਹੋਣਾ ਚਾਹੀਦਾ ਕਿ ਤੁਸੀਂ ਤਿਆਰ ਹੋ ਜਾਂ ਨਹੀਂ। ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਇੱਕ ਗ੍ਰੇਡਰ ਚਾਹੀਦਾ ਹੈ ਜੋ ਇਸ ਕੰਮ ਲਈ ਬਣਾਇਆ ਗਿਆ ਸੀ, ਉਸ ਨੇ ਨਾ ਦੇਖੇ ਹੋਏ ਜਵਾਬਾਂ ’ਤੇ ਟੈਸਟ ਕੀਤਾ ਗਿਆ, ਅਤੇ ਪੱਧਰ-ਦਰ-ਪੱਧਰ ਮਾਪਿਆ ਗਿਆ।
ਤੁਹਾਡੇ ਫੀਡਬੈਕ ਵਿੱਚ ਕੀ ਨਵਾਂ ਹੈ
Engine 2.0 ਦੇ ਨਾਲ ਇੱਕ ਨਵੀਂ ਬਣਾਈ ਗਈ ਫੀਡਬੈਕ ਲੇਅਰ ਆਉਂਦੀ ਹੈ। ਇਹ ਸਿਰਫ਼ ਸਕੋਰ ਨਹੀਂ ਸਗੋਂ ਦੋਵੇਂ ਗ੍ਰੇਡਰਾਂ ਦੇ ਸਬੂਤ ਨੂੰ ਪੜ੍ਹਦੀ ਹੈ, ਅਤੇ ਇਸ ਨੂੰ ਤਿੰਨ ਤਰ੍ਹਾਂ ਦੇ ਵਿਦਿਆਰਥੀਆਂ 'ਤੇ ਪਰਖਿਆ ਗਿਆ: ਪਹਿਲੀ ਵਾਰ CELPIP ਦੇਣ ਵਾਲਾ ਕੋਈ, ਕਮਜ਼ੋਰ ਅੰਗਰੇਜ਼ੀ ਵਾਲਾ ਕੋਈ ਜੋ ਬਸ ਤਰੀਕਾ ਲੱਭ ਰਿਹਾ ਹੈ, ਅਤੇ ਕੋਈ ਜਿਸ ਕੋਲ ਦਿਨ ਵਿੱਚ ਅੱਧਾ ਘੰਟਾ ਹੈ ਤੇ ਅਗਲੇ ਹਫ਼ਤੇ ਟੈਸਟ ਹੈ। ਇਹ ਹੈ ਜੋ ਬਦਲਿਆ।
- ਤੁਹਾਡੇ ਆਪਣੇ ਸ਼ਬਦ, ਦੁਬਾਰਾ ਦਿਖਾਏ ਗਏ. ਫੀਡਬੈਕ ਦਾ ਹਰ ਨੁਕਤਾ ਤੁਹਾਡੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦਾ ਉਹੀ ਵਾਕੰਸ਼ ਦੱਸਦਾ ਹੈ ਜਿਸ 'ਤੇ ਗ੍ਰੇਡਰਾਂ ਨੇ ਪ੍ਰਤੀਕਿਰਿਆ ਦਿੱਤੀ। ਜੇ ਕੋਈ ਵਾਕੰਸ਼ ਕੋਟੇਸ਼ਨ ਨਿਸ਼ਾਨਾਂ ਵਿੱਚ ਹੈ, ਤਾਂ ਇਹ ਸ਼ਬਦ-ਦਰ-ਸ਼ਬਦ ਕਾਪੀ ਕੀਤਾ ਗਿਆ ਹੈ; ਸਾਡੀ ਪੜਤਾਲ ਵਿੱਚ 158 ਵਿੱਚੋਂ 157 ਕੋਟ ਇਸੇ ਤਰ੍ਹਾਂ ਸਨ। ਫੀਡਬੈਕ ਕਦੇ ਵੀ ਕੋਈ ਅਜਿਹੀ ਗੱਲ ਨਹੀਂ ਬਣਾਉਂਦਾ ਜੋ ਤੁਸੀਂ ਕਹੀ ਹੀ ਨਹੀਂ।
- ਪਹਿਲਾਂ ਠੀਕ ਕਰਨ ਵਾਲੀ ਇੱਕ ਗੱਲ. ਹਰ ਜਵਾਬ ਨੂੰ ਇੱਕ ਹੀ ਸਭ ਤੋਂ ਵੱਡੀ ਸਲਾਹ ਮਿਲਦੀ ਹੈ: ਉਹ ਇੱਕ ਤਬਦੀਲੀ ਜੋ ਤੁਹਾਡੇ ਸਕੋਰ ਨੂੰ ਸਭ ਤੋਂ ਵੱਧ ਵਧਾਏਗੀ, ਸਭ ਤੋਂ ਸਾਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ ਲਿਖੀ ਹੋਈ। ਇਸ ਦੇ ਬਾਅਦ ਦੋ ਹੋਰ ਠੋਸ ਕਦਮ ਆਉਂਦੇ ਹਨ, ਫਿਰ ਬੋਲਣਾ ਸ਼ੁਰੂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਮਨ ਵਿੱਚ ਦੁਹਰਾਉਣ ਲਈ ਤਿੰਨ-ਨੁਕਾਤੀ ਚੈੱਕਲਿਸਟ।
- ਟਾਸਕ ਦੇ ਮੁਤਾਬਕ ਸਲਾਹ. ਸਲਾਹ ਦੇਣਾ, ਕਿਸੇ ਦ੍ਰਿਸ਼ ਦਾ ਵਰਣਨ ਕਰਨਾ ਅਤੇ ਕਿਸੇ ਨੂੰ ਮਨਾਉਣਾ — ਇਹਨਾਂ ਸਭ ਦਾ ਸਕੋਰ ਵੱਖ-ਵੱਖ ਗੱਲਾਂ 'ਤੇ ਹੁੰਦਾ ਹੈ। ਫੀਡਬੈਕ ਨੂੰ ਹੁਣ ਪਤਾ ਹੈ ਕਿ ਅੱਠ ਟਾਸਕ ਕਿਸਮਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ਕਿਸ ਗੱਲ ਦਾ ਇਨਾਮ ਦਿੰਦੀ ਹੈ, ਅਤੇ ਉਸੇ ਮੁਤਾਬਕ ਗੱਲ ਕਰਦਾ ਹੈ, ਸਾਰੇ ਟਾਸਕਾਂ ਵਿੱਚ ਇੱਕੋ ਜਿਹੀਆਂ ਆਮ ਟਿਪਸ ਦੁਹਰਾਉਣ ਦੀ ਥਾਂ।
- ਪਹਿਲਾਂ ਕਿਸ ਪਹਿਲੂ ਦਾ ਅਭਿਆਸ ਕਰਨਾ ਹੈ. ਫੀਡਬੈਕ ਤੁਹਾਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਚਾਰ ਪਹਿਲੂਆਂ ਵਿੱਚੋਂ ਕਿਹੜਾ ਤੁਹਾਡਾ ਸਭ ਤੋਂ ਕਮਜ਼ੋਰ ਹੈ ਅਤੇ ਕਿਹੜਾ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ, ਤਾਂ ਜੋ ਤੁਹਾਨੂੰ ਪਤਾ ਹੋਵੇ ਕਿ ਅਗਲਾ ਅੰਕ ਕਿੱਥੇ ਹੈ, ਬਿਨਾਂ ਇਸ ਨੂੰ ਕਿਸੇ ਨੰਬਰ ਪਿੱਛੇ ਲੁਕਾਏ।
- ਟਾਸਕ ਨੇ ਕੀ ਮੰਗਿਆ ਅਤੇ ਤੁਸੀਂ ਕੀ ਛੱਡਿਆ. ਟਾਸਕ ਪੂਰਤੀ ਵਿੱਚ, ਫੀਡਬੈਕ ਉਹ ਖਾਸ ਹਿੱਸੇ ਸੂਚੀਬੱਧ ਕਰਦਾ ਹੈ ਜਿਹੜੇ ਪ੍ਰੌਂਪਟ ਦੇ ਤੁਸੀਂ ਕਵਰ ਨਹੀਂ ਕੀਤੇ, ਜਾਂ ਸਾਫ਼ ਕਹਿ ਦਿੰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਉਹ ਸਭ ਕਵਰ ਕਰ ਲਏ ਹਨ।
- ਗੱਲਾਂ ਜਿਹਨਾਂ ਦੀ ਤੁਸੀਂ ਅਸਲ ਵਿੱਚ ਰਿਹਰਸਲ ਕਰ ਸਕਦੇ ਹੋ. ਹਰ 'ਕਿਵੇਂ ਕਰੀਏ' ਸਲਾਹ ਕੁਝ ਅਜਿਹਾ ਹੈ ਜੋ ਤੁਸੀਂ ਆਪਣੀ ਅਗਲੀ ਕੋਸ਼ਿਸ਼ ਤੋਂ ਪਹਿਲਾਂ ਉੱਚੀ ਆਵਾਜ਼ ਵਿੱਚ ਬੋਲ ਸਕਦੇ ਹੋ। ਵੱਧ ਸਪਸ਼ਟ ਬੋਲਣ ਜਾਂ ਆਪਣਾ ਲਹਿਜਾ ਘਟਾਉਣ ਦੀ ਕੋਈ ਸਲਾਹ ਨਹੀਂ ਦਿੱਤੀ ਜਾਂਦੀ: ਲਹਿਜਾ ਉਹ ਚੀਜ਼ ਨਹੀਂ ਜਿਸ ਨੂੰ ਸੁਣਨਯੋਗਤਾ ਮਾਪਦੀ ਹੈ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ 'ਤੇ ਕਦੇ ਟਿੱਪਣੀ ਨਹੀਂ ਕਰਦਾ।
- ਟਾਈਮਰ ਲਈ ਕੋਈ ਦੋਸ਼ ਨਹੀਂ. ਜੇ ਕੋਈ ਜਵਾਬ ਟਾਸਕ ਪੂਰਾ ਕਰ ਲੈਣ ਤੋਂ ਬਾਅਦ ਸਮੇਂ ਦੀ ਵਜ੍ਹਾ ਨਾਲ ਵਿੱਚੋਂ ਕੱਟਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਸ ਕੱਟ ਦੇ ਲਈ ਸਕੋਰ ਨਹੀਂ ਘਟਾਇਆ ਜਾਂਦਾ, ਅਤੇ ਫੀਡਬੈਕ ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਝਾੜ ਨਹੀਂ ਪਾਉਂਦਾ।
ਜਦੋਂ ਇੱਕ ਸੁਤੰਤਰ ਨਿਰਣਾਇਕ ਮਾਡਲ ਨੇ ਇਸ ਫੀਡਬੈਕ ਦੀ ਤੁਲਨਾ ਉਸ ਨਾਲ ਕੀਤੀ ਜੋ ਸਾਡੇ ਪਿਛਲੇ ਸਿਸਟਮ ਨੇ ਇਹਨਾਂ ਹੀ ਜਵਾਬਾਂ ਲਈ ਦਿੱਤਾ ਸੀ, ਬਿਨਾਂ ਇਹ ਜਾਣੇ ਕਿ ਕਿਹੜਾ ਕਿਹੜਾ ਹੈ, ਇਸ ਨੇ 24 ਵਿੱਚੋਂ 20 ਤੁਲਨਾਵਾਂ ਵਿੱਚ ਨਵੇਂ ਫੀਡਬੈਕ ਨੂੰ ਪਹਿਲ ਦਿੱਤੀ, ਭਾਵੇਂ ਇਹ ਇੱਕ ਪ੍ਰੀਖਿਅਕ ਵਾਂਗ ਨਿਰਣਾ ਕਰ ਰਿਹਾ ਹੋਵੇ ਜਾਂ ਇੱਕ ਵਿਦਿਆਰਥੀ ਵਾਂਗ।
ਅਕਸਰ ਪੁੱਛੇ ਜਾਂਦੇ ਸਵਾਲ
ਕੀ Claude ਮੇਰੀ CELPIP ਸਪੀਕਿੰਗ ਪ੍ਰੈਕਟਿਸ ਸਕੋਰ ਕਰ ਸਕਦਾ ਹੈ? ਇਹ ਤੁਹਾਨੂੰ ਇੱਕ ਨੰਬਰ ਦੇਵੇਗਾ। 48 ਅਣਦੇਖੇ, ਤਸਦੀਕਸ਼ੁਦਾ ਸਕੋਰਾਂ ਵਾਲੇ ਜਵਾਬਾਂ ’ਤੇ ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ, Claude Opus 5 ਨੇ 62% ਵਾਰ ਅਤੇ Claude Sonnet 5 ਨੇ 45% ਵਾਰ ਤਸਦੀਕਸ਼ੁਦਾ ਪੱਧਰ ’ਤੇ ਸਕੋਰ ਦਿੱਤਾ, ਜਦਕਿ Prepamigo Scoring Engine 2.0 ਲਈ ਇਹ 81% ਸੀ। ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬਾਂ ’ਤੇ Sonnet 5 ਸਿਰਫ਼ 29% ਵਾਰ ਸਹੀ ਸੀ।
ਕੀ Prepamigo Claude ਨਾਲੋਂ ਵੱਧ ਸਹੀ ਹੈ? ਹਾਂ: ਸਾਦੀ ਬੇਨਤੀ ਨਾਲ 81% ਬਨਾਮ 62% ਅਤੇ 45%। ਕੈਲੀਬ੍ਰੇਸ਼ਨ ਉਦਾਹਰਣਾਂ ਵਾਲੀ ਸਾਡੀ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦੇ ਨਾਲ, Opus 5 77% ਅਤੇ Sonnet 5 69% ਤੱਕ ਪਹੁੰਚਿਆ, ਅਜੇ ਵੀ ਪਿੱਛੇ, ਅਤੇ ਸਕੇਲ ਦੇ ਟੌਪ ’ਤੇ ਅਜੇ ਵੀ ਸਭ ਤੋਂ ਕਮਜ਼ੋਰ।
ਹਰੇਕ ਦੀ ਕੀਮਤ ਕਿੰਨੀ ਹੈ? Claude Max US$100 ਪ੍ਰਤੀ ਮਹੀਨਾ ਤੋਂ ਸ਼ੁਰੂ ਹੁੰਦਾ ਹੈ, ਲਗਭਗ CA$138 ਟੈਕਸ ਤੋਂ ਪਹਿਲਾਂ, ਵਰਤੋਂ ਸੀਮਾਵਾਂ ਸਮੇਤ; Claude Pro US$20 ਦਾ ਹੈ ਸਖ਼ਤ ਸੀਮਾਵਾਂ ਨਾਲ। Prepamigo ਟੈਕਸ ਸਮੇਤ CA$24.98 ਪ੍ਰਤੀ ਮਹੀਨਾ ਹੈ, ਜਾਂ ਸਲਾਨਾ ਪਲਾਨ ’ਤੇ CA$8.25 ਪ੍ਰਤੀ ਮਹੀਨਾ, ਅਸੀਮਿਤ ਸਕੋਰਿੰਗ ਅਤੇ 80 ਪ੍ਰੈਕਟਿਸ ਸੈੱਟਾਂ ਨਾਲ।
Claude ਮੇਰੇ ਮਜ਼ਬੂਤ ਜਵਾਬਾਂ ਨੂੰ 7 ਜਾਂ 8 ਕਿਉਂ ਦਿੰਦਾ ਰਹਿੰਦਾ ਹੈ? ਬਿਨਾਂ ਕਿਸੇ ਤੁਲਨਾ ਦੇ ਨੰਬਰ ਮੰਗਿਆ ਗਿਆ ਮਾਡਲ ਘੱਟ ਅਤੇ ਵਿਚਕਾਰ ਵੱਲ ਖਿਸਕਦਾ ਹੈ, ਅਤੇ ਇੱਕ ਟੌਪ-ਪੱਧਰ ਦਾ ਜਵਾਬ ਕਦੇ ਵੀ ਪੂਰੀ ਤਰ੍ਹਾਂ ਨਿਰਦੋਸ਼ ਨਹੀਂ ਹੁੰਦਾ। ਸਾਦੇ ਤੌਰ ’ਤੇ ਪੁੱਛਣ ’ਤੇ, Sonnet 5 ਨੇ ਸਿਰਫ਼ 29% ਵਾਰ ਟੌਪ-ਪੱਧਰ ਦੇ ਜਵਾਬ ਨੂੰ 9 ਜਾਂ ਵੱਧ ਦਿੱਤਾ।
ਸਕੋਰਿੰਗ ਅਸਲ ਵਿੱਚ ਕਿਵੇਂ ਕੰਮ ਕਰਦੀ ਹੈ ਇਹ ਦੇਖਣ ਲਈ, ਪੜ੍ਹੋ Scoring Engine 2.0 ਦੇ ਅੰਦਰ। GPT ਅਤੇ Gemini ਸਮੇਤ ਪੂਰੀ ਲੀਡਰਬੋਰਡ ਦੇਖਣ ਲਈ, ਪੜ੍ਹੋ ਕਿਹੜਾ AI CELPIP ਸਪੀਕਿੰਗ ਸਭ ਤੋਂ ਸਹੀ ਸਕੋਰ ਕਰਦਾ ਹੈ। ਜਾਂ ਪੜ੍ਹਨਾ ਛੱਡ ਕੇ ਜਵਾਬ ਰਿਕਾਰਡ ਕਰੋ। ਇਹ ਗਾਈਡ ਅੰਗਰੇਜ਼ੀ ਵਿੱਚ ਪੜ੍ਹੋ
