Bahagi ng mga sagot na na-score sa verified level
48 held-out speaking response, 16 sa bawat isa sa tatlong antas. Binigyan ang Claude ng transcript at hiniling, sa payak na salita, na i-score ito sa CELPIP scale; average ng tatlong takbo. Tumakbo ang Engine 2.0 sa normal nitong production configuration.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
45%
Claude Sonnet 5
Prepamigo laban sa mga nangungunang chatbot plan
Dolyar Canadian. Kasama na ang buwis sa mga presyo ng Prepamigo. Ang Claude Max (mula sa US$100) at ChatGPT Pro (US$200) ay na-convert sa 1.38, bago buwis. Ang accuracy ay ang bahagi ng held-out na mga sagot na na-score sa verified level kapag hiniling sa napiling modelo, sa payak na salita, na i-score ang sagot; average ng tatlong takbo.
Kung minsan ka nang nagdikit ng speaking transcript sa Claude at hiniling ditong i-grade ka gaya ng isang CELPIP rater, alam mo na ang appeal nito. Sumasagot ito agad, ipinaliwanag nito ang sarili nito, at hindi ito napapagod. Ang tanong ay kung ang numerong ibinibigay nito ay talagang ang numerong makukuha mo. Isinagawa namin ang pagsubok sa paraang gagawin ng isang estudyante: parehong transcript, payak na kahilingan para sa score, at pagkatapos ay binilang namin.
Ang maikling sagot: sa 48 speaking response na hindi pa nakita ng mga sistema, na bawat isa ay may independiyenteng na-verify na score, natamo ng Prepamigo Scoring Engine 2.0 ang tamang level 81% ng oras. Nang hiniling sa payak na salita na i-score ang parehong transcript, natamo ng Claude Opus 5 ang tamang level 62% ng oras at ng Claude Sonnet 5 45% ng oras. Ang agwat ay pinakamalawak eksakto sa pinakamahalagang parte para sa sinumang nangangaso ng mataas na score: sa mga sagot sa pinakamataas na antas, nakilala ng Engine 2.0 ang 71%, ng Opus 5 ang 50%, at ng Sonnet 5 ang 29%.
Pagkatapos, gumawa kami ng bagay na hindi ginagawa ng karamihan sa mga paghahambing. Ibinigay namin sa Claude ang aming sariling grading procedure, may totoong calibration examples para sa bawat task at isang forced comparison laban sa mga ito, upang makita kung gaano ito magagaling. Umakyat ang Opus 5 sa 77% at ang Sonnet 5 sa 69%. Pareho silang natapos na nahuhuli pa rin sa Engine 2.0, at pareho pa ring pinakanahirapan sa mga sagot sa pinakamataas na antas. Susuriin ng natitirang bahagi ng artikulong ito ang dalawang pagsubok, kung ano ang hitsura ng mga numero sa bawat antas ng score, kung bakit lumilihis ang isang general-purpose assistant patungo sa gitna ng scale, kung ano ang hitsura ng araw-araw na workflow sa bawat panig, at kung magkano ang gastos ng bawat opsyon kung seryoso kang magpractice.
Ang payak na pagsubok: ang talagang nakukuha ng estudyante
Walumpu’t isang porsyento laban sa animnapu’t dalawa at apatnapu’t lima. Sa isang pagsubok na may 48 sagot, ang pagkakaiba sa pagitan ng Engine 2.0 at Opus 5 ay siyam na dagdag na tamang score, at ang pagkakaiba sa pagitan ng Engine 2.0 at Sonnet 5 ay labimpito. Sa ibang salita, gumagawa ang Engine 2.0 ng 51% na mas kaunting pagkakamali sa scoring kaysa sa Opus 5 at 66% na mas kaunti kaysa sa Sonnet 5.
Ang tatlong hiwalay na takbo ng payak na pagsubok ay nagbigay sa Opus 5 ng 62%, 65%, at 58%, at sa Sonnet 5 ng 44%, 46%, at 46%. Ang pagkakaiba-iba na ilang puntos sa pagitan ng mga takbo ay isang natuklasan mismo: hilingin sa Claude na i-grade ang parehong transcript sa dalawang magkaibang araw at madalas kang makakakuha ng dalawang magkaibang score. Ang Engine 2.0 ay nagkuha ng 81.3% sa bawat isa sa tatlong takbo nito.
Kung saan bumubukas ang agwat: antas por antas
Karamihan sa mga grader, tao man o makina, ay lumilihis patungo sa gitna ng scale. Ang malakas na sagot ay nagiging 8 sa halip na 10; ang mahina ay nagiging 6 sa halip na 5. Ang paglihis na iyon ay hindi nakikita sa average at halata sa sandaling hatiin mo ang resulta ayon sa antas. Sa payak na prompt, nagdaragdag ang Claude ng isang pangalawang ugali sa ibabaw nito: lumilihis din pababa, kaya kahit ang mahihinang sagot ay madalas na na-score sa ibaba ng kanilang antas.
Mababang-antas na sagot (verified score 4 o 5)
16 held-out response, payak na prompt, average ng tatlong takbo. Ang mga miss ng Sonnet 5 dito ay karamihan ay score na 3.
88%
Prepamigo Engine 2.0
77%
Claude Opus 5
44%
Claude Sonnet 5
Sa mahihinang sagot, nangunguna ang Engine 2.0 sa 88%, sumusunod ang Opus 5 sa 77%, at ang Sonnet 5 ay bumaba sa 44%. Ito ang madaling dulo ng scale, at kinakayanan ito nang maayos ng Opus 5. Hindi kaya ng Sonnet 5: mas madalas nitong bigyan ng 3 ang isang sagot na 4 o 5, na mali sa antas kahit maiintindihan ang direksyon. Ang isang estudyante sa antas na ito na gumagamit ng Sonnet 5 para i-grade ang kanyang sarili ay sasabihan na mas mahina siya kaysa sa totoo, karamihan sa oras.
Gitnang-antas na sagot (verified score 7 o 8)
16 held-out response, payak na prompt, average ng tatlong takbo. Ang mga miss ay halos lahat ay 6.
85%
Prepamigo Engine 2.0
63%
Claude Sonnet 5
58%
Claude Opus 5
Sa gitna, ang Engine 2.0 ay sa 85% at ang dalawang model ng Claude ay sa 63% at 58%. Ang mga gitnang-antas na sagot ay may pinaghalong lakas at kahinaan na dapat timbangin sa halip na tuklasin, at walang calibration examples na pagtitimbangan, ang dalawang model ng Claude ay nakikita ang mga kahinaan at nagbibigay ng 6. Ang isang 7 o 8 na nagsasalita ay maririnig na siya ay 6 humigit-kumulang apat sa bawat sampu.
Pinakamataas na-antas na sagot (verified score 10 pataas)
16 held-out response, payak na prompt, average ng tatlong takbo. Halos lahat ng miss ay 7 o 8.
71%
Prepamigo Engine 2.0
50%
Claude Opus 5
29%
Claude Sonnet 5
Sa pinakamataas na antas, nakikilala ng Engine 2.0 ang 71% ng mga sagot sa pinakamataas na antas. Nakikilala ng Opus 5 ang kalahati sa mga ito. Nakikilala ng Sonnet 5 ang 29%, na nangangahulugang binibigyan nito ng 7 o 8 ang pito sa bawat sampung sagot na dapat sana ay 10.
Isipin mo kung ano ang kahulugan nito sa aktwal na buhay. Halimbawang ang iyong speaking talaga ay 10 ngayon. Nagrecord ka ng walong sagot, na-transcribe mo ito, idinikit mo sa Claude Sonnet 5 at hiniling mo ang score, at sinabi sa iyo nito na anim sa mga ito ay 7 at 8. Nagpasya kang hindi ka pa handa. Gumugol ka ng tatlo pang linggo sa pag-drill. Handa ka na noon pa lang. Hindi ito isang haka-haka na paglabag; ito ang pinakakaraniwang pagkakamali sa aming buong pagsubok, at ito ang bumagsak pinakamalakas sa mga kandidato na pinakamatiyaga ang paghahanda.
Ano kung ibigay mo sa Claude ang aming buong procedure?
Nakakatukso na basahin ang mga numero ng payak na pagsubok bilang patunay na mahina ang Claude bilang model. Hindi ito totoo. Ang Opus 5, sa malayong pagkakaiba, ay ang pinakamalakas na general-purpose grader na nasubukan namin. Ang problema ay hindi ang katalinuhan. Ito ay dahil ang isang model na hiniling ng numero, walang ikukumpara, ay nanghuhula, at kapag ito ay nanghuhula, ito ay nanghuhula ng mababa at patungo sa gitna.
Kaya isinagawa namin ang pangalawang pagsubok. Ang Claude ay tumanggap ng parehong package na ibinibigay sa mga grader ng Engine 2.0: ang transcript, ang task, dalawang totoong calibration example sa bawat antas para sa eksaktong task na ito, at isang instruksyon na pangalanan ang pinakamalapit na example para sa bawat isa sa apat na dimensyon sa halip na gumawa ng numero. Ang bawat model ay tumanggap din ng maikling calibration note na iniangkop sa sarili nitong ugali.
Ibinigay ang aming buong procedure: bahagi ng mga sagot na na-score sa verified level
Parehong 48 held-out response. Ang bawat model ng Claude ay nag-grade ng bawat sagot isang beses gamit ang parehong transcript, instruksyon, at calibration examples gaya ng mga sariling grader ng Engine 2.0.
81%
Prepamigo Engine 2.0
77%
Claude Opus 5
69%
Claude Sonnet 5
Malaki ang pagkakaiba na dala ng calibration examples. Umakyat ang Opus 5 mula 62% patungong 77%; ang Sonnet 5 mula 45% patungong 69%. Ang katumpakan sa mababang-antas para sa pareho ay umabot sa 88%, pareho sa Engine 2.0. Ang katumpakan sa gitnang-antas ay umabot sa 81% para sa pareho. Sulit itong pag-isipan, dahil sinasabi nito kung saan talagang nakakapit ang halaga sa isang purpose-built grader: hindi sa isang mas matalinong model, kundi sa totoong halimbawa kung ano ang tunog ng bawat antas sa bawat tiyak na task, at sa isang tanong na pinipilit ang model na maghambing sa halip na manghula.
Kahit gayon, pareho pa ring nahuhuli ang dalawang model sa pinakataas na bahagi ng scale. Sa full procedure, nakikilala ng Opus 5 ang 63% ng mga sagot sa pinakamataas na antas at ng Sonnet 5 ang 38%, kumpara sa 71% para sa Engine 2.0. Ang isang model na gumagawa ng isang pagpasada ay nagpipigil pa rin sa isang malakas na sagot na may maliit na pagkakamali. Isinasara ng Engine 2.0 ang natitirang agwat gamit ang tatlong pang bagay: dalawang independiyenteng grader mula sa magkaibang provider, tatlong boto mula sa bawat isa na ang gitnang boto ay itinatago, at isang panuntunan sa reconciliation na kinukuha ang mas mataas na score kapag magkaiba nang malaki ang dalawang grader, dahil ipinakita ng pagsusuri na ang mas mababang verdict ay halos palaging mali sa malalakas na sagot.
Sinubok din namin ang halatang shortcut: panatilihin ang payak na prompt at magdagdag ng instruksyon tulad ng “huwag lumihis patungo sa gitna” o “ang isang level 9 na sagot ay hindi kailangang perpekto.” Wala silang nadulot na masusukat na pagbabago. Sinasang-ayunan ng model ang instruksyon at pagkatapos ay ginagawa pa rin ang balak nito noon pa man. Ang gumagana ay ang pagbabago ng tanong, at pagbigay ng totoong bagay na ikukumpara.
Ang agwat sa workflow: mag-record at umalis, o gawin mong lahat ang sarili
Ang mga numero ng katumpakan ay ipinapalagay na talagang nangyayari ang pag-grade. Sa Claude, may kagulat-gulat na dami ng trabaho sa pagitan ng pagpindot mo ng stop sa iyong recording at ang pagbasa ng score.
Una, kailangan mo ng transcript. Ang chat interface ng Claude ay hindi nag-grade ng audio recording, kaya kailangan mong gumawa ng teksto. Ito ay nangangahulugang i-type ang iyong sinabi, na nagbabago nito, o patakbuhin ang recording sa isang transcription tool. At narito ang detalye na nagkaubos sa amin ng katumpakan bago namin ito naunawaan: ang transcript ay dapat na verbatim. Ang bawat filler, bawat restart, bawat self-correction ay dapat manatili. Nang sinubukan namin ang isang “nalinis” na transcript na inalis ang mga pag-aatubili, bumaba ang katumpakan ng labinlimang puntos, dahil ang mga pag-aatubiling ito ay eksaktong ang ebidensyang kailangan ng grader upang husgahan kung paano tumunog ang isang sagot. Karamihan sa mga consumer transcription tool ay naglilinis bilang default.
Ikalawa, kailangan mo ng task. Ang Claude ay walang bangko ng mga CELPIP-style prompt na may tamang timing at format. Sumulat ka ng iyong sarili, na nangangahulugang hinuha kung ano talaga ang tanong ng aktwal na test, o humanap ng isa saan man at idikit ito kasama ang transcript.
Ikatlo, kung nais mo ng mas maganda pa sa mga numero ng payak na pagsubok, kailangan mo ng calibration examples: totoong sagot sa bawat antas para sa parehong tipo ng task, may na-verify na antas. Ito ang input na nag-akyat ng Opus 5 mula 62% patungong 77% sa aming pagsubok, at ito ang isang bagay na hindi magagawa ng isang estudyante sa bahay.
Ikaapat, gagawin mo itong lahat ulit para sa susunod na sagot. At ang isa pagkatapos nito.
Sa Prepamigo, pipili ka ng task mula sa bangko, tumatakbo ang timer, nagsasalita ka, at mga sampung segundo pagkatapos mong tumigil, nasa screen na ang score at feedback. Ang transcription ay verbatim sa disenyo, ang calibration examples ay kasama na sa task nang automatiko, at walang idikit at walang i-prompt. Ang ikalabing-isang sagot ng gabi ay may parehong pagsisikap gaya ng una.
Consistency: ang parehong sagot, ang parehong score
Ang isang score na hindi mo maulit ay hindi isang sukat. Kung ang parehong recording ay makukuha ng 8 sa Lunes at 10 sa Martes, wala kang natutunan tungkol sa iyong speaking at may natutunan tungkol sa mood ng grader. Kaya sinubok din namin kung ang bawat sistema ay nagbibigay ng parehong sagot nang dalawang beses.
Ang Engine 2.0 ay pinatakbo sa 48 held-out response ng tatlong hiwalay na pagkakataon. Nakuha nito ang 81.3% sa bawat takbo. Kung titingnan ang indibidwal na sagot sa halip ng aggregate, 87.5% ang tumanggap ng eksaktong parehong score sa lahat ng tatlong takbo, at 4.2% lamang ang kumilos ng dalawang puntos o higit pa. Ang kaunti na ito ay mga sagot na nakatapat mismo sa hangganan sa pagitan ng dalawang antas, kung saan ang maliit na pagkakaiba sa paghusga ay lehitimong nagtutulak sa score sa isang direksyon.
Ang payak na pagsubok sa Claude ay kumilos ng ilang puntos sa pagitan ng mga takbo sa antas na aggregate, at higit pa sa antas ng indibidwal na sagot. Ang agwat sa consistency na ito ay hindi aksidente ng mga model na sangkot. Nagmumula ito sa voting. Ang bawat grader sa Engine 2.0 ay bumoboto ng tatlong beses sa bawat sagot at ang gitnang boto ay itinatago, na inaalis ang bihirang outlier na dulot ng isang pagpasada. Nang sinubukan namin ang parehong configuration na may isang boto sa halip ng tatlo, bumaba ang agreement ng run-to-run mula 87.5% patungong 77.1%. Ang isang solong pag-uusap sa Claude ay isang boto lamang.
Feedback na maaari mong kilusan
Ang score ay nagsasabi sa iyo kung nasaan ka. Ang feedback ay nagsasabi sa iyo ng susunod na gagawin, at ito ay lugar kung saan ang Claude ay talagang mahusay. Nagsusulat ito nang malinaw, matiyaga ito, at kung tatanungin mo ito kung bakit ito nagbigay ng isang tiyak na score, ipapaliwanag nito sa kung anong haba na gusto mo. Para sa isang kandidato na nais makipag-usap tungkol sa isang sagot, mahalaga ito.
Ang panganib ay pareho sa score: ang matatas na paliwanag ay hindi pareho sa tumpak na diagnosis. Ang isang model na nagbigay ng 7 sa isang 10 ay ipapaliwanag, nakakumbinsi, kung bakit ito 7. Makakahanap ito ng bagay na itutukoy. At dahil hindi kinailangan ng Claude na mag-commit sa ebidensya bago mag-score, ang paliwanag ay isinulat pagkatapos ng katotohanan, upang bigyang-katwiran ang numero na napili na nito.
Ang Engine 2.0 ay gumagana sa kabaligtaran. Dahil ang bawat grader ay dapat tumukoy sa ebidensya para sa bawat dimensyon na hinuhusgahan nito, natatanggap mismo ng feedback layer ang ebidensyang ito: ang eksaktong mga parirala mula sa iyong transcript na sumusuporta sa verdict tungkol sa nilalaman, bokabularyo, kung paano ka tumunog, at kung natapos ang task. Isinulat ang feedback mula sa ebidensyang ito at nagsisipi ng iyong mismong mga salita. Sa aming pagsusuri ng 158 sipi sa isang sample ng feedback, 157 ang lumitaw nang verbatim sa transcript. Nang hiniling namin sa isang independiyenteng judging model na ihambing ang feedback ng Engine 2.0 sa feedback ng dating sistema namin, nang hindi nalalaman kung alin ang alin, pinili nito ang Engine 2.0 sa 20 sa 24 na paghahambing, kapwa kapag humuhusga bilang isang examiner at kapag humuhusga bilang isang estudyante.
Sinubok din namin kung ang feedback ay ipinapatong ang puna sa tamang lugar. Kinuha namin ang malalakas na sagot at sinadyang sinira ang isang aspeto ng bawat isa: pagdaragdag ng mga error sa grammar at filler, pagpalit ng eksaktong salita ng malabo, pag-alis ng suportang detalye, o pag-alis ng pangunahing aksyon na hiningi ng task. Sa tatlo sa apat na kaso, ang dimensyon na sinira namin ay ang nagbagsak nang pinakamalaki sa score. Ito ang tipo ng pagsusuri na hindi kayang madaling pasa ng chatbot, dahil walang fixed dimensyon ito na masusukat laban.
Ang gastos sa pagpractice araw-araw
Ang isang speaking score ay pinakakapaki-pakinabang sa iyong ika-apatnapung sagot, hindi sa ikaapat. Iyon ang oras na sinasabi nito kung nagbunga ba ang isang pagbabago sa kung paano ka nagsalita. Kaya ang praktikal na tanong ay hindi kung magkano ang gastos ng bawat tool, kundi kung magkano ang gastos gamitin ito nang bulto.
Ang Claude Pro ay US$20 kada buwan, humigit-kumulang CA$28, o US$17 kada buwan sa annual billing, gaya ng nailathala sa claude.com noong Setyembre 2026. Kasama nito ang rolling five-hour usage window at weekly limit; kapag nasadlak ka sa isa man dito, maghihintay ka. Ang mahahabang transcript na may calibration examples ay eksaktong tipo ng mensahe na gumagamit ng malaking bahagi ng allowance na iyon. Ang mga Max plan, mula US$100 kada buwan, humigit-kumulang CA$138 bago buwis, ay nagtataas ng limitasyon nang malaki pero hindi ito inaalis. Wala sa mga plan na may bangko ng tanong, timer, transcription, calibration examples, o anumang tiyak sa CELPIP.
Ang Prepamigo ay CA$24.98 kada buwan, o CA$8.25 kada buwan sa annual plan, na CA$98.98 para sa taon, kasama na ang buwis, at maaari mong kanselahin anumang oras. Ang bawat plan ay may walang limitasyong pag-score ng Engine 2.0 na walang araw-araw, session, o weekly cap, walang limitasyong pagsubok, at ang buong bangko ng tanong: 80 kumpletong practice set at mahigit 2,000 practice task sa Speaking, Writing, Reading, at Listening, na sinulat upang sundin ang tipo ng task, timing, at format ng CELPIP General test.
Sa madaling salita: para sa mas mababa pa sa presyo ng Claude Pro, makukuha mo ang isang grader na mas tumpak nang malaki sa mga sagot na pinakamahalaga, na hindi ka pinaghihintay, at may kasamang mga tanong at calibration examples na naka-in place na.
Kailan mas mainam ang Claude
Hindi ito isang artikulong nangangatwiran na hindi mo dapat buksan ang Claude habang nagpapaghanda para sa CELPIP. May ilang bagay na mas mahusay itong gawin kaysa sa isang specialized scoring engine, at may magandang tsansang gamitin ng isang seryosong kandidato ang pareho.
- Pag-usapan ang isang sagot. Kung nais mong maunawaan kung bakit mahina ang isang tiyak na dahilan, o mag-brainstorm ng tatlong mas magandang dahilan, angkop ang isang pag-uusap. Nagbibigay ang Engine 2.0 ng verdict at ebidensya; hindi ito nakikipag-chat.
- Tulong sa bokabularyo at pananalita. Ang paghingi ng lima pang natural na paraan ng pagsabi ng isang bagay sa Claude ay mabilis at kapaki-pakinabang, at karaniwang magandang ang mga suhestiyon nito.
- Practice sa Writing. Ang mga sagot na sinulat ay hindi nangangailangan ng transcription, kaya mas maliit ang agwat sa workflow. Ang katumpakan ng Claude sa writing ay hindi bahagi ng pagsubok na ito, at wala kaming pahayag tungkol dito.
- Anumang bagay na wala sa test. Mga tanong tungkol sa immigration paperwork, iskedyul ng pag-aaral, pagpapaliwanag ng punto ng grammar: ang Claude ay isang general assistant at hindi ang Prepamigo.
Ang hindi dapat na gawin ng Claude, sa ebidensyang ito, ay ang bagay na nagsasabi sa iyo kung handa ka na. Para sa iyo iyon, nais mong may grader na binuo para sa trabahong ito, nasubok sa mga sagot na hindi nito nakita, at sinukat antas por antas.
Ano ang bago sa iyong feedback
Dumating ang Engine 2.0 na may bagong itinayong feedback layer. Binabasa nito ang ebidensya ng dalawang grader, hindi lang ang score, at nasubok ito laban sa tatlong klase ng estudyante: ang unang pagkakataong sumagot sa CELPIP, ang mahina sa Ingles na naghahanap ng tips, at ang may kalahating oras bawat araw na may pagsusulit sa susunod na linggo. Ito ang mga pagbabago.
- Ang sarili mong mga salita, na binanggit pabalik. Bawat puntong feedback ay nagsisipi ng eksaktong parirala mula sa iyong transcript na pinag-ugatan ng reaksyon ng mga grader. Kapag may quotation marks ang isang parirala, ito ay eksaktong kopya; sa aming audit, 157 sa 158 na sipi ay ganito. Hindi kailanman ginagawa-gawa ng feedback ang isang bagay na hindi mo talaga sinabi.
- Isang bagay na aayusin muna. Bawat sagot ay may isang pangunahing hakbang: ang isang pagbabago na magpapataas ng iyong score nang pinakamalaki, na isinulat sa pinakasimpleng salita sa pahina. Sinusundan ito ng dalawa pang konkretong aksyon, at pagkatapos ay isang checklist na may tatlong bagay na dadaanan mo sa isip bago ka magsimulang magsalita.
- Payo na akma sa gawain. Ang pagbibigay ng payo, paglalarawan ng isang eksena, at panghihikayat sa isang tao ay ginagrado sa iba't ibang bagay. Alam na ngayon ng feedback kung ano ang binibigyang-halaga ng bawat isa sa walong uri ng gawain at tumutugon dito, sa kadalasan ng pag-uulit ng parehong pangkalahatang tip sa lahat ng gawain.
- Aling dimensyon ang unang sasanayin. Sinasabi sa iyo ng feedback kung alin sa apat na dimensyon ang iyong pinakamahina at alin ang iyong pinakamalakas, para malaman mo kung saan ang susunod na puntos, nang hindi ito itinatago sa likod ng isang numero.
- Ang hinihingi ng gawain na hindi mo natugunan. Para sa task fulfillment, nililista ng feedback ang mga tiyak na bahagi ng prompt na hindi mo nasakop, o sinasabi nang malinaw na nasakop mo ang lahat.
- Mga bagay na talagang maaari mong sanayin. Bawat how-to ay isang bagay na maaari mong sabihin nang malakas bago ang iyong susunod na pagsubok. Walang payo na magsalita nang mas malinaw o bawasan ang iyong accent: hindi sinusukat ng listenability ang accent, at hindi ito kailanman kinukomento ng feedback.
- Walang sisi sa timer. Ang sagot na naputol ng takdang oras pagkatapos nitong matapos ang gawain ay hindi babawasan ng puntos dahil sa pagkaputol, at hindi ka sisisihin ng feedback dito.
Noong ihambing ng isang independiyenteng judging model ang feedback na ito sa ginawa ng aming naunang sistema para sa parehong mga sagot, nang hindi alam kung alin ang alin, mas pinili nito ang bagong feedback sa 20 sa 24 na paghahambing, kapwa sa paghusga bilang isang examiner at sa paghusga bilang isang estudyante.
Mga Tanong
Kaya bang i-score ng Claude ang aking CELPIP speaking practice? Bibigyan ka nito ng numero. Nang hiniling sa payak na salita sa 48 sagot na hindi pa nakikita na may verified score, natamo ng Claude Opus 5 ang verified level 62% ng oras at ng Claude Sonnet 5 45% ng oras, kumpara sa 81% para sa Prepamigo Scoring Engine 2.0. Sa mga sagot sa pinakamataas na antas, tama ang Sonnet 5 29% ng oras.
Mas tumpak ba ang Prepamigo kaysa sa Claude? Oo: 81% laban sa 62% at 45% sa payak na kahilingan. Nang ibinigay ang aming buong procedure na may calibration examples, umabot ang Opus 5 sa 77% at ang Sonnet 5 sa 69%, na nahuhuli pa rin, at pinakamahina pa rin sa itaas ng scale.
Magkano ang gastos ng bawat isa? Ang Claude Max ay nagsisimula sa US$100 kada buwan, humigit-kumulang CA$138 bago buwis, may usage cap; ang Claude Pro ay US$20 na may mas mahigpit na cap. Ang Prepamigo ay CA$24.98 kada buwan kasama na ang buwis, o CA$8.25 kada buwan sa annual plan, may walang limitasyong pag-score at 80 practice set.
Bakit patuloy na binibigyan ng Claude ang aking malalakas na sagot ng 7 o 8? Ang isang model na hiniling ng numero, walang ikukumpara, ay lumilihis pababa at patungo sa gitna, at ang isang sagot sa pinakamataas na antas ay hindi kailanman perpekto. Nang hiniling sa payak na salita, ang Sonnet 5 ay nagbigay ng 9 o mas mataas sa isang sagot sa pinakamataas na antas 29% lamang ng oras.
Para makita kung paano talaga gumagana ang scoring, basahin ang loob ng Scoring Engine 2.0. Para makita ang buong leaderboard kasama ang GPT at Gemini, basahin ang aling AI ang pinakatumpak mag-score ng CELPIP speaking. O laktawan ang pagbabasa at Mag-record ng sagot. Basahin ang gabay na ito sa Ingles.
