Bahagi ng mga sagot na na-score sa verified level
48 held-out speaking response, 16 kada band. Binigyan ang bawat model ng GPT ng transcript at hiniling, sa payak na salita, na i-score ito sa CELPIP scale; average ng tatlong takbo. Tumakbo ang Engine 2.0 sa normal nitong production configuration.
81%
Prepamigo Engine 2.0
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Prepamigo laban sa mga nangungunang chatbot plan
Dolyar Canadian. Kasama na ang buwis sa mga presyo ng Prepamigo. Ang Claude Max (mula sa US$100) at ChatGPT Pro (US$200) ay na-convert sa 1.38, bago buwis. Ang accuracy ay ang bahagi ng held-out na mga sagot na na-score sa verified level kapag hiniling sa napiling modelo, sa payak na salita, na i-score ang sagot; average ng tatlong takbo.
Ang ChatGPT ay marahil ang pinakakaraniwang tool na ginagamit ng mga kandidato ng CELPIP para i-grade ang sarili nilang speaking practice. Nasa telepono ng lahat ito, sumasagot ito sa segundo, at masaya nitong sasabihin sa iyo kung anong antas ang iyong sagot. Ang tanong na sinasagot ng artikulong ito ay kung ang antas na sinasabi nito sa iyo ay talagang antas na makukuha mo. Isinagawa namin ang pagsubok sa paraang gagawin ng isang estudyante: idikit ang transcript, hilingin ang score, at bilangin.
Ang maikling sagot: sa 48 speaking response na wala sa mga sistema ang nakakita, na bawat isa ay may independiyenteng na-verify na score, natamo ng Prepamigo Scoring Engine 2.0 ang tamang level 81% ng oras. Nang hiniling sa payak na salita, natamo ng GPT 5.6 sol, ang model na nasa likod ng mga bayad na plan ng ChatGPT, ang tamang level 35% ng oras. Nakuha ng GPT 5.5 ang 37%, ng GPT 5.6 luna ang 31%, at ng GPT-4o mini ang 45%, isang numero na mukhang mas magaling kaysa talaga, dahil ang model na ito ay nag-iscore nang mababa ang halos lahat at kaya lang tama sa mahihinang sagot.
Pagkatapos, gumawa kami ng bagay na hindi ginagawa ng karamihan sa mga paghahambing. Ibinigay namin sa bawat model ng GPT ang aming sariling grading procedure, na may totoong calibration examples para sa bawat task at forced comparison laban sa mga ito, upang makita kung gaano ito magagaling. Umakyat ang GPT 5.6 sol sa 71%, ang GPT 5.5 sa 69%, ang luna sa 63%, at ang GPT-4o mini sa 50%. Ang lahat ng apat ay natapos na nahuhuli pa rin sa Engine 2.0, at pareho pa ring pinakanahirapan sa mga sagot sa pinakamataas na antas. Susuriin ng natitirang bahagi ng artikulong ito ang dalawang pagsubok, ang resulta sa bawat antas ng score, kung bakit lumilihis ang isang general-purpose assistant patungo sa gitna ng scale, kung ano ang hitsura ng araw-araw na workflow sa bawat panig, at kung magkano ang gastos ng bawat opsyon kung seryoso kang magpractice.
Ang payak na pagsubok: ang talagang nakukuha ng estudyante
Walumpu’t isang porsyento laban sa tatlumpu’t lima. Sa isang pagsubok na may 48 sagot, ito ay dalawampu’t dalawang dagdag na tamang score para sa Engine 2.0 laban sa GPT 5.6 sol. Sa ibang salita, gumagawa ang Engine 2.0 ng 71% na mas kaunting pagkakamali sa scoring kaysa sa GPT 5.6 sol, 70% mas kaunti kaysa sa GPT 5.5, 73% mas kaunti kaysa sa GPT 5.6 luna, at 66% mas kaunti kaysa sa GPT-4o mini.
Ang tatlong hiwalay na takbo ng payak na pagsubok ay nagbigay sa GPT 5.6 sol ng 31%, 40%, at 35%, at sa GPT 5.5 ng 35%, 42%, at 33%. Ang pagkakaiba-iba na iyon sa pagitan ng mga takbo ay isang natuklasan mismo: hilingin sa ChatGPT na i-grade ang parehong transcript sa dalawang magkaibang araw at madalas kang makakakuha ng dalawang magkaibang score. Ang Engine 2.0 ay nagkuha ng 81.3% sa bawat isa sa tatlong takbo nito.
Kung saan bumubukas ang agwat: antas por antas
Ang isang pangkalahatang numero ay nagtatago kung saan bumabagsak ang mga error. Ang isang grader na magaling sa mahihinang sagot at walang kaya sa malalakas ay maayos para sa isang baguhan at aktibong nakakasama para sa isang nangangaso ng 10. Kaya ito ang resulta ng payak na pagsubok, hinati ayon sa verified band.
Mababang-antas na sagot (verified score 4 o 5)
16 held-out response, payak na prompt, average ng tatlong takbo. Karamihan sa miss ay score na 3.
88%
Prepamigo Engine 2.0
75%
GPT-4o mini
54%
GPT 5.5
54%
GPT 5.6 sol
52%
GPT 5.6 luna
Sa mahihinang sagot, nangunguna ang Engine 2.0 sa 88%. Sumusunod ang GPT-4o mini sa 75%, na ang isang lugar kung saan gumagana ang ugali nitong mag-score nang mababa sa kanyang pabor. Ang tatlong mas malalaking model ng GPT ay sa 52% hanggang 54%: humigit-kumulang kalahati ng oras, binibigyan nila ng 3 ang isang sagot na 4 o 5, na mali sa band kahit maiintindihan ang direksyon. Ang isang baguhan na gumagamit ng ChatGPT para i-grade ay sasabihan na mas mahina siya kaysa sa totoo, humigit-kumulang kalahati ng oras.
Gitnang-antas na sagot (verified score 7 o 8)
16 held-out response, payak na prompt, average ng tatlong takbo. Ang mga miss ay halos lahat ay 5 o 6.
85%
Prepamigo Engine 2.0
44%
GPT-4o mini
29%
GPT 5.5
27%
GPT 5.6 sol
27%
GPT 5.6 luna
Ang gitnang band ang lugar kung saan bumagsak ang mga model ng GPT na may payak na prompt. Ang Engine 2.0 ay sa 85%; ang GPT-4o mini sa 44%; ang GPT 5.5, GPT 5.6 sol, at luna ay sa pagitan ng 27% at 29%. Ang mga gitnang-antas na sagot ay may totoong paghalo ng lakas at kahinaan na dapat timbangin, at walang calibration examples na pagtitimbangan, nakikita ng mga model ng GPT ang mga kahinaan at nagbibigay ng 5 o 6. Ang isang 7 o 8 na nagsasalita na humihingi sa GPT 5.6 sol ng score ay maririnig ang tamang band mas mababa sa tatlo sa bawat sampu.
Pinakamataas na-antas na sagot (verified score 10 pataas)
16 held-out response, payak na prompt, average ng tatlong takbo. Halos lahat ng miss ay 7 o 8.
71%
Prepamigo Engine 2.0
27%
GPT 5.5
25%
GPT 5.6 sol
17%
GPT-4o mini
13%
GPT 5.6 luna
Sa pinakamataas, nakikilala ng Engine 2.0 ang 71% ng mga sagot sa pinakamataas na antas. Nakikilala ng GPT 5.5 ang 27%, ng GPT 5.6 sol ang 25%, ng GPT-4o mini ang 17%, at ng GPT 5.6 luna ang 13%. Binibigyan ng bawat model ng GPT ng 7 o 8 ang kahit pito sa bawat sampung sagot na dapat sana ay 10.
Isipin mo kung ano ang kahulugan nito para sa isang malakas na kandidato. Nagrecord ka ng walong sagot, na-transcribe mo ang mga ito, idinikit mo sa ChatGPT at hiniling mo ang score, at sinabi sa iyo nito na anim sa mga ito ay 7 at 8. Nagpasya kang isa kang solidong gitnang-band na nagsasalita na may trabahong gagawin. Sa 10 ka noon pa lang. Hindi ito haka-haka. Iyan ang gawa ng bawat model ng GPT sa karamihan ng mga sagot sa pinakamataas na antas sa aming pagsubok.
Ano kung ibigay mo sa ChatGPT ang aming buong procedure?
Nakakatukso na basahin ang mga numero ng payak na pagsubok bilang patunay na mahina ang pamilya ng GPT bilang model. Hindi ito totoo. Ang problema ay hindi ang katalinuhan. Ito ay dahil ang isang model na hiniling ng numero, walang ikukumpara, ay nanghuhula, at kapag ito ay nanghuhula, ito ay nanghuhula ng mababa at patungo sa gitna.
Kaya isinagawa namin ang pangalawang pagsubok. Ang bawat model ng GPT ay tumanggap ng parehong package na ibinibigay sa mga grader ng Engine 2.0: ang transcript, ang task, dalawang totoong calibration example sa bawat antas para sa eksaktong task na ito, at isang instruksyon na pangalanan ang pinakamalapit na example para sa bawat isa sa apat na dimensyon sa halip na gumawa ng numero. Ang bawat model ay tumanggap din ng maikling calibration note na iniangkop sa sarili nitong ugali.
Ibinigay ang aming buong procedure: bahagi ng mga sagot na na-score sa verified level
Parehong 48 held-out response. Ang bawat model ng GPT ay nag-grade ng bawat sagot isang beses gamit ang parehong transcript, instruksyon, at calibration examples gaya ng mga sariling grader ng Engine 2.0.
81%
Prepamigo Engine 2.0
71%
GPT 5.6 sol
69%
GPT 5.5
63%
GPT 5.6 luna
50%
GPT-4o mini
Malaking pagkakaiba ang dala ng calibration examples. Doble ang GPT 5.6 sol, mula 35% patungong 71%. Ang GPT 5.5 ay mula 37% patungong 69%, ang luna mula 31% patungong 63%. Ang GPT-4o mini ay bahagya lang gumalaw, mula 45% patungong 50%, dahil patuloy nitong nag-iscore nang mababa ang lahat anuman ang ipakita sa kanya; sa full procedure, wala pa itong nakilalang sagot sa pinakamataas na antas. Ipinapakita nito kung saan talagang nakakapit ang halaga sa isang purpose-built grader: hindi sa isang mas matalinong model, kundi sa totoong halimbawa kung ano ang tunog ng bawat antas sa bawat tiyak na task, at sa isang tanong na pinipilit ang model na maghambing sa halip na manghula.
Kahit gayon, pareho pa ring nahuhuli ang bawat model ng GPT. Sa full procedure, sampung puntos na nahuhuli ang GPT 5.6 sol sa Engine 2.0 sa kabuuan, sampung puntos sa gitnang band (75% laban sa 85%), at walong puntos sa pinakataas (63% laban sa 71%). Ang natitirang ugali nito ay ang labis na pagbibigay-gantimpala sa polish: ang isang mahusay na 8 na may makinis na delivery ay itinutulak sa 9 o 10. Ang GPT 5.6 luna ay ang kabaligtaran, hinihila pababa ang mga gitnang sagot patungo sa 5, at natatapos sa 44% sa gitnang band. Ang isang model na gumagawa ng isang pagpasada ay may characteristic bias, at isinasara ng Engine 2.0 ang natitirang agwat gamit ang dalawang independiyenteng grader mula sa magkaibang provider, tatlong boto mula sa bawat isa na ang gitnang boto ay itinatago, at isang panuntunan sa reconciliation na kinukuha ang mas mataas na score kapag magkaiba nang malaki ang dalawang grader.
Sinubok din namin ang halatang shortcut: panatilihin ang payak na prompt at magdagdag ng instruksyon tulad ng “huwag lumihis patungo sa gitna” o “ang isang level 9 na sagot ay hindi kailangang perpekto.” Wala silang nadulot na masusukat na pagbabago. Ang gumagana ay ang pagbabago ng tanong, at pagbigay sa model ng totoong bagay na ikukumpara.
Ang agwat sa workflow: mag-record at umalis, o gawin mong lahat ang sarili
Ang mga numero ng katumpakan ay ipinapalagay na talagang nangyayari ang pag-grade. Sa ChatGPT, may kagulat-gulat na dami ng trabaho sa pagitan ng pagpindot mo ng stop sa iyong recording at ang pagbasa ng score, at binabago ng ilan sa trabahong ito ang score.
Una, kailangan mo ng transcript. Ang voice mode ng ChatGPT ay isang pag-uusap, hindi isang grader; para i-grade ang isang nairecord na sagot, kailangan mo ng teksto. Ito ay nangangahulugang i-type ang iyong sinabi, na nagbabago nito, o patakbuhin ang recording sa isang transcription tool. At dapat na verbatim ang transcript. Ang bawat filler, bawat restart, bawat self-correction ay dapat manatili. Nang sinubukan namin ang isang “nalinis” na transcript na inalis ang mga pag-aatubili, bumaba ang katumpakan ng labinlimang puntos, dahil ang mga pag-aatubiling ito ay eksaktong ang ebidensyang kailangan ng grader upang husgahan kung paano tumunog ang isang sagot. Karamihan sa mga consumer transcription tool, kasama ang nasa loob ng karamihan sa mga telepono, ay naglilinis bilang default.
Ikalawa, kailangan mo ng task. Ang ChatGPT ay kayang gumawa ng isang CELPIP-style na prompt kung hihilingin mo, pero nanghuhula ito tungkol sa format, timing, at tipo ng sitwasyon na ginagamit ng aktwal na test. Hindi mo malalaman kung ang prompt na isinulat nito ay kahawig ng haharapin mo.
Ikatlo, kung nais mo ng mas maganda pa sa mga numero ng payak na pagsubok, kailangan mo ng calibration examples: totoong sagot sa bawat antas para sa parehong tipo ng task, may na-verify na antas. Ito ang input na nag-doble ng katumpakan ng GPT 5.6 sol sa aming pagsubok, at ito ang isang bagay na hindi magagawa ng isang estudyante sa bahay.
Ikaapat, gagawin mo itong lahat ulit para sa susunod na sagot, at bawat isa ay bawas sa iyong allowance ng mensahe.
Sa Prepamigo, pipili ka ng task mula sa bangko, tumatakbo ang timer, nagsasalita ka, at mga sampung segundo pagkatapos mong tumigil, nasa screen na ang score at feedback. Ang transcription ay verbatim sa disenyo, ang calibration examples ay kasama na sa task nang automatiko, at walang idikit at walang i-prompt. Ang ikalabing-isang sagot ng gabi ay may parehong pagsisikap gaya ng una.
Consistency: ang parehong sagot, ang parehong score
Ang isang score na hindi mo maulit ay hindi isang sukat. Kung ang parehong recording ay makukuha ng 8 sa Lunes at 10 sa Martes, wala kang natutunan tungkol sa iyong speaking. Kaya sinubok din namin ang repeatability.
Ang Engine 2.0 ay pinatakbo sa 48 held-out response ng tatlong hiwalay na pagkakataon sa magkaibang araw. Nakuha nito ang 81.3% sa bawat takbo. Kung titingnan ang indibidwal na sagot, 87.5% ang tumanggap ng eksaktong parehong score sa lahat ng tatlong takbo, at 4.2% lamang ang kumilos ng dalawang puntos o higit pa, lahat ng mga ito ay mga sagot na nakatapat sa hangganan sa pagitan ng dalawang band.
Ang payak na pagsubok sa GPT 5.6 sol ay kumilos ng siyam na puntos sa pagitan ng pinakamagaling at pinakamahinang takbo nito. Ang agwat sa stability na ito ay nagmumula sa voting. Ang bawat grader sa Engine 2.0 ay bumoboto ng tatlong beses sa bawat sagot at ang gitnang boto ay itinatago. Nang sinubukan namin ang parehong configuration na may isang boto sa halip ng tatlo, bumaba ang eksaktong pagkakatugma ng run-to-run mula 87.5% patungong 77%, at ang bahagi ng mga sagot na tumalon ng dalawa o higit pang puntos ay higit pang doble. Ang isang solong pag-uusap sa ChatGPT ay isang boto lamang. Sinuri din namin kung ang pagtakda ng fixed random seed sa API ay gumawang mas repeatable ang mga model ng GPT. Hindi ito ang nangyari; sa GPT 5.6 luna, bumaba pa nga ang repeatability.
Feedback na maaari mong kilusan
Ang ChatGPT ay magaling na explainer. Kung tatanungin mo kung bakit ito nagbigay ng score, sasabihin nito sa mahabang detalye, sa malinaw na Ingles, at magmumungkahi ito ng mga pagpapahusay. Para sa isang kandidato na nais makipag-usap tungkol sa isang sagot, talagang mahalaga ito.
Ang panganib ay ang matatas na paliwanag ay hindi pareho sa tumpak na diagnosis. Ang isang model na nagbigay ng 7 sa isang 10 ay ipapaliwanag, nakakumbinsi, kung bakit ito 7. Makakahanap ito ng bagay na itutukoy. At dahil hindi nito kinailangan na mag-commit sa ebidensya bago mag-score, ang paliwanag ay isinulat pagkatapos ng katotohanan upang bigyang-katwiran ang numero na napili na nito.
Ang Engine 2.0 ay gumagana sa kabaligtaran. Ang bawat grader ay dapat tumukoy sa ebidensya para sa bawat dimensyon bago pangalanan ang isang antas, at isinulat ang feedback mula sa ebidensyang ito. Nagsisipi ito ng iyong mismong mga salita: sa pagsusuri ng 158 sipi sa isang sample ng feedback, 157 ang lumitaw nang verbatim sa transcript. Nang inihambing ng isang independiyenteng judging model ang feedback ng Engine 2.0 sa feedback ng dating sistema namin sa parehong mga sagot, nang bulag, pinili nito ang Engine 2.0 sa 20 sa 24 na paghahambing, kapwa sa paghusga bilang isang examiner at sa paghusga bilang isang estudyante.
Sinuri din namin kung ang feedback ay ipinapatong ang puna sa tamang lugar, sa pagkuha ng malalakas na sagot at sinasadyang sinira ang isang dimensyon sa bawat pagkakataon. Sa tatlo sa apat na kaso, ang dimensyon na sinira ay ang nagbagsak nang pinakamalaki sa score. Ito ay pagsusuri na hindi kayang madaling pasa ng chatbot, dahil walang fixed dimensyon ito na masusukat laban.
Ang gastos sa pagpractice araw-araw
Ang isang speaking score ay pinakakapaki-pakinabang sa iyong ika-apatnapung sagot, hindi sa ikaapat. Iyon ang oras na sinasabi nito kung nagbunga ba ang isang pagbabago sa kung paano ka nagsalita. Kaya ang praktikal na tanong ay kung magkano ang gastos gamitin ang bawat tool nang bulto.
Ang ChatGPT Plus ay US$20 kada buwan, humigit-kumulang CA$28, na sinisingil buwan-buwan, gaya ng nailathala noong Setyembre 2026. Ibinibigay nito sa iyo ang pamilyang GPT 5.6 na may cap sa mensahe kada rolling window; ang mahahabang transcript na may calibration examples ay eksaktong tipo ng mensahe na gumagamit ng malaking bahagi ng allowance na iyon, at kapag nasadlak ka, maghihintay ka o bababa sa isang mas maliit na model. Ang ChatGPT Pro, sa US$200 kada buwan, humigit-kumulang CA$276 bago buwis, ay nagtataas ng limitasyon nang malaki. Ang libreng tier ay nagpapadala ng malaking bahagi ng traffic nito sa mas maliliit na model, at sa pagsubok na ito ang pinakamaliit sa kanila ay wala pang nakilalang sagot sa pinakamataas na antas. Wala sa mga plan na may bangko ng tanong, timer, verbatim transcription, calibration examples, o anumang tiyak sa CELPIP.
Ang Prepamigo ay CA$24.98 kada buwan, o CA$8.25 kada buwan sa annual plan, na CA$98.98 para sa taon, kasama na ang buwis, at maaari mong kanselahin anumang oras. Ang bawat plan ay may walang limitasyong pag-score ng Engine 2.0 na walang araw-araw, session, o weekly cap, walang limitasyong pagsubok, at ang buong bangko ng tanong: 80 kumpletong practice set at mahigit 2,000 practice task sa Speaking, Writing, Reading, at Listening, na sinulat upang sundin ang tipo ng task, timing, at format ng CELPIP General test.
Sa madaling salita: para sa mas mababa pa sa presyo ng ChatGPT Plus, makukuha mo ang isang grader na mahigit dalawang doble ang katumpakan sa isang payak na paghahambing, na hindi ka pinaghihintay, at may kasamang mga tanong at calibration examples na naka-in place na.
Kailan mas mainam ang ChatGPT
Hindi ito isang argumento na hindi mo dapat buksan ang ChatGPT habang nagpapaghanda para sa CELPIP. Maaaring gamitin ng isang seryosong kandidato ang pareho.
- Pag-usapan ang isang sagot. Kung nais mong maunawaan kung bakit mahina ang isang dahilan o mag-brainstorm ng tatlong mas magandang dahilan, angkop ang isang pag-uusap. Nagbibigay ang Engine 2.0 ng verdict at ebidensya; hindi ito nakikipag-chat.
- Bokabularyo at pananalita. Ang paghingi ng lima pang natural na paraan ng pagsabi ng isang bagay ay mabilis at kapaki-pakinabang.
- Pagsasalita sa isang bagay na sumasagot. Ang voice mode ng ChatGPT ay isang makatwirang paraan upang masanay sa pagsasalita ng Ingles nang malakas. Hindi ito isang grader, pero kasama ito.
- Practice sa Writing. Ang mga sagot na sinulat ay hindi nangangailangan ng transcription, kaya mas maliit ang agwat sa workflow. Ang katumpakan ng GPT sa writing ay hindi bahagi ng pagsubok na ito at wala kaming pahayag tungkol dito.
- Anumang bagay na wala sa test. Ang ChatGPT ay isang general assistant at hindi ang Prepamigo.
Ang hindi dapat na gawin ng ChatGPT, sa ebidensyang ito, ay ang bagay na nagsasabi sa iyo kung handa ka na. Para sa iyo iyon, nais mong may grader na binuo para sa trabahong ito, nasubok sa mga sagot na hindi nito nakita, at sinukat antas por antas.
Ano ang bago sa iyong feedback
Dumating ang Engine 2.0 na may bagong itinayong feedback layer. Binabasa nito ang ebidensya ng dalawang grader, hindi lang ang score, at nasubok ito laban sa tatlong klase ng estudyante: ang unang pagkakataong sumagot sa CELPIP, ang mahina sa Ingles na naghahanap ng tips, at ang may kalahating oras bawat araw na may pagsusulit sa susunod na linggo. Ito ang mga pagbabago.
- Ang sarili mong mga salita, na binanggit pabalik. Bawat puntong feedback ay nagsisipi ng eksaktong parirala mula sa iyong transcript na pinag-ugatan ng reaksyon ng mga grader. Kapag may quotation marks ang isang parirala, ito ay eksaktong kopya; sa aming audit, 157 sa 158 na sipi ay ganito. Hindi kailanman ginagawa-gawa ng feedback ang isang bagay na hindi mo talaga sinabi.
- Isang bagay na aayusin muna. Bawat sagot ay may isang pangunahing hakbang: ang isang pagbabago na magpapataas ng iyong score nang pinakamalaki, na isinulat sa pinakasimpleng salita sa pahina. Sinusundan ito ng dalawa pang konkretong aksyon, at pagkatapos ay isang checklist na may tatlong bagay na dadaanan mo sa isip bago ka magsimulang magsalita.
- Payo na akma sa gawain. Ang pagbibigay ng payo, paglalarawan ng isang eksena, at panghihikayat sa isang tao ay ginagrado sa iba't ibang bagay. Alam na ngayon ng feedback kung ano ang binibigyang-halaga ng bawat isa sa walong uri ng gawain at tumutugon dito, sa kadalasan ng pag-uulit ng parehong pangkalahatang tip sa lahat ng gawain.
- Aling dimensyon ang unang sasanayin. Sinasabi sa iyo ng feedback kung alin sa apat na dimensyon ang iyong pinakamahina at alin ang iyong pinakamalakas, para malaman mo kung saan ang susunod na puntos, nang hindi ito itinatago sa likod ng isang numero.
- Ang hinihingi ng gawain na hindi mo natugunan. Para sa task fulfillment, nililista ng feedback ang mga tiyak na bahagi ng prompt na hindi mo nasakop, o sinasabi nang malinaw na nasakop mo ang lahat.
- Mga bagay na talagang maaari mong sanayin. Bawat how-to ay isang bagay na maaari mong sabihin nang malakas bago ang iyong susunod na pagsubok. Walang payo na magsalita nang mas malinaw o bawasan ang iyong accent: hindi sinusukat ng listenability ang accent, at hindi ito kailanman kinukomento ng feedback.
- Walang sisi sa timer. Ang sagot na naputol ng takdang oras pagkatapos nitong matapos ang gawain ay hindi babawasan ng puntos dahil sa pagkaputol, at hindi ka sisisihin ng feedback dito.
Noong ihambing ng isang independiyenteng judging model ang feedback na ito sa ginawa ng aming naunang sistema para sa parehong mga sagot, nang hindi alam kung alin ang alin, mas pinili nito ang bagong feedback sa 20 sa 24 na paghahambing, kapwa sa paghusga bilang isang examiner at sa paghusga bilang isang estudyante.
Mga Tanong
Kaya bang i-score ng ChatGPT ang aking CELPIP speaking? Bibigyan ka nito ng numero. Nang hiniling sa payak na salita sa 48 sagot na hindi pa nakikita na may verified score, tama ang GPT 5.6 sol 35% ng oras, ang GPT 5.5 37%, ang luna 31%, ang GPT-4o mini 45%, kumpara sa 81% para sa Engine 2.0. Sa mga sagot sa pinakamataas na antas, tama ang GPT 5.6 sol 25% ng oras.
Mas tumpak ba ang Prepamigo kaysa sa ChatGPT? 81% laban sa 35% para sa GPT 5.6 sol sa payak na kahilingan. Nang ibinigay ang aming buong procedure na may calibration examples, umabot ang GPT 5.6 sol sa 71%, sampung puntos na nahuhuli pa rin.
Magkano ang gastos ng bawat isa? Ang ChatGPT Pro ay US$200 kada buwan, humigit-kumulang CA$276 bago buwis; ang Plus ay US$20 na may message cap. Ang Prepamigo ay CA$24.98 kada buwan kasama na ang buwis, o CA$8.25 kada buwan sa annual plan, may walang limitasyong pag-score at 80 practice set.
Aling model ng GPT ang dapat kong gamitin kung gagamit man ako ng ChatGPT? Sa payak na prompt, walang mahusay sa kanila. May calibration examples, ang GPT 5.6 sol. Kailanman huwag ang GPT-4o mini kung malapit ka sa 10.
Para sa parehong paghahambing laban sa Claude, basahin ang Prepamigo vs Claude. Para sa buong leaderboard ng walong sistema, basahin ang aling AI ang pinakatumpak mag-score ng CELPIP speaking. O laktawan ang transcription at Mag-record ng sagot. Basahin ang gabay na ito sa Ingles.
