Engine 2.0 sa 48 held-out response
Bahagi ng mga sagot na na-score sa loob ng verified band. Tatlong hiwalay na takbo sa magkaibang araw, bawat isa ay nagbigay ng 81.3% sa kabuuan.
81%
Exact band
Prepamigo laban sa mga nangungunang chatbot plan
Dolyar Canadian. Kasama na ang buwis sa mga presyo ng Prepamigo. Ang Claude Max (mula sa US$100) at ChatGPT Pro (US$200) ay na-convert sa 1.38, bago buwis. Ang accuracy ay ang bahagi ng held-out na mga sagot na na-score sa verified level kapag hiniling sa napiling modelo, sa payak na salita, na i-score ang sagot; average ng tatlong takbo.
Ito ang tamang tanong itanong sa anumang practice tool, at karamihan sa mga tool ay hindi sumasagot nito. Ang isang speaking score ay may halaga lamang kung sinasabi nito ang sasabihin ng isang totoong rater, at ang tanging paraan upang malaman kung ganoon talaga ito ay sukatin. Kaya ang artikulong ito ang sukat, inilahad nang tapat, kasama ang mga bahaging pumapuri sa amin at ang mga bahaging hindi.
Ang sagot sa isang talata: sa 48 speaking response na hindi pa nakikita ng Scoring Engine 2.0 ng Prepamigo, na bawat isa ay may independiyenteng na-verify na score, natamo ng engine ang verified level 81% ng oras at sa loob ng isang puntos nito 92% ng oras. Ginawa nito ang parehong 81% sa bawat isa sa tatlong hiwalay na takbo. Pinakatumpak ito sa mahihinang at gitnang-antas na sagot, sa 88% at 85%, at pinakamahina sa mga sagot sa pinakamataas na antas, sa 71%, kung saan ang katangi-tanging pagkakamali nito ay bigyan ng 8 ang isang 10. Nang hiniling sa payak na salita na i-score ang parehong transcript, ang pinakamahusay na general-purpose na AI model na sinubok namin ay umabot sa 62%, at ang pinakamahina ay umabot sa 31%; nang ibinigay ang aming buong grading procedure, umabot ang pinakamahusay sa 77%.
Ang sumusunod ay kung paano namin nakuha ang mga numerong iyon, kung ano ang kahulugan nito sa bawat antas ng score, gaano ito matatag, kung saan bumabagsak ang mga error, kung paano ito ikinukumpara sa mga alternatibong maaari mong gamitin sa halip, at paano babasahin ang iyong mismong score sa liwanag ng lahat nito. Kung nais mo lamang ang praktikal na payo, lumaktaw sa seksyon tungkol sa pagbabasa ng iyong score. Kung nais mong pagpasyahan kung paniwalaan ang numero, basahin ang lahat.
Ang ibig sabihin ng “tumpak” dito
Bago ang anumang numero, ang kahulugan. Hindi namin sinasabi na ang score ng Prepamigo ay nanghuhula ng resulta ng iyong test. Wala sa mga practice tool na kayang ipangako ito, at sinuman ang gagawa nito ay nanghuhula lamang. Ang sinusukat namin ay mas makitid at mas tapat: kung may isang spoken response na independiyenteng na-verify ang score, gaano kadalas gumawa ang engine ng score sa parehong level?
Ang CELPIP speaking ay iniuulat sa isang scale na umaabot sa 12, at ang verified score sa aming reference data ay nahahati sa tatlong band: mababa, ibig sabihin 4 o 5; gitna, ibig sabihin 7 o 8; at pinakamataas, ibig sabihin 10 pataas. Binibilang namin na tama ang engine kapag ang score nito ay napunta sa loob ng verified band. Ang isang sagot na verified sa pinakamataas na antas ay tama kung binigyan ito ng engine ng 9, 10, o 11. Sa isang mas mahigpit na pagbasa na tumatanggap lamang ng 10 pataas, bumaba nang ilang puntos ang bawat numero sa pahinang ito at nananatili sa parehong ayos ang bawat paghahambing.
Ang mga headline number
Ano ang kahulugan ng 81% sa aktwal na buhay? Kung mag-record ka ng sampung sagot sa isang matatag na antas, ilalagay ng engine ang humigit-kumulang walo sa mga ito sa tamang band at isa pa sa loob ng isang puntos nito. Hindi nito ilalagay ang isang 5 sa 10 band o isang 10 sa 5 band; hindi ito nangyari kahit isang beses sa 144 na na-score na sagot sa tatlong takbo. Ang mga pagkakamaling gawa nito ay ang mga pagkakamali ng isang maingat na rater sa isang borderline na sagot, at ipapakita ng susunod na seksyon kung saan ito nagsisiksikan.
Katumpakan sa bawat antas ng score
Katumpakan ayon sa verified band
16 held-out response kada band. Ang bawat bar ay ang bahagi ng mga sagot ng band na iyon na na-score sa loob ng band.
88%
Lower (4–5)
85%
Middle (7–8)
71%
Top (10+)
Mababang-antas na sagot: 88%. Ang mahihinang sagot ay pinakamadaling makilala. Karaniwan silang maikli, ginagamit ulit ang mga salita ng prompt, at may bahagi ng task na iniwang hindi natapos. Nahuhuli ito ng engine sa karamihan ng oras. Kapag nagkamali ito, nagkamali ito pataas: sa bawat kaso, ang sagot ay na-score na 8 sa halip na 4 o 5. Ang dahilan ay halos palagi ang isang sagot na tumunog na matatas at may kumpiyansa pero kaunti ang sinasabi; nakukuha ng delivery ang antas na hindi pa nakukuha sa nilalaman. Alam namin ito dahil nakikita namin kung aling dimensyon ang inilagay nang mataas ng mga grader, at listenability ito sa bawat pagkakataon.
Gitnang-antas na sagot: 85%. Ang mga ito ang pinakamahirap i-grade sa isang kahulugan, dahil naglalaman ng totoong paghalo ng lakas at kahinaan na dapat timbangin sa halip na tuklasin. Ang mga miss ng engine dito ay parehong direksyon. Ang ilang sagot na may nakikitang pag-aatubili pero solidong ideya ay hinila pababa sa 5 o 6; ang ilang polished-sounding na sagot ay itinulak pataas sa 10. Ang hakbang ng reconciliation sa pagitan ng dalawang grader ay nahuhuli ang karamihan sa mga ito, kung bakit ganito na mataas ang numerong ito.
Mga sagot sa pinakamataas na antas: 71%. Ito ang pinakamahinang band at ang pinakamadalas naming pinag-uusapan, dahil pare-pareho ang error. Kapag nawala ng engine ang isang sagot sa pinakamataas na antas, binibigyan nito ito ng 8. Hindi 7, hindi 6; isang 8, sa bawat kaso maliban sa ilang 9 na binibilang bilang tama. Nakikita ng engine ang isang malakas na sagot at nagpipigil nang isang antas.
Nararapat ito ng konteksto. Ang paglihis patungo sa 8 sa malalakas na sagot ay hindi kakaibang katangian ng Prepamigo; ito ang katangi-tanging pagkabigo ng bawat automated grader na nasubok namin, na-calibrate man ng tao o hindi. Ang aming dating engine ay mas malala ito. Nang hiniling sa payak na salita na i-score ang parehong mga sagot, nakilala ng pinakamahusay na general-purpose na model ang 56% ng mga sagot sa pinakamataas na antas; ang model na nasa likod ng mga bayad na plan ng ChatGPT ay nakilala ang 25%; at kahit ibinigay ang aming buong procedure, wala sa kanila na nalampasan ang 63%. Pitumpu’t isa ang pinakamataas na numerong nakamit namin, at ito pa rin ang pinaka-gustong pagbutihin.
Ang problema sa 8, mula sa iyong panig ng screen
Sinasabi sa iyo ng level view kung paano gawa ng engine sa isang sagot na alam ang antas. Ang tinitingnan mo ay sa kabaligtaran: may score ka at nais mong malaman kung gaano ito paniwalaan. Kaya narito ang parehong datos sa kabaligtaran. Para sa bawat score na binigay ng engine, gaano kadalas talagang sa antas na iyon ang sagot?
- Kung sinasabi ng engine na 4 o 5: ang sagot ay sa mababang antas 93% ng oras. Ang natitira ay mga gitnang-antas na sagot na may mabigat na pag-aatubili. Halos palaging tama ang mababang score mula sa Engine 2.0.
- Kung sinasabi ng engine na 10: ang sagot ay sa pinakamataas na antas 92% ng oras. Ang isang 10 mula sa Engine 2.0 ay isang 10.
- Kung sinasabi ng engine na 8: ang sagot ay sa gitnang antas 67% ng oras, sa pinakamataas na antas 23% ng oras, at sa mababang antas 10% ng oras. Ang 8 ang isang score na sulit basahing mabuti.
Sa madaling salita: ang 8 mula sa Engine 2.0 ay nangangahulugang “gitna, malamang, pero posibleng mas mataas.” Humigit-kumulang isa sa apat na sagot na nakakuha ng 8 ay talagang isang 10. Kung nakakuha ka ng 8 sa isang sagot na akala mo napakahusay, huwag mong tapusin na hindi ka pa handa. I-record ulit ang parehong task. Ang isang consistent na 10 sa tatlong pagsubok ay isang 10; ang isang consistent na 8 sa tatlong pagsubok ay isang 8; ang isang halo-halo ay isang sagot na nakatapat sa hangganan, at sasabihin sa iyo ng feedback kung aling dimensyon ang nagpapigil dito.
Nakukuha ba ang parehong score ng parehong recording?
Ang katumpakan na walang consistency ay swerte lamang. Kung ang parehong recording ay makukuha ng 8 ngayon at 10 bukas, ang numerong 81% ay isang average sa ingay lamang at hindi mo magagamit ang score upang subaybayan ang anumang bagay. Kaya sinubok namin ang repeatability nang direkta.
Ang 48 held-out response ay na-score nang tatlong hiwalay na pagkakataon, sa magkaibang araw, na walang binago sa pagitan. Ang pangkalahatang numero ay 81.3% sa bawat takbo. Sa antas ng indibidwal na sagot, 87.5% ang tumanggap ng eksaktong parehong score sa tatlong pagkakataon, at 4.2% lamang ang kumilos ng dalawang puntos o higit pa. Ang kaunti na ito ay mga sagot na nakatapat mismo sa hangganan sa pagitan ng dalawang band, kung saan ang maliit na pagkakaiba sa paghusga ay lehitimong nagtutulak sa score sa isang direksyon.
Ang consistency ay nagmumula sa isang tiyak na desisyon sa disenyo. Ang bawat isa sa dalawang grader ng engine ay bumoboto nang tatlong beses sa bawat sagot, at ang gitnang boto ay itinatago. Nang sinubukan namin ang parehong configuration na may isang boto sa halip ng tatlo, bumaba ang eksaktong pagkakatugma sa mga takbo mula 87.5% patungong 77%, at ang bahagi ng mga sagot na tumalon ng dalawa o higit pang puntos ay higit pang doble. Hindi binago ng voting ang numero ng katumpakan. Binago nito kung ang numero ng katumpakan ay may kahulugan.
Para sa iyo, ang consistency ay nangangahulugang ang isang pagbabago sa iyong score ay isang pagbabago sa iyong speaking. Kung mag-record ka ng parehong tipo ng task nang tatlong beses sa loob ng isang linggo at gumalaw ang score mula 8 patungong 10, hindi ito ang grader na may magandang araw. Ikaw ito.
Paano ito ikinukumpara sa maaari mong gamitin sa halip
Ang isang numero ng katumpakan ay may mas malaking kahulugan kapag may ikukumpara. Kaya pinatakbo namin ang parehong 48 held-out response sa mga general-purpose AI model na talagang ginagamit ng mga tao upang i-grade ang kanilang practice, sa paraang gagawin ng isang tao: binigyan namin ang bawat model ng verbatim transcript at ang task, sinabihan itong isang matalinong CELPIP examiner, at hiniling ang score mula 0 hanggang 12. Tatlong takbo kada isa, kinuha ang average.
Bahagi ng mga sagot na na-score sa loob ng verified band
Parehong 48 held-out response. Ang bawat model ay hiniling, sa payak na salita, na i-score ang transcript; average ng tatlong takbo. Tumakbo ang Engine 2.0 sa normal nitong production configuration.
81%
Prepamigo Engine 2.0
62%
Claude Opus 5
58%
Gemini
45%
Claude Sonnet 5
45%
GPT-4o mini
37%
GPT 5.5
35%
GPT 5.6 sol
31%
GPT 5.6 luna
Nangunguna ang Engine 2.0 sa bawat model nang labinsiyam hanggang limampu’t isang puntos. Nang hiniling sa payak na salita, marahas mag-score ang bawat general-purpose na model: ang miss sa isang mahinang sagot ay karaniwang 3, ang miss sa isang malakas ay 7 o 8. Ang Claude Opus 5 at Gemini ang tanging dalawang lumagpas sa kalahati. Ang tatlong mas malalaking model ng GPT ay sa pagitan ng 31% at 37%, at nakikilala ang isang sagot sa pinakamataas na antas sa pagitan ng 13% at 27% ng oras.
Pagkatapos, ibinigay namin sa bawat model ang aming buong procedure: ang parehong calibration examples para sa eksaktong task, ang parehong forced comparison, at isang maikling calibration note na iniangkop sa sarili nitong ugali. Ito ang pinakamagandang makuha ng bawat model sa aming mga kamay, at hindi ito bagay na kayang gayahin ng estudyante kung walang mga halimbawa. Umakyat ang Opus 5 sa 77%, ang GPT 5.6 sol at Gemini sa 71%, ang GPT 5.5 at Sonnet 5 sa 69%, ang luna sa 63%, at ang GPT-4o mini sa 50%. Bawat isa sa kanila ay natapos na nahuhuli pa rin sa Engine 2.0, at wala nang nakilala nang higit sa 63% ng mga sagot sa pinakamataas na antas.
Ano ang bago sa iyong feedback
Dumating ang Engine 2.0 na may bagong itinayong feedback layer. Binabasa nito ang ebidensya ng dalawang grader, hindi lang ang score, at nasubok ito laban sa tatlong klase ng estudyante: ang unang pagkakataong sumagot sa CELPIP, ang mahina sa Ingles na naghahanap ng tips, at ang may kalahating oras bawat araw na may pagsusulit sa susunod na linggo. Ito ang mga pagbabago.
- Ang sarili mong mga salita, na binanggit pabalik. Bawat puntong feedback ay nagsisipi ng eksaktong parirala mula sa iyong transcript na pinag-ugatan ng reaksyon ng mga grader. Kapag may quotation marks ang isang parirala, ito ay eksaktong kopya; sa aming audit, 157 sa 158 na sipi ay ganito. Hindi kailanman ginagawa-gawa ng feedback ang isang bagay na hindi mo talaga sinabi.
- Isang bagay na aayusin muna. Bawat sagot ay may isang pangunahing hakbang: ang isang pagbabago na magpapataas ng iyong score nang pinakamalaki, na isinulat sa pinakasimpleng salita sa pahina. Sinusundan ito ng dalawa pang konkretong aksyon, at pagkatapos ay isang checklist na may tatlong bagay na dadaanan mo sa isip bago ka magsimulang magsalita.
- Payo na akma sa gawain. Ang pagbibigay ng payo, paglalarawan ng isang eksena, at panghihikayat sa isang tao ay ginagrado sa iba't ibang bagay. Alam na ngayon ng feedback kung ano ang binibigyang-halaga ng bawat isa sa walong uri ng gawain at tumutugon dito, sa kadalasan ng pag-uulit ng parehong pangkalahatang tip sa lahat ng gawain.
- Aling dimensyon ang unang sasanayin. Sinasabi sa iyo ng feedback kung alin sa apat na dimensyon ang iyong pinakamahina at alin ang iyong pinakamalakas, para malaman mo kung saan ang susunod na puntos, nang hindi ito itinatago sa likod ng isang numero.
- Ang hinihingi ng gawain na hindi mo natugunan. Para sa task fulfillment, nililista ng feedback ang mga tiyak na bahagi ng prompt na hindi mo nasakop, o sinasabi nang malinaw na nasakop mo ang lahat.
- Mga bagay na talagang maaari mong sanayin. Bawat how-to ay isang bagay na maaari mong sabihin nang malakas bago ang iyong susunod na pagsubok. Walang payo na magsalita nang mas malinaw o bawasan ang iyong accent: hindi sinusukat ng listenability ang accent, at hindi ito kailanman kinukomento ng feedback.
- Walang sisi sa timer. Ang sagot na naputol ng takdang oras pagkatapos nitong matapos ang gawain ay hindi babawasan ng puntos dahil sa pagkaputol, at hindi ka sisisihin ng feedback dito.
Noong ihambing ng isang independiyenteng judging model ang feedback na ito sa ginawa ng aming naunang sistema para sa parehong mga sagot, nang hindi alam kung alin ang alin, mas pinili nito ang bagong feedback sa 20 sa 24 na paghahambing, kapwa sa paghusga bilang isang examiner at sa paghusga bilang isang estudyante.
Paano babasahin ang iyong score
- Ang 4 o 5 ay halos siguradong tama. Nakikilala ng engine ang mahihinang sagot 88% ng oras, at kapag sinabi nitong 4 o 5, tama ito 93% ng oras. Basahin ang feedback para sa aling dimensyon ang pinakamababa at pagbutihin ang isa iyon.
- Ang 10 ay isang 10. Kapag sinabi ng engine na 10, ang sagot ay sa pinakamataas na antas 92% ng oras. Handa ka sa tipo ng task na iyon. Lumipat sa mga iniiwasan mo.
- Ang 8 ay isang tanong. Dalawang-katlo ng oras, ibig sabihin gitna. Isang oras sa apat, ibig sabihin pinakamataas. I-record ulit ang parehong task at tingnan ang pattern sa maraming pagsubok.
- Ang tiwala ay nagbabago nang higit sa mga antas. Dahil matatag ang score, ang pagbabago sa maraming pagsubok ay pagbabago sa iyong speaking. Ang pag-uulit ng parehong tipo ng task ang pinakamabilis na paraan upang malaman kung gumagana ang isang bagong ugali.
- Basahin ang mga sipi. Ang mga pariralang sinipi sa iyong feedback ay ang naging reaksyon ng mga grader. Ito ang mga tiyak na salitang babaguhin.
Mga Tanong
Gaano tumpak ang speaking score ng Prepamigo? Sa 48 sagot na hindi pa nakikita na may verified score: 81% sa eksaktong band, 92% sa loob ng isang puntos, pareho sa tatlong takbo. Ayon sa band: 88% mababa, 85% gitna, 71% pinakamataas.
Pareho ba ito sa aking totoong score? Walang practice tool na kayang ipangako ito. Ang sinusukat namin ay kung gaano madalas sumasang-ayon ang engine sa isang verified score sa parehong sagot. Basahin ang iyong score bilang isang level na may direksyon, at tingnan ang pattern sa maraming pagsubok.
Bakit ako nakakuha ng 8 sa isang sagot na akala ko napakahusay? Iyan ang pinakamalaking natitirang error ng engine: isa sa apat na 8 ay talagang isang 10. I-record ulit ang parehong task. Ang isang consistent na 10 sa maraming pagsubok ay isang 10.
Makukuha ba ang parehong score ng parehong recording nang dalawang beses? 87.5% na pareho sa tatlong takbo; 4.2% lamang na kumilos ng dalawa o higit pang puntos, lahat sa hangganan ng band.
Para makita kung paano gumagana ang engine hakbang-hakbang, basahin ang loob ng Scoring Engine 2.0. Para makita ang parehong pagsubok sa GPT, Claude, at Gemini, basahin ang aling AI ang pinakatumpak mag-score ng CELPIP speaking. O Mag-record ng sagot at makita mismo ang mga numero. Basahin ang gabay na ito sa Ingles.
