Pag-score

Ipinakikilala: Prepamigo Scoring Engine 2.0 para sa Speaking

Setyembre 6, 2026

Prepamigo Scoring Engine 2.0 laban sa mga frontier model bilang grader

Bahagi ng mga speaking response kung saan tumugma ang score sa independiyenteng na-verify na score. 48 sagot na hindi pa nakita ng mga sistema, pantay na naghahati sa mababa, gitna, at pinakamataas na score. Binigyan ang bawat model ng transcript at hiniling, sa payak na salita, na i-score ito sa CELPIP scale; average ng tatlong takbo.

81%

Prepamigo Scoring Engine 2.0Prepamigo

62%

Claude Opus 5Anthropic

58%

GeminiGoogle

45%

Claude Sonnet 5Anthropic

45%

GPT-4o miniOpenAI

37%

GPT 5.5OpenAI

35%

GPT 5.6 solOpenAI

31%

GPT 5.6 lunaOpenAI

Prepamigo laban sa mga nangungunang chatbot plan

Dolyar Canadian. Kasama na ang buwis sa mga presyo ng Prepamigo. Ang Claude Max (mula sa US$100) at ChatGPT Pro (US$200) ay na-convert sa 1.38, bago buwis. Ang accuracy ay ang bahagi ng held-out na mga sagot na na-score sa verified level kapag hiniling sa napiling modelo, sa payak na salita, na i-score ang sagot; average ng tatlong takbo.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Buwanang bayad
CA$24.98 (kasama buwis)
CA$138+ (dagdag buwis)
CA$276 (dagdag buwis)
Pag-score
Walang limitasyon
Limitado
Limitado
Handang bangko ng tanong
Oo
Hindi
Hindi
Practice set
80
Wala
Wala
Practice task
2,000+
Wala
Wala
Format ng CELPIP
Oo
Hindi
Hindi
Katumpakan
81%
62%
35%
Sagot sa mataas na antas
71%
50%
25%

Ang pinakatumpak naming speaking grader sa ngayon. Sa mga sagot na hindi pa nito nakikita, natugma ng Prepamigo Scoring Engine 2.0 ang verified score 81% ng oras, nangunguna sa bawat frontier model na sinubok namin sa parehong trabaho, at malinaw na hakbang pataas mula sa Engine 1.0, ang grader na pinalitan nito.

Ngayon, inilalabas namin ang Prepamigo Scoring Engine 2.0 para sa Speaking, ang sistema na nag-iscore ng bawat spoken practice response sa Prepamigo. Ang Engine 2.0 ay isang kumpletong muling disenyo ng paano kami nag-iscore. Sa halip na isang solong grading pass, gumagamit ito ng dalawang independiyenteng grader na ikinukumpara ang bawat sagot direkta laban sa na-calibrate na halimbawa, bumoboto nang maraming beses, at ikinakasundo ang kanilang mga sagot bago ipakita ang score.

Ang resulta ay isang grader na mas malayong tumpak kaysa sa anumang frontier model na ginamit sa paraang gagamit ang isang estudyante. Sa isang held-out set ng totoong spoken response na may independiyenteng na-verify na score, natamo ng Engine 2.0 ang tamang score 81% ng oras. Nang hiniling sa payak na salita na i-score ang parehong transcript, ang pinakamalakas sa kanila, ang Claude Opus 5, umabot sa 62%. Ang Gemini ay umabot sa 58%. Ang Claude Sonnet 5 at GPT-4o mini ay umabot sa 45%, ang GPT 5.5 sa 37%, ang GPT 5.6 sol sa 35%, at ang GPT 5.6 luna sa 31%. Nang binigyan namin ang bawat model ng sariling procedure ng Engine 2.0, na may totoong calibration examples para sa bawat task, umakyat ang pinakamahusay sa kanila sa 77% at pareho pa ring natapos na nahuhuli.

Ang katumpakan ay pinakamahalaga kung saan pinakamahirap makamit ito. Nakikilala ng Engine 2.0 ang isang sagot sa pinakamataas na antas 71% ng oras. Nang hiniling sa payak na salita, walang ibang model na nakilala nang higit sa 56%, at ang mga model ng GPT ay nakilala sa pagitan ng 13% at 27%. Nireresistensya rin ng Engine 2.0 ang pinakakaraniwang kahinaan ng mga automated grader: mga score na lumilihis pababa at patungo sa gitna ng scale kahit gaano man lakas o hina ang sagot. Ang paglihis na iyon ang kahinaan na pinakamadalas naming nakita sa Engine 1.0.

Ang Engine 2.0 ay mas mabilis, mas consistent, at gumagawa ng feedback na nagsisipi ng mismong mga salita ng estudyante. Aktibo na ito ngayon para sa bawat user ng Prepamigo. Ipinaliliwanag ng pahinang ito kung ano ang gawa nito, paano namin ito sinukat, at kung saan naroon pa rin ang mga limitasyon nito.

Katumpakan laban sa mga verified score

Ang tanong na pinapahalagahan namin ay simple. Kapag nag-record ang isang estudyante ng sagot, tumutugma ba ang score sa screen sa score na ibinigay ng isang trusted grader? Upang sagutin ito, gumawa kami ng isang test set ng totoong spoken response sa lahat ng walong tipo ng speaking task, na bawat isa ay may score na independiyenteng na-verify, at pantay naming hinati ang set sa mababa, gitna, at pinakamataas na score upang walang solong antas na makapangibabaw sa resulta.

Gumagamit ang paghahambing ng 48 sa mga sagot na iyon na itinago mula pa sa umpisa. Walang sinuman sa team na gumamit ng mga ito habang binubuo o niti-tune ang Engine 2.0. Bawat sagot ay na-transcribe salita-por-salita. Bawat model ay sinabihan na ito ay isang matalinong CELPIP examiner, binigyan ng task prompt at ang transcript, at hiniling na i-score ang sagot mula 0 hanggang 12, nang tatlong beses, sa magkaibang araw. Kinuha namin ang average ng tatlong takbo at binilang kung gaano madalas na ang score ay tumutugma sa level ng verified score.

51%

mas kaunting pagkakamali kaysa sa Claude Opus 5

19 mali kada 100 sagot, kumpara sa 38.

71%

mas kaunting pagkakamali kaysa sa GPT 5.6 sol

19 mali kada 100, kumpara sa 65.

71%

ng mga sagot sa pinakamataas na antas na nakilala

Ang pinakamahusay sa ibang model ay nakikilala ang 56%; ang GPT 5.6 sol ay 25%.

Tatlong bagay ang namumukod sa mga numerong ito. Una, hindi maliit ang agwat. Labinsiyam na puntos laban sa pinakamalakas na frontier model at apatnapu’t anim laban sa model na nasa likod ng mga bayad na plan ng ChatGPT, sa isang pagsubok na may 48 sagot, ay ang pagkakaiba sa pagitan ng siyam at dalawampu’t dalawang dagdag na tamang score. Ikalawa, ang agwat ay hindi isang artifact ng isang palakaibigang pagsubok. Ang 48 sagot ay pinili bago pa naging pinal ang disenyo ng Engine 2.0 at hindi kailanman nagalaw habang pinagbubuo ito. Ikatlo, ang paghahambing ay ang isang mahalaga sa isang estudyante: sinusukat nito ang nakukuha mo kapag idinikit mo ang transcript sa isang chatbot at hihilingin, na kung paano ginagamit ng halos lahat ang mga model na ito.

Isang salita tungkol sa ibig sabihin ng “tama” dito. Ang mga verified score sa scale na ito ay nagmumula sa mga level sa halip na isang solong puntos, kaya binibilang namin ang isang score bilang tama kapag napunta ito sa loob ng verified level. Ang isang sagot na verified sa pinakamataas na antas, halimbawa, ay tama kung binigyan ito ng engine ng 9, 10, o 11. Sa isang mas mahigpit na pagbasa na tumatanggap lamang ng 10 pataas, bumaba ang bawat sistema ng ilang puntos at hindi nagbabago ang ranking.

SistemaPayak na kahilinganIbinigay ang aming buong procedure
Prepamigo Scoring Engine 2.081.3%
Claude Opus 561.8%77.1%
Gemini58.3%70.8%
Claude Sonnet 545.1%68.8%
GPT-4o mini45.1%50.0%
GPT 5.536.8%68.8%
GPT 5.6 sol35.4%70.8%
GPT 5.6 luna30.6%62.5%

Performance sa bawat antas ng score

Ang isang average na numero ng katumpakan ay kayang magtago ng marami. Ang isang grader na magaling sa mahihinang sagot at walang kaya sa malalakas ay maaaring magpakita ng magandang numero habang binibigo ang mga estudyanteng pinakakailangan ng tumpak na sagot. Kaya iniulat namin ang katumpakan nang hiwalay para sa bawat isa sa tatlong antas sa test set: mababang score na 4 o 5, gitnang score na 7 o 8, at pinakamataas na score na 10 pataas.

Karamihan sa mga grader, tao man o makina, ay lumilihis patungo sa gitna. Ang malakas na sagot ay nagiging 8 sa halip na 10. Ang mahina ay nagiging 6 sa halip na 5. Walang ikukumpara, ang mga frontier model ay nagdaragdag ng pangalawang ugali: lumilihis pababa, kaya ang isang mahinang sagot ay madalas na na-score na 3 at ang isang malakas na 7. Ang Engine 2.0 ay binuo tiyak upang resistensyahan ang dalawang panghila, at ipinapakita ito ng resulta nang pinakamalinaw sa itaas ng scale.

Mababang score · verified score na 4 o 5

16 held-out response kada sistema, payak na kahilingan, average ng tatlong takbo.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

Gitnang score · verified score na 7 o 8

16 held-out response kada sistema, payak na kahilingan, average ng tatlong takbo.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

Pinakamataas na score · verified score na 10 pataas

16 held-out response kada sistema, payak na kahilingan, average ng tatlong takbo. Halos lahat ng miss ay 7 o 8.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

Para sa mga estudyanteng malakas na, ito ang agwat na mahalaga. Nang hiniling sa payak na salita, wala sa ibang model na nakikilala nang higit sa 56% ng mga sagot sa pinakamataas na antas; nakikilala ng GPT 5.6 sol ang isa sa apat, at ng GPT 5.6 luna ang isa sa walo. Nakikilala ng Engine 2.0 ang 71%.

Sa mababang antas, nangunguna ang Engine 2.0 sa 88%, may Claude Opus 5 sa 77% at GPT-4o mini sa 75%. Ang lahat ng iba pang model ay sa paligid ng kalahati, at ang Claude Sonnet 5 ay sa 44%. Ang miss ay halos palaging 3: nakikita ng model ang isang mahinang sagot at nag-iscore nito sa ibaba ng antas sa halip na sa loob nito. Ang magandang numero ng GPT-4o mini dito ay ang unang senyales ng problema nito, na ang pag-iscore nito nang mababa sa halos lahat; sa itaas ng scale, nakikilala nito ang isang sagot sa bawat anim.

Sa gitnang antas, nangunguna ang Engine 2.0 sa 85%. Ang Gemini at Claude Sonnet 5 ay sa 63%, ang Claude Opus 5 sa 58%, at pagkatapos ay isang bangin: ang GPT-4o mini sa 44% at ang tatlong mas malalaking model ng GPT sa 27% hanggang 29%. Ang mga gitnang-antas na sagot ay may paghalo ng lakas at kahinaan na dapat timbangin sa halip na tuklasin, at walang pagtitimbangan, nakikita ng mga model ng GPT ang mga kahinaan at nagbibigay ng 5 o 6.

Sa pinakamataas na antas, pinakamalawak ang agwat. Nakikilala nang tama ng Engine 2.0 ang 71% ng mga sagot sa pinakamataas na antas. Nakikilala ng Gemini ang 56% at ng Opus 5 eksaktong kalahati. Lima sa pitong ibang model ay nagbibigay ng 7 o 8 sa kahit pito sa bawat sampung sagot na dapat sana ay 10. Ito ang problema sa middle-drift sa pinakadalisay na anyo nito. Ang isang sagot sa pinakamataas na antas ay hindi perpekto; naglalaman ito ng paminsan-minsang pagkakamali, isang restart, isang payak na pangungusap sa gitna ng mga kumplikado, at ang isang grader na sinusukat ito laban sa isang haka-hakang perpektong sagot ay nagbabawas para sa bawat isa. Na-calibrate ang Engine 2.0 laban sa mga halimbawang ipinapakita kung ano talaga ang tunog ng isang sagot sa pinakamataas na antas, kasama ang mga pagkakamali, at malinaw na disenyado ito upang ikumpara laban sa mga halimbawang iyon sa halip na laban sa perpeksyon.

Ano kung ibigay mo sa kanila ang aming buong procedure?

Ang mga numero ng payak na kahilingan ay hindi isang verdict sa kung gaano matalino ang mga model na ito. Isang verdict ito sa kung ano ang mangyayari kapag ang isang model ay hiniling ng numero, walang ikukumpara. Kaya nagsagawa kami ng pangalawang pagsubok, binibigyan ang bawat model ng eksaktong ibinibigay sa mga sariling grader ng Engine 2.0: ang transcript, ang task, dalawang totoong calibration example sa bawat antas para sa tiyak na task na ito, at isang instruksyon na pangalanan ang pinakamalapit na example para sa bawat isa sa apat na dimensyon sa halip na gumawa ng numero. Ang bawat model ay tumanggap din ng maikling calibration note na iniangkop sa sarili nitong ugali.

Ibinigay ang aming buong procedure: bahagi ng mga sagot na na-score sa verified level

Parehong 48 held-out response. Parehong transcript, instruksyon, at calibration examples para sa bawat sistema; ang bawat model ay nag-grade ng bawat sagot isang beses.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

Bumuti ang bawat model, may pagbuti na dramatiko. Doble ang GPT 5.6 sol, mula 35% patungong 71%. Umakyat ang Opus 5 mula 62% patungong 77%. Bahagya lang gumalaw ang GPT-4o mini, mula 45% patungong 50%, dahil nag-iscore ito nang mababa ang lahat anuman ang ipakita sa kanya. At ang bawat model ay natapos na nahuhuli pa rin sa Engine 2.0. Sa itaas ng scale, nananatili ang agwat: humihinto ang Opus 5, GPT 5.6 sol, Gemini, at GPT 5.5 lahat sa 63% ng mga sagot sa pinakamataas na antas, ang Sonnet 5 sa 38%, ang GPT-4o mini sa zero, kumpara sa 71% para sa Engine 2.0.

Ipinapakita ng pangalawang pagsubok na ito kung saan talagang nakakapit ang halaga sa Engine 2.0. Hindi ito isang mas matalinong model; gumagamit ito ng mga model mula sa parehong listahan na ito. Ito ay totoong halimbawa kung ano ang tunog ng bawat antas sa bawat tiyak na task, isang tanong na pinipilit ang model na maghambing sa halip na manghula, at pagkatapos ay tatlo pang bagay na hindi kayang ibigay ng isang solong pagpasada: dalawang independiyenteng grader mula sa magkaibang provider, tatlong boto mula sa bawat isa na ang gitnang boto ay itinatago, at isang panuntunan sa reconciliation na kinukuha ang mas mataas na score kapag magkaiba nang malaki ang dalawang grader, dahil ipinakita ng pagsusuri na ang mas mababang verdict ay halos palaging mali sa malalakas na sagot.

Consistency at stability

Ang isang grader na mapagkakatiwalaan ay dapat na consistent. Kung ang parehong recording ay makukuha ng 8 ngayon at 10 bukas, wala sa dalawang numero na may malaking kahulugan, at hindi masasabi ng isang estudyante kung gumagana ang kanyang practice. Kaya kasama ang katumpakan, sinusukat namin kung ang Engine 2.0 ay nagbibigay ng parehong sagot kapag tinanong ng parehong tanong nang dalawang beses.

Pinatakbo namin ang Engine 2.0 sa 48 held-out response ng tatlong hiwalay na pagkakataon, sa magkaibang araw, na walang binago sa pagitan. Nakuha nito ang 81.3% sa bawat takbo. Hindi humigit-kumulang 81%: ang parehong 39 tamang sagot sa 48 sa bawat pagkakataon, humigit-kumulang. Kung titingnan ang indibidwal na sagot sa halip ng aggregate, 87.5% ang tumanggap ng eksaktong parehong score sa lahat ng tatlong takbo, at 4.2% lamang ang kumilos ng dalawang puntos o higit pa sa pagitan ng mga takbo. Ang kaunti na ito ay mga sagot na nakatapat mismo sa hangganan sa pagitan ng dalawang antas, kung saan ang maliit na pagkakaiba sa paghusga ay lehitimong nagtutulak sa score sa isang direksyon.

Ang payak na kahilingang pagsubok sa mga frontier model ay kumilos nang higit pa sa pagitan ng mga takbo. Nakuha ng GPT 5.6 sol ang 31%, 40%, at 35% sa tatlong takbo nito; ang Opus 5 ay nakuha ang 62%, 65%, at 58%. Hilingin sa isang chatbot na i-grade ang parehong transcript sa dalawang magkaibang araw at madalas kang makakakuha ng dalawang magkaibang score.

Ang consistency ay nagmumula sa dalawang desisyon sa disenyo. Ang bawat grader sa Engine 2.0 ay bumoboto ng tatlong beses sa bawat sagot at ang gitnang boto ay itinatago, na inaalis ang bihirang outlier na dulot ng isang pagpasada. At ang mga verdict ng dalawang grader ay ikinakasundo ng isang fixed rule sa halip ng isa pang model, kaya ang parehong pares ng verdict ay palaging gumagawa ng parehong huling score. Sinubok ang dalawang desisyon nang direkta: sa isang boto sa halip ng tatlo, bumaba ang agreement ng run-to-run mula 87.5% patungong 77.1%, at ang bahagi ng mga sagot na tumalon ng dalawa o higit pang puntos ay higit pang doble.

Paano nag-iscore ang Engine 2.0 ng isang sagot

Ang Engine 2.0 ay hindi isang solong model. Ito ay isang procedure, at ang procedure ang gumagawa ng pagkakaiba. Narito ang nangyayari sa mga sampung segundo sa pagitan ng pagpindot ng estudyante ng stop at ang paglabas ng score sa screen.

  1. Ang recording ay na-transcribe salita-por-salita. Ang bawat filler, bawat restart, bawat self-correction ay itinatago. Napatunayang mahalaga ito. Nang sinubukan namin ang isang “nalinis” na transcript na inalis ang mga pag-aatubili, bumaba ang katumpakan ng labinlimang puntos, dahil ang mga pag-aatubili ay bahagi ng ebidensya na kailangan ng isang grader upang husgahan kung paano tumunog ang isang sagot.
  2. Dalawang independiyenteng grader ang bumabasa ng transcript. Binuo ang mga ito sa magkaibang underlying model mula sa magkaibang provider, kaya hindi nila pinagsasaluhan ang parehong blind spot. Bawat grader ay tumatanggap ng task prompt, ang transcript, at isang maliit na set ng calibration examples para sa eksaktong task na ito: totoong sagot sa mababa, gitna, at pinakamataas na antas, dalawa kada antas, upang ipakita ang bawat antas bilang isang hanay sa halip na isang solong punto.
  3. Naghahambing ang bawat grader sa halip na nagsi-score. Ito ang sentral na pagbabago mula sa Engine 1.0. Sa halip na hiniling ng numero, ang bawat grader ay tinatanong, para sa bawat isa sa apat na dimensyon ng sagot, kung aling calibration example ang pinakakahawig nito. Wala ang opsyong “sa pagitan.” Ang pagpilit na mag-commit sa pinakamalapit na example ang nagpipigil sa paglihis patungo sa gitna. Ang score ay nagmumula pagkatapos mula sa napiling antas ng isang fixed rule, hindi ng model.
  4. Bumoboto ang bawat grader nang tatlong beses. Ang gitnang boto sa bawat dimensyon ay itinatago. Inaalis nito ang paminsan-minsang sagot na may masamang araw ang model nang hindi in-average palayo ang totoong paghusga.
  5. Ikinakasundo ang dalawang verdict. Kung magkasundo ang mga grader o magkaiba nang isang puntos lamang, ang huling score ay ang kanilang average. Kung magkaiba sila nang dalawa o higit pa, ginagamit ang mas mataas na score. Ang panuntunang iyon ay hindi kabutihang-loob; ito ay calibration. Nang sinuri namin ang bawat kaso kung saan malakas na magkaiba ang dalawang grader, ang mas mababang verdict ay halos palaging mali, dahil ang di-pagkakasundo ay halos palaging nangyayari sa isang sagot sa pinakamataas na antas na masyadong maingat ang isang grader.
  6. Ipinatutupad ang mga safeguard. Isang maikling set ng fixed rule ang humahawak sa mga kaso na walang grader na dapat manghula: ang isang sagot na tahimik, ilang salita lamang, sa ibang wika, o walang-kaugnayan sa topic ay tumatanggap ng floor score anuman ang ibalik ng mga grader. Sa pagsubok, ang katahimikan ay na-score na 3, ang isang ilang-salitang sagot na 4, at ang isang off-topic o hindi-Ingles na sagot na 5, walang kabiguan sa buong set.

Dalawang katangian ng huling disenyo ang karapat-dapat pahalagahan. Ang Engine 2.0 ay nag-iscore mula sa transcript lamang, kaya hindi nito kailangan ang audio pagkatapos ng transcription at hindi umaasa sa audio model ng anumang solong provider. At dahil ang dalawang grader ay mula sa magkaibang provider, kung hindi available ang isa, patuloy ang isa, may ikatlong model na papalit upang laging magbunga ng score.

Ano ang bago sa iyong feedback

Dumating ang Engine 2.0 na may bagong itinayong feedback layer. Binabasa nito ang ebidensya ng dalawang grader, hindi lang ang score, at nasubok ito laban sa tatlong klase ng estudyante: ang unang pagkakataong sumagot sa CELPIP, ang mahina sa Ingles na naghahanap ng tips, at ang may kalahating oras bawat araw na may pagsusulit sa susunod na linggo. Ito ang mga pagbabago.

  • Ang sarili mong mga salita, na binanggit pabalik. Bawat puntong feedback ay nagsisipi ng eksaktong parirala mula sa iyong transcript na pinag-ugatan ng reaksyon ng mga grader. Kapag may quotation marks ang isang parirala, ito ay eksaktong kopya; sa aming audit, 157 sa 158 na sipi ay ganito. Hindi kailanman ginagawa-gawa ng feedback ang isang bagay na hindi mo talaga sinabi.
  • Isang bagay na aayusin muna. Bawat sagot ay may isang pangunahing hakbang: ang isang pagbabago na magpapataas ng iyong score nang pinakamalaki, na isinulat sa pinakasimpleng salita sa pahina. Sinusundan ito ng dalawa pang konkretong aksyon, at pagkatapos ay isang checklist na may tatlong bagay na dadaanan mo sa isip bago ka magsimulang magsalita.
  • Payo na akma sa gawain. Ang pagbibigay ng payo, paglalarawan ng isang eksena, at panghihikayat sa isang tao ay ginagrado sa iba't ibang bagay. Alam na ngayon ng feedback kung ano ang binibigyang-halaga ng bawat isa sa walong uri ng gawain at tumutugon dito, sa kadalasan ng pag-uulit ng parehong pangkalahatang tip sa lahat ng gawain.
  • Aling dimensyon ang unang sasanayin. Sinasabi sa iyo ng feedback kung alin sa apat na dimensyon ang iyong pinakamahina at alin ang iyong pinakamalakas, para malaman mo kung saan ang susunod na puntos, nang hindi ito itinatago sa likod ng isang numero.
  • Ang hinihingi ng gawain na hindi mo natugunan. Para sa task fulfillment, nililista ng feedback ang mga tiyak na bahagi ng prompt na hindi mo nasakop, o sinasabi nang malinaw na nasakop mo ang lahat.
  • Mga bagay na talagang maaari mong sanayin. Bawat how-to ay isang bagay na maaari mong sabihin nang malakas bago ang iyong susunod na pagsubok. Walang payo na magsalita nang mas malinaw o bawasan ang iyong accent: hindi sinusukat ng listenability ang accent, at hindi ito kailanman kinukomento ng feedback.
  • Walang sisi sa timer. Ang sagot na naputol ng takdang oras pagkatapos nitong matapos ang gawain ay hindi babawasan ng puntos dahil sa pagkaputol, at hindi ka sisisihin ng feedback dito.

Noong ihambing ng isang independiyenteng judging model ang feedback na ito sa ginawa ng aming naunang sistema para sa parehong mga sagot, nang hindi alam kung alin ang alin, mas pinili nito ang bagong feedback sa 20 sa 24 na paghahambing, kapwa sa paghusga bilang isang examiner at sa paghusga bilang isang estudyante.

Walang limitasyong practice para sa CA$25 kada buwan

Ang katumpakan ay kapaki-pakinabang lamang kung kaya mo itong gamitin araw-araw. Ang isang speaking score na mapagkakatiwalaan ay pinakamahalaga sa iyong ika-apatnapung practice response, hindi sa ikaapat, dahil iyon ang oras na sinasabi nito kung nagbunga ba ang isang pagbabago sa kung paano ka nagsalita. Kaya na-price namin ang Engine 2.0 upang gamitin nang walang bilangan.

Ang bawat plan ng Prepamigo ay may walang limitasyong pag-score ng Engine 2.0, walang limitasyong pagsubok, at ang buong bangko ng tanong: 80 kumpletong practice set at mahigit 2,000 practice task sa Speaking, Writing, Reading, at Listening, na sinulat upang sundin ang tipo ng task, timing, at format ng CELPIP General test. Pinindot mo ang record, makakakuha ka ng score at ebidensya-based na feedback sa mga sampung segundo, at maaari mo itong gawin ulit kung gaano mo kagustuhan.

Prepamigo

CA$25/ buwan

CA$24.98 kada buwan · CA$8.25 kada buwan sa annual plan (CA$98.98 kada taon) · kasama na ang buwis · kanselahin anumang oras

  • Walang limitasyong pag-score ng Scoring Engine 2.0, walang araw-araw, session, o weekly cap.
  • 80 practice set at 2,000+ task sa lahat ng apat na seksyon, hinugis ayon sa totoong format ng test, kaya hindi mo na kailangang sumulat ng sarili mong prompt.
  • Mag-record at umalis. Hinahawakan para sa iyo ang transcription, grading, at feedback; walang idikit at walang i-prompt.
  • Feedback sa iyong mismong mga salita, na ang bawat sipi ay masusundan sa kung ano talaga ang sinabi mo.

Claude Max, bilang paghahambing

US$100/ buwan

humigit-kumulang CA$138 bago buwis · 20x tier US$200 kada buwan · Pro US$20 na may mas mahigpit na cap

  • Kahit ang Max ay may cap. Isang rolling five-hour usage window at weekly limit, lima o dalawampung beses ang pinapayagan ng Pro; kapag nasadlak ka sa isa man, maghihintay ka.
  • Walang bangko ng tanong. Dadalhin mo ang sariling task, magpapasya ka mismo kung kahawig ito ng totoong test, at susubaybayan mo ang naipractice mo na.
  • Ikaw ang gagawa ng setup. Ang pag-record, pag-transcribe, pagdikit ng transcript, at pagsulat ng mga instruksyon sa grading ay lahat nasa iyo, bawat pagkakataon.
  • Payak na kahilingan, hindi isang na-calibrate na grader. Nang hiniling sa payak na salita, natugma ng Claude Opus 5 ang verified score 62% ng oras at ng Claude Sonnet 5 45%, kumpara sa 81% para sa Engine 2.0.

Ang mga presyo at usage term ng plan ng Claude ay gaya ng nailathala sa claude.com noong Setyembre 2026 at maaaring magbago. Ang CELPIP ay isang trademark ng may-ari nito; ang Prepamigo ay isang independiyenteng practice platform at hindi kaakibat, sinusuportahan, o konektado sa test maker. Ang mga practice task ng Prepamigo ay orihinal na materyal na isinulat upang sundin ang pampublikong format ng test.

Availability

Ang Prepamigo Scoring Engine 2.0 para sa Speaking ay aktibo na ngayon para sa lahat ng user ng Prepamigo sa bawat tipo ng speaking task. Walang kailangang i-enable. Bawat bagong speaking response ay na-score ng Engine 2.0, at ang bawat score ay may kasamang feedback na hinango mula sa mismong mga salita ng estudyante.

Ang isang tipikal na sagot ay na-score sa mga sampung segundo, mas mabilis kaysa sa Engine 1.0. Mas mura rin gastusin ng Engine 2.0 kada sagot kaysa sa disenyong pinalitan nito, na ito ang nagpapahintulot sa aming patakbuhin ang dalawang grader na may tatlong boto bawat isa para sa bawat estudyante nang hindi binabago ang gastos ng Prepamigo.

Maglathala kami ng update sa mga numero sa pahinang ito habang natatapos ang real-world validation na inilarawan sa itaas. Kung may recording ka na naniniwala kang mali ang na-score ng Engine 2.0, nais naming makita ito: ang mga kasong iyan ang pinakamabilis na paraan na alam namin upang matuklasan ang susunod na pagpapahusay.

Para sa mga head-to-head na paghahambing, basahin ang Prepamigo vs Claude at Prepamigo vs ChatGPT. O Mag-record ng sagot at panoorin kung paano tumatakbo ang Engine 2.0. Basahin ang gabay na ito sa Ingles.

Ipinakikilala: Prepamigo Scoring Engine 2.0 para sa Speaking | PrepAmigo