Pag-score

Aling AI ang Pinakatumpak Mag-score ng CELPIP Speaking? Sinubok Namin ang Walo

Setyembre 5, 2026

Bahagi ng mga sagot na na-score sa verified level

48 held-out response, 16 kada band. Binigyan ang bawat model ng transcript at hiniling, sa payak na salita, na i-score ito sa CELPIP scale; average ng tatlong takbo. Tumakbo ang Engine 2.0 sa normal nitong production configuration.

81%

Prepamigo Engine 2.0

62%

Claude Opus 5

58%

Gemini

45%

Claude Sonnet 5

45%

GPT-4o mini

37%

GPT 5.5

35%

GPT 5.6 sol

31%

GPT 5.6 luna

Prepamigo laban sa mga nangungunang chatbot plan

Dolyar Canadian. Kasama na ang buwis sa mga presyo ng Prepamigo. Ang Claude Max (mula sa US$100) at ChatGPT Pro (US$200) ay na-convert sa 1.38, bago buwis. Ang accuracy ay ang bahagi ng held-out na mga sagot na na-score sa verified level kapag hiniling sa napiling modelo, sa payak na salita, na i-score ang sagot; average ng tatlong takbo.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Buwanang bayad
CA$24.98 (kasama buwis)
CA$138+ (dagdag buwis)
CA$276 (dagdag buwis)
Pag-score
Walang limitasyon
Limitado
Limitado
Handang bangko ng tanong
Oo
Hindi
Hindi
Practice set
80
Wala
Wala
Practice task
2,000+
Wala
Wala
Format ng CELPIP
Oo
Hindi
Hindi
Katumpakan
81%
62%
35%
Sagot sa mataas na antas
71%
50%
25%

Marami na sa mga kandidato ng CELPIP na ngayon ay nag-grade sa sariling speaking practice gamit ang isang AI chatbot. Mag-record ng sagot, i-transcribe ito, idikit ito, hilingin ang score. Mabilis ito at libre o halos libre, at parang may kaalamang ang mga paliwanag. Ang walang sumasabi sa iyo ay gaano kadalas tama ang numero, o aling model ang paniwalaan, o kung nagbabago ang sagot depende sa paraan ng iyong pagtanong. Nais naming malaman, kaya binuo namin ang pagsubok at pinatakbo ito sa walong sistema, sa dalawang paraan.

Ang unang paraan ay ang chart sa itaas: idikit ang transcript, hilingin ang score, sa paraang gagawin ng isang estudyante. Sa mga general-purpose na model, ang Claude Opus 5 ang pinakatumpak sa 62%, ang Gemini ay sumunod sa 58%, at wala sa iba na lumagpas sa kalahati: ang Claude Sonnet 5 at GPT-4o mini sa 45%, ang GPT 5.5 sa 37%, ang GPT 5.6 sol sa 35%, ang GPT 5.6 luna sa 31%. Ang isang purpose-built na sistema, ang Prepamigo Scoring Engine 2.0, umabot sa 81% sa parehong mga sagot.

Ang pangalawang paraan ay ang isa naming inaakalang pinaka-nakapagtuturo: ibinigay namin sa bawat model ang aming sariling grading procedure, na may totoong calibration examples at forced comparison, upang makita kung gaano ang bawat isa magagaling. Bumuti ang bawat model, ang ilan sa mga ito nang dramatiko, at ang bawat isa ay natapos na nahuhuli pa rin sa Engine 2.0. Dapat naming banggitin nang tapat na ang Prepamigo ay aming produkto. Sinubukan naming gawing fair ang dalawang pagsubok para sa lahat, at kung saan tumalo sa amin ang isang model sa isang tiyak na antas, sinasabi namin ito.

Ang leaderboard ng payak na prompt

Tatlong antas ang nakikita sa chart sa itaas. Nag-iisa ang Engine 2.0 sa 81%. Ang Claude Opus 5 sa 62% at ang Gemini sa 58% ay bumubuo ng pangalawang antas: magagamit, kung tinatanggap mong mali ka dalawa sa bawat lima. Ang lahat ng iba ay mas mababa sa 50%, na mas mahina kaysa sa isang coin flip sa pagitan ng tatlong band kung walang alam sa sagot.

Iyan ang katangi-tanging katangian ng payak na pagsubok: marahas mag-score ang bawat general-purpose na model. Ang average na score na ibinigay nila sa isang verified na sagot sa pinakamataas na antas ay mula 7.2 (luna) hanggang 8.6 (Opus 5). Ang average na ibinigay nila sa isang verified na mababang-antas na sagot ay mula 3.7 hanggang 4.3, sa ibaba ng band para sa lahat maliban sa Opus 5 at Gemini. Walang halimbawa kung ano ang tunog talaga ng bawat antas, ikukumpara ng mga model ang sagot laban sa isang haka-hakang perpektong sagot at nagbabawas.

Resulta sa bawat antas ng score

Ang isang pangkalahatang numero ay nagtatago kung saan bumabagsak ang mga error, at kung saan ito bumabagsak ang tumutukoy kung ang isang grader ay kapaki-pakinabang para sa iyo. Narito ang resulta ng payak na pagsubok ayon sa band.

Mababang-antas na sagot (verified 4 o 5)

16 held-out response kada sistema, payak na prompt, average ng tatlong takbo.

88%

Prepamigo Engine 2.0

77%

Claude Opus 5

75%

GPT-4o mini

56%

Gemini

54%

GPT 5.5

54%

GPT 5.6 sol

52%

GPT 5.6 luna

44%

Claude Sonnet 5

Ang mahihinang sagot ay dapat na madaling dulo ng scale, at sa payak na prompt, hindi ito ganoon. Ang Engine 2.0 ay sa 88%, ang Opus 5 sa 77%, ang GPT-4o mini sa 75%. Ang lahat ng iba ay sa paligid ng kalahati, at ang Sonnet 5 ay sa 44%. Ang miss ay halos palaging 3: nakikita ng model ang isang mahinang sagot at nag-iscore nito sa ibaba ng band sa halip na sa loob nito. Ang magandang numero ng GPT-4o mini dito ay ang unang senyales ng problema nito, na ang pag-iscore nito nang mababa sa halos lahat.

Gitnang-antas na sagot (verified 7 o 8)

16 held-out response kada sistema, payak na prompt, average ng tatlong takbo.

85%

Prepamigo Engine 2.0

63%

Gemini

63%

Claude Sonnet 5

58%

Claude Opus 5

44%

GPT-4o mini

29%

GPT 5.5

27%

GPT 5.6 sol

27%

GPT 5.6 luna

Ang gitnang band ang naghihiwalay ng field. Ang Engine 2.0 ay sa 85%. Ang Gemini at Sonnet 5 ay sa 63%, ang Opus 5 sa 58%. Pagkatapos ay isang bangin: ang GPT-4o mini sa 44% at ang tatlong mas malalaking model ng GPT sa 27% hanggang 29%. Ang mga gitnang-antas na sagot ay may totoong paghalo ng lakas at kahinaan na dapat timbangin, at walang pagtitimbangan, nakikita ng mga model ng GPT ang mga kahinaan at nagbibigay ng 5 o 6. Ang isang 7 o 8 na nagsasalita na humihingi sa GPT 5.6 sol ng score ay maririnig ang tamang band mas mababa sa tatlo sa bawat sampu.

Mga sagot sa pinakamataas na antas (verified 10 pataas)

16 held-out response kada sistema, payak na prompt, average ng tatlong takbo. Halos lahat ng miss ay 7 o 8.

71%

Prepamigo Engine 2.0

56%

Gemini

50%

Claude Opus 5

29%

Claude Sonnet 5

27%

GPT 5.5

25%

GPT 5.6 sol

17%

GPT-4o mini

13%

GPT 5.6 luna

Ang pinakamataas na band ang lugar kung saan pinakamahalaga ang mga pagkakaiba, at kung saan pinakamalaki ang pinsala ng payak na prompt. Nakikilala ng Engine 2.0 ang 71% ng mga sagot sa pinakamataas na antas. Nakikilala ng Gemini ang 56% at ng Opus 5 eksaktong kalahati. Pagkatapos ang Sonnet 5 sa 29%, ang GPT 5.5 sa 27%, ang GPT 5.6 sol sa 25%, ang GPT-4o mini sa 17%, at ang GPT 5.6 luna sa 13%. Lima sa pitong general-purpose na model ay nagbibigay ng 7 o 8 sa kahit pito sa bawat sampung sagot na dapat sana ay 10.

Kung ikaw ay isang malakas na kandidato na nag-grade sa sarili gamit ang isang chatbot, ito ang numero na tandaan. Ang tsansang sasabihin ng isang payak na kahilingan sa GPT 5.6 sol na ang isang 10 ay isang 10 ay isa sa apat.

Ang pangalawang leaderboard: ibinigay ang aming buong procedure

Ang mga numero ng payak na pagsubok ay hindi isang verdict sa kung gaano matalino ang mga model na ito. Isang verdict ito sa kung ano ang mangyayari kapag ang isang model ay hiniling ng numero, walang ikukumpara. Kaya nagsagawa kami ng pangalawang pagsubok, binibigyan ang bawat model ng calibration examples at ang forced comparison na ginagamit ng mga sariling grader ng Engine 2.0.

Ibinigay ang aming buong procedure: bahagi ng mga sagot na na-score sa verified level

Parehong 48 held-out response. Parehong transcript, instruksyon, at calibration examples para sa bawat sistema; ang bawat model ay nag-grade ng bawat sagot isang beses. Tumanggap din ang Gemini ng audio.

81%

Prepamigo Engine 2.0

77%

Claude Opus 5

71%

GPT 5.6 sol

71%

Gemini

69%

GPT 5.5

69%

Claude Sonnet 5

63%

GPT 5.6 luna

50%

GPT-4o mini

Bumuti ang bawat model. Umakyat ang Opus 5 mula 62% patungong 77%. Doble ang GPT 5.6 sol, mula 35% patungong 71%. Ang GPT 5.5 ay mula 37% patungong 69%, ang Sonnet 5 mula 45% patungong 69%, ang luna mula 31% patungong 63%, ang Gemini mula 58% patungong 71%. Bahagya lang gumalaw ang GPT-4o mini, mula 45% patungong 50%, dahil nag-iscore ito nang mababa ang lahat anuman ang ipakita sa kanya.

Nagbabago rin ang ayos. Sa payak na prompt, malayong nauna ang mga model ng Claude sa mga model ng GPT. Sa full procedure, tinatalo ng GPT 5.6 sol ang Sonnet 5 at nagtabla sa Gemini, at nagkalipumpon ang apat na model sa pagitan ng 69% at 71%, statistically indistinguishable sa sample na ito. Nasa ibabaw ang Opus 5 sa general-purpose field sa 77%, apat na puntos na nahuhuli sa Engine 2.0.

Sa level view, itinaas ng full procedure ang katumpakan sa mababang band sa 88% para sa apat na model, pareho sa Engine 2.0, at ang katumpakan sa gitnang band sa 81% para sa dalawang model ng Claude. Ang pinakamataas na band ang lugar kung saan nananatili ang agwat: humihinto ang Opus 5, GPT 5.6 sol, Gemini, at GPT 5.5 lahat sa 63%, ang Sonnet 5 sa 38%, at ang GPT-4o mini sa zero, kumpara sa 71% para sa Engine 2.0. Ang isang model na gumagawa ng isang pagpasada ay nagpipigil pa rin sa isang malakas na sagot na may maliit na pagkakamali. Isinasara ng Engine 2.0 ang natitirang agwat gamit ang dalawang independiyenteng grader mula sa magkaibang provider, tatlong boto mula sa bawat isa na ang gitnang boto ay itinatago, at isang panuntunan sa reconciliation na kinukuha ang mas mataas na score kapag magkaiba nang malaki ang dalawang grader, dahil ipinakita ng pagsusuri na ang mas mababang verdict ay halos palaging mali sa malalakas na sagot.

Ang tapat na buod ng dalawang leaderboard ay ito: mas mahalaga ang procedure kaysa sa model. Ang parehong GPT 5.6 sol ay umakyat mula 35% patungong 71% na hindi binabago ang kahit isang weight, sa pagpapakita lamang kung ano ang tunog ng bawat antas at pagtatanong kung aling halimbawa ang pinakakahawig ng sagot.

Kung bakit lumihis pababa at patungo sa gitna ang mga model

Ang pattern ay sobrang pare-pareho sa mga model mula sa tatlong magkaibang kompanya na hindi ito maaaring isang kakaibang katangian ng isa lamang sa kanila. Isang katangian ito ng gawain.

Kapag hiniling sa isang model na ilagay ang isang sagot sa isang scale, lumilihis ito patungo sa gitna kapag ito ay hindi sigurado, dahil ang gitna ang lugar na pinakamurang mali. At kapag walang halimbawa kung ano talaga ang tunog ng isang antas, ikukumpara nito ang sagot laban sa isang haka-hakang perpektong sagot at nagbabawas para sa bawat pagkakamali. Ang isang sagot sa pinakamataas na antas ay hindi kailanman perpekto. Naglalaman ito ng isang restart, isang payak na pangungusap sa gitna ng mga kumplikado, isang pag-aatubili bago ng isang mahirap na salita. Sinusukat laban sa perpeksyon, ang mga pagkakamaling ito ay nagkakahalaga ng isa o dalawang antas, at ang isang 10 ay nagiging 8 o 7.

Hindi ito naaayos ng mga instruksyon. Sinubukan naming sabihin nang malinaw sa mga model na ang isang level 9 ay hindi kailangang walang-kamaliang sagot, na ang pag-underscore ng isang malakas na sagot ay kasing-seryoso ng pag-overscore ng isang mahina. Ang bawat instruksyon ay tinanggap at pagkatapos ay hindi pinansin sa aktwal na gawa. Nang pinakain namin ang isang model ng kanyang mismong calibration example na sinabihan itong ito ay kumakatawan sa isang sagot sa pinakamataas na antas at hiniling ditong i-score ito, binigyan nito ito ng 8.

Ang gumana, karamihan, ay ang pagbabago ng tanong mula sa “anong numero?” patungo sa “aling halimbawa?” at ang pagbigay ng totoong halimbawa. Iyan ang pagkakaiba sa pagitan ng dalawang leaderboard. Kahit gayon, ang isang solong pagpasada ay lumilihis pa rin nang bahagya, dahil ang calibration examples ay hindi perpekto at ang isang pagbasa ng mga ito ay isang pagbasa. Ang dalawang grader, tatlong boto, at isang reconciliation rule ang nagsasara ng natitira.

Mga tala sa bawat model

  • Claude Opus 5. Ang pinakamahusay na general-purpose grader sa dalawang pagsubok: 62% payak (62%, 65%, at 58% sa tatlong takbo) at 77% sa full procedure. Ang kahinaan nito sa payak na prompt ay ang gitnang band, kung saan nagbibigay ito ng 6; ang kahinaan nito sa full procedure ay ang pinakamataas na band, kung saan humihinto ito sa 63%. Ito rin ang pinakamahal na model dito, nang malaking pagkakaiba.
  • Gemini. Pangalawa sa payak na pagsubok sa 58%, pareho sa lahat ng tatlong takbo, at ang pinaka-pantay sa mga band, sa 56%, 63%, at 56%. Kasama ang full procedure at ang audio recording, umabot ito sa 71%, kapantay ng GPT 5.6 sol, na gumagana mula sa teksto lamang. Ang pakikinig sa recording ay hindi tumulong dito higit sa ibinigay ng isang verbatim transcript.
  • Claude Sonnet 5. 45% payak, may kakaibang profile: makatwiran sa gitnang band sa 63%, mahina sa mahihinang sagot sa 44% dahil binibigyan niya ng 3 ang mga ito, at mahina sa pinakamataas sa 29%. Sa full procedure, umakyat ito sa 69% pero nanatili sa 38% sa mga sagot sa pinakamataas na antas. Kung patuloy na binibigyan ka ng Sonnet 5 ng 8, huwag mo itong paniwalaan.
  • GPT-4o mini. 45% payak, 50% sa full procedure, at sa dalawang kaso, ang numero ay nagpaganda sa kanya. Nag-iscore ito nang mababa ang halos lahat: 75% sa mahihinang sagot, 17% at pagkatapos ay 0% sa mga sagot sa pinakamataas na antas. Anuman ang gawin mo, huwag mong i-grade ang iyong speaking gamit ang model na ito.
  • GPT 5.5. 37% payak (35%, 42%, 33%), 69% sa full procedure. Ang gitnang band nito sa payak na prompt ay 29%. Ito ang text grader sa naunang bersyon ng aming sariling pipeline at pinalitan dahil sa kahinaan sa eksaktong band na iyon.
  • GPT 5.6 sol. 35% payak (31%, 40%, 35%), ang pinakamalaking run-to-run na pagbabago ng kahit alin sa mga model, at 71% sa full procedure, ang pinakamalaking pagbuti ng kahit alin sa mga model. Isang magaling na grader kapag ipinakita ang mga halimbawa, at isang mahina kapag hindi. Ang ugali nito sa full procedure ay ang labis na pagbibigay-gantimpala sa polish sa gitnang band.
  • GPT 5.6 luna. Huli sa dalawang pagsubok: 31% payak at 63% sa full procedure. Hinihila nito pababa ang mga gitnang sagot patungo sa 5 at nakilala nitong 13% ang mga sagot sa pinakamataas na antas sa payak na prompt. Sapat na mura upang magamit bilang pangalawang opinyon sa loob ng isang two-grader system; hindi sapat na tumpak upang gamitin nang mag-isa.

Ang idinaragdag ng isang purpose-built na sistema

Ang Engine 2.0 ay hindi isang mas magandang model. Gumagamit ito ng mga model mula sa parehong leaderboard na ito. Ang idinaragdag nito ay procedure, at ang bawat piraso ng procedure na iyon ay pinili sa pamamagitan ng pagsukat.

  1. Verbatim transcription, nang automatiko. Ang bawat filler at restart ay itinatago, dahil ang pag-alis nito ay bumaba ng labinlimang puntos sa katumpakan sa pagsubok. Hindi mo na kailangang hanapin ang isang transcription tool na gagawa nito; ang karamihan sa mga consumer tool ay naglilinis bilang default.
  2. Calibration examples na naka-attach na sa bawat task. Dalawang totoong sagot kada antas para sa bawat isa sa walong tipo ng task, naka-in place na. Ito ang solong input na nag-doble ng katumpakan ng GPT 5.6 sol, at ang isa na hindi mo magagawa sa bahay.
  3. Isang paghahambing, hindi isang numero. Pangalanan ng bawat grader ang pinakamalapit na halimbawa sa bawat isa sa apat na dimensyon; sumusunod ang score sa pamamagitan ng panuntunan. Ito ang nagpipigil sa paglihis.
  4. Dalawang grader mula sa dalawang provider. May magkaibang blind spot ang magkaibang model. Ang dalawa sa kanila, ikinasundo ng isang fixed rule, ay tumatalo sa kahit isa lamang.
  5. Tatlong boto kada isa, ang gitna ay itinatago. Hindi ito nagtaas ng katumpakan, pero itinaas nito ang run-to-run na consistency mula 77% patungong 87.5%. Ang isang sagot ng isang chatbot ay isang boto lamang.
  6. Reconciliation na kinukuha ang mas mataas na score sa malakas na di-pagkakasundo.Dahil ang mas mababang verdict ay halos palaging mali sa malalakas na sagot. Ang isang payak na average ay bumagsak sa mid-sixties sa pagsubok.
  7. Mga safeguard. Ang katahimikan, ilang salita, off-topic, at hindi-Ingles na sagot ay tumatanggap ng floor score sa pamamagitan ng panuntunan sa halip ng hula ng isang model.

Ang resulta ay 81% sa kabuuan at 71% sa pinakamataas, pareho sa tatlong hiwalay na takbo, sa mga sampung segundo kada sagot na walang idikit.

Kung gagamit ka man ng chatbot

May mga magbabasa nito na patuloy na mag-grade gamit ang isang chatbot, at makatwirang pagpili ito para sa isang kandidato na may limitadong badyet o isa na nais makipag-usap tungkol sa kanyang mga sagot. Ang mga hakbang na ito ang pagkakaiba sa pagitan ng dalawang leaderboard, at mas mailapit ka nito sa pangalawa kaysa sa una.

  1. Gumamit ng verbatim transcript. Panatilihin ang iyong filler, restart, at self-correction. Kung nililinis ng iyong transcription tool ang mga ito, ang grader ay nag-grade ng isang mas magandang sagot kaysa sa ibinigay mo.
  2. Bigyan ito ng halimbawa, hindi ng rubric. Isa o dalawang totoong sagot sa bawat antas para sa parehong tipo ng task, na may naka-label na antas, ay mas gumagawa kaysa sa anumang paglalarawan ng hitsura ng isang level 9. Kung wala kang na-verify na halimbawa, ito ang hakbang na hindi mo magagaya sa bahay, at ito ang pinakamahalaga.
  3. Tanungin kung aling halimbawa, hindi kung anong numero. Para sa bawat isa sa apat na dimensyon, hilingin sa model na pangalanan ang pinakamalapit na halimbawa at ipagbawal ang “sa pagitan.” Kunin mo mismo ang score mula sa mga antas na pinangalanan nito.
  4. Magtanong nang higit sa isang beses. I-score ang parehong sagot nang dalawa o tatlong beses sa bagong pag-uusap at panatilihin ang gitnang sagot. Kumilos ang GPT 5.6 sol ng siyam na puntos sa pagitan ng mga takbo sa payak na pagsubok.
  5. Pumili ng model na may magandang record sa pinakamataas na band. Ang Opus 5 o Gemini kung nagtatanong ka nang payak; ang Opus 5 o GPT 5.6 sol kung may mga halimbawa ka. Huwag kailanman ang GPT-4o mini kung malapit ka sa 10.
  6. Huwag paniwalaan ang isang 7 o 8. Sa bawat general-purpose na model, ang isang 7 o 8 sa isang sagot na akala mo napakahusay ay mas malamang na miss kaysa sa isang verdict.

Aling model paniwalaan, depende sa nasaan ka

Ang tamang pagbasa ng mga leaderboard na ito ay nakadepende sa iyong kasalukuyang antas, dahil nagkakamali ang mga model sa iba't ibang lugar.

  • Kung ikaw ay sa 4 o 5 ngayon, sasabihin sa iyo ng Opus 5, kung hiniling nang payak, humigit-kumulang tatlo sa apat na pagkakataon; sasabihin ng karamihan sa ibang model na 3 ka humigit-kumulang kalahati ng oras. Ang problema mo ay hindi talaga ang grader; ito ang feedback, at para dito, nais mong may bagay na nagsisipi ng iyong mga salita sa halip na magbuod.
  • Kung ikaw ay sa 7 o 8, iwasan ang mga model ng GPT na may payak na prompt, na tatawag sa iyong 5 o 6 pito sa bawat sampu. Ang Gemini at Sonnet 5 ang pinaka-maaasahang payak-prompt na grader sa gitnang band sa 63%. Ang Engine 2.0 ay sa 85%.
  • Kung ikaw ay sa 10 pataas, dito pinakamahalaga ang pagpili. Nang hiniling sa payak na salita, wala sa general-purpose na model na makikilala ang isang 10 nang higit sa 56% ng oras, at ang mga model ng GPT ay gagawin ito sa pagitan ng 13% at 27% ng oras. Nakikilala ng Engine 2.0 ang pito sa sampu at, higit pa sa lahat, nagbibigay ng parehong sagot sa bawat pagtanong.

Ang pattern sa lahat ng tatlong band ay pareho sa inilalarawan ng buong artikulo. Hindi tanga ang mga model; maingat sila, at ang pag-iingat na walang ikukumpara ay isang mababang numero. Kung mas malayo ka sa gitna, mas malaki ang gastos ng pag-iingat ng isang grader sa iyo, at mas mahalaga na binuo ang grader upang resistensyahan ito.

Ano ang bago sa iyong feedback

Dumating ang Engine 2.0 na may bagong itinayong feedback layer. Binabasa nito ang ebidensya ng dalawang grader, hindi lang ang score, at nasubok ito laban sa tatlong klase ng estudyante: ang unang pagkakataong sumagot sa CELPIP, ang mahina sa Ingles na naghahanap ng tips, at ang may kalahating oras bawat araw na may pagsusulit sa susunod na linggo. Ito ang mga pagbabago.

  • Ang sarili mong mga salita, na binanggit pabalik. Bawat puntong feedback ay nagsisipi ng eksaktong parirala mula sa iyong transcript na pinag-ugatan ng reaksyon ng mga grader. Kapag may quotation marks ang isang parirala, ito ay eksaktong kopya; sa aming audit, 157 sa 158 na sipi ay ganito. Hindi kailanman ginagawa-gawa ng feedback ang isang bagay na hindi mo talaga sinabi.
  • Isang bagay na aayusin muna. Bawat sagot ay may isang pangunahing hakbang: ang isang pagbabago na magpapataas ng iyong score nang pinakamalaki, na isinulat sa pinakasimpleng salita sa pahina. Sinusundan ito ng dalawa pang konkretong aksyon, at pagkatapos ay isang checklist na may tatlong bagay na dadaanan mo sa isip bago ka magsimulang magsalita.
  • Payo na akma sa gawain. Ang pagbibigay ng payo, paglalarawan ng isang eksena, at panghihikayat sa isang tao ay ginagrado sa iba't ibang bagay. Alam na ngayon ng feedback kung ano ang binibigyang-halaga ng bawat isa sa walong uri ng gawain at tumutugon dito, sa kadalasan ng pag-uulit ng parehong pangkalahatang tip sa lahat ng gawain.
  • Aling dimensyon ang unang sasanayin. Sinasabi sa iyo ng feedback kung alin sa apat na dimensyon ang iyong pinakamahina at alin ang iyong pinakamalakas, para malaman mo kung saan ang susunod na puntos, nang hindi ito itinatago sa likod ng isang numero.
  • Ang hinihingi ng gawain na hindi mo natugunan. Para sa task fulfillment, nililista ng feedback ang mga tiyak na bahagi ng prompt na hindi mo nasakop, o sinasabi nang malinaw na nasakop mo ang lahat.
  • Mga bagay na talagang maaari mong sanayin. Bawat how-to ay isang bagay na maaari mong sabihin nang malakas bago ang iyong susunod na pagsubok. Walang payo na magsalita nang mas malinaw o bawasan ang iyong accent: hindi sinusukat ng listenability ang accent, at hindi ito kailanman kinukomento ng feedback.
  • Walang sisi sa timer. Ang sagot na naputol ng takdang oras pagkatapos nitong matapos ang gawain ay hindi babawasan ng puntos dahil sa pagkaputol, at hindi ka sisisihin ng feedback dito.

Noong ihambing ng isang independiyenteng judging model ang feedback na ito sa ginawa ng aming naunang sistema para sa parehong mga sagot, nang hindi alam kung alin ang alin, mas pinili nito ang bagong feedback sa 20 sa 24 na paghahambing, kapwa sa paghusga bilang isang examiner at sa paghusga bilang isang estudyante.

Mga Tanong

Aling AI model ang pinakatumpak sa pag-score ng CELPIP speaking? Nang hiniling sa payak na salita: ang Claude Opus 5 sa 62%, ang Gemini 58%, ang Claude Sonnet 5 at GPT-4o mini 45%, ang GPT 5.5 37%, ang GPT 5.6 sol 35%, ang GPT 5.6 luna 31%. Umabot ang Prepamigo Scoring Engine 2.0 sa 81% sa parehong mga sagot.

ChatGPT o Claude? Ang Claude, malinaw, kapag hiniling nang payak: 62% at 45% kumpara sa 35% at 37%. Sa aming buong procedure, nagsisiksikan ang agwat sa 77% para sa Opus 5 laban sa 71% para sa GPT 5.6 sol.

Bakit binibigyan ng lahat ng 7 o 8 ang aking malalakas na sagot? Ang mga model na walang ikukumpara ay nanghuhula ng mababa at patungo sa gitna, at ang isang malakas na sagot ay palaging may maliit na pagkakamali. Nang hiniling sa payak na salita, wala sa general-purpose na model na nakikilala nang higit sa 56% ng mga sagot sa pinakamataas na antas.

Paano ako makakakuha ng mas magandang score mula sa isang chatbot? Verbatim transcript, halimbawang sagot sa bawat antas, itanong ang aling halimbawa sa halip na anong numero, magtanong nang higit sa isang beses at panatilihin ang gitnang sagot. Ang procedure na iyon ay nag-doble sa GPT 5.6 sol mula 35% patungong 71% sa aming pagsubok.

Para sa mas malapit na tingin sa dalawang head-to-head, basahin ang Prepamigo vs Claude at Prepamigo vs ChatGPT. Para sa kung paano gumagana ang procedure hakbang-hakbang, basahin ang loob ng Scoring Engine 2.0. O Mag-record ng sagot at laktawan ang transcription. Basahin ang gabay na ito sa Ingles.

Aling AI ang Pinakatumpak Mag-score ng CELPIP Speaking? Sinubok Namin ang Walo | PrepAmigo