Pag-score

Tumpak ba ang Writing Scoring ng Prepamigo para sa CELPIP? Ang mga Numero, Nang Tapat

Setyembre 8, 2026

Writing scorer ng Prepamigo sa 36 opisyal na essay

Bahagi ng mga essay na na-score sa loob ng verified level, sa kabuuan at ayon sa antas. Labindalawang essay kada antas sa parehong writing task; hindi kasama ang anim na sample essay na ginagamit ng scorer para sa calibration.

86%

Kabuuan

75%

Mahina (4–5)

100%

Gitna (7–8)

83%

Malakas (10+)

Prepamigo laban sa mga nangungunang chatbot plan

Dolyar Canadian. Kasama na ang buwis sa mga presyo ng Prepamigo. Ang Claude Max (mula sa US$100) at ChatGPT Pro (US$200) ay na-convert sa 1.38, bago buwis. Ang accuracy ay ang bahagi ng 36 opisyal na essay na na-score sa verified level kapag hiniling sa napiling modelo, sa payak na salita, na i-score ang essay; isang takbo.

Prepamigo
Claude MaxOpus 5
ChatGPT ProGPT 5.6 sol
Buwanang bayad
CA$24.98 (kasama buwis)
CA$138+ (dagdag buwis)
CA$276 (dagdag buwis)
Pag-score
Walang limitasyon
Limitado
Limitado
Handang bangko ng tanong
Oo
Hindi
Hindi
Practice set
80
Wala
Wala
Practice task
2,000+
Wala
Wala
Format ng CELPIP
Oo
Hindi
Hindi
Katumpakan
86%
61%
78%
Essay sa gitnang antas
100%
25%
75%

Ito ang tamang tanong itanong sa anumang practice tool, at karamihan sa mga tool ay hindi sumasagot nito. Ang isang writing score ay may halaga lamang kung sinasabi nito ang sasabihin ng isang totoong rater, at ang tanging paraan upang malaman kung ganoon talaga ito ay sukatin. Kaya ang artikulong ito ang sukat, inilahad nang tapat, kasama ang mga bahaging pumapuri sa amin at ang mga bahaging hindi.

Ang sagot sa isang talata: sa 36 opisyal na CELPIP writing response, na bawat isa ay may independiyenteng na-verify na score, tumama ang writing scorer ng Prepamigo sa verified level 86% ng oras. Nakuha nito nang tama ang bawat gitnang-antas na essay, 75% ng mahihinang essay, at 83% ng malalakas. Gumawa ito ng parehong resulta, pataas o pababa ng isang essay, sa tatlong hiwalay na takbo. Nang hiniling sa payak na salita na i-score ang parehong mga essay, umabot ang pinakamahusay na frontier model, ang GPT 5.6 sol, sa 78%; umabot ang mga Claude model sa 61% at 56%.

Ang sumusunod ay kung ano ang kahulugan ng mga numero sa bawat antas, kung saan bumabagsak ang mga error at sa aling direksyon, gaano katatag ang score, paano ito ikinukumpara sa mga chatbot na maaaring ginagamit mo sa halip, ano ang bago sa feedback, at paano babasahin ang iyong mismong score sa liwanag ng lahat nito.

Ang ibig sabihin ng “tumpak” dito

Hindi namin sinasabi na ang score ng Prepamigo ay nanghuhula ng resulta ng iyong test. Walang practice tool na kayang ipangako ito. Ang sinusukat namin ay mas makitid at mas tapat: kung may isang essay na independiyenteng na-verify ang score, gaano kadalas gumagawa ang scorer ng score sa parehong level?

Ang CELPIP writing ay iniuulat sa isang scale na umaabot sa 12, at ang mga verified score sa aming reference data ay nahahati sa tatlong band: mahina, ibig sabihin 4 o 5; gitna, ibig sabihin 7 o 8; at malakas, ibig sabihin 10 pataas. Binibilang namin na tama ang scorer kapag ang score nito ay napunta sa loob ng verified band. Ang isang malakas na essay na na-score na 10, 11, o 12 ay tama; kung na-score na 9, isa itong miss, kahit na muntik na.

Katumpakan sa bawat antas

Mahihinang essay: 75%. Siyam sa labindalawa sa loob ng band. Ang lahat ng tatlong miss ay isang antas na masyadong mataas: dalawang essay na na-score na 6 at isang 7. Bawat isa ay maikli at manipis pero maayos, may kaunting pagkakamali, at ang kaayusan ang bumili ng isang puntos na hindi nito napagtrabahuhan sa nilalaman. Ito ang katangi-tanging error ng scorer sa mababang dulo, at mapagbigay ito: sinasabihan ang isang mahinang manunulat na medyo mas mahusay siya kaysa sa totoo, hindi kailanman mas mahina.

Gitnang essay: 100%. Labindalawa sa labindalawa sa loob ng 7 hanggang 8 band, sa lahat ng tatlong takbo. Ito ang antas kung saan naroon ang karamihan sa mga kandidato at ang antas na nagpapasya sa karamihan ng mga target sa immigration, at dito pinakamalakas ang scorer. Dito rin pinakamahina ang bawat chatbot na sinubok namin, sa mga dahilang ipinaliliwanag ng seksyon ng paghahambing.

Malalakas na essay: 83%. Sampu sa labindalawa. Parehong miss ay 9, isang antas sa ilalim. Ang isang malakas na CELPIP essay ay hindi walang kapintasan, at paminsan-minsan ay nababasa ng scorer ang isang pagkakamaling sobra. Wala sa mga miss ang 7 o 8; ang isang malakas na essay ay hindi kailanman sinasabihan na karaniwan lang ito.

Ayon sa task, tama ang scorer sa 89% ng mga email response at 83% ng mga survey response. Mas mahirap ilagay ang mga survey response dahil ginagantimpalaan ng task ang isang malinaw na posisyon at mga nabuong dahilan, at ang isang sagot na nag-aalinlangan sa pagitan ng mga opsyon ay pinaparusahan ayon sa panuntunan.

Saang direksyon napupunta ang mga error

Ang isang grader na mali 14% ng oras ay maaaring magkamali sa paraang hindi nakakasama o sa paraang nakakasama. Nakakasama ang pagsasabi sa isang kandidatong kailangan ng 8 na nakuha na niya ito kahit hindi pa. Hindi nakakasama ang pagsasabi sa kanya na kulang siya ng isang puntos kahit hindi naman; isang linggo ng practice ang gastos niyon at wala nang iba.

Sa limang miss ng scorer sa 36 essay, tatlo ay mahihinang essay na na-score na 6 o 7 at dalawa ay malalakas na essay na na-score na 9. Walang gitnang-antas na essay na na-score na mataas, at walang mahinang essay na na-score na malakas. Sa praktikal na salita: kung sinasabi ng scorer na naabot mo na ang gitnang antas, naabot mo na, o kulang ka ng isang puntos. Kung sinasabi nitong naabot mo na ang malakas na antas, naabot mo na. Ang tanging lugar na pumupuri ito nang sobra ay sa ibaba, kung saan ang isang maikli at maayos na essay ay maaaring makakuha ng isang puntos na hindi nito napagtrabahuhan.

Ikumpara iyon sa mga chatbot sa parehong mga essay. Tinawag ng Claude Opus 5 na 9 o 10 ang pitong gitnang-antas na essay, na siyang nakakasamang direksyon para sa mga kandidatong pinakaapektado nito. Tinawag ng GPT 5.6 sol na 6 ang tatlong gitnang-antas na essay, na siyang hindi nakakasamang direksyon, at pinigil sa 9 ang tatlong malalakas na essay. Sinasabi sa iyo ng numero ng katumpakan ng isang grader kung gaano kadalas ito mali; sinasabi sa iyo ng direksyon kung ano ang magagastos nito sa iyo kapag mali ito.

Email laban sa survey

Hinati ang 36 essay sa pagitan ng dalawang writing task, at bahagyang mas mahusay ang scorer sa email task, sa 89%, kaysa sa survey response, sa 83%. Iyan ay isang dagdag na miss sa panig ng survey, at nasa direksyong inaasahan mo.

Ang mga email response ay na-iscore nang malaki ayon sa coverage: natugunan ba ang mga kinakailangang punto, tama ba ang tono para sa mambabasa, may pagbati at pangwakas ba. Iyon ang mga bagay na sinusuri ng scorer ayon sa panuntunan bago gawin ang anumang paghusga, kaya ang isang email na mayroon ng mga ito ay nailalagay nang maaasahan. Ang mga survey response ay na-iscore ayon sa kalidad ng isang argumento: isang malinaw na posisyon at mga dahilang binuo sa halip na inilista lamang. Ang pagbuo ay isang paghusga, at ang paghusga ang lugar kung saan ang isang grader, tao man o hindi, ay may puwang na magkaiba ng isang puntos.

Para sa iyo, ibig sabihin nito na ang isang survey score ay bahagyang mas malambot kaysa sa isang email score. Kung nasa gilid ka ng iyong target sa mga survey response, sumulat ng dalawa sa halip na isa bago mo pagpasyahan kung nasaan ka.

Mula sa iyong panig ng screen

Sinasabi sa iyo ng level view kung paano gumagawa ang scorer sa isang essay na alam ang antas. Ang tinitingnan mo ay sa kabaligtaran: may score ka at nais mong malaman kung gaano ito paniwalaan.

  • Kung sinasabi nitong 4 o 5: ang essay ay nasa mahinang antas siyam na beses sa siyam. Tama ang isang mababang score mula sa scorer.
  • Kung sinasabi nitong 7 o 8: ang essay ay nasa gitnang antas labindalawang beses sa labinlima; ang tatlong iba pa ay mahihinang essay na na-score na isang antas na mataas. Ang 7 o 8 ay nangangahulugang gitna, at posibleng medyo mas mababa.
  • Kung sinasabi nitong 10 pataas: ang essay ay nasa malakas na antas sampung beses sa sampu. Ang 10 mula sa scorer ay isang 10.
  • Kung sinasabi nitong 9: pareho sa mga 9 sa pagsubok ay mga verified na malakas na essay. Ang 9 ang score na dapat basahing mabuti: ibig sabihin nito ay malapit na sa itaas, at isang nabuong dahilan o isang tumpak na pagpili ng salita ang kulang.
Kung nakakuha ka ng 9 sa isang essay na akala mo napakahusay, huwag mong tapusin na tumigil ka na sa pag-unlad. Buksan ang model answer katabi ng iyong essay, hanapin ang isang lugar kung saan binuo nito ang isang dahilan na sinabi mo lamang, isulat muli, at i-score ulit.

Nakukuha ba ng parehong essay ang parehong score?

Ang katumpakan na walang consistency ay swerte lamang. Kaya na-score namin ang lahat ng 36 essay nang tatlong beses sa magkaibang araw na walang binago sa pagitan. Nagbalik ang scorer ng 86%, 89%, at 86%. Ang parehong labindalawang gitnang-antas na essay ay nasa loob ng band sa bawat pagkakataon, at walang essay na kumilos ng higit sa isang puntos sa pagitan ng mga takbo.

Nagmumula ang consistency sa kung paano pinapatakbo ang scoring model: naka-off ang reasoning, isang fixed temperature, at isang paghahambing laban sa mga fixed na na-grade na sample sa halip na isang malayang paghusga. Para sa iyo, ibig sabihin nito na ang isang pagbabago sa iyong score ay isang pagbabago sa iyong pagsulat. Kung isusulat mo muli ang isang essay at gumalaw ito mula 8 patungong 10, hindi iyon ang grader na may magandang araw.

Paano ito ikinukumpara sa maaari mong gamitin sa halip

Ang isang numero ng katumpakan ay may mas malaking kahulugan kapag may ikukumpara. Kaya ibinigay namin ang parehong 36 essay sa mga chatbot na talagang ginagamit ng mga tao upang suriin ang kanilang pagsulat, sa paraang gagawin ng isang tao: ang task, ang essay, at isang payak na kahilingan ng score mula 0 hanggang 12.

Bahagi ng mga essay na na-score sa loob ng verified level

Parehong 36 opisyal na essay. Ang bawat model ay hiniling, sa payak na salita, na i-score ang essay; tumakbo ang Prepamigo sa normal nitong production configuration.

86%

Prepamigo Writing Scorer

78%

GPT 5.6 sol

69%

GPT 5.6 luna

61%

Gemini

61%

Claude Opus 5

58%

GPT-4o mini

56%

Claude Sonnet 5

Nangunguna ang scorer sa pinakamahusay na chatbot nang walong puntos at sa mga Claude model nang 25 hanggang 30. Ang hugis ng mga error ang mahalaga. Sa mga gitnang-antas na essay, nasa 100% ang Prepamigo, ang GPT 5.6 sol sa 75%, ang Gemini sa 42%, ang Claude Sonnet 5 sa 33%, at ang Claude Opus 5 sa 25%: ang isang chatbot na walang ikukumpara ay binabasa ang isang malinis, generic na 7 bilang 9, o ang isang generic na 7 na may ilang pagkakamali bilang 6. Sa malalakas na essay, ang Claude Opus 5 ang talagang pinakamahusay na grader sa pagsubok sa 92% laban sa 83% ng Prepamigo; mapagbigay ito, na tama sa itaas at mali sa lahat ng iba pa. Nagbigay ng 9 ang GPT-4o mini sa siyam sa labindalawang malakas na essay.

Ang mayroon ang scorer na wala sa mga chatbot ay mga totoong na-grade na essay para sa parehong task sa bawat antas na maikukumpara, at isang rule layer na sumusuri sa mga kinakailangang punto, paninindigan sa survey, pagbati at pangwakas, at haba bago magbigay ng opinyon ang anumang model. Iyan ang pagkakaiba sa pagitan ng 86% at 78%, at halos lahat ito ay nasa gitna ng scale.

Ano ang bago sa iyong writing feedback

Ang score ay kalahati lamang ng natatanggap mo. Itinayong muli ang writing feedback layer kasabay ng scorer, at lahat ng nasa loob nito ay nakaangkla sa sarili mong teksto. Ito ang mga pagbabago.

  • Mga pagwawasto na mahahanap mo sa sarili mong essay. Bawat pagwawasto sa grammar, spelling at bokabularyo ay nagsisipi ng eksaktong mga salita mula sa iyong sagot, kaya kayang i-highlight ng app ang mga ito kung saan mo isinulat. Anumang hindi mahanap ng checker nang salita por salita sa iyong essay ay tinatanggal bago mo ito makita.
  • Isang model answer, na binuo mula sa sagot mo. Makakatanggap ka ng muling isinulat na bersyon ng sarili mong sagot na nagpapanatili ng iyong mga ideya, sumasakop sa bawat kinakailangang punto, at umaabot sa 150 hanggang 200 salita na hinihingi ng task. Kung hindi maabot ng unang rewrite ang habang iyon, ginagawa itong muli nang isang beses bago ipakita.
  • Ang kinakailangang puntong hindi mo natugunan, na pinangalanan. Para sa email task, inililista ng feedback ang mga bullet point mula sa prompt na hindi nasakop ng iyong sagot. Ang isang napalampas na punto ay nagpapanatili rin ng task-fulfillment score sa 8 o mas mababa, kaya hindi kailanman magkakasalungat ang numero at ang feedback.
  • Isang limiting factor sa bawat dimensyon. Para sa bawat isa sa apat na dimensyon, pinangangalanan ng feedback ang iisang bagay na pumipigil sa score na iyon, sa konkretong salita, o sinasabi nang malinaw na walang pumipigil at kung ano ang bumubuhat dito. Ang pagpapasyang walang problema ang isang dimensyon ay isang totoong sagot, hindi isang puwang.
  • Puna sa tamang lugar. Ang mahinang tono ay problema sa task fulfillment, ang malabong pagpili ng salita ay problema sa bokabularyo, ang run-on sentence ay problema sa readability. Bawat punto ay inilalagay sa ilalim ng dimensyong nagmamay-ari nito sa halip na isama lang sa pangkalahatang buod.
  • Mga rewrite sa antas ng pangungusap. Ang mga tiyak na pangungusap mula sa iyong essay ay ibinabalik na may pinahusay na bersyon at isang linya kung bakit ito mas maganda, para makita mo ang pagbabago sa halip na basahin lang ang tungkol dito.
  • Ang pinakamalakas at pinakamahina mong dimensyon, magkatabi. Sinasabi sa iyo ng feedback kung alin sa apat na dimensyon ang bumubuhat sa iyong score at alin ang pumipigil dito, para malaman mo kung ano ang susunod na sasanayin nang hindi kailangang unawain ang apat na numero.

Bawat sipi sa feedback ay sinusuri laban sa iyong essay bago ito ipakita. Kung hindi mahanap ng checker ang mga salita, tinatanggal ang linya. Kaya hindi kailanman sasabihin sa iyo ng feedback na ayusin ang isang bagay na hindi mo isinulat.

Paano babasahin ang iyong score

  1. Tama ang 4 o 5. Basahin ang mga pagwawasto; sinipi ang mga ito mula sa iyong sariling teksto. Pagkatapos ay basahin ang mga nakaligtaang punto at ang model answer, at isulat muli ang parehong task.
  2. Ang 7 o 8 ay gitna, posibleng medyo mas mababa. Tingnan ang limiting factor para sa bawat dimensyon. Ang isa na nagpapangalan ng isang konkretong problema ang dapat pagbutihin.
  3. Malapit na ang 9. Ikumpara ang iyong essay sa model answer talata por talata. Ang agwat ay karaniwang isang hindi nabuong dahilan o isang generic na pagpili ng salita.
  4. Ang 10 pataas ay isang 10. Handa ka na sa tipo ng task na iyon. Lumipat sa iniiwasan mo.
  5. Mas pagkatiwalaan ang mga pagbabago kaysa sa mga antas. Dahil matatag ang score, ang isang pagbabago sa maraming pagsubok sa parehong task ay isang pagbabago sa iyong pagsulat.

Isang practice routine na gumagamit ng numero

Ang punto ng isang tumpak at matatag na score ay maaari ka nang tumigil sa pagdududa dito at magsimulang gamitin ito. Narito ang routine na iminumungkahi namin, na binuo sa paligid ng kung ano ang sinasabi ng mga numero sa pahinang ito na kaya at hindi kayang sabihin ng score sa iyo.

  1. Sumulat ng isang email at isang survey response, nang walang paghahanda. Huwag munang tingnan ang model answer. Isumite ang pareho. Ang dalawang score na magkasama ang iyong panimulang antas; kung magkaiba sila ng higit sa isang puntos, ang mas mababa ang task na dapat i-practice.
  2. Basahin ang mga nakaligtaang punto at ang limiting factor bago ang mga pagwawasto.Inaayos ng mga pagwawasto ang mga pangungusap; inaayos ng mga nakaligtaang punto at limiting factor ang mga score. Ang isang nawawalang kinakailangang punto ay mas mahalaga kaysa sa bawat kuwit.
  3. Isulat muli ang parehong sagot na bukas ang model answer. Panatilihin ang iyong mga ideya, hiramin ang istruktura nito. Isumite ulit. Dahil binibigyan ng scorer ang parehong essay ng parehong score, ang pagkakaiba sa pagitan ng dalawang pagsusumite ay ganap na ang iyong muling pagsulat.
  4. Lumipat sa bagong task kapag tumibay ang muling pagsulat. Ang isang solong 10 sa isang muling pagsulat ay hindi pa isang antas. Ang dalawang 10 sa dalawang magkaibang task ay oo.
  5. Basahin ang 9 bilang muntik na at ang 6 bilang totoong 6. Hindi hinihila pababa ng scorer ang mga gitnang essay. Kung sinasabi nitong 6, manipis ang essay, at sasabihin ng limiting factor kung saan.

Mga Tanong

Gaano katumpak ang writing score ng Prepamigo? 86% sa eksaktong level sa 36 opisyal na essay: 75% mahina, 100% gitna, 83% malakas. Parehong resulta, pataas o pababa ng isang essay, sa tatlong takbo.

Pareho ba ito sa aking totoong score? Walang practice tool na kayang ipangako ito. Ang sinusukat namin ay kung gaano kadalas sumasang-ayon ang scorer sa isang verified score sa parehong essay.

Bakit ako nakakuha ng 9 sa isang malakas na essay? Iyan ang pinakakaraniwang miss ng scorer sa itaas: dalawa sa labindalawang malakas na essay ay na-score na 9. Isulat muli na katabi ang model answer at i-score ulit.

Mas mahusay ba ito kaysa sa ChatGPT o Claude? 86% laban sa 78% para sa GPT 5.6 sol at 61% at 56% para sa mga Claude model. Sa mga gitnang-antas na essay, 100% laban sa 75% para sa pinakamahusay sa kanila.

Para makita kung paano gumagana ang scorer, basahin ang loob ng writing scorer ng Prepamigo. Para makita ang parehong pagsubok sa lahat ng anim na chatbot, basahin ang aling AI ang pinakatumpak mag-score ng CELPIP writing. O Sumulat ng sagot at makita mismo ang mga numero. Basahin ang gabay na ito sa Ingles.

Tumpak ba ang Writing Scoring ng Prepamigo para sa CELPIP? Ang mga Numero, Nang Tapat | PrepAmigo