Produkto

Prepamigo vs Claude para sa CELPIP Writing: Alin ang Nagbibigay ng Tamang Score?

Setyembre 8, 2026

Bahagi ng mga essay na na-score sa verified level

36 opisyal na CELPIP writing response, 12 sa bawat isa sa tatlong antas, sa parehong writing task. Binigyan ang Claude ng task at ng essay at hiniling, sa payak na salita, na i-score ito sa CELPIP scale. Tumakbo ang writing scorer ng Prepamigo gaya ng ginagawa nito sa production.

86%

Prepamigo Writing Scorer

61%

Claude Opus 5

56%

Claude Sonnet 5

Prepamigo laban sa mga nangungunang chatbot plan

Dolyar Canadian. Kasama na ang buwis sa mga presyo ng Prepamigo. Ang Claude Max (mula sa US$100) at ChatGPT Pro (US$200) ay na-convert sa 1.38, bago buwis. Ang accuracy ay ang bahagi ng 36 opisyal na essay na na-score sa verified level kapag hiniling sa napiling modelo, sa payak na salita, na i-score ang essay; isang takbo.

Prepamigo
Claude MaxOpus 5
Buwanang bayad
CA$24.98 (kasama buwis)
CA$138+ (dagdag buwis)
Pag-score
Walang limitasyon
Limitado
Handang bangko ng tanong
Oo
Hindi
Practice set
80
Wala
Practice task
2,000+
Wala
Format ng CELPIP
Oo
Hindi
Katumpakan
86%
61%
Essay sa gitnang antas
100%
25%

Ang writing ang kasanayan kung saan pinakakapani-paniwala ang isang chatbot bilang grader. Walang recording na kailangang i-transcribe, walang accent na aalalahanin, teksto lang ang pumapasok at numero ang lumalabas, kasama ang isang talata ng kumpiyansang paliwanag. Kaya sinubok namin ang numero. Ibinigay namin sa Claude ang parehong 36 opisyal na CELPIP writing response na pinagsusukatan ng aming sariling scorer, labindalawa sa bawat antas, at hiniling naming i-score ang mga ito sa paraang hihilingin ng isang estudyante.

Ang maikling sagot: natamo ng writing scorer ng Prepamigo ang verified level 86% ng oras. Natamo ito ng Claude Opus 5 61% ng oras at ng Claude Sonnet 5 56% ng oras. Hindi pantay ang pagkakalat ng agwat. Sa mahihina at malalakas na essay, kagalang-galang ang Claude, at sa pinakataas ay talagang mas mahusay ang Opus 5 kaysa sa amin. Sa mga essay sa gitnang antas, ang mga 7 at 8 na talagang isinusulat ng karamihan sa mga kandidato, tama ang Opus 5 isang beses sa apat at ang Sonnet 5 isang beses sa tatlo. Tama ang Prepamigo sa lahat ng labindalawa.

Dadaanan ng natitirang bahagi ng artikulong ito ang mga resultang iyon antas por antas, ipapaliwanag kung bakit nawawala ng isang general-purpose model ang gitna ng scale, titingnan kung ano ang halaga ng feedback sa bawat panig, at ihahambing ang gastos ng seryosong pag-practice ng writing gamit ang bawat isa. Sinikap naming maging patas sa Claude sa buong artikulo, kasama ang iisang lugar kung saan tinalo nito kami.

Ang payak na pagsubok: ang talagang nakukuha ng estudyante

Walumpu’t anim na porsyento laban sa animnapu’t isa at limampu’t anim. Sa 36 essay, iyon ay siyam na dagdag na tamang score kaysa sa Opus 5 at labing-isa na dagdag kaysa sa Sonnet 5. Sa ibang salita, gumagawa ang Prepamigo ng 64% na mas kaunting pagkakamali sa scoring kaysa sa Opus 5 at 69% na mas kaunti kaysa sa Sonnet 5 sa parehong mga essay.

Mahalaga kung ano ang ibinigay sa Claude, kaya narito ito. Sinabihan ang bawat model na ito ay isang may-karanasang CELPIP writing examiner, ibinigay ang task nang eksakto gaya ng nakita ng kandidato, kasama ang mga kinakailangang punto para sa email task at ang mga opsyon para sa survey task, at ibinigay ang essay. Hiniling dito ang isang score mula 0 hanggang 12. Iyon ang buong prompt. Ito ang ita-type mo sa isang chat window, at mas patas itong pagsubok kaysa sa isang-linyang “i-grade mo ito” dahil alam man lang ng model kung ano ang hinihingi ng task.

Tumanggap ang scorer ng Prepamigo ng parehong task at parehong essay. Mayroon din itong palagi nitong taglay sa production: mga totoong graded sample essay para sa task na iyon sa bawat antas na ikukumpara, at isang rule layer na sinusuri ang mga bagay na unang sinusuri ng isang rater, tulad ng kung naroon ba ang bawat kinakailangang punto, kung talagang pumipili ng panig ang isang survey response, kung may pagbati at pagtatapos ang isang email, at kung gaano kahaba ang sagot.

Kung saan bumubukas ang agwat: antas por antas

Itinatago ng pangkalahatang numero kung saan bumabagsak ang mga pagkakamali, at sa writing, bumabagsak ang mga pagkakamali sa iisang lugar. Narito ang parehong mga resulta na hinati ayon sa verified level: mahihinang essay na na-score ng 4 o 5, gitnang essay na na-score ng 7 o 8, at malalakas na essay na na-score ng 10 pataas.

Mahihinang essay (verified score 4 o 5)

12 opisyal na essay. Ang mga miss ng Claude dito ay karamihan ay 3, isang antas sa ibaba.

75%

Prepamigo Writing Scorer

67%

Claude Opus 5

50%

Claude Sonnet 5

Sa mahihinang essay, nasa 75% ang Prepamigo, ang Opus 5 sa 67%, ang Sonnet 5 sa 50%. Ang tatlong miss ng Prepamigo ay lahat umakyat ng isang baitang na mas mataas, sa 6 o 7, sa mga essay na maikli pero maayos. Ang mga miss ng Claude ay sa kabilang direksyon: binigyan ng Sonnet 5 ng 3 ang apat sa labindalawang mahihinang essay, at binigyan ng Opus 5 ng 3 ang dalawa sa mga ito. Ang 3 sa scale na ito ay isang sagot na halos hindi tumutugon sa task. Tumutugon dito ang mga essay na ito; manipis lang sila. Ang Claude, na walang halimbawa kung ano ang hitsura ng isang 4, ay binabasa ang manipis bilang bagsak.

Gitnang essay (verified score 7 o 8)

12 opisyal na essay. Ito ang antas kung nasaan ang karamihan sa mga kandidato, at ang antas kung saan bumabagsak ang Claude.

100%

Prepamigo Writing Scorer

33%

Claude Sonnet 5

25%

Claude Opus 5

Ang gitna ang buong kuwento. Na-score ng Prepamigo ang lahat ng labindalawang essay sa gitnang antas sa loob ng 7 hanggang 8 na banda. Natamaan ng Opus 5 ang tatlo sa mga ito; natamaan ng Sonnet 5 ang apat. Ang mga miss ng Opus 5 ay halos lahat pataas: binigyan nito ng 9 ang anim sa labindalawa at ng 10 ang isa. Nahati ang Sonnet 5 sa dalawang direksyon, may apat na essay na itinulak pababa sa 6 at apat na itinulak pataas sa 9 o 10.

Isipin mo kung ano ang kahulugan nito para sa kandidatong sumulat ng isa sa mga essay na iyon. Ang 7 o 8 ang pinakakaraniwang totoong score sa test, at ito ang score na nagpapasya kung naabot mo na ang iyong immigration target o hindi. Tanungin mo ang Opus 5, at higit sa kalahati ng oras sasabihin nito sa iyo na ikaw ay 9 o 10, handa nang tumigil sa pag-practice. Hindi pa. Tanungin mo ang Sonnet 5, at isang beses sa tatlo sasabihin nito sa iyo na bumaba ka sa 6. Hindi naman. Walang isa sa dalawang sagot ang tumutulong sa iyo na magpasya kung ano ang susunod na gagawin.

Malalakas na essay (verified score 10 pataas)

12 opisyal na essay. Ang iisang antas kung saan tinatalo ng Claude Opus 5 ang Prepamigo.

92%

Claude Opus 5

83%

Prepamigo Writing Scorer

83%

Claude Sonnet 5

Sa pinakataas, ang Opus 5 ang pinakamahusay na grader sa pagsubok na ito: labing-isa sa labindalawang malalakas na essay ang nakilala. Ang Prepamigo at ang Sonnet 5 ay bawat isa nakakilala ng sampu. Ang dalawang miss ng Prepamigo ay parehong 9, isang baitang sa ibaba; ang sa Sonnet 5 ay 9 at 7. Iniuulat namin ito dahil totoo ito, at dahil ipinapaliwanag nito ang pangkalahatang pattern: mapagbigay ang Claude. Malaya itong namimigay ng 9, 10 at 11, na nagkakataong tama sa malalakas na essay at mali sa lahat ng iba pa.

Kung gagamit ka ng Claude sa pag-grade ng iyong writing at binigyan ka nito ng 9, ituring mo itong score sa gitnang antas hangga’t walang ibang nagkukumpirma nito. Sa aming pagsubok, ang isang essay na binigyan ng Opus 5 ng 9 ay mas malamang na verified 7 o 8 kaysa sa verified 9 o 10.

Bakit nawawala ng chatbot ang gitna ng scale

Ang isang CELPIP essay sa gitnang antas ay isang tiyak na bagay. Sinasakop nito ang task, maayos ito, kakaunti ang mga error na humaharang sa pag-unawa, at generic din ito: ang mga dahilan ay ipinapahayag lang sa halip na pinalalawig, ligtas ang bokabularyo, iisa ang hugis ng lahat ng pangungusap. Ang isang rater na nakakita na ng daan-daan sa mga ito ay alam na alam kung saan ito nakalagay. Ang isang general-purpose model ay hindi pa nakakita ng daan-daan sa mga ito na may label na 7. Nakakita ito ng isang malinis, maayos, at halos tamang piraso ng sulatin, at inaabot nito ang isang mataas na numero.

Iyon ang buong pagkakaiba. Hindi hinuhusgahan ng scorer ng Prepamigo ang isang essay laban sa isang ideya ng magandang pagsulat. Hinuhusgahan nito ito laban sa mga totoong graded essay para sa parehong task: isa sa mahinang antas, isa sa gitna, isa sa pinakataas, lahat ay totoong sagot na may totoong mga pagkakamali. Ang isang malinis pero generic na essay ay lumalapag sa tabi ng gitnang sample dahil iyon ang pinakakahawig nito. Ang isang manipis na essay ay lumalapag sa tabi ng mahinang sample sa halip na sa ibaba nito, dahil manipis din ang mahinang sample at 4 pa rin ito.

Sa ibabaw ng paghahambing ay nakalagay ang isang rule layer na humahawak sa mga bagay na hindi magaling bilangin ng isang model. Nasakop ba ng email ang lahat ng tatlong kinakailangang punto, o dalawa lang? Talaga bang pumili ng opsyon ang survey response, o nag-alangan sa pagitan ng mga ito? May pagbati ba at pagtatapos? 180 salita ba ang sagot o 60? Ang isang napalampas na kinakailangang punto ay nagpapanatili ng task-fulfillment score sa 8 o mas mababa gaano man kaganda ang Ingles, dahil ganoon gumagana ang test. Ang Claude, kapag hiniling nang payak, ay walang ganoong sahig o kisame; pinagpapasyahan nito ang lahat ayon sa impresyon.

Sinubok namin kung maaayos ito ng pagsasabi sa Claude tungkol sa mga antas. Hindi, kung ito lang. Ang pagbibigay ng rubric sa isang model ay nagbubunga ng parehong paglihis. Ang nagpapagalaw sa numero ay ang pagbibigay dito ng mga aktwal na graded sample at isang rule layer, na isa pang paraan ng pagsasabi: pagbuo ng isang scorer.

Ang agwat sa workflow: kung ano ang kailangan mong dalhin

Ang writing ang kasanayan kung saan pinakamadaling gamitin ang Claude bilang grader, at sulit na maging tapat tungkol dito. Idinikit mo ang essay, makakakuha ka ng score sa ilang segundo, at kung gusto mong ipaliwanag nito ang sarili, gagawin nito, nang mahaba. Walang hakbang ng transcription, walang audio, walang setup. Para sa isang mabilis na pangalawang opinyon, talagang maginhawa ito.

Ang hindi mo nakukuha ay ang task. Walang bangko ang Claude ng mga CELPIP-style email at survey prompt na may tamang kinakailangang punto, opsyon at bilang ng salita, kaya sumusulat ka ng sarili mong prompt at umaasang kahawig ito ng test, o nagpapractice ka sa kung ano man ang mahanap mo. Hindi ka nakakakuha ng required-point check, dahil hindi alam ng Claude kung aling mga punto ang ililista ng totoong test. Hindi ka nakakakuha ng model answer na muling isinulat mula sa sarili mong essay sa tamang haba. At hindi ka nakakakuha ng numero na na-calibrate laban sa mga totoong graded essay, at iyon ang dahilan kung bakit nagkakamali ang gitna ng scale.

Sa Prepamigo, magbubukas ka ng task mula sa bangko, tumatakbo ang timer, sumusulat ka, at mga isang minuto pagkatapos mong mag-submit, mayroon ka nang apat na dimension score, isang overall score, listahan ng anumang napalampas mo, mga pagwawasto na sinipi mula sa sarili mong teksto, at isang muling isinulat na model answer. Ang ikaapatnapung essay ng buwan ay may parehong pagsisikap gaya ng una.

Ang parehong essay, ang parehong score

Ang isang score na hindi mo maulit ay hindi isang sukat. Kung ang parehong essay ay makakakuha ng 8 ngayon at 10 bukas, wala kang natutunan tungkol sa iyong pagsulat. Kaya pagkatapos ng pangunahing takbo, na-score namin ang lahat ng 36 essay ng dalawa pang beses sa magkaibang araw. Nakakuha ang writing scorer ng Prepamigo ng 86%, 89% at 86% sa tatlong takbo, na ang parehong labindalawang essay sa gitnang antas ay nasa loob ng banda sa bawat pagkakataon.

Gumalaw din ang mga takbo ng Claude, pero hindi nagbago ang hugis ng mga pagkakamali nito: sa bawat takbo, karamihan sa mga essay sa gitnang antas ay bumalik bilang 9 mula sa Opus 5, at patuloy na nakakakuha ng 3 ang mahihinang essay mula sa Sonnet 5. Ang consistency na iyon ang kapaki-pakinabang na natuklasan. Ang problema ay hindi na maingay ang Claude. Ang problema ay kumpiyansang mis-calibrated ang Claude sa parehong direksyon sa bawat pagkakataon, na mas mahirap mapansin.

Feedback: magandang paliwanag ng maling numero

Napakahusay ng Claude sumulat ng feedback. Malinaw ito, matiyaga, at tiyak, at kung hihilingin mong ipaliwanag kung bakit 9 ang isang essay, gagawa ito ng nakakakumbinsing talata. Ang problema ay isinulat ang talata upang bigyang-katwiran ang isang numero na napili na nito, at kapag mali ang numero, mali rin ang paliwanag kasama nito. Ang isang essay na talagang 7 ay pinupuri para sa mga katangiang wala ito, at umaalis ang kandidato na napanatag.

Gumagana ang feedback ng Prepamigo mula sa kabilang dulo. Bawat pagwawasto ay nagsisipi ng eksaktong mga salita mula sa iyong essay, at anumang hindi mahanap ng checker sa iyong teksto ay tinatanggal bago mo ito makita. Ang isang napalampas na kinakailangang punto ay pinangangalanan. Bawat dimensyon ay nakakakuha ng isang limiting factor, o isang malinaw na pahayag na walang pumipigil dito. At nakakakuha ka ng model answer na muling isinulat mula sa sarili mong sagot sa habang hinihingi ng task, para makita mo ang agwat sa halip na basahin lang ang tungkol dito. Inililista ng seksyon sa ibaba kung ano ang nagbago sa feedback layer.

Ano ang bago sa iyong writing feedback

Ang score ay kalahati lamang ng natatanggap mo. Itinayong muli ang writing feedback layer kasabay ng scorer, at lahat ng nasa loob nito ay nakaangkla sa sarili mong teksto. Ito ang mga pagbabago.

  • Mga pagwawasto na mahahanap mo sa sarili mong essay. Bawat pagwawasto sa grammar, spelling at bokabularyo ay nagsisipi ng eksaktong mga salita mula sa iyong sagot, kaya kayang i-highlight ng app ang mga ito kung saan mo isinulat. Anumang hindi mahanap ng checker nang salita por salita sa iyong essay ay tinatanggal bago mo ito makita.
  • Isang model answer, na binuo mula sa sagot mo. Makakatanggap ka ng muling isinulat na bersyon ng sarili mong sagot na nagpapanatili ng iyong mga ideya, sumasakop sa bawat kinakailangang punto, at umaabot sa 150 hanggang 200 salita na hinihingi ng task. Kung hindi maabot ng unang rewrite ang habang iyon, ginagawa itong muli nang isang beses bago ipakita.
  • Ang kinakailangang puntong hindi mo natugunan, na pinangalanan. Para sa email task, inililista ng feedback ang mga bullet point mula sa prompt na hindi nasakop ng iyong sagot. Ang isang napalampas na punto ay nagpapanatili rin ng task-fulfillment score sa 8 o mas mababa, kaya hindi kailanman magkakasalungat ang numero at ang feedback.
  • Isang limiting factor sa bawat dimensyon. Para sa bawat isa sa apat na dimensyon, pinangangalanan ng feedback ang iisang bagay na pumipigil sa score na iyon, sa konkretong salita, o sinasabi nang malinaw na walang pumipigil at kung ano ang bumubuhat dito. Ang pagpapasyang walang problema ang isang dimensyon ay isang totoong sagot, hindi isang puwang.
  • Puna sa tamang lugar. Ang mahinang tono ay problema sa task fulfillment, ang malabong pagpili ng salita ay problema sa bokabularyo, ang run-on sentence ay problema sa readability. Bawat punto ay inilalagay sa ilalim ng dimensyong nagmamay-ari nito sa halip na isama lang sa pangkalahatang buod.
  • Mga rewrite sa antas ng pangungusap. Ang mga tiyak na pangungusap mula sa iyong essay ay ibinabalik na may pinahusay na bersyon at isang linya kung bakit ito mas maganda, para makita mo ang pagbabago sa halip na basahin lang ang tungkol dito.
  • Ang pinakamalakas at pinakamahina mong dimensyon, magkatabi. Sinasabi sa iyo ng feedback kung alin sa apat na dimensyon ang bumubuhat sa iyong score at alin ang pumipigil dito, para malaman mo kung ano ang susunod na sasanayin nang hindi kailangang unawain ang apat na numero.

Bawat sipi sa feedback ay sinusuri laban sa iyong essay bago ito ipakita. Kung hindi mahanap ng checker ang mga salita, tinatanggal ang linya. Kaya hindi kailanman sasabihin sa iyo ng feedback na ayusin ang isang bagay na hindi mo isinulat.

Ang gastos sa pagpractice araw-araw

Ang isang writing score ay pinakakapaki-pakinabang sa iyong ikatatlumpung essay, hindi sa ikatlo. Iyon ang oras na nagsisimula itong magsabi kung gumagana ba ang isang pagbabago sa paraan ng iyong pagsulat. Kaya ang praktikal na tanong ay kung magkano ang gastos gamitin ang bawat opsyon nang bulto.

Ang Claude Pro ay US$20 kada buwan, humigit-kumulang CA$28, o US$17 kada buwan sa annual billing, gaya ng nailathala sa claude.com noong Setyembre 2026, may rolling five-hour usage window at weekly limit. Ang mga Max plan, mula US$100 kada buwan, humigit-kumulang CA$138 bago buwis, ay nagtataas ng mga limitasyong iyon pero hindi ito inaalis. Wala sa mga plan na may bangko ng task, timer, required-point check, model answer, o score na na-calibrate laban sa mga totoong graded essay.

Ang Prepamigo ay CA$24.98 kada buwan, o CA$8.25 kada buwan sa annual plan, na CA$98.98 para sa taon, kasama na ang buwis, at maaari mong kanselahin anumang oras. Ang bawat plan ay may walang limitasyong pag-score na walang araw-araw, session, o weekly cap, walang limitasyong pagsubok, at ang buong bangko ng tanong: 80 kumpletong practice set at mahigit 2,000 practice task sa Writing, Speaking, Reading, at Listening, na sinulat upang sundin ang tipo ng task, timing, at format ng CELPIP General test.

Kailan mas mainam ang Claude

  • Pagpapakinis ng isang malakas na essay. Kung nasa 10 ka na at gusto mong malaman kung ano ang kakailanganin ng 11 o 12, maaasahang nakikilala ng Opus 5 ang malakas na pagsulat at mahusay itong magpaliwanag. Iyon ang iisang antas kung saan tinalo nito kami.
  • Pagsulat muli ng isang pangungusap sa limang paraan. Ang paghingi ng mga alternatibo sa isang magaspang na pangungusap ay mabilis at maganda ang mga suhestiyon.
  • Pag-usapan ito. Kung gusto mong makipagtalo kung bakit mahina ang isang dahilan, angkop ang isang pag-uusap. Nagbibigay ang Prepamigo ng verdict at ebidensya; hindi ito nakikipag-chat.
  • Anumang bagay na wala sa test. Ang Claude ay isang general assistant at hindi ang Prepamigo.

Ang hindi dapat maging papel ng Claude, sa ebidensyang ito, ay ang bagay na nagsasabi sa isang 7 o 8 na manunulat kung nasaan siya. Iyon ang karamihan sa mga kandidato, at doon mismo mali ang Claude tatlong beses sa apat.

Mga Tanong

Kaya bang i-score ng Claude ang aking CELPIP writing? Bibigyan ka nito ng numero. Sa 36 opisyal na sagot na may verified score, tama ang Claude Opus 5 61% ng oras at ang Claude Sonnet 5 56%, kumpara sa 86% para sa Prepamigo. Sa mga essay sa gitnang antas: 25% at 33% kumpara sa 100%.

Mas tumpak ba ang Prepamigo kaysa sa Claude sa writing? Sa kabuuan, oo, ng 25 hanggang 30 puntos. Sa malalakas na essay mas mahusay ang Opus 5, 92% kumpara sa 83%. Sa mga essay sa gitnang antas, kung nasaan ang karamihan sa mga kandidato, ang agwat ay 100% kumpara sa 25%.

Bakit binibigyan ng Claude ang aking karaniwang essay ng 9? Kapag walang ikukumpara, ang isang malinis, maayos, at generic na essay ay mababasa bilang malakas. Binigyan ng Opus 5 ng 9 o 10 ang pito sa labindalawang essay na verified 7 hanggang 8. Inihahambing ng Prepamigo ang bawat essay sa mga totoong graded sample para sa parehong task.

Magkano ang gastos ng bawat isa? Ang Claude Max ay nagsisimula sa US$100 kada buwan, humigit-kumulang CA$138 bago buwis; ang Pro ay US$20 na may mas mahigpit na cap. Ang Prepamigo ay CA$24.98 kada buwan kasama na ang buwis, o CA$8.25 kada buwan sa annual plan, may walang limitasyong pag-score at 80 practice set.

Para sa parehong paghahambing laban sa ChatGPT, basahin ang Prepamigo vs ChatGPT para sa writing. Para makita kung paano gumagana ang writing scorer, basahin ang loob ng writing scorer ng Prepamigo. O Sumulat ng sagot at tingnan ang score. Basahin ang gabay na ito sa Ingles.

Prepamigo vs Claude para sa CELPIP Writing: Alin ang Nagbibigay ng Tamang Score? | PrepAmigo