Bahagi ng mga essay na na-score sa verified level
36 opisyal na CELPIP writing response, 12 kada antas, parehong writing task. Ang bawat model ay binigyan ng task at ng essay at hiniling, sa payak na salita, na i-score ito sa CELPIP scale. Tumakbo ang writing scorer ng Prepamigo sa normal nitong production configuration.
86%
Prepamigo Writing Scorer
78%
GPT 5.6 sol
69%
GPT 5.6 luna
61%
Gemini
61%
Claude Opus 5
58%
GPT-4o mini
56%
Claude Sonnet 5
Prepamigo laban sa mga nangungunang chatbot plan
Dolyar Canadian. Kasama na ang buwis sa mga presyo ng Prepamigo. Ang Claude Max (mula sa US$100) at ChatGPT Pro (US$200) ay na-convert sa 1.38, bago buwis. Ang accuracy ay ang bahagi ng 36 opisyal na essay na na-score sa verified level kapag hiniling sa napiling modelo, sa payak na salita, na i-score ang essay; isang takbo.
Maraming kandidato sa CELPIP ang sumusuri ng kanilang pagsulat gamit ang isang AI chatbot. Idikit ang email, humingi ng score, basahin ang talata. Para sa writing, madali ito: walang recording, walang transcript. Ang hindi sinasabi sa iyo ng sinuman ay kung gaano kadalas tama ang numero, o aling model ang pagkakatiwalaan, o aling mga pagkakamali ang ginagawa ng bawat isa. Gusto naming malaman, kaya ibinigay namin sa anim na chatbot at sa aming sariling scorer ang parehong 36 opisyal na essay na may verified score at nagbilang.
Ang bersyon sa isang pangungusap: ang GPT 5.6 sol ang pinakatumpak na chatbot para sa CELPIP writing sa 78%, ang mga Claude model ang pinakahindi tumpak sa 61% at 56% dahil pinapalaki nila ang mga gitnang-antas na essay, at ang isang purpose-built na scorer, ang sa Prepamigo, ay umabot sa 86% sa parehong mga essay at nakuha nang tama ang bawat gitnang-antas na essay. Dapat naming sabihin nang hayagan na ang Prepamigo ay aming produkto. Kung saan tinalo kami ng isang chatbot sa isang partikular na antas, sinasabi namin ito; dalawa sa kanila ang gumawa nito.
Ang leaderboard
Tatlong tier ang nakikita sa chart sa itaas. Nag-iisa ang Prepamigo sa 86%. Ang GPT 5.6 sol sa 78% at ang GPT 5.6 luna sa 69% ay bumubuo ng ikalawang tier: magagamit, na may kilalang mga ugali. Ang lahat ng iba pa ay nasa 60% o malapit dito, na para sa isang three-band scale ay hindi gaanong mas mahusay kaysa sa isang may-kaalamang hula.
Iba ang pattern sa speaking, kung saan mahusay ang mga Claude model at mahina ang mga GPT model. Sa writing, baligtad ito. Bahagyang mahigpit ang mga GPT model: hinihila nila ang isang generic na 7 pababa sa 6 at pinipigil ang isang malakas na essay na may isang pagkakamali sa 9. Mapagbigay ang mga Claude model: itinutulak nila ang isang generic na 7 pataas sa 9 o 10 at nag-iscore ng 3 sa mga manipis na mahinang essay. Kumikilos ang Gemini na parang Claude sa gitna. Itinuturing ng GPT-4o mini ang 9 bilang kisame.
Mga resulta sa bawat antas
Mahihinang essay (verified na 4 o 5)
12 opisyal na essay kada sistema.
83%
GPT 5.6 sol
83%
GPT 5.6 luna
83%
GPT-4o mini
75%
Prepamigo Writing Scorer
67%
Claude Opus 5
58%
Gemini
50%
Claude Sonnet 5
Ang mahihinang essay ang madaling dulo ng scale, at magkatabla ang tatlong GPT model sa 83%, nangunguna sa Prepamigo sa 75%. Ang tatlong miss ng Prepamigo ay pawang isang antas na mataas, sa 6 o 7, sa maikli pero maayos na mga essay. Nagkakamali ang mga Claude model sa kabilang direksyon: nag-iscore ang Sonnet 5 ng 3 sa apat sa labindalawang mahinang essay, isang antas sa ibaba, at nag-iscore ang Opus 5 ng 3 sa dalawa sa kanila. Ang isang manipis na essay na ginagawa pa rin ang task ay 4, hindi 3, at ang isang model na walang halimbawa ng 4 ay hindi makakakita ng pagkakaiba.
Gitnang essay (verified na 7 o 8)
12 opisyal na essay kada sistema. Ang antas kung saan naroon ang karamihan sa mga kandidato.
100%
Prepamigo Writing Scorer
75%
GPT 5.6 sol
67%
GPT-4o mini
58%
GPT 5.6 luna
42%
Gemini
33%
Claude Sonnet 5
25%
Claude Opus 5
Ang gitnang band ang naghihiwalay sa mga kalahok. Nakuha ng Prepamigo ang lahat ng labindalawa. Nakuha ng GPT 5.6 sol ang siyam, na hinila ang tatlo pababa sa 6. Nakuha ng GPT-4o mini ang walo at itinulak ang apat pataas sa 9. Nakuha ng luna ang pito, kadalasang hinihila pababa. Nakuha ng Gemini ang lima at itinulak ang anim pataas sa 9 o 10. Nakuha ng Claude Sonnet 5 ang apat, hati sa pagitan ng mga 6 at 9. Nakuha ng Claude Opus 5 ang tatlo at nagbigay ng 9 o 10 sa pito sa labindalawa.
Kung ikaw ay isang 7 o 8 na manunulat, at ganoon ang karamihan sa mga kandidato, ito ang chart na dapat tandaan. Tanungin ang Claude Opus 5 at higit sa kalahati ng oras ay sasabihin nito sa iyo na tapos ka na. Tanungin ang Gemini at kalahati ng oras ay ganoon din ang sasabihin nito. Tanungin ang GPT 5.6 sol at isang beses sa apat ay sasabihin nito sa iyo na bumagsak ka sa 6.
Malalakas na essay (verified na 10 pataas)
12 opisyal na essay kada sistema. Halos bawat miss ay 9.
92%
Claude Opus 5
83%
Prepamigo Writing Scorer
83%
Gemini
83%
Claude Sonnet 5
75%
GPT 5.6 sol
67%
GPT 5.6 luna
25%
GPT-4o mini
Sa itaas, ang Claude Opus 5 ang pinakamahusay na grader sa pagsubok na may labing-isa sa labindalawang malakas na essay na nakilala; binigyan nito ng 11 ang lima sa kanila. Nakilala ng Prepamigo, Gemini, at Sonnet 5 ang tig-sampu. Nakilala ng GPT 5.6 sol ang siyam at ng luna ang walo, na pinigil ang iba sa 9. Nakilala ng GPT-4o mini ang tatlo at nagbigay ng 9 sa siyam: hindi ito namimigay ng 10. Ang kabutihang-loob ng Claude ay tama dito at mali sa lahat ng iba pa; ang kahigpitan ng mga GPT model ay mali dito at halos tama sa iba.
Bakit hindi nagkakasundo ang mga model tungkol sa gitna
Ang isang gitnang-antas na CELPIP essay ay isang tiyak na bagay: sumasakop ito sa task, organisado ito, may kaunting pagkakamali na humahadlang sa pag-unawa, at generic ito, na ang mga dahilan ay sinabi lamang sa halip na binuo at ang vocabulary ay ligtas sa halip na tumpak. Ang isang sanay na rater ay nakakita na ng daan-daan sa mga ito at alam kung saan sila nakalagay. Ang isang general-purpose na model ay nakakita ng isang maayos, organisado, at halos tamang piraso ng pagsulat at kailangang magpasya mula sa impresyon. Ang impresyon ng Claude ay malakas ang maayos. Ang impresyon ng GPT ay mahina ang generic. Pareho silang mali tungkol sa isang 7, sa magkasalungat na direksyon.
Hindi humuhusga mula sa impresyon ang scorer ng Prepamigo. Ikinukumpara nito ang essay sa mga totoong na-grade na sagot sa parehong uri ng task sa bawat antas, lahat totoong essay na may totoong pagkakamali, at inilalagay ito katabi ng pinakakahawig nito sa bawat isa sa apat na dimensyon. Ang isang malinis pero generic na essay ay napupunta katabi ng gitnang sample, dahil iyon ang totoo nito. Sa ibabaw ng paghahambing ay may rule layer para sa mga bagay na hindi mahusay bilangin ng isang model: kung nasakop ba ang bawat kinakailangang punto, kung pumipili ba ng panig ang isang survey response, kung may pagbati at pangwakas ba ang email, at gaano ito kahaba. Ang isang nakaligtaang kinakailangang punto ay nagpipigil sa task fulfillment sa 8 o mas mababa anuman ang Ingles, dahil ganoon gumagana ang test.
Sinubukan din naming ibigay sa writing scorer ang two-grader, vote-and-reconcile na disenyo na ginagamit ng aming speaking scorer. Pinalala nito ang writing, dahil ang mga opisyal na writing level ay dalawang puntos lamang ang layo sa isa’t isa sa 0 hanggang 12 scale at ang isang pinilit na pagpili sa pagitan ng mga sample ay nagtulak sa mga gitnang essay pataas sa 9. Pinananatili ng writing ang disenyong tama sa gitna.
Bakit baligtad ang ranking kumpara sa speaking
Kung nabasa mo na ang aming paghahambing sa speaking, magmumukhang baligtad ang writing leaderboard. Sa mga speaking transcript, ang Claude Opus 5 ang pinakamahusay na chatbot sa 62% at ang GPT 5.6 sol ang pinakamahina sa malalaking model sa 35%. Sa writing, ang GPT 5.6 sol ay nasa 78% at ang mga Claude model ay nasa ibaba.
Ang dahilan ay kung ano ang pinagbibigyan ng bawat model. Ang isang CELPIP speaking transcript ay sinasalitang Ingles na isinulat: mga fragment, pag-uulit, pagwawasto sa sarili. Binabasa ito ng GPT bilang sira at mahigpit itong ini-score, na sa isang transcript ay mali; binabasa ng Claude ang mga ideya sa likod nito. Ang isang CELPIP essay ay kabaligtaran: na-edit ito, organisado, maayos sa ibabaw, at kadalasang generic sa ilalim. Binabasa ng Claude ang kaayusan bilang lakas at pinapalaki ang gitna; binabasa ng GPT ang generic na nilalaman bilang kahinaan at halos tama, o mababa ng isang puntos.
Ang praktikal na aral ay walang iisang pinakamahusay na chatbot para sa CELPIP. Ang model na mahusay mag-grade ng iyong speaking ang siyang magpupuri nang sobra sa iyong writing, at kabaligtaran. Iniiwasan ng isang purpose-built na scorer ang tanong sa pamamagitan ng paghahambing laban sa mga na-grade na sample ng tamang uri para sa bawat task. Ang speaking engine at writing engine ng Prepamigo ay magkahiwalay na sistema na may magkaibang disenyo, dahil magkaiba ang paraan ng pagkabigo ng dalawang task.
Ang talatang kasama ng numero
Ang bawat chatbot ay nagbabalik ng isang talata ng feedback kasama ng score nito, at ang talata ay karaniwang mas kumpiyansa kaysa sa nararapat sa numero. Tatlong bagay na dapat suriin bago mo ito paniwalaan.
- Sinisipi ka ba nito? Ang isang pagwawasto na hindi tumuturo sa iyong eksaktong mga salita ay isang pangkalahatang panuntunan, hindi feedback sa iyong essay. Karamihan sa payo ng chatbot ay ang uring naaangkop sa anumang essay: iba-ibahin ang istruktura ng pangungusap, gumamit ng mas tumpak na vocabulary, buuin ang iyong mga dahilan. Totoo, at hindi maisasagawa.
- Pinapangalanan ba nito ang nawawalang punto? Kung idinikit mo ang task, sasabihin sa iyo ng isang magandang sagot kung aling kinakailangang punto ang hindi mo nasakop. Kung hindi mo idinikit, hindi malalaman ng chatbot, at pupurihin pa rin nito ang coverage.
- Tumutugma ba ang kritisismo sa score? Madalas na naglilista ang isang talata ng chatbot ng tatlo o apat na problema at pagkatapos ay nagbibigay ng 10, o pinupuri ang essay at nagbibigay ng 6. Kapag hindi nagkakasundo ang mga salita at ang numero, wala sa dalawa ang maaasahan.
Ang feedback ng Prepamigo ay itinayo sa kabaligtaran: dapat sipiin ng scorer ang mga pariralang sumusuporta sa score ng bawat dimensyon bago nito ibigay ang score, at ang isang sipi na hindi mahanap sa iyong essay ay itinatapon. Nakalista ang mga nakaligtaang punto ayon sa pangalan, at ang isang nakaligtaang punto ay nagpipigil sa task-fulfillment score, kaya hindi maaaring magkasalungat ang mga salita at ang numero. Nakalista sa seksyon sa ibaba kung ano ang nasa loob nito.
Mga tala sa bawat model
- GPT 5.6 sol. Ang pinakamahusay na chatbot para sa writing sa 78%, at ang dapat gamitin kung gagamit ka ng isa. Bahagyang mahigpit: tatlong gitnang essay ang hinila sa 6, tatlong malakas na essay ang pinigil sa 9. Sa mahihinang essay, mas mahusay ito kaysa sa Prepamigo, 83% laban sa 75%.
- GPT 5.6 luna. 69%. Parehong hugis ng sol pero mas mahigpit sa gitna, kung saan nakuha nito ang pito sa labindalawa. Mahusay sa mahihinang essay.
- Gemini. 61%. Ayos sa mga dulo, mahina sa gitna sa 42%, kung saan itinulak nito ang anim sa labindalawang essay pataas sa 9 o 10.
- Claude Opus 5. 61% sa kabuuan pero ang pinakamahusay na grader sa pagsubok sa malalakas na essay sa 92%. Sa gitna, ito ang pinakamahina sa 25%, na nagbibigay ng 9 o 10 sa pito sa labindalawa. Kung malakas na ang iyong pagsulat, kukumpirmahin ito ng Opus 5; kung karaniwan lang ito, sasabihin ng Opus 5 na malakas ito.
- GPT-4o mini. 58%. Itinuturing ang 9 bilang tuktok ng scale: siyam sa labindalawang malakas na essay ang na-score na 9. Huwag itong gamitin sa pag-grade ng writing kung malapit ka na sa 10.
- Claude Sonnet 5. 56%, ang pinakahindi tumpak. Nag-iscore ng 3 sa apat na mahinang essay at hinati ang gitnang band sa pagitan ng mga 6 at 9.
Kung gagamit ka pa rin ng chatbot
- Gamitin ang GPT 5.6 sol. Hindi isang Claude model para sa anumang mas mababa sa malakas na essay, at hindi isang maliit na model para sa anumang mas mataas sa mahinang essay.
- Idikit ang buong task. Binabago ng mga kinakailangang punto para sa email task at ng mga opsyon para sa survey task ang score. Ang isang model na hindi alam ang mga punto ay hindi makapagsasabi sa iyo na nawawala ang isa.
- Hilingin ditong suriin muna ang mga punto. Humingi ng oo o hindi sa bawat kinakailangang punto, at pagkatapos ang score. Ito ang rule layer, ginawa nang mano-mano.
- Magtanong nang dalawang beses, panatilihin ang mas mababang sagot. Nakakuha ang GPT 5.6 sol ng 78%, 83%, at 81% sa tatlong takbo ng parehong mga essay; ang isang solong sagot ay may dalang ilang puntos ng swerte.
- Basahin ang 9 at ang 6 nang may hinala. Mula sa isang GPT model, ang 9 ay kadalasang isang pinigil na 10 at ang 6 ay kadalasang isang hinilang 7. Mula sa isang Claude model, ang 9 ay kadalasang isang itinaas na 7.
Ang isang input na hindi mo maibibigay nang mag-isa ay isang verified na na-grade na essay para sa parehong task sa bawat antas, na siyang ikinukumpara ng isang purpose-built na scorer. Iyon, at ang pagsuri sa kinakailangang punto, ang pagkakaiba sa pagitan ng 78% at 86%.
Ano ang bago sa iyong writing feedback
Ang score ay kalahati lamang ng natatanggap mo. Itinayong muli ang writing feedback layer kasabay ng scorer, at lahat ng nasa loob nito ay nakaangkla sa sarili mong teksto. Ito ang mga pagbabago.
- Mga pagwawasto na mahahanap mo sa sarili mong essay. Bawat pagwawasto sa grammar, spelling at bokabularyo ay nagsisipi ng eksaktong mga salita mula sa iyong sagot, kaya kayang i-highlight ng app ang mga ito kung saan mo isinulat. Anumang hindi mahanap ng checker nang salita por salita sa iyong essay ay tinatanggal bago mo ito makita.
- Isang model answer, na binuo mula sa sagot mo. Makakatanggap ka ng muling isinulat na bersyon ng sarili mong sagot na nagpapanatili ng iyong mga ideya, sumasakop sa bawat kinakailangang punto, at umaabot sa 150 hanggang 200 salita na hinihingi ng task. Kung hindi maabot ng unang rewrite ang habang iyon, ginagawa itong muli nang isang beses bago ipakita.
- Ang kinakailangang puntong hindi mo natugunan, na pinangalanan. Para sa email task, inililista ng feedback ang mga bullet point mula sa prompt na hindi nasakop ng iyong sagot. Ang isang napalampas na punto ay nagpapanatili rin ng task-fulfillment score sa 8 o mas mababa, kaya hindi kailanman magkakasalungat ang numero at ang feedback.
- Isang limiting factor sa bawat dimensyon. Para sa bawat isa sa apat na dimensyon, pinangangalanan ng feedback ang iisang bagay na pumipigil sa score na iyon, sa konkretong salita, o sinasabi nang malinaw na walang pumipigil at kung ano ang bumubuhat dito. Ang pagpapasyang walang problema ang isang dimensyon ay isang totoong sagot, hindi isang puwang.
- Puna sa tamang lugar. Ang mahinang tono ay problema sa task fulfillment, ang malabong pagpili ng salita ay problema sa bokabularyo, ang run-on sentence ay problema sa readability. Bawat punto ay inilalagay sa ilalim ng dimensyong nagmamay-ari nito sa halip na isama lang sa pangkalahatang buod.
- Mga rewrite sa antas ng pangungusap. Ang mga tiyak na pangungusap mula sa iyong essay ay ibinabalik na may pinahusay na bersyon at isang linya kung bakit ito mas maganda, para makita mo ang pagbabago sa halip na basahin lang ang tungkol dito.
- Ang pinakamalakas at pinakamahina mong dimensyon, magkatabi. Sinasabi sa iyo ng feedback kung alin sa apat na dimensyon ang bumubuhat sa iyong score at alin ang pumipigil dito, para malaman mo kung ano ang susunod na sasanayin nang hindi kailangang unawain ang apat na numero.
Bawat sipi sa feedback ay sinusuri laban sa iyong essay bago ito ipakita. Kung hindi mahanap ng checker ang mga salita, tinatanggal ang linya. Kaya hindi kailanman sasabihin sa iyo ng feedback na ayusin ang isang bagay na hindi mo isinulat.
Mga Tanong
Aling AI ang pinakatumpak sa pag-score ng CELPIP writing? Sa mga chatbot, ang GPT 5.6 sol sa 78%, pagkatapos ang luna sa 69%, Gemini at Claude Opus 5 sa 61%, GPT-4o mini sa 58%, Claude Sonnet 5 sa 56%. Umabot ang writing scorer ng Prepamigo sa 86% sa parehong mga essay.
ChatGPT o Claude para sa writing? ChatGPT, malinaw: 78% laban sa 61% at 56%. Pinapalaki ng mga Claude model ang mga gitnang-antas na essay sa 9 o 10. Ang Opus 5 ang pinakamahusay sa lahat sa malalakas na essay.
Bakit binibigyan nila ng 9 ang aking karaniwang essay? Ang maayos at organisado ay nababasa bilang malakas ng isang model na walang ikukumpara. Ikinukumpara ng Prepamigo sa mga totoong na-grade na sample para sa parehong task.
Paano ako makakakuha ng mas magandang score mula sa isang chatbot? Gamitin ang GPT 5.6 sol, idikit ang buong task, hilingin ditong suriin muna ang bawat kinakailangang punto, magtanong nang dalawang beses, at basahin ang mga 9 at 6 nang may hinala.
Para sa dalawang head-to-head, basahin ang Prepamigo laban sa Claude para sa writing at Prepamigo laban sa ChatGPT para sa writing. Para sa kung paano gumagana ang scorer, basahin ang loob ng writing scorer ng Prepamigo. O Sumulat ng sagot at laktawan ang panghuhula. Basahin ang gabay na ito sa Ingles.
