3 Regnearksformler til Delvis Kredit-scoring og Rasch

Delvis kredit-scoring tildeler point langs en skala frem for et alt-eller-intet-resultat og belønner en testdeltager for den del af et svar, der er korrekt. Undervisere bruger det, fordi det måler delvis viden, som dikotom, rigtigt-eller-forkert-scoring smider væk, og veldesignede delvis-kredit-funktioner dæmper gevinsten ved tilfældig gætten. Det passer bedst til flerdelte opgaver, spørgsmål med flere svarmuligheder og konstruerede svar bedømt efter en rubrik, især når du har brug for mere detaljeret diagnostisk information, end en simpel bestået/ikke-bestået-score kan give.
TL;DR:
- Delvis kredit-scoring afspejler studerendes viden bedre på flerdelte opgaver, spørgsmål med flere svarmuligheder og konstruerede svar end simple rigtigt-eller-forkert-tilgange.
- Metoder som delmænge-udvælgelse og lineær straf kontrollerer gætteri, men kræver klare instruktioner og kan introducere kompleksitet i scoring og oplæring af bedømmere.
- Empirisk forskning viser, at delvis kredit forbedrer pålidelighed og diskrimination, især i stor skala eller med spørgsmål med flere svarmuligheder, der er tilbøjelige til gætteri.
- De fleste klasserumstest har ikke brug for avancerede modeller som Rasch delvis kredit, der er forbeholdt storskalede testprogrammer og certificeringseksamener.
- Brug af dedikerede værktøjer, der automatiserer rubrikapplikation, konsistens hos bedømmere og scoringstransparens, forenkler implementeringen og sikrer en fair og konsekvent evaluering med delvis kredit.
Indholdsfortegnelse
- Hvad delvis kredit-scoring betyder, og hvornår man bruger det
- Almindelige metoder til delvis kredit-scoring
- Sådan beregner du delvis kredit: Gennemarbejdede eksempler
- Statistiske modeller og IRT: Rasch delvis kredit-modellen
- Bedste praksis for implementering: Design, konfiguration og rapportering
- Pålidelighed, validitet og undertrykkelse af gætteri
- Scoringsskabeloner til spørgsmål med flere svarmuligheder
- Tjekliste for praktikerforvaltning, inden du skalerer
- Hvornår delvis kredit fortjener sin kompleksitet
- Byg delvis kredit-tests uden selv at bygge infrastrukturen
- Kilder
- FAQ
Hvad delvis kredit-scoring betyder, og hvornår man bruger det
Dikotom scoring behandler et svar som enten fuldt korrekt eller fuldt forkert – værd ét point eller nul. Delvis kredit-scoring bryder den binære opdeling op. En studerende, der vælger tre ud af fire korrekte muligheder i et spørgsmål med flere svarmuligheder, eller som løser opstillingen af et flertrinsproblem korrekt, men fejler den endelige beregning, får kredit proportionalt med, hvad de faktisk demonstrerede.
Argumentet for delvis kredit hviler på tre praktiske resultater. For det første indfanger det delvis viden, som en streng rigtigt/forkert-regel sletter, hvilket er vigtigst på opgaver med flere forsvarlige delsvar. For det andet kan korrekt opbyggede scoringsfunktioner gøre den forventede værdi af et tilfældigt gæt negativ, så gætteri ophører med at være en rationel strategi – en effekt der er formelt modelleret i forskning om scoringsfunktioner. For det tredje fandt empiriske sammenligninger på spørgsmål med flere svarmuligheder, at delvis kredit-metoder forbedrede både pålidelighed og opgavediskrimination i forhold til dikotom scoring.
Du behøver ikke delvis kredit overalt. En glosarprøve med enkle korrekte svar har intet at vinde ved det og tilfører kun scoringskompleksitet. Grib til delvis kredit, når opgaver reelt er flerdelte, når spørgsmål med flere svarmuligheder har mere end to plausible valg, eller når et konstrueret svar kan nedbrydes i en rubrik med adskilte, bedømmelige komponenter.
Almindelige metoder til delvis kredit-scoring
Ingen enkelt formel vinder i alle sammenhænge. Klassiske oversigter over feltet katalogiserer en række metoder og finder konsekvent afvejninger frem for en universel vinder, så det rette valg afhænger af opgaveformatet og det, du forsøger at beskytte dig imod – hvad enten det er gætteri, inkonsistens hos bedømmere eller scoringskompleksitet i sig selv.
- Proportional (antal-korrekte) scoring. Point svarer til andelen af korrekte valg ud af det samlede antal mulige valg. Simpelt at beregne, let at forklare for studerende, men sårbart over for manipulation på spørgsmål med flere svarmuligheder, hvor det at vælge alle muligheder garanterer en grundlæggende score.
- Delmænge-udvælgelses (SS) scoring. Fuld kredit gives kun, når den præcist korrekte delmængde er valgt; delvis kredit tildeles for delmængder, der er korrekte delmatch til svarnøglen, med straf for inkluderede distraktorer. Bedre kontrol af gætteri end ren proportional scoring, på bekostning af en lidt mere kompleks regel at forklare.
- Modificerede Zapechelnyuk-lignende funktioner. Disse bruger en matematisk afledt strafstruktur designet til, at den forventede værdi af blindt gæt bliver negativ, og adresserer direkte gætteroproblemet frem for blot at tolerere det.
- Lineære strafmodeller. Score svarer til antallet af korrekte valg minus et vægtet antal forkerte valg. Kan justeres ved at tilpasse strafvægten, hvilket lader dig kalibrere, hvor aggressivt du ønsker at afskrække over-udvælgelse.
- Rubrikbaseret fraksionering. Konstruerede svar scores mod en ordnet rubrik (fx 0 til 4) og konverteres derefter til en brøkdel af opgavens samlede point. Dette er standardtilgangen til essays, flertrinsproblemer i matematik og laboratorierapporter.
Proportional scoring passer til multiple-select og multi-blank-opgaver, hvor formatet er ligetil, og gætterisikoen er lav. Delmænge-udvælgelses- og lineære strafmodeller passer til spørgsmål med flere svarmuligheder, hvor distraktorer er tilstrækkeligt attraktive til, at tilfældig udvælgelse kan oppuste scorer. Rubrikbaseret fraksionering er reelt den eneste fornuftige mulighed for åbne konstruerede svar, da der ikke er noget diskret "antal korrekte" at dividere med.
Afvejningsmønstret er konsekvent på tværs af metoder: enklere formler (proportional scoring) er lettest for studerende og instruktører at forstå, men svagest mod gætteri, mens straf- og delmængebaserede metoder kontrollerer gætteri bedre, men kræver klarere instruktioner, så studerende forstår, hvordan valg vægtes. Rubrikbaseret scoring bærer en helt anden risiko: inkonsistens hos bedømmere, som ingen formel kan rette på egen hånd.
Sådan beregner du delvis kredit: Gennemarbejdede eksempler
Formlerne ovenfor er ubrugelige, indtil du selv kan køre tallene. Her er tre gennemarbejdede eksempler, du direkte kan overføre til et regneark.
1. Proportional scoring på en fire-muligheder multiple-select-opgave.
Antag, at en opgave har fire korrekte muligheder ud af seks valgmuligheder i alt, og er værd 4 point. En studerende vælger 3 af de 4 korrekte muligheder og 0 distraktorer.
Score = (korrekte valg / samlede korrekte muligheder) × opgavepoint Score = (3 / 4) × 4 = 3,0 point
2. Delmænge-udvælgelse med distraktorsignal.
Samme opgave: 4 korrekte muligheder, 2 distraktorer, 4 point i alt. Denne gang vælger den studerende 3 korrekte muligheder og 1 distraktor.
Score = [(korrekte valgt / samlede korrekte) − (distraktorer valgt / samlede distraktorer)] × opgavepoint, med gulv ved nul Score = [(3/4) − (1/2)] × 4 = [0,75 − 0,5] × 4 = 1,0 point
Sammenlign det med den udelukkende proportionale metode, som ville have ignoreret distraktoren fuldstændigt og tildelt 3,0 point for det identiske svar. Det hul er hele argumentet for strafbaserede metoder på opgaver, hvor distraktorer er reelt fristende.

3. Rubrik-til-brøk-konvertering på et spørgsmål med 20 point.
Et flertrinsproblem i matematik bedømmes på en 0-til-4-rubrik: 0 (ingen gyldig tilgang), 1 (korrekt opstilling alene), 2 (korrekt metode, større fejl), 3 (korrekt metode, mindre fejl), 4 (fuldt korrekt). Spørgsmålet er i alt 20 point værd.
Brøkdelscore = (optjente rubrikpoint / maks. rubrikpoint) × opgavepoint En studerende, der opnår 3 på rubrikken, får: (3/4) × 20 = 15 point
Kør denne konvertering hen over en klasseliste, og du får en fordeling, der slet ikke ligner et simpelt procent-korrekt-histogram: scorer klumper sig om rubrikbånd (0, 5, 10, 15, 20) frem for at sprede sig jævnt, hvilket er værd at vide, inden du bygger en karakterkurve omkring det.
Pro-tip: Byg disse tre formler som navngivne funktioner i en delt regneskabelon, inden eksamensvinduet åbner. Det er at efterfitte en scoringsformel, efter studerende allerede har afleveret svar, der starter de fleste scoringstvister.
Statistiske modeller og IRT: Rasch delvis kredit-modellen
Brøkdels-scoringsformler besvarer "hvor mange point fortjente dette svar." Item response theory (IRT) besvarer et andet spørgsmål: "hvor meget evne indikerer dette svar faktisk, når vi tager højde for, hvor svært hvert svarkategori er at nå." Den sondring er vigtig, så snart du bevæger dig fra bedømmelse i ét klasserum til enhver sammenhæng, hvor scorer skal sammenlignes på tværs af former, kohorter eller år.
Rasch delvis kredit-modellen, udviklet af Geoff Masters, udvider den standard dikotome Rasch-model til opgaver med ordnede svarkategorier. I stedet for at behandle "trin 2 af 4" som simpelthen halvt så meget som "trin 4 af 4," estimerer Rasch PCM en separat tærskelparameter for overgangen mellem hvert par af tilstødende kategorier. At gå fra en score på 1 til 2 på en rubrik kan kræve betydeligt mere demonstreret evne end at gå fra 2 til 3, og modellen indfanger det i stedet for at antage, at hvert trin er ens.

Den praktiske gevinst er parameterseparabilitet: en eksamensdeltageres estimerede evne og en opgaves kategoriske tærskler kan estimeres uafhængigt af hinanden, hvilket er det, der gør krydsprøvesammenligninger statistisk forsvarlige i første omgang.
Hvornår tjener den ekstra kompleksitet sig ind?
- Storskalede testprogrammer, hvor tusindvis af svar kræver konsistent fortolkning på tværs af flere eksamensformer.
- Kobling og ækvivalering, når forskellige grupper af studerende tager forskellige versioner af en test, og scorer skal betyde det samme på tværs.
- Præcis opgavekalibrering, når du har brug for at vide præcis, hvor meget evne der adskiller et "2" fra et "3" på en rubrik, frem for at antage ligelig fordeling.
- Differentieret opgavefunktionskontrol, hvor du skal bekræfte, at en opgaves delvis kredit-trin opfører sig konsistent på tværs af demografiske grupper, inden du stoler på den samlede score.
En enkelt klasserumsquiz har næsten aldrig brug for Rasch-kalibrering. En certificeringseksamen administreret nationalt, genbrugt på tværs af eksamensperioder og brugt til bestået/ikke-bestået-afgørelser med reelle konsekvenser har næsten altid brug for det. Skillelinjen mellem "brug en regnearksformel" og "brug IRT-software" handler egentlig om indsats og skala – ikke om opgaveformat.
Bedste praksis for implementering: Design, konfiguration og rapportering
At få delvis kredit til at fungere korrekt starter godt inden nogen studerende ser opgaven, og det slutter ikke, når scorer er genereret. Tre faser fortjener bevidst opmærksomhed: design, platformskonfiguration og rapportering.
Designtjekliste. Inden du skriver en enkelt opgave, fastsæt scoringsreglen – ikke efter piloteringen afslører inkonsistens.
- Skriv rubrikken eller point-allokeringsreglen på samme tid som du skriver opgaven, ikke efterfølgende.
- Brug en konsistent pointskala på tværs af lignende opgaver, så studerende kan forudsige, hvordan delvis kredit fordeles.
- Pilotér nye rubriker på et lille udsnit af rigtige eller øvelsessvar, inden de anvendes i stor skala, og juster ankerbeskrivelser, hvor to bedømmere er uenige.
- Definer 3 til 5 ankersvar pr. scoringsband for rubriker til konstruerede svar – en praksis understøttet af forskning i rubrikbaseret delvis kredit-scoring, der anbefaler oplæring af bedømmere mod eksempelscripts for at opnå acceptabel interrater-enighed.
LMS- og platformskonfiguration. De fleste læringsplatforme gemmer indstillinger for delvis kredit inde i muligheder på opgaveniveau frem for på eksamenniveau, så tjek hver spørgsmålstype individuelt frem for at antage, at en global knap dækker alt. Bekræft, om feedback vist for studerende viser brøkscoren, rubrikniveauet eller begge, da det at vise kun et afrundet total kan sløre præcis, hvor point gik tabt. Eksporter rå, ikke-afrundede scoringsdata, når det er muligt. At afrunde tidligt og genberegne senere er en af de hurtigste måder at introducere stille bedømmelsesfejl på tværs af en stor klasseliste.
Rapportering. Rapporter både den rå brøkdelscore og det afrundede total, og sig det eksplicit i den scoringsrapport, der når den studerende. En studerende, der ser "15/20" uden kontekst, har ingen mulighed for at vide, om de mistede 5 point til én stor fejl eller flere små. En enkeltlinjes forklaring af, hvordan delvis kredit blev beregnet, vedhæftet scoringsrapporten, løser de fleste tvister, inden de starter. Hold, der bygger scoringsrubriker til strukturerede bedømmelser, kan finde yderligere vejledning og skabeloner til rubrikdesign, der passer direkte til brøkdels-scoringstilgange.
Pålidelighed, validitet og undertrykkelse af gætteri
Pålidelighed er det spørgsmål, der afgør, om delvis kredit var den ekstra kompleksitet værd. Hvis en scoringsændring ikke målbart forbedrer din tests konsistens, er den ekstra oplæring af bedømmere og beregningsomkostning svær at retfærdiggøre.
Den empiriske dokumentation hælder positivt her. Komparative studier af scoringsmetoder på spørgsmål med flere svarmuligheder fandt, at delvis kredit-tilgange forbedrede pålidelighed og diskrimination sammenlignet med simpel dikotom scoring, særligt for opgaver med mere end to svarmuligheder, hvor en rigtigt/forkert-opdeling smider meningsfuld variation væk. Separat fandt teoretisk arbejde om scoringsfunktioner designet omkring negativ forventet gætteværdi, at disse funktioner tenderer mod at forbedre både pålidelighed og diskrimineringsevne i forhold til ren rigtigt-eller-forkert-scoring, særligt når en gætte-straf er indbygget.
Tre praktiske kontroller fortæller dig, om skiftet betaler sig i dine egne data:
Opgave-total-korrelation. Genberegn den efter skiftet til delvis kredit. En opgave, hvis korrelation med den samlede score forbedres, gør nu et bedre job med at adskille stærke fra svage elever under den nye scoringsregel.
Cronbachs alfa før og efter. Kør det samme testdatasæt gennem begge scoringsregler og sammenlign alfaværdier direkte. En meningsfuld stigning er et stærkt signal om, at delvis kredit indfangede information, som den binære version kasserede.
IRT-tilpasningsstatistik, hvor en Rasch- eller anden IRT-model allerede er i brug. Kategoriske tærskler, der viser sig uordnede – dvs. at en højere rubrikscore ikke svarer til en højere estimeret evne – markerer en rubrik, der kræver revision, uanset hvad de rå pålidelighedstal siger.
Intet af dette er gratis. Scoringskompleksitet stiger med hver tilføjet formelvariant, bedømmervariabilitet bliver et aktuelt problem i det øjeblik du introducerer en rubrikbaseret komponent, og administrative omkostninger stiger, når du har brug for software- eller regnearksinfrastruktur ud over en simpel svarnøgle. Afvej disse omkostninger mod dine faktiske indsatser. En ugentlig quiz retfærdiggør sjældent overhead; en certificeringseksamen gør det næsten altid.
Scoringsskabeloner til spørgsmål med flere svarmuligheder
Spørgsmål med flere svarmuligheder – hvor en studerende vælger flere muligheder fra en længere liste – er der, hvor gætteri gør mest skade på en tests validitet. En studerende, der vælger alle muligheder i et "vælg alle der gælder"-spørgsmål med fire korrekte svar ud af seks valg, vil altid få delvis kredit under naiv proportional scoring, uanset om de ved noget eller ej.
Løsningen er en scoringsskabelon bygget omkring forventet værdi. En almindelig struktur: tildel p1 point, når den studerende vælger præcis svarnøglen (det fulde korrekte sæt) eller, i nogle formuleringer, når alle distraktorer er korrekt udelukket; ellers anvend en pc − m formel, hvor pc er andelen korrekte og m er en straf skaleret til valg uden for nøglen. Målet, som formel scoringsfunktionsforskning beskriver det, er at sikre, at matematikken i sig selv afskrækker uforsigtig over-udvælgelse.
- Dimensionér straffen (m) så den forventede værdi af at vælge alle muligheder – eller vælge tilfældigt – bliver negativ eller i det mindste nul.
- Test din straf mod et "vælg alle"-svar, inden du anvender opgaven. Hvis det svar scorer over nul, er straffen for lille.
- Test den også mod et ærligt delvis-viden-svar. Hvis en studerende korrekt identificerer 3 af 4 korrekte muligheder og udelukker begge distraktorer, men scorer dårligere end én, der gættede bredt, er straffen for stor.
Opgaveformuleringen betyder lige så meget som formlen bag den. Instruktioner, der lyder "vælg alle korrekte svar" uden vejledning om straffe, skubber studerende mod at gætte, da der ikke er noget nedsidesignal i selve ordlyden. Tilføj en kort linje om, at forkerte valg reducerer scoren, og du får mere ærlig delvis-viden-rapportering, fordi studerende ikke længere har incitament til at vælge muligheder, de er usikre på, blot for at afdække risici.
Tjekliste for praktikerforvaltning, inden du skalerer
Inden du ruller delvis kredit ud ud over en pilotgruppe, kør disse fire kontroller:
- Rubrikklarhed. Bekræft, at hvert rubrikniveau har en distinkt, observerbar ankerbeskrivelse – ikke blot en vag etiket som "for det meste korrekt."
- Inter-rater-pålidelighed. Lad to bedømmere uafhængigt score de samme 20 til 30 eksempelsvar og tjek enighed, inden du stoler på en enkelt bedømmers scorer i stor skala.
- Pilotsammenligning. Score det samme responssæt under både den gamle scoringsregel og den nye delvis kredit-regel, og sammenlign pålidelighed og karakterfordeling side om side.
- Følsomhedsanalyse. Juster dine strafvægte eller pointallokeringer en smule og kør analysen igen. Vejledning til scoringsmodeller anbefaler dette trin, fordi små ændringer i vægtning kan vende pålidelighedsresultater eller fuldstændigt omrokere kandidatrangeringer.
Dokumentér enhver scoringsbeslutning – herunder hvorfor en bestemt formel eller strafstørrelse blev valgt – i et format, som interessenter kan gennemgå senere. Den dokumentation er det, der gør en forsvarlig pilot til en forsvarlig politik.
Hvornår delvis kredit fortjener sin kompleksitet
Delvis kredit er en målingsforbedring med en reel administrativ pris, og at foregive andet gør en bjørnetjeneste for alle, der piloterer det for første gang. Gevinsten i pålidelighed og diskrimination er veldokumenteret, men det er den øgede byrde også: mere oplæring af bedømmere, mere komplekse formler, mere rum for uenighed om, hvad "delvis" egentlig betyder på en given opgave.
Min ærlige læsning af forskningen er, at de fleste bedømmelser på klasserumsplan ikke har brug for Rasch-kalibrering, delmænge-udvælgelsesstraffe eller noget af den mere elaborate maskine beskrevet ovenfor. En klar rubrik og proportional fraksionering dækker størstedelen af reelle klasserumsbehov. Delvis kredit tjener sin kompleksitet i stor skala: certificeringseksamener, multi-form testprogrammer og enhver bedømmelse, hvor en forkert scoringsantagelse multipliceres på tværs af tusindvis af testdeltagere frem for tredive.
Den operationelle byrde er præcis dér, hvor gode platformsværktøjer ændrer regnestykket, særligt hvis du ønsker at automatisere global ansættelse og reducere compliancerisici. Et værktøj, der automatiserer rubrikapplikation, sporer bedømmerkonsistens og logfører scoringsbeslutninger, fjerner det meste af den friktion, der holder undervisere fra overhovedet at pilotere delvis kredit. Pilotér først, mål pålidelighedsgevinsten mod de ekstra omkostninger, og skalér kun tilgangen, når tallene faktisk retfærdiggør det.
— Jimmie
Byg delvis kredit-tests uden selv at bygge infrastrukturen
Det meste af friktionen ved delvis kredit-scoring er ikke matematikken. Det er infrastrukturen: at skrive konsistente rubriker, holde bedømmere aligned og stole på, at ingen har snydt sig igennem testen. Talent Approved er bygget omkring en betal-per-brug-model uden abonnement, så du kun betaler pr. gennemført kandidatbedømmelse og undgår overhead ved at licensere scoringssoftware, du måske kun lejlighedsvist har brug for.

Platformens Magic Create-funktion bygger en rollespecifik, rubrik-klar bedømmelse direkte fra en jobbeskrivelse eller en liste over kompetencer, hvilket eliminerer den manuelle opgaveskrivefase fuldstændigt. Indbyggede anti-snyd-værktøjer, herunder skærm- og webkameraovervågning med sessionsafspilninger, beskytter integriteten af delvis kredit-resultater på samme måde som oplæring af bedømmere beskytter en rubrik til konstruerede svar. AI-genererede præstationsopsummeringer omsætter brøkscorer til læsbare kandidatrangeringer uden at tvinge dit hold til selv at fortolke rå rubrikmatematik.
Hvis du evaluerer kompetencer frem for at bedømme studerende, og ønsker delvis kredit-lignende scoring uden at eje scoringsinfrastrukturen, kan du tjekke prissiden for kompetencebedømmelser og se, hvad en pilotbedømmelse vil koste til din næste ansættelsesrunde.
Kilder
- Evaluering af forskellige scoringsmetoder for spørgsmål med flere svarmuligheder, der giver delvis kredit
- Teoretisk evaluering af delvis kredit-scoring af multiple choice-testopgaven
- Delvis kredit-scoringsmetoder til multiple choice-tests – ERIC
FAQ
Hvordan beregner du delvis kredit?
Divider de optjente point (korrekte valg, rubrikniveau eller delmængematch) med de maksimalt mulige point for den opgave, og multiplicer derefter med opgavens samlede pointværdi. Delmænge-udvælgelses- og lineære strafmetoder trækker en vægtet straf for forkerte valg fra inden den endelige multiplikation.
Hvad er de tre vigtigste typer af kredit-scoring-tilgange?
Inden for testdesign er de tre brede tilgange dikotom (rigtigt/forkert) scoring, delvis kredit-scoring (proportional, delmænge-udvælgelse eller strafbaserede formler) og rubrikbaseret brøkdelsscoring til konstruerede svar. Hver passer til forskellige opgaveformater, og ingen enkelt tilgang er overlegen i alle sammenhænge.
Hvad underminerer oftest et delvis kredit-scoringssystem?
Uklare rubrikankre og inkonsistent oplæring af bedømmere er de mest almindelige fejlpunkter, da de introducerer uenighed mellem bedømmere, som ingen formel kan rette efterfølgende. En tæt toer er et strafled dimensioneret for lille, hvilket lader tilfældig gætten forblive statistisk fordelagtig frem for undertrykt.
Forbedrer delvis kredit faktisk testpålidelighed?
Empiriske sammenligninger på spørgsmål med flere svarmuligheder fandt, at delvis kredit-scoring forbedrede både pålidelighed og diskrimination sammenlignet med dikotom scoring, særligt når scoringsfunktionen straffer forkerte valg. Gevinsten er ikke automatisk. Den afhænger af rubrikklarhed og strafstørrelse.
Kan en platform håndtere delvis kredit-scoring til kompetencebedømmelser?
Ja. Talent Approved understøtter rubrikbaseret scoring sideløbende med sin Magic Create-bedømmelsesbygger og anti-snyd-overvågning, så ansættelsesteam kan anvende brøkdels-scoringslogik uden selv at bygge beregningsinfrastrukturen. Aktuel prissætning er angivet på siden for kompetencebedømmelser.