部分计分与Rasch模型的3个电子表格公式

部分计分与Rasch模型的3个电子表格公式

部分积分评分是在一个范围内分配分数,而非全有或全无的结果,它根据答案中正确的部分给予考生相应得分。教育工作者之所以采用这种方式,是因为它能衡量二元式是非评分所丢失的部分知识,而设计良好的部分积分函数还能抑制随机猜测所带来的收益。它最适合用于多部分题目、多项选择题以及依据评分标准评分的建构性回答,尤其是当您需要比简单通过/不通过分数更细粒度的诊断信息时。


TL;DR:

  • 与简单的是非评分方法相比,部分积分评分能更好地反映学生在多部分题、多项选择题和建构性回答题上的知识水平。
  • 子集选择法和线性扣分法等方法能有效控制猜测行为,但需要明确的说明,并可能在评分和评分员培训方面引入复杂性。
  • 实证研究表明,部分积分评分能提高信度和区分度,尤其是在大规模测试或容易猜测的多项选择题中效果更为显著。
  • 大多数课堂评估不需要诸如Rasch部分积分模型等高级模型,这些模型专为大规模测试项目和认证考试而保留。
  • 使用专用工具自动化评分标准的应用、评分员一致性以及评分透明度,能简化实施过程,并确保公平、一致的部分积分评估。

Talent Approved
超越简历评估技能
Talent Approved帮助雇主创建结构化、针对特定职位的评估,并以更高的信心审查候选人能力。

目录

部分积分评分的含义及使用时机

二元评分将答案视为完全正确或完全错误,要么得一分,要么得零分。部分积分评分打破了这种二元对立。一名学生在多项选择题中选出了四个正确选项中的三个,或者在多步骤问题中正确完成了解题过程但在最后计算上出了差错,他就能根据实际展示的程度获得相应分数。

支持部分积分的理由建立在三个实际结果上。首先,它能捕捉到严格是非评分规则所抹去的部分知识,这对于拥有多个合理子答案的题目尤为重要。其次,构建得当的评分函数能使随机猜测的期望值变为负数,从而使猜测不再是合理策略——这一效果已在评分函数研究中得到正式建模。第三,对多项选择题的实证比较发现,与二元评分相比,部分积分方法能同时提升信度和题目区分度。

并非所有情况都需要部分积分。只有单一正确答案的词汇测验对此毫无益处,反而会增加评分复杂性。当题目确实是多部分结构、多项选择题有两个以上合理选项,或建构性回答可以分解为具有独立可评分组成部分的评分标准时,才应考虑使用部分积分。

常见的部分积分评分方法

没有一个公式能在所有情境中都表现最佳。该领域的经典综述列出了多种方法,并一致发现它们之间存在权衡取舍,而非存在一个普遍最优选择,因此正确的选择取决于题目形式以及您希望防范的对象——无论是猜测行为、评分员不一致性,还是评分复杂性本身。

  • 比例(正确数量)评分。分数等于正确选项数占总可能选项数的比例。计算简单,易于向学生解释,但在多项选择题上容易被钻空子——选择所有选项可以保证获得一个基础分数。
  • 子集选择(SS)评分。只有选择了完全正确的子集才能获得满分;对于与答案键部分匹配的子集给予部分分数,并对选中干扰项予以扣分。与纯比例评分相比,猜测控制效果更好,代价是需要解释一条稍微复杂的规则。
  • 改良Zapechelnyuk式函数。这些函数采用数学推导的扣分结构,旨在使盲目猜测的期望值变为负数,从而直接解决猜测问题,而非仅仅容忍它。
  • 线性扣分模型。分数等于正确选项数减去错误选项数的加权计数。通过调整扣分权重可以进行调节,让您能够校准希望抑制过度选择的力度。
  • 基于评分标准的分数转换。建构性回答按照有序评分标准(例如0到4分)进行评分,然后转换为题目总分的一个比例。这是论文、多步骤数学问题和实验报告的标准方法。

比例评分适用于格式简单、猜测风险较低的多选和多空填写题。子集选择和线性扣分模型适用于干扰项足够吸引人、随机选择可能虚高分数的多项选择题。基于评分标准的分数转换对于开放式建构性回答而言实际上是唯一合理的选择,因为根本没有离散的"正确数量"可以用来除法计算。

各方法之间的权衡模式是一致的:较简单的公式(比例评分)对学生和教师来说最容易理解,但对猜测行为的抑制效果最弱;而基于扣分和子集的方法能更好地控制猜测,但需要更清晰的说明,以便学生理解选项的权重方式。基于评分标准的评分则存在完全不同的风险:评分员不一致性——这是任何公式本身都无法解决的问题。

如何计算部分积分:实例演示

上述公式在您亲自运算之前毫无用处。以下是三个可以直接转移到电子表格中的实例演示。

1. 四选项多选题的比例评分。

假设一道题有六个总选项中的四个正确选项,共4分。一名学生选了4个正确选项中的3个,以及0个干扰项。

得分 = (正确选项数 / 总正确选项数) × 题目分值 得分 = (3 / 4) × 4 = 3.0分

2. 含干扰项扣分的子集选择评分。

相同题目:4个正确选项,2个干扰项,共4分。这次学生选了3个正确选项和1个干扰项。

得分 = [(已选正确选项数 / 总正确选项数) − (已选干扰项数 / 总干扰项数)] × 题目分值,结果不低于零 得分 = [(3/4) − (1/2)] × 4 = [0.75 − 0.5] × 4 = 1.0分

对比纯比例方法,后者会完全忽略干扰项,对相同回答给出3.0分。这一差距正是对干扰项确实具有吸引力的题目采用扣分方法的全部理由。

三种部分积分公式的比较

3. 20分题目的评分标准分数转换。

一道多步骤数学题按0到4分的评分标准进行评分:0(无有效方法)、1(仅建立正确框架)、2(方法正确,存在重大错误)、3(方法正确,存在小错误)、4(完全正确)。该题共20分。

分数转换 = (已获评分标准分数 / 最高评分标准分数) × 题目分值 一名在评分标准上获得3分的学生得到:(3/4) × 20 = 15分

在整个班级名单上运行该转换,您会得到一个与简单正确率直方图截然不同的分布:分数会聚集在评分标准的分段处(0、5、10、15、20分),而不是连续分布——在您围绕此构建成绩曲线之前,这一点值得了解。

专业提示:在考试窗口开放之前,将这三个公式作为命名函数构建到共享电子表格模板中。在学生提交回答之后才追溯修改评分公式,正是大多数评分争议的起源。

统计模型与IRT:Rasch部分积分模型

分数转换公式回答的是"这个回答获得了多少分"。项目反应理论(IRT)回答的是另一个问题:"一旦考虑到每个反应类别的难度,这个回答实际上反映了多少能力水平。"一旦您从单一课堂评分转向任何需要跨试卷版本、群体或年份比较分数的情境,这一区别就变得至关重要。

由Geoff Masters开发的Rasch部分积分模型,将标准的二元Rasch模型扩展到具有有序反应类别的题目。Rasch PCM不是简单地将"4个步骤中的第2步"视为"4个步骤中的第4步"的一半,而是为每对相邻类别之间的转换估计一个独立的阈值参数。在评分标准上从1分升至2分可能需要比从2分升至3分多得多的能力展示,模型能够捕捉到这一点,而不是假设每个步骤是等距的。

评分标准类别之间的不等间距阈值

实际收益在于参数可分离性:被试者的估计能力和题目的类别阈值可以相互独立地进行估计,这正是使跨试卷版本比较在统计上具有可辩护性的基础。

额外的复杂性在什么情况下物有所值?

  • 大规模测试项目,需要在多个考试版本中对数千份回答进行一致解读。
  • 联结与等值,当不同组别的学生参加不同版本的考试,且分数需要在各版本间具有相同含义时。
  • 精确的题目标定,当您需要知道在评分标准上"2分"和"3分"之间究竟相差多少能力,而不是假设等距间隔时。
  • 差异项目功能检验,当您需要在依赖总分之前确认一道题的部分积分步骤在不同人口群体中表现一致时。

单门课堂测验几乎从不需要Rasch标定。而在全国范围内施测、跨考试窗口重复使用、并被用于有实际后果的通过/不通过决策的认证考试,则几乎总是需要。"使用电子表格公式"和"使用IRT软件"之间的界限,实际上是关于测试的利害关系和规模的界限,而非关于题目形式的界限。

实施最佳实践:设计、配置与报告

正确实施部分积分,需要在任何学生看到题目之前就做好准备,而且不会在生成分数时就结束。有三个阶段需要认真关注:设计、平台配置和报告。

设计检查清单。在您编写任何一道题之前,先确定评分规则——而不是在试点发现不一致之后。

  • 在编写题目的同时撰写评分标准或积分分配规则,而不是之后再补。
  • 在同类题目中使用一致的分值量表,让学生能够预测部分积分的分配方式。
  • 在大规模部署之前,先对真实或练习回答的小样本进行新评分标准的试点,并在两名评分员存在分歧的地方调整锚定描述。
  • 为建构性回答评分标准的每个分数段定义3到5个锚定回答示例——关于基于评分标准的部分积分评分的研究支持这一做法,建议针对示例脚本对评分员进行培训,以达到可接受的评分员间一致性。

LMS与平台配置。大多数学习管理系统将部分积分设置隐藏在题目级别选项中,而非考试级别设置中,因此需要逐题检查,而不是假设全局开关能覆盖所有内容。确认向学生显示的反馈是显示小数分数、评分标准等级,还是两者兼有——因为只显示四舍五入的总分会模糊分数具体在哪里丢失。尽可能导出原始未四舍五入的评分数据。提前四舍五入后再重新计算,是在大型名单中引入无声评分错误的最快方式之一。

报告。同时报告原始小数分数和四舍五入后的总分,并在发给学生的分数报告中明确说明。看到"15/20"但没有任何背景信息的学生,无法知道自己是因为一个大错误还是几个小错误丢了5分。在分数报告中附上一行解释部分积分计算方式的说明,可以在大多数争议发生之前就将其化解。正在为结构化评估构建评分标准的团队,可以找到与分数转换方法直接配套的评分标准设计指南和模板。

信度、效度与猜测抑制

信度是决定部分积分是否值得增加复杂性的关键问题。如果一次评分变更没有可测量地提高评估的一致性,那么额外的评分员培训和计算开销就难以证明其合理性。

实证记录在这方面倾向于积极结论。对多项选择题评分方法的比较研究发现,与简单的二元评分相比,部分积分方法提高了信度和区分度,特别是对于有两个以上响应选项的题目——是非分割会丢弃有意义的差异信息。另外,围绕负期望猜测值设计的评分函数的理论研究发现,这些函数往往能提高信度和区分能力,尤其是一旦引入猜测扣分。

三项实践检验可以告诉您在自己的数据中,这种转变是否确实有效:

题目-总分相关性。切换到部分积分后重新计算。与总分相关性提高的题目,在新的评分规则下能更好地区分强弱表现者。

前后Cronbach's alpha值比较。用同一测试数据集分别运行两种评分规则,并直接比较alpha值。有意义的增加是强烈信号,表明部分积分捕获了二元版本所丢弃的信息。

IRT拟合统计量(在已使用Rasch或其他IRT模型的情况下)。若类别阈值出现无序排列——即较高的评分标准分数并不对应较高的估计能力——则表明评分标准需要修订,无论原始信度数字显示什么。

这一切都不是免费的。评分复杂性随每增加一种公式变体而上升,一旦引入任何基于评分标准的组成部分,评分员差异性就成为现实问题,当您需要超出简单答案键的软件或电子表格基础设施时,管理成本也会增加。请将这些成本与您实际的利害关系相权衡。每周测验很少能证明这种开销是合理的;认证考试几乎总是可以。

多项选择题的评分模板

多项选择题——学生从较长列表中选择多个选项——是猜测对测试效度造成最大损害的地方。一名在六个选项中有四个正确答案的"选择所有符合的"题目上选择全部选项的学生,在朴素的比例评分下总能获得部分积分,无论他们是否真正了解内容。

解决方案是围绕期望值构建的评分模板。一种常见结构:当学生恰好选择了答案键(完整正确集合)时,或在某些表述中,当每个干扰项都被正确排除时,给予p1分;否则应用pc − m公式,其中pc是正确比例,m是按答案键之外的选择比例缩放的扣分值。目标——正如正式的评分函数研究所阐述的——是确保数学本身能抑制粗心的过度选择。

  • 设定扣分值(m),使选择所有选项或随机选择的期望值为负或最多为零。
  • 在部署题目前,用"选择所有选项"的回答测试您的扣分值。如果该回答得分高于零,则扣分值太小。
  • 也要用真正诚实的部分知识回答来测试。如果一名学生正确识别了4个正确选项中的3个,并排除了两个干扰项,但得分却不如广泛猜测的人,则扣分值太大。

题目措辞与其背后的公式同样重要。"选择所有正确答案"的说明,如果没有任何关于扣分的说明,会推动学生去猜测——因为措辞本身没有给出任何不利信号。添加一句简短说明,指出错误选择会降低分数,您就能获得更诚实的部分知识报告,因为学生不再有动机去选择那些他们不确定的选项来对冲风险。

规模化前的从业者治理检查清单

在将部分积分推广到试点组之外之前,请进行以下四项检查:

  1. 评分标准清晰度。确认每个评分标准等级都有明确、可观察的锚定描述,而不仅仅是"基本正确"之类的模糊标签。
  2. 评分员间信度。让两名评分员独立对相同的20到30份样本回答进行评分,并在依赖单一评分员的大规模评分之前检查一致性。
  3. 试点比较。在旧评分规则和新部分积分规则下对相同回答集合分别评分,并并排比较信度和成绩分布。
  4. 敏感性分析。稍微调整您的扣分权重或积分分配,然后重新运行分析。评分模型指南建议进行这一步骤,因为微小的权重变化可能会翻转信度结果或完全改变候选人排名。

记录每一项评分决策,包括选择特定公式或扣分值的原因,以利益相关者日后可以审查的格式保存。这份记录是将一个可辩护的试点转变为可辩护政策的关键。

部分积分何时值得其复杂性

部分积分是一种带有真实行政成本的测量升级,假装情况并非如此,会对首次尝试的人造成伤害。信度和区分度的提升有充分的文献记录,但额外的负担同样如此:更多的评分员培训、更复杂的公式、对于特定题目上"部分"究竟意味着什么存在更多分歧的空间。

我对研究的诚实解读是,大多数课堂级别的评估不需要Rasch标定、子集选择扣分,或上述任何更复杂的机制。清晰的评分标准加上比例分数转换,覆盖了绝大多数真实课堂需求。部分积分在规模化时才值得其复杂性:认证考试、多版本测试项目,以及任何错误的评分假设会在数千名考生而非三十名学生身上累积的评估。

操作负担正是好的平台工具改变计算方式的地方,特别是当您想要自动化全球招聘并降低合规风险时。一个能自动化评分标准应用、追踪评分员一致性并记录评分决策的工具,消除了大多数阻止教育工作者尝试部分积分的摩擦。先进行试点,将信度提升与增加的成本相权衡,只有当数据真正支持时,才将该方法规模化。

— Jimmie

无需自建基础设施即可构建部分积分评估

部分积分评分中大部分的摩擦不在于数学本身,而在于基础设施:编写一致的评分标准、保持评分员步调一致,以及确信没有人在测试中作弊。Talent Approved围绕按需付费模式构建,无需订阅,因此您只需为已完成的候选人评估付费,省去了偶尔才需要的评分软件许可的开销。

Talent Approved

该平台的Magic Create功能直接从职位描述或技能列表构建针对特定职位、配备评分标准的评估,完全省去了手动编写题目的阶段。内置的防作弊工具——包括屏幕和摄像头监控以及会话回放——与评分员培训保护建构性回答评分标准完整性的方式相同,保护部分积分结果的完整性。AI生成的绩效摘要将小数分数转化为可读的候选人排名,无需团队手动解读原始的评分标准数学。

如果您是在评估技能而非给学生评分,并希望获得部分积分式评分而不必拥有评分基础设施,请查看技能评估定价页面,了解您下一轮招聘的试点评估费用。

参考资料

常见问题

如何计算部分积分?

将已得分数(正确选项数、评分标准等级或子集匹配度)除以该题的最高可能分数,然后乘以题目的总分值。子集选择和线性扣分方法在最终乘法之前会减去错误选项的加权扣分值。

评分方法的三种主要类型是什么?

在评估设计中,三种广泛的方法是:二元(是非)评分、部分积分评分(比例、子集选择或基于扣分的公式),以及针对建构性回答的基于评分标准的分数转换。每种方法适合不同的题目形式,没有哪种方法在所有情境中都是最优的。

什么最常破坏部分积分评分系统?

不清晰的评分标准锚定描述和不一致的评分员培训是最常见的失败点,因为它们在评分员之间引入了任何公式事后都无法纠正的分歧。紧随其后的第二大问题是扣分值设置过小,使随机猜测在统计上仍然有利可图,而非被抑制。

部分积分真的能提高测试信度吗?

对多项选择题的实证比较发现,与二元评分相比,部分积分评分同时提高了信度和区分度,尤其是当评分函数对错误选择进行扣分时。这种提升并非自动发生,它取决于评分标准的清晰度和扣分值的合理设置。

平台能否处理技能评估的部分积分评分?

可以。Talent Approved支持基于评分标准的评分,并配备其Magic Create评估构建器和防作弊监控,让招聘团队无需自建计算基础设施即可应用分数转换评分逻辑。当前定价列在技能评估页面。