教育工作者几分钟内部署题目随机化测试

教育工作者几分钟内部署题目随机化测试

题目随机化测试会为每位学生呈现不同的题目顺序、答案排列或题组,从而使抄答案或偷看邻座屏幕的行为失效。这种方式的主要优势在于减少未经授权的信息共享机会,但只有当底层题目库具备同等难度且深度足够、不会出现重复的情况下,这一技术才能保持公正。


TL;DR:

  • 随机化效果最佳的条件是题目库深度充足且平衡良好——每10道题对应至少100至200个题目,以最大程度减少重叠。
  • 同时结合多种随机化技术,尤其是在题目、选项和交付方式上同步变化,能显著提升作弊难度。
  • 正确的设置包括:按学习目标和难度为题目打标签、使用种子值预览测试,并详细记录每位学生所接收的试卷版本。
  • 使用多个小型子题库并保持较低的题目与题库比率,已被证实能有效减少大班级中的重叠和连续重复题目。
  • Talent Approved 等自动化评估工具能简化随机化和防作弊措施,在确保公平性与安全性的同时,显著缩短设置时间。

目录

什么是题目随机化及其重要性

题目随机化涵盖两种相关操作:打乱题目的出现顺序,以及从更大的题库中抽取题目,使不同学生看到完全不同的题目子集。前者可防止学生偷看邻座屏幕并对比答案位置;后者通常被称为随机抽题考试(RSQE),可防止昨天参加考试的学生将答案发送给今天参加考试的朋友。

各机构依赖这一方式有三个实际原因:

  • 远程和在线考试取消了监考员对考场的物理管控。
  • 自动评分系统需要结构化题目,因此随机化可在不增加人工审核工作的情况下实现规模化。
  • 大型课程会在多次考试中复用同一题库,随机化可防止这种复用造成题目泄露。

随机化并不能替代监考或抄袭检测,它是一种结构性手段,通过从源头上降低作弊的收益,使其他工具发挥更大效力。

题目随机化的类型与技术

以下四种技术基本涵盖了教育者的大多数需求,且可叠加使用。

  1. 打乱题目顺序。相同的题目组以不同的顺序呈现给每位学生,从而破解"对比答案位置"式的简单作弊行为。
  2. 打乱答案选项。在选择题中,选项本身会轮换排列,使"答案是C"这类信息失去共享价值。
  3. 从子题库中随机抽取。每位学生不再统一作答同样的40道题,而是从数十个等效子题库中各自抽取一定数量的题目,使每份试卷看起来都各不相同。
  4. 逐题呈现方式。学生完成当前题目后才能看到下一题,防止其纵览整份试卷并与他人实时协调答案。

将以上四种方式结合使用,会大幅提高作弊成本,因为学生不仅需要协调答案,还需要对应不同测试中的位置、措辞和答题节奏。但有一点需要注意:某些选项不应参与打乱。如果"以上均不正确"这类选项始终排在最后,将该位置固定而打乱其余选项可保持题目的逻辑合理性。

专业提示:在发布前,先以预览模式运行打乱后的测试。意外被打乱的固定答案选项,是教育者在发布后反映最多的随机化问题。

如何在LMS或评估工作流程中设置随机化

大多数学习管理系统和调查平台已内置所需的控制选项。工作重点不在于寻找隐藏设置,而在于合理组织内容,使这些设置能按预期运行。

  • 建立带标签的题目库。按主题和难度对题目进行分组,并为每道题标注其所考查的学习目标,确保随机抽取后仍能覆盖正确的考查内容。
  • 设定抽取规则。按模块配置"从该题库抽取X道题",而非从一个大题库中随机抽取,并在适当位置开启选项打乱功能。
  • 使用种子值预览。Qualtrics等平台提供随机模块功能文档,支持生成测试抽取结果,便于在学生查看前进行确认。
  • 锁定需要固定的内容。固定位置的答案选项以及与无障碍访问相关的设置(如延长时间、屏幕阅读器)需要在打乱过程中保持不变。
  • 导出映射记录。保存种子值或抽取结果与对应版本的记录,以便评分和申诉时能够准确参考每位学生所完成的试卷版本。

Canvas等系统中的题目库正是为此类工作流程而设计的,可从一个共享题库中为每位学生生成独特的题目子集。一项针对RSQE设计的蒙特卡洛研究发现,子题库的数量和抽取比率直接决定了两位学生题目重叠的概率,这也是下一节将详细介绍题库深度的原因。

保持随机化测试公平性的设计最佳实践

随机化的效果取决于题库的建设质量。如果每个子题库中只有五道题,无论打乱算法多么优秀,在大班级中仍会频繁出现题目重复。

题目库随机化与重复流程

最有力的证据来自2022年一项针对600份随机抽题考试的蒙特卡洛分析。研究发现,使用多个子题库并保持较低的题目与题库比率——在5%至10%的范围内——能显著减少学生之间的重复题目和连续重叠题目。实际操作中,一份10道题的考试从100至200道子题库题目中抽取,效果优于从40道题目中抽取。

仅靠深度还不够,以下几条规则同样重要:

  • 同一子题库中的每道题应考查相同的学习目标,且难度大致相当,确保学生不会因运气而抽到难度更高或更低的版本。
  • 每个考试窗口结束后,及时淘汰旧题并补充新题,尤其是在多个班级或学期复用同一考试的大规模课程中。
  • 如果通过模板生成题目,在将新题目加入正式题库前,应先进行难度校验——可使用历史表现数据或模拟项目反应理论(IRT)抽取。

历史上针对随机化选择题考试的实验总体发现,在题目难度经过适当校准的情况下,平均成绩不会出现可量化的下降。这一结论完全依赖于事先完成校准工作。

实施检查清单:设置、元数据与考试当天检查

将考试发布分为三个阶段处理,而非一次性完成所有配置。

  1. 考试前:为每道题标注主题、难度和学习目标。以较低的抽取比率构建子题库。进行试运行预览,并确认固定答案位置在打乱后保持不变。
  2. 考试中:在学生作答过程中实时监控会话日志,并确认无障碍访问设置(延长时间、屏幕阅读器兼容性)在随机化设置中未被覆盖,仍正常生效。
  3. 考试后:导出完整的种子值与学生映射记录,以便准确还原每位学生所完成的试卷版本。对提交结果进行基本的答题模式扫描,并记录公平性指标以供审查。

专业提示:在考试当天就保存种子值与学生的映射记录,而不是等到三周后有人申请重新评分时再处理。等待时间越长,还原学生作答版本就越困难。

管理大规模考生群体的团队通常会将此检查清单纳入更广泛的大批量评估工作流程,使考试当天的步骤成为常规操作,而非每个考试周期都临时应对的状况。

随机化的局限性与辅助诚信工具

随机化能够缩小作弊机会,但无法在事后检测作弊行为,也无法保证每个版本的试卷难度完全相同。

  • 统计检测仍不可或缺。即使题目已被打乱或从不同子题库中抽取,随机化p值检验仍可发现学生之间异常相似的答题模式
  • 与监考和日志结合使用。会话录制和带时间戳的活动日志能捕捉到随机化本身无法发现的行为,例如考试中途切换浏览器标签页。
  • 使用IRT检验公平性。伊利诺伊大学的一项分析,通过对100种排列方式和每位学生500次运行进行项目反应理论模拟,发现大多数随机题库考试的公平性是合理的——该研究使用平均绝对偏差等指标来标记某次抽取是否偏易或偏难。

当公平性检验发现问题时,通常应重新设计子题库,而非放弃随机化方案。

无需手动设置,构建随机化的岗位专属测试

上述所有工作——为题目打标签、构建子题库、锁定固定答案、追踪每位学生所接收的试卷版本——手动配置需要耗费大量时间。Talent Approved 可将这些设置缩短至几分钟内完成。其 Magic Create 功能可直接根据职位描述或技能清单构建岗位专属的技能评估,并调用可复用的题目库,让你无需每次招聘时都从空白题库开始。

Talent Approved

该平台的防作弊功能——屏幕与摄像头监控、会话回放以及完整的种子值映射——可自动处理检查清单中的操作环节;AI生成的摘要功能意味着你无需手动逐一查看每位候选人的原始答题内容来判断公平性或标记异常。由于 Talent Approved 按每位完成评估的候选人收取5美元,无需订阅,进行大规模招聘的团队可获得本文所述的随机化、安全测试基础设施,而无需为一年只用两次的软件付费。立即开始构建评估,看看一份职位描述能多快转变为一份实时的、防篡改的测试。

作者观点:真正能发挥作用的是什么

大多数团队在打乱设置上投入过多,而在题库深度上投入不足。拥有较低抽取比率的宽题库对公平性的贡献,远超任何打乱开关的效果。高风险评估应从比看起来必要的数量更多的子题库开始,进行试运行,并让考后公平性数据——而非直觉——告诉你哪些题库过于单薄。

— Jimmie

参考来源

常见问题

什么是随机化测试?

在评估设计中,随机化测试是指向每位考生呈现不同的题目顺序、答案排列或题目组合,通常还会配合事后使用的统计随机化p值检验,用于检测学生之间是否存在可疑的答题模式相似性。

题目随机化是什么意思?

随机化题目是指:该题目对每位考生出现在不同位置,或其答案选项被打乱排列,或从等效题目池中随机抽取,使不同学生可能根本看不到同一道题。

最常被随机化的五种题型是什么?

选择题、判断题、匹配题、填空题和简答题都是常见的随机化题型,其中选择题的处理方式最为精细,因为题目顺序和答案选项顺序可以独立打乱。

如何在不影响公平性的前提下实现题目随机化?

使用多个子题库并保持较低的题目与题库比率(通常为5%至10%),并在题目上线前确认同一子题库中的每道题考查相同的学习目标且难度相近。

Talent Approved 能自动随机化评估题目吗?

可以。Talent Approved 的可复用题目库和 Magic Create 功能,让招聘人员无需从头手动配置题库,即可构建具有随机题目抽取和内置防作弊监控功能的岗位专属评估。