评估无障碍性:NCEO步骤、六维视角与快速可用性测试

评估可及性是指设计测试时,无论学习者的残障状况、语言背景或与技术的交互方式如何,都能衡量其预期技能。最有效的第一步是在编写任何题目之前就规划通用设计,然后在测试交付给应试者之前进行题目级别的可及性检查。联邦法律对此提供了支撑:《美国残障人士法案》(ADA)要求考试机构以残障人士可以使用的地点和方式提供考试。
内容摘要:
- 通用设计应从一开始就纳入规划,并使用带标签的PDF或HTML等无障碍格式,以避免后期代价高昂的改造工作。
- 支持措施分为通用工具、指定支持和合理便利三类,每类所需的审批级别和文件要求各不相同。
- 可及性决策必须迅速作出,以防止剥夺平等机会;同时,合理便利措施不应损害评估的效度。
- 开展题目级别的可及性审查,以及邀请辅助技术用户参与易用性试点,能够发现合规检查可能遗漏的障碍。
- 将评估工具融入日常教学并进行小规模试点测试,可显著提高应试者的成功率,并减少特殊场次的需求。
目录
- 评估可及性的实际涵盖范围
- 每位测试设计者都应了解的法律义务
- 通用设计的实践:将NCEO的步骤转化为行动
- 实用的题目级别可及性检查清单
- 测试的测试:易用性与可及性试点
- 面向考试管理员的培训与沟通
- 团队真正践行通用设计后会发生什么
- 检查清单胜过供应商推介
- Talent Approved 在无障碍工作流程中的定位
- 参考来源
- 常见问题
评估可及性的实际涵盖范围
大多数评估项目将支持措施分为三个层级,混淆这三个层级是团队最常犯的错误之一。通用工具对所有应试者开放,无需提出申请,例如文字转语音、缩放、荧光笔和答案遮挡功能。指定支持需要由教育工作者或团队作出决定,通常是因为该功能会改变部分学生的测试体验,例如调整色彩对比度或安排单独的考试场地。合理便利是限制最多的类别,与个别化教育计划(IEP)或504计划等有记录的方案挂钩,通常包括延长考试时间或配备抄写员等措施。
州级测试项目对此有很好的说明。加利福尼亚州教育厅的可及性资源矩阵在其全州评估中列出了涵盖这三个层级的数十种嵌入式和非嵌入式支持措施。这一区分在操作层面至关重要:
- 通用工具无需任何文书工作,应在日常教学中使用,而不仅限于考试当天。
- 指定支持需要团队决策,但不需要医学或教育诊断。
- 合理便利需要文件证明,并且通常在考试开始前登记到注册系统中。
每位测试设计者都应了解的法律义务
ADA第309条是任何组织——从执照委员会到劳动力认证项目——在实施考试时都必须遵守的核心法规。根据司法部的考试便利措施指南,该条款要求考试机构以"残障人士可以使用的地点和方式"提供考试,并根据申请提供合理便利。
文件标准比大多数人预想的要严格。考试机构可以要求提供文件,但要求必须合理且范围有限,而非穷尽式的资料追踪。接受具备资质的专业人员出具的文件,而无需索取过多额外证明,可以缩短审批时间并保持流程合规。
最容易让评估团队出错的两项义务是:及时性和效度保障。对便利措施申请的决定不能在队列中搁置数周。根据同一份ADA技术援助文件,延迟回应可能等同于剥夺平等机会。此外,无论批准何种便利措施,都必须保留测试所衡量的内容。例如,在阅读理解考试中提供朗读便利,可能会损害测试本身试图评估的核心构念,这也是执照机构会严格审查此类决定的原因。

通用设计的实践:将NCEO的步骤转化为行动
美国国家教育成果中心(NCEO)在其州级通用设计评估指南中详细阐述了一套从一开始就将可及性融入评估建设的九步流程。将其提炼为可执行的操作,评估团队可参考以下步骤:
- 在编写题目之前就规划可及性,而不是等到试点发现问题后再补救。
- 精确界定构念,明确测试必须衡量的内容以及与之无关的内容。
- 在供应商招标文件(RFP)中要求通用设计,确保可及性不会沦为事后才被提及的无偿附加项。
- 在题目编写阶段引入可及性专业知识,而不是仅在合规审查时才介入。
- 在测试上线前进行易用性测试,招募具有代表性的样本参与。
- 开展题目和测试试验,在全面部署前分析结果。
- 每个周期持续监测和修订,因为随着人群和技术的变化,可及性需求也会随之改变。
技术层面与流程层面同样重要。以带标签的PDF、HTML或QTI等语义化、可互操作的格式构建评估(如有支持),而非使用需要后期手动修复的封闭专有文件,这一点在马萨诸塞州教育厅的技术指南中得到了特别强调。从一开始就与WCAG和第508条标准保持一致,可以避免代价高昂的后期改造。
专业提示: 在教学中使用与评估时相同的可及性工具。当学生已经熟悉其文字转语音或缩放工具的使用方式时,测试衡量的是技能本身,而不是他们在压力下学习新界面的能力。
实用的题目级别可及性检查清单
在测试上线前发现障碍,远比在一批学生完成测试后再进行修复节省成本。马萨诸塞州教育厅围绕六个审查维度构建了一套任何团队都可借鉴的检查清单和审查规程。
- 语言要求:词汇是否比构念本身所需的更为复杂?
- 文化偏见:题目是否预设了某些应试者可能不具备的共同经历?
- 技能要求:题目是否只测试了预期技能,还是同时暗中测试了阅读速度或运动协调能力?
- 呈现方式与可读性:文字密度、字号或版式是否会无谓地拖慢低视力读者的速度?
- 作答方式:无法使用鼠标或无法手写的应试者是否能够作答?
- 疲劳度:题目长度或测试时长是否会引入与所测技能无关的误差?
审查规程本身最好作为团队协作来执行。将审查员分配到特定维度,用具体位置和修改建议记录每个问题,然后重新汇聚以整合修订意见,而不是让一个人独自裁决所有问题。
| 常见障碍 | 具体修复方法 |
|---|---|
| 多步骤任务埋藏在一个冗长的题干中 | 拆分为按顺序独立评分的步骤 |
| 图片或图表缺少替代文字 | 添加传达相同信息的描述性替代文字 |
| 单一作答方式(仅限打字) | 提供语音输入或多选题作为备选路径 |
| 句子结构过于复杂 | 在不删除所测概念的前提下简化题干 |
测试的测试:易用性与可及性试点
开展易用性试点并不需要专业实验室。远程出声思考法——让少数应试者在完成题目时口述其思维过程——能够快速发现摩擦点。即使只有三到四名辅助技术用户参与屏幕阅读器演练,也能发现没有残障的题目编写者永远不会注意到的问题,例如一张图表被读取为毫无意义的数字串。
值得追踪的指标很直接:
| 指标 | 揭示的内容 |
|---|---|
| 任务完成率 | 使用辅助技术是否能够完成题目作答 |
| 任务用时 | 疲劳或导航障碍是否导致完成时间虚高 |
| 观察到的障碍 | 应试者卡顿或困惑的具体位置 |
| 辅助技术兼容性 | 屏幕阅读器或放大工具是否按预期运行 |
更难的功课是将这些易用性发现与心理测量检查结合起来。一项改变了题目难度或在不同群体间呈现差异题目功能的可及性修复,在发布前需要重新审视——NCEO指南将此视为不可协商的步骤。可及性与效度并非相互竞争的目标,同步而非顺序地审查两者,才能防止修复悄然破坏测试所衡量的内容。需要以结构化方式追踪此类题目级数据的团队,可以参阅有关以测量为核心的评估分析的相关内容。
面向考试管理员的培训与沟通
便利措施只有在考试当天的执行人员知道如何启用的情况下才能发挥作用。管理员培训应涵盖:提前正确输入嵌入式设置、在不打乱考试安排的情况下处理临时便利措施申请,以及在考试窗口开放前确认辅助技术和设备正常运行——这一做法在Smarter Balanced的易用性与便利措施指南中有所体现。
家长和学习者也需要提前获得通知,并有机会在正式考试前使用实际工具进行练习。
- 在考试窗口开放前确认嵌入式设置已完成输入。
- 为应试者提供使用考试当天实际工具的练习机会。
- 在考试前一天(而非当天早上)检查设备、耳机和辅助技术。
专业提示: 在考试前至少一周以书面形式发送便利措施确认通知。口头"同意"却未录入系统,是考试当天便利措施失败最常见的单一原因。
团队真正践行通用设计后会发生什么
从一开始就将可及性融入设计——而非在收到投诉后才进行补救——的评估团队,往往需要安排的特殊考试场次更少,整体完成率也更高。根据ReadSpeaker关于包容性考试设计的文章,将文字转语音等工具嵌入日常教学而非仅限于考试,能在完成率和应试者信心方面带来可量化的提升。
平台可以加速部分工作流程,但无法取代其背后的人工判断。工具可以标记缺少替代文字标签的情况,却无法判断某项便利措施是否保留了测试所考察的构念。无论周围有多少自动化,这一责任始终由设计团队承担。
检查清单胜过供应商推介
以下是该领域研究实际支持的观点,它与许多惯常建议相悖:购买一个"无障碍"的测试平台,并不等同于拥有一套无障碍的评估。合规供应商很乐意向你出售交付层面的WCAG符合性,而题目本身依然可能将一道数学题埋藏在三句无关背景信息之中,或者预设与所测技能毫无关联的文化知识。平台从来都不是薄弱环节。

题目级别的检查清单枯燥乏味,这恰恰是大多数团队跳过它的原因。这不是一个采购决策,而是某个周二下午,三位审查员为一道应用题的词汇究竟考的是数学还是阅读而争论不休。这种争论,在测试中每一道题上反复发生,才是可及性真正得以建立的地方。供应商的可及性功能固然重要,但它们只是底线,而非策略。
如果你读完这篇文章只改变一件事,那就选择易用性试点吧。一小组辅助技术用户完成你的测试,往往能发现比合规审计更多的真实障碍——而且你不需要专业实验室或供应商合同来开展这项工作。
— Jimmie
Talent Approved 在无障碍工作流程中的定位
Talent Approved 不会取代你的题目审查规程,也不应该尝试这样做。它擅长的是减轻工作流程中最耗时环节的手动负担。一款能够在几分钟内根据职位描述构建针对特定职位评估的工具,可以让你的审查员将时间集中在真正重要的可及性维度上——语言、文化、技能要求、疲劳度——而不是从零开始起草题目。

防作弊监控和AI生成的绩效摘要可以在测试上线后处理审查工作,为招聘团队提供清晰、一致的结果解读,同时不会为便利措施处理增加额外的行政负担。这些都无法替代从一开始规划通用设计或开展自己的易用性试点的工作,只是确保围绕这些决策的工具不会拖慢你的步伐。如果你的团队已准备好构建针对特定职位的评估,并希望检验该工作流程是否符合你自己的可及性检查清单,可以直接试用 Talent Approved。
参考来源
常见问题
什么是评估中的可及性?
评估可及性是指无论应试者的残障状况、语言背景或所使用的作答技术如何,测试都能为每位应试者衡量预期的技能或知识。这要求在设计时将通用工具、指定支持和合理便利措施内置其中,而非事后补充。
评估便利措施有哪些例子?
常见的便利措施包括:延长时间、配备抄写员或朗读员、单独考试场地、屏幕阅读器兼容性,以及语音输入等替代作答方式。便利措施通常与IEP或504计划等文件挂钩,这与向所有人开放的通用工具有所不同。
需要检查的四类可及性障碍是什么?
实用审查涵盖四个核心领域:语言要求、文化偏见、超出所测构念的技能要求,以及呈现方式、可读性和作答方式等物理或感官障碍。许多团队还会增加第五个维度——测试时长带来的疲劳——以捕捉与所测技能无关的误差。
哪些工具支持无障碍在线评估?
文字转语音、缩放和答案遮挡等通用工具,结合带标签的PDF或HTML等语义化、可互操作的文件格式,构成了无障碍在线测试的技术基础。Talent Approved等平台可以加速构建针对特定职位的测试,但可及性审查和易用性测试仍需针对题目内容本身来进行。
便利措施决策应该花多长时间?
ADA没有规定固定的天数,但指南明确指出,不必要的延误可能等同于剥夺平等机会。考试机构应将响应时间表纳入其流程,而不是让便利措施申请在接近考试日期时仍悬而未决。