消除噪声:评估人员提升测试效度与信度的9个步骤

效度探究的是一个分数是否代表你期望它代表的含义。信度探究的是如果明天对同一个人进行测量,该分数是否还会再次出现。两者相互关联,但不可互换:信度是效度的必要条件,但非充分条件,因为一项测验可以产生极为一致的分数,却完全测量了错误的内容。以下内容将逐一分析证据类型、用于估计各类证据的统计方法,以及构建一个在两方面都经得起检验的测评工具的实操步骤。
内容摘要:
- 高信度是首要条件,因为不一致的分数无法支撑有效的测评,尤其是在测量那些应保持稳定的特质时。
- 效度取决于测验分数是否能准确预测预期结果,内容、内部结构、与变量的关系、作答过程以及后果是关键证据来源。
- 收集有力的效度证据需要明确目的、制定内容蓝图、对代表性样本进行试测,并分析构念与效标之间的关系。
- 大多数测评问题源于测量误差过大,可通过有针对性的题目设计和标准化施测来改善,而不仅仅依靠内容审查。
- 使用针对岗位的题目生成功能和内置防作弊工具可简化验证流程,在无需大量手动操作的情况下持续提供证据,尤其适用于基于岗位的测评。
目录
- 理解测验效度:它的真正含义
- 理解测验信度:一致性优先于准确性
- 重测信度、内部一致性与评分者间信度详解
- 信度高却有偏差,或效度好却噪声大:厘清混淆
- 收集效度与信度证据的分步计划
- 提升测评质量的实用清单
- 测评平台如何在实践中记录效度
- 研究真正告诉你应优先关注什么
- 无需手动留存证据,构建经验证的测评
- 参考资料
- 常见问题
理解测验效度:它的真正含义
效度并不是测验像贴认证标签一样与生俱来的属性。它是一套基于证据构建的论证,用以说明分数的解释是否支持某一特定的预期用途。一项编程测评对于预测在职调试表现可能具有很高的效度,但对于预测领导潜力则完全无效,尽管测验本身完全相同。分数没有改变,改变的是你基于分数所做出的判断。
很多混淆就从这里开始。人们会问"这个测验有效吗?",好像效度是非此即彼的,但《教育与心理测验标准》将其定义为一个统一的效度论证,由五类证据来源共同构成,而非一份独立"类型"的清单。这五类来源分别是:
- 内容证据——测验题目是否真实代表了所涉及的领域或技能?
- 内部结构证据——统计上归为一组的题目是否与它们应测量的构念相匹配?
- 与其他变量的关系——分数是否按理论预期与外部指标相关联(这涵盖了旧版教材中所称的聚合效度、区分效度和效标效度)?
- 作答过程证据——考生是否真的在运用你意图测量的技能,还是在钻题目格式的空子?
- 后果证据——使用该测验是否产生了公平、预期的结果,还是对特定群体造成了意外伤害?
目的决定了你最需要哪类证据。招聘前的编程测试更侧重内容证据和效标证据。用于团队分配的人格量表则更侧重内部结构证据和关系证据。效度归根结底取决于测验能否预测其声称要预测的结果,而不在于题目看起来是否精致。
理解测验信度:一致性优先于准确性
信度衡量的是测验在相同条件下反复施测能否产生相同结果。它与结果是否正确无关。一台厨房秤每次放上一磅砝码都显示14盎司,信度完美,但每次都偏差两盎司,始终如一地错误。
信度是测量的一致性和可重复性,反映结果在反复测试中的可靠程度,而效度则是另一个问题,涉及准确性和意义。每一次测量都包含一定量的误差——来自疲劳、分心、措辞模糊或评分者不一致的随机噪声,这些都会使观测分数偏离一个人的"真实"分数。信度本质上是对这种噪声量的估计。
- 低信度意味着分数在不同尝试、不同场次或不同评分者之间出现难以预测的波动。
- 高信度意味着在被测者本身没有发生实质性变化的情况下,分数保持稳定。
- 信度为效度设定了上限:一个噪声很大的测量工具无法与任何事物产生强相关,包括它应该预测的结果。
最后一点值得强调,因为它是两个概念之间的机械联系。任一测量工具的低信度都会限制两者之间可观测相关的最大值,这种效应称为衰减效应。信度的三种常见形式——重测信度、内部一致性和评分者间一致性——各自捕捉不同来源的误差。
重测信度、内部一致性与评分者间信度详解
重测信度衡量跨时间的稳定性。你对同一批人施测两次,通常间隔两到四周,然后对两组分数进行相关分析。它适用于稳定的特质,如一般认知能力或人格维度,而不适合那些本就应该快速变化的构念,如情绪状态或短期压力。
内部一致性衡量同一测验中各题目之间的一致程度,通常通过Cronbach's α来体现。由于只需一次施测即可计算,它是最快捷的信度检验方式,这也是它被过度使用的原因。α对测验题目数量敏感,因此一个很长的测验即便单个题目质量平平,也可能产生虚高的α值。对于题目质量参差不齐的测验,Omega系数能更好地处理这一问题,尽管α仍是行业默认指标。
评分者间信度在涉及人工主观评分时至关重要——例如写作样本、结构化面试或基于视频的任务。Cohen's κ或组内相关系数(ICC)可以量化评分者之间的一致程度,并校正纯属偶然的一致性。
专业提示: 重测相关系数达到相对较高的水平(通常接近 +.80 或更高)通常被视为稳定特质的实践基准。对于那些不应在一周内发生变化的特质,如果数值明显低于此水平,则说明存在设计问题,值得在此基础上构建任何效度论证之前加以调查。
具体情境决定了哪种形式最为重要。一个自动评分的技能测试需要较强的内部一致性,但完全不需要评分者间一致性检验。而结构化面试则几乎在所有其他方面之上,最需要的是评分者间一致性。
信度高却有偏差,或效度好却噪声大:厘清混淆
理解测验效度与信度差异的最清晰方式,是通过两种截然不同却都会破坏测评的失效模式来观察。
- 信度高但效度低:一支每次都高出两度的有偏差温度计。它完全一致,因此信度高,但每次读数都是错的,因此效度低。
- 效度好但信度低:一个只有三道题、却涵盖宽泛能力的技能测试。在许多考生的平均层面上,它可能与工作绩效存在合理的相关,但任何一个人的分数在不同尝试之间波动太大,无法对个体进行可信的判断。
这些例子回答了人们最常搜索的两个问题。哪个更重要?从功能上说,信度优先,因为你无法在不一致的分数之上构建有说服力的效度论证。一个测验可以有信度而没有效度吗?当然可以,而且这种情况在内部一致性良好但对预期用途而言测量了错误构念的测验中不断发生。
如果你的信度很强但效度证据薄弱,解决方法通常在于内容:引入领域专家,检查题目是否真实代表了相应职位或特质。如果信度本身就很弱,再多的效度证据也无法挽救测验。你必须先修复测量噪声——通常是通过增加有针对性的题目或收紧评分规则——效度问题才能真正得到回答。
收集效度与信度证据的分步计划
构建有说服力的效度论证是一个有序的过程,而非一项单独的研究。以下是能够产生真正可信证据的步骤顺序。
- 用一句话定义预期用途。"本测评用于预测客服岗位员工入职前90天的表现"——这样的表述足够具体,可以指导此后的每一个决策。
- 制定内容蓝图。在撰写任何一道题目之前,列出预期用途所需的技能或知识领域,并按重要性加以权重。
- 进行专家内容审查。邀请两到三位领域专家独立评估每道题目是否与蓝图对应,并标记任何偏离之处。
- 在代表性样本上进行试测。即便只有40到80份回答,也能揭示题目层面的问题——措辞混乱、天花板效应、没有人答错的题目等。
- 进行内部结构分析。使用探索性或验证性因子分析,检查题目是否按蓝图预测的方式聚类,并计算每个子量表的Cronbach's α或Omega。
- 检验聚合效度和区分效度关系。将分数与相同构念的成熟测量工具进行相关分析,再与无关测量工具进行比较,以确认测验测量了其声称测量的内容。
- 在可行时收集效标数据。追踪实际结果——工作绩效评级、晋升率、错误率——并将其与原始分数进行相关分析。
- 报告样本量、情境和置信区间。来自一个办公室30人的信度系数,与来自五个国家2000人的系数,意义截然不同。
- 记录完整的论证过程。写下收集了哪些证据、为何收集,以及它如何支持第一步中定义的特定预期用途。
专业提示: 跳过第一步,后续所有内容都会更难辩护。如果预期用途从未被明确写下来,审阅者、审计人员乃至你自己的团队都会不断追问"对什么有效?"。
构建针对特定岗位的筛选测试的团队常常直接跳到试测阶段,跳过蓝图步骤,这恰恰是本末倒置。蓝图才是使后续每一步都具有可解释性的基础。
提升测评质量的实用清单
大多数效度和信度问题都可以追溯到少数几个可修正的设计选择。在发布或修订测评之前,请检查以下几点:
- 每道题目都应对应内容蓝图中的具体条目;删除任何无法证明其存在价值的题目。
- 更多有针对性的题目通常优于更少的宽泛题目,因为增加题目数量可以减少测量噪声并提高内部一致性。
- 标准化施测条件——时间限制、指导语、环境——使分数的差异反映的是被测者本身,而非测试情境。
- 依据共同的评分标准培训评分者,并在信任任何单一评分者的判断之前检验评分者间一致性。
- 在全面推行前先进行试测,将第一版视为需要修订的草稿。
- 尽可能收集效标或聚合效度数据,哪怕是非正式的,并将其与其他证据一并记录。
专业提示: 构建审计就绪型技能测试的雇主往往发现,信度的最大提升来自评分标准化,而不是增加题目数量。一个模糊的评分标准每次都会抵消精心构建的题库所带来的益处。
将题目对应到实际的职位描述而非泛化的技能标签,也能大幅提升内容证据的质量,因为泛化的标签往往导致泛化、低相关性的题目。
测评平台如何在实践中记录效度
手动收集这些证据——题目统计数据存在一张表格里,评分者备注存在另一处,试测数据放在某个文件夹里——正是大多数团队只做内容审查就收工的原因。一个围绕结构化、岗位特定测试构建的平台,可以压缩这一周期,而不是消除严谨性。
直接从职位描述或技能列表生成题目,使你在第一版草稿阶段就拥有内容蓝图,而不是在题目已经存在之后再反向推导。随机题目分发和防作弊监控——包括屏幕和摄像头检查——通过降低分数反映作弊而非技能的可能性,强化了作答过程证据和后果证据。可导出的题目统计数据、会话回放和绩效摘要,将过去零散的验证文件夹变成了近似持续记录的形式。
该平台的方法将每一份完成的测评视为持续效度论证中的一个数据点,而不仅仅是一个招聘决策,这正是可辩护的测试项目与凭直觉拍脑袋之间的区别。
研究真正告诉你应优先关注什么
传统建议与证据支持之间最大的差距在于顺序。大多数指导将效度和信度视为并行的清单,只需各自走一遍即可。它们并不是并行的。信度是地基;效度是在其上构建的内容。再多的专家内容审查,也无法挽救一个分数在每次测试中都大幅波动的测验。

第二个差距更令人不安:团队热衷于内容证据,因为它成本低、速度快——三位专家,一个下午,搞定。效标证据——实际检验分数是否预测了你声称其能预测的结果——在学术研究之外几乎无处不在地被跳过,因为它需要耐心,以及大多数招聘团队从未费心收集的结果数据。
如果你只从这篇文章中带走一件事,那就是:在写下第一道题目之前,先用一句话写下你的预期用途。其他一切——蓝图、统计数据、评分者培训——只有在这句话足够精确的前提下才能发挥作用。预期用途模糊,证据就会模糊,无论因子分析看起来多么复杂精妙。
— Jimmie
无需手动留存证据,构建经验证的测评
手动记录效度论证——在一张表格里追踪题目统计数据,在另一处记录评分者备注,试测数据放在别的地方——正是那种在截止期限压力下悄然被跳过的工作。一款工具直接从职位描述生成针对岗位的题目,在你还没写下一个问题之前就给你一份内容蓝图,而内置的防作弊监控和会话回放则补充了大多数团队根本不会收集的作答过程证据。

无需订阅承诺。按完成测评的候选人付费,因此成本随实际招聘量弹性扩展,而非固定许可费用。如果你正在为特定岗位评估技能,并希望信度和效度证据内嵌于流程之中,而不是事后拼凑,不妨了解一下这个平台,看看一份职位描述如何在几分钟内转化为可测试、可辩护的测评。
参考资料
经典教材仍将内容效度、构念效度和效标效度当作三个独立的方框来讲授。现代心理测量学将它们视为同一论证的不同侧面,一些专家明确反对将它们孤立对待,因为一个测验在某一侧面上表现良好,在另一侧面上却可能严重失败。以下是按收集时机和方式划分的证据实际分布情况:
区分数据收集前的专家判断与数据收集后的统计检验至关重要,因为团队往往止步于第一步。三位领域专家的内容审查看起来很彻底,但它对于测验能否预测任何实际结果毫无说明。
常见问题
效度和信度,哪个更重要?
从功能上讲,信度优先。你无法在不一致的分数之上构建有说服力的效度论证,尽管信度本身永远无法证明一个测验是有效的。
一个测验可以有信度而没有效度吗?
可以。一个测验可以产生高度一致的分数,却仍然完全测量了错误的构念——经典例子就是那台每次都显示相同错误重量的秤。
信度与效度的主要区别是什么?
信度问的是测量是否一致;效度问的是该测量是否真正捕捉了它声称针对特定预期用途所测量的内容。
效度和信度有哪些例子?
一支总是高出两度的有偏差温度计,信度高但效度低;一个三道题的测试平均上能预测工作绩效,但对个体的分数波动很大,效度尚可但信度低。
如何衡量测验信度?
三种最常见的方法是重测相关、内部一致性指标(如Cronbach's α)以及评分者间一致性统计量(如κ或ICC),根据测验是否重复施测、按题目评分还是由人工评分来选择相应方法。