开卷在线测评如何预测招聘团队的90天绩效结果

开卷在线测评如何预测招聘团队的90天绩效结果

开卷在线测评是有时间限制的、针对特定岗位的远程测试,候选人可以查阅在实际工作中会用到的资源,例如文档、电子表格或搜索工具。这类测评最适合本身需要调研、判断或工具使用的岗位,而对于以测试无辅助记忆为核心的合规、安全或资质认证岗位则效果很差。部分平台提供可直接根据职位描述在几分钟内生成测试的工具。


TL;DR:

  • 开卷测评最适合需要调研、查阅文档或使用工具的岗位,不适合需要即时记忆的安全或合规职位。
  • 测评交付方式应根据岗位需求决定:无监考测评适合大规模筛选,而需要严格验证的岗位则必须采用有监考测试。
  • 设计有效测评需要进行岗位分析、使用简短的岗位专属任务、在候选人提交答案前制定评分标准,并对评审者评分进行校准,以确保公平性和预测准确性。
  • 摄像头监控和会话回放等反作弊措施应做到透明、获得授权,并与无障碍访问安排相平衡,以防止偏见。
  • 测评分数应与结构化面试和绩效数据相结合,并定期跟进,以验证和提升评估流程的预测效力。

Talent Approved
超越简历,评估真实技能
根据职位描述创建针对性测评,通过结构化测试和 AI 生成摘要评估候选人能力。
探索 Talent Approved

目录

开卷在线测评对招聘团队意味着什么

忘掉课堂上的那种概念吧。在招聘领域,开卷在线测评是一种有评分、针对特定岗位的任务,候选人可以使用在实际工作中会用到的任何资源。这里不考察死记硬背的知识,目标是能力,而非记忆力。

测评交付方式分为三种,各有实际的权衡:

  • 开卷、无监考:候选人独立完成,可完全访问所有资源。部署最快,阻力最低,候选人体验最佳。
  • 远程监考:通过摄像头和屏幕监控追踪整个会话过程。更适合需要无辅助表现的岗位。
  • 混合式:研究任务阶段开放资源,特定阶段锁定浏览器。常见于技术筛选,其中部分任务考察原始技能,部分任务考察解决问题的能力。

根据远程招聘技能测试结构化指导,大多数设计良好的测评时长为 30 至 90 分钟。设定时间限制对公平性的意义不亚于其对流程管理的意义。没有明确时间限制的任务会让花费大量时间的候选人占据优势,而这些任务本应在更短时间内完成——这样衡量的是候选人的空闲时间,而非技能水平。

开卷 vs. 有监考:如何选择

交付方式应直接依据岗位的实际需求来确定,而非取决于测评工具的默认设置。

  1. 当任务与实际工作相符时,选择开卷。如果工作本身需要查阅文档进行调试、参考风格指南进行写作,或借助计算器分析数据,那么不允许候选人使用这些工具进行测试,实际上考察的是错误的东西。
  2. 合规和安全岗位选择有监考或闭卷。对于无辅助情况下答错即代表真实能力缺口的职位——临床判断、财务管控、安全关键操作——需要更严格的管控。大型公共部门招聘系统专门为需要严格验证和可靠性的岗位保留有监考测评。
  3. 考虑招聘量和候选人体验。开卷测评在大量申请人的场景下更易规模化推广,因为其所需设置更少、无需监考基础设施,且对候选人的阻力更小——当你为单一职位筛选数百名申请人时,这一点尤为重要。

任何方向的错误决策都会付出代价。对本不需要监考的岗位实施监考,会因其侵入性而赶走优秀候选人;对需要无辅助技能的岗位省略监考,则会得到嘈杂、虚高的分数。

构建有效的开卷测评:经得起考验的设计原则

每一个可靠的测评,都始于第一道题目撰写之前。根据循证招聘流程指导,岗位分析——梳理该岗位实际需要完成的任务和达成的成果——是整个测评的基础。跳过这一步,你测评的技能就无法预测绩效表现。

在此基础上,有四条设计原则将真正有效的测评与看起来不错但实则无效的测评区分开来:

  • 使用简短、贴近岗位实际的工作样本。一项能反映候选人入职后 90 天内实际工作的任务,永远胜过一道通用题目。实践设计指导表明,按预设评分标准评分的标准化样本是预测效力最强的形式。
  • 为每项任务设定时间限制。将候选人的时间控制在合理范围内,通常为 30 至 90 分钟,切勿将未支付报酬的实际生产工作伪装成"测试"。
  • 在看到任何一份提交答案之前,先写好评分标准。在审阅候选人答案之后才确定评分标准,会引入偏见——哪怕是无意识的偏见——倾向于那些答案听起来最出色的人。
  • 对评审者进行交叉校准。两位招聘经理对同一份答案的评分,应该相差一两分以内,而不是相差三个档次。

评分标准的用语与其结构同样重要。可观察行为指导建议使用具体、可观察的标准,而非模糊的标签。"沟通能力强"对评审者毫无操作指导意义;"能在两句话以内用通俗语言解释技术权衡"则为每位评审者提供了统一的衡量标准。Talent Approved 的测评模板等工具有助于在不同岗位系列间实现标准化,这样为某个职位撰写的评分标准就不必在下一个职位招聘时从头重建。

专业建议:在向真实候选人开放测评之前,先用两三份样本答案试用你的评分标准。如果评审者对评分意见不一,那需要改进的是评分标准,而不是候选人。

若想深入了解如何选择测试哪些技能,请从岗位需要产出的成果出发,逆向推导出能够揭示这些成果的任务。

远程测评中的反作弊、隐私与公平性

开卷测评同样需要安全机制。资源的使用是被允许的,但参加测试者的身份以及其工作成果的真实性,不能打折扣。

常见的反作弊工具带来真实的隐私权衡,候选人有权提前了解:

  • 浏览器锁定在计时阶段限制切换标签页;请在会话开始前披露这一点,而非事后告知。
  • 摄像头监控确认参加测试者与申请人身份一致;始终需要清晰的知情同意声明,而非隐藏在某处的复选框。
  • 会话回放让评审者可以看到候选人解决问题的过程——对于发现外部帮助很有价值——但应仅限于与招聘相关的审查,不得无限期存储。

无障碍访问安排不能作为反作弊设计的事后补丁。应提供替代格式、将延长时间作为标准住宿选项,以及一个不要求候选人在表单字段中填写诊断信息的申请流程。避免使用行业术语。"申请住宿安排"比一个充满临床专业词汇的下拉菜单要好得多。

每一项自动化决策都需要可导出的记录:谁参加了测试、何时参加、系统标记了哪些输入,以及在任何高风险拒绝决定作出之前,人工审阅了哪些内容。SHRM 关于技能型招聘的指导在这一点上直言不讳:将技能测评与盲评相结合能扩大人才库、减少偏见,但仅凭测评本身无法消除偏见,人工审阅仍是最后的保障。

预测性回报是真实存在的。《快公司》报道称,90% 使用技能测评的雇主表示错误招聘有所减少,91% 表示员工留任率有所提升。这就是将设计工作做对所能带来的回报。

将测评分数转化为招聘决策

分数只是一个数据点,而非最终裁决。这样看待它,你的招聘流程才会既更快又更准确。

  1. 将测评分数与结构化面试和背景调查相结合。根据使用测评结果做出明智招聘决策的指导,任何单一证据来源都不应单独承担招聘决策的责任。在开始比较候选人之前,先建立一个有文档记录的决策矩阵,对每项输入进行权重分配。
  2. 让评审者在小组讨论前独立打分。一旦某位评审者公开表明意见,锚定偏差就会迅速蔓延。
  3. 进行入职后 30 天和 90 天的跟进。将测评分数与实际工作表现进行对比,以验证你的评分标准,然后加以修订。大多数招聘团队止步于此,而这恰恰是真正证明测评有效性的关键步骤。
  4. 将 AI 用于分流,而非判断。AI 生成摘要和快速候选人评估工作流能加快大规模审阅的速度,但对于处于边界线的候选人,最终决定应由人来做出。

测评在初步简历筛选和结构化筛选之后进行,而非之前——这样能将评审者的精力集中在已通过第一关的候选人身上,尊重整个流程中每个人的时间。

为什么评分标准比测试本身更重要

大多数招聘团队对测评题目本身投入了过多心思,却几乎不关注为其评分的标准。这完全本末倒置了。题目只是传递方式,评分标准才是让结果具有可辩护性、在候选人之间可比较,以及在三个月后当有人问起某位候选人为何被拒时仍能派上用场的关键所在。

为什么评分标准比测试本身更重要——概览示意图

我认为,开卷测评设计中最大的错误,不是选错了交付方式,而是跳过岗位分析、因为省事而编写了一个通用任务。一道通用编程题或一个套路化的写作提示,几乎无法告诉你某人在你的具体岗位上会有怎样的表现。一些解决方案使用 AI 生成与岗位实际需求挂钩的测评,而非套用固定模板。将其与 AI 生成摘要和反作弊监控相结合,有助于让评审者将时间花在需要判断的决策上,而非行政整理工作上。

从一个岗位系列入手,先写评分标准,在将这套方法推广到其他地方之前,先衡量分数是否能预测 90 天内的工作表现。

— Jimmie

开始使用 Talent Approved 的技能测评

目前有一些平台专为本文所述工作流而构建:针对特定岗位的测评、快速生成、评分一致。部分工具能在几分钟内将职位描述转化为量身定制、有时间限制的工作样本,避免了为每个空缺职位重复使用通用模板的需要。

Talent Approved

反作弊监控和 AI 生成的候选人摘要承担了审阅过程中的繁重工作,让你的团队专注于真正需要人来判断的决策。由于定价采用按使用付费模式,每位完成测评的候选人收费 5 美元,在招聘周期间隔期间无需承担订阅费用。如果你希望每次测评都附带可供审计的有效性记录,这一功能已包含在同样的 5 美元费用中。前往定价页面查看详情,立即针对当前空缺职位运行你的第一个测评。

参考来源

常见问题

招聘中的开卷在线测评是什么?

这是一种有时间限制、针对特定岗位的远程测试,候选人可以使用文档或调研工具等资源,模拟其在实际工作中的表现方式。它考察的是应用能力,而非死记硬背的知识。

候选人测评应持续多长时间?

大多数设计良好的测评时长为 30 至 90 分钟。更长的任务会引发无偿劳动方面的顾虑,并导致完成率下降,同时并不能提升预测准确性。

什么情况下应选择有监考测试而非开卷测试?

对于合规、安全或资质认证岗位,若无辅助表现本身就是被考察的技能,则应选择有监考交付方式。当工作本身涉及调研、查阅文档或工具使用时,开卷测评更为合适。

开卷测试会增加作弊风险吗?

它改变了风险形态,而非彻底消除风险——这正是摄像头监控、会话回放和浏览器锁定作为可选安全层存在的原因。在会话开始前做到清晰告知和信息披露,与这些技术手段本身同等重要。

Talent Approved 每次测评收费多少?

Talent Approved 按每位完成测评的候选人收费 5 美元,无需订阅。仅在候选人完成测试后才产生费用。