技术手册 · v1.0 · 2026 年 7 月

AssessFit 测评究竟如何运作

这是采购团队会索要的那份文件:开发方法、施测、评分、常模、信度、效度、公平性与安全——每一句都写成可对照运行中的平台验证的形式。凡是实时测得的数字,我们展示实时数字;凡是承诺而非事实,就标明是承诺。

1. 目的与预期用途

AssessFit 提供入职前测评,帮助雇主就与岗位相关的能力、知识、工作风格与判断力比较候选人。分数被设计为招聘决策中 多个输入之一的结构化输入 ——与面试、工作履历和背调并用。它不是医疗、临床或诊断工具,且 AssessFit 的设计确保最终录用决定始终由人做出,而非算法。

本手册描述平台今日所建的方法论。其结构遵循 SIOP 《原则》 与 AERA/APA/NCME 《标准》 对选拔程序文档化的建议(见 参考文献).

2. 测评架构

本库包含 100 项测试 ,建立在 854 道题的题库之上,横跨五个领域:

领域测量内容形式
认知能力数字、语言、逻辑、空间与机械推理,工作记忆,处理速度,注意力多选题,自适应
岗位技能53 项领域知识测试(财务、IT、营销、运营、医疗辅助、技工等)多选题,自适应
情境判断伦理、优先级、领导力、客户情境、危机响应情境多选题
工作风格尽责性、沉着、诚信、团队协作、适应力及另外 10 个量表李克特自评,含反向计分题
语言商务英语(对齐 CEFR)、书面沟通、校对多选题

每项多选测试是按难度标注的 9 题题库(3 易 / 3 中 / 3 难),题目标识符稳定。每个岗位最多可组合五项测试;平台的 1,000+ 职业目录为每个职位推荐循证组合。

3. 测试开发

题目按明确规则编写,发布前经机器校验:

  • 唯一站得住脚的正确项。 每题必须有且仅有一个无歧义的正确答案,加三个像样但错误的干扰项。正确性可争论的题目在评审时被拒。
  • 重概念,轻冷知识。 题目考查稳定的概念,而非绑定版本或会过期的事实。
  • 文化中立。 情境取自普适的职场场景;在构念允许处,认知题降低语言负载。
  • 答案位置均衡。 正确答案在各选项位置近乎均匀分布(当前题库:与均匀分布相差 ±1% 以内),位置猜题策略无利可图。
  • 结构校验。 自动校验器强制执行:全库唯一的题目标识符、严格的 3/3/3 难度构成、每题四个选项、答案键在合法范围内,并拒绝正确答案文本与其他选项重复的题目。

4. 施测与自适应设计

候选人收到随机化的 两阶段自适应卷:第一阶段抽取 3 道中等题;答对至少 2 题者进入 3 道难题,其余获得 3 道易题。没有两位候选人的试卷相同,题目顺序也随机。每项测试有独立时限;总时限在开始前展示给候选人。

答案从不离开服务器:客户端只收到题干和选项,所有对错判定都在提交时于服务器端完成。

5. 评分

  • 多选测试 在服务器端按两个自适应阶段的答对数评分。
  • 工作风格量表 按 0–100 计分,反向题在汇总前翻转;未作答的陈述按量表中点计分,而非向有利方向填补。
  • 综合分。 雇主为简历匹配、技能测试与工作风格设定透明权重;综合分是加权平均,权重可见——不施加任何黑箱因子。
  • 诚信结论。 会话行为信号(见 §10)产生独立的诚信分数与结论;诚信从不悄悄改动能力分——它与能力分并列呈报,供人工审阅。

6. 常模

百分位对照 经验常模组计算:同一岗位模板下真实完成的测评,采用中点百分位法。两条规则保证其诚实:

  • 每个百分位都连同其常模组的真实规模展示("n = 40"),绝不使用夸大的汇总数。
  • 不使用合成或购买的常模。常模组仍小到不足以有意义时,只展示原始分,不做百分位声明。

平台级完成数公开且实时:迄今 次测评完成

7. 信度与题目质量

题库中的每道题都基于真实候选人数据持续监控:

统计量定义处置阈值
难度(p)答对比例p > .95 标记过易;p < .20 标记过难
区分度(rpb)题目对错与候选人测试总分的点二列相关n ≥ 20 时 r < .05 标记为弱; n ≥ 10 时 r 为负即标记疑似错误答案键 并立即复核
作答时间每题平均秒数离群值复核是否歧义或泄题

被标记的题目经复核后退役或替换;由于测试是题库制,退役不影响施测。

为什么我们尚不引用 α 系数。 经典内部一致性系数假设每位候选人作答相同题目;我们的自适应卷有意打破这一点。与其发布用不合适数据算出的 α——或从宣传册抄来的数字——我们实时发布上述题目级统计。当作答矩阵足以支撑时,我们将发布平台级信度分析,并附样本量。

8. 效度

内容效度

目录中 1,000+ 个职业名称各自映射到 30 个职业画像之一,每个画像的推荐测试组合由岗位相关构念与测试匹配而成(如仓储岗 → 物流运营、安全、注意力;护理岗 → 患者情境、护理知识、诚信)。雇主可查看并编辑每个组合——没有任何隐藏。

效标效度——你自己的证据

AssessFit 内置 预测效度仪表盘:雇主为已录用者的在岗表现评分,平台计算测评分数与这些评分的相关——整体与分测试均有,且始终附样本量。这是本地化效度研究,即 EEOC 统一准则视为最有力的证据形式,持续产出且无额外费用。

承诺。 随着匿名化跨雇主结果数据的积累,我们将发布平台级效标效度摘要,附样本量与置信区间——发布在本手册,而非新闻稿。元分析文献的参照:一般认知能力预测工作绩效约为 r ≈ .3–.5(Schmidt & Hunter, 1998)。

9. 公平性

  • 从构造上即盲评。 AssessFit 不向候选人收集种族、宗教、性别或年龄,评分管线中任何位置都不存在此类变量。
  • 不做人脸分析。 不做情绪推断,不做视频评分,没有伪科学信号。
  • 低语言负载的认知题 在构念允许处,降低与构念无关的语言负担。
  • 雇主责任。 根据 EEOC 统一准则,不利影响分析基于雇主自身的申请者流。AssessFit 结构化、与岗位相关的分数使该分析成为可能;监控自身录用率仍是雇主的责任,我们的报告正为支持这一点而设计。

10. 诚信与安全

会话中采集的信号(已告知候选人)包括标签页/窗口切换、粘贴与复制尝试、右键菜单使用、作答时间异常(快得不合常理的正确答案)与自动化痕迹。这些信号加权为诚信分数,并给出三档结论: 清白 (≥ 80), 复核 (55–79)与 高风险 (< 55),每档都列出促成的标记,供人工判断。

  • 答案键只存在于服务器端;评分完全以服务器为准。
  • 邀请链接是单会话令牌;候选人登录使用一次性、15 分钟有效的魔法链接。
  • 随机化自适应题库让泄露的答案价值有限——泄题会在题目统计(§7)中现形并触发退役。

11. 数据保护

  • 全部流量经 TLS 加密;应用强制 HTTPS 与规范主机名。
  • 候选人简历文件存储在网站根目录之外,绝不向公众提供网络访问。
  • 候选人可通过其面板中的自助端点删除自己的资料与数据。
  • 测评作答按上文所述存储用于评分、常模与题目质量监控;汇总统计为匿名。

12. 恰当使用与局限

  • 分数绝不应是录用决定的唯一依据。
  • 小常模组的百分位有标注,应谨慎解读。
  • 工作风格量表是自评工具;它描述典型倾向,不是行为保证。
  • 诚信结论是辅助决策的标记,不是指控; 复核 结论应引出一次谈话,而非自动拒绝。
  • 测试目前以英语提供;以第二语言应试的候选人,其分数部分反映语言水平。请使用专门的语言测试来显式测量它。

13. 参考文献与遵循标准

  • AERA、APA 与 NCME(2014)。 《教育与心理测试标准》。
  • SIOP(2018)。 《人员选拔程序验证与使用原则》 (第 5 版)。
  • EEOC 等(1978)。 《雇员选拔程序统一准则》。
  • Schmidt, F. L., & Hunter, J. E.(1998)。The validity and utility of selection methods in personnel psychology. Psychological Bulletin, 124(2), 262–274.
  • ISO 10667——测评服务交付。

关于方法论的问题,或索取底层统计数据: research@assessfit.com。这是一份活文档——每当平台方法论变化,顶部的版本与日期随之更新。