🌐 由英文原文自动翻译。 查看原文
心理测评到底是什么(说人话版)
心理测评,说人话版
团队里有人刚问你,招聘流程里是不是该加个"心理测评",你点了点头,一脸"我懂"的样子。你自己也为了好玩做过那种16型人格测试。同时你也听过有人把整件事贬得像"带电子表格的占星术"。这两种态度都让人绕开了一个简单的问题:这东西到底能不能告诉你关于候选人的有用信息?
下面是不掺行话的实话版本。
心理测评到底是什么
把名头去掉,它其实就是这样一件事:一套结构化的题目或任务,以同样的方式给每个人做,最后产出一个数字,而不是一种印象。仅此而已。"心理"这个词只是说它测的是一个人脑子里的东西——推理方式、行为倾向、信息处理速度——而不是能用秒表直接看到的东西。
它们大致分两类:
- 能力/认知测试。 这类有标准答案——数字推理、逻辑序列、语言理解。测的是一个人在时间压力下解决某类问题的能力。
- 性格/行为量表。 这类没有标准答案。它问的是一个人的行为倾向——喜欢结构化还是模糊性,主动迎接冲突还是回避冲突——然后把答题模式跟其他人的普遍答题方式做对比。
工作样本测试(写一封邮件、修一个bug、处理一位愤怒的客户)严格来说不算心理测评,尽管人们常把它们混在一起谈论。它更像是驾照路考,而不是性格问卷——它是直接测量技能,而不是靠推断。
什么样的测评算靠谱,什么样的是垃圾
这才是真正重要的部分,而且比听起来简单。一个靠谱的测评通常具备三个特点:
- 它是一致的。 同一个人在相近条件下测两次,得分大致相同。如果某人周一能考到90百分位,周三什么都没变却掉到40百分位,那这个测评测的根本不是什么稳定的东西——只是噪音。
- 它测的确实是它宣称要测的东西。 一个叫"领导力潜质"的测评,如果实际上测的只是一个人填表时够不够自信,那它测的就不是领导力。这一点从外部很难核实,所以第三点才更重要。
- 它经过了真实人群的验证,而不是某人觉得题目"看起来对"就写出来的。 一份只靠内部几个人拍脑袋想出来、从未在真实人群中试用过的测评,不过是披着实验室外套的猜测。
值得警惕的信号包括:没有公开说明编制方法的测评、给你一个可爱动物或颜色而不是数字的测评、宣称十二道题就能揭示"真实的你"这种大而全承诺的测评,以及每个候选人得分都落在讨好人心的中间区域的测评。真正的测量会产生分布差异。如果人人回来看起来都一样出色,那这份测评根本没有区分度——而区分度正是做测评的全部意义。
如何解读分数而不过度解读
多数测评会给出一个百分位——"这个人的得分高于对比组中72%的人"。这里有两点几乎没人会主动跟你解释:
- 对比组是谁,极其重要。 相对于普通人群的72百分位,和相对于已经经过同岗位筛选的人群的72百分位,是完全不同的两件事。一定要问清楚,这个百分位是拿哪个群体作对比算出来的。
- 百分位背后要有足够多的人数,才有意义。 如果一份测评历史上只有三个人做过,那算出来的百分位基本就是摆设——数据量根本不足以说明"平均水平"是什么样子。这是一个实实在在的局限,值得在信任任何供应商给你的数字之前,先问一句他们的对比组样本量有多大。顺带一提,AssessFit在某个具体测评完成人数达到10人以前,是不会显示百分位的——不是因为数字会有多"戏剧性",单纯是因为在那之前它还没有实际意义。
单独一个分数,几乎说明不了匹配度。同样是60百分位的推理得分,如果搭配一份出色的工作样本和干净的背调,和搭配一堆其他红旗信号,是完全不同的两种录用判断。把测评当作一个数据点,而不是最终裁决。
这类测评真正能帮上忙的地方——以及帮不上的地方
它们擅长降低面试中的噪音——在五十分钟的对话里,一个能说会道的人和一个真正有能力的人往往很难分辨。测评能给你一个可比较、可重复的标准,用来衡量同一岗位的所有候选人,这是一场对话无法提供的。
它们不擅长告诉你,某人是否会按时到岗、是否能跟你的团队合得来、是否真的在乎这份工作。屏幕上的任何东西都无法像实际共事六周那样,测出一个人的责任心。如果有人自信地告诉你测评能预测这些,那他大概是在向你推销什么。
诚实的用法是:把它当作众多筛选环节中的一个,权重要低于实际工作表现本身,而且永远不要仅凭它就拒绝一个其他方面都很强的候选人。如果某位候选人的分数比你期待的低,但其他方面都很扎实,那应该是一场跟他/她的对话,而不是自动判"不合格"。
买任何测评产品之前,先问这一个问题
在为任何心理测评工具付费或采用之前,直接问供应商一句话:"你们怎么知道这份测评测的确实是你们所说的东西,又有多少人做过它?"如果得到的回答含糊其辞、全是营销话术,或者只是耸耸肩,那你其实也就得到了关于这份测评的答案。
一份好的测评不需要靠花哨的界面来说服你。它需要经得起这一个问题的检验。
每月免费测评 5 位候选人,永久免费。无需信用卡。
免费开始