AI招聘最隐蔽的偏见:连续招聘40轮后,AI会把员工招得千篇一律
日期:2026-08-09 21:25:43 / 人气:6

最危险的,是偏见在反馈中越滚越大。
说到企业里的AI落地场景,人事部门用AI筛选简历已经跑得很顺:上千封简历10分钟出报告,标出十人进下一轮,高效又"客观"。但普林斯顿与芝加哥大学研究者把一篇原本用于研究人类刻板印象的心理学实验(Bai et al. 2022/2025)搬给大模型后,发现了一个反常识的事实——AI不仅会学人类的偏见,还会在完全没有差异的环境里,自己"造"出新的偏见,而且比人更狠。这篇论文已在ICML 2026亮相,对应的arXiv版本即你附的 https://arxiv.org/html/2511.06148v4 。
一场没有差异的招聘实验
虚构城市,四个完全人造的族群:Tufa、Aima、Reku、Weki。名字是编的,刻意避开训练语料里任何真实族裔、地域、性别的既存联想。20类岗位(医生、律师、幼教、清洁工……按"能力×温度"分四象限),连续招40轮。每轮一个空缺,四族各派一人,模型选一个,系统立刻反馈"成功/失败"。
关键设定:四个族群在任何岗位上的成功概率都是 Bernoulli(0.9),即90%,完全无差异。模型不知道这点,任务只是"尽量多招对人"。
人类被试在这个实验里(Bai et al. 2025a)已经会翻车:早期偶发失败→归咎于某族→不再探索该族→该族永远没机会产出成功数据→"印证"最初错觉。人类的平均分层指数(Stratification Index, SI)约 0.84。
让大模型坐到被试席
GPT-4o/5.4、Claude 3 Haiku→4 Sonnet、Gemini 1.5→3 Flash、Qwen 2.5、Llama 3.2→4、DeepSeek-R1、o3 等,每个模型每种提示方式(直接 / Chain-of-Thought)跑30次40轮游戏。
结果:
• 前沿LLM平均 SI=1.39,比人类高约65%;组间分歧(BGD)0.69 vs 人类0.56。
• 越新越大,分层越狠:Claude 4 Sonnet直接提示 SI=1.79,是Claude 3 Haiku的8倍多;同家族新版全面显著高于旧版。
- 推理模型更极端:o3 SI=1.83,DeepSeek-R1 SI=1.41。
• 跨模型、跨run的组-岗绑定方向不一致(GASI≈0.52,和人类0.47相近),证明偏见不是从预训练背出来的,而是每条run内从随机反馈里临时长出来的。
机制很清晰:模型善于从极少样本总结模式。第1轮让Aima当老师失败→第2轮推断"Aima适体力活",碰巧成功→第3轮选Reku当医生成功→"每个群体显然各有优势"。一次偶然变成印象,印象决定下一轮选择,选择制造支持印象的数据。你以为它在"尊重数据",数据却是它自己前几步选择喂出来的。
论文原话点破:LLMs are not merely passive mirrors of human social biases, but can actively create new ones from experience.
为什么"模型越强,偏见越明显"
不是越强越坏,而是越强越会把早期噪声迅速收敛成稳定理论。弱模型还带点随机性,强模型置信度更高、更早锁定"规律",探索更少。这在多臂老虎机文献里是经典陷阱:Thompson采样都会分出SI=0.61的分层,UCB要调到c=2.0才压到0.067——而前沿LLM连Thompson采样都不如。
更麻烦的是,当AI从"单次简历打分器"变成有状态(stateful)的招聘代理:长期参与搜人、初筛、排面试、读面试纪要、把历史录用/绩效带进下一轮推荐,上述40轮实验就是压缩版的真实闭环。一次面试全员打低分,人类主管可能归为"偶发",Agent却可能把这次噪声写进权重,让某省、某校、某专业的人越来越难进面试——机会分配本身被污染,后续所有"数据"都成了偏见的证据。
只说"请公平"没用
论文测了三类干预:
1. 输入层:升温(T=1.5)对多数模型无显著改善;CoT能略降分层,但Qwen 72B外仍远高于随机基线。
2. 结构层:去掉游戏化奖励、压缩上下文、降成功率到0.1、加年龄/学历特征——部分场景分层下降,但依赖"不真实"的条件(真实岗位成功率不会统一0.1),且Gemini/Claude在某些设定下仍锚定族群信号。
3. 目标层:在prompt里把"最大化成功数"改成"最大化成功数且最大化族群-岗位分配的多样性",几乎所有模型SI跌到随机基线以下,甚至低于同目标下的人类。光喊"要公平"没用,必须把多样性写成可优化的目标项。
但论文也警告:真实候选人有真实差异,盲加diversity bonus可能惩罚正确分配、拉低整体绩效(附录K)。所以干预不能是万能膏药,得知道何时用。
对企业招聘的实在建议
论文没测真实简历,不证明某平台已在伤人选。但它划出的红线很硬:
- 别把Agent当裁判。AI适合扩搜、整理岗位相关信息、标记"长期没被看见的候选人";定标准、复核、申诉权在人。
• 定期给招聘AI做"人才扫描"。跑半年日志,看:谁总进面试、谁总在末尾、哪类背景的成功反馈被反复采样、哪些群体连产生成功数据的机会都没有。这比测一次"你是否歧视"有用得多。
- 警惕"越用越懂我们要的人"这句话。在反馈闭环里,这往往等于"AI已把我们的机会分配焊成了某一种形状"。
• 目标函数要写全。只写"录用成功率最大化",强模型会用偏见换短期指标;把"探索未充分采样群体""长期机会均等"作为可衡量项写进system prompt或评测。
40轮之后,AI招出来的人会千篇一律——不是因为它坏,是因为它在噪声里太会找规律,又太懒得再试一次。人也会这样,但人慢、会迟疑、会有人拍桌子说"再给小王一次机会";Agent没有这层摩擦。删掉这层摩擦时,就得在目标里把"怀疑自己"显式写进去。
相关研究:Wu et al., Large Language机器学习模型通过自适应探索发展出新社会偏见, arXiv:2511.06148v4,代码 https://github.com/addisonwu05/LLM-Natural-Segregation
要不要我把文中提到的分层指数(SI)/组间分歧(BGD)/跨轮随机性(GASI)三个指标拆成一段"企业可自查的量化模板",方便你直接放进AI招聘审计清单?
作者:新航娱乐
新闻资讯 News
- 中国汽车布局摩洛哥,到了最微妙...08-09
- AI招聘最隐蔽的偏见:连续招聘4...08-09
- 合肥消费为何长期疲软:一座“超...08-09
- 以岭药业走出连花清瘟“后遗症”08-09

