Google Research·· 2026-04-03AI 评分36
Google 研究:25 个 LLM 的行为倾向与人类共识存在两类对齐缺口
Evaluating alignment of behavioral dispositions in LLMs
AI 导读
Google Research 提出评估 LLM 行为倾向对齐的框架,用改编自 IRI、ERQ 等心理量表的情境判断测试(SJT)评测 25 个 LLM,并与 550 名标注者的偏好分布对比。结果显示两类缺口:模型倾向偏离人类共识,且在人类无共识时无法覆盖人类意见的分布范围。小模型(<120B)与前沿闭源模型在人类一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头。
来源:Google Research · research.google