跳到正文
原文
Google Research·· 2026-04-03AI 评分53

Google Research 提出评估大语言模型行为倾向与人类对齐的测试框架

Evaluating alignment of behavioral dispositions in LLMs

AI 导读

Google Research 推出一套基于情境判断测试(SJT)的新评估框架,用于衡量大语言模型在真实日常与职场场景中的行为倾向是否与人类对齐。团队对 25 个模型进行的评测显示,参数量小于 25B 的小模型在人类高度共识场景下的方向对齐接近随机水平,而大于 120B 的前沿模型在共识低于 90% 时对齐率也仅停留在 80% 左右。

来源:Google Research · research.google