Berkeley AI Research·· 2026-07-26AI 评分43
教 LLM 更新信念以实现高效长周期交互
Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction
AI 导读
针对大语言模型在长周期交互中自我摘要导致的性能损耗,研究团队提出 ABBEL 框架,用受监督的自然语言“信念状态”替代完整交互历史。该框架将自编码重构等信念评分作为辅助强化学习奖励,以监督状态内容。在 CollabBench 评测中,ABBEL-rec-BG 仅用 50 步训练便追回与全上下文模型约 50% 的差距,训练步数减少 50% 且显著降低峰值 token 占用。
来源:Berkeley AI Research · bair.berkeley.edu