ABBEL:训练 LLM 更新信念状态,以提升长时交互效率
ABBEL 将交互摘要建模为自然语言信念状态,并通过信念评分监督其信息内容,帮助 LLM 更高效地处理长时任务。在 CollabBench 上,ABBEL 将与 full context 模型的性能差距缩小约 50%,相比不使用信念评分的训练方案少用 50%训练步数。
ABBEL 将交互摘要建模为自然语言信念状态,并通过信念评分监督其信息内容,帮助 LLM 更高效地处理长时任务。在 CollabBench 上,ABBEL 将与 full context 模型的性能差距缩小约 50%,相比不使用信念评分的训练方案少用 50%训练步数。