卡内基梅隆大学重磅,用这条Prompt让LLM递归内省,多轮交互中自我改进
都说AGI已经来了,但跟最聪明的LLM多聊几轮,你往往很难真正体会到那种智能跃升的快感。说实话,过去一年里,大家普遍感受到的,反而是多轮对话中的“跑焦”、话题偏移——聊着聊着就跑偏了,这种体验真的谈不上愉悦。
不过,最近卡内基梅隆大学、UC伯克利等机构的研究团队,提出了一种叫RISE(Recursive IntroSpEction,递归内省)的新方法,成功让语言模型学会了一项关键技能:自我改进。这项能力对于打造真正智能的AI系统实在太重要了——它让模型像人一样,能通过反复思考和修正来优化自己的输出。文末的交互案例中,你可以清楚地看到RISE带来的输出质量提升。

图片由xiumaodalle生成
过去,训练一个大语言模型,思路很简单:让它把每一轮对话都答对就行了。但RISE的想法不一样——它不满足于单次答案的准确,而是教会模型如何在多轮对话里,自己琢磨着怎么一步步把回答改得更到位。
01 RISE:从单轮到多轮的智能跃迁
RISE的核心思路很巧妙:把单轮问题转化为一个多轮的马尔可夫决策过程(MDP)。在这个框架里,模型不仅要给出答案,还得学会评估自己的回答,并据此做出修正。这样一来,面对复杂问题时,模型可以通过多次迭代,慢慢逼近正确答案,而不再依赖单次“碰运气”的输出。
MDP是什么?
这个概念在一些文章中反复被提及,这里有必要展开说一下。马尔可夫决策过程(Markov Decision Process,MDP)本质上是一种数学框架,用来模拟在不确定性环境中如何做决策。它提供了一套形式化的方法,来描述决策中的环境状态、行动选择、每个行动带来的结果以及这些结果的概率分布。MDP主要由四个核心元素构成,我们用一个机器人导航的例子来解释:
- :系统所有可能所处的状态集合。比如机器人在不同位置的坐标。
状态
- :在给定状态下,决策者可以选择的动作集合。比如机器人可以向
行动
。北、南、东、西移动
- :执行某个行动后,从当前状态转移到另一个状态的概率。比如地面可能滑,或者有障碍物,机器人往某个方向移动不一定能成功。
转移概率
- :执行行动后,决策者获得的即时奖励。比如机器人到达目标位置得正分,碰到障碍得负分。
奖励函数
目前,高级的机器人导航以及复杂情境下的不确定性决策,很多都基于MDP。它能帮助决策者制定出能最大化长期累积奖励的最优策略。这里先有个基础认知,下面我们会看到GPT-4在RISE框架下的高质量输出示例。
RISE的实现过程可以分解为以下几个关键步骤:
- :将单轮问题转为多轮MDP。每一轮的状态,都包含问题本身、之前的回答历史以及可能的环境反馈。
1. 问题转化
- 定义状态空间:包含问题、回答历史和环境反馈
- 定义动作空间:每一轮模型给出的新回答
- 定义奖励函数:根据回答的正确性给予奖励值
- :
2. 数据收集
- 用当前模型生成多轮对话数据
- 通过自蒸馏或外部专家模型提供改进建议
- 构建数据集 D={(s_t, a_t, r_t, s_{t+1})}
- :
3. 策略优化
- 采用加权回归方法优化模型参数
- 目标函数:max_θ E[Σ log π_θ(a_t|s_t) * exp(r_t/τ)]
- τ 为温度参数,用于调节奖励的影响程度。模型会根据每个回答的奖励值来优化参数。
- :
4. 迭代训练
- 重复步骤2-3,不断提升模型的自我改进能力
- 每次迭代后评估性能,决定是否继续训练
这个方法的独特之处在于,它不只看最终的正确答案,更重视模型如何从错误中学习并修正。这个过程其实是在模拟人类的学习方式——让AI系统在面对新问题时变得更灵活、更聪明。研究者用一张图来展示整个过程:

上图直观地展示了RISE算法的工作流程。从左到右,可以看到算法如何从单轮响应逐步过渡到多轮交互,最终通过多数投票机制产生优化后的输出。这个过程体现了RISE的核心思想——通过递归自省不断提升模型的回答质量。
1. RISE部分:递归内省
- Turn 1: LLM接收初始prompt并生成第一轮响应y1。
- Turn 2: LLM利用Turn 1的响应、反馈和原始prompt来生成改进的响应y2。体现了递归特性。
- :在推理阶段,系统收集多轮对话中的所有响应(y1, y2, ..., yn),最后通过多数投票机制来决定最终输出。
2. 推理部分
02 RISE的惊人效果:数据说话
研究团队在多个标准基准数据集上对RISE进行了测试,结果令人振奋:
- 在GSM8K数据集上,经过RISE训练的Llama2-7B模型,在5轮交互后准确率提升了17.7%,远超其他方法。
- 对于更具挑战性的MATH数据集,RISE也展现出显著提升,准确率提高了4.6%。
- 即便没有外部反馈,RISE训练的模型也能通过自我反思持续提高答案质量。
- RISE的效果还会随着模型规模的增大而进一步提升,说明这个方法具有良好的可扩展性。
这些数据清楚地表明,RISE不仅提升了模型整体的单轮性能,更重要的是,它赋予了模型持续自我改进的能力。这种能力对复杂和开放性问题尤其关键——
它允许模型通过多次尝试,逐步逼近最优解
03 RISE为什么这么有效?
RISE能取得如此显著的效果,主要得益于几个关键设计:
- :将问题转化为多轮MDP,让模型学会如何根据之前的尝试来改进答案。这比单纯的单轮训练更接近人类的解题过程。
多轮交互学习
- :能有效利用不同质量的回答——既从成功中学习,也从失败中汲取经验。
加权回归优化
- :让模型学习如何改进自己的答案,形成一个自我提升的良性循环,大大增强了泛化能力。
自蒸馏机制
- :多轮迭代不断强化模型的自我改进能力,使效果持续攀升。
迭代训练策略
这些设计共同作用,使得RISE训练的模型不仅在单轮表现上有所提升,更重要的是获得了持续自我改进的能力。对于构建真正智能的AI系统来说,这是至关重要的一步。
04 RISE的潜在应用
RISE的成功不仅仅是学术上的突破,它打开了AI在实际应用中的新可能性:
- :AI可以在多轮对话中不断优化回答,提供更精准、更有帮助的信息。
智能客服系统
- :根据学生反馈不断调整解释方式,提供个性化的学习体验。
教育辅助工具
- :作家可以用RISE训练的AI协助创作,AI能根据反馈不断改进文本。
创意写作助手
- :在复杂科研问题上,AI可以通过多轮推理逐步接近解决方案。
科研辅助系统
- :在不确定环境下,RISE可能帮助决策者通过模拟MDP的可能性,获得帕累托累积优势下的最优决策方案。
战略决策系统
这些应用还只是冰山一角。随着RISE技术的进一步发展和完善,我们可以期待看到更多令人兴奋的AI应用出现在各个领域。
如果基于RISE算法写一个系统级的system prompt,以上文的MDP为例,在GPT-4界面下,可能的运行结果如图所示。这条基于递归内省(RISE)的SYSTEM PROMPT是一个系统级的提示,可以用于多轮对话系统或某个复杂的分析系统。你可以自行修改一些参数,比如设为自动迭代5轮、8轮等,借此观察所选LLM的主题聚焦能力以及在该问题上的知识深度;还可以修改SYSTEM PROMPT的置信度参数(信心等级)的触发条件,来逼近MDP的奖励概率。
05 RISE可能的局限性
尽管RISE展现了巨大潜力,但也存在一些局限性,需要后续研究来解决:
- :多轮训练过程需要消耗大量计算资源,可能限制其在某些场景的应用。
计算资源需求
- :效果很大程度上取决于训练数据的质量,如何确保数据的多样性和代表性是个重要问题。
数据质量依赖
- :有利就有弊。在某些临界情况下,模型可能会在多轮改进过程中累积细微的错误,而人类往往不擅长发现这些隐蔽的错误,导致最终结果偏离正确方向。因此,多轮对话中高度负责任的专家参与,可能会减少错误累积的风险。
错误累积风险
- :虽然RISE已经展现出不错的泛化能力,但如何让模型在更广泛的领域中应用自我改进能力,仍需进一步研究。
泛化能力的进一步提升
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名