首页 > 教程攻略 > ai资讯 >卡内基梅隆大学重磅,用这条Prompt让LLM递归内省,多轮交互中自我改进

卡内基梅隆大学重磅,用这条Prompt让LLM递归内省,多轮交互中自我改进

来源:互联网 时间:2026-08-24 14:12:23

都说AGI已经来了,但跟最聪明的LLM多聊几轮,你往往很难真正体会到那种智能跃升的快感。说实话,过去一年里,大家普遍感受到的,反而是多轮对话中的“跑焦”、话题偏移——聊着聊着就跑偏了,这种体验真的谈不上愉悦。

不过,最近卡内基梅隆大学、UC伯克利等机构的研究团队,提出了一种叫RISE(Recursive IntroSpEction,递归内省)的新方法,成功让语言模型学会了一项关键技能:自我改进。这项能力对于打造真正智能的AI系统实在太重要了——它让模型像人一样,能通过反复思考和修正来优化自己的输出。文末的交互案例中,你可以清楚地看到RISE带来的输出质量提升。

图片由xiumaodalle生成

过去,训练一个大语言模型,思路很简单:让它把每一轮对话都答对就行了。但RISE的想法不一样——它不满足于单次答案的准确,而是教会模型如何在多轮对话里,自己琢磨着怎么一步步把回答改得更到位。

01 RISE:从单轮到多轮的智能跃迁

RISE的核心思路很巧妙:把单轮问题转化为一个多轮的马尔可夫决策过程(MDP)。在这个框架里,模型不仅要给出答案,还得学会评估自己的回答,并据此做出修正。这样一来,面对复杂问题时,模型可以通过多次迭代,慢慢逼近正确答案,而不再依赖单次“碰运气”的输出。

MDP是什么?

这个概念在一些文章中反复被提及,这里有必要展开说一下。马尔可夫决策过程(Markov Decision Process,MDP)本质上是一种数学框架,用来模拟在不确定性环境中如何做决策。它提供了一套形式化的方法,来描述决策中的环境状态、行动选择、每个行动带来的结果以及这些结果的概率分布。MDP主要由四个核心元素构成,我们用一个机器人导航的例子来解释:

  • 状态

    :系统所有可能所处的状态集合。比如机器人在不同位置的坐标。
  • 行动

    :在给定状态下,决策者可以选择的动作集合。比如机器人可以向

    北、南、东、西移动

  • 转移概率

    :执行某个行动后,从当前状态转移到另一个状态的概率。比如地面可能滑,或者有障碍物,机器人往某个方向移动不一定能成功。
  • 奖励函数

    :执行行动后,决策者获得的即时奖励。比如机器人到达目标位置得正分,碰到障碍得负分。

目前,高级的机器人导航以及复杂情境下的不确定性决策,很多都基于MDP。它能帮助决策者制定出能最大化长期累积奖励的最优策略。这里先有个基础认知,下面我们会看到GPT-4在RISE框架下的高质量输出示例。

RISE的实现过程可以分解为以下几个关键步骤:

  • 1. 问题转化

    :将单轮问题转为多轮MDP。每一轮的状态,都包含问题本身、之前的回答历史以及可能的环境反馈。
    • 定义状态空间:包含问题、回答历史和环境反馈
    • 定义动作空间:每一轮模型给出的新回答
    • 定义奖励函数:根据回答的正确性给予奖励值
  • 2. 数据收集

    • 用当前模型生成多轮对话数据
    • 通过自蒸馏或外部专家模型提供改进建议
    • 构建数据集 D={(s_t, a_t, r_t, s_{t+1})}
  • 3. 策略优化

    • 采用加权回归方法优化模型参数
    • 目标函数:max_θ E[Σ log π_θ(a_t|s_t) * exp(r_t/τ)]
    • τ 为温度参数,用于调节奖励的影响程度。模型会根据每个回答的奖励值来优化参数。
  • 4. 迭代训练

    • 重复步骤2-3,不断提升模型的自我改进能力
    • 每次迭代后评估性能,决定是否继续训练

这个方法的独特之处在于,它不只看最终的正确答案,更重视模型如何从错误中学习并修正。这个过程其实是在模拟人类的学习方式——让AI系统在面对新问题时变得更灵活、更聪明。研究者用一张图来展示整个过程:

上图直观地展示了RISE算法的工作流程。从左到右,可以看到算法如何从单轮响应逐步过渡到多轮交互,最终通过多数投票机制产生优化后的输出。这个过程体现了RISE的核心思想——通过递归自省不断提升模型的回答质量。

  • 1. RISE部分:递归内省

    • Turn 1: LLM接收初始prompt并生成第一轮响应y1。
    • Turn 2: LLM利用Turn 1的响应、反馈和原始prompt来生成改进的响应y2。体现了递归特性。
  • 2. 推理部分

    :在推理阶段,系统收集多轮对话中的所有响应(y1, y2, ..., yn),最后通过多数投票机制来决定最终输出。

02 RISE的惊人效果:数据说话

研究团队在多个标准基准数据集上对RISE进行了测试,结果令人振奋:

  • 在GSM8K数据集上,经过RISE训练的Llama2-7B模型,在5轮交互后准确率提升了17.7%,远超其他方法。
  • 对于更具挑战性的MATH数据集,RISE也展现出显著提升,准确率提高了4.6%。
  • 即便没有外部反馈,RISE训练的模型也能通过自我反思持续提高答案质量。
  • RISE的效果还会随着模型规模的增大而进一步提升,说明这个方法具有良好的可扩展性。

这些数据清楚地表明,RISE不仅提升了模型整体的单轮性能,更重要的是,它赋予了模型持续自我改进的能力。这种能力对复杂和开放性问题尤其关键——

它允许模型通过多次尝试,逐步逼近最优解

03 RISE为什么这么有效?

RISE能取得如此显著的效果,主要得益于几个关键设计:

  • 多轮交互学习

    :将问题转化为多轮MDP,让模型学会如何根据之前的尝试来改进答案。这比单纯的单轮训练更接近人类的解题过程。
  • 加权回归优化

    :能有效利用不同质量的回答——既从成功中学习,也从失败中汲取经验。
  • 自蒸馏机制

    :让模型学习如何改进自己的答案,形成一个自我提升的良性循环,大大增强了泛化能力。
  • 迭代训练策略

    :多轮迭代不断强化模型的自我改进能力,使效果持续攀升。

这些设计共同作用,使得RISE训练的模型不仅在单轮表现上有所提升,更重要的是获得了持续自我改进的能力。对于构建真正智能的AI系统来说,这是至关重要的一步。

04 RISE的潜在应用

RISE的成功不仅仅是学术上的突破,它打开了AI在实际应用中的新可能性:

  • 智能客服系统

    :AI可以在多轮对话中不断优化回答,提供更精准、更有帮助的信息。
  • 教育辅助工具

    :根据学生反馈不断调整解释方式,提供个性化的学习体验。
  • 创意写作助手

    :作家可以用RISE训练的AI协助创作,AI能根据反馈不断改进文本。
  • 科研辅助系统

    :在复杂科研问题上,AI可以通过多轮推理逐步接近解决方案。
  • 战略决策系统

    :在不确定环境下,RISE可能帮助决策者通过模拟MDP的可能性,获得帕累托累积优势下的最优决策方案。

这些应用还只是冰山一角。随着RISE技术的进一步发展和完善,我们可以期待看到更多令人兴奋的AI应用出现在各个领域。

如果基于RISE算法写一个系统级的system prompt,以上文的MDP为例,在GPT-4界面下,可能的运行结果如图所示。这条基于递归内省(RISE)的SYSTEM PROMPT是一个系统级的提示,可以用于多轮对话系统或某个复杂的分析系统。你可以自行修改一些参数,比如设为自动迭代5轮、8轮等,借此观察所选LLM的主题聚焦能力以及在该问题上的知识深度;还可以修改SYSTEM PROMPT的置信度参数(信心等级)的触发条件,来逼近MDP的奖励概率。

05 RISE可能的局限性

尽管RISE展现了巨大潜力,但也存在一些局限性,需要后续研究来解决:

  • 计算资源需求

    :多轮训练过程需要消耗大量计算资源,可能限制其在某些场景的应用。
  • 数据质量依赖

    :效果很大程度上取决于训练数据的质量,如何确保数据的多样性和代表性是个重要问题。
  • 错误累积风险

    :有利就有弊。在某些临界情况下,模型可能会在多轮改进过程中累积细微的错误,而人类往往不擅长发现这些隐蔽的错误,导致最终结果偏离正确方向。因此,多轮对话中高度负责任的专家参与,可能会减少错误累积的风险。
  • 泛化能力的进一步提升

    :虽然RISE已经展现出不错的泛化能力,但如何让模型在更广泛的领域中应用自我改进能力,仍需进一步研究。