首页 > 教程攻略 > ai资讯 >LLM CoT的工作原理

LLM CoT的工作原理

来源:互联网 时间:2026-08-23 14:11:36

思维链(CoT,Chain of Thought)如今几乎成了大模型推理能力的标配技巧。一个经典的提示词“让我们一步一步地想”(Let's think step by step),就能让模型在复杂任务上表现突飞猛进。可你有没有想过:大模型推理能力的提升,到底是因为人类帮它拆解了任务,还是说——那些额外添加的提示Token,无意中触发了模型内部更深层的计算能力?

LLM CoT的工作原理

一篇来自斯坦福和谷歌等机构的预印论文(“让我们逐步思考:Transformer语言模型中的隐藏计算”[文献1])揭示了一个相当魔幻的现象:在思维链中加入完全无意义的中间Token(比如一连串的“……”),居然能解决那些没有中间Token时模型根本搞不定的算法任务。结论直白得惊人:

只要在推理路径里塞进额外Token,哪怕内容毫无意义,模型的能力也能显著增强

——Token内容本身似乎并不重要。

这消息一出,网上炸了锅。毕竟“让我们一步一步地想”那种提示词的效果已经够让人惊叹了,现在又说AI可以完全不依赖人类经验的token内容、自行完成隐藏推理,听着既科幻又有点细思极恐。

不过,另一篇论文(“思维链使Transformer能解决内在串行的问题”[文献2])刚好能解释这个现象,而且解释得相当直观。这篇论文用了类似文献1中的电路复杂度分析方法,

把Transformer视为一定深度的复杂电路,分析它到底能解决多复杂的计算问题

具体来说,电路复杂度理论里有个指标叫TC0,代表那些能用固定深度电路解决的问题。论文的核心结论是:

足够长的思维链,能把Transformer的表达能力从TC0的边界外推出去

。原文讲得更直白:“

从概念上讲,CoT赋予模型执行本质上串行计算的能力,这是Transformer所缺乏的,尤其是在深度较低的情况下。

换句话说,文献1里那个“AI不依赖人类经验、自己隐藏推理”的现象,既不魔幻也不可怕,它更像是Transformer自身结构缺陷的必然结果——因为Transformer天然擅长并行处理,但面对必须串行求解的问题时,就会卡住。而思维链恰好补上了这个短板。

论文进一步论证了一个更通用的结论:

通过T步CoT,使用固定位精度和O(log n)嵌入大小的固定深度Transformer,可以解决任何由大小为T的布尔电路能解决的问题

。实证上也验证了:

CoT的核心作用,就是提升低深度Transformer在内在串行问题上的表达能力

理解起来其实很简单:

CoT相当于引导Transformer放弃走并行推理的捷径,转而采用串行方式一步步推演

。这就像有向无环图(DAG)里的数据处理——比如SQL查询,不是每个算子都适合并行,像全局排序这类“并行阻断器”(parallel blocker),就必须串行处理。Transformer的并行天性碰到这类问题就会露怯,而CoT恰好充当了那个“串行调度员”。

那么问题来了:这是Transformer独有的缺陷吗?像Mamba这类新兴架构,能不能绕过这个限制,在零样本推理上做得更好?

从更宏观的数理原理角度去看,其实可以这么理解:大模型本质上是在一个范畴(category)里做采样和变分推理。

串行处理

引入了中间信息,相当于加深了模型在范畴对象和态射中遍历的深度,逐步调整采样概率分布,最终得到更精确的推理结果;而

并行处理

则是通过增加填充信息,在宽度上影响采样的概率分布,从而间接影响最终效果。CoT巧妙地结合了这两者——既用串行加深了推理链条,又用额外Token拓宽了计算空间。

所以,别再觉得“AI偷偷自己推理”有多可怕了。本质上,它只是摸清了Transformer的脾气,用最朴素的方式——多写几步、哪怕写废话——激活了它本该有的串行计算能力。这才是思维链的真正秘密。