LLM CoT的工作原理
思维链(CoT,Chain of Thought)如今几乎成了大模型推理能力的标配技巧。一个经典的提示词“让我们一步一步地想”(Let's think step by step),就能让模型在复杂任务上表现突飞猛进。可你有没有想过:大模型推理能力的提升,到底是因为人类帮它拆解了任务,还是说——那些额外添加的提示Token,无意中触发了模型内部更深层的计算能力?

一篇来自斯坦福和谷歌等机构的预印论文(“让我们逐步思考:Transformer语言模型中的隐藏计算”[文献1])揭示了一个相当魔幻的现象:在思维链中加入完全无意义的中间Token(比如一连串的“……”),居然能解决那些没有中间Token时模型根本搞不定的算法任务。结论直白得惊人:
只要在推理路径里塞进额外Token,哪怕内容毫无意义,模型的能力也能显著增强
这消息一出,网上炸了锅。毕竟“让我们一步一步地想”那种提示词的效果已经够让人惊叹了,现在又说AI可以完全不依赖人类经验的token内容、自行完成隐藏推理,听着既科幻又有点细思极恐。
不过,另一篇论文(“思维链使Transformer能解决内在串行的问题”[文献2])刚好能解释这个现象,而且解释得相当直观。这篇论文用了类似文献1中的电路复杂度分析方法,
把Transformer视为一定深度的复杂电路,分析它到底能解决多复杂的计算问题
具体来说,电路复杂度理论里有个指标叫TC0,代表那些能用固定深度电路解决的问题。论文的核心结论是:
足够长的思维链,能把Transformer的表达能力从TC0的边界外推出去
从概念上讲,CoT赋予模型执行本质上串行计算的能力,这是Transformer所缺乏的,尤其是在深度较低的情况下。
换句话说,文献1里那个“AI不依赖人类经验、自己隐藏推理”的现象,既不魔幻也不可怕,它更像是Transformer自身结构缺陷的必然结果——因为Transformer天然擅长并行处理,但面对必须串行求解的问题时,就会卡住。而思维链恰好补上了这个短板。
论文进一步论证了一个更通用的结论:
通过T步CoT,使用固定位精度和O(log n)嵌入大小的固定深度Transformer,可以解决任何由大小为T的布尔电路能解决的问题
CoT的核心作用,就是提升低深度Transformer在内在串行问题上的表达能力
理解起来其实很简单:
CoT相当于引导Transformer放弃走并行推理的捷径,转而采用串行方式一步步推演
那么问题来了:这是Transformer独有的缺陷吗?像Mamba这类新兴架构,能不能绕过这个限制,在零样本推理上做得更好?
从更宏观的数理原理角度去看,其实可以这么理解:大模型本质上是在一个范畴(category)里做采样和变分推理。
串行处理
并行处理
所以,别再觉得“AI偷偷自己推理”有多可怕了。本质上,它只是摸清了Transformer的脾气,用最朴素的方式——多写几步、哪怕写废话——激活了它本该有的串行计算能力。这才是思维链的真正秘密。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名