Meta推出Transfusion:统一Transformer和Diffusion
来源:互联网
时间:2026-08-25 13:43:12
多模态AI的训练,还能怎么玩?Meta最近给出的一个答案,叫做Transfusion。这套全新的训练方法,核心思路其实很直接——不再拘泥于把图像量化成离散的token再送进语言模型,而是直接把语言建模和扩散模型结合起来,用一个Transformer模型同时搞定文本理解和图像生成。
做多模态的人都知道,传统思路是把图像量化成离散的token,然后用语言模型来处理。但这种做法的硬伤在于:量化过程中会丢失信息,生成能力天然受限。而Transfusion的做法是——直接让语言模型和扩散模型在同一个模型中训练,各取所长。这就好比把两种模型的看家本领拼到一起,彼此互补,效果自然不一样。

更具体一点,Meta这次从零开始训练了一个70亿参数的Transfusion模型,用的是海量文本和图像数据。在多个单模态和多模态测试任务上,它的扩展性明显优于传统的量化方法。无论是生成图像还是生成文本,Transfusion的表现都更强。
而且令人印象深刻的是,Transfusion生成的图像质量,已经可以跟专门的图像扩散模型相媲美,同时文本生成能力并未打折。能把两条路线均衡到这个程度,才算真正意义上的多模态。
Transfusion的技术亮点
全局因果注意力 + 图像内部双向注意力
模态特定的编码和解码层
必须指出的是,Meta这一波操作,确实把多模态模型的天花板抬高了。同行们,该加速了。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名