首页 > 教程攻略 > 热点新闻 >美团开源万亿参数LongCat-2.0大模型,专为国产算

美团开源万亿参数LongCat-2.0大模型,专为国产算

来源:互联网 时间:2026-07-06 21:01:11

7月6日,美团正式开源万亿参数大模型LongCat-2.0,同时放出了面向国产算力芯片的推理适配代码。模型总参数量达到1.6万亿,训练和推理时平均激活参数约480亿——专注智能体编程这一真实场景,而非堆叠算力跑分。

架构上的突破才是重头戏。LongCat-2.0首次引入LongCat稀疏注意力机制和N-gram Embedding结构:前者把长上下文处理效率和token级语义表征能力拉高了一个台阶,后者则让模型对代码逻辑、语法结构以及执行语义的理解更精准。面对智能体任务中动不动就超长的输入,它用流感知索引、跨层索引和层级化索引三种策略,把内存访问碎片化和重复索引计算开销压到最低,百万级长度的上下文训练和推理速度明显提升。更值得留意的是,在混合专家架构稀疏度已经做到97%的前提下,模型把1350亿参数集中塞进了N-gram Embedding模块——这个模块占总参数比例严格控制在10%以内,表达能力上去了,整体结构依然鲁棒、稳定。

这还不是全部。LongCat-2.0是首个在五万张国产加速卡集群上完成全流程推理验证的万亿参数模型,从模型设计、芯片特性适配到系统级部署,全程盯着国产算力平台的显存容量和带宽瓶颈做协同优化。模型层面,通过absorb计算范式、Indexer与MLA prolog并行调度、KV-cache分块切分,把超长序列带来的I/O压力和显存占用降下来;芯片适配层面,用Super Kernel整合算子、减少调用频次,再靠Weight Prefetch把权重加载延迟藏进前置计算周期里;部署策略层面,采用Prefill和Decode分离架构,既保证首字响应速度,又兼顾每秒输出吞吐量——Prefill阶段压缩专家并行域、引入序列并行分散负载,Decode阶段则靠KV-cache细粒度切分和高并行度调度,单卡显存峰值需求大幅降低。

后训练阶段同样有亮点。模型采用多教师在线蒸馏框架,把专家知识拆成三条路径:Agent执行、自适应推理、人机交互,分别强化自主任务执行、动态推理路径选择和安全对齐这些关键维度,最终通过MOPD架构在国产算力集群上高效融合、稳定跑起来。

整体技术路线延续LongCat-Flash,这次针对长上下文建模、代码生成和智能体行为建模三大核心场景做了三方面升级。开源的版本涵盖BF16、FP8、INT8等多种精度,适配从高性能服务器到边缘推理设备的各类国产硬件。目的很明确:把模型能力和推理优化成果全面释放出来,推动存量国产算力资源的高效复用,给国产算力生态的长期发展再添一把火。