首页 > 教程攻略 > ai资讯 >SECon | 基于开源的领域模型落地实践

SECon | 基于开源的领域模型落地实践

来源:互联网 时间:2026-08-13 14:30:36

2024年SECon全球软件工程技术大会的议题,恰好契合了“拥抱AI 走深向实”的主题。分享的核心,正是基于开源模型构建领域模型的落地实践。

国内大模型市场正经历一场深刻变革。百模大战打到现在,三个趋势已经非常明显:开源模型的能力在急速攀升;ToB和ToC两个赛道开始各走各路;企业对大模型的需求,也从最初的“什么都试试”转向了“聚焦核心业务,解决实际问题”。大模型正在加速与产业融合,催生出新的市场机遇。在这个背景下,Llama 3作为目前性能最强的开源基座模型,给企业打造领域模型、实现行业价值赋能,提供了一个相当不错的起点。

这次分享,主要围绕三个核心问题展开:

1.

开源基座模型怎么选?

——隐性能力和显性能力之间,如何找到那个最优平衡点?Llama 3的优势和短板分别在哪?
2.

领域大模型怎么建?

——开源模型的能力如何与行业知识深度融合,实现“1+1>2”的效果?从数据、算法到工程,构建领域模型的关键抓手是什么?
3.

技术怎么变成价值?

——领域大模型如何真正融入业务,实现人机协作下的效率提升和价值创造?

下面,就展开聊聊这几个核心问题。

开源崛起:大模型普惠时代来临

在人工智能领域,开源大模型正在快速崛起,成为一股不可忽视的技术力量。目前“百模大战”中,模型数量已经超过300个,各家供应商也开始找准自己的市场定位。生态的繁荣,直接催生了ToB和ToC市场的双线开花。

一边是互联网大厂和创业公司,基于自研大模型猛攻C端市场,通过Web端、App或小程序反赌,核心是优化用户体验,用丰富的供给来激发用户需求。另一边,是各垂直领域的企业和解决方案服务商,它们基于开源或闭源模型,为特定行业提供真实可用的场景化方案。

除了供给侧的变化,企业对大模型的需求也从“广泛探索”转向了“核心业务深化”。大家更务实了,目标非常明确:用大模型解决垂直领域的具体问题,提升ROI。但问题是,大模型在专业性、泛化性和经济性之间,很难做到三者兼顾。这就要求企业必须专注在核心业务上,细化场景,明确目标,用实际效果来说话。

领域模型构建:融合开源优势,打造行业智能引擎

企业对大模型的核心诉求,归结起来就两件事:把私域数据转化成竞争优势,同时确保场景应用的安全可控。而基于开源模型进行适配调优,是当前实现这个目标最有效的路线。

直接上闭源模型,私域数据的安全和隐私是个大问题。直接用开源模型吧,又可能碰到性能瓶颈。走“开源模型+Prompt+知识库”的路线,灵活性提高了,但处理复杂指令时就会出现挑战,而且prompt的编写难度实在不低。相比之下,基于开源模型进行针对性微调,可以很好地平衡这些问题:在少量领域数据上快速适配,自主选择模型结构和优化策略,全流程掌控数据和模型,杜绝泄露风险。这才是真正的定制化、高效性、灵活性和可控性兼得。

那么,如何选择开源基座呢?关键在哪?在于

隐性能力和显性能力的平衡

。大模型能力的“冰山理论”告诉我们,显性能力通过微调可以提升,但隐性能力必须从底层优化,它决定了模型在关键场景中的表现上限。不同场景对这两类能力的要求也各不相同。

Llama 3作为目前最强的开源模型,隐性能力扎实,显性能力领先,确实为领域赋能带来了全新的机会。

不过,Llama 3虽然表现出色,但在中文处理能力、专业场景应用和在线服务能力这三个关键方面,仍然面临不小的挑战。

领域模型落地:从Llama3到行业解决方案

一个反复被提及的观点是:

领域大模型的发展,很像一个人的成长路径

:先接受通识教育(中学生阶段),再进入专业深造(大学生阶段),最后到实际工作场景中应用和反馈(职场人阶段)。

“中学生”阶段,大模型需要掌握广泛的语言理解和信息处理能力,打好基础;“大学生”阶段,则要在大规模通用文本数据上训练,深入了解金融术语、行业案例、专家经验和最佳实践,逐步具备行业所需的专业能力;最终成为“职场人”,以岗位产出为导向,通过真实场景的反馈,持续提高模型性能和适应性。这三个阶段,分别对应了数据优化、金融增强、价值对齐和应用增强等不同的构建环节。

除了这三个阶段,构建领域大模型还有

五大关键抓手

:数据增强是基础,算法增强是核心,工程增强是保障,场景增强是方向,评估反馈是动力。这五个抓手,覆盖了从数据收集到模型训练、再到实际应用和持续优化的全过程。

具体到工程层面,首先是

用数据驱动大模型的智能突破

。海量金融数据的筛选,本质上是“淘沙成金”的过程。度小满轩辕团队打造了一套智能化数据处理流水线,通过规则过滤、模型过滤、去重过滤和质量过滤,最终从原始中文数据中筛选出了32%的“数据精华”,构建了15TB的高质量训练语料。在这个过程中,团队还通过分析、评估和配比等策略,优化了数据源分布,突破了语种、领域和能力的限制。

团队打造的质量模型库,包括了文本质量判别、知识性判别和内容结构判别等多个模型,对数据质量进行了全方位把控。人工评测结果显示,过滤后的数据质量提升了48%,直接推动了模型性能的显著提升。

另外,数据安全是重中之重。团队基于多领域内容安全标准,搭建了业内领先的内容安全系统,高效识别恶意内容,将多领域敏感恶意内容过滤至1%以内,满足了领域安全的需求。

当然,

核心还是算法增强

,它赋予了模型专业理解和决策能力。这主要包括增量预训练、指令微调和强化学习。

重点来了——Llama3的中文增量预训练具体怎么做?首先得考虑

词表构建问题

。相比中文词表过小的Llama2,Llama3的词表大幅扩充,对多语言更加友好,中文压缩率提升明显,甚至无需中文扩充就能满足生产需要。

值得一提的是,我们创新了

预训练文本建模策略

,实现了多长度文本的高效训练。传统方案通常是固定长度截断,导致长文本大量被截断、短文本训练效率低下。针对这个问题,我们采用了分桶式混合长度训练策略,兼顾长短文本建模,截断比例大幅降低,训练效率提升了14.6%。同时,通过无损长文本训练,加入少量数据即可实现100k上下文,为后续的长文本处理任务提供了有力支持。

指令微调阶段,我们分为混合微调和指令微调两个阶段进行,兼顾了大模型的通用能力与领域能力。为了高质量、低成本地构建指令微调数据,团队

自研了数据生成方法Self-QA

,成功将海量无监督数据转化为高质量的有监督指令数据,并合理配比了数据来源。

在指令微调基础上,团队

追求强化对齐的最优策略

,在方法层、样本层和能力层实现了模型的“自我超越”,一系列方法和策略的创新,让模型更符合人类需求,效果显著提升。

工程增强是保障

,确保模型高效、稳定地服务于领域应用。模型量化、推理加速和架构优化是其中的关键。

场景增强是领域模型的方向,包括

智能体(Agent)、提示词工程(Prompt)和检索增强(RAG)

,让模型更懂领域、更懂用户。

为了科学评估模型性能,精准指引优化路径,团队构建了全方位的评测体系。通过不同模型间的“横评”看差距,通过同一模型在不同阶段的“纵评”看提升。评测覆盖预训练、指令微调和应用三个阶段,每个阶段都有相应的指标。评测手段包括实时评测和阶段评测,实时评测通过CheckPoint自动触发,阶段评测则采用“自动+人工”的立体化体系。此外,

评测深入到领域细分场景

,不断挑战模型的专业化潜力,形成评估、反馈和优化的闭环迭代。

到此,我们展示了度小满从Llama3到金融行业的完整解决方案。

领域模型价值创造:赋能、创新与变革

领域模型正在为企业数字化转型提供全链路赋能

,从前端的客户服务到后端的研发创新,大模型都能渗透到业务其中。通过大模型的赋能,企业可以优化业务流程、提升研发效率、增强客户体验、优化决策。

度小满轩辕大模型:跨越认知,走向AGI

为了应对大模型在金融场景的落地挑战,向行业分享实战经验,我们开源了「轩辕」系列大模型。

度小满「轩辕」是国内首个开源中文金融大模型。

2023年5月,千亿参数规模的“XuanYuan-176B”开源发布;2023年9月,“XuanYuan-70B”在C-Eval和CMMLU两大权威榜单上位列所有开源模型榜首;2024年3月,「轩辕」全新发布了6B、13B、70B参数的基座模型、对话模型、int4/int8量化模型,共12款金融大模型,并全部实现开源。

「轩辕」在金融领域的内容理解和生成上能力卓越。在金融自动评测集FinanceIQ上,XuanYuan-70B-V2展现了超过GPT-4的水平,表现出专家级的金融知识能力。在解决实际金融任务时,金融专家的人工评测结果显示,各个参数尺寸的轩辕模型均具有“以小搏大”的实力,达到自身2到5倍参数量的模型水平。

「轩辕」不仅在金融领域成绩优异,模型能力也覆盖了数学计算、场景写作、逻辑推理、文本摘要等多个通用维度

,在MMLU、CEVAL、CMMLU、GSM8K、HumanEval等主流评测集上表现出色,甚至在多个中文评测榜单上超越了GPT-4。

「轩辕」系列大模型的技术认知和实践经验,也毫无保留地总结成了

《大语言模型原理与工程实践》

一书,力求体系性强、实践性强,既便于初学者快速上手,也为有经验的从业者提供了深度学习的机会。

期待模型能力、场景应用和人机协作全面升级的AGI时代。