大模型在融合通信产品中的应用实践
IM(即时通信)和 RTC(实时音视频通信)技术,作为融合通信的核心组成部分,早已渗透到我们日常的社交、客服、协同办公等方方面面。而大模型的快速发展与日渐成熟,尤其是 LLM 技术的第一个现象级应用 ChatGPT 以会话作为唯一交互形态,更是给这个领域带来了深刻的变革。那么,如何将大模型与通信 PaaS 平台深度结合,加速场景化落地,就成了眼下一个非常关键的议题。
网易在大模型技术应用方面也做了不少探索,并在内部多个业务线有了落地实践。在 ArchSummit 架构师峰会上,网易云信首席架构师、产品部负责人周梁伟分享了他们在大模型产品上的应用思路。这里,我把他的分享内容整理出来,供大家参考。

网易数智这个业务,早在 2015 年左右就开始涉足 ToB 市场了。当时业内很多云公司采取高举高打的策略,直接从底层架构开始搭建。而网易的做法不太一样,我们更多是结合自身的业务来做内部基础设施建设,在服务自身业务的过程中,逐步把这些基础设施打磨完善、场景化,最终包装成对外提供的 ToB 服务。
今年年初,网易数智进行了一次业务变革,结合大模型和 AIGC 等前沿技术能力,整合了更多业务,加入了“智慧”和“AI”的元素。那么,现在的网易数智具体包含哪些业务呢?首先是网易易盾,主要负责内容安全。网易有大量内容型产品,比如网易新闻、网易云音乐,这些产品每天都在处理海量的内容审核。在网易易盾里,我们将传统的机器审核与大模型做了结合,推出包括 AI 内容检测、智能风控、实名认证以及安全架构在内的系列能力,对外提供完整的易盾安全产品。
第二块是我负责的网易云信。云信从 2015 年开始对外商业化,说起来它的起源可以追溯到更早的网易泡泡,一款即时通信软件。后来微信时代,我们又和电信合作推出了网易翼信,做到了亿级用户规模。在 C 端市场摸爬滚打,积累了大量融合通信经验之后,我们发现,无论是即时通信(IM)还是音视频通信,在各种场景里都是非常刚需的能力,但要自己从头建好这些能力的门槛又极高。所以,我们把这些能力打包成网易云信,对外提供 IM、RTC、直播、点播以及与运营商结合的信息等业务。
业务整合后,现在内部还融合了部分轻舟微服务和轻舟中间件,这些都是面向开发者的软件服务。网易云商则结合了网易严选和考拉等电商平台,推出了客服平台,数帆和 CodeWa ve 也都整合进来了。随着大模型趋势的深化,各个产品都融入了相关的 AI 能力。举个例子,AI 内容检测从过去基于规则的机器匹配,转变为结合 AI 模型识别海量 UGC 内容,这带来了全新的挑战。尤其是在自动问答生成过程中,如何做好内容风控成了关键一环。我们结合 AI 合规要求,也推出了一些新产品。
网易云信的核心是做通信,它本身是一个通道。但这个通道的应用场景,尤其是社交领域,通常是相对高风险的。在这个过程中,我们不仅要做好内容安全管控,还要将通道过程中产生的数据价值与 AI 结合起来,充分挖掘其潜力。

这是网易云信的 PaaS 架构图。我们从网络层开始构建了一个全球实时通信网络,这个网络支撑着三大主要业务:RTC 音视频通话的实时网络、IM 即时通信和直播流媒体的分发网络。这个基础网络是我们 PaaS 平台的底层服务,虽然不直接提供给客户,但它是整个 PaaS 产品的核心基建。
在 PaaS 产品层,我们提供的服务包括 IM 即时通信、信令、直播、点播、信息和音视频等。这些能力,开发者可以直接拿来用。当然,除了自身提供的能力,我们也和第三方厂商合作,尤其是在安全方面,我们既有网易易盾这样的自研能力,也有第三方厂商的生态支持。
说到大模型的应用场景,因为 PaaS 平台应用广泛,客户会用我们的能力去搭建娱乐社交、教育、协同办公等各种各样的场景。这些场景千差万别,很难通过单一模型来覆盖所有需求。所以,我们更多是扮演桥梁和生态连接器的角色,与各类公有云、私有模型部署、训练实施厂商合作。
另外,我们还与视频处理厂商合作,提供美颜、变声等能力,也跟社交行业中的游戏厂商合作,这些都是我们的生态伙伴。今年业务整合后,我们正式提出了“数字化”方向,主要面向企业场景,包括内部办公和内外营销沟通。
很多企业明确表示不能使用公有云,大模型也不例外。所以我们从 2017 年起就一直提供私有化部署服务,来解决客户在数据安全上的顾虑。同时,我们也结合实施和集成类的生态合作伙伴,共同提供这些服务。
我们的 PaaS 平台支持客户使用多种融合通信场景,包括单聊、群聊、弹幕聊天室、音视频等。这些场景广泛覆盖了娱乐社交、教育、医疗和金融等领域。比如在医疗场景中,本地医院的医生可以和远程专家在线阅片,这里面就有大量的音视频互动和 IM 内容互动。在金融场景中,我们支持虚拟营业厅和柜员,基于底层能力构建上层业务。协同办公是另一个重要场景,虽然市面上有钉钉、飞书这些 all-in-one 的产品,但很多客户出于合规或者个性化需求,用不了 SaaS 产品。他们就可以基于我们的融合通信能力,自己构建 OA 办公平台、企业培训平台、视频会议平台和客服系统。
经过 8 年的持续产品迭代,我们已经积累了约百万开发者,系统里发送了超过 2 万亿条消息。这个数据体量,本身就是一种巨大的优势。

回到大模型结合这个问题上。我们的通信系统本身是一个连接器和消息分发网络。在服务客户的过程中,我们发现几个关键痛点。
第一,怎么把 AI 能力融入到用户交互层面?比如在群聊或客服互动中,如何将 AI 能力整合到点对点或群组的沟通里去。
第二,群聊或客服过程中会产生大量上下文数据。这些数据在与客户沟通时,可以被提取和利用,进行基于上下文的持续问答。这些数据对于模型训练来说至关重要。
第三,也是最关键的一点,很多客户内部已经有 AI 团队在训练自己的大模型,或者在使用供应商提供的大模型训练服务。我们怎么跟这些已有的 AI 能力结合?这才是核心。因此,我们更多是作为一方、二方、三方之间的大模型生态连接器,来促进资源的整合。
最后,很多客户倾向于本地化部署,主要原因有两个:一是安全,二是业务迭代的持续性。本地化部署的大模型成为一个企业的大脑,里面存储着所有数据信息,能够支持更多业务和不同场景的数据整合利用。这可以说是客户最关心的问题。

从业务场景出发,我们的方案主要涉及几个层面。从最基础的层面看,AI 技术已经广泛应用于各种业务,比如通过 AI 进行关键词搜索、信息提取、语言翻译,乃至自动语音识别(ASR),这些都跟传统方法有很大不同。AI 还可以应用在论文索引、代码生成和优化上,为程序员提效。
今天我们重点讨论两个与 IM 和大模型结合的场景。第一个是客服,包括售前咨询和营销类客服。第二个是娱乐社交,包括虚拟人物和 AI 机器人社交语聊。在这些场景之上,AI 技术可以广泛应用于不同行业。比如在电商领域,客户通常在购买商品后需要沟通处理售后,交互时间较短。但在其他场景中,客服的交互时间可能更长。
以网易云信自身为例,我们面向开发者的产品,在售前咨询过程中往往持续半个月到一个月。开发者在集成 SDK 或 API 时,会产生大量的问答,并且这些问答前后关联。在长流程客服场景里,对历史信息的提炼和关联就显得尤为重要。
类似地,在线教育和办公协同里也存在客服场景。例如在办公过程中,HR 和 IT 服务涉及的问答频率很高,像社保政策或薪资问题。在这些情况下,通过 AI 客服提供持续服务就显得尤为重要。把 AI 客服跟 OA 办公平台结合起来,可以有效解决这些问题。此外,AI 技术在游戏和电商等领域也有广泛应用。

先说说客服场景。目前市场上有大量第三方客服平台,比如网易自己的“网易七鱼”。早期的客服主要依赖人工,人工客服需要不断回答问题并持续管理。但随着业务发展,客服人员的规模和培训成本不断上升,运营压力很大。
为了降本,很多企业开始用机器人客服来替代人工。目前常见的客服流程是:机器人客服 -> 人工客服 -> 工单处理。这种模式虽然降低了运营成本,但又带来了新问题,比如知识库的维护成本。客服要回答的问题和产品知识在不断迭代,传统的做法是建一个知识库,需要专门的机器人训练师从非结构化数据中提取知识点和标准问答,进行语义训练。这种方法在面对业务的持续变化和知识的快速迭代时,显然有些力不从心。
大模型的出现则提供了更好的解决思路。它通过自然语言理解、关键信息提取以及持续训练的能力,可以更灵活地应对。其次是用户意图的把握。用户背景不同,表达习惯也千差万别,同一问题的说法可能天差地别。过去主要依赖 NLP 技术,但在准确把握用户意图上,大模型凭借其更强的处理长文本和历史信息的能力,带来了显著的提升。
第三个问题是大量历史信息的查阅。在电商场景里,客服问题通常跟当前订单有关,通过业务系统集成调取订单信息就能解决。但在技术平台类客服或其他复杂场景中,客服需要基于大量历史数据,而这些数据往往就存储在 IM 或 RTC 平台里。大模型可以更有效地处理和利用这些数据。

通过结合 AI 技术,客服效率得到了显著提升,主要体现在:
首先,AI 可以更精准地理解用户意图,提高机器人客服的问答质量。虽然还是需要人工客服,但 AI 的应用可以减少人工的工作量。在人工客服过程中,AI 可以提供两方面帮助:一是为客服人员提供用户的上下文信息和建议答案,客服人员只需进行人工校准;二是收集和利用人工客服提供的精准散点化回答,这些回答很有价值,可以被引入知识库进行二次训练,优化后续的自动化回答。
通过 AI 的群体客服能力,以上问题可以得到有效解决,有助于构建更高效的自动化知识库。

构建知识库的过程中,有两个重要的数据源。传统模式下,企业知识库通常来自业务系统或内部文档,比如 PDF、Word 文件,或者 HR 发布的规章制度网页。这些分散的信息需要被结构化处理,过去是人工理解和提取知识点,再整合到知识库里。结合大模型后,只需将文档输入系统,由大模型自动理解和消化。
第二个重要的数据源是用户沟通过程中的历史记录,这在长会话或多人客服场景中特别重要。举个例子,新能源汽车的客服场景就显著不同于传统汽车。通过直销模式,新能源汽车企业提供更优质的服务,从客户进店、下订单、提车、使用过程中的事故、保险理赔到售后维护,整个过程的信息都通过客服群汇总。在这种场景下,如何把用户过去一个甚至一年的反馈结合起来,解决当前的问题,就成了一个重要课题。通过将 IM 中的大量历史数据与大模型结合,再加上标准的企业知识库,可以大幅提升客服的回答质量。

这是一个精准识别提问的示例。在数字人客服过程中,过去可能主要靠关键词提取,现在可以基于关键词,在企业知识库的向量库里做一些关键内容提取,之后根据场景化定义的提示词(prompt),提供更好的回答。它具备根据上下文不断追溯的能力,做出生成式回答。

这是人工服务持续提效的示意。客服在回答问题的过程中,可能会产生很多散点问题,或者给出一些建议性答案。通过 IM 上层的 UI 工具和底层数据能力之间的打通,可以快速给出一些提示。同时,客服人员可以对当前会话的相关信息打标签,之后这些数据可以回溯,再做二次训练。

另一个场景叫群客服。在群客服场景里解答问题,如何快速提取上下文?可以通过 @AI 机器人,让它帮忙把上下文提取出来,或者给一个建议。

第二个场景主要涉及营销。过去的营销方式,常常是用户访问网站时弹出一个客服页面,询问用户并提供快速链接。但这种方式的精准度比较低,用户往往需要多次点击才能找到准确信息。通过结合大模型,可以显著缩短推荐链路。
大模型的优势在于能够利用用户在产品中的历史数据,分析其特征和偏好。比如用户的年龄、地区、职业标签(如“职场女性”)等信息。将这些分析结果与企业知识库中的产品推荐信息相结合,可以为客户提供更精准的推荐。同时,在客服过程中也能提供快速触达和促成交易的链接,提高营销效果。

第二个场景主要偏向娱乐社交和游戏。当前,新产品推出面临的最大挑战之一是如何快速积累用户,或者需要高昂成本来制作大量的专业内容(PGC)。在这种情况下,如何快速启动就变得尤为关键。比如小说、漫画、动漫等创作,需要大量专业知识和持续的内容积累。借助大模型,可以通过不同的标签和提示,生成拟人化、个性化的人物角色,应用于社交场景。近年来,市场上已经推出了许多类似的 C 端产品,这种虚拟人社交的趋势,可能会逐渐替代部分真人社交。

在社交场景里,即使是真人用户的一对一交流,面对大量问题时也可能应接不暇。在这种情况下,可以利用用户已有的知识信息和表达习惯,通过大模型生成一个类似 AI 角色的“数字人分身”,来代为回答问题。这种方式不仅可以在单聊和群聊中增强互动,还能提高交流频率和交互效率。

基于上述场景,在融合通信或 IM 通信领域与大模型结合,主要面临几个难点:
首先,训练过程非常复杂。目前市场上有大量大模型,包括公有云和私有化版本。要进行有效的二次训练或结合自身业务数据训练,企业会有两大顾虑:一是担心业务数据投入训练后可能带来数据泄露风险;二是对众多大模型和垂直领域模型了解不足,难以选择最合适的。如何解决这个训练难题,成了一个重要课题。
其次是选型问题。客服场景里有很多垂直领域需求。比如网易云信作为一个技术开发平台,客服场景中需要的大模型对代码理解能力要更强,因为客户的问题多与代码相关,答案也多是代码。因此需要选择代码理解能力更好的模型。而在电商、财务或法规等领域,则需要选择对相应领域理解更好的模型。可以预见,未来将存在大量不同领域的垂直模型。
第三是数据整合问题。不论是构建上下文关联数据库、生成提示词,还是进行二次训练,都需要结合大量业务数据。在 IM 中,通信过程已经产生了大量业务数据,这些数据对企业来说非常有价值,可以作为模型训练的重要数据来源。作为一个 PaaS 平台,我们的开放性很好,可以通过 API、SDK、Webhook 等形式实现数据互通与开放,从而持续增强模型的训练效果。
最后是业务融合问题。我们的产品以 UI Kit、SDK 或 API 形式对外提供,可以与各种业务场景进行融合。这种灵活性和开放性使得数据和业务功能能够无缝集成,提高了整体系统的智能化和自动化程度。

这是大概的架构图。底层支持的资源和服务包括本地部署的算力平台、向量数据库存储服务,以及即时通信和内容合规的云服务。我们支持公有云和私有化部署两种模式。
往上一层,我们为客户提供了一些经过调研的大模型建议,可以是云上运行的模型,也可以是私有化部署或经过二次训练的模型,实现与我们平台的互通。
第三部分涉及模型训练过程中可能需要大量第三方标准数据,比如图表、日期、气象数据等,这些数据通过插件形式引入到互动过程中。我们在 UI Kit 等层面实现数据的互通。向量数据库作为关键基础资源,来实现数据上下文的存储。
最顶层提供给用户的是 SDK 和 API,同时还提供了控制台等界面化操作能力。

基于这种方案,作为一个 PaaS 平台,我们服务了大量的 IM 场景客户。
在这些场景中,我们积累了开发者的使用习惯和业务理解。基于这些理解,我们设计了更优的交互方式和 API 与开发者系统的集成方案。另一方面,这些场景产生了大量数据。虽然这些数据对平台本身的价值不高(因为它们主要属于客户的垂直业务场景),但对客户来说,结合他们的大模型进行二次训练,这些数据就非常有价值。
因此,我们的数据可以帮助客户通过与业务系统集成,获得更好的回答。这些数据只有在用户与模型进行互动时才能发挥作用,这个过程基于通信中的数据安全和脱敏机制。另外,由于我们服务的客户场景多样,客户可以积累跨不同垂直领域的经验。比如,我们为某电商公司提供的解决方案,可能在低成本下被另一家电商公司复用,从而让企业以更低的成本实现类似场景的落地。

最后一个部分涉及基础能力的互通。这是传统架构中的一个对话过程。一旦与云信打通,我们便能通过 API 开放平台,让客户提取数据并调用 API 接口快速响应。这种打通可以显著加速整个开发过程。

这解决了当前场景下的两个核心问题:强化 AI 的场景响应效果,以及语料的持续积累。

重点在于,通信过程中用户在我们平台产生的数据,如何结合向量数据库,进而适配我们业务垂直的大模型进行训练,实现更佳的响应效果。

简单来说,作为一个 PaaS 平台,我们提供 UI Kit、SDK 和 API 能力。UI Kit 旨在帮助客户和开发者降低开发成本的同时,提供各种 AI 交互入口,比如工具栏、虚拟账号,以及群体中的机器人交互。

除了 UI Kit 的开放能力,我们还提供控制台和简便的集成互动能力,比如数字人模板库。这个模板库主要基于场景定义和基础数据训练,具有通用性但不包含企业私有数据,可以进行二次定制。
未来,我们将开放生态合作伙伴在模板库内的生态系统,支持模型能力服务、实施和行业场景训练模板的上传,为更多开发者提供使用和定制的机会。
客户选择模型后,可以快速连接并上传私有数据集,进行二次训练和调整。

最后,在交付策略上,我们会充分满足客户对数据和模型安全性的高要求。全面支持私有化部署或混合云部署模式,以适应不同的需求和场景。
总结来看,作为 PaaS 平台,我们的核心思路是:深入理解客户需求和通信领域的底层优势,再结合大模型的能力,与生态合作伙伴一起,推动解决方案的落地。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名