首页 > 教程攻略 > ai资讯 >AIGC大模型实践总结

AIGC大模型实践总结

来源:互联网 时间:2026-08-22 14:06:17

大模型浪潮席卷全球,这话一点儿都不夸张。从2022年底ChatGPT横空出世,到如今各行各业都在琢磨怎么用上AI,这股趋势已经不可逆转。这一年,所在团队也在AIGC领域里持续摸索、反复尝试。这篇文章既是对这些实践的一次总结复盘,也是在这一过程中积累的一些笔记和心得。水平有限,文中难免有理解或表述不到位的地方,欢迎各位大佬随时拍砖指正。

AI时代

2022年11月30日

,OpenAI推出ChatGPT后瞬间引爆市场。五天注册用户破百万,两个月用户数飙到1亿,成了史上增长最快的消费者应用。紧随其后,各大厂纷纷杀入AIGC赛道,国产GPT大模型发布潮和AI创业公司成立潮此起彼伏。

大模型代表着一个新的技术AI时代的来临。它展现出的强大语义理解、内容生成以及泛化能力,正在潜移默化地改变我们的工作方式、生活方式和思维方式。就像《陆奇的大模型观》里说的,我们正处在从信息系统向模型系统过渡的新范式拐点上,“模型”知识无处不在。人工智能的浪潮正在引领一场新的技术革命,或许可以称之为第五次工业革命。

2024年2月16日

,OpenAI正式发布文生视频模型Sora,再次引发全球关注。Sora可以根据用户输入的文本提示,快速制作出长达一分钟的逼真视频。这些视频能够呈现复杂的场景,包含多个角色、特定类型的动作、主题和背景,细节相当准确。要知道,当时像Pika这类主流的视频生成模型,大多只能维持5秒左右的动作和画面一致性,而Sora能在长达17秒的视频中保持这种一致性。

核心优势就三点:

60秒的超长时长、运动镜头下的内容一致性、现实场景的真实感

2024年3月13日

,明星机器人创业公司Figure发布了一个全新demo,背后有OpenAI大模型加持。视频里,Figure机器人直接与人类对话,没有任何远程操作。机器人的动作速度明显提升,开始接近人类的速度。很多人被这种进化速度震惊了——我们正站在这股汹涌的进化浪潮中。甚至有网友感叹:已经准备好迎接更多的机器人了。

大模型基础知识

在人工智能领域,AI、AIGC、AGI、ChatGPT这几个词,其实是四个不同的概念,得先理清楚。

AI(人工智能)

人工智能是最宽泛的概念,泛指通过机器模拟和执行人类智能功能的技术。它涵盖的范围很大,包括狭义和广义两个层面。

狭义的AI(弱人工智能)指的是能执行特定任务的智能系统,比如语音识别、图片识别、智能驾驶,只能在特定场景和范围内体现智能行为。广义的AI(强人工智能)则指具备和人类一样智能水平和认知能力的系统,能在复杂环境下自主学习、推理、理解、适应,表现更高级。

AGI(通用人工智能)

通用人工智能是广义AI的一个子集,指能在各个领域和方面都达到人类智能水平的系统,具备人类的多样性和灵活性。AGI是AI研究的终极目标之一,能够跨领域执行多种任务,具备自我学习和适应能力,可以进行各类学习和推理任务,并且具备

自我意识和通用智能

AIGC(人工智能生成内容)

AIGC,全称"AI Generated Content",又称生成式AI,就是利用AI技术自动创作出新的内容,包括文字、图像、音乐、视频等。它的核心优势在于能大大减轻人类创作者的负担,提高内容生产的效率和规模,同时还能创造出全新的、创意性的作品。

简单理解,AIGC的水平介于弱AI和AGI之间,是AGI在内容生成这个特定领域的一种削弱型应用。目前AIGC已经有广泛的应用场景,而AGI还处于研究阶段,且在实际落地时必然会面临严格的机器人伦理问题。

LLM(大语言模型)

大语言模型一般指在大量文本语料上训练、包含百亿甚至更多参数的语言模型。目前基本都采用Transformer架构。LLM近期之所以爆火,很重要的一点是:只有当语言模型的规模达到一定量级时,某些能力才会出现,这被称为

涌现能力

。代表性的包括上下文学习、指令遵循、逐步推理等。

比如Transformer架构的GPT-3、BERT、T5等模型,通过在海量数据上训练,学习到了丰富的语言和知识表示,展现出强大的自然语言处理能力。

ChatGPT

ChatGPT是"Chat Generative Pre-trained Transformer"的缩写,是一种基于人工智能技术的聊天机器人,能进行自然语言理解和生成,提供流畅且类人的对话体验。它是史上增长最快的消费者应用,可以用于问答、文本摘要生成、机器翻译、分类、代码生成和对话等多种场景。

大模型架构

2017年之前,主流的架构主要有这么几种:N元文法(n-gram)、多层感知器(MLP)、卷积神经网络(CNN,常见于计算机视觉)、循环神经网络(RNN,擅长预测文本、语音和时间序列等序列数据)。

Transformer架构

现在最火的当然是2017年提出的Transformer架构,它已经成为目前最常见的大语言模型基本结构。Transformer涉及大量概念和应用,比如编码-解码(encoder-decoder)、注意力机制(attention)、KQV(Key、Query、Value)等。

Transformer模型的核心架构分为编码器和解码器两部分。编码器负责将输入序列编码成一个向量,解码器则从该向量中生成输出序列。

简单的工作流程是这样的:

1. 获取输入句子中每个单词的表示向量X,X由单词的Embedding(从原始数据提取的特征)和单词位置的Embedding相加得到。

2. 将得到的单词表示向量矩阵传入Encoder中,经过6个Encoder block后,得到句子所有单词的编码信息矩阵C。

3. 将Encoder输出的编码信息矩阵C传递到Decoder中,Decoder会依次根据当前已翻译的单词,逐个翻译下一个单词。

用过ChatGPT的人会发现,输出结果是一个字一个字蹦出来的,这正是Transformer的结构决定的。

可以简单把Transformer的学习和预测过程想象成语言翻译:如果模型要把A语言翻译成B语言,那么编码器就是把A语言翻译成"模型语言",解码器再把"模型语言"翻译成B语言。

注意力机制

Transformer之所以功能强大,很大程度上归功于注意力机制。什么是注意力机制?打个比方,我们看一张图时,并不会同等地查看图中每个位置,而是会自动提取"重要的位置"。

Attention,就是注意力,从两个不同的主体开始,互相注意——我注意到他,他也注意到我。NLP领域最初把它用在翻译任务上,天然就有source和target。比如翻译第一个词时,attention机制会关注到前面所有词,但权重不一样。简单理解就是:

计算词之间的相近关系

注:颜色粗细代表权重大小

这张图可以解读为:

一段自然语言内容本身,就暗含了很多内部关联信息

。比如一句话中,如果用"自注意力"机制,应该给"知识"最多的注意力。也就是说,

一段自然语言里其实暗含了这样一个逻辑:为了得到关于某方面信息Q,可以通过关注某些信息K,进而得到某些信息V作为结果

。(Q就是Query检索/查询,K、V分别是Key、Value。就像我们在图书检索系统里搜"NLP书籍"——这是Q,得到一本叫《自然语言处理实战》的电子书,书名就是Key,这本电子书就是Value。)

Transformer架构还有很多逻辑和知识,这里不一一列举。这个架构之所以能带来巨大变革,核心优势在于:

:相比2017年前的RNN,Transformer并行性更好。

记忆力好

:词间距缩短为1,处理长文本时有更大的容量。

能处理不同长度的序列

:不需要输入的数据序列是固定长度。

上下文学习(In-Context Learning)

一个预训练模型,在处理下游任务时,不需要微调模型参数,只需要在输入时加一些示例,就能有SOTA(State-of-the-Art,即最优秀模型)的表现,这就是上下文学习(ICL)能力。

ICL能力最直接的应用就是Prompt Engineering。2022年,很多学界人士的研究重点都转向了Prompt。一般流程是"Pretrain, Prompt",到了Prompt环节,通常是给模型输入x期望得到输出y。但如果我们对使用者给出的x进行二次加工(把这个加工表示为一个函数f(x)),是否能在输出上获得更好的结果y呢?甚至可以优化输出的结构,得到更好的结果。

举个例子,用户问"自驾去杭州周边两天一夜玩,有什么推荐的地方吗?",模型可能只返回"南浔古镇"。但如果通过Prompt Engineering优化一下,效果会好很多。这里的f(x)就是Prompt Engineering,而g(x)其实是Answer Engineering。

ICL的数学原理和底层逻辑目前还没有明确定论,比较复杂。简单总结几点用于指导后续应用:

在prompt里带上demo很重要,而且demo在形式上input和label都需要。

对于demo中的input,不要随意给出,要提供合理的input。

对于demo中的label,只要它属于正确的值域空间label space就可以了,是否与input有正确的映射关系不重要。

Prompt Framework

Prompt的专业程度直接关系到两个方面的效果:一是大模型回复的准确性和针对性,好的Prompt能帮助模型更好地理解你的意图和需求;二是大模型回复语句的自然度,好的Prompt能帮助模型更好地处理歧义和上下文依赖,提高回答的自然度。

Ela vis Sara via总结了一个Prompt框架,包含四个元素:

Instruction(必须)

:指令,即你希望模型执行的具体任务。

Context(选填)

:背景信息或上下文信息,能引导模型做出更好的反应。

Input Data(选填)

:输入数据,告知模型需要处理的数据。

Output Indicator(选填)

:输出指示器,告知模型要输出的类型或格式。

只要按照这个框架写prompt,模型返回的结果通常都不会差。当然,不一定每次都要包含全部四个元素,可以根据需求自由组合。比如推理场景可以用Instruction + Context + Input Data,信息提取场景可以用Instruction + Context + Input Data + Output Indicator。

提示工程(Prompt Engineering)

在Prompt Framework背景下,为了让LLM输出更高质量、对业务有价值的回答,工程侧通常会将用户的随意问题进行包装、组织和抽取,组成问题的上下文,并添加一些限定语句,从而得到有效的提示词。这需要一个专门的代码逻辑或应用服务来完成。

让query有效并产出好的结果并不容易,需要避免二义性和无结果的情况。这就产生了提示词工程:包括提示词引擎runtime(用来串联产投链路数据)和模板运维。

关键原则有两个:一是模板与工程分离(类似前后端分离),二是确保信息够用——串联产投链路数据,补齐到模板中。

COT(思维链)

在认知科学里有一个"认知双通道理论",讲的是人脑有两套系统:系统1(System-1)是直觉系统,运行无意识且快速,不怎么费脑力;系统2(System-2)是逻辑分析系统,需要注意力,用于复杂的运算和推理。

当前深度学习主要在做的其实是System-1的事,比如图像识别、人脸识别、机器翻译、情感分类、语音识别、自动驾驶等。而System-2要做的事——比如推理、规划——正是未来深度学习的方向。

大语言模型的研究者也在探索System-2要解决的任务,于是有了下面几个技术方向:

Google提出思维链提示(CoT Prompting)

:2022年初,Google在论文中提出"思维链(Chain of Thought,CoT)",研究发现通过在prompts中增加一系列中间推理步骤,就能显著提升LLM的推理表现。具体做法是在问答样例中加入一段思维链,而不是直接给出答案。

Let's Think Step by Step

:2022年5月,三位东京大学学者和两位Google研究人员发现,在prompt中加入一句"Let's think step by step",模型在逻辑推理任务上的表现大幅跃升。具体数据相当惊人:对OpenAI的InstructGPT模型,在MultiArith数据集上准确率从17.7%提升到78.7%,在GSM8K数据集上从10.4%提升到40.7%。对Google的PaLM模型(5400亿参数),在MultiArith数据集上从25.5%提升到66.1%,在GSM8K数据集上从12.5%提升到43.0%。事实上还有很多类似的Prompt插入,但效果都不如这句好。

大模型发展与应用

大模型概述

所有这些应用底座的,就是大模型(Large Models)。大模型在AI领域通常指具有大量参数(通常包含十亿甚至千亿参数)、复杂计算结构和强泛化能力的机器学习模型。其主要特点包括:

大量参数

:远超过传统的小型模型,具备极高的表达能力。

强大的学习能力

:在各种任务上能达到或超越人类表现。

大数据集和计算资源密集

:需要大量训练数据和高性能硬件GPU集群。

预训练和微调

:先在大量无标注数据上预训练,再在特定任务数据集上微调。

自我监督学习

:无需人工标签,模型自己从输入数据中学习特征。

上下文敏感性

:能考虑更多上下文信息,生成更准确流畅的文本。所以在实践中,要尽可能输入足够的上下文信息来提高结果准确度。

业务AIGC应用领域和实践

关键项目概述

产技推进原则很明确:

在有强行业属性的需求方向上坚持投入定制

(比如生图、生产决策因子),

在偏通用的应用上尽可能快速复用平台产品

,底层复杂能力通过集团借力。

AIGC工程实践

策略

:业务侧核心聚焦业务场景应用,平台能力和模型不会搞得太重。

技术目标

:构建一套支持多业务场景的AIGC横向工程引擎架构,辅助业务快速落地AIGC场景。考虑扩展性、模块化和服务可重用性,嵌入产供投链路。

架构设计

:采用分层设计,实现各层次的解耦和服务复用。通过API、消息队列、ODPS回流等方式实现系统间数据交换和流程协同。核心公共能力包括多模型接口封装、Prompt管理、标注反馈能力、任务管理能力、多业务身份隔离等。

具体分为以下几个层次:

1. 用户界面层

:提供用户友好的操作管理界面,可根据不同业务场景定制。包括生成任务提交和结果查看、策略生产集成(将AIGC能力嵌入电商产供投链路)、Prompt模板管理和业务规则管理、横向标注界面等。

2. 应用层

:处理业务逻辑的中心层。包含API网关(IDD + HSF)、业务流程服务、身份验证服务、任务管理器、任务调度器、生产管理等。

3. AI核心能力层

:封装不同AIGC能力成独立服务,最小能力具备可插拔特性。包括文本处理服务、图像处理服务、视频处理服务、对话管理服务等。

4. 模型层

:包括模型管理(接入GPT4/3.5、通义千问、vertex-PaLM2、claude2等)和微调模型。

5. 数据处理层

:处理数据的获取、清洗、转换和存储。包括数据处理服务、知识库、数据库、文件存储等。

6. 基础设施层

:包括计算资源(服务器、GPU)、网络设备、存储等。

7. 监控与运维层

:包括日志管理、性能监控、自动化部署(CI/CD)等。

应用场景举例

素材优化

业务背景:因为多语种翻译、商品信息不足等问题,导致商品属性缺失、图片素材质量低,用户理解难、转化低、万求高。面对极大品量,运营手动仅能补全少量头部商品,无法全量优化。在AI技术成熟的背景下,考虑用AIGC对商品的属性、卖点、素材图片、场景图等信息进行补全和优化。

核心方案:技术选型分三步——模型底层选择、语言和框架选择、整体架构设计。基于大模型生文能力和部署Stable Diffusion生图能力,通过离在线数据接入、配置化设计、异步任务调度等技术,链接业务供给数据资产,构建嵌入产供投链路的批量化AIGC工程。

阶段进展:文生文工程具备Prompt模板提示和自动填充、任务试跑预览、费用预估、批量化AIGC生产等能力,简化了业务使用门槛。商品属性补全超过百万品,获流效果在主搜免费获流上显著提升(有动销商品和动览非动销品均正向),商详AB验证对成交转化率也有正向提升。场景图方面,建设了标品场景图替换、白底图和透明图生产、透明图超分处理、模特服饰上身、图片连通域检测、图片转存、图片裁剪等二创能力。图素材生产上万,首猜获流效率和主搜曝光点击率均为正向。

商家Copilot

另外,团队初步探索构建了具备业务知识的AI办公助手,服务于商家,提升运营效率和业务体验。不仅解放了业务小二的工作量,也提升了操作效率和准确性。

实践过程挑战

在AIGC实践中,技术挑战和机遇是并存的。下面聊聊几个实践中的挑战和部分解决思路。

技术挑战

问题

描述

解决方案及思路

知识量有限

  • 比如GPT-4,主要是21年前训练样本和通用语料,对实时数据、垂直领域数据和专属知识无法理解

  • 无法"在外部世界行动",搜索网页、调用API或查找数据库

方案1. LLM+检索增强:在LLM基础上通过检索额外提供领域数据信息。对于用户输入Query,结合业务数据中检索到的结果一起输入给LLM,可以得到更精准的回答。

方案2. 构建行业数据集对LLM微调,使模型本身具备输出行业信息的能力(成本高且效果不佳)。

【解决方案】:LLM+检索增强。OpenAI提出了chatgpt-retrieval-plugin、WebGPT,开源社区也提出了DocsGPT、ChatPDF、基于langchain的检索增强chatbot等方案。

效果问题

  • 部分场景效果不及预期

  • 复杂逻辑推理能力不佳

  • 对未见过的知识语料回答效果差

1. 大模型+上下文学习技术(ICL),设计合理的prompt模板

2. 大模型+思维链提示(CoT),引入推理路径作为提示,激发大模型按这种推理模式生成合理结果

3. 大模型+高质量标注样本+指令微调(PEFT技术),提高模型对特定任务的泛化能力

延迟问题

  • 一次完整问答大概10秒以上(用户200ms就有体感)

  • 延迟主要受模型和生成的令牌数量影响

1. 流式传输:设置stream:true,使模型在令牌可用时立即开始返回,缩短首次响应时间。

2. 基础设施优化:OpenAI美国服务器存在跨国网络延时。

3. 减小token:比如使用更短的提示。

4. 缓存:存储经常访问的数据,缩短响应时间,但新增信息时需使缓存失效。

资源和性能

  • 训练和微调需要大量机器资源,GPU资源匮乏

  • 部署资源,尤其C端投放有高并发低延时要求,需投入巨大成本

1. 不训练基座模型,微调选择几B到几十B左右的LLM(如ChatGLM-6B)

2. 曲线救国:线上不直接使用大模型Serving,一种是用大模型的embedding,另一种是用大模型标注更多样本辅助小模型学习

量产与低质矛盾

业务在AIGC应用中更多是批量化生产,快速辅助业务补全海量商品素材的质量问题。不同于交互式生成,批量化生成面临很多挑战,最突出的就是原商品图的质量,以及原商品图和背景模板的匹配问题。

1. 商品素材图主体清晰度低、布局混乱。

这对最终用户的购买体验有极大负面影响。技术解决方案是采用超分辨率技术,特别是real-esrgan方法(ESRGAN做生成网络,Unet做判别网络),最终将合成图扩展到1000x1000分辨率,满足高质量输出需求。

2. 商品素材布局混乱,物品位置不当、画面杂乱。

通过主体识别和连通域检测技术,对商品主体结构分布进行筛选,预剔除不符合规范的商品图片,优化布局和整体美观度。

3. 商品图与背景模板匹配问题。

由于缺乏标准化样本进行模型训练,批量化生成面临挑战。解决方案是精选背景模板,通过细分类目,结合人工评测批量化产出生成图后,剔除采纳率低的背景图模板,提高背景的适配性和美观度。

特别是C端投放场景,需要建立审核、验收、效果等业务SOP流程,提高生产投放效率和质量。

伦理和监管问题

随着大模型在AIGC中的广泛应用,数据隐私、版权、内容监管和偏见等问题也随之而来。大模型的使用不仅涉及技术层面,还涉及伦理和法律层面。比如整治敏感、违法犯罪、身体伤害、心理健康、隐私财产、偏见歧视、礼貌文明、伦理道德等问题。尤其是LLM直接面向C端消费者时,由于消费者输入不可控,模型有一定概率返回不合规内容。

问题

描述

解决方案及思路

安全与合规

如整治敏感、违法犯罪、伦理道德等问题,尤其LLM直接面向C端场景

1. 建设安全校验模块能力

2. B端:生成素材数据清洗和人工审核

3. C端:生成式大模型必须通过SFT、RLHF等微调技术对模型做适配微调,对齐人类价值观

政策问题

类GPT能力作为C端应用的开放程度受限于政策

1. 上线前找安全同学评估

【附】网信办411公布的《生成式人工智能服务管理办法》征求意见稿,对生成式AI产品的开发使用方式、行业定义、生产者要求和责任等做了规范。特别提出:利用生成式人工智能产品向公众提供服务前,应当按照《具有舆论属性或社会动员能力的互联网信息服务安全评估规定》

向国家网信部门申报安全评估

,并按照《互联网信息服务算法推荐管理规定》

履行算法备案和变更、注销备案手续

C端应用上线需要过"双新评估"。

未来展望

业务侧规划

面向新的一年,AIGC实践的未来展望应基于业务场景继续创新,扩大战果。

深入探索行业应用

:结合不同行业的特点和需求,开发出更定制化、精细化的AIGC应用,提高生产效率和质量。加强与业务场景的深度融合,推动AIGC技术实际落地。

提高模型性能

:与算法联动,结合实际应用场景需求,通过人工、算法、数据反馈等机制不断优化业务场景微调模型,提高性能和准确性。

探索多模态AIGC应用

:将文本、图像二创、视频等多模态生成能力结合起来。

个人期待

AI大势浩浩荡荡,顺之者昌,逆之者亡。这里大胆YY几个未来的场景:

1.

增强的交互式AI

:类似Google发布的Gemini,改变当前信息交互方式。期待每个人都能拥有专属的"贾维斯"。

2.

个性化和定制化内容

:大数据+AIGC,根据用户偏好、历史行为和实时反馈生成个性化和定制化内容。

3.

虚拟现实内容

:随着AIGC多模态内容生成的发展,图像、视频、音频等能力不断进步,说不定未来AI能直接构建虚拟现实内容。

结语

积极拥抱变化,拒绝无谓焦虑。AI技术的发展更多的是对人类能力的补充而非替代,它更像一个"助理"的角色。

在人工智能飞速发展的今天,我们正站在这时代的十字路口。AI的进步揭开了技术创新的新篇章,提供了前所未有的便利和机遇;但另一方面,技术的飞跃也带来了人们对未来工作和生活方式的不确定性,引发焦虑和恐惧。

前总理曾说过:"中国有6亿人月收入不到1千。"最广大的用户可能并没有感受到GPT日新月异的变化。持续学习与适应才是关键,不断学习新知识,提升对AI技术的理解和掌握。唯有接纳和理解AI技术的进步,才能把握发展的机遇。通过深入了解AI技术的实际应用,我们会发现,技术的发展更多的是对人类能力的补充而非替代。

参考资料

Massive Exploration of Neural Machine Translation Architectures: https://arxiv.org/pdf/1703.03906.pdf

Safety-Prompts: https://github.com/thu-coai/Safety-Prompts

团队介绍

天猫国际,中国进口电商领域的领航者,不仅是阿里巴巴-淘天集团电商技术体系中的佼石,更是集平台运营、跨境贸易、大贸业务、免税服务于一体的综合性业务旗舰。技术产品覆盖了从商家入驻到消费者体验的每一个环节,构成了电商链路上最丰富和复杂的生态系统。