AIGC大模型实践总结
大模型浪潮席卷全球,这话一点儿都不夸张。从2022年底ChatGPT横空出世,到如今各行各业都在琢磨怎么用上AI,这股趋势已经不可逆转。这一年,所在团队也在AIGC领域里持续摸索、反复尝试。这篇文章既是对这些实践的一次总结复盘,也是在这一过程中积累的一些笔记和心得。水平有限,文中难免有理解或表述不到位的地方,欢迎各位大佬随时拍砖指正。
AI时代
2022年11月30日
大模型代表着一个新的技术AI时代的来临。它展现出的强大语义理解、内容生成以及泛化能力,正在潜移默化地改变我们的工作方式、生活方式和思维方式。就像《陆奇的大模型观》里说的,我们正处在从信息系统向模型系统过渡的新范式拐点上,“模型”知识无处不在。人工智能的浪潮正在引领一场新的技术革命,或许可以称之为第五次工业革命。
2024年2月16日
核心优势就三点:
60秒的超长时长、运动镜头下的内容一致性、现实场景的真实感
2024年3月13日
大模型基础知识
在人工智能领域,AI、AIGC、AGI、ChatGPT这几个词,其实是四个不同的概念,得先理清楚。
AI(人工智能)
人工智能是最宽泛的概念,泛指通过机器模拟和执行人类智能功能的技术。它涵盖的范围很大,包括狭义和广义两个层面。
狭义的AI(弱人工智能)指的是能执行特定任务的智能系统,比如语音识别、图片识别、智能驾驶,只能在特定场景和范围内体现智能行为。广义的AI(强人工智能)则指具备和人类一样智能水平和认知能力的系统,能在复杂环境下自主学习、推理、理解、适应,表现更高级。
AGI(通用人工智能)
通用人工智能是广义AI的一个子集,指能在各个领域和方面都达到人类智能水平的系统,具备人类的多样性和灵活性。AGI是AI研究的终极目标之一,能够跨领域执行多种任务,具备自我学习和适应能力,可以进行各类学习和推理任务,并且具备
自我意识和通用智能
AIGC(人工智能生成内容)
AIGC,全称"AI Generated Content",又称生成式AI,就是利用AI技术自动创作出新的内容,包括文字、图像、音乐、视频等。它的核心优势在于能大大减轻人类创作者的负担,提高内容生产的效率和规模,同时还能创造出全新的、创意性的作品。
简单理解,AIGC的水平介于弱AI和AGI之间,是AGI在内容生成这个特定领域的一种削弱型应用。目前AIGC已经有广泛的应用场景,而AGI还处于研究阶段,且在实际落地时必然会面临严格的机器人伦理问题。
LLM(大语言模型)
大语言模型一般指在大量文本语料上训练、包含百亿甚至更多参数的语言模型。目前基本都采用Transformer架构。LLM近期之所以爆火,很重要的一点是:只有当语言模型的规模达到一定量级时,某些能力才会出现,这被称为
涌现能力
比如Transformer架构的GPT-3、BERT、T5等模型,通过在海量数据上训练,学习到了丰富的语言和知识表示,展现出强大的自然语言处理能力。
ChatGPT
ChatGPT是"Chat Generative Pre-trained Transformer"的缩写,是一种基于人工智能技术的聊天机器人,能进行自然语言理解和生成,提供流畅且类人的对话体验。它是史上增长最快的消费者应用,可以用于问答、文本摘要生成、机器翻译、分类、代码生成和对话等多种场景。
大模型架构
2017年之前,主流的架构主要有这么几种:N元文法(n-gram)、多层感知器(MLP)、卷积神经网络(CNN,常见于计算机视觉)、循环神经网络(RNN,擅长预测文本、语音和时间序列等序列数据)。
Transformer架构
现在最火的当然是2017年提出的Transformer架构,它已经成为目前最常见的大语言模型基本结构。Transformer涉及大量概念和应用,比如编码-解码(encoder-decoder)、注意力机制(attention)、KQV(Key、Query、Value)等。
Transformer模型的核心架构分为编码器和解码器两部分。编码器负责将输入序列编码成一个向量,解码器则从该向量中生成输出序列。
简单的工作流程是这样的:
1. 获取输入句子中每个单词的表示向量X,X由单词的Embedding(从原始数据提取的特征)和单词位置的Embedding相加得到。
2. 将得到的单词表示向量矩阵传入Encoder中,经过6个Encoder block后,得到句子所有单词的编码信息矩阵C。
3. 将Encoder输出的编码信息矩阵C传递到Decoder中,Decoder会依次根据当前已翻译的单词,逐个翻译下一个单词。
用过ChatGPT的人会发现,输出结果是一个字一个字蹦出来的,这正是Transformer的结构决定的。
可以简单把Transformer的学习和预测过程想象成语言翻译:如果模型要把A语言翻译成B语言,那么编码器就是把A语言翻译成"模型语言",解码器再把"模型语言"翻译成B语言。
注意力机制
Transformer之所以功能强大,很大程度上归功于注意力机制。什么是注意力机制?打个比方,我们看一张图时,并不会同等地查看图中每个位置,而是会自动提取"重要的位置"。
Attention,就是注意力,从两个不同的主体开始,互相注意——我注意到他,他也注意到我。NLP领域最初把它用在翻译任务上,天然就有source和target。比如翻译第一个词时,attention机制会关注到前面所有词,但权重不一样。简单理解就是:
计算词之间的相近关系
注:颜色粗细代表权重大小
这张图可以解读为:
一段自然语言内容本身,就暗含了很多内部关联信息
一段自然语言里其实暗含了这样一个逻辑:为了得到关于某方面信息Q,可以通过关注某些信息K,进而得到某些信息V作为结果
Transformer架构还有很多逻辑和知识,这里不一一列举。这个架构之所以能带来巨大变革,核心优势在于:
快
记忆力好
能处理不同长度的序列
上下文学习(In-Context Learning)
一个预训练模型,在处理下游任务时,不需要微调模型参数,只需要在输入时加一些示例,就能有SOTA(State-of-the-Art,即最优秀模型)的表现,这就是上下文学习(ICL)能力。
ICL能力最直接的应用就是Prompt Engineering。2022年,很多学界人士的研究重点都转向了Prompt。一般流程是"Pretrain, Prompt",到了Prompt环节,通常是给模型输入x期望得到输出y。但如果我们对使用者给出的x进行二次加工(把这个加工表示为一个函数f(x)),是否能在输出上获得更好的结果y呢?甚至可以优化输出的结构,得到更好的结果。
举个例子,用户问"自驾去杭州周边两天一夜玩,有什么推荐的地方吗?",模型可能只返回"南浔古镇"。但如果通过Prompt Engineering优化一下,效果会好很多。这里的f(x)就是Prompt Engineering,而g(x)其实是Answer Engineering。
ICL的数学原理和底层逻辑目前还没有明确定论,比较复杂。简单总结几点用于指导后续应用:
在prompt里带上demo很重要,而且demo在形式上input和label都需要。
对于demo中的input,不要随意给出,要提供合理的input。
对于demo中的label,只要它属于正确的值域空间label space就可以了,是否与input有正确的映射关系不重要。
Prompt Framework
Prompt的专业程度直接关系到两个方面的效果:一是大模型回复的准确性和针对性,好的Prompt能帮助模型更好地理解你的意图和需求;二是大模型回复语句的自然度,好的Prompt能帮助模型更好地处理歧义和上下文依赖,提高回答的自然度。
Ela vis Sara via总结了一个Prompt框架,包含四个元素:
Instruction(必须)
Context(选填)
Input Data(选填)
Output Indicator(选填)
只要按照这个框架写prompt,模型返回的结果通常都不会差。当然,不一定每次都要包含全部四个元素,可以根据需求自由组合。比如推理场景可以用Instruction + Context + Input Data,信息提取场景可以用Instruction + Context + Input Data + Output Indicator。
提示工程(Prompt Engineering)
在Prompt Framework背景下,为了让LLM输出更高质量、对业务有价值的回答,工程侧通常会将用户的随意问题进行包装、组织和抽取,组成问题的上下文,并添加一些限定语句,从而得到有效的提示词。这需要一个专门的代码逻辑或应用服务来完成。
让query有效并产出好的结果并不容易,需要避免二义性和无结果的情况。这就产生了提示词工程:包括提示词引擎runtime(用来串联产投链路数据)和模板运维。
关键原则有两个:一是模板与工程分离(类似前后端分离),二是确保信息够用——串联产投链路数据,补齐到模板中。
COT(思维链)
在认知科学里有一个"认知双通道理论",讲的是人脑有两套系统:系统1(System-1)是直觉系统,运行无意识且快速,不怎么费脑力;系统2(System-2)是逻辑分析系统,需要注意力,用于复杂的运算和推理。
当前深度学习主要在做的其实是System-1的事,比如图像识别、人脸识别、机器翻译、情感分类、语音识别、自动驾驶等。而System-2要做的事——比如推理、规划——正是未来深度学习的方向。
大语言模型的研究者也在探索System-2要解决的任务,于是有了下面几个技术方向:
Google提出思维链提示(CoT Prompting)
Let's Think Step by Step
大模型发展与应用
大模型概述
所有这些应用底座的,就是大模型(Large Models)。大模型在AI领域通常指具有大量参数(通常包含十亿甚至千亿参数)、复杂计算结构和强泛化能力的机器学习模型。其主要特点包括:
大量参数
强大的学习能力
大数据集和计算资源密集
预训练和微调
自我监督学习
上下文敏感性
业务AIGC应用领域和实践
关键项目概述
产技推进原则很明确:
在有强行业属性的需求方向上坚持投入定制
在偏通用的应用上尽可能快速复用平台产品
AIGC工程实践
策略
技术目标
架构设计
具体分为以下几个层次:
1. 用户界面层
2. 应用层
3. AI核心能力层
4. 模型层
5. 数据处理层
6. 基础设施层
7. 监控与运维层
应用场景举例
素材优化
业务背景:因为多语种翻译、商品信息不足等问题,导致商品属性缺失、图片素材质量低,用户理解难、转化低、万求高。面对极大品量,运营手动仅能补全少量头部商品,无法全量优化。在AI技术成熟的背景下,考虑用AIGC对商品的属性、卖点、素材图片、场景图等信息进行补全和优化。
核心方案:技术选型分三步——模型底层选择、语言和框架选择、整体架构设计。基于大模型生文能力和部署Stable Diffusion生图能力,通过离在线数据接入、配置化设计、异步任务调度等技术,链接业务供给数据资产,构建嵌入产供投链路的批量化AIGC工程。
阶段进展:文生文工程具备Prompt模板提示和自动填充、任务试跑预览、费用预估、批量化AIGC生产等能力,简化了业务使用门槛。商品属性补全超过百万品,获流效果在主搜免费获流上显著提升(有动销商品和动览非动销品均正向),商详AB验证对成交转化率也有正向提升。场景图方面,建设了标品场景图替换、白底图和透明图生产、透明图超分处理、模特服饰上身、图片连通域检测、图片转存、图片裁剪等二创能力。图素材生产上万,首猜获流效率和主搜曝光点击率均为正向。
商家Copilot
另外,团队初步探索构建了具备业务知识的AI办公助手,服务于商家,提升运营效率和业务体验。不仅解放了业务小二的工作量,也提升了操作效率和准确性。
实践过程挑战
在AIGC实践中,技术挑战和机遇是并存的。下面聊聊几个实践中的挑战和部分解决思路。
技术挑战
问题 |
描述 |
解决方案及思路 |
知识量有限 |
|
方案1. LLM+检索增强:在LLM基础上通过检索额外提供领域数据信息。对于用户输入Query,结合业务数据中检索到的结果一起输入给LLM,可以得到更精准的回答。 方案2. 构建行业数据集对LLM微调,使模型本身具备输出行业信息的能力(成本高且效果不佳)。 【解决方案】:LLM+检索增强。OpenAI提出了chatgpt-retrieval-plugin、WebGPT,开源社区也提出了DocsGPT、ChatPDF、基于langchain的检索增强chatbot等方案。 |
效果问题 |
|
1. 大模型+上下文学习技术(ICL),设计合理的prompt模板 2. 大模型+思维链提示(CoT),引入推理路径作为提示,激发大模型按这种推理模式生成合理结果 3. 大模型+高质量标注样本+指令微调(PEFT技术),提高模型对特定任务的泛化能力 |
延迟问题 |
|
1. 流式传输:设置stream:true,使模型在令牌可用时立即开始返回,缩短首次响应时间。 2. 基础设施优化:OpenAI美国服务器存在跨国网络延时。 3. 减小token:比如使用更短的提示。 4. 缓存:存储经常访问的数据,缩短响应时间,但新增信息时需使缓存失效。 |
资源和性能 |
|
1. 不训练基座模型,微调选择几B到几十B左右的LLM(如ChatGLM-6B) 2. 曲线救国:线上不直接使用大模型Serving,一种是用大模型的embedding,另一种是用大模型标注更多样本辅助小模型学习 |
量产与低质矛盾
业务在AIGC应用中更多是批量化生产,快速辅助业务补全海量商品素材的质量问题。不同于交互式生成,批量化生成面临很多挑战,最突出的就是原商品图的质量,以及原商品图和背景模板的匹配问题。
1. 商品素材图主体清晰度低、布局混乱。
2. 商品素材布局混乱,物品位置不当、画面杂乱。
3. 商品图与背景模板匹配问题。
特别是C端投放场景,需要建立审核、验收、效果等业务SOP流程,提高生产投放效率和质量。
伦理和监管问题
随着大模型在AIGC中的广泛应用,数据隐私、版权、内容监管和偏见等问题也随之而来。大模型的使用不仅涉及技术层面,还涉及伦理和法律层面。比如整治敏感、违法犯罪、身体伤害、心理健康、隐私财产、偏见歧视、礼貌文明、伦理道德等问题。尤其是LLM直接面向C端消费者时,由于消费者输入不可控,模型有一定概率返回不合规内容。
问题 |
描述 |
解决方案及思路 |
安全与合规 |
如整治敏感、违法犯罪、伦理道德等问题,尤其LLM直接面向C端场景 |
1. 建设安全校验模块能力 2. B端:生成素材数据清洗和人工审核 3. C端:生成式大模型必须通过SFT、RLHF等微调技术对模型做适配微调,对齐人类价值观 |
政策问题 |
类GPT能力作为C端应用的开放程度受限于政策 |
1. 上线前找安全同学评估 |
【附】网信办411公布的《生成式人工智能服务管理办法》征求意见稿,对生成式AI产品的开发使用方式、行业定义、生产者要求和责任等做了规范。特别提出:利用生成式人工智能产品向公众提供服务前,应当按照《具有舆论属性或社会动员能力的互联网信息服务安全评估规定》
向国家网信部门申报安全评估
履行算法备案和变更、注销备案手续
C端应用上线需要过"双新评估"。
未来展望
业务侧规划
面向新的一年,AIGC实践的未来展望应基于业务场景继续创新,扩大战果。
深入探索行业应用
提高模型性能
探索多模态AIGC应用
个人期待
AI大势浩浩荡荡,顺之者昌,逆之者亡。这里大胆YY几个未来的场景:
1.
增强的交互式AI
2.
个性化和定制化内容
3.
虚拟现实内容
结语
积极拥抱变化,拒绝无谓焦虑。AI技术的发展更多的是对人类能力的补充而非替代,它更像一个"助理"的角色。
在人工智能飞速发展的今天,我们正站在这时代的十字路口。AI的进步揭开了技术创新的新篇章,提供了前所未有的便利和机遇;但另一方面,技术的飞跃也带来了人们对未来工作和生活方式的不确定性,引发焦虑和恐惧。
前总理曾说过:"中国有6亿人月收入不到1千。"最广大的用户可能并没有感受到GPT日新月异的变化。持续学习与适应才是关键,不断学习新知识,提升对AI技术的理解和掌握。唯有接纳和理解AI技术的进步,才能把握发展的机遇。通过深入了解AI技术的实际应用,我们会发现,技术的发展更多的是对人类能力的补充而非替代。
参考资料
Massive Exploration of Neural Machine Translation Architectures: https://arxiv.org/pdf/1703.03906.pdf
Safety-Prompts: https://github.com/thu-coai/Safety-Prompts
团队介绍
天猫国际,中国进口电商领域的领航者,不仅是阿里巴巴-淘天集团电商技术体系中的佼石,更是集平台运营、跨境贸易、大贸业务、免税服务于一体的综合性业务旗舰。技术产品覆盖了从商家入驻到消费者体验的每一个环节,构成了电商链路上最丰富和复杂的生态系统。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名