Data+AI 一体架构的产品创新
Data+AI 已经成为数据架构领域最火热的技术方向,没有之一。把这个概念拆开来看,其实藏着两条截然不同但又紧密咬合的技术路径:一条叫“Data for AI”,另一条叫“AI for DataWarehouse”。前者讲的是怎么把海量结构化、半结构化和非结构化数据,跟深度学习、大模型训练做到深度协同——这里面技术挑战不少;后者则是反过来,用AI能力去改造数据仓库本身,而数据治理是目前大家最关心、也是最能看到效果的一个方向。能不能真正用AI把数据仓库的智能管理水平提上去,是另一个关键难题。
接下来,我就结合阿里云在
MaxCompute Data+AI 一体架构
Data+AI 一体趋势
市场主要趋势
先梳理一下这个大方向。Data+AI 一体化,目前能清晰分出两个技术分支:
- :大数据为AI赋能。针对结构化、半结构化、非结构化数据,探索数据预处理怎么跟深度学习、大模型训练协同。我们这边提供的是一套基于 MaxCompute 的分布式 Python 开发框架 MaxFrame,加上分布式机器学习平台 PAI。MaxFrame 负责镜像管理和数据整合,实现 MaxCompute + PAI 的一体化产品能力。
Data for AI
- :智能数仓。数据治理是眼下大家最关注的能力,能不能用更多AI能力来驱动智能数据管理?我们在智能数仓层面,已经构建了分层存储推荐、资源管理优化、查询计划优化、物化视图推荐,以及自然语言生成SQL等AI能力。
AI for DataWarehouse
开发的全生命周期
Data+AI 开发的全生命周期很长——数据分析、数据预处理、模型创建、训练、评估、预测、部署发布……涉及的角色也多元:业务人员、数据工程师、数据分析师、数据科学家,每个环节都环环相扣。
架构的开发痛点
在这个全生命周期里,核心挑战集中在三个维度:
成本、效率、运维
- 数据类型多,数据管理能力差;
- 数据开发与模型开发脱节;
- 性能扩展能力差,训练效率低;
- 工程化实现,缺少统一运维管理。
总之一句话:在行业标准还没落地的当下,所有技术产品实践,都是在不断尝试解决成本、效率、运维这三个方向上的具体问题。
MaxCompute Data+AI 能力
这部分重点聊聊 MaxCompute 在 Data+AI 一体架构上的产品架构实践。
分层架构
先看分层架构。底层是数据层,统一元数据服务、分布式存储、对象存储。其中半结构化数据(比如JSON)的优化处理,是个不小的挑战。中间层是计算层,包括数据处理、模型开发、训练和管理。平台提供了交互式开发的 Notebook、统一开发调度平台 DataWorks、可视化建模的 PAI Designer 等。亮点是自研的分布式计算框架 MaxFrame 和自定义镜像管理——它们支持统一的 Python 编程接口,能构建大模型应用的数据预处理算子,实现分布式高效计算,还能管理第三方包和模型镜像。
核心功能
MaxCompute Data+AI 产品架构的核心功能,可以拆成四大组件:
- :基于 OpenLake 平台,提供统一数据湖仓能力,支持结构化、半结构化、非结构化数据的管理。
统一数据管理
- :统一 Python 编程接口,分布式计算能力,在数据预处理阶段提供更高效的计算,为后续AI训练准备好数据。
分布式 Python 计算框架 MaxFrame
- :即开即用的 Notebook,提供更便捷的交互式大数据与AI开发体验。
交互式开发环境
- :通过内置第三方依赖包、通用模型等,提供便捷高效的自定义镜像管理。
自定义镜像管理
One Env + OneData + One Code 用户体验
MaxCompute 支持统一数据管理,通过 MaxFrame 做数据预处理,结果直接集成到 PAI 机器学习平台进行模型开发。然后使用 PAI-DLC 分布式AI训练平台进行分布式训练优化,再通过 PAI 的镜像管理能力管理各类模型,最后用 PAI-EAS 自动化推理组件实现在线模型部署与发布。整个链路是通的。
交互式开发环境:MaxCompute Notebook
第一个核心能力是 Notebook,提供 Web 交互式开发环境,支持多引擎与 MaxCompute 集成,结果可以直接输送到机器学习平台。内置丰富函数库,数据安全也有保障。
分布式计算框架:MaxFrame
第二个核心能力是自研的 MaxFrame。它支持统一 Python 编程接口,算子灵活兼容;还能实现大数据、离线、AI任务统一编排的 Data+AI 一体化 Pipeline。开箱即用的开发体验,复用 MaxCompute 计算资源和数据接口,在大规模数据处理、数据可视化、科学计算、ML/AI 开发等场景下都能用。
面向海量数据预处理场景:性能提升
这里有个实际案例。我们用 MaxFrame 对开源大模型项目 RedPajama 提供的数据集做预处理——数据清洗、文档去重、水印去除、数据过滤等。结果呢?使用 MaxFrame 框架,比用开源算子做预处理,整体耗时节省了
97.8%
深化AI非结构化数据管理:Object Table
第三个核心能力是非结构化数据处理。现在国内外都特别关注非结构化数据的接入和管理——毕竟 Data+AI 的重要需求之一就是处理非结构化数据。我们做了个抽象:把对象存储中的数据映射成表格式,通过 Python 编程接口或 SQL 语法就能便捷查询或检索。缓存加速、查询优化、列式数据裁剪这些能力,本质上是把智能数仓的AI特性用到了非结构化数据管理上。
MaxCompute + PAI 产品组合:Data+AI 一体化应用
目前应用最多的就是 MaxCompute 与 PAI 的组合。多类型数据存储、统一元数据管理、数据分析/AI数据预处理——MaxCompute 为经典机器学习场景提供了通用算法。而 PAI 平台套件(PAI-DLC 分布式训练、模型仓库、PAI-EAS 推理服务、AI 镜像管理)把整个链路顺畅地串联了起来。
MaxCompute AI for DW 探索
这部分聊聊怎么用AI让云原生数仓更智能——也就是 AI for DataWarehouse 方向的产品探索。
分层存储推荐:按场景分层优化
分层存储是数仓产品的标配功能,但我们现在在尝试更进一步:智能推荐、自动分层。比如根据数据访问量自动推荐冷存或归档,或者根据存储时间和使用场景在冷热存储之间自动转化,最终目标就是不断降低存储成本。
物化视图智能化
物化视图本质上是一种预计算——把那些耗时操作(JOIN、AGGREGATE)的结果保存下来,查询时直接复用,加速计算。现在AI正在深度改造这个领域,比如提供物化视图推荐等智能化能力。
智能数仓的新创新
智能数仓这块,包括基于AI的数据治理:统一元数据管理、作业计算统计分析来助力SQL提速。作业管理优化的目标是“最多跑一次”——同样计算在新数据到来时,能根据已有数据结构自动加速或路由分发,不用每次都重新加载和计算。资源分配、查询计划优化也是重点。其中比较关键的是基于学习的查询优化器(learning-based query optimizer),利用大模型或传统机器学习的AI能力,提供更自动化的计算查询优化体验。
大数据里数据分布倾斜是个老问题,需要通过智能数据重分布实现自动化的数据分布优化,减少倾斜。最终目标:智能数仓全面自动化。
成本优化器:智能资源配置
MaxCompute 成本优化器是一个产品组件,它根据近30天预付费资源请求情况,模拟当前资源配置下的满足度和作业延迟,然后生成推荐变配方案。
另外,DataWorks Copilot 智能助手——阿里云一站式数据开发治理平台 DataWorks 打造的AI助手,能辅助用户完成数据开发和数据分析。目前与 MaxCompute 做了整合,基于历史SQL和数据进行训练,提供 Copilot 能力。比如输入“统计一下今天的销售额”,就能生成相应SQL,实测准确率在80%以上。
MaxCompute 大模型应用最佳实践
最后一部分,分享一下 MaxCompute 在大数据+大模型应用上的最佳实践。
LLM 数据处理:文本去重
在 Data+AI 领域,数据预处理是最常见的场景,文本去重又是其中最重要的一环——从海量数据里找出真正有价值的内容。具体流程包括:数据读取、文本分词、计算Hash、近似最近邻搜索、原始文本去重。
自定义镜像构建

文本去重的第一步,可以用开源或自定义的镜像部署到 MaxFrame 机器学习平台,平台会加载相应的分布式模型。
基于 MaxFrame 完成 LLM 数据处理
第二步,MaxCompute Notebook 对裸数据进行清洗、文本分词、Hash 计算等,然后提交到 MaxFrame 上分布式执行。整个链路在交互式开发环境里就能完成。
与开源算子性能对比
性能对比数据:对8亿条原始数据进行处理(包含多个算子),MaxCompute 相比开源算子在性能上提升70%以上,环境准备效率提升10%到30%。
LLM 数据处理:大规模图片处理
第二个实践是基于大规模图片的处理——主要是非结构化数据处理。流程包括:基于 MaxCompute 创建弹性资源池,通过 MaxFrame 并发读取 OSS 数据,调用第三方算子进行图片渲染,实现分布式数据读取和计算。
MaxCompute 4.0 Data+AI
最后总结一下 MaxCompute 4.0 的 Data+AI 整体产品架构。底层是统一元数据管理,能接入结构化、半结构化、非结构化数据存储。中间层是围绕 MaxFrame 的分布式AI数据计算框架——不同的 DAG 分别处理数据预处理、智能数仓、对接AI分布式训练 PAI-DLC、多类型镜像管理,这些子 DAG 都由 MaxFrame 的 DAG driver 框架统一调用编排。上层则是统一的交互式开发平台 MaxCompute Notebook,实现全栈大数据+AI 开发。底层统一开放、中间层多场景AI计算训练、上层统一交互——这套三层架构,随着业务实践的深入,很有希望成为未来 Data+AI 领域的行业技术标准。我们拭目以待。
Q&A
Q:
A:
以上就是本次分享的核心内容,希望能给正在探索 Data+AI 一体架构的朋友们一些启发。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名