首页 > 教程攻略 > ai资讯 >Data+AI 一体架构的产品创新

Data+AI 一体架构的产品创新

来源:互联网 时间:2026-08-27 13:53:28

Data+AI 已经成为数据架构领域最火热的技术方向,没有之一。把这个概念拆开来看,其实藏着两条截然不同但又紧密咬合的技术路径:一条叫“Data for AI”,另一条叫“AI for DataWarehouse”。前者讲的是怎么把海量结构化、半结构化和非结构化数据,跟深度学习、大模型训练做到深度协同——这里面技术挑战不少;后者则是反过来,用AI能力去改造数据仓库本身,而数据治理是目前大家最关心、也是最能看到效果的一个方向。能不能真正用AI把数据仓库的智能管理水平提上去,是另一个关键难题。

接下来,我就结合阿里云在

MaxCompute Data+AI 一体架构

上的产品实践,把这几个方向拆开聊透。内容主要包括:一体化的技术趋势、MaxCompute 在 Data for AI 方面的能力、在 AI for DataWarehouse 上的探索、大模型应用的最佳实践,以及一些现场问答的精华整理。

Data+AI 一体趋势

市场主要趋势

先梳理一下这个大方向。Data+AI 一体化,目前能清晰分出两个技术分支:

  • Data for AI

    :大数据为AI赋能。针对结构化、半结构化、非结构化数据,探索数据预处理怎么跟深度学习、大模型训练协同。我们这边提供的是一套基于 MaxCompute 的分布式 Python 开发框架 MaxFrame,加上分布式机器学习平台 PAI。MaxFrame 负责镜像管理和数据整合,实现 MaxCompute + PAI 的一体化产品能力。
  • AI for DataWarehouse

    :智能数仓。数据治理是眼下大家最关注的能力,能不能用更多AI能力来驱动智能数据管理?我们在智能数仓层面,已经构建了分层存储推荐、资源管理优化、查询计划优化、物化视图推荐,以及自然语言生成SQL等AI能力。

开发的全生命周期

Data+AI 开发的全生命周期很长——数据分析、数据预处理、模型创建、训练、评估、预测、部署发布……涉及的角色也多元:业务人员、数据工程师、数据分析师、数据科学家,每个环节都环环相扣。

架构的开发痛点

在这个全生命周期里,核心挑战集中在三个维度:

成本、效率、运维

。成本方面,既要高效完成一体化工作,又要考虑学习成本;效率方面,性能、开发效率、训练效率都得盯;运维就更头疼了——Data+AI 一体本身就是个还在探索期的技术架构,行业标准都没成型,运维复杂度可想而知。围绕这三个维度,我们提炼出四个主要痛点:

  • 数据类型多,数据管理能力差;
  • 数据开发与模型开发脱节;
  • 性能扩展能力差,训练效率低;
  • 工程化实现,缺少统一运维管理。

总之一句话:在行业标准还没落地的当下,所有技术产品实践,都是在不断尝试解决成本、效率、运维这三个方向上的具体问题。

MaxCompute Data+AI 能力

这部分重点聊聊 MaxCompute 在 Data+AI 一体架构上的产品架构实践。

分层架构

先看分层架构。底层是数据层,统一元数据服务、分布式存储、对象存储。其中半结构化数据(比如JSON)的优化处理,是个不小的挑战。中间层是计算层,包括数据处理、模型开发、训练和管理。平台提供了交互式开发的 Notebook、统一开发调度平台 DataWorks、可视化建模的 PAI Designer 等。亮点是自研的分布式计算框架 MaxFrame 和自定义镜像管理——它们支持统一的 Python 编程接口,能构建大模型应用的数据预处理算子,实现分布式高效计算,还能管理第三方包和模型镜像。

核心功能

MaxCompute Data+AI 产品架构的核心功能,可以拆成四大组件:

  • 统一数据管理

    :基于 OpenLake 平台,提供统一数据湖仓能力,支持结构化、半结构化、非结构化数据的管理。
  • 分布式 Python 计算框架 MaxFrame

    :统一 Python 编程接口,分布式计算能力,在数据预处理阶段提供更高效的计算,为后续AI训练准备好数据。
  • 交互式开发环境

    :即开即用的 Notebook,提供更便捷的交互式大数据与AI开发体验。
  • 自定义镜像管理

    :通过内置第三方依赖包、通用模型等,提供便捷高效的自定义镜像管理。

One Env + OneData + One Code 用户体验

MaxCompute 支持统一数据管理,通过 MaxFrame 做数据预处理,结果直接集成到 PAI 机器学习平台进行模型开发。然后使用 PAI-DLC 分布式AI训练平台进行分布式训练优化,再通过 PAI 的镜像管理能力管理各类模型,最后用 PAI-EAS 自动化推理组件实现在线模型部署与发布。整个链路是通的。

交互式开发环境:MaxCompute Notebook

第一个核心能力是 Notebook,提供 Web 交互式开发环境,支持多引擎与 MaxCompute 集成,结果可以直接输送到机器学习平台。内置丰富函数库,数据安全也有保障。

分布式计算框架:MaxFrame

第二个核心能力是自研的 MaxFrame。它支持统一 Python 编程接口,算子灵活兼容;还能实现大数据、离线、AI任务统一编排的 Data+AI 一体化 Pipeline。开箱即用的开发体验,复用 MaxCompute 计算资源和数据接口,在大规模数据处理、数据可视化、科学计算、ML/AI 开发等场景下都能用。

面向海量数据预处理场景:性能提升

这里有个实际案例。我们用 MaxFrame 对开源大模型项目 RedPajama 提供的数据集做预处理——数据清洗、文档去重、水印去除、数据过滤等。结果呢?使用 MaxFrame 框架,比用开源算子做预处理,整体耗时节省了

97.8%

。这个数字说明了很多问题。

深化AI非结构化数据管理:Object Table

第三个核心能力是非结构化数据处理。现在国内外都特别关注非结构化数据的接入和管理——毕竟 Data+AI 的重要需求之一就是处理非结构化数据。我们做了个抽象:把对象存储中的数据映射成表格式,通过 Python 编程接口或 SQL 语法就能便捷查询或检索。缓存加速、查询优化、列式数据裁剪这些能力,本质上是把智能数仓的AI特性用到了非结构化数据管理上。

MaxCompute + PAI 产品组合:Data+AI 一体化应用

目前应用最多的就是 MaxCompute 与 PAI 的组合。多类型数据存储、统一元数据管理、数据分析/AI数据预处理——MaxCompute 为经典机器学习场景提供了通用算法。而 PAI 平台套件(PAI-DLC 分布式训练、模型仓库、PAI-EAS 推理服务、AI 镜像管理)把整个链路顺畅地串联了起来。

MaxCompute AI for DW 探索

这部分聊聊怎么用AI让云原生数仓更智能——也就是 AI for DataWarehouse 方向的产品探索。

分层存储推荐:按场景分层优化

分层存储是数仓产品的标配功能,但我们现在在尝试更进一步:智能推荐、自动分层。比如根据数据访问量自动推荐冷存或归档,或者根据存储时间和使用场景在冷热存储之间自动转化,最终目标就是不断降低存储成本。

物化视图智能化

物化视图本质上是一种预计算——把那些耗时操作(JOIN、AGGREGATE)的结果保存下来,查询时直接复用,加速计算。现在AI正在深度改造这个领域,比如提供物化视图推荐等智能化能力。

智能数仓的新创新

智能数仓这块,包括基于AI的数据治理:统一元数据管理、作业计算统计分析来助力SQL提速。作业管理优化的目标是“最多跑一次”——同样计算在新数据到来时,能根据已有数据结构自动加速或路由分发,不用每次都重新加载和计算。资源分配、查询计划优化也是重点。其中比较关键的是基于学习的查询优化器(learning-based query optimizer),利用大模型或传统机器学习的AI能力,提供更自动化的计算查询优化体验。

大数据里数据分布倾斜是个老问题,需要通过智能数据重分布实现自动化的数据分布优化,减少倾斜。最终目标:智能数仓全面自动化。

成本优化器:智能资源配置

MaxCompute 成本优化器是一个产品组件,它根据近30天预付费资源请求情况,模拟当前资源配置下的满足度和作业延迟,然后生成推荐变配方案。

另外,DataWorks Copilot 智能助手——阿里云一站式数据开发治理平台 DataWorks 打造的AI助手,能辅助用户完成数据开发和数据分析。目前与 MaxCompute 做了整合,基于历史SQL和数据进行训练,提供 Copilot 能力。比如输入“统计一下今天的销售额”,就能生成相应SQL,实测准确率在80%以上。

MaxCompute 大模型应用最佳实践

最后一部分,分享一下 MaxCompute 在大数据+大模型应用上的最佳实践。

LLM 数据处理:文本去重

在 Data+AI 领域,数据预处理是最常见的场景,文本去重又是其中最重要的一环——从海量数据里找出真正有价值的内容。具体流程包括:数据读取、文本分词、计算Hash、近似最近邻搜索、原始文本去重。

自定义镜像构建

文本去重的第一步,可以用开源或自定义的镜像部署到 MaxFrame 机器学习平台,平台会加载相应的分布式模型。

基于 MaxFrame 完成 LLM 数据处理

第二步,MaxCompute Notebook 对裸数据进行清洗、文本分词、Hash 计算等,然后提交到 MaxFrame 上分布式执行。整个链路在交互式开发环境里就能完成。

与开源算子性能对比

性能对比数据:对8亿条原始数据进行处理(包含多个算子),MaxCompute 相比开源算子在性能上提升70%以上,环境准备效率提升10%到30%。

LLM 数据处理:大规模图片处理

第二个实践是基于大规模图片的处理——主要是非结构化数据处理。流程包括:基于 MaxCompute 创建弹性资源池,通过 MaxFrame 并发读取 OSS 数据,调用第三方算子进行图片渲染,实现分布式数据读取和计算。

MaxCompute 4.0 Data+AI

最后总结一下 MaxCompute 4.0 的 Data+AI 整体产品架构。底层是统一元数据管理,能接入结构化、半结构化、非结构化数据存储。中间层是围绕 MaxFrame 的分布式AI数据计算框架——不同的 DAG 分别处理数据预处理、智能数仓、对接AI分布式训练 PAI-DLC、多类型镜像管理,这些子 DAG 都由 MaxFrame 的 DAG driver 框架统一调用编排。上层则是统一的交互式开发平台 MaxCompute Notebook,实现全栈大数据+AI 开发。底层统一开放、中间层多场景AI计算训练、上层统一交互——这套三层架构,随着业务实践的深入,很有希望成为未来 Data+AI 领域的行业技术标准。我们拭目以待。

Q&A

Q:

目前用大模型+RAG 架构处理非结构化文本时,在不了解业务属性的情况下,怎么把文本的知识块分割得更好?怎么保证拆分后的知识块未来有价值、语义不被拆开、检索查询时准确率更高?比如上传一个政策文件,但不知道哪些内容需要让用户看到,是否需要做文本标注?

A:

每次拆分都跟数据本身的特征相关。比如基于NLP的大模型,文本是否有价值是能直接看到的。如果要过滤,去重比较明确——不懂业务也可以去重(包括去水印等)。但哪些数据真的跟业务相关?目前阿里云会加载一套标准清洗算法,每次根据业务属性调整。比如金融相关业务,模型会加载金融算法来提供处理金融数据的能力。文本标注是必要的,但光有标注不够。我们是在数据存入向量数据库之前,在数据清洗阶段加入算法做过滤——这是个迭代过程。总结三点:第一,特定行业都要构建对应的专门知识库,通过RAG加载到AI模型中;第二,每次处理完都有人工审查,然后微调后重新清洗;第三,训练过程中也会针对性地调优和微调。目前清洗算法还不算先进,所以 Data+AI 中数据处理那部分的智能化很关键。另外,云计算服务中常遇到一个AI大模型用户一周的计算资源处理量比十个典型大数据用户的总和还多,这就带来极致的弹性波峰波谷问题——如何优化整体资源消耗,也是非常重要的工作。

以上就是本次分享的核心内容,希望能给正在探索 Data+AI 一体架构的朋友们一些启发。