首页 > 教程攻略 > ai资讯 >泼天富贵,OpenAI收购数据仓库公司,为什么?

泼天富贵,OpenAI收购数据仓库公司,为什么?

来源:互联网 时间:2026-08-13 13:47:30

01

OpenAI买哪家公司,哪家公司就算是被泼天的富贵砸中了。比如,这次被收购的Rockset——一家数据仓库公司。先插一条八卦:Rockset被收购后,官网直接告知现有客户,服务不再继续。美国这边也是“上岸第一剑,先斩意中人”。客户是上帝?只要钱给够,上帝也可以暂时放一放。

说回正经事。新闻快讯里的细节很多,大家自己去看。这里主要聊点深入的。市场很关心三个问题:

第一,OpenAI为什么要买一家数据仓库公司?

第二,这类公司很多,为什么偏偏是Rockset?

第三,Rockset到底做对了什么?

回答之前,先看看相关公司有多少(数据来源于Rockset官网)。竞品确实不少,但OpenAI买的公司,技术肯定不差。而且这次收购,要么是为了投资,要么就是为了技术整合——把Rockset的技术融入现有体系。所以,Rockset的技术必须足够硬,才能配得上GPT。

02

先聊第一个问题:

为什么要买数据仓库公司?

数据是AI大模型的石油,这基本是行业共识。想让模型变强,就得往里面“加油”(加数据)。而从基础模型的角度看,加油的方式只有两种:一是微调训练,二是RAG(检索增强生成)。

既然只有这两种,它们的价值就不言而喻。那么,谁对“给大模型加油”的需求最迫切?答案是那些有很多数据的企业。没数据,也迫切不起来。所以,话题自然进入了企业级服务的范畴。

想让中石油、高盛这类公司把数据直接拿出来给大模型厂商?根本不可能——不是秘密也是机密。这时候,要么去企业自己的服务器上微调模型,数据不出门;要么就用RAG。

RAG这个名字听起来很复杂——“检索增强生成”,三个动词叠在一起。但道理很简单:你有一个非常聪明的朋友,什么都能回答,但有时答案可能不准确或过时,因为ta只靠以前学过的知识。那就在回答问题前,让ta先翻查一下资料。这样答案自然更准确、更可靠。

RAG的本质就是“找东西”。怎么找,取决于怎么存。从企业级服务的角度看,找东西主要有三种方式。

第一种:在数据仓库(OLAP)里找。

数据仓库是专门用于在线数据分析的数据库。它最大的特点是精确——查询去年可口可乐的销售额并排序,不管查多少次,答案都一样。这是精确运算,结果是确定不变的。

第二种:用Elasticsearch这样的搜索组件找。

这是一款开源的分析引擎,特别擅长找文本信息,也就是语义信息。比如搜索“AI芯片”,它能把所有包含这个词或其同义词的文章都找出来,还给你排好序。这是一种模糊查找。

第三种:在向量空间里找。

这时候,所有信息都被转换成向量,核心是找“距离近”的向量。这是一种近似搜索。

这三种方式各有优势。以OpenAI的调性来推测,它大概率会说:“经费有限才做选择,有钱就全都要。”巧了,Rockset恰好能实现“一石三鸟”。

03

那就接着聊第二个问题:

全世界类似产品很多,为什么是Rockset?

这个问题其实很好回答——因为OpenAI把它买了,这就是最大的商誉背书。夸它的空间很大。创始团队背景光鲜:前大厂员工创业,六名高管中有四人来自Facebook;CEO是威斯康星大学麦迪逊分校计算机专业出身,CTO兼联创更是大名鼎鼎的RocksDB的作者。

但更重要的是技术本身。Rockset最突出的特点是

“实时”

。大模型的服务本身就是实时的,如果RAG检索信息还要等一小时,那机器人就成了“呆若木鸡”的状态。RAG是一个在线服务,整个链条都必须是实时的。

这背后暗藏一个关键点:找东西到底用什么组件?前面提到了三种——数据仓库、Elasticsearch、向量数据库。Rockset的选择是,把这三者在同一个技术栈里整合起来。

04

最后看第三个问题:

Rockset做对了哪些事情?

核心在于:在数据仓库(OLAP)上扩展向量检索和语义检索并不困难,但反之则不行。这从另一个角度说明,数据仓库的技术栈比单纯的向量检索或语义检索更深,想做好并不容易。更重要的是,数据仓库是企业数字化转型最核心的组件。

数字化有三件重要的事:有数、存数、用数。需要一套扩展性强的体系来满足企业所有数字化的需求。巧了,数据仓库恰好能胜任这件事。更巧的是,Rockset不仅这么做了,还是在众多数据仓库产品中,把文本检索和向量检索支持得最好的。

Rockset的技术路线,正是从数据仓库技术栈出发,向向量和语义搜索扩展。这个顺序很重要——只有向量检索和文本检索是不够的。企业级RAG的核心,是具备搜索召回能力的数据仓库。而且数据仓库的扩展性,从70年代有BI开始就一直在被证明。

为什么扩展性如此重要?因为数据仓库上层的负载变化多样、快速增长。文本检索的浪潮来了,要做好;向量检索的浪潮又来了,也要能接住。每招都要能接招。

做好扩展性的根本是什么?一是数据开放性,二是可组装性(架构松耦合),并且要在保证前两者的基础上,与性能做好平衡。也就是说,不能为了开放性和可组装性而牺牲性能。这就像一辆可以换引擎的车,不能比换不了引擎的车耗油多十倍。

对OpenAI来说,To C赚钱,To B也要赚钱。To B就必须在数据架构上发力,夯实数据平台基础。这类产品需要积累——比如Snowflake和Databricks就积累得很深。好消息是,美国的软件生态很好,只要觉得值,就可以花钱买一家好公司来。不卖?那就再加点价。

一个判断是:OpenAI准备认真赚B端客户的大钱了。因为这个阶段,在企业级生意里,企业级RAG最为核心。如果OpenAI想落地这套东西,它需要一个能承接这一切的平台或引擎。它没有选择纯粹的向量数据库,说明它的判断是:需要一个具备优秀搜索能力的数据仓库,再加上向量数据库的能力。这个观点可能会让一些做向量数据库的朋友不太舒服,但市场的选择已经说明了一切。

(完)