首页 > 教程攻略 > ai教程 >从 OpenAI 12 天发布会里,我们看到了行业的四个关键问题

从 OpenAI 12 天发布会里,我们看到了行业的四个关键问题

来源:互联网 时间:2026-08-02 07:15:14

历史上第一次有公司敢这么玩——连续开12天产品发布会。当OpenAI宣布这个消息时,全球科技圈的期待值直接被拉满。但发布临近收尾,有人直接扔出一句:“就这?就这?”这个评价,基本是主流写照。确实,这次的“十二天圣诞大礼包”,整体来看亮点有限,低于外界预期。

前11天里,OpenAI拿出的东西其实不少:完整版推理模型o1、强化微调、文生视频Sora、升级后的写作与编程工具Canvas、与苹果生态的深度整合、语音和视觉功能、Projects功能、ChatGPT搜索、以及给ChatGPT打电话和用WhatsApp聊天。但之所以有人觉得失望,核心原因就一个:“还以为会发GPT-5。”发布会刚结束,外媒就有报道说,GPT-5的研发遇到了阻力。

当然,最后一天的o3是个例外。作为o1的下一代推理模型,它在数学、代码、物理等多项测试中的表现,只能用“惊人”来形容。一位国内大模型公司的技术人士直言:“AGI已来。”业内对o3的评价普遍很高。

回头看这12天,OpenAI一边秀技术肌肉,一边优化产品形态、扩大落地应用空间。有人开玩笑说,这就像一场“直播带货”,目标很明确——让更多用户和开发者用上ChatGPT。在新的一年里,OpenAI在日活、营收等数据上或许会迎来一轮飞跃。

o3 发布会|图片来源:OpenAI

但这个过程不会一帆风顺。尽管模型能力在增强,但要说到落地应用,数据瓶颈、工程化封装能力、还有居高不下的模型成本……这些障碍可一点都不少。

这次发布会其实透露了一个趋势:大模型行业的竞争焦点,已经不单纯是模型参数和技术上限了,用户体验和市场规模同样重要。只有两条腿一起走,才能保持领先。

整理完这12场发布会的信息,结合与国内大模型行业人士的交流,有几个关键看点值得拿出来好好聊聊。

01 o3的智能深度已经够了,但能否称之为AGI要看智能广度

“疯狂,太疯狂了。”这是某国内模型负责人看到o3之后的第一反应。

在数学、编程、博士级科学问答这类硬核任务上,o3已经超越了部分人类专家的水准。举个例子:在涉及生物学、物理学和化学的博士级科学考试GPQA Diamond中,o3的准确率达到87.7%,而相关领域的博士专家只能到70%;在美国AIME数学竞赛中,o3拿了96.7分,只错了一道题,这已经是顶级数学家的水平。

讨论最多的还是它的代码能力。在全球最大的算法竞赛平台Codeforces上,o3得分2727分,比o1提升了800多分,相当于排在第175名的顶级人类选手。更夸张的是,这个分数甚至超过了OpenAI自己的研究高级副总裁Mark Chen(他得分2500分)。

o1-preview、o1、o3 的代码能力对比 | 图片来源:OpenAI

从9月推出o1-preview到现在,短短三个月,o1系列在推理能力上完成了超强进化。发布会第一天推出的o1完整版,思考速度比o1-preview快了约50%,针对困难现实问题的重大错误减少了34%,还支持多模态输入。而o3在复杂问题上,已经超越部分人类专家。

清华大学长聘副教授、面壁智能发起人刘知远对此分析道:“从o1到o3,是通过增加推理计算量来实现能力提升。随着Deepseek-R1、Gemini 2.0 Flash Thinking等模型的发布,大模型已经开始从预训练Scaling Law转向推理的Scaling Law。”

自o1-preview发布以来,大模型的技术范式就切换了。之前的预训练Scaling Law,核心是不断扩大训练参数、提升智能上限;新的范式则是在推理阶段注入强化学习,提高复杂推理能力。前者像“快思考”,模型靠下一个词预测来给出答案,读万卷书但学而不思;后者则是“慢思考”,先拆解问题、规划步骤,再得出结果,如果走不通就换条路,通过强化学习不断变强。

在刘知远看来,o3的超强研究推理能力表明,它正在朝“超高智能的超级计算机”方向前进。不少行业人士认为,这对前沿科学领域的影响会很深远。从积极角度看,它能帮人类推动数学、物理、化学等学科的基础研究;当然,也有人担心它会冲击科研人员的工作。

o3的智能深度确实让人看到了AGI的曙光。但刘知远指出,信息革命的标志不是大型计算机,而是个人计算机的普及。同理,只有实现AGI的大众化、普惠化——让每个人都能拥有自己的大模型、解决自己的日常问题——才是真正的智能革命。“我们总不能让陶哲轩、Hinton这样的顶尖科学家来帮我们处理日常事务吧?”他说。

这里的关键问题是,o3的智能深度能否泛化到其他领域,拥有足够的智能广度。在上述那位技术人士看来,只有同时突破智能的深度和广度,才能叫AGI。他对此很乐观:“就像你们班来了个转校生,你还不了解他,但他数学和编程都考了全班第一。你觉得他语文和英语会差到哪去?”

对国内大模型公司来说,核心问题还是如何追赶o3。从训练架构、数据、训练方法到评价数据集,这似乎都是工程化能解决的问题。当被问到“距离我们拥有一个o3水平的开源模型还有多远”时,那位模型负责人回答:“一年之后。”

02 模型只是发动机,关键是帮助开发者用起来

尽管o3的模型能力很强,但在一些应用层的人看来,模型和落地应用之间的距离还很大。澜码科技创始人兼CEO周健打了个比方:“今天OpenAI训练了爱因斯坦,但如果想让他变成上市公司的首席科学家,中间还隔着很长的路。”

作为大模型中间层的玩家,澜码科技很早就开始探索把大模型落地、打造AI Agent。周健认为,大模型只是基础设施,要真正用起来,必须结合具体场景做大量工作,而目前最大的掣肘其实是数据。在很多场景里,拿到完整数据本身就很难,有些数据甚至根本没有数字化。比如猎头可能需要简历数据,但很多简历都没有被数字化。

成本是影响o系列模型落地的另一个关键因素。根据ARC-AGI测试标准,o3在低计算量模式下每个任务耗费20美金,高计算量模式则要数千美金——哪怕问一个最简单的问题,也要花掉近两万元。收益和成本完全不成正比,o3的落地恐怕还需要很长时间。

o 系列模型的成本测算 | 图片来源:ARC-AGI 测试标准

为了帮开发者解决落地问题,OpenAI在这次发布会上也拿出了相应的方案。比如第二天发布的AI强化微调功能,就是周健最关心的一项。它能让模型通过少量数据来优化推理能力、提升性能,特别适用于精细化领域。OpenAI的技术人士表示,它能帮助任何需要深厚专业知识的领域,比如法律、金融、工程、保险。一个典型案例是,汤森路透用强化微调来微调o1-mini,做出了一个很好用的AI法律助理,帮法律人员完成了“最具分析性的工作流程”。

再比如第九天,o1模型终于向开发者开放了。它支持函数调用和视觉能力,引入了WebRTC实现实时语音应用开发,推出了偏好微调功能,还发布了Go和Ja va SDK。同时,4o语音模型的价格大幅下调,音频输入降到$40/百万tokens,输出降到$80/百万tokens,缓存音频价格更是降低了87.5%。对于预算有限的开发者,还推出了GPT-4o mini,音频费用只有4o的四分之一。

这些新功能正是周健关注的。他认为,更新的实时语音、视觉识别等功能,将能在营销、电话客服、销售外呼等场景中发挥更大价值。按他的经验,OpenAI推出领先技术后,国内一般6到12个月就能追上。这让他对新一年的应用业务充满信心。

03 Sora的视频生成低于预期,但产品开放会提升其物理模拟能力

年初OpenAI发布Sora的demo时,全球科技圈都炸了。但整整一年,国内各大模型公司纷纷杀进文生视频赛道,等到OpenAI在发布会第三天正式放出Sora时,反倒让国内公司松了一口气。

生数科技联合创始人兼CEO唐家渝的评价很直接:“基本没有超出预期的内容,真实感、物理特性等方面和2月份的发布相比没有明显变化,基础模型能力层面算是低于预期的。”目前,字节、快手、MiniMax、智谱、生数、爱诗等公司都已经推出了自己的文生视频产品。唐家渝认为:“Sora的效果和实力综合来看,并无明显领先优势。我们自己跟OpenAI确实还是齐头并进的。”

在他看来,Sora稍微有点亮点的部分,是在基础的文生视频、图生视频之外,提供了一些提升创作体验的编辑功能。这说明OpenAI确实更关注产品体验了。比如故事板功能,相当于按时间轴把一段视频切成多个故事卡,用户只需要设计和调整每张卡片,Sora就会自动把它们补成一段流畅的视频——这很像电影分镜或动画手稿,导演画好分镜,动画就做好了。它能让创作者更好地表达自己。

另外还有文字直接修改视频、无缝融合两段不同视频、改变视频画风等功能,这些相当于直接给视频加“特效”了。而一般的文生视频产品,无法直接修改原视频,只能不断调整提示词、重新生成。

Sora 的故事板功能 | 图片来源:OpenAI

唐家渝说,这些功能设计确实是为了给创作者更大的自由度,类似的功能已经在Vidu(生数科技的文生视频产品)的迭代计划中。“Sora实现这些功能,对我们来说并没有难度,路径也已经很明确了。”

在发布会上,Sam Altman解释了做Sora的原因:一是工具性价值,为创意人员提供创作工具;二是交互价值,大模型不应只通过文本交互,应扩展多模态;三是最重要的——这与AGI的技术愿景一致。Sora在学习更多关于世界的规律,最终有可能建立起理解物理规律的“世界模型”。

唐家渝指出,目前Sora生成的视频中,依然有不少明显违背物理定律的地方,和2月的demo相比进步不大。他认为,Sora发布后会吸引更多人尝试和探索它的物理模拟能力,这些测试样本或许对提升它的物理模拟能力有一定指导作用。

04 内加功能、外接生态,ChatGPT能变成Super App吗?

除了o系列模型、Sora和开发者服务,OpenAI在发布会上的主要动作,一方面是持续在产品端增加新功能、优化用户体验,另一方面是积极推动与苹果等企业的深度合作,探索AI融入终端设备和操作系统。

从前者来看,ChatGPT的演进方向似乎是成为一个“无所不能、无所不在、人人可得”的超级AI助理。极客公园了解到,OpenAI创立之初的愿景就是打造一个“无所不能”的Agent,它能理解人类指令、自动调用不同工具、满足人类需求。终点就是起点。

比如第六天,ChatGPT增加了支持屏幕共享的视频通话和圣诞老人语音模式。前者让用户能跟AI实时通话,共享屏幕或展示周围环境,进行多模态互动,复现了电影《Her》中的场景。

比如第八天,ChatGPT向全体用户开放了搜索功能。除了基础搜索,还增加了语音搜索,集成了手机地图服务,能调用苹果、谷歌地图展示搜索结果,还与多家顶级新闻和数据提供商建立了合作,支持查看股票、体育赛事、天气预报等信息。

又比如第十一天,ChatGPT宣布扩展与桌面软件的集成。它能接入更多编码应用(如BBEdit、MatLab、Nova、Script Editor等),能和Warp、XCode等应用一起使用,还能在语音模式下与其他应用协同工作,包括Notion、Apple Notes等。现场演示了一个场景:用户在Apple Notes中设定“节日派对歌单”,语音征询ChatGPT意见,ChatGPT能指出用户的错误——比如把《Frosty the Snowman》误写成了《Freezy the Snowman》。

ChatGPT 指出了 Apple Notes 的错误 | 图片来源:OpenAI

“ChatGPT会从单纯的会话助手向更为强大的袋里工具转变。”OpenAI首席产品官凯文·韦尔这样说。

另一方面,OpenAI也在积极扩张生态,通过融入人们最常用的终端设备、操作系统、上层软件,触达更广泛的用户群体。比如第五天,ChatGPT宣布集成苹果智能生态,融入iOS、MacOS和iPadOS,支持跨平台、跨应用调用AI能力,包括Siri交互、写作工具(Writing Tools)、视觉功能识别场景内容(Visual Intelligence)等。通过这次合作,ChatGPT触达了全球数十亿苹果用户,也开启了大模型与端侧、操作系统合作的先例。

比如第十天,ChatGPT公布了自己的电话联系方式(1-800-242-8478),美国用户每月可免费通话15分钟。同时上线的还有WhatsApp联系人(1-800-242-8478),全球用户都可以通过WhatsApp发送消息,目前只支持文字。

ChatGPT 公布了自己的电话联系方式 | 图片来源:OpenAI

全球很多国家和地区的智能手机和移动互联网渗透率还远远不够,通过电话这种最基础的通讯工具,ChatGPT触达了这些人群。同时通过WhatsApp,也触达了其近30亿用户。

无论是内加功能还是外接生态,ChatGPT的核心目标都是想让产品触达更广泛的人群,变成真正的Super APP。但也有人并不看好它这种不断内加功能、把业务线拉得极长的做法,甚至形容为“铺了一个大饼,但每一块都有点薄,深入不下去”。很多业务都需要足够深才能发挥价值,也有对应的公司在深耕,这或许是OpenAI要面对的挑战。

尽管o3让外界看到了OpenAI惊人的技术实力,但关于推理Scaling Law能达到怎样的智能上限,以及GPT-5的难产问题,依然让人对这家公司的技术发展充满疑问。这次发布会上,OpenAI将关注点转向产品形态、合作生态和落地建设,也未尝不是一种思路。这两者的结合,可能决定了行业接下来的走向。