重磅!OpenAI正式发布博士水平的推理模型o1!附详细说明
昨天刚在《ChatGPT Pro都来了,ChatGPT Pro Max还会远吗?》一文中聊到OpenAI即将推出一款具备推理能力的新模型,没想到今天它就来了。

北美时间9月12日下午,OpenAI官方正式宣布了新模型o1-preview(o1预览版)的发布。这和昨天文章中的判断一致——o1-preview作为新一代模型,擅长通过推理来解决复杂的任务,尤其在科学、代码和数学方面,表现确实让人眼前一亮。
短短2个小时,OpenAI的帖子阅读量就已突破百万。
本次发布的新模型共有两个。除了刚刚提到的o1-preview,另一个是o1-mini,可以理解为o1-preview的弟弟版本,更加注重经济高效。两者的关系,有点像GPT-4o和GPT-4o mini。
o1模型发布后,OpenAI的CEO Sam Altman随即在社交媒体上连发多条帖子表示,这将会是目前最强大、最对齐的模型。虽然还不完美,但它呈现出来的能力,足以让人感到惊艳。
o1工作原理
o1模型的核心逻辑其实不难理解——OpenAI让模型在回复前花更多时间思考,从而提升其解决复杂问题的能力。和传统的AI模型不同,o1更加注重推理过程,就像人类遇到难题时,会先花时间分析、思考,然后再做回应。
在训练过程中,模型会逐步优化自己的思维方式,不断尝试不同的策略,甚至能进行自我识别和纠错。经过这种反复训练,o1逐渐掌握了精细化的推理能力,面对问题时的准确性和灵活性都有了显著提升。
从测试结果来看,这次更新的o1模型在物理、化学和生物学等复杂学科的高难度基准任务上,表现几乎与博士生相当。而数学和编码领域,更是它的强项。在国际数学奥林匹克(IMO)资格考试中,GPT-4o只能正确解决13%的问题,而o1的正确率达到了惊人的83%。在Codeforces编程竞赛中,o1的表现排到了第89百分位——也就是说,它超过了89%的评估对象,名列前11%。
作为一款早期模型,o1目前还没有浏览网页、上传文件和图像等ChatGPT的常用功能。但在复杂的推理任务中,它的表现已经显著超越了之前的模型,包括GPT-4o。这一表现,无疑代表了AI模型的新高度。
OpenAI对此模型寄予厚望,认为它能大幅提升科学、数学和编程等领域的工作效率。也正因如此,OpenAI决定将版本编号从头开始,并把这一系列模型重新命名为o1。
新模型的安全性能
安全性一直是AI模型开发中的核心问题,尤其在模型推理能力不断提升的背景下。针对o1系列模型,OpenAI采用了全新的安全训练方法——通过模型的推理能力,使其能更好地遵循安全和对齐指南。和传统的规则式限制不同,o1模型可以根据上下文进行推理,从而更有效地应用这些安全规则。
OpenAI还采取了更严格的安全评估机制,确保新模型在面对复杂场景时依然能够遵守安全规则。比如,在用户试图绕过安全限制(也就是“越狱”)的情况下,OpenAI进行了专门测试。测试结果显示,上一代的GPT-4o在越狱测试中只得了22分(满分100分),而o1-preview则拿到了84分——差距相当明显。
为了进一步增强安全保障,OpenAI还强化了内部治理体系,并加强了与政府的合作。这包括使用准备框架进行的全面测试、顶级的红队测试,以及由安全与安保委员会主持的董事会级别的审查流程。
o1适用人群
o1系列模型所具备的增强推理能力,特别适合那些需要处理复杂问题的专业领域——无论是科学研究、代码开发,还是数学运算。这一代新模型正在用其强大的推理能力,解决此前难以处理的复杂任务。
举个例子:o1可以帮助医疗研究人员标注细胞测序数据,这在生命科学领域中的基因研究、药物研发等方面尤为关键。对于物理学家来说,o1能够生成量子光学所需的复杂数学公式,大幅提升计算效率和准确性。同时,o1也能支持各类开发者,帮助他们构建和执行多步骤的工作流程,实现任务的自动化与优化。不管是处理大规模数据集,还是编写复杂算法,o1的推理能力都能提供有力支撑。
这也意味着,在这些需要精确计算和严密推理的领域,o1将能显著提升生产力,减少人为错误,并大幅加快科研进程和开发速度。而且,随着o1模型的持续改进和功能拓展,未来它有望在更多领域中发挥作用,帮助更多人提升工作效率和成果质量。
o1-mini:更经济高效的选择
o1系列模型在复杂代码生成和调试方面表现出色。为了给开发者提供更高效的解决方案,OpenAI还推出了o1-mini。相比o1-preview,o1-mini速度更快,成本更低,特别适合那些需要推理但不需要广泛世界知识的应用场景。作为一个较小的模型,o1-mini的价格比o1-preview便宜80%。如果需要在强大推理能力和成本之间找到平衡,o1-mini确实是一个更好的选择。
如何使用o1模型
从9月12日起,ChatGPT Plus和Team用户可以在ChatGPT中手动选择o1系列模型,包括o1-preview和o1-mini。目前阶段,o1-preview的消息限额是每周30条,o1-mini是每周50条——是的,你没看错,30条和50条是每周的限额。
从下周开始,ChatGPT Enterprise和Edu用户也将获得访问这两个模型的权限。
对于API用户,符合使用等级5(usage tier 5)的开发者今天就可以开始使用这两个模型,初期API速率限制为每分钟20次请求。目前的API版本还不支持函数调用、流式传输和系统消息等功能,不过这些功能的增加和限制的提升正在测试中,OpenAI也会在后续扩展更多功能。
值得一提的是,OpenAI还计划将o1-mini开放给所有ChatGPT免费用户,让更多人能体验到这款新推理模型。
未来展望
目前,o1系列模型仍处于早期预览阶段,用户可以通过ChatGPT和API体验其推理能力。随着模型的持续改进,OpenAI计划为o1系列增加更多实用功能,比如网页浏览、文件上传、图片处理等,进一步提升模型的实用性。
与此同时,OpenAI也明确表示,除了o1系列,GPT系列的开发并不会停止。未来,GPT系列模型将继续更新和发布,与o1系列共同发展。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名