首页 > 教程攻略 > ai资讯 >GPT4+prompt ≈ GPT o1? 都了, 还在微调、自训练模型?

GPT4+prompt ≈ GPT o1? 都了, 还在微调、自训练模型?

来源:互联网 时间:2026-08-27 14:33:30
早上打开ChatGPT,习惯性把模型从GPT-4 Mini切换到GPT-4,结果发现菜单里多了几个陌生的名字——o1。嗯?这是什么?简单浏览了一下资讯,说的是在数学、量子物理、经济学这些需要深度思考、多步骤推理的场景里,o1有了明显提升,回答更清晰、更丰富。训练过程中特别强调让模型自己花更多时间思考,修正自己的推理链条,同时根据OpenAI的安全规则,在模型安全性上做了更深入的处理——可以说,让GPT“越狱”变得更难了。之所以叫o1,是因为这是AI在复杂问题思考上的关键一步,回到了数字1(代表一个新起点)。
从最常用的两个场景——英文翻译和AI论文理解——来看,o1的回答确实内容更多,解释更详细。下面对比了同一翻译任务在o1-preview、o1-mini和GPT-4上的表现:
可以看到,o1-mini效果最好,毕竟o1-preview只是正式版的前置预览。此后o1-mini成为了常用模型。在AI论文解释场景中,用GPT-4配合Prompt与直接用o1-mini的效果对比如下:
左侧的提示词基于OpenAI官方Prompt框架(关于提示词入门可参考《AI论文GPT》那篇)。简单来说,GPT o1在基础文本理解和翻译场景里提供了更详尽的思考,一句一句逐步解释,不仅给出翻译结果,还解释了原句的含义——而这些在之前的GPT-4里需要专门写Prompt才能达到。OpenAI自己介绍o1时也强调,这个模型并没有在工具调用和网页搜索上进步,只是在复杂问题推理上做了增强,而这类推理原本可以通过人为编写提示词来部分实现。 因此,一个快速的总结是:**GPT-4 + Prompt ≈ GPT o1**。这再一次印证了去年观察到的一个规律:选择模型时,大家都想一股脑用参数最大最新的那个,但实际上在该模型上加知识库、API工具、Prompt、工作流,能让低参数模型实现零样本下大参数模型的效果。可以想象,未来GPT-5或更先进的模型,其生成质量可能就是现在“GPT-4 + Workflow + 知识库 + Prompt + 微调”这个组合的集成。 关于微调,再补充几句。在《提升RAG检索回答质量:Shortwa ve的4大优化指南》中曾解释过为什么RAG和微调之间更倾向微调。2023年因为FOMO,很多人都在谈训练、谈微调,也确实有人去做,比如BloombergGPT招了9个全职人员,专门在金融数据上训练模型。结果呢?不到一年就被新更新的GPT-4超越。从零开始自训练模型在2024年已经不具有吸引力——谁有那么多人力、算力、资金投入?谁又能保证训练水平赶得上现在的Claude、GPT、Qwen?之前有人尝试在农业领域自训练,到现在也没什么水花。 微调也需要谨慎,原因有三: 第一,需要更多算力、人力和时间。RAG在保持高效性能的同时使用更少的算力资源,还具备灵活应对信息检索准确性问题的能力——当检索到的信息不准确或有害时,只需调整或替换索引,而不需要重新训练整个模型。 第二,相比RAG这类在模型上叠加API工具、知识库的方式,微调的内容全部在黑箱里,要修改内容必须重新训练,而不能仅仅修改某个API或知识库文档,也无法对不同知识库和工具做清晰划分。 第三,微调基座LLM发生版本更新(比如出现了更大参数、更优质的模型),就得更换模型版本重新训练,而新模型内部的机制与之前不同,理解能力也会变化。即使只是Prompt,换模型或模型升级后,Prompt对质量的提升效果都会不一样,微调也会经历新一轮的投入。针对这一点,只要发生模型更换,就需要重新走一套流程——重新微调、写Prompt、设置API工具和工作流。一个节省时间的策略是制定有效的评估(eval):对结果进行断言定性评估、LLM评估、人工评估,在新旧两个模型上分别评估,这样能判断两者差距是否真的需要更换;并且评估中获得的反馈和标注数据,可以作为下一次微调的数据。关于LLM评估,《终于看懂大模型评估:5个策略让GPT更听话》一文虽有格式错误,但有不少扎实干货。 那么什么时候真的需要微调或本地部署呢?用户数据需要私有化,模型要完全自主掌控,并基于模型打造自己的系统产品;或者为了满足用户需求,需要使用市面上不公开的保密数据。 回到GPT本身,现在构建GPTs时无法选择模型,默认都是GPT-4,不知道什么时候能升级成GPT o1。既然o1有了更深入思考的能力,学习Prompt时应该能学得更好。下图是将AI论文GPT的提示词发送到GPT o1对话框后的回答效果,与前面Figure 3的差异不大:
尝试让GPT o1阅读总结网页文章,却遭到了更严格的拒绝:
从目前的体验来看,GPT o1在没有提示词的情况下表现得更好,回答更完善清晰;而加入Prompt后,效果与GPT-4差不多。针对灰色地带的问题,o1反而更严格——用OpenAI的话说,就是“更安全”:“我们提出了一种新的安全训练方法,利用模型的推理能力使其遵守安全和对齐指南。通过推理上下文中的安全规则,模型能更有效地应用这些规则。” GPT4+prompt ≈ GPT o1? 都了, 还在微调、自训练模型?