写在GPT5之前|大模型、AIAgent在领域中替代边界在哪?
前两天OpenAI全员大会上抛出了一个挺有意思的讨论——他们搞了个AGI能力评分,说现在的ChatGPT还在第一阶段晃悠,但马上要冲进第二阶段了。加上之前GPT-5的进展消息,这玩意儿预计能达到领域博士的水平。可惜啊,得等到2025年底才能落地。正好最近亲身经历了一个高考志愿AIAgent的开发过程,借着这个机会,把一些思考和感受串起来聊聊。

高考志愿AIAgent对话助理
之前搞的那个高考志愿AIAgent,跟市面上其他同类产品比起来,确实有些拿得出手的优势。具体的实现细节和代码之前的文章里聊过,这里就不展开说了,但核心差异在于数据来源和处理方式的不同。


当前大模型、AIAgent还是人机接口
为啥咱们推荐的高考志愿学校和专业更靠谱?关键一步其实是人工来拆解问题,然后调一个叫Score2School的动作,利用去年各学校专业的录取分数,直接把考生分数在本省能报上的学校专业列表给筛出来。紧接着再调用智能搜索KFind去补充一些背景信息。整个流程清晰得像一道流水线。

但这里得说清楚:为什么这玩意儿本质上还只是个人机接口?因为大模型自己还没法把问题拆解得那么利索。现在的方案是手工拆解,我们也试过让大模型自己来拆,像AgentUniverse里其实有现成的例子,但试下来效果还是差一截。后续也可能试试Chain of Thought之类的路径,不过话说回来,在GPT-5出来之前,折腾来折腾去大概率都是缝缝补补的事儿。
zero_shot_template_decomposition = """introduction: 你是高考志愿填报专家。instruction:需要遵守下面的规则:1.去除重复的信息。2.去除对回答原始问题没有帮助的信息。3.简要拆解问题,重点突出。4.拆解问题中不要重复,一个问题只出现一次。5.尽量使用数值类信息。6.提问需要高度注意信息的时效性。Task:将给定的问题分解成更易于回答的简单子问题。注意:只能返回分解后的问题。不要回答它们中的任何一个,包括原始问题。原始问题: {question}分解后的问题:"""
人机接口已经改变世界了
2023年底微软CEO的年度公开信里就提到过,人工智能正在以全新方式跟数据互动,所谓人机接口正在被重塑。虽说他当时指望的Dynamics 365 Copilot能成为各个职能部门的标配,这个愿景还没完全实现,但方向是对的。
回到高考志愿AIAgent这个例子上来:如果没有大模型,光靠传统NLP处理完再跑score2School做自然语言查询,那绝不是几十行代码就能搞定的。而有了大模型赋予的新人机接口,整个领域流程被重构的可能性就摆在了台面上。相关的系统建设完全可以干起来,每个领域情况不同,但方向已经明确了。
GPT5之后,大部分领域必然都是大模型方案,边界在哪?
前阵子OpenAI官方透露GPT-5发布要等到2025年底,看来模型规模上再来一个大跃进可真不容易。但几乎没人会怀疑GPT-5的能力会再次跃迁。这次高考,大模型在文科基本能上一本线了,理科还差口气。而GPT-5重点优化的方向就是逻辑推理能力。从高中直接跳到博士水平,ChatGPT达到Level 3阶段是可以预见的。
这些天萝卜快跑引发了不少社会讨论。作为中年人,对滴滴司机的焦虑感同身受。可惜市场经济里,技术替代的边界是成本,而不是别的什么。

司机的替代边界在哪?在复杂场景、人车混行、异常天气这些环节。说到底,人工作为全天候适应性最强的劳动工具,还是有它的不可替代性。
那各个领域呢?
AI助理提升工具理性
马克斯·韦伯把人的理性分成两种:工具理性和价值理性。工具理性就是找做事的效率最优解,核心是计算——目标明确的情况下算成本和收益,选最优路径。它不关心目的,只看手段。价值理性则不同,它信仰特定行为本身的内在价值,不管成败。没人会怀疑AI提升了工具理性,但在价值选择上,比如小红书上那个浙江考生的纠结:选外省985还是本省或上海的211?点赞最高的是建议上海211,理由是外省985在江浙沪影响力不大,南北饮食有差异,想家时回家麻烦。另一条意见则认为还是该选985,招聘里硬性条件卡着呢。这就是价值选择。外省985还是本地211,AI确实给不了明确答案。
《卖桔者言》搜索成本
经济学家张五常教授在《卖桔者言》里记录了他元宵节卖四季桔盆栽的亲身经历,自然引出了经济学中价格歧视、信息不对称、需求弹性和搜索成本这些概念。那天他进了200多盆,每盆成本40块,最终以最高80元、最低20元全部售出。起初开价80元,最低60元。一下雨立刻降价,雨停了又涨回去;午夜后直接30元。他惊讶地发现,顾客并不会走遍整个夜市找到性价比最高的才买,隔壁家卖40,这家卖80,照样有人成交。只要价格到了心理预期,搜索成本和信息不对称就这么合理地把交易完成了。
人们会评估搜索的代价——值不值得去进行有利可图的搜索发现行为,很大程度上取决于信息获取的方便程度和处理成本。这个逻辑跟不确定性环境下有限理性决策描述的启发性搜索很像:一旦达到预期满意度就停止,而这个满意度又和信息搜索成本以及期望结果紧密相关。所以交易中有意图的搜索,是由预期的商品或服务价值及搜索成本共同决定的。奥地利经济学派有个观点:市场本身就是一个竞争性发现的过程,发现的过程某种程度上就是搜索的过程。
高考志愿的搜索成本
今年高考志愿填报,因为张雪峰老师,因为国家的阳光志愿系统,搜索成本确实被极大降低了。

张雪峰老师不仅提供工具理性,更重要的贡献是在价值理性层面。比如:普通家庭的孩子优先选能让自己过得好的专业,比理想主义实际得多,要选有专业壁垒的专业;想学法律又考不上五院四系,建议选期望就业地域的法学院,好过外地的一般211法学院;如果告知想学气象专业的学生,清华和南京某非985、211院校的气象专业,就业单位基本一样;一个专业方向是否饱和,可以看专业对口就业率;物生地怎么报考偏理科的专业……
但仔细琢磨,其实大部分还是工具理性,少部分才是价值选择。上面那个本地211和外地985的纠结看似完全是价值判断,但要是能把本地211的专业与就业、外地985的专业与就业都相对准确地列出来,价值理性问题就能一定程度上转化为工具理性问题。当然未来终究不可知,价值理性还是有它的一席之地。
提升工具理性能部分代替价值理性
之前讨论大模型如何撑起几十万亿美元估值时,提到过必须占据核心价值分配。刚开始做高考志愿AIAgent时,觉得张雪峰老师的主要价值来自价值理性,做着做着慢慢发现,他的价值更多还是工具理性——是在工具理性无法决策时,才用价值决策来兜底。
在替代中逐渐明确边界
这篇文章多少有点标题党。萝卜快跑的替代边界还在摸索中,更不用说GPT-5之后领域AI和人工的替代边界了。但既然我们生活在开放世界,未来本来就预测不了。在下那个高考志愿AIAgent时虽然导入了张雪峰老师的语录,但也依赖搜索和经济行业数据来提供支撑。毕竟张老师2020年还力推过土木呢。

当领域AGI方案全面推广的时候,信机器还是信人,真就是个问题了。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名