中国版 LMSYS 来了!扣子模型广场带来了什么?
大模型价格战打到现在,从字节豆包点燃第一把火开始,整个行业——从大厂到创业公司——都卷入了一场新的较量。当API价格被压到接近免费,竞争的核心就从“谁更便宜”转向了“谁更管用”,实打实的产品力成为新的战场。而在这背后,AI原生应用已经成了大模型厂商的必争之地,对于无数想要借助大模型大展拳脚的用户来说,这恰恰也是把创意变成落地应用的好时机。
去年11月,OpenAI发布了GPTs,今年又上线了GPTs商店。这一连串动作,让普通开发者也能用大模型创建独有的AI Agent产品。近期,OpenAI甚至把GPTs的使用权限完全开放给所有用户——不管你是专业程序员还是刚入门的小白。AI就这样一步步走向大众,更多人开始感受到它的真正魅力。
对于专业开发者来说,用LangChain这样的开源框架快速搭建智能体早已不是难事。但问题在于,这些框架对完全不懂编程的用户来说,门槛还是太高了——要想完成一个AI原生应用,光是前期准备就够折腾一番。于是,大模型应用领域的第一场战役,就是如何把门槛降到最低,做到“无需编程经验就能快速创建智能体”。字节跳动的扣子(coze.cn)就是这个方向的典型代表,它直接集成了豆包、通义千问、智谱、MiniMax、Moonshot、Baichuan等多个国内知名大模型。
模型选择变得方便了。但另一个让人头疼的问题随之而来——截至目前,可选的模型数量已经超过300个。每个模型的能力侧重点都不一样:有的在语言理解和生成上很出色,有的在逻辑推理上更胜一筹。对于AI原生应用开发者来说,要选一个真正适合自己场景的模型,谈何容易?而要让创建的智能体运行出令人满意的效果,往往还需要一遍遍地反复调试。
于是,横亘在用户面前的一个核心问题就变成了:到底该怎么选择趁手的模型?
大模型竞技场:盲测模型,先用后选
大模型竞技场:盲测模型,先用后选
目前,各大模型公司在发布新模型时,通常都会对标GPT-4,公布一系列测试评分——包括中文/英文的综合理解、知识储备、基础算数、数学解题、逻辑推理、指令遵从等方面。这些数据是业界公认的基准。与此同时,也有一些第三方机构会站在中立角度,构建私有的测试集来评估模型能力,覆盖语言理解与生成、专业技能与知识、安全性等维度。
正因为模型效果孰优孰劣难以直接判断,各种评测层出不穷。2023年,大模型评测领域就出现了不少复杂甚至有争议的测评风波,业界对测评标准的公正性与专业水平提出了越来越高的要求。
在这样的背景下,LMSYS Org提出了一个颇具创新性的“实战竞技”模式——Chatbot Arena。它以盲测的方式进行,用户在模型匿名的前提下对模型效果进行打分。这种做法很受业内认可,如今已经成为OpenAI、Anthropic、Google、Meta等国际大厂的模型竞技场。举个例子,在OpenAI正式发布GPT-4o之前,它曾化名“gpt2-chatbot”出现在LMSYS Chatbot Arena中,经过用户匿名实测,排名直超GPT-4 Turbo和Gemini 1.5 Pro。
在Chatbot Arena的评测体系中,用户根本不知道当前使用的是哪个模型,只需要在聊天框里输入Prompt,然后根据模型回答的满意度进行投票——投票后才会揭晓具体用的是哪个模型。这种评价体系的最大优势在于公平:评审者只能凭模型的实际表现打分,避免了“先入为主”的偏见,让真正优秀的模型脱颖而出。
不过,这种匿名测试也并非没有短板。模型的设计往往与其目标应用场景密切相关,而使用通用的Prompt,未必能充分展现模型在特定领域的能力。此外,大模型对Prompt非常敏感,有时候只是修改几个字,对输出结果的评分就可能出现超过10%的波动。
正是基于这些现实需求与痛点,扣子模型广场应运而生。它不仅像LMSYS Chatbot Arena一样支持模型随机、匿名地对决,还支持基于具体Bot进行对战PK。开发者可以很方便地使用对战功能,更直观地了解每个模型最擅长的能力。

扣子模型广场:告别模型选择困难症
扣子模型广场:告别模型选择困难症
正如前面所说,现阶段的评估报告确实可以在一定程度上反映一个模型的强弱,但对于AI原生应用开发者来说——特别是那些不太了解大模型的人——这些测试结果很难直接帮助他们做出决策。因为纸面上的数据看起来所有模型都很强,但真实应用中的表现如何?这往往很难评估。为了让开发者找到真正合适自己的大模型,扣子给出了它的答案。
首先,扣子把大量模型接入平台,开发者只需要点点鼠标就能轻松切换模型,不需要二次开发,几乎没有迁移成本。这让开发者能以最低成本尝试任何大模型,也不用担心选错后难以切换。
其次,在扣子的模型广场中,也引入了匿名模型对战功能。开发者同样只需要点点鼠标,就能运行一次实时对战,轻松看清不同模型在基础能力和特定场景中的区别,同时还能对比响应速度与稳定性,从而选出最优模型。
基于模型通用能力和细分领域表现的不同需求,模型广场提供了三种对战模式:
纯模型对战

指定Bot对战

随机Bot对战

扣子模型广场通过接入足够多的模型、降低切换成本,以及引入模型对战功能,帮助开发者解决了模型选择的难题。与此同时,模型对战也让大模型厂商看到了自家模型的能力边界,促使它们定点解决具体问题,推动整个大模型生态向前发展。

未来,人人都能开发智能体
未来,人人都能开发智能体
开发一个智能体,模型当然重要,但智能体需要的记忆、外部知识源、各种工具同样不可或缺。值得注意的是,在扣子AI应用开发平台中,不仅模型选择的问题得到了解决,平台还为用户提供了大量实用工具。无论是否有编程基础,都可以在扣子上快速搭建基于大模型的各类Bot。打开首页的Bot商店就能看到,平台上已经有非常丰富的Bot可供使用。

作为开发者,最终的目标还是实现自己的Bot,为他人提供帮助。而开发者最关心的,始终是整个应用生态。在扣子平台中,Bot拥有插件扩展、知识库存储和记忆能力。同时,扣子本身也是一个社区——平台上有插件商店和工作流商店。创建Bot时,并不需要所有能力都自己开发,你完全可以在商店中选择所需的能力,快速组装出自己的智能体。
目前,扣子与Intel联合推出了主题Bot征集活动——扣子AI工坊(Coze AI Factory),涵盖图文创作、实用工具、互动创意三大赛道,零基础、超低门槛。从行业视角来看,这有助于让更多人成为开发者——只要你有想法,就能参与到AI智能体的创建中来。在这波AI浪潮中,感受技术的真正魅力。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名