我彻底替换了ChatGPT,AI果然没有护城河
在这一年的实践里,大模型领域的演进速度确实让人应接不暇。从最初训练自研模型,到用One-API接入LLama3、幻方、百川、ChatGLM等开源方案,再到阿里开源Qwen2后横扫大模型竞技场,Qwen2 72B如今已经是我们开发应用中的首选。
需要先明确一个前提:这里说的“本地”,可不是指在一台个人电脑上跑个7B、13B的小模型。而是指在企业自己的算力服务器上,私有化部署700亿参数以上的大模型。只有到了这个规模,模型才具备良好的指令依从性,再结合RAG、Agent等技术,才能有效完成你分配的任务。
大模型的价值到底在哪?简单说,它是我们能用钱“雇佣”到的最便宜的智力——可以完成大部分本科实习生级别的工作。所以它天然是优秀的AI助手:处理日常重复工作,做简单的逻辑判断和总结,生成结论。如果你读过《原则》,就会明白,关键在于搭建一个稳定的系统,让它不知疲倦地、完全按照你的想法运转,成为7×24小时待命的贴心秘书。说白了,我们想要的就是《钢铁侠》里的贾维斯。
举个例子,假如我需要一个私有的AI理财师,它得具备哪些能力?持续盯盘,跟踪全球期货和股票的价格变动;实时捕捉利好利空的消息;阅读各企业的公告和研报,判断经营是否正常;甚至还要能识别财务造假的风险。市场上已有案例,有人用AI分析K线做技术面策略,赚了些钱,但那还只是上传K线图让模型给点预测,相对初级。真实的场景要复杂得多:你同时持有几只股票,每只涉及的题材不同,行业整体发展情况也不同。除非给大模型一个完整的策略,让它自己去网上搜索相关信息,再结合资金流向,才能做出相对准确的判断。
坦白讲,3B、7B参数的小模型很难完成这类有价值的任务。在实际应用中,7B模型更适合做精调,用来完成过去需要NLP才能实现的工作,比如意图识别、实体抽取——毕竟成本低。但当我试图用它做AI理财师时,问题就暴露了:哪怕只要求对一条新闻报道输出“正面、负面、中性”,7B模型的指令依从性也不够,常常编造出新的判断结果,让人很无奈。
可一旦切换到70B乃至100B以上的大模型,之前在小参数模型上怎么精调都无法提升性能的Prompt,突然就变得好用了。所以,一个比较务实的路径是:如果你想做有价值的应用开发,不妨先在阿里百炼平台上用官方API做验证性开发。这样就不用急着折腾CUDA环境、配置正确的Transformer版本、下载几百G的模型文件、维护推理环境这些事。等云端验证通过,再考虑本地部署以保证数据安全。
以Qwen2为例,我在百炼上用它的API成功实现了AI诊股——模型会帮我去查企业的公告、研报、题材、热点、同行业情况、主要产品,然后生成个股诊断报告。从报告质量看,显著优于其他开源模型。还用它完成了合同中上百个关键信息的提取,这类工作以前是法大大这样的专业公司才能做的,而调用API抽取一份合同的成本不过6块钱,准确率基本达到90%。
整个过程非常轻量:打开阿里云百炼官网,登录开通即可。注册首月还会赠送1千万免费tokens。就算长期用,价格也完全可接受——1000 tokens只要0.5分钱,网速稳定,能力基本达到GPT-4的中文水准。开通模型服务后,进入模型广场选择开源模型,点开API调用示例就能查看自己的API-KEY。百炼平台还提供了代码参考,轻松开始实现各种创意。
等云端验证完想法,再在本地服务器上部署Qwen2。72B版本的显存需求是143G,一台8卡4090的服务器(成本约24万)拥有192G显存,足以支撑推理和精调。如果手上只有一块4090的台式机,或者有个人机密数据不希望流出到互联网,也可以尝试Qwen2 7B,最低显存要求16.7G,精调要求20G,综合表现同样出色。


我自己家里的电脑是8G显存的3070,有点后悔当初没买显存更大的3060Ti,所以通过Ollama部署了Qwen2-1.5B模型,做基础的总结和摘要完全没问题,速度飞快。本地部署的方案也很简单:用Ollama加通义千问,三步搞定,安装后执行一个bat文件即可。




本地部署大模型能做什么?举个刚需场景:每天有数不尽的微信聊天记录,我希望模型能帮我总结今天聊了哪些话题、有哪些待办事项、收到了哪些问题。这个任务只能跑在个人电脑上,不能外泄。于是我用Ollama下载并运行千问大模型,暴露出API,再通过FastGPT加RPA构造一个工作流:先读取电脑端的微信聊天记录数据库,构造查询语句,把今天和每个人的对话逐个交给模型总结,判断是否有待办任务,最后生成一份总结清单。
这才是只听命于一个人、能保守秘密的AI助理。这,才是AIGC真正该有的样子。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名