新模型的斩杀线!Qwen3.8-27B开源,本地AI这次真不一样
27B正在成为本地AI的新选择。
一个能塞进24GB家用显卡的开源模型,凭什么被开发者称为新模型的斩杀线?

答案就藏在Artificial Analysis最新的Intelligence Index榜单里,它的得分是52分,与GPT-5.6 Luna、DeepSeek-V4-Flash并列。这意味着什么呢?往后要是再推出小模型,得分达不到这条线,可就很难吸引大家的关注了。

它就是刚刚开源的Qwen3.8-27B。
而比这个分数更让个人开发者上心的一点是:这一次,它是真的能被下载回家、跑在自己电脑上的。
Qwen3.8-27B在正式开放权重之前,海外开源社区已经等了好一阵。
量化版本什么时候出来,24GB显存能跑到什么程度,接进Coding Agent以后表现怎么样,这些讨论甚至比模型先热了起来。
Unsloth这类专门服务本地模型的团队也早早开始预热,比起参数和榜单,更多人在意的是自己的显卡、Mac内场和现有工具到底能带得动什么版本。



27B之所以让这么多个人开发者上心,原因并不复杂,它关系到普通人拿到权重以后,到底能自己做点什么。
很多能力很强的开源模型,即便放出权重,运行也依然离不开庞大的服务器集群,多数人的参与方式还是围观模型卡、调用别人提供的 API,或者等推理平台接入。
而27B已经进入另一种范围,尤其是量化版本可以塞进高端消费级显卡和大内存个人电脑,开发者可以直接下载、调整、接工具,再按照自己的需求折腾。
这也是Qwen3.8-27B发布后,「Local Opus」这个称呼很快在社区里出现的原因。
在Qwen官方公布的成绩里,它在部分编程、办公和电脑操作评测里超过了Opus 4.6 Max,虽然也有一些高难推理项目依然存在差距。
但以往我们需要调用前沿闭源模型才能完成的一些工作,如今开始有机会交给自己掌握权重、自己决定运行环境的中尺寸模型。
值得一提的是,27B并不属于手机、汽车或者普通智能硬件可以直接运行的小模型,按照当前常见的模型尺寸划分,它更接近中尺寸模型,它的特别之处在于,经过量化之后,个人设备有机会承载它。

目前社区已经出现大量Qwen3.8-27B量化版本。
以常见的4-bit版本为例,文件体积大约可以压到十几GB至二十GB附近。
Unsloth发布的GGUF版本也把不同量化精度直接列了出来,像24GB显存的高端消费级显卡或者较大统一内存的Apple Silicon设备,已经进入比较现实的尝试范围。

但要提醒一句,模型运行还需得给系统、上下文和KV Cache留空间,文件装得下并不等于任何24GB设备都可以随意拉满长上下文,只不过,它与2.4T旗舰模型面对的硬件条件已经完全不同。
架构上,27B是Dense带视觉编码器,原生支持图片和视频理解;上下文长度为262144 Tokens,还可以通过YaRN扩展至100万Tokens。

它默认会思考,同时加入reasoning_effort来控制推理深度,对于复杂任务可以给模型更多推理预算,普通问答可以降低档位,也可以直接关掉。
模型开放以后,第一波冒出来的还是开发者最喜欢拿来试模型的小游戏。

两张二手3090带着Qwen3.8-27B跑完整个Agent循环,中途没有中断,从头到尾写出了一个可玩的第一人称射击游戏。
three.js也成了这轮测试里的高频素材,画面的完整度、细节和模型主动补出来的效果也开始进入比较范围。
比如对比Grok 4.6在水波纹的表现:

或者是对比Claude opus 4.6在渲染沉没的亚特兰蒂斯上:

以及拿HTML Canvas完成的动画:

每个人都在测试自己最在意的那部分能力。并且好的体验并不只由权重决定,量化精度、上下文长度以及承载它的Harness架构都会参与其中。
在Agents' Last Exam评测中,Qwen3.8-27B搭配Claude Code的任务满分通过率达到20.4%。

对开源模型用户而言,尺寸决定了一个模型可以进入多少人的电脑,也决定开发者愿不愿意围绕它制作量化版本、适配推理框架和开发新的应用。
一个能力很高但使用门槛极高的模型,能够参与二次开发的人自然更少。27B则处在一个相对舒服的位置,能力已经足够处理复杂任务,硬件门槛又没有高到只剩少数服务器用户。
Transformers、vLLM和SGLang这些主流框架也已经可以直接使用,llama.cpp、Ollama、LM Studio等本地工具则可以通过量化版本接入。

小编一开始打算在Unsloth里运行Qwen3.8-27B,受限于手里的设备配置,Q3量化版本无法正常加载,Q2虽然勉强跑了起来,可用上下文很有限,生成速度也只有每秒几个Token,只适合完成比较轻的任务。
鉴于更低精度的量化可能会致使明显的能力受损,最终选定了32GB vGPU、62GB内存以及50GB数据盘的云服务器配置,并转而采用Unsloth提供的Qwen3.8-27B-UD-Q4_K_XL.gguf,同时加载mmproj-F16.gguf以开启视觉能力。

模型通过llama.cpp运行,并开放OpenAI Chat Completions兼容接口,可以接入在DSH Desktop以及其他支持OpenAI API的工具。
实际运行下来,短请求的生成速度大约稳定在33 Token/s附近,图片输入也能够正常处理。
又试了一下丢进去一条YouTube视频链接,读取写好的Skill,看看它能把视频内容学到什么程度。

再让它生成几张PPT,这次小编把原生上下文和单词输出上限的tokens都调高了,方便模型生成大量的html代码。

3张slide基本在2分钟左右就完成了,效果也很不错,后续实测下来基本能完成日常大多任务。
并且在近日,Hugging Face刚刚发布了一份2026年夏季开源模型观察报告,其中单独用了一个部分讨论Qwen。结论和社区反馈一致,Qwen 已经是开源社区最重要的基座模型之一。
就连CNBC、The Information都专门做了报道,The Information还提到,它开源短短几天下载就突破了100万次,社区贡献的量化版本超过500个,相关模型总下载量已超500万次。这个增速确实惊人。

模型足够强只是第一步,能被更多设备承载,才会出现更密集的使用和改造。
Coding Agent,个人知识库,离线文档处理都可以采用它更换模型,强调隐私的内部工具也多了新的选择。
开发者拥有权重以后,还可以按照自己的数据继续微调,或者根据硬件调整精度和推理方式。这也是开源模型和API调用模型很不一样的一点。
这种影响也开始越过纯粹的模型爱好者社区。

Airbnb CEO此前公开提到,公司在AI客服里大量使用Qwen,并将原因归结为效果、速度和成本。
对于一家需要长期处理真实用户请求的公司而言,模型选择最后会落到很具体的问题,响应要够快,成本要可控,也要方便接进现有系统。
Qwen的开源策略,恰好不断扩大这种可选择范围,27B现在受到的关注,某种程度说明开源模型的竞争正在改变。
对于开源模型来说,被多少人拿去继续折腾,有时候比多拿下一项榜单第一更值得关注。
模型发布后的几天里,这些答案已经开始陆续出现。
-
下载
-
- 关于柯南的沙雕网名有哪些
- 角色扮演 | 1
- 网名
-
- 最新中性名字男女通用网名有哪些
- 角色扮演 | 1
- 网名
-
- 关于蓝色说唱的网名有哪些
- 角色扮演 | 1
- 网名
-
- 我好喜欢你是什么梗?
- 角色扮演 |