后摩智能漫界M50芯片完成阿里千问QQwen3.8-27B大模型适配
8月14日晚,阿里巴巴通义实验室正式开源Qwen3.8-27B。作为千问团队的紧密合作伙伴,后摩智能同步完成Qwen3.8-27B 在后摩漫界M50芯片上的深度适配,并将27B级别模型的端侧部署时效性首次推到Day 0。
开发者通过后摩大道工具链,即可在M50上完成从量化编译到推理部署的全流程,将Qwen3.8-27B + 单M50或双M50运行于端侧设备。

(DM50上部署Qwen3.8-27B+mtp的实测性能)
Qwen3.8-27B是原生多模态稠密(Dense)模型,支持262K 原生上下文,通过YaRN技术可外推至 1M Tokens上下文。较Qwen3.6-27B,新模型在编程和办公场景的性能大幅提升,表现甚至超越了Qwen3.7-Plus;同时,模型还新增了 reasoning_effort 功能,根据任务难度控制思考深度,更省资源。Qwen3.8-27B也拥有Qwen3.8系列模型的共性,可以端到端完成复杂任务,直接交付经得起检验的可靠成果。

(千问官方发布Qwen3.8-27B Text Performance)
Qwen最强27B模型,10W端侧落地
端侧AI这些年始终绕不开一个核心矛盾:一边是大模型参数量还在不断膨胀,另一边却是终端设备的物理边界基本没怎么变。以Qwen3.8-27B为例,它的4-bit量化版本体积大约在17GB;再看硬件侧,M50单芯片功耗只有10~15W,双芯片加起来也不到30W。换句话说,一台甚至可以由移动电源供电的端侧设备,已经能够在本地跑通千问当前最强的开源27B模型。
更重要的在于响应速度。模型权重发布当天即完成适配,开发者不需要等芯片厂商的适配周期。
Day 0 背后的技术底座:架构性兼容
Day 0为什么可行?这是由于后摩大道工具链的适配策略是以模型架构为单位,而非以单个模型为单位。同一架构的模型共享相同的ONNX导出图,量化编译流程可直接复用。
Qwen3.8-27B与后摩智能已支持的Qwen3.6系列共享底层架构,这是此次 Day 0适配的技术基础。工具链内部已完成对该架构的算子映射和推理引擎对接,模型权重发布后无需重新做底层适配,直接进入量化编译阶段。
在生态层面,后摩大道工具链已内置Qwen系列的完整算子优化,支持PyTorch、vLLM等主流框架;编译产物可通过llama.cpp、vLLM、SGLang等推理引擎部署为标准化API服务,与OpenClaw等Agent框架无缝对接。搭载M50芯片的量产终端设备同步支持Qwen3.8-27B本地推理。
工具链全流程:从权重到部署
后摩大道工具链覆盖了从模型量化到编译再到推理服务的全链路。以下是Qwen3.8-27B在M50上的完整部署流程。
1. 资源下载
从后摩开发者社区下载工具链资源包,从Hugging Face或ModelScope获取 Qwen3.8-27B模型权重。
2. 量化导出
后摩采用GPTQ后训练量化方案,核心流程为逐层替代:每次只加载一层到 GPU,用校准数据跑前向收集激活值分布,再基于Hessian矩阵将FP16权重压缩为4-bit,最小化量化误差。
python ptq.py --config config.yaml --model
/Qwen3.8-27B/
HMONNX导出阶段将量化后的权重加载到ONNX计算图中。导出后自动跑余弦相似度校验,对比PyTorch原始输出与HMONNX输出,确保精度无偏差。
3. 编译
编译阶段将HMONNX图转化为M50可执行的HMM文件:
执行时可直接使用这条命令:python build.py --model_dir output/xh2/hmquant --model_name qwen3.8-27b --ncore 2 --context_length 32768 --prefill_length 256 --stage build --j 16 --ndevice 1
参数说明:
--ncore 2:芯片运行时使用的计算核心数
--context_length 32768:最大上下文窗口,编译时设32K以优化编译速度,M50实际可支持更大窗口
--prefill_length 256:prefill阶段每次分块处理的token数
--ndevice 1:单芯片编译,也可指定2做双芯片部署
--stage build:仅编译,确认通过后可追加--stage test跑余弦相似度验证
4. 推理测试
编译完成后在M50设备上进行推理测试:
python demo.py --tokenizer_dir 5. 通过llama.cpp部署推理服务 工具链支持将编译产物转换为GGUF格式,通过llama-server部署为生产推理服务: python ./scripts/convert_hm_to_gguf.py / --use-temp-file./bin/llama-server -m ./scripts/qwen3.8-27b.gguf 部署完成后可通过OpenAI兼容API接入Agent框架,实现从模型推理到业务落地的完整闭环。