Qwen3真香,通义App满血接入,一手实测在此
在故意关闭联网模式后,Qwen3经过一步步推理,最终给出了正确答案。
更令人玩味的是,从它的思考过程中可以看到,其思维方式与人类如出一辙——通过不断推翻各种方案来寻找可行路径。

接下来,我们上第二道菜:一道超高难度的专业数学题。
这道题源自今年的普特南数学竞赛,号称是本科数学考试中的“地狱难度”,人类需要花费6小时作答,而且题目本身据称连前500名选手都没能完整解出来。
将它丢给Qwen3后,能明显感觉到它的思考时间显著拉长,最终在5分38秒内给出了正确答案。
p.s. 千问智能体无法直接上传图片,因此我们选择从App首页上传图片,提取文字后继续使用千问智能体作答。
更有趣的是,翻看它的思考过程,还能看到模型在线表演“崩溃”:

当然,尽管AI的解读速度和正确率明显胜过人类,但还是要跟同类模型比一比。
在国外网友的测试中,同一道题Grok 3(Think)用了大约8分钟才找到解决方案。
这么一对比,这一局算是Qwen3略胜一筹。

第三关:多语言能力
另一个亮点是,Qwen3支持119种语言和方言,被网友戏称为“AI届多邻国”。
不妨直接让它挑战一下国内专业译者的地位。
把莎士比亚《哈姆雷特》的经典选段丢给它,要求按照“信达雅”的标准翻译成中文。
它居然还知道参考优秀译本,并且刻意避免直接抄袭造成侵权。

最终生成的结果如下(左侧),对比我们熟知的朱生豪经典译本(右侧),你觉得AI味儿浓度如何?

第四关:赛博闺蜜、shopping比价、写歌一网打尽
除了上述更侧重基础能力的测试,当Qwen3被塞进App后,我们还解锁了更多玩法。
做旅游规划这种常规操作就不必多提了,关键是还能充当“赛博闺蜜”,帮忙挑选更适合发朋友圈的游客照。

日常购物比价也不在话下,比如分析出当下最值得入手的3000元预算内平板。
不仅用表格清晰列出了各品牌的核心参数,还按不同需求进行了推荐,简直是“伸手党”的福音。
此外,最近火上热搜的“AI写歌”,我们也用Qwen3尝试了一把。
五一版·大张伟嗨歌新鲜出炉,光看歌词确实有内味儿了:
Okk,以上为我们的全部实测。
最后做个总结,通过在通义App使用Qwen3专属智能体,能明显感受到以下几点:
Qwen3旗舰模型的生成速度非常快,体验很丝滑;
模型擅长推理,能够解决经典逻辑陷阱和复杂数学题;
代码能力方面,已经能够快速实现一些简单需求;
由于载体是App,可拓展的玩法很多。
而且,通义App自上个月页面改版后,整体设计更简洁,交互也更加完善了。
更多网友实测
与此同时,随着Qwen3模型的爆火,更多网友也第一时间进行了试玩。
有和“空间内弹小球”类似效果的页面设计:

还有用阿拉伯语、法语和印地语解释爱因斯坦相对论的玩法,该博主声称这位博主声称:

当然,大家一直尤为钟爱的小游戏开发也安排上了:

开源界的新王者
Qwen3引发热议背后,可以看到的是,在开源影响力上,以Qwen为代表的国产大模型,已经有超越Llama之势。
这一点,从reddit LocalLLaMA等开发者聚集板块的最新话题中,亦可见一斑。

不仅是基准评测数据的纸面超越,实测越多,模型实力究竟几何就越能被客观公允地认知。
而如今的开源格局之变,并非一蹴而就。前有DeepSeek,今有Qwen3,背后体现的是来自中国的开源力量一以贯之的努力,和一如既往的“中国速度”。
以Qwen为例:
2024年11月底,开源推理模型QwQ;
2025年春节档,连发Qwen2.5百万上下文版本、视觉理解模型Qwen2.5-VL,还有超大规模MoE模型Qwen-2.5 Max;
2025年3月,QwQ-32B以1/10成本比肩DeepSeek-R1;
多模态方面,还有万相Wan的持续开源和迭代……
这还只是短短5个月内的进展。
再加上更加开放和商用友好的Apache 2.0协议,开发者们的转向,自然在情理之中。


作为普通用户,一方面,可以在通义App这样的官方应用上更快感知到满血模型的能力。
另一方面,也可以期待开源,带来更多衍生应用的可能性。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名