实测7套 Code Agent组合:最终效果,真不只取决于模型
前几天,我刚分享过一个观点:个人想真正驾驭智能体,关键不只是模型,还要给它搭好一套干活的环境,也就是Harness。
理论讲了一堆,但是一直缺少个实践案例的说明。
这次正好一起测试下。
这次不看代码,只看像不像
先看一下本次需要复刻的原始设计图。

这是本次测试使用的原始设计图,所有组合面对的是同一个任务。
这是一张完整的平台门户设计图,包含顶部导航、Banner、数字化服务入口、资讯区域,也有不少图标、背景和装饰素材。
这次测试,我们不去比较谁的代码更优雅、用了什么框架、消耗了多少Token。
标准就一个:
最终做出来的页面,到底像不像原图。
大部分测试场景都采用统一的指令,如下:
<原设计图>把图片里的网页按1:1完整复刻出来,直接使用html+css实现,不必受任何框架限制,尽量把设计能力放开,确保最终效果与原图一致。图片能截取就尽量截取;如果确实不方便,直接使用占位图片Lorem Picsum。
连续试了三次K3,效果都不太行
最近K3确实很火,所以第一时间就拿它来试了试。
第一组用的是Cursor + K3,本组是唯一没有采用统一提示词的场景,只使用了:实现如图前端页面。
页面确实生成出来了,但和原设计图可以说是毫不相关。

一开始,我觉得可能是Cursor和K3的配合问题。
于是又换成TRAE + K3跑了一遍,比第一组好点,但不多。

为了确认,我又试了OpenCode + K3,感觉好像又好了点,但依然一般。

连续三套工具跑下来,我心里已经开始犯嘀咕了:
K3不会也是那种榜单成绩挺漂亮,真正落到前端任务里却差点意思的“打榜选手”吧?
但我们之前实现 mac 系统复刻还可以呀。
于是,我准备换一个前端表现一直不错的模型做参照。
换成Gemini,又验证2次
我选择了Gemini。
这个选择不是随机的。根据我之前的使用感受,Gemini一直算是前端视觉效果比较好的模型,做网页和界面时,通常不会太难看。
这次正好拿它做一下对照。
我先后测试了2组:
TRAE + Gemini 3 FlashTRAE + Gemini 3.1 Pro
效果只能说差不多。


这样看起来,K3好像没有什么太大问题。
那总不能这些模型都只能搞点小case?
换到Kimi官网,K3突然又行了
接下来,我又尝试把同一个任务放到了Kimi官网。
这结果真让我有点吃惊了。

前面同样是K3,放在Cursor、TRAE和OpenCode里,结果都不理想。回到Kimi自己的产品里,页面效果却明显上了一个台阶。
后来我又测试了ChatGPT,效果也挺棒。

这里我不准备给Kimi和ChatGPT硬排第一、第二,因为我们团队都没达成一致。
但是,看到这里,前面那个“K3是不是只会打榜”的担心,基本可以先放下了。
好的两个Case,过程有些不一样
我又回头看了一遍Kimi和GPT的执行过程。
两个效果最好的Case,都做了两件很具体的事。
第一件是切割设计图。
它们没有一直对着一张完整长图直接写代码,而是先把页面切分成不同区域,再分别分析和实现。

第二件是自动提取素材。
设计图里的图标、背景图和装饰元素,它们没有全部用代码重画,也没有找一个差不多的素材替代,而是从原始设计图里切出来,再放回页面。

自己的模型,可能还是得配自家的Harness
这次还有一个挺有意思的小感悟:
自己的模型,可能还是得配自家的Harness。
同样是K3,在几款第三方AI编程工具里的效果都不理想,回到Kimi官网以后,能力才真正发挥出来。
模型厂商可能更清楚自家模型需要怎样组织上下文,适合调用什么工具,又应该按照什么方式推进任务。
结语
不算非常严谨的一次测试,但已经很能说明Harness的重要性了。
不过,复杂门户页面1比1复刻的这个场景好像还有得研究,后续有所得之后再和大家分享~
-
- 元宵节猜灯谜的祝福短信
- 角色扮演 |
-
- 关于柯南的沙雕网名有哪些
- 角色扮演 | 1
- 网名
-
- 最新中性名字男女通用网名有哪些
- 角色扮演 | 1
- 网名
-
- 关于蓝色说唱的网名有哪些
- 角色扮演 | 1
- 网名
-
- 我好喜欢你是什么梗?
- 角色扮演 |