详情

首页手游攻略 实测7套 Code Agent组合:最终效果,真不只取决于模型

实测7套 Code Agent组合:最终效果,真不只取决于模型

佚名 2026-08-19 10:00:59

前几天,我刚分享过一个观点:个人想真正驾驭智能体,关键不只是模型,还要给它搭好一套干活的环境,也就是Harness

理论讲了一堆,但是一直缺少个实践案例的说明。

这次正好一起测试下。

这次不看代码,只看像不像

先看一下本次需要复刻的原始设计图。

这是本次测试使用的原始设计图,所有组合面对的是同一个任务。

这是一张完整的平台门户设计图,包含顶部导航、Banner、数字化服务入口、资讯区域,也有不少图标、背景和装饰素材。

这次测试,我们不去比较谁的代码更优雅、用了什么框架、消耗了多少Token。

标准就一个:

最终做出来的页面,到底像不像原图。

大部分测试场景都采用统一的指令,如下:

<原设计图>1比1复刻图片中的网页,直接采用html+css,不需要受限于任何框架,充分发挥你的设计能力,保证设计效果一致。 图片如果可以截取就截取,如果不方便,直接采用占位图片Lorem Picsum

连续试了三次K3,效果都不太行

最近K3很热,自然优先试一下。

第一组用的是Cursor + K3,本组是唯一没有采用统一提示词的场景,只使用了:实现如图前端页面。

页面确实生成出来了,但和原设计图可以说是毫不相关。

一开始,我觉得可能是Cursor和K3的配合问题。

于是又换成TRAE + K3跑了一遍,比第一组好点,但不多。

为了确认,我又试了OpenCode + K3,感觉好像又好了点,但依然一般。

连续三套工具跑下来,我心里已经开始犯嘀咕了:

K3不会也是那种榜单成绩挺漂亮,真正落到前端任务里却差点意思的“打榜选手”吧?

但我们之前实现 mac 系统复刻还可以呀。

于是,我准备换一个前端表现一直不错的模型做参照。

换成Gemini,又验证2次

我选择了Gemini

这个选择不是随机的。根据我之前的使用感受,Gemini一直算是前端视觉效果比较好的模型,做网页和界面时,通常不会太难看。

这次正好拿它做一下对照。

我先后测试了2组:

  1. TRAE + Gemini 3 Flash

  2. TRAE + Gemini 3.1 Pro

效果只能说差不多。

这样看起来,K3好像没有什么太大问题。

那总不能这些模型都只能搞点小case

换到Kimi官网,K3突然又行了

接下来,我又尝试把同一个任务放到了Kimi官网。

这结果真让我有点吃惊了。

前面同样是K3,放在CursorTRAEOpenCode里,结果都不理想。回到Kimi自己的产品里,页面效果却明显上了一个台阶。

后来我又测试了ChatGPT,效果也挺棒。

这里我不准备给KimiChatGPT硬排第一、第二,因为我们团队都没达成一致。

但是,看到这里,前面那个“K3是不是只会打榜”的担心,基本可以先放下了。

好的两个Case,过程有些不一样

我又回头看了一遍KimiGPT的执行过程。

两个效果最好的Case,都做了两件很具体的事。

第一件是切割设计图。

它们没有一直对着一张完整长图直接写代码,而是先把页面切分成不同区域,再分别分析和实现。

第二件是自动提取素材。

设计图里的图标、背景图和装饰元素,它们没有全部用代码重画,也没有找一个差不多的素材替代,而是从原始设计图里切出来,再放回页面。

自己的模型,可能还是得配自家的Harness

这次还有一个挺有意思的小感悟:

自己的模型,可能还是得配自家的Harness。

同样是K3,在几款第三方AI编程工具里的效果都不理想,回到Kimi官网以后,能力才真正发挥出来。

模型厂商可能更清楚自家模型需要怎样组织上下文,适合调用什么工具,又应该按照什么方式推进任务。

结语

不算非常严谨的一次测试,但已经很能说明Harness的重要性了。

不过,复杂门户页面1比1复刻的这个场景好像还有得研究,后续有所得之后再和大家分享~

相关资讯
点击查看更多
游戏推荐
推荐专题
热门阅读
推荐下载