🕹️ Harness 选对了,能让你事半功倍 —— DeepSeek V4 Flash 在 CodeBuddy 和 ZCode 上的实测对比
写在前面
一个好的 harness,绝对能让你事半功倍。但前提是——你得选对。
最近这大半年,我在 AI 编程工具上没少踩坑。CodeBuddy、Trae、OpenCode 这些主流的 harness 我都用过一圈,今天把这段时间的感受,以及最新一次的对比实测,跟大家聊聊。
先说一下个人主观体验,纯主观:
- CodeBuddy 和 Trae 都是基于 VSCode 魔改的,有自己的技能、MCP 等可视化展示和管理,也支持原生 VSCode 插件。但 Trae 在 SSH 远程连接上有个硬伤——如果目标服务器是 CentOS,经常报错,排查下来基本是”服务端系统版本太低不支持”。CodeBuddy 这块就稳得多,连 CentOS 基本不用折腾。
- 积分消耗:Trae 因为接的是 GLM-5.2,积分消耗相对低;CodeBuddy 用 DeepSeek 的成本会高一些,看你卡在哪。
- OpenCode / Codex:Codex 用 DeepSeek API 会很慢,至少我体感是这样——一个很简单的问题也要思考半天。
所以你看,模型一样,harness 不一样,体验差距可以非常大。
为什么这次对比
最近我一直在琢磨一件事:同样跑 DeepSeek V4 Flash,不同的 harness 到底能差多少?
之前总看各种博主测试,这回我也亲自下场,而且专门挑一个”出效果”的活儿——让 AI 给我搓一个完整的超级马里奥小游戏,看哪个 harness 出活儿更漂亮。
我之前用过/试过的 harness 包括:Codex、Pi(极简风)、OpenCode、Claude Code 等等。最近又关注到一个新工具——ZCode。
顺便认识一下 ZCode
ZCode 是智谱 AI(Z.ai)在 2026 年 7 月 2 日刚发布的官方编程 harness,定位挺有意思:
- 第一层:它本身就是 GLM-5.2 模型的官方桌面编程 agent,配了
/goal长程任务、SSH 远程开发、移动端控制、20 多个集成工具(含 Git)。 - 第二层:它把自己做成给现有 CLI agent 用的可视化外壳——Claude Code、Codex、Gemini 这些原本要敲终端、配环境变量、改
settings.json才能用起来的工具,被它包进了图形界面,还带了对话式版本管理(AI 改的每一步都能回溯)和 MCP 协议支持。
简单说,它既是一个 harness,又是一个跨模型的 agent 桌面。新用户还送 5 百万 token 免费额度,挺有诚意的。
我下载下来看了下主界面和功能,跟 CodeX 风格类似,但更贴合编程的基本要素:
- 查看文档
- Git 管理
- 浏览器预览
还内置了一部分常用工具,以及它内部的系统提示词。
所以这次,我就拿我用得最多的 CodeBuddy 和 ZCode 来一次硬碰硬的实测。同样的提示词,看看哪个效果更好。
测试提示词
我给的提示词很简单:
参考这张图,使用 Agnes ImageGen 生成超级马里奥小游戏所需的图片要素,生成一个超级马里奥的小游戏。
参考图(也就是马里奥的角色形象):

CodeBuddy 的效果
首页长这样:

进入游戏后的界面:

耗时:44 分钟。
可以看到 CodeBuddy 的版本整体是出来了,但视觉风格相对朴素,缺少完整的游戏 HUD(计分、生命、时间那种顶栏),画面元素也偏扁平,背景和角色的整体协调感差一些。
ZCode 的效果
首页:

游戏界面:

耗时:50 分钟。
ZCode 这边出来的效果,肉眼可见地更精致:
- 完整的游戏 HUD:SCORE、COINS、WORLD 1-1、LIVES、TIME 300,全齐。
- 经典横版游戏味儿到位:背景是城堡 + 蓝天 + 绿地草地,金币、土豆怪(Goomba)、问号方块,都是马里奥老玩家熟悉的味儿。
- 视觉一致性明显更强:从首页到游戏界面是同一套美术风格,不会让人觉得”这是两个东西拼起来的”。
结果对比
同样跑的 DeepSeek V4 Flash,harness 不一样,差距是真明显:
| 维度 | CodeBuddy(44 分钟) | ZCode(50 分钟) |
|---|---|---|
| 整体还原度 | 中规中矩,能玩 | 经典横版味儿到位 |
| 视觉一致性 | 元素相对零散 | 首页/游戏界面同一套美术 |
| HUD 完整度 | 缺少完整游戏状态栏 | SCORE / COINS / LIVES / TIME 全有 |
| 美术细节 | 偏扁平,背景简单 | 城堡、敌人、问号方块都到位 |
| 可玩性 | 基本可玩 | 敌人、金币、关卡概念齐了 |
虽然 ZCode 慢了 6 分钟,但这 6 分钟换来的是画面、可玩性、音乐(默认带的 BGM 风格)、还原度全维度的提升。
在 ZCode 里用 DeepSeek 的体验,给我的感觉就一个字:爽。模型本身的优势能被 harness 放大出来,而不是被它框死。
接下来我会持续用 ZCode 做更复杂的活儿,看看它在大型项目、长程任务上的表现。
写在最后:DeepSeek V4 Pro 正式版也来了
对了,就在写这篇文章的同一天(8 月 13 日凌晨),DeepSeek V4 Pro 正式版 上线了,模型版本号 DeepSeek-V4-Pro-0813,API 已经更新。
几个关键变化:
- 1M 上下文 / 384K 最大输出:处理长代码库、长文档、连续执行多步骤的 Agent 任务,一次能塞下的内容规模直接拉满。
- Agent 能力暴涨:DeepSWE 编码基准从预览版的 12.8 跃升到 62.7,已经超过 Claude Opus 4.8;在 Cybergym、AutomationBench 这两项上甚至超过了 Fable 5。
- 价格是 Flash 的 3 倍:缓存命中输入 0.025 元/百万 token、未命中 3 元、输出 6 元(Flash 是 0.02 / 1 / 2 元)。官方也提前放了风说后续会整体涨价,目前暂时还没动。
DeepSeek 之前出的预告是”计划近期整体上调 API 服务定价,预计涨幅较大”。所以如果你最近在规划用量,可以趁现在价格还没涨先囤一波。
Flash 适合高频大规模调用,Pro 适合规格要求更高的活儿。等我试完 Pro,回头再来给大家交个作业。
——
以上就是我这次 harness 对比实测的全部内容了。我是糖糖IT,下一篇我们继续。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时