DeepSeek Harness 发布 45 小时,我们听到了 8 种不同的声音

把全世界变成一个分布式 Harness 团队

把世界变成一个分布式Harness团队

👦🏻 作者: DeKox

🥷 编辑: Koji

🧑‍🎨 排版: NCon

此刻,DeepSeek Harness 的 GitHub 仓库显示 10.50 万个 Star、10033 次 Fork。

距离发布仅 45 小时。

当然,热度不意味着胜利。值得关注的是开发者具体在拿它做什么。

人们开始拿 DSH 做完全相反的事——有人跑实测,有人报 Bug,有人造插件,也有人质疑"为什么还要再做一个 Harness"。

发布 45 小时后,围绕 DSH 的讨论,正在逼近 Agent 时代最关键的问题:

模型之外,谁来定义 Agent 的工作方式?

第一种声音:官方 Harness 真的能把 DeepSeek 的能力榨出来

程序员鱼皮用 DSH 跑了 4 个任务。

第一个有对照的任务,是做一个"注意力残差"交互网站。鱼皮此前用 DeepSeek V4 Pro + Codex 跑过同一条提示词。这次 DSH 用约 20 分钟完成,缓存命中率 99%;鱼皮认为连线、动画、总结和测验都明显好于旧版本。

第二个任务是做一个支持鼠标和摄像头手势控制的 3D"竹知了"网页游戏。DSH 跑了近 40 分钟,缓存命中率接近 100%,最终功能可以工作。

4 个任务总费用不到 5 元。这不是标准化 Benchmark,但同一个人、同一条提示词、同一个模型的前后对照,至少说明了一件事:模型能力不会自动变成任务能力。工具契约、上下文组织、自检和重试都会改变结果。

所以,Agent 的有效能力不是 Model,而是 Model + Harness。

程序员鱼皮首发实测:https://www.163.com/dy/article/L4A6PBVO0556DREL.html

第二种声音:结果不错,但慢得离谱

同一组实测也给出了反面证据。

20 分钟完成一个网站,40 分钟完成一个 3D 游戏。鱼皮明确写道,主要时间花在自检上。

小红书的负面反馈更直接。在一篇 443 赞、329 条评论的"怒喷 DSH"转帖下,获赞最高的评论是"一个 Bug 能给你修一个小时";另一位用户称,两次各思考一小时,答案仍然错误。

缓存命中率解决的是重复输入价格,不解决执行时间。Agent 读取文件、调用工具、验证结果、失败重试,每一步都在拉长链路。

所以,"更主动"不等于"更高效"。真正有效的指标是:完成同一项任务,成功率、耗时和总成本分别是多少。

小红书争议帖:https://www.xiaohongshu.com/explore/6a7e0cc6000000002402d6ae

第三种声音:0.1 就是 0.1,强骨架还没有长出好皮肤

DeepSeek 在 README 里把警告写成了大写:当前版本是开发者预览,后续会出现破坏兼容性的改动。

截至 8 月 15 日 8:55,GitHub Discussions 页面已经出现一批具体问题:MSYS2 下启动静默失败并返回 127;插件热更新命中旧模块缓存;多步任务已经结束,主分支仍显示"执行中";Windows 极简预设存在未审批写入工作区外目录的安全问题。

最新讨论编号已经到 #1624。问题密度说明用户真的在用,也说明 DSH 还不是稳定的生产工具。

因此,DSH 0.1 的产品价值不在"已经完善",而在问题能否快速进入下一个版本。

GitHub Discussions:https://github.com/deepseek-ai/deepseek-harness/discussions

第四种声音:"一切皆插件"既是天花板,也是未来的治理债

DSH 最重要的设计不是 Web UI,而是插件边界一直下沉到 Agent Loop。

模型、工具、技能、会话、沙箱、存储、调度和 UI 都能替换。工具调用还被拆成一条流水线:Hook、审批、权限检查、沙箱、超时、结果改写、日志和 UI 渲染。PTC 生成的程序化工具调用也必须经过同一套审批与沙箱。

开放带来的结果已经出现。Tony Bai 发现,官方目前只提供基础上下文压缩接口和朴素实现;开源当天,社区已经开始做自适应压缩、跨会话记忆和轻量记忆插件。

但插件边界越深,接口稳定、依赖管理、版本兼容、性能开销和调试复杂度越难控制。InfoQ 的判断很直接:v0.1 进入生态的开发者,要承担较高的迁移成本。

所以,"一切皆插件"不是免费午餐。DeepSeek 把创新空间打开了,也把长期治理问题提前了。

InfoQ 架构分析:https://www.infoq.cn/article/de9AljWc4ejW2KAyW8dD

Tony Bai 技术拆解:https://tonybai.com/2026/08/14/deepseek-harness-everything-is-a-plugin/

第五种声音:我们真的还需要另一个 Harness 吗?

质疑者的问题成立:Claude Code、Codex、OpenCode、Pi、Hermes 已经存在,DeepSeek 为什么还要再做一个?

Hacker News 上,一位开发者只写了一个很薄的桥接层,就让 DeepSeek 通过 Codex 工作。一次统计中,缓存命中输入为 39,123,200 Token,未命中输入为 1,692,286 Token。该开发者的结论是:成熟 Harness 已经能很好地利用缓存,未必需要一个 DeepSeek 原生 Harness。

小红书上的争论更接近普通用户。一篇"DeepSeek Harness 来了,WorkBuddy 要凉?"拿到 598 赞、402 收藏、363 条评论。高赞评论却认为,两者不在同一层:WorkBuddy 拼产品体验,DSH 争模型和应用之间的运行时。

所以,如果 DSH 只是一款 AI 编程产品,市场不缺一个新选项;如果 DSH 是一套可被别的产品采用的 Agent Runtime,问题就变成"谁来定义公共接口"。

Hacker News 讨论:https://news.ycombinator.com/item?id=48257509

小红书 WorkBuddy 讨论:https://www.xiaohongshu.com/explore/6a7dddd30000000032021eb6

第六种声音:模型可以换,Harness 才是长期控制点

最反直觉的地方是:DeepSeek 开源的 Harness,并不强制使用 DeepSeek 模型。

官方架构把模型适配器也做成插件。开发者可以接入第三方服务商和本地模型。Reddit 已经出现了自定义 OpenAI-compatible provider 的讨论,也有人把 Hermes 接到 DSH 上,把 DSH 当作委托式编程引擎。

小红书一条获赞较高的评论把战略说得很清楚:模型会换,工具、Session、Memory、Sandbox、子 Agent 调度、权限和 Trajectory 会长期存在;谁掌握 Harness,谁就站在模型和应用之间。

因此,DSH 的目标不是把用户锁在某个模型里,而是争夺模型进入真实工作流的入口。

自定义模型服务商讨论:https://www.reddit.com/r/AI_Agents/comments/1vo2f5a/deepseek_harness_got_one_awkward_constraint_right/

Hermes 接入 DSH:https://www.reddit.com/r/hermesagent/comments/1voo8pj/hermes_deepseek_harness/

第七种声音:Agent 竞赛最终要按"完整任务"算账

DeepSeek 当前官方价格显示,V4 Flash 每百万输出 Token 为 0.28 美元,V4 Pro 为 0.87 美元。

北京时间 8 月 17 日 0 点起,DeepSeek 改为峰谷计价。V4 Flash 每百万输出 Token 将变为谷时 0.66 美元、峰时 1.32 美元;V4 Pro 将变为谷时 1.98 美元、峰时 3.96 美元。

价格上涨不会推翻 DSH 的缓存优势,但会放大低效循环的成本。99% 命中率很漂亮;如果 Agent 为一个错误多跑一小时,漂亮的命中率仍然会变成一张长账单。

所以,下一阶段的价格战不会比较"每百万 Token 多少钱",而会比较:完成同一个真实任务,哪一组 Model + Harness 的成功率最高、耗时最短、总成本最低。

DeepSeek 官方价格页:https://api-docs.deepseek.com/quick_start/pricing/

第八种声音:不要把它理解成产品,这其实是一个战略

Koji 对 DeepSeek Harness 的判断是:

DeepSeek Harness 很妙呀! 在模型能力没有收敛的时期,把大家都动员起来、都 involve 进来,广纳天下之 Harness 贤才,一起迭代和探索未至之境。 不要理解这是一个产品,这其实是一个战略。

官方贡献指南给出了同样的信号。

DSH 指南还写道:官方仓库里的包不比社区包天然重要;官方仓库是一种想法、一份展示和灵感来源,不是社区必须服从的标准答案。

这套安排不是为了把开发任务外包给社区,而是为了扩大探索带宽。

模型能力没有收敛,Agent 架构就没有标准答案。记忆该怎么压缩,什么时候调用子 Agent,工具该逐次调用还是先编程再执行,单个团队只能测试有限组合。

插件生态可以让全球开发者同时试不同答案。

所以,每个插件都是一种假设,每次任务执行都是一次实验,每个 Bug 都在暴露一条能力边界。DeepSeek 把内部的 Agent 研发,扩展成了一场公开的并行实验。

DeepSeek Harness 贡献指南:https://github.com/deepseek-ai/deepseek-harness/blob/master/CONTRIBUTING.md

写在最后

发布 40 小时,8 种声音没有形成共识,但已经形成一条清楚的分界线。

把 DSH 当产品看,结论是:慢、粗糙、Bug 多,离成熟工具还有距离。

把 DSH 当基础设施看,结论是:9.89 万 Star、9255 次 Fork、最新讨论编号 #1624、开源当天出现记忆和压缩插件,说明公开实验已经启动。

热度只能证明关注,不能证明战略成功。接下来应该盯三组硬指标:同一真实任务的成功率、耗时和总成本;第三方插件跨过破坏性升级后的存活率;社区问题进入新版本的速度。

核心观点因此很明确:

DeepSeek 开源的不是另一个 Coding Agent,而是一套让全球开发者共同寻找 Agent 最优解的分布式研发机制。

8 月 13 日,DeepSeek 把"下一代 Agent 应该怎样工作"这个问题,交给了全球开发者。

🎪

十字路口将在8.20(周四)晚上举办 Agent Harness 线上闭门分享会,从 DeepSeek Harness 带来发观察与思考聊起。

欢迎对 Agent Harness 领域感兴趣的研究员、工程师、创业者参与。

扫码报名。