欢迎,为后人种点树
DeepSeek Harness,终于发布,并且将源代码开源了。
为啥说「终于」呢?因为我已经内测了快半个月,现在也是终于能发了。。。
这段时间里,为了测试,我几乎把我所有Vibe Coding项目,都从Codex迁移到了黑鲸(是的,logo黑化了)。
深度体验这么久,又把官方Repo从头到尾翻了个底朝天之后,我最大的感触是——
这简直是套彻头彻尾为「自进化」和「DIY」而生的马鞍啊。
内测群里,有大佬直接给改成了这样。。。
这样。
还有这样的TUI。
而DSH真正能做的,远远不止这些。
事实上,DSH的一切:模型、工具、策略、存储、上下文管理……都是可插拔的积木。
这意味着,如果你想,完全可以自己上手改造,或者针对特定场景定制运行时。
目前,官方已经内置了一百多个插件。后续社区会提供更多。
Agent时代的安卓,来了。
但在说底层技术相关的内容前,咱们还是先讲讲产品体验本身。
官方给出了两个安装方法:
快速体验:在已安装Node.js开发工具链的系统中,可以使用npx命令快速启动DeepSeek Harness的Web UI。
npx @deepseek-ai/dsh web源码安装:获取完整项目源码,并按照仓库说明完成安装。
git clone https://github.com/deepseek-ai/deepseek-harness其实可以更简单,直接把仓库链接(见文末)丢给AI,让它帮你全部搞定(doge)。
但暂时没有Electron APP,启动服务后,得通过浏览器Web UI用。
打开后,会先让你填模型API Key,没有的话直接到DeepSeek开发平台买一个。
但梁圣这次可能不止收你电费钱了,17号要大涨价,尤其是缓存。。。
不过,你也是可以接入其他模型的。
之后就能看到「黑鲸」真容了,基本和DeepSeek网页版长得一模一样,只不过现在对话列表成了本地项目管理列表。
使用上也和主流Agent有些区别。
Agent预设。
这是DSH比较新鲜的功能,目前官方有四类预设供你选择——
- 标准模式:功能完整的编码Agent,涵盖文件编辑、Shell、文件与网页检索、Skills、计划模式、目标追踪、子代理和工作流等全部能力
- PTC模式:在标准模式全部能力之上,额外提供Code Mode SDK,允许模型编写TypeScript程序来组合多步操作。
- 极简模式:仅保留bash和str_replace_editor两个工具,用于基准测试和最小化复现。
- 创造模式:在标准模式全部能力之上,额外提供运行时检查、插件实验和preset创作指导,用于自定义Agent预设。
此外,也支持自定义预设。
这也是DSH带给我最深的印象——这是一个非常极客,甚至可以说是开发者天选的马鞍。
很多设计都围绕这个第一性原理展开。
比如有个叫轨迹的功能。
众所周知,随着Agent跑得越久、工具链越复杂,Chat摘要就越来越黑盒,根本搞不清楚模型在背后干啥。
DSH做的这个轨迹,就是一个能随时监控Agent的回放窗口。
和Chat视图的是润色后的对话不同,Trajectory能直接看到原始事件级记录,你可以随时回放,查看会话内部到底发生了什么。
这样,能更直观地看到模型究竟是在哪栽了跟头,每个环节都烧了多少钱。
此外,DeepSeek还在仓库里内置了一堆Skill,专为开发而生。
- dsh-code-review:审PR用的。按本仓库的规范检查代码里看不出来的问题。
- dsh-find-simplifications:找可以简化代码的地方,并把简化想法写成Agent Note。
- dsh-doc-standards:写/审文档用的。管文档层级、区分教程和参考、砍「文档废话」。
- dsh-prose-standard:全仓库文字品控。Markdown、JSDoc、代码注释、提示词、CLI/UI文案该不该写、怎么写。
不过,我不是重度开发者用户,日常确实不太用得着这些。
但多轮交互下来,我发现DSH有一个非常好用的小设计——
即便不开计划模式,黑鲸在遇见用户指令不明确的情况时,也会主动拉起提问。
这点和Codex很不一样。在DSH的鞭策下,黑鲸会非常主动地开启头脑风暴,并且给出建议选项。
说实话,太爽了,能节省巨多脑力,少吃很多根香蕉(bushi)。
当然,你也可以哪个都不选,自己巴拉巴拉语音输出一堆上下文给它。
其他就和Codex没啥区别。
你可以用/,调用上下文压缩、设置目标、计划模式等功能,或者调用Skills。
像任务清单这种功能,也是有的。
比较遗憾的是,经典Agent三列表中右侧栏还没做出来,体验上还是有些不方便。
这点Codex就非常吃香了,内置浏览器、文件管理、预览……
甚至能直接在对话中播放视频。。。
诸如此类,反正就是很多UI和交互上的小细节,跟Codex比起来肯定还是有差距,可能也得等后续更新打磨吧。
对了,DSH是支持图片作为附件上传的。
但众所周知,V4是个瞎子啊o(╥﹏╥)o,这个功能需要额外搭配多模态模型食用。
最后聊聊Token消耗。
也是很神了,DSH专门在屏幕最下方搞了个统计表,你可以随时在这里查看Token消耗量、缓存命中率,以防一不留神给信用卡刷爆掉。
缓存命中方面,也是很猛的,大多处于99%左右,有几次直接干到100%了。
当然,也是遇到过几次掉到60-70%的情况的。
但奈何内测的时候DeepSeek是真便宜啊!
说实话,我真就没咋关注过这个仪表盘。
感谢梁叔叔。
最后就来拴上这套原生马具后,黑鲸的表现吧。
我让V4 Flash分别用Codex和DeepSeek自己的harness跑了几个demo,大家可以自行对比一下。
左边是DSH,右边是Codex。模型、推理强度完全一致。
首先是鹈鹕自行车。
比较经典的一个测试了,说实话,没太大差别,甚至右边Codex的审美更好。
但这个猪八戒3D白模就很离谱了。
同样是只简单嘱咐了一句任务,没有写复杂提示词,右边Codex马鞍一把梭的产物简直不像个生物。
从《后室》逃出来的是吧。
至于原因,我个人感觉是:DSH驾驭下,模型的长程任务能力会强非常非常多。
像猪八戒这个demo,就一句「生成猪八戒3D白模」,DS直接猛跑了20min。
反观Codex,几乎就没怎么返工,6分钟就跑完了,异常自信。
甚至最开始还以为是要生成图片,还管我要GPT-Image-2的API。。。
搁这带货来了啊??
这也是社区比较一致的反馈,听有个哥们说,他最长跑了10个小时。。。
我自己的体验也差不多,基本都是一句prompt直出,很少出现直接、不绕弯子地交付半成品的情况。
比如这个第一人称射击游戏,我真就啥prompt没给,下蹲、换弹、瞄准、NPC……所有功能都它自己做的。
也建议大家不用让AI单独生成一遍Prompt,直接语音输入把需求讲清楚就行,太过详细反而会限制模型发挥。
对了,这有个黑鲸给自己做的「思考」gif,欢迎大家拿去当表情包。
所以,买了梁叔叔的API,接DSH还是Codex?
结论很简单:自家模型肯定是优先搭配自家Harness。
不然也没必要单独做一个了。。。
实测的部分就先到这,主要聊的还是产品设计上的细节。至于模型能力,市面上已经有太多demo了,这里不再赘述。
我更想聊的,是藏在这个对话框之下的东西。
打开官方Repo,你会发现README里反复出现同一个词——Cordis。
啥意思?我看了一下,大概可以理解为乐高的底座板。
你玩乐高的时候,不会从零开始捏,你有一块带凸点的底板,然后往上插各种零件。
Cordis,就是程序员写代码时的「那块底板」。在设计Agent框架时,它将整体拆解为一个个独立插件,各司其职。
这样,可以最大程度避免重复造轮子。
开发者若有魔改需求,只需按规则 Vibe Coding 一个新插件,直接插到底板上即可;若对现有插件不满,也能随时拔下替换。
说实话,这是一种相当AI-Native的设计思路。
要知道,Skill只是Prompt Engineering的范畴,已经爆发出如此强大的影响力。
而Cordis插件,允许用户自定义整个Agent运行时。
它采用了一切皆插件的架构。
这个主流Agent的思路很不一样,虽然Codex的Harness也开源了,但骨子里还是iPhone这类闭源哲学——
Rust写单体核心,依靠「外部挂件」做App Store扩展,MCP工具、hooks、skills,统统挂在核心外面,你不能随意触碰主干。
优点当然很明显。
Rust直接控制内存和并发,比插件框架的抽象层更快;一体化封装,可控性也更高、更极致。
缺点嘛,就是封闭,社区没啥插手空间。
而DSH,我觉得,就是Agent时代的安卓。
它以Cordis为一等公民,打造了一套彻底开放的操作系统。在仓库的Doc文件夹中,甚至有手把手教你从零构建插件、接入官方Harness的完整教程。
甚至还内置了一个魔改Cordis的Skill。
这意味着,任何人、在任何时候遇到Bug或需要新功能,都可以直接动手实现,然后再开源出来。
未来,其他用户遇到相似问题时,也能直接安装社区已有的DSH插件,就像《我的世界》装模组一样。
比如前面说到困扰我很久的侧边栏功能,社区里就有老哥做了插件。
事实上,DeepSeek Harness已经预留好了Plugin Store,光是官方,现在就已经内置了100多个插件。
公众号宣发物料里,也披露了不少社区开发者所做的插件。有大鲸鱼TUI、上古QQ风皮肤、鲸鱼专属emoji……
这也是DeepSeek Harness团队呼吁的事情:
我们期待与全球开发者一起,在开源、开放、可复用、可组合的基础设施之上,共同探索智能上限。欢迎全球Harness开发者加入DSH插件生态。
我感觉DeepSeek可能在下一盘大棋。
今年自从Anthropic那篇self-improvement博客发出来之后,大家一直在聊「自进化」,但说实话,始终没有一个很清晰的路线图。
DeepSeek这套思路,是我目前看到的比较可落地的实现方式——
普通用户也能参与AI的自进化。
Cordist协议下,模型可以在不打断任务的前提下,自己写个插件、自己安上。
再配上用户生态,你想想:从成百上千万个Agent实例里,筛出魔改得比较好的插件,再融回主线……
这不得起飞了啊!
什么?你问说了这么多,这Cordis对用户体验到底有啥帮助??
好问题。
在社区里问了一圈,目前看来,对普通用户而言,暂时是没太大帮助。。。
毕竟是个吃生态的feature,也许要等后面大量高质量插件沉淀下来后,才能体现出差异。
当然,如果你是极客选手,欢迎,为后人种点树。
DSH链接:https://github.com/deepseek-ai/deepseek-harness
- 刚刚,DeepSeek V4 Pro正式版发布,多项对标Fable 52026-08-13
- 刚刚,Manus恢复独立运营2026-08-12
- Claude骂声中启动「隐形水印」:新模型全量嵌入,标记所有文字2026-08-11
- 奥特曼的ChatGPT育儿大法,捅了马蜂窝2026-08-08