易君召
发布于 2026-08-13 / 作者:易君召 / 4 阅读
0

🧩 DeepSeek Harness 开源:一切皆插件的 Agent 框架,正在重构"模型→智能体"的最后一公里

#AI

2026-08-13 · DeepSeek Harness v0.1 开发者预览版(MIT)· 发布当天 GitHub Star 突破 1.4 万 · 与 DeepSeek-V4-Pro-0813 同日开源

🔥 一、背景:DeepSeek 深夜放出"模型之外的另一半"

8 月 13 日,DeepSeek 双线开火。一边是 DeepSeek-V4-Pro-0813 正式开源:MoE 总参数 1.6 万亿、单 token 激活 490 亿100 万 token 上下文、最大 38.4 万 token 输出,权重采用 MIT 许可证,原生支持 OpenAI Responses API 与 Anthropic API,官方内部测评 Terminal Bench 2.1 得分 87.9(预览版仅 72.1)、DeepSWE 从 12.8 跃升至 62.7、DSBench-Hard 翻倍至 67.2,权重还特别强调可适配国产 GPU 降低政企私有化门槛。

另一边,DeepSeek 官方开源了代码智能体框架 DeepSeek Harness(dsh)v0.1 开发者预览版,主打一个公式:

🔑 Model + Harness = Agent —— 模型是智能体的"灵魂",Harness 负责调度上下文、工具、任务状态、反馈与边界,让模型从"只会聊天"变成"真正干活"。

这并非突发。时间线早有铺垫:8 月 2 日团队负责人崔添翼面向全球公开征集内测用户,数十名全球开发者报名;8 月 11 日 IT之家报道 DeepSeek 注册"Deepseek Harness 团队"微信公众号,并披露其内部已组建 Harness 团队、公开招聘 Harness 产品经理与研发工程师(工作地北京海淀融科资讯中心),内部对标 Anthropic 的 Claude Code;8 月 13 日正式开源。官方称其定位精准对标 OpenAI Codex 与 Anthropic Claude Cowork(Claude Code),主攻编程与办公场景。这是国内大模型厂商首次把"Agent Harness"作为独立开源产品线对外发布。

关键信息

数据

仓库

deepseek-ai/deepseek-harness(TypeScript)

开源协议

MIT(全量源码)

发布当天 Star

约 1.0 万 → 1.4 万+(数小时内翻倍)

仓库规模

8,600+ 文件、44 个子系统、40+ 模型可见工具

启动方式

npx @deepseek-ai/dsh web(Web UI 默认 :3080)

运行模式

Standard / Code(PTC)/ Minimal / Creator 四种

🎯 二、解决了什么核心痛点?

行业痛点

DeepSeek Harness 的解法

模型不会干活:只会生成文本,不会操作环境

bash、文件读写、Web 搜索等 40+ 工具闭环,完成"理解需求→写码→运行→看报错→自修正"的全自动循环

Harness 被厂商垄断:Claude Code 闭源、生态被官方控制

一切皆插件,模型/工具/沙箱/存储/UI 全部可替换,没有特权核心,任意能力可从配置层换掉

上下文遗忘:长任务记不住、越聊越笨

事件溯源会话日志 + 上下文压缩(compaction)+ 100 万 token 原生支持,动态注入相关代码片段

安全风险:模型乱跑代码、破坏宿主

沙箱能力缝:Linux Landlock/bwrap、macOS Seatbelt、Windows ACL 受限令牌,另有 E2B 云沙箱(POC),三档策略 read-only / workspace-write / danger-full-access,未达完全隔离会明确报告 partial

多 Agent 协同难:编排靠人肉轮询

子代理 6 种后端:进程内 / fork / ACP / Claude Code / Codex / dsh-SDK,支持持续会话、后台任务、消息收发与中断控制

不可追溯:AI 干了啥说不清、审计难

"Every run is traceable":模型所见全部写入追加式(append-only)会话日志——系统提示、推理、工具调用与结果、子代理调度、上下文注入皆有记录,Trajectory 视图按来源检视,续跑、fork、搜索、回放全基于同一事件流

换模型成本高:Harness 与模型强绑定

官方提供 deepseek 与 pi-ai 双 LLM 适配器,模型接入走标准能力缝,不锁 DeepSeek 一家

⚡ 三、核心特性:为什么说它是"框架中的框架"

1️⃣ 一切皆插件(Powered by Cordis)
dsh 基于 Cordis 元框架构建——Cordis 只负责插件的挂载/卸载与依赖管理(其设计论文《A Programming Paradigm for Spatiotemporal Composability》也已公开),所有 Agent 能力(模型、工具、技能、会话、沙箱、存储、循环、调度、UI)都是插件,通过 Cordis 服务与事件协作。连 agent loop(智能体主循环)本身都是可替换插件,没有"为了改核心必须 fork"的特权层。

2️⃣ 四种运行模式

  • 标准模式:完整工具集(文件编辑、shell、文件/网页搜索、技能、规划、目标、子代理、工作流)

  • 代码模式(PTC,Programmatic Tool Calling):模型生成一段 TypeScript 程序,一次编排多轮工具调用(Code Mode SDK)

  • 极简模式:仅 shell + 文件编辑器两个工具,用于最小环境下跑模型基准测试

  • 创造模式:检查当前运行时、在内存中试验 Cordis 插件、组合创作全新模式

3️⃣ 全栈工程化能力

  • 动态工作流:模型编写 JS 编排脚本,内置 agent()/parallel()/pipeline()/phase() 组合器,与 Claude Code 的 workflows 语法兼容,每轮运行一个独立 worker 线程;

  • 深度工具矩阵:持久化终端(PTY)、run_code 代码模式、str_replace_editor 编辑器、glob/grep(内置 ripgrep)、LSP 语言诊断、skill 技能加载、create_goal/get_goal 目标管理、schedule_create 定时调度、job_* 后台任务、subagent/subagent_fork 委派、web_search/web_fetch(DeepSeek/Exa/Perplexity 多后端)、session_search 历史检索、ask_user_question 人机确认;

  • 互联互通:MCP 客户端、Claude Code / Codex hooks 桥接、ACP(Agent Client Protocol)服务端、Typert 类型图生成、API 网关(可远程调用会话服务)、Python SDK + JSON-RPC SDK;

  • 可靠与观测:SQLite/JSONL 双持久化后端、OpenTelemetry 遥测、token 计量、凭证管理系统(引用而非明文)、审批与权限预设、运行时不变量断言、事件溯源会话(model-visible means logged,运行时强制)。

🏆 四、特色与亮点

  1. 官方原生 Harness,全量开源 MIT —— 不是"API 包装壳",而是 8,600+ 文件的完整工程,连架构文档、Agent Notes(RFC 式决策记录)、postmortem 事故复盘、双语 i18n 都全部开放,工程透明度罕见;

  2. 不锁模型:双 LLM 适配器 + 标准能力缝,社区观点认为这与 Claude Code 的封闭策略形成鲜明差异化;

  3. 能"指挥友军":把 Claude Code、Codex 作为子代理后端,甚至可用 DeepSeek 模型走 Anthropic 兼容端点驱动 Claude Code 干活——Harness 中立化,这是开源生态最具想象力的点;

  4. 生态运营前置:GitHub Discussions、Discord、企微群 + 微信公众号(国内少见)、dsh-plugin 插件话题,公开征集插件/Skill/MCP/第三方界面生态伙伴;

  5. 面向 Harness 开发者:预览版定位是"给全球 agent harness 开发者",Creator 模式 + 配置化组合让"造一个自己的智能体框架"成为可能。

⚔️ 五、对比:优势与短板

与头部 Agent Harness 对比:

维度

dsh(DeepSeek)

Claude Code

OpenAI Codex CLI

DeepSeek-TUI(现 CodeWhale)

开源

✅ MIT 全量

❌ 闭源

✅ 开源

✅ 开源(Rust)

插件可替换性

极高(一切皆插件)

低(hooks/SDK 级)

模型支持

多模型(官方双适配器)

仅 Claude

仅 OpenAI

DeepSeek 为主

界面

Web UI + Headless + Python/JSON-RPC SDK

终端/IDE

终端

TUI

沙箱

Landlock/Seatbelt/ACL/E2B 云沙箱

有限

子代理能力

6 后端(含 Claude Code/Codex)

内置

内置

有限

生态成熟度

刚起步(发布当天插件为 0)

成熟

成熟

社区单核维护

生产稳定性

⚠️ developer preview,明示兼容性破坏

生产级

生产级

生产级

与开源框架/平台对比: 相对 LangGraph / AutoGen / CrewAI / openai-agents-python 等编排框架,dsh 定位更重——不止做多 Agent 编排,而是覆盖沙箱、持久化、UI、遥测、插件的完整 Harness 闭环,代价是上手门槛更高;相对 Dify / Coze 等低代码平台,dsh 面向开发者而非业务人员;相对国内企业级平台(华为 openJiuwen、字节 DeerFlow、ChatGPT-on-WeChat 系的 CowAgent),dsh 走开发者原生开源路线,不绑定具体企业交付场景。

核心优势总结:开源 + 中立 + 可组合性最强;核心短板:preview 期不稳定、生态空白、文档以英文为主、无官方 TUI 与移动端。

⚠️ 六、风险与不足

  • 开发者预览阶段:官方明示"将有破坏兼容性的变更",持久化格式与插件 API 均可能重构,暂不建议生产依赖;

  • 生态空窗:插件市场发布当天为 0,需时间沉淀;"便宜模型打出豪华战绩"等成本数据来自社区实测(如单任务约 0.028 美元),官方未披露,需谨慎引用;

  • 无 TUI:8 月初已移除 TUI 包,终端用户需适应 Web UI / Headless;

  • 运行时依赖:需 Node.js ^22.19+,非单二进制分发,边缘设备部署受限;

  • 海外热度待观察:发布数小时 Hacker News 仅 20+ 分、零评论,与年初 DeepSeek-TUI 病毒式传播的声量尚有差距。

🔮 七、未来演进方向(基于仓库提案笔记与战略布局)

阶段

方向

短期

Task Surface 任务面、可召回压缩(recallable compaction)、交互式侧会话、npm artifact 首发发布流程;配合 V4 Pro 的 Responses/Anthropic API 双协议,深度打通 Codex 与 Claude Code 生态(V4 Pro 官方已针对性适配 Codex)

中期

Cordis Web 动态插件(浏览器内插件热装载)、语义组合器链、API 网关远程化(手机/远端操控智能体)、插件市场 dsh-plugin 规模化、更多第三方 LLM 适配器

长期

Cordis"时空可组合"范式落地,让 Harness 成为模型无关的中立基础设施;叠加 V4 Pro 权重 MIT 化 + 国产 GPU 适配,形成"开源模型 + 开源 Harness"的政企私有化组合拳,冲击 Claude Code 在国内的替代窗口

📌 八、总结:三个核心信号

  1. 🏆 大模型厂商亲自下场做"模型之外的工程层"——"Agent = Model + Harness"成为行业共识,Harness 从配角升级为战略卡位,DeepSeek 是第一家把 Harness 开源当独立产品线做的国内大厂;

  2. 🏆 "一切皆插件 + 全量开源"是对封闭生态的正面解构——模型可换、沙箱可换、UI 可换,连 Claude Code 都能被"指挥"做子代理,中立化是最大差异化;

  3. 🏆 模型层(V4 Pro MIT 权重)+ Harness 层(dsh MIT)双开源——DeepSeek 正在押注"开源组合拳"抢占下一代 AI 基建入口,成败取决于插件生态与 preview 期的工程兑现。

📌 一句话总结:DeepSeek Harness 不是又一个编码助手,而是想成为所有智能体的"操作系统"——能否成事,就看插件生态与稳定性能否扛过 preview 期。


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/deepseek-harness-open-source-plugin-based-agent-framework-last-mile

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/