DeepSeek Harness 开源之后:执行框架的公共化与产业 Agent 的工程边界
8 ⽉ 13 ⽇,DeepSeek 正式开源其 Agent 执⾏框架 DeepSeek Harness。这个建⽴在“Model + Harness = Agent”理念之上、以“⼀切皆插件”为设计原则的微内核框架,开源公测两天内即收获近⼗万 GitHub Stars,成为该领域增⻓最快的开源项⽬之⼀。
消息传来,不少市场参与者的第⼀反应是紧张:模型⼚亲⾃下场做执⾏框架,是不是要把做 Agent 落地的公司“卷”没了?我们的判断恰恰相反——这不是威胁的开始,⽽是确认的开始,更是扩容的开始。
今年年中,我们在《Harness 时代:海致科技如何定义 AI 的“驾驭⼯程”》⼀⽂中系统论述过:产业级 AI 的决胜点不在模型的“⻢⼒”,⽽在驾驭模型的“⻢具”;模型是烈⻢,Harness 是缰绳,模型决定智能的上限,Harness 决定系统稳定运⾏的底线。随后在《Graph Engineering》⼀⽂中,我们进⼀步回答了“模型该信什么”——靠图谱⼯程构建可信、可推理、可演化的知识底座。
如今,最懂模型的头部玩家亲⾃下场造“⻢具”,并选择把它开源。这等于由产业最核⼼的⼀⽅,为这套论断盖上了来自模型层的产品与生态验证。对海致而言,这是一次方向确认,也是一次加速:它验证了我们两年前就选定的路径。海致并非从今天才开始回答“模型之外那一层”的问题,而是早已在 Harness 工程、本体、图模融合与 FDE 上持续投入。底盘被开源,不会削弱这些积累,反而让它们的价值更容易被看见。
本⽂将从以下三个方面展开:这次开源确认了什么、它做不到什么、以及海致如何在标准化底盘之上构建不可替代的工程层。
01 范式确立:当“模型之外的那⼀层”被头部玩家背书
模型⼚的天职是把模型做得更强,为什么要把宝贵的资源投向模型之外的执⾏框架?
合理的解释只有⼀个:在 Agent 时代,“开箱即⽤”不存在。模型能⼒要转化为客⼾现场的可执⾏动作——任务规划、⼯具调⽤、权限控制、结果校验、安全运⾏,必须有⼀层⼯程框架来承载。这层框架重要到模型⼚⽆法假⼿于⼈,也重要到值得⽤开源去争夺⽣态标准。
这次开源带来两个确认:
第⼀,Harness 作为独⽴价值层被确认。“Agent = Model + Harness”从⼯程圈的共识,变成了头部模型⼚的产品路线。2026 年 AI 工程领域正在完成从模型竞赛向系统竞赛的范式转移——Harness 作为 Agent 的运行系统,承担状态管理、工具执行、反馈校验与安全约束等核心职责,将模型的概率性推理转化为确定性行动序列。
行业数据也印证了这一判断:生产环境 Agent 的失败率在 70%~95% 区间,但 60% 的失败归因于数据质量、上下文缺口和治理缺失,而非模型本身。换言之,决定 Agent 能否落地的,不是模型有多聪明,而是模型外面那圈工程有多扎实。
第⼆,Harness 作为公共设施被确认。值得特别注意的不是发布本⾝,⽽是“开源”这个动作:DeepSeek Harness 构建在 Cordis 元框架之上,采用微内核架构,运行时组件以彼此隔离、可相互替换的插件形式运行。模型适配器、工具注册表、沙箱环境、会话状态处理器、事件分发器和用户界面等功能单元均作为独立扩展加载,通过更新声明式配置文件即可替换执行工作流。微内核加全插件的设计,说明 DeepSeek ⽆意把 Harness 做成封闭栈,⽽是把它做成 Agent 时代的“底盘标准”。
回顾信息产业史,Linux 的开源没有消灭做系统的公司,⽽是把操作系统从竞争壁垒变成了公共设施,把竞争推向上层的应⽤与⾏业纵深。在 Agent 技术栈中,一个类似的“拆分”正在发生:执行基础设施正在从单体框架向模块化、解耦式架构转变。底盘标准化之后,价值不会消失,只会向底盘之上转移——⾏业知识、可信数据、结果责任,将成为新的定价基准。
02 边界分析:Harness 解决不了什么
对⼀项新技术最负责任的评估,是说清它的边界。
DeepSeek Harness 提供的是⼀套⾼质量的通⽤执⾏框架。但从 2026 年 Agent 工程的行业实践来看,产业 AI 的落地清单上,还有⼀⼤半条⽬与它⽆关——⽽这些条⽬,恰恰是 Agent 从 Demo 走向生产系统的核心瓶颈。
第一,⾏业知识不会随框架⽽来。Harness 能保证 Agent “正确地执⾏”,但保证不了“执⾏的是对的东西”。供热企业的供回⽔温差阈值、政务场景的业务事项关联、制造企业的质量归因链路——这些刻在⾏业专家脑⼦⾥、沉在客⼾台账与系统⾥的知识,任何通⽤框架都⽆法预置,必须⼀项⼀项地访谈出来、建模成本体、沉淀为机器可推理的规则。同济大学王昊奋教授的判断值得引用:大模型越强,本体和知识图谱反而越重要——它们正是 AI Agent 需要的那道“缰绳”。大模型做的是相关性推断,而严肃决策要的是因果链——哪一步导致哪一步,必须说得清、查得到。
第二,企业环境不会因框架⽽简化。数据不出域的合规要求、异构系统林⽴的 IT 现状、层层审批的组织流程、必须可审计的责任链条——在这些约束下,Agent 落地不是“跑通⼀个 Demo”,⽽是包含数据⼯程、本体建模、权限治理、驻场运营的系统⼯程。在我们的实践中,某制造业客⼾跨系统数据对接的开发量曾占到整个项⽬的六成以上,这部分⼯作与模型和框架都⽆关,靠的是⼈对企业系统的理解。
第三,中⽴性是模型⼚的结构性盲区。模型⼚的 Harness 天然以⾃家模型为中⼼设计和调优。⽽企业的真实采购清单上,模型从来不⽌⼀个:信创场景要求国产化适配,成本敏感场景要权衡推理价格,能⼒敏感场景要在不同模型间取⻓补短。2026 年,多模型路由已从高端特性变成企业 Agent 平台的标配。以单⼀模型为中⼼的 Harness 越多,多模型中⽴调度的需求反⽽越旺盛。
第四,长程任务的记忆瓶颈尚未被任何通用框架解决。CMU、耶鲁和亚马逊联合发布的调研指出:“The harness is becoming the binding constraint”——运行框架正在成为制约 Agent 能力的瓶颈,而非底层模型。在该调研梳理的 ETCLOVG 七层分类法中,执行环境与沙箱层已有 20 个主项目,是基础设施层最成熟的部分;而上下文与记忆管理层几乎是七层里最薄的,独立发布的组件极少。Agent 正在从跑几分钟的短任务走向跑几个小时的长期任务,但每次任务结束后环境被销毁,下一次启动从零开始——它永远无法积累经验。这个问题,通用 Harness 本身解决不了。
把边界画清楚,产业分⼯反⽽前所未有地清晰:
⼀句话概括:DeepSeek 把最好的底盘开源了,但把⻋开到客⼾⽬的地、应对沿途所有路况的活,依然是专业运输公司的⽣意。
03 行业正在往哪里走:三个技术趋势
理解了通用 Harness 的边界,就能看清产业 Agent 的技术演进方向。
趋势一:从单 Agent 循环走向多智能体图化编排。单个 Agent 又做规划、又做执行、又做验证,上下文很快撑爆,长任务跑到 10—15 步就开始“目标漂移”。行业给出的答案是把多个专职 Agent 组织成有向状态图:一个负责拆解任务,一个负责调研,一个写代码,一个跑代码,一个做评审,再由编排器收集结果决定下一步。
2025 年的一项对照实验显示:单 Agent 在事件响应任务中产生可执行建议的比例是 1.7%,多智能体编排是 100%。2026 年的架构动量已明确转向图化编排,LangGraph 1.0 正式 GA,OpenTelemetry 成为默认的链路追踪格式。图化编排的核心原语已经清晰:节点(每个节点是一个跑着自己循环的 Agent)、边(定义数据流和依赖关系)、类型化状态、检查点、中断与恢复。
趋势二:协议层收敛,竞争上移到应用层。MCP 协议在 2026 年 7 月完成史上最大修订——从有状态双向协议转向请求/响应模型,引入无状态核心和标准化扩展框架。Anthropic 随后推出高级工具调用套件,补齐了 MCP 此前在工具发现、选择和组装环节的缺失。
协议之争基本结束,“MCP 管工具,A2A 管代理”的格局已经形成,竞争上移到应用层与行业纵深。这意味着,通用工具调用的标准化程度越高,行业规则、数据约束、业务语义的差异化价值就越突出。
趋势三:本体从“静态地图”变成“动态导航”。早期的本体是一张静态地图,画的是一个组织里有哪些人、哪些事。但到了 Agent 时代,光有地图不够了——还得能走起来。本体需要挂上接口和各种功能,把背后的服务、流程接出来,让 AI 能照着去做事。
Snowflake 已经在 Cortex Agents 中实践本体感知的推理方案,将行业标准本体与知识图谱、GraphRAG 结合,弥补关系型数据与领域语义之间的建模鸿沟。在需要确定性因果链的严肃场景中——反洗钱、质量归因、故障根因——模型优先的路线只能提供相关性,本体优先的路线才追得到因果。
04 海致的工程应对
在上述三个趋势下,海致的工程路径是清楚的。
第⼀重:交付杠杆——FDE 的成本曲线整体下移
2026 年,FDE (Forward Deployed Engineer,前线部署工程师)岗位需求同比增长 729%,AWS 投入 10 亿美元组建 FDE 团队,这一模式正在全球范围内被验证为 Agent 落地的关键路径。海致是国内较早把 FDE 模式系统化落地的国内团队之⼀。FDE 效率的核⼼杠杆从来不是⼈⼒密度,⽽是⼯程杠杆:AI Coding 让单⼈⽇产出从千⾏级迈向万⾏级,标准化的 POC ⼯具链让售前周期被持续压缩。
DeepSeek Harness 开源后,这根杠杆⼜⻓了⼀截。过去我们为每个项⽬⾃建的 Agent 脚⼿架——任务规划、⼯具调⽤、结果校验——如今有了⾼质量的开源底盘,FDE 的⼯作重⼼从“造轮⼦”进⼀步转向“装⾏业模块”:本体构建、规则库校准、场景联调。
以我们交付的北京热⼒ Data Agent 项⽬为例——L0 总调度、L1 规则引擎、L2 数据调⽤智能体的分层架构,放在 Harness 标准底盘上重建,⼯程量还可以显著收缩。底盘越标准,⾏业模块越值钱;⽽⾏业模块,正是海致⼀个项⽬⼀个项⽬攒下来的家底。
第⼆重:体系融合——Atlas 智能体与开源框架的体系融合
Atlas 智能体是海致⾯向产业级 Agent 的核⼼平台,也是公司已公开披露并规模化创收的产品线:2026 年上半年收⼊同⽐增⻓ 135.6%,占公司整体收⼊的⽐重升⾄ 38.8%。它在这场变局中的位置,值得从技术架构层面单独讲清楚。
其⼀,Atlas 的架构理念与 Harness 天然同构。编排层将企业 API、数据库、业务系统封装为Agent 可调⽤的⼯具,以状态机管理复杂任务流程,并在关键决策点保留⼈的最终决策权;控制层依托⾏业本体与图模融合技术做“AI 除幻”——通过图查询验证模型输出是否符合本体事实,冲突即触发强制重推理;记忆层由 AtlasGraph 提供可推理的关系记忆。这套“控制—记忆—编排”三层体系,与 DeepSeek Harness 的微内核正是同⼀命题的两个实现。
其⼆,中⽴路由是 Atlas 与⽣俱来的⽴场。Atlas 兼容百余款⼤模型,Agent 根据任务类型动态路由⾄最合适的引擎,客⼾不被任何单⼀模型锁定。事实上,Atlas 智能体正是基于DeepSeek、通义千问等开源⼤模型适配构建的——DeepSeek 早已是我们的⼀等公⺠,⽽⾮新来的竞争者。
其三,我们的路线图因此更加明确:基于 DeepSeek Harness 的框架与思路,构建海致⾃有Harness 的下⼀代。底盘层借⼒开源社区——插件机制、⼯具标准、运⾏内核,能复⽤的不再⾃研;⾏业层坚持⾃有——本体约束、图模融合验证、⾏业插件与组件库,这些是开源框架给不了、客⼾买账的部分。同时,海致⾃研的多模型 Agent 引擎将继续作为中⽴侧的补充:在客⼾需要跨⼚商评测、私有协议适配或深度定制执⾏逻辑的场景中,提供 Atlas 平台之下的弹性内核。⽤开源的底盘跑⾃家的⾏业模块,是这场开源浪潮⾥成本结构最优的姿势。
第三重:市场扩容——门槛从工具层向知识与责任层迁移
DeepSeek 模型的开源把企业级推理成本拉低了⼀个量级,DeepSeek Harness 的开源⼜把 Agent 的⼯程⻔槛拉低了⼀个量级。两个量级叠加的直接后果是:⼀⼤批原本观望的政企客⼾,从今年开始真实⽴项。
供热、政务、电⽹、制造——我们今年交付的项⽬清单上,新增客⼾的典型画像正是“第⼀次上 Agent,预算已有,缺⼀个能对结果负责的伙伴”。
市场变⼤当然也会引来更多竞争者,但竞争的⻔槛正在发⽣对海致有利的迁移:当“搭⼀个 Agent Demo”⼈⼈可为,客⼾的选择标准就会从“能不能演⽰”变成“懂不懂我的⾏业、敢不敢对结果负责、量产后谁来运维”。⻔槛没有消失,只是从⼯具层移到了知识与责任层。
工具层正在变成公共品——通用 Harness 把任务规划、工具调用、权限控制、结果校验这些能力标准化了。而知识与责任层对应的是行业本体、规则库、图模融合验证、驻场交付和长期运维能力。这些能力无法通过一次开源获得,只能在一个个项目中沉淀:把行业专家的判断变成可推理的规则,把客户系统里的数据变成可验证的本体,把一次性的 POC 变成能通过验收、能长期运行的生产系统。那⾥,是海致 FDE团队、⾏业本体与图模融合体系所在的主场。
对有国产化要求的客户,“开源模型 + 开源框架 + 国产图数据库 + 全栈信创部署”的组合正在扫清技术合规障碍;同时,Agent 从试点走向生产之后,采购评审关注的重点也会从“模型能力演示”转向“结果是否可审计、责任是否可追溯、系统是否可运维”。市场扩容不是把竞争变简单,而是把竞争推到更靠近客户现场、更靠近结果责任的位置。
05 海致的三个既定动作
其⼀,全⾯拥抱,做 DeepSeek ⽣态最深度的落地伙伴。基于 DeepSeek Harness 的框架与思路升级海致⾃有 Harness 已进⼊路线图:插件机制对⻬、⼯具标准互通、⾏业插件双向封装。底盘越普及,我们⾏业模块的复⽤率越⾼。
其⼆,坚持中⽴,让 Atlas 成为多模型时代的“公共站台”。DeepSeek 是⼀等公⺠,通义千问是⼀等公⺠,未来每⼀家主流模型都应是⼀等公⺠。客⼾要的不是站队,⽽是每个任务都跑在当下最优的模型组合上,并且随时可换。中立不是技术上的“谁也不靠”,而是工程上的可评测、可路由、可替换:模型接入标准化、效果评测可量化、路由策略可配置、故障切换可回退。
其三,持续加深 Graph Engineering 的护城河。Harness 解决“怎么执⾏”,图谱解决“凭什么信”。执⾏框架越标准化,幻觉治理、可审计推理与⾏业本体的差异化价值就越突出。郑纬⺠院⼠那句“图谱如左脑,⼤模型如右脑”,在 Harness 时代应当补上后半句:Harness 是躯⼲,让右脑的意图变成左脑约束下的⾏动;⽽⾏业知识,决定这具躯体最终能⾛多远。落到工程上,就是三件事:本体约束前置、图模融合验证、推理链路可追溯。
结语
2026 年初,我们论述“模型是 CPU,Harness 是操作系统”;年中,我们论述“图谱是让 Agent 不迷路的地图”;8 ⽉,DeepSeek ⽤⼀次开源把操作系统铺成了公共设施。
操作系统⼈⼈可得之后,胜负⼿在哪⾥?在⾏业数据、⾏业本体、⾏业插件,以及那个愿意驻在客⼾现场、对结果签字的⻆⾊上。
这不是某一家公司的机会,而是整个产业分工走向成熟的标志。海致选择的位置,是在标准化的执行框架之上,持续投入行业本体工程、图模融合验证与驻场交付体系——把这些工程能力做深、做扎实,让每一个项目的行业知识都能沉淀为可复用的组件库和规则库。执行框架的公共化,让这件事变得比以往任何时候都更有杠杆。
这三件事,恰好对应海致过去十年持续投入的工程方向。引擎开源不是终局威胁,而是一个起跑信号:当执行框架成为公共设施,产业的竞争重心将进一步向行业知识与结果责任转移。海致选择继续把工程能力压在这一层。
参考资料:
1、同济大学王昊奋教授2026年7月《大模型越强,知识图谱反而越重要》系列访谈
2、Agent Harness Engineering: A Survey
*本文作者为海致科技首席架构师张伟,经编辑。
本文来自微信公众号“海致科技”,作者:海致,36氪经授权发布。