自己会进化的Agent来了:用它20分钟拆解 DeepSeek Harness 整个项目!
你好,我是郭震。
DeepSeek 最近开源了一个很重要的新项目:DeepSeek Harness
模型决定 Agent 聪不聪明,Harness 决定它能不能调用工具、管理上下文、进入真实环境持续工作。
代码工程浩大,里面不只有一个聊天界面,还涉及插件内核、工具、Skills、会话、沙箱、存储、调度和四种运行模式。
短时间靠人肯定搞不定,不过现在Agent越来越好用,比如这个复杂工程项目理解,可以让Agent组队,理解一遍这个工程源码。
做这件事有一个智能体比较推荐,就是EvoX
这是我使用它生成的源码解析台前端,点击每个核心组件,都会对应到组成Harness的组件中:

更加方便帮我理解DeepSeek Harness,比如点击任何一个节点,都能观察到它和其他模块的关系。除此以外,还有这样的执行路径图动画:

如下为LLM请求的执行路径,看到这些节点图,能更好方便我理解Harness的执行路径:

前后二十分钟,就把源码扒完,并生成这样的成果,更多功能我会在文中展示。
EvoX能自动拉起一支 AI 小队,更好帮把DeepSeek Harness从架构到源码完整拆一遍。具体做法,感兴趣的可以看下。
实测Case 1:Agent组队分析DeepSeek Harness
我发送下面提示词给EvoX智能体:
请调用蜂群模式,对 DeepSeek 官方开源项目 DeepSeek Harness 进行一次源码级深度解析。目标不是简单总结 README,而是帮助一名中国开发者真正看懂:DeepSeek Harness 是什么、“一切皆插件”如何实现、Cordis 内核承担什么职责、一次 Agent 任务如何运行,以及它目前是否适合实际使用。
请自行拆解任务和组织多个 Agent,不要让我规定具体分工。任务至少覆盖:
官网、README和开发者文档核验;
GitHub源码目录与核心模块分析;
Cordis内核、服务、事件和插件依赖机制;
模型、工具、Skills、会话、沙箱、存储、循环、调度和UI插件;
标准、PTC、极简和创造四种运行模式对比;
会话日志、Trajectory、恢复、分叉和回放机制;
本地安装、Web UI启动和基础功能实测;
开发者预览版的限制、风险和适用场景;
对各Agent结论进行交叉校验。
所有技术判断必须附上官方文档链接,或者对应的源码文件路径。无法确认的内容必须标记为“待核验”,不得根据文件名自行推断。

比较惊喜的是,我没有替它规定具体分工,它自动成立了下面由11个Agent的小分队:

从图中可以看到,不同 Agent 分别负责文档核验、架构梳理、Cordis 内核、工具与 Skill、会话轨迹、沙箱存储、调度循环、Web UI、安装运行和风险分析。
最后还有一个专门的 cross-check 任务,负责读取各路结果、检查冲突并完成统一汇总:

这就是蜂群和普通多开几个 Agent 最大的区别。
以往多Agent完成任务,一般通过多 Agent 各写一段互不相关的答案。
但是,EvoX智能体是围绕同一个目标并行工作、共享中间结果,最后再进行交叉校验和集体合成。
第一轮执行并没有全部变绿:

部分子 Agent 因工具调用预算耗尽,没有按计划生成报告,但是它可以自动重试失败节点,剩余缺口由主协调 Agent 接管:

经过一轮修复后得到DeepSeek Harness解析台:

它理解完整仓库大概十分钟,再打开看看前端界面动画,点击进入任务执行路径:

除了文中开头介绍的结构图动画和执行路径图,还包括四种Harness模式:

模式关系图:

DeepSeek Harness整个仓库代码,非常庞大,但是经过这次实测,看到EvoX 能像项目负责人一样,拆解任务并干完,这个效果真的出乎我的意料。
具体来说,它能围绕同一个目标自动拆解任务、组织并行协作、共享中间结果、重试失败节点并交叉校验,最后把复杂分析收束成一个可打开、可核验的完整交付物。
实测Case 2: 从一句需求到可运行的数据分析网页
第二个实测任务,让它在指定目录里开发一个完整的数据分析网页工具。
我要求它支持 CSV 上传、字段识别、核心指标、交互图表、联动筛选、数据洞察、数据质量检查、明细搜索和导出,而且不能安装依赖、不能访问网络,只能使用本地 HTML、CSS、JavaScript 和 CSV:

我同样没有手工写工作流,只说清楚目标和边界。
EvoX 没有立刻丢出一大段代码,而是先列出 7 项待办:

第一轮大约用了 18 分钟。它在本地生成了 9 个项目文件。我刚才第一个case生成的数据。
网站打开后可以看到总销售额、订单数、客单价和环比增长:

下面还有销售趋势、品类销售、地区占比和渠道排行:

它不是一张写死的效果图。
可以灵活选择地区、品类、渠道或日期后,指标、图表、洞察、数据质量和明细表会一起变化:

第一次生成并不完美。比如筛选器使用英文键匹配中文字段,选择地区后会变成 0 行。
我把错误位置、筛选结果和测试日志继续反馈给 EvoX。
这次真正值得看的,它没有从头理解项目,而是自动调用了前面任务中沉淀的 3 条本地记忆,直接知道项目目录、代码结构和之前采用的实现方式:

任务过程中的有效信息和处理经验还会被沉淀下来。第二次遇到修改或类似任务时,EvoX可以直接接着做,而不是每次都从零开始。
简单来说,普通 Agent 更像“这次帮你干完”;EvoX 想做到的是“这次干完以后,下次还记得怎么干”。
实测Case3:复杂办公任务
EvoX和普通聊天工具最大的区别,除了有Workbuddy这类Agents能力和Skill外,还加入了两个很关键的能力:蜂群协作和自进化:

面对复杂办公任务,EvoX 可以通过蜂群模式自动拆解目标,如下所示:

最终会话里出现了两张是完整文档卡片::

这两个成品分别对应结构化调研报告:

4 自进化智能体EvoX
打开EvoX以后,依次可以看到会话、协作、编码,下图是协作截图可以实现电脑操作:

我直接用中文说清楚目标,它就可以读取庞大代码、资料、调用技能、生成文档,或者进入真实项目目录开发代码。

从上面看到了,EvoX 解决的是改变 Agent 的工作方式。前面三个 Case 也让我看清了 EvoX 的两个核心能力: 蜂群协作和自进化。
关于自进化的论文,可以阅读学习下面这篇,我最近也在研读:

蜂群先拆解大任务,再让不同 Agent 分别处理自己的上下文、共享中间结果,最后统一校验和汇总:

这样做不仅可以并行推进,还能减少多个任务反复读取完整上下文造成的 Token 浪费。在任务可拆分、可汇总、可验证的前提下,单一长上下文的成本可能接近 O(N²),蜂群分治则可以接近 O(N):

蜂群解决的是“这次任务如何完成”,自进化解决的则是“下次为什么不用从零开始”。
EvoX 的自进化有两层。
第一层是本地进化,在这三次实测中,EvoX 也多次显示从记忆库调用了经验:

第二层是联网进化,任务完成以后,它还会将过程中有效的经验沉淀到EvoMap:

过一会就会加入到网络中Gene 和 Capsule:

简单来说, 蜂群让多个 Agent 更高效地完成任务,本地进化让 EvoX 记住跑通的方法,EvoMap 则让这些经验在更多 Agent 之间继续流动。
最后总结一下
三次实测下来,我最大的感受EvoX 不仅能把任务“做完”,而且把复杂项目从分工、执行到交付的过程真正跑了起来。
蜂群解决复杂任务的分工与汇总,自进化把成功经验沉淀到本地;连接 EvoMap 后,还能将经验转化为 Gene 和 Capsule,供其他 Agent 继承复用。
结论:EvoX 是一个能组织多个 Agent 协作,并把任务经验沉淀下来、继续复用的桌面 Agent。
国产通用 Agent 赛道,不一定只有大厂才值得关注。从这次实测看,EvoX 至少已经站到了国产 Agent 的第一梯队,也很可能会成为这个赛道接下来值得关注的一匹黑马。
常见问题
自己会进化的Agent来了:用它20分钟拆解 DeepS…测了什么?
看 AI消息 的实际效果、使用门槛和结果表现。
自己会进化的Agent来了:用它20分钟拆解 DeepS…适合谁看?
适合正在选工具、做本地部署或验证 AI 工作流的人。
自己会进化的Agent来了:用它20分钟拆解 DeepS…要注意什么?
重点看配置成本、失败点、数据边界和可替代方案。
相关内容