DeepSeek Harness首个候选版实测:开源Agent运行时冲刺1.0还有多远
开源 Agent 运行时的迭代速度正在刷新行业认知。9 月 3 日,DeepSeek 官方发布的 DeepSeek Harness(简称 dsh)0.1.2-rc.1 成为该系列的第一个候选版本,释放出明确的信号:功能基本冻结,接下来全力打磨质量。回顾 release 历史,从 9 月 1 日的 alpha.4 到 3 日的 rc.1,连续三天一天一版,这种冲刺节奏在开源 Agent 框架中极为罕见。rc 版本的到来意味着什么?真实任务中的表现能否支撑起 1.0 的期待?本文基于 headless 模式下的实测结果,为开发者与 AI 实践者提供第一手的评估参考。
迭代节奏透视
连续三天发布三个版本,背后是明确的版本策略转向。从 alpha 阶段的快速试错、功能堆叠,到 rc 阶段冻结新功能、转攻质量稳定,这种节奏把控体现了开源项目从探索期迈向成熟期的关键跃迁。rc.1 的发布意味着项目方认为核心功能已具备可用性,开始收口接口、固化行为模式,让外部开发者和插件作者能够在此基础上稳定构建。对于一个开源 Agent 运行时而言,版本策略的成熟度直接影响社区的信任度和生态的扩展速度——这次冲刺式的迭代节奏,正在为 1.0 正式版奠定基础。
实测一:写跑验闭环
第一个测试任务是让 Agent 生成一个 Python 脚本,计算 100 个随机整数的均值、中位数和极值,并实际运行。dsh 一次通过:脚本生成、命令执行、统计输出全部正确。关键亮点在于它没有止步于“任务完成”——随后自发进行了 5 次重复校验,确认每次都恰好生成 100 个数、均值稳定在 500 附近。这套“写-跑-验”闭环展现了 Agent 的主动质量意识:验证不是被要求的,而是模型自发追加的保障步骤。这种自我加码的能力,在长链路复杂任务中将成为可靠性保障的重要支点。
开源 Agent 的成熟度,不在功能数量里、不在文档厚度里,而在真实任务执行的每一次自我纠错里
“行业观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
实测二:临场自我纠错
第二个任务更具实战价值:编写脚本抓取今日头条热榜前 5 条并打印热度值,若头条失败则自动切换至百度热搜。两个细节暴露了真实 Agent 能力的边界与突破。其一,Agent 在编辑过程中将自己写的函数改坏,旧代码与新定义混杂在一起——它没有硬着头皮继续执行,而是主动回读文件、识别错误、整文件重写,最终恢复干净状态后继续执行。这种写坏→自查→修复→继续的自我纠错链路,证明了 Agent 在单任务内处理上下文污染的能力。其二,当百度 wise 接口返回数据缺少 hotScore 字段时,Agent 尝试了加 cookie、改请求头等手段,最终发现通过 platform=pc 参数可绕过字段缺失,成功获取热度值。这段接口字段探测与自动兜底的完整过程,全程不到三分钟,无任何人工干预,展现了 Agent 在真实网络环境下处理异常情况的临场能力。
rc.1 版本关键升级
候选版的核心变化集中在三个维度。透明度和审计大幅增强:会话流默认折叠中间过程,末尾直接显示 token 用量和耗时,一键展开查看精确统计;回合导航支持预览和跳转任意历史轮次。多 Agent 与模型编排优化最密:子代理可在授权范围内自主选模型,调用方可指定提供方、模型和推理力度,甚至为 Claude Code、Codex 单独配置模型;父子代理间升级为 send_message 双向对话,替代原有的单向 report 机制。跨平台与开放性补齐:Python SDK 新增 Windows x64 运行时(此前仅支持 macOS/Linux),ACP 协议补齐会话控制、模型设置、MCP、权限和取消能力,Web 界面开始支持第三方语言,实验性的 Inspector 和 Web Preview 也已上线。更值得关注的是社区信号:oh-my-dsh 开源社区推出了帮插件作者跟随版本升级代码的专用 skill,说明外部开发者已形成一定的插件生态规模。
从实测结果看,dsh 0.1.2-rc.1 的核心 Agent 能力——代码生成、命令执行、网络请求、自我纠错——已相当能打,UI 与多 Agent 编排在快速补齐。但两个变量仍悬而未决:0.1.x 版本的破坏性变更仍时有发生,插件生态的丰富度离“装上即用”尚有距离。候选版的意义正在于此——功能不再削减,剩余工作交给 bug 修复与社区反馈去打磨。dsh 与 Hermes 的定位差异未变:dsh 押注“一切皆插件”的极简内核,Hermes 押注开箱即用的完整生态。rc.1 把前者的完成度又推高了一截,两者真正分胜负的时刻,要等 1.0 正式版发布后才能到来。
