DeepSeek Harness工程能力评测:基于阿里云AgentLoop的三维评估方法与实证
随着大语言模型从文本生成向任务执行演进,Agent工程的关注重心正从模型能力转向「模型之外的运行时」。DeepSeek于2026年8月以MIT协议开源其Agent运行框架Harness,进一步印证了「Agent等于Model加Harness」这一工程命题:模型决定能力上限,而负责工具调用、上下文管理、权限控制与会话记录的Harness框架,决定了能力落地的方式。然而,如何客观评测一个Harness的工程能力,当前仍缺乏成熟方法论。传统的问答式基准无法度量Agent在真实环境中以状态变更完成任务的能力,LLM-as-Judge类主观评分存在方差与宽松偏差,而仅报告二值通过率的做法,更掩盖了任务完成度、结果正当性与执行过程可靠性之间的差异。本文报告一项基于阿里云AgentLoop平台的DeepSeek Harness评测实践,构建三个正交的确定性评估器,从执行轨迹中提取比二值通过率更细粒度的信号,为Harness类框架的工程能力评测提供可复现的方法论支撑。
DeepSeek Harness的架构定位与核心机制
DeepSeek对Harness的官方界定可概括为「Agent等于Model加Harness」:模型决定能力上限,Harness决定能力落地方式。DeepSeek Harness采用Cordis微内核加「一切皆插件」的架构组织,模型适配器、Agent Loop、会话持久化、工具、安全策略与Web UI均拆分为独立包,注册至Cordis微内核。仓库包含230余个workspace成员,每个目录对应一项可替换能力,内核仅负责插件的加载、卸载与依赖管理。该设计提供两项关键组合性特性:时间可组合性允许插件卸载后其副作用被完整撤销;空间可组合性则使插件能够动态处理自身依赖的新增、消失与变更。框架以Session Log作为唯一的权威事件源,系统提示词、运行环境、工具schema、模型请求、流式输出、工具调用结果、权限切换与取消原因均以事件形式追加至同一日志。这一事件溯源设计使基于轨迹的细粒度归因评测具备了完整的证据基础,也为后续评估器设计提供了结构化、可回放的完整执行轨迹。
三维正交评估器的设计原则与实现
在采信数据集自身判定的基础上,本文构建三个正交的确定性评估器,从执行轨迹中提取比二值通过率更细粒度的信号。任务完成度维度权重55%采信verifier判定、25%评估断言单元通过率、20%评估产物完整性,O1权重过半保证评估器与benchmark强对齐;红线规则判定维度采用hard、soft、light三级规则体系,审计结果是否正当获得,任意一条hard级红线触发即判零分,确保作弊行为与刷分嫌疑得到有效识别;执行过程可靠性维度覆盖目标进展、自检闭环、失败恢复与效率纪律四个方面,与outcome解耦使低完成度run的过程分仍可能较高。三个评估器均以AgentLoop的AGENT加Skill形态交付,评分逻辑以规则化脚本实现,从机制上排除模型打分的方差与宽松偏差。评估协调Agent只承担编排与I/O,分数来自脚本而非模型,保证同输入同输出的可复现性与可审计性。
Agent的成败,不在模型的参数里、不在框架的噱头里,而在Trajectory的每一个可溯源的动作里
“行业观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
从产业实践看Harness评测的工程价值
从多年产业实践经验来看,Agent评估本质上是判断Agent对于问题的解决能力,可抽象理解为考试的判卷行为:Agent输入task对应考卷题目,执行过程对应解题步骤与演算草稿,验证交付物对应答卷,评估器对应判题人。传统评估多采用机器批阅客观题加人工批阅主观题的方式,正对应Code-as-Judge和Agent或LLM-as-Judge两种模式。对于客观事实可使用固定规则引擎进行标准化评分,但对于执行失败原因千奇百怪的复杂任务,LLM-as-Judge模式容易受到错误信息的污染和影响,尤其当评估器选择普通模型时可信度较低。高考数学压轴大题都有过程分的评分逻辑表明,复杂任务的执行本身是有迹可循的,这也正是Trajectory评估的核心价值所在。当Agent执行变得有迹可循,评估的思路也随之打开:通过设计完善的规则匹配、提示词与交付物加载方式,可将黑盒的评估过程变成流水线任务。当评估任务固化为详细流程Prompt加具体评分脚本的Skill形式,评估器就可以选择成本更低、尺寸更小的模型来执行,实现评估效率与成本的最优平衡。
实证案例分析:DSH与Codex的对比评测
DeepSeek Harness加Qwen3.7-Plus模型在Terminal-Bench 2.1的10条任务上完成三评估器全量评估,整体平均分0.85,三维度平均归一化得分分别为执行过程0.83、红线规则0.98、任务完成度0.74。compliance接近满分表明10条轨迹均未触发硬性作弊红线,结果获得方式总体正当;outcome相对最低,受2项任务未通过verifier与2项任务触发0.50封顶的直接影响。同等条件下,Codex通过率同样为80%,但二值通过率之下的面貌各不相同:extract-elf在Codex侧通过而在DSH侧以0.1917失败,产物缺失是主要原因;qemu-startup在Codex侧触及墙钟时限判负,而在DSH侧通过但被0.50封顶。两者的交叉差异表明,Agent Trajectory评估能够揭示传统评估缺失的信息维度,为Harness框架的工程能力对比提供更丰富的决策依据。低分案例的逐维度归因与超时封顶案例的raw等于1.0触发cap等于0.50机制,进一步验证了三维正交设计在失败可定位、超时可识别方面的实用价值。
本文的评测实践验证了一套以AgentLoop为载体的通用评测方法论,其核心在于评测对象可替换、判据锚定答案卷、评分依据来自脚本和数据、评估器不需要很强的模型。DSH和Codex通过率持平但失败面貌各异的实证结果表明,Agent Trajectory评估能够补充传统评估缺失的信息维度。后续工作将沿规模化与多基准迁移、评估器资产化与降本、走向自进化闭环三个方向推进,使评测管线本身可低成本规模化运行,并最终实现评估发现短板、归因定位、优化迭代、再评估验证的完整闭环。
