华尔街投行杰富瑞(Jefferies)近期对八款主流中美AI Agent进行了一次系统性实测,结果颠覆了“模型越强,Agent越强”的直觉。在总分排名中,阿里巴巴的千问办公以95分位居第一,尽管其背后模型Qwen 3.8 Max的智能分仅为56,在参测模型中排第四;而模型能力最强的Claude Opus 5(智能分61)对应的Anthropic产品Claude Cowork以94分屈居第二。OpenAI的Codex(基于GPT-5.6 Sol,智能分59)以92分位列第三。这一结果让杰富瑞得出核心结论:决定一个AI Agent好不好用,往往不是背后那个模型,Harness(管理机制)做得好足以弥补模型智能的差距。
所谓Harness,是指Agent中除模型外的所有组件,负责“管理”而非“思考”。杰富瑞将其拆解为六层:指令(定义任务与红线)、上下文(提供背景信息)、工具(可调用的外部能力)、边界(行动范围)、反馈(错误纠正与重新规划)以及治理(组织级管控)。这六层对应企业雇佣员工后的管理流程,模型如同聪明的新人,而Harness则是让新人发挥效能的管理体系。报告用控制变量实验证明:同一模型Claude Opus 4.6在不同Harness下,在Terminal-Bench 2.0基准上的得分从58.0%到76.4%不等,差距达18.4个百分点;Gemini 3 Pro同样仅换Harness,得分从56.0%到69.4%,差13.4个百分点。
本次实测覆盖美国三款(Claude Cowork、Codex、Gemini Spark)和中国五款(腾讯Workbuddy、阿里千问办公、字节豆包、月之暗面Kimi Work、MiniMax Code)产品,测试任务包括多文件检索、自主联网研究、控制浏览器、制作PPT和生成营销海报,每项任务按5个维度打分,满分100分。最终排名为:千问办公95分、Claude Cowork 94分、Codex 92分、Kimi Work 86分、豆包77分、MiniMax Code 71分,Workbuddy与Gemini Spark并列垫底(66分)。
值得注意的是,千问办公的“逆袭”并非偶然。杰富瑞将Agent能力拆分为模型(权重60%)和Harness(权重40%),反推出各产品的“隐含Harness分”,结果显示千问办公的Harness分最高,甚至超过美国产品。这印证了Harness优势足以抵消模型智能差距。
实测还揭示了中美Agent的能力差异:在营销海报任务上,美国产品普遍表现不佳,Claude Cowork和Gemini Spark均在此翻车,而中国产品如千问办公和豆包表现更好;在控制浏览器任务上,中国产品成为弱点,Workbuddy和MiniMax Code在此栽跟头,美国产品则更稳定。速度方面,美国产品中Gemini Spark最快、Codex次之、Claude Cowork最慢;中国产品中Workbuddy最快,Kimi Work和千问办公偏慢。此外,Claude Cowork在PPT排版和配色上“品味”最佳,但杰富瑞认为这归功于模型能力而非Harness。
价格上,中国模型具有显著优势:千问办公背后的Qwen 3.8 Max API价格每百万token约1.1美元,而GPT-5.6 Sol为4.4美元、Opus 5为3.9美元。
报告特别分析了腾讯Workbuddy的“错位”现象:其6月月访问量约2100万,在中国同类Agent中排名第一,但隐含Harness分却在中国产品中垫底。杰富瑞给出三个原因:一是Workbuddy深度嵌入腾讯生态(腾讯文档、IMA、企业微信),入口优势明显;二是其采用模型无关路线,用户可切换Kimi K3、DeepSeek V4、GLM 5.2等开源模型;三是腾讯营销投入较大。报告判断,短期Workbuddy赢在入口和分发,长期来看2100万用户基础将沉淀海量真实使用数据,反哺Harness改进和模型训练。在中国市场现阶段,分发能力暂时跑在Harness工程前面,但决定Agent最终走多远的关键仍是Harness。
杰富瑞还对比了中美在Harness上的优劣势。中国优势包括:超级App集成(Agent直接嵌入企微、飞书、钉钉等平台,打通数据、分发、变现);模型无关的Harness(如Workbuddy、字节Trae);低token价格(出口管制倒逼高效MoE架构和推理优化,中国模型token价格平均比美国低70%到80%);迭代速度快(用户量大、失败案例多,促进快速改进)。短板则有:模型差距仍在(弱模型更依赖Harness);产品定价低(中小企业价格敏感、大型央国企偏爱定制项目);出海难(中国Agent为本地生态优化,而美国Harness受益于全球标准化软件栈);算力瓶颈(Agent工作流对推理算力消耗大,高端算力短缺可能影响服务稳定性)。
报告最后强调Harness的三大价值:粘性(客户的工作习惯、历史、连接器等沉淀在Harness中,换走成本高);数据飞轮(每次运行产生trace数据,可反哺强化学习和Harness改进,形成正循环);付费意愿(企业购买的是“Harness+模型”打包的完整产品,而非单纯“智能”)。因此,对AI公司而言,AI落地的关键在工程层而非模型层,把Harness做好比追最强模型更可能做出落地产品。




津公网安备12011002023007号