seedance2.5

DeepSeek内测招募帖引爆Agent开源生态:769人报名、712个仓库、超120万Stars

AIGC行业资讯12小时前发布 zhang
10 0

DeepSeek的Agent Harness团队负责人崔添翼在社交平台发文,公开招募DeepSeek Harness内测人员,要求申请者参与过开源Agent项目的建立和维护,并提交GitHub仓库作为代表作品。这条看似普通的内测招募帖,迅速演变成一场Agent开源生态的“大摸底”,大量开发者带着自己的项目涌入评论区,从个人Harness、Coding Agent,到记忆系统、安全工具、评测框架,几乎覆盖了当前Agent基础设施探索的各个方向。

据开发者统计,截至8月3日上午11:30,共有769位报名者、去重后712个开源仓库,合计超过120万Stars,跨越18个赛道,评论区秒变“开源Agent路演”。这一数据由开发者自发统计,统计仓库地址为 https://github.com/Octo-o-o-o/deepseek-harness-applicants 。

从目前公开信息看,DeepSeek已经在内部使用Harness完成DeepSeek-V4-Flash正式版的基准测试。社区开始猜测,DeepSeek未来可能会打造一款面向软件工程场景的AI Coding Agent。按照社区流传的说法,这款产品或将具备自主规划、工具调用、代码执行等能力,并围绕长周期Agent工作流加入Memory、项目仓库感知(Repo Awareness)等机制,定位上可能会对标Claude CodeCodex等现有Coding Agent产品。这些信息目前尚未得到DeepSeek官方确认。

不过,从此前公布的Harness基准成绩来看,DeepSeek测试的重点本身就集中在终端操作、多工具调用、全栈开发等长流程任务场景。业内一直有“Model+Harness=Agent”的说法:模型负责理解需求、推理和生成方案,Harness负责把这些能力落到真实环境中——调用工具、操作终端、读写文件、管理上下文、处理执行过程中的错误,最终完成一个完整任务闭环。DeepSeek Harness的定位逐渐清晰:它并不是一个单纯的代码生成工具,而是在模型和真实软件工程环境之间增加一层“执行系统”。

这一点在DeepSeek-V4-Flash成绩单中的五组基准里有所体现:Terminal Bench测试终端环境操作,Cybergym测试安全攻防能力,Toolathlon测试多工具调用,DSBench-FullStackDSBench-Hard则聚焦全栈开发任务。这些测试的共同特点是任务链条长、步骤多,需要Agent持续调用工具并根据反馈调整策略。DeepSeek选择测试的方向,更接近一个能够自主执行软件工程任务的Agent,这与社区流传的对标Claude Code、Codex等产品的目标一致。

除了基准之外,DeepSeek的生态动作也透露出类似信号。目前公开信息显示,DeepSeek-V4-Flash已支持Responses API,并适配Codex,走向标准化工具调用协议;识图模式正在灰度,用于补充代码Agent在理解架构图、报错截图等视觉信息上的能力。这些动作共同指向一个趋势:未来Coding Agent的竞争,不只取决于模型能力,也取决于模型之外的工程基础设施。

769份报名记录里,开发者关注的是一个非常现实的问题:当Agent需要独立完成一个真实工程任务时,哪些方面还需要优化?首先是长任务执行能力,这是Agent从Demo走向生产的第一道门槛。DeepSeek公布的五组基准,本质上都在测试Agent是否具备持续执行复杂任务的能力。从报名项目来看,智能体框架和编程智能体是最大的两个方向,合计242个,占全部项目约三分之一。Top 10高星项目中,deer-flow(79k星)探索长周期SuperAgent框架;CodeWhale(40k星)是由DeepSeek原生项目发展成的编程智能体框架;orca(36k星)关注多Agent编排。这些开源项目路径不同,但都在回答同一个问题:如何让Agent在“持续执行”上走得更远。

其次是上下文和记忆管理。当任务从几分钟延长到几个小时,Agent面临的除了推理能力问题,还有如何保存状态、理解项目历史,并在后续任务中正确调用已有信息。在报名统计中,记忆与上下文相关项目共有56个,累计194k星(剔除头部项目vllm的88k星后仍约106k星)。开发者正在尝试Git、数据库、知识图谱等不同路线,但Agent记忆目前仍没有统一答案。最后是评测和安全。研究与评测、安全治理两个方向各有24个项目,是报名生态中规模较小的类别,但决定着Agent能否真正进入生产环境。有开发者尝试建立跨Harness评测体系;有开发者则关注工具调用权限、文件系统隔离和代码执行沙箱。如果说长任务和记忆解决的是“Agent能不能完成任务”,那么评测和安全解决的就是“Agent能不能被放心使用”。

这三个方向对应了Agent从“能用”走向“好用”的关键迭代路径:长任务执行能力决定Agent能否完成复杂工作,上下文和记忆能力决定Agent能否持续参与长期项目,而评测和安全能力决定Agent能否被真正部署到生产环境。这也是Harness需要持续优化的核心方向。

DeepSeek官方尚未、也或许不会公布最终的筛选标准和名单。但从这份报名统计表来看,真正有价值的,是开发者们正在从不同角度探索Agent落地应用的路径。对于DeepSeek Harness团队而言,内测名单的意义,或许并不是寻找“最热门”的项目,而是找到能够在产品迭代过程中提供有效反馈的开发者。比如名单中,akashic-agent的作者于V4 Flash高思考强度模式运行TerminalBench2.1,拿到70.8%的成绩,是基于DeepSeek模型调优Agent运行时并给出实测结果的开发者。此外,open-design(83k星)、lobehub(81k星)、career-ops(63k星)等高星项目,都已经拥有一定用户基础,并处于Agent应用生态的上层,这些开发者长期面对真实用户和实际工作流,能够帮助DeepSeek了解Harness在不同场景中的使用需求。

随着Agent获得更强的工具调用和代码执行能力,权限控制、文件隔离、安全边界等问题会越来越重要。报名区中有开发者曾挖掘CodexClaude CodeCursor等产品漏洞,关注的正是这些Agent从Demo走向产品时必须面对的问题。当然,这份名单并非完整样本。由于评论区天然混杂报名、讨论和围观,加上提交格式不统一,部分项目仍存在身份无法确认、仓库失效、描述缺失等问题。统计档案也并非完全准确,核查过程中发现一些开源项目的分类出现错误,比如“我的世界机器人”被分到了安全领域,但总体上可以作为参考。同时,很多高星项目的报名也并非作者本人,有不少是仅提交过PR的参与者,并不能完全代表这些Agent项目。

DeepSeek Harness最终会是什么样,目前还没有答案。但这场由内测招募引发的开源项目“大摸底”,却揭露了Agent时代的竞争焦点。769份报名记录、712个开源仓库、120万Stars背后,开发者关注的是一个底层的问题:当模型具备越来越强的推理能力后,如何让它稳定、长期、可靠地完成真实任务。有人在解决长任务执行,让Agent不会跑到一半失控;有人在探索记忆和上下文管理,让Agent能理解一个持续演进的项目;有人在测试安全边界,确保工具调用和代码执行不会成为风险源。这些项目未必都会进入DeepSeek的内测名单,但它们提前勾勒出了一张未来Agent工程演进的路线图。

© 版权声明

相关文章

堆友更新