DeepSeek Harness更新14项,多模态输入上线

AIGC行业资讯10小时前发布 zhang
4 0

8月20日,DeepSeek Harness迎来公测后的首次重要更新,v0.1.0-rc.8版本正式上线。此次更新共带来14项调整,覆盖多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个方向,其中多模态能力成为重头戏,补齐了Agent处理图片等任务的能力。

新版DeepSeek Harness支持原生图片请求和图文混合输入,/goal、/plan等命令也可以直接接收图片。同时,输入框中的@菜单新增文件和会话引用,用户可以将本地文件、已有会话等内容拉入当前任务。这意味着,过去主要围绕文本、代码和工具调用展开的Agent工作流,现在可以进一步将截图、图片等视觉信息纳入任务上下文。

在子代理体系方面,新版支持将Claude Code和Codex作为Profile Bundle按需安装。其中,Codex支持非交互权限模式以及多个命名实例,方便在同一任务中配置不同子代理。Windows用户也得到重点照顾,PTY终端加入持久PowerShell会话,并在极简模式预设中默认开启,减少命令执行过程中频繁重建终端环境的问题。

除了新能力,这次更新还集中修复了一批公测后暴露的问题。例如,当单张图片尺寸过大或历史会话中累积图片过多时,可能导致模型请求失败,新版对此进行了处理。取消一次流式生成后,已显示的回复前缀此前可能不会被带入下一轮提问或分叉会话,这一问题也已修正。对于使用自定义OpenAI兼容网关的开发者,新版修复了部分网关因请求格式差异而无法调用,以及推理内容回传缺失的问题。

一个有意思的细节是,开发者发现DeepSeek Harness在处理图片时,若所调用模型本身不支持图像输入,它会退化到另一套工具链:先进行OCR文字识别,再统计图片中的颜色比例、扫描部分像素行,同时读取图片尺寸、色彩模式等元信息。这些结构化结果会被重新交给文本大模型,让模型根据OCR文本、颜色占比、像素位置等证据“脑补”出整张图的大致内容。这种能力与视觉大模型直接理解图片有明显区别,对于PPT截图、流程图、界面截图等结构相对明确的图片,它可以借助OCR和像素特征得到不少有效信息;面对真实照片、复杂空间关系等内容,恢复的信息则受到明显限制。

事实上,在官方加强多模态支持之前,DeepSeek Harness社区已经围绕视觉能力出现了一批插件,包括dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision以及通过pi2dsh桥接的pi-vision等。其中一些方案就是通过OCR、像素分析、结构化证据或独立视觉子代理,让纯文本模型间接处理图片;也有开发者通过自定义路由,为本身支持视觉的模型配置input: [text, image],直接接收图片。rc.8上线后,原生多模态模型和这类工具层视觉方案可以进一步配合使用。

DeepSeek Harness于8月13日正式开启v0.1版本公测并同步开源。公测当晚,智东西曾第一时间拉取源码进行实测,用它完成88页论文翻译、贪吃蛇游戏开发等任务。仅过去不到一周,这套Agent Harness就把多模态补上了。公测时团队强调,其核心设计思路是“一切皆插件”:模型、工具、技能、会话、沙箱、存储、循环、调度和UI等Agent能力,都可以由不同插件组合和替换。当Agent Harness拥有越来越丰富的工具和子代理后,一些原本依赖单个模型能力的任务,也可以通过工具编排被重新拆解和实现。

此次rc.8继续强化了这种插件化思路:视觉模型可以原生接收图片,纯文本模型也能借助视觉工具获得部分图像信息;Claude Code和Codex则可以作为子代理按需装进同一套Harness中。除了这些核心变化,rc.8还加入了web_search并发查询、子代理reportDelivery及时唤醒父任务、本地运行dsh web自动打开浏览器等优化,并提升了大型历史会话分叉以及SQLite后端的读写性能。

从8月14日开放公测,到如今把多模态和更多子代理能力装进来,DeepSeek Harness仍处于快速迭代阶段。接下来值得期待的,是这套插件化Harness能否继续把更多模型、工具和Agent装进同一个体系,并跑出更复杂、更稳定的任务流程。

© 版权声明

相关文章

堆友更新