DeepSeek Harness v0.1.0-rc.8上线:14项更新补齐多模态,支持原生图片请求与图文混合输入
8月20日,据国内消息,DeepSeek Harness迎来公测后首次重要更新,v0.1.0-rc.8版本正式上线。此次更新共带来14项调整,多模态能力成为重头戏,正式补齐原生图片请求与图文混合输入,同时将Claude Code、Codex进一步接入其子代理体系,并集中修复了公测阶段暴露的一批问题。
DeepSeek Harness于8月13日正式开启v0.1版本公测并同步开源,其核心设计思路是"一切皆插件":模型、工具、技能、会话、沙箱、存储、循环、调度和UI等Agent能力,都可以由不同插件组合和替换。公测开放不到一周,这套Agent Harness便补上了多模态能力,迭代速度相当快。
多模态正式补齐:直接"看图"
rc.8版本最明显的变化,是DeepSeek Harness进一步补齐了多模态输入。根据官方更新日志,DeepSeek模型适配器现在可以通过配置启用原生图片请求:对于具备视觉能力的模型,Harness可以直接把图片送进模型处理,/goal、/plan等指令也已经支持图文混合输入。
同时,输入框中的@菜单新增文件和会话引用,用户可以直接把本地文件、已有会话等内容拉进当前任务。这意味着,过去主要围绕文本、代码和工具调用展开的Agent工作流,现在可以进一步把截图、图片等视觉信息纳入任务上下文。
图:新版支持原生图片请求与图文混合输入
纯文本模型也能"看图":OCR与像素分析拼出工具层视觉
除了原生多模态,一个有意思的设计细节也被开发者挖掘出来。有网友测试发现,当所调用的模型本身没有声明图像输入能力时,直接调用read_image会首先失败,但任务并不会就此停下——Harness随后会退化到另一套工具链:先进行OCR文字识别,再统计图片中的颜色比例、扫描部分像素行,同时读取图片尺寸、色彩模式等元信息。
一张包含文字和简单图形的图片,可以被拆成"文字内容及坐标""背景颜色比例""特定区域像素变化""图片尺寸"等多组信息,最后这些结构化结果会被重新交给文本大模型,让模型根据OCR文本、颜色占比、像素位置等证据"脑补"出整张图的大致内容。
这种能力和视觉大模型直接理解图片仍有明显区别:对于PPT截图、流程图、界面截图等结构相对明确的图片,它可以借助OCR和像素特征得到不少有效信息;面对真实照片、复杂空间关系等内容,这种工具链能够恢复的信息则会受到明显限制。但从Agent Harness的角度看,视觉能力并不完全绑死在底座模型上,工具也可以承担一部分感知工作。
事实上,在官方加强多模态支持之前,DeepSeek Harness社区已经围绕视觉能力出现了一批插件,包括dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision以及通过pi2dsh桥接的pi-vision等。其中一些方案就是通过OCR、像素分析、结构化证据或者独立视觉子代理,让纯文本模型间接处理图片。
图:海外开发者关注多模态支持与子代理集成
子代理体系扩充:Claude Code、Codex按需接入
子代理协作也是本次更新的重点。新版支持把Claude Code和Codex作为Profile Bundle按需安装,其中Codex支持非交互权限模式以及多个命名实例,方便在同一个任务中配置不同Codex子代理。
Windows用户这次也被重点照顾。DeepSeek Harness的PTY终端加入持久PowerShell会话,并在极简模式预设中默认开启,减少命令执行过程中频繁重建终端环境的问题。
除了新能力,这次更新还集中修掉了一批公测后暴露的问题:单张图片尺寸过大或历史会话中累积图片过多时可能导致的模型请求失败、取消流式生成后回复前缀无法带入下一轮提问或分叉会话、以及部分自定义OpenAI兼容网关因请求格式差异无法调用、推理内容回传缺失等问题,均已得到修正。
加速迭代:盯上多模态与子代理
除核心变化外,rc.8还加入了web_search并发查询、子代理reportDelivery及时唤醒父任务、本地运行dsh web自动打开浏览器等优化,并提升了大型历史会话分叉以及SQLite后端的读写性能。
图:工具层视觉方案让纯文本模型也能间接处理图片
从8月14日开放公测,到如今把多模态和更多子代理能力装进来,DeepSeek Harness仍处于快速迭代阶段。接下来值得期待的,是这套插件化Harness能否继续把更多模型、工具和Agent装进同一个体系,并跑出更复杂、更稳定的任务流程。