「图片进了命令行」:DeepSeek Harness 多模态更新,V4 视觉版呼之欲出

| | 1 次浏览

距离发布仅过去七天,DeepSeek 的 AI 编程工具 Harness 就完成了新一轮功能更新。这次的关键词是多模态:图片正式进入命令行工作流,而配置文件里一个不起眼的开关,还顺带透露了 V4 视觉版的可能时间表。(IT 之家

图片是怎么进来的

具体拆开看,这次更新动了三层:

模型层:DeepSeek 模型适配器现在支持配置启用原生图片请求。需要说明的是,DeepSeek V4 本身尚未发布支持视觉的版本——但如果用户把后端换成第三方的视觉模型,就可以在配置中手动开启图片输入。适配器先把路修好,等自家视觉模型到位即可直接通车。这也是外界猜测“DeepSeek 视觉版在路上”的主要依据。

交互层:此前只能接收纯文本的 /goal/plan 等命令,现在可以带图发送;@ 引用的范围也从文件扩展到了历史会话。也就是说,一次提问里,截图、本地文件和过往对话可以同时挂载。

基础设施层:MCP 与 ACP 支持持久化图片附件,附件不再随单次调用结束而消失;PTC Mode 可以转发嵌套图片。这些底层改动其实在上一轮更新中就已铺垫完毕。

此外,这次还修复了图片场景下最容易踩的两个坑:图片尺寸过大导致模型请求失败,以及多轮对话中的相关问题。

为什么开发者需要“看图”

对编程场景来说,多模态不是锦上添花。开发者的日常输入里有大量天然以图像形式存在的素材——UI 截图、设计稿、报错弹窗、监控面板。纯文本时代的做法是人工转录或 OCR,不仅繁琐,排版、颜色这类视觉信息在转录过程中几乎必然丢失。把图片直接挂进对话,“看图改代码”才真正形成闭环:报错截图直接丢进去,设计稿直接圈出来,工具自己去理解。

更值得注意的是“Harness”这个概念本身。Harness 直译是“挽具”,在 AI 语境里指围绕模型搭建的任务框架——模型负责生成,Harness 负责理解目标、拆解任务、组织素材、调度工具。无独有偶,MiniMax 刚发布的 MiniMax Design 也自称“多模态创作 Harness”。当各家模型的能力差距逐渐收窄,Harness 的设计正在成为差异化竞争的主战场。

竞争焦点正在转移

把这次更新放进行业背景里看会更有意思。Claude Code 刚被社区催着支持 AGENTS.md,试图给 AI 编程工具立一份“README 规范”;VS Code 1.134 把 AI 聊天窗口纳入正经工作区;Codex 则还在为权限过大导致误删文件的问题善后。可以看出,AI 编程工具的竞争焦点正从“能不能写代码”转向“能不能可靠地融入既有工作流”——上下文管理、附件引用、权限边界,这些不起眼的细节决定了工具是被留下来,还是被卸载。

七天两次更新的节奏,也说明 Harness 不是模型的附属演示品,而是被当成正经产品线在经营。对 DeepSeek 而言,视觉能力是追赶第一梯队的必经之路——主流闭源模型大多已完成图像输入能力的补课,纯文本模型的护城河正在变窄。适配器里预留的开关,与其说是彩蛋,不如说是路线图。

一点保留意见

当然,给工具“装眼睛”只是第一步。图片进入长上下文之后,token 成本、检索精度、多轮对话中的信息保持,都是比“能发图”难得多的问题——这次修复的恰好是其中最基础的坑。V4 视觉版何时发布、效果如何,仍有待观察。但至少在工程节奏上,DeepSeek 展示出了一种清晰的产品思路:先把工作流的地基打好,模型到位之日,就是能力兑现之时。

评论(0)

暂无评论,来写第一条吧。