「马具赢了马」:英伟达把 Agent 的功劳记给脚手架

| | 1 次浏览

这两年 AI Agent 领域有一条默认的叙事主线:模型决定一切。上下文窗口多长、推理步数几步、基准榜上几分,构成了一块不断刷新的军备竞赛记分牌。Agent 产品不好用?“等下一代模型就好了”——这句话几乎成了工程投入不足时最顺手的挡箭牌。

英伟达最近的一项研究,在这条叙事线上撕开了一道口子。据 TechCrunch 报道,英伟达的研究表明:即便基础模型本身并不擅长某项任务,只要配合得当的微调与外围工程,Agent 依然可以把任务做得有声有色,而且不会“跑偏失控”。报道的标题说得更直白——如今真正的英雄是 harness,而不是 AI 模型。

harness:既是马具,也是脚手架

harness 的本义是马具:一套皮带与挽具,负责把马的原始力量转化为可控、可用的拉力。在软件工程语境里,它指围绕模型搭建的整套执行框架——工具调用与重试逻辑、上下文的压缩与检索、权限边界与沙箱隔离、错误恢复机制,以及最容易被忽视的一环:评估与回归测试体系。

模型负责“能不能”,马具负责“稳不稳、敢不敢放出去跑”。这层区分并不新鲜,但长期以来,业界注意力几乎全押在前者身上。

微调做了什么

这项研究里最值得咀嚼的细节,是“不失控”这一点。

Agent 落地时最让工程师头疼的,往往不是任务做不出来,而是做着做着就跑偏:陷入死循环、幻觉出不存在的工具、对文件系统做越权操作。传统解法是加提示词、加护栏、换更强的模型。而英伟达的结论指出一条更经济的路径:通过针对性微调,把“任务边界在哪里、出错时如何收场”这些约定,从提示词层面的临时叮嘱固化到权重层面的肌肉记忆里。模型不必是最聪明的,但可以是训练有素的。

换句话说,马具与马之间的界线本身就是流动的——一部分“马具”可以通过微调内化进模型。这也是为什么研究的功劳簿上,主角的位置发生了移动。

业界早有伏笔

平心而论,这个结论并非凭空出现。Anthropic 的 Claude Code 团队在多次公开分享中都提过,Agent 可靠性的大头藏在模型之外的工程细节里;开源社区里各类 Agent 框架的快速迭代——工具编排、会话状态管理、失败恢复——本质上都是在打磨越来越精细的马具。英伟达这项工作的价值,在于用更系统的方式把这套散落的行业经验验证了一遍,并且给出了一个不太好听但很重要的推论:模型能力的边际差距,正在被工程层的差距迅速抹平。

对开发者意味着什么

其一,不必 all in 最强模型。 在任务明确、边界清晰的场景里,“中等模型 + 好马具”的组合,很可能比“顶级模型 + 裸奔”更便宜也更稳。这对预算有限的中型团队是个实打实的利好。

其二,Agent 工程师的价值被重新定价。 过去被视为“给模型打杂”的外围工程——沙箱、重试、状态机、评估集——正式从配套角色升为主战场。会写提示词不算本事,会搭一套让平庸模型稳定交付的马具才算。

其三,评测的意义发生位移。 当工程层可以显著改写最终表现,通用基准分数与产品体验之间的相关性就会持续走低。真正值钱的评估,是围绕自己业务场景构建的私有测试集:你的马具好不好,只有你自己的赛道说了算。

一点保留

当然,结论不宜推向另一个极端。模型能力依然是地基——马具再精良,也造不出一匹马;前沿模型在长程推理与复杂泛化上的优势,仍是工程手段难以完全替代的。这项研究真正的启示在于:当主流模型的能力普遍跨过“够用”门槛之后,竞争的重心正在从模型层移向工程层。

对做产品的团队来说,这或许是个久违的好消息——你不必每次都守着模型厂商的发布会过日子。你的手艺,就长在自己的代码库里。

评论(0)

暂无评论,来写第一条吧。