「话痨税催生保洁岗」:Vomit 让一个 LLM 专门清理另一个的输出

| | 1 次浏览

大模型这两年一边变聪明,一边稳定地变啰嗦。回答要先复述一遍问题,中间垫上“当然”“需要注意的是”,结尾再补一段总结与免责声明。人类读者扫一眼就能跳过这些内容,但在自动化管线里,每一个 token 都是账单上的真金白银。本周,一个叫 vomit 的开源项目登上 Hacker News(讨论帖,45 分、31 条评论),作者 zachahn 的方案朴素得近乎好笑:既然 Claude 5 的输出充满"token 呕吐物",那就再请一个模型专门负责擦。

一个“保洁员”模型的工作日志

从仓库描述看,vomit 的定位是 Claude 5 输出的后处理器:调用另一个 LLM,把冗长回答中的寒暄、重复、铺垫和免责式补充剥离掉,压缩信息密度后,再交给下游程序或下一个模型使用。名字起得直白,问题也是真的——所谓 token vomit,指的就是模型在正式内容之外倾泻的那些“礼貌性废话”。

单次聊天里,这顶多影响阅读体验;麻烦出在 Agent 工作流。上一步的输出往往被整体塞进下一步的上下文,冗余于是被链式放大:一次啰嗦是噪音,十次嵌套就是成本黑洞,而输出 token 的计价通常还要比输入贵上数倍。

HN 评论区吵的也正是三件事:

  • 成本挪移而非消除。 多调一次模型,就多一份延迟和费用。“用模型擦模型”到底是在省钱,还是把账单从一个科目挪到另一个科目,取决于清理模型的价目表和实际压缩率。
  • 有损压缩的风险。 清理模型自己也可能删掉有用信息,甚至顺手改写语义。上游的幻觉问题没解决,下游又叠了一层二次蒸馏的失真,出了错很难追责。
  • 治标不治本。 冗长很大程度上是训练出来的“人格”,是偏好详尽、礼貌、爱解释的对齐过程的副产品。提示词约束和后处理都是在下游打补丁,上游不改,补丁永远要打。

话痨是训出来的

值得说明的是,模型的啰嗦并非缺陷,而是对齐的副作用:奖励机制天然偏爱周全、谨慎、解释性强的回答,安全训练又让模型习惯堆叠限定语。在聊天产品里,这叫得体;在 Agent 场景里,这叫负债。

生态其实已经在分层应对:小模型被派去干路由、摘要、清理这类脏活;JSON Schema 之类的结构化输出把格式钉死;各家厂商也陆续提供控制输出详略的开关。vomit 属于同一潮流里更“手工”的一种——不动提示词、不改调用方,只在输出端加一道 minify 工序,思路接近前端工程里压缩脚本的老传统。

但“模型管理模型”的中间层并非没有隐忧:日志被二次加工之后,可审计性会明显下降——出了问题,你很难分清是原始输出的错,还是清理环节的错。对医疗、金融这类强调留痕与合规的场景,这层额外的保洁工序反而可能成为新的负担。

结语

一个胶带式的补丁工具能冲上热榜,说明痛点足够真实。AI 落地的成本不只来自算力,也来自这种隐蔽的“话痨税”。工程界的惯例向来如此:先用一个模型去补另一个模型的短板,等上游把“简洁”做成可训练、可控的旋钮,这类一次性中间件就会被悄悄扔掉。在那之前,不必惊讶于越来越多的流水线里,站着一个专门擦口水的模型。

评论(0)

暂无评论,来写第一条吧。