用 AI 产品久了的人,多半有过这种「玄学」时刻:同一个模型、同一份提示词,昨天还能一步步拆解问题,今天就草草交差。过去大家习惯把锅甩给「模型状态」或「服务器心情」,最近一位开发者给出了更具体的解释——你可能只是被分进了实验组。
事件要点
8 月 22 日,开发者 argofowl 在 X 上发帖,称 Anthropic 疑似正在 Claude Code 中进行 A/B 测试,内容是对部分用户下调「努力程度」(effort level)。这条观察随后被搬到 Hacker News 讨论。
这里的关键词是 effort。对编程 Agent 来说,它大致对应模型在给出答案前愿意投入多少推理深度——是老老实实读完全部上下文、多跑几轮工具验证,还是扫一眼就动手、快速交差。它不改变模型权重,却实实在在地改变输出质量与 token 消耗。
需要强调的是,目前这仍属于「疑似」:Anthropic 未公开确认存在此类实验,也没有披露实验设计。但这个观察之所以引发共鸣,是因为它戳中了 AI 产品一个长期悬而未决的问题,你按月付费订阅的那个模型,到底是什么?
背景与影响
A/B 测试本是互联网产品的基本功。按钮换成什么颜色、推荐流先出哪条内容,都靠分组实验拿数据,用户早已见怪不怪。但模型行为层面的分组实验,性质不太一样:订阅制 AI 用户付钱买的不是界面,而是模型能力本身。静默调整 effort,相当于在没人注意的情况下改了商品配方。
这种担忧并非空穴来风。2023 年底,大量用户抱怨 ChatGPT「变懒」,OpenAI 后来承认模型更新可能带来行为变化;同年斯坦福与伯克利研究者的实证研究也显示,GPT-4 与 GPT-3.5 在多项固定任务上的表现会随版本更替漂移,答案长度、任务完成率都可能悄悄变化。用户感知到的「时好时坏」,很多时候并不是错觉。
从商业动机看,这类实验也不难理解。Claude Code 这类终端 Agent 是 token 消耗大户,推理链拉得越长、工具调用越勤,成本越高。effort 恰好是那个最顺手的旋钮:拧小一点,响应更快、成本更低,多数日常任务未必能察觉差别。问题在于,谁被分进低档、实验跑多久、依据什么标准分组,用户一概不知,甚至没有渠道确认自己当下拿到的是哪一档。
对把模型当作基础设施的开发者来说,这还牵出可复现性问题。今天评测跑通的 Agent 工作流,明天可能因为某个隐性配置而失灵,且无从归因,你分不清是自己的提示词出了问题,还是对面换了实验分组。没有版本锁定、没有行为快照,「模型即依赖」的工程范式就始终缺一层保险。这也解释了为什么不少团队坚持在关键链路上做多模型冗余:与其赌供应商的行为一致性,不如提前留好后路。
简短点评
平心而论,A/B 测试不是原罪。产品迭代离不开数据,AI 公司也确实需要在质量与成本之间找平衡,尤其是在推理成本高企的 Agent 场景里。真正的问题在于披露方式:互联网产品改个按钮颜色尚且会写进更新日志,直接影响输出质量的模型行为调整,反而可以完全无声进行。
比较合理的做法其实并不复杂,公开告知存在行为层面的实验,给订阅用户提供档位开关或版本锁定选项,把选择权交回用户。对 Anthropic 这类把「负责任的 AI」当作核心叙事的公司来说,这一点尤其值得做:用户可以接受模型分明码标价的高中低档,但很难接受自己不知道拿到的是哪一档。信任一旦开始折旧,可比推理成本贵多了。