基准之外,体感登场
在 AI 编码工具的讨论里,基准分数越来越难回答那个最实际的问题:我到底该用哪个?终端里的编码智能体如今是许多开发者的日常主力,而 Anthropic 的 Claude Code 与 OpenAI 的 Codex,是当下最常被放在同一张桌上比较的一对。
8 月 21 日,一篇题为《Quick impressions: A week of using Codex more than Claude》的博客文章被贴到 Hacker News。作者的做法很直接:一周之内,把更多的编码工作交给 Codex,Claude 退居对照位置,然后记录下快速印象。讨论规模不大,19 个赞、4 条评论,但这恰恰是耐人寻味之处:换用笔记已经多到不再成为新闻。
事件要点
从标题和定位就能看出,这篇文章写的是“快照”,不是评测:一周时间、单一开发者、明确标注为初步印象。而这类文章真正能提供信息的,往往也不是“谁赢了”的结论,而是基准测试难以覆盖的那些维度——对既有代码库的理解程度、任务拆解的自主性、改动幅度是否可预期,以及日常交互中的种种摩擦。
Hacker News 上的少量讨论也是如此:回应者更多是带着自己的使用经验来对照,而不是争论模型名次的输赢。这个现象本身比任何单一结论都更有信息量。
值得注意的是,“换用一周”正在成为一种固定文体。当一款工具值得开发者认真换用一周、再专门写篇文章,通常说明两件事:其一,两者的差距没有大到一边倒;其二,切换成本已经低到值得试一试。这两点加在一起,恰恰是市场竞争进入成熟阶段的标志。
背景:终端 Agent 的两年缠斗
把镜头拉远一点看,这场对比的背景是终端编码智能体过去两年的快速缠斗。Claude Code 在 2025 年率先把“终端里的智能体”做成主流形态,把权限确认、上下文压缩、批量改动这些交互范式固化下来;OpenAI 随后以 Codex 应战,从 CLI 工具到云端后台任务,再到与 ChatGPT 订阅捆绑,节奏紧凑。两家在模型能力、上下文管理、沙箱与权限模型、订阅额度上反复拉锯,功能清单几乎逐月对齐。
但另一个趋势更值得留意:Agent 的操作面反而在走向标准化。AGENTS.md 让仓库自己声明给智能体的规则,MCP 让工具接入不再绑定单一客户端。这意味着上层工作流的迁移成本在持续下降,模型可以是变量,工作流才是资产。开发者今天写下的换用笔记,本质上是在为这种可迁移性做注脚。
简短点评
单人一周的印象,样本是一人一仓库,参考价值天然有限,不必把任何一条感受当成选购指南。但它的价值恰恰在于基准测试照不到的地方:“用起来顺不顺手”这种体感,最终决定一款工具能在开发者的 PATH 里待多久。
对普通开发者的建议或许可以压缩成一句话:跟着工作流选工具,别跟着发布周期换工具。同时留意 MCP、AGENTS.md 这类正在成形的约定,它们才是让你在下一轮模型竞赛中保持选择自由的东西。至于 Codex 和 Claude Code 谁更强,答案大概每个季度都会刷新一次,而这,可能正是这场竞争最健康的地方。