AI 圈最近又玩起了「猜猜我是谁」的老游戏。8 月 20 日,全球最大的模型聚合平台 OpenRouter 悄悄上架了一款名为 Ox Alpha 的匿名模型,免费开放一周。没有任何官方介绍,没有机构署名,但几天之内,它的跑分就在开发者社区里炸开了锅。
事情经过
据 IT 之家报道,开发者 Ben Davis 将这个来历不明的模型送上了 DeepSWE 基准测试。与那些喂合成题目的编程基准不同,DeepSWE 衡量的是模型读取真实代码库、识别漏洞并生成有效补丁的能力,更接近工程现场的脏活累活。在十项测试任务上,Ox Alpha 的平均得分约为 80%,成绩单大致如下:
| 模型 | DeepSWE 十项任务平均分 |
|---|---|
| Ox Alpha(匿名) | 约 80% |
| Claude Fable 5(max) | 65% |
| GLM-5.3(max) | 62% |
| Grok 4.6(xhigh) | 62% |
| GPT-5.6 Sol | 52% |
也就是说,这个无名模型把 Anthropic、OpenAI、xAI 的当家编程模型集体甩在了身后。Davis 本人也坦言,鉴于模型来源不明,这个结果让他困惑不已。而外界的推测线索,大多指向了智谱(Zhipu)。
为什么是「匿名上架」
用化名偷跑测试,其实是行业里的保留节目。此前 LMArena 上出现过 gpt2-chatbot 等神秘代号,后来被证实是 OpenAI 新模型的隐身内测。逻辑并不复杂:挂上真名,用户会带着品牌预期打分;隐姓埋名,收到的才是对能力本身的裸反馈,同时还能顺带收集真实世界的推理流量。OpenRouter 这次的一周限免,玩法如出一辙。
线索指向智谱也不算意外。GLM-5.3 max 拿下 62% 已经说明其编程智能体的第一梯队水准;如果 Ox Alpha 真是智谱的下一代模型,从 62% 到 80% 的跨越幅度才是真正值得关注的信号——那意味着差距不是「接近」,而是「反超」。
几盆冷水
不过在下结论之前,有几点需要冷静看待:
样本太小。 十项任务、单一测试者,统计波动空间很大。DeepSWE 单项任务通过与否往往是零一分布,一两个任务的差异就能撬动十几个百分点。
匿名配置可能是「满血版」。 隐身模型常被开到最大的推理算力与尝试次数,正式发布时的默认配置未必如此,历史上有过「测试版惊艳、商用版缩水」的先例。
基准不等于体验。 漏洞修补是一回事,日常代码生成、上下文理解、工具调用是另一回事。开发者最终会用脚投票的是综合成本与稳定性。
简短点评
抛开真假悬念,这件事本身透露了一个有趣的趋势:用户越来越只认分数、不认牌子。当一款匿名模型能在榜单上把一线大厂挑落马下,说明品牌溢价在编程模型这个赛道正在快速贬值,这是好事。
但真正的分水岭从来不在隐身跑分,而在正式发布后的两件事:价格和开放策略。近期的降价潮已经说明,编程模型的竞争正从「谁更能跑」转向「谁更便宜地能跑」。如果智谱最终认领 Ox Alpha 并延续其开源路线,冲击会更为实质;如果只是一次营销式的悬念造势,热闹过后留下的东西有限。
一周限免期还剩几天,感兴趣的读者不妨亲自上手验一验货——毕竟在猜谜游戏里,亲手测试永远比看榜单纯靠谱。