开源大模型追赶闭源旗舰的速度,正在超出多数人的预期。8 月 19 日,DeepReinforce 宣布推出 Ornith-1.5 系列开源模型,据 IT 之家援引博文的报道,其最大规模的 397B 模型性能媲美 Claude Opus 4.8,并在部分测试中超过后者;更值得注意的是,该系列引入了「自我改进循环」机制,让模型在学习过程中自己提出更困难的任务。旗舰级性能、开源权重、端侧可运行,这三件事同时出现在一次发布里,值得展开聊聊。
事件要点
- 发布方与时间:DeepReinforce 于 8 月 19 日宣布推出 Ornith-1.5 系列,模型开源。
- 核心训练机制:所谓「自我改进循环」,指模型在学习过程中不断自主提出更困难的任务,形成一个持续提升性能的训练闭环,减少对人工设计课程和标注数据的依赖。
- 三档规模覆盖不同场景:
- Ornith-1.5-397B:MoE 架构,总参数 3970 亿,官方称性能媲美 Claude Opus 4.8,部分测试超过后者;
- Ornith-1.5-35B-A3B:MoE 架构,总参数 350 亿,性能优于稠密模型 Muse-Glimmer-30B 和 Gemma-4-31B;
- 系列还包含更小规模的版本,报道称其量化版可在 iPhone 17 等手机上本地运行。
「自我改进」不是新词,但正在从论文走进发行说明
自我改进并不是全新概念。强化学习阶段的模型训练长期依赖人类偏好数据(RLHF),瓶颈也很明显:高质量人工标注昂贵且有限,模型的「教材」天然存在天花板。而自我对弈、自我出题的思路在 AlphaZero 时代就已验证过上限,问题在于如何安全地迁移到语言模型上:模型给自己出的题是否真的有效、答案由谁判定、会不会强化自身偏差。
Ornith-1.5 的做法是把这个循环显式地做进训练流程,模型主动构造更难的任务,再在解题中提升自己。如果这一方法随开源一起被完整披露并可复现,其价值可能不亚于模型权重本身,出题能力的自动化,直接关系到数据飞轮能转多快。当然,此类机制也天然存在「自我验证」的难题,模型既是考生又是出题人时,评测的可信度需要外部锚点。
一杯三档:MoE 与端侧的实用主义
从产品策略看,Ornith-1.5 的三档布局相当务实。397B 是扛起跑分的旗舰门面;35B-A3B 则是开发者最该关注的「甜点杯」,按照通行的命名惯例,A3B 意味着约 30 亿激活参数:推理成本接近一个 3B 小模型,能力却对标 30B 级稠密模型。对需要自建推理服务的团队来说,这种总参大、激活小的 MoE 结构,几乎是性价比的代名词。
端侧版本同样契合当下趋势。量化版能在 iPhone 17 这类手机上运行,背后是量化格式与本地推理框架生态多年成熟的结果。隐私不出设备、离线可用、零边际调用成本,加上操作系统层面正在为本地 AI 铺路(Windows 给 NPU 装仪表盘就是一例),本地小模型正在从极客玩具变成正经的部署选项。
对跑分保持一分冷静
「部分测试超过 Claude Opus 4.8」这类表述,历来需要谨慎对待。基准测试存在污染与过拟合的可能,「部分超过」与「整体更好用」之间也常有距离。真实场景下的长链路任务、代码工程、多轮工具调用表现,往往要等社区独立评测和实际使用反馈才能下结论。
但开源的意义恰恰在这里:权重可下载、方法可审视、结果可复现。闭源旗舰的性能声明只能选择相信,开源模型的声明可以被整个社区验证、证伪乃至改进。
简短点评
Ornith-1.5 最值得记住的不只是「逼近 Opus」,而是把「自我改进循环」从研究术语变成了发行说明里的常规特性。如果这条路被验证有效,训练数据的瓶颈将被进一步松动,开源与闭源的差距也会加速收窄。对普通开发者,我的建议很直接:397B 看个热闹就好,认真试试 35B-A3B 的量化版,在你的笔记本或手机上跑一跑,能不能用,你的任务说了算。