开源大模型的常规剧本大致是:放出最终权重,配一份技术报告,宣布若干榜单分数,然后收场。至于这些权重在训练途中经历了什么、能力在哪个阶段成型,外界通常无从知晓。8 月 20 日,蚂蚁百灵团队给这个剧本加了一段新情节:在已开源的 Ling-3.0-tiny 与 Ling-3.0-flash 之外,又放出了两者的 Base 版本,而且不止给"成品",连训练途中的中间权重也一并交了出来(IT之家)。
这次开了什么
按官方说明,本次开源覆盖两个模型的三个训练节点,合计 6 个 checkpoint:
- 预训练 checkpoint:完成大规模预训练,尚未进行中期训练、WSM 合并与后训练;
- 中期训练 checkpoint:中期训练完成后冻结,仍未做 WSM 合并;
- WSM 合并 checkpoint:在中期训练基础上完成 WSM 合并,只差最后一步后训练。
这里的 Base 模型,指未经特定任务微调与偏好对齐的基础模型。从 Ling 系列以往技术报告的用语看,WSM 大致对应面向网络搜索与数学等能力的增强与权重合并环节。换句话说,从"生肉"到"差一步上桌",每个火候节点的权重都被保留并公开了——完成 WSM 合并、尚未后训练的节点,正是一份可以拿去做下游改造的底座。
为什么值得在意
对普通使用者来说,Base 模型并不好用:它不会规规矩矩回答问题,也谈不上安全对齐。它的价值在另一群人手里。
研究者是第一类受众。 大模型训练中的能力涌现、灾难性遗忘、数据课程效应,长期缺乏直接证据,因为几乎没人能拿到中途的权重。此前 EleutherAI 的 Pythia 项目专门为研究保存了上百个中途 checkpoint,AI2 的 OLMo 也走了"数据、代码、权重、中间产物"的全开源路线,但这类实践在更贴近生产级的模型上仍然少见。Ling-3.0 把这件事往前推了一步。
需要深度定制的团队是第二类。 从接近完成的 WSM 合并节点起步做自己的后训练,意味着可以跳过最烧钱的预训练阶段;想注入领域语料继续预训练的,也有中途节点可作为参照系,评估注入带来的偏移。
第三类是旁观者。 蚂蚁的 Ling 团队此前以"算力受限下如何训大模型"的研究为外界所知,曾发表论文讨论在低带宽、弱连接的集群上训练大模型。这次开放训练过程,与该团队一贯偏研究友好的姿态是连续的,也延续了国内从 Qwen、DeepSeek 到 GLM 的开源惯性。
影响与边界
当各家开源模型的权重性能逐渐趋同,差异化的空间正在转向透明度——谁的过程更可研究、可复现、可分叉。中间 checkpoint 正是这种"过程资产"的一部分。它不会直接转化为榜单分数,却会累积成一种更慢、更实的信用。
当然,边界依然清晰:6 个节点不等于完整训练日志,数据配比、清洗细节、超参曲线大概率不会全量公开,谈"完全可复现"为时尚早。对多数开发者而言,先期开源的对话版本仍是更实际的选择;Base 与中间产物的受众,本来就该是研究者和要做深度改造的团队。
一点看法
把"半成品"也当作开源资产交出来,这个动作本身比一次跑分更值得记一笔。有意思的是对照:同一天的新闻流里,Google 正因为把 Android 部分源码改成表单申请加网盘发放,被 GrapheneOS 指为违反 GPLv2。开源世界的方向感并不一致——有人在收缩流程,有人在加码透明。Ling-3.0 这 6 个 checkpoint 未必会立刻改变什么,但它至少示范了另一种可能:开源的诚意,不只体现在最终权重的许可证上,也体现在愿意让人看见来路。