「先跑进三分钟,再压穿成本线」:NanoGPT Speedrun 给训练效率立了块记分牌

| | 1 次浏览

引言

这条新闻在 Hacker News 上热度并不高:Prime Intellect 发布了名为 NanoGPT Speedrun Frontier 的研究页面。表面看只是一份排行榜,但它背后是过去一年多 AI 开源圈产出密度最高的一场实验竞赛——把训练一个 GPT-2 规模模型的成本,从 2019 年的“三万美元级”一路卷到“几十美元级”。这个数量级的坍缩,不是靠某次单点突破,而是几百次公开可复现的小优化堆出来的。

这场竞赛在比什么

规则简单到近乎苛刻:在 8 张 H100 上,把 GPT-2(124M 参数)在 FineWeb 数据上训练到指定的验证损失(3.28),比拼谁用的墙钟时间更短。

  • 起点是 Andrej Karpathy 的 NanoGPT——一份以“可读性优先”著称的极简训练实现。2024 年年中,Keller Jordan 发起 nanogpt-speedrun 挑战,首条基准约为 11 分钟。
  • 此后纪录在社区成员之间反复易手,逐步压进 3 分钟以内。对照 OpenAI 训练 GPT-2 时约 3 万美元的成本估算,同等级训练的成本降幅超过两个数量级。
  • Prime Intellect(INTELLECT 系列去中心化训练背后的团队)长期为挑战者提供算力、托管榜单,自己也多次刷新纪录。此次的 Frontier 页面,相当于把散落在各处的纪录、配置与方法论,整理成一份可以持续追踪的前沿档案。

赢家不是模型,是那些“不起眼的小优化”

翻看纪录刷新史,几乎每一条都来自朴素到近乎枯燥的工程与算法改进:

  • Muon 优化器:Keller Jordan 等人提出,对动量做 Newton-Schulz 正交化,在同样步数下损失降得更快;
  • 榨干硬件:FlashAttention、FP8 矩阵乘、torch.compile、通信与计算重叠;
  • 架构微调:U-net 式跳跃连接、value residuals、logit softcapping、序列打包等。

单项收益往往只有百分之几,但叠起来就是数量级。更值得注意的是迁移效应:月之暗面在 Kimi K2 的训练中将 Muon 的改进版(MuonClip)用于万亿参数规模,并称显著节省了算力,随后将其开源。从一个教学仓库里的优化器,到万亿参数模型的生产线,中间只隔了一年多——这正是 speedrun 作为“研究风洞”的价值所在。

为什么一个“玩具基准”值得认真看

  • 迭代速度:常规大模型实验以周为单位,speedrun 以小时为单位。一年多的公开纪录更迭,等效于数百次高信号、低成本的对照实验。
  • 公开可复现:代码、配置、日志全部开源,任何人都可以挑战榜首。它把原本发生在封闭实验室里的超参数搜索,变成了一场竞技体育。
  • 但也有边界:不少技巧在 124M 上灵验,放大到更大模型就失效;基准目标是某个验证损失,并不等于“有用的模型”;而且省下的算力通常会被更多的实验次数吃掉——这是效率研究里典型的杰文斯悖论。

简短点评

NanoGPT Speedrun 最有意思的地方,不是某条具体纪录,而是它示范了一种低成本、高透明度的“元科研基础设施”:用极小的模型充当试验田,让方法层面的创新先在公开赛道上被验证,再向工业规模迁移。Muon 的路径已经证明了这条路走得通。当然,对一份 speedrun 排行榜保持清醒同样重要——它是效率研究的试金石,而不是模型能力的度量衡。但当“训练一个 GPT-2”从科研预算变成一顿饭钱时,受益的不只是刷榜的极客,还有所有想亲手摸一摸预训练的人。

评论(0)

暂无评论,来写第一条吧。