靠合成数据续命大模型?图灵奖得主萨顿:这会是下一个“苦涩教训”

| | 1 次浏览

引言

高质量人类文本即将“见底”,是这轮大模型竞赛最现实的瓶颈之一。当各家公司在授权协议、爬虫条款和各种新奇数据源之间辗转腾挪时,合成数据被不少团队视为续命良方,用模型生成数据再喂给模型,理论上可以无限量产。但强化学习先驱、图灵奖得主里奇·萨顿(Rich Sutton)最近给出了截然相反的判断。

事件要点

IT之家报道,萨顿在红杉资本本周发布的播客节目中,被问到“合成数据能否帮助大语言模型持续扩展”时,回答得毫不客气:“这绝对是个大错误。也许这会成为下一条重要的经验教训。”

他所说的合成数据,指由算法或 AI 模型生成的信息,而非来自真实世界的原始数据。如今这类数据已经无处不在:自动驾驶公司用计算机生成的道路图像训练感知系统,金融风控用虚构的交易记录训练欺诈检测。而在大模型训练侧,“用旧模型生成语料、再拿去训练新模型”的自举做法,正在从权宜之计变成常规操作。

耐人寻味的是,报道同时指出了一个微妙的现实:某种程度上,科技巨头自己也认同这一风险,正不惜代价寻找更多真实数据,从与出版机构、社交平台签订授权协议,到押注各种新型专有数据来源。

背景:一个老问题的两副面孔

萨顿的警告并非孤例。学术界的担忧可以追溯到“模型崩溃”研究:2024 年发表于《自然》的一项研究显示,当模型反复以自己生成的数据为主要训练来源时,分布尾部的信息会逐代流失,输出趋于同质化,性能不升反降。直观地说,合成数据像“复印件的复印件”,越拷越糊。

但问题的另一面同样成立,合成数据并非没有战绩。AlphaGo 与 AlphaZero 靠自我对弈(本质上就是高质量合成数据)超越了人类千年的棋类经验;数学与编程领域因为存在可验证的奖励信号,模型可以生成解题路径、筛出正确答案、再用于训练,近年推理模型的进步正是沿着这条路径狂奔。不少开源小模型也借助大模型蒸馏出的数据,获得了远超自身参数量级的能力。

分歧的关键在于“合成”的成色。自我对弈之所以有效,是因为棋盘规则提供了无情的裁判;推理数据之所以有效,是因为代码能否运行、证明是否成立可以自动校验。而互联网风格的开放式文本没有这样的裁判,一段“像模像样”的编造与一段真实陈述,在统计上可能难以区分。萨顿反对的,恐怕正是后者:用没有外部反馈校验的模型输出,去替代承载真实人类经验与意图的语料。

这也与他一贯的立场一脉相承。萨顿在 2019 年那篇著名的《苦涩的教训》中指出,AI 研究七十年来的反复教训是:依赖人类手工归纳的知识结构,终归敌不过算力加大规模学习。而他近年反复强调的“下一课”,是让智能体通过与环境交互、从真实经验中学习,那恰恰是一种有真实反馈做地基的“合成经验”。换言之,他批评的不是合成数据本身,而是“没有落地根基的数据自举”这条捷径。

简短点评

对从业者来说,这盆冷水的价值不在于站队,而在于提醒:数据战略正在从“抢存量”转向“造增量”,但造增量的方式有高下之分。可验证领域(代码、数学、工具调用)的合成数据已被证明是富矿;而无校验的开放式文本自举,短期或许能撑住跑分,长期可能在悄悄掏空模型的真实性与多样性。对大量依赖合成语料的小模型团队和垂直领域厂商,这一点尤其值得警惕。

苦涩的教训之所以苦涩,往往因为它是事后才被普遍承认的。这一次,萨顿提前把话挑明了,至于行业听不听,就要交给时间检验。

评论(0)

暂无评论,来写第一条吧。