「先复现论文,再谈新发现」:DeepMind 旧部把 AI 队友送上实验台

| | 1 次浏览

当「AI 队友」盯上了实验室

近两年智能体的应用清单越拉越长:写代码、订机票、做报表。如今有人想把它们塞进白大褂。据 TechCrunch 报道,由 DeepMind 校友创办的英国 AI 公司 Inherent 发布了一款名为 Faraday 的 AI 智能体,并宣称它在复现科学论文这项任务上击败了 Anthropic 和 OpenAI 的模型。报道同时指出,复现论文的能力,或许正是通往「AI 驱动创新」的垫脚石。

事件要点

  • 公司背景:Inherent 是一家设在英国的 AI 实验室,创始团队有 DeepMind 背景。近几年 DeepMind 系创业者遍布各赛道,从基础模型到垂直应用,科研自动化是其中颇为引人注目的一支。
  • 产品形态:Faraday 被官方称为「teammate」(队友),而非工具或助手。措辞上的差异折射出产品定位——它瞄准的不是一次性问答,而是与人类研究员的长期协作。
  • 核心主张:Inherent 声称 Faraday 在复现科学研究的评测中跑赢了 Anthropic 与 OpenAI 的前沿模型。所谓论文复现,即依据已发表论文的方法描述,重新实现其实验并验证结论,这是衡量「AI 能否真正做科研」最朴素的一把尺子。

复现:科学界的苦活,智能体的试金石

把切入点选在「复现」上,比看上去更聪明。

一方面,科学界苦「可复现性危机」久矣。不少领域的研究结果难以被独立验证,复现工作费时费力,却往往不产出能写上简历的成果——它是学术体系里典型的脏活累活。把这部分交给不知疲倦的机器,是实打实的刚需。

另一方面,复现恰好是对智能体最残酷的测试。它不是单轮问答,而是一条长链路:读论文、理解方法细节、搭建实验环境、写代码、跑实验、处理报错、比对结果。任何一步的幻觉或懈怠,都会让最终数字对不上。能在这种任务上拿高分,意味着规划、编码、环境操作等底层能力都过了关——而这些能力与工程领域的编码智能体同源,进展大概率会外溢到日常开发工具上。

冷静看待「跑赢 Anthropic 和 OpenAI」

不过,对这份成绩单宜保留几分审慎。

其一,这是厂商自报的基准。评测集由谁设计、任务如何判定成功、覆盖哪些学科,都直接决定结论成色。AI 行业「自选赛场、自带裁判」的宣传并不新鲜,在第三方独立验证之前,任何排名都应视作营销材料的一部分。

其二,「复现」与「发现」之间还隔着相当距离。复现已有结论,本质上是高质量的模仿;而提出新假设、设计巧妙的实验、判断哪个方向值得下注,涉及对领域的品味和对不确定性的容忍。TechCrunch 把它称作创新的「垫脚石」,措辞是克制的——垫脚石意味着必要,但不意味着充分。

简短点评

Faraday 的故事之所以值得留意,不在于又一次「击败巨头」的标题,而在于它选了一条被低估的路径:先让 AI 赢得科学共同体的信任,再谈改写科研流程。信任的货币是可验证的结果——能复现出来的数字,比任何演示视频都硬。对 Inherent 而言,真正的考验是拿出公开、可复核的评测;对整个「AI for Science」赛道而言,谁能把复现做成稳定的日常基础设施,谁才真正握住通往「自主发现」的门票。在满屏「AI 科学家」的宏大叙事里,愿意从抄作业做起的那一个,反而更值得多看两眼。

评论(0)

暂无评论,来写第一条吧。