引言
在 AI 行业的热闹发布之外,ARC 系列基准长期以来扮演着"泼冷水"的角色。从 2019 年的 ARC-AGI-1 到 2025 年的 ARC-AGI-2,这套由 François Chollet 设计的抽象推理测试,一次次让在常规评测里刷榜的前沿模型现出原形。8 月 21 日,英伟达通过官方账号宣布,其 AVO 系统在最新的 ARC-AGI-3 交互推理基准上取得了 100% 的成绩——如果结果得到确认,这将是该基准首次被"刷穿"。
事件要点
- 英伟达 AI 官方账号公布了 AVO 在 ARC-AGI-3 上获得满分的消息,宣称其为首个在该基准上达到 100% 的系统。
- ARC-AGI-3 由 ARC Prize 基金会推出,与前辈最大的不同在于考核形式:模型不再面对静态视觉谜题,而是被放进一局从未见过的游戏里,通过实时交互——观察、行动、试错、调整策略——来学会通关。
- 此前,前沿模型在这一基准上的得分长期处于低位,"能否完成一局全新游戏"被普遍视为智能体能力尚未补齐的短板。
从静态谜题到交互游戏
要理解这个满分的分量,得先看 ARC 系列的演进逻辑。ARC-AGI-1 时代,GPT-4 级别的模型只能拿到 5% 左右的分数;2024 年底 OpenAI 的 o3 用高算力换来了 87.5%,一度被视为范式转折。随后上线的 ARC-AGI-2 又把分数打了回去——新题、少样本、更强调流体智能,模型得分重新跌入低位。
ARC-AGI-3 则换了一种考法:它不再考"看图找规律",而是考"在陌生世界里活下来"。智能体需要在连续的交互流中维护记忆、分配注意力、判断哪个动作带来了奖励,还要在探索与利用之间做取舍。这更接近真实工作场景——写代码跑测试、操作软件界面、处理多步任务——本质上都是在与环境持续互动中纠错。这也是为什么 Chollet 一直强调:交互式适应能力,才是通用智能更真实的试金石。
正因如此,各家做 Agent 的团队都盯着这块试炼场。满分的出现,至少说明"从零学会玩新游戏"这件事,在方法层面已经有了可行解。
满分之后看什么
不过,公告与论文之间还有距离,有几个问题值得等答案:
其一,验证方是谁。 ARC-AGI 系列历来区分官方跑分与第三方监督下的评测,满分是否在受控环境中复现,需要 ARC Prize 方面的确认。
其二,成本账怎么算。 ARC 基金会反复强调"技能效率"(skill efficiency)——即解题消耗的算力与样本量。当年 o3 的高分就伴随争议:用高出人类数万倍的算力换分数,算不算真本事?AVO 的满分每局花了多少计算、多少次交互,目前尚无细节。
其三,饱和之后呢。 基准与能力是猫鼠游戏。ARC-AGI-1 从发布到被攻克用了五年多,如今交互推理这道题也交卷了,可以预期更难的版本已在路上。
简短点评
满分本身不等于 AGI 到站,基准分数从来只是能力的一个切面。但对正在做 Agent 产品的工程师来说,这个信号比榜单排名更有用:实时探索、策略适应这类去年还明显欠缺的能力,正在以可见的速度被补齐。接下来的看点,是这套能力能否从游戏环境迁移到真实工具链里——以及英伟达会以论文还是产品形态,把 AVO 的方法亮出来。在那之前,不妨把"100%"当作一个值得追踪的开题,而不是终章。