「乘法交给欧姆定律」:Anthropic 为模拟推理芯片押上 2.5 亿美元

| | 1 次浏览

推理成本是 AI 行业真正的"水电费":每一次模型调用背后,都是真金白银的 GPU 时间。当大多数目光集中在英伟达下一代 GPU 的路线图上时,一些公司开始从更底层的地方找答案——把矩阵乘法从数字电路搬回模拟电路。

据彭博社报道(IT之家转述),Anthropic 已与 AI 芯片初创公司 Fractile 就一份总价值约 2.5 亿美元的供应合同达成初步协议,采购后者的 AI ASIC 推理加速器,计划 2027 年开始交付,并可能在此基础上扩大交易规模。

事件要点

  • 合同为初步协议,总价值约 2.5 亿美元,Fractile 的推理加速器 2027 年起交付;
  • Fractile 宣称其"模拟内存计算"架构在运行头部模型时可实现 25 倍速度、1/10 成本;
  • 资本层面,Fractile 今年 5 月刚以约 10 亿美元估值融资 2.2 亿美元,如今寻求以 65 亿美元估值完成新一轮融资;报道同时透露,部分新融资将基于低于 65 亿的估值完成。

技术背景:为什么是"模拟"

传统数字芯片把存储与计算分开:模型权重躺在显存里,每次计算都要搬进计算单元,算完再搬回去。在大型模型推理的能耗与延迟构成中,这种"搬运"占了惊人比例,业界称之为冯·诺依曼瓶颈,或者更直白的"内存墙"。模型越大、上下文越长,墙越高。

模拟存内计算换了个思路:把权重"写"进存储单元的电导值里,输入以电压形式加载到阵列上。根据欧姆定律,每个单元流出的电流正比于电压乘以电导——乘法在物理定律里完成了;再根据基尔霍夫电流定律,同一位线上的电流自然相加——加法也完成了。一次模拟读出,等于一整列乘加运算同时落定,中间没有任何数据搬运。

这解释了"25 倍速度、1/10 成本"的宣称从何而来:省掉的是搬运,而不是计算本身。

但代价同样写在物理里:电导会漂移、电流有噪声、模数转换有开销,位宽与精度天生受限。这也是模拟计算几十年没有走出实验室的原因。变化在于,大模型推理对数值精度的容错远高于传统科学计算——INT8、FP8 乃至更低精度都能稳定工作——给模拟电路留出了久违的用武之地。

行业影响

Anthropic 的算力焦虑不难理解:其训练与推理高度依赖亚马逊、谷歌的云和英伟达的 GPU,而推理恰恰是长期最大的成本项。自研或定制 ASIC 已成为大模型公司的标准动作——谷歌有 TPU,亚马逊有 Trainium,微软有 Maia,OpenAI 也屡屡被曝与博通合作设计自用芯片。Fractile 这类初创公司的机会,是在"通用 GPU"与"全定制 ASIC"之间提供架构层面的第三条路。同属差异化路线的还有主打 SRAM 与确定性延迟的 Groq、做晶圆级计算的 Cerebras 等。

资本的逻辑同样清晰:一份 Anthropic 的合同本身就是估值背书。三个月前估值还是 10 亿美元,如今目标 65 亿;而"部分新融资基于更低估值完成"的细节,则暴露了投资人对"未交付先给高估值"的分歧——这可能是整篇报道里最诚实的一处。

简短点评

模拟计算并不新鲜——上世纪的微分分析机就用机械轴系解微分方程。它在 AI 时代的回归说明了一件事:瓶颈变了。晶体管的开关速度逼近物理极限之后,真正昂贵的是搬运数据的能量,于是行业开始向物理定律本身讨要"免费"的乘法。

对开发者而言,若推理成本真能降一个量级,被改写的不只是账单:长上下文、高频 Agent 调用、端侧本地推理的经济学都会重新计算。但也需要保持清醒:"25 倍"是特定条件下的宣称数字,与量产交付之间还隔着良率、工具链、软件生态三道墙;等到 2027 年交付时,GPU 和其他 ASIC 的进化也不会原地等待。这份合同真正的意义,或许在于为"后 GPU 时代"的推理硬件探索,保留了一条足够异质的路线。

评论(0)

暂无评论,来写第一条吧。