83亿个"AI人"背后:MatrAIx 想给社会科学造一座"风洞",但代价是什么?

| | 1 次浏览

当社会科学终于有了“风洞”

自然科学的进步很大程度上依赖实验:风洞里的飞机模型、培养皿中的细胞、加速器里的粒子,都可以反复施加变量、观察结果。而社会科学长期以来缺少这样的手段——你无法把一个国家塞进实验室,反复测试某项政策的效果。

本月,由哈佛大学和麻省理工学院牵头、OpenAI 与谷歌 DeepMind 等机构参与的研究团队推出了 MatrAIx 系统,试图逼近这个目标:它生成了 83 亿个 AI 智能体,数量几乎与全球人口一比一对应,用于模拟全人类的行为模式(来源:IT之家)。

这些“数字人”能做什么

根据项目披露的信息,MatrAIx 利用 1,290 个维度对不同背景和生活方式的人群进行建模。生成的智能体不止是静态的"人口画像",而是能执行具体行为的动态体:像真人一样填写问卷、与客服对话、浏览网页、操作 App。

验证方式也颇具新意。团队设计了一项包含 400 次测试的对照研究,覆盖 10 个行为属性和全部四个环境。结果是:智能体在 366 次测试中表现出正确的特质,或在不相关时正确地抑制了该特质,整体一致性达 91.5%

不过细分场景差异值得注意:在问卷和聊天场景中,一致性升至 92%~96%;而在操控 App 的测试中,准确度降至 83%。这符合直觉,结构化的问答更容易模拟,而涉及视觉理解与多步交互的任务仍是短板。团队还提供了一个经过确定性与质量过滤的"百万人格核心集"(coreset),供研究者实际使用。

从规则到语言模型:社会模拟的三十年跃迁

用计算模型模拟社会并非新想法。上世纪 90 年代起,基于主体的建模(Agent-Based Modeling)就已流行,圣塔菲研究所的学者们用简单规则涌现出复杂的城市 segregation 图景。但传统智能体本质上是几条 if-else,行为僵硬、泛化能力差。

大语言模型改变了这一切。LLM 天然携带了大量人类行为的“先验”,可以被一个人设驱动,在开放场景中给出接近真人的反应。MatrAIx 的 1,290 维建模,实质上就是把人口统计学的条件系统性地注入这类智能体。学术圈近年类似方向的研究不少,但把规模推到 83 亿、并联合头部 AI 公司做系统验证,这是第一次。

其应用前景不难想象:政策出台前的"沙盘推演"、公共卫生宣传的 A/B 测试、产品设计的用户研究,甚至社会科学中难以开展的“反事实实验”——如果提高某项补贴 10%,模拟人群的储蓄行为会怎么变?这些以往只能靠小样本调查外推的问题,理论上都可以在数字孪生社会中低成本反复验证。

保真度之外,更难的问题是治理

但兴奋之余,几个问题无法回避。

**其一,数据从哪里来。**83 亿个人格的统计分布,必然源自对真实人群行为数据的大规模学习。被建模的个体从未同意成为某个“数字人”的蓝本,这比传统的用户画像更接近"数字分身",隐私边界需要重新界定。

**其二,偏差会被放大还是抹平。**91.5% 的一致性意味着还有 8.5% 的系统性偏差,而政策模拟最怕的就是偏差被当作规律。尤其在跨文化场景下,基于特定语料训练的模型能否准确刻画未被充分数字化的群体,仍是未知数。

**其三,也是最值得警惕的:反向使用。**能模拟"人群如何对某信息做出反应"的系统,同样可以用来优化说服策略、精准操纵舆论。同样的技术,在实验室里是政策风洞,在营销部门手里可能是史上最强大的"话术测试机"。当 83 亿个数字人的反应可以被无限次试错,针对真实人类的操纵成本将大幅下降。

简短点评

MatrAIx 代表了 AI 应用范式的又一次转变:从"AI 作为工具"到"AI 作为人群"。这类系统几乎肯定会成为下一代社会科学研究与商业测试的基础设施,问题只在于由谁、以何种透明度来使用。项目方选择与 OpenAI、DeepMind 合作发布,某种意义上也是把技术过早地推入了商业生态。

我的看法是:与其争论"AI 能否像人"——91.5% 的一致性已经部分回答了这个问题——不如尽早建立模拟人群的使用规范,比如核心集的构建方法开源、使用场景白名单、以及禁止用于针对性说服的红线。风洞造出来了,接下来考验的是造风洞的人。

评论(0)

暂无评论,来写第一条吧。