当互联网的「新增」被模型接管
2022 年 11 月底 ChatGPT 上线,此后三年多,生成式 AI 从聊天框里的新奇玩意,变成了内容工业的基础设施。TechCrunch 近日报道的一项研究给出了一个直观的刻度:自 ChatGPT 发布以来上线的网页中,约有三分之一显示出由 AI 撰写或编辑的迹象。
这个数字的分量取决于怎么读。它不是在断言「三分之一的网页是 AI 生成的垃圾」,而是说明 AI 已经深度介入互联网新增内容的生产——从全文代笔到局部润色,都算在内。在互联网每年新增的海量页面里,纯人类独立完成的比例正在被快速稀释。
数字之外,更值得注意的三件事
其一,这个比例可能还是保守估计。 研究依赖识别「AI 写作迹象」,而检测本身并不对称:整段生成的营销文案容易露出马脚,但被模型改写、扩写、润色过的文章,与人类初稿之间的边界相当模糊。越是熟练的使用者,留下的痕迹越少。
其二,动力来自经济而非技术。 用模型批量生成内容,边际成本趋近于零;只要搜索流量换来的广告收入高于电费和 API 账单,这条流水线就会持续运转。过去两年,「内容农场 2.0」已经从英文世界蔓延到各个语种,搜索引擎不得不反复调整算法来压制低质 AI 页面。
其三,这是一条会回旋的飞镖。 大模型的训练语料大量来自公开网页抓取。当新增内容中 AI 占比不断上升,下一代模型的训练数据里就混入了越来越多上一代模型的输出。学术界讨论已久的「模型坍缩」风险——模型反复学习自己的产物,分布逐渐收窄、错误被放大——正从理论担忧变成工程现实。
连锁反应已经开始
对普通用户,最直接的体感是搜索质量:一个技术问题搜下去,前几页结构工整、辞藻流畅却互相抄袭、答非所问的页面越来越多。于是更多人干脆直接问 AI 助手,网页流量进一步下滑;网站为降本,又用更多 AI 内容填满页面——一个自我强化的闭环正在成形。
对内容创作者,这是明确的挤压。翻译、通稿、评测、攻略这类标准化程度高的文字工作,价格已被拉到地板;剩下能溢价的,是真正的一手信息、实测数据和个人判断——而讽刺的是,这些内容恰恰又是 AI 最想抓取学习的部分。
对开发者和平台,问题更底层:构建在公开网页语料之上的搜索、推荐与 RAG 系统,都要面对语料质量随时间衰减的现实。「网上的说法」不再天然等价于「人类的说法」,数据清洗与来源权重正在从工程细节变成核心竞争力。
简短点评
三分之一不是终点,更像一个中途刻度。真正的问题从来不是「AI 能不能写」,而是「我们如何知道一段内容是谁写的、为什么而写」。当生成成本归零,稀缺的不再是文字本身,而是可信度——谁能证明内容背后有真实的经历、可复现的数据或承担责任的署名,谁就握住了下一代互联网内容生态的入场券。在那之前,每打开一页网页,或许都值得多问一句:这是写出来的,还是吐出来的?