剑桥大学研究员 Hector Zenil 最近的一篇论文为许多计算机科学家长期以来的怀疑提供了数学证明:LLM(大型语言模型)无法通过对自身输出进行训练而自我改进。这种现象被称为模型崩溃,当这些统计模型开始使用自己的生成内容,而不是新鲜的人类创造的数据时,就会发生。这就像一种知识版的疯牛病,系统通过自我消耗慢慢退化。 核心问题在于 LLM 的本质实际是什么,而非炒作所暗示的。尽管有关人工智能和机器学习的市场宣传如火如荼,但这些系统本质上是概率引擎。它们分析大量由人类创造的文本数据,建立统计模型,预测哪些词应该跟随其他词。当你向 ChatGPT 提问时,它并没有在任何意义上进行思考或推理。它是在运行一个复杂的计算,以确定基于你的提示最可能出现的词序列。 Zenil 的论文表明,当一个 LLM 在其自身输出或其他 LLM 创建的内容上训练时,会经历他所说的退化动态。模型没有学习或改进;而是收敛到一个统计奇点,基本上成为自己偏见和模式的一个扭曲的回声室。每一代自我训练放大了现有的怪癖和错误,同时失去了原始人类生成训练数据的多样性和丰富性。在几个周期内,输出变得越来越同质化、重复和脱离现实。 这不仅仅是一个理论问题。随着 AI 生成的内容充斥互联网(一些估计表明到 2026 年 AI 创造的文本已占新网络内容的 10-15%),未来的 LLM 面临着一个日益被污染的数据池。像 OpenAI、Anthropic 和 Google 这样的公司已经努力寻找足够高质量的人类生成文本来训练他们的下一代模型。使用合成数据、让 AI 训练 AI 的简单解决方案,事实证明是一条死路。 该论文提出了可能的机制以对抗这些模型中的熵衰减,但基本结论仍然是:统计模型需要不断的外部锚定到人类生成的数据以避免崩溃。没有一种神奇的反馈循环可以使 AI 自我训练成超智能。被大肆宣传的 AGI(人工通用智能)从扩大规模的 LLM 中出现的概念越来越像是由风险投资家和技术福音者兜售的幻想,他们将模式匹配误认为思考。