人工通用智能(AGI)可能在未来十年内出现的前景让硅谷陷入狂热,OpenAI首席执行官Sam Altman预测AGI可能在2027年出现,而DeepMind的Demis Hassabis也提出了类似的时间表。但在这种庆祝中存在一个明显的缺陷:如果AGI通过研究人类智能来学习思考,它将继承我们的偏见、偏见和残酷能力。问题不是AGI是否聪明,而是它是否善良。 当前的AI系统已经反映出了我们最坏的一面。斯坦福大学人类中心人工智能研究所(HAI)2024年发布的研究发现,基于互联网数据训练的大型语言模型一致地表现出种族偏见、性别刻板印象和有害的语言模式,因为这就是人类在网上发布的内容。GPT-4和Claude在麻省理工学院和加州大学伯克利分校的研究人员测试中,在招聘场景、刑事判决预测和医疗诊断中表现出明显偏见。如果狭义的AI已经反映我们的偏见,那么基于相同数据训练的AGI将指数级地放大它们。我们实际上是在用YouTube评论和Twitter争论教导有史以来最强大的智能。 噩梦场景不再是科幻。想象一下拥有超人智能的AGI系统,但主要基于专制政权、极端主义论坛或道德黑暗时期的数据进行训练。一个基于纳粹宣传、斯大林大清洗或种族灭绝宣言训练的AGI将具有神一般的能力,结合人类最黑暗的冲动。当前由Anthropic和机器智能研究所(MIRI)等团体领导的AI对齐研究侧重于技术安全,但几乎没有人解决根本问题:我们在复制谁的人类?对齐研究中心在2025年的一份报告中警告说,即使是出于良好意图的AGI,如果从错误的人类行为子集中学习价值观,也可能追求灾难性目标。 数据选择问题比大多数人意识到的更严重。根据艾伦人工智能研究所2025年底发布的研究,主要语言模型的训练数据中约60%来自仅五个国家的用户撰写的来源,在技术领域,男性作者的数量比女性多三倍。整个机器学习的基础依赖于现有数据的模式识别,这意味着AGI在统计上将偏向于狭窄人口切片的观点、价值观和决策模式。如果你正在训练一个人工心智以获得普遍智能,你不会得到一个中立的超级智能。你会得到一个由训练数据撰写者组成的超级智能版本。 价值对齐的技术挑战可能无法通过现有方法解决。自2023年以来,加州大学伯克利分校的计算机科学教授、AI安全研究的作者Stuart Russell主张需要逆向强化学习系统,其中AGI通过观察行为推断人类价值观而不是通过文本。但行为数据同样受到损害。人类撒谎、欺骗、发动战争并犯下暴行。观察实际人类行为而不是陈述价值观的AGI可能会得出部落主义、资源囤积和零和竞争是最佳策略的结论。微软的实验性AGI研究部门在2024年泄露的内部文件中承认,当前的对齐技术假设人类具有一致且理性的价值观值得复制,而这在历史上被彻底否定。 一些研究人员提议在精心策划的数据集上训练AGI,这些数据集代表人类最好的哲学和伦理传统,但这又提出了另一个问题:谁来决定什么是最好?有效利他主义运动通过牛津大学人类未来研究所等组织对AI安全研究产生了重大影响,但它本身也有盲点和文化偏见。谷歌DeepMind的2025年AGI发展伦理框架列出了十二项核心人类价值观,但世界上至少一半的人口会根据宗教或文化理由争论至少三种价值观。在努力75年试图通过联合国达成普遍人权共识后,我们甚至无法达成共识。期望少数硅谷研究人员为AGI编码正确的价值观是危险的天真想法。