让我们从当你向ChatGPT提问时实际发生的事情开始。你简单的提示触发了数十亿次的数学运算,分布在数千个被称为GPU(图形处理单元)的专用芯片上。这些芯片不仅存储AI模型,还积极计算每个可能下一词的概率,交叉参考从代表整个互联网一部分的训练数据中提取的模式,并通过神经网络层次来优化预测。每层都增加了计算负担。GPT-4据报道拥有超过1万亿个参数。把这些参数当作AI调整以生成连贯响应的旋钮。每个旋钮都需要电力来操作。 在这些事情发生之前,你的提示经历了一个称为标记化的过程。当你在ChatGPT中输入“LLM是如何设计的?”你的浏览器不会将原始文本发送到OpenAI的服务器。相反,运行在本地计算机上的JavaScript将句子分解成模型理解的文本块。一个标记可能是一个完整的词,比如“How”,或者是像“design”和“ed”这样被分开的词的一部分。标记器将你的句子转换为一系列数字,每个数字代表模型词汇中的特定标记(通常有50,000到100,000个可能标记)。这些数字,而不是你原始的文本,被传输到数据中心。这些发生在毫秒间,并且在你的设备上使用的电力可以忽略不计。 一旦你的标记化提示到达数据中心,它会命中一个负载均衡器,这是一台专用计算机,决定哪个服务器应该处理你的请求。主要的AI提供商在不同的大陆运行多个数据中心,因此你的请求可能会根据地理位置和当前服务器负载被路由到弗吉尼亚州、俄勒冈州、爱尔兰或新加坡。负载均衡器的工作是防止任何单一机器过载,同时保持其他机器闲置。它跟踪哪些服务器繁忙,哪些有容量,并相应地分配输入请求。这个路由决策在微秒内完成。 然后你的请求被分配到一个特定的推理服务器,这可能是一台拥有8个GPU的物理机器,更可能的是一个合作工作的机器集群。这里的复杂性爆炸了。AI模型太大,无法放在一个GPU上。GPT-4超过1万亿个参数需要数百GB的内存。单个H100 GPU拥有80GB的高带宽内存(HBM)。因此,模型通过一种称为模型并行化的技术分布在多个GPU上。不同的神经网络层驻留在不同的芯片上。在处理你的提示时,GPU必须不断地相互通信,从一个层到下一个层传递中间结果。 这些GPU通过专用的高速互连设备通信,而不是普通以太网。NVIDIA的NVLink技术允许同一服务器中的GPU以每秒900GB的速度传输数据,约为最快消费者SSD的10倍。对于不同服务器中的GPU,数据中心使用提供类似速度和极低延迟(微秒级)的InfiniBand网络。这一点极为重要,因为AI模型按顺序处理你的提示,一次一个标记。第一个GPU处理第一层的计算,将结果发送到第二个GPU用于第二层,如此类推,可能需要经过96层或更多层。任何通信中的延误都会成为瓶颈,减慢响应时间。 大多数人没有意识到的一点是:这些GPU不只在处理你的请求。通过一种称为批处理的技术,它们同时处理几十甚至上百个请求。服务器将同时到达的不同用户请求组合在一起,在同一个GPU核心上并行处理,然后再分离结果。这显著提高了效率。一个GPU只计算一个响应会浪费大部分的处理核心。将多个请求批处理在一起可以让所有核心忙碌。不过,批处理给GPU间通信带来了复杂性。不同用户的结果必须保持分离,需要额外的内存管理和仔细的数据路由。 计算的物理现实创造了一个不可避免的问题:电力变成了热量。像NVIDIA的H100这样的现代AI芯片在满负载下消耗700瓦电力,相当于同时运行七个老式白炽灯。但数据中心不是只有七个GPU。它们有数千甚至数万个。Meta的AI研究超级集群使用了16,000个GPU。据报道,支持OpenAI的微软设施使用的更多。当你把700瓦乘以20,000个GPU,你看到的是14兆瓦,仅用于计算,还不包括冷却、网络或存储。这足以为大约10,000个美国家庭供电。 冷却成了隐藏的能源消耗者。这些GPU在紧密排列的服务器架中产生惊人的热量。如果没有积极的冷却,芯片在几分钟内会过热并失效。数据中心使用工业级别的空调系统、液体冷却系统,有时还有消耗数百万加仑水的蒸发冷却。谷歌的数据中心在2022年就使用了43亿加仑的水。冷却基础设施通常消耗的电力约为计算本身的30%到40%。物理现象不容妥协。热量必须以生成的速度被除去,否则硬件会融化。 为什么他们不能使用更小的模型呢?因为性能会灾难性地下降。研究表明,参数更多的大模型展现出自发能力,是更小模型无法复制的,无论训练时间多长。拥有1750亿参数的GPT-3在复杂推理任务上的表现远远好于拥有10亿参数的模型。这无关效率破解。你想让AI理解上下文、生成创造性的回答、避免不合逻辑的输出?你就得付出参数的代价。更多的参数意味着每次查询需要更多的计算,也就意味着更多的电力。 但事情并不总是这样。第一个真正震惊研究人员和公众的大型语言模型是GPT-2,由OpenAI于2019年2月发布。该模型拥有15亿个参数,与今天比起来显得很小,但在当时却具有革命性。OpenAI最初拒绝发布完整模型,理由是担心其产生虚假新闻和垃圾信息的潜在滥用。这一决定本身就成为一个分水岭,是AI实验室首次公开声明他们的技术过于危险,不适合自由分享。 最初的GPT-2演示非常简单,在普通硬件上运行。OpenAI研究人员给模型一个提示,比如“在一个震惊的发现中,科学家们在安第斯山脉一个偏远、此前未被探测的山谷中发现了独角兽群。”然后模型继续撰写有关这些独角兽的多个连贯段落,它们银白色的外套,具有治疗功能的独特囊角,以及科学家们对这一发现的惊讶。文本流畅自然,保持了一致的细节,甚至发明了听起来很有可能的科学家名字和研究机构。读者无法立即判断出是机器生成的。 这个演示的强大之处不在于所需的硬件,而在于概念上的突破。GPT-2证明单一模型仅通过预测下一序列中的单词,就能看似理解叙事结构,维护数百字的上下文,并生成创造性小说而不需要任何特定任务的编程。以前的AI系统需要为不同任务设置不同的模块:翻译一个,总结另一个,问答第三个。GPT-2在同一架构下完成了所有这些工作,只需通过学习文本模式。 这一首次演示的计算需求按数据中心标准来看是适度的。GPT-2可以在单个高端消费级GPU上运行推理(生成文本),一个装备良好的研究者可能在其办公工作站上拥有这样的设备。一个拥有11GB内存的NVIDIA GTX 1080 Ti可以处理最大变种的GPT-2,以每秒几个词的速度生成文本。模型文件本身约6GB大小。你可以下载它,加载进内存,然后开始生成文本而无需云资源。此可达性至关重要。全球研究人员可以实验GPT-2,探索其能力和问题。 然而,训练GPT-2却是另一回事。OpenAI使用40GB的互联网文本,在一个机器集群上训练了数周。即便在2019年,这需要显著计算资源,可能数十万美元的云计算费用。但是对于一个资金充足的实验室来说这仍然是可行的,尚未达到训练GPT-4所需的数百万美元努力。 安德烈·卡尔帕斯(Andrej Karpathy),前任Tesla的AI主管和OpenAI研究员,后来通过一个称为“minGPT”的教学项目展示了语言模型的基本简单性。他展示你可以用几百行Python代码实现一个工作中的GPT风格模型。架构并不神奇,是矩阵乘法和注意力机制,任何计算机科学研究生都能理解的标准操作。在GPT-2和GPT-4之间变化的不是基本算法,而是规模:更多的参数,更多的训练数据,更多的计算,更关键的是,更多的能源。 GPT-2的时刻是AI的“你好,世界”,因为它证明语言建模在一个重要的规模上起作用。先前的模型产出的是语法正确的胡言乱语或记住训练数据而不理解什么。GPT-2展示出了类似理解的东西,尽管哲学上它仅仅是在预测统计模式。研究人员给它用法语提示并得到连贯的法语回应,尽管没有明确的翻译训练。他们要求它以特定风格写诗并得到合理的尝试。模型不完美,它最终可能偏离主题或自相矛盾,但能力无可否认。 OpenAI的分阶段发布策略增加了GPT-2的影响。他们首先发布了一个较小的1.24亿参数版本,随后在未来几个月随着研究界展示出负责任使用的情况逐步发布更大尺寸的变体。这造成了持续的关注,让研究人员有时间探索每个尺寸的能力。当完整1.5亿参数版本在2019年11月发布时,AI社区已经花了九个月时间了解大型语言模型可以做什么。那基础工作使得GPT-3在2020年6月的宣布感觉像是一种自然进化而非震惊。 GPT-3改变了一切,因为OpenAI没有释放模型供下载。相反,他们提供API访问,开发人员将提示发送到OpenAI的服务器并接收完成。这种转变至关重要,有两个原因:它保护了OpenAI的竞争优势(无人能直接研究或复制他们的模型),并集中化了计算需求。突然间你不需要GPU去使用GPT-3。你只需要一个API密钥和一张信用卡。这种方式虽然使得访问民主化,但也创造了对OpenAI基础设施的依赖。 API模式也意味着用户从未见过真实的计算成本。当你在本地机器上运行GPT-2时,你听到风扇加速,感觉到热量,或许注意到你的电费账单会不断增加如果你持续运行它。使用GPT-3的API,计算隐形发生在某地的数据中心。你按标记收费,每千字几美分,没有背后燃烧的兆瓦的感。行业迅速扩张,却未立即引发能源关注的原因就是这种抽象。成本被隐藏在运营预算和公用账单中,对终端用户不可见。 现在这是许多人忽略的核心区别:使用训练好的AI模型(推理)与从头训练AI模型完全不同。当你与ChatGPT交谈时,你使用的是一个已经训练好的模型。训练是在几个月前发生的,当OpenAI从头创建这个模型时。把它想象成阅读一本书与写这本书的区别。使用ChatGPT是阅读。训练是费力的过程,写下每一个字。 训练开始于空白状态,一个具有随机参数值的神经网络,这些值产生完全的无意义。想象一下数十亿个旋钮都随机设置的情况。网络对语言、语法、事实或推理一无所知。是数字的胡言乱语。训练过程是关于调整那些数十亿的旋钮,一次微小的调整,直到网络开始产生连贯的文本。 这是如何实际运作的:你给网络输入一大块文本,比如一篇关于海豚的维基百科文章。网络尝试预测句子中的下一个词。随机参数下,它会严重失败。在真正的文本上写着“海豚是高度智能的海洋哺乳动物”,未经训练的网络可能预测“海豚是紫色的十七篮球”,因为它的参数一塌糊涂。 训练算法计算这种预测的错误程度。这被称为计算损失。预测越差,损失数值越高。然后关键步骤来了:反向传播。算法向后遍历网络的所有层,精确计算出哪些数十亿参数对糟糕预测的贡献。这就像是对神经网络的法证会计,追踪错误回到其源头。 一旦算法知道哪些参数导致了问题,就略微调整它们向着会产生更好预测的方向调整。这被称为梯度下降。你在微调数十亿的旋钮,每次略微调整,努力接近更好的表现。一次调整不会改变太多。但你重复这个过程万亿次,用万亿个不同的文本示例,慢慢地那些随机旋钮转向能真正起作用的配置。 训练的能源消耗绝对惊人,因为你在互联网上的整个文本上重复进行这种计算。训练GPT-3据称需要1287兆瓦小时,相当于120个美国家庭一整年内使用的电量,在数周或数月的连续计算中烧掉。你不仅在阅读文本。你在执行数万万次的数学运算:矩阵乘法、梯度计算、参数更新,这些都在24/7运行的数千个GPU上进行。 这是为什么训练比推理昂贵得多:当你使用ChatGPT(推理)时,参数是冻结的。网络执行一个正向穿过其层的传递,计算概率,选择一个词,然后继续。训练需要一个正向传递进行预测,然后一个反向传递计算梯度,然后更新参数,然后进行验证检查,这些反复进行数十亿次。训练每个词时你进行的计算可能是推理时的100倍。 现代训练也在多个阶段进行。首先是预训练,模型从大量数据集学习一般语言模式。这是昂贵的部分,消耗超过1000兆瓦小时。然后是微调,你在已经预训练的模型上进行微调,使其专门用于特定任务,例如遵循指令或进行对话。微调使用较小且精心挑选的数据集,更温和地调整参数。它仍然昂贵,但可能只占预训练成本的1至10%。 公司还进行来自人类反馈的强化学习(RLHF),人类评分者对AI的响应打分,训练算法调整参数以生成得分更高的响应。这给训练成本增加了另一层,因为你需要人类参与,产生反馈,然后推动更多的梯度下降和参数更新。 训练完成后,你将得到一个包含数十亿静态参数值的模型文件。该文件复制到全球的推理服务器上。这些服务器只读取参数,并使用它们回答问题。它们从不修改参数。模型保持训练结束时一样聪明(或愚蠢)。使用ChatGPT一百万次不会让它变得更聪明,因为推理不改变参数。这是很多人误解的一个关键点:AI模型不会从与用户的对话中学习。它们是冻结在训练过程结尾的知识快照。 这就是为什么树莓派幻想不起作用。你可以下载一个预先训练好的模型到你的Pi并运行推理,但Pi永远不会通过使用让该模型变得更聪明。训练需要专业硬件、大规模数据集和数月的计算,而你的Pi需要数世纪才能完成。你下载的模型是冻结在时间中的,拍下了它在训练期间学到的东西。 为什么Claude在编码任务上常常表现优于ChatGPT?答案不只是更多的数据。涉及的是哪些数据,如何加权,以及模型在初次训练后的微调。Anthropic用一种称为宪法AI(CAI)的技术训练Claude,这涉及多轮精炼,AI根据明确的原则批评并修订自己的输出。对于编码特别意味着Claude在训练期间可能看到更多多样的代码示例,收到更强的信号优先考虑正确性而非创造性,并经历了额外的针对编程挑战的强化学习。 OpenAI和Anthropic使用不同的训练数据集,采用不同的许可和来源策略。Claude可能摄取了更多的GitHub存储库、Stack Overflow讨论和技术文档。模型架构也有细微不同。尽管两者都使用基于变压器的设计,Anthropic在注意机制、上下文窗口优化以及模型处理结构化与非结构化文本方面的选择可能显著影响需要精确语法和逻辑的任务性能。 训练数据中的质量重于数量。这意味着优先考虑注释良好的生产级代码存储库,而不是从论坛抓取的学生作业。这意味着比随意的编码博客帖子更重视技术文档和API参考。 Anthropic可能在编码杰出性上花费大量工程努力来筛选训练数据,而OpenAI在GPT-4上更广泛地优化了对话能力、创造性写作和一般知识。两种方法都没有错,但它们产生了不同优势的模型。 AI学习是否有上限,或者模型能不断改进吗?诚实的答案是:我们仍不清楚,但证据表明我们正接近当前架构的实际限制。OpenAI研究人员在2020年发现的规模法则显示,随着参数、训练数据和计算的增加,模型性能可预测地提高。但那些法则假设你有无限量的高质量数据。我们却用尽了。整个可访问的互联网可能包含10到50万亿字的可用文本。前沿模型已经在这个语料库的重要部分上训练。你不能只是反复使用相同的数据。模型会记忆而不是学习。研究人员正触碰数据墙,找到全新高质量训练材料变得指数级困难。 合成数据(用来训练其他AI的AI生成内容)提供了一个诱人的解决方案,但大多不起作用。早期实验表明,训练在自身输出上的模型遭受模型崩溃,错误连累积累,性能在几代中恶化。这就像复印件的复印件:质量迅速恶化。然而,精心策划的合成数据可以用于特定任务。你可以生成拥有验证解的百万个数学题,或拥有单元测试确认正确的编程挑战。关键在于拥有自动化验证,以捕捉产生失真和错误的假象,防止这种污染训练集。此方法适用结构化领域如数学和代码,但不适用于创造性写作或细致推理等非凡情况无法算法验证的开放任务。 AI学习的未来或许涉及多模式数据和体现的经验,而非更多文本。从视频、传感器数据和交互环境中学习的模型可以继续提高,因为这些数据源在绝对量上远超文本。一个小时的视频包含的讯息远胜于几小时的阅读。在模拟环境中通过试错学习的机器人生成的训练数据几乎是无限的。这一转变需要根本不同的架构和训练技术,这意味着当前偏重文本的LLMs(大型语言模型)可能代表了一个地方峰值,而非通往人工通用智能(AGI)的路径。我们没有在机器智能广泛上限;我们在当前方法和现有文本数据上顶到的只是纯语言模型的上限。
💻 technology
为什么人工智能消耗的电力足以点亮小城市
像ChatGPT这样的大型语言模型需要大规模的数据中心,这些中心消耗的电力达到数吉瓦——足以为整个社区供电。这不是企业贪婪或工程不良的原因,而是纯粹的数学结果:每秒数万亿次计算,数十亿个参数需要处理,以及将计算转化为热量的物理现象。
我的看法
AI行业正睡步入一个它拒绝公开承认的能源危机。高管们不停地谈论AI安全和对齐,而忽视了机房中的大象:他们的创造物在工业规模上是环境灾难。我们正在构建在小国一样消耗电力的数字大脑,以告诉你如何写邮件和总结文章。成本收益分析不成立,而没人愿意大声说出来。 真正的丑闻不是LLMs需要大量电力,这是物理学。丑闻是公司竞相将这些模型放到任何地方却没有诚实地讨论能源折中。每个网站都需要AI聊天机器人吗?每部智能机都需要设备上的AI处理吗?我们正在自动化由人以忽略不计的能源成本完美执行的任务,然后为创新喝彩。与此同时,公用事业公司正重新开启退役的燃煤电厂,以满足AI数据中心需求。这不是进步,是伪装为先进的瘾。 向前的道路需要对于哪些AI应用能证明有其能源成本的无情的诚实。医学诊断,科学研究,气候建模这些可能可以达标。产生营销文案和娱乐垃圾?可能不行。除非行业开始公布实时能源消耗数据并接受增长的硬限制,否则我们只是在建造一个更复杂的方法来煮沸地球。
接下来会发生什么
18个月内,由于电网容量限制而非技术失误,我们将看到第一个主要AI项目被取消。可能在弗吉尼亚、爱尔兰或新加坡的一家主要云提供商将宣布延期扩展,因为公用事业公司根本无法提供足够的电力。公司不会将其框定为能源问题;他们会称呼为战略重新定位或监管挑战。但内部文件将告诉真相:电网已达到最大负载。 核能成为AI故事里的意外英雄,但不是科技乐观者想象的那样。小型模块化反应堆(SMR)不会拯救局面,因为它们距商业大规模部署仍有数年之遥。相反,传统的公用事业公司将专门为科技合同重新启动停役核电站。在微软的三里岛协议之后,预计亚马逊和谷歌将在2027年初宣布类似的消息。环保主义者将面临一个不可能的选择:支持AI的核能,还是看到燃煤电厂重新开。大多数会捏着鼻子接受核能作为较小的恶。 没人预料到的变数场景是:能源成本引发一个实际上有效的算法效率研究复兴。现在,公司扩展模型,因为这比让每个参数变得更聪明更容易。但如果电力成为限制因素——如果公用事业公司开始在高峰期向AI公司收费正常3到5倍——那么突然间有强大的经济激励去建造像GPT-4表现的模型使用GPT-3的计算水平。我们可能看到突破性的压缩技术、只激活相关参数的稀疏方法,或完全新的架构,放弃变压器模型的蛮力方法。危机可能会迫使那些富裕阻碍的创新。
历史告诉我们什么
AI行业的能源轨迹与2017至2021年加密货币挖矿热潮有着惊人相似的动态。比特币挖矿场在高峰时估计每年消耗150太瓦时电力,超过了整个国家如阿根廷的电力消耗。矿工追逐便宜电力到偏远地区,压倒本地电网,并引发社区面对停电和电费上涨反弹。中国最终在2021年部分出于能源考虑禁止挖矿。几个美国州现在限制新的挖矿业务。 相似之处不仅在数字上。两者均承诺革命性好处,同时将能源成本外部化到公共电网和收费人头上。两种行业坚称效率的提高将解决问题(它们没有在规模上超越效率增益)。两者触发全球硬件短缺,因为公司争相购买专用的芯片。关键区别是:AI获得远超过加密货币的公司和政治支持,使得尽管有相似的能源要求,但限制性法规不太可能。历史表明,通过自愿行业限制解决技术驱动的能源危机不太可能——它们通过资源限制、监管干预或技术过时结束。
市场影响
截至2026年5月,NVIDIA交易价格约为每股900-950美元,已经计入巨大的AI基础设施需求,但能源限制叙述可能限制进一步的上行空间。如果公用事业公司开始拒绝数据中心扩展请求,H100和未来的Blackwell芯片的需求可能比分析师预期的更快达到顶点。短期看涨(6-12个月),因为现有项目完成,但留意超大规模者的订单推迟迹象。 维斯特拉能源和星座能源是意外的AI电力参与者。两者都拥有核电资产,并积极与科技巨头谈判合同。当宣布星座的三里岛协议时其股票上涨了20%。随着AI公司急需专用电源,预计具有核能力的公用事业公司将以溢价价率指挥。长期看好VST和CEG。 更广泛的纳斯达克面临没人讨论的悬顶风险。如果能源限制迫使AI公司减缓部署或缩小模型尺寸,整个技术行业的AI驱动估值溢价就会蒸发。我们正在谈论MSFT、GOOGL、META和AMZN可能的15-20%的修正,如果增长叙述从“无处不在的AI”转向“AI仅在能源允许的情况下”。这不是2026年风险——是2027-2028年风险,因为基础设施限制开始咬。