AI与科技第 17 期 ·

以为只要买GPU就够了?AI基础设施战争的真正胜负手

AI基础设施竞争的真正瓶颈不是芯片,而是先确保电力和内存的企业才能赢得这场战争

以为只要买GPU就够了?AI基础设施战争的真正胜负手

开篇

订阅者朋友,先给您一个数字。690万亿韩元。

这是2026年五家大型科技公司宣布将投入基础设施的金额。相当于韩国年度GDP的约30%。可即便有这笔钱想花,也有企业花不出去。就是微软。萨蒂亚·纳德拉CEO亲口承认了这一点。GPU堆在仓库里,却没有电可以插。有800亿美元的Azure1​订单积压,但物理上根本无法让服务器运转起来。

2026年2月的最后一周,大型科技公司的公告接连不断。2月17日Meta与英伟达的GPU合作伙伴关系,2月24日Meta与AMD的合约,同一天谷歌宣布德州数据中心计划。大多数报道都只聚焦在“又一笔GPU交易”上。而我认为,这些公告其实在讲述另一个故事。

今天要说的就是这个故事。不是谁买了更多GPU,而是真正的瓶颈究竟在哪里。

AI基础设施战争的结构:三个轴心

要构建AI基础设施,需要同时具备三样东西。

第一是高算力芯片。也就是GPU、TPU2​这类AI专用半导体。第二是电力基础设施。要真正运转这些芯片,需要数据中心和电力。第三是消耗性内存芯片。也就是HBM3​、DRAM、NAND这类半导体,负责在AI模型运算期间承载数据。

问题在于,目前没有任何一家企业能同时掌控这三者。所以现在发生的事情是:各家企业一边砸下690万亿韩元,一边拼命弥补自己薄弱的那个轴心。

我们一个一个拆开来看。

第一轴:高算力芯片——只有三个选项的市场

能够从外部采购的高算力AI芯片,实际上只来自三个地方。英伟达GPU、AMD GPU、谷歌TPU。这就是常说的寡头垄断4​。而且是相当结构性的寡头垄断。从软件生态(英伟达的CUDA5​)到封装技术,再到与台积电的关系,新玩家想要进入这个市场,是需要花上好几年的项目。

因此,大型科技公司如今正在正式化其供应源多元化战略。Meta是最鲜明的案例。<2月17日,Meta与英伟达签署了数百万颗规模的Blackwell、Rubin GPU长期合作协议,一周后的2月24日,又与AMD签订了最高6GW规模的Instinct GPU多年期合约。>与此同时,Meta也在开发自研的MTIA芯片。

马克·扎克伯格是怎么说的呢?他说这是“为实现算力多元化迈出的重要一步”。这等于是正式宣布不能依赖单一供应商。AMD CEO丽莎·苏将这份合约形容为“一项多年、多代际的合作,将为Meta的工作负载提供优化的高性能、高能效基础设施”。

谷歌则朝着另一个方向前进。凭借自研TPU v7 Ironwood强化推理6​专用芯片战略的同时,与Anthropic签订了超过100万颗TPU的供应合约,并开始向外部Neocloud销售。也就是说,谷歌不打算把TPU留给自己用,而是要像英伟达一样对外出售。

不过这里有一点不能误解。英伟达并没有崩溃。英伟达在通用性和软件生态上依然占据压倒性优势。只是在大规模推理工作负载7​中,TPU或ASIC8​这类定制芯片开始在成本效率上占据优势。市场正在从垄断结构转向多层结构。

第二轴:电力基础设施——“有钱却没有电”

在我看来,这是最物理、也最严峻的瓶颈。

谷歌在2月24日宣布,将在德州威尔巴杰县新建数据中心,并称已在德州电网签约超过7,800MW的净增电力。按1GW约相当于70万户家庭用电量计算,7,800MW的规模超过了韩国釜山、仁川、大邱三座城市人口的总用电量。此外还包括与AES合作建设清洁能源,以及采用风冷方式将用水量降到最低。

Meta正在俄亥俄州建设1GW规模的Prometheus数据中心,并计划在路易斯安那州建设最高5GW规模的Hyperion。扎克伯格亲自提到的场地规模,约为汝矣岛面积的20倍。

为什么需要这么多电力?因为AI正在结构性地推高电力需求。美国能源信息署EIA预测,美国商业用电需求将在2025年增长3%,2026年增长4.5%;国际能源署IEA则预计,到2030年全球数据中心的电力消耗将是目前的两倍。

但这里有个真正的问题。电力变压器的交货周期已经延长到128周(约2.5年)。也就是说,即便现在下单,也要等到2028年下半年才能拿到货。这意味着,即使有钱,也得等上两年半。

正因如此,德州正在成为炙手可热的数据中心选址。因为那里有独立电网ERCOT9​,监管灵活,且土地广袤。谷歌选择威尔巴杰县并非单纯的土地问题,关键在于提前确保了电力供应。像微软这样没能充分确保电力的企业会发生什么,我们已经亲眼见到了——GPU正躺在仓库里睡大觉。

最近还有消息称,软银、美国以及OpenAI雄心勃勃推进的Stargate项目10​,也因电力短缺问题,取消了原本集中在德州建设的计划,改为缩小规模或分散建设。

第三轴:内存——AI正在吞噬内存

第三个轴心,是与韩国关系最密切的故事。

HBM 2026年的产能实际上已经全部售罄。SK海力士在2025年10月的财报发布会上表示,其HBM、DRAM、NAND的2026年产能“实际上已完全售罄”,美光则宣布将彻底退出消费级内存市场,只专注于AI数据中心客户。

为什么会变成这样?这里有结构性原因。

HBM3E相比标准DDR5,需要约3倍的晶圆面积。也就是说,为一块AI加速器配上内存,需要占用相当于三块普通内存的产线。内存厂商越是专注于HBM生产,我们智能手机和笔记本电脑里用的普通内存就越少。

结果已经显现出来了。三星将DDR5 32GB模组价格从149美元上调至239美元,涨幅约60%。DDR5合约价格更是暴涨超过100%。也有人提到,由于消费级内存短缺,索尼PS6的发售可能会延期(这并非索尼官方证实,而是来自主机游戏专业媒体的传闻)。

那么这种情况会持续到什么时候?SK海力士管理层在摩根大通的会议上表示,有信心认为内存上涨周期可能持续到2027年,甚至2028至2029年。他们认为,即便CSP11​们双重、三重下单,供应短缺现象仍将持续。

这里还有一点值得特别指出。LTA(长期供应合约)的主导权已经逆转。过去内存过剩时,是供应商主动推销合约;而现在,谷歌、微软这类云服务企业反而主动找上门来,请求锁定供货量。这是内存从单纯零部件升级为战略资产的信号。

而且随着AI推理时代的到来,内存需求结构也在发生变化。以前需求集中在AI训练(training)上,如今重心正转向推理(inference)。随着KV缓存12​成为新的内存需求驱动因素,每台服务器所需的DRAM容量在增加,企业级SSD(eSSD)的需求也随之上升。

美银美林(BofA)预测,2026年HBM市场规模将达到546亿美元,同比增长58%,并将SK海力士选为全球内存行业的首选股。

Oswarld视角

老实说,看着这场竞争,我想起了在GTM战略师时期经常见到的一种模式。

这种模式就是——瓶颈会转移。产品每克服一个制约,瓶颈总会转移到别处。AI芯片供应增加了,电力就被卡住;确保了电力,这次轮到内存被卡住。

从这个角度来看,目前处于最有利位置的企业是哪家?我认为是谷歌。自研TPU生态、德州7.8GW电力、以及与Anthropic的AI技术栈合作,谷歌在三个轴心中拥有最均衡的组合。

Meta选择了芯片多元化(英伟达+AMD+MTIA三足鼎立)这一精明的战略。但这只是分散供应风险的策略,并不能解决瓶颈本身。Meta真正的变数在于路易斯安那州5GW规模的Hyperion何时能真正投入运转。

微软目前处境最为艰难。对英伟达的依赖度高,在电力确保方面也最为落后。积压的800亿美元未满足订单意味着,此时此刻,微软仍在不断错失变现的机会。

而且,不能不提韩国的故事。SK海力士和三星是三大轴心中掌控内存这一轴心的核心玩家。SK海力士在HBM市场的份额约为50%到62%,这一份额在HBM4上很可能得以延续。作为数据分析师,这个数字意味着一件很简单的事:AI基础设施每增加一个单位,其中就有一半以上的可能性用的是SK海力士或三星的内存。

不过也有一点需要保持警惕。市场总是存在周期。目前内存短缺具有结构性,这一点没错,但2027至2028年SK海力士龙仁工厂和三星新工厂投产后,供应量将迎来增长的时点。到那时,需求是否依然超过供应,还是重新转为供应过剩,将成为检验这一周期的真正试金石。

结语

我来为大家梳理一下,这次一系列公告中真正重要的信息是什么。

AI基础设施的竞争,已经从比谁买了更多芯片,转向比谁先确保了电力和内存。变压器交货周期长达2.5年,HBM产能全部售罄。这些都不是靠软件或算法能解决的问题,而是彻头彻尾的物理制约。

690万亿韩元的资金在倾泻而下,可为什么电力和内存却依然短缺?您明白了吗?这个数字所展示的,不是意志的强弱,而是瓶颈的深度。

最后,我想向大家提一个问题。这些基础设施投资最终能收回成本吗?AI服务创造的收益,是否能以足够快的速度增长,从而证明这些物理投资的合理性,目前还没有确切答案。下次,我们就来聊聊这个问题——也就是AI基础设施的盈利方程式。

参考资料与延伸阅读

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。

注释

  1. Azure:微软的云服务平台。企业无需自行搭建服务器、数据库、AI模型,即可租用这套基础设施。

  2. TPU(Tensor Processing Unit):谷歌自主设计的AI专用芯片。如果说GPU是“万能工具箱”,那么TPU就是“只拧特定螺栓的电动螺丝刀”。通用性较低,但在AI运算上成本效率更高。

  3. HBM(High Bandwidth Memory):紧贴AI加速器搭载的高带宽内存。数据传输速度比普通DRAM快数十倍,但生产时需要标准DRAM三倍的晶圆。原理类似于在高速公路上直接架设加油站。

  4. 寡头垄断:市场供应集中在少数几家企业手中的结构。与独占(1家)不同,是由2到3家企业瓜分市场大部分份额的形态。AI芯片市场就是英伟达、AMD、谷歌TPU的三方寡头垄断。

  5. CUDA:英伟达开发的GPU编程环境。全球AI研究人员和开发者数十年积累的代码都与之绑定,是转向其他芯片时最大的转换成本所在。

  6. 推理(Inference):AI模型在实际服务中回应用户请求的过程。与最初构建模型的训练(Training)不同,推理需要在服务运行期间持续进行。AI商用化程度越高,推理基础设施所占比重就越大。

  7. 工作负载(Workload):计算系统需要处理的作业总量。AI推理工作负载,指的是实时响应用户查询的作业。

  8. ASIC(Application-Specific Integrated Circuit):专为特定用途设计的半导体。灵活性低于GPU,但在对应作业上效率高得多。谷歌TPU、亚马逊Trainium都是典型的ASIC。

  9. ERCOT(Electric Reliability Council of Texas):德州独立电网。与美国联邦电网相分离,因此监管更为灵活,这也是德州成为数据中心热门选址的原因之一。

  10. Stargate项目(Stargate Project)是一项大规模公私合营计划,专注于开发驱动下一代AI所需的物理和数字基础设施,总规模达5000亿美元。

  11. CSP(Cloud Service Provider):云服务提供商。指AWS(亚马逊)、Azure(微软)、GCP(谷歌)这类企业。

  12. KV缓存(Key-Value Cache):AI模型在推理时为记住之前对话脉络而存储的数据。对话越长,KV缓存越大,内存消耗呈指数级增长。可以理解为AI“记住对话”所需付出的内存成本。