谷歌称人工智能算力遭遇内存墙 高带宽内存占成本四分之三以上
在 SEMICON Taiwan 2026 上,谷歌(Google)强调 AI 计算正面临日益严峻的“内存墙”(memory wall)挑战。据《工商时报》(Commercial Times)报道,Alphabet 旗下谷歌云供应链基础设施高级总监 Nikhil Cherian 表示,多模态与混合专家(Mixture of Experts, MoE)等架构的兴起,正推动 AI 计算从计算密集型转向内存密集型,高性能内存如今已占 AI 服务器硬件物料清单(BOM)成本的 75% 以上。
Cherian 指出,大语言模型与 AI 代理工作流的快速演进,推动内存层次结构在容量、带宽、延迟和功耗等方面逼近物理极限。为突破这些瓶颈,谷歌采取差异化硬件路线:TPU 8i 面向低延迟推理,TPU 8t 则瞄准超大规模训练。
硬件与软件双轨并进
硬件方面,报道称,面向推理的 TPU 8i 配备 288GB 高带宽内存(HBM),并将片上 SRAM 容量提升至 384 MiB,达到此前的三倍,使动态对话状态和键值(KV)缓存能够留在片上,实现零片外延迟。面向训练的 TPU 8t 将 9,600 颗芯片连成大规模计算集群,共享 HBM 池最高达 2PB,可降低片外数据传输瓶颈;其还集成 TPU Direct Storage,有助于维持高加速器利用率。
软件与可持续性方面,谷歌开发了 TurboQuant——一种无需训练的无损量化算法,可将大模型 KV 缓存从 32 比特压缩至 3 比特,内存占用降至原来的六分之一,同时不牺牲精度,并使注意力计算提速 8 倍。
对内存市场影响有限,或加速 AI 应用落地
《经济日报》(Economic Daily News)3月的一篇报道称,TurboQuant 主要压缩 AI 推理阶段的 KV 缓存,对用于模型训练和权重存储的 HBM 以及长期存储需求并无影响,因此对整体内存市场的冲击预计有限。不过,通过降低计算成本,TurboQuant 可能加快 AI 应用普及,并带动终端设备与边缘计算需求增长。
内存支出在 AI 基础设施投入中的占比正不断提高。据 TrendForce 集邦咨询预测,在内存合约价格上涨和更高比特需求的推动下,DRAM 与 NAND Flash 合计将在 2026 年占云服务提供商(CSP)总资本支出的 47%,到 2027 年进一步升至 68%。TrendForce 还预计,2026 年服务器 DRAM 合约价格将上涨约 270%,企业级 SSD 价格约上涨 235%。












