Hot Chips:AI处理器竞逐,IBM Z融合ARM

最近在加利福尼亚举行的 Hot Chips 大会上,AI 毫无意外地成为主导,展出的处理器覆盖推理、数据中心乃至桌面领域;大会前后还有多款高性能处理器发布。尽管名称各异,许多设计都力求将芯片功耗控制在约 300W,考虑到其性能,这并非易事。

AI 推理处在十字路口

一个非常值得关注的发展是 IBM 将 Z 架构与 ARM 指令集结合的工作。这并非采用两个核心,而是让 ARM 核心能够运行 Z 指令,从而使 IBM 未来的 Z 和 LinuxONE 处理器能在同一 CPU 核心上原生执行 IBM Z 与 ARM AArch64 软件。

Moor Insights & Strategy 首席分析师 Matthew Kimball 在 Hot Chips 上表示:“芯片上的每个核心都能执行 z/Architecture 和 ARM。不是通过仿真,不是通过转换层,也不是把一组 ARM 核心放在芯片一角。每个物理核心都能说两种语言,并在分派工作时在两者之间切换。为主机系统上已经为 ARM 构建的庞大软件目录打开了大门,无需任何人先进行移植。”

IBM 复用了 z/Architecture 的分支预测器、地址转换硬件和主要算术路径,然后加入 ARM 所需的功能,包括在数据移出缓存时翻转字节顺序,使 ARM 软件看到它预期的一切。

Kimball 说:“把 ARM 放进现有核心也是一个有意选择。授权一个标准 ARM 模块会容易得多,但那样会变成商品级硅片,支撑该平台的整合计算也会随之崩溃。”

IBM 的做法意义重大,不仅因为架构本身,还因为它能在保留 IBM Z 和 LinuxONE 主机安全性、可用性和运营特性的同时,接入 ARM 软件生态。

该生态目前覆盖超过 2200 万开发者,以及 Linux 发行版、云原生软件、企业应用和 AI 框架。对 IBM 客户而言,潜在结果是无需强迫开发者移植应用,就能让 ARM 原生 Linux 环境与 z/OS 和 IBM Z 上的 Linux 同时运行。

图注:可在同一核心上运行 IBM Z 与 ARM 指令的处理器核心。来源:IBM

该处理器基于 2 nm 工艺节点,设计将包含 11 个运行频率超过 5.7 GHz 的高性能核心、用于交易中欺诈检测的 AI 推理加速器、用于 I/O 加速的专用片上数据处理单元,以及面向苛刻企业负载的大型缓存架构。

ARM 云 AI 执行副总裁 Mohamed Awad 表示:“随着 AI 规模扩大,越来越多计算版图正向 ARM 汇聚。IBM Z 和 LinuxONE 为高度受监管行业中最苛刻的一些工作负载提供动力。将 ARM 计算及其软件生态带到这些平台,会把这一势头延伸到关键任务企业基础设施,让组织在部署 AI 的方式上有更多选择。”

存在一个解码流水线,其许多细节为两种指令集架构共享。不过,执行实际解码的独立解码器——无论是 z/Architecture 的 16 至 48 位指令,还是 ARM 架构的 32 位指令——都是我们构建的独立解码器。

在加载-存储单元中,数据缓存按字组织,但我们支持任意字节边界上的非对齐访问。一种结构会把来自缓存的字访问格式化为加载指令实际请求的字,以支持大端与小端操作。

下一代超级计算机之争

富士通展示了另一种路径:用于高性能计算(HPC)的 Monaka 处理器集成 144 个 ARM 核心。Monaka 基于 ARMv9 架构,并与广泛的 AI 和 HPC 软件环境同步开发,包括主要开源软件、操作系统、框架和库。富士通表示,该平台无需修改即可接入 ARM 软件生态,同时仍允许其围绕自身性能和能效目标进行深度优化。

关于 ARM 自己的 AI 数据中心 AGI 处理器,更多细节已经浮现。该芯片在两个芯粒(chiplet)上集成最多 136 个 ARM Neoverse V3 核心,采用 3 nm 工艺,运行频率 3.7 GHz。它拥有 12 个 DDR5 内存通道、96 条 PCIe Gen 6 通道并支持 CXL 3.0,全部处于 300W 热设计功耗范围内。它每核心提供超过 6 GB/s 内存带宽,同时提供与加速器和扩展内存协同工作所需的连接能力。

ARM 还推出了其 Neoverse N 系列最新版本 N4,此前代号 Dionysus。这是首个在 3 nm 工艺上运行于 3.8 GHz 的 N 系列核心;此前 V 系列才是高性能设计。

N4 最初实现在新的计算子系统 CSS N4 中,支持每 die 最多 128 个核心、LPDDR6 内存,以及最多 128 条 PCIe Gen 7 连接以支持 CXL 4.0 规范。这一组合将提供 Neoverse CSS N3 两倍的性能、1.25 倍的每瓦性能,以及最高 1.75 倍的内存带宽。

N4 CSS 的关键是一个 16 × 16 一致性网状互连,其带宽是此前 S3 互连的两倍,并使用 AMBA CHI C2C 协议连接芯粒。CHI C2C 处理上层逻辑,例如跨芯粒的缓存一致性、系统安全和虚拟化;UCIe 则处理下层任务,包括物理连接(PHY)、链路管理和原始数据传输。

这允许以芯粒形式向平台添加定制加速器,使开发者能专注于自己的增值部分,而非底层处理器基础设施。

阿里巴巴和微软已在数据中心芯片中使用 N2 CSS,谷歌则在其 Axion N4A 芯片中使用 N3。

Awad 表示:“身处云业务是非常令人兴奋的时刻。自 2018 年以来,已有 15 亿个 Neoverse 核心出货到全球数据中心,其中过去九个月出货 5 亿个,这能让你感受到,作为全球数据中心计算建设的一部分,Neoverse 在数据中心中的加速有多快。”

Nvidia 也披露了其基于 ARM 的 Olympus 核心更多细节,该核心用于 Vera CPU,与 Rubin GPU 搭配。公司称这是首个为 AI 智能体设计的核心。

Nvidia 高级技术负责人 Eduardo Alvarez 表示:“智能体式 AI 将更多关键执行路径转移到 CPU 上。智能体在沙箱中运行,执行代码、调用工具、检索上下文、与数据库交互并分析结果,然后才把信息返回给模型。”

“这些需求不同于传统云 CPU 设计,后者往往优先考虑核心密度和面向更均匀工作负载的吞吐量。智能体式 AI 反而更看重在每个智能体循环中,跨顺序、分支密集且对延迟敏感的软件路径的持续每线程进展。Vera CPU 正是为此类工作负载打造,Olympus 核心是其设计中心。”

Olympus 前端旨在让核心在大型、分支密集的软件栈中持续获得有用指令。智能体运行时、解释器、编译器、图分析和数据处理框架等工作负载,往往同时具有大指令足迹和频繁控制流变化,这可能导致执行资源利用不足。Olympus 通过先进分支预测、高带宽指令获取和每周期向核心输送更多指令的 10 宽解码引擎来应对这些挑战。

该方法的核心是 Olympus 分支预测子系统,其中包括一个神经分支预测器,旨在提高对困难、统计上有偏的分支模式的准确率。通过减少错误路径执行并支持每周期最多两个 taken 分支,它有助于在软件行为不规则时维持控制流吞吐量。结合宽解码路径,这些能力使 Olympus 能为延迟敏感工作负载维持更强前端吞吐量,包括智能体式 AI 和强化学习应用——在这些场景中,高效处理复杂控制流最为重要。

智能体工作负载往往遵循长链依赖工作:解释代码、遍历对象、管理运行时状态、处理工具输出,以及导航图状数据结构。在这些路径中,性能不仅取决于指令获取,还取决于核心在前序指令等待分支、内存或依赖解析时,发现独立工作的能力。

Olympus 核心中部设计用于暴露并加速这种隐藏并行性。宽重命名和分配引擎将解码后的指令映射到物理资源,而大型重排序缓冲区和大量物理寄存器容量则让更多指令在飞行中,以实现更深度的乱序执行。依赖打破能力——包括内存重命名、值预测和关键路径加速——有助于减少指针密集代码、串行化内存操作和长依赖链造成的停顿。

这些特性共同让执行引擎保持高效,提升 IPC,并增强智能体、强化学习环境和现代 AI 基础设施中常见不规则软件路径的单线程性能。

智能体工作负载需要的不仅是宽前端。一旦指令进入核心,CPU 就必须高效执行不断变化的整数运算、分支、向量工作和内存访问组合,且不能制造新瓶颈。传统 x86 服务器 CPU 往往依靠更高时钟频率来改善单线程响应速度,但智能体工作负载经常受不规则控制流、长依赖链和内存延迟制约。这些挑战要求更高 IPC,而不仅是频率。

Olympus 执行引擎将宽指令供给转化为有效执行。它在广泛的整数、分支、向量、浮点、加密、加载和存储资源上动态调度操作,并由宽后端和深度乱序执行支持。这种平衡设计帮助 Olympus 高效处理分支密集软件、向量化数据处理、AI 预处理、加密、压缩、分析及其他内存密集型工作负载。

图注:Nvidia Olympus 核心

智能体经常操作无法整齐放入缓存的数据结构,包括运行时对象、检索索引、工具状态、图结构、稀疏数据、数据库和环境内存。传统缓存和预取设计适合规则流式访问模式,但当每个地址取决于前一次内存查找结果时——这在指针密集和图状智能体工作流中很常见——效果就会下降。

Olympus 缓存子系统旨在减少这些停顿,并持续向执行引擎提供指令和数据。它结合深缓存层级、内存消歧和多个硬件预取引擎。Olympus 还包括一个图预取器,旨在提升数据密集型图和分析工作负载的性能。

这些能力共同降低有效内存延迟并提高内存级并行度,帮助智能体、图分析和数据处理工作负载减少等待不规则内存访问的时间,把更多时间用于有用工作。

多线程

多线程对智能体工作负载很重要,这类负载往往具有突发性、事件驱动,并与后台系统活动交织。典型沙箱可能运行主执行路径,同时处理异步 I/O、定时器、运行时服务、网络、日志、内存管理和工具编排。第二个硬件线程使 CPU 能在本地吸收这些支持性工作,提高利用率和响应性,同时减少主智能体线程必须让出、迁移或等待的频率。

传统同时多线程(SMT)通过让两个硬件线程共享一个核心来提高利用率,但这种共享可能引入争用。在密集线程化沙箱环境中,线程可能竞争分支预测、解码带宽、执行资源、加载/存储容量、缓存和内存带宽。这会在核心内部造成“吵闹邻居”效应,一个线程的活动可能降低另一个线程的性能。对于智能体式 AI、强化学习环境和云服务,这种可变性很重要,因为延迟会直接影响吞吐量和服务质量。

Vera CPU 采取了不同方法,采用 Nvidia 所称的空间多线程(Spatial Multithreading,SMT)。宽 Olympus 核心并非仅依赖机会性资源共享,而是设计为在两个硬件线程之间更有效地划分资源。这使 Olympus 在需要最大每线程性能时,可作为高吞吐单线程核心运行,兄弟线程处理管理活动;在需要更高线程密度时,则可作为两个更隔离的执行上下文运行。

Vera CPU 已开始向客户批量出货。亚马逊云科技(AWS)于 2026 年 8 月收到其首台 Vera CPU 服务器和 Vera Rubin GPU,由超大规模与 HPC 副总裁 Ian Buck 在 Seattle 亲手交付。此前,Buck 已向 Oracle Cloud Infrastructure 以及三家领先 AI 实验室 Anthropic、OpenAI 和 SpaceXAI 交付 Vera CPU 系统。

Intel 一直在展示其基于 18A 工艺技术的最新处理器,并将芯粒牢牢带入主流。

Intel 首席技术官 Pushkar Ranade 表示:“智能体式 AI 正在从根本上改变我们设计和交付计算的方式——从晶体管和封装,一直到完整系统架构。未来在于把通用计算与专用加速、先进封装和开放芯粒技术紧密集成,构建能适应工作负载、并在现实功耗、成本和部署约束内扩展的系统。”

Diamond Rapids 是面向企业级 AI 编排的下一代 Xeon 处理器,而 Crescent Island 是经过推理优化的 GPU,旨在改善 AI 部署的经济性。Wildcat Lake 将 AI 能力带到主流笔记本电脑和边缘设备,并且是首款使用 UCIe 芯粒标准的 Intel 处理器。

Diamond Rapids 使用 Intel 18A-P 工艺,具备可适应的计算构建块、统一内存架构和灵活 I/O。单芯片最多可容纳 256 个核心,配备 1.28 GB 末级缓存(LLC)和 16 个运行于 12,800 MT/s 的内存通道。I/O 支持 128 条 PCIe Gen 6 通道和 CXL 3.0。该处理器采用 Foveros Direct 3D 工艺构建,使用 UCIe-S 互连连接所有芯粒。它还包括新的高级性能扩展(APX)和增强的高级矩阵扩展(AMX),以加速下一代 AI 应用。

Crescent Island 是一款面向推理优化的低功耗 GPU,可在现有风冷数据中心空间内支持更大的 AI 模型、更长的上下文窗口和更多并发 AI 智能体。该 GPU 基于现有 Xe 架构,拥有 32 个 Xe 核心和 256 个基于 Xe3P 的 XMX 引擎,支持最高 480 GB LPDDR5X 内存。它可以装在 350W 热设计功耗的风冷 PCIe 卡上。

最新 Core Series 3 处理器代号 Wildcat Lake,基于 18A 构建,包含集成 Xe3 显卡(带 XMX 加速),以及为混合 AI 提供最高 17 TOPS 的 NPU。Wildcat Lake 也标志着 UCIe 首次用于 Intel 处理器,使面向主流 AI 平台的高性价比多芯片封装设计成为可能。它有两个性能核心和四个能效核心,支持 LPDDR5X 内存。

Diamond Rapids 将与 AMD 上月发布的 Verona 核心竞争。该核心计划于 2027 年作为 EPYC 9006 LP 服务器 CPU 亮相,采用 2 nm 工艺,运行频率 5 GHz,每芯片 72 个核心,并使用 LPDDR5 内存。AMD 还在加入其最近收购的加拿大公司 Taalas 的硅技术,后者开发了专用 AI 推理硅。

AMD 人工智能集团高级副总裁 Vamsi Boppana 表示:“AMD 正在构建全栈 AI 平台,让客户能灵活地为每种 AI 工作负载部署合适的计算解决方案。Taalas 的技术和世界级工程团队通过提供差异化的推理性能和效率,增强了我们的 AI 产品组合。”

Taalas 联合创始人兼 CEO Ljubisa Bajic 表示:“我们创立 Taalas,是为了围绕模型构建硬件,从根本上重新思考 AI 推理。我们位于加拿大的团队将深厚技术专长与挑战传统方法的意愿结合起来。加入 AMD 将为我们提供规模、工程资源和全球覆盖,以加速创新。”

新人专享大礼包