Apple M6 与 M5 Ultra 技术解读:2nm 首秀、四芯粒 UltraFusion 与 512GB 统一内存

Apple 发布了两颗定位完全不同的新芯片:Mac mini 首发的 M6 是 Apple 首颗采用 2nm 制程的芯片,Mac Studio 首发的 M5 Ultra 则是 M 系列第一次把封装做到四芯粒(quad-die),统一内存上限推到 512GB,统一内存带宽 1.2TB/s。两个系列的新机即日起接受预购,9 月 22 日正式发售。本文基于 Apple 新闻室的三篇官方新闻稿,逐项拆解这两颗芯片的架构数据和它们对本地 AI 推理的实际意义。

Apple M6 与 M5 Ultra

M6:2nm 制程首秀

M6 采用 2nm 工艺,在更小的裸片上塞进更高的晶体管密度。CPU 部分是全新的 12 核心组合:2 颗超级核心(super core)、4 颗性能核心、6 颗能效核心,比 M5 多出 2 个核心。按 Apple 的说法,超级核心提供全球最快的单线程性能,多线程性能较 M5 提升最高 1.2 倍,较 M1 提升最高 2.4 倍。

GPU 同样是 12 核心(比 M5 多 2 核心),每颗核心内置 Neural Accelerator(神经加速器),面向 AI 的峰值 GPU 算力较 M5 提升接近 30%,较 M1 提升超过 8 倍。图形特性包括更新的着色器核心架构、Dynamic Caching、硬件光追,以及提升 50% 的几何处理速率。

Neural Engine 从单引擎改为 Dual 16-core(双 16 核)设计,峰值算力翻倍,系统框架可以自动同时调度两个引擎加速模型执行。内存侧支持最高 32GB 统一内存,带宽 170GB/s,较 M5 提升 10%,较 M1 提升 2.5 倍。

Apple M6 芯片

落到整机上,搭载 M6 的新 Mac mini 对比 M4 版 Mac mini:AI 性能最高 4 倍,图形和存储速度最高 2 倍,CPU 性能提升 40%。标准配置 16GB 统一内存,可选 32GB。Apple 在新闻稿里给这台小机器的定位词是「always-on agentic computing」(常开的代理计算桌面机),即让编码代理、本地模型这类需要长时间驻留的任务在桌面设备上持续运行。

M5 Ultra:第一次四芯粒

M5 Ultra 的核心变化在封装。上一代 Ultra 芯片是两颗 Max 裸片互连,M5 Ultra 用下一代 UltraFusion 技术连接两颗 dual-die 版 M5 Max,形成 M 系列首个四芯粒架构。芯粒间带宽超过 4.4TB/s,连接密度提升超过 6 倍,四颗裸片在软件层表现为一颗统一处理器。

M5 Max 与 M5 Ultra

CPU 最高 36 核(12 超级核心 + 24 性能核心),单线程性能较 M3 Ultra 提升最高 1.25 倍,多线程提升最高 1.3 倍。GPU 最高 80 核心,是 Apple 迄今最强的硅晶 GPU,Neural Accelerator 第一次进入 Ultra 级芯片:面向 AI 的峰值 GPU 算力较 M3 Ultra 提升最高 4.5 倍,较 M1 Ultra 超过 6 倍。图形性能方面,芯片新闻稿给出较 M3 Ultra 提升最高 40% 的数字,Mac Studio 新闻稿则给出较上一代整机最高 1.8 倍的图形性能。GPU 还带来第二代 Dynamic Caching、硬件网格着色(mesh shading)和第三代光追。

内存是这颗芯片最有讨论价值的部分:最高 512GB 统一内存,1.2TB/s 带宽,比 M3 Ultra 高 50%。Apple 的表述是,这个容量可以让用户把「数千亿参数级」的大模型完整装进本地内存运行,同时提高 token 生成速度。Media Engine 的视频编解码模块数量是 M5 Max 的两倍,支持 H.264、HEVC、四路 ProRes 编解码引擎和 AV1 硬解,可同时播放 33 路 8K ProRes 422 30fps 视频。

四颗芯片规格对照

规格M6M5 ProM5 MaxM5 Ultra
制程2nm未披露未披露未披露
CPU12 核(2+4+6)最高 18 核18 核(6+12)最高 36 核(12+24)
GPU12 核最高 20 核最高 40 核最高 80 核
GPU 神经加速器有(Ultra 首次)
Neural Engine双 16 核未披露未披露32 核
统一内存最高 32GB最高 64GB最高 128GB最高 512GB
内存带宽170GB/s307GB/s614GB/s1.2TB/s

M5 Pro 和 M5 Max 的制程信息未出现在本次新闻稿中,表中不做推测。

512GB 统一内存对本地大模型意味着什么

大模型本地推理有两个硬约束:权重必须完整装进内存,token 生成速度主要受内存带宽限制。

第一个约束决定了能跑多大的模型。云端 NVIDIA H200 这类数据中心 GPU 的显存是 141GB,Apple 这次把桌面设备的统一内存做到 512GB,量级上超过了单颗数据中心 GPU 的显存配置。对 MoE(混合专家)架构的开源权重模型来说,这个容量意味着更多的模型可以在一台桌面上完整加载,而不是依赖多卡分割或云端 API。

第二个约束决定了跑得多快。1.2TB/s 的带宽比 M3 Ultra 高 50%,直接反映为解码阶段(逐 token 生成)的吞吐提升。Apple 在 Mac Studio 新闻稿中的场景描述很直白:把前沿级开源权重模型放在桌面上运行,完全本地、保护隐私,「不用数 token,也不用担心云成本上涨」。

需要注意的是内存类型差异:统一内存是 LPDDR(板载、与 CPU/GPU 共享),与数据中心 GPU 的 HBM 在带宽量级和用途上并不相同,前者的优势在于容量大、功耗低、CPU 与 GPU 零拷贝共享,适合推理与端侧开发场景,而非训练集群。

多机集群:Thunderbolt 5 + RDMA

Mac Studio 内置对 Thunderbolt 5 和 RDMA(远程直接内存访问)的集群支持。多台机器通过 TB5 互连后形成一个跨机的共享内存池,可以加载当前最大的前沿级开源权重模型。Apple 给出的数字是:四台 Mac Studio 集群的 AI 推理性能最高可达单机的 3 倍。TB5 提供最高 120Gb/s 的传输带宽。

这个能力下放了:Mac mini 的 M5 Pro 版本同样支持通过 Thunderbolt 5 集群多台机器运行大模型。对小型团队来说,用几台迷你主机搭一个本地推理池,是一条比采购独立 GPU 服务器更省电的路径。

开发者栈:Core AI 与 MLX

软件侧这次同步出现了一个新框架 Core AI,定位是在 Apple 芯片上构建、运行和部署 AI 模型,针对统一内存、CPU、GPU 和 Neural Engine 做架构级优化,开发者可以在本地部署完整规模的 LLM,或把自有模型接入应用。MLX 继续承担运行、训练和微调的角色。配合 Xcode、Apple Foundation Models 和 App Intents,开发者可以完全在设备上构建和运行 AI 工作负载。

Apple 的新闻稿配图也给出了生态参考:LM Studio Bionic 跑本地模型、Draw Things 跑图像生成、MATLAB 跑数据可视化,都在 Mac Studio 上演示。

整机层面的其他更新

Mac Studio:存储改用 PCIe Gen 6 架构 SSD,读写速度翻倍,对加载大体积 LLM 权重文件有直接意义;Apple 自研 N1 网络芯片首次带入 Wi-Fi 7 和蓝牙 6;新增 USB-C genlock 支持,可与 iPhone 17 Pro 等相机设备精确同步;支持最多 8 台显示器,或 4 台 5K 120Hz 的 Studio Display XDR。M5 Max 版本配置 18 核 CPU、最高 40 核 GPU(图形性能较上代提升 50%)、最高 128GB 内存和 614GB/s 带宽。

Mac mini:两个版本均支持 Wi-Fi 7、蓝牙 6 和 2.5Gb 以太网(可选 10Gb)。M6 版后置三个 Thunderbolt 4 接口,M5 Pro 版为三个 Thunderbolt 5 接口。M5 Pro 版最高 64GB 内存、307GB/s 带宽,支持复杂 3D 场景和 ProRes RAW 剪辑。

两台机器都随 macOS 27 Golden Gate 上市,包含 Siri AI 和下一代 Apple Intelligence。

小结

M6 和 M5 Ultra 这次把两条路线同时推到新位置:M6 用 2nm 制程和双 Neural Engine 拉高主流桌面每瓦性能,M5 Ultra 用四芯粒封装和 512GB 统一内存把「单机跑数百亿到数千亿参数模型」从概念推进到货架商品。配合 TB5 集群和 Core AI 框架,本地 AI 推理在 Apple 平台上第一次形成了从 32GB 迷你主机到 2TB 内存集群(四台 512GB 机器)的完整梯度。9 月 22 日发售后,第三方实测数据将回答两个关键问题:2nm 的能效曲线实际长什么样,以及 1.2TB/s 带宽在主流开源模型上的 token 吞吐到底能到多少。

来源