Apple 新一代Mac Studio(搭载M5 Ultra)正式出货时间还没到,在oMLX 效能资料库上已经悄悄出现首批M5 Ultra 本机AI 效能数据,相较前代规格看起来相当亮眼。这些数据在曝光后没多久就被移除,让这场「提前流出」多了一层话题性。
根据苹果官方规格,M5 Ultra 采用首款四晶粒UltraFusion 架构,最高提供36 核心CPU(12 个超级核心+ 24 个效能核心)、80 核心GPU,并首次在Ultra 晶片内置神经网路加速器,AI 峰值运算效能最高可达M3 Ultra 的4.3 倍、M1 Ultra 的9.8 倍。 搭配最高512GB 统一记忆体与1.2TB/s 记忆体频宽(较前代提升50%),这台机器从发表之初就被定位为「可以完全在本机执行大型语言模型」的桌上型电脑。
这次流出的数据之所以受到关注,有两个原因。其一,这是M5 Ultra 晶片第一份实际跑在MLX 生态系上的效能成绩,而不是官方简报上的理论数字;其二,这些数据是通过oMLX 的社群基准测试页面出现,代表测试环境、上下文长度、批次大小都有标准化条件,比一般个人跑分更容易与其他晶片横向比较。
oMLX 流出的首批实测数据
在oMLX 的Community Benchmarks 页面上(现在已被移除),出现了标记为「M5 Ultra (80c) / 256GB」的实测资料。 oMLX 是架构在Apple MLX 框架之上的推理引擎,提供统一的社群基准测试平台,让不同Apple Silicon 晶片在同一套测试条件下(相同上下文长度、相同批次大小)互相比较。 根据流出截图,该平台的测量指标分为PP(prefill,提示处理速度)与TG(text generation,文字生成速度)两个栏位,并支援过滤晶片、模型、量化、上下文长度等条件。

根据流出数据,M5 Ultra 在不同模型与量化组合下的表现如下:
- Qwen3.8-27B(Q4 量化,8K 上下文):prefill(提示处理)1,800 tokens/s、decode(文字生成)51 tokens/s
- Qwen3.8-Flash-Next(Q4 量化+ MTP,64K 上下文):prefill 2,574 tokens/s、decode 80 tokens/s
- GLM 5.3 Flash(oQ4e 量化,16K 上下文):prefill 955.4 tokens/s、decode 33.0 tokens/s
- Qwen3.8-Flash-Next(Q4 量化+ MTP,32K 上下文):prefill 2,661 tokens/s、decode 23.8 tokens/s
- Qwen3.8-Flash-Next(Q4 量化+ MTP,16K 上下文):prefill 2,681 tokens/s、decode 61.3 tokens/s
其中Qwen3.8-Flash-Next 在16K 上下文跑出最高2,681 tokens/s 的prefill 速度,64K 上下文维持2,574 tokens/s,显示M5 Ultra 的提示处理能力几乎不随上下文长度明显衰退。
另一名开发者也有存到相关数值,可作为补充:

世代升级的关键:prefill 快了3-4 倍
对比同样由社群跑出的M3 Ultra 数据,这次升级最有感的环节是prefill(预填充处理)速度。在MLX 官方社群的M3 Ultra 系统性测试中,Qwen 32B Q4 量化在8K 上下文只有约27.5 tokens/s 的decode 速度,1K 上下文时Q2 量化才达到约47.6 tokens/s。 当时的测试也点出M3 Ultra 的prefill 受计算瓶颈(约54 TFLOPS FP16)限制,与量化程度无关。
AI 社群观察到,M5 Ultra 与同级M3 Ultra 配置相比,prefill 速度约提升3 到4 倍,被认为是这代晶片最大的世代进步之一。这与苹果官方宣称「AI 峰值运算效能达M3 Ultra 的4.3 倍」的方向一致。

decode (解码)速度方面,M5 Ultra 在27B 模型上约50-80 tokens/s 的表现,与M3 Ultra 的30B 级模型数据相比也有明显增长,但两者使用的模型与量化方式不同,数值只能参考方向,不宜直接画上等号。 从MLX 社群的经验来看,decode 阶段的瓶颈主要是记忆体频宽而非算力,M5 Ultra 的1.2TB/s 频宽对文字生成速度的帮助,会比prefill 更直接反映在长上下文、长输出的应用情境。
数据曝光后随即被移除
这批数据在网路上引起讨论后,oMLX 上的M5 Ultra 项目已经消失。发文者在后续推文中表示,无法确认是原始测试者自行删除,还是oMLX 平台事后下架。
关键问题是:M5 Ultra Mac Studio 要到9 月22 日才正式开始出货给一般消费者,也就是说,提交这批数据的人至少在正式出货前5 天就拿到了机器,可能是媒体、开发者或提前收到样机的内部人士。 这也解释了数据为何会被移除:在产品尚未正式开卖前,非官方公布的效能数据通常会涉及保密协议或产品上市节奏考量。
本地AI 落地的意义
这份数据对开发者社群而言,象征的是「旗舰级本地AI」的门槛又下修了一阶。过往要在Mac 上顺畅跑70B 等级以上的模型,往往需要忍受不快的文字生成速度,或是在长上下文下明显变慢。 M5 Ultra 的定位则不同:80 核心GPU 加上最高512GB 统一记忆体,可以同时容纳多个30B 级模型,prefill 2,500+ tokens/s 的速度也让「丢大量文件进去分析」的场景变得实际。苹果官方也曾提到,多台Mac Studio 可以通过Thunderbolt 5 与RDMA 串联成丛集,四台组成的丛集AI 推理速度最高可达单台的3 倍,进一步扩展本地推理的规模上限。
总结
虽然流出的数据只涵盖80 核心GPU + 256GB 记忆体的配置,而且已经被下架,但方向相当明确:M5 Ultra 在预填充(prefill)阶段的效能跃升是这代晶片最值得期待的部分,官方宣称的「AI 效能4.3 倍提升」并不是纸上数字。 对于打算在Mac 上跑大型语言模型、甚至通过Thunderbolt 5 串联多台Mac Studio 组成丛集的开发者来说,9 月22 日出货后,真正的实测数据很快就会陆续出现。
