Apple 公布本地端AI 能力对照表:iPhone 可跑140 亿参数,Mac Studio 丛集直上1.6 兆

网路上很多苹果用户经常以Mac 的统一记忆体适合跑本地端AI 大模型,但似乎没有任何人讲清楚可以跑多大的模型。近日Apple 把「哪一台机器能跑多大的模型」写成了一张表,列出从iPhone、iPad 一路到Mac Studio 丛集的统一记忆体上限、记忆体频宽与可承载的模型规模,最高一阶写着1.6 兆个启动参数。

六个栏位,一张表看完

表上六个产品线,每一栏都给了记忆体、频宽与模型规模三个数字:

  • iPhone 与iPad:16GB 统一记忆体、76GB/s 频宽,最高140 亿个启动参数
  • MacBook Air:32GB、153GB/s,最高350 亿个
  • Mac mini:64GB、307GB/s,最高700 亿个
  • MacBook Pro:128GB、614GB/s,最高1,200 亿个
  • Mac Studio:512GB、1.2TB/s,最高4,800 亿个
  • Mac Studio 丛集:2TB、1.2TB/s,1.6 兆个以上

Mac mini 与Mac Studio 的数字,Apple 自己写过

依照Apple 教育社群由顾问工程师James Garringer 撰写主题是校园采购的文章,文中写明M5 Pro 版Mac mini 支援最高700 亿个启动参数、307GB/s 频宽,足以在本机执行Llama 3.3 70B 或Qwen 3.6 35B,不需要呼叫云端API;M5 Ultra 版Mac Studio 支援4,800 亿个启动参数、1.2TB/s,多台串成的丛集则推进到1.6 兆个启动参数。文章列出的用途是大学的AI 与资料科学课程,学生与研究人员可在私有环境里实验Qwen、Mistral、Gemma、LLaMA、DeepSeek 等开源模型,不必按token 计费。

表上Mac mini 那一栏,对应的是M5 Pro 配置。 2 奈米制程的M6 内置双16 核心神经网路引擎、GPU 每核心都带神经网路加速器,统一记忆体最高32GB、频宽最高170GB/s;要拿到64GB 与307GB/s,得选M5 Pro 版本,也就是表上列出的那一阶。我们最近也入手了一台Mac mini M6 32GB 版测本地端(之后会出详测视频),大家了解一下就好,原则上四万多的机器体验也没有很好。

Apple 公布本地端AI 能力对照表:iPhone 可跑140 亿参数,Mac Studio 丛集直上1.6 兆

手机那一阶:76GB/s 的门槛

表上为iPhone 与iPad 开出的条件是16GB 统一记忆体与76GB/s 频宽,A20 Pro 的记忆体频宽已达115.2GB/s,高于表上列的数字。所以可能是以最低能支援的机型做为基准。

Mac Studio 的硬体底子

4,800 亿那一阶靠的是M5 Ultra。这颗晶片以UltraFusion 串起四个晶粒,CPU 最高36 核心、GPU 最高80 核心且每核心内置神经网路加速器、神经网路引擎32 核心,统一记忆体最高512GB,记忆体频宽1.2TB/s,比M3 Ultra 高出50%。 Apple 称其AI 峰值算力可达M3 Ultra 的4.5 倍,在LM Studio 中的提示处理快上4 倍。这些数字都是出自Apple 自行公布的测试结果,不是第三方实测。

1.6 兆怎么凑出来:Thunderbolt 5 加上RDMA

单机装不下的模型,靠多台机器分摊。 Apple 在WWDC26 议程「Explore distributed inference and training with MLX」中把整套架构讲得很清楚:macOS 26.2 起支援Thunderbolt 5 上的RDMA,资料可直接从一台机器的记忆体写进另一台,省掉大部分CPU 与作业系统的搬运成本;往上一层是Apple 自家的开源集体通讯函式库JACCL,负责节点之间的资料交换与结果合并;最上层才是开源框架MLX,负责把模型切开、派工给各台机器。

Apple 的示范用四台M3 Ultra,以270 亿参数的Qwen 3.6 测试,丛集的token 生成速度接近单机的3 倍;微调90 亿参数的Qwen 3.5 时,单机约每秒180 个token,丛集约600 个。 Apple 在Mac Studio 的官方说明里也用同一种说法,指分散式AI 推理效能相较单一系统最快可达3 倍,并注明实际结果依模型大小与架构而异。

「启动参数」不是记忆体占用量

表上每一阶的单位都是启动参数,这个词要放在混合专家(MoE)模型上才读得懂。 MoE 模型由多个专家子网路组成,处理每个token 时只动用其中几个,总参数量涵盖全部专家,启动参数量只算当下用到的那一小块。模型要跑得起来,看的是总参数在指定的量化精度下塞不塞得进统一记忆体,还要留空间给上下文视窗与作业系统;速度则跟启动参数走。

Apple 的示范里就有现成例子。开源模型Kimi 2.6 的总参数为1 兆,即使压到8 位元量化,光权重就要约1TB 记忆体,单台M3 Ultra 装不下,四台才够。表上那句1.6 兆,读成「这个记忆体规模能容纳多大的模型」比较贴近实情,它没有交代量化精度与上下文长度,也没有交代速度。

1,200 亿那一阶的对照组

表上MacBook Pro 那一栏给的是128GB 统一记忆体、614GB/s 与最高1,200 亿个启动参数。这个组合与同样搭载128GB 记忆体的RTX Spark 笔记本放在同一级,两边能跑的模型规模相当。挑机器的分界线因此不在GPU 核心数,而在记忆体容量与频宽:统一记忆体让CPU 与GPU 共用同一个池子,模型不必拆开搬进显示卡记忆体(不过Apple 会因为不支援CUDA 生态在表现上相对吃亏)。

结语

这张表回答的是记忆体够不够,没有回答跑得顺不顺。挑机器时把模型、量化精度与上下文长度放在一起算,比记住14B 还是480B 的标签数字有用得多。 Apple 这次至少把选购的起点讲清楚了:先挑定模型,再回头挑记忆体。不过苹果跑本地端​​AI 的优势是记忆体大,劣势是因为生态问题(靠大神燃烧热情)所以表现不会比NV 好,但只要你本够厚,都是「能跑」,不会有连测试的机会都没有,就看你怎么选择了。

赞 (0)
insunshineinsunshine

相关推荐

发表回复

您的电子邮箱地址不会被公开。 必填项已用 * 标注