BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年09月25日

注册 / 登录

4台Mac Studio跑通万亿参数,英伟达的增量生意去哪了

四台Mac Studio拼在一起,跑通了一个万亿参数的大语言模型。

这不是演示环节的花架子——9月22日起,搭载M5 Ultra芯片的最新款Mac Studio已经在交付。苹果官网上挂着的数据更直接:LLM首次词元输出速度较M1 Ultra加速9.8倍,多机分布式集群模式下推理性能额外提速最高3倍。

苹果硬件主管Johny Srouji在向路透社解释这一变化时,抛出了一个与英伟达叙事直接相悖的观点:企业一旦花重金买断了设备,就不需要再为每一次推理请求支付按令牌计费的云端费用。对于工作负载稳定的团队来说,本地算力的总拥有成本可能优于长期租用云端GPU。

这句话背后的意思很直白——如果推理任务从云端迁移到本地,英伟达在AI推理增量活动中能分到的那块蛋糕,可能比当前市场预期要小。

从"用AI"到"跑AI"

过去几年,苹果的AI叙事一直是你能用AI——Siri、照片识别、邮件摘要。Mac和iPhone的用户已经为芯片付过费,端侧处理的任务不需要额外花钱。

现在这套逻辑正在向企业端延伸。

M5 Ultra芯片由两块M5 Max整合为一枚SoC,标配64核GPU、选配80核GPU,统一内存最高支持到512GB。这个容量将于10月下旬开始到货。1.2TB/s的内存带宽意味着它可以在一块芯片上加载常规单GPU装不下的模型。四台机器并联,就能分担更大参数量级的权重。

苹果官方宣传口径中提到的可运行模型包括DeepSeek、Kimi、GLM等大语言模型,以及使用Qwen生成图像。不过官网并未指明具体运行的模型版本、参数量大小或量化精度。高盛在相关研报中也只提到了万亿参数级别,但同样没有点出具体是哪一款模型。

这层模糊性恰恰是需要观察的地方:四台机器能否稳定吞吐真正的商用级大模型,还是更多停留在技术可行性验证阶段?

推理成本的结构差异

云端GPU部署的成本结构是持续的——按实例时长计费、按Token量付费,或者承担闲置时段的运维开销。以AWS、Azure等主流云服务商的定价来看,一台搭载L4 GPU的实例每小时价格在0.8至1.5美元之间,而H100集群的价格则更高,且通常需要多台实例并行才能支撑大规模推理任务。

本地算力的成本是一次性的——设备采购加电力加维护。假设一台满载配置的Mac Studio售价在1万美元左右(含512GB统一内存和高配选项),加上每年约500美元的电力和维护成本,三年总持有成本大约在11500美元上下。作为对比,如果一家企业每天需要处理十万次左右的推理请求,按照云端按Token计费的单价(不同模型费率在每千Token 0.1至10美元不等)计算,一年的云端推理开支就可能接近甚至超过一台Mac Studio的采购价格。

关键在于规模效应的临界点。对于一个日推理量持续稳定在数十万次的企业应用来说,本地算力的优势会随着时间推移越来越明显。而对于那些推理需求波动剧烈的公司,云端弹性伸缩的便利性仍然是不可替代的。

不过苹果也承认,Mac Studio不会在所有工作负载上取代数据中心GPU。苹果自身也在谷歌云上为部分高要求AI任务使用英伟达GPU。真正决定企业选择的关键变量有三个:推理速度、并发用户数、以及真实的总拥有成本对比。这些目前还没有第三方独立实测数据支撑。

英伟达不必失去现有订单,但增量份额存疑

理解这场博弈的关键在于区分存量和增量。

英伟达目前在AI训练市场的占有率超过九成,这部分需求不会因为Mac Studio的出现而发生根本性动摇。训练一个万亿参数模型需要成百上千颗H100集群运行数周,这远远超出任何桌面级设备的算力边界。训练阶段的算力需求和推理阶段完全不同——前者需要的是极致的并行计算能力,后者更需要的是低延迟响应和大内存吞吐。

真正面临叙事转变风险的,是AI推理这一增量市场。

当越来越多的推理任务转向终端或企业自有机器时,云端GPU租赁需求的增速就会放缓。高盛在分析中指出,英伟达隐含波动率处于疫情前以来最低水平,期权定价几乎未为推理向本地迁移这一变数预留风险溢价。因此其建议买入英伟达看跌期权,同时做多苹果。

英伟达股价仍困于宽幅区间,缺乏中期趋势,而苹果股价则保持强势。部分分析人士已开始在期权市场上表达这种相对观点。值得注意的是,这种期权策略反映的不是对英伟达基本面的全面否定,而是对市场预期偏见的修正——当所有人都认为AI基础设施投资只会继续向上时,任何减速信号都可能被放大。

苹果与英伟达的长期博弈

这场竞争并非突然到来。回顾过去七年,苹果一直在通过自研芯片降低对ARM架构和其他供应商的依赖。M系列芯片在能效比上的优势早已得到验证,而在AI推理领域的布局则是这一战略的自然延伸。

英伟达当然也不是坐以待毙的一方。CUDA生态的护城河、与各大云厂商的深度绑定、以及在软件开发工具链上的先发优势,都是短期内难以被复制的壁垒。苹果的软件栈虽然进步显著,但在兼容性、开发者工具和成熟度上与CUDA仍有差距。

真正决定胜负的可能不是某一代芯片的性能参数,而是整个生态系统的时间窗口。当开发者习惯了某个平台的工作流,转换成本会越来越高。反之亦然——如果苹果能在未来两到三年内建立起足够多的本地推理开发案例和行业最佳实践,那么这个生态位就可能会固化。

接下来看什么

这篇报道的结论不是苹果取代英伟达——那不可能发生,也不是本地推理将全面替代云端——那也不现实。真实的情况更微妙:当推理任务的分布向边缘分散,每一片碎片化的增量都在侵蚀云厂商的规模效应假设。

后续需要关注三个指标:

第一,10月下旬512GB配置到货后的实际推理速度与并发能力实测数据。这是判断Mac Studio能否承接生产级推理负载的关键验证。特别是不同量化精度下的TTFT和吞吐量表现,将直接影响早期采用者的体验反馈。

第二,企业客户对本地推理方案的早期采购反馈。如果第一批买家主要是个人开发者和小型实验室而非中大型企业,说明场景仍有局限;反之则意味着结构性拐点正在形成。重点关注金融、医疗和法律行业的应用测试——这些领域对数据隐私和合规的要求最高,也是本地推理最有价值的切入点。

第三,英伟达在下一季度财报中对数据中心收入增长的指引调整。如果云端GPU租赁需求确实出现放缓迹象,管理层可能会在电话会议上给出解释。同时也要留意AMD和英特尔在推理芯片领域的最新进展——这些玩家同样在争夺本地算力市场份额。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。