网站首页 > 市场观察 > 行业动态
DeepSeek新技术“搬进”Mac,电脑跑大模型提速60%!
发布时间:2026-07-11

26675426-baVJ9p.jpg?auth_key=1783871999-

DeepSeek开源的DSpark技术刚满一周,就被工程师“搬进”了苹果电脑。这款名为mlx-dspark的移植版本,让Gemma-4 12B和Qwen3-4B两个模型在Mac上的生成速度分别提升了1.6倍和1.4倍,且输出质量与原模型逐字节相同。


以前大家觉得苹果电脑跑大模型慢,是因为硬件架构不同。现在开源社区的大牛直接给Mac写了“专属外挂”,不仅速度飙升60%,而且一字不差。这证明端侧AI的性能上限,正在被软件优化不断打破。


01


|苹果电脑跑大模型提速60%

DeepSeek在6月底开源了DSpark技术,官方数据显示,它能让服务器端的大模型推理提速60%到85%。不过,当时这套技术只适配了数据中心的GPU,苹果电脑用户还“眼馋”着用不上。


现在,情况改变了。工程师Rahim开发了 mlx-dspark,这是DSpark技术的第一个苹果芯片原生版本。


“小模型打下手”的加速逻辑:DSpark的原理,其实就是给主力大模型配一个“小助手”。小模型先一口气猜出几个候选词,大模型再一次性核对:对的直接收下,错的打回去重猜。


不过,这种核对机制在数据中心和苹果电脑上的成本是不一样的。

数据中心GPU:就像“包车”,不管车上坐几个人都是一口价,多核对几个词几乎不增加时间成本。


苹果芯片更像“打表计费的出租车”,核对的候选词越多,耗时就越长。


Rahim经过实测算了一笔账:在苹果芯片上,每多核对一个词(token),就要多花约14毫秒。基于这个成本模型,他得出结论:苹果芯片上的速度提升天花板大约在2.2倍。


为了达到这个效果,Rahim把小模型搬到了苹果电脑上,并用苹果自家的MLX框架重新搭建了核对流程,还把模型权重量化压缩到了4-bit。


在M4 Pro芯片上的实测结果非常亮眼:Gemma-4 12B模型:生成速度从原来的18.4 tok/s涨到了约30 tok/s,提速约1.6倍。Qwen3-4B模型:生成速度从52.9 tok/s涨到了约73 tok/s,提速约1.4倍。


26675426-ObfbBD.jpg?auth_key=1783871999-


02


|移植也绝不“偷工减料”:输出精度做到逐字节对齐

很多把大模型搬到本地电脑上的版本,为了降低实现难度,通常只支持“贪婪解码”(也就是每一步都无脑挑概率最高的那个词)。但Rahim没有走这条捷径,他硬是把DSpark论文里更复杂的“温度采样”方法也完美实现了出来。


经过他自己反复核对,这套移植版跑出来的输出,和原生大模型在相同参数下给出的结果严格一致,做到了逐字节对齐,没有任何精度损失。


为了做到“又快又好”,Rahim在背后踩了不少坑,并摸索出了一套最优解:

  • 小助手(草稿模型)要“轻量”:他把负责打前站猜词的小模型进行了4-bit量化压缩,体积仅有1.8GB,塞进内存毫无压力,而且跑起来依然无损。

  • 大模型(目标模型)要“对口”:如果大模型用的是没经过指令微调的基础版,小助手猜对的概率只有47%;换成对应的指令微调版后,猜对的比例直接飙升到82%。

  • 精度选择要“算账”:他曾尝试把大模型切换到更高精度的bf16,结果发现多花的时间远超准确率提升带来的收益,反而变慢了。因此,大模型保持在8-bit精度才是苹果芯片上的最优解。


经过这一系列精细调优,DSpark不仅成功实现了大幅加速,还确确实实把论文中提到的16%到18%的接受率提升,完美地在苹果设备上复现了出来。


03


|DFlash也加入战局:代码任务提速

Rahim的推文发出后,DFlash论文的作者之一Jian Chen在评论区留言,希望他能顺便测试一下他们团队的模型。


DFlash是今年5月由z-lab发布的一种全新的投机解码方案(其团队带头人Zhijian Liu同时也是NVIDIA的研究科学家)。它的思路和DSpark完全不同:DSpark是一步步带着上下文依赖关系去“猜”下一个词,而DFlash则是利用并行的“块扩散”技术,一次性去噪生成一整块(16个)token。


Rahim迅速响应,利用现成的脚本将DFlash接入到同一台Mac上,与DSpark进行了一场“头对头”的实测对决。测试结果呈现出明显的“偏科”现象:

  • 代码和数学任务(DFlash胜):在这类逻辑规整、可预测性强的任务中,DFlash的优势尽显。它一次性生成的16个token,平均有5.95到6.20个能被大模型认可(即接受长度极高),生成速度达到了约36 tok/s,提速约2.1倍,直接跑赢了DSpark。

  • 开放聊天场景(DSpark胜):在日常聊天这种内容随机性很强的场景下,DFlash的短板暴露了。由于它是一次性蹦出一整块词,后面的词往往缺乏前面的依赖关系,导致大模型“审核”时经常不认可,实际接受长度大幅下降,速度优势荡然无存。


这时候,DSpark自带的“Markov头”机制就派上用场了。它专门给并行生成的词补充了前后依赖关系,让候选词更加连贯。因此,在聊天场景下,DSpark反而比DFlash跑得更快。


04


竞泰观点|端侧推理加速进入“百花齐放”阶段

过去,本地大模型的性能上限被认为完全由芯片制程和内存决定。但mlx-dspark的成功证明,通过针对性的投机解码和量化策略,苹果芯片的算力潜能仍有巨大的挖掘空间。


随着Mac本地大模型体验的飞跃,针对特定硬件架构(如Apple Silicon)的推理加速工具、量化算法以及模型适配框架,将成为AI基础设施投资的新蓝海。


关注“大小模型协同”产业链:DSpark和DFlash的落地,验证了“草稿模型+目标模型”架构在消费级设备上的可行性。未来,专为端侧设计的小参数草稿模型,以及支持动态块长度的智能调度引擎,将迎来广阔的市场需求。


谁能率先在消费级设备上实现“云端级”的推理体验,谁就能在端侧AI的入口争夺战中占据先机。对于投资者而言,紧盯那些能为硬件“松绑”的软件创新,是把握这一轮产业红利的最优解。


统一服务热线:
18117862238
邮箱地址:zhangruxia@jt-capital.com.cn
公司地址:成都市高新区泰合·国际金融中心18层

Copyright © 2021 jt-capital.com.cn All Rights Reserved 

版权所有: 竞泰资本 粤ICP备2022003949号-1  

快速链接

Copyright © 2021 jt-capital.com.cn All Rights Reserved 

版权所有: 竞泰资本 粤ICP备2022003949号-1