一台48GB内存的Mac,跑起一个官方标称104GB的大模型,暖启动解码能到约12 tok/s,冷启动到首个token只要3秒——这是开发者carloslfu上周发布的slotstream交出的成绩单。它用Swift加MLX写了一套运行时,把MoE模型的专家权重从SSD按需流式读入内存,兼容Ollama和OpenAI的API接口,端口11434,装好就能用。听起来像解决了"内存不够也能跑大模型"这个老问题,但往深处翻两层,故事没那么干净:这个被称作"125B MoE"的模型,官方口径其实是180B;"从SSD流式读专家权重"这条路,slotstream也不是第一个走的人。
"104GB"背后,还有一个"180B"没说清
Qwen官方模型卡上的Qwen3.8-Flash-Next,不是一个纯粹的125B模型。125B是语言模型主干的参数量,512个专家里每个token只路由激活约6B;主干之外还挂着两块专门为设备端内存卸载设计的组件:51B的n-gram嵌入参数,和4B的多token预测(MTP)参数。三者加起来,官方标注的完整checkpoint规模是约180B,以BF16/I64格式发布。
slotstream用的104GB,是社区转换的4bit量化版本,来自pipenetwork仓库。跑一个"125B MoE"的叙事没错,但跟官方"180B完整checkpoint"是两个口径。51B的嵌入层和4B的MTP组件,量化版是否完整保留,项目文档里没写清楚——这决定了你腾出的110GB硬盘,装的到底是完整版还是被裁过的精简版。
官方跑分能撑起腾出百GB硬盘的理由吗
Qwen官方公布的基准分数看起来确实亮眼:GPQA Diamond 91.7,LiveCodeBench v6 91.9,SWE-bench Pro 62.5,AndroidWorld 84.5,原生上下文26.2万token、可扩展到约100万。这些数字全部是阿里自己测的,还没有独立评测验证过。如果它真在agentic和代码任务上有这个水准,本地部署确实有意义——省掉云端API费用,数据也不用出门。但在为它腾出110GB硬盘、等上大半天下载之前,这几个分数目前只能当参考,不能当承诺。
五档内存,只有一档是真实测的
- 风险.如果你的Mac是16GB或24GB内存,你看到的tok/s数字目前只是外推估算,不是真实体验。
slotstream给出的性能表覆盖8GB到48GB共五个档位,但真正在硬件上跑出来的只有48GB这一档——一台M5 Pro。16GB约5 tok/s、24GB约8 tok/s、32GB约10 tok/s,全部是"基于同一条测量曲线"推算出来的,项目文档自己也承认小内存Mac的SSD往往更慢,实际表现可能还要打折。
一台机器的实测,撑不起五档内存的"确定性"。
用SSD流式读专家权重应对内存墙,这个思路本身也不新——本质接近操作系统的分页机制,只是针对MoE的专家路由做了定制缓存。Hacker News的讨论区里,有用户直接列出了streamlx、mlx-flash、mlx-moe等已经在做同样事情的项目,slotstream的首发姿态,在这条拥挤的赛道里更像"又一个"而不是"第一个"。作者本人也回应说计划补充和这些项目的直接性能对比——目前还没有。
这不是说slotstream没价值。104GB的模型能在48GB Mac上跑到12 tok/s,对愿意折腾本地部署、看重隐私和离线能力的开发者来说,依然是个能用的选项,也比"官方原版mmap路径把48GB内存直接跑进swap、一个token都没吐出来"要好得多。只是"能跑"和"跑得好、跑得清楚自己在跑什么"之间,还差一段没填上的路。接下来该盯的是三件事:16/24/32GB的真实硬件数据会不会补上,104GB量化版对51B嵌入层的处理方式会不会说清楚,作者承诺的竞品对比什么时候能看到。
