一位开发者在自己的M4 Pro Mac mini上跑起两个本地大模型,接管了原本靠云端订阅处理的日常请求。这台机器只有48GB内存,他此前却同时开着两笔每月200美元的订阅,合计月费400美元,经常跑满额度。现在大部分日常提问改成本地跑,理由不只是省钱——订阅制下,供应商随时可能换模型、限流、调价,他毫不知情。
这套方案的关键不是硬件多贵,是MoE架构改变了大模型对内存的"要价"方式。但它能替掉的只是日常里不需要顶级模型的那部分,遇到真正棘手的推理任务,他仍然要切回云端API。
发生了什么:一台Mac mini,两个模型,一张私有网络
| 项目 | 配置 |
|---|---|
| 硬件 | M4 Pro Mac mini,48GB统一内存 |
| 推理模型 | Qwen3.6-35B-A3B,4bit量化,实际占用约20GB |
| 轻量模型 | Gemma-4-E4B,占用约2.4GB |
| 推理框架 | MLX(苹果的本地推理框架) |
| 组网 | Tailscale,连接Mac mini、iPhone、MacBook,共享同一模型端点和对话历史 |
推理模型负责需要深度推理的请求,轻量模型处理闲聊、格式化这类简单任务。48GB内存里,20GB分给主力模型,剩下近28GB要同时装下轻量模型、上下文窗口和系统开销——这也是这套配置敢同时开两个模型的原因。
为什么重要:MoE省的是计算量,不是内存总量
这篇里最容易被过度解读的一点,是模型名字里的A3B。Qwen3.6-35B-A3B总共35B参数,但每个token真正参与计算的只有约3B,剩下的参数这一步不用算。
这不等于内存只需要装3B。4bit量化之后,35B参数大部分仍要装进内存待命,这也是它在Mac mini上实际占用约20GB的原因——如果内存真按3B计算,占用会小得多。MoE真正省下的是"计算量":密集模型每算一个token都要把全部参数算一遍,MoE只挑一小部分算,所以速度更接近一个小模型。
作者提到一个对照:朋友的16GB内存MacBook Air装某个27B密集模型的4bit版本,几乎吃满内存,一触发SSD换页就卡。换成这个35B的MoE模型,反而能正常跑。原文没细讲背后是不是靠按需加载被激活的专家参数来省常驻内存,只能说,MoE让"能不能装下"这件事,不再简单等于参数总量。
本地能跑得动,靠的是计算量分得聪明,不是内存账变小了
这笔账怎么算,谁该动手
把这台机器按官网价位估算,48GB内存的M4 Pro Mac mini大约1800美元起。两笔订阅合计每月400美元,理论回本周期在4到5个月左右。电费这部分,Mac mini功耗不高,大致可以忽略,原文也没给出精确数字。
| 维度 | 云端订阅(如两笔$200/月) | 本地Mac mini方案 |
|---|---|---|
| 计费方式 | 按月/按token,用得越多越贵 | 硬件一次性成本+电费,用多用少一个价 |
| 模型上限 | 可调用GPT-5、Claude Opus级顶级模型 | 35B MoE模型,顶级推理仍要回云端 |
| 稳定性 | 供应商随时可能换模型、限流、调价 | 性能取决于自己这台机器 |
| 隐私 | 请求经过第三方服务器 | 数据留在本地 |
| 上手门槛 | 注册即用 | 要自己下载模型、配置MLX和Tailscale |
速度、上下文窗口具体多大、能扛多少并发,原文都没给出数字——这恰恰是想复制这套方案的人最该自己测的部分,不是照搬别人的判断。这套方案还高度依赖Apple Silicon的统一内存架构,同样思路搬到普通PC上未必成立。
对经常跑满订阅额度、又愿意自己搭环境的开发者,这笔账值得算。对只想打开App直接用的人,现在还谈不上换。作者自己已经下单了内存更大的128GB M5 Max Mac Studio,说明48GB这个量级,对他来说也只是过渡配置。
