Lode 需求雷达
--卡片
--主题
--失败
HN讨论 · 身份未知

低内存 Mac 本地运行 125B 大模型:expert-offloading 新进展

作者发布 slotstream,通过 expert-offloading/ssd-streaming 让 125B 参数 4-bit 模型在 16GB 起步的 Mac 上运行;评论区用户指出 32GB 内存在本地使用中不够用,并希望这类技术让新 32GB Mac 也能本地跑大模型。

目标用户

拥有 16GB 或 32GB 统一内存 Mac、想本地运行 100B 级以上开源模型的开发者、AI 爱好者和隐私敏感用户。

潜在需求

在 16GB/32GB 有限统一内存的 Mac 上,以可用速度和稳定热表现本地运行 100B+ 参数大模型,不必升级高内存设备。

发生场景

用户尝试本地运行 Qwen 这类 125B 参数模型时,模型本身需要 100GB+ 内存,而常见 16GB/32GB 统一内存的 Mac 明显不足;评论区认为 32GB 本地使用也不够,同时有人质疑低内存下宣称的速度会忽略热警告。

来源证据

评论者希望看到低内存本地推理的进展:32GB 内存在本地使用中不够,希望类似 offloading 工作让新的 32GB Mac 设备在本地真正有用。

I'm hoping to see progress in this space. Folks talking about how 32G is not enough for local use, but then there's been work like this to empower it. My hope is that the new 32G M6 will be "useful" locally, possibly because of work like this.
https://news.ycombinator.com/item?id=49524447

为什么值得留意

评论区用户主动表达“32GB 不够本地使用”并期待这类 offloading 工作让新 32GB M6 在本地变得有用;同时作者展示 16GB 起步、约 12 tok/s 的权衡,另一个 16GB M3 优化实例也佐证这一方向可被继续验证。

已有方案

  • slotstream:expert-offloading/ssd-streaming 让 125B 4-bit 模型跑在 16GB 起步的 Mac
  • samosa-chat:在 16GB M3 上运行 Qwen3.6-35B-A3B 并控制峰值内存与热警告

未满足部分

  • 32GB 统一内存仍被认为不足以本地运行主流大模型
  • 16GB 下宣称的 5 tok/s 被质疑忽略热警告,速度和热控制难兼顾
  • 项目 README 对新用户不友好,像 session log 转储,增加采用门槛

可能延伸 · 模型推测

  • 把 expert-offloading 逻辑抽象成通用库,供其他模型和不同容量 Mac 复用
  • 建立跨 16GB/32GB/48GB 内存的基准测试,验证速度、内存占用和热降频的 tradeoff

目前未知

  • 作者即项目发布者,帖子可能偏向展示自己方案
  • 评论者关于 32GB 不够的说法是个人观点,不代表广泛需求
  • 16GB 下 5 tok/s 的宣称被另一用户质疑,未看到独立复现
  • 新 32GB M6 尚未发布,具体内存配置不一定如评论人所想

继续核实

  • 32GB 统一内存 Mac 使用者目前本地运行多大参数模型、具体卡在什么任务?
  • 类似 offloading 方案在 16GB/32GB 设备上长时间推理的热降频与速度稳定性如何?
  • 除了 slotstream 和 samosa-chat,还有哪些低内存本地推理方案在互相竞争,用户如何选择?

主题词

local llm inferencememory constraintsexpert offloadingunified memorylarge model quantizationlow-memory mac

管理令牌