slotstream: run Qwen3.8-Flash-Next on a Mac that can't hold it
- ID: 6c4c6243
- 原文链接: https://github.com/carloslfu/slotstream
- 作者: carloslfu
- 日期: 2026-09-01
- 抓取时间: 2026-09-02T15:31:00Z
- 分类: infra
- 来源类型: github
- 语言: zh
- 标签: apple-silicon, moe, mlx, ollama, quantization
- 质量评分: 4/5
中文导读
carloslfu 这周发的 slotstream 把 Qwen3.8-Flash-Next(125B MoE,4-bit 量化后 104 GB)从 SSD 上按 expert 流式加载到 MLX,Swift 单二进制,兼容 Ollama 和 OpenAI chat 协议,已有的工具链不用改48 GB M5 Pro 上 warm decode 约 12 tok/s,冷启动到第一个 token 约 3s,峰值占用 32 GBauto-size 表给得透明8 GB Mac 跑 3 tok/s16 GB 跑 424 GB 跑 832 GB 跑 9,数字可以从 slotstream doctor --sim-ram N 重现安装一行 curl;权重 103.8 GB 分 24 个文件,sha256 编进二进制,中断续传安全MoE 流式加载以前在 llama.cpp 系生态里都不算稳定,slotstream 的实测速度数字比想象中好看
一句话点评
carloslfu 这周发的 slotstream 把 Qwen3.
English Abstract / Summary
slotstream streams Qwen3.8-Flash-Next (125B MoE, 4-bit 104GB) per-expert from SSD into MLX as a Swift single-binary that speaks Ollama and OpenAI chat protocols. On a 48GB M5 Pro it sustains ~12 tok/s warm decode, 3s cold-start to first token, and 32GB peak occupancy; the auto-size table reports 3 tok/s on 8GB, 4 on 16GB, 8 on 24GB, 9 on 32GB, all reproducible via slotstream doctor --sim-ram N. Install is a one-line curl; the 103.8GB weights are split into 24 files with sha256 baked into the binary for safe resume.
Obsidian Notes
- 由
daily-intake-evening2026-09-02 cron 从当日 Obsidian 摘要(论文流水线 / AK-RSS / ClawFeed / X 书签消化)发现并入库存量阶段。 - 中文导读与判断均锚定在条目已有摘要、源页面正文、作者、日期与分类信息;未补充源页面之外的实验细节。