开源
社区自量化 Kimi K3:Q3_K_S 版 1.1 TB 可在纯 CPU 推理
Atomic Chat 团队公开 Kimi K3 GGUF 量化进展,Q3_K_S 版约 1.1 TB,纯 CPU 环境…
2026.07.30 · 周四约 2 分钟阅读
社区团队 Atomic Chat 近日在 r/LocalLLaMA 公开了对 Kimi K3(2.8T 总参数、50B 激活 MoE 架构)模型的 GGUF 自量化结果。Q3_K_S 版本已完成并可正常加载,文件体积约 1114.76 GiB;Q1、Q2 更低比特量化仍在进行中,团队表示结果将于次日公布。
量化方法与工具链
- 量化基于官方原始权重,使用团队自维护的 llama.cpp 分支进行动态量化
- 已交付 Q3_K_S,Q1、Q2 进行中
- 量化策略属于社区常用的 GGUF K-quants 方案,强调体积与质量的折中
硬件配置与推理性能
团队租用的运行节点规格如下:
- CPU:AMD EPYC 9554P,64 核
- 内存:1.5 TB DDR5
- 存储:NVMe RAID0,用于放置权重文件
- 推理完全在内存中完成,未使用 GPU
实测使用 110 线程运行,pp512(prompt processing 512 tokens)速度为 4.21 t/s。
能力验证
为确认量化未显著损伤模型能力,团队做了一次简短的图文理解测试:输入 1969 年《纽约时报》「Men Walk on Moon」头版图片,要求模型描述画面内容。模型准确识别出:
- 报头信息
- 「All the news that's fit to print」标语
- 日期与 10 美分定价
- 主标题与关于宇航员采集岩石样本的副标题
- 「Voice from Moon」专栏
团队称未观察到明显的幻觉文本。
讨论与局限
团队在文末抛出一个开放问题:在消费级硬件上运行 1.1 TB 级别的超大规模量化模型,与选择体量更小、推理速度正常的模型相比,前者的实际收益如何。这一问题对本地部署与社区选型具有一定参考价值。需要指出的是,Q3_K_S 已属偏激进的低比特方案,进一步压缩到 Q1、Q2 后能力是否仍可保持,还有待后续数据验证。此外,原帖明确披露发布者为 Atomic Chat(atomic.chat)团队,内容具有产品与品牌曝光属性,读者评估时应一并考虑。
