2026.09.24 · 周四工具
←返回首页话题 · Topic
#量化
共 73 条相关资讯
2026.08.30 · 周日工具
社区发布 ShimQuant:把 Nemotron-3.5-Lightning 压到 11.77 GiB
2026.08.29 · 周六开源
社区推出 Qwen3-Next Flash 主线兼容量化版
2026.08.29 · 周六开源
用户发现 Ornith 1.5 35B GGUF 权重文件被静默替换
2026.08.29 · 周六研究论文
本地大模型为何不如官方版?实测:推理栈的每一层都在制造偏差
2026.08.29 · 周六模型发布
腾讯混元公布超低比特量化结果,准确率几乎不降
2026.08.29 · 周六开源
ISTA-DASLab 发布 Qwen3.8-27B 最优 GGUF 量化
2026.08.29 · 周六工具
GGUF 量化文件名审计:443 个模型中 64 个精度虚标
2026.08.28 · 周五工具
Qwen3-8B 实验:KV 缓存 q8 量化并非无损
2026.08.27 · 周四工具
ik_llama.cpp 本月更新:Dflash 2 推测解码与多模型支持
2026.08.26 · 周三工具
社区团队推出 Qwen 3.8 27B 视觉模型 MLX 量化版并横向对比
2026.08.26 · 周三开源
QUASAR 团队发布 Qwen3.8-27B 全量化 NVFP4 权重
2026.08.25 · 周二研究论文
Hugging Face 提出量化感知修复:4-bit 模型反超 16-bit 原版
2026.08.24 · 周一开源
TielCoder 推出 22GB 4-bit 量化编码模型,宣称对标 Opus 4.6 中等推理档
2026.08.24 · 周一开源
250M 参数 LLM 量化至 60 MB,纯 CPU 即可运行
2026.08.24 · 周一工具
llama-cpp-turboquant 集成 ConvRot 量化方法
2026.08.23 · 周日研究论文
Qwen3.8-27B 量化精度实测:4-bit 与 8-bit 差距悬殊
2026.08.23 · 周日开源
社区用户推出 Qwen3.8-27B MTP 移植版,声称可节省显存
2026.08.23 · 周日工具
实测 Kimi K3(2.8T 参数)自托管:B300 达 92 tok/s,每百万 token 成本 190 美元
2026.08.23 · 周日研究论文
本地跑大模型为何「变笨」:一篇推理精度实验拆解
2026.08.23 · 周日工具
Tesla P40 KV 缓存实测:F16 反而比 Q8 更快
2026.08.22 · 周六开源
社区玩家修补 Ornith1.5 35B A3B MTP 头:任务耗时降三成
2026.08.22 · 周六研究论文
Qwen 3.5 4B 量化实验:张量级精度分配带来 16.67% 推理提升
2026.08.22 · 周六开源
开发者从零训练 250M 极小 LLM:2 位量化、60MB 体积、纯 CPU 400 tok/s
2026.08.22 · 周六开源
Qwen3.8-27B 在 16GB 显卡上的量化与智能体实测
2026.08.21 · 周五工具
MagicQuant 更新 Unsloth v3 量化流程,发布 Qwen3 27B 多档位 GGUF
2026.08.21 · 周五工具
Qwen3 8B 新 NVFP4 量化发布,Blackwell 上预fill 提速 50%
2026.08.21 · 周五行业动态
Qwen3.8-27B AIME 2026 实测:FP8 量化 29/30,速度近翻倍
2026.08.20 · 周四开源
llama.cpp 新 PR:用 AVX2 大幅加速 IQ 量化 CPU 推理
2026.08.20 · 周四开源
SyzygyResearch 发布 Mach-1-Additive-35B 量化模型,35B MoE 压缩至 7GB
2026.08.20 · 周四开源
社区为新模型 Ornith 1.5 提供量化版本并发布对比数据
2026.08.20 · 周四开源
Unsloth 推出 Qwen3.8-27B Dynamic v3.0 GGUF,同尺寸精度提升 10%
2026.08.18 · 周二工具
DeepSeek V4 Flash Q4 量化版在 4×RTX 3060 上的实测记录
2026.08.17 · 周一工具
RTX 3090 单卡优化 Qwen3 28B 推理,单请求达 82 tps
2026.08.17 · 周一工具
Qwen3.8 27B 与 35B-A3B MoE 12GB VRAM 本地对比
2026.08.16 · 周日开源
社区推出 Qwen3-27B int4 量化版,支持 MTP 推测解码
2026.08.16 · 周日行业动态
三元大模型卷土重来?近期 1.58-bit 模型盘点
2026.08.16 · 周日开源
Qwen3-27B 量化实验:哪些权重组真正决定质量
2026.08.16 · 周日行业动态
Qwen 3.8 27B 在苹果芯片上量化与 MTP 的反直觉性能差异
2026.08.15 · 周六工具
Gemma 4 E4B 极低比特量化:推理能力恢复 96.74%
2026.08.15 · 周六工具
Qwen3.8 GGUF 量化精度实测:Atomic 方案全面占优
2026.08.15 · 周六工具
Atomic 发布 Qwen 27B 极限量化版:1-bit 压缩可在笔电运行
2026.08.14 · 周五开源
社区新量化 Qwen3.5-9B 称 SOTA,多档位超越主流 GGUF
2026.08.14 · 周五行业动态
bitsandbytes 作者 Tim Dettmers 预告新量化方法,可在单卡运行大模型
2026.08.14 · 周五开源
社区关注 GLM 5.3 权重容量体积比
2026.08.14 · 周五工具
Gemma 4 12B Q3 量化新方案:编码性能提升 8.55%
2026.08.13 · 周四研究论文
arXiv 研究:MoE 量化中检测路由翻转比判断其是否有害更容易
2026.08.12 · 周三工具
Gemma 4 QAT 版本在 KV cache 量化下表现显著优于非 QAT 版本
2026.08.12 · 周三工具
社区开发者发布 Muse Glimmer 30B 多档 GGUF 量化版本
2026.08.12 · 周三开源
DeepSeek V4 0731 量化与基准测试:发现转换漏洞并对比 38 个版本
2026.08.12 · 周三开源
Ling-3.0-flash 量化测试:单卡全档速度几乎持平
2026.08.10 · 周一研究论文
KLQ 量化新法:免训练 W4A4KV4 接近训练方案
2026.07.30 · 周四工具
llama.cpp 合并支持 Ternary-Bonsai-8B-Q2_0 的 CUDA 推理 PR
2026.07.30 · 周四开源
社区自量化 Kimi K3:Q3_K_S 版 1.1 TB 可在纯 CPU 推理
2026.07.30 · 周四开源
Unsloth 发布 Kimi K3 量化版本,最低 594GB 可本地运行
2026.07.28 · 周二研究论文
DeepSeek V4 Flash 在 AMD Strix Halo 上跑出 32 tok/s
2026.07.28 · 周二开源
DeepSeek V4 Flash 在 128GB 锐龙 AI MAX+ 上跑到 32 tok/s
2026.07.27 · 周一研究论文
Qwen3.6-27B 投机解码跨量化基准测试:DFlash 综合最快
2026.07.25 · 周六研究论文
IST-DASLab 提出 SLQ 量化方法:3.3 比特实现任务级无损压缩
2026.07.24 · 周五工具
社区定制内核把 Qwen3.5 35B A3B 推到 RTX 5060 Ti 上 55 tok/s
2026.07.24 · 周五行业动态
梁文锋的两种面孔:AI 梁圣与量化代表
2026.07.19 · 周日研究论文
任务导向压缩研究:消费者敏感度决定编码胜负
2026.07.08 · 周三工具
llama.cpp 合并 Q2_0 量化 支持 1.58-bit 三元 Bonsai 模型
2026.07.08 · 周三工具
Qwen3.6-27B KV 缓存量化实测:Q6 不量化 KV 接近 Q8 水平
2026.07.05 · 周日工具
Qwen 3.6 27B VLLM 基准测试:BF16 / FP8 / NVFP4 量化对比
2026.07.01 · 周三开源
社区上线 DeepSeek V4 Flash 多比特 GGUF 量化版
2026.06.30 · 周二开源
Bartowski 发布 DeepSeek-V4-Flash 的 GGUF 量化版本
2026.06.30 · 周二开源
NVIDIA 上架 Qwen3.6-27B NVFP4 量化权重
2026.06.29 · 周一工具
纯 CPU 跑 GLM 5.2:512GB 内存 Epyc 服务器实测
2026.06.29 · 周一行业动态
社区实测:低量化大模型能否击败高量化小模型?
2026.06.29 · 周一开源
Ornith-35B GGUF 引入 MTP 投机解码
2026.06.28 · 周日开源
4×3090 实测 Step-3.7-Flash:全驻留量化反超更高级别,MTP 与视觉互斥
2026.06.28 · 周日研究论文
