2026.07.30 · 周四工具
←返回首页话题 · Topic
#llama.cpp
共 60 条相关资讯
2026.07.30 · 周四工具
llama.cpp 默认加载 MTP 张量,即便未启用推测解码也会占用额外显存
2026.07.30 · 周四工具
Kimi K3 社区首测:768GB DDR5 + 双 5090 跑出 50–70 t/s 预填充
2026.07.29 · 周三开源
llama.cpp 合并 PR:新增 GLM-5.2 推测解码支持
2026.07.29 · 周三工具
Kimi 大模型 GGUF 本地推理实测:速度仅 0.23 tok/s
2026.07.28 · 周二工具
llama.cpp 合并 DSpark 推测解码 支持 DeepSeek 系列加速推理
2026.07.27 · 周一工具
开发者推出 llmux:统一管理 vLLM 与 llama.cpp 的模型参数切换
2026.07.27 · 周一开源
MiniMax-M3 视觉支持已合并至 llama.cpp
2026.07.27 · 周一开源
MiniMax M3 模型支持合并入 llama.cpp
2026.07.26 · 周日研究论文
MI50 推理功耗实测:50W 即可获得七成峰值速度
2026.07.26 · 周日工具
llama.cpp 全面支持 MCP,本地模型可实现代理式对话
2026.07.26 · 周日工具
Slipstream:让 36GB 内存 MacBook 流式跑 35B–480B MoE 模型
2026.07.26 · 周日开源
TensorSharp 开源 LLM 推理引擎亮相,自称对 llama.cpp 不落下风
2026.07.25 · 周六工具
llama.cpp 原生 MTP 推测解码实测:稠密提速明显,MoE 收益有限
2026.07.25 · 周六工具
CachyLLama:给 llama.cpp 加持久化 KV 缓存的本地推理分支
2026.07.25 · 周六行业动态
推测解码:本地大模型的免费加速开关
2026.07.25 · 周六工具
CachyLLama:llama.cpp 分支加入持久化 KV 缓存,缓解本地智能体长会话卡顿
2026.07.25 · 周六工具
实测发现:Qwen MoE 模型用 llama.cpp 推理时,E 核反而比 P 核更快
2026.07.23 · 周四工具
Atomic TurboQuant:面向小量化模型的运行时与 6.4 倍 KV cache 压缩
2026.07.23 · 周四工具
Atomic 开源本地智能体 Atomic Agent
2026.07.23 · 周四行业动态
llama.cpp 拟正式接受 AI 生成代码贡献,社区反应不一
2026.07.23 · 周四工具
Poolside 修复 Laguna S 2.1 推理模式模板缺陷
2026.07.23 · 周四工具
MindControl:基于 llama.cpp 分支的推理过程注入引导工具
2026.07.22 · 周三工具
llama.cpp 新增 Laguna XS.2 与 M.1 模型支持
2026.07.22 · 周三开源
llama.cpp 新增对 Laguna XS.2 与 M.1 两款 MoE 编程模型的支持
2026.07.21 · 周二工具
AI 编程工具 pi 0.81.0 集成 llama.cpp 支持
2026.07.21 · 周二开源
llama.cpp 新 PR:ROCm 提示处理提速约 15%,修复 Q2_K 性能 bug
2026.07.20 · 周一工具
BeeLlama.cpp v0.4.0 发布:聚焦 KV cache 量化,新增 KVarN 与精度尾部机制
2026.07.14 · 周二工具
Atomic Chat 推出 DFlash,本地 Qwen 模型推理提速 2.2 倍
2026.07.09 · 周四工具
llama.cpp 修复 DeepSeek V4 Flash 卡死与崩溃
2026.07.08 · 周三工具
llama.cpp 合并 Q2_0 量化 支持 1.58-bit 三元 Bonsai 模型
2026.07.08 · 周三开源
DFlash 投机解码登陆 llama.cpp,Qwen3.6-27B 长上下文实测 4.44 倍提速
2026.07.07 · 周二工具
mistral.rs v0.9.0 发布:CPU 解码速度较 llama.cpp 最高提升 1.8 倍
2026.07.06 · 周一工具
llama.cpp 为 ARM 端 NVFP4 添加查表优化,CPU 推理速度提升超 5 倍
2026.07.06 · 周一工具
llama.cpp 提交 HIP 构建启用 ffast-math,AMD GPU 推理小幅提速
2026.07.06 · 周一工具
llama-server 跨重启丢 KV 缓存的根因与修复
2026.07.06 · 周一工具
开发者推出 Kivarro:面向 llama.cpp / mistral.rs 的本地推理桌面工作台
2026.07.06 · 周一工具
开发者发布 Kivarro 本地大模型推理一体化工作台
2026.07.05 · 周日工具
开源本地 LLM 推理工作台 Kivarro 发布 v0.1 Alpha
2026.07.05 · 周日工具
Rust 从零写的 LLM 推理引擎 Kortex:20GB 显卡跑 70B 模型
2026.07.03 · 周五工具
用户实测 DeepSeek V4 Pro 本地批量推理性能
2026.07.03 · 周五开源
Step 3.7 Flash 长推理卡顿问题或在 llama.cpp 中得到修复
2026.07.03 · 周五工具
社区补丁让 RTX 5090 本地跑 DeepSeek V4 Flash 1M 上下文
2026.07.02 · 周四工具
DGX Spark + Strix Halo 拆分推理实测
2026.07.02 · 周四工具
Kimi K2.7 Code 混合推理基准:Mac 加 RTX PRO 6000 的 RPC 实测
2026.07.02 · 周四工具
llama.cpp Windows CUDA 12.4 构建遭 Defender 误报为木马
2026.07.01 · 周三工具
DeepSeek-V4-Flash MXFP4 推理显存异常:KV 缓存量化类型影响计算缓冲区约 3 倍
2026.06.30 · 周二工具
Qwen3.6-27B 单卡 3090 推测解码横评:ik_llama 最快,mainline 最稳
2026.06.30 · 周二工具
社区发布 Qwen3.5/3.6 MTP 张量 GGUF 子集
2026.06.30 · 周二工具
llama.cpp 个人分支新增循环检测采样器
2026.06.30 · 周二工具
Ornith 35B 搭配 DFlash 草稿模型,本地推理获 30–40% 加速
2026.06.30 · 周二开源
DeepSeek V4 支持合并入 llama.cpp,本地推理即将可用
2026.06.29 · 周一工具
Off Grid:Mac 本地一体化运行聊天、图像与语音 AI 工具发布
2026.06.29 · 周一行业动态
NASA 测试本地大模型 为深空任务打造 AI 医疗助手
2026.06.29 · 周一工具
llama.cpp 社区分支实现运行时跳过 Transformer 层
2026.06.29 · 周一开源
llama.cpp 出现 DeepSeek V4 支持 PR
2026.06.29 · 周一开源
Ornith-35B GGUF 引入 MTP 投机解码
2026.06.28 · 周日开源
DFlash 推测解码支持合并进 llama.cpp
2026.06.28 · 周日行业动态
DuckDuckGo 对本地 LLM 搜索请求弹出 CAPTCHA
2026.06.28 · 周日研究论文
