2026.07.30 · 周四工具
←返回首页话题 · Topic
#本地推理
共 83 条相关资讯
2026.07.30 · 周四工具
llama.cpp 默认加载 MTP 张量,即便未启用推测解码也会占用额外显存
2026.07.30 · 周四工具
Kimi K3 社区首测:768GB DDR5 + 双 5090 跑出 50–70 t/s 预填充
2026.07.29 · 周三工具
Kimi 大模型 GGUF 本地推理实测:速度仅 0.23 tok/s
2026.07.28 · 周二研究论文
DeepSeek V4 Flash 在 AMD Strix Halo 上跑出 32 tok/s
2026.07.28 · 周二开源
DeepSeek V4 Flash 在 128GB 锐龙 AI MAX+ 上跑到 32 tok/s
2026.07.28 · 周二工具
llama.cpp 合并 DSpark 推测解码 支持 DeepSeek 系列加速推理
2026.07.27 · 周一工具
Otlet:把本地 LLM 推理塞进 Postgres 的开源实验
2026.07.27 · 周一工具
Ornith-397B 单卡部署实测:Q4 量化下预填充超 2,300 tok/s
2026.07.27 · 周一开源
开源项目 HART OS 发布:以本地优先的 AI 原生操作系统
2026.07.27 · 周一工具
Readability Reader:本地优先的网页与 PDF AI 阅读器
2026.07.27 · 周一开源
MiniMax M3 模型支持合并入 llama.cpp
2026.07.26 · 周日工具
ARIA:语音原生 3D 空间 SOC 平台,强调「受治理自治」
2026.07.26 · 周日工具
本地多卡 AI 实时生成视频讽刺解说:概念原型展示
2026.07.26 · 周日开源
POCKET-35B 发布:可在无 GPU PC 和手机上运行的 35B 模型
2026.07.26 · 周日工具
Hydra:本地优先的多模型 AI 路由 CLI,按置信度自动选最便宜模型
2026.07.26 · 周日研究论文
MI50 推理功耗实测:50W 即可获得七成峰值速度
2026.07.26 · 周日工具
三卡旧 GPU 跑 Qwen3 与 Gemma 量化模型:性能基准实测
2026.07.26 · 周日工具
Slipstream:让 36GB 内存 MacBook 流式跑 35B–480B MoE 模型
2026.07.26 · 周日行业动态
观点:开源模型浪潮下,Apple 或成 AI 时代真正赢家
2026.07.25 · 周六工具
llama.cpp 原生 MTP 推测解码实测:稠密提速明显,MoE 收益有限
2026.07.25 · 周六工具
CachyLLama:给 llama.cpp 加持久化 KV 缓存的本地推理分支
2026.07.25 · 周六行业动态
推测解码:本地大模型的免费加速开关
2026.07.25 · 周六开源
DKV:面向本地推理的开源 KV-cache 压缩框架
2026.07.25 · 周六工具
CachyLLama:llama.cpp 分支加入持久化 KV 缓存,缓解本地智能体长会话卡顿
2026.07.24 · 周五工具
社区定制内核把 Qwen3.5 35B A3B 推到 RTX 5060 Ti 上 55 tok/s
2026.07.24 · 周五工具
社区开发者将 DeepSeek V4 Flash 移植至 RTX 4090D:重写 Blackwell 内核
2026.07.24 · 周五工具
百元级单板机纯 CPU 跑 0.6B 至 8B 模型实测
2026.07.23 · 周四行业动态
Mac 路线图揭示新分类:一种给人用,一种给 AI 用
2026.07.23 · 周四工具
KTransformers:单卡 RTX 5090 即可本地推理 100B+ 大模型
2026.07.23 · 周四工具
4 张 RTX 3080 跑 Qwen3-27B 代码生成:69 tps 解码,成本约 2000 美元
2026.07.23 · 周四工具
LocalMaxxing:聚焦本地 LLM 推理的社区基准平台
2026.07.23 · 周四工具
ClawLite:本地优先的 Telegram 个人 AI 助手开源发布
2026.07.22 · 周三工具
llama.cpp 新增 Laguna XS.2 与 M.1 模型支持
2026.07.22 · 周三研究论文
Reddit 推出 FlightSimulatorBench:小尺寸 MoE 模型创意编码横评
2026.07.21 · 周二工具
AI 编程工具 pi 0.81.0 集成 llama.cpp 支持
2026.07.21 · 周二工具
Show HN:TZRO 本地化卸载 AI 编码任务
2026.07.21 · 周二工具
HugstonOne 企业版 3.0 发布,主打本地隐私 AI 工作站
2026.07.21 · 周二开源
llama.cpp 新 PR:ROCm 提示处理提速约 15%,修复 Q2_K 性能 bug
2026.07.21 · 周二工具
开源 LLM 路由器 LLMrPro 发布:本地推理与云端兜底统一接口
2026.07.21 · 周二行业动态
8GB 显存实测 Bonsai 27B 三值模型:跑得动,但输给 Qwen3.5-9B
2026.07.21 · 周二产品功能
Cue 语音助手本地部署 Gemma 4:延迟下降 44%,推理边际成本归零
2026.07.21 · 周二工具
Stoke:为 AI Agent 加装预算熔断与本地路由网关
2026.07.20 · 周一产品功能
Epilude Model 4 发布:基于 Qwen 微调的本地听写清理模型
2026.07.20 · 周一行业动态
观点:开源模型商品化加速,苹果或借统一内存成为 AI 推理新主角
2026.07.20 · 周一工具
Headroom:30 秒测出本地 AI 推理的 GPU 带宽上限
2026.07.20 · 周一工具
BeeLlama.cpp v0.4.0 发布:聚焦 KV cache 量化,新增 KVarN 与精度尾部机制
2026.07.19 · 周日工具
NVIDIA 矿卡 CMP 170HX 遭解锁,64GB HBM2 重获算力
2026.07.19 · 周日开源
openPangu-2.0-Flash 接入 ik_llama.cpp,提供 GGUF 本地推理支持
2026.07.14 · 周二工具
Atomic Chat 推出 DFlash,本地 Qwen 模型推理提速 2.2 倍
2026.07.08 · 周三工具
llama.cpp 合并 Q2_0 量化 支持 1.58-bit 三元 Bonsai 模型
2026.07.08 · 周三工具
Squish:面向 Apple Silicon 的本地 LLM 推理服务器
2026.07.08 · 周三开源
DFlash 投机解码登陆 llama.cpp,Qwen3.6-27B 长上下文实测 4.44 倍提速
2026.07.07 · 周二工具
REAP 剪枝版 DeepSeek 在 Ascent GX10 长上下文测试
2026.07.07 · 周二开源
AnythingLLM 开源 OpenComputer:面向 Agent 的隔离虚拟机桌面
2026.07.06 · 周一工具
开发者推出 Kivarro:面向 llama.cpp / mistral.rs 的本地推理桌面工作台
2026.07.06 · 周一研究论文
独立研究者发布2.7亿参数语言模型
2026.07.06 · 周一工具
开发者发布 Kivarro 本地大模型推理一体化工作台
2026.07.05 · 周日工具
开源本地 LLM 推理工作台 Kivarro 发布 v0.1 Alpha
2026.07.04 · 周六工具
HN 分享:Mlx-serve——为 Apple Silicon 打造的大模型推理引擎
2026.07.03 · 周五工具
用户实测 DeepSeek V4 Pro 本地批量推理性能
2026.07.03 · 周五工具
双 RTX 3090 开启 P2P 实测:Qwen3-27B INT4 推理性能对比
2026.07.03 · 周五工具
社区补丁让 RTX 5090 本地跑 DeepSeek V4 Flash 1M 上下文
2026.07.03 · 周五工具
Halo:一款主打本地隐私的 macOS AI 助手上线
2026.07.03 · 周五行业动态
RTX 3090 本地实测:三款开源模型基准对比
2026.07.03 · 周五工具
Gemma 4 WebGPU 推理内核达 255 tok/s,本地大模型实用化再进一步
2026.07.02 · 周四开源
开发者开源本地 LLM NPC 后端:让 NPC 之间互相交谈
2026.07.02 · 周四工具
More AI:开源模型无关的 AI 桌面工作台
2026.07.02 · 周四工具
llama.cpp Windows CUDA 12.4 构建遭 Defender 误报为木马
2026.07.01 · 周三工具
audio.cpp 集成 VibeVoice 1.5B,RTX 5090 上 4 倍实时合成长音频
2026.06.30 · 周二工具
Lullabeast:开源自主开发流水线,本地 27B 对比廉价云端
2026.06.30 · 周二开源
Bartowski 发布 DeepSeek-V4-Flash 的 GGUF 量化版本
2026.06.30 · 周二工具
llama.cpp 个人分支新增循环检测采样器
2026.06.30 · 周二工具
V100 16GB 本地 LLM 推理实测:单卡与双卡 NVLink 基准及避坑
2026.06.30 · 周二开源
DeepSeek V4 支持合并入 llama.cpp,本地推理即将可用
2026.06.29 · 周一工具
Off Grid:Mac 本地一体化运行聊天、图像与语音 AI 工具发布
2026.06.29 · 周一行业动态
NASA 测试本地大模型 为深空任务打造 AI 医疗助手
2026.06.29 · 周一工具
纯 CPU 跑 GLM 5.2:512GB 内存 Epyc 服务器实测
2026.06.29 · 周一工具
Private Whisper:主打本地与隐私的 AI 语音听写工具
2026.06.29 · 周一开源
llama.cpp 出现 DeepSeek V4 支持 PR
2026.06.28 · 周日行业动态
本地 27B 裸 C 写体素引擎,对比 Opus 4.8
2026.06.28 · 周日工具
role-model:本地与云端模型的混合路由协议
2026.06.28 · 周日行业动态
