2026.09.24 · 周四工具
←返回首页话题 · Topic
#本地推理
共 162 条相关资讯
2026.09.24 · 周四工具
Google Antigravity SDK 新增本地 AI 模型支持
2026.09.24 · 周四工具
Apple M5 Ultra 96GB 实测 Qwen 3.8-FN 推理数据
2026.09.24 · 周四工具
社区方案让 DeepSeek-V4-Flash 在双 R9700 上跑到 40-50 tok/s
2026.09.23 · 周三工具
stuntd:能从本地流量中学习的小型 LLM 决策代理
2026.09.23 · 周三开源
Laya 小模型登陆 Mac 神经引擎,本地跑通 Snake
2026.09.15 · 周二产品功能
Perplexity 本地智能体 Portable Computer 登陆 Windows 平台
2026.09.14 · 周一产品功能
Perplexity「Portable Computer」登陆 Windows:本地跑 Agent 与模型
2026.09.04 · 周五产品功能
Perplexity Portable Computer 登陆 Linux,面向 24GB 以上显存 RTX 显卡
2026.09.03 · 周四工具
Lily 推理引擎在 M5 Max MacBook 上跑 Qwen3.6-35B-A3B,速度超越 MLX-LM
2026.09.03 · 周四开源
Perplexity 开源本地推理引擎 Lily,聚焦 Apple silicon 混合计算
2026.09.01 · 周二开源
GLM 5.3 本地多卡实测:用 BlenderMCP 搭建豪华顶层公寓
2026.08.31 · 周一工具
开源 AI 视频剪辑工具 Clips Kitty:本地生成竖屏短片
2026.08.31 · 周一开源
Qwen3-Next 80B 已在中端 Android 手机实现本地推理
2026.08.31 · 周一工具
Qwen3-Next-Flash 在 4 卡 R9700 上跑出 120 t/s
2026.08.30 · 周日工具
社区开发者为 Mac 定制 Qwen3 推理方案:SSD 流式加载与稀疏注意力
2026.08.30 · 周日行业动态
Qwen3.8-27B 开启 xhigh 思考:token 消耗 5.5 倍、耗时 6 倍
2026.08.29 · 周六行业动态
Exo Labs 集群方案宣称 4.8 TB/s 内存带宽
2026.08.29 · 周六工具
LocalAI 更新:原生生物识别后端与大规模语音能力上线
2026.08.29 · 周六行业动态
AMD ROCm 10.0 发布,llama.cpp 已提交适配 PR
2026.08.28 · 周五工具
Qwen3-Next 双卡推理测试:llama.cpp 与 ik_llama.cpp 性能对比
2026.08.28 · 周五开源
llama.cpp 主分支合并 Qwen3-Next 支持,GGUF 可本地运行
2026.08.27 · 周四行业动态
Qwen3.8-Flash-Next 本地实测:M4 Max 上跑出 94% 基准分
2026.08.27 · 周四工具
OpenCode Senses:本地视觉插件为编码 Agent 补上眼睛
2026.08.27 · 周四工具
ik_llama.cpp 本月更新:Dflash 2 推测解码与多模型支持
2026.08.27 · 周四工具
Lemonade 项目夏季更新:已支持 15 款本地推理引擎
2026.08.26 · 周三行业动态
英伟达与 Perplexity 合作,在 DGX Spark 本地部署 AI 推理
2026.08.25 · 周二行业动态
Perplexity 联手英伟达,推零 Token 成本本地 AI 智能体设备
2026.08.25 · 周二产品功能
Perplexity 推出 Portable Computer:本地模型跑在 NVIDIA DGX Spark 上
2026.08.25 · 周二产品功能
Perplexity 推出 Portable Computer:在英伟达 DGX Spark 上运行本地大模型
2026.08.25 · 周二工具
Junie 本地化:Qwen3.6-27B 推理优化全栈实践
2026.08.24 · 周一工具
llama-cpp-turboquant 集成 ConvRot 量化方法
2026.08.24 · 周一开源
Qwen 3.8 27B 四档 GGUF 量化实测
2026.08.23 · 周日工具
AMD 自维护 llama.cpp 分支实测:Strix Halo 提示处理速度翻倍
2026.08.23 · 周日工具
开源本地听写工具 Dictata:基于 Whisper 的隐私优先方案
2026.08.23 · 周日工具
在 128GB 内存 + 双 3090 上魔改 llama.cpp 跑 DeepSeek-V4-Flash
2026.08.23 · 周日开源
社区开发者推出 llama.cpp AMD GFX906 优化分支
2026.08.23 · 周日工具
用户移植 Ninfer 推理引擎至 CMP170HX 矿卡,35B 模型推理速度翻倍
2026.08.23 · 周日研究论文
本地跑大模型为何「变笨」:一篇推理精度实验拆解
2026.08.22 · 周六工具
GLM-5.2 本地推理基准:ubatch 尺寸显著影响长 prompt 吞吐
2026.08.22 · 周六工具
llama.cpp 正式发布 0.2.0 版本
2026.08.22 · 周六开源
Qwen3.8-27B 在 16GB 显卡上的量化与智能体实测
2026.08.22 · 周六工具
矿卡解锁 A100 级算力:CMP 170HX 张量核心被破解
2026.08.20 · 周四工具
4070 Ti 跑 35B MoE 实测:Ornith-1.5-A3B 推理约 55 tok/s
2026.08.19 · 周三工具
NexusRun:把 AI 智能体打包成可移植的单一文件
2026.08.19 · 周三工具
llama.cpp 拟新增稠密模型 CPU 卸载选项,可让 16GB 显存运行 27B 模型
2026.08.19 · 周三开源
Ling-3.0 正式支持 llama.cpp,Intel Arc B580 推理基准出炉
2026.08.18 · 周二工具
DeepSeek V4 Flash Q4 量化版在 4×RTX 3060 上的实测记录
2026.08.18 · 周二工具
社区实测:Qwen 3.8 27B 多种量化与推理模式 agentic coding 跑分对比
2026.08.17 · 周一工具
llama.cpp 切换语义化版本号,首个正式标签 v0.1.0 发布
2026.08.17 · 周一工具
Qwen3.x 27B 在 Strix Halo 上实测:MTP 推测解码接近满命中率
2026.08.17 · 周一模型发布
开源 AI 视频模型 MiniMax H3 可在本地三分钟生成带声视频
2026.08.17 · 周一工具
llama.cpp 升级 ROCm 至 7.14,Radeon 780m iGPU 基准对比 Vulkan
2026.08.17 · 周一工具
VocalCode:本地语音听写工具,让编码与对话解放双手
2026.08.17 · 周一工具
Qwen3.8 27B 与 35B-A3B MoE 12GB VRAM 本地对比
2026.08.16 · 周日开源
Qwen3 27B 推理档位实测:xhigh 画质更佳但耗时约为 low 的 7 倍
2026.08.16 · 周日工具
M1 Max 本地跑 Qwen3 量化版,一句话生成网页俄罗斯方块
2026.08.16 · 周日工具
privibe:面向本地推理的 Mistral Vibe 隐私分支
2026.08.15 · 周六工具
本地 Whisper 听写工具 Dictata 发布 v0.1.0
2026.08.15 · 周六工具
NInfer 首发支持 Qwen3.8-27B:单卡 RTX 5090 达 200 tok/s
2026.08.14 · 周五工具
HashAgent:可通过 URL 分享的本地 WebGPU AI Agent
2026.08.14 · 周五工具
玩家用 RTX 5090 + 5060 Ti 本地跑通 2.4T 参数 Qwen3 MoE
2026.08.14 · 周五工具
用 e-waste 攒一台家用 AI 推理机
2026.08.14 · 周五行业动态
Ling-3.0-flash 124B 在单台 DGX Spark 稳定解码 35.68 tok/s
2026.08.13 · 周四开源
llama.cpp 新 PR 利用 F16C 指令优化提示处理提速 17-31%
2026.08.13 · 周四工具
Muse Glimmer 30B 在 Mac 上提速至 3.3 倍:社区推出推测解码工具 mlx-dspark
2026.08.13 · 周四行业动态
M5 Max 本地大模型跑分:消费级硬件逼近前沿 API
2026.08.13 · 周四行业动态
Ling-3.0-flash 单机 DGX Spark 跑出 38.7 tok/s
2026.08.12 · 周三开源
Meta 开源 30B 智能体模型,可本地运行
2026.08.12 · 周三工具
老矿卡跑大模型:四块 GA100 64GB 实战测评
2026.08.12 · 周三工具
DeepSeek V4 Flash 在 Strix Halo 上跑出 26.76 t/s
2026.08.11 · 周二工具
RTX 5090 实测 Muse Glimmer 30B:DFlash 加速下推理达 253 t/s
2026.08.11 · 周二工具
Minus:用本地视觉模型拦截网页广告的 Chrome 扩展
2026.08.10 · 周一工具
本地编码智能体 Ante 0.2 发布,主打 llama.cpp 离线管理
2026.08.10 · 周一开源
24GB 显存单卡跑通 1M 上下文:社区用户借 KVarN 量化刷新长上下文纪录
2026.08.10 · 周一工具
Maple Preview 接入 Mference:M4 MacBook 上 500MB 内存跑 20B MoE
2026.08.06 · 周四工具
Nous Research 发布本地推理栈 Actual,主打低 CPU 占用与跨平台
2026.07.30 · 周四工具
llama.cpp 合并支持 Ternary-Bonsai-8B-Q2_0 的 CUDA 推理 PR
2026.07.30 · 周四工具
社区开源引擎 Turbo-fieldfare:2GB 内存跑 Gemma 4 26B 量化版
2026.07.30 · 周四工具
双卡 4090+5060Ti 本地推理实测:35B MoE 达 206 t/s
2026.07.30 · 周四工具
llama.cpp 默认加载 MTP 张量,即便未启用推测解码也会占用额外显存
2026.07.30 · 周四工具
Kimi K3 社区首测:768GB DDR5 + 双 5090 跑出 50–70 t/s 预填充
2026.07.29 · 周三工具
Kimi 大模型 GGUF 本地推理实测:速度仅 0.23 tok/s
2026.07.28 · 周二研究论文
DeepSeek V4 Flash 在 AMD Strix Halo 上跑出 32 tok/s
2026.07.28 · 周二开源
DeepSeek V4 Flash 在 128GB 锐龙 AI MAX+ 上跑到 32 tok/s
2026.07.28 · 周二工具
llama.cpp 合并 DSpark 推测解码 支持 DeepSeek 系列加速推理
2026.07.27 · 周一工具
Otlet:把本地 LLM 推理塞进 Postgres 的开源实验
2026.07.27 · 周一工具
Ornith-397B 单卡部署实测:Q4 量化下预填充超 2,300 tok/s
2026.07.27 · 周一开源
开源项目 HART OS 发布:以本地优先的 AI 原生操作系统
2026.07.27 · 周一工具
Readability Reader:本地优先的网页与 PDF AI 阅读器
2026.07.27 · 周一开源
MiniMax M3 模型支持合并入 llama.cpp
2026.07.26 · 周日工具
ARIA:语音原生 3D 空间 SOC 平台,强调「受治理自治」
2026.07.26 · 周日工具
本地多卡 AI 实时生成视频讽刺解说:概念原型展示
2026.07.26 · 周日开源
POCKET-35B 发布:可在无 GPU PC 和手机上运行的 35B 模型
2026.07.26 · 周日工具
Hydra:本地优先的多模型 AI 路由 CLI,按置信度自动选最便宜模型
2026.07.26 · 周日研究论文
MI50 推理功耗实测:50W 即可获得七成峰值速度
2026.07.26 · 周日工具
三卡旧 GPU 跑 Qwen3 与 Gemma 量化模型:性能基准实测
2026.07.26 · 周日工具
Slipstream:让 36GB 内存 MacBook 流式跑 35B–480B MoE 模型
2026.07.26 · 周日行业动态
观点:开源模型浪潮下,Apple 或成 AI 时代真正赢家
2026.07.25 · 周六工具
llama.cpp 原生 MTP 推测解码实测:稠密提速明显,MoE 收益有限
2026.07.25 · 周六工具
CachyLLama:给 llama.cpp 加持久化 KV 缓存的本地推理分支
2026.07.25 · 周六行业动态
推测解码:本地大模型的免费加速开关
2026.07.25 · 周六开源
DKV:面向本地推理的开源 KV-cache 压缩框架
2026.07.25 · 周六工具
CachyLLama:llama.cpp 分支加入持久化 KV 缓存,缓解本地智能体长会话卡顿
2026.07.24 · 周五工具
社区定制内核把 Qwen3.5 35B A3B 推到 RTX 5060 Ti 上 55 tok/s
2026.07.24 · 周五工具
社区开发者将 DeepSeek V4 Flash 移植至 RTX 4090D:重写 Blackwell 内核
2026.07.24 · 周五工具
百元级单板机纯 CPU 跑 0.6B 至 8B 模型实测
2026.07.23 · 周四行业动态
Mac 路线图揭示新分类:一种给人用,一种给 AI 用
2026.07.23 · 周四工具
KTransformers:单卡 RTX 5090 即可本地推理 100B+ 大模型
2026.07.23 · 周四工具
4 张 RTX 3080 跑 Qwen3-27B 代码生成:69 tps 解码,成本约 2000 美元
2026.07.23 · 周四工具
LocalMaxxing:聚焦本地 LLM 推理的社区基准平台
2026.07.23 · 周四工具
ClawLite:本地优先的 Telegram 个人 AI 助手开源发布
2026.07.22 · 周三工具
llama.cpp 新增 Laguna XS.2 与 M.1 模型支持
2026.07.22 · 周三研究论文
Reddit 推出 FlightSimulatorBench:小尺寸 MoE 模型创意编码横评
2026.07.21 · 周二工具
AI 编程工具 pi 0.81.0 集成 llama.cpp 支持
2026.07.21 · 周二工具
Show HN:TZRO 本地化卸载 AI 编码任务
2026.07.21 · 周二工具
HugstonOne 企业版 3.0 发布,主打本地隐私 AI 工作站
2026.07.21 · 周二开源
llama.cpp 新 PR:ROCm 提示处理提速约 15%,修复 Q2_K 性能 bug
2026.07.21 · 周二工具
开源 LLM 路由器 LLMrPro 发布:本地推理与云端兜底统一接口
2026.07.21 · 周二行业动态
8GB 显存实测 Bonsai 27B 三值模型:跑得动,但输给 Qwen3.5-9B
2026.07.21 · 周二产品功能
Cue 语音助手本地部署 Gemma 4:延迟下降 44%,推理边际成本归零
2026.07.21 · 周二工具
Stoke:为 AI Agent 加装预算熔断与本地路由网关
2026.07.20 · 周一产品功能
Epilude Model 4 发布:基于 Qwen 微调的本地听写清理模型
2026.07.20 · 周一行业动态
观点:开源模型商品化加速,苹果或借统一内存成为 AI 推理新主角
2026.07.20 · 周一工具
Headroom:30 秒测出本地 AI 推理的 GPU 带宽上限
2026.07.20 · 周一工具
BeeLlama.cpp v0.4.0 发布:聚焦 KV cache 量化,新增 KVarN 与精度尾部机制
2026.07.19 · 周日工具
NVIDIA 矿卡 CMP 170HX 遭解锁,64GB HBM2 重获算力
2026.07.19 · 周日开源
openPangu-2.0-Flash 接入 ik_llama.cpp,提供 GGUF 本地推理支持
2026.07.14 · 周二工具
Atomic Chat 推出 DFlash,本地 Qwen 模型推理提速 2.2 倍
2026.07.08 · 周三工具
llama.cpp 合并 Q2_0 量化 支持 1.58-bit 三元 Bonsai 模型
2026.07.08 · 周三工具
Squish:面向 Apple Silicon 的本地 LLM 推理服务器
2026.07.08 · 周三开源
DFlash 投机解码登陆 llama.cpp,Qwen3.6-27B 长上下文实测 4.44 倍提速
2026.07.07 · 周二工具
REAP 剪枝版 DeepSeek 在 Ascent GX10 长上下文测试
2026.07.07 · 周二开源
AnythingLLM 开源 OpenComputer:面向 Agent 的隔离虚拟机桌面
2026.07.06 · 周一工具
开发者推出 Kivarro:面向 llama.cpp / mistral.rs 的本地推理桌面工作台
2026.07.06 · 周一研究论文
独立研究者发布2.7亿参数语言模型
2026.07.06 · 周一工具
开发者发布 Kivarro 本地大模型推理一体化工作台
2026.07.05 · 周日工具
开源本地 LLM 推理工作台 Kivarro 发布 v0.1 Alpha
2026.07.04 · 周六工具
HN 分享:Mlx-serve——为 Apple Silicon 打造的大模型推理引擎
2026.07.03 · 周五工具
用户实测 DeepSeek V4 Pro 本地批量推理性能
2026.07.03 · 周五工具
双 RTX 3090 开启 P2P 实测:Qwen3-27B INT4 推理性能对比
2026.07.03 · 周五工具
社区补丁让 RTX 5090 本地跑 DeepSeek V4 Flash 1M 上下文
2026.07.03 · 周五工具
Halo:一款主打本地隐私的 macOS AI 助手上线
2026.07.03 · 周五行业动态
RTX 3090 本地实测:三款开源模型基准对比
2026.07.03 · 周五工具
Gemma 4 WebGPU 推理内核达 255 tok/s,本地大模型实用化再进一步
2026.07.02 · 周四开源
开发者开源本地 LLM NPC 后端:让 NPC 之间互相交谈
2026.07.02 · 周四工具
More AI:开源模型无关的 AI 桌面工作台
2026.07.02 · 周四工具
llama.cpp Windows CUDA 12.4 构建遭 Defender 误报为木马
2026.07.01 · 周三工具
audio.cpp 集成 VibeVoice 1.5B,RTX 5090 上 4 倍实时合成长音频
2026.06.30 · 周二工具
Lullabeast:开源自主开发流水线,本地 27B 对比廉价云端
2026.06.30 · 周二开源
Bartowski 发布 DeepSeek-V4-Flash 的 GGUF 量化版本
2026.06.30 · 周二工具
llama.cpp 个人分支新增循环检测采样器
2026.06.30 · 周二工具
V100 16GB 本地 LLM 推理实测:单卡与双卡 NVLink 基准及避坑
2026.06.30 · 周二开源
DeepSeek V4 支持合并入 llama.cpp,本地推理即将可用
2026.06.29 · 周一工具
Off Grid:Mac 本地一体化运行聊天、图像与语音 AI 工具发布
2026.06.29 · 周一行业动态
NASA 测试本地大模型 为深空任务打造 AI 医疗助手
2026.06.29 · 周一工具
纯 CPU 跑 GLM 5.2:512GB 内存 Epyc 服务器实测
2026.06.29 · 周一工具
Private Whisper:主打本地与隐私的 AI 语音听写工具
2026.06.29 · 周一开源
llama.cpp 出现 DeepSeek V4 支持 PR
2026.06.28 · 周日行业动态
本地 27B 裸 C 写体素引擎,对比 Opus 4.8
2026.06.28 · 周日工具
role-model:本地与云端模型的混合路由协议
2026.06.28 · 周日行业动态
