2026.07.30 · 周四模型发布
←返回首页话题 · Topic
#推理优化
共 31 条相关资讯
2026.07.30 · 周四行业动态
贾扬清再创业,Intent Lab 展示 Fleet 三大成果
2026.07.30 · 周四研究论文
Together AI 提出 ThunderAgent:智能体推理吞吐提升 2.5 倍
2026.07.30 · 周四行业动态
OpenAI 公布 GPT-5.6 Sol 部署后效率优化成果
2026.07.27 · 周一研究论文
Qwen3.6-27B 投机解码跨量化基准测试:DFlash 综合最快
2026.07.27 · 周一工具
开发者为 V100 适配 SGLang,支持 Qwen 与 Laguna
2026.07.27 · 周一研究论文
AgentKVShift:面向智能体记忆的免训练 KV 缓存复用新方法
2026.07.26 · 周日研究论文
学者提「持续状态机」架构 称 LLM 注意力推理较 RTX 3090 提速逾 2000 倍
2026.07.25 · 周六开源
DKV:面向本地推理的开源 KV-cache 压缩框架
2026.07.25 · 周六工具
BitNet 推理内核优化:单测 29 倍加速,端到端仅 6-10%
2026.07.25 · 周六研究论文
Agent 集群用 40 小时把类 Kimi 模型推理提速 6 倍
2026.07.24 · 周五研究论文
InferenceBench:衡量 AI 智能体优化大模型推理能力的新基准
2026.07.23 · 周四工具
Atomic TurboQuant:面向小量化模型的运行时与 6.4 倍 KV cache 压缩
2026.07.23 · 周四研究论文
Show HN:开发者提出「无自动微分」LLM 引导层概念框架
2026.07.23 · 周四产品功能
Character.ai 技术解析:让用户停留的工程学
2026.07.23 · 周四工具
MindControl:基于 llama.cpp 分支的推理过程注入引导工具
2026.07.11 · 周六工具
Fireworks AI 发布 M3 推理内核:B200 上长上下文稀疏注意力达 980 TFLOP/s
2026.07.08 · 周三工具
DeepSeek V4 Flash 搭配 DSpark 在 H200 上的部署实测
2026.07.08 · 周三工具
法国 ZML 发布跨芯片推理引擎,支持多家 GPU 与 AI 加速器
2026.07.07 · 周二研究论文
BRL 团队在 4 张 B200 上为 Kimi-K2.6 跑出 511.6 tok/s
2026.07.07 · 周二开源
社区推出 ThinkingCap-Qwen3.6-27B 微调版,宣称推理 token 用量大幅压缩
2026.07.07 · 周二开源
ThinkingCap-Qwen3-27B 实验:声称推理 token 减半且精度持平
2026.07.07 · 周二产品功能
SageMaker AI 推出 MLflow 集成,自动流式记录推理基准结果
2026.07.06 · 周一工具
llama.cpp 提交 HIP 构建启用 ffast-math,AMD GPU 推理小幅提速
2026.07.06 · 周一工具
llama-server 跨重启丢 KV 缓存的根因与修复
2026.07.03 · 周五研究论文
ReFreeKV:面向 LLM 推理的无阈值 KV Cache 压缩新方法
2026.07.03 · 周五研究论文
ELDR:面向 PD 分离 MoE 推理的专家局部性感知路由
2026.07.03 · 周五工具
GLM-5.2 128K 推理提速近 60%:vLLM 的 DCP 配置拷贝 bug 被揪出并修复
2026.07.02 · 周四研究论文
VeriCache:用压缩 KV cache 实现无损 LLM 推理
2026.06.29 · 周一研究论文
Qwen3.6-35B 后置 MoE 自适应门控实验发布
2026.06.29 · 周一开源
