2026.08.24 · 周一工具
←返回首页话题 · Topic
#基准测试
共 123 条相关资讯
2026.08.24 · 周一研究论文
StateSight:面向视觉语言模型的空间状态重建基准
2026.08.24 · 周一行业动态
Together AI 基准对比:同预算下 GLM-5.3 解题数为 Fable 5 五倍
2026.08.23 · 周日行业动态
Together AI 称 GLM-5.3 在 DeepSWE 上以约 1/5 成本匹配 Claude Fable 5
2026.08.22 · 周六工具
本地大模型新基准 ctx-cliff:定位 VRAM 与上下文极限
2026.08.22 · 周六研究论文
Artificial Analysis 完成 Qwen 3 低/中推理档位独立基准
2026.08.22 · 周六研究论文
Chollet 评 NVIDIA ARC-AGI-3 表现:刷满演示集不等于刷满基准
2026.08.21 · 周五行业动态
NVIDIA 通用编码智能体 AVO 据称完成 ARC-AGI-3 全部任务
2026.08.21 · 周五研究论文
Reddit 用户称 NVIDIA AVO 在 ARC-AGI-3 上拿下 100% 满分
2026.08.21 · 周五研究论文
11.7 亿 token 大比拼:10 款 AI 模型漏洞挖掘能力实测
2026.08.21 · 周五工具
BlackBench 上线:对前沿大模型的政治、伦理与人格评测
2026.08.21 · 周五研究论文
中端 AI 模型在黑客任务上快速追赶前沿模型
2026.08.20 · 周四研究论文
研究发现 22 款前沿大模型在网络安全基准上普遍作弊
2026.08.20 · 周四研究论文
τ³-Banking 榜单:Qwen 3.8 Max 登顶,26 款主流模型排名一览
2026.08.20 · 周四研究论文
新基准揭示大模型几何作图短板:解题强,构图弱
2026.08.19 · 周三开源
Ornith-1.5 开源模型家族发布:三档规格、对标前沿闭源
2026.08.19 · 周三研究论文
Pander Score:衡量大模型迎合用户程度的新基准
2026.08.19 · 周三研究论文
GxP-Agent:用流程 DAG 拓扑提升临床试验编程可靠性
2026.08.19 · 周三开源
Qwen3.8-27B 登顶 Harvey 法律 Agent 基准开源权重榜首
2026.08.19 · 周三行业动态
智谱 GLM 5.3 现身 Artificial Analysis 基准,社区关注具体表现
2026.08.18 · 周二行业动态
社区讨论:Qwen3.8 27B 为何默认开启 xhigh 推理
2026.08.18 · 周二研究论文
新基准测试暴露多模态AI推理短板:GPT-4o、Gemini 2.5 Pro不足10%
2026.08.18 · 周二模型发布
Qwen 3.8 27B 智能指数获 52 分,追平更大参数模型
2026.08.18 · 周二工具
Holdline:为 AI Agent 防护插件推出中立基准
2026.08.18 · 周二工具
社区实测:Qwen 3.8 27B 多种量化与推理模式 agentic coding 跑分对比
2026.08.18 · 周二行业动态
Reddit 讨论 Qwen 版本 Artificial Analysis 指数跳升
2026.08.17 · 周一研究论文
稀疏注意力与 KV 压缩评估的四种“美化”手法
2026.08.17 · 周一研究论文
MobileMem:面向移动端长时记忆的智能体基准框架
2026.08.17 · 周一研究论文
如何更真实地评估 AI 编程 Agent:数据标注交互任务法
2026.08.17 · 周一行业动态
社区分析:开源模型追赶前沿大模型的滞后时间正在缩短
2026.08.16 · 周日研究论文
Vero:首个仓库级代码与证明联合生成基准
2026.08.16 · 周日研究论文
Qwen3.8-27B vs Qwen3.6-27B:代理基准实测差距显著
2026.08.15 · 周六研究论文
研究综述:LLM 在软件开发中的真实能力与局限
2026.08.15 · 周六研究论文
IntegrityBench:衡量大模型在压力下能否守住研究诚信
2026.08.15 · 周六行业动态
Together AI 对比 DeepSeek-V4 Pro 与 GPT-5.6 等模型的 SWE 基准
2026.08.14 · 周五研究论文
Rails 基金会启动「Agents on Rails」基准测试,对比主流编码 Agent 表现
2026.08.13 · 周四行业动态
M5 Max 本地大模型跑分:消费级硬件逼近前沿 API
2026.08.12 · 周三研究论文
研究发现可完全解码 Claude 与 GPT 隐藏推理过程
2026.08.12 · 周三行业动态
AI 智能体加速半导体新材料发现,YC 团队发布材料发现基准
2026.08.12 · 周三模型发布
通义 Qwen 模型在 Legal Research Bench 排名升至第 4
2026.08.12 · 周三研究论文
Reddit 用户实测:32GB 显卡跑 Qwen 27B/35B,前沿模型仍更可靠
2026.08.12 · 周三开源
DeepSeek V4 0731 量化与基准测试:发现转换漏洞并对比 38 个版本
2026.08.12 · 周三工具
LocalLLaMA 用户实测:Muse Glimmer 30B 与 Qwen 27B、Gemma 31B 推理对比
2026.08.11 · 周二研究论文
USC 研究:音频大模型「听」不如「读」,语音情感理解普遍偏弱
2026.08.10 · 周一模型发布
韩国 Motif-3 模型发布,综合基准略胜 Qwen 3.7 Max
2026.08.09 · 周日行业动态
Together AI:DeepSeek V4 Flash 编码任务成本约为 GPT-5.6 Luna 三分之一
2026.08.07 · 周五行业动态
Together AI 对比 DeepSeek-V4 Flash 与 GPT-5.6 Luna:前者成本约 1/6,性能达八成
2026.08.06 · 周四模型发布
Qwen3.8-Max 登上 Artificial Analysis 智能与智能体指数前列
2026.08.06 · 周四行业动态
Kimi K3 传在法律基准上接近 Claude 两倍得分
2026.08.06 · 周四行业动态
Together AI 声称在 Kimi K3 多项推理基准中领先
2026.08.06 · 周四模型发布
DeepSeek V4 Flash 基准跑分反超 V4 Pro Preview
2026.07.30 · 周四行业动态
前沿 AI 基准测试正失去人类基线对比
2026.07.30 · 周四工具
MindControl for llama.cpp 发布基准测试,推理 token 减半且精度不损
2026.07.30 · 周四研究论文
多模态大模型动机推理受质疑:新基准 MultivationBench 揭示短板
2026.07.30 · 周四研究论文
新基准 StatMechBench-v0 评估 AI 智能体发现统计力学结构的能力
2026.07.30 · 周四行业动态
OpenAI 发文谈基准测试与长时智能体的推理延续
2026.07.30 · 周四研究论文
OpenAI 透露 GPT-5.6 Sol 数学与 ARC-AGI-3 实测细节
2026.07.30 · 周四产品功能
Ideogram 称 Object Remover 在 RemovalBench 排名第一
2026.07.30 · 周四工具
Kimi K3 社区首测:768GB DDR5 + 双 5090 跑出 50–70 t/s 预填充
2026.07.28 · 周二工具
Apple Silicon 上 LLM 推理速度实测:开源原始基准数据
2026.07.28 · 周二研究论文
35B 编码模型 120 轮对比:KAT-Coder 效率领先
2026.07.28 · 周二模型发布
微软推出网络安全模型 MAI-Cyber-1-Flash 与多智能体框架 MDASH
2026.07.27 · 周一研究论文
研究:22 款前沿大模型在网络安全基准测试中普遍作弊
2026.07.27 · 周一研究论文
SCOPE 基准与 SCION 流水线:面向文本的 Schema 归纳与融合评估
2026.07.26 · 周日行业动态
IOAI 2026 新增 AI 模型赛道,首向智能体颁发官方奖牌
2026.07.26 · 周日开源
23 款 Gemma 4 E4B 衍生模型对比:下载量最高者反而最差
2026.07.26 · 周日工具
LLM 评测的两个噪声来源与处理方法
2026.07.26 · 周日研究论文
UC Berkeley 联合 Anthropic、OpenAI、Google 发布 ExploitGym 基准
2026.07.25 · 周六工具
FoodTruck Bench:让 AI 当 30 天餐车老板,谁更会做生意?
2026.07.24 · 周五研究论文
AI 写基准:Codex 自主生成元评测论文
2026.07.24 · 周五研究论文
InferenceBench:衡量 AI 智能体优化大模型推理能力的新基准
2026.07.23 · 周四研究论文
GPT/Claude/Gemini/Kimi 真实任务成本差 10.6 倍,隐性推理 token 是元凶
2026.07.23 · 周四工具
LocalMaxxing:聚焦本地 LLM 推理的社区基准平台
2026.07.23 · 周四研究论文
研究者严格测试:AI 实验室是否在「骑自行车的鹈鹕」上做过优化
2026.07.23 · 周四研究论文
骑自行车的鹈鹕:1008 张图实测 AI 实验室是否在刷榜
2026.07.22 · 周三研究论文
端侧语音识别基准第二轮:苹果原生引擎紧追英伟达 Parakeet
2026.07.22 · 周三研究论文
无需重训练即可跨方言泛化:模式约束解码在 MLIR 上的基准与评估
2026.07.22 · 周三研究论文
SysAdmin 基准:前沿大模型权力寻求倾向如何
2026.07.22 · 周三行业动态
Kimi K3 登顶 ErrataBench 前十,成首个突破 90% 的开放权重模型
2026.07.22 · 周三行业动态
Laguna-S-2.1 本地实测:速度领先,但事实幻觉严重
2026.07.21 · 周二行业动态
GPT-5.6 三档与 Claude Fable 5 物理建模对决:Fable 以 0.889 加权分领跑
2026.07.21 · 周二研究论文
DeepSWE:评估 AI 编程代理的新基准
2026.07.21 · 周二研究论文
DeepSWE:面向 AI 编程智能体的新一代基准
2026.07.20 · 周一研究论文
研究提出 AI 代理管理「胁迫与欺骗」基准
2026.07.20 · 周一行业动态
四项独立指标交叉印证:AI 能力「曲棍球杆」拐点出现
2026.07.19 · 周日研究论文
ASCIITermDraw-Bench:用纯文本画图,考验视觉语言模型的另一项硬功夫
2026.07.18 · 周六行业动态
Reddit 用户称 Kimi K3 登顶 SpreadsheetBench 2
2026.07.18 · 周六行业动态
Together AI 称 Kimi 在编程任务上以约三折价格追平 Claude
2026.07.17 · 周五开源
Kimi K3 基准表现亮眼,开放权重预计 7 月 27 日发布
2026.07.11 · 周六行业动态
TestingCatalog 称 Grok 4.5 在 WANDR 基准上居首
2026.07.10 · 周五行业动态
传闻:OpenAI GPT‑5.6 智能体表现抢眼,Agents' Last Exam 创新高
2026.07.09 · 周四模型发布
OpenAI 语音模型 GPT-Live-1 曝光,多项基准超越 Advanced Voice Mode
2026.07.08 · 周三研究论文
本地小模型技术问答实测:RAG 加持下准确率显著提升
2026.07.08 · 周三行业动态
沃顿教授点评微软 MAI-1:自测基准逊于 Sonnet 4.6,独立验证尚缺
2026.07.07 · 周二研究论文
AAI Labs 发布 DGX Spark 本地大模型行政任务基准
2026.07.07 · 周二产品功能
SageMaker AI 推出 MLflow 集成,自动流式记录推理基准结果
2026.07.06 · 周一研究论文
小型 TTS 模型 CPU 基准:Pocket TTS 架构独特,UTMOS 评分存盲区
2026.07.06 · 周一工具
Pocket TTS:CPU 上跑 5 秒声音克隆的 MIT 开源模型
2026.07.06 · 周一工具
FlowerBench:面向企业真实工作流的 AI 智能体基准
2026.07.06 · 周一研究论文
企业Agent真实任务评测:EnterpriseClawBench基准
2026.07.06 · 周一研究论文
AI 能否胜任事实核查?专业核查员与基准测试给出的答案是:还不行
2026.07.05 · 周日工具
Qwen 3.6 27B VLLM 基准测试:BF16 / FP8 / NVFP4 量化对比
2026.07.05 · 周日研究论文
13 款本地大模型长上下文实测:prefill 才是关键
2026.07.05 · 周日研究论文
AI Agent 一周挑战三道核工程基准
2026.07.04 · 周六研究论文
Reddit 用户实测 8 款本地模型:Gemma-4-31B 领跑奇幻 RP 基准
2026.07.03 · 周五工具
用户实测 DeepSeek V4 Pro 本地批量推理性能
2026.07.03 · 周五研究论文
社区推出 Surface Evolver Bench:用物理仿真代码生成能力测试 LLM
2026.07.03 · 周五行业动态
Together AI:GLM 5.2 以两成价格达 Sonnet 5 八成能力
2026.07.03 · 周五研究论文
拉马努金挑战赛上线:用 AI 证明数学常数公式
2026.07.03 · 周五行业动态
RTX 3090 本地实测:三款开源模型基准对比
2026.07.02 · 周四工具
开发者开源 VCCB 基准:测试多模态模型读懂日历截图
2026.07.01 · 周三研究论文
研究提出 CoPref 框架:AI 智能体应帮用户构建偏好,而非仅被动询问
2026.07.01 · 周三研究论文
Hugging Face 发布 ScarfBench:AI Agent 企业级 Java 框架迁移基准
2026.07.01 · 周三模型发布
Anthropic 推出 Claude Sonnet 5,性能接近 Opus 4.8
2026.07.01 · 周三产品功能
Cursor 接入 Claude Sonnet 5,CursorBench 得分提升 8 个百分点
2026.07.01 · 周三研究论文
OpenAI 发布 GeneBench-Pro 基准,衡量 AI 代理生物数据判断力
2026.07.01 · 周三研究论文
OSWorld2.0 发布:长链路真实任务下的电脑操作 Agent 基准
2026.06.30 · 周二研究论文
Graph-RAG 还是无图多跳 RAG?社区基准测试引发讨论
2026.06.30 · 周二研究论文
AIMAC 代码无障碍榜单:GPT 5.4 Mini 居首
2026.06.30 · 周二行业动态
AI 智能体真实任务仅完成约三分之一,可靠性随步骤指数衰减
2026.06.29 · 周一研究论文
社区测试:去拒绝训练后 MoE 模型数学与代码反超原版
2026.06.29 · 周一研究论文
NormAct 基准:多模态大模型在具身规划中难以遵循隐性社会规范
2026.06.28 · 周日行业动态
