2026.09.25 · 周五工具
←返回首页话题 · Topic
#基准评测
共 35 条相关资讯
2026.09.24 · 周四工具
OpenAI 发布 MentalHealthBench 覆盖心理健康全场景
2026.09.23 · 周三研究论文
企业数据 Agent 新框架:以潜等价学习拆解证据组织与语义推理
2026.08.30 · 周日行业动态
Ling 金融大模型基准披露遭质疑
2026.08.29 · 周六工具
Terminal Bench 4.0 发布,强调快速迭代应对基准饱和
2026.08.29 · 周六开源
Pipecat 发布开源语音智能体模型 PhoneLLM Alpha 1
2026.08.28 · 周五模型发布
Agnes AI 发布 2.5 Pro Beta:智能指数升至 49,智能体能力大幅提升
2026.08.28 · 周五研究论文
Stanford 联合 Terminal-Bench 推出科研智能体基准 Terminal-Bench-Science 0.1
2026.08.27 · 周四开源
社区发布文生图评测基准,覆盖 52 个模型超 9000 张图
2026.08.26 · 周三研究论文
重测「64% 大模型可靠性」基准:现代模型得分超 95%
2026.08.26 · 周三研究论文
ESQ-Bench:企业级 NL2SQL 新基准,揭示大模型在复杂 Schema 下严重退化
2026.08.22 · 周六行业动态
Ox Alpha 自测跑分 SWE-bench Mini 达 96%,作者提醒或偏高
2026.08.20 · 周四研究论文
学者提议用转换复杂度刻画游戏世界,强化学习评测缺一把尺
2026.08.17 · 周一研究论文
CladBench 开源评测基准发布:聚焦英欧建筑法规的 LLM 横评
2026.08.15 · 周六研究论文
大模型多约束遵循研究:5 条以上时能力骤降
2026.08.14 · 周五行业动态
Chollet 提醒:ARC 3 公开集仅作演示,不可作为训练或评测依据
2026.08.13 · 周四工具
Agent Memory Leaderboard 首发评测结果:MemoraX 居榜首
2026.08.11 · 周二研究论文
学者发布 NL2SHACL-Bench:首个自然语言转 SHACL 约束基准
2026.08.11 · 周二研究论文
MetaSpace:用变形测试评估具身智能体空间认知
2026.07.28 · 周二研究论文
Kimi 发布 PerceptionBench:聚焦视觉感知原子能力评测基准
2026.07.27 · 周一研究论文
Chollet 评论 iLands:环境塑造智能,而非仅靠基准衡量
2026.07.25 · 周六模型发布
Anthropic 发布 Opus 5:半价对标 Fable 5,多项基准反超
2026.07.24 · 周五研究论文
arXiv 新基准 SDR-Bench:前沿大模型在销售个性化上均未突破"效果平台期"
2026.07.20 · 周一研究论文
ASCIITermDraw-Bench 发布 专测大模型 ASCII 绘图能力
2026.07.19 · 周日工具
ASCIITermDraw Bench:测试视觉语言模型生成 ASCII 图能力
2026.07.19 · 周日行业动态
Inkling 基准复盘:被忽略的 IFBench 与被误读的 Tinker 案例
2026.07.09 · 周四研究论文
OpenAI 审计 SWE-Bench Pro:发现三成任务异常
2026.07.09 · 周四研究论文
Reka 介绍 PhysicalRealismBench-U:评测 VLM 物理常识的新基准
2026.07.08 · 周三研究论文
CSTutorBench:面向积木式编程的小语言模型教学评测基准
2026.07.08 · 周三行业动态
AI 黑客能力快速提升,传统评测基准面临失效
2026.07.07 · 周二研究论文
Architecture 2.0:用 AI 设计循环重塑计算机体系结构
2026.07.03 · 周五研究论文
Reka 发布 WorldModelGym:评估世界模型能否帮助智能体做出正确决策
2026.07.01 · 周三研究论文
BayesBench:评估大模型多轮证据下的信念更新轨迹
2026.06.30 · 周二研究论文
Cursor 量化研究:前沿模型在 SWE-bench 上大量「检索答案」而非真正解题
2026.06.28 · 周日工具
