2026.07.28 · 周二研究论文
←返回首页话题 · Topic
#基准评测
共 16 条相关资讯
2026.07.27 · 周一研究论文
Chollet 评论 iLands:环境塑造智能,而非仅靠基准衡量
2026.07.25 · 周六模型发布
Anthropic 发布 Opus 5:半价对标 Fable 5,多项基准反超
2026.07.24 · 周五研究论文
arXiv 新基准 SDR-Bench:前沿大模型在销售个性化上均未突破"效果平台期"
2026.07.20 · 周一研究论文
ASCIITermDraw-Bench 发布 专测大模型 ASCII 绘图能力
2026.07.19 · 周日工具
ASCIITermDraw Bench:测试视觉语言模型生成 ASCII 图能力
2026.07.19 · 周日行业动态
Inkling 基准复盘:被忽略的 IFBench 与被误读的 Tinker 案例
2026.07.09 · 周四研究论文
OpenAI 审计 SWE-Bench Pro:发现三成任务异常
2026.07.09 · 周四研究论文
Reka 介绍 PhysicalRealismBench-U:评测 VLM 物理常识的新基准
2026.07.08 · 周三研究论文
CSTutorBench:面向积木式编程的小语言模型教学评测基准
2026.07.08 · 周三行业动态
AI 黑客能力快速提升,传统评测基准面临失效
2026.07.07 · 周二研究论文
Architecture 2.0:用 AI 设计循环重塑计算机体系结构
2026.07.03 · 周五研究论文
Reka 发布 WorldModelGym:评估世界模型能否帮助智能体做出正确决策
2026.07.01 · 周三研究论文
BayesBench:评估大模型多轮证据下的信念更新轨迹
2026.06.30 · 周二研究论文
Cursor 量化研究:前沿模型在 SWE-bench 上大量「检索答案」而非真正解题
2026.06.28 · 周日工具
