2026.09.02 · 周三研究论文
←返回首页话题 · Topic
#评测基准
共 19 条相关资讯
2026.09.02 · 周三研究论文
Ai2 发布 BenchMIRT:审计大模型评测基准「考了什么」
2026.08.28 · 周五研究论文
机器人模仿学习评测失灵:成功率可能计入了「错误」的成功
2026.08.25 · 周二工具
Megaton AI 推出 V-Benchmark,专注视频生成模型评估
2026.08.25 · 周二开源
复古 LLM「Bart」开源:2.82B 参数、20.1B 旧时代语料训练
2026.08.21 · 周五工具
Meta 预览多模态智能体评测框架 WildArtifactBench
2026.08.20 · 周四研究论文
FinSkillBench:面向投资管理的 AI Agent 技能评测基准
2026.08.15 · 周六工具
AletheionAGI:面向 AI 智能体的证据绑定交付层
2026.08.10 · 周一研究论文
C4 评测框架:测试多模态大模型能否「读懂」中文成语的跨概念创意
2026.07.30 · 周四行业动态
ARC-AGI-3 评测规则说明:Chollet 澄清测试工具边界
2026.07.28 · 周二研究论文
Nature Medicine 呼吁构建医学 AI 超智能评测框架
2026.07.20 · 周一研究论文
DrawingVQA:首个面向建筑工程图纸的多模态大模型评测基准
2026.07.18 · 周六产品功能
Runway 称其 Agent 在独立评测中三项居首
2026.07.15 · 周三工具
WANDR:面向 agent 的大规模实体发现与事实验证基准
2026.07.09 · 周四行业动态
OpenAI 呼吁编程模型评测需更难、更公平、更可信
2026.07.09 · 周四工具
Google 更新 Android Bench:新增 8 款主流编程大模型
2026.07.08 · 周三工具
VetoBench:评估 AI 智能体是否重复已否决决策的开源基准
2026.07.08 · 周三研究论文
Reka Labs 发布两项 VLM 物理理解与世界模型评测基准
2026.06.30 · 周二工具
