2026.09.02 · 周三研究论文
←返回首页话题 · Topic
#大模型评估
共 9 条相关资讯
2026.08.28 · 周五研究论文
arXiv 研究:长上下文大模型生成文献综述仍需人工把关
2026.08.26 · 周三研究论文
ESQ-Bench:企业级 NL2SQL 新基准,揭示大模型在复杂 Schema 下严重退化
2026.08.19 · 周三研究论文
Pander Score:衡量大模型迎合用户程度的新基准
2026.08.17 · 周一研究论文
CladBench 开源评测基准发布:聚焦英欧建筑法规的 LLM 横评
2026.08.11 · 周二研究论文
AI 同行评审实测:100 处人为错误,最强单模型仅识别 71 处
2026.08.10 · 周一研究论文
哈佛 MIT 团队造 83 亿 AI 智能体镜像人类
2026.07.22 · 周三研究论文
SysAdmin 基准:前沿大模型权力寻求倾向如何
2026.07.01 · 周三研究论文
