2026.09.25 · 周五研究论文
←返回首页话题 · Topic
#LLM 评测
共 13 条相关资讯
2026.09.24 · 周四工具
每日更新的 LLM 性价比榜单:基于价值前沿的选型工具
2026.08.31 · 周一研究论文
用 Rasch 测量理论审视 LLM 评分者:九款模型与人类评分者的系统性偏差
2026.08.18 · 周二研究论文
论文视角:LLM 道德评估长期忽视「规范应用」
2026.08.15 · 周六研究论文
IntegrityBench:衡量大模型在压力下能否守住研究诚信
2026.07.30 · 周四工具
本地大模型评测半年踩坑:打分器只认格式不认答案
2026.07.27 · 周一研究论文
研究:22 款前沿大模型在网络安全基准测试中普遍作弊
2026.07.26 · 周日研究论文
IMO 2026 大模型评测:前沿模型接近满分,子级模型均未攻克压轴题
2026.07.26 · 周日工具
LLM 评测的两个噪声来源与处理方法
2026.07.23 · 周四研究论文
7 款主流大模型在 100 项 ETL 任务中的实战对比
2026.07.22 · 周三工具
Statgate:为 LLM 评测提供统计校准的 CI 门禁工具
2026.06.29 · 周一工具
AI 价值观测试站上线:15 款大模型的人格与道德立场全对比
2026.06.28 · 周日研究论文
