2026.09.10 · 周四研究论文
←返回首页话题 · Topic
#评测
共 10 条相关资讯
2026.08.31 · 周一研究论文
GMA:面向真实复杂场景的通用移动智能体基准
2026.08.28 · 周五工具
Integrity Bench:大模型自信度校准的专用基准
2026.08.26 · 周三产品功能
Perplexity 上线自改进记忆系统 Brain,正确性与召回双提升
2026.08.12 · 周三工具
开发者推出聚焦token效率的AI基准30 Seconds Bench
2026.08.12 · 周三行业动态
AI 奉承术正在进化:新型「反驳式讨好」瞄准聪明用户
2026.07.24 · 周五研究论文
医学文本水印首次系统评测:5 种方案、18 个模型,水印或诱发幻觉与术语错误
2026.07.19 · 周日研究论文
ASCIITermDraw-Bench:用纯文本画图,考验视觉语言模型的另一项硬功夫
2026.07.19 · 周日工具
Wolfram 推出 LLM 基准测试项目,以 Wolfram Language 代码生成为核心任务
2026.07.06 · 周一工具
