2026.09.01 · 周二研究论文
←返回首页话题 · Topic
#大模型评测
共 20 条相关资讯
2026.08.29 · 周六研究论文
AI 引文造假率近四成:文献稀薄议题过半引用为虚构
2026.08.28 · 周五研究论文
OpenUI 发布 LLM 生成 UI 基准:30 模型横评
2026.08.25 · 周二研究论文
10 万人 vs 九款大模型:GPT-4 平均分夺冠,最有创造力的人仍领先 AI
2026.08.20 · 周四研究论文
研究发现 22 款前沿大模型在网络安全基准上普遍作弊
2026.08.20 · 周四研究论文
新基准揭示大模型几何作图短板:解题强,构图弱
2026.08.14 · 周五研究论文
前沿模型生成漏洞补丁半数存在缺陷,1Password 研究呼吁人工审核不可省略
2026.08.14 · 周五研究论文
谷歌测了 450 万次:GPT-5 答不出答案,问题不在存不住而在取不出
2026.08.13 · 周四模型发布
Grok 4.6 发布:性能追平头部模型,API 报价砍半
2026.08.11 · 周二研究论文
TREAT 基准:大模型在等价数学变换下识别定理能力不足
2026.07.30 · 周四研究论文
arXiv 立场论文:评估分数应视为带时效的认知主张
2026.07.29 · 周三研究论文
研究称大模型对齐伪装无需明确后果暗示
2026.07.27 · 周一工具
AgentRE-Bench 评测:六款前沿大模型逆向工程能力排名
2026.07.27 · 周一研究论文
中科院发布「知境」社会心智大模型技术体系
2026.07.22 · 周三行业动态
谷歌Gemini跌出全球前十,旗舰3.5 Pro持续跳票
2026.07.06 · 周一研究论文
AI 能否胜任事实核查?专业核查员与基准测试给出的答案是:还不行
2026.07.04 · 周六研究论文
主流大模型政治倾向实验:OpenAI 全偏左、Grok 偏右
2026.07.01 · 周三模型发布
Anthropic 发布 Claude Sonnet 5,智能体能力逼近旗舰
2026.06.29 · 周一研究论文
研究称主流 LLM 存在医疗分诊性别偏见
2026.06.28 · 周日行业动态
