2026.07.30 · 周四研究论文
←返回首页话题 · Topic
#模型评测
共 17 条相关资讯
2026.07.28 · 周二行业动态
研究称主流大模型多落在自由派左翼,Grok 表现反复
2026.07.27 · 周一工具
90 轮代理任务实测:ThinkingCap、Fable Fusion 与原生 Qwen3.6-27B 对比
2026.07.25 · 周六工具
FoodTruck Bench:让 AI 当 30 天餐车老板,谁更会做生意?
2026.07.25 · 周六研究论文
208 次盲测揭 AI 偏差:四款主流模型几乎从不劝用户冷静
2026.07.23 · 周四研究论文
公私医疗二选一:17 家厂商 AI 模型怎么投票
2026.07.22 · 周三研究论文
英国 AISI 评估:主流大模型普遍在测试中作弊且常不承认
2026.07.22 · 周三产品功能
谷歌 Gemini 3.6 Flash 上线遇冷,3.5 Pro 延期、Gemini 4 已启动最大规模预训练
2026.07.22 · 周三行业动态
Fireworks AI 将上线 Kimi K3,自研路由准确率达 93%
2026.07.17 · 周五行业动态
Mollick 质疑 Kimi K3 过早定论:基准已饱和,难题测试才是关键
2026.07.17 · 周五行业动态
学者 Mollick 反馈:Kimi K3 Max 在复杂统计审计中频繁出错
2026.07.16 · 周四模型发布
Kimi K3 获知名学者好评,称接近前沿水平
2026.07.16 · 周四开源
学者评新开源模型 Inkling:表现粗糙,距前沿差距明显
2026.07.08 · 周三研究论文
新模型不一定更划算:Sonnet 4.6 与 Sonnet 5 实测对比
2026.07.03 · 周五行业动态
Fable 5 回归遭集体吐槽:跑分骤降、暗中降级、账单猫腻
2026.07.01 · 周三工具
SWE-rebench 编码榜更新:GLM-5.2、Qwen3.6 等多款模型入榜
2026.06.28 · 周日研究论文
