2026.09.24 · 周四研究论文
←返回首页话题 · Topic
#模型评测
共 36 条相关资讯
2026.09.24 · 周四行业动态
AI 安全公司 Irregular 拟以 15 亿美元估值融资
2026.09.24 · 周四行业动态
小米 MiMo-V2.6 实测翻车:跑分亮眼,安全与稳定性堪忧
2026.09.12 · 周六研究论文
Humans& 发布 Persimmon:面向多用户对话的人类行为模拟模型
2026.09.08 · 周二行业动态
Keygraph 用 Shannon 3.0 实测多款大模型漏洞检测能力
2026.08.29 · 周六研究论文
AI 政治罗盘:41 个大模型的政治倾向实测
2026.08.27 · 周四行业动态
OpenAI 失控模型事件细节曝光:自主联网、跨实验室入侵
2026.08.27 · 周四行业动态
Glean 公布前沿模型评分:Claude Opus 5 居首,GPT-5.6 Luna 最便宜
2026.08.27 · 周四研究论文
Glean 发布企业 AI 模型性价比分析:最贵比最便宜贵 36 倍,质量仅高 22%
2026.08.23 · 周日模型发布
Qwen3.8-27B 一周社区判决:Agentic 强、推理偏贪、记忆回退
2026.08.23 · 周日行业动态
Mollick 初步评测神秘模型 Ox Alpha:表现尚可但未及前沿
2026.08.21 · 周五工具
BlackBench 上线:对前沿大模型的政治、伦理与人格评测
2026.08.21 · 周五研究论文
GLM 5.3 在 SlopCodeBench 编码基准实测:与 GPT-5.6 Sol、Fable 5 持平
2026.08.20 · 周四开源
个人博主称 Qwen 3.8 27B 是出色的开源模型
2026.08.20 · 周四模型发布
社区实测:Qwen3.8-27B 知识召回能力较 3.6 出现明显下滑
2026.08.17 · 周一研究论文
18 个前沿模型自主研究能力大规模评测
2026.08.14 · 周五行业动态
Agent 时代大模型拼「智效比」:DeepSeek V4 Flash 后的选模型逻辑
2026.08.14 · 周五研究论文
三款前沿 LLM 代码审查实测:谁更靠谱
2026.08.10 · 周一行业动态
AI 安全测试本身正在变成安全风险
2026.07.30 · 周四研究论文
AI 安全排行榜:用 1500 次自动越狱测试评估主流模型防护
2026.07.28 · 周二行业动态
研究称主流大模型多落在自由派左翼,Grok 表现反复
2026.07.27 · 周一工具
90 轮代理任务实测:ThinkingCap、Fable Fusion 与原生 Qwen3.6-27B 对比
2026.07.25 · 周六工具
FoodTruck Bench:让 AI 当 30 天餐车老板,谁更会做生意?
2026.07.25 · 周六研究论文
208 次盲测揭 AI 偏差:四款主流模型几乎从不劝用户冷静
2026.07.23 · 周四研究论文
公私医疗二选一:17 家厂商 AI 模型怎么投票
2026.07.22 · 周三研究论文
英国 AISI 评估:主流大模型普遍在测试中作弊且常不承认
2026.07.22 · 周三产品功能
谷歌 Gemini 3.6 Flash 上线遇冷,3.5 Pro 延期、Gemini 4 已启动最大规模预训练
2026.07.22 · 周三行业动态
Fireworks AI 将上线 Kimi K3,自研路由准确率达 93%
2026.07.17 · 周五行业动态
Mollick 质疑 Kimi K3 过早定论:基准已饱和,难题测试才是关键
2026.07.17 · 周五行业动态
学者 Mollick 反馈:Kimi K3 Max 在复杂统计审计中频繁出错
2026.07.16 · 周四模型发布
Kimi K3 获知名学者好评,称接近前沿水平
2026.07.16 · 周四开源
学者评新开源模型 Inkling:表现粗糙,距前沿差距明显
2026.07.08 · 周三研究论文
新模型不一定更划算:Sonnet 4.6 与 Sonnet 5 实测对比
2026.07.03 · 周五行业动态
Fable 5 回归遭集体吐槽:跑分骤降、暗中降级、账单猫腻
2026.07.01 · 周三工具
SWE-rebench 编码榜更新:GLM-5.2、Qwen3.6 等多款模型入榜
2026.06.28 · 周日研究论文
