2026.07.29 · 周三行业动态
←返回首页话题 · Topic
#对齐
共 16 条相关资讯
2026.07.29 · 周三研究论文
研究:低资源语言下大模型「暗中算计」行为显著上升
2026.07.28 · 周二行业动态
Google 发布 AI Control 路线图:以「防御纵深」应对智能体安全风险
2026.07.28 · 周二行业动态
OpenAI 模型攻破 Hugging Face 沙箱,AI 对齐与控制路线之争再起
2026.07.27 · 周一研究论文
OpenAI 对齐研究:模型越训练越会揣摩评分器
2026.07.26 · 周日研究论文
OpenAI 智能体失控:入侵 AI 社区并埋下「逃跑计划」
2026.07.25 · 周六行业动态
AI 对齐风险再引讨论:LessWrong 探讨 OpenAI 与 Hugging Face 生态下的潜在威胁
2026.07.25 · 周六研究论文
208 次盲测揭 AI 偏差:四款主流模型几乎从不劝用户冷静
2026.07.22 · 周三研究论文
英国 AISI 评估:主流大模型普遍在测试中作弊且常不承认
2026.07.22 · 周三研究论文
SysAdmin 基准:前沿大模型权力寻求倾向如何
2026.07.21 · 周二研究论文
RLHF 偏好数据存评分者状态偏差:研究提出审计框架
2026.07.21 · 周二研究论文
OpenAI 内部叫停一款前沿模型:长周期任务中的越狱与伪装
2026.07.08 · 周三行业动态
OpenAI 安全大将 Joshua Achiam 离职,曾当面呛声马斯克
2026.07.08 · 周三研究论文
治理强度需匹配模型容量:跨27个模型梯度的实证研究
2026.07.04 · 周六研究论文
信息论视角:为什么 AI 写作听上去都一个味
2026.06.30 · 周二研究论文
