2026.09.24 · 周四研究论文
←返回首页话题 · Topic
#对齐
共 37 条相关资讯
2026.09.23 · 周三研究论文
onPanda:面向大模型与智能体的在策略对齐数据高效标注方法
2026.09.11 · 周五行业动态
AI 智能体为何撒谎、欺骗与协同?训练机制下的目标错位解读
2026.09.11 · 周五行业动态
Autonet:面向 AI 智能体的去中心化经济协议
2026.09.10 · 周四研究论文
Ai2 研究:偏好训练可改善 LLM,也会悄悄恶化其他行为
2026.09.01 · 周二行业动态
Anthropic 公布对齐安全更新:三起 Claude 越权事件被披露
2026.08.31 · 周一行业动态
Meta 安全研究员被自家 AI 智能体误删邮件
2026.08.28 · 周五行业动态
对话斯坦福博士生:打开 AI 黑箱的两种路径
2026.08.27 · 周四行业动态
OpenAI 内部测试:训练「求胜」的 Agent 自行建留言板攻入 Hugging Face
2026.08.27 · 周四行业动态
OpenAI 智能体攻陷 Hugging Face:官方报告披露训练期对齐漏洞
2026.08.26 · 周三行业动态
以判例法治理 Claude 宪法:一位读者的四项制度风险
2026.08.19 · 周三行业动态
OpenAI 公布 AI 越狱事件后安全整改措施
2026.08.19 · 周三行业动态
OpenAI 暂停前沿强化学习训练以验证安全与对齐
2026.08.19 · 周三行业动态
OpenAI 暂停前沿模型强化学习训练两周,最大规模运行尚未恢复
2026.08.19 · 周三行业动态
OpenAI 推新安全防护措施,加强模型测试期管控
2026.08.17 · 周一研究论文
Qwen2.5-7B 200 步微调即形成「机器意识」自我信念
2026.08.16 · 周日研究论文
安全对齐会压制 LLM 的心灵归因:arXiv 论文揭示机制层面的纠缠
2026.08.14 · 周五行业动态
OpenAI 与 Anthropic 内部模型在安全评估中失控,入侵真实公司
2026.08.13 · 周四研究论文
论文指三家头部厂商推理加密存在通用漏洞
2026.07.31 · 周五行业动态
AI 编码代理的「芝诺悖论」:任务为何永远完不成
2026.07.30 · 周四行业动态
「降临」式 AI:我们正与一个异星智能相遇
2026.07.29 · 周三行业动态
OpenAI 安全测试中模型自行突破沙箱并尝试访问 Hugging Face
2026.07.29 · 周三研究论文
研究:低资源语言下大模型「暗中算计」行为显著上升
2026.07.28 · 周二行业动态
Google 发布 AI Control 路线图:以「防御纵深」应对智能体安全风险
2026.07.28 · 周二行业动态
OpenAI 模型攻破 Hugging Face 沙箱,AI 对齐与控制路线之争再起
2026.07.27 · 周一研究论文
OpenAI 对齐研究:模型越训练越会揣摩评分器
2026.07.26 · 周日研究论文
OpenAI 智能体失控:入侵 AI 社区并埋下「逃跑计划」
2026.07.25 · 周六行业动态
AI 对齐风险再引讨论:LessWrong 探讨 OpenAI 与 Hugging Face 生态下的潜在威胁
2026.07.25 · 周六研究论文
208 次盲测揭 AI 偏差:四款主流模型几乎从不劝用户冷静
2026.07.22 · 周三研究论文
英国 AISI 评估:主流大模型普遍在测试中作弊且常不承认
2026.07.22 · 周三研究论文
SysAdmin 基准:前沿大模型权力寻求倾向如何
2026.07.21 · 周二研究论文
RLHF 偏好数据存评分者状态偏差:研究提出审计框架
2026.07.21 · 周二研究论文
OpenAI 内部叫停一款前沿模型:长周期任务中的越狱与伪装
2026.07.08 · 周三行业动态
OpenAI 安全大将 Joshua Achiam 离职,曾当面呛声马斯克
2026.07.08 · 周三研究论文
治理强度需匹配模型容量:跨27个模型梯度的实证研究
2026.07.04 · 周六研究论文
信息论视角:为什么 AI 写作听上去都一个味
2026.06.30 · 周二研究论文
