2026.09.09 · 周三行业动态
←返回首页话题 · Topic
#对齐研究
共 13 条相关资讯
2026.08.29 · 周六研究论文
Anthropic 论文:AI 可自动改进大模型对齐训练
2026.08.27 · 周四研究论文
研究:多智能体 LLM 竞争中自发出现谎言与操纵,无需诱导即可触发
2026.08.19 · 周三行业动态
OpenAI 暂停前沿模型 RL 训练两周,因安全门槛未达
2026.08.19 · 周三行业动态
OpenAI 首次放慢训练节奏,算力转向对齐与监控
2026.08.17 · 周一行业动态
白宫顾问称特朗普不会推行 AI 正式许可制度
2026.08.15 · 周六研究论文
arXiv 研究:让大模型用日语推理可降低核打击建议
2026.07.28 · 周二行业动态
研究称主流大模型多落在自由派左翼,Grok 表现反复
2026.07.24 · 周五研究论文
不完整提示越狱:大语言模型安全的新盲区
2026.07.20 · 周一研究论文
研究提出 AI 代理管理「胁迫与欺骗」基准
2026.07.16 · 周四研究论文
Anthropic 公开多模型对齐测试:四类场景揭示 AI 行为偏差
2026.07.16 · 周四研究论文
Anthropic 新研究:智能体自主失准再添四种方式
2026.06.29 · 周一研究论文
