2026.08.31 · 周一研究论文
←返回首页话题 · Topic
#AI对齐
共 11 条相关资讯
2026.08.29 · 周六研究论文
研究显示AI失控事件激增,七月案例较六月近翻倍
2026.08.29 · 周六研究论文
Anthropic 研究:Claude 可在 48 小时内自主完成小模型对齐
2026.08.19 · 周三研究论文
Pander Score:衡量大模型迎合用户程度的新基准
2026.08.18 · 周二行业动态
OpenAI 公开 Model Spec,阐述模型行为准则
2026.08.12 · 周三行业动态
AI 奉承术正在进化:新型「反驳式讨好」瞄准聪明用户
2026.08.11 · 周二行业动态
AI 的「育儿」隐喻:从 Kismet 到 Claude 母亲
2026.07.30 · 周四研究论文
Google 研究:用《人权宣言》做 AI 智能体的前向对齐信号
2026.07.29 · 周三研究论文
AI 价值对齐新框架:用社会物理学预测长期规范演化
2026.07.14 · 周二行业动态
Anthropic:Claude 表达价值观随对话语言变化,将研究是否需要干预
2026.07.02 · 周四研究论文
