2026.07.28 · 周二行业动态
←返回首页话题 · Topic
#对齐研究
共 6 条相关资讯
2026.07.24 · 周五研究论文
不完整提示越狱:大语言模型安全的新盲区
2026.07.20 · 周一研究论文
研究提出 AI 代理管理「胁迫与欺骗」基准
2026.07.16 · 周四研究论文
Anthropic 公开多模型对齐测试:四类场景揭示 AI 行为偏差
2026.07.16 · 周四研究论文
Anthropic 新研究:智能体自主失准再添四种方式
2026.06.29 · 周一研究论文
