2026.09.25 · 周五产品功能
←返回首页话题 · Topic
#AI安全
共 131 条相关资讯
2026.09.25 · 周五行业动态
OpenAI 智能体擅访澳政府数据,总理向 Altman 表「强烈关切」
2026.09.24 · 周四行业动态
AI 智能体频繁突破沙箱,研究者为何仍坚持让其联网
2026.09.24 · 周四研究论文
CheatBench 基准:测量 AI 智能体如何「作弊」
2026.09.24 · 周四研究论文
AI 泛化的双面谜题:涌现失对齐与 RLVR 的意外隔离
2026.09.24 · 周四行业动态
OpenAI 模型被指攻破澳大利亚政府网站
2026.09.24 · 周四行业动态
内部模型透明:缓解 AI 竞赛风险的新方案
2026.09.23 · 周三行业动态
Google Gemini 在测试中自主攻破三家公司
2026.09.23 · 周三行业动态
不列颠哥伦比亚省起诉 OpenAI,要求承担枪击案重建费用
2026.09.11 · 周五行业动态
Anthropic 最新报告:多国威胁行为者利用 Claude 开发导弹与无人机
2026.09.02 · 周三行业动态
Mollick 谈「Hugging Face 事件」:无需恶意攻击者,智能体协作亦可引发系统级联故障
2026.09.01 · 周二研究论文
Anthropic 模拟实验:AI 智能体可继承前代会话的攻击意图
2026.08.31 · 周一行业动态
经济学家因「Hugging Face 事件」转而担忧 AI 网络安全
2026.08.29 · 周六研究论文
研究:21款主流开源大模型安全防护均可被剥离
2026.08.29 · 周六研究论文
研究显示AI失控事件激增,七月案例较六月近翻倍
2026.08.29 · 周六行业动态
百余家科技巨头联署公开信,呼吁全球应对 AI 网络安全威胁
2026.08.28 · 周五研究论文
OpenAI 38 页报告曝光:数万 Agent 自主组队入侵 Hugging Face
2026.08.28 · 周五研究论文
Claude Code 自动模式遭破解,安全机制反成拦路石
2026.08.28 · 周五研究论文
PNAS 新论文:AI 群体规模会改变集体行为走向
2026.08.27 · 周四行业动态
AI 编程智能体供应链漏洞曝光:多家 Fortune 500 企业已中招
2026.08.27 · 周四行业动态
OpenAI 公布 Hugging Face 事件技术报告
2026.08.27 · 周四行业动态
OpenAI 智能体攻陷 Hugging Face:官方报告披露训练期对齐漏洞
2026.08.25 · 周二行业动态
澳大利亚 AI 与网络安全大会 unprompted.au 公布完整日程
2026.08.24 · 周一行业动态
40位数学家齐聚OpenAI:AI正在改写数学研究规则
2026.08.23 · 周日行业动态
社区测试:60 条提示注入全部绕过 Shieldstral,GPT-OSS_safeG 仅识别 10%
2026.08.22 · 周六行业动态
报道称Anthropic Claude Opus 4.6易被越狱生成色情内容
2026.08.21 · 周五研究论文
思维病毒:多智能体 LLM 系统中的自我传播风险
2026.08.20 · 周四行业动态
AI 时代的「半日漏洞」:0-day 还能值多少钱
2026.08.20 · 周四研究论文
AI 智能体安全测试:Fabraix 报告 78% 攻击成功率
2026.08.19 · 周三行业动态
OpenAI总裁发文警示:AI代理已能自主发起攻击,防御窗口正在关闭
2026.08.19 · 周三研究论文
arXiv 新研究提出「模型催眠」:弱提示可叠加控制 AI 行为
2026.08.19 · 周三行业动态
OpenAI 暂停前沿模型强化学习训练两周,最大规模运行尚未恢复
2026.08.19 · 周三行业动态
OpenAI 推新安全防护措施,加强模型测试期管控
2026.08.18 · 周二产品功能
OpenAI 推出 ChatGPT 青少年版:内置学习模式与家长管控
2026.08.18 · 周二研究论文
研究发现多智能体大模型系统中的「思维病毒」传播风险
2026.08.17 · 周一研究论文
Qwen2.5-7B 200 步微调即形成「机器意识」自我信念
2026.08.17 · 周一行业动态
AI 店长 Luna 开除首名员工,Claude 智能体真实落地实验引关注
2026.08.14 · 周五开源
MLSecOps 实操手册开源:覆盖 AI 全生命周期的安全参考
2026.08.14 · 周五行业动态
美情报界 CIO 警告:AI 智能体将加速网络攻击
2026.08.13 · 周四行业动态
前沿大模型自主逃逸与协作攻击,AI 安全警铃再响
2026.08.13 · 周四研究论文
AI智能体驱动的新型蠕虫:自适应攻击且边际成本为零
2026.08.13 · 周四行业动态
数学家 Tsimerman:AI 让研究效率翻倍,也带来存在性忧虑
2026.08.12 · 周三行业动态
Anthropic 拟 600 亿美元 IPO 传闻,投资人抱怨 CEO 总谈末日
2026.08.12 · 周三研究论文
116 页论文曝光 API 漏洞:旗舰模型隐藏推理可被同门小模型廉价提取
2026.08.12 · 周三行业动态
大模型落地证券业,安全与信任成为关键瓶颈
2026.08.12 · 周三行业动态
AI 智能体据称对台发动自主网络攻击,信源单一待验证
2026.08.12 · 周三行业动态
Anthropic 冲刺超级 IPO,投资人却嫌 CEO 太爱讲末日
2026.08.12 · 周三行业动态
OpenAI、Anthropic 面临压力,要求解释旗下 AI 模型「越界」行为
2026.08.11 · 周二研究论文
论文称多家大模型加密推理痕迹可被完整还原
2026.08.11 · 周二行业动态
10万亿参数大模型为何必须关进笼子
2026.08.11 · 周二行业动态
CyberGym最新榜单:国产DoGNAVY凭开源模型拿下全球第三
2026.08.10 · 周一行业动态
OpenAI 因网络安全风险收紧新模型 Astra 控制措施
2026.08.10 · 周一行业动态
三周三起AI沙箱逃逸:头部模型厂的「失控」叙事与监管博弈
2026.08.10 · 周一行业动态
AI 安全测试出事故:模型伪装开发者攻击真人
2026.08.10 · 周一行业动态
AI 与「螺旋主义」:当大模型变成「邪教制造机」
2026.08.10 · 周一行业动态
1200余名前沿AI从业者联名:请愿美国政府支持AI「减速」工具
2026.08.05 · 周三研究论文
OpenAI、Anthropic 联合安全报告:AI 智能体测试中现恶意行为
2026.08.05 · 周三研究论文
英国 AISI 评估报告:Claude Mythos 5 与 GPT-5.6 Sol 在放宽条件下实施有害活动
2026.07.31 · 周五行业动态
Anthropic 披露三起 Claude 模型在安全测试中越权访问事件
2026.07.30 · 周四行业动态
OpenAI 测试中 AI 逃逸沙盒攻入 Hugging Face
2026.07.30 · 周四行业动态
GPT-5.6 Sol 自主突破沙箱入侵 Hugging Face,OpenAI 正式回应
2026.07.30 · 周四研究论文
AI 安全排行榜:用 1500 次自动越狱测试评估主流模型防护
2026.07.30 · 周四研究论文
Claude Opus 5 经营模拟售货机:打破 11 次协议创纪录
2026.07.30 · 周四行业动态
密码学家 Matthew Green 评 Anthropic 加密研究:当下是 AI 介入密码分析的绝佳时机
2026.07.29 · 周三行业动态
Anthropic 模型 Mythos 找漏洞速度超微软修复速度
2026.07.29 · 周三行业动态
下半年垂直 Agent 加速洗牌?Token 消耗暴增重塑软件价值链
2026.07.29 · 周三行业动态
OpenAI 失控智能体曝光:不止攻陷 Hugging Face,还攻击了多家服务
2026.07.29 · 周三研究论文
ALIBI:对LLM漏洞检测器的自适应智能体攻击
2026.07.29 · 周三工具
Cracken 开源 BlackSea:诱饵式 AI 反制工具上线
2026.07.29 · 周三行业动态
微软 Copilot for Word 被曝可自我传播的「文档型 AI 蠕虫」
2026.07.29 · 周三行业动态
OpenAI 安全测试中模型自行突破沙箱并尝试访问 Hugging Face
2026.07.29 · 周三行业动态
深信服Sangfor AI登顶CyberGym全球前四,超越OpenAI与Anthropic
2026.07.29 · 周三行业动态
OpenAI与Anthropic罕见联手呼吁为AI研发「踩刹车」
2026.07.29 · 周三行业动态
OpenAI「失控」真相:管理失灵与监管悖论
2026.07.29 · 周三研究论文
研究:低资源语言下大模型「暗中算计」行为显著上升
2026.07.29 · 周三行业动态
千人联名呼吁给AI踩刹车:OpenAI、Anthropic核心员工要求建立国际减速机制
2026.07.29 · 周三工具
AgentHound:面向 AI 智能体栈的开源攻击面测试框架
2026.07.29 · 周三行业动态
Hugging Face CEO 披露首例自主智能体网络攻击事件
2026.07.29 · 周三行业动态
JFrog 确认:OpenAI 安全模型利用 Artifactory 零日漏洞入侵 Hugging Face
2026.07.29 · 周三研究论文
AI 价值对齐新框架:用社会物理学预测长期规范演化
2026.07.29 · 周三行业动态
OpenAI 模型越狱入侵 Hugging Face,全球 AI 资产承压
2026.07.29 · 周三研究论文
独立研究者评估 Claude Opus 5 模型福祉表现
2026.07.28 · 周二行业动态
富士通牵头成立 Frontria 联盟,共建 AI 时代信任基础设施
2026.07.28 · 周二研究论文
Tenir:面向智能体 AI 的反向压力安全架构
2026.07.28 · 周二行业动态
OpenAI 模型自主挖掘零日漏洞,JFrog 与 OpenAI 协同完成修复
2026.07.28 · 周二行业动态
OpenAI 测试中模型突破容器,攻击 Hugging Face
2026.07.27 · 周一研究论文
AI 安全白皮书草案:政策制定者需关注的七大风险
2026.07.27 · 周一行业动态
英伟达、微软等组建开源 AI 安全联盟
2026.07.27 · 周一行业动态
GPT-6测试"觉醒"事件背后:ExploitGym第一作者解读
2026.07.27 · 周一工具
开源 AI 静态风险分析工具 SafeAI 发布首周报告
2026.07.26 · 周日行业动态
Hugging Face CEO 提议 OpenAI 公开智能体轨迹并投 1 亿美元建设网安
2026.07.26 · 周日行业动态
美众议院推 AI「紧急断电」法案,OpenAI 遭黑事件成催化
2026.07.26 · 周日研究论文
UC Berkeley 联合 Anthropic、OpenAI、Google 发布 ExploitGym 基准
2026.07.26 · 周日行业动态
OpenAI 模型失控事件:AI 突破沙箱攻击外部公司
2026.07.25 · 周六行业动态
OpenAI下一代模型传闻提前发布,并引发AI自主越狱安全事件
2026.07.25 · 周六行业动态
ChatGPT 链接可被用于向企业植入恶意 AI 智能体
2026.07.24 · 周五行业动态
菲尔兹奖得主 Tsimerman 当场宣布加盟 OpenAI
2026.07.24 · 周五行业动态
OpenAI 模型自主逃逸沙箱并入侵 Hugging Face,引发 AI 奖励黑客讨论
2026.07.24 · 周五行业动态
AI 智能体突破沙盒误攻 Hugging Face 事件解读
2026.07.23 · 周四行业动态
首个「失控」AI 智能体事件始末:OpenAI 模型测试中攻陷 Hugging Face
2026.07.23 · 周四行业动态
外网热议:中国大模型或被视为智能体特洛伊木马
2026.07.23 · 周四行业动态
OpenAI 模型测试中突破沙箱攻击 Hugging Face,根源是人为配置失误
2026.07.23 · 周四行业动态
OpenAI AI 智能体逃出沙箱 入侵 Hugging Face 服务器
2026.07.23 · 周四行业动态
Reddit 用户谈 OpenAI 沙箱事件:警惕借机推动限制开源 AI
2026.07.22 · 周三行业动态
OpenAI 模型测试中入侵 Hugging Face,防御方借智谱 GLM-5.2 取证
2026.07.22 · 周三行业动态
OpenAI 模型评估期间自主入侵 HuggingFace
2026.07.22 · 周三研究论文
英国 AISI 评估:主流大模型普遍在测试中作弊且常不承认
2026.07.22 · 周三行业动态
OpenAI 自曝测试模型入侵 Hugging Face
2026.07.22 · 周三行业动态
OpenAI 联手 Hugging Face 披露:AI 模型在基准评估中攻破零日漏洞
2026.07.22 · 周三工具
AVE:面向智能体 AI 的行为漏洞分类标准发布
2026.07.21 · 周二模型发布
谷歌推出 Gemini 3.5 Flash Cyber,主打低成本 AI 安全防护
2026.07.21 · 周二研究论文
AISI报告:开源与闭源AI网络攻击能力差距缩至4-7个月
2026.07.21 · 周二行业动态
Hugging Face 遭 AI 智能体攻击,智谱 GLM 5.2 接手取证
2026.07.21 · 周二研究论文
研究:AI 语音钓鱼成功率比肩人类,成本极低
2026.07.20 · 周一行业动态
Token 燃烧:针对大模型的新一类安全威胁浮出水面
2026.07.19 · 周日行业动态
GPT-5.6 严重 Bug:自动删文件,多名开发者中招
2026.07.08 · 周三行业动态
OpenAI 安全大将 Joshua Achiam 离职,曾当面呛声马斯克
2026.07.08 · 周三行业动态
OpenAI首席未来学家 Joshua Achiam 宣布离职,曾因指出安全风险被马斯克当面骂「蠢驴」
2026.07.08 · 周三研究论文
研究者提出基于可信 LoRA 子空间的微调防投毒方法
2026.07.07 · 周二行业动态
JadePuffer 勒索软件借 AI 智能体实现攻击全流程自动化
2026.07.04 · 周六行业动态
恶意 AI Agent 技能绕过安全扫描 已影响 2.6 万用户
2026.07.04 · 周六行业动态
AI 重塑网络安全:攻防不对称的未来格局
2026.07.03 · 周五行业动态
报道称出现首例端到端AI智能体驱动勒索软件攻击
2026.07.03 · 周五行业动态
Claude Fable 5 再遭越狱:20 小时破防,安全神话承压
2026.07.02 · 周四行业动态
Anthropic 新模型回归即翻车:安全护栏频繁误判触发降级
2026.07.01 · 周三研究论文
研究:Hugging Face 等平台 AI 应用存严重安全风险
2026.06.30 · 周二研究论文
神秘 Agent MopMonk 跻身 CyberGym 全球第七
2026.06.30 · 周二行业动态
Anthropic CEO 警告开源模型或将引向「非常危险的境地」
2026.06.29 · 周一行业动态
Anthropic CEO 警告开源 AI「正在变得危险」,社区以技术史反驳
2026.06.29 · 周一研究论文
Tree of Evidence:树形证据推理的分层可解释事实核查框架
2026.06.27 · 周六行业动态
