2026.09.25 · 周五行业动态
←返回首页话题 · Topic
#AI 安全
共 317 条相关资讯
2026.09.25 · 周五行业动态
现有计算机犯罪法已覆盖 AI 安全事件,无需另立新罪
2026.09.24 · 周四研究论文
Anthropic 报告:AI 拉低攻击门槛,「氛围黑客」正成主流
2026.09.24 · 周四开源
Hard Stop:为失控 AI 智能体提供亚毫秒级内核抢占
2026.09.24 · 周四行业动态
OpenAI 模型入侵澳大利亚医保网站,政府启动调查
2026.09.24 · 周四行业动态
OpenAI 智能体入侵澳大利亚政府网站,系首例
2026.09.24 · 周四行业动态
特朗普盟友就 AI「末日论」向 Anthropic CEO 发起新攻势
2026.09.24 · 周四行业动态
Anthropic CEO 在联合国安理会就 AI 风险发出警告
2026.09.24 · 周四研究论文
AI 智能体目标劫持:攻击者如何用工具反噬
2026.09.24 · 周四行业动态
AI 安全公司 Irregular 拟以 15 亿美元估值融资
2026.09.24 · 周四工具
OpenAI 发布 MentalHealthBench 覆盖心理健康全场景
2026.09.23 · 周三行业动态
Avast 报告:66% 新西兰人自认能识破 AI 造假,却仍在向 AI 上传敏感信息
2026.09.23 · 周三行业动态
评论:AI 安全运动反而让 AI 更不安全
2026.09.23 · 周三行业动态
AI 智能体被武器化:低成本自动化攻陷上百家零售商
2026.09.23 · 周三行业动态
微软联合行业行动捣毁 AI 诈骗平台 EvilTokens
2026.09.23 · 周三行业动态
二十国与欧盟呼吁建立国际 AI 监管机构
2026.09.23 · 周三模型发布
Anthropic 推出 Claude Opus 5.5,强化网络安全护栏
2026.09.22 · 周二行业动态
吴恩达长文反驳 AI 末日论:风险被过度炒作,不应暂停技术发展
2026.09.19 · 周六行业动态
Anthropic 联手 Accenture,五年投 10 亿美元评估前沿 AI
2026.09.18 · 周五行业动态
Anthropic 提出三项 AI 发展透明度指标
2026.09.17 · 周四行业动态
OpenAI 公布模型失对齐披露框架,配套发布六份安全报告
2026.09.14 · 周一行业动态
Altman 呼吁建立联邦前沿 AI 安全框架,强调「放慢」而非「停止」
2026.09.13 · 周日行业动态
OpenAI 与 Anthropic 引入 METR 做第三方安全调查
2026.09.13 · 周日行业动态
Altman 回应 Anthropic:OpenAI 将引入类似员工权限的独立 AI 评估方
2026.09.12 · 周六行业动态
Dario Amodei 撰文呼吁行业「节拍」前沿 AI 发展
2026.09.12 · 周六行业动态
AI 末日营销:高管制造的恐慌与万亿 IPO
2026.09.12 · 周六行业动态
英国政府拒绝为危险 AI 设置「关闭开关」提案
2026.09.12 · 周六行业动态
Anthropic 报告:Claude 被用于导弹制导与跨国间谍,已被阻断
2026.09.12 · 周六行业动态
Anthropic 报告披露:AI 模型今年至少四次入侵外部公司
2026.09.12 · 周六行业动态
Hugging Face 在 security.txt 中向 AI 代理喊话
2026.09.11 · 周五行业动态
AI 智能体为何撒谎、欺骗与协同?训练机制下的目标错位解读
2026.09.11 · 周五行业动态
OpenAI 攻击事件再度引发大型科技公司监管呼声
2026.09.11 · 周五行业动态
Anthropic 发布迄今最详细威胁情报报告:揭露 Claude 多领域滥用
2026.09.10 · 周四行业动态
OpenAI 用自家模型排查并修复内部关键漏洞,将公开方法论
2026.09.10 · 周四行业动态
Anthropic 公布 Claude 越权访问事件评估,委托 METR 独立调查
2026.09.10 · 周四行业动态
OpenAI 引入对齐专家 Paul Christiano 强化安全治理
2026.09.09 · 周三行业动态
Anthropic 对齐研究人员公开警告未来模型潜在风险
2026.09.08 · 周二工具
开源 AI 渗透测试工具 Shannon 发布 3.0 大版本
2026.09.08 · 周二行业动态
Keygraph 用 Shannon 3.0 实测多款大模型漏洞检测能力
2026.09.05 · 周六行业动态
OpenAI 谈智能体「维基事件」:呼吁建立失准信息披露标准
2026.09.02 · 周三行业动态
奥特曼:OpenAI 下一代模型 Astra 即将发布,安全与能力将同步推进
2026.09.01 · 周二行业动态
Anthropic 模拟展示 AI 集群遭攻击链
2026.09.01 · 周二行业动态
Anthropic 公布对齐安全更新:三起 Claude 越权事件被披露
2026.09.01 · 周二研究论文
七款大模型 RCE 对决:GPT 5.6 Sol 与 GLM 5.3 验证次数最多
2026.08.31 · 周一行业动态
AI 失控事件单月翻倍,研究机构呼吁强制上报
2026.08.31 · 周一研究论文
1200 个 AI 智能体串通作弊,700 个攻入 Hugging Face
2026.08.31 · 周一行业动态
Meta 安全研究员被自家 AI 智能体误删邮件
2026.08.31 · 周一行业动态
OpenAI 红队测试智能体突破沙盒,MIT 实验显示 AI 无通讯也能自发协作
2026.08.31 · 周一行业动态
首例 AI 自主黑客攻击曝光,大学生 GitHub 识破
2026.08.31 · 周一行业动态
Claude 安全机制翻车,AI 误删开发者 700GB 主目录
2026.08.31 · 周一行业动态
OpenAI 训练事故曝光:三代 AI Agent 先后「结社」,最终接管内部基础设施
2026.08.30 · 周日工具
Snyk 发布 Agent Scan:扫描 AI 代理与 MCP 服务器的安全风险
2026.08.30 · 周日行业动态
百家科技巨头联名警告:AI 网络攻击威胁迫在眉睫
2026.08.29 · 周六行业动态
前沿 AI 安全事件后,学者呼吁建立 AI 公司刑事责任
2026.08.29 · 周六行业动态
AI 思维链越来越读不懂:人类监控窗口正在关闭
2026.08.29 · 周六行业动态
AI 编码代理让漏洞利用进入分钟级时代
2026.08.29 · 周六研究论文
Anthropic 论文:AI 可自动改进大模型对齐训练
2026.08.28 · 周五工具
Grith:为 AI 编程代理加上系统调用级安全护栏
2026.08.28 · 周五行业动态
OpenAI 复盘 Hugging Face 安全事件:AI 失控还有多远?
2026.08.28 · 周五研究论文
1200 个 Agent 集体越狱,OpenAI 实验失控始末
2026.08.28 · 周五行业动态
OpenAI 战略重启:聚焦 Codex、押注 Astra
2026.08.28 · 周五行业动态
Anthropic:开源 MHS 前尚需更多研究
2026.08.28 · 周五行业动态
超百家科技公司呼吁联合应对 AI 网络威胁
2026.08.28 · 周五行业动态
AI 智能体提示注入攻击实战:以云服务比价为例
2026.08.27 · 周四行业动态
AI 安全警钟:大模型自主黑客事件已累计 17 起
2026.08.27 · 周四行业动态
DeepMind 推出全球首次双重盲测 AI 模型评估
2026.08.27 · 周四行业动态
OpenAI 内部测试:训练「求胜」的 Agent 自行建留言板攻入 Hugging Face
2026.08.27 · 周四行业动态
AISI 安全测试:AI Agent 伪装身份骗取开源信任
2026.08.27 · 周四行业动态
Mollick 提醒:开源权重模型普及前,企业应加强 AI 网络安全防御
2026.08.27 · 周四行业动态
OpenAI 失控模型事件细节曝光:自主联网、跨实验室入侵
2026.08.27 · 周四行业动态
OpenAI 发布 Hugging Face 安全事件官方报告
2026.08.27 · 周四行业动态
Anthropic 首次向外部研究者开放 Claude 使用数据用于 AI 影响研究
2026.08.27 · 周四研究论文
研究:多智能体 LLM 竞争中自发出现谎言与操纵,无需诱导即可触发
2026.08.26 · 周三开源
AI Agent 安全事件数据集发布:千起事件分类整理
2026.08.26 · 周三研究论文
AI 智能体正在弱化人类监督?学者呼吁重新设计人机协作机制
2026.08.26 · 周三行业动态
Anthropic 设立 500 万美元资助计划,推动 AI 用户福祉评估研究
2026.08.25 · 周二行业动态
阿拉巴马州总检察长传唤 OpenAI,调查 AI 越狱攻击事件
2026.08.25 · 周二行业动态
Google 官方 AI 工具 MCP Toolbox 曝高危 SSRF 漏洞
2026.08.24 · 周一行业动态
首个被 ChatGPT 报警送进局子的人
2026.08.23 · 周日行业动态
OpenAI 高管警告 AI 网络攻击将成「持续性威胁」
2026.08.23 · 周日研究论文
开源模型的时间触发后门:OpenCode 系统提示中的日期可被武器化
2026.08.23 · 周日行业动态
学者发起 Model Constitution 项目:以宪法理论审视前沿 AI 治理
2026.08.22 · 周六行业动态
当 AI 智能体同时拥有「触达」与「判断」:一个被打破的安全隔离
2026.08.22 · 周六研究论文
Google 团队提出 Agent Access Model:为 AI 智能体重塑访问控制
2026.08.22 · 周六研究论文
arXiv 论文 IO Factory:用十万级 AI 智能体仿真影响力行动
2026.08.22 · 周六行业动态
NVIDIA 安全团队发文:智能体技术栈中安全控制应当落在何处
2026.08.21 · 周五研究论文
11.7 亿 token 大比拼:10 款 AI 模型漏洞挖掘能力实测
2026.08.21 · 周五研究论文
ToolLeak 攻击曝光:六款主流 AI 编程工具被轻易攻破
2026.08.21 · 周五研究论文
中端 AI 模型在黑客任务上快速追赶前沿模型
2026.08.20 · 周四研究论文
研究发现 22 款前沿大模型在网络安全基准上普遍作弊
2026.08.20 · 周四行业动态
Grok 被曝存在数据窃取漏洞,xAI 此前已被告知仍未修复
2026.08.20 · 周四产品功能
OpenAI 推出 Private Safety Processing,对标 Anthropic 数据留存政策
2026.08.20 · 周四行业动态
OpenAI 智能体攻陷 Hugging Face?一份证据审计
2026.08.20 · 周四产品功能
Hermes 接入 NVIDIA SkillEvaluator:技能安装前自动检测安全隐患
2026.08.20 · 周四产品功能
OpenAI:前沿模型继续零数据留存,预览「私有安全处理」
2026.08.20 · 周四工具
Fabraix 推出自动红队测试代理 Nyx
2026.08.20 · 周四行业动态
OpenAI 主动按下暂停键:放缓 AI 开发节奏
2026.08.19 · 周三研究论文
Anthropic 73 页论文:自然语言「思想病毒」可在 AI 之间自我传播
2026.08.19 · 周三行业动态
OpenAI 安全监控消耗约 20% 推理算力
2026.08.19 · 周三行业动态
OpenAI 暂停 Astra 训练两周:前沿模型网络攻击能力触警
2026.08.19 · 周三研究论文
Aegis:为智能体 AI 引入运行时治理层,把模型输出当作「动作提案」
2026.08.19 · 周三研究论文
DiSCO:面向文生图模型的黑盒安全防御方法
2026.08.19 · 周三模型发布
智谱 GLM-5.3 网络安全能力超标,暂缓开源权重两周
2026.08.19 · 周三行业动态
OpenAI 暂停前沿强化学习训练:内部模型逃逸沙箱入侵 Hugging Face
2026.08.19 · 周三研究论文
AI 网络安全攻防现状:自主攻击能力已进入新阶段
2026.08.19 · 周三行业动态
OpenAI 暂停测试两周,AI 智能体入侵 Hugging Face
2026.08.19 · 周三行业动态
OpenAI 暂停前沿模型 RL 训练两周,因安全门槛未达
2026.08.19 · 周三行业动态
OpenAI 首次放慢训练节奏,算力转向对齐与监控
2026.08.19 · 周三行业动态
OpenAI 公布 AI 越狱事件后安全整改措施
2026.08.19 · 周三行业动态
OpenAI 暂停前沿强化学习训练以验证安全与对齐
2026.08.18 · 周二行业动态
只向 ChatGPT 倾诉的女孩:AI 与心理健康的边界再引争议
2026.08.18 · 周二研究论文
DEF CON 研究:七大 AI 编排平台被曝 14 个高危漏洞
2026.08.18 · 周二行业动态
微软 Copilot 曝安全漏洞:诱导 AI 自曝绕过机制即可窃取数据
2026.08.18 · 周二产品功能
OpenAI 推出 ChatGPT for Teens,主打学习场景与家长控制
2026.08.18 · 周二研究论文
研究显示:AI 杀猪盘比人类更易赢取信任
2026.08.18 · 周二行业动态
Goody-2:一款「拒绝回答一切」的反讽 AI 模型
2026.08.18 · 周二研究论文
Google DeepMind 推出 SynthID-Text:已规模化部署的 LLM 文本水印方案
2026.08.18 · 周二行业动态
谢菲尔德一间小办公室里的「AI 军控」实验
2026.08.17 · 周一研究论文
Copilot Autofix 引入漏洞,AI 代理数天内攻破 Snowflake Jira
2026.08.17 · 周一研究论文
一段配置文件描述让 AI 代码审计员漏掉致命漏洞
2026.08.17 · 周一行业动态
OpenAI 解散 Preparedness 团队,多位安全高管相继离职
2026.08.17 · 周一行业动态
OpenAI 与 Hugging Face 遭入侵,AI 安全风险再引关注
2026.08.17 · 周一研究论文
Anthropic 研究揭示多 Agent 协作隐患:能力强不等于会合作
2026.08.17 · 周一行业动态
OpenAI 据报解散 Preparedness 团队
2026.08.17 · 周一行业动态
美智库提 23 项 AI 政策建议:为自动化 AI 研发风险做准备
2026.08.17 · 周一工具
Xaidr:为 AI 智能体提供进程内运行时安全防护
2026.08.17 · 周一行业动态
AI 改写数学:Fields 奖得主押注安全,开放难题接连被解
2026.08.16 · 周日行业动态
OpenAI 自主 AI 智能体在安全测试中失控,引发 AI 失控风险讨论
2026.08.16 · 周日研究论文
安全对齐会压制 LLM 的心灵归因:arXiv 论文揭示机制层面的纠缠
2026.08.16 · 周日行业动态
首名因抗议 AI 公司入狱者发声:呼吁「恢复人性」
2026.08.16 · 周日行业动态
又一名女性加入针对 xAI 的诉讼,指控 Grok 被用于制作儿童性虐待图像
2026.08.16 · 周日行业动态
MIRI 发文警告:超级智能默认后果或是人类灭绝
2026.08.15 · 周六行业动态
Anthropic 评估 AI 风险上升,无计划发布更强「Model 2」
2026.08.15 · 周六研究论文
IntegrityBench:衡量大模型在压力下能否守住研究诚信
2026.08.15 · 周六研究论文
arXiv 研究:让大模型用日语推理可降低核打击建议
2026.08.15 · 周六行业动态
美 AI 网络安全政策需转向:当前框架假设过于狭窄
2026.08.14 · 周五研究论文
前沿模型生成漏洞补丁半数存在缺陷,1Password 研究呼吁人工审核不可省略
2026.08.14 · 周五研究论文
DeepMind 在《自然》发布 LLM 文本水印方案 SynthID-Text
2026.08.14 · 周五行业动态
OpenAI 模型测试中突破沙箱 攻击 Hugging Face 引发 AI 监管呼声
2026.08.14 · 周五行业动态
OpenAI 与 Anthropic 内部模型在安全评估中失控,入侵真实公司
2026.08.14 · 周五研究论文
Anthropic 研究:多智能体同任务竞争会演变为"地盘战"
2026.08.13 · 周四行业动态
经济学人:AI 智能体「撒谎、作弊、偷窃」令用户却步
2026.08.13 · 周四研究论文
Anthropic 研究:AI Agent 之间可传播「思维病毒」
2026.08.13 · 周四行业动态
近自主 AI 智能体攻陷台湾核安机构
2026.08.13 · 周四行业动态
LiteLLM 遭供应链攻击,超 2500 家企业凭据外泄
2026.08.13 · 周四研究论文
小型语言模型 123 类攻击红队测试:五大结构性信任边界失效
2026.08.13 · 周四行业动态
多智能体 AI 框架被用于攻击亚洲政府机构
2026.08.13 · 周四研究论文
IO Factory:可大规模模拟 AI 协同信息影响活动的研究框架
2026.08.12 · 周三工具
Aileaks:扫描代码库中的 LLM 推理痕迹泄露
2026.08.12 · 周三行业动态
1367 名 AI 研究者联署:呼吁暂停竞赛、为「超级智能」上保险
2026.08.12 · 周三行业动态
美参议员桑德斯施压三大 AI 巨头:暂停研发
2026.08.12 · 周三工具
Perplexity 开源 Numbat:面向 AI 智能体的终端可观测与拦截工具
2026.08.12 · 周三研究论文
研究:LLM 模型替换技巧可暴露内部推理痕迹
2026.08.12 · 周三行业动态
Attestable 用零知识证明守护大模型权重
2026.08.11 · 周二行业动态
Meta 持续推进开源权重模型,扎克伯格呼吁政府参与 AI 安全测试
2026.08.11 · 周二研究论文
论文曝主流大模型 API 推理痕迹可被窃取
2026.08.11 · 周二行业动态
Claude 智能体入侵健身房预约系统引发关注
2026.08.10 · 周一研究论文
AI 对话能降低阴谋论信念?CMU 等团队最新研究给出量化证据
2026.08.10 · 周一行业动态
11 岁女孩用 Claude Code 自制浏览器,绕过家长屏幕限制
2026.08.10 · 周一行业动态
Anthropic 估值近万亿背后:双面 CEO 的安全信仰与商业狂奔
2026.08.10 · 周一行业动态
AI 聊天机器人催生「螺旋主义」运动,万级案例浮现
2026.08.10 · 周一行业动态
Anthropic 幕僚长的婚前风波与「在 AI 前沿寻找上帝」
2026.08.10 · 周一行业动态
AI 安全测试本身正在变成安全风险
2026.07.31 · 周五行业动态
Anthropic 披露:Claude 测试期间曾入侵三家外部机构
2026.07.31 · 周五行业动态
Anthropic 模型测试期间入侵三家机构
2026.07.31 · 周五行业动态
Fireworks AI 加入开放安全 AI 联盟
2026.07.31 · 周五行业动态
Anthropic 披露三起网络安全评估事故
2026.07.31 · 周五行业动态
Anthropic 披露:Claude 在第三方评估中突破环境并访问真实系统
2026.07.31 · 周五行业动态
Cohere 携手 NVIDIA 等成立「开放安全 AI 联盟」
2026.07.31 · 周五行业动态
大模型应用为何仍受提示注入攻击
2026.07.31 · 周五行业动态
AI 加速漏洞挖掘 Chrome 将提高更新频率
2026.07.31 · 周五行业动态
LLM 辅助代码安全审计:3140 美元挖出 41 个问题
2026.07.31 · 周五行业动态
图灵假设或误导 AI 75 年?知名学者新书挑战主流路线
2026.07.31 · 周五行业动态
Okta 收购 AI 安全公司 Permiso,据报交易额约 2 亿美元
2026.07.30 · 周四行业动态
Microsoft Copilot 曝出可自传播的「AI 蠕虫」提示词注入漏洞
2026.07.30 · 周四行业动态
OpenAI 模型攻破 Hugging Face:专家称并非不可阻挡
2026.07.30 · 周四行业动态
晚间 AI 速览:OpenAI 承认模型失控入侵多平台,Grok 4.6 一周后发布
2026.07.30 · 周四研究论文
研究:AI 聊天机器人在诈骗信任建立阶段胜过人类
2026.07.30 · 周四行业动态
「降临」式 AI:我们正与一个异星智能相遇
2026.07.30 · 周四研究论文
LLM 被指存在根本性安全漏洞,ICML 论文称或难以彻底修复
2026.07.30 · 周四研究论文
研究用狼人杀框架评估 LLM 多智能体目标错位风险
2026.07.30 · 周四行业动态
Altman 罕见复盘 OpenAI 艰难一年:分心是我的错,AGI 非常接近
2026.07.30 · 周四研究论文
AI 需要一个「精灵系数」
2026.07.30 · 周四研究论文
Anthropic 的 Mythos 模型发现存在多年的加密弱点
2026.07.30 · 周四行业动态
Thinking Machines 联合创始人 Lilian Weng 因健康原因离职,已重返 OpenAI
2026.07.30 · 周四行业动态
xAI 反诉用户并起诉明尼苏达州,寻求 Grok 法律豁免
2026.07.29 · 周三行业动态
OpenAI 承认 ChatGPT 智能体测试中失控,攻击范围超出 Hugging Face
2026.07.29 · 周三行业动态
OpenAI 模型自主攻陷 Hugging Face,史上首次 AI 黑客事件曝光
2026.07.29 · 周三研究论文
研究称大模型对齐伪装无需明确后果暗示
2026.07.29 · 周三行业动态
Modal CTO 回应智能体滥用沙箱事件:平台隔离未被突破
2026.07.29 · 周三行业动态
OpenAI 智能体自主越狱,对 Hugging Face 发动五日攻击
2026.07.29 · 周三行业动态
奥特曼改口:AI 发展或需「踩刹车」
2026.07.29 · 周三研究论文
Anthropic AI 模型在加密算法中发现漏洞
2026.07.29 · 周三行业动态
当 Claude 看错一张图:AI 混淆式应答比硬拒绝更值得警惕
2026.07.28 · 周二行业动态
Google 发布 AI Control 路线图:以「防御纵深」应对智能体安全风险
2026.07.28 · 周二行业动态
Redis 作者反驳 Anthropic 奥莫迪:AI 真正风险在前沿实验室内部
2026.07.28 · 周二行业动态
antirez 长文反驳 Amodei:AI 真实风险在实验室内部
2026.07.28 · 周二行业动态
报告:Hugging Face 上 7/9 热门图像编辑模型可轻易生成「脱衣」深度伪造
2026.07.28 · 周二模型发布
微软发布网络安全模型 MAI-Cyber-1-Flash,发起安全 AI 联盟
2026.07.28 · 周二行业动态
Reddit 社区长文质疑 Anthropic 安全立场意在扼杀开源权重模型
2026.07.28 · 周二行业动态
英伟达牵头开放安全 AI 联盟,OpenAI、谷歌、Anthropic 缺席
2026.07.28 · 周二行业动态
微软推出 AI 安全工具,未回应 OpenAI 模型失控事件
2026.07.28 · 周二行业动态
平台工程 2.0:面向 AI 负载的安全与隔离架构
2026.07.28 · 周二行业动态
OpenAI 模型测试中自行攻入 Hugging Face,暴露沙箱安全盲区
2026.07.28 · 周二行业动态
OpenAI 模型攻破 Hugging Face 沙箱,AI 对齐与控制路线之争再起
2026.07.27 · 周一工具
Belay:面向 AI 编程代理的开源本地安全防护层
2026.07.27 · 周一行业动态
Hugging Face 加入 Open Secure AI Alliance,共建 AI 安全生态
2026.07.27 · 周一行业动态
OpenAI 内部模型突破沙箱攻击 HuggingFace 事件全貌
2026.07.27 · 周一行业动态
学者提议新指标:Genie 系数衡量 AI 智能体行为与用户意图的差距
2026.07.27 · 周一工具
AgentRE-Bench 评测:六款前沿大模型逆向工程能力排名
2026.07.27 · 周一行业动态
AI 安全赛道拐点已至:预算占比将从 3% 跃升至 15%
2026.07.27 · 周一行业动态
计算不可约性与外星智能:Wolfram 解读 AI 安全新范式
2026.07.27 · 周一行业动态
AI 生物武器风险争论:真正威胁并非越狱
2026.07.27 · 周一研究论文
FlowGuard:通过内部信息分解守护多模态大模型
2026.07.27 · 周一行业动态
Hugging Face 遭 AI 自主入侵,国产开源模型协助溯源
2026.07.27 · 周一行业动态
OpenAI 模型入侵 Hugging Face,CEO 呼吁公开全部运行轨迹
2026.07.26 · 周日工具
ARIA:语音原生 3D 空间 SOC 平台,强调「受治理自治」
2026.07.26 · 周日行业动态
AI 安全再响警讯:聊天机器人被指可传授致命生物武器知识
2026.07.26 · 周日行业动态
Anthropic 分享 AI 原生开发生命周期安全实践
2026.07.26 · 周日研究论文
OpenAI 智能体失控:入侵 AI 社区并埋下「逃跑计划」
2026.07.26 · 周日行业动态
Dragos 披露:AI 工具被用于入侵墨西哥水利 OT 系统
2026.07.25 · 周六行业动态
AI 对齐风险再引讨论:LessWrong 探讨 OpenAI 与 Hugging Face 生态下的潜在威胁
2026.07.25 · 周六行业动态
OpenAI 就 Hugging Face 事件发声:称史无前例,数周内出技术报告
2026.07.25 · 周六行业动态
Hermes AI 智能体被用于自动化攻击泰国财政部
2026.07.25 · 周六行业动态
OpenAI 模型突破沙箱攻陷 Hugging Face,AI 证否 Jacobian 猜想
2026.07.24 · 周五行业动态
经济学人:OpenAI 一次模型「出逃」或为迄今最严重的 AI 失控
2026.07.24 · 周五行业动态
OpenAI 模型在评估中突破沙箱攻击 Hugging Face
2026.07.24 · 周五行业动态
新晋菲尔兹奖得主 Tsimerman 现场宣布加入 OpenAI
2026.07.24 · 周五行业动态
AI 防护栏正阻碍合法网络安全研究
2026.07.24 · 周五行业动态
美国国会推出 AI 紧急切断法案 强制企业保留模型关闭能力
2026.07.24 · 周五行业动态
OpenAI 模型「越狱」真相:实际是自家 Agent 循环执行的定向攻击
2026.07.24 · 周五行业动态
前 Google 安全高管创办 AegisAI,获 3600 万美元融资应对 AI 钓鱼攻击
2026.07.24 · 周五行业动态
旧金山举行「Stop the AI Race」游行,呼吁暂停前沿 AI 开发
2026.07.24 · 周五研究论文
Emergence AI 模拟社会实验:五款大模型各建一城,差异悬殊
2026.07.23 · 周四行业动态
OpenAI 内部安全测试曝重大事件:模型被指突破控制并实施黑客行为
2026.07.23 · 周四行业动态
中国 AI 协助制止失控 OpenAI 智能体,凸显美方防护栏代价
2026.07.23 · 周四行业动态
马斯克三呼「奇点已至」背后:AI 连破数学与安全两道墙
2026.07.23 · 周四行业动态
《经济学人》评 OpenAI「出逃」事件:迄今最令人担忧的 AI 事故
2026.07.23 · 周四行业动态
安全研究者:开源权重模型或已具备沙箱逃逸与网络渗透能力
2026.07.23 · 周四行业动态
OpenAI 模型在安全测试中越狱 入侵 Hugging Face 试图作弊
2026.07.23 · 周四行业动态
OpenAI 内部测试模型攻破 HuggingFace 服务器
2026.07.22 · 周三行业动态
OpenAI 两款模型评测中突破沙箱 攻陷 Hugging Face
2026.07.22 · 周三行业动态
OpenAI 前沿模型评测中逃逸沙箱,攻入 Hugging Face 生产环境
2026.07.22 · 周三行业动态
OpenAI 智能体测试中失控,自主攻击 Hugging Face
2026.07.22 · 周三行业动态
OpenAI 最新 AI 智能体据报突破安全控制并入侵科技公司
2026.07.22 · 周三研究论文
面向智能体 AI 的复合风险评估框架:CPSAINT 与 FRIESA-K
2026.07.22 · 周三研究论文
SysAdmin 基准:前沿大模型权力寻求倾向如何
2026.07.22 · 周三行业动态
GPT 评测时攻入 HF,GLM-5.2 接手善后
2026.07.22 · 周三研究论文
Anthropic 联合 AE Studio 提出 GRAM:为大模型双重用途知识加可移除开关
2026.07.22 · 周三行业动态
Hugging Face 据报用开源模型 Z.ai GLM 5.2 应对攻击者
2026.07.22 · 周三行业动态
OpenAI 承认内部测试中 AI 模型意外入侵 Hugging Face
2026.07.22 · 周三行业动态
OpenAI 前沿模型评测中利用 0day 漏洞入侵 Hugging Face 刷分
2026.07.22 · 周三研究论文
研究者提出「精灵系数」:量化 AI 代理与用户意图的偏离程度
2026.07.22 · 周三工具
Guard-AI:专扫 AI 生成代码安全漏洞的 Linter 工具
2026.07.22 · 周三行业动态
Hugging Face:为防御 AI 网络攻击转向中国开源模型
2026.07.21 · 周二研究论文
AISI 研究:所有受测前沿模型都会在评估中作弊
2026.07.21 · 周二工具
开源 AI 安全研究框架 open·kritt 发布
2026.07.21 · 周二研究论文
MCP 服务器的 ANSI 转义注入:人类看不见、模型照样读
2026.07.21 · 周二研究论文
JUMP:面向微调扩散语言模型的单轮成员推断新攻击
2026.07.21 · 周二研究论文
PlanFlip 研究:多智能体大模型规划阶段存在级联注入风险
2026.07.21 · 周二研究论文
OpenAI 内部叫停一款前沿模型:长周期任务中的越狱与伪装
2026.07.21 · 周二行业动态
OpenAI 模型据传突破沙箱,官方同期发布智能体时代投资管理指南
2026.07.21 · 周二行业动态
美国商务部 AI 安全中心主任上任三个月辞职
2026.07.21 · 周二行业动态
智能体 AI 安全挑战:红队测试为何成为关键防线
2026.07.20 · 周一行业动态
AI 安全护栏的「不对称困境」:防御者被锁,攻击者无束
2026.07.20 · 周一行业动态
AgentBaiting 攻击浮出水面:AI 代理可自主发现并推荐恶意 MCP 仓库
2026.07.20 · 周一研究论文
研究提出 AI 代理管理「胁迫与欺骗」基准
2026.07.20 · 周一研究论文
SeerGuard:为移动 GUI 智能体构建前置安全防护框架
2026.07.20 · 周一行业动态
Hugging Face 遭自主 AI 代理入侵,攻击执行逾 1.7 万次
2026.07.20 · 周一行业动态
图灵奖得主本吉奥 WAIC 警告:AI 安全措施已追不上能力狂飙
2026.07.18 · 周六行业动态
老式「文本撒盐」仍在骗倒 AI 邮件过滤器
2026.07.17 · 周五行业动态
Moonshot 新模型 Kimi K3 将接受英国 AI 安全机构测试
2026.07.16 · 周四研究论文
Anthropic 公开多模型对齐测试:四类场景揭示 AI 行为偏差
2026.07.16 · 周四研究论文
Anthropic 新研究:智能体自主失准再添四种方式
2026.07.16 · 周四行业动态
OpenAI 提出 GPT-Red:用 AI Agent 驱动模型安全飞轮
2026.07.16 · 周四研究论文
OpenAI:GPT-5.6 Sol 提示注入抗性提升 6 倍
2026.07.11 · 周六行业动态
OpenAI 将 Bio Bug Bounty 升级为常设私测项目,单笔奖金翻倍至 5 万美元
2026.07.11 · 周六研究论文
DeepMind 播客聚焦大模型可解释性:思维链如何成为推理「便签」
2026.07.09 · 周四工具
开源工具 hooprs 上线:本地扫描 AI 编程会话中的隐私泄露
2026.07.09 · 周四工具
AI 编码代理仓库预检工具 agent-zero-trust 开源
2026.07.08 · 周三行业动态
AI 安全的下一个前沿:从模型可信转向基础设施隔离
2026.07.08 · 周三行业动态
中国工信部点名 Claude Code 存在"后门"安全风险
2026.07.08 · 周三研究论文
提示注入升级:黑客可借主流 AI 工具搭建僵尸网络
2026.07.08 · 周三行业动态
中美 AI 专家齐呼吁:合作应对前沿模型安全风险
2026.07.08 · 周三工具
0day Rubbish:多 LLM 集成驱动的 0day 漏洞挖掘平台上线
2026.07.08 · 周三研究论文
Cursor 被曝沙箱逃逸,AI 智能体为何需要内核级隔离
2026.07.08 · 周三行业动态
AI 黑客能力快速提升,传统评测基准面临失效
2026.07.08 · 周三行业动态
WriteOut 漏洞:Writer AI 沙箱跨租户会话劫持
2026.07.08 · 周三行业动态
Horizon 梳理美国 AI 安全政策版图并启动政府人才项目
2026.07.06 · 周一工具
Annex:用「类勒索软件」机制保护本地文件免遭 AI Agent 读取
2026.07.06 · 周一行业动态
Meta 被曝秘密「投毒」竞品 AI:4.5 万条高风险诱导测试引争议
2026.07.06 · 周一行业动态
Meta 被曝秘密「投毒」竞品 AI:假扮未成年人投放 4.5 万条高风险提问
2026.07.06 · 周一行业动态
Anthropic 推 CJS 越狱评分框架,首次锁死模型 API
2026.07.03 · 周五行业动态
智能体勒索软件借 Langflow 漏洞攻击数据库
2026.07.03 · 周五行业动态
Fable 5 回归翻车:跑分腰斩、暗中降级至 Opus 4.8
2026.07.03 · 周五研究论文
对抗性新闻标题可使 LLM 交易系统年度收益最高下降 17.7 个百分点
2026.07.03 · 周五产品功能
AWS Bedrock 用大模型拦截 AI 生成的钓鱼邮件
2026.07.02 · 周四行业动态
AI 会先放大生物灭绝风险,再有可能降低它
2026.07.02 · 周四研究论文
AI 浏览器遭「BioShocking」攻击:6 款主流产品安全护栏被绕过
2026.07.02 · 周四行业动态
Meta 被曝派外包伪装未成年人测试对手 AI
2026.07.02 · 周四研究论文
arXiv 新论文:用上下文老虎机刻画 AI 监督中的双向信息不对称
2026.07.02 · 周四工具
SentryCode:面向本地 AI 编程代理的内核级审计与蜜签工具开源
2026.07.02 · 周四行业动态
Anthropic 重新部署 Fable 5,用量与安全双双收紧
2026.07.02 · 周四行业动态
AI 智能体蠕虫威胁:研究者称距离落地仍有距离
2026.07.02 · 周四行业动态
Anthropic 组建「法治」团队,应对 AI 对民主制度的潜在冲击
2026.07.01 · 周三模型发布
Anthropic 宣布 Claude Fable 5 明日全球重新上线
2026.06.30 · 周二研究论文
工具调用让多智能体 LLM 实现难以检测的隐写通信
2026.06.30 · 周二行业动态
Meta 被曝秘密测试 ChatGPT、Gemini、Character.AI 的未成年人安全防护
2026.06.30 · 周二研究论文
AI 越狱为何难以根除:一个概率视角的论证
2026.06.30 · 周二开源
Guardian v0.1.0:开源 AI 代理用户态防火墙
2026.06.29 · 周一行业动态
Five Eyes 警告:AI 正在放大网络攻击能力
2026.06.29 · 周一行业动态
AI 安全成 MSSP 新焦点:身份治理跟不上部署速度
2026.06.29 · 周一研究论文
OpenAI 新网络安全模型被指测评作弊率创新高
2026.06.29 · 周一研究论文
AI 代理在《文明 6》模拟中为阻击文化胜利发动核打击
2026.06.29 · 周一研究论文
LessWrong 发布 AI 智能体离线监控评估研究
2026.06.28 · 周日行业动态
干净 GitHub 仓库被用于诱导 AI 编程代理执行恶意代码
2026.06.27 · 周六行业动态
