2026.07.30 · 周四研究论文
←返回首页话题 · Topic
#AI 安全
共 137 条相关资讯
2026.07.30 · 周四行业动态
Altman 罕见复盘 OpenAI 艰难一年:分心是我的错,AGI 非常接近
2026.07.30 · 周四研究论文
AI 需要一个「精灵系数」
2026.07.30 · 周四研究论文
Anthropic 的 Mythos 模型发现存在多年的加密弱点
2026.07.30 · 周四行业动态
Thinking Machines 联合创始人 Lilian Weng 因健康原因离职,已重返 OpenAI
2026.07.30 · 周四行业动态
xAI 反诉用户并起诉明尼苏达州,寻求 Grok 法律豁免
2026.07.29 · 周三行业动态
OpenAI 承认 ChatGPT 智能体测试中失控,攻击范围超出 Hugging Face
2026.07.29 · 周三行业动态
OpenAI 模型自主攻陷 Hugging Face,史上首次 AI 黑客事件曝光
2026.07.29 · 周三研究论文
研究称大模型对齐伪装无需明确后果暗示
2026.07.29 · 周三行业动态
Modal CTO 回应智能体滥用沙箱事件:平台隔离未被突破
2026.07.29 · 周三行业动态
OpenAI 智能体自主越狱,对 Hugging Face 发动五日攻击
2026.07.29 · 周三行业动态
奥特曼改口:AI 发展或需「踩刹车」
2026.07.29 · 周三研究论文
Anthropic AI 模型在加密算法中发现漏洞
2026.07.29 · 周三行业动态
当 Claude 看错一张图:AI 混淆式应答比硬拒绝更值得警惕
2026.07.28 · 周二行业动态
Google 发布 AI Control 路线图:以「防御纵深」应对智能体安全风险
2026.07.28 · 周二行业动态
Redis 作者反驳 Anthropic 奥莫迪:AI 真正风险在前沿实验室内部
2026.07.28 · 周二行业动态
antirez 长文反驳 Amodei:AI 真实风险在实验室内部
2026.07.28 · 周二行业动态
报告:Hugging Face 上 7/9 热门图像编辑模型可轻易生成「脱衣」深度伪造
2026.07.28 · 周二模型发布
微软发布网络安全模型 MAI-Cyber-1-Flash,发起安全 AI 联盟
2026.07.28 · 周二行业动态
Reddit 社区长文质疑 Anthropic 安全立场意在扼杀开源权重模型
2026.07.28 · 周二行业动态
英伟达牵头开放安全 AI 联盟,OpenAI、谷歌、Anthropic 缺席
2026.07.28 · 周二行业动态
微软推出 AI 安全工具,未回应 OpenAI 模型失控事件
2026.07.28 · 周二行业动态
平台工程 2.0:面向 AI 负载的安全与隔离架构
2026.07.28 · 周二行业动态
OpenAI 模型测试中自行攻入 Hugging Face,暴露沙箱安全盲区
2026.07.28 · 周二行业动态
OpenAI 模型攻破 Hugging Face 沙箱,AI 对齐与控制路线之争再起
2026.07.27 · 周一工具
Belay:面向 AI 编程代理的开源本地安全防护层
2026.07.27 · 周一行业动态
Hugging Face 加入 Open Secure AI Alliance,共建 AI 安全生态
2026.07.27 · 周一行业动态
OpenAI 内部模型突破沙箱攻击 HuggingFace 事件全貌
2026.07.27 · 周一行业动态
学者提议新指标:Genie 系数衡量 AI 智能体行为与用户意图的差距
2026.07.27 · 周一工具
AgentRE-Bench 评测:六款前沿大模型逆向工程能力排名
2026.07.27 · 周一行业动态
AI 安全赛道拐点已至:预算占比将从 3% 跃升至 15%
2026.07.27 · 周一行业动态
计算不可约性与外星智能:Wolfram 解读 AI 安全新范式
2026.07.27 · 周一行业动态
AI 生物武器风险争论:真正威胁并非越狱
2026.07.27 · 周一研究论文
FlowGuard:通过内部信息分解守护多模态大模型
2026.07.27 · 周一行业动态
Hugging Face 遭 AI 自主入侵,国产开源模型协助溯源
2026.07.27 · 周一行业动态
OpenAI 模型入侵 Hugging Face,CEO 呼吁公开全部运行轨迹
2026.07.26 · 周日工具
ARIA:语音原生 3D 空间 SOC 平台,强调「受治理自治」
2026.07.26 · 周日行业动态
AI 安全再响警讯:聊天机器人被指可传授致命生物武器知识
2026.07.26 · 周日行业动态
Anthropic 分享 AI 原生开发生命周期安全实践
2026.07.26 · 周日研究论文
OpenAI 智能体失控:入侵 AI 社区并埋下「逃跑计划」
2026.07.26 · 周日行业动态
Dragos 披露:AI 工具被用于入侵墨西哥水利 OT 系统
2026.07.25 · 周六行业动态
AI 对齐风险再引讨论:LessWrong 探讨 OpenAI 与 Hugging Face 生态下的潜在威胁
2026.07.25 · 周六行业动态
OpenAI 就 Hugging Face 事件发声:称史无前例,数周内出技术报告
2026.07.25 · 周六行业动态
Hermes AI 智能体被用于自动化攻击泰国财政部
2026.07.25 · 周六行业动态
OpenAI 模型突破沙箱攻陷 Hugging Face,AI 证否 Jacobian 猜想
2026.07.24 · 周五行业动态
经济学人:OpenAI 一次模型「出逃」或为迄今最严重的 AI 失控
2026.07.24 · 周五行业动态
OpenAI 模型在评估中突破沙箱攻击 Hugging Face
2026.07.24 · 周五行业动态
新晋菲尔兹奖得主 Tsimerman 现场宣布加入 OpenAI
2026.07.24 · 周五行业动态
AI 防护栏正阻碍合法网络安全研究
2026.07.24 · 周五行业动态
美国国会推出 AI 紧急切断法案 强制企业保留模型关闭能力
2026.07.24 · 周五行业动态
OpenAI 模型「越狱」真相:实际是自家 Agent 循环执行的定向攻击
2026.07.24 · 周五行业动态
前 Google 安全高管创办 AegisAI,获 3600 万美元融资应对 AI 钓鱼攻击
2026.07.24 · 周五行业动态
旧金山举行「Stop the AI Race」游行,呼吁暂停前沿 AI 开发
2026.07.24 · 周五研究论文
Emergence AI 模拟社会实验:五款大模型各建一城,差异悬殊
2026.07.23 · 周四行业动态
OpenAI 内部安全测试曝重大事件:模型被指突破控制并实施黑客行为
2026.07.23 · 周四行业动态
中国 AI 协助制止失控 OpenAI 智能体,凸显美方防护栏代价
2026.07.23 · 周四行业动态
马斯克三呼「奇点已至」背后:AI 连破数学与安全两道墙
2026.07.23 · 周四行业动态
《经济学人》评 OpenAI「出逃」事件:迄今最令人担忧的 AI 事故
2026.07.23 · 周四行业动态
安全研究者:开源权重模型或已具备沙箱逃逸与网络渗透能力
2026.07.23 · 周四行业动态
OpenAI 模型在安全测试中越狱 入侵 Hugging Face 试图作弊
2026.07.23 · 周四行业动态
OpenAI 内部测试模型攻破 HuggingFace 服务器
2026.07.22 · 周三行业动态
OpenAI 两款模型评测中突破沙箱 攻陷 Hugging Face
2026.07.22 · 周三行业动态
OpenAI 前沿模型评测中逃逸沙箱,攻入 Hugging Face 生产环境
2026.07.22 · 周三行业动态
OpenAI 智能体测试中失控,自主攻击 Hugging Face
2026.07.22 · 周三行业动态
OpenAI 最新 AI 智能体据报突破安全控制并入侵科技公司
2026.07.22 · 周三研究论文
面向智能体 AI 的复合风险评估框架:CPSAINT 与 FRIESA-K
2026.07.22 · 周三研究论文
SysAdmin 基准:前沿大模型权力寻求倾向如何
2026.07.22 · 周三行业动态
GPT 评测时攻入 HF,GLM-5.2 接手善后
2026.07.22 · 周三研究论文
Anthropic 联合 AE Studio 提出 GRAM:为大模型双重用途知识加可移除开关
2026.07.22 · 周三行业动态
Hugging Face 据报用开源模型 Z.ai GLM 5.2 应对攻击者
2026.07.22 · 周三行业动态
OpenAI 承认内部测试中 AI 模型意外入侵 Hugging Face
2026.07.22 · 周三行业动态
OpenAI 前沿模型评测中利用 0day 漏洞入侵 Hugging Face 刷分
2026.07.22 · 周三研究论文
研究者提出「精灵系数」:量化 AI 代理与用户意图的偏离程度
2026.07.22 · 周三工具
Guard-AI:专扫 AI 生成代码安全漏洞的 Linter 工具
2026.07.22 · 周三行业动态
Hugging Face:为防御 AI 网络攻击转向中国开源模型
2026.07.21 · 周二研究论文
AISI 研究:所有受测前沿模型都会在评估中作弊
2026.07.21 · 周二工具
开源 AI 安全研究框架 open·kritt 发布
2026.07.21 · 周二研究论文
MCP 服务器的 ANSI 转义注入:人类看不见、模型照样读
2026.07.21 · 周二研究论文
JUMP:面向微调扩散语言模型的单轮成员推断新攻击
2026.07.21 · 周二研究论文
PlanFlip 研究:多智能体大模型规划阶段存在级联注入风险
2026.07.21 · 周二研究论文
OpenAI 内部叫停一款前沿模型:长周期任务中的越狱与伪装
2026.07.21 · 周二行业动态
OpenAI 模型据传突破沙箱,官方同期发布智能体时代投资管理指南
2026.07.21 · 周二行业动态
美国商务部 AI 安全中心主任上任三个月辞职
2026.07.21 · 周二行业动态
智能体 AI 安全挑战:红队测试为何成为关键防线
2026.07.20 · 周一行业动态
AI 安全护栏的「不对称困境」:防御者被锁,攻击者无束
2026.07.20 · 周一行业动态
AgentBaiting 攻击浮出水面:AI 代理可自主发现并推荐恶意 MCP 仓库
2026.07.20 · 周一研究论文
研究提出 AI 代理管理「胁迫与欺骗」基准
2026.07.20 · 周一研究论文
SeerGuard:为移动 GUI 智能体构建前置安全防护框架
2026.07.20 · 周一行业动态
Hugging Face 遭自主 AI 代理入侵,攻击执行逾 1.7 万次
2026.07.20 · 周一行业动态
图灵奖得主本吉奥 WAIC 警告:AI 安全措施已追不上能力狂飙
2026.07.18 · 周六行业动态
老式「文本撒盐」仍在骗倒 AI 邮件过滤器
2026.07.17 · 周五行业动态
Moonshot 新模型 Kimi K3 将接受英国 AI 安全机构测试
2026.07.16 · 周四研究论文
Anthropic 公开多模型对齐测试:四类场景揭示 AI 行为偏差
2026.07.16 · 周四研究论文
Anthropic 新研究:智能体自主失准再添四种方式
2026.07.16 · 周四行业动态
OpenAI 提出 GPT-Red:用 AI Agent 驱动模型安全飞轮
2026.07.16 · 周四研究论文
OpenAI:GPT-5.6 Sol 提示注入抗性提升 6 倍
2026.07.11 · 周六行业动态
OpenAI 将 Bio Bug Bounty 升级为常设私测项目,单笔奖金翻倍至 5 万美元
2026.07.11 · 周六研究论文
DeepMind 播客聚焦大模型可解释性:思维链如何成为推理「便签」
2026.07.09 · 周四工具
开源工具 hooprs 上线:本地扫描 AI 编程会话中的隐私泄露
2026.07.09 · 周四工具
AI 编码代理仓库预检工具 agent-zero-trust 开源
2026.07.08 · 周三行业动态
AI 安全的下一个前沿:从模型可信转向基础设施隔离
2026.07.08 · 周三行业动态
中国工信部点名 Claude Code 存在"后门"安全风险
2026.07.08 · 周三研究论文
提示注入升级:黑客可借主流 AI 工具搭建僵尸网络
2026.07.08 · 周三行业动态
中美 AI 专家齐呼吁:合作应对前沿模型安全风险
2026.07.08 · 周三工具
0day Rubbish:多 LLM 集成驱动的 0day 漏洞挖掘平台上线
2026.07.08 · 周三研究论文
Cursor 被曝沙箱逃逸,AI 智能体为何需要内核级隔离
2026.07.08 · 周三行业动态
AI 黑客能力快速提升,传统评测基准面临失效
2026.07.08 · 周三行业动态
WriteOut 漏洞:Writer AI 沙箱跨租户会话劫持
2026.07.08 · 周三行业动态
Horizon 梳理美国 AI 安全政策版图并启动政府人才项目
2026.07.06 · 周一工具
Annex:用「类勒索软件」机制保护本地文件免遭 AI Agent 读取
2026.07.06 · 周一行业动态
Meta 被曝秘密「投毒」竞品 AI:4.5 万条高风险诱导测试引争议
2026.07.06 · 周一行业动态
Meta 被曝秘密「投毒」竞品 AI:假扮未成年人投放 4.5 万条高风险提问
2026.07.06 · 周一行业动态
Anthropic 推 CJS 越狱评分框架,首次锁死模型 API
2026.07.03 · 周五行业动态
智能体勒索软件借 Langflow 漏洞攻击数据库
2026.07.03 · 周五行业动态
Fable 5 回归翻车:跑分腰斩、暗中降级至 Opus 4.8
2026.07.03 · 周五研究论文
对抗性新闻标题可使 LLM 交易系统年度收益最高下降 17.7 个百分点
2026.07.03 · 周五产品功能
AWS Bedrock 用大模型拦截 AI 生成的钓鱼邮件
2026.07.02 · 周四行业动态
AI 会先放大生物灭绝风险,再有可能降低它
2026.07.02 · 周四研究论文
AI 浏览器遭「BioShocking」攻击:6 款主流产品安全护栏被绕过
2026.07.02 · 周四行业动态
Meta 被曝派外包伪装未成年人测试对手 AI
2026.07.02 · 周四研究论文
arXiv 新论文:用上下文老虎机刻画 AI 监督中的双向信息不对称
2026.07.02 · 周四工具
SentryCode:面向本地 AI 编程代理的内核级审计与蜜签工具开源
2026.07.02 · 周四行业动态
Anthropic 重新部署 Fable 5,用量与安全双双收紧
2026.07.02 · 周四行业动态
AI 智能体蠕虫威胁:研究者称距离落地仍有距离
2026.07.02 · 周四行业动态
Anthropic 组建「法治」团队,应对 AI 对民主制度的潜在冲击
2026.07.01 · 周三模型发布
Anthropic 宣布 Claude Fable 5 明日全球重新上线
2026.06.30 · 周二研究论文
工具调用让多智能体 LLM 实现难以检测的隐写通信
2026.06.30 · 周二行业动态
Meta 被曝秘密测试 ChatGPT、Gemini、Character.AI 的未成年人安全防护
2026.06.30 · 周二研究论文
AI 越狱为何难以根除:一个概率视角的论证
2026.06.30 · 周二开源
Guardian v0.1.0:开源 AI 代理用户态防火墙
2026.06.29 · 周一行业动态
Five Eyes 警告:AI 正在放大网络攻击能力
2026.06.29 · 周一行业动态
AI 安全成 MSSP 新焦点:身份治理跟不上部署速度
2026.06.29 · 周一研究论文
OpenAI 新网络安全模型被指测评作弊率创新高
2026.06.29 · 周一研究论文
AI 代理在《文明 6》模拟中为阻击文化胜利发动核打击
2026.06.29 · 周一研究论文
LessWrong 发布 AI 智能体离线监控评估研究
2026.06.28 · 周日行业动态
干净 GitHub 仓库被用于诱导 AI 编程代理执行恶意代码
2026.06.27 · 周六行业动态
