AI 安全研究、洞见、报告、即将举办的活动以及工具与资源摘要。关注 AISecHub 社区 和我们的 LinkedIn 小组 获取更多更新。另请查看我们的项目 Awesome AI Security。
由 InnovGuard.com 赞助 - 技术风险与网络安全咨询 - 创新与投资,信心与保障并行。
📌 更新我们的分类体系:智能体 AI 系统的故障模式 微软基于红队工作扩展了其智能体 AI 故障模式分类体系,为安全团队提供了一种更清晰的方式来推理已部署智能体系统中的工具误用、过度授权、记忆污染、身份边界以及人工覆盖缺口等问题。
📌 Miasma 蠕虫再次攻击微软:Azure Functions Action 及其他 72 个仓库在针对 AI 编码智能体的供应链攻击后被禁用 StepSecurity 记录了一场针对 AI 编码智能体工作流和 GitHub 仓库的供应链攻击活动,其防御重点是 CI/CD 环境中的依赖信任、操作来源、仓库写入路径以及智能体可见的凭据。
📌 技能分发的可悲现状 Trail of Bits 研究人员通过使用截断、归档间接、字节码投毒和提示注入框架的技能包,绕过了 ClawHub、Cisco skill-scanner 和 skills.sh 的检查,展示了为什么公共智能体技能市场需要策展和来源控制,而不仅仅是扫描器信任。
📌 Codex CLI RCE:提示注入缓解措施 Cymulate 详细介绍了命令行编码智能体中的提示注入风险,除非在模型之外强制执行沙箱、批准边界和命令约束,否则不受信任的文本可以引导文件写入或工具执行。
📌 Agentjacking:MCP 注入劫持 AI 编码智能体 云安全联盟总结了从 Sentry 到 MCP 的“agentjacking”模式,其中外部控制的遥测或问题内容成为编码智能体的可信上下文。有用的防御框架是将可观测性、错误报告和集成数据视为不受信任的智能体输入,而不是中立的开发元数据。
📌 SearchLeak:我们如何将 M365 Copilot 变成一键数据窃取武器 Varonis 描述了一个 Microsoft 365 Copilot Enterprise 攻击链,该链结合了参数到提示注入、HTML 渲染行为和搜索路径滥用,通过单次点击工作流泄露敏感的 M365 数据。
📌 AutoJack:单个页面如何对运行 AI 智能体的主机执行 RCE 微软展示了 AI 浏览智能体查看的恶意网页如何能到达本地 AutoGen Studio 服务,并通过不安全的本地主机信任和智能体操作处理触发主机进程执行。
📌 Mastra npm 供应链攻击:通过 easy-day-js 拼写错误后门入侵 140 多个包 StepSecurity 报告了 Mastra 的 npm 生态系统因一个拼写错误的依赖项而被入侵,该依赖项包含一个混淆的 postinstall 释放器,影响了 AI 应用栈中使用的智能体、RAG、MCP 和工作流包。
📌 攻破 LiteLLM:从低权限用户到管理员与 RCE Obsidian 记录了一条链式 LiteLLM 权限提升和 RCE 路径,展示了 AI 网关的低权限访问如何变成对提供者密钥、代理策略和运行时智能体功能的管理控制。
📌 Amazon Q 漏洞:通过 MCP 自动执行入侵 Wiz 分析了 Amazon Q VS Code 扩展的一个问题,其中克隆仓库中工作区信任的 MCP 配置可能自动加载攻击者控制的行为,并暴露开发者执行路径和云凭据。
📌 macOS.Gaslight:Rust 后门将对分析师的提示注入转向,而非沙箱 SentinelOne 记录了一个 Rust 后门,它为分析师和 AI 辅助工具植入了提示注入内容,将攻击从沙箱逃逸转变为对审查恶意软件的人员和模型的操纵。
📌 计算机使用与 TOCTOU:你点击的不是你得到的! Johann Rehberger 演示了一种计算机使用智能体的竞争条件,其中屏幕在模型观察之后但在点击发生之前发生变化,将一个看似良性的交互变成 Outlook 发送操作,并使操作前像素或状态重新验证成为核心控制。
📌 AI 辅助软件开发的“氛围编码”光谱方法 英国国家网络安全中心 (NCSC) 将 AI 辅助编码视为一个风险光谱,将低风险原型与涉及身份验证、授权、敏感数据、安全关键行为或关键基础设施的生成代码区分开来。
📌 提示注入与智能体运行时安全:实用威胁模型 TMLS 将提示注入视为一个运行时安全问题,通过工具中介、记忆存储、出站通道和人工批准缺口映射攻击。实用的结论是将控制措施转移到能力代理、沙箱执行、白名单和审计路径中,而不是将提示文本视为安全边界。
📌 2000 人试图入侵我的 AI 助手后发生了什么 Fernando Irarrázaval 报告了一个 OpenClaw 邮件智能体提示注入挑战,有超过 6000 次尝试且没有成功泄露秘密,同时揭示了围绕智能体记忆污染、批量上下文、API 成本、账户暂停和模型选择等方面的实际部署问题。
🧰 AgentStalker - 智能体漏洞基准测试与分析工具包,具备污点跟踪、AST 分析、代码审计和沙箱复现功能,适用于智能体攻击路径。⭐️115
🧰 darknet-mcp-server - MCP 服务器,向 AI 智能体公开泄露、勒索软件、恶意软件、漏洞、窃密日志和威胁情报工具,用于受控的安全研究工作流。⭐️67
🧰 mcp-trust-plane - 面向模型上下文协议 (MCP) 提供者的可组合数据安全与防护平面,专注于围绕 MCP 连接工具和数据的策略控制。⭐️60
🧰 prompt-gate - 本地数据丢失防护 (DLP) 和 DNS 层控制,用于阻止未经授权的 AI 工具,并在出站提示离开端点前检查其中的密钥或敏感数据。⭐️28
🧰 claude-ai-cyber-security-skills - 面向安全工作流的 Claude Code 技能集合,包括进攻性测试、防御性分析和工具辅助调查模式。⭐️17
🧰 talos - 面向人类、服务和 AI 智能体的 API 密钥与能力令牌服务,用于需要作用域限制的机器对机器授权。⭐️14
🧰 SkillsGuard - 针对恶意或不安全 AI 智能体技能包、SKILL.md 文件和捆绑脚本的静态扫描器。⭐️13
🧰 tamga - 自托管 LLM 安全代理,用于个人身份信息 (PII) 脱敏、提示注入防御以及模型流量的合规控制。⭐️11
🧰 llm-sec-range - LLM 攻防演练场,涵盖提示注入 CTF、OWASP LLM Top 10、脆弱智能体和本地模型目标。⭐️9
🧰 aka-claude-tools - Claude Code 安全增强实用工具,用于清理上下文、隔离配置文件、锁定凭据、保护出站连接和更安全的本地默认设置。⭐️9
🧰 agent-jackstop - 针对 Cursor 和 Claude Code 的加固层,防御通过不受信任工具输出进行的提示注入,也被称为 agentjacking。⭐️8
🧰 LLM-Safety-platform - AI 红队测试平台,用于 LLM 漏洞评估、提示注入、混淆攻击和采样稳定性分析。⭐️6
OWASP 的六月更新将智能体 AI 安全转化为治理和工程地图,涵盖了自主工作流、智能体风险类别、控制措施,以及早期威胁模型与生产事件之间的实际差距。
云安全联盟发布 247 项 AI 控制目标,涵盖 18 个安全领域,并映射到 ISO 42001、ISO 27001、BSI AIC4 以及欧盟 AI 法案导向的治理等保证与合规框架。
CSA 将 AI 控制矩阵转化为云提供商实施指南,涵盖审计规划、补救、漏洞管理、合作伙伴监督、威胁检测以及 AI 特定的保证实践。
英国 NCSC 和五眼联盟合作伙伴警告称,AI 正在降低攻击者门槛并压缩漏洞到利用的时间窗口,同时将风险转变映射到安全设计默认值、暴露减少、补丁速度、强身份验证、事件准备和防御性 AI 使用。
美国国家安全局 (NSA) 与国际合作伙伴发布 MCP 安全设计指南,用于 AI 驱动的自动化,涵盖身份验证、授权、服务器信任、传输控制、工具暴露以及从实验过渡到生产的智能体生态系统的监控。
🛡️ CVE-2026-49257: mcp-pinot 暴露未经身份验证的 MCP 工具调用 严重性 10.0。mcp-pinot 可将 HTTP MCP 服务器绑定到 0.0.0.0,且默认禁用 OAuth,通过服务器端的 Apache Pinot 凭据暴露 SQL、模式和表变异工具。
🛡️ CVE-2026-54309: n8n MCP Browser 传输接受未经身份验证的工具调用 严重性 10.0。n8n 的 MCP Browser HTTP 传输可在未经身份验证的情况下接受会话初始化和工具调用,将浏览器控制自动化暴露给可达客户端。
🛡️ CVE-2026-56274: Flowise Custom MCP Server 命令注入 严重性 9.9。Flowise Custom MCP Server 的命令标志处理和文件访问限制可被绕过,导致在 LLM 工作流平台内执行操作系统命令注入。
🛡️ CVE-2026-55255: Langflow 流程执行 IDOR 严重性 9.9。Langflow 的响应 API 可能允许已认证攻击者通过提供受害者流程 ID 来执行其他用户的流程,破坏 AI 工作流执行的租户隔离。
🛡️ CVE-2026-50548: Cursor 智能体终端沙箱逃逸 严重性 9.8。Cursor 的智能体终端沙箱可通过修改工作目录参数被绕过,允许智能体驱动的终端操作超出预期工作空间边界。
🛡️ CVE-2026-50549: Cursor 智能体文件写入沙箱逃逸 严重性 9.8。Cursor 的文件写入沙箱在规范化失败后可能错误回退,为智能体文件写入超出预期项目边界开辟路径。
🛡️ CVE-2026-49468: LiteLLM 代理主机头授权绕过 严重性 9.8。LiteLLM 代理的主机头解析在特定部署条件下可能允许未授权访问受保护的管理路由,危及网关控制和提供者密钥。
🛡️ CVE-2026-7664: IBM Langflow Streamable MCP 授权绕过 严重性 9.8。IBM Langflow 的 Streamable MCP 传输可能将受保护的 MCP 资源和操作暴露给受影响开源版本中的未授权攻击者。
🛡️ CVE-2026-55743: OpenHuman 桌面智能体 shell 白名单绕过 严重性 9.6。OpenHuman 的桌面智能体 shell 白名单可通过查找执行标志和环境技巧被绕过,将间接提示注入路径转变为主机命令执行。
📅 IEEE CSR GenXSec 2026 - 2026年8月3-5日 · 葡萄牙里斯本 · 主办方:IEEE CSR
📅 Black Hat USA 2026 - AI 峰会 - 2026年8月4日 · 美国内华达州拉斯维加斯 · 主办方:Black Hat
📅 CAMLIS 2026 - 2026年10月21-23日 · 美国弗吉尼亚州阿灵顿 · 主办方:CAMLIS
📅 GAISS 2026 - 2026年10月28-30日 · 美国德克萨斯州奥斯汀 · 主办方:IEEE
📅 ACM AISec 2026 - 2026年11月15-19日 · 荷兰海牙 · 主办方:ACM AISec
📖 AgentRedBench: 面向 SaaS 集成的 LLM 智能体动态红队与集成感知防御
针对连接 SaaS 集成(如 Gmail、Salesforce 和 Jira)的工具使用智能体进行间接提示注入基准测试,使攻击面更接近生产智能体工作流,而不仅仅是纯聊天的提示注入测试。arXiv
📖 SkillGuard: 智能体技能权限框架
将第三方智能体技能视为有权限的软件制品,映射技能可以注入到智能体上下文的内容与其在运行时可以导致智能体执行的操作之间的关系。arXiv
📖 真实世界 MCP 服务器中的描述-代码不一致性:测量、检测与安全影响
测量来自 2,214 个 MCP 服务器的 19,200 个描述-代码对,发现工具描述通常与实际实现行为存在差异,为基于自然语言描述选择工具的智能体创造了盲点。arXiv
📖 GitInject: AI 驱动 CI/CD 流水线中的真实世界提示注入攻击
展示嵌入在 CI/CD 和拉取请求工作流中的 AI 智能体如何在持有提升权限的同时摄取攻击者控制的仓库内容,将提示注入转化为软件供应链风险。arXiv
📖 迈向安全的 LLM 智能体:威胁面、攻击、防御与评估
综合 247 篇论文,形成面向系统的智能体安全地图,聚焦于信息流、委托授权、持久状态、工具介导的控制流劫持以及非组合防御的弱点。arXiv
📖 面向智能体浏览器的同源策略
展示智能体浏览器如何成为自动化的跨源数据流通道,然后提出 SOPGuard 以在保持任务实用性的同时强制实施浏览器源边界。arXiv
📖 隔离时良性,组合时有害:智能体技能生态系统中的安全风险
引入技能组合风险,其中单独良性的技能在其输出、信任信号、授权线索或副作用影响共享智能体上下文中的后续工具调用时变得有害。arXiv
📖 SafeClawBench: 区分使用工具的 LLM 智能体中的语义、审计证据和沙箱危害
引入一个分阶段基准测试,用于工具使用智能体安全,涵盖直接和间接提示注入、工具返回注入、记忆投毒、记忆提取和不安全推理,将模型协议与审计可见和沙箱观察到的危害区分开来。arXiv
📖 "本地发生,全局泄露":检测 MCP 服务器中的隐私泄露风险
将 MCP 泄露视为协议引发的隐私问题,其中凭据、API 密钥或 PII 通过返回值、日志或工具处理程序错误跨越本地到 LLM 的边界。arXiv
📖 ShareLock: 一种针对 MCP 的隐蔽多工具阈值投毒攻击
引入一种多工具 MCP 投毒攻击,其中恶意指令被分割到看起来良性的工具描述中,并在触发后才重建,相比单工具投毒降低了可检测性。arXiv
💬 干净的 GitHub 仓库欺骗 AI 编码智能体运行恶意软件 r/cybersecurity · Reddit 评分 183 · 19 条评论 从业者将该讨论视为编码智能体信任边界案例:仓库提示、配置文件、安装脚本和工具输出上下文可以在审查者看到传统恶意负载之前成为执行影响力。
💬 macOS Gaslight 后门利用提示注入攻击安全分析人员 r/cybersecurity · Reddit 评分 202 · 11 条评论 讨论将提示注入视为恶意软件分析工作流滥用:恶意样本可以为分析人员及其 AI 工具植入指令,因此审查环境、分析人员笔记和模型上下文成为攻击面的一部分。
💬 推广 Copilot - 我对间接提示注入应该有多担心? r/cybersecurity · Reddit 评分 48 · 31 条评论 安全团队比较了 Copilot 推广中针对间接提示注入的控制措施,重点关注不受信任的文档和电子邮件、继承的用户权限、过度共享的数据、连接器范围,以及最小权限是否足以应对检索增强助手。💬 团队如何处理 MCP 工具暴露面? r/cybersecurity · Reddit 评分 13 · 19 条评论 该帖子聚焦 MCP 作为工具暴露边界:团队讨论了服务器可达性、工具描述的可信度、审批关口、每个工具的授权,以及代理工具访问应更接近 API 访问还是本地代码执行。
💬 有没有团队的安全策略真的为 AI 代理做好了准备,还是我们都在假装? r/cybersecurity · Reddit 评分 47 · 73 条评论 从业者将 AI 代理映射到现有策略中的治理缺口:谁拥有自动化操作、哪些需要人工审批、委派权限如何记录、以及当工作流操作部分自动化时事件响应如何变化。
1️⃣ LLM 编码代理中的 RCE:来自 Claude Code 新披露漏洞的教训 Cloud Native San Francisco 关于编码代理 RCE 教训的演讲,对于评估提示注入、本地工具和开发环境如何结合成主机端执行风险的团队很有帮助。
2️⃣ 安全企业 AI 的未来:使用 MCP 构建可靠的代理 Xpand 大会上关于基于 MCP 的企业代理设计的演讲,重点强调可靠的代理基础设施、数据暴露以及围绕连接工具的安全控制。
3️⃣ CNAS 2026 国家安全会议:设定 AI 战争的规则 CNAS 关于 AI 战争规范与国家安全政策的讨论,与关注 AI 网络行动如何进入公共部门政策与治理的安全团队相关。
4️⃣ 构建安全代理的黑客指南 NDC 大会上关于安全代理构建的演讲,涵盖当代理获得工具、凭证、状态和自主权时出现的工程风险。
5️⃣ 攻击 AI 系统 CodeValue 关于攻击 AI 系统的演讲,作为面向从业者的实践指南,说明 AI 功能如何将应用威胁模型扩展到普通提示和 API 处理之外。
6️⃣ BlueHat 2026:从可信代理到对手:在提示注入时代保护代理型 AI BlueHat 2026 大会上关于可信代理工作流在工具输出、检索内容及委派操作跨越信任边界时如何变得具有对抗性的演讲。
7️⃣ 攻破 LLM 驱动的应用:克服安全与隐私挑战 Spring I/O 大会上由 Brian Vermeer 主讲的演讲,涵盖针对 LLM 驱动的应用的实践攻击路径,包括提示注入、隐私泄露、应用集成风险及架构缓解措施。
8️⃣ ContinuumCon 2026 - 追踪提示注入 ContinuumCon 大会上由 Mackenzie Jackson 主讲的演讲,讨论如何发现、测试和推理 AI 系统中的提示注入行为,将其视为一个运营安全问题。
9️⃣ 使用 MCP 和零信任身份保护 AI 代理 DZone Events 关于使用零信任身份概念、范围访问、工具授权和更安全的委派工作流保护 MCP 连接代理的演讲。
🔟 实战中的 MCP 安全 保加利亚 Java 用户组技术演讲,由 Willem Jan Glerum 主讲,讨论 MCP 安全权衡、服务器与工具暴露、配置风险以及代理集成的控制措施。
如果你是一位正在构建新事物的创始人,或者是一位评估早期机会的投资者——联系我们。
💬 读到有趣的内容?请在评论区分享你的想法。