深度解析 OWASP LLM Top 10 与 Agentic AI Top 10:智能体时代的安全攻防图谱
前言 2025年,AI安全领域迎来了两座重要的里程碑:OWASP LLM Top 10 2025版正式发布,以及全球首个 OWASP Agentic AI Top 10 于2025年12月正式出炉。前者针对大语言模型应用,后者则剑指正在兴起的自主智能体(Agentic AI)系统。两者共同构成了当下AI安全研究的核心知识体系。 本文将深入解析这两份报告的核心内容,梳理其内在联系,结合2025—2026年最前沿的安全实践,提出系统性
前言
2025年,AI安全领域迎来了两座重要的里程碑:OWASP LLM Top 10 2025版正式发布,以及全球首个 OWASP Agentic AI Top 10 于2025年12月正式出炉。前者针对大语言模型应用,后者则剑指正在兴起的自主智能体(Agentic AI)系统。两者共同构成了当下AI安全研究的核心知识体系。
本文将深入解析这两份报告的核心内容,梳理其内在联系,结合2025—2026年最前沿的安全实践,提出系统性的解法思路与重心建议。
一、OWASP LLM Top 10(2025版)全面解析
2025版OWASP LLM Top 10相比2023版有重大更新,新增了三个风险类别,重新调整了优先级分布。以下是完整解析:
LLM01 — 提示词注入(Prompt Injection)
不变的第一名。提示词注入是LLM应用中最经典也最危险的风险,攻击者通过在用户输入、RAG检索结果、工具输出等位置注入恶意指令,使模型执行非预期操作。
2025年新增重点:Indirect Prompt Injection(间接提示词注入)成为主要攻击向量——恶意网页内容、日历邀请、邮件正文中的隐藏指令可在模型处理外部数据时被触发。
防御重心:输入层严格隔离与验证(CDR / 内容消毒)、运行时意图验证(Intent Validation)、系统提示词锁定、行为基线监控。
LLM02 — 敏感信息泄露(Sensitive Information Disclosure)
从第9位跃升至第2位。模型可能通过输出泄露API密钥、个人隐私数据、商业机密或系统内部信息。攻击路径包括:训练数据记忆、上下文窗口泄露、过度详细的响应等。
防御重心:输出过滤与PII检测、数据最小化原则、差分隐私训练、严格的上下文隔离。
LLM03 — 供应链风险(Supply Chain)
从第6位升至第3位。涵盖第三方模型、数据集、预训练权重、工具库中的恶意组件。2025年随着MCP生态的爆发,供应链攻击面急剧扩大。
防御重心:SBOM / AIBOM 清单管理、模型来源验证与签名、依赖项把关与版本固定、容器化构建环境。
LLM04 — 数据与模型投毒(Data & Model Poisoning)
攻击者通过污染训练数据、RAG知识库或嵌入向量,使模型在特定触发条件下产生错误输出或有害行为。这是一种慢性的、持久性的攻击。
防御重心:训练数据来源审计、RAG知识库输入验证、嵌入向量异常检测、定期模型行为审计。
LLM05 — 不当输出处理(Improper Output Handling)
将模型输出视为可信输入,未做消毒直接传给浏览器(XSS)、Shell或SQL查询(SQL注入)。这是LLM应用中最容易转化为经典漏洞的路径。
防御重心:输出编码与验证(与传统Web安全一致)、强制Schema校验、禁止将未验证输出写入危险操作。
LLM06 — 过度代理(Excessive Agency)
从第4位升至第6位但内容大幅扩展。模型被授予了超出任务所需的工具调用权限,导致一次成功的提示词注入可以触发真实的外部操作(发邮件、删除数据、修改记录等)。
防御重心:最小工具集原则、动作级鉴权与审批、关键操作强制人工确认(Human-in-the-Loop)、MCP网关统一管控。
LLM07 — 系统提示词泄露(System Prompt Leakage)
2025版新增。攻击者可提取应用的隐藏系统提示词,暴露内部指令逻辑、业务规则,甚至嵌入的密钥或凭证。此风险源于对提示词保密性的过度假设。
核心教训:永远不要将任何安全敏感信息放入系统提示词。
LLM08 — 向量与嵌入弱点(Vector & Embedding Weaknesses)
2025版新增,直接回应RAG(检索增强生成)大规模应用后的安全需求。风险包括:嵌入反转攻击(从向量恢复原始数据)、知识库投毒、跨租户向量存储泄露。
防御重心:向量数据库访问控制、嵌入内容验证、按信任度加权检索、多租户隔离。
LLM09 — 虚假信息(Misinformation)
2025版新增。模型生成看似合理但实际错误或有害的内容,并在缺乏来源标注的情况下被用户信任。
防御重心:事实核查机制、来源追踪与标注、置信度分级显示、幻觉检测系统。
LLM10 — 无界消耗(Unbounded Consumption)
2025版新增,将资源管理风险与成本风险合并。攻击者通过精心构造的输入触发模型的高计算量行为,导致服务降级或意外的高额API成本。
防御重心:输入长度与复杂度限制、Token预算强制控制、自适应限流、成本监控与告警。
二、OWASP Agentic AI Top 10(2025版)深度解析
2025年12月,OWASP正式发布首个针对自主智能体系统的安全风险框架——Agentic Applications Top 10。这份框架的核心洞察是:LLM Top 10问的是「模型如何被操纵」,Agentic Top 10问的是「当这种操纵被赋予自主性、记忆、凭证和真实工具访问能力后会发生什么」。
ASI01 — 智能体目标劫持(Agent Goal Hijack)
攻击者通过操纵指令、外部数据或工具输出,改变智能体的既定目标。与一次性提示注入不同,目标劫持的影响是持续性的——被劫持的目标可能被写入记忆,在跨会话中反复生效。
真实案例:EchoLeak事件中,攻击者通过隐藏指令将Copilot变成静默数据窃取引擎。
防御重心:意图胶囊(Intent Capsules)、高风险操作强制人工审批、运行时意图验证。
ASI02 — 工具滥用与利用(Tool Misuse and Exploitation)
智能体在合法权限范围内错误使用工具——调用不恰当的API、使用错误参数或异常顺序组合多个工具。Amazon Q事件是典型案例:攻击者通过模糊指令诱导智能体将合法工具串联,完成数据导出。
防御重心:工具级最小特权、动作级鉴权、语义防火墙(Semantic Firewall)、自适应工具预算。
ASI03 — 身份与权限滥用(Identity & Privilege Abuse)
智能体缺乏独立身份或过度继承用户权限,形成「身份爆炸」问题。Agent可以代表用户批准自己的请求、绕过审批流或访问管理端点。
防御重心:Agent独立服务身份(与用户身份分离)、JIT(即时)权限发放、时间限定令牌、禁止自我授权。
ASI04 — 智能体供应链风险(Agentic Supply Chain Vulnerabilities)
恶意或被篡改的工具、MCP服务器、模型或智能体描述文件在运行时动态加载,影响行为。2025年GitHub MCP服务器漏洞事件是标志性案例。
防御重心:SBOM/AIBOM、来源签名验证、容器化隔离、供应链「急停」开关。
ASI05 — 意外代码执行(Unexpected Code Execution)
智能体生成或处理的文本被直接或间接解释为可执行代码。AutoGPT RCE事件表明,自然语言执行路径可以成为通向远程代码执行的高危通道。
防御重心:禁止生产环境eval()、沙箱执行、非root权限、代码审计与监控。
ASI06 — 记忆与上下文投毒(Memory & Context Poisoning)
攻击者将错误或恶意信息写入智能体的长期记忆或RAG数据库。Gemini Memory Attack展示了恶意网页如何直接写入Agent的记忆存储。
与LLM04的区别:这是持久性的、跨会话的风险,危害远超一次性注入。
防御重心:内存分段、访问与留存限制、来源追溯与异常检测、按信任度加权检索。
ASI07 — 智能体间通信不安全(Insecure Inter-Agent Communication)
多智能体系统中,消息被视为「内部可信流量」而缺乏验证。攻击者可伪造、篡改或重放智能体间消息,导致协作行为被操纵。
防御重心:消息身份验证与完整性校验、安全通信通道、Agent感知防重放、协议固定。
ASI08 — 级联失败(Cascading Failures)
一个错误在自主执行与多智能体协作机制下被不断复制放大,最终演变为系统级连锁故障。规划错误或被污染的记忆可能触发自动部署级联。
防御重心:零信任设计、信任边界隔离、爆炸半径护栏、行为与治理漂移检测。
ASI09 — 人机信任滥用(Human-Agent Trust Exploitation)
智能体以权威、紧急或高度合理的方式输出内容,操纵人类执行高风险操作。「人在回路」并不等于安全——决策已被误导,最终操作却由人完成。
防御重心:明确确认机制、不可变日志、行为检测、计划偏离检测。
ASI10 — 失控智能体(Rogue Agents)
智能体因目标漂移、奖励机制缺陷或持续操纵逐渐偏离原始设计意图,在多智能体环境中可能相互强化。
防御重心:治理与日志记录、监控与检测、身份认证与行为完整性强制、定期行为认证。
三、两大框架的内在联系与演进逻辑
将两份报告对照分析,可以清晰看到AI安全的三层演进:
| 阶段 | 形态 | 主要风险 |
|---|---|---|
| Level 1 | LLM应用(对话机器人) | 提示词操纵、信息泄露、输出注入 |
| Level 2 | 工具调用LLM(带工具的模型) | 过度代理、供应链漏洞 |
| Level 3 | Agentic AI(自主智能体) | 目标劫持、记忆投毒、失控传播 |
两个框架的核心映射关系:
| Agentic ASI | 对应 LLM Top 10 | 核心区别 |
|---|---|---|
| ASI01 目标劫持 | LLM01 + LLM06 | 持续性 vs 一次性 |
| ASI02 工具滥用 | LLM06 | 自动化放大效应 |
| ASI03 身份滥用 | LLM02 + LLM06 | 跨系统越权 |
| ASI04 供应链 | LLM03 | 动态加载风险 |
| ASI05 代码执行 | LLM05 | 语言到行为边界失效 |
| ASI06 记忆投毒 | LLM01 + LLM04 + LLM08 | 跨会话持久性 |
| ASI07 通信安全 | LLM06 | Agent间信任滥用 |
| ASI08 级联失败 | LLM01 + LLM04 | 放大效应 |
| ASI09 人机信任 | LLM05 + LLM09 | 人在回路失效 |
| ASI10 失控 | LLM09 | 长期行为漂移 |
四、前沿发展与新兴威胁
4.1 MCP(Model Context Protocol)生态的安全挑战
2024年底Anthropic发布MCP后,其生态系统在2025年经历了爆发式增长,同时也成为安全研究的核心战场:
- CVE-2025-6515:MCP会话ID劫持漏洞,攻击者可接管已建立的MCP会话
- Line Jumping攻击:恶意MCP服务器通过工具描述注入指令,在任何工具被调用前就改变Agent行为
- Tool Shadowing:恶意服务器先注册无害工具获取信任,之后动态替换工具行为
- MCPTox基准:专门针对MCP服务器的可复现攻击基准,揭示了MCP生态系统的系统性风险
4.2 AI红队评测的前沿进展
AIRTBench(2025年6月):首个面向LLM自主红队能力的评测基准,基于70个真实CTF挑战。结果显示Claude-3.7-Sonnet以61%总解决率领先,在提示词注入任务上平均解决率达49%。自动化AI红队在可解题任务上效率领先人类安全专家5000倍以上。
AgentSecurityBench(ASB):支持直接/间接提示注入(DPI/IPI)、Plan-of-Thought后门、内存投毒等多种攻击场景。
4.3 零信任AI智能体架构
Anthropic发布的《Zero Trust for AI Agents》白皮书提出了核心设计原则:
「当你不确定某个控制是否有效,问自己:它让攻击变得不可能,还是只是变得麻烦?」
在AI加速攻击的时代,仅靠摩擦来防御是不够的,必须从架构层面消除攻击路径。
五、系统性解法与核心重心
5.1 架构层:最小Agent原则(Least Agency)
OWASP Agentic AI框架提出的核心理念,超越传统最小权限原则:
- 不仅限制「能访问什么」,更限制「在什么条件下自主行动」
- 工具调用前:意图验证
- 执行中:动作级鉴权
- 执行后:完整审计日志
- 关键操作:强制人工审批
5.2 技术层:五层防御体系
第一层:输入安全 — 内容消毒(CDR)、提示词与外部数据严格隔离、意图验证、多层输入过滤
第二层:工具与通信安全 — MCP网关、工具级最小特权、Agent间消息身份验证、语义防火墙
第三层:身份与权限管理 — Agent独立服务身份、JIT权限发放(零持久权限)、时间限定令牌、禁止自我授权
第四层:记忆与数据安全 — 内存分段存储、来源追溯机制、RAG知识库输入验证、按信任度加权检索
第五层:运行时监控与响应 — 完整不可变日志、行为基线与漂移检测、熔断机制、Agent「急停」开关
5.3 流程层:持续安全运营
左移安全:将安全测试集成到CI/CD管道,提示注入测试、工具权限审查成为发布前必须环节。
红队测试常态化:AI Agent需要与传统渗透测试不同的红队方法——CSA Agentic AI Red Teaming Guide提出了12大威胁类别和4层渗透模型(基础层→目标层→环境层→元认知层)。
监管合规对齐:欧盟AI法案(EU AI Act)的高风险分类与OWASP Agentic Top 10高度一致,需要对关键决策Agent实施强制人类监督。
六、2026年AI安全重心建议
🔴 最高优先级(立即行动)
- MCP生态安全审计:对所有MCP服务器实施零信任策略,部署MCP网关,限制工具描述直接进入模型上下文
- Agent身份隔离:为每个Agent分配独立服务身份,消除Agent继承用户凭证的问题
- 关键操作强制HITL:对涉及财务、敏感数据、外部通信的操作强制人工审批
- Agent记忆安全:将Agent记忆视为不可信存储,实施访问控制和输入验证
🟡 中期建设(3-6个月)
- 建立AIBOM:为所有Agent组件(模型、工具、MCP服务器、Prompt模板)建立资产清单
- AI红队常态化:建立针对Agentic AI的持续红队测试流程
- 日志与可观测性:实施完整的Agent行为追踪,覆盖意图→决策→工具调用→结果的全链路
🟢 长期演进(6-12个月)
- 零信任AI架构:重新设计网络和身份架构,将Zero Trust原则应用于非人类身份
- 对抗性鲁棒性训练:将Agent投毒和目标劫持纳入持续安全评估
- 跨框架合规对接:将OWASP LLM/Agentic Top 10与EU AI Act、NIST AI Risk Management Framework对齐
结语
OWASP LLM Top 10与Agentic AI Top 10共同描绘了一幅清晰的图景:AI安全正在从「模型被操纵」演进到「AI被赋予行动能力后的系统性风险」。
提示词注入从文字游戏变成了真正的行动触发器。记忆投毒从一次性事件变成了持久性行为控制。供应链漏洞从代码风险扩展到了Prompt和工具描述的「软逻辑」层面。
安全的重心必须从「防御模型」升级到「治理Agent行为」。这需要的不仅是技术改进,更是架构理念的根本转变——从最小权限到最小Agent,从边界防御到零信任AI,从被动修复到主动红队。
在这个AI加速一切的时代,安全不再是护城河,而是生存条件。
本文参考:OWASP Top 10 for LLM Applications 2025(owasp.org)、OWASP Top 10 for Agentic Applications 2026(genai.owasp.org)、CSA Agentic AI Red Teaming Guide、Anthropic Zero Trust for AI Agents白皮书、AIRTBench论文等。
Originally published by Dev.to Security. Aggregated on AIWithGhost for educational purposes — full credit and traffic to the original publisher.