当下越来越多的前沿研究印证了一个颠覆行业认知的结论:AI智能体遭遇攻击、出现风险漏洞时,问题往往不在于核心大模型,而在于包裹、调度、驱动模型运行的外层代码,但遗憾的是,绝大多数企业的AI安全防护重心,始终聚焦在模型本身,对这一致命的隐形短板视而不见。

长久以来,行业里存在一个固化的思维惯性。如果我们询问安全研究员,是什么让AI智能体产生安全隐患,他们的第一反应几乎都会围绕大模型展开:模型的安全边界在哪里、能否抵御提示词越狱攻击、模型权重是否安全可信。

但这套传统认知,早已跟不上AI安全的迭代节奏。如今,从各类漏洞复现演示、专业红队渗透测试,到一线安全研究员的实战评估,大量研究结果指向了同一个核心真相:AI智能体真正的安全软肋,藏在连接大模型与真实世界的外层代码之中。

在行业内,这段关键代码被统一命名为外壳层,它如同AI智能体的“外接躯干”,包裹着核心模型,为模型调配各类工具,并将模型逐一生成的文本Token,转化为可落地的真实操作——服务器指令、文件读写、第三方API调用等。可在绝大多数企业的研发体系中,这层关键代码长期处于“三无状态”:无完整台账记录、无全面安全测试、无专人专项负责运维,沦为AI安全的真空地带。

一系列真实的攻防案例,直观揭露了外壳层的致命风险。

Novee Security创始工程师、资深安全研究员Elad Meged,仅凭借GitHub公开问题报告中的细微漏洞,就成功入侵了Anthropic、Google、OpenAI三家头部企业的官方自动化代码库。整个攻击过程无需突破大模型安全防线,仅利用外壳层的代码缺陷就完成了渗透。

Lasso Security的专项实验数据更具说服力:在固定大模型、提示词、工具配置完全一致的前提下,研究团队仅替换了部分本该中立稳定的智能体管道代码(外壳层模块),就让AI模型的攻击成功率从1%飙升至24%,安全风险直接翻倍激增。

AI安全公司Zenity联合创始人兼CTO Michael Bargury也发现了全新攻击路径:攻击者将窃取凭证的恶意程序,隐藏在AI智能体的自定义“技能”中,这些携带恶意代码的技能,成功绕过了市面上主流安全检测工具的筛查,其中不乏Anthropic、Cisco等大厂的官方防护体系。

这些安全事故的表现形式各不相同,却有着高度统一的核心特征:所有攻击都无需篡改、污染大模型本身,也无需诱导模型产生异常行为。攻击者的突破口,始终是模型外围的软件体系——这套决定了模型可视范围、操作权限、行为边界的外壳层代码。

也正因如此,越来越多的AI安全研究者呼吁行业重塑安全认知:必须将外壳层视作独立、高危的攻击面,而非依附于大模型、可以忽略不计的辅助脚手架。

到底什么是AI外壳层?行业大咖的通俗解读

对于长期深耕AI安全领域的从业者而言,外壳层没有晦涩的官方教条定义,每个人都能用通俗的比喻,精准概括它的核心价值。

在接受CSO媒体采访时,Bargury将其比作AI智能体的“手脚与双眼”。核心大模型的唯一工作,是完成文本Token的输入与输出、实现逻辑推理;而外壳层,负责把模型抽象的文本指令,转化为对接真实系统的落地操作,串联起模型与现实场景的所有交互。

SANS Institute首席AI官、研究主管Rob T. Lee给出了更具象的机械类比:大模型是AI智能体的核心发动机,而外壳层是承载、支撑、调度发动机的整车底盘,决定了整机的运行逻辑与安全下限。

Lasso Security高级机器学习工程师Michael Sromin则将其定义为AI智能体的专属操作系统,他表示:“在我看来,外壳层承载了智能体的核心循环逻辑,串联起大模型、工具组件与用户需求,支撑着AI应用不间断的完整运行流程。”

Cisco杰出工程师Omar Santos则给出了最严谨、最全面的官方定义:“AI外壳层是包裹在大模型外层、保障模型落地运行的完整代码体系,它涵盖了任务编排、工具调用、提示词管理、上下文加载、角色权限、效果评估、安全护栏,以及将模型原始输出,转化为标准化、可管控、可复盘的业务工作流的全部能力。”

所有解读最终指向同一个安全核心:外壳层是AI智能体行使所有权限的唯一载体,它横亘在大模型的推理能力,与真实的文件系统、接口密钥、生产数据库之间,是AI对接企业核心数据与业务的唯一通道,也是所有安全风险的集中爆发点。

正如Santos反复强调的:“安全团队必须把外壳层当作核心攻击面,因为智能体的所有操作权限、上下文信息、业务操作路径,全部来源于这层代码。”

更关键的是,外壳层代码和所有传统软件一样,存在天然的漏洞风险。即便企业部署了一个经过极致安全对齐、零缺陷的大模型,一旦配套的外壳层存在配置漏洞——比如采用通配符信任模式、在不可信内容处理后复用工作区间,那么模型所有的安全对齐能力都会彻底失效。此时的安全隐患,与模型本身毫无关联。

三大失效模式:外壳层漏洞的核心风险场景

今年多项重磅专项研究,系统拆解了外壳层的安全失效逻辑,将其风险归纳为三类核心模式:架构信任边界漏洞、设计实现缺陷、供应链污染。三类风险根源不同,但最终都指向同一个高危攻击面。

1. 架构信任边界失效:决策与权限脱节

这一风险的典型案例,正是Elad Meged在黑帽大会上公开的渗透研究,他仅凭GitHub公开漏洞,就成功突破了Anthropic、Google、OpenAI三大厂商的官方自动化程序。

Meged总结了这类漏洞的共性逻辑:低权限组件负责安全决策,高权限组件无条件信任执行,全程无二次校验。

三家大厂的具体漏洞表现各有不同:有的允许外部代码执行、有的会泄露外壳层本应清除的私密凭证、有的可被植入恶意指令,且后续高权限流程会直接采信这些指令、不做重新核验。

但底层架构缺陷完全一致:系统前端组件完成安全判定后,下游更高权限的核心组件盲目信任前置结论,跳过了二次安全校验,这是典型的架构设计漏洞,全程不存在任何模型缺陷,纯粹是外壳层的信任边界管控失效。

2. 设计实现缺陷:外壳层决定智能体安全下限

Lasso Security的研究打破了行业另一个普遍误区:很多人认为,只要模型、工具、配置足够安全,智能体就不会有风险,外壳层只是无关紧要的传输管道,但事实证明,即便没有显性代码漏洞,外壳层的设计选择,也能彻底改写AI智能体的安全属性。

“当你选定大模型、工具、全套参数后,最终的智能体安全形态,由外壳层决定。”Sromin解释道,“更换一套外壳层,哪怕核心模型完全不变,你得到的也是一款安全特性截然不同的全新智能体。”

实验数据足以印证这一结论:在开源模型、任务场景、工具配置完全统一的条件下,仅替换外壳层代码,模型攻击成功率就从1%暴涨至24%。在100组模型与任务的配对测试中,有43组的安全结果被彻底颠覆。

Sromin着重提醒:“外壳层的选择绝非无关紧要的微调,而是影响智能体全场景运行的核心安全决策,足以改变AI落地应用的整体安全格局。”他建议企业必须对模型与外壳层进行同步安全基准测试,若盲目选用开源现成方案,相当于在不知情的情况下,埋下重大安全隐患。

3. 供应链污染:AI技能引发的新型渗透风险

Zenity团队在Bargury的主导下,发现了外壳层最隐蔽、传播性最强的风险——快速扩张的AI供应链,已成为攻击者的重点突破口,而核心载体就是AI“技能”。

所谓AI技能,是教导智能体完成各类专项任务的配置文件,这类文件让传统的供应链攻击,以全新的形态卷土重来。“这不是新型漏洞,而是经典的供应链污染问题,在AI智能体场景下的复刻与升级。”Bargury在黑帽大会上说道。

相较于传统软件供应链攻击,AI技能的风险更特殊、更顽固:它能够长期篡改智能体的信任环境,实现持续性渗透。

Zenity披露的攻击案例极具代表性:恶意技能可将自身写入智能体的内存配置,即便用户手动删除该技能,自动重装的恶意指令仍会留存,待智能体下次启动时自动复原,实现反复入侵,另有恶意技能会伪装成Anthropic官方合法工具,运行后悄悄替换原生程序,在用户无任何感知的情况下,持续执行恶意代码。

最触目惊心的是一场大规模开源工具攻击:攻击者批量克隆热门AI开源工具,暗中植入窃取登录凭证的恶意代码,再上传至skills.sh平台,这些篡改后的恶意工具,凭借更优的展示效果吸引用户下载,在风险曝光前,累计下载量高达170万次,造成大范围安全泄露。

三项顶尖研究共同印证了一条核心铁律:保护好大模型,绝不等于保护好了AI智能体。忽略外壳层安全,再安全的模型防护都会形同虚设。

给企业CISO的安全整改指南

针对以上系列风险,所有企业CISO需要聚焦三大核心工作,快速补齐AI安全短板:全面梳理企业内部所有运行中的外壳层、严格管控外壳层的资源访问权限、独立核验外壳层的安全防护有效性。

首先,全面摸排隐形存在的AI外壳层资产,这一步看似基础,实则是多数企业的安全盲区。目前行业内没有统一的“AI外壳层”资产分类标准,导致这类核心代码长期游离于安全台账之外。

正如Santos所言:“企业团队习惯以应用、服务、流水线、智能助手的维度划分资产,却从未意识到,这些五花八门的载体背后,本质都是AI外壳层。”不同业务团队对其命名各不相同,智能体、Copilot、工作流助手、插件自动化系统,看似品类不同,核心都是驱动AI运行的外壳层代码。

对此,Santos给出明确落地建议:为所有生产环境中的AI智能体建立专属台账,精准识别每一套外壳层,全面梳理其可调用的工具、可访问的资源,严格执行最小权限原则,最大限度缩减攻击面。企业无需追求一步到位的全局管控,可优先排查生产核心系统,后续迭代优化原型与测试环境,快速实现70%以上的资产可见性。

其次,严格管控外壳层的所有信任源,AI智能体并非独立运行,会持续从插件、技能、外部服务器、网页接口、业务系统获取指令与数据,且普遍持有企业用户的操作凭证与权限,这意味着攻击者根本无需攻破大模型,只需污染外壳层信任的任意一个外部资源,就能实现渗透攻击。

Bargury用一个通俗的比喻警示企业:“部署AI智能体,相当于把承载你所有身份信息、私密文件、核心密钥的电脑,对外共享使用。一旦防护缺位,所有数据都将暴露在风险之中。”

对于暂无专项AI安全预算的中小企业,他给出了兜底方案:至少通过开源隔离工具实现智能体的独立运行,虽无法彻底根除风险,但能大幅降低安全隐患。

同时,AI智能体的供应链复杂度,远超传统软件体系。“传统软件供应链,核心也就十余类包管理器。但AI智能体的供应链包罗万象,任意文本、图片、网页、业务数据、自定义技能、外部服务器,甚至互联网上的所有公开内容,都能成为它的信任来源。”Bargury表示,这种无边界的供应链,让传统防护体系彻底失效。

最后,摒弃对厂商官方安全声明的盲目信任。目前多数厂商公布的AI安全数据,往往脱离真实落地场景,不具备实际参考价值。很多厂商宣称可拦截99%提示词注入攻击,其基准测试环境与企业真实部署环境天差地别。

Lasso Security的实验早已证实这一点:模型、提示词、工具完全不变,仅更换外壳层,安全防护效果就会彻底颠覆,这也说明,企业评估AI安全的核心思路需要彻底转变:不必执着于寻找“最安全的模型”,而要验证模型、外壳层、工具、权限、外部输入的整套组合,在自身真实业务场景下的安全稳定性。

曾攻破三大头部厂商自动化系统的Meged,给出了最直白的实战忠告:“不要迷信官方宣传文档,真正的安全风险,永远藏在产品的默认配置里,这也是所有攻击者的核心突破口。”

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐