当AI开始“动手”,问题就不再只是“动嘴”

过去两年,大模型的能力跃迁主要发生在“生成”层面——写代码、写文案、做总结。但当AI Agent(智能体)开始调用工具、执行命令、访问网络、操作文件系统时,问题的性质发生了根本变化:它不再只是一个语言模型,而是一个有副作用的执行体

蚂蚁AI Agent的大规模企业级实践、Figma用AI代理提升安全性,这些线索背后指向同一个基础命题:如何让一个不可完全信任的智能体,在可控边界内安全地执行任务? 这就是“沙箱”与“执行边界”要解决的问题。

一、沙箱的本质:不是隔离,而是“可控的暴露”

很多人把沙箱理解为“把东西关起来”。这个理解不算错,但不够本质。沙箱的核心不是禁止,而是定义边界——让被隔离的进程只能看到、只能操作边界内允许的资源。

从操作系统视角看,沙箱依赖几个基础机制:

  • 命名空间(Namespace) :让进程拥有独立的PID、网络、挂载点、用户等视图。容器技术的基础。
  • 控制组(Cgroup) :限制CPU、内存、IO等资源用量,防止一个Agent耗尽整台机器。
  • 能力(Capability)与Seccomp:细粒度控制系统调用,决定进程能执行哪些内核操作。
  • 文件系统挂载与chroot:限制可见的文件树范围。

这些机制组合起来,构成一个最小权限执行环境。AI Agent在里面跑代码、调工具,即使行为异常,影响也被限制在边界内。

关键认知:沙箱不是一堵墙,而是一套权限模型。墙是被动的,权限模型是主动设计的。

二、执行边界:Agent安全的核心抽象

如果说沙箱是“在哪里跑”,执行边界就是“能做什么”。蚂蚁的实践之所以值得关注,是因为企业级场景下,Agent的行为空间必须被精确刻画。

一个Agent的执行边界至少包含四个维度:

1. 资源边界 它能访问哪些文件、哪些网络端点、哪些数据库?这类似网络ACL,但粒度更细。比如一个代码生成Agent可能需要读代码库,但不应有写生产数据库的权限。

2. 时间边界 单次任务最长执行多久?是否有超时熔断?无限循环的Agent比崩溃的Agent更危险,因为它持续消耗资源。

3. 副作用边界 哪些操作是幂等的、可回滚的?哪些是不可逆的?发送邮件、删除文件、调用支付接口,这些必须被单独标记和审批。

4. 信任边界 Agent调用的工具本身是否可信?工具返回的数据是否可能被注入?这是提示注入问题的根源——Agent读到的内容可能包含恶意指令。

这四个维度构成了Agent的能力矩阵。设计Agent系统时,先画这张矩阵,再谈实现。

三、从进程隔离到“意图隔离”

传统沙箱解决的是代码隔离:这段代码不可信,把它关起来跑。但AI Agent带来一个新问题:代码是Agent自己生成的,意图也是Agent自己推断的

这意味着隔离的层次要往上走一层。不仅要隔离进程,还要隔离意图

举个例子:你让Agent“整理项目文档”。它可能推断出需要读取所有文件,于是遍历目录;也可能推断出需要“清理旧文件”,于是执行删除。后者就是意图偏离。

应对思路有几类:

  • 能力预声明:Agent在行动前必须声明需要哪些能力,系统据此授权。类似移动端的权限弹窗,但自动化。
  • 执行前模拟:在真正执行前,先dry-run,检查副作用。
  • 人在回路:高风险操作强制人工确认。
  • 审计与回放:所有操作留痕,可回溯、可撤销。

这里有一个深层矛盾:Agent越自主,边界就要越严格;边界越严格,Agent的能力就越受限。企业级实践的本质,就是在这条曲线上找到平衡点。

四、一个具体的边界模型:能力令牌

为了让概念落地,可以用一个简化模型说明执行边界如何实现。

假设Agent要执行一个任务,系统不直接给它文件系统权限,而是发放能力令牌(Capability Token)

token = {
    "resources": ["/project/docs/*"],
    "operations": ["read"],
    "expires_at": "2025-01-01T00:10:00Z",
    "max_calls": 100
}

Agent的每次操作都要携带令牌,由策略执行点(PEP) 校验。这类似OAuth的scope机制,但更细粒度。

这个模型的好处是: - 权限是显式的,不是隐式的环境继承。 - 权限是可过期的,不是永久授予。 - 权限是可审计的,每次校验都有记录。

它把“沙箱”从一个静态容器,变成了一个动态的权限协商过程

五、为什么这是基础理论问题,而不只是工程问题

回到线索中的另一个观察:当AI写出更多代码,企业为什么没有跑得更快?答案往往不在模型能力,而在执行边界没有设计好——代码写出来了,但不敢让它自动部署;Agent能操作了,但不敢给它生产权限。

这说明,AI Agent的瓶颈正在从“智能”转向“可控”。而可控性的基础,是操作系统级别的隔离机制、权限模型、审计能力。这些不是新框架能绕过的,它们是计算的底层约束

沙箱和执行边界,本质上是把信任问题转化为权限问题。你无法让一个概率模型100%可信,但你可以让它即使不可信,也无法越界。

结语

AI Agent的规模化落地,不会只靠更强的模型。它需要一套扎实的基础设施:命名空间、能力控制、策略校验、审计回放。这些概念在操作系统和网络安全领域已经存在几十年,现在被重新组合,用来回答一个新问题——当执行者不是人,边界该怎么画?

理解沙箱与执行边界,不是为了追热点,而是为了在下一波Agent浪潮中,知道地基在哪里。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐