Cloudera Field CTO:当AI Agent“满天飞“,谁守住企业数据的底线?

Cloudera Field CTO、网络安全负责人Carolyn Duby
未来6至9个月,网络安全市场或将出现一类新的AI Agent。其不负责分析报表,也不直接处理业务,主要任务是持续观察其他Agent调用了哪些数据、使用了什么工具,有没有越过权限边界。
Cloudera Field CTO、网络安全负责人Carolyn Duby将其称为“守卫智能体”(Guardian Agent)。她认为,企业需要给业务端的Agent配备一名“数字警察”,借助AI监督AI。
这类需求,目前在市场中已经开始显现。
事实上,传统的安全体系主要负责管理用户、设备和服务账号,而AI Agent的应用,增加了动态规划、工具调用、代码生成和多步骤执行能力。其执行一次任务会同时遍历数据库、业务系统和多个云环境,安全团队既要确认其能访问什么,还要弄清实际做了什么。
最近,在新加坡Cloudera EVOLVE26期间,至顶网专访了Carolyn Duby。围绕混合云、私有AI、安全数据湖仓,以及Agent治理问题,她强调,企业能否安全地使用AI,很大程度上取决于数据是否可控、可追溯并具备足够的上下文。
对话实录(整理):
01 跨云部署的“数据引力”
1、许多企业部署AI时,非常看重工作负载能否在本地数据中心和不同云平台之间迁移。获得这种灵活性,是否意味着必须牺牲性能?
Carolyn Duby:工作负载的可移植性和性能并不是天然对立的,关键在于架构设计之初,是否充分利用了不同运行环境的原生能力。
以Cloudera的公有云产品为例,我们会与Amazon S3、Azure Data Lake Storage等云原生存储服务进行深度集成,使数据访问、配置和计算能够适配不同云平台的底层架构。这样一来,工作负载迁移到不同环境后,仍然可以利用目标平台的原生能力,而不是以牺牲性能为代价换取可移植性。
另一方面,大规模数据本身具有很强的“数据引力”。如果将数据留在一个地方,而计算任务运行在另一个数据中心或云环境中,就必须进行大规模的数据迁移,由此就会带来网络延迟、传输成本,以及额外的安全风险。
因此,更合理的方式是让计算尽可能靠近数据。
这也是我们在设计跨环境架构时关注的重点。无论数据位于本地数据中心还是公有云,只要运行环境和相关配置保持兼容,我们数据处理体系中的计算引擎Spark,就可以在数据所在的位置执行,不必为了更换运行环境而进行大幅修改作业。
这样一来,企业既能够根据实际需求灵活迁移工作负载,又可以减少数据跨环境传输,在保持性能的同时,实现一致的安全治理和运维方式。
2、Cloudera一直在强调“私有AI”。对于核心数据较为敏感的企业,私有AI主要解决什么问题?与第三方SaaS模式的关键区别在哪里?
Carolyn Duby:私有AI首先解决的是企业对数据的控制问题。
当企业使用第三方SaaS模型时,提示词、检索内容以及相关业务数据通常需要进入服务商托管的环境完成推理。数据如何留存、是否用于模型训练,取决于具体产品、合同条款和隐私政策。
但无论如何,企业都需要将部分数据处理交给外部服务商,这意味着原有的数据边界发生了变化,企业也需要对新增的外部信任关系进行管理。
私有AI则是将模型和推理能力部署在企业能够直接控制的环境中,这一环境既可以是本地数据中心,也可以是企业自己的云账户或VPC。
这样,AI应用处理的数据仍然可以沿用企业现有的访问控制、审计和数据治理机制,不需要为了调用模型而频繁将核心数据交给外部环境。
因此,两者的关键区别除了“模型部署在哪里”,更重要的是谁控制数据处理环境,以及企业能否继续沿用原有的数据安全和治理体系。对于金融、医疗、制造等涉及大量敏感数据的企业而言,这种控制能力尤其重要。
02 网络安全的“数据大关”
3、您曾提出“网络安全是数据问题”。那么企业SOC(安全运营中心)在数据层面面临哪些主要障碍?
Carolyn Duby: 根据企业规模和数据采集范围,在具体场景中每天产生的安全数据可以达到10TB至50TB。这些日志和事件会持续进入系统,而安全团队则需要尽快判断其中是否存在风险。
历史数据同样重要。许多高级攻击具有“低调、缓慢”的特征,攻击者可能潜伏很长时间,通过一系列看似无关的操作逐步接近目标。如果系统只保留短期数据,或者每次只分析很小的时间窗口,安全团队很难发现完整的攻击路径。
另一个挑战来自工具的分散。不少企业同时运行数十种安全工具,分别处理终端、网络、身份、云平台和应用安全。不同工具的数据格式和告警机制缺乏统一标准,分析人员需要在多个界面之间反复切换。数据没有经过清洗、标准化和关联,AI很难给出可靠判断。
4、很多企业已经购买了带有AI功能的安全产品,SOC仍然会收到大量误报。问题出在哪里?
Carolyn Duby:问题出在缺少跨系统的上下文,这是误报长期居高不下的常见原因。
某个安全工具看到局部异常后可能立即报警,却不了解同一事件在其他系统中的处理结果。威胁也许已经被另一道防线拦截,相关告警却没有被关联起来。分析人员看到的是许多碎片信息,很难快速还原事情的全貌。
所以,企业需要先形成统一的安全数据视图。
Cloudera Data Warehouse中的Apache Trino可以对分散在不同系统中的数据进行联邦查询,在合适的场景下减少数据的复制和搬移;Cloudera的开放数据湖仓则可以集中保存关键日志,并为长期分析提供统一的数据结构。数据流进入湖仓之前,还需要完成解析、标准化和信息补充。
当AI能够同时看到终端、网络、身份和应用等多类信号,其才有条件把分散线索串联起来,帮助安全团队判断告警的优先级。尽管这样的数据基础无法根除所有误报,但却可以明显减少重复告警和缺乏上下文的判断。
5、建设安全数据湖仓听起来成本很高,这类项目是否只有公共部门和大型企业承担得起?
Carolyn Duby:建设安全基础设施确实需要投入,企业也需要把这笔投入与安全事件可能造成的损失放在一起计算。
比如,埃克森美孚是我们公开的合作客户之一。对于这样的大型能源企业,一次严重的网络攻击可能造成生产或业务系统中断,随后还会产生调查、恢复、合规处罚、诉讼,以及声誉损失。
所以,企业需要结合自身的业务规模、数据敏感程度和潜在攻击损失,判断应该建设多大规模的安全数据底座。只计算平台采购成本,很难看清完整的风险账目。
03 从流数据溯源到拆分Agent权限
6、现在的业务越来越依赖实时流数据。如果提供给AI的数据在传输过程中被篡改,企业怎样发现问题?
Carolyn Duby: 实时流数据需要同时保障机密性和完整性。传输链路缺少加密、身份验证、访问控制时,数据就有可能被泄露,甚至被未经授权的主体修改。
基于Apache NiFi构建的Cloudera Data Flow,其数据溯源能力可以记录数据的来源、处理步骤、修改信息,以及流向。结合Kafka、Flink和Cloudera SQL Stream Builder等流式处理工具,企业可以持续检查数据状态,发现异常变化。
不过,数据溯源本身不能证明源头数据一定真实,也无法代替加密、权限控制和完整性校验。其价值在于留下完整记录。一旦数据出现异常,安全团队可以追查问题在哪个环节发生,判断哪些下游系统和AI应用可能受到影响。
7、AI Agent可以调用数据库、业务系统和代码工具。在混合云、多云环境中,传统的身份和权限管理还够用吗?
Carolyn Duby: 现有的非人类身份管理仍然重要,但Agent带来了更多需要管理的动态行为。传统服务账号通常执行相对固定的操作,而Agent会根据模型输出规划步骤、选择工具,甚至生成代码。一次权限配置失误,会经过连续调用后,被进一步放大。
所以,Agent治理首先需要足够的可观测性和审计能力。企业要记录Agent如何分解任务、调用了哪些工具、访问了什么数据、生成了哪些代码和中间结果。
Cloudera AI Agent Studio可以帮助企业保留相关日志,让安全团队能够还原Agent的实际执行过程。
另外,评估机制也要贯穿Agent的运行周期。企业需要持续检查Agent的输出和行动是否符合业务目标、安全政策及合规要求,尤其要关注其在异常输入和复杂环境下的表现。
权限设计方面,应尽量避免把大量能力集中到一个通用Agent中。更稳妥的做法是拆分任务,让每个Agent只拥有完成特定工作所需的数据和工具权限,并将代码执行限制在隔离环境内。
此外,企业还需要统一的控制平台。无论Agent运行在AWS、Azure、Google Cloud还是本地数据中心,身份、权限、安全政策和审计记录都应保持一致。否则,跨环境部署越多,就越容易出现配置偏差和治理盲区。
我预计,未来6至9个月,网络安全市场将会出现“守卫智能体”。它类似于专门巡逻的警察,持续观察其他Agent的工具调用、数据访问和执行行为,在发现偏离预期的操作时发出告警。
当企业开始用Agent处理真实业务,用AI监督AI也会成为安全体系的一部分。
目前,Cloudera正在与合作伙伴共同探索这一方向,希望在Agent大规模进入企业系统之前,先建立起可观察、可审计、可控制的运行环境。
更多推荐

所有评论(0)