当你的手机和电脑交给各种AI工具时,大概率有过一瞬间的心慌:它会不会手滑删错东西?比如:AI 编码助手、小龙虾帮你跑终端命令、整理电脑的照片、视频等等。

最近Codex团队发布的一轮安全更新,把这份担忧摆到了台面上,他们确实修复了一个可能让AI误删用户文件的严重问题。

一场差点发生的“文件灾难”

事情的起因是几周前,少量用户反馈:Codex中的GPT-5.6会执行超出指令范围的破坏性操作。其中最危险的一个场景,是本应清理临时工作文件的命令,最终却指向了用户的真实文件目录。

官方复盘后,找到了两个核心的故障诱因:

  • 路径复用的隐患。Codex工作时经常会创建临时文件夹,任务结束后自动清理。但在极少数情况下,模型会错误地复用 $HOME 这类系统环境变量来存放临时文件。一旦清理命令格式出错,就会直接作用在用户的主目录上,而非临时文件夹。
  • 无校验的删除操作。模型在执行删除、覆盖路径的操作时,不会预先检查目标路径内原本有什么内容,相当于闭着眼执行删除指令。

我在推文上就看到一个哥们说,Codex 误删除了他电脑上5000多张照片。

全链路加固:不只是修一个Bug

针对这些问题,Codex团队没有只做单点修复,而是在多个层级都补上了防护,相当于给AI的操作行为套上了多层安全笼。

第一层是模型行为的硬约束。现在Codex会被明确要求:执行删除前必须校验目标路径、必须创建全新的独立临时目录、禁止随意复用系统环境变量、优先选择可恢复的操作,一旦对操作范围有疑问就立刻停止。相当于给AI植入了一套“操作前三思”的行为准则。

第二层是执行层的风险拦截。系统强化了对高危删除命令的识别机制,一旦判定风险过高就会拦截并进入复审;如果命令被拒绝,会引导模型改用更安全的实现方案。这是在AI和你的文件系统之间,加了一道人工逻辑的安全阀。

除此之外,团队还抬高了“全权限模式”的开启门槛,减少误触可能,补充了更醒目的风险警告,并直接限制了部分高危权限组合;自动审核模块也做了升级,对破坏性操作的识别精度更高。

最值得关注的是训练层面的修正。他们把本次出现的故障场景做成了定向评测集反复回放验证,同时在强化学习中加入了针对这类风险的任务与评分机制,还会从训练数据里过滤破坏性操作内容——从根源上减少模型学到危险行为的概率。

根据官方的复现测试结果,这些改动大幅降低了危险行为的发生概率,同时基本没有折损Codex完成正常编码工作的效率。这点其实挺难得:很多安全策略一加,工具就变得束手束脚,能在安全与体验之间找到平衡,算是一次合格的迭代。

给使用者的两个提醒

安全从来不是厂商单方面的事。官方也给所有使用者提了两个非常务实的建议,我自己也十分认同:

  • 保持Codex客户端更新。这类安全修复大多是静默迭代的,只有运行最新版本,才能享受到完整的防护机制。
  • 优先使用沙箱模式,也就是“Ask for approval(请求批准)”或“Approve for me(替我批准)”模式。Full access(完全访问权限)只建议用在你完全信任、并且数据可以随时恢复的环境中。

我自己的习惯是,只要涉及文件删除、批量修改、系统级命令的操作,一律开审批模式。完全访问权限不要给AI。

写在最后

现在AI开发工具的能力边界扩张得很快:从补全代码到排查Bug,再到直接操作文件系统、执行终端命令,几乎快要接管我们的整个开发环境。但能力越强,失控的成本就越高。

这次Codex的安全事件算不上严重事故,但它给所有开发者和AI工具厂商都提了个醒:当AI拥有了修改我们本地环境的权限时,安全永远应该走在功能前面。

对我们使用者来说,永远别把所有信任都交给AI。收一收权限,做好备份,多一步确认,总不会错。

文章来源:https://defaultcode.cn/ 默认代码-宁波开发者技术社区

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐