数据合规这件事:大模型用了我司数据,我心里一直不踏实
一个技术负责人的碎碎念
去年年底那次评审会,我到现在都记得。法务总监把一摞材料推到桌子中间,抬头问我:“你们准备把客服对话记录喂给大模型做微调,这批数据能不能用?”我张了张嘴,没答上来。不是不知道法规,是那一瞬间我真没法拍板——这些对话里有没有身份证号、有没有银行卡尾号、有没有用户随手填的家庭住址,我一个都说不准。
这件事之后,我才知道“数据能不能喂给大模型”这九个字,背后藏着一个技术负责人整年的心惊肉跳。
合规这一年到底发生了什么
先把时间线捋一捋,免得有人说我危言耸听。2023年8月,《生成式人工智能服务管理暂行办法》落地,这是全球第一部专门针对生成式AI的规章,白纸黑字写了训练数据来源要合法、不能侵害个人信息权益。到了2025年底,《网络安全法》完成修正,2026年1月1日施行,第一次在法律层面写进了人工智能安全治理的要求。同一年,工信部等十个部门联合印发《人工智能科技伦理审查与服务办法(试行)》,把伦理审查从口号变成了要走的流程。再往后,《人工智能拟人化互动服务管理暂行办法》定在2026年7月15日施行,上海那边“浦江护航”2026专项行动也把大模型训练数据安全单列成了重点任务。
法规是越来越密了,这点不假。可落地到我们这种一家普通公司,问题就来了:文件读得懂,数据怎么分、合同怎么写、日志留多久,没人给我一份能照着抄的作业。
真正让人崩溃的几个时刻
第一道坎是数据分类。我们以为“敏感数据”就是带身份证的那批,结果年初看到全国信息安全标准化技术委员会在修订个人信息安全规范,草案把敏感个人信息的范围扩大了,连一些原本算普通的信息都可能被重新认定。我盯着我们的数据湖发呆:同一个字段,在A业务里是普通备注,在B业务里可能就是能定位到人的间接标识符。分不清,是真分不清。
第二道坎是合同。我们买了家云厂商的API做智能客服,回头翻采购合同,密密麻麻十几页,从头到尾没写一句“允许把我们的数据用于模型训练”。法务说这叫授权缺口,我说那之前三个月跑的调用算不算已经把数据交出去了?法务看了我一眼,没说话。后来才知道,像三星工程师把半导体资料粘进ChatGPT那种事,根子就在合同没写清“不得用于训练”。
第三道坎是云端API本身。数据一出内网,到了别人服务器上,我就失去了控制权。行业里那份调研我看过,主流平台普遍没开放训练数据退订,你输进去的内容会一直留在训练集里。我们走的是私有化部署,本以为高枕无忧,可推理时还是要调外部模型能力,这条缝怎么堵,至今没标准答案。
第四道坎是审计日志。监管要的是“出了问题能溯源”,可我们的日志记录到什么程度算够?模型版本记了,提示词记了,谁在几点调了什么接口记了,但训练数据血缘、每次微调用了哪批样本、这批样本脱敏到了哪一步——这些要么没记,要么散在三个系统里对不上。每次被审计问,我都心虚。
那些又气又笑的时刻
最荒诞的不是风险本身,是大家围着风险转圈却谁也不动。
法务在评审单上写:“该数据用途请技术判断。”技术这边回:“是否涉及个人信息请法务确认。”一个来回,谁都没往前走一步。有次我忍不住在群里说,要不咱们按最严的来,全部脱敏再训练。法务回:“脱敏到什么标准算合规,你给个依据?”我给了个字段级脱敏加差分隐私加K-匿名的组合方案,法务又问:“这个组合够不够通过审查,你技术能担保吗?”我担保不了,这事又悬在那了。
最后往往是业务等不及先上线,技术偷偷加一层脱敏,法务在合同补一句“供应商不得用于训练”——各退半步,谁都不敢说“完全合规”,但至少夜里睡得着一点。
怎么让心里踏实一点
折腾一年,我慢慢攒出几条能落地的土办法,不一定周全,但确实让我少做噩梦。
一、先把数据分清楚。公开、内部、敏感、核心四档,训练原则上不碰敏感及以上,非用不可的走审批、加脱敏、加单独授权。分级不是写给检查看的,是给自己划底线。
二、合同里把“AI能用吗”写死。采购任何带模型能力的服务,必须加一条:供应商不得将我方数据用于其模型训练或微调,违者追责。别信口头承诺,监管那边的逻辑很直接——你承诺了不用又在用,就是欺骗。
三、能私有化就私有化,但私有化不等于安全。推理接口、日志、备份都要按出网从严管,外部能力调用前想清楚数据是不是非出去不可。
四、日志留全留久。生成内容记时间、模型版本、提示词、审核人、发布渠道,保存期不低于三年,这是多家处罚案例里反复被要求自证的东西。
五、训练前脱敏,不是训练后补救。等模型把数据学进参数里,删源文件也删不干净——个人信息保护法下的删除权在模型权重面前是道真难题,重训一次的成本够喝一壶。
说到底,合规不是要把大模型挡在门外。我们这种公司,不用AI才真是等死。我要的只是:下次法务再问“这批数据能不能喂”,我能拍着胸脯说,分过级、脱过敏、合同写过、日志留着——心里那块石头,就这么一块一块搬开。
本文基于公开技术资料与行业实践整理,不构成具体产品选型或部署方案建议。
更多推荐

所有评论(0)