第四百三十五章 数据治理细则与审计落地
晶圆缺陷分布数据、设计域的版图层数数据、生态域的用户行为日志,三者的脱敏要求完全不一样。如果把制造域的数据脱敏标准强行套到生态域上,生态数据里的异常功耗触发条件——就是阿贡发现的那种——就会被脱敏算法当作‘异常值’自动抹掉,而这些异常值恰恰是我们做质量改进最有价值的信号。”

    郑工敲了几下键盘,屏幕上弹出一张表格。表格里列着六个数据域中每一种数据类型在脱敏处理中的最小颗粒度要求。制造域的晶圆缺陷坐标精度可以脱敏到五十微米而不影响工艺分析,设计域的版图数据需要脱敏到标准单元级别才能保护设计机密,生态域的用户设备型号必须保留完整而不能被泛化——因为阿贡发现的基带芯片功耗异常只有在特定设备型号和特定运营商频段组合下才会触发,一旦泛化就丢失了定位故障的全部线索。

    “脱敏标准不能一刀切。”郑工说,“但脱敏标准的制定过程可以一刀切——不论哪个域,脱敏规则的制定、审批、修改和生效日期都必须走同一套治理流程,每一条脱敏规则的背后都必须附着明确的业务理由和风险评估,且全部留痕。”

    周明在会议纪要上写下数据治理细则的第一条内核条款草案:“数据脱敏标准由各数据域负责人根据业务须求提出,经数据治理委员会审议批准后生效。每一条脱敏标准均需附带业务必要性说明和风险评估报告,审议过程保留完整记录,记录对外公开。”

    讨论进入数据访问权限分级时,秦教授提出了一个让在场所有人都不得不正视的问题。神农AI的临床数据目前采用的是二级审批——数据用户提交申请,经秦教授和医院伦理委员会两位委员共同批准后即可获取脱敏后的数据。但安德松教授在访问时无意中发现,神农AI的模型训练日志——不是原始临床数据,而是模型在训练过程中的中间参数更新记录——同样被纳入了二级审批的范围。这个设计导致赵静团队在做预调度模型与神农AI的联合调优时,每一次调参都要等至少两个工作日的审批周期。

    “临床原始数据的严格审批是对的。”秦教授说,“但模型训练日志的安全级别不应该和原始临床数据一样。把两者的审批门坎拉平,表面上是提高了安全标准,实际上是降低了研发效率——而且这种降低不会换来任何实质性的安全保障,因为模型训练日志里根本没有可追朔的个人信息。”

    周明把这个问题放大到了全部六个数据域。追光产线的设备传感器数据、补天工具链的代码提交日志、天罡OS的应用崩溃记录——这些数据的敏感级别各不相同,但目前的访问审批规则大多是在各自为政的状态下临时设置的,有的过于宽松,有的过于严格,几乎没有跨域的一致性。

    他提出的解决方案是在数据治理细则中创建一套三级数据访问权限体系。一级是公开数据——任何内部员工和签署了数据使用协议的合作伙伴均可直接访问,包括设备稼动率汇总统计、天罡OS装机量公开数据、补天工具链的公开文档和基础模块代码。二级是受限数据——需经数据域负责人审批后方可访问,包括产线工艺参数的详细记录、芯片设计版图的非内核局域数据、生态应用的非敏感用户行为统计。三级是受控数据——需经数据治理委员会全票批准后方可访问,包括芯片设计版图的内核电路局域数据、神农AI的原始临床数据、用户个人身份关联数据和产业链供应商的内核工艺参数。

    这套三级体系的命名直接沿用了天罡Edge接口安全分级的框架——不是巧合,是周明刻意为之。他在会议桌上摊开了天罡Edge接口三级安全分级体系的文档,指着上面“一级公开、二级受限、三级受控”的分类标签说:“天罡Edge的安全分级已经在联合检测验证工作组那里作为参考基准案例。数据治理细则沿用同一套分级逻辑,可以最大限度减少外部审计的理解成本——审计方不需要重新学一套新的分类体系,只需要确认同一套逻辑是否被一致地应用到了数据治理领域。”

    方程在视频那端翻出了天罡Edge安全分级体系的设计文档。文档的起草人是林薇,当时在天罡Edge全球合作试验决策会上,陈醒以“被审计比被怀疑强”定调之后,林薇用了一个周末把接口安全分级的第一版草案写了出来。“天罡Edge安全分级从草案到正式发布用了六周。数据治理细则能不能更快?”方程问。

    “不能。”周明回答得很干脆,“因为数据治理细则不是一份技术文档,而是一部制度立法。每一个条款都要经过六个数据域负责人的逐条确认,每一个定义都要在真实数据流上做回归验证,每一个审批流程都要在试运行中暴露问题、迭代修正。最重要的是——数据治理委员会的外部委员遴选需要时间。星环学术委员会、补天高校团队和独立审计机构各自推荐候选人,候选人背景审查,利益冲突申报,全部走完至少需要四周。”

    苏黛从产业扶持基金评审会的中场休息中拨进视频,听到周明的时间表后

本章未完,请点击下一页继续阅读>>