EN
返回档案库

案例库 · 研发与科研 · 技术决策 · 2006–2014

差分隐私:通过隐藏个人数据使统计安全

德沃克的定义限制了单个人能改变的范围,然后通过校准噪声掩盖——隐私是可以证明的。

微软研究院

解法

到2000年代中期,'匿名化'数据集不断被重新识别,因为删除姓名并不能抹去数据本身的指纹。辛西娅·德沃克2006年的工作将隐私重新定义为算法的一个性质,而不是数据集的性质。

差分隐私要求添加或删除任何一条记录,输出分布只能变化一点点。拉普拉斯机制实现了这一点:计算真实答案,然后加上与查询的ℓ1敏感性成比例的噪声——即一个人能移动结果的最坏情况。

这一保证是形式化的、针对最坏情况的:无论攻击者拥有何种辅助信息,一个人的参与几乎不可见。组合定理允许系统回答许多查询,同时跟踪总隐私损失;2014年德沃克与罗斯合著的书系统化了这一理论。

生效的原因

  • 该界限针对任意辅助知识都成立
  • 拉普拉斯噪声针对最坏情况敏感性校准
  • 保证可跨多次查询组合
  • 保护的是个体,而不仅仅是数据集
取得的成效针对最坏情况敏感性校准噪声神来之笔

可借鉴之处

不要承诺隐藏数据——承诺一个人的存在不可区分。衡量一条记录能改变答案的最坏情况,然后用噪声覆盖:一个正式的界限胜过希望。

后续进展

差分隐私成为私有数据分析的标准形式化定义,被统计机构和科技公司采纳,用于官方统计和遥测数据;德沃克与罗斯合著的书至今仍是其权威参考。

资料来源

发现哪里写错了?告诉我们。

相关案例