案例库 · 研发与科研 · 技术决策 · 2006–2014
差分隐私:通过隐藏个人数据使统计安全
德沃克的定义限制了单个人能改变的范围,然后通过校准噪声掩盖——隐私是可以证明的。
微软研究院
解法
到2000年代中期,'匿名化'数据集不断被重新识别,因为删除姓名并不能抹去数据本身的指纹。辛西娅·德沃克2006年的工作将隐私重新定义为算法的一个性质,而不是数据集的性质。
差分隐私要求添加或删除任何一条记录,输出分布只能变化一点点。拉普拉斯机制实现了这一点:计算真实答案,然后加上与查询的ℓ1敏感性成比例的噪声——即一个人能移动结果的最坏情况。
这一保证是形式化的、针对最坏情况的:无论攻击者拥有何种辅助信息,一个人的参与几乎不可见。组合定理允许系统回答许多查询,同时跟踪总隐私损失;2014年德沃克与罗斯合著的书系统化了这一理论。
生效的原因
- 该界限针对任意辅助知识都成立
- 拉普拉斯噪声针对最坏情况敏感性校准
- 保证可跨多次查询组合
- 保护的是个体,而不仅仅是数据集
取得的成效针对最坏情况敏感性校准噪声神来之笔
可借鉴之处
不要承诺隐藏数据——承诺一个人的存在不可区分。衡量一条记录能改变答案的最坏情况,然后用噪声覆盖:一个正式的界限胜过希望。
后续进展
差分隐私成为私有数据分析的标准形式化定义,被统计机构和科技公司采纳,用于官方统计和遥测数据;德沃克与罗斯合著的书至今仍是其权威参考。
资料来源
发现哪里写错了?告诉我们。