- iOS/Objective-C 元类和类别
- objective-c - -1001 错误,当 NSURLSession 通过 httpproxy 和/etc/hosts
- java - 使用网络类获取 url 地址
- ios - 推送通知中不播放声音
我在一本书(Interview Question)中读到这个问题,想在这里详细讨论这个问题。请点亮它。
问题如下:-
隐私和匿名化
马萨诸塞州集团保险委员会早在 1990 年代中期就有一个绝妙的主意 - 它决定发布有关州雇员的“匿名”数据,显示他们每次去医院就诊的情况。
目标是帮助研究人员。该州花时间删除姓名、地址和社会保险号等标识符。马萨诸塞州州长向公众保证,这足以保护患者隐私。
当时的一名研究生发现这种方法存在重大缺陷。她索取了一份数据副本,并通过整理多列数据,她能够识别出州长的健康记录。
这表明在匿名化数据时需要格外小心。确保隐私的一种方法是聚合数据,这样任何记录都可以映射到至少 k 个个体,对于某个较大的 k 值。
我想通过某种示例集实际体验这个问题,然后了解执行此匿名化实际需要什么。我希望你清楚这个问题......
我没有有经验的人可以帮我处理这类问题。请不要投票结束这个问题.....因为如果发生这种情况我会很无助......
谢谢,如果需要更多解释,请提出问题。
最佳答案
我只是复制粘贴了您文本的一部分,然后偶然发现了 this
这有助于理解您的问题:
At the time GIC released the data, William Weld, then Governor of Massachusetts, assured the public that GIC had protected patient privacy by deleting identifiers. In response, then-graduate student Sweeney started hunting for the Governor’s hospital records in the GIC data. She knew that Governor Weld resided in Cambridge, Massachusetts, a city of 54,000 residents and seven ZIP codes. For twenty dollars, she purchased the complete voter rolls from the city of Cambridge, a database containing, among other things, the name, address, ZIP code, birth date, and sex of every voter. By combining this data with the GIC records, Sweeney found Governor Weld with ease. Only six people in Cambridge shared his birth date, only three of them men, and of them, only he lived in his ZIP code. In a theatrical flourish, Dr. Sweeney sent the Governor’s health records (which included diagnoses and prescriptions) to his office.
轰!但这只是 Sweeney 职业生涯早期的里程碑。 2000 年,她表明,87% 的美国人可以仅使用三位信息进行唯一识别:邮政编码、出生日期和性别。
好吧,正如您所说,您需要一个随机数据库,并确保任何记录都可以映射到至少 k 个个体,对于某个较大的 k 值。
换句话说,您需要清除数据库中的歧视性信息。例如,如果您只在数据库中保留性别 (M/F),则无法找出谁是谁。因为只有两个条目:M 和 F。
但是,如果您取生日,那么您的条目总数将变为或多或少 2*365*80 ~=50.000。 (我选择了80年)。即使您的数据库包含 500.000 个人,也有可能只有其中一个人(假设是 1985 年 3 月 3 日出生的男性)具有此类条目,因此您可以认出他。
这只是一种依赖组合的简单方法。如果您想要更复杂的东西,请查找 correlated information和 PCA
编辑:让我们举个例子。假设我正在从事医疗方面的工作。如果我只保留
这导致类别总数为 2*4*2*50*12*10 = 96.000 个类别。因此,如果您的数据库包含 200.000.000 个条目(粗略估计数据库中美国居民的数量),您将无法识别某人。
这也意味着您不给出任何进一步的信息,没有邮政编码等...仅给出的 6 条信息,您可以计算出一些不错的统计数据(12 月出生的人生命周期更长吗?)但无法识别,因为 96.000 远低于 200.000.000。
但是,如果您只有所居住城市的数据库,例如有 200.000 居民,则无法保证匿名。因为 200.000 比 96.000“大不了多少”。 (“不大”是一个真正复杂的科学术语,需要概率方面的知识 :P )
关于algorithm - 隐私和匿名化 "Algorithm",我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/6249013/
我是 python 的新手。我试图找到我的文本的频率分布。这是代码, import nltk nltk.download() import os os.getcwd() text_file=open(
我对安卓 fragment 感到困惑。我知道内存 fragment 但无法理解什么是 android fragment 问题。虽然我发现很多定义,比如 Android fragmentation re
尝试对 WordPress 进行 dockerise 我发现了这个场景: 2个数据卷容器,一个用于数据库(bbdd),另一个用于wordpress文件(wordpress): sudo docker
这个问题已经有答案了: From the server is there a way to know that my page is being loaded in an Iframe (1 个回答)
我正在玩小型服务器,试图对运行在其上的服务进行docker化。为简化起见,假设我必须主要处理:Wordpress和另一项服务。 在Docker集线器上有许多用于Wordpress的图像,但是它们似乎都
我想要发生的是,当帐户成功创建后,提交的表单应该消失,并且应该出现一条消息(取决于注册的状态)。 如果成功,他们应该会看到一个简单的“谢谢。请检查您的电子邮件。” 如果不是,那么他们应该会看到一条适当
就是这样,我需要为客户添加一个唯一标识符。通过 strip 元数据。这就是我现在完全构建它的方式,但是我只有最后一部分告诉我用户购买了哪个包。 我试着看这里: Plans to stripe 代码在这
我有一个类将执行一些复杂的操作,涉及像这样的一些计算: public class ComplexAction { public void someAction(String parameter
这个问题已经有答案了: maven add a local classes directory to module's classpath (1 个回答) 已关闭10 年前。 我有一些不应更改的旧 E
我使用 fragment 已经有一段时间了,但我经常遇到一个让我烦恼的问题。 fragment 有时会相互吸引。现在,我设法为此隔离了一个用例,它是这样的: Add fragment A(也使用 ad
我的 html 中有一个 ol 列表,上面有行条纹。看起来行条纹是从数字后面开始的。有没有办法让行条纹从数字开始? 我已经包含了正在发生的事情的片段 h4:nth-child(even) {
如何仅使用 css 将附加图像 html 化? 如果用纯 css 做不到,那我怎么能至少用一个图像来做 最佳答案 这不是真正的问题,而是您希望我们为您编写代码。我建议您搜索“css breadcrum
以下是 Joshua 的 Effective Java 的摘录: If you do synchronize your class internally, you can use various te
在这里工作时,我们有一个框向业务合作伙伴提供 XML 提要。对我们的提要的请求是通过指定查询字符串参数和值来定制的。其中一些参数是必需的,但很多不是。 例如,我们要求所有请求都指定一个 GUID 来标
我有 3 个缓冲区,其中包含在 32 位处理器上运行的 R、G、B 位数据。 我需要按以下方式组合三个字节: R[0] = 0b r1r2r3r4r5r6r7r8 G[0] = 0b g1g2g3g4
我最近发现了关于如何使用 History.js、jQuery 和 ScrollTo 通过 HTML5 History API 对网站进行 Ajax 化的要点:https://github.com/br
我们有一个 Spring Boot 应用程序,由于集成需要,它变得越来越复杂——比如在你这样做之后发送一封电子邮件,或者在你之后广播一条 jms 消息等等。在寻找一些更高级别的抽象时,我遇到了 apa
我正在尝试首次实施Google Pay。我面临如何指定gateway和gatewayMarchantId的挑战。 我所拥有的是google console帐户,不知道在哪里可以找到此信息。 priva
昨天下午 3 点左右,我为两个想要从一个 Azure 帐户转移到另一个帐户的网站设置了 awverify 记录。到当天结束时,Azure 仍然不允许我添加域,所以我赌了一把,将域和 www 子域重新指
我正在使用terms facet在elasticsearch服务器中获取顶级terms。现在,我的标签"indian-government"不被视为一个标签。将其视为"indian" "governm
我是一名优秀的程序员,十分优秀!