- android - 多次调用 OnPrimaryClipChangedListener
- android - 无法更新 RecyclerView 中的 TextView 字段
- android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0
- android - 使用 AppCompat 时,我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色
我正在做一个与此类似的项目:Data matching algorithm
其中,我有一个包含客户详细信息的数据框 (dataset1),没有特殊的唯一 ID,然后将其与具有相同字段和特殊唯一 ID 的数据框 2 (dataset2) 进行匹配。
示例:Dataset1 列包括:
头衔、姓氏、名字、中间名/其他姓名、地址、出生日期、性别、医疗保健号码
dataset2 列包括:
唯一 ID、头衔、姓氏、名字、中间名/其他姓名、地址、出生日期、性别、医疗保健号码
我的计划:
我的数据集 1 大约有 500,000 行,大约 11 列 - 如果需要,可以拆分行数。数据集 2 约为 2,000,000
基于企业的匹配标准,例如。 >5 列必须匹配,并且可能是模糊组件,例如在一个数据集中用连字符连接的名称(包括其他特殊字符),但在另一个数据集中则不然。
根据近似匹配,此 ID 和数据集 2 中的字段以及总体匹配百分比将复制到数据集 1 的相邻列中。
然后,业务可以提取并检查总体匹配百分比范围。
我计划将 Panda 与 Fuzzywuzzy 一起使用。我在根据代码逻辑规划技术方法时遇到困难。
我是否应该在第一个字段中查找匹配项,然后向下筛选下一列,依此类推?我想是的,但是循环如何在两个比较数据集中的列之间移动?我是否需要将每个比较操作写回到数据集中进行存储,或者可以将其保存在其他地方吗?
另一种可行的方法是,我将所有列连接到一个列中,然后将这些列进行匹配,并返回匹配的 ID、其他字段和匹配的 %。
我正在寻找最好的方向,以及最佳方法的一般逻辑。
最佳答案
一般来说:尝试、观察、调整和重复。
在使用 Fuzzywuzzy 之前,可能值得探索任何小的调整来标准化并使数据尽可能一致。
某些数据集可以使用 555-555-5555、0 或 - 表示空电话号码,或使用 Jan 1, 1970 表示空白出生日期。 Dataframe.replace({column:{to_replace:replace_val}) 可以帮助清理这些内容。
Python 的 dateutil.parser 有助于标准化各种日期格式。
在分析之前尝试包裹模糊率并删除姓氏中的标点符号。
地址:Pandas.column.str.upper() 可用于应用一致的大小写。也尝试不使用标点符号。
连接所有字段可能是精确匹配的良好第一步。第二遍可以评估不太重要的字段(例如“性别”和“头衔”)是否缺少数据。
一般来说,您可能需要分层处理,删除直接匹配,然后删除最确定的匹配,重新评估,直到下一波所需的工作量接近您认为该项目的 yield 递减的程度。
如果您按列进行处理,您可能需要删除某些匹配项,然后从姓氏开始,然后创建下一个最具确定性的列的选择列表,并使用 fuzzywuzzy 的 process.extract 来协助决策树。可能还有我不知道的更好的方法!
关于python - 使用模糊匹配标准匹配多列数据,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/49397732/
我最近在读 CSAPP。在 10.9 节中,它说标准 I/O 不应该与 socket 一起使用,原因如下: (1) The restrictions of standard I/O Restricti
似乎是一个足够标准的问题,可以保证解决方案中的标准设计: 假设我想在文件中写入 x+2(或更少)个字符串。 x 字符串构成一个部分的内容,这两个字符串构成该部分的页眉和页脚。要注意的是,如果内容中没有
代码版本管理 在项目中,代码的版本管理非常重要。每个需求版本的代码开发在版本控制里都应该经过以下几个步骤。 在master分支中拉取该需求版本的两个分支,一个feature分支,
我有以下sql查询,我需要获取相应的hibernate条件查询 SELECT COUNT(DISTINCT employee_id) FROM erp_hr_payment WHERE payment
所以我正在编写一些代码,并且最近遇到了实现一些 mixin 的需要。我的问题是,设计混音的正确方法是什么?我将使用下面的示例代码来说明我的确切查询。 class Projectile(Movable,
我的环境变量包含如下双引号: $echo $CONNECT_SASL_JAAS_CONFIG org.apache.kafka.common.security.plain.PlainLoginModu
示例: /** * This function will determine whether or not one string starts with another string. * @pa
有没有办法在 Grails 中做一个不区分大小写的 in 子句? 我有这个: "in"("name", filters.tags) 我希望它忽略大小写。我想我可以做一个 sqlRestriction
我搜索了很长时间,以查找将哪些boost库添加到std库中,但是我只找到了一个新库的完整列表(如此处:http://open-std.org/jtc1/sc22/wg21/docs/library_t
我已经通过使用这个肮脏的黑客解决了我的问题: ' Filter managerial functions ActiveSheet.Range("$A$1:$BW$2211").Auto
因此,我很难理解我需要遵循的标准,以便我的 Java 程序能够嵌入 HTML。我是否只需将我的主类扩展到 Applet 类,或者我还需要做更多的事情吗?另外,在我见过的每个 Applet 示例中,它都
我对在 Hibernate 中使用限制有疑问。 我必须创建条件,设置一些限制,然后选择日期字段最大值的记录: Criteria query = session.createCriteria(Stora
我有标准: ICriteria criteria = Session.CreateCriteria() .SetFetchMode("Entity1", FetchMo
我很难编写条件来选择所有子集合或孙集合为空的实体。我可以将这些作为单独的条件来执行,但我无法将其组合成一个条件。 类结构: public class Component { p
@Entity class A { @ManyToMany private List list; ... } @Entity class B { ... } 我想使用条件(不是 sql 查询)从 A
我的数据库中有以下表结构: Table A: Table B: Table C: _______________
请帮助我: 我有下一张 table : 单位 ID 姓名 用户 ID 姓名 利率 单位 ID 用户 ID 我不明白如何从 SQL 创建正确的条件结构: 代码: SELECT * FROM Unit W
我正在构建一个包含项目的网站,每个项目都有一个页面,例如: website.com/book/123 website.com/film/456 website.com/game/789 每个项目都可以
我需要使用两个属性的组合来过滤结果列表。一个简单的 SQL 语句如下所示: SELECT TOP 10 * FROM Person WHERE FirstName + ' ' + LastName L
我有一个“ super 实体”SuperEntity 和三个扩展父类(super class)的实体 ChildEntity1、...、ChildEntity3。 搜索数据库中的所有实体很容易,即我们
我是一名优秀的程序员,十分优秀!