【发布时间】:2019-07-18 10:29:07
【问题描述】:
在示例数据中,我列出了我们从 2 个不同来源收到的特定人员(潜在客户)的雇主姓名。 我一直在尝试找到一种方法来更好地匹配这两个名称并获得良好的结果。 (目前,它是作为手动工作完成的) 我不认为我在尝试做不可能的事情......但如果它无法实现,请不要苛刻!
以下是根据手动验证“匹配”的数据集。
ADDUS==============================================Addus Home Care
Amazon.com, Inc. and its affiliates=====================Amazon.com
Aon========================================Aon Service Corporation
ARAMARK Food & Support Svc.================================Aramark
AT&T Mobility Services LLC===========================AT&T Mobility
CDW, LLC===========================================CDW Corporation
Lurie Children's Hospital of Chicago======Lurie Childrens Hospital
Securitas Security Services USA, Inc============Securitas security
The PNC Financial Services Group, Inc.======================PNC NA
United States Department of Homeland Security====US Homeland Securiti
TCS=========================================Tata Consultancy Services
虽然几乎是显而易见的,但为了强调,让我陈述一下。
- 来自这些来源的名称可能存在拼写错误
- 可能有缩写(例如:TCS 在一个地方,Tata Consultancy 在另一个地方)
请向我推荐一种算法或方法,以最少的“错误接受案例”数量来做到这一点 - 我的意思是这样的案例,它们从不同的算法中获得了很高的匹配率。
请尝试提出一种方法。
【问题讨论】:
-
好吧,我想我可以从 stackoverflow 获得一两个想法。但我想没有!如果有任何人可以提供任何意见,请提供。
标签: string-comparison similarity levenshtein-distance fuzzy-logic edit-distance