【发布时间】:2016-05-31 18:17:57
【问题描述】:
我一直在尝试一些框架和算法,但我找不到一个能做我想做的事——即根据值对数据列进行分类。
我尝试使用贝叶斯算法,但它不是很精确,因为我不能期望正在搜索的数据在训练集中 - 但我可以期望模式在训练中。
我没有机器学习/人工智能方面的背景,但在真正深入实施之前,我一直在寻找一些工作示例。
我构建了一个较小的 ARFF 来举例说明。也尝试了很多 Weka 分类算法,但都没有给我很好的结果。
@relation recommend
@attribute class {name,email,taxid,phone}
@attribute text String
@data
name,'Erik Kolh'
name,'Eric Candid'
name,'Allan Pavinan'
name,'Jubaru Guttenberg'
name,'Barabara Bere'
name,'Chuck Azul'
email,'erik@gmail.com'
email,'steven@spielberg.com'
email,'dogs@cats.com'
taxid,'123611216'
taxid,'123545413'
taxid,'562321677'
taxid,'671312678'
taxid,'123123216'
phone,'438-597-7427'
phone,'478-711-7678'
phone,'321-651-5468'
我的期望是训练一个像上面这样的庞大数据集并根据模式获得推荐,例如:
joao@bing.com -> email
Joao Vitor -> name
400-123-5519 -> phone
您能否建议任何算法、示例或想法进行研究? 我找不到合适的,也许只是缺乏词汇。
谢谢!
【问题讨论】:
-
写几个正则表达式有什么问题?
-
嗯,对于给定的数据集,这是可能的,但我所拥有的场景比这更复杂。例如,我有一个名为 Name 的字段和另一个名为 Company Name 的字段,我想获得有关“Stack Overflow Inc”作为公司和“Joao Vitor”作为名称的建议。
-
@JoaoVitor 你得到最终解决方案了吗?我面临着完全相同的问题。需要帮助。
标签: algorithm machine-learning artificial-intelligence weka