【问题标题】:Source for Names to use in web scraping用于网络抓取的名称来源
【发布时间】:2011-02-12 00:03:36
【问题描述】:

谁能推荐一个好的名称来源,我可以用来帮助分析网页上的一些表格。

我正在抓取的表格的第一列只有名称,名称和标题或只是标题。

名字可以多种多样,从 John Smith 到 Vikram Saksena。
我一直在寻找可以在专有名称中找到的单词的编译列表。

已编辑我已经尝试过人口普查中设置的名称,其中包含太多垃圾,不值得使用。

【问题讨论】:

    标签: python web-scraping


    【解决方案1】:

    下载Febrl project source code

    它的数据文件夹包含名称表(给定/中间/姓/等)。您可能必须根据自己的需要对数据进行处理。

    对于姓氏,您可以四处查看美国人口普查数据。我现在没有链接,但我知道我以前使用过来自该来源的常见美国姓氏。

    【讨论】:

      猜你喜欢
      • 2023-02-02
      • 2023-03-26
      • 2020-06-20
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2010-12-28
      • 1970-01-01
      • 2022-11-28
      相关资源
      最近更新 更多