【问题标题】:Web Mining Via Search Engines通过搜索引擎进行网络挖掘
【发布时间】:2011-05-07 10:58:02
【问题描述】:

当我意识到这是多么不必要的重复和低效时,我正在通过 Google 地图购买公寓,将各种列表复制到电子表格中,以便更轻松地比较和附加注释。我可以很容易地编写一个脚本来自动查询谷歌并提取我需要的数据,但是要获取一些数据(例如联系电话号码),我需要点击一个指向特定列表站点的链接并四处寻找数据,而且我从来没有写过一个动态的网络爬虫。为给定任意 HTML 的信息提取“最佳猜测”的常用数据挖掘和/或机器学习技术和工具有哪些?

【问题讨论】:

  • google.com/squared 并导出到 Google 电子表格。
  • @aartist,绝对精彩。字段自动填充结果远非完美,但 UI 非常接近我的想象。
  • @aartist:你为什么不把它作为一个解决方案发布..

标签: machine-learning web-crawler data-mining


【解决方案1】:

这不是后端技术,但在 cmets 中是很有帮助的。转到http://www.google.com/squared,然后将结果导出为 Google 电子表格或 csv 数据。它为您命名字段并从网络填充数据。

【讨论】:

    【解决方案2】:

    这称为信息提取。

    这个视频不错。这个人来自谷歌:

    http://videolectures.net/mlas06_nigam_tie/

    查看 RapidMiner 及其信息提取插件。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2013-04-15
      • 1970-01-01
      • 2018-01-28
      • 2013-06-27
      相关资源
      最近更新 更多