【问题标题】:Extract titles and paragraphs from html by elements style按元素样式从html中提取标题和段落
【发布时间】:2017-03-08 11:06:25
【问题描述】:

根据元素样式(fontSize、fontWeight 等)从 html 文件中提取标题和段落的最佳数据挖掘策略是什么。我已经提取了文本和 fontSize 属性并将它们放在一个 csv 文件中,现在我需要知道如何分类(或聚类?)这些数据,以便它可以给我例如所有 fontSize 为 20px 的元素公差为 +- 5px。这些元素将被转换为 h1 标签,依此类推..

编辑:我可以使用集群算法 Simple KMeans 和 Weka 中的曼哈顿距离函数将 fontSizes 集群化为我想要的任意多的集群。但是,我得到了每个集群的精确值,例如:字体大小 10px 被捕获 100 次,20px 被捕获 200 次等。我需要一个范围而不是特定值来覆盖所有值。

【问题讨论】:

  • 你为什么要依赖集群呢?这还不够可靠。
  • 我正在寻求你们的任何建议。你有什么建议?
  • 使用阈值。

标签: machine-learning data-mining text-classification unsupervised-learning


【解决方案1】:

首先这将是一个评论,但我是新人,现在不能写 cmets。

我可以使用集群算法 Simple KMeans 和 Weka 中的曼哈顿距离函数将 fontSizes 集群化为我想要的尽可能多的集群。但是,我得到了每个集群的精确值,例如:字体大小 10px 被捕获 100 次,20px 被捕获 200 次等。我需要一个范围而不是特定值来覆盖所有值。

您可以使用名为“numClusters”之类的选项指定集群的数量。因此,您可以强制 weka 构建任意数量的集群,这意味着如果您有比集群更多的不同值,它必须使用范围而不是特定数字

但这是我的问题,您为什么不使用简单的循环来迭代您的数据并手动指定您想要的内容。 类似的东西

if(fontSize < 10) {
/*Do s.th*/
}else if(fontSize < 20){
/*Do s.th.
}

因为这似乎更加可靠和简单。 即使您有更多属性,也只需手动为每个集群定义属性范围,并检查任何数据集是否适合您的集群之一。

如果你有大量的属性或集群,或者对数据的理解不是很好,我只会推荐类似 weka 的东西来完成这项任务。但你的任务看起来不是那样的。

【讨论】:

    【解决方案2】:

    尝试基于机器学习的boilerpipe java API。可以测试不同型号on-line

    【讨论】:

      猜你喜欢
      • 2021-11-11
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2023-03-14
      • 1970-01-01
      • 2015-08-29
      • 1970-01-01
      • 2016-04-02
      相关资源
      最近更新 更多