【发布时间】:2017-03-08 11:06:25
【问题描述】:
根据元素样式(fontSize、fontWeight 等)从 html 文件中提取标题和段落的最佳数据挖掘策略是什么。我已经提取了文本和 fontSize 属性并将它们放在一个 csv 文件中,现在我需要知道如何分类(或聚类?)这些数据,以便它可以给我例如所有 fontSize 为 20px 的元素公差为 +- 5px。这些元素将被转换为 h1 标签,依此类推..
编辑:我可以使用集群算法 Simple KMeans 和 Weka 中的曼哈顿距离函数将 fontSizes 集群化为我想要的任意多的集群。但是,我得到了每个集群的精确值,例如:字体大小 10px 被捕获 100 次,20px 被捕获 200 次等。我需要一个范围而不是特定值来覆盖所有值。
【问题讨论】:
-
你为什么要依赖集群呢?这还不够可靠。
-
我正在寻求你们的任何建议。你有什么建议?
-
使用阈值。
标签: machine-learning data-mining text-classification unsupervised-learning