【问题标题】:data mining with unstructured data how to implement?非结构化数据的数据挖掘如何实现?
【发布时间】:2018-03-29 21:24:43
【问题描述】:

我有非结构化数据(应用程序截图)和半结构化数据(屏幕转储文件),我选择将其存储在 hbase 中。我的目标是在应用程序上找到缺陷或问题(有意义的数据)。现在,我想对这些应用数据挖掘,这是一种文本挖掘吗?我如何在这些数据上应用一些数据挖掘技术?

【问题讨论】:

  • 屏幕截图将是图像,屏幕转储将是文本数据。对吗?
  • 是的,屏幕转储是 xml 数据,它是屏幕的层次结构

标签: bigdata data-mining text-mining


【解决方案1】:
  • 首先,您可以使用基于规则的方法来定义检测缺陷场景的规则集。
  • 然后您可以准备包含许多缺陷、非缺陷场景实例的训练数据集。在此步骤中,对于您收集的每个屏幕截图或屏幕转储文件;您可以手动将其标记为缺陷或非缺陷。
  • 然后您可以使用此训练数据训练分类器。分类器会尝试泛化训练样本以预测过去未见过的样本的输出标签。
  • 由于您的输入是非标准的,您可能需要进行一些预处理才能将您的输入转换为标准格式。例如,要处理屏幕截图,您可能需要一些图像处理、OCR、计算机视觉库。

【讨论】:

  • 感谢 Yogi Devendra
猜你喜欢
  • 2010-09-11
  • 2011-02-07
  • 2016-03-17
  • 1970-01-01
  • 2015-11-14
  • 1970-01-01
  • 1970-01-01
  • 2019-04-24
  • 2011-07-28
相关资源
最近更新 更多