【问题标题】:data mining algorithm that suggest for this situation针对这种情况提出建议的数据挖掘算法
【发布时间】:2015-12-02 10:16:50
【问题描述】:

这不是直接与编程相关的问题,而是关于选择正确的数据挖掘算法的问题。

我有一些文件夹假设有 100 个文件夹,这些文件夹的内容是图像和文本文档,我有这些文件夹的 excel 表(100 个表),这意味着每个文件夹都有特定的表,这个 excel 表的内容如下:

在标题(列标题)中包含此文件夹的内容,行包含我将要检查的文件(我的测试文件)如果在该文件夹中找到文件,则此表中的值为 o 和 1,否则为 1 o , 这些测试文件名对于所有文件夹都是一样的,

问:什么是最好的数据挖掘算法可以在 excel 文件表上工作,并且可以根据测试文件内容对这些文件夹进行聚类,例如聚类 1 包括包含文件 1 和文件 20 和文件 25 的文件夹......等等在..考虑我使用matlab语言?

谢谢...

【问题讨论】:

    标签: excel algorithm data-mining text-mining


    【解决方案1】:

    这里的英文有点混乱,所以我会尽可能地解释这个问题。你想在这里做的似乎不需要任何复杂的算法。继续获取您的 Excel 数据并将其导出为 CSV,以便您可以在 Matlab 中工作。

    现在你有如下数据:

    Folder -> [ Files ]

    您可能希望以这种方式构建索引:

    File -> [ Folders ]

    这样,当你问问题:“哪些文件夹包含文件 1、20 和 25”时,你可以(在恒定时间内)查找 3 件事:

    1. 包含文件 1 的文件夹
    2. 包含文件 20 的文件夹
    3. 包含文件 25 的文件夹

    然后取这些集合的交集。

    ================================================ ====

    您可能有兴趣做的另一件事是“集群”。为此,请继续使用您的文件夹描述符(一和零)并将其视为特征/向量。然后继续并在其上运行任何聚类算法。 K-means 聚类在 Matlab 中很容易实现。

    [1]https://en.wikipedia.org/wiki/Cluster_analysis

    【讨论】:

      猜你喜欢
      • 2011-01-22
      • 2011-11-28
      • 2015-09-11
      • 1970-01-01
      • 2011-08-25
      • 2011-01-13
      • 2015-07-19
      • 2019-04-24
      • 2023-03-20
      相关资源
      最近更新 更多