【问题标题】:Text Classification Technique for this scenario此场景的文本分类技术
【发布时间】:2018-02-08 10:00:51
【问题描述】:

我对机器学习算法完全陌生,我有一个关于数据集分类的快速问题。

目前有一个训练数据由两列 Message 和 Identifier 组成。

消息 - 从包含时间戳和一些文本的日志中提取的典型消息 标识符 - 应根据消息内容对类别进行分类。

通过从工具中提取特定类别并相应地标记它来准备训练数据。

现在测试数据只包含消息,我正在尝试相应地获取类别。

在这种情况下哪种方法最有帮助?是监督学习还是非监督学习?

我有一个训练有素的数据集,我正在尝试预测测试数据的类别。

提前致谢, 亚当

【问题讨论】:

    标签: machine-learning classification cluster-analysis data-mining


    【解决方案1】:

    如果您的标签是准确的,那么您可以使用 ANN、SVM 等进行分类。但是标签并不准确,您必须根据数据中的特征对数据进行聚类。 K-means 或最近邻可以作为聚类的起点。

    【讨论】:

    • 感谢极客博士!根据我的理解,因为这是一种无监督学习,所以建议使用 K 均值或最近邻方法而不是有监督学习方法??
    • 没有。 A)你是有监督的,而不是无监督的,B)kmeans 是无监督的,kNN 是有监督的,你把事情搞混了,C)两者都不是一个有前途的候选人,他们往往表现很差。
    【解决方案2】:

    这是一个监督学习,一个分类问题。

    但是,显然您的测试集没有标签列(待预测的值)。因此,您无法计算该测试集的错误度量(例如误报率、准确性等)。

    但是,您可以将您拥有的已标记训练数据集拆分为较小的训练集和验证集。也许将其拆分为 70%/30%。然后从较小的 70% 训练数据集构建预测模型。然后在你的 30% 验证集上调整它。当准确度足够好时,将其应用于您的测试集以获取/预测缺失值。

    使用哪种技术/算法是一个不同的问题。你没有提供足够的信息来回答这个问题。即使你这样做了,你仍然需要自己调整模型。

    【讨论】:

      【解决方案3】:

      您有要预测的标签和训练数据。

      所以根据定义,这是一个有监督的问题。

      尝试任何文本分类器,例如 NB、kNN、SVM、ANN、RF、...

      很难预测哪种方法最适合您的数据。您将不得不尝试和评估几个

      【讨论】:

        猜你喜欢
        • 2015-01-16
        • 1970-01-01
        • 2015-12-21
        • 2020-07-05
        • 1970-01-01
        • 2014-05-28
        • 1970-01-01
        • 1970-01-01
        • 2011-01-19
        相关资源
        最近更新 更多