【问题标题】:Dealing with several text columns in a labeled data set while running NLP in R在 R 中运行 NLP 时处理标记数据集中的多个文本列
【发布时间】:2021-07-23 06:41:34
【问题描述】:

希望你们所有人都身体健康。 我是 NLP 世界的新手,我的问题可能听起来很愚蠢,所以我提前道歉。我想对一些标记的文本数据执行 NLP 并运行文本挖掘预测模型。我有四个可用作预测变量的文本列,我的标记列是我的类变量。或许,以下可以让你一窥数据集

 var1    var2  var3    var4      class_var
  NA     text  text     NA          0
  text   text   NA     text         1
  text    NA    NA     text         1
  NA      NA    NA     text         0
  NA     text  text    text         1  

如图所示,在某些列中没有文本(I put NAs)我在其他列中有文本。 话虽如此,我的问题是我是否应该将所有文本列合并为一个? 如果是这样,处理这个问题的合适方法是什么?

非常感谢你们的帮助。

非常感谢!

【问题讨论】:

    标签: r nlp text-mining data-cleaning tm


    【解决方案1】:

    这里的选项太多了,但是看到您的数据已经分为四列,也许您可​​以首先将文本替换为 1(如果存在文本)或 0 (对于 NA),然后看看您可以如何预测 class_var以简单的逻辑回归作为开始。从那里,您可以进入标记器等。

    【讨论】:

    • 所以我不应该将所有文本合并为一列并从那里开始吗?
    • 在检查上述内容之后,这可能是一个很好的下一步。对我来说,您的数据首先是分开的这一事实意味着信息存在某种分段,这就是我首先推荐 1 或 0 的原因。我会将它们组合起来,将它们标记化,然后尝试分类。其次,我会尝试分别拆分每一列,标记化,然后尝试分类以查看一列是否真的很重要。
    • 谢谢,我会采取相应的行动,并会与我们联系以获得更多帮助
    猜你喜欢
    • 2019-08-19
    • 1970-01-01
    • 1970-01-01
    • 2017-10-10
    • 2022-10-04
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多