【发布时间】:2021-07-23 06:41:34
【问题描述】:
希望你们所有人都身体健康。 我是 NLP 世界的新手,我的问题可能听起来很愚蠢,所以我提前道歉。我想对一些标记的文本数据执行 NLP 并运行文本挖掘预测模型。我有四个可用作预测变量的文本列,我的标记列是我的类变量。或许,以下可以让你一窥数据集
var1 var2 var3 var4 class_var
NA text text NA 0
text text NA text 1
text NA NA text 1
NA NA NA text 0
NA text text text 1
如图所示,在某些列中没有文本(I put NAs)我在其他列中有文本。
话虽如此,我的问题是我是否应该将所有文本列合并为一个?
如果是这样,处理这个问题的合适方法是什么?
非常感谢你们的帮助。
非常感谢!
【问题讨论】:
标签: r nlp text-mining data-cleaning tm