【发布时间】:2018-10-11 08:55:49
【问题描述】:
我正在使用以下数据集 (https://www.kaggle.com/crowdflower/twitter-user-gender-classification/data) 开发一个朴素贝叶斯分类器。
我正在尝试做的是训练一个分类器,它允许我根据 twitter 文本、twitter 个人资料描述和 twitter 个人资料侧面颜色来预测用户性别。 由于 twitter 文本和配置文件描述属性是字符串列,因此我需要在训练分类器之前对数据进行预处理。为了做到这一点,我看到在很多示例中都使用了 Strings to Document 节点。然后,这个新列 Document 会被其他节点如数字过滤器、大小写转换器等预处理。
由于我想使用多个属性来训练我的分类器,我必须做什么?我应该将字符串属性(twitter 文本和个人资料描述)都转换为文档吗?
【问题讨论】:
-
由您决定如何处理您的数据。如果您不想使用两个 Strings to Document 节点,您可以在此之前简单地连接两个字符串列(尽管这可能不是您想要的,因为它们是不同的文本)。我没有看到工作流中有两个 Strings to Document 节点有任何问题。
标签: classification text-classification naivebayes knime