【问题标题】:How do I combine text and numerical features in training set for machine learning?如何在机器学习训练集中结合文本和数字特征?
【发布时间】:2016-07-31 09:42:47
【问题描述】:

我试图根据数字特征和文本特征来预测社交网络中帖子的点赞数。现在我有了具有所需功能的数据框,但我不知道如何处理发布文本数据。我应该对其进行矢量化/做其他事情以获得合适的火车矩阵吗?我将使用 sklearn 的 LinearSVC 进行分析。

【问题讨论】:

  • 你打算用什么机器学习方法? SVM 可能是一个不错的选择,因为您正在处理文本特征。
  • 对不起,我没有提到,是的,我要使用SVM。线性 SVC。

标签: machine-learning scikit-learn ipython svm feature-selection


【解决方案1】:

您可以通过多种不同的方式将文本特征转换为数字特征。

最常见的方法之一是词袋方法。您将文本转换为包含每个单词出现次数的数组。

如果您使用 scikit-learn,我建议您阅读他们的 Text Feature extraction User Guide

另请参阅NLTK toolkit,了解处理文本数据的更复杂方法。

【讨论】:

  • 感谢您的回答。我明白,我需要一个单词错误。我已经将帖子的文本数据划分为单词并进行了预处理。我不知道下一步该做什么,如何将其加入一个矩阵以供将来 SVM 分析。
  • 明白了你的想法,并在我的代码中发现了一些愚蠢的错误。谢谢你的回答:)
猜你喜欢
  • 2018-05-10
  • 2014-12-27
  • 2018-10-10
  • 2017-06-25
  • 2017-04-06
  • 2017-03-19
  • 2015-03-22
  • 2021-08-23
  • 2014-06-01
相关资源
最近更新 更多