【问题标题】:Python how to apply bag of words to tweets in csv filePython如何将词袋应用于csv文件中的推文
【发布时间】:2018-05-17 07:17:12
【问题描述】:

我目前正在从事 Twitter 数据分析工作,一直致力于在 Python 中应用词袋技术,但一直没有运气。 目前,我已经能够通过一些预处理将数据流式存储在数据库中,然后我将推文导出到 csv 文件中,但在下一部分使用词袋进行机器学习时遇到了困难。

我已经尝试关注https://www.kaggle.com/c/word2vec-nlp-tutorial#part-1-for-beginners-bag-of-words,但是我没有成功,也无法通过查看 scikit 或 nltk 文档来理解如何处理。谁能建议我可以遵循的教程来使用 Python 3 实现词袋? 感谢您的帮助

【问题讨论】:

  • 先从这个开始:kaggle.com/alvations/basic-nlp-with-nltk 然后也许 Word2vec 教程更容易理解。
  • 感谢您的链接。这看起来非常有用,因为它通过描述分解了每个步骤。非常感谢!

标签: python twitter scikit-learn nlp nltk


【解决方案1】:

所以 scikit-learn 的 CountVectoriser 是一个很好的起点。您需要创建一个固定大小的词汇表(从您的推文中收集 N 个唯一单词),以便您可以将每条推文表示为一个固定长度的向量,其中向量中的每个位置代表您的词汇表中的一个特定单词,并且value 是该词出现的次数。

对于纯 Python,这将是:

  1. 创建推文文本数组
  2. 初始化一个代表您的词汇的空集

先通过推文

  1. 为每条推文提取唯一的词
    • 如果这些词不存在,请将它们添加到您的词汇表中

第二次通过相同的推文

  1. 为每条推文提取唯一的词
    • 创建一个用大小为 N 的零填充的向量,表示推文
    • 对于每个单词,根据单词在向量中的位置递增计数

您可以使用 1 或 0 来表示存在或不存在的词,而不是词频。看看有什么用。

然而,scikit-learn 让这一切变得更加容易。

我找到了this tutorial,这可能也有帮助。

【讨论】:

  • 感谢您的回复和帮助。
猜你喜欢
  • 2019-02-28
  • 1970-01-01
  • 2020-02-14
  • 2021-05-30
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2022-11-20
  • 1970-01-01
相关资源
最近更新 更多