【发布时间】:2018-05-17 07:17:12
【问题描述】:
我目前正在从事 Twitter 数据分析工作,一直致力于在 Python 中应用词袋技术,但一直没有运气。 目前,我已经能够通过一些预处理将数据流式存储在数据库中,然后我将推文导出到 csv 文件中,但在下一部分使用词袋进行机器学习时遇到了困难。
我已经尝试关注https://www.kaggle.com/c/word2vec-nlp-tutorial#part-1-for-beginners-bag-of-words,但是我没有成功,也无法通过查看 scikit 或 nltk 文档来理解如何处理。谁能建议我可以遵循的教程来使用 Python 3 实现词袋? 感谢您的帮助
【问题讨论】:
-
先从这个开始:kaggle.com/alvations/basic-nlp-with-nltk 然后也许 Word2vec 教程更容易理解。
-
感谢您的链接。这看起来非常有用,因为它通过描述分解了每个步骤。非常感谢!
标签: python twitter scikit-learn nlp nltk