【发布时间】:2019-09-18 13:26:56
【问题描述】:
我必须对超过 10,000 个类别的大量文本进行分类。我需要专家建议,因为我还是一名学生。
我的数据是按类别分类的商业产品的描述和标题。例如,标题为“大而好的键盘”的键盘属于办公室 > 计算机 > 键盘类别。
现在,我使用“from sklearn.feature_extraction.text import TfidfVectorizer”来表示我的文本数据。但是矩阵在内存中太大了。 对于表示大量数据,您有什么技巧吗?
我正在考虑使用 word-2-vec 来表示数据,然后使用神经网络进行分类。
但我需要你的建议才能走上正确的道路!!
谢谢
【问题讨论】:
-
您的问题到底是什么?您是否尝试过为您的数据拟合分类器,您是否说它“太大”,因为它花费了太多时间?
-
另外,tfidf 向量化然后应用 word2vec 没有多大意义……你想达到什么目的?
-
我的数据是商业产品的描述和标题。我的目标是产品类别。例如,键盘的描述为“大键盘”,它被归类为办公室> 计算机> 键盘。目前我在我的数据上使用“from sklearn.feature_extraction.text import TfidfVectorizer”,但矩阵在内存中非常大。是否有另一种表示文本数据的解决方案?感谢您的帮助
标签: python-3.x machine-learning keras scikit-learn nlp