【发布时间】:2017-12-28 05:06:46
【问题描述】:
我正在创建一个词袋。我参考了这个链接https://pythonprogramminglanguage.com/bag-of-words/#respond
df = pd.read_csv('Twidb11.csv',error_bad_lines=False, sep='delimiter', engine='python')
# Creating Bag of Words
count_vect = CountVectorizer()
X_train_counts = count_vect.fit_transform(df.Text)
print count_vect.fit_transform(df.Text).todense()
#X_train_counts.shape
print count_vect.vocabulary_
它给了我单词和它们的频率,但单词没有按字母顺序排列,并且 u' 符号在那里,如下所示。如何摆脱这种情况?
输出:{ u'binance': 28, u'they': 139, u'just': 83, u'global': 67, u'alternatives': 11, u'zcash': 168, u' years': 165, u'talks': 133, u'japan': 82, u'yes': 166, u'25': 1, u'chinese': 37, u'6000': 5, u'zzzpositive ': 170, u'winner': 162, u'28': 2, u'actually':12 ....}
【问题讨论】:
标签: python-2.7 machine-learning sentiment-analysis