【发布时间】:2015-11-25 14:29:18
【问题描述】:
我正在使用 Andreas Mueller 编写的 Python 中的 wordcloud 模块来可视化我的学生将完成的调查结果。出色的模块,非常漂亮的图片,但是即使设置stopwords=None 和ranks_only=True,我也无法让它识别所有单词。调查回复的长度在 1 到 3 个单词之间,并且可能包含连字符。
这是一个例子。首先,我在 Jupyter 笔记本中安装依赖项:
import matplotlib.pyplot as plt
%matplotlib inline
from wordcloud import WordCloud
from scipy.misc import imread
然后假设我把所有的响应都放到一个字符串中:
words = "do do do do do do do do do do re re re re re mi mi fa fa fa fa fa fa fa fa fa fa-so fa-so fa-so fa-so fa-so so la ti do"
然后我执行剧情:
wordcloud = WordCloud(ranks_only = True,stopwords=None).generate(words)
plt.imshow(wordcloud)
plt.axis('off')
plt.show()
但由于某种原因,它忽略了“do”和“fa-so”,尽管它们的频率很高。
有什么建议吗?除了“不要使用词云”。这是一个愚蠢的调查,它邀请了一个愚蠢的可视化。谢谢。
更新
仍然无法包含连字符(例如“fa-so”),它们就会退出。
【问题讨论】:
-
尝试不带任何参数的调用,例如:WordCloud().generate(words)
-
那是我的第一次尝试。没有骰子。同样的问题。
标签: python visualization