【发布时间】:2015-07-26 05:06:33
【问题描述】:
我有一个具有两个特征的数据集:类(int)和内容(文本)。
每一行内容都需要向量化为一组与正则表达式匹配的布尔特征。我的矢量化函数返回一个包含 17 个特征的字典,例如:
{'email':1, 'phone':0, 'curses':1,....}
现在我的代码是这样的:
vectorized = data[['content', 'class']].join(
pd.DataFrame(
data.content.apply(lambda c: vectorize_content(c)).tolist(),
dtype = int,
index = data.index
)
)
想要的结果是:
class content email phone curse ...
0 'Hi' 0 0 0 ...
1 'john@doe.com' 1 0 0 ...
在真实的单词数据集(约 1 毫米行)中,这需要很长时间!
我的目标是获得一个包含类的最终数据集,并将每个布尔特征作为列来提供 RandomForestClassifier。
我真的是 sklearn/pandas 的新手,所以很可能我做错了什么。
关于如何优化此过程的任何提示?
谢谢!
【问题讨论】:
标签: python scikit-learn pandas