【发布时间】:2014-07-18 03:48:11
【问题描述】:
我在使用数据集中所有 URL 的主机名作为特征时遇到了这个问题。我无法弄清楚如何使用 TfidfVectorizer 仅从 URL 中提取主机名并计算它们的权重。 例如,我有一个数据框 df,其中“url”列包含我需要的所有 URL。我想我必须这样做:
def preprocess(t):
return urlparse(t).hostname
tfv = TfidfVectorizer(preprocessor=preprocess)
tfv.fit_transform([t for t in df['url']])
这种方式似乎不起作用,因为它拆分主机名而不是将它们视为整个字符串。我认为这与analyzer='word'(默认情况下)有关,它将字符串拆分为单词。
任何帮助将不胜感激,谢谢!
【问题讨论】:
标签: python nlp preprocessor scikit-learn