【发布时间】:2015-11-17 11:59:59
【问题描述】:
我知道 scikit-learn 根据documentation 遵循词袋假设/模型。但是,有没有办法在计算 tf-idf 时提取词的位置?
例如,如果我有这些文件
document1 = "foo bar baz"
document2 = "bar bar baz"
我能以某种方式得到这个(term_id 的元组/列表)
document1_terms = (1, 2, 3)
document2_terms = (2, 2, 3)
或(术语字典,以位置元组为值)
document1_terms = {1: (1, ), 2: (2, ), 3: (3, )}
document2_terms = {2: (1, 2), 3: (3, )}
【问题讨论】:
标签: python scikit-learn