【发布时间】:2018-06-02 01:29:42
【问题描述】:
所以我有一个由交易数据组成的非常大的 pandas 数据框:
description amount
foo 10
bar 5
baz 9
foo bar 12
foobar 15
bar baz 20
bazbar 19
预期输出如下:
description amount tag
foo 10 foo
bar 5 bar
baz 9 baz
foo bar 12 foo, bar
foobar 15 foobar
bar baz 20 bar, baz
bazbar 19 bazbar
我的思考过程如下:
- 从
df['description']的所有行中创建一个巨大的唯一words列表 - 然后对于新列
df['tag'],对于列表中的每个项目,执行isin并分配相关标签。
我不确定如何创建唯一words 列表。另外,我不确定这是解决此问题的正确方法。
感谢任何帮助!
【问题讨论】:
-
为什么
bazbar被归类为baz, bar,而不被视为一个唯一的词?与foobar相同。 -
因为,我想要部分字符串匹配
-
可能是因为
'baz' in 'bazbar' == True? -
是的@AChampion 是正确的。
-
我明白了,但是你是怎么知道部分字符串的,为什么
bazb不是部分字符串,你是怎么找到“唯一词”的
标签: python pandas text classification