【发布时间】:2021-07-31 07:08:43
【问题描述】:
df = pd.DataFrame({'source': [1000, 1000, 1001, 1001, 1002,1002], 'acceptability': [1,0,1,0,1,0], 'sentence': ['I do not know', 'I does not know', 'you are stupid', 'you is stupid', 'she is bad for python', 'she are bad for python']})
我想做的是比较两个共享相同来源的句子。拆分或合并后(无论如何..),我想在两个句子之间使用 Jaccard Similarity。
我不知道如何使用循环来完成。
也许原型是这样的。
来源:1000,可接受性:1,句子:
来源:1000,可接受性:0,句子:
....
来源:1001,可接受性:1,句子:
来源:1001,可接受性:0,句子:
...
在将 DataFrame 与 loop station 拆分后,我希望根据 Jaccard Similarity 比较这些对。 如果这对的相似度分数太低,我想从 DataFrame 中删除该对。
我真的需要你们的帮助!!
谢谢你帮助我!!
【问题讨论】:
标签: python dataframe nlp pandas