【发布时间】:2019-06-20 02:16:37
【问题描述】:
如何从每个超过 500 个单词的数据框列中获取累积的唯一单词。数据框有 ~300,000 行
我在 A 列包含文本数据的数据框中读取了 csv 文件。 我尝试通过遍历 A 列并从 A 列中获取唯一单词作为集合并在 B 列和 C 列中添加唯一单词来创建几列(B 和 C)
随后,我通过从前一行(集合)中获取 A 列和 B 列(联合)来获取唯一的单词
这适用于少量行。但是一旦行数超过 10,000 行,性能就会下降,内核最终会死掉
对于巨大的数据框有没有更好的方法?
尝试使用唯一的单词和计数创建单独的数据框,但仍然有问题
示例代码:
for index, row in DF.iterrows():
if index = 0:
result = set(row['Column A'].lower().split()
DF.at[index, 'Column B'] = result
else:
result = set(row['Column A'].lower().split()
DF.at[index, 'Cloumn B'] = result.union(DF.loc[index -1,
'Column B'])
DF['Column C'] = DF['Column B'].apply(len)
【问题讨论】:
-
贴出你的代码,不要描述它。同时发布minimal, complete and verifiable example
-
抱歉,贴出代码
-
所以您只想要数据框中的“A Column”的所有唯一值?
-
A 列的累积唯一值,A 列的累积唯一字数
标签: python pandas dataframe nlp