【发布时间】:2021-06-22 11:10:20
【问题描述】:
我有一个 pd.dataframe 的句子,例如:
text
0 kusebenta ngendlela lefanele kwemabhizinisi em...
1 bumetima ekuvisiseni umnotfo wemhlaba nekuntji...
2 ngaleyo ndlelake sesincume kusebentisa emandla...
3 emabhisizinisi embuso kufanele angenise imali ...
4 nanoma kulungile kutsi umbuso uwasite ngetimal...
... ...
63121 alimata nobe enta kutsi kulahleke imphahla yem...
63122 afaka engotini imphilo yakhe nobe yalabanye ng...
63123 akhinyabeta kuphatfwa kucondziswa kwetigwegwe ...
63124 asebentisa kabi sikhundla sakhe emisebentini y...
63125 antjontja afumbatsisa nobe enta inkohliso
我有一个 pd.series 的句子,我在爆炸 pd.dataframe 后得到了这样的句子:
series1 = df1['field_name'].str.split().explode()
这给出了 pd.series:
0 kusebenta
0 ngendlela
0 lefanele
0 kwemabhizinisi
0 embuso
0 tate
0 owned
0 enterprises
0 kungumgogodla
0 wentfutfuko
0 yelive
1 bumetima
1 ekuvisiseni
1 umnotfo
1 wemhlaba
1 nekuntjintjantjintja
1 kwawo
1 emandla
1 etimakethe
1 kanye
Name: text, dtype: object
我现在想对 pd.series 中的单词进行分解并重新组合,在我对该系列进行一些处理后再次组成完整的句子。
我一直在考虑使用“groupby”,但在尝试对索引进行分组时没有取得太大成功。
我也尝试将其转换为 pd.dataframe,但出现有关具有相同索引的错误。
附:是否有可能创建一个索引长达 pd.series 长度的新 DF,然后以某种方式将 pd.series 数据连接为完整句子或以这种方式使用 groupby?
编辑 1:
按照评论中的建议运行 vocab.head().to_dict() 会产生以下输出:
{0: 'embuso'}
哪个是第 5 个元素,因为 head 默认情况下会给出 5 个结果。
运行vocab.head(20).to_dict() 会产生:
{0: 'yelive', 1: 'kanye'}
索引为 0 的最后一个元素是“yelive”,而“kanye”是来自“索引 1”的元素
【问题讨论】:
-
执行
df.head().to_dict()并将输出数据添加到问题中。
标签: python pandas dataframe nlp series