【问题标题】:Pandas un-exponde Series based off of Index基于 Index 的 Pandas 未展开系列
【发布时间】:2021-06-22 11:10:20
【问题描述】:

我有一个 pd.dataframe 的句子,例如:

    text
0   kusebenta ngendlela lefanele kwemabhizinisi em...
1   bumetima ekuvisiseni umnotfo wemhlaba nekuntji...
2   ngaleyo ndlelake sesincume kusebentisa emandla...
3   emabhisizinisi embuso kufanele angenise imali ...
4   nanoma kulungile kutsi umbuso uwasite ngetimal...
... ...
63121   alimata nobe enta kutsi kulahleke imphahla yem...
63122   afaka engotini imphilo yakhe nobe yalabanye ng...
63123   akhinyabeta kuphatfwa kucondziswa kwetigwegwe ...
63124   asebentisa kabi sikhundla sakhe emisebentini y...
63125   antjontja afumbatsisa nobe enta inkohliso

我有一个 pd.series 的句子,我在爆炸 pd.dataframe 后得到了这样的句子:

series1 = df1['field_name'].str.split().explode()

这给出了 pd.series:

0               kusebenta
0               ngendlela
0                lefanele
0          kwemabhizinisi
0                  embuso
0                    tate
0                   owned
0             enterprises
0           kungumgogodla
0             wentfutfuko
0                  yelive
1                bumetima
1             ekuvisiseni
1                 umnotfo
1                wemhlaba
1    nekuntjintjantjintja
1                   kwawo
1                 emandla
1              etimakethe
1                   kanye
Name: text, dtype: object

我现在想对 pd.series 中的单词进行分解并重新组合,在我对该系列进行一些处理后再次组成完整的句子。

我一直在考虑使用“groupby”,但在尝试对索引进行分组时没有取得太大成功。

我也尝试将其转换为 pd.dataframe,但出现有关具有相同索引的错误。

附:是否有可能创建一个索引长达 pd.series 长度的新 DF,然后以某种方式将 pd.series 数据连接为完整句子或以这种方式使用 groupby?

编辑 1: 按照评论中的建议运行 vocab.head().to_dict() 会产生以下输出: {0: 'embuso'} 哪个是第 5 个元素,因为 head 默认情况下会给出 5 个结果。

运行vocab.head(20).to_dict() 会产生: {0: 'yelive', 1: 'kanye'} 索引为 0 的最后一个元素是“yelive”,而“kanye”是来自“索引 1”的元素

【问题讨论】:

  • 执行df.head().to_dict() 并将输出数据添加到问题中。

标签: python pandas dataframe nlp series


【解决方案1】:

explode()生成的索引上应用str.join

>>>  series1.groupby(level=0).apply(' '.join)
0    kusebenta ngendlela lefanele kwemabhizinisi em...
1    bumetima ekuvisiseni umnotfo wemhlaba nekuntji...
Name: text, dtype: object

【讨论】:

  • 谢谢,我之前用过groupby(level=0),但apply(...) 是神奇的答案!
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2021-08-13
  • 2021-07-17
  • 2015-12-01
  • 2018-07-07
  • 2019-06-19
  • 2021-04-03
  • 1970-01-01
相关资源
最近更新 更多