【问题标题】:need to extract all the content between two string in pandas dataframe需要提取熊猫数据框中两个字符串之间的所有内容
【发布时间】:2017-06-26 03:03:38
【问题描述】:

我在 pandas 数据框中有数据。我需要提取以“影响因子:”开头并以“”结尾的字符串之间的所有内容。如果内容没有“影响因子:”我想在数据框的那一行中为 null

这是来自单行的样本数据。

在线保存到 EndNote 添加到标记列表 影响因子:Journal 2 和 Citation Reports 500 其他信息 IDS 编号:EW5UR

我想要数据框中的如下内容。 期刊 2 和引文报告 500 期刊 6 和引文报告 120 期刊 50 和引文报告 360 期刊 30 和引文报告 120

【问题讨论】:

    标签: pandas dataframe text-extraction data-extraction


    【解决方案1】:

    您好,您可以在这里使用正则表达式:

    result = your_df.your_col.apply(lambda x: re.findall('Impact Factor:(.*?)&#',x))
    

    你可能也想去掉空格,在这种情况下你可以使用:

    result = your_df.your_col.apply(lambda x: re.findall('Impact Factor:\s*(.*?)\s*&#',x))
    

    【讨论】:

      猜你喜欢
      • 2017-04-29
      • 1970-01-01
      • 1970-01-01
      • 2017-10-12
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多