【发布时间】:2021-11-15 01:40:49
【问题描述】:
同事们,
也许你可以帮助我完成看似简单的任务,但我还没有足够的经验来解决这个问题。
假设我们有两个数据框:
- df1 包含子字符串;
- df2 包含较长的文本块,其中一些包含来自 df1 的子字符串。
df1 = {'subst': ['LONDON BRIDGE', 'TRUE GRIT', 'FIVE TIMES FIVE', 'THREE TIME DEAD', 'TRUE IS NOT', 'OH NO', 'LEBRON JAMES']}
df2 = {'strng': ['LEBRON JAMES SCORED 20', 'THREE TIMES DEAD JOHNY WAS HELL OF THE COOK', 'TRUE IS NOT WHAT YOU THINK', 'FIVE TIMES FIVE IS NOT WHAT LEBRON SCORED']}
df1 = pd.DataFrame(df1)
df2 = pd.DataFrame(df2)
这是我需要的:
- 我需要遍历行以检查 df1['subst'] 中的子字符串是否存在于 df2['strng'] 中的任何位置
- 如果它存在于 df2 中,我希望 df2 中的新列 ['match_df1'] 包含来自 df1 的子字符串值。
df2 中的最终输出看起来像这样
| strng | match_df1 |
|---|---|
| LEBRON JAMES SCORED 20 | LEBRON JAMES |
| THREE TIMES DEAD JOHNY WAS HELL OF THE COOK | THREE TIMES DEAD |
| TRUE IS NOT WHAT YOU THINK | TRUE IS NOT |
| FIVE TIMES FIVE IS NOT WHAT LEBRON SCORED | FIVE TIMES FIVE |
【问题讨论】:
标签: python pandas dataframe contains isin