【发布时间】:2023-04-05 18:21:01
【问题描述】:
def clean_hrefs(allHrefs):
links = {'links' : allHrefs}
df = pd.DataFrame(links).drop_duplicates()
df = df[df['links'].str.contains('financial|investors|investor|Investors|Investor|INVESTORS|INVESTOR|relations|relation|Relations|Relation|report|filings|news|media')]
df['segment'] = df['links'].str.split(r'\w/')
return df
clean_hrefs() 函数接受一个漂亮的汤结果集“allHrefs”,其中包含网页的所有href 值,并将其分配到字典链接中。 df 数据框只存储唯一的链接以及其中包含某些关键字的链接。
在那之后,我尝试拆分到目前为止得到的链接,例如: 例如,存储在数据框中的第一个链接是:
https://www.example.com/news-and-media/press-releases?page=/en/pressreleases/example-performs-first-crash-test-of-an-e-scooter-airbag- 1769461
代码:
df['segment'] = df['links'].str.split(r'\w/')
正在创建另一个名为segments的列并提供以下输出:
['https://www.example.co', 'news-and-medi', 'press-releases?page=/e', 'pressrelease', 'example-performs-first-crash-test-of-an-e-scooter-airbag-1769461']
我希望输出在哪里:
['https://www.example.com', 'news-and-media', 'press-releases?page=','en', 'pressreleases', 'example-performs-first-crash-test-of-an-e-scooter-airbag-1769461']
任何帮助将不胜感激!
【问题讨论】:
标签: python regex pandas dataframe split