【发布时间】:2021-04-25 08:02:48
【问题描述】:
我正在使用 Python BeautifulSoup 从 10K 文件中提取风险因素部分(因此我需要找到该部分的开始和结束位置)。例如:
https://www.sec.gov/Archives/edgar/data/1321502/000143774910004615/andain_10k-123106.htm
要获取这个元素:
项目 1A。风险因素
我想改编这样的东西:
my_text = soup.find_all(string=["ITEM1A.RISKFACTORS", "RISKFACTORS"])
为了捕捉任何内容,一旦去掉前后的所有空格(也可能是单词之间的空格)、不间断空格和任何其他妨碍格式,完全正确匹配我的一个字符串(“ITEM1A.RISKFACTORS”、“RISKFACTORS”)。
我想要:
"Item 1A. Risk Factors"
"Risk Factors"
" Risk Factors"
"Risk Factors"
"Item 1A.\xa0Risk Factors"
我不想要:
"We have a number of Risk Factors."
理想情况下,我想避免使用正则表达式,如果有某种“stripped=True”参数我可以与 find_all 一起使用会更好,但如果需要正则表达式,请帮我写!谢谢
【问题讨论】:
-
欢迎来到 SO。帮助我们帮助您 - 请改进您的问题,以便我们可以重现您的问题。 How to create a Minimal, Reproducible Example 谢谢一些书面代码,网址,...会很酷。
-
谢谢!我已经编辑了我的帖子。
标签: python html web-scraping beautifulsoup