【发布时间】:2021-01-24 11:27:30
【问题描述】:
我有一个 xml,它有多个标签,如下所示:
<textblock height="55" hpos="143" id="Page1_Block5" lang="en-US" stylerefs="StyleId-E6BF91A3-3D6A-442F-9A46-22A0459A02E9- font1" vpos="226" width="393">
我想获取由页面聚集的所有<textblock> 标记(textblock 标记中的id 属性)。但是,我的id是这样写的:id="Page1_Block5"。
但是,我只想以页码而不是块号为条件。 (我想要特定页面的所有块)。
我正在尝试通过以下方式做同样的事情:
xml_soup = bs.BeautifulSoup(table, 'lxml')
text_blocks = xml_soup.find_all('textblock')
我还需要在find_all() 函数中添加哪些参数才能仅根据Page{} 调整结果?
【问题讨论】:
标签: python-3.x beautifulsoup xml-parsing