【发布时间】:2020-08-04 08:00:43
【问题描述】:
早安,
我正在用 Python 进行一些 HTML 解析,我遇到了以下问题,这是单个表格单元格中的时间和名称配对。我正在尝试分别提取每条信息,并尝试了几种不同的方法来拆分以下字符串。
HTML 字符串:
<span><strong>13:30</strong><br/>SecondWord</span></a>
希望我的输出是:
text1 = 13:30
text2 = "SecondWord"
我目前正在使用循环遍历表中的所有行,我在其中获取文本并将其拆分为新行。我注意到 HTML 之间有一个换行符,因此它在网络上单独呈现,我试图用新行替换它并在其上运行我的拆分 - 但是我的 string.replace() 和 re.sub()方法似乎不起作用。 我很想知道我做错了什么。
最新方法:
resub_pat = r'<br/>'
rows=list()
for row in table.findAll("tr"):
a = re.sub(resub_pat,"\n",row.text).split("\n")
这有点杂乱无章,但我希望我已经抓住了我的问题!我找不到任何类似的问题。
【问题讨论】:
标签: python html python-3.x beautifulsoup