【发布时间】:2022-01-19 22:01:48
【问题描述】:
我想从一个 html 文件中提取一些数据。我的问题是您看到的第一段代码。我无法正确擦除文本中的每个标签(<tr>,<th>,...)
table = soup.find(class_="article-table")
[row.text.split() for row in table.find_all("tr")]
table = lxml.html.fromstring(table)
data = []
for row in table.find_all("tr")[1:]:
x = row.text.split()
name = " ".join(i for i in x if i.isalpha() or "-" in i)
res = [i for i in x if not (i.isalpha() or "-" in i)]
res.insert(1, name)
在你看到的下一行代码中,它删除了每个标签,但现在我不知道如何只提取我想要的文本。
soup = BeautifulSoup(page.content, 'lxml').text
有什么想法吗?
【问题讨论】: