【发布时间】:2010-09-18 09:49:41
【问题描述】:
我一直在尝试从 HTML 文件中删除一些数据。我有逻辑编码以获得正确的单元格。现在我正在努力获取“单元格”的实际内容:
这是我的 HTML sn-p:
headerRows[0][10].contents
[<font size="+0"><font face="serif" size="1"><b>Apples Produced</b><font size="3">
</font></font></font>]
请注意,这是来自 Python [] 的列表项。
我需要 Apples Produced 的价值,但无法获得。
任何建议将不胜感激
对一本解释这一点的好书的建议将赢得我永远的感激
感谢您的回答。然而,没有更普遍的答案。如果我的单元格没有粗体属性会怎样
说是:
[<font size="+0"><font face="serif" size="1"><I>Apples Produced</I><font size="3">
</font></font></font>]
苹果生产
我正在努力学习阅读/理解文档,您的回复会有所帮助
我非常感谢您的帮助。这些答案最好的一点是,从它们中概括起来要容易得多,然后我可以从 BeautifulSoup 文档中做到这一点。我在 Fortran 时代学会了编程,现在我正在学习 python,我对它的力量感到惊讶——BeautifulSoup 就是一个例子。制作一个连贯的整个文档对我来说很难。
干杯
【问题讨论】:
标签: python html parsing beautifulsoup