【发布时间】:2014-05-12 17:59:04
【问题描述】:
我有一个保存为 .htm 的网页。本质上,我需要解析 6 层 div 并从中获取特定数据,我对如何处理这个问题感到很困惑。我尝试了不同的技术,但没有任何效果。
HTM 文件有一堆标签,但有一个看起来像这样的 div:
<div id="fbbuzzresult" class.....>
<div class="postbuzz"> .... </div>
<div class="linkbuzz">...</div>
<div class="descriptionbuzz">...</div>
<div class="metabuzz>
<div class="time">...</div>
<div>
<div class="postbuzz"> .... </div>
<div class="postbuzz"> .... </div>
<div class="postbuzz"> .... </div>
</div>
我目前正在尝试 BeautifulSoup。更多上下文...
- 整个文件中只有一个 fbbuzzresult。
- fbbuzzresult 中有多个 postbuzz
- postbuzz 中有如上所示的 div
我需要在 each postbuzz div 中提取并打印上面显示的每个内容。
非常感谢您对一些框架代码的帮助和指导! P.S - 忽略 div 类中的破折号。 谢谢!
【问题讨论】:
标签: python html beautifulsoup extract