【发布时间】:2013-07-30 10:12:04
【问题描述】:
我正在尝试根据位置将抓取的网页分成不同的部分
<p> <br> 或 <div> 标签。所以第一个<p> 标签将包含从<html> 到有问题的<p> 标签的所有数据/标签。我看过 lxml 项目中的 etree 之类的东西,但它看起来很相切。
我从“正常” html 解析中看到的区别是选择的标签数量。我想选择多个标签及其数据并单独保存它们,而“普通” html 解析工具提供仅选择一个隔离标签/标签(使用 xpath 等)并使用它的能力。 (我对网络编程也很陌生)。
我已经想到了一种方法,我可以保存文件偏移量,然后继续对输入文件进行剪切和切片以实现我的目标,但它充其量似乎是 hackish。
我该如何实现我的既定目标,请帮助。
谢谢。
【问题讨论】:
-
beautifulsoup 会是一个很好的使用工具
-
您好,感谢您的回答,但我应该在美丽的汤中使用什么。您能否更具体地说明如何将部分 html 树保存到单独的文件中
标签: python html-parsing beautifulsoup lxml