【发布时间】:2010-10-08 18:41:48
【问题描述】:
我正在尝试从包含无效 HTML 的网站中抓取数据。 Simple HTML DOM Parser 解析它,但由于它如何处理无效的 HTML 而丢失了一些信息。带有 DOMXPath 的内置 DOM 解析器不起作用,它返回一个空白结果集。在通过 PHP Tidy 运行获取的 HTML 后,我能够让它(DOMDocument 和 DOMXPath)在本地工作,但是 PHP Tidy 没有安装在服务器上并且它是一个共享托管服务器,所以我无法控制它。我试过HTMLPurifier,但这似乎只是为了保护用户输入,因为它完全删除了文档类型、头部和正文标签。
有没有 PHP Tidy 的独立替代品?我真的更喜欢使用 DOMXPath 来导航并获取我需要的东西,它似乎需要一些帮助来清理 HTML,然后才能解析它。
编辑:我正在抓取这个网站:http://courseschedules.njit.edu/index.aspx?semester=2010f。现在我只是想获取所有课程链接。
【问题讨论】:
-
你在抓取什么网站?
-
那个帖子实际上有我需要的东西。 PHPQuery 完成了这项工作。
标签: php web-scraping