【发布时间】:2011-11-18 04:46:17
【问题描述】:
如果有其他类可以做到这一点,那么链接会很棒。如果没有,我该如何使用 PHPCrawl?
是否可以根据特定于网站的一组规则存储来自已抓取网站的特定信息?例如,[div.wantThis, img#defaultPicture] 是为站点 A 返回的数组,而只有 [div.shortTextContent] 是为站点 B 返回的数组?
在 PHPCrawl 中,如何从 $page_data 数组中获取这些信息?
需要
必须只能定位某些元素。
能够从变量(可以是指定要定位的元素的数组)中读取数据存储规则。
【问题讨论】:
标签: php web-crawler phpcrawl