【发布时间】:2012-05-25 22:29:39
【问题描述】:
我试图从this webpage检索以下数据变量
- 地址
- 城市
- 状态
- 邮政编码
- 商店电话
- 药房电话
- 开放时间
- 药房营业时间
- 取货选项
- 在这个商店/位置
- 站点到存储时间
我尝试过这种方式,但是我无法分离出一些数据来存储在上述数据变量中,所以需要一些 PHP 专家的帮助和建议
$html = file_get_html('http://www.walmart.com/storeLocator/ca_storefinder_results.do?serviceName=&rx_title=com.wm.www.apps.storelocator.page.serviceLink.title.default&rx_dest=%2Findex.gsp&sfrecords=50&sfsearch_single_line_address=K6T');
foreach($html->find('div[class=StoreAddress] div[1]') as $name)
{
echo $name->innertext.'<br>';
}
这个网站的 html 很难用它的标签来识别每个数据项,因为它们没有分配给标签的正确 id。任何人都可以建议简单且可扩展的方法来解析来自 website 的上述数据项。
谢谢
【问题讨论】:
-
其实问题是很多标签有相同的类名,或者有些标签没有任何id或类来识别..所以一些不需要的数据也被解析了......我很困惑哪个数据存储在哪个变量中,因为它们都有相同的标签、类和没有 id..
标签: php parsing screen-scraping web-scraping