【发布时间】:2015-10-20 16:20:46
【问题描述】:
我有一点 php 从页面中抓取 html 并将其加载到 simplexml 对象中。但是它没有在
中获取元素的类php
//load the html page with curl
$html = curl_exec($ch);
curl_close($ch);
$doc = new DOMDocument();
$doc->loadHTML($html);
$sxml = simplexml_import_dom($doc);
页面 html。如果我执行 $html 的 var_dump 会显示它已被抓取并存在于 $html 中
<li class="large">
<a style="" id="ref_3" class="off" href="#" onmouseover="highlightme('07');return false;" onclick="req('379');return false;" title="">07</a>
</li>
$doc 和 $sxml 的 var_dump(下)表明现在缺少 'off' 类。不幸的是,我需要根据这个类来处理页面。
[8]=>
object(SimpleXMLElement)#50 (2) {
["@attributes"]=>
array(1) {
["class"]=>
string(16) "large"
}
["a"]=>
string(2) "08"
}
【问题讨论】:
-
您想从您的文档中获取所有具有
off类的a元素吗?或所有li类为“大”的a元素? -
我需要找到 li 中所有的 a 元素,其中 class 为 large。在我的另一个问题中,我们提取了所有人员及其工作时间,我需要提取那些“关闭”的字符串。问题是如您在上面的示例中看到的,simplxml 没有提取 的类,只是字符串:-( 此处为完整的 html,带有关闭类 bl.ocks.org/hotnuts21/2a3658c34f61872b6709
-
我在您的文档中看不到任何“关闭”类
-
您可能需要强制刷新我编辑的页面。
标签: php html web-scraping simpledom