【发布时间】:2010-06-28 19:25:48
【问题描述】:
我正在使用 PHP libcurl 加载页面。现在我需要获取这个页面的
【问题讨论】:
我正在使用 PHP libcurl 加载页面。现在我需要获取这个页面的
【问题讨论】:
您可以使用DOMDocument::loadHTML。
这将回显“标题”:
<?php
$doc = <<<HTML
<html>
<head>
<title>The title</title>
<body>
hhhhhh
HTML;
libxml_use_internal_errors(true);
$d = new DOMDocument;
$d->loadHTML($doc);
$ts = $d->getElementsByTagName("title");
if ($ts->length > 0) {
echo $ts->item(0)->textContent;
}
【讨论】:
或者你可以使用Simple HTML DOM
【讨论】:
您可以使用此脚本来获取页面的标题。
# Script Title.txt
var str page, content
cat $page > $content
stex -r -c "^<title&</title&\>^" $content
将此小代码保存在文件 C:/Scripts/Title.txt 中。代码在双脚本中。开始biterscripting,然后输入这个命令。
script "C:/Scripts/Title.txt" page("http://stackoverflow.com/questions/3135488/how-can-i-get-pages-title-tags-content-if-it-cant-be-parsed-as-xml")
它将获得此页面的标题(您正在查看的那个)。使用任何其他 URL 或本地文件路径作为 page() 的值。使用双引号。当我执行这个命令时,我得到了
如何获取页面的
标签的内容,如果它 不能解析为 XML? - 堆 溢出
您可以从任何可执行文件或批处理文件中调用此脚本。
【讨论】:
尝试使用 Yahoo 的 YQL 控制台。您可以查询几乎任何 url,然后以 XML 格式要求返回结果。您甚至可以添加 xpath 来缩小范围。
http://developer.yahoo.com/yql/console/
也许您可以使用 curl 调用此服务。这很方便。
【讨论】: